CAIS، CAISI و ریسک در مقیاس اجتماعی
Type: Learn
Languages: Python (stdlib, four-risk inventory and mitigation matcher)
Prerequisites: Phase 15 · 19 (RSP), Phase 15 · 20 (PF + FSF)
Time: ~45 minutes
مشکل
دروس 19 و 20 سیاست های مقیاس بندی داخلی آزمایشگاه را پوشش می دهد. دروس 21 ارزیابی توانایی مستقل را پوشش می دهد. این درس دیدگاه سوم را پوشش می دهد: جامعه مدنی و سازمان های دولتی که بحث عمومی و پایه های نظارتی را برای خطر فاجعه آمیز هوش مصنوعی شکل می دهند.
CAIS یک سازمان تحقیقاتی غیر انتفاعی است که چارچوب هایی برای فکر کردن در مورد ریسک هوش مصنوعی را منتشر می کند و بیانیه های عمومی را هماهنگ می کند. CAISI یک مرکز دولتی ایالات متحده در NIST است که توافق نامه های داوطلبانه با آزمایشگاه ها و ارزیابی های قابلیت غیر طبقه بندی شده را اجرا می کند. نام ها قافیه می کنند؛ مأموریت ها همپوش نمی شوند. یک تمرین کننده باید هر دو را بداند.
محتوای عملی: چارچوب چهار ریسک CAIS، تاکسونومی ریسک در مقیاس اجتماعی در ادبیات به طور گسترده ای ذکر شده است. فرهنگ ایمنی و ریسک سازمانی یکی از این چهار مورد است و این یکی از مستقیم ترین تحت کنترل یک تمرین کننده است. SB-53 (کالیفورنیا) اولین مقررات خطر فاجعه بار در سطح ایالت ایالات متحده خواهد بود اگر امضا شود؛ چارچوبی از لایحه مهم است زیرا مقررات سطح ایالت به طور تاریخی منجر به اقدام فدرال در سیاست فناوری ایالات متحده شده است.
مفهوم
CAIS مرکز ایمنی هوش مصنوعی
- تاسیس: سال 2022 در سانفرانسیسکو، توسط دان هندریکس و همکارانش (نام "ژانگ" به یک همکاری اولیه اشاره دارد، نه یک شریک بنیانگذار فعلی؛ برای رهبری فعلی به وب سایت CAIS مراجعه کنید).
- وضعیت: 501 ((c) ((3) غیرانتفاعی
- نتایج قابل توجه سال 2023: بیانیه در مورد خطر انقراض، با همکاری صدها محقق و مدیر عامل امضا شده است. اعلام شده است: "کم کردن خطر انقراض از AI باید در کنار سایر خطرات مقیاس اجتماعی مانند بیماری همه گیر و جنگ هسته ای اولویت جهانی باشد".
- نتایج 2026: داشبورد هوش مصنوعی برای ارزیابی مدل مرزی، شاخص کار از راه دور (با هوش مصنوعی مقیاس) ، مقاله استراتژی هوش مصنوعی، خبرنامه مرز های هوش مصنوعی.
چارچوب چهار ریسک
چارچوب CAIS ریسک فاجعه آمیز هوش مصنوعی را به چهار دسته بالا تقسیم می کند:
- Malicious use: یک بازیگر بد از هوش مصنوعی برای ایجاد آسیب استفاده می کند (تولید سلاح های زیستی، اطلاعات غلط، حملات سایبری).
- AI races: فشار رقابتی بین آزمایشگاه ها، شرکت ها یا کشورها، انتشار را از نقطه ای فراتر می برد که در آن امن است.
- Organizational risks: پویایی آزمایشگاهی داخلی (شکست های فرهنگ ایمنی، حسابرسی ناکافی، امنیت کم منابع) باعث انتشار بد می شود.
- Rogue AIs: هوش مصنوعی به اندازه کافی قادر به دنبال اهداف که در تضاد با رفاه انسان است.
این تنها طبقه بندی نیست، بلکه بیشترین ذکر شده است. دسته ها متقابل نیستند یک هوش مصنوعی مخرب تولید شده توسط یک سازمان که در مسابقه، همه چهار مورد را بررسی می کند.
جایی که ریسک سازمانی زندگی می کند
از چهار دسته، خطر سازمانی برای تمرین کنندگان قابل اجرا ترین است. فرهنگ ایمنی یک آزمایشگاه، صمیمیت حسابرسی، لایه بندی دفاعی و امنیت اطلاعات تصمیم می گیرد که آیا مدل کشتی های آنها با کنترل های درس 1018 در واقع در محل هستند یا اینکه آیا این کنترل ها موارد چک لیست هستند که هیچ کس تایید نکرده است.
مفع های ریسک سازمانی مشخص:
- Safety cultureآیا اعضای تیم احساس می کنند که می توانند نگرانی را بدون هزینه شغلی افزایش دهند؟ نظرسنجی های CAIS نشان می دهد این یک پیش بینی قوی در مورد دیگر اهرم ها است.
- Rigorous audits: خارجی و داخلی. تنها بازرسی های داخلی گزارش های خوش بینانه را ارائه می دهند.
- Multi-layered defenses: هیچ لایه ای کافی نیست (موضوع اجرا مرحله 15)
- Information security: دزدی وزن مدل، دزدی داده های ارزیابی، دزدی تکنیک های دور زدن مانیتور. RAND SL-4 در درس 19 یک استاندارد خاص است.
CAISI مرکز استاندارد و نوآوری هوش مصنوعی
- در اين اداره عمل ميکنه
- قرارداد داوطلبانه با لابراتوارهای مرزی اجرا می کنه
- ارزیابی های غیر طبقه بندی شده توانایی را که بر خطرات سایبری، بیولوژیکی و سلاح های شیمیایی متمرکز است، منتشر می کند.
- از CAIS متفاوت است؛ مخففات با هم برخورد می کنند؛ URL (nist.gov) را برای تایید اینکه کدام یک را می خوانید، بررسی کنید.
نقش CAISI، مقابل عمومی و دولتی برای فعالیت های آزمایشگاهی خصوصی METR است (درسی 21). گزارش های CAISI طبقه بندی نشده اند؛ گزارش های METR اغلب با گات NDA بسته شده اند. یک متخصص که هر دو را می خواند، یک تصویر کامل تر می یابد.
کالیفرنیا SB-53
لایحه سنا کالیفرنیا (20252026 جلسه) با ریسک فاجعه بار از مدل های مرزی برخورد می کند. مقررات اصلی به عنوان طرح:
- محدودیت های خاص توانایی که باعث ایجاد تعهدات در سطح دولت می شود.
- حفاظت از خبرنگاران براي کارکنان آزمایشگاه هوش مصنوعی
- الزامات گزارش حوادث برای شکست های فاجعه بار
اگر امضا شود، اولین مقررات خطر فاجعه بار در سطح ایالت ایالات متحده خواهد بود. صرف نظر از وضعیت امضا، چارچوب این لایحه شکل می دهد که سایر قانونگذاران ایالت به مشکل چگونه نزدیک می شوند. تمرین کنندگان در کالیفرنیا باید وضعیت لایحه را پیگیری کنند؛ تمرین کنندگان در جای دیگر باید آن را بخوانند تا درک کنند که مقررات سطح ایالت ایالات متحده احتمالاً چگونه خواهد بود.
ریسک در مقیاس اجتماعی یک مشکل یک لایه نیست
موضوع اجرا از مرحله 15 دفاع عمیق نیز در لایه اجتماعی اعمال می شود. هیچ سازمان، مقررات یا چارچوبی یک خطر فاجعه آمیز را متوقف نمی کند. اکوسیستم تنها زمانی عمل می کند که:
- سیاست های مقیاس گذاری آزمایشگاه ها (درسه ۱۹،۲۰).
- ارزیابی کنندگان خارجی اندازه گیری ها را انجام می دهند (درسی 21).
- جامعه مدنی ردیابی و انتشار می کند (CAIS).
- دولت برنامه های داوطلبانه و مقررات پایه را اجرا می کند (CAISI، SB-53).
- تمرین کنندگان کنترل های چند لایه ای را ایجاد می کنند (درسه 1018).
این سنتز نهایی مرحله است: هر درس قبلی یک لایه در یک دسته است که کاملیت آن بیشتر از قدرت هر لایه مهم است.
ازش استفاده کن
code/main.pyدر نظر گرفتن یک برنامه ریزی پیشنهادی، این برنامه برنامه برنامه ریزی را با چهار دسته خطر مقایسه می کند و یک لیست چک کاهش را باز می گرداند. این یک کمک خواندن برای چارچوب است، نه جایگزین قضاوت انسانی.
-باده
outputs/skill-societal-risk-review.mdبررسی یک تعین برای موقعیت ریسک در مقیاس اجتماعی: کدام از چهار دسته ای را می کشد، چه کاهش هایی در محل است، معرض خطر سازمانی چیست.
تمرینات
- فرار کن
code/main.py.در سه برنامه ی مصنوعی در مقیاس های مختلف استفاده کنید. تایید کنید که برچسب های چهار خطر با آنچه که انتظار دارید مطابقت دارند؛ یک مورد را شناسایی کنید که در آن ابزار برچسب های کم یا بیش از حد است.
- مقاله چهار خطر CAIS را به طور کامل بخوانید. یک دسته خطر را انتخاب کنید و دو پاراگراف در مورد آنچه که شما معتقدید مهمترین پیشرفت 2026 در آن دسته است، بنویسید.
- يه طرح قانون قانون قانون 53 كاليفورنيا رو بخوني.
- یک پیاده سازی هوش مصنوعی تولیداتی را انتخاب کنید که می دانید (خود یا یک منتشر شده) و آن را با زیرفراغ های ریسک سازمانی مقایسه کنید: فرهنگ ایمنی، صمیمیت حسابرسی، دفاع های چند لایه، امنیت اطلاعات. کدام یک ضعیف است؟ هزینه آن برای برآورد آن چقدر است؟
- یک نسخه 2028 از چارچوب چهار خطر را که نشان دهنده یک سال توانایی اضافی و یک سال تجربه اضافی در پیاده سازی است، نشان دهید. چه چیزی را اضافه می کنید، حذف می کنید یا دوباره گروه بندی می کنید؟
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| CAIS | "Center for AI Safety" | Non-profit; four-risk framework; 2023 extinction statement |
| CAISI | "US government AI safety" | NIST Center; voluntary agreements; unclassified evals |
| Four-risk framework | "CAIS's taxonomy" | malicious use, AI races, organizational risks, rogue AIs |
| Malicious use | "Bad actor uses AI" | Bioweapons, disinformation, cyberattacks |
| AI races | "Competitive pressure" | Labs/companies/nations push deployment past safety |
| Organizational risk | "Lab internal failure" | Safety culture, audit, defenses, infosec |
| Rogue AI | "Misaligned agent" | Capable AI pursuing goals conflicting with human welfare |
| California SB-53 | "State-level regulation" | 2025–2026 bill; first US state catastrophic-risk regulation if signed |
خواندن بیشتر
- Center for AI Safety خانه های نهادی از چهار ریسک.
- CAIS — AI Risks that Could Lead to Catastrophe مقاله چهار خطر
- CAIS — May 2023 statement on extinction risk بیانیه مشترک کوتاه
- NIST CAISI مرکز استاندارد های هوش مصنوعی و نوآوری در مقابل دولت.
- Anthropic — Measuring agent autonomy in practice تعهدات سطح آزمایشگاه را به چارچوبی در مقیاس جامعه متصل می کند.
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.