Phase 18: Ethics, Safety & Alignment

چارچوب های امنیتی مرزی RSP، PF، FSF

سه چارچوب آزمایشگاهی بزرگ حاکمیت صنعت ظرفیت مرزی را در سال 2026 تعریف می کنند. سیاست مقیاس پذیری مسئولانه انسان 3.0 (فروری 2026) سطوح ایمنی هوش مصنوعی (ASL-1 تا ASL-5+) را در سطوح بیولوژیکی معرفی می کند، با فعال کردن ASL-3 در ماه مه 2025 برای مدل های مرتبط با CBRN. چارچوب آماده سازی OpenAI v2 (اپریل 2025) پنج معیار برای قابلیت های ردیابی را تعریف کرده و گزارش های قابلیت ها را از گزارش های حفاظت جدا می کند. چارچوب ایمنی مرز DeepMind v3.0 (ستمبر 2025) سطوح توانایی حیاتی را شامل CCL کنترل مضر جدید معرفی می کند. حالا سه تا از آنها شامل بند های تنظیم کننده رقبا می شوند که اجازه می دهد اگر آزمایشگاه های همسنگ بدون تضمین های قابل مقایسه حمل شوند، تعویق شود. تعادل بین آزمایشگاه ها ساختار باقی می ماند، نه اصطلاحی: "هدف های ظرفیت"، "هدف های ظرفیت بالا" و "هدف های ظرفیت انتقادی" ساختارهای مشابه را نشان می دهد.

Type: Learn

Languages: none

Prerequisites: Phase 18 · 17 (WMDP), Phase 18 · 07-09 (deception failures)

Time: ~75 minutes

اهداف یادگیری

  • ساختار سطح ASL Anthropic را توصیف کنید و آنچه ASL-3 را فعال می کند.
  • پنج معیاری OpenAI Preparedness Framework v2 را برای قابلیت های ردیابی نام دهید.
  • ساختار سطح توانایی های حیاتی DeepMind و CCL دستکاری مضر را توصیف کنید.
  • بند های تنظیم رقبای را توضیح دهید و چرا برای دینامیک نژاد مهم هستند.
  • یک مورد ایمنی تعریف کنید و ساختار سه ستون را توصیف کنید (مراقب، غیر قابل خواندن، ناتوانی).

مشکل

دروس 7-17 نشان می دهد که فریب ممکن است، قابلیت استفاده دوگانه وجود دارد و ارزیابی محدودیت هایی دارد. یک آزمایشگاه با یک مدل با قابلیت مرزی نیاز به یک ساختار حاکمیت داخلی دارد که:

  • محدوده های محدودی برای زمانی که نیاز به تضمین های جدید باشد تعریف می کند.
  • ارزیابی های مورد نیاز را قبل از مقیاس بندی تعریف می کند.
  • شرحي ميده که يه پرونده امنيتي چطوره
  • مشکل دینامیک مسابقه را حل می کند (اگر رقبای بدون محافظت کشتی می کنند، شما چه می کنید؟)

سه چارچوب 2025-2026 وضعیت فن هستند نامکمل، در حال تکامل و به اندازه کافی در سراسر آزمایشگاه ها هماهنگ است که سوال حاکمیت اکنون این است که آیا چارچوب ها مناسب هستند، نه اینکه آیا وجود دارند.

مفهوم

سیاست مقیاس پذیری مسئولانه انسان (فبروری 2026) v3.0

ساختار ASL:

  • ASL-1: مدل مرز نیست (به اساس خط پایه ضعیف تر از مرز).
  • ASL-2: خط اصلی مرزی فعلی؛ با حفاظت های معمول استفاده می شود.
  • ASL-3: خطر سوءاستفاده فاجعه بار بسیار بالاتر؛ قابلیت های مربوط به CBRN. فعال شده در ماه مه سال 2025.
  • ASL-4: عبور از آای آر و دی ۲؛ مدل هایی که می توانند تحقیقات آای را در سطح ورود خودکار کنند.
  • ASL-5+: مدل های پیشرفته تحقیق و توسعه هوش مصنوعی که مقیاس بندی موثر را به شدت تسریع می کنند.

در نسخه 3.0 تازه:

  • نقشه های جاده ای ایمنی مرزها (در صورت اصلاح شده عمومی)
  • گزارش های ریسک (هر سه ماهه، برخی از آنها از طریق خارجی بررسی می شوند).
  • تحقیق و توسعه هوش مصنوعی به تحقیق و توسعه هوش مصنوعی 2 و تحقیق و توسعه هوش مصنوعی 4 تقسیم می شود.
  • هنگامی که AI R&D-4 عبور می کند، یک مورد ایمنی مثبت مورد نیاز است، شناسایی خطرات عدم هماهنگی از مدل هایی که به دنبال اهداف اشتباه هستند.

چارچوب آماده سازی OpenAI v2 (15 آوریل 2025)

پنج معیار برای قابلیت های ردیابی:

  • Plausible.مدل تهدید منطقی وجود داره
  • Measurable.ارزیابی تجربی ممکن است
  • Severe.آسیب ها بزرگه
  • Net-new.نه خطر موجودي که در حال رشد بوده
  • Instantaneous-or-irremediable.آسیب سریع اتفاق می افتد یا نمی تواند اصلاح شود.

توانایی هایی که با پنج مورد مطابقت دارند ردیابی می شوند.

ساختار PF v2 دیگر:

  • گزارش های قابلیت های جداگانه (چه کاری مدل می تواند انجام دهد) از گزارش های حفاظت (چه کنترل هایی وجود دارد)
  • بررسی گروه مشاوره ایمنی
  • رهبری تایید می کند؛ کمیته ایمنی و امنیت هیئت مدیره نظارت می کند.
  • "حجره تعدیل": OpenAI ممکن است الزامات را کاهش دهد اگر یک آزمایشگاه دیگر بدون تضمین های قابل مقایسه کشتی ها.

چارچوب ایمنی مرزی DeepMind v3.0 (ستمبر 2025)

سطوح توانایی انتقادی (CCL) بر اساس حوزه:

  • افزایش سلاح های زیستی
  • افزایش سایبری
  • ML سرعت تحقیق و توسعه
  • دستکاری مضر (جدید در نسخه 3.0): مدل هایی که می توانند باورها / رفتار را در زمینه های بالا تغییر دهند.

در نسخه 2.0 (فروری 2025) بخش سازگاری فریبنده و سطوح امنیتی بالاتر برای CCL های تحقیق و توسعه ML اضافه شده است.

تعادل بین آزمایشگاه ها

  • "توانايي هاي انساني"
  • "مستفاديت هاي مهم"
  • OpenAI "حده های ظرفیت بالا".

هیچ اصطلاحاتی استاندارد صنعت نیست. از نظر ساختاری هماهنگ: سه سطح ظرفیت مرزی با معیارهای ارزیابی منتشر شده. همه سه شامل بند های تنظیم رقبا (2025 و بعد) است.

موارد ایمنی

یک مورد ایمنی یک استدلال نوشته شده است که یک پیاده سازی در بدترین موارد قابل قبول است. ساختار استاندارد سه ستون را هدف قرار می دهد:

  • Monitoring.اگه بدرفتار رو پيدا کنيم ميتونيم متوجه بشيم؟
  • Illegibility.آیا مدل توانایی اجرای یک برنامه منسجم برای ایجاد آسیب ندارد؟
  • Incapability.آیا مدل توانایی ایجاد آسیب در موردش را ندارد؟

موارد امنیتی مختلف به ستون های مختلف هدف می گیرند. برای یک مورد ASL-3 CBRN، ناتوانی (به وسیله عدم یادگیری) هدف اصلی است. برای تعادل فریبنده، نظارت و غیر قابل خواندن اهداف هستند. برای ارتقاء سایبری، همه سه مورد مرتبط هستند.

مشکل دینامیک نژاد

متداولین استدلال می کنند که این بند ها یک مسابقه به پایین می آورند: اگر هر سه آزمایشگاه نیاز را کاهش دهند وقتی یک رقابت شکست می خورد، تعادل به سمت فرار می رود. مدافعان استدلال می کنند که گزینه ای (حمایه های یک جانبه) نتایج بدتر را به همراه می آورد اگر آزمایشگاه فرار کمتر از ایمنی آگاه باشد.

AISI بریتانیا، CAISI ایالات متحده و اداره هوش مصنوعی اتحادیه اروپا (درسی 24) همتایان حاکمیت خارجی هستند. چارچوب های آزمایشگاهی داوطلبانه هستند؛ چارچوب های نظارتی در حال ظهور هستند.

جایی که این در مرحله 18 قرار داره

درس 17-18 لایه اندازه گیری و حکومت در بالای فریب و تجزیه و تحلیل های تیم قرمز است. درس 19-24 شامل رفاه، تعصب، حریم خصوصی، علامت گذاری آب و ساختار نظارتی است. درس 28 نقشه ای از اکوسیستم تحقیقاتی (MATS، Redwood، Apollo، METR) است که ارزیابی ها را عملیاتی می کند.

ازش استفاده کن

هیچ کد برای این درس نیست. سه منبع اصلی را بخوانید: RSP v3.0، PF v2، FSF v3.0. ساختار سطوح هر آزمایشگاه را با سایر آزمایشگاه ها نقشه برداری کنید و یک حد مشخص کنید که هر آزمایشگاه تعریف می کند که بقیه نمی کنند.

-باده

این درس به ما کمک می کندoutputs/skill-framework-diff.mdدر نظر گرفتن چارچوب ایمنی یا یادداشت انتشار، تعریف های حدودی، ارزیابی های مورد نیاز و ساختار پرونده ایمنی این چارچوب را با RSP v3.0، PF v2، FSF v3.0 و خطوط بین لابراتوار مقایسه می کند.

تمرینات

  1. RSP v3.0، PF v2 و FSF v3.0 را بخوانید. جدول از حد CBRN هر آزمایشگاه، حد R&D هوش مصنوعی هر یک و ارزیابی قبل از انتشار مورد نیاز هر یک را مرتب کنید.
  1. بند تنظیم رقبایی در هر سه چارچوب (2025+) وجود دارد. یک پاراگراف را با استدلال برای آن بنویسید؛ یک پاراگراف را با استدلال در برابر آن بنویسید. فرضیه ای را که هر موقعیت بستگی دارد شناسایی کنید.
  1. یک کیس ایمنی برای یک مدل که از حد R&D-4 هوش مصنوعی Anthropic عبور می کند طراحی کنید. شواهد مورد نیاز هر یک از سه ستون (مراقب، غیر قابل خواندن، ناتوانی) را نام ببرید.
  1. FSF v3.0 DeepMind یک CCL دستکاری مضر را معرفی می کند. سه اندازه گیری تجربی را پیشنهاد می کند که نشان می دهد یک مدل از این حد عبور کرده است.
  1. "عناصر مشترک سیاست های ایمنی هوش مصنوعی مرزی" (2025) METR را بخوانید. سه متقابل قوی ترین کنگرژنی آزمایشگاهی و دو متغیر بزرگ را نام ببرید.

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
RSP"Anthropic's framework"Responsible Scaling Policy; ASL tiers; v3.0 February 2026
PF"OpenAI's framework"Preparedness Framework; five criteria; v2 April 2025
FSF"DeepMind's framework"Frontier Safety Framework; CCLs; v3.0 September 2025
ASL-3"biosafety level 3-analog"Anthropic tier for CBRN-relevant capabilities; activated May 2025
CCL"critical capability level"DeepMind's threshold construct; per-domain
Safety case"the formal argument"Written argument that deployment is acceptably safe under worst-case U
Adjustment clause"competitor defection allowance"Framework provision for reducing requirements if competitors ship without comparable safeguards

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.