چارچوب آماده سازی OpenAI و چارچوب ایمنی مرزی DeepMind
Type: Learn
Languages: Python (stdlib, three-framework decision-table diff tool)
Prerequisites: Phase 15 · 19 (Anthropic RSP)
Time: ~45 minutes
مشکل
دروس 19 سیاست مقیاس پذیری Anthropic را به دقت مطالعه می کند. این درس تصویر را با خواندن OpenAI و DeepMind تکمیل می کند. سه سند آثار عموی هستند که به همان سوال پاسخ می دهند چه زمانی یک آزمایشگاه مرزی باید یک مدل را متوقف کند یا دروازه کند و آنها در مجموعه ای کوچک از دسته بندی ها به هم می رسند و در مکان های خاص که اهمیت دارند متفاوت هستند.
تقارب: هر سه خود مختاری بلند مدت را به عنوان یک کلاس توانایی ارزش ردیابی می دانند. هر سه رفتار فریبنده (تزویر صف بندی، تزویر) را به عنوان یک کلاس خاص خطر می شناسند. سه تا از آنها یک سازمان بازرسی داخلی دارند. تفاوت: OpenAI دسته ها را به "تراکی" (کم کردن اجباری) و "تحقیق" (هیچ عامل خودکار) تقسیم می کند. دپ مایند استقلال را به دو دامنه تقسیم می کند تا به جای نامگذاری آن به طور جداگانه. آزمایشگاه ها Tracked vs Research، یا Critical vs Moderate، یا Tier-1 vs Tier-2 نام می دهند؛ نتیجه عملیاتی که در آن سطل یک توانایی زندگی می کند در آزمایشگاه های مختلف متفاوت است.
خواندن آنها با هم تمرین مفید است. این قابلیت می تواند "کم کردن اجباری" در Anthropic، "مراقب اما غیر فعال" در OpenAI و "در یک دامنه خاص" در DeepMind باشد. موضع سیاست مهم است.
مفهوم
چارچوب آماده سازی OpenAI v2 (اپریل 2025)
ساختار:
- Tracked Categories: گزارش های قابلیت (چه کاری می تواند مدل انجام دهد) و گزارش های حفاظتی (چه کاهشاتی وجود دارد) که قبل از انتشار توسط گروه مشاوره ایمنی بررسی می شود.
- Research Categories: قابلیت های مدل ای که آزمایشگاه در حال پیگیری است اما هنوز به کاهش های خاص متعهد نشده است. شامل استقلال در راه دور، تکه شن، تکثیر خود مختار و سازگاری، تضعیف حفاظتی است.
چارچوب کلیدی در v2: دسته بندی های تحقیق به طور خودکار کاهش ها را تحریک نمی کنند. زبان سیاست کاهش های "محتمل" است. این دلتا خاص برای مشاهده است: مکان یک دسته در Tracked vs Research، پیچ بین "گات" و "نظر گرفته شده" است.
چارچوب ایمنی مرزی DeepMind v3 (ستمبر 2025؛ سطوح قابلیت ردیابی 17 آوریل 2026)
ساختار:
- Critical Capability Levels (CCLs): حد توانایی در پنج حوزه: سایبر، بیولوژی، تحقیق و توسعه ML، CBRN، استقلال (به تحقیق و توسعه ML و سایبر)
- Tracked Capability Levels: گرانولیت اضافی در آوریل 2026 اضافه شد. مثال مشخص: ML R&D خود مختاری سطح 1 = به طور کامل خودکار سازی لوله R&D هوش مصنوعی با هزینه رقابتی در مقابل ابزار های انسانی + هوش مصنوعی.
- Deceptive alignment monitoring: تعهد صریح به نظارت خودکار برای سوء استفاده از استدلال ابزار.
چارچوبی که از خودمختاری استفاده می شود، از OpenAI متفاوت است. DeepMind "خود مختاری" را به عنوان یک دامنه سطح بالا حفظ نمی کند؛ به دامنه هایی که در آن استقلال آسیب می رساند (ML R&D و سایبر) تقسیم می شود. استدلال این است که استقلال بدون یک دامنه توانایی بدون ریسک است؛ استدلال ضد این است که استقلال در سراسر دامنه ها یک متاریسک است که چارچوب باید نام دهد.
که سه تا هم بر روی آن همگام می شوند
- گروه مشاوره ایمنی داخلی (به نام Anthropic SAG، OpenAI SAG، DeepMind) قبل از انتشار برای مدل های با قابلیت بالا بررسی می شود.
- ذکر صریح تعادل فریبنده / تعادل تظاهر به عنوان یک کلاس خطر.
- آثار ثابت در یک زمان اعلام شده (انترپاتیک: نقشه راه ایمنی مرز، گزارش ریسک؛ OpenAI: گزارش قابلیت ها و تضمین ها؛ DeepMind: چرخه به روز رسانی FSF).
- اعتراف به این که دفاعی که فقط نظارت می کند، سقف دارد. DeepMind به وضوح می گوید: "مراقب خودکار به مدت طولانی کافی نخواهد بود".
جایی که متمایز می شوند
- Anthropic: تعهد توقف در v3.0 حذف شده است؛ آای R&D-4 درحاله نام گذاری دروازه بعدی است.
- OpenAI: ردیابی در مقابل تحقیق تقسیم شده است؛ دسته بندی های تحقیقاتی (از جمله خود مختاری در فاصله طولانی) به طور خودکار دروازه نمی شوند.
- DeepMind: استقلال به حوزه های دیگر تقسیم شده است؛ سطوح توانایی ردیابی در آوریل 2026 به اندازه ی جزئی اضافه می شود.
شنباده کردن: یک توانایی خاص که سه تا را پیچیده می کند
Sandbagging (مودلی که از نظر استراتژیک در ارزیابی ها عملکرد کمتری دارد) در دسته بندی های تحقیقاتی OpenAI قرار دارد. RSP v3.0 Anthropic از طریق شکاف ارزیابی-مناطق (درس 1) آن را حل می کند. DeepMind از طریق نظارت خطایی بر تعاونی در FSF v3.
اگر یک مدل در ارزیابی ها، محدودیت های توانایی هر چارچوبی زیرنظر گرفته می شود. چارچوب تنها در صورتی کار می کند که اندازه گیری کار کند. به همین دلیل اندازه گیری خارجی (درسی 21، METR) و ارزیابی متضاد علاوه بر خود ارزیابی آزمایشگاهی ضروری است.
مهارت در خواندن سیاست ها
- موقعیت: هر قابلیت که به آن اهمیت می دهید باید در سیاست یافت شود. اگر قابل یافت نباشد، سیاست آن را پوشش نمی دهد.
- طبقه بندی: آیا ردیابی شده است (تحرک کاهش) یا تحقیق (تراکی شده است اما تحریک نمی شود) OpenAI این نام را می دهد؛ انسان شناسی و DeepMind معادل خود را دارند.
- زمان: آیا سیاست در یک برنامه اعلام شده به روز می شود یا فقط پس از رویدادهای خاص؟ زمان اعلام شده قوی تر است.
- استقلال: بررسی خارجی اجباری است یا اختیاری؟ شرکای بشری با اپولو و موسسه ایمنی هوش مصنوعی ایالات متحده؛ OpenAI با METR؛ DeepMind با SAG داخلی عمدتا.
ازش استفاده کن
code/main.pyاین ابزار یک ابزار تفاوت جدول تصمیم گیری کوچک را اجرا می کند. با توجه به قابلیت (خود مختاری، هماهنگی فریبنده، اتوماسیون تحقیق و توسعه، ارتقاء سایبری، و غیره) ، این محصول چگونگی طبقه بندی هر یک از سه سیاست، توانایی را و آنچه کاهش می دهد را ایجاد می کند. این یک کمک خواندن است، نه یک ابزار سیاست.
-باده
outputs/skill-cross-policy-diff.mdیک مقایسه میان سیاست ها برای یک قابلیت خاص را با استفاده از سه چارچوب به عنوان مرجع ارائه می دهد.
تمرینات
- فرار کن
code/main.py. تایید کنید که محصول ابزار مختلف با سیاست ها مطابقت دارد برای حداقل دو قابلیت که می توانید با اسناد منبع بررسی کنید.
- OpenAI Preparedness Framework v2 را به طور کامل بخوانید. هر دسته تحقیق را شناسایی کنید. برای هر یک یک یک جمله را در مورد اینکه چرا در تحقیق به جای ردیابی قرار دارد بنویسید.
- DeepMind FSF v3 را به طور کامل بخوانید، به علاوه به روزرسانی سطح قابلیت های ردیابی آوریل 2026 . معیارهای ارزیابی خاص سطح 1 خود مختاری تحقیق و توسعه ML را شناسایی کنید. چگونه آن را از خارج اندازه گیری می کنید؟
- Sandbagging در دسته بندی های تحقیق OpenAI قرار دارد. یک ارزیابی طراحی کنید که یک مدل sandbagging را مجبور به افشا کردن توانایی واقعی آن کند. به بحث درس 1 ارزیابی-حالت-بازی مراجعه کنید.
- سه سیاست را در مورد یک قابلیت خاص (انتخاب خود) مقایسه کنید. طبقه بندی کدام سیاست را سختگیرانه ترین و کمترین می دانید نام دهید. با متن منبع توجیه کنید.
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| Preparedness Framework | "OpenAI's scaling policy" | PF v2 (April 2025); Tracked vs Research categories |
| Tracked Category | "Mandatory mitigation" | Triggers Capabilities + Safeguards Reports; SAG review |
| Research Category | "Monitored only" | Tracked but no automatic mitigation; includes Long-range Autonomy |
| Frontier Safety Framework | "DeepMind's scaling policy" | FSF v3 (Sept 2025) + Tracked Capability Levels (Apr 2026) |
| CCL | "Critical Capability Level" | DeepMind threshold per domain (Cyber, Bio, ML R&D, CBRN) |
| ML R&D autonomy level 1 | "R&D automation" | Fully automate AI R&D pipeline at competitive cost |
| Sandbagging | "Strategic underperformance" | Model underperforms on evals; in OpenAI Research Categories |
| Instrumental reasoning | "Means-ends reasoning" | Reasoning about how to achieve goals; target of DeepMind monitoring |
خواندن بیشتر
- OpenAI — Updating our Preparedness Frameworkاعلامیه v2.
- OpenAI — Preparedness Framework v2 PDF اسناد کامل
- DeepMind — Strengthening our Frontier Safety Framework اعلامیه FSF v3
- DeepMind — Updating the Frontier Safety Framework (April 2026) اضافه کردن سطوح توانایی پیگیری شده
- Gemini 3 Pro FSF Report نمونه ای از گزارش ریسک در قالب FSF.
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.