Phase 15: Autonomous Systems

چارچوب آماده سازی OpenAI و چارچوب ایمنی مرزی DeepMind

OpenAI Preparedness Framework v2 (اپریل 2025) دسته بندی های تحقیقاتی را معرفی می کند خود مختاری طولانی مدت، تکه شن، نقل و نقل خودکار و سازگاری، تضعیف حفاظتی که از دسته بندی های ردیابی متفاوت است. دسته بندی های ردیابی گزارش های قابلیت ها و گزارش های حفاظت را که توسط گروه مشاوره ایمنی بررسی شده است، فعال می کند. FSF v3 DeepMind (ستمبر 2025, با اضافه کردن سطوح قابلیت ردیابی 17 آوریل 2026) خود مختاری را به دامنه های ML R&D و سایبر (ML R&D خود مختاری سطح 1 = خودکار سازی کامل لوله R&D AI با هزینه رقابتی در مقابل ابزار های انسانی + AI) می کند. FSF v3 به طور صریح به تعادل فریبنده از طریق نظارت خودکار برای سوء استفاده از استدلال ابزار اشاره می کند. نکته صادقانه: دسته بندی های تحقیقاتی در PF v2 (از جمله خود مختاری طولانی مدت) به طور خودکار کاهش ها را ایجاد نمی کنند؛ زبان سیاست "محتمل است". خود DeepMind می گوید نظارت خودکار "در دراز مدت کافی نخواهد بود" اگر استدلال ابزارک تقویت شود.

Type: Learn

Languages: Python (stdlib, three-framework decision-table diff tool)

Prerequisites: Phase 15 · 19 (Anthropic RSP)

Time: ~45 minutes

مشکل

دروس 19 سیاست مقیاس پذیری Anthropic را به دقت مطالعه می کند. این درس تصویر را با خواندن OpenAI و DeepMind تکمیل می کند. سه سند آثار عموی هستند که به همان سوال پاسخ می دهند چه زمانی یک آزمایشگاه مرزی باید یک مدل را متوقف کند یا دروازه کند و آنها در مجموعه ای کوچک از دسته بندی ها به هم می رسند و در مکان های خاص که اهمیت دارند متفاوت هستند.

تقارب: هر سه خود مختاری بلند مدت را به عنوان یک کلاس توانایی ارزش ردیابی می دانند. هر سه رفتار فریبنده (تزویر صف بندی، تزویر) را به عنوان یک کلاس خاص خطر می شناسند. سه تا از آنها یک سازمان بازرسی داخلی دارند. تفاوت: OpenAI دسته ها را به "تراکی" (کم کردن اجباری) و "تحقیق" (هیچ عامل خودکار) تقسیم می کند. دپ مایند استقلال را به دو دامنه تقسیم می کند تا به جای نامگذاری آن به طور جداگانه. آزمایشگاه ها Tracked vs Research، یا Critical vs Moderate، یا Tier-1 vs Tier-2 نام می دهند؛ نتیجه عملیاتی که در آن سطل یک توانایی زندگی می کند در آزمایشگاه های مختلف متفاوت است.

خواندن آنها با هم تمرین مفید است. این قابلیت می تواند "کم کردن اجباری" در Anthropic، "مراقب اما غیر فعال" در OpenAI و "در یک دامنه خاص" در DeepMind باشد. موضع سیاست مهم است.

مفهوم

چارچوب آماده سازی OpenAI v2 (اپریل 2025)

ساختار:

  • Tracked Categories: گزارش های قابلیت (چه کاری می تواند مدل انجام دهد) و گزارش های حفاظتی (چه کاهشاتی وجود دارد) که قبل از انتشار توسط گروه مشاوره ایمنی بررسی می شود.
  • Research Categories: قابلیت های مدل ای که آزمایشگاه در حال پیگیری است اما هنوز به کاهش های خاص متعهد نشده است. شامل استقلال در راه دور، تکه شن، تکثیر خود مختار و سازگاری، تضعیف حفاظتی است.

چارچوب کلیدی در v2: دسته بندی های تحقیق به طور خودکار کاهش ها را تحریک نمی کنند. زبان سیاست کاهش های "محتمل" است. این دلتا خاص برای مشاهده است: مکان یک دسته در Tracked vs Research، پیچ بین "گات" و "نظر گرفته شده" است.

چارچوب ایمنی مرزی DeepMind v3 (ستمبر 2025؛ سطوح قابلیت ردیابی 17 آوریل 2026)

ساختار:

  • Critical Capability Levels (CCLs): حد توانایی در پنج حوزه: سایبر، بیولوژی، تحقیق و توسعه ML، CBRN، استقلال (به تحقیق و توسعه ML و سایبر)
  • Tracked Capability Levels: گرانولیت اضافی در آوریل 2026 اضافه شد. مثال مشخص: ML R&D خود مختاری سطح 1 = به طور کامل خودکار سازی لوله R&D هوش مصنوعی با هزینه رقابتی در مقابل ابزار های انسانی + هوش مصنوعی.
  • Deceptive alignment monitoring: تعهد صریح به نظارت خودکار برای سوء استفاده از استدلال ابزار.

چارچوبی که از خودمختاری استفاده می شود، از OpenAI متفاوت است. DeepMind "خود مختاری" را به عنوان یک دامنه سطح بالا حفظ نمی کند؛ به دامنه هایی که در آن استقلال آسیب می رساند (ML R&D و سایبر) تقسیم می شود. استدلال این است که استقلال بدون یک دامنه توانایی بدون ریسک است؛ استدلال ضد این است که استقلال در سراسر دامنه ها یک متاریسک است که چارچوب باید نام دهد.

که سه تا هم بر روی آن همگام می شوند

  • گروه مشاوره ایمنی داخلی (به نام Anthropic SAG، OpenAI SAG، DeepMind) قبل از انتشار برای مدل های با قابلیت بالا بررسی می شود.
  • ذکر صریح تعادل فریبنده / تعادل تظاهر به عنوان یک کلاس خطر.
  • آثار ثابت در یک زمان اعلام شده (انترپاتیک: نقشه راه ایمنی مرز، گزارش ریسک؛ OpenAI: گزارش قابلیت ها و تضمین ها؛ DeepMind: چرخه به روز رسانی FSF).
  • اعتراف به این که دفاعی که فقط نظارت می کند، سقف دارد. DeepMind به وضوح می گوید: "مراقب خودکار به مدت طولانی کافی نخواهد بود".

جایی که متمایز می شوند

  • Anthropic: تعهد توقف در v3.0 حذف شده است؛ آای R&D-4 درحاله نام گذاری دروازه بعدی است.
  • OpenAI: ردیابی در مقابل تحقیق تقسیم شده است؛ دسته بندی های تحقیقاتی (از جمله خود مختاری در فاصله طولانی) به طور خودکار دروازه نمی شوند.
  • DeepMind: استقلال به حوزه های دیگر تقسیم شده است؛ سطوح توانایی ردیابی در آوریل 2026 به اندازه ی جزئی اضافه می شود.

شنباده کردن: یک توانایی خاص که سه تا را پیچیده می کند

Sandbagging (مودلی که از نظر استراتژیک در ارزیابی ها عملکرد کمتری دارد) در دسته بندی های تحقیقاتی OpenAI قرار دارد. RSP v3.0 Anthropic از طریق شکاف ارزیابی-مناطق (درس 1) آن را حل می کند. DeepMind از طریق نظارت خطایی بر تعاونی در FSF v3.

اگر یک مدل در ارزیابی ها، محدودیت های توانایی هر چارچوبی زیرنظر گرفته می شود. چارچوب تنها در صورتی کار می کند که اندازه گیری کار کند. به همین دلیل اندازه گیری خارجی (درسی 21، METR) و ارزیابی متضاد علاوه بر خود ارزیابی آزمایشگاهی ضروری است.

مهارت در خواندن سیاست ها

  • موقعیت: هر قابلیت که به آن اهمیت می دهید باید در سیاست یافت شود. اگر قابل یافت نباشد، سیاست آن را پوشش نمی دهد.
  • طبقه بندی: آیا ردیابی شده است (تحرک کاهش) یا تحقیق (تراکی شده است اما تحریک نمی شود) OpenAI این نام را می دهد؛ انسان شناسی و DeepMind معادل خود را دارند.
  • زمان: آیا سیاست در یک برنامه اعلام شده به روز می شود یا فقط پس از رویدادهای خاص؟ زمان اعلام شده قوی تر است.
  • استقلال: بررسی خارجی اجباری است یا اختیاری؟ شرکای بشری با اپولو و موسسه ایمنی هوش مصنوعی ایالات متحده؛ OpenAI با METR؛ DeepMind با SAG داخلی عمدتا.

ازش استفاده کن

code/main.pyاین ابزار یک ابزار تفاوت جدول تصمیم گیری کوچک را اجرا می کند. با توجه به قابلیت (خود مختاری، هماهنگی فریبنده، اتوماسیون تحقیق و توسعه، ارتقاء سایبری، و غیره) ، این محصول چگونگی طبقه بندی هر یک از سه سیاست، توانایی را و آنچه کاهش می دهد را ایجاد می کند. این یک کمک خواندن است، نه یک ابزار سیاست.

-باده

outputs/skill-cross-policy-diff.mdیک مقایسه میان سیاست ها برای یک قابلیت خاص را با استفاده از سه چارچوب به عنوان مرجع ارائه می دهد.

تمرینات

  1. فرار کنcode/main.py. تایید کنید که محصول ابزار مختلف با سیاست ها مطابقت دارد برای حداقل دو قابلیت که می توانید با اسناد منبع بررسی کنید.
  1. OpenAI Preparedness Framework v2 را به طور کامل بخوانید. هر دسته تحقیق را شناسایی کنید. برای هر یک یک یک جمله را در مورد اینکه چرا در تحقیق به جای ردیابی قرار دارد بنویسید.
  1. DeepMind FSF v3 را به طور کامل بخوانید، به علاوه به روزرسانی سطح قابلیت های ردیابی آوریل 2026 . معیارهای ارزیابی خاص سطح 1 خود مختاری تحقیق و توسعه ML را شناسایی کنید. چگونه آن را از خارج اندازه گیری می کنید؟
  1. Sandbagging در دسته بندی های تحقیق OpenAI قرار دارد. یک ارزیابی طراحی کنید که یک مدل sandbagging را مجبور به افشا کردن توانایی واقعی آن کند. به بحث درس 1 ارزیابی-حالت-بازی مراجعه کنید.
  1. سه سیاست را در مورد یک قابلیت خاص (انتخاب خود) مقایسه کنید. طبقه بندی کدام سیاست را سختگیرانه ترین و کمترین می دانید نام دهید. با متن منبع توجیه کنید.

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
Preparedness Framework"OpenAI's scaling policy"PF v2 (April 2025); Tracked vs Research categories
Tracked Category"Mandatory mitigation"Triggers Capabilities + Safeguards Reports; SAG review
Research Category"Monitored only"Tracked but no automatic mitigation; includes Long-range Autonomy
Frontier Safety Framework"DeepMind's scaling policy"FSF v3 (Sept 2025) + Tracked Capability Levels (Apr 2026)
CCL"Critical Capability Level"DeepMind threshold per domain (Cyber, Bio, ML R&D, CBRN)
ML R&D autonomy level 1"R&D automation"Fully automate AI R&D pipeline at competitive cost
Sandbagging"Strategic underperformance"Model underperforms on evals; in OpenAI Research Categories
Instrumental reasoning"Means-ends reasoning"Reasoning about how to achieve goals; target of DeepMind monitoring

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.