سیاست مقیاس بندی مسئولانه انسان v3.0
Type: Learn
Languages: Python (stdlib, RSP threshold decision engine)
Prerequisites: Phase 15 · 06 (AAR), Phase 15 · 07 (RSI)
Time: ~45 minutes
مشکل
آزمایشگاه های مرزها سیاست های مقیاس بندی را منتشر می کنند که بخشی از آنها اسناد فنی، بخشی از اسناد حاکمیت و بخشی از سیگنال ها به تنظیم کنندگان است. RSP v3.0 سند فعلی انسان شناسی است. خواندن آن به دقت مهم نیست زیرا رعایت آن ملزم است (نه است) ، بلکه به این دلیل است که چارچوب شکل می دهد که چگونه یک آزمایشگاه از خطر فاجعه بار تصور می کند و چگونه آنها تبادله را به عموم می رسانند.
تفاوت v3.0 در مقابل v2.0 واحد مفید است. آنچه اضافه شد: نقشه های جاده ای ایمنی مرزی، گزارش های ریسک، آای آر و دی -4 آنچه حذف شد: تعهد توقف 2023 آنچه که بازتکنی شد: یک برنامه کاهش دو سطح تقسیم بین انتروپک یک طرفه و توصیه صنعت. بررسی خارجی SaferAI رتبه را از 2.2 (v2) به 1.9 (v3.0) کاهش داد. اینگونه یک سیاست مقیاس بندی می تواند در حالی که بیشتر صاف به نظر می رسد، کمتر سخت گیر شود.
مفهوم
برنامه کاهش دو سطح
- Anthropic unilateral actionsآموزش ها بالاتر از یک حد، اقدامات امنیتی خاص، دروازه های خاص استفاده می شود.
- Industry-wide recommendations: آنچه که آنترروپک فکر می کند صنعت باید به طور جمعی انجام دهد. شامل استانداردهای امنیتی RAND SL-4. این تعهدات از طرف آنترروپک نیست؛ آنها حمایت از سیاست است.
ساختار دو سطحی در v2 نبود. این بدان معنی است که خواننده باید به کالم هر تعهد زندگی می کند نگاه کند. یک اقدام امنیتی در کالم "وصیه صنعت" وعده Anthropic نیست؛ این امید Anthropic است.
آای آر آر و دی ۴
این سطح قابلیت RSP v3.0 به عنوان آستانه بعدی مهم نام می گیرد. به طور خاص: یک مدل که می تواند بخش قابل توجهی از تحقیقات هوش مصنوعی را با هزینه رقابتی خودکار کند. هنگامی که آنترروپک معتقد است که یک مدل از آن عبور می کند، آنها باید یک مورد تأییدی را منتشر کنند که خطرات خطای خطای خطای خطای خطای و کاهش را قبل از ادامه مقیاس بندی شناسایی می کند.
کلاود اوپوس 4.6 به گفته اعلامیه v3.0 از این حد عبور نمی کند. سند اضافه می کند: "با اطمینان از این که خارج کردن این موضوع دشوار می شود". این عبارت مهم است؛ این نشان می دهد که این حد به اندازه کافی نزدیک است تا یک نگرانی زنده باشد، نه یک محدودیت حدس زده.
درس 6 (تحقیق تنظیم خودکار) و درس 7 (توسعه خود بهبود مکرر) مستقیماً به این حد دسترسی دارند. محققان تنظیم خودکار که از ردیف های کیفیت تحقیق عبور می کنند، شواهد این است که حد R&D-4 هوش مصنوعی نزدیک شده است.
نقشه های راه ایمنی مرزی و گزارش های ریسک
در v3.0 دو نوع آثار را به اسناد ثابت می رساند:
- Frontier Safety Roadmap: یک سند پیش بینی کننده که کار های امنیتی برنامه ریزی شده، انتظارات قابلیت و تحقیقات کاهش را توصیف می کند.
- Risk Report: یک سند بازبینی در مورد مدل های خاص پس از انتشار، توصیف توانایی مشاهده شده و ریسک باقیمانده.
هر دو عمومی هستند. هر دو در یک زمان اعلام شده به روز می شوند. مفید این است که خواننده می تواند ردیابی کند که آنچه که آنترپیک گفت در یک نقشه راه انجام می دهد با آنچه که در یک گزارش ریسک گزارش می دهد مقایسه می شود.
حذف بند توقف
در RSP 2023 تعهد صریح توقف شامل شده است: اگر یک مدل از حد محدودیت های قابلیت خاص عبور کند، آموزش تا زمانی که کاهش ها در محل قرار گیرد متوقف می شود. v3.0 توقف صریح را با فرموله نرم تر جایگزین می کند (برنامه ای مثبت منتشر کنید، اگر کاهش ها کافی باشد ادامه دهید). SaferAI و تحلیلگران دیگر این را به طور مستقیم به عنوان قوی ترین بازگشت در سند جدید اعلام کردند.
استدلال سیاست برای تغییر: حد بندی کمی در سال 2023 توسط معیار های مرجع توانایی 2026 غیر قابل دستیابی به نظر می رسد زیرا معیار های مرجع خود را دوباره مقیاس بندی کردند. استدلال ضد: بند توقف در سیاست مقیاس بندی یک وسیله تعهد است؛ حذف آن اعتبار سیاست را از بین می برد.
کاهش رتبه SaferAI
SaferAI یک سازمان مستقل است که اسناد سبک RSP را رتبه بندی می کند. رتبه عمومی آنها: 2023 Anthropic RSP 2.2 امتیاز (از مقیاس ای که 4.0 بهترین RSP فعلی و 1.0 نام تجاری است) را کسب کرد. v3.0 امتیاز 1.9. این باعث شد Anthropic از "متوسط" به "ضعف" تبدیل شود و در دسته ضعیف OpenAI و DeepMind به هم پیوست.
عوامل کاهش رتبه بندی در هر SaferAI:
- آستانه های کیفی، آستانه های کمی را جایگزین می کنند.
- تعهد توقف برداشته شده
- کاهش محدودیت های R&D-4 هوش مصنوعی به عنوان "حال تایید" و نه اقدامات خاص توصیف می شود.
- مکانیسم های بررسی به گروه مشاوره ایمنی Anthropic بستگی دارد که نظارت مستقل محدود دارد.
این درس چیست؟
این یک درس در مورد رعایت نیست. RSP v3.0 یک مقررات نیست؛ هیچ چیز آنترپک را مجبور به دنبال آن نمی کند. درس در خواندن سند با مشخصه و تردید است که سزاوار آن است. سیاست های مقیاس بندی اولین آزمایشگاه های مرزی سیگنال عمومی هستند که در مورد وضعیت خطر فاجعه بار منتشر می شوند. خواندن آنها به خوبی یک مهارت عملی برای هر کسی است که کارش به توانایی های مرزی بستگی دارد.
ازش استفاده کن
code/main.pyیک موتور تصمیم گیری کوچک را اجرا می کند که شکل ارزیابی رواج RSP را منعکس می کند: با توجه به یک مدل کاندید و مجموعه ای از اندازه گیری های قابلیت، برگردید که آیا رواج AI R&D-4 عبور شده است، بخش های مورد تایید مورد مورد نیاز، و اینکه آیا انتشار می تواند ادامه یابد. این عمدا ساده است؛ نکته این است که منطق سند را صریح کند.
-باده
outputs/skill-scaling-policy-review.mdبررسی سیاست مقیاس بندی (Anthropic، OpenAI، DeepMind یا داخلی) در برابر مرجع v3.0: ساختار دو سطح، آستانه، تعهدات توقف، بررسی مستقل.
تمرینات
- فرار کن
code/main.py. در سه مدل مصنوعی در سطوح مختلف توانایی وارد کنید. تایید کنید که ارزیابی کننده حد به طور انتظار می رود و الگوی صحیح مورد مثبت را تولید می کند.
- RSP v3.0 را به طور کامل بخوانید (32 صفحه). هر تعهداتی را که در سطح "وصیه صنعت" زندگی می کند شناسایی کنید. کدام یک از این تعهدات در v2 "وحدی جانبی بشری" بوده است؟
- روش رتبه بندی RSP SaferAI را بخوانید. با اعمال Rubric خود را به سند بازیافت کنید. کدام ردیف Rubric بیشترین کاهش درجه را ایجاد کرد؟
- تعهد توقف در سال 2023 حذف شد. پیشنهاد یک تعهد جایگزین را ارائه دهید که اعتبار سیاست را حفظ کند و در عین حال مشکل تغییر مقیاس معیار در سال 2026 را به رسمیت بشناسد.
- مقایسه RSP v3.0 با OpenAI Preparedness Framework v2 (درس 20) یک منطقه را انتخاب کنید که v3.0 قوی تر باشد. یک منطقه را انتخاب کنید که چارچوب آماده سازی قوی تر باشد.
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| RSP | "Anthropic's scaling policy" | Responsible Scaling Policy; v3.0 effective Feb 24, 2026 |
| AI R&D-4 | "Research-automation threshold" | Capability to automate substantial AI research at competitive cost |
| Affirmative case | "Safety justification" | Published argument that risks are identified and mitigations adequate |
| Frontier Safety Roadmap | "Forward plan" | Standing document on planned safety work and expected capabilities |
| Risk Report | "Retrospective on a model" | Standing document on observed capability and residual risk after release |
| Two-tier mitigation | "Unilateral vs industry" | Anthropic commitments vs industry recommendations, separated |
| Pause commitment | "2023 clause" | Explicit promise to pause training; removed in v3.0 |
| SaferAI rating | "Independent RSP grade" | Third-party rubric; v3.0 scored 1.9 (v2 was 2.2) |
خواندن بیشتر
- Anthropic — Responsible Scaling Policy v3.0 سیاست 32 صفحه ای کامل
- Anthropic — RSP v3.0 announcement خلاصه ی تغییرات از v2.
- Anthropic — Frontier Safety Roadmap سند ثابت مرتبط با RSP v3.0.
- Anthropic — Risk Report: February 2026 بازنگری در مورد کلاود اپوس 4.6، مدل مرز زمانی که منتشر شد.
- Anthropic — Measuring agent autonomy in practice ارتباط AI R&D-4 با استقلال اندازه گیری شده.
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.