Phase 15: Autonomous Systems

سیاست مقیاس بندی مسئولانه انسان v3.0

RSP v3.0 در 24 فوریه 2026 به اجرا در آمد و جایگزین سیاست 2023 شد. کاهش دو سطح: آنچه که آنترروپک به صورت یک جانبه انجام می دهد در مقابل آنچه که به عنوان یک توصیه در سراسر صنعت (از جمله استاندارد های امنیتی RAND SL-4) تعریف شده است. نقشه های راه ایمنی مرزی و گزارش های ریسک را به عنوان اسناد دائمی به جای تحویل یک بار اضافه می کند. تعهد توقف سال 2023 رو قطع ميکنه آنتروپک، یک بار از حد تحقیق و توسعه ۴ هوش مصنوعی را معرفی می کند: پس از عبور آن، باید یک مورد تأییدی را که خطرات خط خط خط و کاهش آن را شناسایی می کند، منتشر کند. کلاود اپوس 4.6 از آن عبور نمی کند. انتروپک در اعلامیه v3.0 می گوید که "با اطمینان از این موضوع اجتناب دشوار می شود". SaferAI RSP 2023 را به 2.2 رتبه بندی کرد؛ آنها v3.0 را به 1.9 کاهش دادند، و این به عنوان یک گروه RSP "ضعف" در کنار OpenAI و DeepMind قرار دادند. آستانه های کیفی تعهدات کمی 2023 را جایگزین کردند؛ حذف بند توقف شدیدترین بازگشت است.

Type: Learn

Languages: Python (stdlib, RSP threshold decision engine)

Prerequisites: Phase 15 · 06 (AAR), Phase 15 · 07 (RSI)

Time: ~45 minutes

مشکل

آزمایشگاه های مرزها سیاست های مقیاس بندی را منتشر می کنند که بخشی از آنها اسناد فنی، بخشی از اسناد حاکمیت و بخشی از سیگنال ها به تنظیم کنندگان است. RSP v3.0 سند فعلی انسان شناسی است. خواندن آن به دقت مهم نیست زیرا رعایت آن ملزم است (نه است) ، بلکه به این دلیل است که چارچوب شکل می دهد که چگونه یک آزمایشگاه از خطر فاجعه بار تصور می کند و چگونه آنها تبادله را به عموم می رسانند.

تفاوت v3.0 در مقابل v2.0 واحد مفید است. آنچه اضافه شد: نقشه های جاده ای ایمنی مرزی، گزارش های ریسک، آای آر و دی -4 آنچه حذف شد: تعهد توقف 2023 آنچه که بازتکنی شد: یک برنامه کاهش دو سطح تقسیم بین انتروپک یک طرفه و توصیه صنعت. بررسی خارجی SaferAI رتبه را از 2.2 (v2) به 1.9 (v3.0) کاهش داد. اینگونه یک سیاست مقیاس بندی می تواند در حالی که بیشتر صاف به نظر می رسد، کمتر سخت گیر شود.

مفهوم

برنامه کاهش دو سطح

  • Anthropic unilateral actionsآموزش ها بالاتر از یک حد، اقدامات امنیتی خاص، دروازه های خاص استفاده می شود.
  • Industry-wide recommendations: آنچه که آنترروپک فکر می کند صنعت باید به طور جمعی انجام دهد. شامل استانداردهای امنیتی RAND SL-4. این تعهدات از طرف آنترروپک نیست؛ آنها حمایت از سیاست است.

ساختار دو سطحی در v2 نبود. این بدان معنی است که خواننده باید به کالم هر تعهد زندگی می کند نگاه کند. یک اقدام امنیتی در کالم "وصیه صنعت" وعده Anthropic نیست؛ این امید Anthropic است.

آای آر آر و دی ۴

این سطح قابلیت RSP v3.0 به عنوان آستانه بعدی مهم نام می گیرد. به طور خاص: یک مدل که می تواند بخش قابل توجهی از تحقیقات هوش مصنوعی را با هزینه رقابتی خودکار کند. هنگامی که آنترروپک معتقد است که یک مدل از آن عبور می کند، آنها باید یک مورد تأییدی را منتشر کنند که خطرات خطای خطای خطای خطای خطای و کاهش را قبل از ادامه مقیاس بندی شناسایی می کند.

کلاود اوپوس 4.6 به گفته اعلامیه v3.0 از این حد عبور نمی کند. سند اضافه می کند: "با اطمینان از این که خارج کردن این موضوع دشوار می شود". این عبارت مهم است؛ این نشان می دهد که این حد به اندازه کافی نزدیک است تا یک نگرانی زنده باشد، نه یک محدودیت حدس زده.

درس 6 (تحقیق تنظیم خودکار) و درس 7 (توسعه خود بهبود مکرر) مستقیماً به این حد دسترسی دارند. محققان تنظیم خودکار که از ردیف های کیفیت تحقیق عبور می کنند، شواهد این است که حد R&D-4 هوش مصنوعی نزدیک شده است.

نقشه های راه ایمنی مرزی و گزارش های ریسک

در v3.0 دو نوع آثار را به اسناد ثابت می رساند:

  • Frontier Safety Roadmap: یک سند پیش بینی کننده که کار های امنیتی برنامه ریزی شده، انتظارات قابلیت و تحقیقات کاهش را توصیف می کند.
  • Risk Report: یک سند بازبینی در مورد مدل های خاص پس از انتشار، توصیف توانایی مشاهده شده و ریسک باقیمانده.

هر دو عمومی هستند. هر دو در یک زمان اعلام شده به روز می شوند. مفید این است که خواننده می تواند ردیابی کند که آنچه که آنترپیک گفت در یک نقشه راه انجام می دهد با آنچه که در یک گزارش ریسک گزارش می دهد مقایسه می شود.

حذف بند توقف

در RSP 2023 تعهد صریح توقف شامل شده است: اگر یک مدل از حد محدودیت های قابلیت خاص عبور کند، آموزش تا زمانی که کاهش ها در محل قرار گیرد متوقف می شود. v3.0 توقف صریح را با فرموله نرم تر جایگزین می کند (برنامه ای مثبت منتشر کنید، اگر کاهش ها کافی باشد ادامه دهید). SaferAI و تحلیلگران دیگر این را به طور مستقیم به عنوان قوی ترین بازگشت در سند جدید اعلام کردند.

استدلال سیاست برای تغییر: حد بندی کمی در سال 2023 توسط معیار های مرجع توانایی 2026 غیر قابل دستیابی به نظر می رسد زیرا معیار های مرجع خود را دوباره مقیاس بندی کردند. استدلال ضد: بند توقف در سیاست مقیاس بندی یک وسیله تعهد است؛ حذف آن اعتبار سیاست را از بین می برد.

کاهش رتبه SaferAI

SaferAI یک سازمان مستقل است که اسناد سبک RSP را رتبه بندی می کند. رتبه عمومی آنها: 2023 Anthropic RSP 2.2 امتیاز (از مقیاس ای که 4.0 بهترین RSP فعلی و 1.0 نام تجاری است) را کسب کرد. v3.0 امتیاز 1.9. این باعث شد Anthropic از "متوسط" به "ضعف" تبدیل شود و در دسته ضعیف OpenAI و DeepMind به هم پیوست.

عوامل کاهش رتبه بندی در هر SaferAI:

  • آستانه های کیفی، آستانه های کمی را جایگزین می کنند.
  • تعهد توقف برداشته شده
  • کاهش محدودیت های R&D-4 هوش مصنوعی به عنوان "حال تایید" و نه اقدامات خاص توصیف می شود.
  • مکانیسم های بررسی به گروه مشاوره ایمنی Anthropic بستگی دارد که نظارت مستقل محدود دارد.

این درس چیست؟

این یک درس در مورد رعایت نیست. RSP v3.0 یک مقررات نیست؛ هیچ چیز آنترپک را مجبور به دنبال آن نمی کند. درس در خواندن سند با مشخصه و تردید است که سزاوار آن است. سیاست های مقیاس بندی اولین آزمایشگاه های مرزی سیگنال عمومی هستند که در مورد وضعیت خطر فاجعه بار منتشر می شوند. خواندن آنها به خوبی یک مهارت عملی برای هر کسی است که کارش به توانایی های مرزی بستگی دارد.

ازش استفاده کن

code/main.pyیک موتور تصمیم گیری کوچک را اجرا می کند که شکل ارزیابی رواج RSP را منعکس می کند: با توجه به یک مدل کاندید و مجموعه ای از اندازه گیری های قابلیت، برگردید که آیا رواج AI R&D-4 عبور شده است، بخش های مورد تایید مورد مورد نیاز، و اینکه آیا انتشار می تواند ادامه یابد. این عمدا ساده است؛ نکته این است که منطق سند را صریح کند.

-باده

outputs/skill-scaling-policy-review.mdبررسی سیاست مقیاس بندی (Anthropic، OpenAI، DeepMind یا داخلی) در برابر مرجع v3.0: ساختار دو سطح، آستانه، تعهدات توقف، بررسی مستقل.

تمرینات

  1. فرار کنcode/main.py. در سه مدل مصنوعی در سطوح مختلف توانایی وارد کنید. تایید کنید که ارزیابی کننده حد به طور انتظار می رود و الگوی صحیح مورد مثبت را تولید می کند.
  1. RSP v3.0 را به طور کامل بخوانید (32 صفحه). هر تعهداتی را که در سطح "وصیه صنعت" زندگی می کند شناسایی کنید. کدام یک از این تعهدات در v2 "وحدی جانبی بشری" بوده است؟
  1. روش رتبه بندی RSP SaferAI را بخوانید. با اعمال Rubric خود را به سند بازیافت کنید. کدام ردیف Rubric بیشترین کاهش درجه را ایجاد کرد؟
  1. تعهد توقف در سال 2023 حذف شد. پیشنهاد یک تعهد جایگزین را ارائه دهید که اعتبار سیاست را حفظ کند و در عین حال مشکل تغییر مقیاس معیار در سال 2026 را به رسمیت بشناسد.
  1. مقایسه RSP v3.0 با OpenAI Preparedness Framework v2 (درس 20) یک منطقه را انتخاب کنید که v3.0 قوی تر باشد. یک منطقه را انتخاب کنید که چارچوب آماده سازی قوی تر باشد.

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
RSP"Anthropic's scaling policy"Responsible Scaling Policy; v3.0 effective Feb 24, 2026
AI R&D-4"Research-automation threshold"Capability to automate substantial AI research at competitive cost
Affirmative case"Safety justification"Published argument that risks are identified and mitigations adequate
Frontier Safety Roadmap"Forward plan"Standing document on planned safety work and expected capabilities
Risk Report"Retrospective on a model"Standing document on observed capability and residual risk after release
Two-tier mitigation"Unilateral vs industry"Anthropic commitments vs industry recommendations, separated
Pause commitment"2023 clause"Explicit promise to pause training; removed in v3.0
SaferAI rating"Independent RSP grade"Third-party rubric; v3.0 scored 1.9 (v2 was 2.2)

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.