Phase 15: Autonomous Systems

मानव जिम्मेदार स्केलिंग नीति v3.0

आरएसपी v3.0 24 फरवरी, 2026 को लागू हुआ, जो 2023 नीति की जगह लेगा। दो-स्तरीय मिट्यागः एंथ्रोपिक एकतरफा क्या करेगा बनाम उद्योगव्यापी सिफारिश के रूप में ढांचा (RAND SL-4 सुरक्षा मानकों सहित) । सीमा सुरक्षा रोडमैप और जोखिम रिपोर्ट को एक बार के परिणामों के बजाय स्थायी दस्तावेजों के रूप में जोड़ता है। 2023 के लिए विराम की प्रतिबद्धता को समाप्त कर देता है। एआई आर एंड डी-4 सीमा का परिचय देता हैः एक बार पार कर जाने के बाद, एंथ्रोपिक को गलत संरेखण जोखिमों और mitigations की पहचान करने वाला एक सकारात्मक मामला प्रकाशित करना चाहिए। क्लाउड ओपस 4.6 इसे पार नहीं करता है। मानव विज्ञान v3.0 घोषणा में कहता है कि "विश्वासपूर्वक इसे बाहर करना मुश्किल हो रहा है।" सुरक्षितएआई ने 2023 आरएसपी को 2.2 पर रेट किया; उन्होंने v3.0 को 1.9 पर गिरा दिया, जिससे मानव विज्ञान को ओपनएआई और डीपमाइंड के साथ "कमज़ोर" आरएसपी श्रेणी में रखा गया। 2023 के लिए मात्रात्मक प्रतिबद्धताओं की जगह गुणात्मक सीमाएं ली गई हैं; विराम खंड को हटाकर सबसे तेज गिरावट है।

Type: Learn

Languages: Python (stdlib, RSP threshold decision engine)

Prerequisites: Phase 15 · 06 (AAR), Phase 15 · 07 (RSI)

Time: ~45 minutes

समस्या

फ्रंटियर लैब्स स्केलिंग नीतियां प्रकाशित करते हैं जो आंशिक रूप से तकनीकी दस्तावेज, आंशिक रूप से शासन दस्तावेज और आंशिक रूप से नियामकों को संकेत हैं। आरएसपी 3.0 वर्तमान मानव विज्ञान दस्तावेज है। इसे बारीकी से पढ़ना महत्वपूर्ण नहीं है क्योंकि इसका अनुपालन बाध्यकारी है (यह नहीं है), लेकिन क्योंकि ढांचा यह आकार देता है कि एक प्रयोगशाला कैसे आपदा जोखिम को समझती है और कैसे वे जनता को समझौता संवाद करते हैं।

v3.0 बनाम v2.0 अंतर उपयोगी इकाई है। जो जोड़ा गया: सीमा सुरक्षा रोडमैप, जोखिम रिपोर्ट, एआई आर एंड डी-4 की सीमा। जो हटा दिया गया: 2023 के लिए विराम प्रतिबद्धता। क्या पुनर्निर्माण किया गयाः दो स्तरों के उन्मूलन कार्यक्रम मानव-एकतरफा और उद्योग-अनुशंसा के बीच विभाजित। बाहरी समीक्षा SaferAI ने स्कोर को 2.2 (v2) से घटाकर 1.9 (v3.0) कर दिया। यह है कि कैसे एक स्केलिंग नीति कम कठोर हो सकता है जबकि अधिक पॉलिश लग रहा है।

अवधारणा

दो स्तरीय राहत कार्यक्रम

  • Anthropic unilateral actionsप्रशिक्षण एक सीमा से ऊपर, विशिष्ट सुरक्षा उपायों, विशिष्ट तैनाती के द्वारों पर बंद हो जाता है।
  • Industry-wide recommendations: जो एंथ्रोपिक का मानना है कि उद्योग को सामूहिक रूप से करना चाहिए। इसमें RAND SL-4 सुरक्षा मानक शामिल हैं। ये एंथ्रोपिक की ओर से प्रतिबद्धता नहीं हैं; वे नीति वकालत हैं।

दो-स्तरीय संरचना v2 में नहीं थी। इसका मतलब है कि एक पाठक को यह देखने की आवश्यकता है कि प्रत्येक प्रतिबद्धता किस स्तंभ में रहती है। "उद्योगव्यापी सिफारिश" स्तंभ में सुरक्षा उपाय एंथ्रोपिक का वादा नहीं है; यह एंथ्रोपिक की आशा है।

एआई आरएंडडी-4 की सीमा

यह क्षमता स्तर आरएसपी v3.0 महत्वपूर्ण अगले सीमा के रूप में नामित है। विशेष रूप सेः एक मॉडल जो प्रतिस्पर्धी लागत पर एआई अनुसंधान के एक महत्वपूर्ण अंश को स्वचालित कर सकता है। एक बार जब एंथ्रोपिक का मानना है कि एक मॉडल इसे पार करता है, तो उन्हें स्केलिंग जारी रखने से पहले गलत संरेखण जोखिमों और mitigations की पहचान करने वाला एक सकारात्मक मामला प्रकाशित करना चाहिए।

क्लॉड ओपस 4.6 v3.0 घोषणा के अनुसार इसे पार नहीं करता है। दस्तावेज़ में कहा गया हैः "विश्वासपूर्वक इसे बाहर करना मुश्किल हो रहा है।" यह वाक्यांश महत्वपूर्ण है; यह स्वीकार करता है कि सीमा एक जीवित चिंता होने के लिए पर्याप्त करीब है, न कि एक अटकलों की सीमा।

पाठ 6 (स्वचालित संरेखण अनुसंधान) और पाठ 7 (पुनर्वर्ती आत्म-सुधार) सीधे इस सीमा में फ़ीड करते हैं। अनुसंधान-गुणवत्ता वाले बारों को पार करने वाले स्वचालित संरेखण शोधकर्ता इस बात का प्रमाण हैं कि एआई आर एंड डी-4 सीमा निकट आ रही है।

सीमा सुरक्षा रोडमैप और जोखिम रिपोर्ट

v3.0 दो कलाकृतियों के प्रकार को स्थायी दस्तावेजों में बढ़ाता हैः

  • Frontier Safety Roadmap: भविष्य की ओर देखने वाला दस्तावेज जिसमें नियोजित सुरक्षा कार्य, क्षमता अपेक्षाएं और न्यूनीकरण अनुसंधान का वर्णन किया गया है।
  • Risk Report: रिलीज़ के बाद विशिष्ट मॉडल पर एक प्रतिबिंबित दस्तावेज, जिसमें अवलोकन क्षमता और अवशिष्ट जोखिम का वर्णन किया गया है।

दोनों सार्वजनिक हैं. दोनों एक घोषित कैडेन्स पर अपडेट किए जाते हैं। उपयोगिता यह हैः पाठक ट्रैक कर सकता है कि रोडमैप में जो कुछ एंथ्रोपिक ने कहा था कि वे करेंगे, वह जोखिम रिपोर्ट में रिपोर्ट के साथ कैसे तुलना करता है।

विराम खंड को हटाना

2023 आरएसपी में स्पष्ट विराम प्रतिबद्धता शामिल थीः यदि एक मॉडल विशिष्ट क्षमता सीमाओं को पार करता है, तो प्रशिक्षण को तब तक विराम दिया जाएगा जब तक कि मिट्याग लागू नहीं हो जाते। v3.0 स्पष्ट विराम को एक नरम सूत्र के साथ बदल देता है (एक सकारात्मक मामला प्रकाशित करें, यदि मिट्याग पर्याप्त हैं, तो आगे बढ़ें) । SaferAI और अन्य विश्लेषकों ने इसे सीधे नए दस्तावेज़ में सबसे मजबूत प्रतिगमन के रूप में बुलाया।

परिवर्तन के लिए नीतिगत तर्कः 2023 में मात्रात्मक सीमाएं 2026 युग के क्षमता बेंचमार्क द्वारा अछूता साबित हुईं क्योंकि बेंचमार्क स्वयं को फिर से स्केल किया गया था। काउंटर-आर्कमेंटः स्केलिंग नीति में एक विराम खंड एक प्रतिबद्धता उपकरण है; इसे हटाने से नीति की विश्वसनीयता समाप्त हो जाती है।

सेफराई का डाउनग्रेड

सुरक्षितएआई एक स्वतंत्र संगठन है जो आरएसपी शैली के दस्तावेजों को रेट करता है। उनकी सार्वजनिक रेटिंगः 2023 मानव आरएसपी ने 2.2 (एक पैमाने से जहां 4.0 सबसे अच्छा वर्तमान आरएसपी है और 1.0 नाममात्र है) स्कोर किया। v3.0 ने 1.9 स्कोर किया। इससे मानव "मध्यम" से "कमज़ोर" हो गया, ओपनएआई और डीपमाइंड में शामिल होकर कमजोर श्रेणी में शामिल हो गया।

SaferAI के अनुसार घटने वाले कारकः

  • गुणात्मक सीमाएं मात्रात्मक सीमाओं की जगह लेती हैं।
  • विराम प्रतिबद्धता हटा दी गई है।
  • एआई आर एंड डी-4 सीमा को कम करने के लिए विशिष्ट उपायों के बजाय "सकारात्मक मामला" के रूप में वर्णित किया जाता है।
  • समीक्षा तंत्र मानव जाति के सुरक्षा सलाहकार समूह पर निर्भर करते हैं, सीमित स्वतंत्र पर्यवेक्षण के साथ।

यह सबक क्या नहीं है

यह अनुपालन का एक सबक नहीं है। आरएसपी 3.0 एक विनियमन नहीं है; कुछ भी मानव विज्ञान को इसका पालन करने के लिए मजबूर नहीं करता है। सबक दस्तावेज़ को विशिष्टता और संदेह के साथ पढ़ने में है जो इसके लायक है। स्केलिंग नीतियां आपदा-जोखिम के बारे में जारी प्राथमिक सार्वजनिक संकेत सीमा प्रयोगशालाएं हैं। उन्हें अच्छी तरह से पढ़ना किसी के लिए एक व्यावहारिक कौशल है जिसका काम सीमा क्षमताओं पर निर्भर करता है।

इसका प्रयोग करें

code/main.pyएक छोटे से निर्णय इंजन को लागू करता है जो आरएसपी सीमा-मूल्यांकन के आकार को दर्शाता हैः एक उम्मीदवार मॉडल और क्षमता माप के एक सेट को देखते हुए, यह लौटाता है कि क्या एआई आर एंड डी -4 सीमा पार कर ली गई है, आवश्यक सकारात्मक मामले अनुभाग, और क्या तैनाती आगे बढ़ सकती है। यह जानबूझकर सरल है; बिंदु दस्तावेज़ के तर्क को स्पष्ट करना है।

इसे भेजें

outputs/skill-scaling-policy-review.mdv3.0 संदर्भ के मुकाबले एक स्केलिंग नीति (एंट्रोपिक, ओपनएआई, डीपमाइंड या आंतरिक) की समीक्षा करता हैः दो-स्तरीय संरचना, सीमाएँ, विराम प्रतिबद्धताएं, स्वतंत्र समीक्षा।

व्यायाम

  1. दौड़ेंcode/main.py. विभिन्न क्षमता स्तरों पर तीन सिंथेटिक मॉडल में फ़ीड करें. सीमा मूल्यांकनकर्ता की अपेक्षा के अनुसार व्यवहार की पुष्टि करें और सही सकारात्मक मामले के टेम्पलेट का उत्पादन करें।
  1. आरएसपी v3.0 को पूरा पढ़ें (32 पृष्ठ) "उद्योगव्यापी सिफारिश" स्तर में रहने वाले प्रत्येक प्रतिबद्धता की पहचान करें। उन प्रतिबद्धताओं में से कौन सी v2 में "मानव एकतरफा" होगी?
  1. SaferAI की RSP रेटिंग पद्धति पढ़ें। दस्तावेज़ पर अपनी rubric लागू करके v3.0 के लिए उनके 1.9 स्कोर को पुनः प्रस्तुत करें। किस rubric पंक्ति ने सबसे अधिक डाउनग्रेड किया?
  1. 2023 के लिए विराम प्रतिबद्धता को हटा दिया गया। 2026 में बेंचमार्क रीस्केलिंग की समस्या को स्वीकार करते हुए नीति की विश्वसनीयता को बनाए रखने के लिए एक प्रतिस्थापन प्रतिबद्धता का प्रस्ताव करें।
  1. आरएसपी v3.0 की तुलना OpenAI Preparedness Framework v2 (पाठ 20) से करें। एक ऐसा क्षेत्र चुनें जहां v3.0 मजबूत है। एक ऐसा क्षेत्र चुनें जहां Preparedness Framework मजबूत है।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
RSP"Anthropic's scaling policy"Responsible Scaling Policy; v3.0 effective Feb 24, 2026
AI R&D-4"Research-automation threshold"Capability to automate substantial AI research at competitive cost
Affirmative case"Safety justification"Published argument that risks are identified and mitigations adequate
Frontier Safety Roadmap"Forward plan"Standing document on planned safety work and expected capabilities
Risk Report"Retrospective on a model"Standing document on observed capability and residual risk after release
Two-tier mitigation"Unilateral vs industry"Anthropic commitments vs industry recommendations, separated
Pause commitment"2023 clause"Explicit promise to pause training; removed in v3.0
SaferAI rating"Independent RSP grade"Third-party rubric; v3.0 scored 1.9 (v2 was 2.2)

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.