सीमा सुरक्षा ढांचे आरएसपी, पीएफ, एफएसएफ
Type: Learn
Languages: none
Prerequisites: Phase 18 · 17 (WMDP), Phase 18 · 07-09 (deception failures)
Time: ~75 minutes
सीखने के लक्ष्य
- एंथ्रोपिक की एएसएल स्तर संरचना का वर्णन करें और एएसएल-3 को सक्रिय करने के लिए क्या किया गया है।
- ट्रैक किए गए क्षमताओं के लिए पांच ओपनएआई तैयारी फ्रेमवर्क v2 मानदंडों का नाम दें।
- डीपमाइंड के महत्वपूर्ण क्षमता स्तर संरचना और हानिकारक हेरफेर सीसीएल का वर्णन करें।
- प्रतियोगी समायोजन खंडों को समझाएं और वे दौड़ की गतिशीलता के लिए महत्वपूर्ण क्यों हैं।
- एक सुरक्षा मामले को परिभाषित करें और तीन स्तंभ संरचना (निरीक्षण, गैर-पठनीयता, अक्षमता) का वर्णन करें।
समस्या
पाठ 7-17 में यह निर्धारित किया गया है कि धोखाधड़ी संभव है, दोहरे उपयोग की क्षमता मौजूद है, और मूल्यांकन की सीमाएं हैं। सीमा-सक्षम मॉडल वाली प्रयोगशाला को आंतरिक शासन संरचना की आवश्यकता होती है जोः
- नए सुरक्षा उपायों की आवश्यकता होने पर सीमाओं को परिभाषित करता है।
- स्केल करने से पहले आवश्यक मूल्यांकन को परिभाषित करता है।
- यह बताता है कि सुरक्षा मामले की तरह कैसा दिखता है।
- दौड़-गतिशीलता की समस्या को संभालता है (यदि प्रतियोगी बिना सुरक्षा के जहाज करते हैं, तो आप क्या करते हैं?
2025-2026 के तीन ढांचे अत्याधुनिक हैं अपूर्ण, विकसित और लैबों में पर्याप्त रूप से संरेखित हैं कि शासन प्रश्न अब यह है कि ढांचे पर्याप्त हैं या नहीं, न कि वे मौजूद हैं।
अवधारणा
मानव जिम्मेदार स्केलिंग नीति v3.0 (फरवरी 2026)
एएसएल संरचनाः
- एएसएल-1: सीमा मॉडल नहीं (सीमा से कम कमजोर आधार रेखा द्वारा संकलित) ।
- एएसएल-2: वर्तमान सीमा आधार रेखा; सामान्य सुरक्षा उपायों के साथ तैनात।
- एएसएल-3: विनाशकारी दुरुपयोग का काफी अधिक जोखिम; सीबीआरएन से संबंधित क्षमताएं। मई 2025 में सक्रिय।
- एएसएल-4: एआई आर एंड डी-2 पार करने की सीमा; मॉडल जो एंट्री लेवल एआई अनुसंधान को स्वचालित कर सकते हैं।
- एएसएल-5+: उन्नत एआई आर एंड डी; मॉडल जो प्रभावी पैमाने पर नाटकीय रूप से गति प्रदान करते हैं।
3.0 में नयाः
- सीमा सुरक्षा रोडमैप (संपादित रूप में सार्वजनिक)
- जोखिम रिपोर्ट (त्रहमासिक, कुछ बाहरी रूप से समीक्षा की जाती है)
- एआई आर एंड डी को एआई आर एंड डी-2 और एआई आर एंड डी-4 में विभाजित किया गया है।
- एक बार एआई आर एंड डी-4 को पार कर जाने के बाद, एक सकारात्मक सुरक्षा मामले की आवश्यकता होती है, जो गलत लक्ष्य का पीछा करने वाले मॉडल से गलत संरेखण जोखिमों की पहचान करता है।
ओपनएआई तैयारी ढांचा v2 (15 अप्रैल 2025)
ट्रैक किए जाने वाले क्षमताओं के लिए पांच मानदंडः
- Plausible.एक उचित खतरा मॉडल मौजूद है।
- Measurable.अनुभवजन्य मूल्यांकन संभव।
- Severe.नुकसान बड़ा है।
- Net-new.पहले से मौजूद जोखिम नहीं बढ़ाया गया।
- Instantaneous-or-irremediable.नुकसान जल्दी होता है या इसे ठीक नहीं किया जा सकता है।
उन क्षमताओं को जो सभी पांचों को पूरा करती हैं, ट्रैक किया जाता है.
अन्य PF v2 संरचनाः
- सुरक्षा रिपोर्ट (कौन से नियंत्रण मौजूद हैं) से अलग क्षमता रिपोर्ट (मॉडल क्या कर सकता है) ।
- सुरक्षा सलाहकार समूह की समीक्षाएं।
- नेतृत्व अनुमोदन करता है; बोर्ड की सुरक्षा और सुरक्षा समिति पर्यवेक्षण करती है।
- "समायोजन खंड": OpenAI आवश्यकताओं को कम कर सकता है यदि अन्य प्रयोगशाला जहाजों के पास समान सुरक्षा नहीं है।
डीपमाइंड फ्रंटियर सेफ्टी फ्रेमवर्क v3.0 (सितंबर 2025)
डोमेन द्वारा महत्वपूर्ण क्षमता स्तर (CCL)
- जैव हथियारों का वृद्धि
- साइबर अपलिफ्ट
- ML आर एंड डी त्वरण
- हानिकारक हेरफेर (v3.0 में नया): मॉडल जो उच्च-सट्टेबाजी के संदर्भों में विश्वासों / व्यवहार को काफी बदल सकते हैं।
v2.0 (फरवरी 2025) ने ML R&D CCL के लिए एक धोखाधड़ी संरेखण अनुभाग और उच्च सुरक्षा स्तर जोड़े।
प्रयोगशाला पार संरेखण
- मानवजाति "सक्षमता की सीमाएं।
- गहरी मन "महत्वपूर्ण क्षमता स्तर।
- OpenAI "उच्च क्षमता के सीमांत"
कोई उद्योग मानक शब्दावली नहीं। संरचनात्मक रूप से संरेखितः तीन स्तरों की सीमा क्षमता प्रकाशित मूल्यांकन मानदंडों के साथ। सभी तीनों में प्रतियोगी-समायोजन खंड (2025 से आगे) शामिल हैं।
सुरक्षा मामले
सुरक्षा मामला एक लिखित तर्क है कि सबसे खराब स्थिति में एक तैनाती स्वीकार्य रूप से सुरक्षित है। मानक संरचना तीन स्तंभों को लक्षित करती हैः
- Monitoring.क्या हम बुरा व्यवहार का पता लगा सकते हैं यदि यह होता है?
- Illegibility.क्या मॉडल को नुकसान पहुंचाने के लिए एक सुसंगत योजना को निष्पादित करने की क्षमता नहीं है?
- Incapability.क्या मॉडल में इस नुकसान का कारण बनने की क्षमता नहीं है?
विभिन्न सुरक्षा मामलों में अलग-अलग स्तंभों को लक्षित किया जाता है। एएसएल-3 सीबीआरएन मामले के लिए, अक्षमता (अनलर्निंग के माध्यम से) प्राथमिक लक्ष्य है। धोखाधड़ी संरेखण, निगरानी और अनपठनीयता के लिए लक्ष्य हैं। साइबर उत्थान के लिए, तीनों प्रासंगिक हैं।
दौड़-गतिशीलता समस्या
प्रतियोगी-समायोजन खंड विवादास्पद हैं। आलोचकों का तर्क है कि वे नीचे की दौड़ बनाते हैंः यदि तीनों प्रयोगशालाएं प्रतियोगी दोषों के कारण आवश्यकताओं को कम करती हैं, तो संतुलन भटकने की ओर स्थानांतरित हो जाता है। बचावकर्ताओं का तर्क है कि वैकल्पिक (एकतरफा सुरक्षा उपाय) खराब परिणाम देता है यदि भटकने वाली प्रयोगशाला सुरक्षा के प्रति कम जागरूक है।
यूके एआईएसआई, यूएस कैसीआई और यूरोपीय संघ के एआई कार्यालय (पाठ 24) बाहरी शासन समकक्ष हैं। प्रयोगशाला ढांचे स्वैच्छिक हैं; नियामक ढांचे उभर रहे हैं।
जहां यह चरण 18 में फिट बैठता है
पाठ 17-18 धोखाधड़ी और रेड-टीम विश्लेषण के शीर्ष पर माप और शासन परत है। पाठ 19-24 कल्याण, पूर्वाग्रह, गोपनीयता, वॉटरमार्किंग और नियामक संरचना को कवर करते हैं। पाठ 28 अनुसंधान पारिस्थितिकी तंत्र (MATS, रेडवुड, अपोलो, METR) का नक्शा बनाता है जो मूल्यांकन को संचालित करता है।
इसका प्रयोग करें
इस पाठ के लिए कोई कोड नहीं है. तीन प्राथमिक स्रोतों को पढ़ेंः आरएसपी v3.0, पीएफ v2, एफएसएफ v3.0. प्रत्येक प्रयोगशाला की स्तरीय संरचना को अन्य के साथ नक्शा करें और एक सीमा की पहचान करें प्रत्येक प्रयोगशाला परिभाषित करती है कि अन्य नहीं करते हैं।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-framework-diff.md. सुरक्षा ढांचे या रिलीज़ नोट को देखते हुए, यह RSP v3.0, PF v2, FSF v3.0 और फ्लैग्स क्रॉस-लैब अंतराल के साथ ढांचे की सीमा परिभाषाओं, आवश्यक मूल्यांकन और सुरक्षा-केस संरचना की तुलना करता है।
व्यायाम
- आरएसपी v3.0, पीएफ v2 और एफएसएफ v3.0 पढ़ें। प्रत्येक प्रयोगशाला के सीबीआरएन सीमा, प्रत्येक के एआई आर एंड डी सीमा और प्रत्येक के आवश्यक पूर्व-निर्मिती मूल्यांकन की एक तालिका तैयार करें।
- प्रतियोगी-समायोजन खंड तीनों ढांचे (2025+) में है। इसके लिए तर्क देने वाला एक पैराग्राफ लिखें; इसके खिलाफ तर्क देने वाला एक पैराग्राफ लिखें। प्रत्येक स्थिति पर निर्भर होने वाली धारणा की पहचान करें।
- एंट्रोपिक के एआई आर एंड डी -4 सीमा पार करने वाले मॉडल के लिए एक सुरक्षा मामले का डिजाइन करें। तीन स्तंभों (निरीक्षण, अयोग्यता, अक्षमता) में से प्रत्येक के लिए आवश्यक सबूतों का नाम दें।
- डीपमांड के एफएसएफ v3.0 ने हानिकारक हेरफेर सीसीएल पेश किया है। तीन अनुभवजन्य माप प्रस्तावित करें जो संकेत देंगे कि एक मॉडल ने इस सीमा को पार कर लिया है।
- METR की "सीमागत एआई सुरक्षा नीतियों के सामान्य तत्व" (2025) पढ़ें। तीन सबसे मजबूत पार-लैब अभिसरण और दो सबसे बड़े अंतर का नाम दें।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| RSP | "Anthropic's framework" | Responsible Scaling Policy; ASL tiers; v3.0 February 2026 |
| PF | "OpenAI's framework" | Preparedness Framework; five criteria; v2 April 2025 |
| FSF | "DeepMind's framework" | Frontier Safety Framework; CCLs; v3.0 September 2025 |
| ASL-3 | "biosafety level 3-analog" | Anthropic tier for CBRN-relevant capabilities; activated May 2025 |
| CCL | "critical capability level" | DeepMind's threshold construct; per-domain |
| Safety case | "the formal argument" | Written argument that deployment is acceptably safe under worst-case U |
| Adjustment clause | "competitor defection allowance" | Framework provision for reducing requirements if competitors ship without comparable safeguards |
आगे पढ़ना
- Anthropic — Responsible Scaling Policy v3.0 (February 2026) एएसएल स्तर, रोडमैप, एआई आरएंडडी का विघटन
- OpenAI — Updating the Preparedness Framework (April 15, 2025) पांच मानदंड, समायोजन खंड
- DeepMind — Strengthening our Frontier Safety Framework (September 2025) CCL v3.0, हानिकारक हेरफेर
- METR — Common Elements of Frontier AI Safety Policies (2025) पार-लैब तुलना
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.