ओपनएआई तैयारी ढांचा और डीपमाइंड फ्रंटियर सेफ्टी ढांचा
Type: Learn
Languages: Python (stdlib, three-framework decision-table diff tool)
Prerequisites: Phase 15 · 19 (Anthropic RSP)
Time: ~45 minutes
समस्या
पाठ 19 में मानव विज्ञान की स्केलिंग नीति को ध्यान से पढ़ा गया है। यह पाठ ओपनएआई और डीपमाइंड की पढ़कर चित्र को पूरा करता है। तीन दस्तावेज एक ही प्रश्न को संबोधित करने वाले चचेरे भाई के कलाकृतियां हैं एक सीमा प्रयोगशाला को मॉडल को कब रोकना या गेट करना चाहिए और वे श्रेणियों के एक छोटे सेट पर एक साथ आते हैं और विशिष्ट स्थानों पर भिन्न होते हैं जो मायने रखते हैं।
अभिसरणः तीनों को लंबी दूरी की स्वायत्तता को ट्रैक करने योग्य क्षमता वर्ग के रूप में लेबल किया गया है। तीनों ही धोखाधड़ी व्यवहार (अनुरूपता का फर्जीकरण, रेतबैक करना) को जोखिम के एक विशिष्ट वर्ग के रूप में स्वीकार करते हैं। तीनों में एक आंतरिक समीक्षा निकाय है। अंतरः ओपनएआई "ट्रेस" (निष्पादित कम करने) और "अनुसंधान" (कोई स्वचालित ट्रिगर नहीं) में श्रेणियों को विभाजित करता है। डीपमाइंड इसे अलग से नाम देने के बजाय दो डोमेन में स्वायत्तता को मोड़ता है। प्रयोगशालाओं का नाम Tracked vs Research, या Critical vs Moderate, या Tier-1 vs Tier-2 है; परिचालन परिणाम जो बैकेट में एक क्षमता रहता है अलग अलग प्रयोगशालाओं के बीच है।
इनका एक साथ पढ़ना उपयोगी अभ्यास है। एक ही क्षमता मानव विज्ञान में "निवारक कम करने" हो सकती है, "निरीक्षण किया जाता है लेकिन ट्रिगर नहीं होता" ओपनएआई में, और "एक विशिष्ट डोमेन में ट्रैक किया जाता है" डीपमाइंड में। नीति की स्थिति मायने रखती है।
अवधारणा
ओपनएआई तैयारी ढांचा v2 (अप्रैल 2025)
संरचनाः
- Tracked Categories: ट्रिगर क्षमता रिपोर्ट (मॉडल क्या कर सकता है) और सुरक्षा रिपोर्ट (क्या मिटाने हैं) तैनाती से पहले सुरक्षा सलाहकार समूह द्वारा समीक्षा की।
- Research Categories: मॉडल क्षमताओं प्रयोगशाला ट्रैक कर रही है लेकिन अभी तक विशिष्ट कम करने के लिए प्रतिबद्ध नहीं है। इसमें लंबी दूरी की स्वायत्तता, रेतबागिंग, स्वायत्त प्रतिकृति और अनुकूलन, सुरक्षा उपायों को कम करना शामिल है।
v2 में कुंजी फ्रेमिंगः अनुसंधान श्रेणियां स्वचालित रूप से कम करने को ट्रिगर नहीं करती हैं। नीति भाषा "संभावित" कम करने वाली है। यह देखने के लिए विशिष्ट डेल्टा हैः ट्रैक बनाम अनुसंधान में एक श्रेणी का स्थान "गेटेड" और "निरीक्षित" के बीच की शिंज है।
डीपमाइंड फ्रंटियर सेफ्टी फ्रेमवर्क v3 (सितंबर 2025; ट्रैक किए गए क्षमता स्तर 17 अप्रैल, 2026)
संरचनाः
- Critical Capability Levels (CCLs): पांच क्षेत्रों में क्षमता की सीमाएंः साइबर, बायो, एमएल आरएंडडी, सीबीआरएन, स्वायत्तता (एमएल आरएंडडी और साइबर में फंटा हुआ) ।
- Tracked Capability Levels: अप्रैल 2026 में अतिरिक्त क्षुद्रता जोड़ी गई। ठोस उदाहरणः एमएल आर एंड डी स्वायत्तता स्तर 1 = प्रतिस्पर्धी लागत बनाम मानव + एआई उपकरणों के साथ एआई आर एंड डी पाइपलाइन को पूरी तरह से स्वचालित करें।
- Deceptive alignment monitoring: साधन-कारण के दुरुपयोग के लिए स्वचालित निगरानी के लिए स्पष्ट प्रतिबद्धता।
स्वायत्तता फ्रेमिंग ओपनएआई से अलग है। डीपमाइंड "स्वयत्तता" को शीर्ष-स्तरीय डोमेन के रूप में नहीं रखता है; यह उन डोमेन में ढँकाया जाता है जहां स्वायत्तता नुकसान पहुंचाएगी (एमएल आर एंड डी और साइबर) । तर्क यह है कि एक डोमेन के बिना स्वायत्तता जोखिम के बिना क्षमता है; काउंटर-आर्कमेंट यह है कि डोमेन के बीच स्वायत्तता एक मेटा-जोखिम है जिसे ढांचे को नाम देना चाहिए।
जो तीनों एक साथ आते हैं
- आंतरिक सुरक्षा सलाहकार समूह (अंत्रोपिक एसएजी, ओपनएआई एसएजी, डीपमाइंड आंतरिक समिति) उच्च क्षमता वाले मॉडल के लिए तैनाती से पहले समीक्षा।
- जोखिम वर्ग के रूप में धोखाधड़ी/असंतुलन का स्पष्ट उल्लेख।
- घोषित क्रम पर स्थायी कलाकृतियां (एंट्रोपिकः फ्रंटियर सेफ्टी रोडमैप, जोखिम रिपोर्ट; ओपनएआईः क्षमताओं और सुरक्षा उपायों की रिपोर्ट; डीपमाइंडः एफएसएफ अपडेट चक्र) ।
- यह स्वीकार करना कि केवल निगरानी रक्षा की सीमा है। डीपमाइंड स्पष्ट हैः "स्वचालित निगरानी लंबे समय तक पर्याप्त नहीं रहेगी।"
जहाँ वे भिन्न होते हैं
- Anthropic: विराम प्रतिबद्धता v3.0 में हटा दिया गया; एआई आर एंड डी-4 सीमा अगले गेट नामित है।
- OpenAI: ट्रैक बनाम रिसर्च विभाजन; रिसर्च श्रेणियां (लंबे दूरी की स्वायत्तता सहित) स्वचालित रूप से गेट नहीं करते हैं।
- DeepMind: स्वायत्तता अन्य क्षेत्रों में फॉल्ट; ट्रैक किए गए क्षमता स्तर अप्रैल 2026 में granularity जोड़ते हैं।
रेतबैगिंगः एक विशिष्ट क्षमता जो तीनों को जटिल बनाती है
Sandbagging (मूल्यांकन पर रणनीतिक रूप से कम प्रदर्शन वाला मॉडल) OpenAI की अनुसंधान श्रेणियों में है। मानव विज्ञान के RSP v3.0 ने मूल्यांकन-सापेक्ष अंतर (पाठ 1) के माध्यम से इसका समाधान किया। डीपमाइंड FSF v3 में भ्रामक संरेखण निगरानी के माध्यम से इसका समाधान करता है।
यदि एक मॉडल मूल्यांकन पर सैंडबैग करता है, तो प्रत्येक ढांचे के क्षमता सीमाओं का मूल्यांकन किया जाता है। ढांचा केवल तभी काम करता है जब माप काम करता है। यही कारण है कि प्रयोगशाला स्व-मूल्यांकन के अलावा बाहरी माप (पाठ 21, METR) और प्रतिकूल मूल्यांकन आवश्यक हैं।
नीति-पठना कौशल
- पता लगाएंः आपकी रुचि रखने वाली प्रत्येक क्षमता पॉलिसी में खोजे जाने योग्य होनी चाहिए। यदि खोजे जाने योग्य नहीं है, तो पॉलिसी इसे कवर नहीं करती है।
- वर्गीकृत करेंः क्या यह ट्रैक किया गया है (ट्रिगर मिटायगेशन) या अनुसंधान (ट्रैक किया गया है लेकिन ट्रिगर नहीं किया गया है)? ओपनएआई इसे नाम देता है; मानव विज्ञान और डीपमाइंड के अपने समकक्ष हैं।
- कैडेन्सः क्या पॉलिसी को घोषित समय सीमा पर अपडेट किया जाता है या केवल विशिष्ट घटनाओं के बाद?
- स्वतंत्रताः क्या बाहरी समीक्षा अनिवार्य है या वैकल्पिक है? अपोलो और यूएस एआई सुरक्षा संस्थान के साथ मानव साझेदार; एमईटीआर के साथ ओपनएआई; आंतरिक एसएजी के साथ डीपमाइंड मुख्य रूप से।
इसका प्रयोग करें
code/main.pyएक छोटे से निर्णय तालिका अंतर उपकरण लागू करता है। एक क्षमता (स्वतंत्रता, धोखाधड़ी संरेखण, आर एंड डी स्वचालन, साइबर अपलिफ्ट, आदि) को देखते हुए, यह आउटपुट करता है कि तीनों नीतियों में से प्रत्येक क्षमता को कैसे वर्गीकृत करता है, और क्या mitigations ट्रिगर करता है। यह एक पढ़ने की मदद है, एक नीति उपकरण नहीं।
इसे भेजें
outputs/skill-cross-policy-diff.mdएक विशिष्ट क्षमता के लिए एक क्रॉस-पॉलिसी तुलना तैयार करता है, जिसमें संदर्भ के रूप में तीन ढांचे का उपयोग किया जाता है।
व्यायाम
- दौड़ें
code/main.py. पुष्टि करें कि अंतर उपकरण का आउटपुट मूल दस्तावेजों के साथ कम से कम दो क्षमताओं के लिए नीति से मेल खाता है।
- OpenAI Preparedness Framework v2 को पूरी तरह से पढ़ें। प्रत्येक अनुसंधान श्रेणी की पहचान करें। प्रत्येक के लिए, एक वाक्य लिखें कि यह ट्रैक किए जाने के बजाय अनुसंधान में क्यों है।
- डीपमाइंड एफएसएफ v3 को पूरा पढ़ें, साथ ही अप्रैल 2026 ट्रैक किए गए क्षमता स्तर अपडेट। एमएल आर एंड डी स्वायत्तता स्तर 1 के विशिष्ट मूल्यांकन मानदंडों की पहचान करें। आप इसे बाहरी रूप से कैसे मापेंगे?
- Sandbagging OpenAI के अनुसंधान श्रेणियों में है। एक मूल्यांकन डिजाइन करें जो एक sandbagging मॉडल को इसकी वास्तविक क्षमता का खुलासा करने के लिए मजबूर करेगा। पाठ 1 मूल्यांकन-संदर्भ-गेमिंग चर्चा का संदर्भ दें।
- एक विशिष्ट क्षमता पर तीन नीतियों की तुलना करें (आपकी पसंद) । किस नीति की वर्गीकरण को आप सबसे कठोर और कौन सा कम समझते हैं, नाम दें। स्रोत पाठ के साथ औचित्य दें।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| Preparedness Framework | "OpenAI's scaling policy" | PF v2 (April 2025); Tracked vs Research categories |
| Tracked Category | "Mandatory mitigation" | Triggers Capabilities + Safeguards Reports; SAG review |
| Research Category | "Monitored only" | Tracked but no automatic mitigation; includes Long-range Autonomy |
| Frontier Safety Framework | "DeepMind's scaling policy" | FSF v3 (Sept 2025) + Tracked Capability Levels (Apr 2026) |
| CCL | "Critical Capability Level" | DeepMind threshold per domain (Cyber, Bio, ML R&D, CBRN) |
| ML R&D autonomy level 1 | "R&D automation" | Fully automate AI R&D pipeline at competitive cost |
| Sandbagging | "Strategic underperformance" | Model underperforms on evals; in OpenAI Research Categories |
| Instrumental reasoning | "Means-ends reasoning" | Reasoning about how to achieve goals; target of DeepMind monitoring |
आगे पढ़ना
- OpenAI — Updating our Preparedness Framework v2 घोषणा.
- OpenAI — Preparedness Framework v2 PDF पूर्ण दस्तावेज।
- DeepMind — Strengthening our Frontier Safety Framework FSF v3 घोषणा।
- DeepMind — Updating the Frontier Safety Framework (April 2026) अनुवर्ती क्षमता स्तरों का जोड़ना।
- Gemini 3 Pro FSF Report एफएसएफ प्रारूप में जोखिम रिपोर्ट का उदाहरण।
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.