Phase 15: Autonomous Systems

ओपनएआई तैयारी ढांचा और डीपमाइंड फ्रंटियर सेफ्टी ढांचा

ओपनएआई तैयारी फ्रेमवर्क v2 (अप्रैल 2025) अनुसंधान श्रेणियों को पेश करता है लंबी दूरी की स्वायत्तता, सैंडबैगिंग, स्वायत्त प्रतिकृति और अनुकूलन, सुरक्षा उपायों को कमजोर करना ट्रैक किए गए श्रेणियों से अलग। ट्रैक किए गए श्रेणियों से क्षमता रिपोर्ट और सुरक्षा सलाहकार समूह द्वारा समीक्षा की गई सुरक्षा रिपोर्ट शुरू होती हैं। डीपमांड के एफएसएफ v3 (सितंबर 2025, ट्रैक किए गए क्षमता स्तरों के साथ जोड़ा गया 17 अप्रैल 2026) एमएल आर एंड डी और साइबर डोमेन में स्वायत्तता को मोड़ता है (एमएल आर एंड डी स्वायत्तता स्तर 1 = प्रतिस्पर्धी लागत बनाम मानव + एआई उपकरण पर एआई आर एंड डी पाइपलाइन को पूरी तरह से स्वचालित करें) । FSF v3 स्पष्ट रूप से उपकरण तर्क के दुरुपयोग के लिए स्वचालित निगरानी के माध्यम से भ्रामक संरेखण को संबोधित करता है। ईमानदार नोटः पीएफ v2 में अनुसंधान श्रेणियां (लंबे दूरी की स्वायत्तता सहित) स्वचालित रूप से कम करने को ट्रिगर नहीं करती हैं; नीति भाषा "संभावित" है। डीपमाइंड स्वयं का कहना है कि स्वचालित निगरानी "लंबे समय तक पर्याप्त नहीं रहेगी" यदि साधन तर्क मजबूत हो जाता है।

Type: Learn

Languages: Python (stdlib, three-framework decision-table diff tool)

Prerequisites: Phase 15 · 19 (Anthropic RSP)

Time: ~45 minutes

समस्या

पाठ 19 में मानव विज्ञान की स्केलिंग नीति को ध्यान से पढ़ा गया है। यह पाठ ओपनएआई और डीपमाइंड की पढ़कर चित्र को पूरा करता है। तीन दस्तावेज एक ही प्रश्न को संबोधित करने वाले चचेरे भाई के कलाकृतियां हैं एक सीमा प्रयोगशाला को मॉडल को कब रोकना या गेट करना चाहिए और वे श्रेणियों के एक छोटे सेट पर एक साथ आते हैं और विशिष्ट स्थानों पर भिन्न होते हैं जो मायने रखते हैं।

अभिसरणः तीनों को लंबी दूरी की स्वायत्तता को ट्रैक करने योग्य क्षमता वर्ग के रूप में लेबल किया गया है। तीनों ही धोखाधड़ी व्यवहार (अनुरूपता का फर्जीकरण, रेतबैक करना) को जोखिम के एक विशिष्ट वर्ग के रूप में स्वीकार करते हैं। तीनों में एक आंतरिक समीक्षा निकाय है। अंतरः ओपनएआई "ट्रेस" (निष्पादित कम करने) और "अनुसंधान" (कोई स्वचालित ट्रिगर नहीं) में श्रेणियों को विभाजित करता है। डीपमाइंड इसे अलग से नाम देने के बजाय दो डोमेन में स्वायत्तता को मोड़ता है। प्रयोगशालाओं का नाम Tracked vs Research, या Critical vs Moderate, या Tier-1 vs Tier-2 है; परिचालन परिणाम जो बैकेट में एक क्षमता रहता है अलग अलग प्रयोगशालाओं के बीच है।

इनका एक साथ पढ़ना उपयोगी अभ्यास है। एक ही क्षमता मानव विज्ञान में "निवारक कम करने" हो सकती है, "निरीक्षण किया जाता है लेकिन ट्रिगर नहीं होता" ओपनएआई में, और "एक विशिष्ट डोमेन में ट्रैक किया जाता है" डीपमाइंड में। नीति की स्थिति मायने रखती है।

अवधारणा

ओपनएआई तैयारी ढांचा v2 (अप्रैल 2025)

संरचनाः

  • Tracked Categories: ट्रिगर क्षमता रिपोर्ट (मॉडल क्या कर सकता है) और सुरक्षा रिपोर्ट (क्या मिटाने हैं) तैनाती से पहले सुरक्षा सलाहकार समूह द्वारा समीक्षा की।
  • Research Categories: मॉडल क्षमताओं प्रयोगशाला ट्रैक कर रही है लेकिन अभी तक विशिष्ट कम करने के लिए प्रतिबद्ध नहीं है। इसमें लंबी दूरी की स्वायत्तता, रेतबागिंग, स्वायत्त प्रतिकृति और अनुकूलन, सुरक्षा उपायों को कम करना शामिल है।

v2 में कुंजी फ्रेमिंगः अनुसंधान श्रेणियां स्वचालित रूप से कम करने को ट्रिगर नहीं करती हैं। नीति भाषा "संभावित" कम करने वाली है। यह देखने के लिए विशिष्ट डेल्टा हैः ट्रैक बनाम अनुसंधान में एक श्रेणी का स्थान "गेटेड" और "निरीक्षित" के बीच की शिंज है।

डीपमाइंड फ्रंटियर सेफ्टी फ्रेमवर्क v3 (सितंबर 2025; ट्रैक किए गए क्षमता स्तर 17 अप्रैल, 2026)

संरचनाः

  • Critical Capability Levels (CCLs): पांच क्षेत्रों में क्षमता की सीमाएंः साइबर, बायो, एमएल आरएंडडी, सीबीआरएन, स्वायत्तता (एमएल आरएंडडी और साइबर में फंटा हुआ) ।
  • Tracked Capability Levels: अप्रैल 2026 में अतिरिक्त क्षुद्रता जोड़ी गई। ठोस उदाहरणः एमएल आर एंड डी स्वायत्तता स्तर 1 = प्रतिस्पर्धी लागत बनाम मानव + एआई उपकरणों के साथ एआई आर एंड डी पाइपलाइन को पूरी तरह से स्वचालित करें।
  • Deceptive alignment monitoring: साधन-कारण के दुरुपयोग के लिए स्वचालित निगरानी के लिए स्पष्ट प्रतिबद्धता।

स्वायत्तता फ्रेमिंग ओपनएआई से अलग है। डीपमाइंड "स्वयत्तता" को शीर्ष-स्तरीय डोमेन के रूप में नहीं रखता है; यह उन डोमेन में ढँकाया जाता है जहां स्वायत्तता नुकसान पहुंचाएगी (एमएल आर एंड डी और साइबर) । तर्क यह है कि एक डोमेन के बिना स्वायत्तता जोखिम के बिना क्षमता है; काउंटर-आर्कमेंट यह है कि डोमेन के बीच स्वायत्तता एक मेटा-जोखिम है जिसे ढांचे को नाम देना चाहिए।

जो तीनों एक साथ आते हैं

  • आंतरिक सुरक्षा सलाहकार समूह (अंत्रोपिक एसएजी, ओपनएआई एसएजी, डीपमाइंड आंतरिक समिति) उच्च क्षमता वाले मॉडल के लिए तैनाती से पहले समीक्षा।
  • जोखिम वर्ग के रूप में धोखाधड़ी/असंतुलन का स्पष्ट उल्लेख।
  • घोषित क्रम पर स्थायी कलाकृतियां (एंट्रोपिकः फ्रंटियर सेफ्टी रोडमैप, जोखिम रिपोर्ट; ओपनएआईः क्षमताओं और सुरक्षा उपायों की रिपोर्ट; डीपमाइंडः एफएसएफ अपडेट चक्र) ।
  • यह स्वीकार करना कि केवल निगरानी रक्षा की सीमा है। डीपमाइंड स्पष्ट हैः "स्वचालित निगरानी लंबे समय तक पर्याप्त नहीं रहेगी।"

जहाँ वे भिन्न होते हैं

  • Anthropic: विराम प्रतिबद्धता v3.0 में हटा दिया गया; एआई आर एंड डी-4 सीमा अगले गेट नामित है।
  • OpenAI: ट्रैक बनाम रिसर्च विभाजन; रिसर्च श्रेणियां (लंबे दूरी की स्वायत्तता सहित) स्वचालित रूप से गेट नहीं करते हैं।
  • DeepMind: स्वायत्तता अन्य क्षेत्रों में फॉल्ट; ट्रैक किए गए क्षमता स्तर अप्रैल 2026 में granularity जोड़ते हैं।

रेतबैगिंगः एक विशिष्ट क्षमता जो तीनों को जटिल बनाती है

Sandbagging (मूल्यांकन पर रणनीतिक रूप से कम प्रदर्शन वाला मॉडल) OpenAI की अनुसंधान श्रेणियों में है। मानव विज्ञान के RSP v3.0 ने मूल्यांकन-सापेक्ष अंतर (पाठ 1) के माध्यम से इसका समाधान किया। डीपमाइंड FSF v3 में भ्रामक संरेखण निगरानी के माध्यम से इसका समाधान करता है।

यदि एक मॉडल मूल्यांकन पर सैंडबैग करता है, तो प्रत्येक ढांचे के क्षमता सीमाओं का मूल्यांकन किया जाता है। ढांचा केवल तभी काम करता है जब माप काम करता है। यही कारण है कि प्रयोगशाला स्व-मूल्यांकन के अलावा बाहरी माप (पाठ 21, METR) और प्रतिकूल मूल्यांकन आवश्यक हैं।

नीति-पठना कौशल

  • पता लगाएंः आपकी रुचि रखने वाली प्रत्येक क्षमता पॉलिसी में खोजे जाने योग्य होनी चाहिए। यदि खोजे जाने योग्य नहीं है, तो पॉलिसी इसे कवर नहीं करती है।
  • वर्गीकृत करेंः क्या यह ट्रैक किया गया है (ट्रिगर मिटायगेशन) या अनुसंधान (ट्रैक किया गया है लेकिन ट्रिगर नहीं किया गया है)? ओपनएआई इसे नाम देता है; मानव विज्ञान और डीपमाइंड के अपने समकक्ष हैं।
  • कैडेन्सः क्या पॉलिसी को घोषित समय सीमा पर अपडेट किया जाता है या केवल विशिष्ट घटनाओं के बाद?
  • स्वतंत्रताः क्या बाहरी समीक्षा अनिवार्य है या वैकल्पिक है? अपोलो और यूएस एआई सुरक्षा संस्थान के साथ मानव साझेदार; एमईटीआर के साथ ओपनएआई; आंतरिक एसएजी के साथ डीपमाइंड मुख्य रूप से।

इसका प्रयोग करें

code/main.pyएक छोटे से निर्णय तालिका अंतर उपकरण लागू करता है। एक क्षमता (स्वतंत्रता, धोखाधड़ी संरेखण, आर एंड डी स्वचालन, साइबर अपलिफ्ट, आदि) को देखते हुए, यह आउटपुट करता है कि तीनों नीतियों में से प्रत्येक क्षमता को कैसे वर्गीकृत करता है, और क्या mitigations ट्रिगर करता है। यह एक पढ़ने की मदद है, एक नीति उपकरण नहीं।

इसे भेजें

outputs/skill-cross-policy-diff.mdएक विशिष्ट क्षमता के लिए एक क्रॉस-पॉलिसी तुलना तैयार करता है, जिसमें संदर्भ के रूप में तीन ढांचे का उपयोग किया जाता है।

व्यायाम

  1. दौड़ेंcode/main.py. पुष्टि करें कि अंतर उपकरण का आउटपुट मूल दस्तावेजों के साथ कम से कम दो क्षमताओं के लिए नीति से मेल खाता है।
  1. OpenAI Preparedness Framework v2 को पूरी तरह से पढ़ें। प्रत्येक अनुसंधान श्रेणी की पहचान करें। प्रत्येक के लिए, एक वाक्य लिखें कि यह ट्रैक किए जाने के बजाय अनुसंधान में क्यों है।
  1. डीपमाइंड एफएसएफ v3 को पूरा पढ़ें, साथ ही अप्रैल 2026 ट्रैक किए गए क्षमता स्तर अपडेट। एमएल आर एंड डी स्वायत्तता स्तर 1 के विशिष्ट मूल्यांकन मानदंडों की पहचान करें। आप इसे बाहरी रूप से कैसे मापेंगे?
  1. Sandbagging OpenAI के अनुसंधान श्रेणियों में है। एक मूल्यांकन डिजाइन करें जो एक sandbagging मॉडल को इसकी वास्तविक क्षमता का खुलासा करने के लिए मजबूर करेगा। पाठ 1 मूल्यांकन-संदर्भ-गेमिंग चर्चा का संदर्भ दें।
  1. एक विशिष्ट क्षमता पर तीन नीतियों की तुलना करें (आपकी पसंद) । किस नीति की वर्गीकरण को आप सबसे कठोर और कौन सा कम समझते हैं, नाम दें। स्रोत पाठ के साथ औचित्य दें।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
Preparedness Framework"OpenAI's scaling policy"PF v2 (April 2025); Tracked vs Research categories
Tracked Category"Mandatory mitigation"Triggers Capabilities + Safeguards Reports; SAG review
Research Category"Monitored only"Tracked but no automatic mitigation; includes Long-range Autonomy
Frontier Safety Framework"DeepMind's scaling policy"FSF v3 (Sept 2025) + Tracked Capability Levels (Apr 2026)
CCL"Critical Capability Level"DeepMind threshold per domain (Cyber, Bio, ML R&D, CBRN)
ML R&D autonomy level 1"R&D automation"Fully automate AI R&D pipeline at competitive cost
Sandbagging"Strategic underperformance"Model underperforms on evals; in OpenAI Research Categories
Instrumental reasoning"Means-ends reasoning"Reasoning about how to achieve goals; target of DeepMind monitoring

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.