Phase 18: Ethics, Safety & Alignment

सीमा सुरक्षा ढांचे आरएसपी, पीएफ, एफएसएफ

तीन प्रमुख प्रयोगशाला ढांचे सीमा क्षमता के 2026 उद्योग शासन को परिभाषित करते हैं। मानव जिम्मेदार स्केलिंग नीति v3.0 (फरवरी 2026) बायोसेफ्टी स्तरों पर आधारित, स्तरित एआई सुरक्षा स्तर (एएसएल-1 से एएसएल-5+) पेश करता है, जिसमें सीबीआरएन-संबंधित मॉडल के लिए एएसएल-3 मई 2025 में सक्रिय किया गया है। ओपनएआई तैयारी ढांचे v2 (अप्रैल 2025) में ट्रैक क्षमताओं के लिए पांच मानदंडों की परिभाषा की गई है और क्षमता रिपोर्ट को सुरक्षा रिपोर्ट से अलग किया गया है। डीपमाइंड फ्रंटियर सेफ्टी फ्रेमवर्क v3.0 (सितंबर 2025) ने एक नया हानिकारक हेरफेर सीसीएल सहित महत्वपूर्ण क्षमता स्तर पेश किया है। अब इन तीनों में प्रतियोगी समायोजन खंड शामिल हैं जो समकक्ष प्रयोगशालाओं के बिना समान सुरक्षा प्रदान किए जाने पर स्थगित करने की अनुमति देते हैं। प्रयोगशालाओं के पार संरेखण संरचनात्मक है, शब्दशास्त्रीय नहींः "सक्षमता सीमाओं", "उच्च क्षमता सीमाओं", और "महत्वपूर्ण क्षमता स्तर" समान संरचनाओं को दर्शाता है।

Type: Learn

Languages: none

Prerequisites: Phase 18 · 17 (WMDP), Phase 18 · 07-09 (deception failures)

Time: ~75 minutes

सीखने के लक्ष्य

  • एंथ्रोपिक की एएसएल स्तर संरचना का वर्णन करें और एएसएल-3 को सक्रिय करने के लिए क्या किया गया है।
  • ट्रैक किए गए क्षमताओं के लिए पांच ओपनएआई तैयारी फ्रेमवर्क v2 मानदंडों का नाम दें।
  • डीपमाइंड के महत्वपूर्ण क्षमता स्तर संरचना और हानिकारक हेरफेर सीसीएल का वर्णन करें।
  • प्रतियोगी समायोजन खंडों को समझाएं और वे दौड़ की गतिशीलता के लिए महत्वपूर्ण क्यों हैं।
  • एक सुरक्षा मामले को परिभाषित करें और तीन स्तंभ संरचना (निरीक्षण, गैर-पठनीयता, अक्षमता) का वर्णन करें।

समस्या

पाठ 7-17 में यह निर्धारित किया गया है कि धोखाधड़ी संभव है, दोहरे उपयोग की क्षमता मौजूद है, और मूल्यांकन की सीमाएं हैं। सीमा-सक्षम मॉडल वाली प्रयोगशाला को आंतरिक शासन संरचना की आवश्यकता होती है जोः

  • नए सुरक्षा उपायों की आवश्यकता होने पर सीमाओं को परिभाषित करता है।
  • स्केल करने से पहले आवश्यक मूल्यांकन को परिभाषित करता है।
  • यह बताता है कि सुरक्षा मामले की तरह कैसा दिखता है।
  • दौड़-गतिशीलता की समस्या को संभालता है (यदि प्रतियोगी बिना सुरक्षा के जहाज करते हैं, तो आप क्या करते हैं?

2025-2026 के तीन ढांचे अत्याधुनिक हैं अपूर्ण, विकसित और लैबों में पर्याप्त रूप से संरेखित हैं कि शासन प्रश्न अब यह है कि ढांचे पर्याप्त हैं या नहीं, न कि वे मौजूद हैं।

अवधारणा

मानव जिम्मेदार स्केलिंग नीति v3.0 (फरवरी 2026)

एएसएल संरचनाः

  • एएसएल-1: सीमा मॉडल नहीं (सीमा से कम कमजोर आधार रेखा द्वारा संकलित) ।
  • एएसएल-2: वर्तमान सीमा आधार रेखा; सामान्य सुरक्षा उपायों के साथ तैनात।
  • एएसएल-3: विनाशकारी दुरुपयोग का काफी अधिक जोखिम; सीबीआरएन से संबंधित क्षमताएं। मई 2025 में सक्रिय।
  • एएसएल-4: एआई आर एंड डी-2 पार करने की सीमा; मॉडल जो एंट्री लेवल एआई अनुसंधान को स्वचालित कर सकते हैं।
  • एएसएल-5+: उन्नत एआई आर एंड डी; मॉडल जो प्रभावी पैमाने पर नाटकीय रूप से गति प्रदान करते हैं।

3.0 में नयाः

  • सीमा सुरक्षा रोडमैप (संपादित रूप में सार्वजनिक)
  • जोखिम रिपोर्ट (त्रहमासिक, कुछ बाहरी रूप से समीक्षा की जाती है)
  • एआई आर एंड डी को एआई आर एंड डी-2 और एआई आर एंड डी-4 में विभाजित किया गया है।
  • एक बार एआई आर एंड डी-4 को पार कर जाने के बाद, एक सकारात्मक सुरक्षा मामले की आवश्यकता होती है, जो गलत लक्ष्य का पीछा करने वाले मॉडल से गलत संरेखण जोखिमों की पहचान करता है।

ओपनएआई तैयारी ढांचा v2 (15 अप्रैल 2025)

ट्रैक किए जाने वाले क्षमताओं के लिए पांच मानदंडः

  • Plausible.एक उचित खतरा मॉडल मौजूद है।
  • Measurable.अनुभवजन्य मूल्यांकन संभव।
  • Severe.नुकसान बड़ा है।
  • Net-new.पहले से मौजूद जोखिम नहीं बढ़ाया गया।
  • Instantaneous-or-irremediable.नुकसान जल्दी होता है या इसे ठीक नहीं किया जा सकता है।

उन क्षमताओं को जो सभी पांचों को पूरा करती हैं, ट्रैक किया जाता है.

अन्य PF v2 संरचनाः

  • सुरक्षा रिपोर्ट (कौन से नियंत्रण मौजूद हैं) से अलग क्षमता रिपोर्ट (मॉडल क्या कर सकता है) ।
  • सुरक्षा सलाहकार समूह की समीक्षाएं।
  • नेतृत्व अनुमोदन करता है; बोर्ड की सुरक्षा और सुरक्षा समिति पर्यवेक्षण करती है।
  • "समायोजन खंड": OpenAI आवश्यकताओं को कम कर सकता है यदि अन्य प्रयोगशाला जहाजों के पास समान सुरक्षा नहीं है।

डीपमाइंड फ्रंटियर सेफ्टी फ्रेमवर्क v3.0 (सितंबर 2025)

डोमेन द्वारा महत्वपूर्ण क्षमता स्तर (CCL)

  • जैव हथियारों का वृद्धि
  • साइबर अपलिफ्ट
  • ML आर एंड डी त्वरण
  • हानिकारक हेरफेर (v3.0 में नया): मॉडल जो उच्च-सट्टेबाजी के संदर्भों में विश्वासों / व्यवहार को काफी बदल सकते हैं।

v2.0 (फरवरी 2025) ने ML R&D CCL के लिए एक धोखाधड़ी संरेखण अनुभाग और उच्च सुरक्षा स्तर जोड़े।

प्रयोगशाला पार संरेखण

  • मानवजाति "सक्षमता की सीमाएं।
  • गहरी मन "महत्वपूर्ण क्षमता स्तर।
  • OpenAI "उच्च क्षमता के सीमांत"

कोई उद्योग मानक शब्दावली नहीं। संरचनात्मक रूप से संरेखितः तीन स्तरों की सीमा क्षमता प्रकाशित मूल्यांकन मानदंडों के साथ। सभी तीनों में प्रतियोगी-समायोजन खंड (2025 से आगे) शामिल हैं।

सुरक्षा मामले

सुरक्षा मामला एक लिखित तर्क है कि सबसे खराब स्थिति में एक तैनाती स्वीकार्य रूप से सुरक्षित है। मानक संरचना तीन स्तंभों को लक्षित करती हैः

  • Monitoring.क्या हम बुरा व्यवहार का पता लगा सकते हैं यदि यह होता है?
  • Illegibility.क्या मॉडल को नुकसान पहुंचाने के लिए एक सुसंगत योजना को निष्पादित करने की क्षमता नहीं है?
  • Incapability.क्या मॉडल में इस नुकसान का कारण बनने की क्षमता नहीं है?

विभिन्न सुरक्षा मामलों में अलग-अलग स्तंभों को लक्षित किया जाता है। एएसएल-3 सीबीआरएन मामले के लिए, अक्षमता (अनलर्निंग के माध्यम से) प्राथमिक लक्ष्य है। धोखाधड़ी संरेखण, निगरानी और अनपठनीयता के लिए लक्ष्य हैं। साइबर उत्थान के लिए, तीनों प्रासंगिक हैं।

दौड़-गतिशीलता समस्या

प्रतियोगी-समायोजन खंड विवादास्पद हैं। आलोचकों का तर्क है कि वे नीचे की दौड़ बनाते हैंः यदि तीनों प्रयोगशालाएं प्रतियोगी दोषों के कारण आवश्यकताओं को कम करती हैं, तो संतुलन भटकने की ओर स्थानांतरित हो जाता है। बचावकर्ताओं का तर्क है कि वैकल्पिक (एकतरफा सुरक्षा उपाय) खराब परिणाम देता है यदि भटकने वाली प्रयोगशाला सुरक्षा के प्रति कम जागरूक है।

यूके एआईएसआई, यूएस कैसीआई और यूरोपीय संघ के एआई कार्यालय (पाठ 24) बाहरी शासन समकक्ष हैं। प्रयोगशाला ढांचे स्वैच्छिक हैं; नियामक ढांचे उभर रहे हैं।

जहां यह चरण 18 में फिट बैठता है

पाठ 17-18 धोखाधड़ी और रेड-टीम विश्लेषण के शीर्ष पर माप और शासन परत है। पाठ 19-24 कल्याण, पूर्वाग्रह, गोपनीयता, वॉटरमार्किंग और नियामक संरचना को कवर करते हैं। पाठ 28 अनुसंधान पारिस्थितिकी तंत्र (MATS, रेडवुड, अपोलो, METR) का नक्शा बनाता है जो मूल्यांकन को संचालित करता है।

इसका प्रयोग करें

इस पाठ के लिए कोई कोड नहीं है. तीन प्राथमिक स्रोतों को पढ़ेंः आरएसपी v3.0, पीएफ v2, एफएसएफ v3.0. प्रत्येक प्रयोगशाला की स्तरीय संरचना को अन्य के साथ नक्शा करें और एक सीमा की पहचान करें प्रत्येक प्रयोगशाला परिभाषित करती है कि अन्य नहीं करते हैं।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-framework-diff.md. सुरक्षा ढांचे या रिलीज़ नोट को देखते हुए, यह RSP v3.0, PF v2, FSF v3.0 और फ्लैग्स क्रॉस-लैब अंतराल के साथ ढांचे की सीमा परिभाषाओं, आवश्यक मूल्यांकन और सुरक्षा-केस संरचना की तुलना करता है।

व्यायाम

  1. आरएसपी v3.0, पीएफ v2 और एफएसएफ v3.0 पढ़ें। प्रत्येक प्रयोगशाला के सीबीआरएन सीमा, प्रत्येक के एआई आर एंड डी सीमा और प्रत्येक के आवश्यक पूर्व-निर्मिती मूल्यांकन की एक तालिका तैयार करें।
  1. प्रतियोगी-समायोजन खंड तीनों ढांचे (2025+) में है। इसके लिए तर्क देने वाला एक पैराग्राफ लिखें; इसके खिलाफ तर्क देने वाला एक पैराग्राफ लिखें। प्रत्येक स्थिति पर निर्भर होने वाली धारणा की पहचान करें।
  1. एंट्रोपिक के एआई आर एंड डी -4 सीमा पार करने वाले मॉडल के लिए एक सुरक्षा मामले का डिजाइन करें। तीन स्तंभों (निरीक्षण, अयोग्यता, अक्षमता) में से प्रत्येक के लिए आवश्यक सबूतों का नाम दें।
  1. डीपमांड के एफएसएफ v3.0 ने हानिकारक हेरफेर सीसीएल पेश किया है। तीन अनुभवजन्य माप प्रस्तावित करें जो संकेत देंगे कि एक मॉडल ने इस सीमा को पार कर लिया है।
  1. METR की "सीमागत एआई सुरक्षा नीतियों के सामान्य तत्व" (2025) पढ़ें। तीन सबसे मजबूत पार-लैब अभिसरण और दो सबसे बड़े अंतर का नाम दें।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
RSP"Anthropic's framework"Responsible Scaling Policy; ASL tiers; v3.0 February 2026
PF"OpenAI's framework"Preparedness Framework; five criteria; v2 April 2025
FSF"DeepMind's framework"Frontier Safety Framework; CCLs; v3.0 September 2025
ASL-3"biosafety level 3-analog"Anthropic tier for CBRN-relevant capabilities; activated May 2025
CCL"critical capability level"DeepMind's threshold construct; per-domain
Safety case"the formal argument"Written argument that deployment is acceptably safe under worst-case U
Adjustment clause"competitor defection allowance"Framework provision for reducing requirements if competitors ship without comparable safeguards

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.