Phase 15: Autonomous Systems

आत्म-सुधार के सीमित डिजाइन

आत्म-सुधार लूप को सीमांकित करने के लिए अनुसंधान चार आदिमों पर अभिसरण हुआ है। औपचारिक अपरिवर्तित जो हर संपादन पर पकड़ना चाहिए। संरेखण एंकर जो संशोधित नहीं किए जा सकते हैं। बहु-उद्देश्यीय प्रतिबंध जहां प्रत्येक आयाम (सुरक्षा, निष्पक्षता, मजबूती) को बनाए रखना चाहिए, न कि केवल प्रदर्शन। पुनरावृत्ति का पता लगाना जो लूप को रोकता है जब ऐतिहासिक माप क्षमता हानि का सुझाव देते हैं। इनमें से कोई भी सुरक्षा का प्रमाण नहीं है सूचना-सैद्धांतिक परिणाम (कोलमोगोरोव जटिलता, लोब का प्रमेय) किसी भी प्रणाली के अपने उत्तराधिकारियों के बारे में क्या साबित कर सकता है। ये ऐसे उपाय हैं जो चुपचाप विफलता की लागत को बढ़ाते हैं।

Type: Learn

Languages: Python (stdlib, bounded-loop with invariant check)

Prerequisites: Phase 15 · 07 (RSI), Phase 15 · 04 (DGM)

Time: ~60 minutes

समस्या

पाठ 7 के दौड़ सिम्युलेटर ने दिखाया कि छोटी दरों में अंतर बड़े अंतराल में मिश्रित होता है। पाठ 4 के डीजीएम केस स्टडी ने दिखाया कि लूप अपने स्वयं के मूल्यांकनकर्ताओं को सक्रिय रूप से खेल सकते हैं। दोनों परिणाम एक ही इंजीनियरिंग प्रश्न की ओर इशारा करते हैंः आप स्वयं सुधार लूप पर क्या प्रतिबंध लगा सकते हैं ताकि लूप स्वयं द्वारा प्रतिबंधों को चुपचाप कमजोर नहीं किया जा सकता है?

ICLR 2026 RSI कार्यशाला सारांश (openreview.net/pdf?id=OsPQ6zTQXV) चार ऐसी आदिम की पहचान करता है। मानव विज्ञान के RSP v3.0 (पाठ 19) और डीपमाइंड के FSF v3 (पाठ 20) दोनों उन्हें क्षमता सीमाओं में संदर्भित करते हैं। मेटा हाइपरएजेंट्स काम और समुदाय फ्रेमवर्क जैसे SAHOO (मार्च 2026) उत्पादन में उपसेट लागू करते हैं।

ईमानदार ढांचाः ये मिट्याग हैं। सूचना-सैद्धांतिक परिणाम अपने उत्तराधिकारी के बारे में किसी भी प्रणाली को क्या साबित कर सकते हैं, और कोई वर्तमान डिजाइन समस्या को औपचारिक रूप से बंद नहीं करता है। एक अच्छी तरह से सीमित लूप एक असीमित से अधिक सुरक्षित है, पूर्ण रूप से सुरक्षित नहीं है।

अवधारणा

प्राथमिक 1: औपचारिक अपरिवर्तित

एक अपरिवर्तनीय एक गुण है जो प्रत्येक स्व-परिवर्तन से पहले और बाद में धारण करना चाहिए। उदाहरणः

  • आउटपुट वितरण एक निश्चित संविधान हेडर (पाठ 17) पर स्थित है।
  • कोई उपकरण कॉल अनधिकृत एंडपॉइंट पर नहीं जाता है।
  • स्मृति लिखता है एक लॉग, हस्ताक्षरित पथ से गुजरता है।
  • मूल्यांकनकर्ता का मॉड्यूल हैश अनुमोदित संस्करण से मेल खाता है।

इनवैरिएंट बाहरी कोड द्वारा जाँच किए जाते हैं जो लूप संपादित नहीं कर सकता है। यदि प्रस्तावित संशोधन एक इनवैरिएंट का उल्लंघन करता है, तो इसे खारिज कर दिया जाता है। यह डीजीएम-शैली के मूल्यांकनकर्ता-मशीन मोड (पाठ 4) को पकड़ता है।

कठिन भाग सुरक्षा के लिए आवश्यक और उचित समय में गणना योग्य अपरिवर्तनीय विकल्पों का चयन करना है। अति विशिष्टता स्टॉल प्रगति; कम विशिष्टता लूप महत्वपूर्ण गुणों से गुजरने की अनुमति देती है।

प्राथमिक 2: संरेखण एंकर

एक संरेखण एंकर लूप के मूल उद्देश्य का अपरिवर्तनीय प्रतिनिधित्व है, जो लूप की संपादन सतह के बाहर चिपका हुआ है। उदाहरणः

  • संविधान का पाठ (पाठ 17) जो प्रत्येक आह्वान पर केवल पढ़ने के लिए स्थित स्थान से लोड किया जाता है।
  • स्वतंत्र पहुंच नियंत्रण के साथ एक अलग भंडार में एक मूल्यांकनकर्ता।
  • एक मानव द्वारा हस्ताक्षरित और प्रत्येक चक्र के लिए पुनः सत्यापित उपकरण-अनुमति घोषणा पत्र।

लूप का कार्य उद्देश्य के बहाव को रोकने के लिए है। लूप उद्देश्य का पीछा करने के तरीके को बेहतर बना सकता है, लेकिन उद्देश्य क्या है, उसे संपादित नहीं कर सकता है।

सूक्ष्म विफलता मोडः एक एंकर लूप को संपादित नहीं कर सकता है फिर भी एक लूप द्वारा फिर से व्याख्या की जा सकती है जो एंकर को पढ़ने के तरीके में बहती है। संवैधानिक एआई (पाठ 17) स्पष्ट रूप से नई स्थितियों को संभालने के लिए तर्क आधारित है; यह तर्क परत वह जगह है जहां व्याख्या बहती रहती है। एंकर आवश्यक हैं, पर्याप्त नहीं।

प्राथमिक 3: बहु-उद्देश्यीय प्रतिबंध

एक लूप जो एकल स्केलर स्कोर को अनुकूलित करता है, शॉर्टकट पाएगा। एक लूप जो एक साथ कई कठिन प्रतिबंधों को पूरा करना चाहिए, उसके पास कम शॉर्टकट उपलब्ध हैं।

  • प्रदर्शन (कार्य स्तर का बेंचमार्क)
  • सुरक्षा (लाल टीम के मूल्यांकन, ज्ञात-बुरे पर अस्वीकार दर)
  • निष्पक्षता (संवेदनशील उपसमूहों पर असमान प्रभाव सीमा)
  • मजबूती (OOD परीक्षण सेट, प्रतिकूल इनपुट हैंडलिंग)

एक संशोधन केवल तभी स्वीकार किया जाता है जब प्रत्येक प्रतिबंध मान्य हो। पाठ 13 के लागत गवर्नर इसे वित्तीय प्रतिबंधों के साथ ढेर करते हैं। पाठ 18 के लामा गार्ड सुरक्षा अक्ष के रूप में प्लग इन करते हैं।

प्राथमिक 4: प्रतिगमन का पता लगाना

प्रत्येक चक्र के स्कोर की तुलना ऐतिहासिक वितरण के साथ की जाती है। कॉन्फ़िगर किए गए सहिष्णुता से परे एक गिरावट लूप को रोकती है। यह मौन क्षमता हानि को पकड़ता है जो अन्यथा चल रही औसत में अवशोषित हो जाएगा क्योंकि लूप इसे "बढ़ा" गया।

एक व्यावहारिक कार्यान्वयनः पिछले N चक्रों के प्रति-कार्य स्कोर को संग्रहीत करें। प्रत्येक नए चक्र में प्रति-कार्य डेल्टा की गणना की जाती है। यदि कोई डेल्टा एक सीमा से नीचे गिरता है, तो चक्र अस्वीकार कर दिया जाता है और मानव समीक्षा करता है।

सूचना-सैद्धांतिक सीमाएँ

कोलमोगोरोव जटिलता और लोब का प्रमेय एक प्रणाली के बारे में क्या साबित कर सकती है, इसके ऊपर सीमाएं निर्धारित करता है। श्मिदहुबर की औपचारिक गोडेल मशीन (पाठ 4) का उद्देश्य उच्चतम इस तरह के सीमा के लिए था; किसी ने भी एक गैर-नाजुक सबूत पूरा नहीं किया है। लोब का परिणाम कहता हैः यदि कोई प्रणाली "यदि मैं साबित करता हूं कि मुझे X करना चाहिए तो मैं X करूंगा", तो यह यह साबित किए बिना X करेगा, एक प्रसिद्ध स्व-संदर्भ विफलता।

हमारे आदिमों के लिए इसका मतलब यह है कि वे सुरक्षा समस्या को बंद नहीं कर सकते। वे चुपचाप विफलता को अधिक महंगा बनाते हैं। एक दुर्भावनापूर्ण या बहती लूप जो चुपचाप एक गायब चेक को बायपास कर देगा अब सक्रिय रूप से एक स्पष्ट को कमजोर करना चाहिए, जो एक अधिक पता लगाने योग्य हस्ताक्षर है।

एक व्यावहारिक उदाहरण

मान लीजिए कि एक एजेंट एक संपादन प्रस्ताव।

  1. अपरिवर्तनीय जाँचेंः मॉड्यूल हैश, उपकरण-अनुमति घोषणा पत्र, संवैधानिक हेडर।
  2. एंकर जांचः वस्तुनिष्ठ कथन स्वीकृत संस्करण (बाइट-विसंभव या अर्थशास्त्र के अनुसार) से मेल खाता है।
  3. बहु-उद्देश्यीय मूल्यांकनः प्रदर्शन, सुरक्षा, निष्पक्षता, मजबूती के अक्ष।
  4. प्रतिगमन का पता लगानाः कोई भी अक्ष सहनशीलता से अधिक नहीं गिरता है।

चारों को संपादन को लैंड करने के लिए पास करना होगा। किसी भी एक विफलता लूप को रोकती है।

इसका प्रयोग करें

code/main.pyपाठ 4 से डीजीएम-शैली के खिलौने पर एक सीमाबद्ध आत्म-सुधार लूप चलाता है, लेकिन शीर्ष पर चार आदिम परतों के साथ। प्रत्येक आदिम को व्यक्तिगत रूप से सक्षम या अक्षम किया जा सकता है। प्रदर्शन यह है कि प्रत्येक आदिम एक विशिष्ट विफलता वर्ग को पकड़ता है, और उनमें से किसी को हटाने से उस विफलता वर्ग को पारित करने की अनुमति मिलती है।

इसे भेजें

outputs/skill-bounded-loop-review.mdएक प्रस्तावित सीमांत लूप का लेखा परीक्षा और स्कोर करता है कि चार आदिमों में से यह वास्तव में लागू करता है बनाम दावा करता है।

व्यायाम

  1. दौड़ेंcode/main.pyपुष्टि लूप अभी भी हैक जीतने के बिना प्राथमिक मीट्रिक पर सुधार करता है।
  1. प्रतिगमन का पता लगाने को अक्षम करें. एक इनपुट का निर्माण करें जहां इससे मौन क्षमता हानि को स्वीकार किया जाता है।
  1. बहु-उद्देश्य प्रतिबंध को अक्षम करें. प्रदर्शन अक्ष पर लूप को एक सुरक्षा अक्ष गिरते हुए दिखाएं।
  1. कोडिंग एजेंट के लिए एक संरेखण एंकर डिज़ाइन करें. किस पाठ को, कहाँ संग्रहीत किया गया, कैसे जांच किया गया?
  1. ICLR 2026 RSI कार्यशाला सारांश पढ़ें। चार आदिमों में से एक चुनें और वर्तमान तकनीक की स्थिति में ठोस सुधार का प्रस्ताव दें।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
Invariant"Always-true property"A property checked by external code before and after every edit
Alignment anchor"Pinned objective"Immutable core-goal representation outside the loop's edit surface
Multi-objective constraint"All axes must hold"Performance, safety, fairness, robustness — all required
Regression detection"Pause on drop"Pause the loop when historical metric deltas suggest capability loss
Kolmogorov bound"Information-theoretic limit"Limits what a system can prove about its own successor
Lob's theorem"Self-reference trap"System can act on "I should" without proving it should
Gate stack"Layered check"Multiple primitives combined; any failure rejects the edit
Bounded improvement"Mitigation, not proof"Raises silent-failure cost; does not close the safety problem

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.