आत्म-सुधार के सीमित डिजाइन
Type: Learn
Languages: Python (stdlib, bounded-loop with invariant check)
Prerequisites: Phase 15 · 07 (RSI), Phase 15 · 04 (DGM)
Time: ~60 minutes
समस्या
पाठ 7 के दौड़ सिम्युलेटर ने दिखाया कि छोटी दरों में अंतर बड़े अंतराल में मिश्रित होता है। पाठ 4 के डीजीएम केस स्टडी ने दिखाया कि लूप अपने स्वयं के मूल्यांकनकर्ताओं को सक्रिय रूप से खेल सकते हैं। दोनों परिणाम एक ही इंजीनियरिंग प्रश्न की ओर इशारा करते हैंः आप स्वयं सुधार लूप पर क्या प्रतिबंध लगा सकते हैं ताकि लूप स्वयं द्वारा प्रतिबंधों को चुपचाप कमजोर नहीं किया जा सकता है?
ICLR 2026 RSI कार्यशाला सारांश (openreview.net/pdf?id=OsPQ6zTQXV) चार ऐसी आदिम की पहचान करता है। मानव विज्ञान के RSP v3.0 (पाठ 19) और डीपमाइंड के FSF v3 (पाठ 20) दोनों उन्हें क्षमता सीमाओं में संदर्भित करते हैं। मेटा हाइपरएजेंट्स काम और समुदाय फ्रेमवर्क जैसे SAHOO (मार्च 2026) उत्पादन में उपसेट लागू करते हैं।
ईमानदार ढांचाः ये मिट्याग हैं। सूचना-सैद्धांतिक परिणाम अपने उत्तराधिकारी के बारे में किसी भी प्रणाली को क्या साबित कर सकते हैं, और कोई वर्तमान डिजाइन समस्या को औपचारिक रूप से बंद नहीं करता है। एक अच्छी तरह से सीमित लूप एक असीमित से अधिक सुरक्षित है, पूर्ण रूप से सुरक्षित नहीं है।
अवधारणा
प्राथमिक 1: औपचारिक अपरिवर्तित
एक अपरिवर्तनीय एक गुण है जो प्रत्येक स्व-परिवर्तन से पहले और बाद में धारण करना चाहिए। उदाहरणः
- आउटपुट वितरण एक निश्चित संविधान हेडर (पाठ 17) पर स्थित है।
- कोई उपकरण कॉल अनधिकृत एंडपॉइंट पर नहीं जाता है।
- स्मृति लिखता है एक लॉग, हस्ताक्षरित पथ से गुजरता है।
- मूल्यांकनकर्ता का मॉड्यूल हैश अनुमोदित संस्करण से मेल खाता है।
इनवैरिएंट बाहरी कोड द्वारा जाँच किए जाते हैं जो लूप संपादित नहीं कर सकता है। यदि प्रस्तावित संशोधन एक इनवैरिएंट का उल्लंघन करता है, तो इसे खारिज कर दिया जाता है। यह डीजीएम-शैली के मूल्यांकनकर्ता-मशीन मोड (पाठ 4) को पकड़ता है।
कठिन भाग सुरक्षा के लिए आवश्यक और उचित समय में गणना योग्य अपरिवर्तनीय विकल्पों का चयन करना है। अति विशिष्टता स्टॉल प्रगति; कम विशिष्टता लूप महत्वपूर्ण गुणों से गुजरने की अनुमति देती है।
प्राथमिक 2: संरेखण एंकर
एक संरेखण एंकर लूप के मूल उद्देश्य का अपरिवर्तनीय प्रतिनिधित्व है, जो लूप की संपादन सतह के बाहर चिपका हुआ है। उदाहरणः
- संविधान का पाठ (पाठ 17) जो प्रत्येक आह्वान पर केवल पढ़ने के लिए स्थित स्थान से लोड किया जाता है।
- स्वतंत्र पहुंच नियंत्रण के साथ एक अलग भंडार में एक मूल्यांकनकर्ता।
- एक मानव द्वारा हस्ताक्षरित और प्रत्येक चक्र के लिए पुनः सत्यापित उपकरण-अनुमति घोषणा पत्र।
लूप का कार्य उद्देश्य के बहाव को रोकने के लिए है। लूप उद्देश्य का पीछा करने के तरीके को बेहतर बना सकता है, लेकिन उद्देश्य क्या है, उसे संपादित नहीं कर सकता है।
सूक्ष्म विफलता मोडः एक एंकर लूप को संपादित नहीं कर सकता है फिर भी एक लूप द्वारा फिर से व्याख्या की जा सकती है जो एंकर को पढ़ने के तरीके में बहती है। संवैधानिक एआई (पाठ 17) स्पष्ट रूप से नई स्थितियों को संभालने के लिए तर्क आधारित है; यह तर्क परत वह जगह है जहां व्याख्या बहती रहती है। एंकर आवश्यक हैं, पर्याप्त नहीं।
प्राथमिक 3: बहु-उद्देश्यीय प्रतिबंध
एक लूप जो एकल स्केलर स्कोर को अनुकूलित करता है, शॉर्टकट पाएगा। एक लूप जो एक साथ कई कठिन प्रतिबंधों को पूरा करना चाहिए, उसके पास कम शॉर्टकट उपलब्ध हैं।
- प्रदर्शन (कार्य स्तर का बेंचमार्क)
- सुरक्षा (लाल टीम के मूल्यांकन, ज्ञात-बुरे पर अस्वीकार दर)
- निष्पक्षता (संवेदनशील उपसमूहों पर असमान प्रभाव सीमा)
- मजबूती (OOD परीक्षण सेट, प्रतिकूल इनपुट हैंडलिंग)
एक संशोधन केवल तभी स्वीकार किया जाता है जब प्रत्येक प्रतिबंध मान्य हो। पाठ 13 के लागत गवर्नर इसे वित्तीय प्रतिबंधों के साथ ढेर करते हैं। पाठ 18 के लामा गार्ड सुरक्षा अक्ष के रूप में प्लग इन करते हैं।
प्राथमिक 4: प्रतिगमन का पता लगाना
प्रत्येक चक्र के स्कोर की तुलना ऐतिहासिक वितरण के साथ की जाती है। कॉन्फ़िगर किए गए सहिष्णुता से परे एक गिरावट लूप को रोकती है। यह मौन क्षमता हानि को पकड़ता है जो अन्यथा चल रही औसत में अवशोषित हो जाएगा क्योंकि लूप इसे "बढ़ा" गया।
एक व्यावहारिक कार्यान्वयनः पिछले N चक्रों के प्रति-कार्य स्कोर को संग्रहीत करें। प्रत्येक नए चक्र में प्रति-कार्य डेल्टा की गणना की जाती है। यदि कोई डेल्टा एक सीमा से नीचे गिरता है, तो चक्र अस्वीकार कर दिया जाता है और मानव समीक्षा करता है।
सूचना-सैद्धांतिक सीमाएँ
कोलमोगोरोव जटिलता और लोब का प्रमेय एक प्रणाली के बारे में क्या साबित कर सकती है, इसके ऊपर सीमाएं निर्धारित करता है। श्मिदहुबर की औपचारिक गोडेल मशीन (पाठ 4) का उद्देश्य उच्चतम इस तरह के सीमा के लिए था; किसी ने भी एक गैर-नाजुक सबूत पूरा नहीं किया है। लोब का परिणाम कहता हैः यदि कोई प्रणाली "यदि मैं साबित करता हूं कि मुझे X करना चाहिए तो मैं X करूंगा", तो यह यह साबित किए बिना X करेगा, एक प्रसिद्ध स्व-संदर्भ विफलता।
हमारे आदिमों के लिए इसका मतलब यह है कि वे सुरक्षा समस्या को बंद नहीं कर सकते। वे चुपचाप विफलता को अधिक महंगा बनाते हैं। एक दुर्भावनापूर्ण या बहती लूप जो चुपचाप एक गायब चेक को बायपास कर देगा अब सक्रिय रूप से एक स्पष्ट को कमजोर करना चाहिए, जो एक अधिक पता लगाने योग्य हस्ताक्षर है।
एक व्यावहारिक उदाहरण
मान लीजिए कि एक एजेंट एक संपादन प्रस्ताव।
- अपरिवर्तनीय जाँचेंः मॉड्यूल हैश, उपकरण-अनुमति घोषणा पत्र, संवैधानिक हेडर।
- एंकर जांचः वस्तुनिष्ठ कथन स्वीकृत संस्करण (बाइट-विसंभव या अर्थशास्त्र के अनुसार) से मेल खाता है।
- बहु-उद्देश्यीय मूल्यांकनः प्रदर्शन, सुरक्षा, निष्पक्षता, मजबूती के अक्ष।
- प्रतिगमन का पता लगानाः कोई भी अक्ष सहनशीलता से अधिक नहीं गिरता है।
चारों को संपादन को लैंड करने के लिए पास करना होगा। किसी भी एक विफलता लूप को रोकती है।
इसका प्रयोग करें
code/main.pyपाठ 4 से डीजीएम-शैली के खिलौने पर एक सीमाबद्ध आत्म-सुधार लूप चलाता है, लेकिन शीर्ष पर चार आदिम परतों के साथ। प्रत्येक आदिम को व्यक्तिगत रूप से सक्षम या अक्षम किया जा सकता है। प्रदर्शन यह है कि प्रत्येक आदिम एक विशिष्ट विफलता वर्ग को पकड़ता है, और उनमें से किसी को हटाने से उस विफलता वर्ग को पारित करने की अनुमति मिलती है।
इसे भेजें
outputs/skill-bounded-loop-review.mdएक प्रस्तावित सीमांत लूप का लेखा परीक्षा और स्कोर करता है कि चार आदिमों में से यह वास्तव में लागू करता है बनाम दावा करता है।
व्यायाम
- दौड़ें
code/main.pyपुष्टि लूप अभी भी हैक जीतने के बिना प्राथमिक मीट्रिक पर सुधार करता है।
- प्रतिगमन का पता लगाने को अक्षम करें. एक इनपुट का निर्माण करें जहां इससे मौन क्षमता हानि को स्वीकार किया जाता है।
- बहु-उद्देश्य प्रतिबंध को अक्षम करें. प्रदर्शन अक्ष पर लूप को एक सुरक्षा अक्ष गिरते हुए दिखाएं।
- कोडिंग एजेंट के लिए एक संरेखण एंकर डिज़ाइन करें. किस पाठ को, कहाँ संग्रहीत किया गया, कैसे जांच किया गया?
- ICLR 2026 RSI कार्यशाला सारांश पढ़ें। चार आदिमों में से एक चुनें और वर्तमान तकनीक की स्थिति में ठोस सुधार का प्रस्ताव दें।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| Invariant | "Always-true property" | A property checked by external code before and after every edit |
| Alignment anchor | "Pinned objective" | Immutable core-goal representation outside the loop's edit surface |
| Multi-objective constraint | "All axes must hold" | Performance, safety, fairness, robustness — all required |
| Regression detection | "Pause on drop" | Pause the loop when historical metric deltas suggest capability loss |
| Kolmogorov bound | "Information-theoretic limit" | Limits what a system can prove about its own successor |
| Lob's theorem | "Self-reference trap" | System can act on "I should" without proving it should |
| Gate stack | "Layered check" | Multiple primitives combined; any failure rejects the edit |
| Bounded improvement | "Mitigation, not proof" | Raises silent-failure cost; does not close the safety problem |
आगे पढ़ना
- ICLR 2026 RSI Workshop summary (OpenReview) चार-प्राथमिक अभिसरण।
- Anthropic Responsible Scaling Policy v3.0 बहु-उद्देश्य क्षमता सीमाएँ।
- DeepMind Frontier Safety Framework v3 एक अपरिवर्तनीय आदिम के रूप में धोखाधड़ी-अनुरेखण निगरानी।
- Schmidhuber (2003). Godel Machines इन आदिमों के औपचारिक-प्रमाण पूर्वज।
- Anthropic — Claude's Constitution (January 2026) कारण आधारित संरेखण लंगर।
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.