स्वचालित संरेखण अनुसंधान (एएआर)
Type: Learn
Languages: Python (stdlib, parallel-research-forum simulator)
Prerequisites: Phase 15 · 05 (AI Scientist v2), Phase 15 · 04 (DGM)
Time: ~60 minutes
समस्या
मानव-अनुसंधानकर्ता समय में संरेखण अनुसंधान महंगा है। स्केलेबल पर्यवेक्षण, इनाम विनिर्देश, या कमजोर से मजबूत प्रशिक्षण जैसी समस्याओं के लिए प्रति पुनरावृत्ति के लिए हफ्तों तक प्रयोगों की आवश्यकता होती है। सीमा क्षमताओं के आगे बढ़ने के साथ, संरेखण कार्यभार योग्य शोधकर्ताओं की आपूर्ति से तेजी से बढ़ता है।
स्वचालित संरेखण अनुसंधान (एएआर) पूछता है कि क्या वही सीमा मॉडल जिनके क्षमता संरेखण से आगे है अंतर को बंद करने में योगदान कर सकते हैं। एएआर द्वारा संचालित कमजोर-से-बल प्रशिक्षण अध्ययन (संरेखण.एएनएचआरपीसी.कॉम/2026/स्वचालित-डब्ल्यू2एस-अनुसंधानकर्ता/) पर मानव विज्ञान की 2026 रिपोर्ट इस वर्ग के एक तैनात प्रणाली के पहले सार्वजनिक परिणामों में से एक है।
परिणाम वास्तव में सकारात्मक हैः एएआर ने मानव आधार रेखा की तुलना में एक शोध समस्या को बेहतर तरीके से हल किया। परिणाम एक एकल प्रणाली में, इस चरण में विकसित होने वाली हर चिंता को भी केंद्रित करता है। यदि संरेखण अनुसंधान स्वचालित हो सकता है, तो सुरक्षा उपायों को भी आश्वासन दे सकते हैं। एआई अनुसंधान और विकास क्षमता के लिए आरएसपी के सीमांकन इस लूप को ध्यान में रखते हुए लिखे गए हैं।
अवधारणा
वास्तुकला (जैसा कि सार्वजनिक रूप से वर्णित है)
- Parallel agents.कई क्लाउड ओपस 4.6 उदाहरण AAR के रूप में चल रहे हैं, प्रत्येक एक स्वतंत्र सैंडबॉक्स में। सैंडबॉक्स फ़ाइल सिस्टम, नेटवर्क और प्रक्रिया सतह को सीमित करते हैं।
- Shared forum.निष्कर्ष एक साझा मंच पर प्रकाशित किए जाते हैं जिसका भंडारण बैकेंड प्रत्येक सैंडबॉक्स के बाहर स्थित है। एजेंट मंच को पढ़ सकते हैं; एजेंट अपने स्वयं के सैंडबॉक्स के भीतर से फोरम रिकॉर्ड को नहीं हटा सकते हैं या संपादित नहीं कर सकते हैं।
- Task allocation.मानव द्वारा डिज़ाइन किए गए कार्य कतार एआर के लिए अनुसंधान समस्याओं को सौंपता है। एआर विघटन का प्रस्ताव देते हैं, प्रयोग करते हैं, निष्कर्ष लिखते हैं।
- Weak-to-strong training focus.प्रकाशित अध्ययन में कमजोर से मजबूत प्रशिक्षण पर ध्यान दिया गया था एक कमजोर पर्यवेक्षक मॉडल का उपयोग करके एक मजबूत छात्र मॉडल को प्रशिक्षित किया गया था। एएआर इस कार्य में मानव शोधकर्ताओं से बेहतर प्रदर्शन करते थे।
किन बातों से बालू के बक्से से बाहर की लॉग महत्वपूर्ण है
लॉग-अखंडता संपत्ति एक नियंत्रित प्रयोग और संभावित रूप से असुरक्षित प्रयोग के बीच अंतर है। यदि एएआर अपने स्वयं के लॉग को संपादित कर सकते हैं, तो वे असफल या संदिग्ध प्रयोगों को कवर कर सकते हैं। मानव जातिवादी ध्वज यह सीधेः संपत्ति अनुसंधान उत्पादन पर भरोसा करने के लिए एक आवश्यक शर्त है, और यह सत्यापित करना गैर-नाशिक है।
बुनियादी ढांचे के संदर्भ में एनालॉग केवल बाहरी भंडारण (जैसे S3 ऑब्जेक्ट-लॉक, अपरिवर्तनीय Datadog लॉग) के माध्यम से लेखन के साथ जोड़ लॉग हैं। एजेंट के पास पिछले रिकॉर्ड को संशोधित करने के लिए कोई क्रेडेंशियल नहीं है। यह वही पैटर्न है जो 2026 कॉर्पोरेट सुरक्षा टीमों द्वारा रैंसमवेयर प्रतिरोधी ऑडिट ट्रेल बनाने के लिए उपयोग किया जाता है।
निर्धारित कार्यप्रवाह व्यापारिक अंतर
मानव विज्ञान की रिपोर्ट में कहा गया है कि निर्धारित कार्यप्रवाह अक्सर एएआर लचीलापन को सीमित करते हैं और प्रदर्शन को कम करते हैं। दूसरे शब्दों मेंः यदि मानव डिजाइनर अनुसंधान योजना को कदम से कदम लिखता है, तो एएआर उच्च स्तर के लक्ष्यों और विघटन की स्वतंत्रता के साथ दिए जाने की तुलना में बदतर प्रदर्शन करते हैं। यह एजेंटिक अनुसंधान (लैंगग्राफ, माइक्रोसॉफ्ट के एजेंट फ्रेमवर्क) के परिणामों के अनुरूप है।
सुरक्षा प्रभाव सूक्ष्म है। एएआर प्रदर्शन में सुधार करने वाली लचीलापन यह लचीलापन भी है जो अनुमोदित विघटन, नए उपकरण उपयोग और लक्ष्य-विभाजन की अनुमति देता है। समझौता एक डिजाइन-स्थान निर्णय हैः मानव को हराने के लिए पर्याप्त क्षमता कितनी लचीलापन खरीदता है, बिना एजेंट के कमरे को वितरित किए बिना लक्ष्य को सामान्य बनाने के लिए?
संपीड़न जोखिम
आरएसपी v3.0 (पाठ 19) एक एआई आर एंड डी क्षमता सीमा पेश करता हैः प्रतिस्पर्धी लागत बनाम मानव + एआई उपकरणों पर एआई आर एंड डी पाइपलाइन को पूरी तरह से स्वचालित करने की क्षमता। डीपमाइंड के एफएसएफ v3 में एक समान एमएल आर एंड डी स्वायत्तता स्तर शामिल है। दोनों ढांचे इस सीमा को ऊंचा नियंत्रण के लिए ट्रिगर के रूप में मानते हैं।
एएआर सीमा से एक कदम कम हैः यह पाइपलाइन के हिस्से को स्वचालित करता है (विशिष्ट, अच्छी तरह से स्केलेबल कार्यों पर संरेखण अनुसंधान) लेकिन अंत-से-अंत क्षमता विकास लूप नहीं। समयरेखा प्रश्न यह है कि अंतराल कितनी जल्दी बंद हो जाता है।
संपीड़ित समय रेखाएं संश्लेषण विफलता की चिंता हैं। यदि संरेखण अनुसंधान और क्षमता अनुसंधान समान दरों से संयुग्मित होते हैं, तो गलत संरेखण जोखिम सतह क्षमता के समान ही तेजी से बढ़ जाती है। यदि क्षमता तेजी से बढ़ जाती है (ऐतिहासिक प्रवृत्ति), तो अंतर बढ़ जाता है। यह तर्क है कि एआरए एक योग्य वस्तु है: प्रत्येक अतिरिक्त संरेखण परिणाम अंतर को कम करता है यदि और केवल यदि अनुसंधान प्रक्रिया विश्वसनीय है।
AAR क्या नहीं बदलता है
मानव शोधकर्ताओं ने कार्य कतार निर्धारित की, परिणामों की समीक्षा की और संवैधानिक प्राधिकरण को बनाए रखा। एआरपी पाइपलाइन के मध्य में तेजी लाता है, अंत में नहीं। मानव शोधकर्ताओं के प्रकाशित आउटपुट में एआरपी योगदान और मानव-अनुसंधानकर्ता निर्णय दोनों शामिल हैं कि क्या प्रकाशित करना है, क्या वापस लेना है, और क्या परिष्कृत करना है।
यह अध्ययन के लिए लागू पाठ 15 से प्रस्ताव-तब-कमाएं पैटर्न से मेल खाता हैः एआर प्रस्ताव; मनुष्य प्रतिबद्ध।
इसका प्रयोग करें
code/main.pyतीन स्वतंत्र "अनुसंधान एजेंट" समानांतर चल रहे हैं, वैकल्पिक छेड़छाड़ के प्रयासों के साथ केवल एक ऐड-ऑन मंच पर निष्कर्ष पोस्ट करते हैं।
देखो:
- कैसे रेत बॉक्स से बाहर लॉगिंग लॉग-टैम्पिंग के प्रयासों को पकड़ता है।
- कैसे मुक्त विघटन के साथ कार्य आवंटन कठिन समस्याओं पर तय कार्यप्रवाहों से बेहतर प्रदर्शन करता है।
- कैसे एक ही समझौता किया एआर फोरम के संकेत दूषित कर सकते हैं अगर लॉग छेड़छाड़ के लिए स्पष्ट नहीं है।
इसे भेजें
outputs/skill-aar-deployment-review.mdएक स्वचालित-अनुसूचित-अनुसंधान पाइपलाइन की तैनाती से पहले समीक्षा है।
व्यायाम
- दौड़ें
code/main.py. "फिक्स्ड वर्कफ़्लो" बनाम "फ्री-डिमोप्शन" सेटिंग्स की तुलना करें. क्या फ्री-डिमोप्शन हमेशा जीतता है, या समस्या वर्ग हैं जहां फिक्स्ड वर्कफ़्लो प्रतिस्पर्धी है?
- सिम्युलेटर को संशोधित करें ताकि एक एजेंट लॉग को हेरफेर करने का प्रयास करे। केवल अनुलग्नक लॉग को पता चलता है। एक पैराग्राफ लिखें जो लॉग में पता लगाने के हस्ताक्षर का सटीक रूप बताता है।
- मानव शोधकर्ताओं को हराए एआर के विशिष्ट उप-कार्य की पहचान करें। यह स्वचालित करने के लिए क्या सक्षम बना दिया?
- कार्य-सूची आवंटन नीति बनाएं जो निर्धारित कार्यप्रवाह प्रतिबंधों (आसान लेखा परीक्षा) के साथ एआरए लचीलापन (बेहतर परिणाम) को संतुलित करे। वर्णन करें कि आप दोनों का ए / बी परीक्षण कैसे करेंगे।
- आरएसपी v3.0 के एआई आर एंड डी 4 सीमा पढ़ें. एक पैराग्राफ में, वर्णन करें कि आप क्या सोचते हैं कि इसे पार कर जाएगा कि एएआर वर्तमान में नहीं करता है.
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| AAR | "Automated Alignment Researcher" | Claude Opus 4.6 instance operated autonomously on alignment problems |
| Weak-to-strong training | "Training a stronger model with a weaker supervisor" | Classic scalable-oversight benchmark AARs outperformed humans on |
| Shared forum | "Where agents publish findings" | Append-only, out-of-sandbox storage |
| Out-of-sandbox log | "Agent cannot edit its own record" | Tamper-evident write-through to external storage |
| Prescribed workflow | "Step-by-step plan from human designer" | Constrains AAR; often degrades performance vs free decomposition |
| Free decomposition | "Agent decides how to break the task" | More capable, harder to audit |
| AI R&D threshold | "RSP/FSF capability level" | Full automation of R&D pipeline at competitive cost |
| Compressed timeline | "Alignment vs capability race" | If capability compounds faster than alignment, misalignment risk grows |
आगे पढ़ना
- Anthropic — Automated Weak-to-Strong Researcher प्राथमिक स्रोत।
- Anthropic Responsible Scaling Policy v3.0 AI आरएंडडी सीमा फ्रेमिंग।
- Anthropic — Measuring AI agent autonomy व्यापक एजेंट-स्वतंत्रता ढांचे।
- DeepMind Frontier Safety Framework v3 आरएसपी के समानांतर आरएंडडी स्वायत्तता स्तर।
- Burns et al. (2023). Weak-to-Strong Generalization (OpenAI) एएआर द्वारा हमला किया गया अंतर्निहित समस्या।
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.