Phase 15: Autonomous Systems

स्वचालित संरेखण अनुसंधान (एएआर)

मानव विज्ञान ने स्वतंत्र रेत बॉक्स में क्लाउड ओपस 4.6 स्वायत्त संरेखण शोधकर्ताओं की समानांतर टीमों को चलाया, एक साझा मंच के माध्यम से समन्वयित किया, जिसका लॉग किसी भी रेत बॉक्स के बाहर रहता है (इसलिए एजेंट अपने स्वयं के रिकॉर्ड को नहीं हटा सकते हैं) । कमजोर से मजबूत प्रशिक्षण समस्या पर, एएआर मानव शोधकर्ताओं से बेहतर प्रदर्शन करते थे। मानविकी के स्वयं के संक्षिप्त ध्वज जो कार्यप्रवाहों को निर्धारित करते हैं, अक्सर एएआर लचीलापन को सीमित करते हैं और प्रदर्शन को कम करते हैं। संरेखण अनुसंधान को स्वचालित करना संपीड़न चरण है जो समयरेखा को सटीक गलत संरेखण जोखिमों के लिए संपीड़न करता है।

Type: Learn

Languages: Python (stdlib, parallel-research-forum simulator)

Prerequisites: Phase 15 · 05 (AI Scientist v2), Phase 15 · 04 (DGM)

Time: ~60 minutes

समस्या

मानव-अनुसंधानकर्ता समय में संरेखण अनुसंधान महंगा है। स्केलेबल पर्यवेक्षण, इनाम विनिर्देश, या कमजोर से मजबूत प्रशिक्षण जैसी समस्याओं के लिए प्रति पुनरावृत्ति के लिए हफ्तों तक प्रयोगों की आवश्यकता होती है। सीमा क्षमताओं के आगे बढ़ने के साथ, संरेखण कार्यभार योग्य शोधकर्ताओं की आपूर्ति से तेजी से बढ़ता है।

स्वचालित संरेखण अनुसंधान (एएआर) पूछता है कि क्या वही सीमा मॉडल जिनके क्षमता संरेखण से आगे है अंतर को बंद करने में योगदान कर सकते हैं। एएआर द्वारा संचालित कमजोर-से-बल प्रशिक्षण अध्ययन (संरेखण.एएनएचआरपीसी.कॉम/2026/स्वचालित-डब्ल्यू2एस-अनुसंधानकर्ता/) पर मानव विज्ञान की 2026 रिपोर्ट इस वर्ग के एक तैनात प्रणाली के पहले सार्वजनिक परिणामों में से एक है।

परिणाम वास्तव में सकारात्मक हैः एएआर ने मानव आधार रेखा की तुलना में एक शोध समस्या को बेहतर तरीके से हल किया। परिणाम एक एकल प्रणाली में, इस चरण में विकसित होने वाली हर चिंता को भी केंद्रित करता है। यदि संरेखण अनुसंधान स्वचालित हो सकता है, तो सुरक्षा उपायों को भी आश्वासन दे सकते हैं। एआई अनुसंधान और विकास क्षमता के लिए आरएसपी के सीमांकन इस लूप को ध्यान में रखते हुए लिखे गए हैं।

अवधारणा

वास्तुकला (जैसा कि सार्वजनिक रूप से वर्णित है)

  • Parallel agents.कई क्लाउड ओपस 4.6 उदाहरण AAR के रूप में चल रहे हैं, प्रत्येक एक स्वतंत्र सैंडबॉक्स में। सैंडबॉक्स फ़ाइल सिस्टम, नेटवर्क और प्रक्रिया सतह को सीमित करते हैं।
  • Shared forum.निष्कर्ष एक साझा मंच पर प्रकाशित किए जाते हैं जिसका भंडारण बैकेंड प्रत्येक सैंडबॉक्स के बाहर स्थित है। एजेंट मंच को पढ़ सकते हैं; एजेंट अपने स्वयं के सैंडबॉक्स के भीतर से फोरम रिकॉर्ड को नहीं हटा सकते हैं या संपादित नहीं कर सकते हैं।
  • Task allocation.मानव द्वारा डिज़ाइन किए गए कार्य कतार एआर के लिए अनुसंधान समस्याओं को सौंपता है। एआर विघटन का प्रस्ताव देते हैं, प्रयोग करते हैं, निष्कर्ष लिखते हैं।
  • Weak-to-strong training focus.प्रकाशित अध्ययन में कमजोर से मजबूत प्रशिक्षण पर ध्यान दिया गया था एक कमजोर पर्यवेक्षक मॉडल का उपयोग करके एक मजबूत छात्र मॉडल को प्रशिक्षित किया गया था। एएआर इस कार्य में मानव शोधकर्ताओं से बेहतर प्रदर्शन करते थे।

किन बातों से बालू के बक्से से बाहर की लॉग महत्वपूर्ण है

लॉग-अखंडता संपत्ति एक नियंत्रित प्रयोग और संभावित रूप से असुरक्षित प्रयोग के बीच अंतर है। यदि एएआर अपने स्वयं के लॉग को संपादित कर सकते हैं, तो वे असफल या संदिग्ध प्रयोगों को कवर कर सकते हैं। मानव जातिवादी ध्वज यह सीधेः संपत्ति अनुसंधान उत्पादन पर भरोसा करने के लिए एक आवश्यक शर्त है, और यह सत्यापित करना गैर-नाशिक है।

बुनियादी ढांचे के संदर्भ में एनालॉग केवल बाहरी भंडारण (जैसे S3 ऑब्जेक्ट-लॉक, अपरिवर्तनीय Datadog लॉग) के माध्यम से लेखन के साथ जोड़ लॉग हैं। एजेंट के पास पिछले रिकॉर्ड को संशोधित करने के लिए कोई क्रेडेंशियल नहीं है। यह वही पैटर्न है जो 2026 कॉर्पोरेट सुरक्षा टीमों द्वारा रैंसमवेयर प्रतिरोधी ऑडिट ट्रेल बनाने के लिए उपयोग किया जाता है।

निर्धारित कार्यप्रवाह व्यापारिक अंतर

मानव विज्ञान की रिपोर्ट में कहा गया है कि निर्धारित कार्यप्रवाह अक्सर एएआर लचीलापन को सीमित करते हैं और प्रदर्शन को कम करते हैं। दूसरे शब्दों मेंः यदि मानव डिजाइनर अनुसंधान योजना को कदम से कदम लिखता है, तो एएआर उच्च स्तर के लक्ष्यों और विघटन की स्वतंत्रता के साथ दिए जाने की तुलना में बदतर प्रदर्शन करते हैं। यह एजेंटिक अनुसंधान (लैंगग्राफ, माइक्रोसॉफ्ट के एजेंट फ्रेमवर्क) के परिणामों के अनुरूप है।

सुरक्षा प्रभाव सूक्ष्म है। एएआर प्रदर्शन में सुधार करने वाली लचीलापन यह लचीलापन भी है जो अनुमोदित विघटन, नए उपकरण उपयोग और लक्ष्य-विभाजन की अनुमति देता है। समझौता एक डिजाइन-स्थान निर्णय हैः मानव को हराने के लिए पर्याप्त क्षमता कितनी लचीलापन खरीदता है, बिना एजेंट के कमरे को वितरित किए बिना लक्ष्य को सामान्य बनाने के लिए?

संपीड़न जोखिम

आरएसपी v3.0 (पाठ 19) एक एआई आर एंड डी क्षमता सीमा पेश करता हैः प्रतिस्पर्धी लागत बनाम मानव + एआई उपकरणों पर एआई आर एंड डी पाइपलाइन को पूरी तरह से स्वचालित करने की क्षमता। डीपमाइंड के एफएसएफ v3 में एक समान एमएल आर एंड डी स्वायत्तता स्तर शामिल है। दोनों ढांचे इस सीमा को ऊंचा नियंत्रण के लिए ट्रिगर के रूप में मानते हैं।

एएआर सीमा से एक कदम कम हैः यह पाइपलाइन के हिस्से को स्वचालित करता है (विशिष्ट, अच्छी तरह से स्केलेबल कार्यों पर संरेखण अनुसंधान) लेकिन अंत-से-अंत क्षमता विकास लूप नहीं। समयरेखा प्रश्न यह है कि अंतराल कितनी जल्दी बंद हो जाता है।

संपीड़ित समय रेखाएं संश्लेषण विफलता की चिंता हैं। यदि संरेखण अनुसंधान और क्षमता अनुसंधान समान दरों से संयुग्मित होते हैं, तो गलत संरेखण जोखिम सतह क्षमता के समान ही तेजी से बढ़ जाती है। यदि क्षमता तेजी से बढ़ जाती है (ऐतिहासिक प्रवृत्ति), तो अंतर बढ़ जाता है। यह तर्क है कि एआरए एक योग्य वस्तु है: प्रत्येक अतिरिक्त संरेखण परिणाम अंतर को कम करता है यदि और केवल यदि अनुसंधान प्रक्रिया विश्वसनीय है।

AAR क्या नहीं बदलता है

मानव शोधकर्ताओं ने कार्य कतार निर्धारित की, परिणामों की समीक्षा की और संवैधानिक प्राधिकरण को बनाए रखा। एआरपी पाइपलाइन के मध्य में तेजी लाता है, अंत में नहीं। मानव शोधकर्ताओं के प्रकाशित आउटपुट में एआरपी योगदान और मानव-अनुसंधानकर्ता निर्णय दोनों शामिल हैं कि क्या प्रकाशित करना है, क्या वापस लेना है, और क्या परिष्कृत करना है।

यह अध्ययन के लिए लागू पाठ 15 से प्रस्ताव-तब-कमाएं पैटर्न से मेल खाता हैः एआर प्रस्ताव; मनुष्य प्रतिबद्ध।

इसका प्रयोग करें

code/main.pyतीन स्वतंत्र "अनुसंधान एजेंट" समानांतर चल रहे हैं, वैकल्पिक छेड़छाड़ के प्रयासों के साथ केवल एक ऐड-ऑन मंच पर निष्कर्ष पोस्ट करते हैं।

देखो:

  • कैसे रेत बॉक्स से बाहर लॉगिंग लॉग-टैम्पिंग के प्रयासों को पकड़ता है।
  • कैसे मुक्त विघटन के साथ कार्य आवंटन कठिन समस्याओं पर तय कार्यप्रवाहों से बेहतर प्रदर्शन करता है।
  • कैसे एक ही समझौता किया एआर फोरम के संकेत दूषित कर सकते हैं अगर लॉग छेड़छाड़ के लिए स्पष्ट नहीं है।

इसे भेजें

outputs/skill-aar-deployment-review.mdएक स्वचालित-अनुसूचित-अनुसंधान पाइपलाइन की तैनाती से पहले समीक्षा है।

व्यायाम

  1. दौड़ेंcode/main.py. "फिक्स्ड वर्कफ़्लो" बनाम "फ्री-डिमोप्शन" सेटिंग्स की तुलना करें. क्या फ्री-डिमोप्शन हमेशा जीतता है, या समस्या वर्ग हैं जहां फिक्स्ड वर्कफ़्लो प्रतिस्पर्धी है?
  1. सिम्युलेटर को संशोधित करें ताकि एक एजेंट लॉग को हेरफेर करने का प्रयास करे। केवल अनुलग्नक लॉग को पता चलता है। एक पैराग्राफ लिखें जो लॉग में पता लगाने के हस्ताक्षर का सटीक रूप बताता है।
  1. मानव शोधकर्ताओं को हराए एआर के विशिष्ट उप-कार्य की पहचान करें। यह स्वचालित करने के लिए क्या सक्षम बना दिया?
  1. कार्य-सूची आवंटन नीति बनाएं जो निर्धारित कार्यप्रवाह प्रतिबंधों (आसान लेखा परीक्षा) के साथ एआरए लचीलापन (बेहतर परिणाम) को संतुलित करे। वर्णन करें कि आप दोनों का ए / बी परीक्षण कैसे करेंगे।
  1. आरएसपी v3.0 के एआई आर एंड डी 4 सीमा पढ़ें. एक पैराग्राफ में, वर्णन करें कि आप क्या सोचते हैं कि इसे पार कर जाएगा कि एएआर वर्तमान में नहीं करता है.

प्रमुख शर्तें

TermWhat people sayWhat it actually means
AAR"Automated Alignment Researcher"Claude Opus 4.6 instance operated autonomously on alignment problems
Weak-to-strong training"Training a stronger model with a weaker supervisor"Classic scalable-oversight benchmark AARs outperformed humans on
Shared forum"Where agents publish findings"Append-only, out-of-sandbox storage
Out-of-sandbox log"Agent cannot edit its own record"Tamper-evident write-through to external storage
Prescribed workflow"Step-by-step plan from human designer"Constrains AAR; often degrades performance vs free decomposition
Free decomposition"Agent decides how to break the task"More capable, harder to audit
AI R&D threshold"RSP/FSF capability level"Full automation of R&D pipeline at competitive cost
Compressed timeline"Alignment vs capability race"If capability compounds faster than alignment, misalignment risk grows

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.