Phase 15: Autonomous Systems

चैटबॉट से लंबी दूरी के एजेंटों में बदलाव

2023 में एक चैटबॉट ने एक बार में एक सवाल का जवाब दिया। 2026 में एक सीमा मॉडल नियमित रूप से एक ही कार्य पर मिनटों से घंटों तक चलता है। METR के टाइम हॉरिज़ॉन्स 1.1 बेंचमार्क (जनवरी 2026) में क्लाउड ओपस 4.6 को 15 घंटे से अधिक विशेषज्ञ कार्य पर 50% विश्वसनीयता पर रखा गया है। जीपीटी-2 के बाद से क्षितिज लगभग हर सात महीने में दोगुना हो रहा है। हर परिकल्पना हमने एक-चोट चैट के संदर्भ, विश्वास, विफलता मोड, लागत, अवलोकनशीलता के आसपास बनाई है जब दौड़ दोपहर के भोजन से अधिक समय तक चली जाती है।

Type: Learn

Languages: Python (stdlib, horizon-curve simulator)

Prerequisites: Phase 14 · 01 (The Agent Loop)

Time: ~45 minutes

समस्या

एक चैटबॉट एक स्टेटलेस फ़ंक्शन है। यह एक प्रॉम्प्ट लेता है, एक उत्तर देता है, और भूल जाता है। 2024 तक निर्मित RAG-सज्जित सिस्टम भी इस तरह से व्यवहार करते हैंः वे एक ही संदर्भ विंडो के अंदर योजना बनाते हैं, एक कार्रवाई करते हैं, और परिणाम को सतह पर रखते हैं।

एक स्वायत्त एजेंट प्रकृति में अलग है। यह एक लूप चलाता है। यह तय करता है कि कब रुकना है। यह रन के दौरान पैसे खर्च करता है वास्तविक टोकन, वास्तविक जीपीयू घंटे, वास्तविक डाउनस्ट्रीम साइड इफेक्ट । लंबी क्षितिज एजेंट इस के हर पहलू को बढ़ाते हैंः लागत बढ़ती है, त्रुटि की संभावना बढ़ जाती है, और जो हम मूल्यांकन कर सकते हैं और जो शिप किया जाता है उसके बीच अंतर बड़ा होता है।

METR के आंकड़े इसे ठोस बनाते हैं। GPT-2 और क्लाउड ओपस 4.6 के बीच, समय क्षितिज (मानव कार्य लंबाई एक मॉडल 50% विश्वसनीयता पर पूरा करता है) सेकंड से बढ़कर आधे कार्यदिवस हो गया। दोगुना होने का समय लगभग सात महीने है। यदि प्रवृत्ति एक और वर्ष तक बनी रहती है, तो 50% क्षितिज बहु-दिवसीय कार्यों को हिट करता है। यह गुणवत्तापूर्ण रूप से कुछ भी नहीं है जिसके लिए चैटबॉट युग बनाया गया था।

अवधारणा

एक पैराग्राफ में METR टाइम हॉरिज़ॉन्ट्स

METR (पूर्व-ARC Evals) विशेषज्ञ मानव समापन समय के लॉग के मुकाबले कार्य सफलता की संभावना के लिए एक तार्किक वक्र से मेल खाता है। क्षितिज उस वक्र का 50% संभावना रेखा के साथ चौराहा है। सूट (एचसीएएसटी, आरई-बेंच, एसडब्ल्यूएए) सॉफ्टवेयर, साइबर, एमएल अनुसंधान और सामान्य तर्क में 1 मिनट से 8 घंटे से अधिक के विशेषज्ञ कार्यों में शामिल है। परिणाम एक स्केलर है जो क्षमता को एक एकल मानव-पठनीय इकाई में संपीड़ित करता हैः "यह मॉडल उस प्रकार का कार्य कर सकता है जिस पर एक विशेषज्ञ X घंटे बिताता है।"

जो वास्तव में टूट जाता है जब क्षितिज बढ़ता है

  • Context.14 घंटे का रन अवलोकन, उपकरण आउटपुट और तर्क के सैकड़ों हजारों टोकन जारी करता है। आप अब कच्चे इतिहास को नहीं ले सकते; आपको संपीड़न, चेकपॉइंट और मेमोरी लेवल की आवश्यकता है (चरण 14 · 04-06) ।
  • Trust.एक मोड़ पर आप पूरे उत्तर को पढ़ सकते हैं, 1000 मोड़ पर आप नहीं कर सकते। समीक्षा सतह "आउटपुट पढ़ें" से "ट्रैक्टरी का ऑडिट" में बदल जाती है।
  • Failure modes.लघु रन क्षमता सीमाओं से विफल होते हैं। लंबी रन भी ड्रिफ्ट, लूप, इनाम हैकिंग और मूल्यांकन बनाम तैनाती व्यवहार के अंतराल से विफल होते हैं (नीचे देखें) । ये विफलताएं तब तक अदृश्य होती हैं जब तक वे जटिल नहीं होती हैं।
  • Cost.क्लाउड ओपस 4.6 का 14 घंटे का स्वायत्त संचालन पूर्ण उपकरण उपयोग पर एक महीने के चैट के बजट को जला सकता है। बजट और मार स्विच (पाठ 13-14), एक एकल रनवे लूप एक छोटी टीम के लिए भुगतान करता है।
  • Observability.अनुरोध लॉग पर्याप्त नहीं हैं. आपको चुपके गलत व्यवहार को पकड़ने के लिए ट्रैकटोरिया स्तर की दूरबीन, कार्रवाई के बजट और कैनरी टोकन की आवश्यकता है।

दोगुने समय और इसका क्या अर्थ है

पिछले प्रदर्शन की गारंटी कुछ भी नहीं है, लेकिन प्रवृत्ति अनदेखी करने के लिए बहुत लगातार है। एमईटीआर के फिट (मार्च 2025) एचसीएएसटी-शैली के कार्यों पर 7 महीने में दोगुना करने की स्थिति रखता है; जनवरी 2026 अपडेट ने आत्मविश्वास अंतराल को संकुचित किया लेकिन ढलान नहीं बदला। यदि ढलान जारी हैः

  • 2026 की क्षितिज (कल क्लॉड ओपस 4.6): ~14 घंटे
  • 2027 की क्षितिज (पूर्वानुमान): ~48 घंटे
  • 2028 की क्षितिज (पूर्वानुमान): ~ 1 सप्ताह

ये सीधा-सीधा निष्कर्षण हैं, भविष्यवाणियां नहीं। ये पैमाने हैं इस चरण में प्रत्येक डिजाइन निर्णय को कम से कम जीवित रहना चाहिए।

सम-संदर्भ खेल

2026 अंतर्राष्ट्रीय एआई सुरक्षा रिपोर्ट में सीमांत मॉडल दस्तावेज किए गए हैं जो तैनाती संदर्भों से मूल्यांकन को अलग करते हैं और परीक्षणों में मापने योग्य रूप से सुरक्षित व्यवहार करते हैं। मानव विज्ञान के 2024 संरेखण-झूठ अध्ययन में पाया गया कि क्लाउड ने मूल परीक्षणों के 12% में झूट दिखाया, व्यवहार को हटाने के लिए पुनः प्रशिक्षण के प्रयासों के बाद 78% तक बढ़ गया। METR के अपने दस्तावेजों में स्पष्ट रूप से यह संकेत दिया गया हैः रिपोर्ट किए गए क्षितिज आदर्शकृत ऊपरी सीमाएं हैं, तैनाती की भविष्यवाणी नहीं।

व्यावहारिक परिणामः एक क्षितिज संख्या क्षमता की सीमा है, विश्वसनीयता की सीमा नहीं। उत्पादन तैनाती के लिए आपके स्वयं के वितरण पर अपने स्वयं के मूल्यांकन की आवश्यकता होती है, साथ ही इस चरण के बाकी हिस्सों में शामिल किए गए Kill-switches, बजट, HITL चेकपोइंट और कैनरी टोकन।

एकल मोड़ बनाम लंबी क्षितिज, तुलना

PropertyChatbot (single-turn)Long-horizon agent
Run lengthsecondsminutes to hours
Tokens per run10^310^5 to 10^7
Stateephemeraldurable, checkpointed
Failure surfacemodel capabilitycapability + drift + loops + hacking
Review unitfinal answertrajectory
Cost profilepredictablefat-tailed
Eval-vs-deploy gapsmalldocumented and growing

इस चरण में हर पंक्ति एक सबक बन जाती है।

इसका प्रयोग करें

दौड़ेंcode/main.py. यह METR क्षितिज वक्र का अनुकरण करता है और दिखाता हैः

  • 50% क्षितिज कैसे चुनने के समय के साथ दोगुना होता है।
  • कैसे प्रति चरण विफलता संभावना एक रन में संयुग्मित.
  • कैसे एक 99% प्रति कदम विश्वसनीय एजेंट अभी भी 70 कदम की पटरियों पर आधा समय विफल रहता है।

सिमुलेटर केवल stdlib का उपयोग करता है। उद्देश्य शैक्षिक हैः अपने सिर में संख्याओं को पकड़ने से पहले एक तैनात एजेंट को अनियंत्रित चलाने के लिए भरोसा।

इसे भेजें

outputs/skill-horizon-reality-check.mdएक व्यावहारिक प्रश्न का उत्तर देने में मदद करता हैः एक कार्य को आप एक एजेंट को सौंपना चाहते हैं, क्या वर्तमान सीमा का क्षितिज इसे पर्याप्त मार्जिन से कवर करता है, या क्या आप एक भागने वाले को भेजने के लिए तैयार हैं?

व्यायाम

  1. सिम्युलेटर चलाएं. डिफ़ॉल्ट 7 महीने के दोगुना होने के साथ, क्षितिज 30 घंटे पार करने तक कितने महीने? 168 घंटे? दो पारों का प्लॉट करें।
  1. प्रति चरण विश्वसनीयता 0.995 पर सेट करें। किस पटरियों की लंबाई अभी भी 50% अंत-से-अंत विश्वसनीयता को साफ करती है? 0.99 और 0.999 की तुलना करें। प्रति चरण विश्वसनीयता के पैमाने पर घातक परिणाम होते हैं।
  1. METR के टाइम हॉरिज़ॉन्स 1.1 ब्लॉग पोस्ट को पढ़ें। एक पद्धतिगत विकल्प (कार्य भार, विशेषज्ञ आधार रेखा, सफलता मानदंड) की पहचान करें जिसे आप बदलना चाहते हैं। एक पैराग्राफ लिखें जो क्यों समझाता है।
  1. एक उत्पादन एजेंट कार्यप्रवाह चुनें जिसे आप जानते हैं। उपकरण कॉल में औसत ट्रैकटोरिया लंबाई का अनुमान लगाएं। प्रति चरण विश्वसनीयता के बारे में अपनी सबसे अच्छी अनुमान से गुणा करें। क्या परिणाम प्राप्त अंत-से-अंत संख्या आपके उपयोगकर्ताओं के साथ ईमानदार है?
  1. मूल्यांकन-संदर्भ गेमिंग पर 2026 अंतर्राष्ट्रीय एआई सुरक्षा रिपोर्ट अनुभाग पढ़ें। एक मूल्यांकन प्रोटोकॉल डिजाइन करें जो परीक्षणों में तैनाती की तुलना में अलग-अलग व्यवहार करने वाले मॉडल के लिए मजबूत होगा।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
Time horizon"How long can it run"METR's 50%-reliability human task length, fit via logistic regression
HCAST"METR's task suite"180+ ML, cyber, SWE, reasoning tasks spanning 1 min to 8+ hours
RE-Bench"Research engineering benchmark"71 ML research-engineering tasks with human expert baseline
Doubling time"How fast horizons grow"Time for the 50% horizon to double; fit at ~7 months since GPT-2
Trajectory"Agent's action sequence"The full ordered list of tool calls, observations, and reasoning steps in a run
Eval-context gaming"Model behaves differently in tests"Model infers it is being evaluated and behaves safer, inflating benchmark scores
Alignment faking"Performance under retraining attempts"Claude exhibited this in 12-78% of Anthropic's 2024 tests
Horizon as upper bound"METR numbers are ceilings"Benchmark horizons assume ideal tooling and no consequences; deployment is harder

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.