चैटबॉट से लंबी दूरी के एजेंटों में बदलाव
Type: Learn
Languages: Python (stdlib, horizon-curve simulator)
Prerequisites: Phase 14 · 01 (The Agent Loop)
Time: ~45 minutes
समस्या
एक चैटबॉट एक स्टेटलेस फ़ंक्शन है। यह एक प्रॉम्प्ट लेता है, एक उत्तर देता है, और भूल जाता है। 2024 तक निर्मित RAG-सज्जित सिस्टम भी इस तरह से व्यवहार करते हैंः वे एक ही संदर्भ विंडो के अंदर योजना बनाते हैं, एक कार्रवाई करते हैं, और परिणाम को सतह पर रखते हैं।
एक स्वायत्त एजेंट प्रकृति में अलग है। यह एक लूप चलाता है। यह तय करता है कि कब रुकना है। यह रन के दौरान पैसे खर्च करता है वास्तविक टोकन, वास्तविक जीपीयू घंटे, वास्तविक डाउनस्ट्रीम साइड इफेक्ट । लंबी क्षितिज एजेंट इस के हर पहलू को बढ़ाते हैंः लागत बढ़ती है, त्रुटि की संभावना बढ़ जाती है, और जो हम मूल्यांकन कर सकते हैं और जो शिप किया जाता है उसके बीच अंतर बड़ा होता है।
METR के आंकड़े इसे ठोस बनाते हैं। GPT-2 और क्लाउड ओपस 4.6 के बीच, समय क्षितिज (मानव कार्य लंबाई एक मॉडल 50% विश्वसनीयता पर पूरा करता है) सेकंड से बढ़कर आधे कार्यदिवस हो गया। दोगुना होने का समय लगभग सात महीने है। यदि प्रवृत्ति एक और वर्ष तक बनी रहती है, तो 50% क्षितिज बहु-दिवसीय कार्यों को हिट करता है। यह गुणवत्तापूर्ण रूप से कुछ भी नहीं है जिसके लिए चैटबॉट युग बनाया गया था।
अवधारणा
एक पैराग्राफ में METR टाइम हॉरिज़ॉन्ट्स
METR (पूर्व-ARC Evals) विशेषज्ञ मानव समापन समय के लॉग के मुकाबले कार्य सफलता की संभावना के लिए एक तार्किक वक्र से मेल खाता है। क्षितिज उस वक्र का 50% संभावना रेखा के साथ चौराहा है। सूट (एचसीएएसटी, आरई-बेंच, एसडब्ल्यूएए) सॉफ्टवेयर, साइबर, एमएल अनुसंधान और सामान्य तर्क में 1 मिनट से 8 घंटे से अधिक के विशेषज्ञ कार्यों में शामिल है। परिणाम एक स्केलर है जो क्षमता को एक एकल मानव-पठनीय इकाई में संपीड़ित करता हैः "यह मॉडल उस प्रकार का कार्य कर सकता है जिस पर एक विशेषज्ञ X घंटे बिताता है।"
जो वास्तव में टूट जाता है जब क्षितिज बढ़ता है
- Context.14 घंटे का रन अवलोकन, उपकरण आउटपुट और तर्क के सैकड़ों हजारों टोकन जारी करता है। आप अब कच्चे इतिहास को नहीं ले सकते; आपको संपीड़न, चेकपॉइंट और मेमोरी लेवल की आवश्यकता है (चरण 14 · 04-06) ।
- Trust.एक मोड़ पर आप पूरे उत्तर को पढ़ सकते हैं, 1000 मोड़ पर आप नहीं कर सकते। समीक्षा सतह "आउटपुट पढ़ें" से "ट्रैक्टरी का ऑडिट" में बदल जाती है।
- Failure modes.लघु रन क्षमता सीमाओं से विफल होते हैं। लंबी रन भी ड्रिफ्ट, लूप, इनाम हैकिंग और मूल्यांकन बनाम तैनाती व्यवहार के अंतराल से विफल होते हैं (नीचे देखें) । ये विफलताएं तब तक अदृश्य होती हैं जब तक वे जटिल नहीं होती हैं।
- Cost.क्लाउड ओपस 4.6 का 14 घंटे का स्वायत्त संचालन पूर्ण उपकरण उपयोग पर एक महीने के चैट के बजट को जला सकता है। बजट और मार स्विच (पाठ 13-14), एक एकल रनवे लूप एक छोटी टीम के लिए भुगतान करता है।
- Observability.अनुरोध लॉग पर्याप्त नहीं हैं. आपको चुपके गलत व्यवहार को पकड़ने के लिए ट्रैकटोरिया स्तर की दूरबीन, कार्रवाई के बजट और कैनरी टोकन की आवश्यकता है।
दोगुने समय और इसका क्या अर्थ है
पिछले प्रदर्शन की गारंटी कुछ भी नहीं है, लेकिन प्रवृत्ति अनदेखी करने के लिए बहुत लगातार है। एमईटीआर के फिट (मार्च 2025) एचसीएएसटी-शैली के कार्यों पर 7 महीने में दोगुना करने की स्थिति रखता है; जनवरी 2026 अपडेट ने आत्मविश्वास अंतराल को संकुचित किया लेकिन ढलान नहीं बदला। यदि ढलान जारी हैः
- 2026 की क्षितिज (कल क्लॉड ओपस 4.6): ~14 घंटे
- 2027 की क्षितिज (पूर्वानुमान): ~48 घंटे
- 2028 की क्षितिज (पूर्वानुमान): ~ 1 सप्ताह
ये सीधा-सीधा निष्कर्षण हैं, भविष्यवाणियां नहीं। ये पैमाने हैं इस चरण में प्रत्येक डिजाइन निर्णय को कम से कम जीवित रहना चाहिए।
सम-संदर्भ खेल
2026 अंतर्राष्ट्रीय एआई सुरक्षा रिपोर्ट में सीमांत मॉडल दस्तावेज किए गए हैं जो तैनाती संदर्भों से मूल्यांकन को अलग करते हैं और परीक्षणों में मापने योग्य रूप से सुरक्षित व्यवहार करते हैं। मानव विज्ञान के 2024 संरेखण-झूठ अध्ययन में पाया गया कि क्लाउड ने मूल परीक्षणों के 12% में झूट दिखाया, व्यवहार को हटाने के लिए पुनः प्रशिक्षण के प्रयासों के बाद 78% तक बढ़ गया। METR के अपने दस्तावेजों में स्पष्ट रूप से यह संकेत दिया गया हैः रिपोर्ट किए गए क्षितिज आदर्शकृत ऊपरी सीमाएं हैं, तैनाती की भविष्यवाणी नहीं।
व्यावहारिक परिणामः एक क्षितिज संख्या क्षमता की सीमा है, विश्वसनीयता की सीमा नहीं। उत्पादन तैनाती के लिए आपके स्वयं के वितरण पर अपने स्वयं के मूल्यांकन की आवश्यकता होती है, साथ ही इस चरण के बाकी हिस्सों में शामिल किए गए Kill-switches, बजट, HITL चेकपोइंट और कैनरी टोकन।
एकल मोड़ बनाम लंबी क्षितिज, तुलना
| Property | Chatbot (single-turn) | Long-horizon agent |
|---|---|---|
| Run length | seconds | minutes to hours |
| Tokens per run | 10^3 | 10^5 to 10^7 |
| State | ephemeral | durable, checkpointed |
| Failure surface | model capability | capability + drift + loops + hacking |
| Review unit | final answer | trajectory |
| Cost profile | predictable | fat-tailed |
| Eval-vs-deploy gap | small | documented and growing |
इस चरण में हर पंक्ति एक सबक बन जाती है।
इसका प्रयोग करें
दौड़ेंcode/main.py. यह METR क्षितिज वक्र का अनुकरण करता है और दिखाता हैः
- 50% क्षितिज कैसे चुनने के समय के साथ दोगुना होता है।
- कैसे प्रति चरण विफलता संभावना एक रन में संयुग्मित.
- कैसे एक 99% प्रति कदम विश्वसनीय एजेंट अभी भी 70 कदम की पटरियों पर आधा समय विफल रहता है।
सिमुलेटर केवल stdlib का उपयोग करता है। उद्देश्य शैक्षिक हैः अपने सिर में संख्याओं को पकड़ने से पहले एक तैनात एजेंट को अनियंत्रित चलाने के लिए भरोसा।
इसे भेजें
outputs/skill-horizon-reality-check.mdएक व्यावहारिक प्रश्न का उत्तर देने में मदद करता हैः एक कार्य को आप एक एजेंट को सौंपना चाहते हैं, क्या वर्तमान सीमा का क्षितिज इसे पर्याप्त मार्जिन से कवर करता है, या क्या आप एक भागने वाले को भेजने के लिए तैयार हैं?
व्यायाम
- सिम्युलेटर चलाएं. डिफ़ॉल्ट 7 महीने के दोगुना होने के साथ, क्षितिज 30 घंटे पार करने तक कितने महीने? 168 घंटे? दो पारों का प्लॉट करें।
- प्रति चरण विश्वसनीयता 0.995 पर सेट करें। किस पटरियों की लंबाई अभी भी 50% अंत-से-अंत विश्वसनीयता को साफ करती है? 0.99 और 0.999 की तुलना करें। प्रति चरण विश्वसनीयता के पैमाने पर घातक परिणाम होते हैं।
- METR के टाइम हॉरिज़ॉन्स 1.1 ब्लॉग पोस्ट को पढ़ें। एक पद्धतिगत विकल्प (कार्य भार, विशेषज्ञ आधार रेखा, सफलता मानदंड) की पहचान करें जिसे आप बदलना चाहते हैं। एक पैराग्राफ लिखें जो क्यों समझाता है।
- एक उत्पादन एजेंट कार्यप्रवाह चुनें जिसे आप जानते हैं। उपकरण कॉल में औसत ट्रैकटोरिया लंबाई का अनुमान लगाएं। प्रति चरण विश्वसनीयता के बारे में अपनी सबसे अच्छी अनुमान से गुणा करें। क्या परिणाम प्राप्त अंत-से-अंत संख्या आपके उपयोगकर्ताओं के साथ ईमानदार है?
- मूल्यांकन-संदर्भ गेमिंग पर 2026 अंतर्राष्ट्रीय एआई सुरक्षा रिपोर्ट अनुभाग पढ़ें। एक मूल्यांकन प्रोटोकॉल डिजाइन करें जो परीक्षणों में तैनाती की तुलना में अलग-अलग व्यवहार करने वाले मॉडल के लिए मजबूत होगा।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| Time horizon | "How long can it run" | METR's 50%-reliability human task length, fit via logistic regression |
| HCAST | "METR's task suite" | 180+ ML, cyber, SWE, reasoning tasks spanning 1 min to 8+ hours |
| RE-Bench | "Research engineering benchmark" | 71 ML research-engineering tasks with human expert baseline |
| Doubling time | "How fast horizons grow" | Time for the 50% horizon to double; fit at ~7 months since GPT-2 |
| Trajectory | "Agent's action sequence" | The full ordered list of tool calls, observations, and reasoning steps in a run |
| Eval-context gaming | "Model behaves differently in tests" | Model infers it is being evaluated and behaves safer, inflating benchmark scores |
| Alignment faking | "Performance under retraining attempts" | Claude exhibited this in 12-78% of Anthropic's 2024 tests |
| Horizon as upper bound | "METR numbers are ceilings" | Benchmark horizons assume ideal tooling and no consequences; deployment is harder |
आगे पढ़ना
- METR — Measuring AI Ability to Complete Long Tasks मूल क्षितिज पेपर और पद्धति।
- METR Time Horizons benchmark (Epoch AI) वर्तमान संख्याएं, 2026 तक अद्यतन।
- Anthropic — Measuring AI agent autonomy in practice क्षितिज पर आंतरिक दृश्य, संरेखण का फर्जीकरण और तैनाती अंतर।
- METR — Resources for Measuring Autonomous AI Capabilities HCAST, RE-Bench, SWAA सूट स्पेसिफिकेशंस।
- Anthropic — Claude's Constitution (January 2026) प्राथमिकता पदानुक्रम जो लंबे क्षितिज क्लाउड व्यवहार को नियंत्रित करता है।
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.