METR समय क्षितिज और बाहरी क्षमता मूल्यांकन
Type: Learn
Languages: Python (stdlib, logistic-fit horizon estimator)
Prerequisites: Phase 15 · 01 (Long-horizon agents), Phase 15 · 19 (RSP)
Time: ~60 minutes
समस्या
स्केलिंग नीतियां (पाठ 19, 20) केवल उन मापों के रूप में उपयोगी हैं जिनका वे संदर्भित करते हैं। "एआई आर एंड डी-4 सीमा" और "लंबे दूरी की स्वायत्तता" नीति प्रोज में परिभाषित की जाती हैं; वे केवल तभी लागू हो जाती हैं जब विशिष्ट मूल्यांकन विशिष्ट संख्याएं उत्पन्न करते हैं।
METR 20242026 बाहरी मूल्यांकन संगठन है जिसने उन संख्याओं में से कई को परिभाषित किया है। वे सीमा मॉडल का मूल्यांकन करते हैं अक्सर पूर्व-रिलीज़, प्रयोगशालाओं के साथ एनडीए के तहत और बाद में पद्धति प्रकाशित करते हैं। टाइम हॉरिज़ॉन्स 1.1 बेंचमार्क (जनवरी 2026) उनका मुख्य कलाकृत्यः एक एकल स्केलर जो क्षमता को मानव-पठनीय इकाई में संपीड़ित करता है ("यह मॉडल उस प्रकार का कार्य कर सकता है जिस पर एक विशेषज्ञ 50% विश्वसनीयता के साथ X घंटे बिताता है") ।
पाठ आंशिक रूप से पद्धति (एक क्षितिज की गणना कैसे की जाती है) और आंशिक रूप से व्याख्या (क्यों एक क्षितिज एक ऊपरी सीमा है, न कि एक तैनाती भविष्यवाणी) के बारे में है। दोनों कौशल एक साथ आते हैं। एक टीम जो समझती है कि क्षितिज कैसे फिट है, एक स्लाइड पर "14 घंटे" देखने की तुलना में एक टीम के साथ एक खराब विक्रेता दावे से धोखा देना बहुत मुश्किल है।
अवधारणा
METR पृष्ठभूमि
- स्थापनाः दिसंबर 2023 (पूर्व-ARC Evals, स्वतंत्र 501 ((c) ((3)) में विभाजित) ।
- दायराः सीमा मॉडल की स्वायत्त क्षमताओं का मूल्यांकन, अक्सर पूर्व-प्रकाशन।
- भागीदार प्रयोगशालाएं: मानव विज्ञान, ओपनएआई (कई प्रतिबद्धताएं 20252026) ।
- उल्लेखनीय परिणामः टाइम हॉरिज़ोन 1.0 (मार्च 2025), टाइम हॉरिज़ोन 1.1 (जनवरी 2026), प्रोटोटाइप निगरानी मूल्यांकन।
समय क्षितिज फिट
पद्धति (METR ब्लॉग और पत्रों से):
- मिनट-स्केल से लेकर घंटे-स्केल विशेषज्ञ पूर्णता समय तक एक कार्य सूट एकत्र करें। वर्तमान सूटः HCAST (180+ कार्य), RE-Bench (71 कार्य), SWAA।
- प्रत्येक कार्य पर मॉडल चलाएँ; सफलता या विफलता रिकॉर्ड करें।
- लॉजिस्टिक वक्र को फिट करें: log (विशेषज्ञ) पूरा होने के समय के फ़ंक्शन के रूप में P (सफलता) ।
- क्षितिज विशेषज्ञ समय है जिसमें P (सफलता) = 0.5 है।
लॉजिस्टिक फिट आकार सही है क्योंकि क्षमता में सामान्य रूप से कार्य कठिनाई के साथ एक बढ़ता, पठार-अवसर का संबंध होता है। 50% बिंदु एक विकल्प है (यह 10%, 90% हो सकता है); METR विस्तृत पेपर में कई सीमाओं की रिपोर्ट करता है लेकिन 50% के साथ अग्रणी है क्योंकि यह सबसे सहज है।
जनवरी 2026 के आंकड़े
समय क्षितिज 1.1:
- क्लाउड ओपस 4.6: ~14 घंटे 50% विश्वसनीयता पर, टाइम हॉरिज़ोन 1.1 (जनवरी 2026) के अनुसार।
- एचसीएएसटी-शैली के कार्यों पर दोगुना समयः ~4.3 महीने (130.8 दिन) समय क्षितिज 1.1 (जनवरी 2026) द्वारा रिपोर्ट किए गए 2023 के बाद फिट पर; ~7 महीने का आंकड़ा समय क्षितिज 1.0 से पूर्ण 20192025 फिट है और इसे 2023 के बाद के नंबर के साथ TH1.1 में रिपोर्ट किया गया है।
ये विशिष्ट संख्याएं हैं जो फेज 15 संदर्भों के बाकी भाग में हैं। उन्हें एंट्रोपिक के आरएसपी v3.0 (पाठ 19) और डीपमाइंड के एफएसएफ v3 (पाठ 20) में सीमा मूल्यांकन को फ़ीड करने वाले मापों में से एक के रूप में उद्धृत किया गया है।
बेंचमार्क सुइट्स
- HCAST: 189 कार्य एमएल, साइबर सुरक्षा, सॉफ्टवेयर इंजीनियरिंग और सामान्य तर्क में। अवधिः 1 मिनट से 8 घंटे से अधिक विशेषज्ञ समय। मुख्य सूट क्षितिज संख्या के पीछे।
- RE-Bench: 71 एमएल अनुसंधान-उद्योगिकी कार्य मानव विशेषज्ञ आधार रेखा के साथ। यह मापता है कि क्या मॉडल एमएल अनुसंधान एवं विकास कार्य का प्रकार कर सकता है जो एआई आर एंड डी-4 सीमा में भोजन करता है।
- SWAA: कम कार्य; क्षितिज वक्र के निचले छोर को मापने के लिए उपयोगी।
प्रोटोटाइप निगरानी मूल्यांकन
20252026 METR कार्य में निगरानी-मूल्यांकन प्रोटोटाइप शामिल थेः क्या एक मॉनिटर एक साइड टास्क (ऑपरेटर द्वारा अनुरोध किए गए से कुछ अलग) को करने वाले मॉडल को पकड़ सकता है; क्या एजेंट मॉनिटर से बच सकता है। ये सीधे OpenAI PF v2 में "अंडरमाइनिंग सुरक्षा उपायों" श्रेणी और डीपमाइंड FSF v3 (पाठ 20) में धोखाधड़ी-अनुरेखण निगरानी को खिलाते हैं।
क्षितिज ऊपरी सीमाएँ क्यों हैं
- Idealized toolingउदाहरण के लिए, उदाहरण के लिए, एक मॉडल के लिए एक विशिष्ट मॉडल है।
- No real consequences: मॉडल वास्तव में कभी भी ग्राहक का बिल नहीं करता है, वास्तविक डेटा को हटाता है, या वास्तविक लोगों से संपर्क नहीं करता है। वास्तविक तैनाती में अपरिवर्तनीय दांव होते हैं।
- Eval-context gamingपाठ 1: परीक्षणों में मॉडल अलग-अलग व्यवहार करते हैं। 2026 अंतर्राष्ट्रीय एआई सुरक्षा रिपोर्ट इसका अनुभवजन्य रूप से दस्तावेज करती है।
- No legitimate user varianceवास्तविक उपयोगकर्ता अस्पष्ट, संदर्भ-निर्भर अनुरोध उत्पन्न करते हैं।
क्षितिज अनुकूल परिस्थितियों में क्षमता की सीमा है। तैनाती विश्वसनीयता एक अलग संख्या है, कम है, और टीमों को इसे जानने के लिए अपने स्वयं के वितरण को मापना होगा।
बाहरी मूल्यांकनकर्ता मामला
बाहरी मूल्यांकन महत्वपूर्ण है क्योंकि आंतरिक प्रयोगशालाओं में वे रिपोर्टिंग मीट्रिक को अनुकूलित करने के लिए प्रोत्साहन हैं। METR की स्वतंत्रता एक 501 ((c) (3) एक घोषित पद्धति और सहकर्मी-परीक्षण किए गए पत्रों के साथ संरचनात्मक कम करने के लिए है। यह अकेले पर्याप्त नहीं है (लैब अभी भी नियंत्रित करते हैं कि METR क्या देखता है), लेकिन यह किसी भी बाहरी मूल्यांकन से सख्ती से बेहतर है।
क्षितिज संख्याओं का प्रयोग कैसे करें
- As a capability filter: यदि किसी मॉडल का क्षितिज प्रस्तावित कार्य के विशेषज्ञ समय से बहुत नीचे है, तो इसे स्वायत्त रूप से भेजें (लेसन 1 कौशल फ़ाइल) ।
- As a trend indicator: दोगुना होने का समय आपको बताता है कि नए उपायों के बिना भी मौजूदा अभ्यास कितने समय तक सुरक्षित रहेगा।
- As a priorअपने कार्य वितरण, अपने उपकरण की गुणवत्ता और अपने तैनाती के संदर्भ के लिए समायोजित करें।
इसका प्रयोग करें
code/main.pyयह एक सिंथेटिक परिणाम सेट को देखते हुए कार्य-सफलता बनाम लॉगएक्सपर्ट समय के एक तार्किक फिट को लागू करता है। यह 50% क्षितिज (METR का शीर्षक), 10% क्षितिज (रक्षावादी) और 90% क्षितिज (उन्नतवादी) की रिपोर्ट करता है। यह यह भी दिखाता है कि सफलता दर का कृत्रिम रूप से मूल्यांकन-संदर्भ गेमिंग द्वारा बढ़ जाता है।
इसे भेजें
outputs/skill-horizon-interpretation.mdएक विक्रेता के क्षितिज दावे की समीक्षा करता है और बेंचमार्क दावे और तैनाती वास्तविकता के बीच अंतर विश्लेषण करता है।
व्यायाम
- दौड़ें
code/main.py. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
- METR के टाइम हॉरिज़ोन 1.1 ब्लॉग पोस्ट को पढ़ें। विशिष्ट कार्यों की पहचान करें जहां विश्वसनीयता सबसे अधिक है और जहां यह सबसे कम है। अंतर क्यों मौजूद है, समझाएं।
- METR के "स्वचालित एआई क्षमताओं को मापने" संसाधनों को पढ़ें। HCAST कार्य श्रेणियों की सूची बनाएं। एक श्रेणी चुनें जिसे आप उत्पादन कार्य के लिए अधिक वजन देंगे और इसका कारण बताएं।
- सिम्युलेटर में मूल्यांकन-संदर्भ गेमिंग पेश करेंः असफल कार्यों के ~20% को सफलता के लिए फ्लिप करें। नए क्षितिज की रिपोर्ट करें। यह अनुमानित है कि 20% की गेमिंग दर देखी गई संख्या के साथ क्या करती है।
- अपने स्वयं के बग बैकलॉग या प्रतिनिधि कार्य सेट पर आंतरिक क्षितिज मूल्यांकन डिजाइन करें। डेटा संग्रह, फिट और आउटपुट आपको क्या बताता है, इसका वर्णन करें। METR संख्याओं की तुलना करें।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| METR | "External evaluator" | ex-ARC Evals; independent 501(c)(3) since Dec 2023 |
| Time Horizon | "Capability measure" | Expert task length at 50% reliability, from logistic fit |
| HCAST | "METR's main suite" | 180+ tasks spanning 1 min to 8+ hours |
| RE-Bench | "Research engineering" | 71 ML research-engineering tasks with human baseline |
| SWAA | "Short-task suite" | Calibrates the low end of the horizon curve |
| Doubling time | "Growth rate" | Time for the 50% horizon to double; ~7 months per HCAST |
| Eval-context gaming | "Model behaves differently" | Documented behavior gap between tests and deployment |
| Upper bound | "Horizon is a ceiling" | Benchmark horizon > deployment reliability under load |
आगे पढ़ना
- METR — Resources for Measuring Autonomous AI Capabilities HCAST, RE-Bench, SWAA विनिर्देश।
- METR — Measuring AI Ability to Complete Long Tasks मूल क्षितिज कागज।
- METR — Time Horizon 1.1 (January 2026) वर्तमान संख्या और पद्धति।
- Epoch AI — METR Time Horizons benchmark लाइव ट्रैकिंग।
- Anthropic — Measuring agent autonomy in practice METR के मापों पर आंतरिक दृष्टिकोण।
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.