Phase 15: Autonomous Systems

METR समय क्षितिज और बाहरी क्षमता मूल्यांकन

METR (पूर्व-ARC Evals) दिसंबर 2023 से एक स्वतंत्र 501(c)(3) है। उनका टाइम हॉरिज़ॉन्स 1.1 बेंचमार्क (जनवरी 2026) कार्य सफलता की संभावना बनाम विशेषज्ञ मानव पूरा समय के लिए एक तार्किक वक्र से मेल खाता है; 50% संभावना पर चौराहे मॉडल के समय क्षितिज को परिभाषित करता है। 20252026 एंगेजमेंट सेट में GPT-5.1, GPT-5.1-कोडेक्स-मैक्स और प्रोटोटाइप निगरानी मूल्यांकन शामिल हैं (एक मॉनिटर पकड़ साइड टास्क कर सकता है; एजेंट से बच सकता है) । बेंचमार्क सूटः HCAST (180+ ML, साइबर, SWE, तर्क कार्य; 1 मिनट से 8+ घंटे), RE-Bench (71 ML अनुसंधान-इंजीनियरिंग कार्य विशेषज्ञ आधार रेखा के साथ), SWAA। ईमानदार नोटः METR माप आदर्श हैं कोई मानव, कोई वास्तविक परिणाम और टीम ने मूल्यांकन बनाम तैनाती व्यवहार अंतर का दस्तावेजीकरण किया है (पाठ 1) । समय क्षितिज एक ऊपरी सीमा है, तैनाती की भविष्यवाणी नहीं।

Type: Learn

Languages: Python (stdlib, logistic-fit horizon estimator)

Prerequisites: Phase 15 · 01 (Long-horizon agents), Phase 15 · 19 (RSP)

Time: ~60 minutes

समस्या

स्केलिंग नीतियां (पाठ 19, 20) केवल उन मापों के रूप में उपयोगी हैं जिनका वे संदर्भित करते हैं। "एआई आर एंड डी-4 सीमा" और "लंबे दूरी की स्वायत्तता" नीति प्रोज में परिभाषित की जाती हैं; वे केवल तभी लागू हो जाती हैं जब विशिष्ट मूल्यांकन विशिष्ट संख्याएं उत्पन्न करते हैं।

METR 20242026 बाहरी मूल्यांकन संगठन है जिसने उन संख्याओं में से कई को परिभाषित किया है। वे सीमा मॉडल का मूल्यांकन करते हैं अक्सर पूर्व-रिलीज़, प्रयोगशालाओं के साथ एनडीए के तहत और बाद में पद्धति प्रकाशित करते हैं। टाइम हॉरिज़ॉन्स 1.1 बेंचमार्क (जनवरी 2026) उनका मुख्य कलाकृत्यः एक एकल स्केलर जो क्षमता को मानव-पठनीय इकाई में संपीड़ित करता है ("यह मॉडल उस प्रकार का कार्य कर सकता है जिस पर एक विशेषज्ञ 50% विश्वसनीयता के साथ X घंटे बिताता है") ।

पाठ आंशिक रूप से पद्धति (एक क्षितिज की गणना कैसे की जाती है) और आंशिक रूप से व्याख्या (क्यों एक क्षितिज एक ऊपरी सीमा है, न कि एक तैनाती भविष्यवाणी) के बारे में है। दोनों कौशल एक साथ आते हैं। एक टीम जो समझती है कि क्षितिज कैसे फिट है, एक स्लाइड पर "14 घंटे" देखने की तुलना में एक टीम के साथ एक खराब विक्रेता दावे से धोखा देना बहुत मुश्किल है।

अवधारणा

METR पृष्ठभूमि

  • स्थापनाः दिसंबर 2023 (पूर्व-ARC Evals, स्वतंत्र 501 ((c) ((3)) में विभाजित) ।
  • दायराः सीमा मॉडल की स्वायत्त क्षमताओं का मूल्यांकन, अक्सर पूर्व-प्रकाशन।
  • भागीदार प्रयोगशालाएं: मानव विज्ञान, ओपनएआई (कई प्रतिबद्धताएं 20252026) ।
  • उल्लेखनीय परिणामः टाइम हॉरिज़ोन 1.0 (मार्च 2025), टाइम हॉरिज़ोन 1.1 (जनवरी 2026), प्रोटोटाइप निगरानी मूल्यांकन।

समय क्षितिज फिट

पद्धति (METR ब्लॉग और पत्रों से):

  1. मिनट-स्केल से लेकर घंटे-स्केल विशेषज्ञ पूर्णता समय तक एक कार्य सूट एकत्र करें। वर्तमान सूटः HCAST (180+ कार्य), RE-Bench (71 कार्य), SWAA।
  2. प्रत्येक कार्य पर मॉडल चलाएँ; सफलता या विफलता रिकॉर्ड करें।
  3. लॉजिस्टिक वक्र को फिट करें: log (विशेषज्ञ) पूरा होने के समय के फ़ंक्शन के रूप में P (सफलता) ।
  4. क्षितिज विशेषज्ञ समय है जिसमें P (सफलता) = 0.5 है।

लॉजिस्टिक फिट आकार सही है क्योंकि क्षमता में सामान्य रूप से कार्य कठिनाई के साथ एक बढ़ता, पठार-अवसर का संबंध होता है। 50% बिंदु एक विकल्प है (यह 10%, 90% हो सकता है); METR विस्तृत पेपर में कई सीमाओं की रिपोर्ट करता है लेकिन 50% के साथ अग्रणी है क्योंकि यह सबसे सहज है।

जनवरी 2026 के आंकड़े

समय क्षितिज 1.1:

  • क्लाउड ओपस 4.6: ~14 घंटे 50% विश्वसनीयता पर, टाइम हॉरिज़ोन 1.1 (जनवरी 2026) के अनुसार।
  • एचसीएएसटी-शैली के कार्यों पर दोगुना समयः ~4.3 महीने (130.8 दिन) समय क्षितिज 1.1 (जनवरी 2026) द्वारा रिपोर्ट किए गए 2023 के बाद फिट पर; ~7 महीने का आंकड़ा समय क्षितिज 1.0 से पूर्ण 20192025 फिट है और इसे 2023 के बाद के नंबर के साथ TH1.1 में रिपोर्ट किया गया है।

ये विशिष्ट संख्याएं हैं जो फेज 15 संदर्भों के बाकी भाग में हैं। उन्हें एंट्रोपिक के आरएसपी v3.0 (पाठ 19) और डीपमाइंड के एफएसएफ v3 (पाठ 20) में सीमा मूल्यांकन को फ़ीड करने वाले मापों में से एक के रूप में उद्धृत किया गया है।

बेंचमार्क सुइट्स

  • HCAST: 189 कार्य एमएल, साइबर सुरक्षा, सॉफ्टवेयर इंजीनियरिंग और सामान्य तर्क में। अवधिः 1 मिनट से 8 घंटे से अधिक विशेषज्ञ समय। मुख्य सूट क्षितिज संख्या के पीछे।
  • RE-Bench: 71 एमएल अनुसंधान-उद्योगिकी कार्य मानव विशेषज्ञ आधार रेखा के साथ। यह मापता है कि क्या मॉडल एमएल अनुसंधान एवं विकास कार्य का प्रकार कर सकता है जो एआई आर एंड डी-4 सीमा में भोजन करता है।
  • SWAA: कम कार्य; क्षितिज वक्र के निचले छोर को मापने के लिए उपयोगी।

प्रोटोटाइप निगरानी मूल्यांकन

20252026 METR कार्य में निगरानी-मूल्यांकन प्रोटोटाइप शामिल थेः क्या एक मॉनिटर एक साइड टास्क (ऑपरेटर द्वारा अनुरोध किए गए से कुछ अलग) को करने वाले मॉडल को पकड़ सकता है; क्या एजेंट मॉनिटर से बच सकता है। ये सीधे OpenAI PF v2 में "अंडरमाइनिंग सुरक्षा उपायों" श्रेणी और डीपमाइंड FSF v3 (पाठ 20) में धोखाधड़ी-अनुरेखण निगरानी को खिलाते हैं।

क्षितिज ऊपरी सीमाएँ क्यों हैं

  • Idealized toolingउदाहरण के लिए, उदाहरण के लिए, एक मॉडल के लिए एक विशिष्ट मॉडल है।
  • No real consequences: मॉडल वास्तव में कभी भी ग्राहक का बिल नहीं करता है, वास्तविक डेटा को हटाता है, या वास्तविक लोगों से संपर्क नहीं करता है। वास्तविक तैनाती में अपरिवर्तनीय दांव होते हैं।
  • Eval-context gamingपाठ 1: परीक्षणों में मॉडल अलग-अलग व्यवहार करते हैं। 2026 अंतर्राष्ट्रीय एआई सुरक्षा रिपोर्ट इसका अनुभवजन्य रूप से दस्तावेज करती है।
  • No legitimate user varianceवास्तविक उपयोगकर्ता अस्पष्ट, संदर्भ-निर्भर अनुरोध उत्पन्न करते हैं।

क्षितिज अनुकूल परिस्थितियों में क्षमता की सीमा है। तैनाती विश्वसनीयता एक अलग संख्या है, कम है, और टीमों को इसे जानने के लिए अपने स्वयं के वितरण को मापना होगा।

बाहरी मूल्यांकनकर्ता मामला

बाहरी मूल्यांकन महत्वपूर्ण है क्योंकि आंतरिक प्रयोगशालाओं में वे रिपोर्टिंग मीट्रिक को अनुकूलित करने के लिए प्रोत्साहन हैं। METR की स्वतंत्रता एक 501 ((c) (3) एक घोषित पद्धति और सहकर्मी-परीक्षण किए गए पत्रों के साथ संरचनात्मक कम करने के लिए है। यह अकेले पर्याप्त नहीं है (लैब अभी भी नियंत्रित करते हैं कि METR क्या देखता है), लेकिन यह किसी भी बाहरी मूल्यांकन से सख्ती से बेहतर है।

क्षितिज संख्याओं का प्रयोग कैसे करें

  • As a capability filter: यदि किसी मॉडल का क्षितिज प्रस्तावित कार्य के विशेषज्ञ समय से बहुत नीचे है, तो इसे स्वायत्त रूप से भेजें (लेसन 1 कौशल फ़ाइल) ।
  • As a trend indicator: दोगुना होने का समय आपको बताता है कि नए उपायों के बिना भी मौजूदा अभ्यास कितने समय तक सुरक्षित रहेगा।
  • As a priorअपने कार्य वितरण, अपने उपकरण की गुणवत्ता और अपने तैनाती के संदर्भ के लिए समायोजित करें।

इसका प्रयोग करें

code/main.pyयह एक सिंथेटिक परिणाम सेट को देखते हुए कार्य-सफलता बनाम लॉगएक्सपर्ट समय के एक तार्किक फिट को लागू करता है। यह 50% क्षितिज (METR का शीर्षक), 10% क्षितिज (रक्षावादी) और 90% क्षितिज (उन्नतवादी) की रिपोर्ट करता है। यह यह भी दिखाता है कि सफलता दर का कृत्रिम रूप से मूल्यांकन-संदर्भ गेमिंग द्वारा बढ़ जाता है।

इसे भेजें

outputs/skill-horizon-interpretation.mdएक विक्रेता के क्षितिज दावे की समीक्षा करता है और बेंचमार्क दावे और तैनाती वास्तविकता के बीच अंतर विश्लेषण करता है।

व्यायाम

  1. दौड़ेंcode/main.py. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
  1. METR के टाइम हॉरिज़ोन 1.1 ब्लॉग पोस्ट को पढ़ें। विशिष्ट कार्यों की पहचान करें जहां विश्वसनीयता सबसे अधिक है और जहां यह सबसे कम है। अंतर क्यों मौजूद है, समझाएं।
  1. METR के "स्वचालित एआई क्षमताओं को मापने" संसाधनों को पढ़ें। HCAST कार्य श्रेणियों की सूची बनाएं। एक श्रेणी चुनें जिसे आप उत्पादन कार्य के लिए अधिक वजन देंगे और इसका कारण बताएं।
  1. सिम्युलेटर में मूल्यांकन-संदर्भ गेमिंग पेश करेंः असफल कार्यों के ~20% को सफलता के लिए फ्लिप करें। नए क्षितिज की रिपोर्ट करें। यह अनुमानित है कि 20% की गेमिंग दर देखी गई संख्या के साथ क्या करती है।
  1. अपने स्वयं के बग बैकलॉग या प्रतिनिधि कार्य सेट पर आंतरिक क्षितिज मूल्यांकन डिजाइन करें। डेटा संग्रह, फिट और आउटपुट आपको क्या बताता है, इसका वर्णन करें। METR संख्याओं की तुलना करें।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
METR"External evaluator"ex-ARC Evals; independent 501(c)(3) since Dec 2023
Time Horizon"Capability measure"Expert task length at 50% reliability, from logistic fit
HCAST"METR's main suite"180+ tasks spanning 1 min to 8+ hours
RE-Bench"Research engineering"71 ML research-engineering tasks with human baseline
SWAA"Short-task suite"Calibrates the low end of the horizon curve
Doubling time"Growth rate"Time for the 50% horizon to double; ~7 months per HCAST
Eval-context gaming"Model behaves differently"Documented behavior gap between tests and deployment
Upper bound"Horizon is a ceiling"Benchmark horizon > deployment reliability under load

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.