افق زمانی METR و ارزیابی قابلیت های خارجی
Type: Learn
Languages: Python (stdlib, logistic-fit horizon estimator)
Prerequisites: Phase 15 · 01 (Long-horizon agents), Phase 15 · 19 (RSP)
Time: ~60 minutes
مشکل
سیاست های مقیاس بندی (درسه های ۱۹، ۲۰) تنها به اندازه اندازه گیری هایی که به آن اشاره می کنند مفید هستند. "حده ی R&D-4 هوش مصنوعی" و "آتونومی درازمدت" در نثر سیاست تعریف شده است؛ آنها تنها زمانی عملی می شوند که ارزیابی های خاص اعداد خاص تولید کنند.
METR سازمان ارزیابی خارجی 20242026 است که بسیاری از این اعداد را تعریف کرده است. آنها مدل های مرزی را ارزیابی می کنند اغلب پیش از انتشار، تحت NDA با آزمایشگاه و بعد از آن روش را منتشر می کنند. معیار Time Horizon 1.1 (جنوری 2026) ، آرتیفکت اصلی آنها است: یک مقیاس واحد که توانایی را به یک واحد قابل خواندن انسان فشرده می کند ("این مدل می تواند نوع کاری را انجام دهد که یک متخصص ساعت X را با قابلیت اطمینان 50٪ صرف می کند").
درسی بخشی در مورد روش (چگونه افق محاسبه می شود) و بخشی در مورد تفسیر (چرا افق یک مرز بالا است، نه یک پیش بینی انتشار). این دو مهارت به هم تعلق دارند. یک تیم که درک می کند افق چگونه مناسب است، با ادعای فروشنده بد بسیار سخت تر از یک تیم که فقط "14 ساعت" را در یک اسلاید می بیند، فریب می دهد.
مفهوم
پس زمینه METR
- تاسیس: دسامبر 2023 (سابق Evals، به 501 ((c) ((3)) مستقل تقسیم شد).
- دامنه: ارزیابی قابلیت های مستقل مدل های مرزی، اغلب پیش از انتشار.
- آزمایشگاه های شریک: انسان شناسی، OpenAI (مختلف های متعدد 20252026).
- نتایج قابل توجه: مهتاب زمانی 1.0 (مارس 2025) ، مهتاب زمانی 1.1 ( ژانویه 2026) ، ارزیابی های نظارت بر نمونه.
فیت زمان افق
روش (از وبلاگ و مقاله های METR):
- مجموعه ای از وظایف را جمع آوری کنید که از زمان تکمیل دقیق تا ساعت است. مجموعه های فعلی: HCAST (180+ کار) ، RE-Bench (71 کار) ، SWAA.
- مدل را در هر کار اجرا کنید؛ موفقیت یا شکست را ثبت کنید.
- یک منحنی لوژیستیک را تنظیم کنید: P(نجاح) به عنوان تابع زمان تکمیل log(مختبر).
- افق زمانی است که P (نجاح) = 0.5
شکل مناسب لجستیک مناسب است زیرا توانایی به طور کلی رابطه فزاینده ای با مشکل کار را به سطح بالا نزدیک می کند. نقطه 50٪ یک انتخاب است (می تواند 10٪ ، 90٪ باشد) ؛ METR در مقاله مفصل چندین حد را گزارش می دهد اما با 50٪ پیش می رود زیرا آن را به طور ساده ترین است.
اعداد ژانویه 2026
بر اساس افق زمانی 1.1:
- کلاود اپوس 4.6: ~ 14 ساعت با قابلیت اطمینان 50٪، از زمان افق 1.1 (جنوری 2026).
- زمان دو برابر کردن در وظایف سبک HCAST: ~ 4.3 ماه (130.8 روز) در تناسب پس از 2023 گزارش شده توسط Time Horizon 1.1 (جنوری 2026)؛ رقم ~ 7 ماه تناسب کامل 20192025 از Time Horizon 1.0 است و در TH1.1 همراه با شماره پس از 2023 گزارش شده است.
این اعداد خاص باقی مرجع های مرحله 15 هستند. آنها در RSP v3.0 (درسی 19) و FSF v3 (درسی 20) DeepMind به عنوان یکی از اندازه گیری های تغذیه ارزیابی آستانه ذکر شده اند.
سوئیت های مرجع
- HCAST: 189 وظیفه در زمینه ML، امنیت سایبری، مهندسی نرم افزار و استدلال عمومی. مدت: 1 دقیقه تا 8 ساعت بیشتر از زمان متخصص. مجموعه اصلی پشت تعداد افق.
- RE-Bench: 71 ML وظایف تحقیقاتی و مهندسی با یک پایه متخصص انسانی. اندازه گیری می کند که آیا مدل می تواند نوع کار تحقیق و توسعه ML را انجام دهد که به حد R&D-4 هوش مصنوعی تغذیه می کند.
- SWAA: وظایف کوتاه تر؛ برای کالیبر کردن پایان پایین منحنی افق مفید است.
ارزیابی های نظارت بر نمونه اولیه
20252026 کار METR شامل نمونه های اولیه نظارت و ارزیابی بود: آیا یک مانیتور می تواند یک مدل را که یک کار جانبی انجام می دهد (آنچه غیر از آنچه که اپراتور از آن خواسته است) بگیرد؛ آیا عامل می تواند از مانیتور فرار کند. این موارد مستقیماً به دسته "حمایه های زیربنایی" در OpenAI PF v2 و نظارت بر تعاونی فریبنده در DeepMind FSF v3 (درسی 20) تغذیه می کنند.
چرا افق ها مرز بالایی هستند
- Idealized tooling: وظایف مرجع به مدل ابزار پاک و داده های فرمت شده می دهند.
- No real consequences: مدل هرگز واقعا یک مشتری را صورتحساب نمی کند، داده های واقعی را حذف نمی کند یا با افراد واقعی تماس می گیرد.
- Eval-context gamingدرس ۱: مدل ها در آزمایش ها متفاوت رفتار می کنند. گزارش بین المللی ایمنی هوش مصنوعی 2026 این را تجربی مستند می کند.
- No legitimate user variance: پیام های مرجع بندی ساختار یافته است. کاربران واقعی درخواست های مبهم و وابسته به زمینه را تولید می کنند.
افق، سقف توانایی در شرایط مطلوب است. قابلیت اطمینان در راه اندازی یک عدد متفاوت است، پایین تر است و تیم ها باید توزیع خود را اندازه گیری کنند تا آن را بدانند.
پرونده ارزیابی کننده خارجی
ارزیابی خارجی مهم است زیرا آزمایشگاه های داخلی انگیزه ای برای بهینه سازی متریک هایی دارند که گزارش می دهند. استقلال METR یک 501 ((c) 3) با یک روش اعلام شده و مقالات بررسی شده توسط همتایان کاهش ساختاری است. این به تنهایی کافی نیست (مایشگاه ها هنوز کنترل می کنند که METR چه می بیند) ، اما کاملا بهتر از هیچ ارزیابی خارجی است.
چگونه از اعداد افق در عمل استفاده کنیم
- As a capability filter: اگر افق یک مدل بسیار پایین تر از زمان تخصصی یک کار پیشنهادی باشد، آن را به صورت مستقل ارسال نکنید (فایل مهارت های Lesson 1).
- As a trend indicator: زمان دو برابر کردن به شما می گوید که عمل فعلی حتی بدون کاهش های جدید تا چه مدت ایمن خواهد ماند.
- As a priorیک افق ۱۴ ساعته نقطه شروع است. برای توزیع وظایف، کیفیت ابزار و زمینه های پیاده سازی خود تنظیم کنید.
ازش استفاده کن
code/main.pyاین برنامه یک تطبیق لوژیستی از موفقیت وظیفه در مقابل زمان متخصص را اجرا می کند ، با توجه به مجموعه نتایج مصنوعی. این گزارش 50٪ افق (سرنامه METR) ، 10٪ افق (حافظی) و 90٪ افق (امیدوار) را گزارش می دهد. همچنین نشان می دهد که چه تغییری در هنگام افزایش نرخ موفقیت توسط بازی های ارزیابی-مناظر ایجاد می شود.
-باده
outputs/skill-horizon-interpretation.mdبررسی ادعای افق فروشنده و تجزیه و تحلیل شکاف بین ادعای معیار و واقعیت انتشار.
تمرینات
- فرار کن
code/main.py.تصديق کن که افق 50 درصد سازش با حقيقت مصنوعي زمين مطابقت داره. حالا نصف شبكه زمان انجام دادن را نصف کن. افق تغییر را به طور معنادار تخمین می زند؟
- پست وبلاگ Time Horizon 1.1 METR را بخوانید. وظایف خاص را که در آن قابلیت اطمینان بالاتر است و در آن پایین ترین است شناسایی کنید. توضیح دهید که چرا شکاف وجود دارد.
- منابع " اندازه گیری توانایی های هوش مصنوعی مستقل" METR را بخوانید. دسته های وظیفه HCAST را لیست کنید. یک دسته را انتخاب کنید که برای یک کار تولید وزن بیشتری دارید و دلیل آن را توجیه کنید.
- بازی های ارزیابی-مناظر را در شبیه ساز معرفی کنید: ~ 20% از وظایف شکست خورده را به موفقیت تبدیل کنید. افق جدید را گزارش دهید. این تقریباً آنچه که نرخ بازی ۲۰٪ به تعداد مشاهده شده انجام می دهد را نشان می دهد.
- یک ارزیابی افق داخلی را بر روی پس زمینه خطا یا مجموعه ای از وظایف نماینده خود طراحی کنید. جمع آوری داده ها، مناسب بودن و آنچه که محصول به شما می گوید را توصیف کنید. با اعداد METR مقایسه کنید.
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| METR | "External evaluator" | ex-ARC Evals; independent 501(c)(3) since Dec 2023 |
| Time Horizon | "Capability measure" | Expert task length at 50% reliability, from logistic fit |
| HCAST | "METR's main suite" | 180+ tasks spanning 1 min to 8+ hours |
| RE-Bench | "Research engineering" | 71 ML research-engineering tasks with human baseline |
| SWAA | "Short-task suite" | Calibrates the low end of the horizon curve |
| Doubling time | "Growth rate" | Time for the 50% horizon to double; ~7 months per HCAST |
| Eval-context gaming | "Model behaves differently" | Documented behavior gap between tests and deployment |
| Upper bound | "Horizon is a ceiling" | Benchmark horizon > deployment reliability under load |
خواندن بیشتر
- METR — Resources for Measuring Autonomous AI Capabilities مشخصات HCAST، RE-Bench، SWAA
- METR — Measuring AI Ability to Complete Long Tasks کاغذ افق اصلی
- METR — Time Horizon 1.1 (January 2026) اعداد و روش های فعلی
- Epoch AI — METR Time Horizons benchmark ردیابی زنده
- Anthropic — Measuring agent autonomy in practice دیدگاه داخلی در مورد اندازه گیری های METR.
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.