Phase 15: Autonomous Systems

أفقات الوقت و تقييم القدرة الخارجية

METR (Evals السابقة لـARC) هي 501(c)(3) مستقلة منذ ديسمبر 2023. يتناسب معدل معدل Time Horizon 1.1 (يناير 2026) مع منحنى لوجستي لفرصة نجاح المهمة مقابل الوقت المختبر لإكمال البشر) ؛ يحدد التقاطع عند احتمال 50٪ أفق الزمن للنموذج. مجموعة المشاركة 20252026 تغطي GPT-5.1، GPT-5.1-Codex-Max، وتقييمات مراقبة النموذج الأول (يمكن للمراقب أن يقوم بمهمات الصيد الجانبية؛ هل يمكن للوكيل التهرب). مجموعات المقاييس: HCAST (180+ ML، الكترونية، SWE، مهام التفكير؛ من دقيقة إلى 8 ساعات+) ، RE-Bench (71 ML مهام البحث الهندسية مع أساس الخبراء) ، SWAA. ملاحظة صادقة: قياسات METR مثاليّة لا وجود للاإنسان، لا وجود للاعمال الحقيقية وقد وثّق الفريق الفجوة في سلوك التقييم مقابل التنفيذ (الدرس 1). الأفق الزمني هو الحد الأعلى، وليس توقعات النشر.

Type: Learn

Languages: Python (stdlib, logistic-fit horizon estimator)

Prerequisites: Phase 15 · 01 (Long-horizon agents), Phase 15 · 19 (RSP)

Time: ~60 minutes

المشكلة

إن سياسات التوسع (الدرس 19، 20) مفيدة فقط بقدر القياسات التي تشير إليها. يتم تعريف "عتبة البحث والتطوير الذكية الرقمية 4" و"السياسة ذاتية المدى الطويل" في النص؛ فإنها تصبح قابلة للتنفيذ فقط عندما تنتج التقييمات المحددة أرقام محددة.

METR هي منظمة التقييم الخارجية 20242026 التي حددت العديد من هذه الأرقام. يقومون بتقييم نماذج الحدود غالباً ما تكون مسبقاً للإصدار، تحت إطار إدارة التكنولوجيا الوطنية مع المختبرات ونشر المنهج بعد ذلك. مقياس Time Horizon 1.1 (يناير 2026) هو أساسية: مقياس واحد يضغط على القدرة إلى وحدة يمكن قراءتها من قبل الإنسان ("يمكن لهذا النموذج القيام بنوع المهمة التي يقضي الخبير ساعات X عليها مع موثوقية بنسبة 50٪").

يتعلق الدروس جزئياً بالمنظور (كيفية حساب الأفق) وجزئياً بالفسير (لماذا الأفق هو الحد الأعلى وليس توقعات التنفيذ). تتوافق المهارات الثانية. فريق يفهم كيفية تناسب الأفق يصعب كثيراً على الوهم مع ادعاء البائع السيئ من فريق يرى "14 ساعة" فقط على المنقطة.

المفهوم

خلفية METR

  • تأسست: ديسمبر 2023 (إيفالز السابقة ، تم الانتشار إلى 501 ((ج) ((3)) مستقلة).
  • نطاق العمل: تقييم قدرات النماذج الحدودية ذاتية الحكم، غالباً ما تكون مقدمة الإصدار.
  • مختبرات الشركاء: الأنثروبيك، OpenAI (مشاركات متعددة 20252026).
  • المنتجات المهمة: أفق زمني 1.0 (مارس 2025) ، أفق زمني 1.1 (يناير 2026) ، وتقييمات مراقبة النموذج الأول.

"تايم هوريزون"

المنهج (من مدونة وملفات METR):

  1. جمع مجموعة من المهام التي تتراوح بين أوقات الانتهاء من المهارات المتخصصة على نطاق الدقائق إلى النطاق الساعات. المجموعات الحالية: HCAST (180 + مهام) ، RE-Bench (71 مهام) ، SWAA.
  2. قم بتشغيل النموذج على كل مهمة، سجل النجاح أو الفشل.
  3. تطبيق منحنى لوجستي: P(نجاح) كعمل من التاريخ ((وقت الانتهاء الخبير).
  4. الأفق هو الوقت الخبير الذي يصل فيه P ((نجاح) = 0.5

الشكل اللوجستي المناسب هو الصواب لأن القدرة عادةً ما تكون في علاقة متزايدة، تقترب من المستوى مع صعوبة المهمة. نقطة 50٪ هي خيار (يمكن أن تكون 10٪ ، 90٪) ؛ METR تقرير عدة عتبات في الورقة التفصيلية ولكن يقود مع 50٪ لأنه هو الأكثر بديهية.

أرقام يناير 2026

لكل أفق زمني 1.1:

  • كلود أوبوس 4.6: ~ 14 ساعة مع موثوقية بنسبة 50%، اعتبارا من أفق الوقت 1.1 (يناير 2026).
  • وقت مضاعف على مهام على النمط HCAST: ~ 4.3 شهر (130.8 يوم) على التكيف بعد عام 2023 الذي أبلغ عنه أفق الوقت 1.1 (يناير 2026) ؛ الرقم ~ 7 أشهر هو التكيف الكامل 20192025 من أفق الوقت 1.0 ويتم الإبلاغ عنه في TH1.1 إلى جانب الرقم بعد عام 2023.

هذه هي الأرقام المحددة التي يستخدمها باقي المراجع في المرحلة 15. تم استشهاد بها في RSP v3.0 (دروس 19) من Anthropic و FSF v3 من DeepMind (دروس 20) كواحدة من القياسات التي تغذي تقييمات العدالة.

الأجسام المرجعية

  • HCAST: 189 مهمة عبر ML، الأمن السيبراني، هندسة البرمجيات، والحكمة العامة. فترة: من دقيقة إلى 8 ساعات + من الوقت الخبراء. مجموعة الرئيسية وراء عدد الأفق.
  • RE-Bench: 71 ML مهام البحث الهندسة مع خط أساسي من الخبراء البشريين. يقيس ما إذا كان النموذج يمكن أن تفعل نوع من العمل البحث والتطوير ML التي تغذية في عتبة AI R&D-4.
  • SWAA: مهام أقصر؛ مفيدة لتصفية نهاية المنحدر السفلى من منحنى الأفق.

تقييمات مراقبة النماذج الأولية

20252026 عمل METR شملت النماذج الأولية لمراقبة وتقييم: هل يمكن للمراقب أن يلتقط نموذجًا يقوم بمهمة جانبية (شيء آخر غير ما طلبه المشغل) ؛ هل يمكن للوكيل تجنب المراقب. هذه تغذية مباشرة الفئة "أسباب الحماية القائمة على التهديد" في OpenAI PF v2 ومراقبة التحالف الخادع في DeepMind FSF v3 (المدرسة 20).

لماذا الأفق هو الحدود العليا

  • Idealized tooling: مهام المراجع توفر للنموذج أدوات نظيفة وبيانات مُصممة بشكل جيد.
  • No real consequences: النموذج لا يقوم فعلا بتفويض عميل، أو يزيل البيانات الحقيقية، أو يواصل مع أشخاص حقيقيين.
  • Eval-context gamingالدرس الأول: تتصرف النماذج بشكل مختلف في الاختبارات. يثبت تقرير سلامة الذكاء الاصطناعي الدولي لعام 2026 هذا بشكل تجربي.
  • No legitimate user variance: يتم تنظيم طلبات المراجع. يخلق المستخدمون الحقيقيون طلبات غامضة ومتعلقة بالسياق.

الأفق هو السقف القدرة في ظل ظروف مواتية. موثوقية التنفيذ هي رقم مختلف، أقل، والفرق يجب أن تقيس توزيعها الخاصة لمعرفة ذلك.

قضية المقيّم الخارجي

التقييم الخارجي مهم لأن المختبرات الداخلية لديها حافزات لتحسين المقاييس التي تقررها. استقلال METR 501 ((c) (3) مع منهجية مدعومة ورقائق مراجعة من قبل الأقران هو التخفيف الهيكلي. لا يكفي بمفرده (المختبرات لا تزال تسيطر على ما يراه METR) ، ولكنه أفضل تمامًا من عدم وجود تقييم خارجي.

كيفية استخدام أرقام الأفق في الممارسة العملية

  • As a capability filter: إذا كان آفاق النموذج أقل بكثير من وقت الخبراء للمهمة المقترحة، فلا ترسلها بشكل مستقل (ملف المهارات ليسون 1).
  • As a trend indicator: يخبرك مضاعفة الوقت كم من الوقت ستظل الممارسة الحالية آمنة حتى دون تخفيفات جديدة.
  • As a prior: أفق 14 ساعة هو نقطة البداية. قم بتعديل توزيع المهام، جودة الأدوات، ووضع السياق الخاص بك.

استخدمها

code/main.pyيطبق التكيف اللوجستي بين نجاح المهمة مقابل وقت الخبراء) ، نظراً لمجموعة النتائج الاصطناعية. يبلغ عن آفاق 50٪ (رأس METR) ، وأفق 10٪ (محافظة) ، وأفق 90٪ (متفائل). يظهر أيضًا ما يتغير عندما يتم تضخم معدل النجاح بشكل اصطناعي من خلال ألعاب تقييم السياق.

أرسله

outputs/skill-horizon-interpretation.mdيراجع ادعاء مؤشر البائع ويجري تحليل الفجوة بين ادعاء المؤشر المرجعي وواقع التنفيذ.

التمارين

  1. أركضcode/main.pyتأكد أن أفق 50٪ من التكيف يطابق الحقيقة الأرضية الاصطناعية الآن نصف شبكة وقت المهمة هل يقدر الأفق التغيير بشكل معنى؟
  1. اقرأ مدونة METR Time Horizon 1.1 تحديد المهام المحددة حيث تكون الموثوقية أعلى وأقل وأيضًا شرح سبب وجود الفجوة.
  1. اقرأ موارد METR "قياس قدرات الذكاء الاصطناعي الذاتي الذاتي". قم بإدراج فئات المهام في HCAST. اختر فئة واحدة من فئات المهام التي ستحمل وزنًا أكبر لمهام الإنتاج وتبرير السبب.
  1. أدخل ألعاب تقييم السياق في المحاكي: قم بتحويل ~ 20% من المهام الفاشلة إلى نجاح. قم بتقرير الأفق الجديد. هذا يقترب مما يفعله معدل الألعاب بنسبة 20% إلى الرقم الملاحظ.
  1. قم بتصميم تقييم الأفق الداخلي على سجلات الأخطاء الخاصة بك أو مجموعة المهام الممثلة. وصف جمع البيانات والتناسب وما يخبرك به الخروج. مقارنة بأرقام METR.

الشروط الرئيسية

TermWhat people sayWhat it actually means
METR"External evaluator"ex-ARC Evals; independent 501(c)(3) since Dec 2023
Time Horizon"Capability measure"Expert task length at 50% reliability, from logistic fit
HCAST"METR's main suite"180+ tasks spanning 1 min to 8+ hours
RE-Bench"Research engineering"71 ML research-engineering tasks with human baseline
SWAA"Short-task suite"Calibrates the low end of the horizon curve
Doubling time"Growth rate"Time for the 50% horizon to double; ~7 months per HCAST
Eval-context gaming"Model behaves differently"Documented behavior gap between tests and deployment
Upper bound"Horizon is a ceiling"Benchmark horizon > deployment reliability under load

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.