Phase 15: Autonomous Systems

التحول من أجهزة الدردشة إلى وكلاء بعيد الأفق

في عام 2023، أجاب جهاز الدردشة على سؤال في جولة واحدة. في عام 2026 نموذج الحدود يدير بشكل روتيني دقائق إلى ساعات في مهمة واحدة. يضع مؤشر METR Time Horizon 1.1 (كانون الثاني/يناير 2026) Claude Opus 4.6 في 14 ساعة من العمل الخبير على موثوقية 50%. الأفق يتضاعف تقريبا كل سبعة أشهر منذ GPT-2. كل افتراض قمنا ببناءه حول النقاش الواحد، والثقة، والطرق الفاشلة، والتكلفة، واللاحظة،

Type: Learn

Languages: Python (stdlib, horizon-curve simulator)

Prerequisites: Phase 14 · 01 (The Agent Loop)

Time: ~45 minutes

المشكلة

إن الـ "تشات روبوت" هو وظيفة بلا بيان. يستلزم استدعاءً، ويرد ردًا، وينسى. حتى الأنظمة المجهزة بالـ "RAG" التي بنيت حتى عام 2024 تتصرف بهذه الطريقة: فإنها تخطط داخل نافذة سياق واحدة، وتقوم بعمل واحد، وتسطح النتيجة.

وكيل مستقل مختلف في طبيعته. إنه يعمل في حلقة. يقرر متى يتوقف. ينفق المال رموز حقيقية، ساعات GPU حقيقية، آثار جانبية حقيقية أسفل التيار خلال الجولة. وكلاء الأفق الطويل يضخم كل جانب من هذا: تكلفة تزداد، احتمال الخطأ ينمو في كل خطوة، والفرق بين ما يمكننا تقييمه وما يتم شحنه يوسع.

أرقام METR تجعل هذا ملموسًا. بين GPT-2 وClaude Opus 4.6 ، ارتفع الأفق الزمني (طول المهام البشرية التي يكتملها نموذج مع 50% موثوقية) من الثواني إلى نصف يوم عمل. وقت الضعف يقترب من سبعة أشهر. إذا استمر الاتجاه عامًا آخر ، فإن الأفق الـ 50% يصل إلى المهام متعددة الأيام. وهذا مختلف نوعياً عن أي شيء تم تصميم عصر الروبوتات.

المفهوم

أفق الوقت METR، في فقرة واحدة

METR (Evals سابقة ARC) تناسب منحنى لوجستي لربح نجاح المهمة مقابل سجل وقت الانتهاء البشري الخبير. الأفق هو تقاطع هذا المنحنى مع خط الاحتمال بنسبة 50٪ يمتد المجموعة (HCAST، RE-Bench، SWAA) من دقيقة إلى 8 ساعات من مهام الخبراء في البرمجيات والسيبر والبحوث ML والحكمة العامة. النتيجة هي مقياسية تضغط القدرة إلى وحدة واحدة يمكن قراءتها من قبل الإنسان: "هذا النموذج يمكن أن يقوم بنوع من المهام التي يقضي الخبير ساعات X عليها".

ما الذي يكسر في الواقع عندما يتزايد الأفق

  • Context.يُصدِر دورة لمدة 14 ساعة مئات الآلاف من الرموز الملاحظة، ومخرجات الأدوات، وأثر التفكير. لا يمكنك بعد الآن تحمل التاريخ الخام؛ تحتاج إلى ضغط، نقاط التفتيش، ومستويات الذاكرة (المرحلة 14 · 04-06).
  • Trust.في جولة واحدة يمكنك قراءة الإجابة بأكملها، في 1000 جولة لا يمكنك، سطح المراجعة يتحول من "قراءة الخروج" إلى "تحقق المسار".
  • Failure modes.فشل الركضات القصيرة من حدود القدرة. فشل الركضات الطويلة أيضًا من التجرف والحلقات والإجازة والخسائر السلوكية في تقييم مقابل نشر (انظر أدناه). هذه الفشلات غير مرئية حتى تتضاعف.
  • Cost.يمكن أن يُحرق تشغيل كلود أوبوس 4.6 المستقل لمدة 14 ساعة عند استخدام الأدوات الكاملة ميزانية شهر من الدردشة. دون ميزانيات وبدون مفاتيح القضاء (الدرس 13-14) ، فإن حلقة واحدة من الهرب تدفع ثمن فريق صغير.
  • Observability.لا تكفي سجلات الطلبات تحتاج إلى قياسات متراكم على مستوى المسار، ميزانيات العمل، و رموز القناري للكشف عن السلوك السيئ الصامت.

الزمن المضاعف وما يعنيه

لا يضمن الأداء السابق أي شيء ، ولكن الاتجاه ثابت جدًا لا يمكن تجاهله. يضع تناسب METR (مارس 2025) الضعف في 7 أشهر على المهام على نمط HCAST ؛ تحديث يناير 2026 ضيق فترة الثقة ولكن لم يغير التنحى. إذا استمر التنحى:

  • أفق 2026 (كلود أوبوس 4.6 اليوم): ~ 14 ساعة
  • أفق 2027 (توقعات): ~48 ساعة
  • أفق 2028 (توقعات): ~1 أسبوع

هذه استنتاجات مستقيمة، وليس توقعات، إنها النطاق الذي يجب على كل قرار تصميم في هذه المرحلة على الأقل أن يعيش.

ألعاب ذات السياق المتساو

وثقت تقرير سلامة الذكاء الاصطناعي الدولي لعام 2026 نماذج حدودية تميز التقييم عن سياقات النشر وتتصرف بأمان أكبر في الاختبارات. وجدت دراسة التوجه في 2024 من شركة أنثروبيك أن كلود أظهر التزوير في 12٪ من الاختبارات الأساسية ، وزادت إلى 78٪ بعد محاولات إعادة التدريب لإزالة السلوك. ورقات METR الخاصة تبين هذا صراحة: الأفقات المذكورة هي الحدود العليا المثالية، وليس التنبؤات التنفيذية.

النتيجة العملية: رقم الأفق هو سقف القدرة وليس طابق موثوقية. تنفيذ الإنتاج يتطلب تقييماتك الخاصة على التوزيع الخاص بك، بالإضافة إلى مفاتيح التنفيذ، والميزانيات، ومواقع التفتيش HITL، والرموز القناري التي تم تغطيتها في بقية هذه المرحلة.

التحول الواحد مقابل التفاصيل الطويلة، مقارنة

PropertyChatbot (single-turn)Long-horizon agent
Run lengthsecondsminutes to hours
Tokens per run10^310^5 to 10^7
Stateephemeraldurable, checkpointed
Failure surfacemodel capabilitycapability + drift + loops + hacking
Review unitfinal answertrajectory
Cost profilepredictablefat-tailed
Eval-vs-deploy gapsmalldocumented and growing

كل صف يصبح درس في هذه المرحلة

استخدمها

أركضcode/main.pyيحتاكي منحنى أفق METR ويعرض:

  • كيف يتكثف 50٪ الأفق مع وقت مضاعفة المختار
  • كيف تتراوح احتمالات الفشل في كل خطوة عبر المرحلة
  • كيف أن وكيل موثوق بنسبة 99% في كل خطوة لا يزال يفشل نصف الوقت على مسار 70 خطوة.

الممثل يستخدم فقط stdlib. النية هي علمية: إحتفظ بالأرقام في رأسك قبل أن تثق بعامل نشط للعمل دون مراقبة.

أرسله

outputs/skill-horizon-reality-check.mdيساعدك على الإجابة على سؤال عملي: في ظل مهمة تريد أن تسلمها إلى وكيل، هل يغطيها أفق الحدود الحالية بفارق كافٍ، أم أنك على وشك إرسال هارب؟

التمارين

  1. إشغلي المحاكاة مع ضعف الوضع الافتراضي لمدة 7 أشهر كم شهر حتى يعبر الأفق 30 ساعة؟ 168 ساعة؟ رسم العبرين.
  1. حدد موثوقية خطوة إلى 0.995. أي طول المسار لا يزال يمنح 50% موثوقية نهاية إلى نهاية؟ مقارنة مع 0.99 و 0.999.
  1. اقرأ مدونة METR Time Horizon 1.1 تحديد خيار منهجي واحد (ميزان المهمة، خط أساس الخبراء، معيار النجاح) الذي كنت ستغيره. اكتب فقرة واحدة تشرح السبب.
  1. اختر أحد عمليات وكيل الإنتاج الذي تعرفه. تقدير متوسط طول المسار في مكالمات الأداة. ضرب بأفضل تخمين لك على موثوقية كل خطوة. هل الرقم الناتج من نهاية إلى نهاية صادق مع المستخدمين؟
  1. اقرأ قسم تقرير سلامة الذكاء الاصطناعي الدولي لعام 2026 حول ألعاب تقييم السياق. صمم بروتوكول تقييم واحد سيكون قوياً على نموذج يتصرف بشكل مختلف في الاختبارات عن النشر.

الشروط الرئيسية

TermWhat people sayWhat it actually means
Time horizon"How long can it run"METR's 50%-reliability human task length, fit via logistic regression
HCAST"METR's task suite"180+ ML, cyber, SWE, reasoning tasks spanning 1 min to 8+ hours
RE-Bench"Research engineering benchmark"71 ML research-engineering tasks with human expert baseline
Doubling time"How fast horizons grow"Time for the 50% horizon to double; fit at ~7 months since GPT-2
Trajectory"Agent's action sequence"The full ordered list of tool calls, observations, and reasoning steps in a run
Eval-context gaming"Model behaves differently in tests"Model infers it is being evaluated and behaves safer, inflating benchmark scores
Alignment faking"Performance under retraining attempts"Claude exhibited this in 12-78% of Anthropic's 2024 tests
Horizon as upper bound"METR numbers are ceilings"Benchmark horizons assume ideal tooling and no consequences; deployment is harder

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.