Phase 15: Autonomous Systems

تصميمات محدودة للتحسين الذاتي

لقد تجمع البحوث على أربعة بدائيات لتحديد حلقة تحسين الذات. غير متغيرات رسمية يجب أن تمتلك كل تحرير مُركبات التوجه التي لا يمكن تعديلها. القيود المتعددة الأهداف التي يجب أن تتحمل كل بعد (السلامة والعدالة والثبات) وليس فقط الأداء. اكتشاف التراجعة الذي يوقف الحلقة عندما تشير المقاييس التاريخية إلى فقدان القدرة. لا يوجد أحد منهم دليل على السلامة النتائج النظرية للمعلومات (معقدة كولموجوروف، نظرية لوب) مقيدة ما يمكن لأي نظام أن يثبت عن خلفائه. إنها التخفيفات التي تزيد من تكلفة الفشل الصامت.

Type: Learn

Languages: Python (stdlib, bounded-loop with invariant check)

Prerequisites: Phase 15 · 07 (RSI), Phase 15 · 04 (DGM)

Time: ~60 minutes

المشكلة

أظهرت محاكاة السباق في الدروس 7 أن الاختلافات الصغيرة في معدل التكامل تتسبب في فجوات كبيرة. أظهرت دراسة حالة DGM في الدروس 4 أن الحلقات يمكن أن تلعب بشكل نشط مع تقييماتها الخاصة. تشير كلا النتائج إلى نفس السؤال الهندسي: ما هي القيود التي يمكنك وضعها على حلقة تحسين الذات بحيث لا يمكن إضعاف القيود بصمت من قبل الحلقة نفسها؟

يحدد ملخص ورشة ICLR 2026 RSI (openreview.net/pdf?id=OsPQ6zTQXV) أربعة من هذه الأصول البدائية. يشار إليها RSP v3.0 (المرحلة 19) و FSF v3 (المرحلة 20) من DeepMind في حدوداً من القدرة. يطبق Meta HyperAgents العمل والإطاريات المجتمعية مثل SAHOO (مارس 2026) مجموعات فرعية في الإنتاج.

الإطار الصادق: هذه التخفيفات. نتائج النظرية المعلومات تحدد ما يمكن لأي نظام أن يثبت عن خليفته، ولا يوجد تصميم حالي يغلق المشكلة رسميا. حلقة محدودة بشكل جيد أكثر أمانا من غير محدودة، وليس آمناً من حيث المعدل المطلق.

المفهوم

الأولية 1: غير متغيرات رسمية

إن عدم التغير هو خاصية يجب أن تحافظ عليها قبل وبعد كل تعديل ذاتي. أمثلة:

  • يتم تشريع توزيع الإنتاج على رأس تشريعي ثابت (الدرس 17).
  • لا يوجد مكالمة أداة تذهب إلى نقطة نهاية غير مصرح بها
  • كتابات الذاكرة تمر عبر مسار مسجل وموقّع
  • يطابق محور الحاسوب من خيار المعتمد.

يتم التحقق من المتغيرات بواسطة رمز خارجي لا يمكن تحرير الحلقة. إذا كان التعديل المقترح ينتهك متغيرًا ، يتم رفضه. هذا يلتقط وضع التلاعب بالمقيّم على طراز DGM (الدرس 4).

الجزء الصعب هو اختيار غير المتغيرات التي هي ضرورية للسلامة والحساب في وقت معقول. تقدم المراكز المفرطة التفصيل؛ وتسمح التفصيل دون تحديد الحلقة الممر من خلال خصائص مهمة.

الأولية 2: مرساة التوجه

مقعد التنحي هو تمثيل لا يتغير من الهدف الأساسي للطلقة ، والذي يتم وضعه خارج سطح تحرير الطلقة. أمثلة:

  • نص دستوري (الدرس 17) يتم تحميله من موقع يقرأ فقط في كل دعوة.
  • المقيّم في مخزن منفصل مع مراقبة الوصول المستقلة.
  • مذكرة تصريح الأداة التي وقعها إنسان ويتم إعادة التحقق منها في كل دورة.

دور المرسوم هو منع الانحراف الموضوعي. قد يحسن الحلقة كيفية متابعة الهدف، ولكن لا يمكن تحرير ما هو الهدف.

وضع الفشل الخفيف: يمكن إعادة تفسير المرسوم الذي لا يمكن تحرير اللفة من خلال حلقة تتحرك في كيفية قراءة المرسوم. الذكاء الاصطناعي الدستوري (الدرس 17) يعتمد صراحة على العقل للتعامل مع الحالات الجديدة. هذه الطبقة التفكير هي حيث تعيش التأويل التحرك. المرسومات ضرورية ، وليس كافية.

الأولية الثالثة: القيود المتعددة الأهداف

حلقة تحسن درجة قياسية واحدة ستجد اختصارات. حلقة يجب أن تلبي في نفس الوقت العديد من القيود الصعبة لديها اختصارات أقل متاحة. المحور النموذجي:

  • الأداء (المعيار المرجعي على مستوى المهام)
  • السلامة (تقييمات الفريق الأحمر، معدل رفض على معروف سيء)
  • العدالة (حدود التأثير المتباينة على المجموعات الفرعية الحساسة)
  • الصمود (مجموعات اختبار OOD، ومعالجة المدخلات المتضاربة)

يتم قبول تعديل فقط إذا كان كل قيود سارية. مدير التكلفة في الدروس 13 يضع هذا مع قيود مالية.

الرقم الرابع: اكتشاف التراجع

يتم مقارنة درجات كل دورة مع التوزيعات التاريخية. إنخفاض ما بعد التسامح الموضح يوقف الحلقة. هذا يلتقط فقدان القدرة الصامتة الذي سيتم امتصاصه في المتوسط التشغيلي عندما "تحسن الحلقة" ما وراءها.

تنفيذ عملي: تخزين درجات المهام في آخر دورات N. كل دورة جديدة تقوم بحساب دلتا لكل مهمة. إذا انخفض أي دلتا دون عتبة، يتم رفض الدورة ومراجعة البشر.

الحدود النظرية للمعلومات

تعقيد كولموجوروف ونظرية لوب تحدد حدود أعلى لما يمكن أن يثبته النظام عن نفسه. كانت آلة غودل رسمية شميدهوبر (دروس 4) تهدف إلى أعلى حد من هذا النوع ؛ لم يكتمل أحد دليل غير بسيط. تقول نتيجة لوب: إذا كان النظام يعتقد بشكل مؤكد "سوف أفعل X إذا أثبت أنني يجب أن أفعل X ،" فسوف يفعل X دون إثبات أنه يجب ، فشل إرجاع ذاتي معروف.

ما يعنيه ذلك بالنسبة لبراميتينا: لا يمكنهم إغلاق مشكلة السلامة. يجعلون الفشل الصامت أكثر تكلفة. حلقة ضارة أو متجولة تتخطى بهدوء شيك مفقود يجب أن تقوض الآن بشكل نشط واحد صريح، وهو توقيع أكثر اكتشافا.

مثال عمل

لنفترض أن عميل يقدم تحرير

  1. التحققات غير المتغيرة: الاختيارات المكونة، دليل تصريح الأدوات، العنوان الدستوري.
  2. التحقق من المرسوم: تعتبر البيانات الموضوعية مطابقة للنسخة المعتمدة (بالتصفيق أو من الناحية النطاقية).
  3. تقييم متعدد الأهداف: أداء، السلامة، العدالة، قوة المحور.
  4. كشف الرجوع: لا يوجد محور ينخفض أكثر من التسامح.

كلّ أربعة يجب أن يمرّوا لكي يصل التحرير إلى الأرض أيّ فشل واحد يُوقف الحلقة

استخدمها

code/main.pyيستخدم حلقة تحسين ذاتي محدودة على لعبة DGM من الدروس 4 ، ولكن مع أربعة أسباب بدائية مرتبة فوقها. يمكن تمكين كل أسباب بدائية أو تعطيلها بشكل فردي. التظاهر هو أن كل أسباب بدائية تحصل على فئة فشل محددة ، وأن إزالة أي منها يسمح لفئة الفشل بذلك.

أرسله

outputs/skill-bounded-loop-review.mdيقوم بمراجعة حلقة محددة مقترحة ويحصى على أي من الأسباب الأربعة التي يطبقها فعليا مقابل المطالبة بها.

التمارين

  1. أركضcode/main.pyتأكد أن الحلقة لا تزال تتحسن على المقياس الأساسي دون السماح للفاشل بالفوز
  1. تعطيل الكشف عن التراجع. قم ببناء مدخل حيث يؤدي هذا إلى قبول فقدان القدرة الصامتة.
  1. تعطيل القيود المتعددة الأهداف. أظهر أن الحلقة تتقارب على محور الأداء بينما ينخفض محور السلامة.
  1. تصميم مقعد التنظيم لوكيل التشفير ما النص، مخزن أين، التحقق من كيف؟
  1. اقرأ ملخص ورشة ICLR 2026 RSI. اختر واحدة من الأربعة البدائية واقترح تحسينًا ملموسًا للدولة الحالية للتكنولوجيا.

الشروط الرئيسية

TermWhat people sayWhat it actually means
Invariant"Always-true property"A property checked by external code before and after every edit
Alignment anchor"Pinned objective"Immutable core-goal representation outside the loop's edit surface
Multi-objective constraint"All axes must hold"Performance, safety, fairness, robustness — all required
Regression detection"Pause on drop"Pause the loop when historical metric deltas suggest capability loss
Kolmogorov bound"Information-theoretic limit"Limits what a system can prove about its own successor
Lob's theorem"Self-reference trap"System can act on "I should" without proving it should
Gate stack"Layered check"Multiple primitives combined; any failure rejects the edit
Bounded improvement"Mitigation, not proof"Raises silent-failure cost; does not close the safety problem

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.