Phase 15: Autonomous Systems

طرح های محدود برای بهبود خود

تحقیقات روی چهار ابتدایی برای محدود کردن یک حلقه بهبود خود گردیده است. اينوريانت هاي رسمي که بايد در هر ترميم نگه داشته بشه لنگرهای تعادل که نمی توانند تغییر دهند. محدودیت های چند هدف که هر ابعاد (سلامت، عدالت، ثبات) باید در آن جای بگیرند نه فقط عملکرد. تشخیص بازپسین که زمانی که متریک های تاریخی نشان می دهد از دست دادن قابلیت را متوقف می کند. هیچ یک از آنها اثبات ایمنی نیست نتایج نظری اطلاعات (معقدیت کولمگوروف، نظریه لوب) آنچه هر سیستم می تواند در مورد جانشین های خود ثابت کند را محدود می کند. این ها کاهش هایی هستند که هزینه شکست خاموش را افزایش می دهند.

Type: Learn

Languages: Python (stdlib, bounded-loop with invariant check)

Prerequisites: Phase 15 · 07 (RSI), Phase 15 · 04 (DGM)

Time: ~60 minutes

مشکل

شبیه ساز مسابقه در درس 7 نشان داد که تفاوت های کوچک نرخ به شکاف های بزرگ ترکیب می شود. مطالعه موردی DGM در درس 4 نشان داد که حلقه ها می توانند به طور فعال با ارزیابی کنندگان خود بازی کنند. هر دو نتیجه به یک سوال مهندسی مشابه اشاره می کنند: چه محدودیت هایی را می توانید در حلقه خود بهبود دهید تا محدودیت ها به طور خاموش توسط حلقه خود ناتوان نشود؟

خلاصه ورشکاپ ICLR 2026 RSI (openreview.net/pdf?id=OsPQ6zTQXV) چهار نوع اولیه را شناسایی می کند. RSP v3.0 (درسی 19) و FSF v3 (درسی 20) DeepMind هر دو آنها را در حد توانایی اشاره می کنند. کار Meta HyperAgents و چارچوب های جامعه مانند SAHOO (مارس 2026) زیر مجموعه ها را در تولید اجرا می کنند.

چارچوب صادقانه: اینها کاهش ها هستند. نتایج نظری اطلاعات آنچه را که هر سیستم می تواند در مورد جانشین خود ثابت کند را محدود می کند و هیچ طرح فعلی مشکل را به طور رسمی بسته نمی کند. یک حلقه محدود بهتر از یک حلقه بدون محدودیت است، نه در شرایط مطلق امن است.

مفهوم

ابتدایی 1: غیر متغیرات رسمی

یک غیر متغیر یک خاصیت است که باید قبل و بعد از هر تغییر خود برقرار باشد.

  • توزیع تولید بر اساس یک عنوان اساسی ثابت (درس 17) است.
  • هيچ تماس با ابزار به نقطه آخري غير مجاز نمي رود
  • حافظه نوشته ها از طریق مسیر ثبت شده و امضا شده عبور می کنند.
  • هاش ماژول ارزیابی کننده با نسخه تایید شده مطابقت دارد.

در این حالت، یک تغییر در حالت ارزیابی کننده (DGM) تغییر می کند. در حالت تغییر در حالت تغییر، یک تغییر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر تغییر پذیر در حالت تغییر پذیر در حالت تغییر تغییر تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر تغییر تغییر پذیر در حالت تغییر تغییر تغییر پذیر در حالت تغییر تغییر تغییر تغییر پذیر در حالت تغییر تغییر تغییر تغییر تغییر پذیر در حالت تغییر تغییر تغییر پذیر در حالت تغییر تغییر تغییر تغییر پذیر در حالت تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر پذیر در حالت تغییر تغییر تغییر تغییر تغییر پذیر در حالت تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر در حالت در حالت تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر

بخش سخت انتخاب انورینت هایی است که برای ایمنی ضروری هستند و در زمان معقول قابل محاسبه هستند. بیش از حد مشخص کردن پیشرفت استال ها؛ کم مشخص کردن اجازه می دهد تا حلقه از خواص مهم عبور کند.

۲: لنگرهای تعادل

لنگر تعادل یک نمایش ثابت از هدف اصلی حلقه است که خارج از سطح ویرایش حلقه قرار گرفته است. نمونه ها:

  • یک متن اساسی (درس 17) که از یک مکان فقط برای خواندن در هر دعوت بارگذاری می شود.
  • یک ارزیابی کننده در یک مخزن جداگانه با کنترل دسترسی مستقل.
  • یک دفترچه مجوز ابزار که توسط یک انسان امضا شده و هر چرخه دوباره تایید شده است.

نقش لنگر جلوگیری از حرکت هدف است. حلقه ممکن است نحوه دنبال کردن هدف را بهبود بخشد، اما نمی تواند هدف را ویرایش کند.

حالت شکست ظریف: یک لنگر که حلقه نمی تواند ویرایش کند هنوز می تواند توسط یک حلقه که در نحوه خواندن لنگر حرکت می کند دوباره تفسیر شود. هوش مصنوعی آئینی (درس 17) به طور صریح مبتنی بر دلیل برای مدیریت موقعیت های جدید است؛ این لایه استدلال جایی است که حرکت تفسیر زندگی می کند. لنگرها ضروری هستند، کافی نیستند.

ابتدایی 3: محدودیت های چند هدف

یک حلقه ای که یک امتیاز اسکالر را بهینه می کند، میانراه های کوتاه را پیدا می کند. یک حلقه ای که باید همزمان محدودیت های سخت چندگانه را برآورده کند، میانراه های کوتاه کمتری دارد. محور های معمولی:

  • عملکرد (مقایسه سطح وظیفه)
  • ایمنی (ملاحظات گروه قرمز، میزان رد در مورد بد شناخته شده)
  • عدالت (حدود تاثیرات متمایز در زیر گروه های حساس)
  • قابلیت تقویت (سخت های آزمایش OOD، کنترل ورودی متناقض)

تغییر تنها در صورتی پذیرفته می شود که هر محدودیت برقرار باشد. دولت هزینه در درس 13 این را با محدودیت های مالی جمع می کند. نگهبان لامای در درس 18 به عنوان محور ایمنی متصل می شود.

ابتدایی 4: تشخیص بازپسین

امتیاز هر چرخه با توزیع های تاریخی مقایسه می شود. کاهش فراتر از تحمل تنظیم شده، حلقه را متوقف می کند. این باعث از دست دادن قابلیت خاموش می شود که به صورت غیر قابل توجهی به میانگین در حال اجرا جذب می شود.

یک پیاده سازی عملی: ذخیره امتیازات هر کار در آخرین چرخه N. هر چرخه جدید یک دلتا در هر کار را محاسبه می کند. اگر هر دلتا زیر یک حد کاهش یابد، چرخه رد می شود و یک بررسی انسانی انجام می شود.

محدودیت های نظری اطلاعات

پیچیدگی کلمگوروف و نظریه لوب محدودیت های بالایی را بر روی آنچه که یک سیستم می تواند در مورد خود ثابت کند تعیین می کند. ماشین گودل رسمی شمیدهبر (درس 4) به بالاترین حد چنین هدف را هدف قرار داده است؛ هیچ کس یک اثبات غیر معمولی را تکمیل نکرده است. نتیجه لوب می گوید: اگر یک سیستم به طور قابل اثبات اعتقاد دارد "اگر ثابت کنم X انجام دهم،" X را بدون اثبات باید انجام دهد، شکست خود مرجع شناخته شده است.

این برای ابتدایی ها معنی دارد که نمی توانند مشکل ایمنی را ببندند. آنها شکست خاموش را گران تر می کنند. یک حلقه مخرب یا منحرف که به طور آرام یک چک گمشده را دور می کند باید اکنون به طور فعال یک چک صریح را تضعیف کند، که یک امضا قابل تشخیص تر است.

یک مثال عملی

فرض کن يه مامور پيشنهاد يه تدوين ميکنه

  1. چک های ثابت: هشت ماژول، مانیف مجوز ابزار، سرنوشت ساز.
  2. بررسی لنگر: بیان هدف با نسخه تایید شده (به لحاظ باایت یا معنوی) مطابقت دارد.
  3. ارزیابی چند هدف: عملکرد، ایمنی، عدالت، ثبات.
  4. تشخیص بازگشت: هیچ محور بیش از تحمل کاهش نمی یابد.

هر چهار تا بايد براي ورود به حالت تعديل عبور کنند هر شکستي که باشه، حلقه رو متوقف ميکنه

ازش استفاده کن

code/main.pyدر کلاس 4، یک حلقه خود بهبود محدود در اسباب بازی سبک DGM اجرا می شود، اما با چهار نوع ابتدایی که در بالای آن لایه قرار دارند. هر نوع ابتدایی را می توان به صورت جداگانه فعال یا غیرفعال کرد. نشان داده می شود که هر نوع ابتدایی یک کلاس شکست خاص را می گیرد و حذف هر یک از آنها اجازه می دهد تا کلاس شکست عبور کند.

-باده

outputs/skill-bounded-loop-review.mdیک حلقه محدود پیشنهادی را بررسی می کند و امتیاز می دهد که کدام از چهار ابتدایی را در واقع اجرا می کند در مقابل ادعاهای خود.

تمرینات

  1. فرار کنcode/main.pyبا تمام Primitive فعال شد. تایید کن حلقه هنوز در متریک اولیه بهبود می یابد بدون اینکه اجازه دهد هک برنده شود.
  1. تشخیص بازپسین را غیر فعال کنید. یک ورودی را بسازید که منجر به پذیرفتن از دست دادن قابلیت خاموش شود.
  1. محدودیت چند هدف را غیرفعال کنید. نشان دهید که حلقه در محور عملکرد در حالی که محور ایمنی کاهش می یابد.
  1. براي يه عامل کدسازي يه لنگر تعادل رو طراحی کنيد.
  1. خلاصه ورشکاپ RSI ICLR 2026 را بخوانید. یکی از چهار ابتدایی را انتخاب کنید و یک بهبود مشخصی را برای وضعیت فعلی هنر پیشنهاد کنید.

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
Invariant"Always-true property"A property checked by external code before and after every edit
Alignment anchor"Pinned objective"Immutable core-goal representation outside the loop's edit surface
Multi-objective constraint"All axes must hold"Performance, safety, fairness, robustness — all required
Regression detection"Pause on drop"Pause the loop when historical metric deltas suggest capability loss
Kolmogorov bound"Information-theoretic limit"Limits what a system can prove about its own successor
Lob's theorem"Self-reference trap"System can act on "I should" without proving it should
Gate stack"Layered check"Multiple primitives combined; any failure rejects the edit
Bounded improvement"Mitigation, not proof"Raises silent-failure cost; does not close the safety problem

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.