طرح های محدود برای بهبود خود
Type: Learn
Languages: Python (stdlib, bounded-loop with invariant check)
Prerequisites: Phase 15 · 07 (RSI), Phase 15 · 04 (DGM)
Time: ~60 minutes
مشکل
شبیه ساز مسابقه در درس 7 نشان داد که تفاوت های کوچک نرخ به شکاف های بزرگ ترکیب می شود. مطالعه موردی DGM در درس 4 نشان داد که حلقه ها می توانند به طور فعال با ارزیابی کنندگان خود بازی کنند. هر دو نتیجه به یک سوال مهندسی مشابه اشاره می کنند: چه محدودیت هایی را می توانید در حلقه خود بهبود دهید تا محدودیت ها به طور خاموش توسط حلقه خود ناتوان نشود؟
خلاصه ورشکاپ ICLR 2026 RSI (openreview.net/pdf?id=OsPQ6zTQXV) چهار نوع اولیه را شناسایی می کند. RSP v3.0 (درسی 19) و FSF v3 (درسی 20) DeepMind هر دو آنها را در حد توانایی اشاره می کنند. کار Meta HyperAgents و چارچوب های جامعه مانند SAHOO (مارس 2026) زیر مجموعه ها را در تولید اجرا می کنند.
چارچوب صادقانه: اینها کاهش ها هستند. نتایج نظری اطلاعات آنچه را که هر سیستم می تواند در مورد جانشین خود ثابت کند را محدود می کند و هیچ طرح فعلی مشکل را به طور رسمی بسته نمی کند. یک حلقه محدود بهتر از یک حلقه بدون محدودیت است، نه در شرایط مطلق امن است.
مفهوم
ابتدایی 1: غیر متغیرات رسمی
یک غیر متغیر یک خاصیت است که باید قبل و بعد از هر تغییر خود برقرار باشد.
- توزیع تولید بر اساس یک عنوان اساسی ثابت (درس 17) است.
- هيچ تماس با ابزار به نقطه آخري غير مجاز نمي رود
- حافظه نوشته ها از طریق مسیر ثبت شده و امضا شده عبور می کنند.
- هاش ماژول ارزیابی کننده با نسخه تایید شده مطابقت دارد.
در این حالت، یک تغییر در حالت ارزیابی کننده (DGM) تغییر می کند. در حالت تغییر در حالت تغییر، یک تغییر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر تغییر پذیر در حالت تغییر پذیر در حالت تغییر تغییر تغییر پذیر در حالت تغییر پذیر در حالت تغییر پذیر در حالت تغییر تغییر تغییر پذیر در حالت تغییر تغییر تغییر پذیر در حالت تغییر تغییر تغییر تغییر پذیر در حالت تغییر تغییر تغییر تغییر تغییر پذیر در حالت تغییر تغییر تغییر پذیر در حالت تغییر تغییر تغییر تغییر پذیر در حالت تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر پذیر در حالت تغییر تغییر تغییر تغییر تغییر پذیر در حالت تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر در حالت در حالت تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر تغییر
بخش سخت انتخاب انورینت هایی است که برای ایمنی ضروری هستند و در زمان معقول قابل محاسبه هستند. بیش از حد مشخص کردن پیشرفت استال ها؛ کم مشخص کردن اجازه می دهد تا حلقه از خواص مهم عبور کند.
۲: لنگرهای تعادل
لنگر تعادل یک نمایش ثابت از هدف اصلی حلقه است که خارج از سطح ویرایش حلقه قرار گرفته است. نمونه ها:
- یک متن اساسی (درس 17) که از یک مکان فقط برای خواندن در هر دعوت بارگذاری می شود.
- یک ارزیابی کننده در یک مخزن جداگانه با کنترل دسترسی مستقل.
- یک دفترچه مجوز ابزار که توسط یک انسان امضا شده و هر چرخه دوباره تایید شده است.
نقش لنگر جلوگیری از حرکت هدف است. حلقه ممکن است نحوه دنبال کردن هدف را بهبود بخشد، اما نمی تواند هدف را ویرایش کند.
حالت شکست ظریف: یک لنگر که حلقه نمی تواند ویرایش کند هنوز می تواند توسط یک حلقه که در نحوه خواندن لنگر حرکت می کند دوباره تفسیر شود. هوش مصنوعی آئینی (درس 17) به طور صریح مبتنی بر دلیل برای مدیریت موقعیت های جدید است؛ این لایه استدلال جایی است که حرکت تفسیر زندگی می کند. لنگرها ضروری هستند، کافی نیستند.
ابتدایی 3: محدودیت های چند هدف
یک حلقه ای که یک امتیاز اسکالر را بهینه می کند، میانراه های کوتاه را پیدا می کند. یک حلقه ای که باید همزمان محدودیت های سخت چندگانه را برآورده کند، میانراه های کوتاه کمتری دارد. محور های معمولی:
- عملکرد (مقایسه سطح وظیفه)
- ایمنی (ملاحظات گروه قرمز، میزان رد در مورد بد شناخته شده)
- عدالت (حدود تاثیرات متمایز در زیر گروه های حساس)
- قابلیت تقویت (سخت های آزمایش OOD، کنترل ورودی متناقض)
تغییر تنها در صورتی پذیرفته می شود که هر محدودیت برقرار باشد. دولت هزینه در درس 13 این را با محدودیت های مالی جمع می کند. نگهبان لامای در درس 18 به عنوان محور ایمنی متصل می شود.
ابتدایی 4: تشخیص بازپسین
امتیاز هر چرخه با توزیع های تاریخی مقایسه می شود. کاهش فراتر از تحمل تنظیم شده، حلقه را متوقف می کند. این باعث از دست دادن قابلیت خاموش می شود که به صورت غیر قابل توجهی به میانگین در حال اجرا جذب می شود.
یک پیاده سازی عملی: ذخیره امتیازات هر کار در آخرین چرخه N. هر چرخه جدید یک دلتا در هر کار را محاسبه می کند. اگر هر دلتا زیر یک حد کاهش یابد، چرخه رد می شود و یک بررسی انسانی انجام می شود.
محدودیت های نظری اطلاعات
پیچیدگی کلمگوروف و نظریه لوب محدودیت های بالایی را بر روی آنچه که یک سیستم می تواند در مورد خود ثابت کند تعیین می کند. ماشین گودل رسمی شمیدهبر (درس 4) به بالاترین حد چنین هدف را هدف قرار داده است؛ هیچ کس یک اثبات غیر معمولی را تکمیل نکرده است. نتیجه لوب می گوید: اگر یک سیستم به طور قابل اثبات اعتقاد دارد "اگر ثابت کنم X انجام دهم،" X را بدون اثبات باید انجام دهد، شکست خود مرجع شناخته شده است.
این برای ابتدایی ها معنی دارد که نمی توانند مشکل ایمنی را ببندند. آنها شکست خاموش را گران تر می کنند. یک حلقه مخرب یا منحرف که به طور آرام یک چک گمشده را دور می کند باید اکنون به طور فعال یک چک صریح را تضعیف کند، که یک امضا قابل تشخیص تر است.
یک مثال عملی
فرض کن يه مامور پيشنهاد يه تدوين ميکنه
- چک های ثابت: هشت ماژول، مانیف مجوز ابزار، سرنوشت ساز.
- بررسی لنگر: بیان هدف با نسخه تایید شده (به لحاظ باایت یا معنوی) مطابقت دارد.
- ارزیابی چند هدف: عملکرد، ایمنی، عدالت، ثبات.
- تشخیص بازگشت: هیچ محور بیش از تحمل کاهش نمی یابد.
هر چهار تا بايد براي ورود به حالت تعديل عبور کنند هر شکستي که باشه، حلقه رو متوقف ميکنه
ازش استفاده کن
code/main.pyدر کلاس 4، یک حلقه خود بهبود محدود در اسباب بازی سبک DGM اجرا می شود، اما با چهار نوع ابتدایی که در بالای آن لایه قرار دارند. هر نوع ابتدایی را می توان به صورت جداگانه فعال یا غیرفعال کرد. نشان داده می شود که هر نوع ابتدایی یک کلاس شکست خاص را می گیرد و حذف هر یک از آنها اجازه می دهد تا کلاس شکست عبور کند.
-باده
outputs/skill-bounded-loop-review.mdیک حلقه محدود پیشنهادی را بررسی می کند و امتیاز می دهد که کدام از چهار ابتدایی را در واقع اجرا می کند در مقابل ادعاهای خود.
تمرینات
- فرار کن
code/main.pyبا تمام Primitive فعال شد. تایید کن حلقه هنوز در متریک اولیه بهبود می یابد بدون اینکه اجازه دهد هک برنده شود.
- تشخیص بازپسین را غیر فعال کنید. یک ورودی را بسازید که منجر به پذیرفتن از دست دادن قابلیت خاموش شود.
- محدودیت چند هدف را غیرفعال کنید. نشان دهید که حلقه در محور عملکرد در حالی که محور ایمنی کاهش می یابد.
- براي يه عامل کدسازي يه لنگر تعادل رو طراحی کنيد.
- خلاصه ورشکاپ RSI ICLR 2026 را بخوانید. یکی از چهار ابتدایی را انتخاب کنید و یک بهبود مشخصی را برای وضعیت فعلی هنر پیشنهاد کنید.
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| Invariant | "Always-true property" | A property checked by external code before and after every edit |
| Alignment anchor | "Pinned objective" | Immutable core-goal representation outside the loop's edit surface |
| Multi-objective constraint | "All axes must hold" | Performance, safety, fairness, robustness — all required |
| Regression detection | "Pause on drop" | Pause the loop when historical metric deltas suggest capability loss |
| Kolmogorov bound | "Information-theoretic limit" | Limits what a system can prove about its own successor |
| Lob's theorem | "Self-reference trap" | System can act on "I should" without proving it should |
| Gate stack | "Layered check" | Multiple primitives combined; any failure rejects the edit |
| Bounded improvement | "Mitigation, not proof" | Raises silent-failure cost; does not close the safety problem |
خواندن بیشتر
- ICLR 2026 RSI Workshop summary (OpenReview) انقباض چهار اولیه
- Anthropic Responsible Scaling Policy v3.0 حدّی قابلیت چند هدف.
- DeepMind Frontier Safety Framework v3 نظارت بر تعادل فریبنده به عنوان یک ابتدایی غیر متغیر.
- Schmidhuber (2003). Godel Machines اجداد رسمی این ابتدایی ها
- Anthropic — Claude's Constitution (January 2026) لنگر تعادل مبتنی بر دلیل.
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.