نظارت قابل مقیاس بندی و عمومی سازی ضعیف تا قوی
Type: Learn
Languages: Python (stdlib, W2SG gap simulator)
Prerequisites: Phase 18 · 01 (instruction-following), Phase 18 · 10 (AI Control), Phase 09 (RL foundations)
Time: ~60 minutes
اهداف یادگیری
- نظارت مقیاس پذیر و کلی سازی ضعیف تا قوی را تعریف کنید و توضیح دهید که چگونه مکمل هستند.
- تنظیمات تجربی Burns et al. 2023 را توصیف کنید: GPT-4 را با استفاده از برچسب های GPT-2 تنظیم کنید.
- متریک شکاف عملکرد بازیافت شده (PGR) و آنچه را که اندازه گیری می کند را توضیح دهید.
- سه مکانیسم اصلی نظارت مقیاس پذیر (بحث، مدل سازی پاداش مکرر، تجزیه وظایف) و یک قدرت هر یک را بیان کنید.
مشکل
هر تکنیک تعاونی تا کنون در مرحله 18 فرض می کند که ناظری می تواند رفتار مدل را ارزیابی کند. وقتی مدل فوق انسانی است، ناظری پیوند ضعیف است. سوال فوق تعاونی: آیا یک ناظری ضعیف تر می تواند به طور قابل اعتماد یک مدل قوی تر و تعاونی را تولید کند؟
برنز و همکاران این را به یک تنظیم تجربی عملیاتی محدود می کنند: نظارت قوی با ضعیف، اندازه گیری اینکه چقدر از توانایی مدل قوی از نظارت ضعیف زنده می ماند. این یک راه حل برای تعاونی بیش از حد نیست.
مفهوم
W2SG: تنظیمات برنز و همکاران
- مدل ضعیف: کلاس GPT-2
- مدل قوی: کلاس GPT-4
- هدف: سقف قوي GPT-4 در کار
روش:
- پيش بيني هاي صفر شوت مدل ضعيف رو در مورد يه کار بدست بيار
- مدل قوی را با داده های ضعیف مشخص کنید.
- دقت مدل قوی و دقیق را اندازه گیری کنید.
خط پایه: دقت ضعیف مدل، سقف نظارت شده مدل قوی در برچسب های طلا.
متریک شکاف: بازیافت شکاف عملکرد (PGR) = (مستقیم - ضعیف) / (سقف - ضعیف) PGR 1.0 به معنای نظارت ضعیف شکاف را به طور کامل می پوشاند؛ PGR 0 به معنای نظارت ضعیف کمک نکرد.
برنز و همکاران یافته های تجربی
در این زمینه، PGR به طور مداوم مثبت بود: مدل قوی فراتر از اشتباهات سرپرست ضعیف عمومی شده است. PGR خاص به وظایف از ~20% تا ~80% متفاوت است. مدل قوی از برچسب های نامکمل، تکمیل با پیش از خود را آموزش داده است.
محدودیت های Burns و همکاران توجه کنید:
- شکاف بین ضعیف و قوی در اینجا توانایی است نه هماهنگی. مدل ضعیف هماهنگی دارد؛ یک مدل واقعا فوق انسانی ممکن است توسط یک انسان هماهنگی داشته باشد اما با شکاف توانایی بسیار بزرگتر.
- کلی سازی مدل قوی ممکن است بیشتر در مورد پیش فرض وظایف باشد تا اینکه در مورد بازیابی هدف حقیقت اصلی باشد.
- ایجاد دانش پنهان مدل قوی مشکل واقعی است؛ PGR یک عملیاتی خاص را اندازه گیری می کند.
نظارت قابل مقیاس بندی: سه مکانیسم
- Debate (Irving et al. 2018).دو مورد از U با طرف های مخالف بحث می کنند؛ قاضی ضعیف تصمیم می گیرد. فرض: پیدا کردن یک پاسخ واقعی قانع کننده آسان تر از پیدا کردن یک پاسخ نادرست قانع کننده است. کار اخیر 2024-2025 (خان و همکاران، مایکل و همکاران) نشان می دهد بحث گاهی کمک می کند و گاهی نمی کند، و اینکه آیا کمک می کند بستگی به ساختار کار دارد.
- Recursive Reward Modeling (Leike et al. 2018).U به انسان کمک می کند تا مدل پاداش برای U + 1 را آموزش دهد. توانایی موثر ناظر با مدل رشد می کند.
- Task Decomposition (Christiano, Shlegeris, Amodei 2018).يه کار سخت رو به ذيلي کار هاي قابل به بررسی انسان ميکنه.
هر مکانیسم چیزی در مورد ساختار کار یا موازی اجزای میانگین را فرض می کند.
چرا نظارت مقیاس پذیر و W2SG مکمل هستند
نظارت قابل مقیاس باعث افزایش کیفیت سیگنال موثر نظارت کننده می شود.
W2SG شکاف را از هر سیگنال نامکمل که ناظر می تواند ارائه دهد، می پوشاند.
Lang et al. بحث کمک می کند عمومی سازی ضعیف تا قوی (arXiv:2501.13124) آنها را ترکیب می کند: پروتکل بحث برچسب های ضعیف بهتر را فراهم می کند و مدل قوی بر روی این برچسب ها آموزش داده می شود. گزارش شده افزایش PGR در وظایف NLP.
درام سازمان
تیم Superalignment OpenAI در ماه مه 2024 پس از خروج جان لیک به Anthropic منحل شد. دستور کار ( نظارت مقیاس پذیر، W2SG، تحقیقات تعاونی خودکار) در Anthropic و در آزمایشگاه های دانشگاهی ادامه یافت.
جایی که این در مرحله 18 قرار داره
دروس 6-10 تهدید و پارادایم دفاعی را تحت فرض U غیر قابل اعتماد توصیف می کند. دروس 11 پارادایم تهاجمی است: نظارت کننده را به اندازه کافی قوی کنید تا موازی U را تأیید کند. دروس 12-16 سپس به ابزار عملی ارزیابی خصومت تبدیل می شود.
ازش استفاده کن
code/main.pyشبیه سازی یک W2SG fine-tune در یک کار مصنوعی. برچسب ضعیف دارای دقت 70٪ با خطاهای ساختاری است؛ مدل قوی دارای 95٪ سقف در برچسب های طلا است. شما مدل قوی را در برچسب های ضعیف fine-tune می کنید، PGR را اندازه گیری می کنید و با قوی بر روی طلا و ضعیف به تنهایی مقایسه می کنید.
-باده
این درس به ما کمک می کندoutputs/skill-w2sg-pgr.md. در نظر گرفتن یک توصیف تنظیمات نظارت، آن را شناسایی ضعیف نظارت کننده، مدل قوی، کیفیت نظارت، و محاسبه (یا درخواست) PGR. آن نشان می دهد که آیا ادعا "ضعف می تواند نظارت قوی" یا "ضعف + مکانیسم نظارت می تواند نظارت قوی".
تمرینات
- فرار کن
code/main.py. گزارش PGR برای ضعیف_درست = 0.60, 0.70, 0.80. شکل منحنی PGR را توضیح دهید.
- تغییر برچسب ضعیف برای داشتن خطای ساختاری (به عنوان مثال، همیشه در یک کلاس ورودی خاص اشتباه است). آیا PGR افزایش می یابد، کاهش می یابد یا باقی می ماند؟ توضیح دهید.
- برنز و همکارانش را بخوانید 2023 بخش 4.3 (کار های NLP). اینوئتیو "نقصان پشتیبان اعتماد" را تکرار کنید: وقتی مدل قوی اعتماد به نفس بیشتری نسبت به برچسب های ضعیف دارد، چه کسی برنده می شود؟
- یک پروتکل نظارت مقیاس پذیر طراحی کنید که بحث و تجزیه وظایف را برای یک کار مهندسی نرم افزار ترکیب کند. یک حالت شکست هر جزء را نام ببرید و توضیح دهید که چگونه ترکیبی به هر یک از آنها رسیدگی می کند یا نمی تواند به آنها رسیدگی کند.
- توضیح دهید که چه چیزی ادعا "اعمالی ضعیف تا قوی یک مسیر قابل اجرا برای برقراری ارتباط" را جعلی می کند. در مورد امضای تجربی که باید ببینید مشخص باشید.
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| Scalable oversight | "making the overseer stronger" | Mechanisms that increase an overseer's ability to evaluate a more-capable model |
| W2SG | "weak supervises strong" | Fine-tuning a strong model on weak labels and measuring the capability recovered |
| PGR | "performance gap recovered" | (fine-tuned - weak) / (ceiling - weak); 1.0 = fully closed, 0 = no help |
| Debate | "two U instances argue" | Scalable oversight mechanism where a weak judge picks between two U defenders |
| RRM | "recursive reward modeling" | U helps train the reward model for U+1; overseer capability tracks U |
| Task decomposition | "sub-tasks the human checks" | Break a hard task into sub-tasks the human can verify, recursively |
| Superalignment | "aligning superhuman AI" | The research agenda concerned with aligning models the human cannot directly evaluate |
خواندن بیشتر
- Burns et al. — Weak-to-Strong Generalization (OpenAI 2023) ورق W2SG
- Irving, Christiano, Amodei — AI safety via debate (arXiv:1805.00899) مکانیسم بحث
- Leike et al. — Scalable agent alignment via reward modeling (arXiv:1811.07871) مدل سازی پاداش تکراری
- Khan et al. — Debating with More Persuasive LLMs Leads to More Truthful Answers (arXiv:2402.06782) 2024 مطالعه تجربی بحث با بحث کنندگان قوی تر
- Lang et al. — Debate Helps Weak-to-Strong Generalization (arXiv:2501.13124) 2025 ترکیب بحث + W2SG
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.