الإشراف القابل للتحدي و التعميم الضعيف إلى القوي
Type: Learn
Languages: Python (stdlib, W2SG gap simulator)
Prerequisites: Phase 18 · 01 (instruction-following), Phase 18 · 10 (AI Control), Phase 09 (RL foundations)
Time: ~60 minutes
أهداف التعلم
- تحديد الإشراف القابل للتوسع والعملية الضعيفة إلى القوية وتوضيح كيفية تكملتها.
- وصف إعداد برنز وآخرين التجريبي لعام 2023: ضبط GPT-4 بتحسين باستخدام علامات من GPT-2.
- شرح مقياس الفجوة في الأداء المستردة (PGR) وما الذي يقيسه.
- أوضح آليات الرقابة القابلة للتوسع الثلاث الرئيسية (المناقشة، وتصميم النموذج التكافئ التجاري، وتفكيك المهام) وقوة واحدة لكل منها.
المشكلة
كل تقنية التنظيم حتى الآن في المرحلة 18 تفترض أن المشرف يمكن تقييم سلوك النموذج. عندما يكون النموذج فوق البشر، المشرف هو الرابط الضعيف. سؤال التنظيم الزائد: هل يمكن للمشرف الأضعف أن ينتج بشكل موثوق نموذج أقوى وموافق؟
برنز وغيره. تقليص هذا إلى إعداد تجربي عملي: مراقبة قوية مع ضعيفة، قياس كمية قدرة النموذج القوي على البقاء على قيد الحياة من الإشراف الضعيف. هذا ليس حلًا للتحديد القوي إنه وكيل يسمح لنا بتقييم التقدم.
المفهوم
W2SG: إعداد برنز وغيره
- النموذج الضعيف: فئة GPT-2
- النموذج القوي: فئة GPT-4
- الهدف: سقف قوي GPT-4 على المهمة.
الإجراء:
- الحصول على النموذج الضعيف التنبؤات الصفر في مهمة.
- تحسين النموذج القوي على البيانات الضعيفة.
- قياس دقة النموذج المُحسّن القوي.
خطوط أساسية: دقة النموذج الضعيف، السقف المراقب للنموذج القوي على علامات الذهب.
مقياس الفجوة: الفجوة في الأداء تم استعادتها (PGR) = (مُحسنة - ضعيفة) / (السقف - ضعيف).
(برنز) وغيره من النتائج التجريبية
عبر المهام النمطية، واللغز الشطرنجي، ونموذج الجائزة، كان PGR إيجابيا باستمرار: تمتعميل النموذج القوي خارج أخطاء المشرف الضعيف. يختلف PGR المحدد للمهمة من ~20% إلى ~80٪. "يفهم" النموذج القوي المهمة المقصودة من اللبوابات غير الكاملة، ويملأ مع سابقاته المتدربة مسبقا.
القيود (برنز) وآخرون ملاحظة:
- الفجوة بين الضعيفة والقوية هنا هي القدرة وليس التوجه. النموذج الضعيف متوافق؛ قد يكون نموذج فوق البشري حقاً متوافقًا من قبل الإنسان ولكن مع فجوة قدرة أكبر بكثير.
- قد يكون تعميم النموذج القوي أكثر عن مسؤوليات المهام السابقة من استعادة نية الحقيقة الأرضية.
- إن إثارة المعرفة الخفية للنموذج القوي هي المشكلة الحقيقية؛ قياس PGR عملية محددة.
الإشراف القابل للتوسع: ثلاثة آليات
- Debate (Irving et al. 2018).مثالين من U يجادلان جانباً متناقضاً؛ القضاة الضعفاء يقررون. افتراض: إيجاد إجابة حقيقية مقنعة أسهل من إيجاد إجابة خاطئة مقنعة. أظهر العمل الأخير 2024-2025 (خان وزملاءه، مايكل وزملاءه) أن النقاش يساعد أحياناً و لا يساعد أحياناً، وما إذا كان يساعد يعتمد على بنية المهمة.
- Recursive Reward Modeling (Leike et al. 2018).يُساعدُ U الإنسان على تدريب نموذج الجائزة لـ U + 1.
- Task Decomposition (Christiano, Shlegeris, Amodei 2018).تحلل المهمة الصعبة إلى مهام فرعية يمكن للبشر التحقق منها بشكل متكرر.
كل آلية تفترض شيئا عن بنية المهمة أو التوجه للمكونات المتوسطة.
لماذا الإشراف القابل للتوسع والإشراف على النطاق الكلي يكتملان
الإشراف المتوسع يزيد من نوعية الإشارة الفعالة للمراقب.
W2SG يغلق الفجوة من أي إشارة غير كاملة يمكن للمشرف أن يقدمها.
لانغ وزملاءه النقاش يساعد على التعميم الضعيف إلى القوي (arXiv:2501.13124) يجمع بينها: بروتوكول النقاش يوفر علامات ضعيفة أفضل، ويتم تدريب النموذج القوي على تلك اللوائح.
الدراما التنظيمية
تم حل فريق OpenAI Super alignment في مايو 2024 بعد رحيل جان لايك إلى Anthropic. استمر جدول الأعمال (الإشراف القابل للتوسع ، W2SG ، البحث عن التوجه الآلي) في Anthropic وفي المختبرات الأكاديمية MATS (الدرس 28) ، Redwood (الدرس 10) ، Apollo (الدرس 8) ، METR (الدرس 28). تغيرت الهيكل التنظيمي ؛ لم تكن أسئلة البحث كذلك.
حيث يتناسب هذا مع المرحلة 18
الدرس 6-10 يصف التهديد والنموذج الدفاعي تحت افتراض U غير موثوق به. الدرس 11 هو النموذج الهجومي: جعل المشرف قويًا بما فيه الكفاية للتحقق من مواكبة U. الدرس 12-16 ثم يتحول إلى الأدوات العملية لتقييم المعارضة.
استخدمها
code/main.pyيحاكي تحديد W2SG على مهمة اصطناعية. مؤشر ضعيف له دقة 70٪ مع الأخطاء المهيكلة؛ نموذج قوي لديه سقف 95٪ على علامات الذهب. يمكنك تحديد النموذج القوي على علامات ضعيفة، وقياس PGR، ومقارنة مع قوي على الذهب والضعيف وحدها.
أرسله
هذا الدرس يُنتجoutputs/skill-w2sg-pgr.md. بالنظر إلى وصف إعداد الإشراف، فإنه يحدد المراقب الضعيف، والنموذج القوي، ونوعية الإشراف، ويحسب (أو يطلب) PGR. فإنه يضع علامة على ما إذا كان الادعاء "ضعيف يمكن الإشراف القوي" أو "ضعيف + آلية الإشراف يمكن الإشراف القوي".
التمارين
- أركض
code/main.py. إبلغ PGR للدقة الضعيفة = 0.60، 0.70, 0.80. شرح شكل منحنى PGR.
- تعديل علامة الضعف لتكون لها خطأ هيكلي (على سبيل المثال ، دائما خطأ في فئة مدخل محددة). هل تزيد PGR ، أو تقل ، أو تبقى نفسها؟ شرح.
- اقرأ برنز وزملاءه 2023 القسم 4.3 (مهام النظام النووي). استعادوا الحس "الخسارة المفيدة للثقة": عندما يكون النموذج القوي أكثر ثقة من اللقب الضعيف، من الذي يفوز؟
- صمم بروتوكول مراقبة قابلة للتوسع يجمع بين النقاش وتفكيك المهام لمهمة هندسة البرمجيات. أسمائ وضع فشل واحد لكل مكون و اشرح كيفية حل أو عدم حل كل منهما.
- أوضح ما الذي يجعلك تزوّد ادعاء "التعميم الضعيف إلى القوي هو طريق قابلة للتطبيق" كن محدداً حول التوقيع التجريبي الذي تحتاج إلى رؤيته.
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| Scalable oversight | "making the overseer stronger" | Mechanisms that increase an overseer's ability to evaluate a more-capable model |
| W2SG | "weak supervises strong" | Fine-tuning a strong model on weak labels and measuring the capability recovered |
| PGR | "performance gap recovered" | (fine-tuned - weak) / (ceiling - weak); 1.0 = fully closed, 0 = no help |
| Debate | "two U instances argue" | Scalable oversight mechanism where a weak judge picks between two U defenders |
| RRM | "recursive reward modeling" | U helps train the reward model for U+1; overseer capability tracks U |
| Task decomposition | "sub-tasks the human checks" | Break a hard task into sub-tasks the human can verify, recursively |
| Superalignment | "aligning superhuman AI" | The research agenda concerned with aligning models the human cannot directly evaluate |
المزيد من القراءة
- Burns et al. — Weak-to-Strong Generalization (OpenAI 2023)ورقة W2SG
- Irving, Christiano, Amodei — AI safety via debate (arXiv:1805.00899)آلية النقاش
- Leike et al. — Scalable agent alignment via reward modeling (arXiv:1811.07871) نموذج مكافأة متكرر
- Khan et al. — Debating with More Persuasive LLMs Leads to More Truthful Answers (arXiv:2402.06782) 2024 دراسة تجربية للنقاش مع المناقشين القويين
- Lang et al. — Debate Helps Weak-to-Strong Generalization (arXiv:2501.13124) 2025 مزيج من النقاش + W2SG
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.