اتباع التعليمات كإشارة للتنظيم
Type: Learn
Languages: Python (stdlib, toy three-stage pipeline)
Prerequisites: Phase 10 · 06 (SFT), Phase 10 · 07 (RLHF), Phase 10 · 08 (DPO)
Time: ~45 minutes
أهداف التعلم
- أسمائ المراحل الثلاثة من خط الأنابيب InstructGPT والخسارة المستخدمة في كل منها.
- شرح لماذا نموذج 1.3B المنسق مع التعليمات يفوق نموذج 175B GPT-3 الخام في تقييم تفضيلات الإنسان.
- أوضح ما يحميه عقوبة KL في المرحلة الثالثة ولماذا إنزالها ينهار إلى سلوك البحث عن النظام.
- وصف ضريبة التحالف والحد من PPO-ptx التي استخدمتها Ouyang et al.
المشكلة
نموذج اللغة المتدربة مسبقاً يكتمل النص. لا يجيب على الأسئلة. اطلب من GPT-3 "كتابة وظيفة Python التي تعكس القائمة" وغالباً ما تحصل على طلب آخر ، لأن معظم توزيع التدريب هو نص ويب يستمر مع المزيد من النص الويب. يقوم النموذج بعمله العمل خاطئ.
وكيل كل مختبر جاد يستخدم لإصلاح هذا هو تفضيل الإنسان. إكمالان تذهب إلى معدل؛ معدل يختار الأفضل؛ نموذج مكافأة يتعلم معدل. ثم حلقة RL تحويل السياسة نحو نتائج نموذج مكافأة أعلى. وهذا هو أطروحة InstructGPT كاملة في ثلاث جمل. البقية من الورقة هي الهندسة.
المفهوم
المرحلة الأولى: التأقلم المراقب (SFT)
جمع أزواج استجابة سريعة حيث يكون الاستجابة ما يكتبه إنسان ذي نوايا جيدة. استخدم Ouyang et al. طلبات 13k من الملصقات و API OpenAI. ضبط النموذج الأساسي على هذه البيانات مع فقدان الانتروبية المتقاطعة القياسية.
ما يمنحه لك SFT: النموذج يرد الآن على الأسئلة بدلاً من مواصلةها. ما لا يمنحه لك: أي إشارة حول الجواب الذي يفضله المقيّم عندما تكون المتعددة معقولة.
المرحلة الثانية: نموذج الجائزة (RM)
لكل طلب، عينة K الإكمالات من نموذج SFT. يقوم المصنفون بتصنيفها. قم بتدريب نموذج مكافأة يسجل أي زوج استجابة طلب بحيث، بالنسبة للزوجات حيث y_wكان مفضلاً علىy_l:
L_RM = -log sigmoid(r(x, y_w) - r(x, y_l))هذه هي فقدان تفضيل برادلي تيري بالتزاوج. عادة ما يتم تشغيل RM من نموذج SFT مع استبدال رأس LM بال رأس متزاوج.
نموذجات المكافآت صغيرة: 6B كان كافياً لـ 175B InstructGPT. هم أيضاً هشاشة.
المرحلة الثالثة: المشاركة في المشاركة مع عقوبة KL
تحديد الهدف:
J(pi) = E_{x~D, y~pi(.|x)} [ r(x, y) ] - beta * KL(pi(.|x) || pi_SFT(.|x))أقصى مع PPO. مصطلح KL يحتفظpiبدونها، يجد المحسن أمثلة معادلة السلاسل التي تسجل عالية تحت RM لأن RM لم يرها أبدا، وليس لأن البشر يفضلونها في الواقع.
معدل KL betaهو أهم مفارقة ريال هف. منخفضة جداً: اختراق المكافآت. عالية جداً: لا تحسن على SFT.
ضريبة التحالف
بعد RLHF ، يفضل البشر النموذج ولكن يتراجع على المعايير القياسية (SQuAD ، HellaSwag ، DROP). يطلق على Ouyang et al. هذا ضريبة التنظيم ويحللها مع PPO-ptx: مزج تراجعات ما قبل التدريب في هدف RL حتى لا ينسى النموذج كيفية القيام بالمهام المتدفقة التي لم يتم مكافأتها من أجلها.
J_ptx(pi) = J(pi) + gamma * E_{x~D_pretrain} [ log pi(x) ]أصبح PPO-ptx قياسياً. إنثروپي، ديب ميند، و ميتا تستخدم جميعها بعض التغيرات.
النتيجة
يفضل المختطفون 1.3B InstructGPT (SFT + RM + PPO-ptx) على GPT-3 القاعدة 175B حوالي 70% من الوقت. يزيد الفجوة على طلبات الاختبار المخفية من حركة الإنتاج. هناك شيئين للاستفادة من هذا الرقم:
- التنحي هو محور مختلف عن القدرة. كان نموذج 175B أكثر قدرة؛ كان نموذج 1.3B أكثر تنسيقًا؛ وأفضل الملصقات المتحسن.
- قاعدة القدرة هي التي يحددها النموذج الأساسي لا يمكنك أن تُحاول أن تُحاول أن تُحاول أن تعرف النموذج الأساسي
لماذا هذه هي نقطة مرجع للمرحلة 18
كل انتقاد في الدروس اللاحقة اختراق المكافآت (درسة 2) ، DPO (درسة 3) ، التشوه (درسة 4) ، CAI (درسة 5) ، وكلاء النوم (درسة 7) ، التزوير التوافق (درسة 9) يجادل ضد بعض جزء من هذا النزيف. مكافأة هجمات القرصنة المرحلة 2. المرحلة 2 و 3 تحلّ محلّ "CAI" للكتابة البشرية. التشخيص يظهر أن المُسمّع إشارة متحيزة تزوير التحالف يظهر أن السياسة يمكن أن تتحرك حول المرحلة 3 بالكامل. لا يمكنك اتباع أي من هذه النقدات دون أن تكوني في رأسك أولاً
استخدمها
code/main.pyيحاكي المراحل الثلاثة على بيانات تفضيل الألعاب. "سياسة" الأساسية هي عملة متحيزة على الإجراءات {A، B، C}. المرحلة 1 SFT تتقليد على أفعال الملصق على 200 طلب. المرحلة الثانية تتناسب مع نموذج مكافأة برادلي تيري من 500 تصنيف زوجية. المرحلة الثالثة تنظم تحديثات البيانات الخاصة بالشركات المختلفة مع عقوبة KL على سياسة SFT. يمكنك مشاهدة ارتفاع مكافأة، وتزايد اختلافات KL، وتحرك السياسات ويمكنك إيقاف المدة KL لرؤية اختراق مكافأة تظهر في 50 خطوة تحديث.
ما الذي يجب أن ننظر إليه:
- مسار مكافأة مع
beta = 0.1وbeta = 0.0. . . - (بالتالي، فإنّه من المفترض أن يكون هناك إمكانية إضافة المزيد من التدريبات إلى خطوات التدريب.
- توزيع العمل النهائي مقارنة مع تفضيل الملصق.
أرسله
هذا الدرس يُنتجoutputs/skill-instructgpt-explainer.md. في ظل وصف خط أنابيب RLHF أو ملخص ورقي، فإنه يحدد أي من المراحل الثلاثة يتم تعديلها، وما هي الخسائر التي تستخدم في كل مرحلة، وما إذا كانت هناك عقوبة KL أو منظمة متساوية.
التمارين
- أركض
code/main.py- أُحددbeta = 0.0ويقومون بتقديم تقرير عن توزيع العمل بعد 200 خطوة من خطوات PPO.
- تعديل نموذج المكافأة ليكون لديه تحيز +0.5 للعمل B (خطأ مكافأة محاكاة). تشغيل PPO مع
beta = 0.1هل عقوبة ك.إل تمنع السياسة من استغلال التحيز؟betaهل يصبح الاستغلال واضحاً؟
- اقرأ Ouyang et al. (arXiv:2203.02155) الشكل 1. إعادة إنتاج منحنى التسمية-التفضيلة عن طريق تشغيل PPO لمدة 1, 5, 20, 100 خطوة وقياس التفضيل ضد نموذج SFT.
- تقرير القسم 4.3 من الورقة 1.3B InstructGPT يضرب 175B GPT-3 حوالي 70% من الوقت. لماذا يكون النسبة أعلى على طلبات الإنتاج المخفية من على طلبات الملصق نفسه؟
- استبدل خسارة PPO ب DPO (مرحلة 10 · 08) على نفس البيانات التفضلية. مقارنة الانحراف النهائي للسياسة (KL إلى SFT) والمكافأة النهائية. أي طريقة تنحرف أكثر عند مكافأة مطابقة؟
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| SFT | "instruction tuning" | Stage 1: cross-entropy fine-tune on prompt-response pairs |
| Reward model | "the RM" | Scalar regressor over (prompt, response) trained with Bradley-Terry on pairwise labels |
| Bradley-Terry | "pairwise preference loss" | -log sigmoid(r_w - r_l); reduces pairwise ranking to binary classification |
| KL penalty | "the regularizer" | beta * KL(pi || pi_SFT) — keeps the RL policy near the SFT anchor |
| PPO-ptx | "PPO with pretraining mix" | Adds a fraction of pre-training log-likelihood to the PPO objective to offset the alignment tax |
| Alignment tax | "the RLHF regression" | Post-RLHF drop on standard benchmarks that RLHF did not target |
| Labeler preference | "the ground truth" | Sample of human rankings; the RM is a statistical proxy for this, not for "human values" |
المزيد من القراءة
- Ouyang et al. — Training language models to follow instructions with human feedback (arXiv:2203.02155)ورقة "InstructGPT" ، التي كانت أساس كل خط أنابيب RLHF الذي اتبع
- Stiennon et al. — Learning to summarize from human feedback (arXiv:2009.01325) سلف RLHF للجمع
- Christiano et al. — Deep reinforcement learning from human preferences (arXiv:1706.03741) الصيغة الأصلية للـ RL القائمة على التفضيلات
- Bai et al. — Training a Helpful and Harmless Assistant with RLHF (arXiv:2204.05862) تمديد HH من شركة Anthropic لخط الأنابيب InstructGPT
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.