Phase 18: Ethics, Safety & Alignment

اتباع التعليمات كإشارة للتنظيم

كل انتقاد لاحقاً لـ RLHF يجادل ضد هذا النظام قبل أن تدرس كيفية تشويه ضغط التحسين للاستثمار، يجب أن ترى الوكالة. ووصفت InstructGPT (Ouyang وآخرون 2022) بنية المرجعية: التكيف الدقيق المراقب على أزواج الاستجابة للتعليمات، ونموذج الجائزة المدرب على تصنيفات الاختيارات المتعددة الأزواج، و PPO ضد نموذج الجائزة مع عقوبة KL لسياسة SFT. تم تفضيل 1.3B InstructGPT على 175B GPT-3. هذه النتيجة الوحيدة هي السبب في أن كل مختبر حدودي في عام 2026 ما زال يرسل خط أنابيب بعد التدريب على شكل RLHF.

Type: Learn

Languages: Python (stdlib, toy three-stage pipeline)

Prerequisites: Phase 10 · 06 (SFT), Phase 10 · 07 (RLHF), Phase 10 · 08 (DPO)

Time: ~45 minutes

أهداف التعلم

  • أسمائ المراحل الثلاثة من خط الأنابيب InstructGPT والخسارة المستخدمة في كل منها.
  • شرح لماذا نموذج 1.3B المنسق مع التعليمات يفوق نموذج 175B GPT-3 الخام في تقييم تفضيلات الإنسان.
  • أوضح ما يحميه عقوبة KL في المرحلة الثالثة ولماذا إنزالها ينهار إلى سلوك البحث عن النظام.
  • وصف ضريبة التحالف والحد من PPO-ptx التي استخدمتها Ouyang et al.

المشكلة

نموذج اللغة المتدربة مسبقاً يكتمل النص. لا يجيب على الأسئلة. اطلب من GPT-3 "كتابة وظيفة Python التي تعكس القائمة" وغالباً ما تحصل على طلب آخر ، لأن معظم توزيع التدريب هو نص ويب يستمر مع المزيد من النص الويب. يقوم النموذج بعمله العمل خاطئ.

وكيل كل مختبر جاد يستخدم لإصلاح هذا هو تفضيل الإنسان. إكمالان تذهب إلى معدل؛ معدل يختار الأفضل؛ نموذج مكافأة يتعلم معدل. ثم حلقة RL تحويل السياسة نحو نتائج نموذج مكافأة أعلى. وهذا هو أطروحة InstructGPT كاملة في ثلاث جمل. البقية من الورقة هي الهندسة.

المفهوم

المرحلة الأولى: التأقلم المراقب (SFT)

جمع أزواج استجابة سريعة حيث يكون الاستجابة ما يكتبه إنسان ذي نوايا جيدة. استخدم Ouyang et al. طلبات 13k من الملصقات و API OpenAI. ضبط النموذج الأساسي على هذه البيانات مع فقدان الانتروبية المتقاطعة القياسية.

ما يمنحه لك SFT: النموذج يرد الآن على الأسئلة بدلاً من مواصلةها. ما لا يمنحه لك: أي إشارة حول الجواب الذي يفضله المقيّم عندما تكون المتعددة معقولة.

المرحلة الثانية: نموذج الجائزة (RM)

لكل طلب، عينة K الإكمالات من نموذج SFT. يقوم المصنفون بتصنيفها. قم بتدريب نموذج مكافأة يسجل أي زوج استجابة طلب بحيث، بالنسبة للزوجات حيث y_wكان مفضلاً علىy_l:

L_RM = -log sigmoid(r(x, y_w) - r(x, y_l))

هذه هي فقدان تفضيل برادلي تيري بالتزاوج. عادة ما يتم تشغيل RM من نموذج SFT مع استبدال رأس LM بال رأس متزاوج.

نموذجات المكافآت صغيرة: 6B كان كافياً لـ 175B InstructGPT. هم أيضاً هشاشة.

المرحلة الثالثة: المشاركة في المشاركة مع عقوبة KL

تحديد الهدف:

J(pi) = E_{x~D, y~pi(.|x)} [ r(x, y) ] - beta * KL(pi(.|x) || pi_SFT(.|x))

أقصى مع PPO. مصطلح KL يحتفظpiبدونها، يجد المحسن أمثلة معادلة السلاسل التي تسجل عالية تحت RM لأن RM لم يرها أبدا، وليس لأن البشر يفضلونها في الواقع.

معدل KL betaهو أهم مفارقة ريال هف. منخفضة جداً: اختراق المكافآت. عالية جداً: لا تحسن على SFT.

ضريبة التحالف

بعد RLHF ، يفضل البشر النموذج ولكن يتراجع على المعايير القياسية (SQuAD ، HellaSwag ، DROP). يطلق على Ouyang et al. هذا ضريبة التنظيم ويحللها مع PPO-ptx: مزج تراجعات ما قبل التدريب في هدف RL حتى لا ينسى النموذج كيفية القيام بالمهام المتدفقة التي لم يتم مكافأتها من أجلها.

J_ptx(pi) = J(pi) + gamma * E_{x~D_pretrain} [ log pi(x) ]

أصبح PPO-ptx قياسياً. إنثروپي، ديب ميند، و ميتا تستخدم جميعها بعض التغيرات.

النتيجة

يفضل المختطفون 1.3B InstructGPT (SFT + RM + PPO-ptx) على GPT-3 القاعدة 175B حوالي 70% من الوقت. يزيد الفجوة على طلبات الاختبار المخفية من حركة الإنتاج. هناك شيئين للاستفادة من هذا الرقم:

  1. التنحي هو محور مختلف عن القدرة. كان نموذج 175B أكثر قدرة؛ كان نموذج 1.3B أكثر تنسيقًا؛ وأفضل الملصقات المتحسن.
  2. قاعدة القدرة هي التي يحددها النموذج الأساسي لا يمكنك أن تُحاول أن تُحاول أن تُحاول أن تعرف النموذج الأساسي

لماذا هذه هي نقطة مرجع للمرحلة 18

كل انتقاد في الدروس اللاحقة اختراق المكافآت (درسة 2) ، DPO (درسة 3) ، التشوه (درسة 4) ، CAI (درسة 5) ، وكلاء النوم (درسة 7) ، التزوير التوافق (درسة 9) يجادل ضد بعض جزء من هذا النزيف. مكافأة هجمات القرصنة المرحلة 2. المرحلة 2 و 3 تحلّ محلّ "CAI" للكتابة البشرية. التشخيص يظهر أن المُسمّع إشارة متحيزة تزوير التحالف يظهر أن السياسة يمكن أن تتحرك حول المرحلة 3 بالكامل. لا يمكنك اتباع أي من هذه النقدات دون أن تكوني في رأسك أولاً

استخدمها

code/main.pyيحاكي المراحل الثلاثة على بيانات تفضيل الألعاب. "سياسة" الأساسية هي عملة متحيزة على الإجراءات {A، B، C}. المرحلة 1 SFT تتقليد على أفعال الملصق على 200 طلب. المرحلة الثانية تتناسب مع نموذج مكافأة برادلي تيري من 500 تصنيف زوجية. المرحلة الثالثة تنظم تحديثات البيانات الخاصة بالشركات المختلفة مع عقوبة KL على سياسة SFT. يمكنك مشاهدة ارتفاع مكافأة، وتزايد اختلافات KL، وتحرك السياسات ويمكنك إيقاف المدة KL لرؤية اختراق مكافأة تظهر في 50 خطوة تحديث.

ما الذي يجب أن ننظر إليه:

  • مسار مكافأة مع beta = 0.1وbeta = 0.0. . .
  • (بالتالي، فإنّه من المفترض أن يكون هناك إمكانية إضافة المزيد من التدريبات إلى خطوات التدريب.
  • توزيع العمل النهائي مقارنة مع تفضيل الملصق.

أرسله

هذا الدرس يُنتجoutputs/skill-instructgpt-explainer.md. في ظل وصف خط أنابيب RLHF أو ملخص ورقي، فإنه يحدد أي من المراحل الثلاثة يتم تعديلها، وما هي الخسائر التي تستخدم في كل مرحلة، وما إذا كانت هناك عقوبة KL أو منظمة متساوية.

التمارين

  1. أركضcode/main.py- أُحددbeta = 0.0ويقومون بتقديم تقرير عن توزيع العمل بعد 200 خطوة من خطوات PPO.
  1. تعديل نموذج المكافأة ليكون لديه تحيز +0.5 للعمل B (خطأ مكافأة محاكاة). تشغيل PPO مع beta = 0.1هل عقوبة ك.إل تمنع السياسة من استغلال التحيز؟betaهل يصبح الاستغلال واضحاً؟
  1. اقرأ Ouyang et al. (arXiv:2203.02155) الشكل 1. إعادة إنتاج منحنى التسمية-التفضيلة عن طريق تشغيل PPO لمدة 1, 5, 20, 100 خطوة وقياس التفضيل ضد نموذج SFT.
  1. تقرير القسم 4.3 من الورقة 1.3B InstructGPT يضرب 175B GPT-3 حوالي 70% من الوقت. لماذا يكون النسبة أعلى على طلبات الإنتاج المخفية من على طلبات الملصق نفسه؟
  1. استبدل خسارة PPO ب DPO (مرحلة 10 · 08) على نفس البيانات التفضلية. مقارنة الانحراف النهائي للسياسة (KL إلى SFT) والمكافأة النهائية. أي طريقة تنحرف أكثر عند مكافأة مطابقة؟

الشروط الرئيسية

TermWhat people sayWhat it actually means
SFT"instruction tuning"Stage 1: cross-entropy fine-tune on prompt-response pairs
Reward model"the RM"Scalar regressor over (prompt, response) trained with Bradley-Terry on pairwise labels
Bradley-Terry"pairwise preference loss"-log sigmoid(r_w - r_l); reduces pairwise ranking to binary classification
KL penalty"the regularizer"beta * KL(pi || pi_SFT) — keeps the RL policy near the SFT anchor
PPO-ptx"PPO with pretraining mix"Adds a fraction of pre-training log-likelihood to the PPO objective to offset the alignment tax
Alignment tax"the RLHF regression"Post-RLHF drop on standard benchmarks that RLHF did not target
Labeler preference"the ground truth"Sample of human rankings; the RM is a statistical proxy for this, not for "human values"

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.