Phase 18: Ethics, Safety & Alignment

निर्देशों का पालन संरेखण संकेत के रूप में

आरएलएचएफ की हर बाद की आलोचना इस पाइपलाइन के खिलाफ तर्क देती है। इससे पहले कि आप अध्ययन करें कि अनुकूलन दबाव प्रॉक्सी को कैसे विकृत करता है, आपको प्रॉक्सी को देखना होगा। InstructGPT (Ouyang et al., 2022) ने संदर्भ वास्तुकला को परिभाषित कियाः निर्देश-उत्तर जोड़े पर पर्यवेक्षित बारीक-बारी से समायोजन, जोड़े-तरह की प्राथमिकता रैंकिंग पर प्रशिक्षित पुरस्कार मॉडल, और एसएफटी नीति के लिए एक KL दंड के साथ पुरस्कार मॉडल के खिलाफ पीपीओ। एक 1.3B इंस्ट्रक्टजीपीटी को 175B जीपीटी-3 से अधिक पसंद किया गया था। यह एक ही परिणाम है कि 2026 में हर सीमांत प्रयोगशाला अभी भी RLHF के आकार में पोस्ट-प्रशिक्षण पाइपलाइन भेजता है।

Type: Learn

Languages: Python (stdlib, toy three-stage pipeline)

Prerequisites: Phase 10 · 06 (SFT), Phase 10 · 07 (RLHF), Phase 10 · 08 (DPO)

Time: ~45 minutes

सीखने के लक्ष्य

  • InstructGPT पाइपलाइन के तीन चरणों का नाम दें और प्रत्येक में इस्तेमाल होने वाले नुकसान का नाम दें।
  • व्याख्या कीजिए कि मानव प्राथमिकता मूल्यांकन पर निर्देशों से जुड़ा एक 1.3B मॉडल कच्चे 175B GPT-3 से क्यों बेहतर है।
  • चरण 3 में KL दंड क्या सुरक्षा प्रदान करता है और इसे हटाने से मोड-खोज व्यवहार में क्यों गिरावट आती है, इसका वर्णन करें।
  • संरेखण कर और इसके खिलाफ इस्तेमाल किए गए पीपीओ-पीटीएक्स को कम करने वाले ओयंग आदि का वर्णन करें।

समस्या

पूर्व-शिक्षित भाषा मॉडल पाठ पूरा करते हैं। वे प्रश्नों का उत्तर नहीं देते हैं। GPT-3 से पूछें "पायथन फ़ंक्शन लिखें जो एक सूची को उलट देता है" और आपको अक्सर एक और संकेत मिलता है, क्योंकि प्रशिक्षण वितरण का अधिकांश वेब पाठ है जो अधिक वेब पाठ के साथ जारी है। मॉडल अपना काम कर रहा है काम गलत है।

प्रत्येक गंभीर प्रयोगशाला द्वारा इस समस्या को ठीक करने के लिए इस्तेमाल किया गया प्रॉक्सी मानव प्राथमिकता है। दो पूर्णता एक रेटर के लिए जाती है; रेटर बेहतर एक का चयन करता है; एक पुरस्कार मॉडल रेटर को सीखता है। फिर एक आरएल लूप नीति को आउटपुट की ओर स्थानांतरित करता है पुरस्कार मॉडल स्कोर उच्च है। यह तीन वाक्य में पूर्ण इंस्ट्रक्टजीपीटी थीसिस है। बाकी पेपर इंजीनियरिंग है।

अवधारणा

चरण 1: पर्यवेक्षित सूक्ष्म समायोजन (SFT)

शीघ्र प्रतिक्रिया जोड़े एकत्र करें जहां प्रतिक्रिया वह है जो एक अच्छे इरादे वाले मानव लिखेंगे। Ouyang et al. लेबलरों और OpenAI API से 13k प्रमाणीकरण का उपयोग किया। मानक क्रॉस-एंट्रोपी हानि के साथ इस डेटा पर बेस मॉडल को ठीक से समायोजित करें।

SFT आपको क्या देता हैः मॉडल अब प्रश्नों का जवाब देता है, उन्हें जारी रखने के बजाय। यह आपको क्या नहीं देता हैः कोई संकेत जिसके बारे में रेटर पसंद करता है जब बहुवचन यथार्थवादी होते हैं।

चरण 2: इनाम मॉडल (आरएम)

प्रत्येक प्रॉम्प्ट के लिए, SFT मॉडल से K पूर्णता का नमूना लें। एक लेबलर उन्हें रैंक करता है। एक इनाम मॉडल को प्रशिक्षित करें जो किसी भी प्रॉम्प्ट-रिस्पॉन्स जोड़े को स्कोर करता है ताकि, जोड़े के लिए जहां y_wy_l:

L_RM = -log sigmoid(r(x, y_w) - r(x, y_l))

यह ब्रैडली-टेरी जोड़ी प्राथमिकता हानि है। आरएम आमतौर पर एसएफटी मॉडल से आरंभ किया जाता है जिसमें एलएम सिर को स्कारर सिर से प्रतिस्थापित किया जाता है।

पुरस्कार मॉडल छोटे हैंः 175B इंस्ट्रक्टजीपीटी के लिए 6B पर्याप्त था। वे भी नाजुक हैं। पेपर का खंड 5 ज्यादातर पुरस्कार हैकिंग व्यवहार के बारे में है जो छोटे पैमाने पर दिखाई दिया।

चरण 3: पीपीओ के साथ एक KL जुर्माना

लक्ष्य को परिभाषित करेंः

J(pi) = E_{x~D, y~pi(.|x)} [ r(x, y) ] - beta * KL(pi(.|x) || pi_SFT(.|x))

पीपीओ के साथ अधिकतम करें।piइसके बिना, अनुकूलक प्रतिकूल उदाहरणों को पाता है स्ट्रिंग जो आरएम के नीचे उच्च स्कोर करते हैं क्योंकि आरएम ने उन्हें कभी नहीं देखा, न कि क्योंकि मनुष्य वास्तव में उन्हें पसंद करते हैं।

KL गुणांक betaबहुत कम: इनाम हैकिंग. बहुत अधिकः एसएफटी पर कोई सुधार नहीं।

संरेखण कर

आरएलएचएफ के बाद, मॉडल को मनुष्यों द्वारा पसंद किया जाता है लेकिन मानक बेंचमार्क (एसक्वाड, हेलास्वाग, डीआरओपी) पर पीछे हटता है। Ouyang et al. इसे संरेखण कर कहते हैं और इसे पीपीओ-पीटीएक्स के साथ तय करते हैंः आरएल लक्ष्य में पूर्व-शिक्षण ग्रेडिएंट्स को मिलाएं ताकि मॉडल यह न भूलें कि कैसे डाउनस्ट्रीम कार्यों को करना है जिसके लिए इसे कभी पुरस्कृत नहीं किया गया था।

J_ptx(pi) = J(pi) + gamma * E_{x~D_pretrain} [ log pi(x) ]

पीपीओ-पीटीएक्स मानक बन गया। मानव, डीपमाइंड और मेटा सभी कुछ प्रकार का उपयोग करते हैं।

परिणाम

1.3B InstructGPT (SFT + RM + PPO-ptx) को 175B बेस GPT-3 पर लेबलरों द्वारा लगभग 70% समय में पसंद किया जाता है। उत्पादन यातायात से छिपे हुए परीक्षण संकेतों पर अंतर बढ़ जाता है। इस संख्या को पढ़ने के लिए दो चीजें हैंः

  1. संरेखण क्षमता से एक अलग अक्ष है। 175 बी मॉडल में अधिक क्षमता थी; 1.3 बी मॉडल में अधिक संरेखण था; लेबलरों ने संरेखित को पसंद किया।
  2. क्षमता स्तर आधार मॉडल द्वारा निर्धारित किया जाता है आप एक आधार मॉडल को जानने के लिए नहीं कर सकते तथ्य यह कभी नहीं देखा है।

यह चरण 18 के लिए संदर्भ बिंदु क्यों है

बाद के पाठों में हर आलोचना इनाम हैकिंग (पढ़ें 2), डीपीओ (पढ़ें 3), सिकोफैंसी (पढ़ें 4), सीएआई (पढ़ें 5), नींद एजेंट (पढ़ें 7), संरेखण नकली (पढ़ें 9) इस पाइपलाइन के कुछ हिस्से के खिलाफ तर्क देती है। पुरस्कार हैकिंग हमले चरण 2। डीपीओ चरण 2 और 3 में गिर जाता है। CAI मानव लेबलर की जगह लेगा। Sycophancy लेबलर एक पक्षपाती संकेत है पता चलता है। संरेखण का फर्जीकरण दिखाता है कि नीति चरण 3 के आसपास पूरी तरह से मार्ग प्रशस्त कर सकती है। आप इन आलोचनाओं में से किसी को भी अपने सिर में पाइपलाइन के बिना नहीं देख सकते।

इसका प्रयोग करें

code/main.pyखिलौना वरीयता डेटा पर तीन चरणों का अनुकरण करता है। आधार "नीति" कार्रवाई पर एक पक्षपातपूर्ण सिक्का है {A, B, C}. चरण 1 एसएफटी 200 संकेतों पर लेबलर क्रियाओं की नकल करता है। चरण 2 500 जोड़ी क्रम से ब्रैडली-टेरी पुरस्कार मॉडल फिट बैठता है। चरण 3 में एसएफटी नीति के लिए एक KL दंड के साथ पीपीओ को सरल अद्यतन किया जाता है। आप पुरस्कार चढ़ाई देख सकते हैं, KL विचलन बढ़ता है, और नीति बहाव और आप बंद कर सकते हैं KL अवधि पुरस्कार हैकिंग देखने के लिए दिखाई देने के लिए 50 अद्यतन चरणों के भीतर.

क्या देखना हैः

  • के साथ पुरस्कार पथbeta = 0.1vs beta = 0.0. .
  • प्रशिक्षण चरणों पर।
  • लेबलर प्राथमिकता की तुलना में अंतिम कार्रवाई वितरण।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-instructgpt-explainer.md. आरएलएचएफ पाइपलाइन विवरण या कागजी सार को देखते हुए, यह पता लगाता है कि तीन चरणों में से कौन सा संशोधित किया जा रहा है, प्रत्येक चरण में क्या नुकसान किया जा रहा है, और क्या एक KL दंड या समकक्ष नियामक मौजूद है।

व्यायाम

  1. दौड़ेंcode/main.pyसेटbeta = 0.0एक पैराग्राफ में मोड-खोज व्यवहार की व्याख्या करें।
  1. प्रतिफल मॉडल को संशोधित करें कार्य B के लिए +0.5 पूर्वाग्रह (एक अनुकरणीय प्रतिफल बग) है। के साथ PPO चलाएंbeta = 0.1क्या KL दंड नीति को पूर्वाग्रह का उपयोग करने से रोकता है?betaक्या शोषण दिखाई देता है?
  1. Ouyang et al. (arXiv:2203.02155) चित्र 1. 1, 5, 20, 100 चरणों के लिए PPO चलाकर लेबलर-प्राथमिकता वक्र को पुनः प्रस्तुत करें और SFT मॉडल के मुकाबले प्राथमिकता को मापें।
  1. पेपर के खंड 4.3 में बताया गया है कि 1.3B इंस्ट्रक्टजीपीटी 175B जीपीटी-3 को लगभग 70% समय से अधिक हराता है। छिपे हुए उत्पादन संकेतों पर अनुपात लेबलर के स्वयं के संकेतों की तुलना में अधिक क्यों होगा?
  1. समान प्राथमिकता डेटा पर पीपीओ हानि को डीपीओ (चरण 10 · 08) से बदलें। अंतिम नीति विचलन (केएल से एसएफटी) और अंतिम इनाम की तुलना करें। किस विधि को मिलान इनाम पर आगे बढ़ना चाहिए?

प्रमुख शर्तें

TermWhat people sayWhat it actually means
SFT"instruction tuning"Stage 1: cross-entropy fine-tune on prompt-response pairs
Reward model"the RM"Scalar regressor over (prompt, response) trained with Bradley-Terry on pairwise labels
Bradley-Terry"pairwise preference loss"-log sigmoid(r_w - r_l); reduces pairwise ranking to binary classification
KL penalty"the regularizer"beta * KL(pi || pi_SFT) — keeps the RL policy near the SFT anchor
PPO-ptx"PPO with pretraining mix"Adds a fraction of pre-training log-likelihood to the PPO objective to offset the alignment tax
Alignment tax"the RLHF regression"Post-RLHF drop on standard benchmarks that RLHF did not target
Labeler preference"the ground truth"Sample of human rankings; the RM is a statistical proxy for this, not for "human values"

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.