निर्देशों का पालन संरेखण संकेत के रूप में
Type: Learn
Languages: Python (stdlib, toy three-stage pipeline)
Prerequisites: Phase 10 · 06 (SFT), Phase 10 · 07 (RLHF), Phase 10 · 08 (DPO)
Time: ~45 minutes
सीखने के लक्ष्य
- InstructGPT पाइपलाइन के तीन चरणों का नाम दें और प्रत्येक में इस्तेमाल होने वाले नुकसान का नाम दें।
- व्याख्या कीजिए कि मानव प्राथमिकता मूल्यांकन पर निर्देशों से जुड़ा एक 1.3B मॉडल कच्चे 175B GPT-3 से क्यों बेहतर है।
- चरण 3 में KL दंड क्या सुरक्षा प्रदान करता है और इसे हटाने से मोड-खोज व्यवहार में क्यों गिरावट आती है, इसका वर्णन करें।
- संरेखण कर और इसके खिलाफ इस्तेमाल किए गए पीपीओ-पीटीएक्स को कम करने वाले ओयंग आदि का वर्णन करें।
समस्या
पूर्व-शिक्षित भाषा मॉडल पाठ पूरा करते हैं। वे प्रश्नों का उत्तर नहीं देते हैं। GPT-3 से पूछें "पायथन फ़ंक्शन लिखें जो एक सूची को उलट देता है" और आपको अक्सर एक और संकेत मिलता है, क्योंकि प्रशिक्षण वितरण का अधिकांश वेब पाठ है जो अधिक वेब पाठ के साथ जारी है। मॉडल अपना काम कर रहा है काम गलत है।
प्रत्येक गंभीर प्रयोगशाला द्वारा इस समस्या को ठीक करने के लिए इस्तेमाल किया गया प्रॉक्सी मानव प्राथमिकता है। दो पूर्णता एक रेटर के लिए जाती है; रेटर बेहतर एक का चयन करता है; एक पुरस्कार मॉडल रेटर को सीखता है। फिर एक आरएल लूप नीति को आउटपुट की ओर स्थानांतरित करता है पुरस्कार मॉडल स्कोर उच्च है। यह तीन वाक्य में पूर्ण इंस्ट्रक्टजीपीटी थीसिस है। बाकी पेपर इंजीनियरिंग है।
अवधारणा
चरण 1: पर्यवेक्षित सूक्ष्म समायोजन (SFT)
शीघ्र प्रतिक्रिया जोड़े एकत्र करें जहां प्रतिक्रिया वह है जो एक अच्छे इरादे वाले मानव लिखेंगे। Ouyang et al. लेबलरों और OpenAI API से 13k प्रमाणीकरण का उपयोग किया। मानक क्रॉस-एंट्रोपी हानि के साथ इस डेटा पर बेस मॉडल को ठीक से समायोजित करें।
SFT आपको क्या देता हैः मॉडल अब प्रश्नों का जवाब देता है, उन्हें जारी रखने के बजाय। यह आपको क्या नहीं देता हैः कोई संकेत जिसके बारे में रेटर पसंद करता है जब बहुवचन यथार्थवादी होते हैं।
चरण 2: इनाम मॉडल (आरएम)
प्रत्येक प्रॉम्प्ट के लिए, SFT मॉडल से K पूर्णता का नमूना लें। एक लेबलर उन्हें रैंक करता है। एक इनाम मॉडल को प्रशिक्षित करें जो किसी भी प्रॉम्प्ट-रिस्पॉन्स जोड़े को स्कोर करता है ताकि, जोड़े के लिए जहां y_wy_l:
L_RM = -log sigmoid(r(x, y_w) - r(x, y_l))यह ब्रैडली-टेरी जोड़ी प्राथमिकता हानि है। आरएम आमतौर पर एसएफटी मॉडल से आरंभ किया जाता है जिसमें एलएम सिर को स्कारर सिर से प्रतिस्थापित किया जाता है।
पुरस्कार मॉडल छोटे हैंः 175B इंस्ट्रक्टजीपीटी के लिए 6B पर्याप्त था। वे भी नाजुक हैं। पेपर का खंड 5 ज्यादातर पुरस्कार हैकिंग व्यवहार के बारे में है जो छोटे पैमाने पर दिखाई दिया।
चरण 3: पीपीओ के साथ एक KL जुर्माना
लक्ष्य को परिभाषित करेंः
J(pi) = E_{x~D, y~pi(.|x)} [ r(x, y) ] - beta * KL(pi(.|x) || pi_SFT(.|x))पीपीओ के साथ अधिकतम करें।piइसके बिना, अनुकूलक प्रतिकूल उदाहरणों को पाता है स्ट्रिंग जो आरएम के नीचे उच्च स्कोर करते हैं क्योंकि आरएम ने उन्हें कभी नहीं देखा, न कि क्योंकि मनुष्य वास्तव में उन्हें पसंद करते हैं।
KL गुणांक betaबहुत कम: इनाम हैकिंग. बहुत अधिकः एसएफटी पर कोई सुधार नहीं।
संरेखण कर
आरएलएचएफ के बाद, मॉडल को मनुष्यों द्वारा पसंद किया जाता है लेकिन मानक बेंचमार्क (एसक्वाड, हेलास्वाग, डीआरओपी) पर पीछे हटता है। Ouyang et al. इसे संरेखण कर कहते हैं और इसे पीपीओ-पीटीएक्स के साथ तय करते हैंः आरएल लक्ष्य में पूर्व-शिक्षण ग्रेडिएंट्स को मिलाएं ताकि मॉडल यह न भूलें कि कैसे डाउनस्ट्रीम कार्यों को करना है जिसके लिए इसे कभी पुरस्कृत नहीं किया गया था।
J_ptx(pi) = J(pi) + gamma * E_{x~D_pretrain} [ log pi(x) ]पीपीओ-पीटीएक्स मानक बन गया। मानव, डीपमाइंड और मेटा सभी कुछ प्रकार का उपयोग करते हैं।
परिणाम
1.3B InstructGPT (SFT + RM + PPO-ptx) को 175B बेस GPT-3 पर लेबलरों द्वारा लगभग 70% समय में पसंद किया जाता है। उत्पादन यातायात से छिपे हुए परीक्षण संकेतों पर अंतर बढ़ जाता है। इस संख्या को पढ़ने के लिए दो चीजें हैंः
- संरेखण क्षमता से एक अलग अक्ष है। 175 बी मॉडल में अधिक क्षमता थी; 1.3 बी मॉडल में अधिक संरेखण था; लेबलरों ने संरेखित को पसंद किया।
- क्षमता स्तर आधार मॉडल द्वारा निर्धारित किया जाता है आप एक आधार मॉडल को जानने के लिए नहीं कर सकते तथ्य यह कभी नहीं देखा है।
यह चरण 18 के लिए संदर्भ बिंदु क्यों है
बाद के पाठों में हर आलोचना इनाम हैकिंग (पढ़ें 2), डीपीओ (पढ़ें 3), सिकोफैंसी (पढ़ें 4), सीएआई (पढ़ें 5), नींद एजेंट (पढ़ें 7), संरेखण नकली (पढ़ें 9) इस पाइपलाइन के कुछ हिस्से के खिलाफ तर्क देती है। पुरस्कार हैकिंग हमले चरण 2। डीपीओ चरण 2 और 3 में गिर जाता है। CAI मानव लेबलर की जगह लेगा। Sycophancy लेबलर एक पक्षपाती संकेत है पता चलता है। संरेखण का फर्जीकरण दिखाता है कि नीति चरण 3 के आसपास पूरी तरह से मार्ग प्रशस्त कर सकती है। आप इन आलोचनाओं में से किसी को भी अपने सिर में पाइपलाइन के बिना नहीं देख सकते।
इसका प्रयोग करें
code/main.pyखिलौना वरीयता डेटा पर तीन चरणों का अनुकरण करता है। आधार "नीति" कार्रवाई पर एक पक्षपातपूर्ण सिक्का है {A, B, C}. चरण 1 एसएफटी 200 संकेतों पर लेबलर क्रियाओं की नकल करता है। चरण 2 500 जोड़ी क्रम से ब्रैडली-टेरी पुरस्कार मॉडल फिट बैठता है। चरण 3 में एसएफटी नीति के लिए एक KL दंड के साथ पीपीओ को सरल अद्यतन किया जाता है। आप पुरस्कार चढ़ाई देख सकते हैं, KL विचलन बढ़ता है, और नीति बहाव और आप बंद कर सकते हैं KL अवधि पुरस्कार हैकिंग देखने के लिए दिखाई देने के लिए 50 अद्यतन चरणों के भीतर.
क्या देखना हैः
- के साथ पुरस्कार पथ
beta = 0.1vsbeta = 0.0. . - प्रशिक्षण चरणों पर।
- लेबलर प्राथमिकता की तुलना में अंतिम कार्रवाई वितरण।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-instructgpt-explainer.md. आरएलएचएफ पाइपलाइन विवरण या कागजी सार को देखते हुए, यह पता लगाता है कि तीन चरणों में से कौन सा संशोधित किया जा रहा है, प्रत्येक चरण में क्या नुकसान किया जा रहा है, और क्या एक KL दंड या समकक्ष नियामक मौजूद है।
व्यायाम
- दौड़ें
code/main.pyसेटbeta = 0.0एक पैराग्राफ में मोड-खोज व्यवहार की व्याख्या करें।
- प्रतिफल मॉडल को संशोधित करें कार्य B के लिए +0.5 पूर्वाग्रह (एक अनुकरणीय प्रतिफल बग) है। के साथ PPO चलाएं
beta = 0.1क्या KL दंड नीति को पूर्वाग्रह का उपयोग करने से रोकता है?betaक्या शोषण दिखाई देता है?
- Ouyang et al. (arXiv:2203.02155) चित्र 1. 1, 5, 20, 100 चरणों के लिए PPO चलाकर लेबलर-प्राथमिकता वक्र को पुनः प्रस्तुत करें और SFT मॉडल के मुकाबले प्राथमिकता को मापें।
- पेपर के खंड 4.3 में बताया गया है कि 1.3B इंस्ट्रक्टजीपीटी 175B जीपीटी-3 को लगभग 70% समय से अधिक हराता है। छिपे हुए उत्पादन संकेतों पर अनुपात लेबलर के स्वयं के संकेतों की तुलना में अधिक क्यों होगा?
- समान प्राथमिकता डेटा पर पीपीओ हानि को डीपीओ (चरण 10 · 08) से बदलें। अंतिम नीति विचलन (केएल से एसएफटी) और अंतिम इनाम की तुलना करें। किस विधि को मिलान इनाम पर आगे बढ़ना चाहिए?
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| SFT | "instruction tuning" | Stage 1: cross-entropy fine-tune on prompt-response pairs |
| Reward model | "the RM" | Scalar regressor over (prompt, response) trained with Bradley-Terry on pairwise labels |
| Bradley-Terry | "pairwise preference loss" | -log sigmoid(r_w - r_l); reduces pairwise ranking to binary classification |
| KL penalty | "the regularizer" | beta * KL(pi || pi_SFT) — keeps the RL policy near the SFT anchor |
| PPO-ptx | "PPO with pretraining mix" | Adds a fraction of pre-training log-likelihood to the PPO objective to offset the alignment tax |
| Alignment tax | "the RLHF regression" | Post-RLHF drop on standard benchmarks that RLHF did not target |
| Labeler preference | "the ground truth" | Sample of human rankings; the RM is a statistical proxy for this, not for "human values" |
आगे पढ़ना
- Ouyang et al. — Training language models to follow instructions with human feedback (arXiv:2203.02155) इंस्ट्रक्टजीपीटी पेपर, जो प्रत्येक आरएलएचएफ पाइपलाइन के लिए आधार है जो इसके बाद आया
- Stiennon et al. — Learning to summarize from human feedback (arXiv:2009.01325) संक्षेप के लिए आरएलएचएफ पूर्ववर्ती
- Christiano et al. — Deep reinforcement learning from human preferences (arXiv:1706.03741) मूल प्राथमिकता आधारित आरएल सूत्र
- Bai et al. — Training a Helpful and Harmless Assistant with RLHF (arXiv:2204.05862) इंस्ट्रक्टजीपीटी पाइपलाइन का मानव संसाधन विस्तार
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.