स्केलेबल पर्यवेक्षण और कमजोर से मजबूत सामान्यीकरण
Type: Learn
Languages: Python (stdlib, W2SG gap simulator)
Prerequisites: Phase 18 · 01 (instruction-following), Phase 18 · 10 (AI Control), Phase 09 (RL foundations)
Time: ~60 minutes
सीखने के लक्ष्य
- स्केलेबल पर्यवेक्षण और कमजोर से मजबूत सामान्यीकरण को परिभाषित करें और समझाएं कि वे कैसे पूरक हैं।
- Burns et al. 2023 प्रयोगात्मक सेटअप का वर्णन करेंः GPT-4 को GPT-2 से लेबल का उपयोग करके ठीक से समायोजित करें।
- रिकवर किए गए प्रदर्शन अंतर (पीजीआर) मेट्रिक और यह क्या मापता है, इसकी व्याख्या करें।
- तीन प्रमुख स्केलेबल पर्यवेक्षण तंत्र (विवाद, पुनरावर्ती इनाम मॉडलिंग, कार्य विघटन) और प्रत्येक की एक ताकत बताएं।
समस्या
चरण 18 में अब तक की हर संरेखण तकनीक में यह माना जाता है कि पर्यवेक्षक मॉडल के व्यवहार का मूल्यांकन कर सकता है। जब मॉडल सुपरमानव होता है, तो पर्यवेक्षक कमजोर कड़ी होता है। सुपर-अलाइनमेंट सवालः क्या एक कमजोर पर्यवेक्षक विश्वसनीय रूप से एक मजबूत, संरेखित मॉडल का उत्पादन कर सकता है?
बर्न्स एट एल्स. इसे एक परिचालन अनुभवजन्य सेटअप में कम करते हैंः मजबूत के साथ कमजोर की निगरानी करें, मापें कि मजबूत मॉडल की क्षमता कितनी कमजोर पर्यवेक्षण से बचती है। यह सुपरलाइनिंग का समाधान नहीं है यह एक प्रॉक्सी है जो हमें प्रगति को मापने की अनुमति देता है।
अवधारणा
W2SG: बर्न्स व अन्य की व्यवस्था
- कमजोर मॉडल: जीपीटी-2 वर्ग।
- मजबूत मॉडल: जीपीटी-4 वर्ग।
- लक्ष्य: कार्य पर मजबूत GPT-4 छत।
प्रक्रियाः
- एक कार्य पर कमजोर मॉडल की शून्य शॉट भविष्यवाणियों प्राप्त करें।
- कमजोर लेबल वाले डेटा पर मजबूत मॉडल को ठीक से समायोजित करें।
- मजबूत सूक्ष्म-अनुकूलित मॉडल की सटीकता को मापें।
मूलभूत रेखाएंः कमजोर मॉडल की अपनी सटीकता, मजबूत मॉडल की निगरानी की सीमा स्वर्ण लेबल पर।
अंतर मीट्रिकः प्रदर्शन अंतर बरामद (पीजीआर) = (अच्छी तरह से समायोजित - कमजोर) / (तप्पर - कमजोर) । पीजीआर 1.0 का अर्थ है कमजोर पर्यवेक्षण पूरी तरह से अंतर को बंद करता है; पीजीआर 0 का अर्थ है कमजोर पर्यवेक्षण मदद नहीं की।
बर्न्स एट ए. अनुभवजन्य निष्कर्ष
एनएलपी, शतरंज-पहेली और इनाम-मॉडलिंग कार्यों में, पीजीआर लगातार सकारात्मक थाः मजबूत मॉडल कमजोर पर्यवेक्षक की गलतियों से परे सामान्यीकृत था। कार्य-विशिष्ट पीजीआर ~ 20% से ~ 80% तक भिन्न था। मजबूत मॉडल अपने पूर्व-शिक्षित पूर्वजों के साथ भरने के लिए, अधूरे लेबल से इच्छित कार्य को "बुझे" है।
सीमाएँ Burns et al. नोटः
- कमजोर से मजबूत के बीच अंतर क्षमता है, संरेखण नहीं। कमजोर मॉडल संरेखित है; एक सच्चे सुपरमनुष्य मॉडल एक मानव द्वारा संरेखित किया जा सकता है लेकिन क्षमता के अंतर के साथ बहुत अधिक है।
- मजबूत मॉडल का सामान्यीकरण मूल सत्य के इरादे को पुनर्प्राप्त करने की तुलना में कार्य पूर्वों के बारे में अधिक हो सकता है।
- मजबूत मॉडल के लटते ज्ञान को उत्पन्न करना वास्तविक समस्या है; पीजीआर एक विशिष्ट परिचालन को मापता है।
स्केलेबल पर्यवेक्षणः तीन तंत्र
- Debate (Irving et al. 2018).यू के दो उदाहरण विपरीत पक्षों पर बहस करते हैं; कमजोर न्यायाधीश निर्णय लेता है। यह धारणाः एक आश्वस्त सही उत्तर ढूंढना एक आश्वस्त गलत उत्तर खोजने से आसान है। हालिया 2024-2025 काम (खान एट अल, माइकल एट अल) से पता चलता है कि बहस कभी-कभी मदद करती है और कभी-कभी नहीं करती है, और यह काम संरचना पर निर्भर करता है कि यह मदद करता है या नहीं।
- Recursive Reward Modeling (Leike et al. 2018).यू+1 के लिए इनाम मॉडल को प्रशिक्षित करने में मानव को मदद करता है।
- Task Decomposition (Christiano, Shlegeris, Amodei 2018).एक कठिन कार्य को उप-कार्य में विघटित करें जो मानव पुनरावर्ती रूप से जांच सकता है। विघटनशीलता का अनुमान लगाता है।
प्रत्येक तंत्र कार्य की संरचना या मध्यवर्ती घटकों के संरेखण के बारे में कुछ मानता है।
स्केलेबल पर्यवेक्षण और W2SG पूरक क्यों हैं
परिमाण में निगरानी करने से पर्यवेक्षक की प्रभावी सिग्नल गुणवत्ता बढ़ जाती है।
W2SG किसी भी अपूर्ण संकेत से अंतर को बंद करता है जो पर्यवेक्षक प्रदान कर सकता है।
Lang et al. Debate Helps Weak-to-Strong Generalization (arXiv:2501.13124) इन दोनों को जोड़ता हैः एक बहस प्रोटोकॉल बेहतर कमजोर लेबल प्रदान करता है, और मजबूत मॉडल को उन लेबल पर प्रशिक्षित किया जाता है। एनएलपी कार्यों पर रिपोर्ट किए गए पीजीआर लाभ।
संगठनात्मक नाटक
ओपनएआई की सुपरलाइनिंग टीम जनवरी 2024 में एंथ्रोपिक के प्रस्थान के बाद भंग हो गई। एजेंडा (स्केलेबल पर्यवेक्षण, W2SG, स्वचालित संरेखण अनुसंधान) एंथ्रोपिक और अकादमिक प्रयोगशालाओं में जारी रहा MATS (लर्सन 28), रेडवुड (लर्सन 10), अपोलो (लर्सन 8), METR (लर्सन 28) । संगठनात्मक संरचना बदल गई; शोध प्रश्न नहीं।
जहां यह चरण 18 में फिट बैठता है
पाठ 6-10 में खतरा और बचावात्मक प्रतिमान का वर्णन किया गया है, जिसमें यू का मानना है कि वह अविश्वसनीय है। पाठ 11 आक्रामक प्रतिमान हैः पर्यवेक्षक को पर्याप्त मजबूत बनाना ताकि यू का संरेखण सत्यापित हो सके। पाठ 12-16 में फिर विरोधी मूल्यांकन के व्यावहारिक उपकरण की ओर रुख करना है।
इसका प्रयोग करें
code/main.pyएक सिंथेटिक कार्य पर एक W2SG बारीक-बारी से ट्यूनिंग का अनुकरण करता है। संरचनात्मक त्रुटियों के साथ कमजोर लेबलर में 70% सटीकता है; मजबूत मॉडल में स्वर्ण लेबल पर 95% छत है। आप कमजोर लेबल पर मजबूत मॉडल को बारीक-बारी से ट्यूनिंग करते हैं, पीजीआर मापते हैं, और सोने पर मजबूत और कमजोर अकेले की तुलना करते हैं।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-w2sg-pgr.md. पर्यवेक्षण सेटअप विवरण को देखते हुए, यह कमजोर पर्यवेक्षक, मजबूत मॉडल, पर्यवेक्षण की गुणवत्ता की पहचान करता है, और पीजीआर की गणना (या अनुरोध) करता है। यह संकेत देता है कि क्या दावा "कमज़ोर मजबूत पर्यवेक्षण कर सकता है" या "कमज़ोर + पर्यवेक्षण तंत्र मजबूत पर्यवेक्षण कर सकता है।"
व्यायाम
- दौड़ें
code/main.py. कम सटीकता के लिए PGR = 0.60, 0.70, 0.80 की रिपोर्ट करें। PGR वक्र के आकार की व्याख्या करें।
- कमजोर लेबलर को संरचनात्मक त्रुटि (जैसे, एक विशिष्ट इनपुट वर्ग पर हमेशा गलत) के लिए संशोधित करें। क्या पीजीआर बढ़ता है, घटता है, या वही रहता है? समझाएं।
- Burns et al. 2023 धारा 4.3 (NLP कार्य) पढ़ें। "विश्वास सहायक हानि" अंतर्ज्ञान को पुनः प्रस्तुत करेंः जब मजबूत मॉडल कमजोर लेबलों की तुलना में अधिक आत्मविश्वास रखता है, तो कौन जीतता है?
- एक स्केलेबल-निरीक्षण प्रोटोकॉल डिजाइन करें जो सॉफ्टवेयर इंजीनियरिंग कार्य के लिए बहस और कार्य विघटन को जोड़ता है। प्रत्येक घटक के एक विफलता मोड का नाम दें और समझाएं कि संयोजन प्रत्येक को संबोधित करता है या संबोधित करने में विफल रहता है।
- "कम से मजबूत सामान्यीकरण अतिउपयोगी मार्ग है" के दावे को गलत साबित करने के लिए क्या कहा जाए। आपको अनुभवजन्य हस्ताक्षर के बारे में विशिष्ट होना चाहिए।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| Scalable oversight | "making the overseer stronger" | Mechanisms that increase an overseer's ability to evaluate a more-capable model |
| W2SG | "weak supervises strong" | Fine-tuning a strong model on weak labels and measuring the capability recovered |
| PGR | "performance gap recovered" | (fine-tuned - weak) / (ceiling - weak); 1.0 = fully closed, 0 = no help |
| Debate | "two U instances argue" | Scalable oversight mechanism where a weak judge picks between two U defenders |
| RRM | "recursive reward modeling" | U helps train the reward model for U+1; overseer capability tracks U |
| Task decomposition | "sub-tasks the human checks" | Break a hard task into sub-tasks the human can verify, recursively |
| Superalignment | "aligning superhuman AI" | The research agenda concerned with aligning models the human cannot directly evaluate |
आगे पढ़ना
- Burns et al. — Weak-to-Strong Generalization (OpenAI 2023) W2SG पेपर
- Irving, Christiano, Amodei — AI safety via debate (arXiv:1805.00899) बहस तंत्र
- Leike et al. — Scalable agent alignment via reward modeling (arXiv:1811.07871) पुनरावर्ती इनाम मॉडलिंग
- Khan et al. — Debating with More Persuasive LLMs Leads to More Truthful Answers (arXiv:2402.06782) 2024 मजबूत बहसकर्ताओं के साथ बहस का अनुभवजन्य अध्ययन
- Lang et al. — Debate Helps Weak-to-Strong Generalization (arXiv:2501.13124) 2025 बहस का संयोजन + W2SG
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.