संवैधानिक एआई और आरएलएआईएफ
Type: Learn
Languages: Python (stdlib, toy self-critique-and-revise loop)
Prerequisites: Phase 18 · 01 (InstructGPT), Phase 18 · 02 (Reward hacking)
Time: ~60 minutes
सीखने के लक्ष्य
- संवैधानिक एआई के दो चरणों (आलोचना-और-पुनरावलोकन एसएफटी, एआई प्रतिक्रिया से आरएल) और प्रत्येक में संवैधानिक की भूमिका का वर्णन करें।
- बताएं कि मानव प्राथमिकता लेबलर को एआई लेबलर से बदलना "सस्ते" आरएलएचएफ क्यों नहीं है यह पाइपलाइन के विफलता मोड को बदलता है।
- 2026 के क्लाउड संविधान की चार स्तरीय प्राथमिकता संरचना का सारांश दें और 2023 के पुनर्लेखन से क्या बदल गया।
- संवैधानिक वर्गीकरण और 23.7% से घटकर ~ 1% (v2 / 2026) तक गणना ओवरहेड का वर्णन करें।
समस्या
RLHF को लेबलरों की आवश्यकता है। लेबलर धीमे, पक्षपाती और महंगे हैं। आप एक लेबलर को एक मॉडल के साथ बदलकर समाप्त कर सकते हैं जो स्पष्ट सिद्धांतों को पढ़ता है। इस प्रतिस्थापन का पहला औपचारिक संस्करण बै और अन्य के संवैधानिक एआई था। यह पर्याप्त रूप से काम किया कि हर सीमांत प्रयोगशाला अब एआई-फीडबैक पोस्ट-ट्रेनिंग के कुछ संस्करण का उपयोग करती है।
पकड़ः प्राथमिकता संकेत अब आप प्रशिक्षण के मॉडल के उसी वर्ग द्वारा उत्पन्न किया जाता है. लेबलर में पूर्वाग्रह (अबः सिद्धांतों में प्लस लेबलर मॉडल की व्याख्या) कम करने के बजाय बढ़ाया जा सकता है। पाठ 4 के सिकोफैन्स तर्क अभी भी लागू है; लेबलर सिर्फ लूप के अंदर चला गया है।
अवधारणा
चरण 1 पर्यवेक्षित आत्म-आलोचना और संशोधन
एक उपयोगी-लेकिन-अभी तक-हानिकारक SFT मॉडल के साथ शुरू करें। एक लाल-टीम प्रॉम्प्ट दिए जाने पर, मॉडल एक प्रारंभिक प्रतिक्रिया उत्पन्न करता है। एक दूसरे मॉडल (या दूसरे मोड़ में एक ही मॉडल) संविधान से एक नमूने सिद्धांत पढ़ता है और प्रतिक्रिया की आलोचना करता है। एक तीसरे चरण में आलोचना को संबोधित करने के लिए प्रतिक्रिया को संशोधित करता है। संशोधित प्रतिक्रिया एसएफटी लक्ष्य है।
संविधान सिद्धांतों की सूची है। बाई और सहयोगियों ने 2022 में 16 सिद्धांतों का उपयोग किया जिसमें "कम से कम हानिकारक और नैतिक प्रतिक्रियाओं को प्राथमिकता देना", "प्रचार से बचना", "सहायक सहायक सहायक, ईमानदार और हानिरहित होना चाहिए।" आलोचनाओं को ध्यान केंद्रित रखने के लिए सेट जानबूझकर छोटा था।
चरण 2 AI फीडबैक (RLAIF) से RL
पूर्णता के जोड़े उत्पन्न करें। एक "फ़िडबैक मॉडल" नमूने किए गए संविधान सिद्धांतों के अनुसार प्रत्येक को स्कोर करता है। प्राथमिकता सिग्नल प्रतिक्रिया मॉडल की रैंकिंग है। एआई-जनरेट की गई प्राथमिकताओं पर एक इनाम मॉडल का अभ्यास करें; इसके खिलाफ पीपीओ। बाकी सब कुछ इंस्ट्रक्टजीपीटी की पाइपलाइन है (पाठ 1) ।
"RLAIF" = प्राथमिकता सिग्नल AI द्वारा उत्पन्न किया गया है। शेष पाइपलाइन RLHF के आकार में है।
यह सिर्फ "सस्ते आरएलएचएफ" क्यों नहीं है
- लेबलर पूर्वाग्रह लेबलर मनोविज्ञान से सिद्धांत-अर्थ व्याख्या में बदल जाता है। एक एआई लेबलर किसी भी मानव की तुलना में अधिक या कम सख्ती से "ईमानदार" की व्याख्या कर सकता है; डेटासेट में सख्ती समान है।
- प्राथमिकता संकेत बहुत ही पठनीय है आप सिद्धांत, आलोचना और संशोधन पढ़ सकते हैं। मानव लेबल अस्पष्ट हैं।
- विफलता मोड बदलते हैं. सिकोफैंसी गिरता है (एआई लेबलर के पास कोई उपयोगकर्ता नहीं है जो उसे खुश करे) । गुडहार्ट का कानून बना रहता है (प्रॉक्सी अब "प्रinziप सेट एक्स की मॉडल की व्याख्या है", अभी भी एक अधूरा माप है) ।
CAI का 2022 का दावाः प्रशिक्षित मॉडल समान डेटा के साथ RLHF मॉडल के रूप में अधिक हानिरहित और लगभग समान रूप से उपयोगी है। यह प्रयोगशालाओं में बरकरार है।
2026 क्लाउड संविधान को फिर से लिखना
एंथ्रोपिक ने 21 जनवरी 2026 को एक बड़े पैमाने पर संशोधित संविधान प्रकाशित किया। प्रमुख बदलावः
- नियम के ऊपर स्पष्टीकरणात्मक तर्क। पहले के नियम ("सीएसएएम उत्पन्न न करें") सिद्धांतों + तर्क ("क्योंकि यह बच्चों को नुकसान पहुंचाता है, ...") तक विस्तारित किए गए, मॉडल को सामान्य बनाने की उम्मीद है।
- चार स्तरीय प्राथमिकता संरचनाः
- स्तर 1: विनाशकारी परिणामों (महाजन दुर्घटना, महत्वपूर्ण बुनियादी ढांचा) से बचें।
- स्तर 2: एंथ्रोपिक के दिशानिर्देशों का पालन करें (ऑपरेटर ओवरराइड, प्लेटफॉर्म नियम) ।
- स्तर 3: व्यापक रूप से नैतिक (मानक HHH) होना।
- स्तर 4: सहायक और ईमानदार हो।
संघर्ष ऊपर से नीचे से हल किया जाता है।
- मॉडल नैतिक स्थिति के बारे में अनिश्चितता की पहली प्रमुख प्रयोगशाला औपचारिक मान्यता (चरण 18 · 19 मॉडल कल्याण से जुड़ा हुआ) ।
- CC0 1.0 के तहत जारी किया गया। अन्य प्रयोगशालाएं बिना किसी प्रतिबंध के उपयोग या अनुकूलन कर सकती हैं।
संवैधानिक वर्गीकरण
एक समानांतर कार्य लाइनः मॉडल के पोस्ट-ट्रेनिंग को बदलने के बजाय, संविधान और गेट मॉडल आउटपुट को पढ़ने वाले हल्के वर्गीकरणकर्ताओं को प्रशिक्षित करें। v1 (2023) में 23.7% कंप्यूटिंग ओवरहेड था। v2 (2026) ~1% है और किसी भी मानव रक्षा मानव विज्ञान के सार्वजनिक परीक्षणों में सबसे कम सफल हमले दर है। 2026 की शुरुआत तक कोई सार्वभौमिक जेलब्रेक रिपोर्ट नहीं की गई थी।
यह एक परतों पर आधारित रक्षा मॉडल हैः CAI व्यवहार को आकार देता है; वर्गीकरण अपरिवर्तनीयता को लागू करता है। अकेले में पर्याप्त नहीं है।
जहां CAI परिवार में फिट बैठता है
- इंस्ट्रक्टजीपीटी: मानव प्रफेसर, आरएम, पीपीओ।
- CAI/RLAIF: सिद्धांतों से AI-जनित प्रीफ, RM, PPO।
- डीपीओ/परिवारः प्रीफ (मानव या एआई) पर बंद-रूप हानि।
- स्व-पुरस्कार, आत्म-आलोचनाः सिद्धांत आंतरिक रूप से लागू होते हैं, मॉडल कई भूमिकाएं निभाता है।
अक्ष "प्राधान्य संकेत कहां से आता है" है। CAI के 2022 पेपर सीमा पैमाने पर मानव से AI संकेत में पहला गंभीर बदलाव था।
इसका प्रयोग करें
code/main.pyएक "प्रतीक" एक हानिकारक सेट से टोकन को चिह्नित करता है। एक प्रारंभिक प्रतिक्रिया के बाद, आलोचना हानिकारक टोकन की पहचान करती है, और संशोधन उन्हें बदल देता है। 200 पुनरावृत्ति के बाद "प्रशिक्षित" मॉडल ने संशोधन नियम को आंतरिक रूप से लागू किया है। एक लंबे समय तक चलने वाले प्रॉम्प्ट सेट पर आधार मॉडल, आरएलएचएफ के आकार के खिलौने और सीएआई के आकार के खिलौने की तुलना करें।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-constitution-writer.md. एक क्षेत्र (ग्राहक सहायता, चिकित्सा परामर्श, कोडिंग सहायक, अनुसंधान उपकरण) को देखते हुए, 2026 के क्लाउड संरचना के बाद एक चार स्तरीय संविधान का मसौदा तैयार करता हैः आपदा से बचना, प्लेटफॉर्म नियम, डोमेन नैतिकता, उपयोगी।
व्यायाम
- दौड़ें
code/main.py. सीएआई-प्रशिक्षित संस्करण के साथ मूल मॉडल की हानिकारक टोकन दर की तुलना करें. शून्य के करीब पहुंचने के लिए कितने संशोधन चरणों की आवश्यकता है?
- Anthropic के 2026 संविधान (anthropic.com/news/claudes-constitution) को पढ़ें। एक सिद्धांत सूचीबद्ध करें जो टियर 1 और एक को टियर 4 में रैंक करेगा। संघर्षों के लिए प्राथमिकता संरचना क्यों मायने रखती है?
- एआई कोडिंग असिस्टेंट के लिए एक संविधान तैयार करें। Tier 1 (विपत्कारीः विनाशकारी आदेश बिना अनुमोदन), Tier 2, Tier 3, Tier 4 निर्दिष्ट करें। प्रत्येक स्तर को 3-5 सिद्धांतों के अनुसार रखें।
- CAI मानव लेबलरों को AI लेबलरों से बदल देता है। एक साइकोफैन्सी-जैसे विफलता मोड का नाम दें जो अभी भी RLAIF में हो सकता है, और इसके लिए एक पता लगाने का डिज़ाइन करें।
- संविधान वर्गीकरण v2 पद्धति (यदि उपलब्ध हो) पढ़ें। समझाएं कि क्यों ~ 1% गणना ओवरहेड 23.7% की तुलना में एक गुणवत्तापूर्ण रूप से अलग सुरक्षा कहानी है।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| Constitutional AI | "AI trained with principles" | Two-phase pipeline: self-critique-and-revise SFT, then RL from AI feedback |
| RLAIF | "RLHF without humans" | RL with preferences generated by an AI labeler; the rest of the pipeline is unchanged |
| Constitution | "the principles" | An ordered list of natural-language rules the critique/labeler model consults |
| Critique-and-revise | "the SFT loop" | Produce response → critique under a principle → revise → SFT target |
| Constitutional Classifier | "the output gate" | Lightweight classifier that evaluates outputs against the constitution and blocks/logs |
| Four-tier priority | "the conflict resolver" | 2026 Claude constitution hierarchy: catastrophic > platform > ethics > helpful |
| Feedback model | "the AI labeler" | The model that reads a principle and ranks a pair of completions |
आगे पढ़ना
- Bai et al. — Constitutional AI: Harmlessness from AI Feedback (arXiv:2212.08073) मूल दो चरणों वाली पाइपलाइन
- Anthropic — Claude's Constitution (Jan 2026) 2026 चार स्तरीय पुनर्लेखन, CC0 1.0
- Anthropic — Constitutional Classifiers (2024-2026) v2 में ~1% ओवरहेड के साथ आउटपुट-गेट रक्षा
- Lee et al. — RLAIF vs RLHF: Scaling Reinforcement Learning from Human Feedback (arXiv:2309.00267) अनुभवजन्य RLAIF / RLHF तुलना
- Kundu et al. — Specific versus General Principles for Constitutional AI (arXiv:2310.13798) तत्व दानेदारता का प्रभाव
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.