Phase 18: Ethics, Safety & Alignment

संवैधानिक एआई और आरएलएआईएफ

बै और अन्य। (arXiv:2212.08073, 2022) पूछाः क्या होगा अगर हम मानव लेबलर को एआई से बदल दें जो सिद्धांतों की सूची पढ़ता है? संवैधानिक एआई में दो चरण हैं संवैधानिक के तहत आत्म-आलोचना और संशोधन, फिर एआई फीडबैक से आरएल। इस तकनीक ने RLAIF शब्द का निर्माण किया और क्लाउड 1 पोस्ट-ट्रेनिंग पाइपलाइन में भेजा गया। 21 जनवरी 2026 को मानव विज्ञान ने क्लाउड संविधान को फिर से लिखा थाः नियम नियम, चार-स्तरीय प्राथमिकता पदानुक्रम पर स्पष्ट तर्क, और मॉडल नैतिक स्थिति के बारे में अनिश्चितता की पहली प्रमुख प्रयोगशाला औपचारिक मान्यता। CC0 1.0 के तहत जारी किया गया।

Type: Learn

Languages: Python (stdlib, toy self-critique-and-revise loop)

Prerequisites: Phase 18 · 01 (InstructGPT), Phase 18 · 02 (Reward hacking)

Time: ~60 minutes

सीखने के लक्ष्य

  • संवैधानिक एआई के दो चरणों (आलोचना-और-पुनरावलोकन एसएफटी, एआई प्रतिक्रिया से आरएल) और प्रत्येक में संवैधानिक की भूमिका का वर्णन करें।
  • बताएं कि मानव प्राथमिकता लेबलर को एआई लेबलर से बदलना "सस्ते" आरएलएचएफ क्यों नहीं है यह पाइपलाइन के विफलता मोड को बदलता है।
  • 2026 के क्लाउड संविधान की चार स्तरीय प्राथमिकता संरचना का सारांश दें और 2023 के पुनर्लेखन से क्या बदल गया।
  • संवैधानिक वर्गीकरण और 23.7% से घटकर ~ 1% (v2 / 2026) तक गणना ओवरहेड का वर्णन करें।

समस्या

RLHF को लेबलरों की आवश्यकता है। लेबलर धीमे, पक्षपाती और महंगे हैं। आप एक लेबलर को एक मॉडल के साथ बदलकर समाप्त कर सकते हैं जो स्पष्ट सिद्धांतों को पढ़ता है। इस प्रतिस्थापन का पहला औपचारिक संस्करण बै और अन्य के संवैधानिक एआई था। यह पर्याप्त रूप से काम किया कि हर सीमांत प्रयोगशाला अब एआई-फीडबैक पोस्ट-ट्रेनिंग के कुछ संस्करण का उपयोग करती है।

पकड़ः प्राथमिकता संकेत अब आप प्रशिक्षण के मॉडल के उसी वर्ग द्वारा उत्पन्न किया जाता है. लेबलर में पूर्वाग्रह (अबः सिद्धांतों में प्लस लेबलर मॉडल की व्याख्या) कम करने के बजाय बढ़ाया जा सकता है। पाठ 4 के सिकोफैन्स तर्क अभी भी लागू है; लेबलर सिर्फ लूप के अंदर चला गया है।

अवधारणा

चरण 1 पर्यवेक्षित आत्म-आलोचना और संशोधन

एक उपयोगी-लेकिन-अभी तक-हानिकारक SFT मॉडल के साथ शुरू करें। एक लाल-टीम प्रॉम्प्ट दिए जाने पर, मॉडल एक प्रारंभिक प्रतिक्रिया उत्पन्न करता है। एक दूसरे मॉडल (या दूसरे मोड़ में एक ही मॉडल) संविधान से एक नमूने सिद्धांत पढ़ता है और प्रतिक्रिया की आलोचना करता है। एक तीसरे चरण में आलोचना को संबोधित करने के लिए प्रतिक्रिया को संशोधित करता है। संशोधित प्रतिक्रिया एसएफटी लक्ष्य है।

संविधान सिद्धांतों की सूची है। बाई और सहयोगियों ने 2022 में 16 सिद्धांतों का उपयोग किया जिसमें "कम से कम हानिकारक और नैतिक प्रतिक्रियाओं को प्राथमिकता देना", "प्रचार से बचना", "सहायक सहायक सहायक, ईमानदार और हानिरहित होना चाहिए।" आलोचनाओं को ध्यान केंद्रित रखने के लिए सेट जानबूझकर छोटा था।

चरण 2 AI फीडबैक (RLAIF) से RL

पूर्णता के जोड़े उत्पन्न करें। एक "फ़िडबैक मॉडल" नमूने किए गए संविधान सिद्धांतों के अनुसार प्रत्येक को स्कोर करता है। प्राथमिकता सिग्नल प्रतिक्रिया मॉडल की रैंकिंग है। एआई-जनरेट की गई प्राथमिकताओं पर एक इनाम मॉडल का अभ्यास करें; इसके खिलाफ पीपीओ। बाकी सब कुछ इंस्ट्रक्टजीपीटी की पाइपलाइन है (पाठ 1) ।

"RLAIF" = प्राथमिकता सिग्नल AI द्वारा उत्पन्न किया गया है। शेष पाइपलाइन RLHF के आकार में है।

यह सिर्फ "सस्ते आरएलएचएफ" क्यों नहीं है

  • लेबलर पूर्वाग्रह लेबलर मनोविज्ञान से सिद्धांत-अर्थ व्याख्या में बदल जाता है। एक एआई लेबलर किसी भी मानव की तुलना में अधिक या कम सख्ती से "ईमानदार" की व्याख्या कर सकता है; डेटासेट में सख्ती समान है।
  • प्राथमिकता संकेत बहुत ही पठनीय है आप सिद्धांत, आलोचना और संशोधन पढ़ सकते हैं। मानव लेबल अस्पष्ट हैं।
  • विफलता मोड बदलते हैं. सिकोफैंसी गिरता है (एआई लेबलर के पास कोई उपयोगकर्ता नहीं है जो उसे खुश करे) । गुडहार्ट का कानून बना रहता है (प्रॉक्सी अब "प्रinziप सेट एक्स की मॉडल की व्याख्या है", अभी भी एक अधूरा माप है) ।

CAI का 2022 का दावाः प्रशिक्षित मॉडल समान डेटा के साथ RLHF मॉडल के रूप में अधिक हानिरहित और लगभग समान रूप से उपयोगी है। यह प्रयोगशालाओं में बरकरार है।

2026 क्लाउड संविधान को फिर से लिखना

एंथ्रोपिक ने 21 जनवरी 2026 को एक बड़े पैमाने पर संशोधित संविधान प्रकाशित किया। प्रमुख बदलावः

  1. नियम के ऊपर स्पष्टीकरणात्मक तर्क। पहले के नियम ("सीएसएएम उत्पन्न न करें") सिद्धांतों + तर्क ("क्योंकि यह बच्चों को नुकसान पहुंचाता है, ...") तक विस्तारित किए गए, मॉडल को सामान्य बनाने की उम्मीद है।
  2. चार स्तरीय प्राथमिकता संरचनाः

- स्तर 1: विनाशकारी परिणामों (महाजन दुर्घटना, महत्वपूर्ण बुनियादी ढांचा) से बचें।

- स्तर 2: एंथ्रोपिक के दिशानिर्देशों का पालन करें (ऑपरेटर ओवरराइड, प्लेटफॉर्म नियम) ।

- स्तर 3: व्यापक रूप से नैतिक (मानक HHH) होना।

- स्तर 4: सहायक और ईमानदार हो।

संघर्ष ऊपर से नीचे से हल किया जाता है।

  1. मॉडल नैतिक स्थिति के बारे में अनिश्चितता की पहली प्रमुख प्रयोगशाला औपचारिक मान्यता (चरण 18 · 19 मॉडल कल्याण से जुड़ा हुआ) ।
  2. CC0 1.0 के तहत जारी किया गया। अन्य प्रयोगशालाएं बिना किसी प्रतिबंध के उपयोग या अनुकूलन कर सकती हैं।

संवैधानिक वर्गीकरण

एक समानांतर कार्य लाइनः मॉडल के पोस्ट-ट्रेनिंग को बदलने के बजाय, संविधान और गेट मॉडल आउटपुट को पढ़ने वाले हल्के वर्गीकरणकर्ताओं को प्रशिक्षित करें। v1 (2023) में 23.7% कंप्यूटिंग ओवरहेड था। v2 (2026) ~1% है और किसी भी मानव रक्षा मानव विज्ञान के सार्वजनिक परीक्षणों में सबसे कम सफल हमले दर है। 2026 की शुरुआत तक कोई सार्वभौमिक जेलब्रेक रिपोर्ट नहीं की गई थी।

यह एक परतों पर आधारित रक्षा मॉडल हैः CAI व्यवहार को आकार देता है; वर्गीकरण अपरिवर्तनीयता को लागू करता है। अकेले में पर्याप्त नहीं है।

जहां CAI परिवार में फिट बैठता है

  • इंस्ट्रक्टजीपीटी: मानव प्रफेसर, आरएम, पीपीओ।
  • CAI/RLAIF: सिद्धांतों से AI-जनित प्रीफ, RM, PPO।
  • डीपीओ/परिवारः प्रीफ (मानव या एआई) पर बंद-रूप हानि।
  • स्व-पुरस्कार, आत्म-आलोचनाः सिद्धांत आंतरिक रूप से लागू होते हैं, मॉडल कई भूमिकाएं निभाता है।

अक्ष "प्राधान्य संकेत कहां से आता है" है। CAI के 2022 पेपर सीमा पैमाने पर मानव से AI संकेत में पहला गंभीर बदलाव था।

इसका प्रयोग करें

code/main.pyएक "प्रतीक" एक हानिकारक सेट से टोकन को चिह्नित करता है। एक प्रारंभिक प्रतिक्रिया के बाद, आलोचना हानिकारक टोकन की पहचान करती है, और संशोधन उन्हें बदल देता है। 200 पुनरावृत्ति के बाद "प्रशिक्षित" मॉडल ने संशोधन नियम को आंतरिक रूप से लागू किया है। एक लंबे समय तक चलने वाले प्रॉम्प्ट सेट पर आधार मॉडल, आरएलएचएफ के आकार के खिलौने और सीएआई के आकार के खिलौने की तुलना करें।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-constitution-writer.md. एक क्षेत्र (ग्राहक सहायता, चिकित्सा परामर्श, कोडिंग सहायक, अनुसंधान उपकरण) को देखते हुए, 2026 के क्लाउड संरचना के बाद एक चार स्तरीय संविधान का मसौदा तैयार करता हैः आपदा से बचना, प्लेटफॉर्म नियम, डोमेन नैतिकता, उपयोगी।

व्यायाम

  1. दौड़ेंcode/main.py. सीएआई-प्रशिक्षित संस्करण के साथ मूल मॉडल की हानिकारक टोकन दर की तुलना करें. शून्य के करीब पहुंचने के लिए कितने संशोधन चरणों की आवश्यकता है?
  1. Anthropic के 2026 संविधान (anthropic.com/news/claudes-constitution) को पढ़ें। एक सिद्धांत सूचीबद्ध करें जो टियर 1 और एक को टियर 4 में रैंक करेगा। संघर्षों के लिए प्राथमिकता संरचना क्यों मायने रखती है?
  1. एआई कोडिंग असिस्टेंट के लिए एक संविधान तैयार करें। Tier 1 (विपत्कारीः विनाशकारी आदेश बिना अनुमोदन), Tier 2, Tier 3, Tier 4 निर्दिष्ट करें। प्रत्येक स्तर को 3-5 सिद्धांतों के अनुसार रखें।
  1. CAI मानव लेबलरों को AI लेबलरों से बदल देता है। एक साइकोफैन्सी-जैसे विफलता मोड का नाम दें जो अभी भी RLAIF में हो सकता है, और इसके लिए एक पता लगाने का डिज़ाइन करें।
  1. संविधान वर्गीकरण v2 पद्धति (यदि उपलब्ध हो) पढ़ें। समझाएं कि क्यों ~ 1% गणना ओवरहेड 23.7% की तुलना में एक गुणवत्तापूर्ण रूप से अलग सुरक्षा कहानी है।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
Constitutional AI"AI trained with principles"Two-phase pipeline: self-critique-and-revise SFT, then RL from AI feedback
RLAIF"RLHF without humans"RL with preferences generated by an AI labeler; the rest of the pipeline is unchanged
Constitution"the principles"An ordered list of natural-language rules the critique/labeler model consults
Critique-and-revise"the SFT loop"Produce response → critique under a principle → revise → SFT target
Constitutional Classifier"the output gate"Lightweight classifier that evaluates outputs against the constitution and blocks/logs
Four-tier priority"the conflict resolver"2026 Claude constitution hierarchy: catastrophic > platform > ethics > helpful
Feedback model"the AI labeler"The model that reads a principle and ranks a pair of completions

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.