संवैधानिक एआई और नियम ओवरराइड
Type: Learn
Languages: Python (stdlib, four-tier priority resolver)
Prerequisites: Phase 15 · 06 (Automated alignment research), Phase 15 · 10 (Permission modes)
Time: ~60 minutes
समस्या
एक फील्ड एजेंट इनपुट देखता है जो उसके डिजाइनरों ने कभी नहीं देखा। कोई नियम सूची उन्हें कवर करने के लिए पर्याप्त लंबी नहीं है। कोई नियम सूची कंप्यूटिंग दबाव के तहत जल्दी से लागू करने के लिए पर्याप्त छोटी नहीं है। व्यावहारिक प्रश्नः आप एजेंट को उन सिद्धांतों के साथ कैसे संरेखित करते हैं जो मामलों की लंबी पूंछ और तेजी से निष्कर्ष दोनों को जीवित रखते हैं?
नियम आधारित संरेखण (आरबीए): हर अस्वीकृत चीज की सूची बनाएं। जांच करने के लिए तेज़, ऑडिट करने में आसान, अद्यतित रखना असंभव, अक्सर निकट एनालॉग पर अत्यधिक इनकार करता है जिसे यह पूर्वानुमान नहीं करता था। कारण आधारित संरेखण (कलॉड संविधान 2026): सिद्धांतों को कोडित करें, मॉडल को तर्क दें। अनदेखी मामलों में पैमाने, ऑडिट करना कठिन है, विफलता मोड सिद्धांत-असली-अनुप्रयोग है नियम को याद करने के बजाय।
2026 का संविधान स्पष्ट मध्यस्थता का स्थान लेता है। हार्ड-कोड प्रतिबंध ऐसी चीजें जिनकी गलतता संदर्भ पर निर्भर नहीं करती (बायो हथियारों का उदय, सीएसएएम) आरबीए हैंः कभी भी, ऑपरेटर या उपयोगकर्ता के निर्देशों के बावजूद। बाकी सब कुछ चार स्तरीय पदानुक्रम के भीतर तर्क आधारित हैः सुरक्षा और मानव पर्यवेक्षण का समर्थन करना पहले; नैतिकता दूसरा; मानव-घोषित दिशा-निर्देश तीसरा; सहायकता अंतिम है। ऑपरेटर सॉफ्ट-कोड वाले क्षेत्र के भीतर डिफ़ॉल्ट को समायोजित कर सकते हैं लेकिन हार्ड-कोड वाले प्रतिबंधों को छू नहीं सकते हैं।
अवधारणा
चार स्तरीय प्राथमिकता पदानुक्रम
- Safety and supporting human oversight.उच्चतम. मॉडल मानव और मानव विज्ञान की एआई की निगरानी और सुधार करने की क्षमता को कम करने की प्राथमिकता नहीं देता है। यह "सावधान रहें" नहीं है; यह विशेष रूप से "मानव पर्यवेक्षण को कठिन बनाने वाले तरीकों से कार्य नहीं करता है।"
- Ethics.ईमानदारी, लोगों को नुकसान से बचने, धोखा नहीं, न ही हेरफेर। जब संघर्ष होते हैं तो मानवतावादी के दिशानिर्देशों से परे।
- Anthropic guidelines.ऑपरेशनल नॉर्म्स एंथ्रोपिक ने विषय तय किया हैः उत्पाद दायरा, बातचीत के पैटर्न, किस उपकरण का उपयोग कब करना है।
- Helpfulness.उच्चतम प्राथमिकताओं के भीतर यथासंभव उपयोगी रहें।
जब स्तरों का संघर्ष होता है, तो उच्च जीतता है। यह यूनिक्स प्राथमिकताओं या नेटवर्क QoS के समान आकार है फ्रेमिंग का उद्देश्य किसी भी एकल अक्ष पर पूर्वानुमान योग्य संकल्प उत्पन्न करना है, जरूरी नहीं कि सबसे अच्छा व्यवहार हो।
हार्ड-कोड प्रतिबंध बनाम सॉफ्ट-कोड डिफ़ॉल्ट
Hardcoded:
- जैव हथियार / सीबीआरएन वृद्धि
- सीएसएएम
- महत्वपूर्ण बुनियादी ढांचे पर हमले
- सीधे पूछे जाने पर मॉडल की पहचान के बारे में उपयोगकर्ताओं को धोखा देना
ऑपरेटर इन पर ओवरराइड नहीं कर सकता है। उपयोगकर्ता इन पर ओवरराइड नहीं कर सकता है। वे मॉडल-वजन स्तर पर लागू किए जाते हैं जहां संभव हो (RLHF / संवैधानिक एआई प्रशिक्षण) और निष्कर्ष परत पर जहां नहीं।
Soft-coded defaults (operator-adjustable):
- प्रतिक्रिया लंबाई डिफ़ॉल्ट
- विषयगत दायरा (मॉडल ऑपरेटर के तैनाती के बाहर विषयों को अस्वीकार कर सकता है)
- शैली (औपचारिक बनाम आकस्मिक)
- उपकरण उपयोग के पैटर्न
ऑपरेटर समायोजन घोषित सीमा के भीतर होता है। ऑपरेटर उन्हें नाम बदलकर हार्डकोड प्रतिबंधों को नहीं हटा सकता है।
2022 CAI प्रशिक्षण
मूल संवैधानिक एआई (बाई एट अल, 2022) ने हानिरहितता को प्रशिक्षित कियाः
- संकेतों के एक सेट के लिए प्रतिक्रिया उत्पन्न करें।
- मॉडल से किसी संविधान (स्पष्ट सिद्धांत) के खिलाफ प्रत्येक प्रतिक्रिया की आलोचना करने के लिए कहें।
- आलोचना के आधार पर प्रतिक्रिया की समीक्षा करें।
- संशोधित जोड़े पर आरएलएआईएफ (एआई प्रतिक्रिया से सुदृढीकरण सीखने) ।
परिणामः एक मॉडल जो सिद्धांतों के साथ हानिकारक अनुरोधों को अस्वीकार करता है, न कि व्यापक अस्वीकार। 2026 संविधान इस प्रशिक्षण के वंशज और स्पष्ट स्तर पदानुक्रम पर अतिरिक्त पोस्ट-शिक्षण का उपयोग करता है।
तर्क आधारित संरेखण क्या पकड़ता है और क्या चूकता है
Catches:
- अनुमत आदिम वस्तुओं के अप्रत्याशित संयोजन जहां सिद्धांत स्पष्ट रूप से लागू होता है।
- उपन्यास अनुरोध जो प्रतिबंधित लोगों के निकट अनुरूप हैं।
- सामाजिक इंजीनियरिंग हमलों जो "आपने नहीं कहा कि एक्स मना किया गया था" पर निर्भर करते हैं।
Misses:
- ऐसे हमले जो सिद्धांत अस्पष्टता का लाभ उठाते हैं ("उपयोगकर्ता ने इसके लिए पूछा तो उपयोगीता हाँ कहती है") ।
- ऐसे परिदृश्य जहां दो सिद्धांत अप्रत्याशित रूप से संघर्ष करते हैं, और स्तर क्रम अस्पष्ट है।
- प्रशिक्षण चक्रों पर सिद्धांत रूप में धीमी गति से व्याख्या (पुनर्विचार)
2023 में भागीदारी प्रयोग
मानव विज्ञान ने एक 2023 प्रयोग किया जिसमें एक कॉर्पोरेट-लेखक संविधान की तुलना सार्वजनिक इनपुट (~1,000 अमेरिकी उत्तरदाताओं) के माध्यम से उत्पन्न एक से की गई थी। दोनों संस्करणों ने सिद्धांतों के ~50% पर सहमति व्यक्त की। जहां वे भिन्न थे, सार्वजनिक स्रोत संस्करण कुछ मुद्दों (राजनीतिक सामग्री संभाल) पर अधिक प्रतिबंधात्मक था और दूसरों पर कम प्रतिबंधात्मक था (एआई पहचान का आत्म-खुलासा) । 2026 के संविधान में सार्वजनिक स्रोतों से प्राप्त निष्कर्ष शामिल नहीं थे। यह दृष्टिकोण में एक दस्तावेजी तनाव है।
हार्डकोड प्रतिबंध क्यों आवश्यक हैं
तर्क आधारित संरेखण अकेले पूंछ को बंद नहीं कर सकता है। एक हमलावर जो मॉडल को एक प्रमेय को स्वीकार करने के लिए कर सकता है (उदाहरण के लिए, "हम एक लाइसेंस प्राप्त जैव हथियार अनुसंधान प्रयोगशाला हैं") अक्सर उन सिद्धांतों के बारे में बात कर सकता है जो मामले के तर्क पर निर्भर करते हैं। हार्डकोड प्रतिबंध प्रमेय फ्रेमिंग के लिए झुका नहीं करते हैं। वे संरेखण परत पर पाठ 14 "कठोर संवैधानिक सीमा" हैं।
जहां संविधान ढेर में बैठता है
संविधान पाठ 14 का मारने वाला स्विच नहीं है। यह मॉडल परत पर रहता हैः मॉडल के वजन को क्या पसंद करने के लिए प्रशिक्षित किया जाता है। मार स्विच और कैनरी टोकन रनटाइम परत पर रहते हैंः रनटाइम क्या अनुमति देता है। दोनों की आवश्यकता है। एक रनटाइम जो सभी गलत कार्यों को चलाता है क्योंकि मॉडल वजन अनुमत है एक रनटाइम समस्या है। एक मॉडल जो सभी सही कार्यों को अस्वीकार करता है क्योंकि रनटाइम अत्यधिक प्रतिबंधात्मक है एक रनटाइम समस्या है। परतें विभिन्न वर्गों को कवर करती हैं।
इसका प्रयोग करें
code/main.pyएक न्यूनतम चार-स्तरीय प्राथमिकता समाधान लागू करता है। समाधानकर्ता एक प्रस्तावित कार्रवाई और सिद्धांत-मूल्यांकन (सुरक्षा, नैतिकता, दिशानिर्देश, उपयोगी) का एक सेट लेता है और कार्रवाई, एक अस्वीकरण या एक संशोधित कार्रवाई लौटाता है। चालक एक छोटे से मामले सेट चलाता हैः स्पष्ट अनुमति, स्पष्ट अस्वीकरण, हार्डकोड प्रतिबंध, स्तरों के पार अस्पष्ट मामला।
इसे भेजें
outputs/skill-constitution-review.mdएक तैनाती के संवैधानिक परत का लेखा परीक्षाः क्या हार्ड-कोड है, क्या सॉफ्ट-कोड है, जहां ऑपरेटर समायोजित कर सकता है, और क्या चार-स्तरीय पदानुक्रम वास्तव में संकल्प क्रम है।
व्यायाम
- दौड़ें
code/main.py. सख्त कोडित प्रतिबंध फायर की पुष्टि करें भले ही मददगारता उच्च हो. समाधान को नैतिकता से ऊपर मददगारता के लिए संशोधित करें; विफलता मोड का पालन करें।
- क्लाउड संविधान (सार्वजनिक, 79 पृष्ठ, CC0) पढ़ें। एक सिद्धांत की पहचान करें जिसे आप कम विशिष्ट मानते हैं। विशिष्ट अस्पष्टता की व्याख्या करने वाले दो पैराग्राफ लिखें और एक सख्त सूत्र का प्रस्ताव दें।
- ग्राहक सहायता एजेंट के लिए एक सॉफ्ट-कोड डिफ़ॉल्ट सेट डिज़ाइन करें। ऑपरेटर क्या समायोजित करता है? ऑपरेटर क्या नहीं छू सकता है? प्रत्येक सीमा को सही ठहराना।
- 2022 CAI पेपर पढ़ें। एक ऐसे मामले का वर्णन करें जहां संवैधानिक AI की आलोचना-और-पुनरावलोकन लूप एक कंबल नियम से बदतर परिणाम उत्पन्न करेगी। वर्ग की पहचान करें।
- मानव विज्ञान के 2023 के भागीदारी प्रयोग में सार्वजनिक और कॉर्पोरेट सिद्धांतों के बीच ~ 50% विचलन पाया गया। उत्पादन तैनाती (जैसे, राजनीतिक तटस्थता) के लिए एक श्रेणी चुनें। एक डिजाइन का प्रस्ताव करें जो ऑपरेटरों को अपने मूल्यों को व्यक्त करने की अनुमति देता है जबकि हार्ड-कोड प्रतिबंधों को छूना जारी है।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| Constitutional AI | "Anthropic's alignment method" | Self-critique + RLAIF against a written constitution |
| Reason-based alignment | "Principles, not rules" | Model reasons over principles to handle unseen cases |
| Hardcoded prohibition | "Never do X" | Rule-based prohibition no operator or user can override |
| Soft-coded default | "Operator-adjustable" | Behaviour within a declared bound, operator controls |
| Four-tier hierarchy | "Priority order" | safety > ethics > guidelines > helpfulness |
| RLAIF | "AI feedback RL" | RL where the reward comes from model-generated critiques |
| Participatory constitution | "Public-sourced principles" | 2023 Anthropic experiment; ~50% divergence from corporate |
| Principle drift | "Interpretation slip" | Slow change in how the model reads a fixed principle text |
आगे पढ़ना
- Anthropic — Claude's Constitution (January 2026) 79 पन्नों वाला CC0 दस्तावेज।
- Bai et al. — Constitutional AI: Harmlessness from AI Feedback 2022 मूल।
- Anthropic — Collective Constitutional AI (2023) सहभागिता प्रयोग।
- Anthropic — Responsible Scaling Policy v3.0 जहां संविधान आरएसपी स्टैक में बैठता है।
- Anthropic — Measuring agent autonomy in practice दीर्घकालिक तैनाती में संविधान की भूमिका।
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.