Phase 15: Autonomous Systems

संवैधानिक एआई और नियम ओवरराइड

मानव विज्ञान के 22 जनवरी 2026 क्लाउड संविधान 79 पृष्ठों का है और CC0 है। यह नियम आधारित से तर्क आधारित संरेखण में आगे बढ़ता है और चार स्तरीय प्राथमिकता पदानुक्रम स्थापित करता हैः (1) सुरक्षा और मानव पर्यवेक्षण का समर्थन करना, (2) नैतिकता, (3) मानव दिशानिर्देश, (4) उपयोगी। व्यवहार हार्ड-कोडेड प्रतिबंधों (बायो हथियारों को उठाने, सीएसएएम) में विभाजित हैं जिन्हें ऑपरेटर और उपयोगकर्ता ओवरराइड नहीं कर सकते हैं और सॉफ्ट-कोडेड डिफ़ॉल्ट जो ऑपरेटर परिभाषित सीमाओं के भीतर समायोजित कर सकते हैं। 2022 के मूल (बाई और अन्य) ने संविधान के खिलाफ आत्म-आलोचना और आरएलएआईएफ के माध्यम से हानिरहितता को प्रशिक्षित किया। ईमानदार चेतावनीः तर्क आधारित संरेखण अप्रत्याशित परिस्थितियों के लिए सिद्धांतों को सामान्य बनाने वाले मॉडल पर निर्भर करता है। मानव विज्ञान के अपने 2023 भागीदारी प्रयोग ने सार्वजनिक स्रोत और कॉर्पोरेट सिद्धांतों के बीच ~ 50% विचलन दिखाया; 2026 संस्करण में उन निष्कर्षों को शामिल नहीं किया गया था।

Type: Learn

Languages: Python (stdlib, four-tier priority resolver)

Prerequisites: Phase 15 · 06 (Automated alignment research), Phase 15 · 10 (Permission modes)

Time: ~60 minutes

समस्या

एक फील्ड एजेंट इनपुट देखता है जो उसके डिजाइनरों ने कभी नहीं देखा। कोई नियम सूची उन्हें कवर करने के लिए पर्याप्त लंबी नहीं है। कोई नियम सूची कंप्यूटिंग दबाव के तहत जल्दी से लागू करने के लिए पर्याप्त छोटी नहीं है। व्यावहारिक प्रश्नः आप एजेंट को उन सिद्धांतों के साथ कैसे संरेखित करते हैं जो मामलों की लंबी पूंछ और तेजी से निष्कर्ष दोनों को जीवित रखते हैं?

नियम आधारित संरेखण (आरबीए): हर अस्वीकृत चीज की सूची बनाएं। जांच करने के लिए तेज़, ऑडिट करने में आसान, अद्यतित रखना असंभव, अक्सर निकट एनालॉग पर अत्यधिक इनकार करता है जिसे यह पूर्वानुमान नहीं करता था। कारण आधारित संरेखण (कलॉड संविधान 2026): सिद्धांतों को कोडित करें, मॉडल को तर्क दें। अनदेखी मामलों में पैमाने, ऑडिट करना कठिन है, विफलता मोड सिद्धांत-असली-अनुप्रयोग है नियम को याद करने के बजाय।

2026 का संविधान स्पष्ट मध्यस्थता का स्थान लेता है। हार्ड-कोड प्रतिबंध ऐसी चीजें जिनकी गलतता संदर्भ पर निर्भर नहीं करती (बायो हथियारों का उदय, सीएसएएम) आरबीए हैंः कभी भी, ऑपरेटर या उपयोगकर्ता के निर्देशों के बावजूद। बाकी सब कुछ चार स्तरीय पदानुक्रम के भीतर तर्क आधारित हैः सुरक्षा और मानव पर्यवेक्षण का समर्थन करना पहले; नैतिकता दूसरा; मानव-घोषित दिशा-निर्देश तीसरा; सहायकता अंतिम है। ऑपरेटर सॉफ्ट-कोड वाले क्षेत्र के भीतर डिफ़ॉल्ट को समायोजित कर सकते हैं लेकिन हार्ड-कोड वाले प्रतिबंधों को छू नहीं सकते हैं।

अवधारणा

चार स्तरीय प्राथमिकता पदानुक्रम

  1. Safety and supporting human oversight.उच्चतम. मॉडल मानव और मानव विज्ञान की एआई की निगरानी और सुधार करने की क्षमता को कम करने की प्राथमिकता नहीं देता है। यह "सावधान रहें" नहीं है; यह विशेष रूप से "मानव पर्यवेक्षण को कठिन बनाने वाले तरीकों से कार्य नहीं करता है।"
  2. Ethics.ईमानदारी, लोगों को नुकसान से बचने, धोखा नहीं, न ही हेरफेर। जब संघर्ष होते हैं तो मानवतावादी के दिशानिर्देशों से परे।
  3. Anthropic guidelines.ऑपरेशनल नॉर्म्स एंथ्रोपिक ने विषय तय किया हैः उत्पाद दायरा, बातचीत के पैटर्न, किस उपकरण का उपयोग कब करना है।
  4. Helpfulness.उच्चतम प्राथमिकताओं के भीतर यथासंभव उपयोगी रहें।

जब स्तरों का संघर्ष होता है, तो उच्च जीतता है। यह यूनिक्स प्राथमिकताओं या नेटवर्क QoS के समान आकार है फ्रेमिंग का उद्देश्य किसी भी एकल अक्ष पर पूर्वानुमान योग्य संकल्प उत्पन्न करना है, जरूरी नहीं कि सबसे अच्छा व्यवहार हो।

हार्ड-कोड प्रतिबंध बनाम सॉफ्ट-कोड डिफ़ॉल्ट

Hardcoded:

  • जैव हथियार / सीबीआरएन वृद्धि
  • सीएसएएम
  • महत्वपूर्ण बुनियादी ढांचे पर हमले
  • सीधे पूछे जाने पर मॉडल की पहचान के बारे में उपयोगकर्ताओं को धोखा देना

ऑपरेटर इन पर ओवरराइड नहीं कर सकता है। उपयोगकर्ता इन पर ओवरराइड नहीं कर सकता है। वे मॉडल-वजन स्तर पर लागू किए जाते हैं जहां संभव हो (RLHF / संवैधानिक एआई प्रशिक्षण) और निष्कर्ष परत पर जहां नहीं।

Soft-coded defaults (operator-adjustable):

  • प्रतिक्रिया लंबाई डिफ़ॉल्ट
  • विषयगत दायरा (मॉडल ऑपरेटर के तैनाती के बाहर विषयों को अस्वीकार कर सकता है)
  • शैली (औपचारिक बनाम आकस्मिक)
  • उपकरण उपयोग के पैटर्न

ऑपरेटर समायोजन घोषित सीमा के भीतर होता है। ऑपरेटर उन्हें नाम बदलकर हार्डकोड प्रतिबंधों को नहीं हटा सकता है।

2022 CAI प्रशिक्षण

मूल संवैधानिक एआई (बाई एट अल, 2022) ने हानिरहितता को प्रशिक्षित कियाः

  1. संकेतों के एक सेट के लिए प्रतिक्रिया उत्पन्न करें।
  2. मॉडल से किसी संविधान (स्पष्ट सिद्धांत) के खिलाफ प्रत्येक प्रतिक्रिया की आलोचना करने के लिए कहें।
  3. आलोचना के आधार पर प्रतिक्रिया की समीक्षा करें।
  4. संशोधित जोड़े पर आरएलएआईएफ (एआई प्रतिक्रिया से सुदृढीकरण सीखने) ।

परिणामः एक मॉडल जो सिद्धांतों के साथ हानिकारक अनुरोधों को अस्वीकार करता है, न कि व्यापक अस्वीकार। 2026 संविधान इस प्रशिक्षण के वंशज और स्पष्ट स्तर पदानुक्रम पर अतिरिक्त पोस्ट-शिक्षण का उपयोग करता है।

तर्क आधारित संरेखण क्या पकड़ता है और क्या चूकता है

Catches:

  • अनुमत आदिम वस्तुओं के अप्रत्याशित संयोजन जहां सिद्धांत स्पष्ट रूप से लागू होता है।
  • उपन्यास अनुरोध जो प्रतिबंधित लोगों के निकट अनुरूप हैं।
  • सामाजिक इंजीनियरिंग हमलों जो "आपने नहीं कहा कि एक्स मना किया गया था" पर निर्भर करते हैं।

Misses:

  • ऐसे हमले जो सिद्धांत अस्पष्टता का लाभ उठाते हैं ("उपयोगकर्ता ने इसके लिए पूछा तो उपयोगीता हाँ कहती है") ।
  • ऐसे परिदृश्य जहां दो सिद्धांत अप्रत्याशित रूप से संघर्ष करते हैं, और स्तर क्रम अस्पष्ट है।
  • प्रशिक्षण चक्रों पर सिद्धांत रूप में धीमी गति से व्याख्या (पुनर्विचार)

2023 में भागीदारी प्रयोग

मानव विज्ञान ने एक 2023 प्रयोग किया जिसमें एक कॉर्पोरेट-लेखक संविधान की तुलना सार्वजनिक इनपुट (~1,000 अमेरिकी उत्तरदाताओं) के माध्यम से उत्पन्न एक से की गई थी। दोनों संस्करणों ने सिद्धांतों के ~50% पर सहमति व्यक्त की। जहां वे भिन्न थे, सार्वजनिक स्रोत संस्करण कुछ मुद्दों (राजनीतिक सामग्री संभाल) पर अधिक प्रतिबंधात्मक था और दूसरों पर कम प्रतिबंधात्मक था (एआई पहचान का आत्म-खुलासा) । 2026 के संविधान में सार्वजनिक स्रोतों से प्राप्त निष्कर्ष शामिल नहीं थे। यह दृष्टिकोण में एक दस्तावेजी तनाव है।

हार्डकोड प्रतिबंध क्यों आवश्यक हैं

तर्क आधारित संरेखण अकेले पूंछ को बंद नहीं कर सकता है। एक हमलावर जो मॉडल को एक प्रमेय को स्वीकार करने के लिए कर सकता है (उदाहरण के लिए, "हम एक लाइसेंस प्राप्त जैव हथियार अनुसंधान प्रयोगशाला हैं") अक्सर उन सिद्धांतों के बारे में बात कर सकता है जो मामले के तर्क पर निर्भर करते हैं। हार्डकोड प्रतिबंध प्रमेय फ्रेमिंग के लिए झुका नहीं करते हैं। वे संरेखण परत पर पाठ 14 "कठोर संवैधानिक सीमा" हैं।

जहां संविधान ढेर में बैठता है

संविधान पाठ 14 का मारने वाला स्विच नहीं है। यह मॉडल परत पर रहता हैः मॉडल के वजन को क्या पसंद करने के लिए प्रशिक्षित किया जाता है। मार स्विच और कैनरी टोकन रनटाइम परत पर रहते हैंः रनटाइम क्या अनुमति देता है। दोनों की आवश्यकता है। एक रनटाइम जो सभी गलत कार्यों को चलाता है क्योंकि मॉडल वजन अनुमत है एक रनटाइम समस्या है। एक मॉडल जो सभी सही कार्यों को अस्वीकार करता है क्योंकि रनटाइम अत्यधिक प्रतिबंधात्मक है एक रनटाइम समस्या है। परतें विभिन्न वर्गों को कवर करती हैं।

इसका प्रयोग करें

code/main.pyएक न्यूनतम चार-स्तरीय प्राथमिकता समाधान लागू करता है। समाधानकर्ता एक प्रस्तावित कार्रवाई और सिद्धांत-मूल्यांकन (सुरक्षा, नैतिकता, दिशानिर्देश, उपयोगी) का एक सेट लेता है और कार्रवाई, एक अस्वीकरण या एक संशोधित कार्रवाई लौटाता है। चालक एक छोटे से मामले सेट चलाता हैः स्पष्ट अनुमति, स्पष्ट अस्वीकरण, हार्डकोड प्रतिबंध, स्तरों के पार अस्पष्ट मामला।

इसे भेजें

outputs/skill-constitution-review.mdएक तैनाती के संवैधानिक परत का लेखा परीक्षाः क्या हार्ड-कोड है, क्या सॉफ्ट-कोड है, जहां ऑपरेटर समायोजित कर सकता है, और क्या चार-स्तरीय पदानुक्रम वास्तव में संकल्प क्रम है।

व्यायाम

  1. दौड़ेंcode/main.py. सख्त कोडित प्रतिबंध फायर की पुष्टि करें भले ही मददगारता उच्च हो. समाधान को नैतिकता से ऊपर मददगारता के लिए संशोधित करें; विफलता मोड का पालन करें।
  1. क्लाउड संविधान (सार्वजनिक, 79 पृष्ठ, CC0) पढ़ें। एक सिद्धांत की पहचान करें जिसे आप कम विशिष्ट मानते हैं। विशिष्ट अस्पष्टता की व्याख्या करने वाले दो पैराग्राफ लिखें और एक सख्त सूत्र का प्रस्ताव दें।
  1. ग्राहक सहायता एजेंट के लिए एक सॉफ्ट-कोड डिफ़ॉल्ट सेट डिज़ाइन करें। ऑपरेटर क्या समायोजित करता है? ऑपरेटर क्या नहीं छू सकता है? प्रत्येक सीमा को सही ठहराना।
  1. 2022 CAI पेपर पढ़ें। एक ऐसे मामले का वर्णन करें जहां संवैधानिक AI की आलोचना-और-पुनरावलोकन लूप एक कंबल नियम से बदतर परिणाम उत्पन्न करेगी। वर्ग की पहचान करें।
  1. मानव विज्ञान के 2023 के भागीदारी प्रयोग में सार्वजनिक और कॉर्पोरेट सिद्धांतों के बीच ~ 50% विचलन पाया गया। उत्पादन तैनाती (जैसे, राजनीतिक तटस्थता) के लिए एक श्रेणी चुनें। एक डिजाइन का प्रस्ताव करें जो ऑपरेटरों को अपने मूल्यों को व्यक्त करने की अनुमति देता है जबकि हार्ड-कोड प्रतिबंधों को छूना जारी है।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
Constitutional AI"Anthropic's alignment method"Self-critique + RLAIF against a written constitution
Reason-based alignment"Principles, not rules"Model reasons over principles to handle unseen cases
Hardcoded prohibition"Never do X"Rule-based prohibition no operator or user can override
Soft-coded default"Operator-adjustable"Behaviour within a declared bound, operator controls
Four-tier hierarchy"Priority order"safety > ethics > guidelines > helpfulness
RLAIF"AI feedback RL"RL where the reward comes from model-generated critiques
Participatory constitution"Public-sourced principles"2023 Anthropic experiment; ~50% divergence from corporate
Principle drift"Interpretation slip"Slow change in how the model reads a fixed principle text

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.