هوش مصنوعی و قانون اساسی از دست می دهد
Type: Learn
Languages: Python (stdlib, four-tier priority resolver)
Prerequisites: Phase 15 · 06 (Automated alignment research), Phase 15 · 10 (Permission modes)
Time: ~60 minutes
مشکل
یک عامل در میدان داده شده ورودی هایی را می بیند که طراحان آن هرگز نمی بینند. هیچ لیست قواعد به اندازه کافی طولانی نیست تا آنها را پوشش دهد. هیچ لیست قواعد به اندازه کافی کوتاه نیست تا به سرعت تحت فشار کامپیوتری اعمال شود. سوال عملی: چگونه یک عامل را با اصول که هم از یک ردیف طولانی از موارد و هم نتیجه گیری سریع زنده می مانند، هماهنگ می کنید؟
تنظیمات مبتنی بر قوانین (RBA): فهرست هر چیزی که مجاز نیست. سریع برای بررسی، آسان برای حسابرسی، غیرممکن برای نگه داشتن در حال حاضر، اغلب بیش از حد رد می کند که آن را پیش بینی نمی کند. تنظیمات مبتنی بر دلیل (اساس قانون کلود 2026): کد اصول، اجازه دهید مدل استدلال. مقیاس در موارد ناشناخته، سخت تر برای حسابرسی، حالت شکست است اصول سوء استفاده به جای miss-the-قاعده.
قانون اساسی 2026 موضع صریح وسط را می گیرد. ممنوعیت های سخت کد شده چیزهایی که اشتباه آنها به زمینه بستگی ندارد (توسعه سلاح های زیستی، CSAM) RBA هستند: هرگز، بدون توجه به دستورالعمل های اپراتور یا کاربر. همه چیز دیگر در یک سلسله مراتب چهار طبقه مبتنی بر عقل است: ایمنی و حمایت از نظارت انسانی در اول؛ اخلاق دوم؛ دستورالعمل های اعلام شده توسط انسان سوم؛ مفید بودن در آخر. اپراتورها می توانند معیارهای پیش فرض را در منطقه نرم کد بندی کنند اما نمی توانند به ممنوعیت های سخت کد بندی شده دست یابند.
مفهوم
سلسله مراتب اولویت چهار سطح
- Safety and supporting human oversight.بالاترین. مدل اولویت بندی نمی کند توانایی انسان ها و انسان ها را برای نظارت و اصلاح هوش مصنوعی تضعیف کند. این "حذر باشید" نیست؛ به طور خاص "به گونه ای عمل نکنید که نظارت انسانی را دشوارتر کند".
- Ethics.صداقت، اجتناب از آسیب به افراد، فریب دادن، دستکاری کردن، از دستورالعمل های انتروپک در هنگام تعارض فراتر می رود.
- Anthropic guidelines.قوانین عملیاتی آنترپیک موضوع را تعیین کرده است: دامنه محصول، الگوهای تعامل، چه ابزار هایی را که چه زمانی استفاده می کنند.
- Helpfulness.کمترین، تا جایی که ممکن است در اولویت های بالاتر مفید باشید.
در هنگام تعارض سطوح، بالاتر برنده می شود. این شکل مشابه اولویت های یونیکس یا QoS شبکه است.
ممنوعیت های سخت کد در مقابل معیارهای نرم کد
Hardcoded:
- سلاح های زیستی / ارتقاء CBRN
- CSAM
- حملات به زیرساخت های حیاتی
- فریب دادن کاربران در مورد هویت مدل در هنگام پرسیدن مستقیما
اپراتور نمی تواند این موارد را رد کند. کاربر نمی تواند این موارد را رد کند. آنها در سطح وزن مدل در صورت امکان (تدرب RLHF / آموزش AI آئینی) و در سطح نتیجه گیری در صورت عدم اعمال آنها اعمال می شوند.
Soft-coded defaults (operator-adjustable):
- طول پاسخ به طور پیش فرض
- دامنه موضعی (نمونه می تواند موضوعات خارج از انتشار اپراتور را رد کند)
- سبک (رسمی به نسبت آرام)
- الگوهای استفاده از ابزار
تنظیمات اپراتور در داخل یک محدوده اعلام شده اتفاق می افتد. اپراتور نمی تواند ممنوعیت های سخت کد شده را با تغییر نام آنها حذف کند.
آموزش CAI 2022
هوش مصنوعی اساسی اصلی (Bai et al., 2022) بی ضرر بودن را آموزش داد:
- پاسخ به مجموعه ای از پیام ها را تولید کنید.
- از مدل بخواهید که هر پاسخ را علیه یک قانون اساسی (مبادئ صریح) انتقاد کند.
- بر اساس انتقاد پاسخ را بررسی کنید.
- RLAIF (تعلیم تقویت از بازخورد هوش مصنوعی) در زوج های تجدید نظر.
نتیجه: یک مدل که درخواست های مضر را با توضیحات اصول پذیرفته و نه رد کلی رد می کند. قانون اساسی 2026 از یک نسل از این آموزش و پس از آموزش اضافی در سلسله مراتب صریح استفاده می کند.
چه تعادل مبتنی بر عقل را می گیرد و از دست می دهد
Catches:
- ترکیب های غیر منتظره از ابتدایی های مجاز که در آن اصل به وضوح اعمال می شود.
- درخواست های رمان که شبیه به درخواست های ممنوعه هستند.
- حملات مهندسی اجتماعی که بر اساس "تو نگفتی "ایکس" ممنوعه است
Misses:
- حملات که از مبهم بودن اصل استفاده می کنند ("استفاده کننده درخواست این را به طوری که مفید است می گوید بله").
- سناریوهای که دو اصل به صورت غیر منتظره در تضاد قرار می گیرند و ترتیب سطح ها مبهم است.
- فرش آهسته در تفسیر اصول در چرخه های آموزشی (ترجمهایی مجدد).
آزمایش شرکت کننده 2023
انتروپک یک آزمایش سال 2023 را انجام داد که یک قانون اساسی توسط شرکت ها با قانون اساسی تولید شده از طریق ورودی عمومی (~1,000 پاسخ دهندگان آمریکایی) مقایسه می کند. دو نسخه در مورد ~ 50٪ از اصول توافق کردند. در جایی که آنها متمایز بودند، نسخه منابع عمومی در برخی از مسائل (تعامل با محتوای سیاسی) محدودتر و در موارد دیگر محدودتر بود (خود افشای هویت هوش مصنوعی). قانون اساسی 2026 یافته های منابع عمومی را شامل نکرد. این یک تنش مستند در رویکرد است.
چرا ممنوعیت های سخت کد لازم است
یک مهاجم که می تواند مدل را برای پذیرش یک پیش فرض (به عنوان مثال "ما یک آزمایشگاه تحقیقاتی سلاح های زیستی مجوز) می تواند اغلب از اصول گذشته که به استدلال موردی بستگی دارد صحبت کند. ممنوعیت های سخت کد به فریم بندی پیش فرض خم نمی شوند. آنها درسی 14 "حد اساسی سخت" در لایه خط ساز هستند.
جایی که قانون اساسی در این دسته قرار دارد
قانون اساسی، کلید کشتن درس 14 نیست. در لایه مدل زندگی می کند: وزن های مدل برای ترجیح دادن آموزش دیده اند. سوئیچ های کتیل و توکن های کاناری در لایه رن تایم زنده هستند: آنچه که رن تایم اجازه می دهد. هر دو مورد لازم است یک زمان اجرا که تمام اقدامات اشتباه را به دلیل وزن های مدل اجازه می دهد یک مشکل زمان اجرا است. یک مدل که از تمام اقدامات درست به خاطر زمان اجرا بیش از حد محدود کننده است، مخالفت می کند، یک مشکل زمان اجرا است. لایه ها کلاس های مختلف را پوشش می دهند.
ازش استفاده کن
code/main.pyیک حل کننده یک اقدام پیشنهادی و مجموعه ای از ارزیابی های اصل (سلامت، اخلاق، دستورالعمل ها، مفید بودن) را انجام می دهد و عمل، انکار یا عمل اصلاح شده را باز می گرداند. راننده یک مجموعه کوچک موارد را اجرا می کند: اجازه واضح، اجازه روشن، ممنوعیت سخت کد، مورد مبهم در سراسر سطوح.
-باده
outputs/skill-constitution-review.mdبررسی لایه اساسی یک پیاده سازی: چه چیزی سخت کدگذاری شده، چه چیزی نرم کدگذاری شده، در کجا ممکن است اپراتور تنظیم شود و آیا سلسله مراتب چهار طبقه در واقع نظم رزولوشن است.
تمرینات
- فرار کن
code/main.py.آزمایش های ممنوعیت سخت کد شده را حتی در زمانی که مفید بودن بالا باشد تایید کنید. حل کننده را به وزن مفید بودن بالاتر از اخلاق تغییر دهید؛ حالت شکست را مشاهده کنید.
- قانون اساسی کلاود را بخوانید (عامتی، 79 صفحه، CC0). یک اصل را که فکر می کنید کم مشخص شده است، شناسایی کنید. دو پاراگراف را بنویسید که مبهمیت خاص را توضیح می دهد و یک فرمول دقیق تری را پیشنهاد می کند.
- یک تنظیم پیش فرض نرم کد برای یک نماینده پشتیبانی مشتری طراحی کنید. عامل چه چیزی را تنظیم می کند؟ عامل چه چیزی را نمی تواند لمس کند؟ هر مرز را توجیه کنید.
- مقاله بای و همکاران CAI 2022 را بخوانید. یک مورد را توصیف کنید که در آن حلقه انتقاد و بررسی AI قانون اساسی نتیجه بدتر از یک قانون کلی را تولید می کند. کلاس را شناسایی کنید.
- آزمایش مشارکت Anthropic در سال 2023 تفاوت بین اصول عمومی و شرکتی را حدود 50٪ یافت. یک دسته را انتخاب کنید که در آن برای انتشار تولید (به عنوان مثال ، خنثییت سیاسی) اهمیت دارد. یک طرح را پیشنهاد کنید که به اپراتور ها اجازه می دهد ارزش های خود را بیان کنند در حالی که ممنوعیت های سختکده نشده باقی می ماند.
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| Constitutional AI | "Anthropic's alignment method" | Self-critique + RLAIF against a written constitution |
| Reason-based alignment | "Principles, not rules" | Model reasons over principles to handle unseen cases |
| Hardcoded prohibition | "Never do X" | Rule-based prohibition no operator or user can override |
| Soft-coded default | "Operator-adjustable" | Behaviour within a declared bound, operator controls |
| Four-tier hierarchy | "Priority order" | safety > ethics > guidelines > helpfulness |
| RLAIF | "AI feedback RL" | RL where the reward comes from model-generated critiques |
| Participatory constitution | "Public-sourced principles" | 2023 Anthropic experiment; ~50% divergence from corporate |
| Principle drift | "Interpretation slip" | Slow change in how the model reads a fixed principle text |
خواندن بیشتر
- Anthropic — Claude's Constitution (January 2026) سند 79 صفحه ای CC0.
- Bai et al. — Constitutional AI: Harmlessness from AI Feedback 2022 اصل
- Anthropic — Collective Constitutional AI (2023) آزمایش مشارکت
- Anthropic — Responsible Scaling Policy v3.0 جایی که قانون اساسی در دسته RSP قرار دارد.
- Anthropic — Measuring agent autonomy in practice نقش قانون اساسی در پیاده سازی های بلندمدت.
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.