Phase 15: Autonomous Systems

هوش مصنوعی و قانون اساسی از دست می دهد

قانون اساسی کلود 22 ژانویه 2026 Anthropic 79 صفحه دارد و CC0 است. این از تنظیم مبتنی بر قوانین به تنظیم مبتنی بر عقل حرکت می کند و سلسله مراتب اولویت چهار مرحله ای را ایجاد می کند: (1) ایمنی و حمایت از نظارت انسانی، (2) اخلاق، (3) دستورالعمل های بشری، (4) مفید. رفتارهای تقسیم شده به ممنوعیت های سخت کد (توسع سلاح های زیستی، CSAM) که اپراتورها و کاربران نمی توانند از آن ها استفاده کنند و معیارهای نرم کد که اپراتورها می توانند در حدود مشخص تنظیم کنند. نسخه اصلی 2022 (Bai و همکاران) بی ضرر بودن را از طریق انتقاد از خود و RLAIF علیه یک قانون اساسی آموزش داد. نکته ی صادقانه: تعادل مبتنی بر عقل بر روی مدل ای که اصول را به موقعیت های غیر منتظره عام می کند، متکی است. آزمایش شرکت کننده خود Anthropic در سال 2023 نشان داد که بین اصول عمومی و شرکت ها بین حدود 50٪ تفاوت وجود دارد؛ نسخه 2026 این یافته ها را شامل نمی کند.

Type: Learn

Languages: Python (stdlib, four-tier priority resolver)

Prerequisites: Phase 15 · 06 (Automated alignment research), Phase 15 · 10 (Permission modes)

Time: ~60 minutes

مشکل

یک عامل در میدان داده شده ورودی هایی را می بیند که طراحان آن هرگز نمی بینند. هیچ لیست قواعد به اندازه کافی طولانی نیست تا آنها را پوشش دهد. هیچ لیست قواعد به اندازه کافی کوتاه نیست تا به سرعت تحت فشار کامپیوتری اعمال شود. سوال عملی: چگونه یک عامل را با اصول که هم از یک ردیف طولانی از موارد و هم نتیجه گیری سریع زنده می مانند، هماهنگ می کنید؟

تنظیمات مبتنی بر قوانین (RBA): فهرست هر چیزی که مجاز نیست. سریع برای بررسی، آسان برای حسابرسی، غیرممکن برای نگه داشتن در حال حاضر، اغلب بیش از حد رد می کند که آن را پیش بینی نمی کند. تنظیمات مبتنی بر دلیل (اساس قانون کلود 2026): کد اصول، اجازه دهید مدل استدلال. مقیاس در موارد ناشناخته، سخت تر برای حسابرسی، حالت شکست است اصول سوء استفاده به جای miss-the-قاعده.

قانون اساسی 2026 موضع صریح وسط را می گیرد. ممنوعیت های سخت کد شده چیزهایی که اشتباه آنها به زمینه بستگی ندارد (توسعه سلاح های زیستی، CSAM) RBA هستند: هرگز، بدون توجه به دستورالعمل های اپراتور یا کاربر. همه چیز دیگر در یک سلسله مراتب چهار طبقه مبتنی بر عقل است: ایمنی و حمایت از نظارت انسانی در اول؛ اخلاق دوم؛ دستورالعمل های اعلام شده توسط انسان سوم؛ مفید بودن در آخر. اپراتورها می توانند معیارهای پیش فرض را در منطقه نرم کد بندی کنند اما نمی توانند به ممنوعیت های سخت کد بندی شده دست یابند.

مفهوم

سلسله مراتب اولویت چهار سطح

  1. Safety and supporting human oversight.بالاترین. مدل اولویت بندی نمی کند توانایی انسان ها و انسان ها را برای نظارت و اصلاح هوش مصنوعی تضعیف کند. این "حذر باشید" نیست؛ به طور خاص "به گونه ای عمل نکنید که نظارت انسانی را دشوارتر کند".
  2. Ethics.صداقت، اجتناب از آسیب به افراد، فریب دادن، دستکاری کردن، از دستورالعمل های انتروپک در هنگام تعارض فراتر می رود.
  3. Anthropic guidelines.قوانین عملیاتی آنترپیک موضوع را تعیین کرده است: دامنه محصول، الگوهای تعامل، چه ابزار هایی را که چه زمانی استفاده می کنند.
  4. Helpfulness.کمترین، تا جایی که ممکن است در اولویت های بالاتر مفید باشید.

در هنگام تعارض سطوح، بالاتر برنده می شود. این شکل مشابه اولویت های یونیکس یا QoS شبکه است.

ممنوعیت های سخت کد در مقابل معیارهای نرم کد

Hardcoded:

  • سلاح های زیستی / ارتقاء CBRN
  • CSAM
  • حملات به زیرساخت های حیاتی
  • فریب دادن کاربران در مورد هویت مدل در هنگام پرسیدن مستقیما

اپراتور نمی تواند این موارد را رد کند. کاربر نمی تواند این موارد را رد کند. آنها در سطح وزن مدل در صورت امکان (تدرب RLHF / آموزش AI آئینی) و در سطح نتیجه گیری در صورت عدم اعمال آنها اعمال می شوند.

Soft-coded defaults (operator-adjustable):

  • طول پاسخ به طور پیش فرض
  • دامنه موضعی (نمونه می تواند موضوعات خارج از انتشار اپراتور را رد کند)
  • سبک (رسمی به نسبت آرام)
  • الگوهای استفاده از ابزار

تنظیمات اپراتور در داخل یک محدوده اعلام شده اتفاق می افتد. اپراتور نمی تواند ممنوعیت های سخت کد شده را با تغییر نام آنها حذف کند.

آموزش CAI 2022

هوش مصنوعی اساسی اصلی (Bai et al., 2022) بی ضرر بودن را آموزش داد:

  1. پاسخ به مجموعه ای از پیام ها را تولید کنید.
  2. از مدل بخواهید که هر پاسخ را علیه یک قانون اساسی (مبادئ صریح) انتقاد کند.
  3. بر اساس انتقاد پاسخ را بررسی کنید.
  4. RLAIF (تعلیم تقویت از بازخورد هوش مصنوعی) در زوج های تجدید نظر.

نتیجه: یک مدل که درخواست های مضر را با توضیحات اصول پذیرفته و نه رد کلی رد می کند. قانون اساسی 2026 از یک نسل از این آموزش و پس از آموزش اضافی در سلسله مراتب صریح استفاده می کند.

چه تعادل مبتنی بر عقل را می گیرد و از دست می دهد

Catches:

  • ترکیب های غیر منتظره از ابتدایی های مجاز که در آن اصل به وضوح اعمال می شود.
  • درخواست های رمان که شبیه به درخواست های ممنوعه هستند.
  • حملات مهندسی اجتماعی که بر اساس "تو نگفتی "ایکس" ممنوعه است

Misses:

  • حملات که از مبهم بودن اصل استفاده می کنند ("استفاده کننده درخواست این را به طوری که مفید است می گوید بله").
  • سناریوهای که دو اصل به صورت غیر منتظره در تضاد قرار می گیرند و ترتیب سطح ها مبهم است.
  • فرش آهسته در تفسیر اصول در چرخه های آموزشی (ترجمهایی مجدد).

آزمایش شرکت کننده 2023

انتروپک یک آزمایش سال 2023 را انجام داد که یک قانون اساسی توسط شرکت ها با قانون اساسی تولید شده از طریق ورودی عمومی (~1,000 پاسخ دهندگان آمریکایی) مقایسه می کند. دو نسخه در مورد ~ 50٪ از اصول توافق کردند. در جایی که آنها متمایز بودند، نسخه منابع عمومی در برخی از مسائل (تعامل با محتوای سیاسی) محدودتر و در موارد دیگر محدودتر بود (خود افشای هویت هوش مصنوعی). قانون اساسی 2026 یافته های منابع عمومی را شامل نکرد. این یک تنش مستند در رویکرد است.

چرا ممنوعیت های سخت کد لازم است

یک مهاجم که می تواند مدل را برای پذیرش یک پیش فرض (به عنوان مثال "ما یک آزمایشگاه تحقیقاتی سلاح های زیستی مجوز) می تواند اغلب از اصول گذشته که به استدلال موردی بستگی دارد صحبت کند. ممنوعیت های سخت کد به فریم بندی پیش فرض خم نمی شوند. آنها درسی 14 "حد اساسی سخت" در لایه خط ساز هستند.

جایی که قانون اساسی در این دسته قرار دارد

قانون اساسی، کلید کشتن درس 14 نیست. در لایه مدل زندگی می کند: وزن های مدل برای ترجیح دادن آموزش دیده اند. سوئیچ های کتیل و توکن های کاناری در لایه رن تایم زنده هستند: آنچه که رن تایم اجازه می دهد. هر دو مورد لازم است یک زمان اجرا که تمام اقدامات اشتباه را به دلیل وزن های مدل اجازه می دهد یک مشکل زمان اجرا است. یک مدل که از تمام اقدامات درست به خاطر زمان اجرا بیش از حد محدود کننده است، مخالفت می کند، یک مشکل زمان اجرا است. لایه ها کلاس های مختلف را پوشش می دهند.

ازش استفاده کن

code/main.pyیک حل کننده یک اقدام پیشنهادی و مجموعه ای از ارزیابی های اصل (سلامت، اخلاق، دستورالعمل ها، مفید بودن) را انجام می دهد و عمل، انکار یا عمل اصلاح شده را باز می گرداند. راننده یک مجموعه کوچک موارد را اجرا می کند: اجازه واضح، اجازه روشن، ممنوعیت سخت کد، مورد مبهم در سراسر سطوح.

-باده

outputs/skill-constitution-review.mdبررسی لایه اساسی یک پیاده سازی: چه چیزی سخت کدگذاری شده، چه چیزی نرم کدگذاری شده، در کجا ممکن است اپراتور تنظیم شود و آیا سلسله مراتب چهار طبقه در واقع نظم رزولوشن است.

تمرینات

  1. فرار کنcode/main.py.آزمایش های ممنوعیت سخت کد شده را حتی در زمانی که مفید بودن بالا باشد تایید کنید. حل کننده را به وزن مفید بودن بالاتر از اخلاق تغییر دهید؛ حالت شکست را مشاهده کنید.
  1. قانون اساسی کلاود را بخوانید (عامتی، 79 صفحه، CC0). یک اصل را که فکر می کنید کم مشخص شده است، شناسایی کنید. دو پاراگراف را بنویسید که مبهمیت خاص را توضیح می دهد و یک فرمول دقیق تری را پیشنهاد می کند.
  1. یک تنظیم پیش فرض نرم کد برای یک نماینده پشتیبانی مشتری طراحی کنید. عامل چه چیزی را تنظیم می کند؟ عامل چه چیزی را نمی تواند لمس کند؟ هر مرز را توجیه کنید.
  1. مقاله بای و همکاران CAI 2022 را بخوانید. یک مورد را توصیف کنید که در آن حلقه انتقاد و بررسی AI قانون اساسی نتیجه بدتر از یک قانون کلی را تولید می کند. کلاس را شناسایی کنید.
  1. آزمایش مشارکت Anthropic در سال 2023 تفاوت بین اصول عمومی و شرکتی را حدود 50٪ یافت. یک دسته را انتخاب کنید که در آن برای انتشار تولید (به عنوان مثال ، خنثییت سیاسی) اهمیت دارد. یک طرح را پیشنهاد کنید که به اپراتور ها اجازه می دهد ارزش های خود را بیان کنند در حالی که ممنوعیت های سختکده نشده باقی می ماند.

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
Constitutional AI"Anthropic's alignment method"Self-critique + RLAIF against a written constitution
Reason-based alignment"Principles, not rules"Model reasons over principles to handle unseen cases
Hardcoded prohibition"Never do X"Rule-based prohibition no operator or user can override
Soft-coded default"Operator-adjustable"Behaviour within a declared bound, operator controls
Four-tier hierarchy"Priority order"safety > ethics > guidelines > helpfulness
RLAIF"AI feedback RL"RL where the reward comes from model-generated critiques
Participatory constitution"Public-sourced principles"2023 Anthropic experiment; ~50% divergence from corporate
Principle drift"Interpretation slip"Slow change in how the model reads a fixed principle text

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.