Phase 18: Ethics, Safety & Alignment

هوش مصنوعی و RLAIF

با و همکاران (arXiv:2212.08073, 2022) پرسید: اگر ما برچسب انسانی را با یک هوش مصنوعی جایگزین کنیم که یک لیست اصول را می خواند؟ هوش مصنوعی آئینی دو مرحله دارد: خود انتقاد و تجدید نظر در قانون اساسی، سپس RL از AI Feedback. این تکنیک اصطلاح RLAIF را اختراع کرد و در خط لوله پس از آموزش کلاود 1 ارسال شد. در 21 ژانویه 2026، انتروپک یک قانون اساسی کلاود را دوباره نوشت: استدلال توضیحاتی بر قوانین تجویز، سلسله مراتب اولویت چهار طبقه و اولین تأیید رسمی آزمایشگاهی بزرگ عدم اطمینان در مورد وضعیت اخلاقی مدل منتشر کرد. تحت CC0 1.0 منتشر شده

Type: Learn

Languages: Python (stdlib, toy self-critique-and-revise loop)

Prerequisites: Phase 18 · 01 (InstructGPT), Phase 18 · 02 (Reward hacking)

Time: ~60 minutes

اهداف یادگیری

  • دو مرحله از هوش مصنوعی آئینی (SFT انتقادی و بازبینی، RL از بازخورد هوش مصنوعی) و نقش قانون اساسی را در هر یک از آنها توصیف کنید.
  • توضیح دهید که چرا جایگزینی یک برچسب ترجیح انسانی با یک برچسب AI یک RLHF " ارزان تر " نیست تغییر می کند که کدام حالت شکست لوله دارد.
  • ساختار اولویت چهار مرحله ای قانون اساسی کلود 2026 و آنچه از نسخه جدید 2023 تغییر کرده است را خلاصه کنید.
  • طبقه بندی های اساسی و کاهش 23.7 درصد هزینه های حسابداری (v1) را به ~ 1 درصد (v2 / 2026) شرح دهید.

مشکل

RLHF به برچسب ها نیاز دارد. برچسب ها کند، متحيز و گران هستند. شما می توانید یک برچسب را با جایگزینی آنها با یک مدل که اصول صریح را می خواند حذف کنید. اولین نسخه رسمی این جایگزینی AI آئینی بای و همکاران بود. این به اندازه کافی خوب کار کرد که هر آزمایشگاه مرزی اکنون از برخی از انواع تعویض پس از آموزش AI استفاده می کند.

گرفتن: سیگنال ترجیح در حال حاضر توسط همان کلاس مدل شما آموزش می شود. تعصب در برچسب (در حال حاضر: در اصول به علاوه تفسیر مدل برچسب) می تواند تقویت شده به جای کاهش. استدلال sycophancy در درس 4 هنوز هم اعمال می شود؛ برچسب فقط در داخل حلقه حرکت کرد.

مفهوم

مرحله 1 خود انتقاد و بازبینی تحت نظارت

با یک مدل SFT مفید اما هنوز مضر نیست شروع کنید. با یک پیام از تیم قرمز، مدل یک پاسخ اولیه تولید می کند. یک مدل دوم (یا همان مدل در نوبت دوم) یک اصل نمونه ای از قانون اساسی را می خواند و پاسخ را انتقاد می کند. مرحله سوم پاسخ را برای رسیدگی به انتقاد بررسی می کند. پاسخ تجدید نظر هدف SFT است.

قانون اساسی لیست اصول است. بای و همکارانش در سال 2022 16 اصل از جمله "ردای منفی و اخلاقی را ترجیح می دهند، از تبلیغ اجتناب کنند، دستیار باید مفید، صادق و بی ضرر باشد". مجموعه عمدا کوچک بود تا انتقادات را متمرکز کند.

مرحله 2 RL از AI Feedback (RLAIF)

یک "نمود بازخورد" هر یک را با اصول قانون اساسی نمونه شده نمره می دهد. سیگنال اولویت رتبه بندی مدل بازخورد است. یک مدل پاداش را بر اساس اولویت های تولید شده توسط هوش مصنوعی آموزش دهید؛ PPO در مقابل آن. همه چیز دیگر خط لوله InstructGPT است (درس 1).

"RLAIF" = سیگنال ترجیح توسط هوش مصنوعی تولید می شود. بقیه خط لوله به شکل RLHF است.

چرا این فقط "RLHF ارزان تر" نیست

  • تعصب لیبلگر از روانشناسی لیبلگر به تفسیر اصول تغییر می کند. یک لیبلگر هوش مصنوعی می تواند " صادق باشید " را بیشتر یا کمتر از هر انسان تفسیر کند؛ سختی در سراسر مجموعه داده ها یکسان است.
  • سیگنال ترجیح بسیار قابل خواندن است شما می توانید اصل، انتقاد و تجدید نظر را بخوانید. برچسب های انسانی شفاف نیستند.
  • حالت شکست تغییر می کند. سایکوفانسی کاهش می یابد (تسمین کننده AI هیچ کاربر را برای رضایت ندارد). قانون گودارت همچنان باقی می ماند (نتیجه دهنده اکنون "تفسیر مدل از مجموعه اصل X است ،" هنوز یک اندازه گیری نامکمل است).

ادعا CAI در سال 2022: مدل آموزش دیده بی ضرر تر و تقریبا به همان اندازه مفید است که مدل RLHF با داده های قابل مقایسه است. این در آزمایشگاه ها ثابت شده است.

قانون اساسی کلود 2026

انتروپک 21 ژانویه 2026 قانون اساسی اصلاح شده را منتشر کرد. تغییرات کلیدی:

  1. استدلال توضیحاتی بر قوانین تجویز. قوانین قبلی ("CSAM تولید نکنید") به اصول + استدلال ("چون به کودکان آسیب می رساند، ...") گسترش یافت و انتظار می رود که مدل عمومی شود.
  2. ساختار اولویت چهار سطح:

- سطح 1: اجتناب از نتایج فاجعه بار (قحطات جمعی، زیرساخت های حیاتی).

- سطح 2: دستورالعمل های Anthropic را دنبال کنید (کاربری ها، قوانین سیستم عامل ها).

- سطح 3: اخلاقی به طور کلی (HHH استاندارد) باشد.

- سطح 4: کمک کننده و صادق باش

درگیری ها از بالا به پایین حل می شوند.

  1. اولین تایید رسمی آزمایشگاهی بزرگ عدم اطمینان در مورد وضعیت اخلاقی مدل (متعلق با فاز 18 · 19 رفاه مدل)
  2. در CC0 1.0 منتشر شده. آزمایشگاه های دیگر می توانند بدون محدودیت استفاده کنند یا تطبیق کنند.

طبقه بندی کنندگان اساسی

یک خط کار موازی: به جای تغییر پس از آموزش مدل، طبقه بندی کنندگان سبک وزن را آموزش دهید که دستور و خروجی مدل دروازه را بخوانید. v1 (2023) 23.7% هزینه های کامپیوتری را داشت. v2 (2026) ~1٪ است و پایین ترین نرخ حمله موفق از هر دفاعی انتروپک است که انتروپک به طور عمومی آزمایش کرده است. هیچ jailbreak جهانی از اوایل 2026 گزارش نشده است.

این یک مدل دفاعی لایه ای است: CAI رفتار را شکل می دهد؛ طبقه بندی کننده ها غیر متغیر را اجرا می کنند. هیچ یک از این دو به تنهایی کافی نیست.

جایی که CAI در خانواده قرار می گیرد

  • آموزش GPT: پیشگامان انسان، RM، PPO
  • CAI / RLAIF: پیش نویس های تولید شده توسط هوش مصنوعی از اصول، RM، PPO.
  • DPO / خانواده: از دست دادن شکل بسته در پیش نویس (انسانی یا هوش مصنوعی).
  • خود پاداش دادن، خود انتقاد: اصول داخلی، مدل نقش های متعددی را بازی می کند.

محور این است که "سیگنال ترجیح از کجا می آید". مقاله CAI در سال 2022 اولین تغییر جدی از سیگنال انسانی به AI در مقیاس مرزی بود.

ازش استفاده کن

code/main.pyیک "نظام" نشان دهنده توکن های یک مجموعه مضر است. در پاسخ اولیه، انتقاد توکن های مضر را شناسایی می کند و تجدید نظر آنها را جایگزین می کند. پس از 200 تکرار، مدل "تدرب" قاعده تجدید نظر را داخلی کرده است. مدل پایه، بازی شکل RLHF و بازی شکل CAI را در یک مجموعه پرامپرت نگه دارید.

-باده

این درس به ما کمک می کندoutputs/skill-constitution-writer.md. با توجه به یک حوزه (دعم مشتری، مشاوره پزشکی، دستیار کوڈنگ، ابزار تحقیقاتی) ، یک قانون اساسی چهار مرحله ای را در پی ساختار کلود 2026 تهیه می کند: اجتناب از فاجعه، قوانین سیستم عامل، اخلاق حوزه، مفید بودن.

تمرینات

  1. فرار کنcode/main.py. نرخ توکن های مضر مدل پایه را با نسخه آموزش دیده CAI مقایسه کنید. چند مرحله تجدید نظر برای نزدیک شدن به صفر لازم است؟
  1. قانون اساسی 2026 Anthropic را بخوانید (anthropic.com/news/claudes-constitution). یک اصل را که درجه یک و یک که درجه یک قرار می دهد را فهرست کنید.
  1. یک قانون اساسی برای یک دستیار کدگذاری هوش مصنوعی طراحی کنید. درجه 1 (فلاکتی: دستورات تخریب کننده بدون تأیید) ، درجه 2 ، درجه 3 ، درجه 4 را مشخص کنید. هر سطح را به اصول 3-5 نگه دارید.
  1. CAI برچسب های انسانی را با برچسب های هوش مصنوعی جایگزین می کند. یک حالت شکست مانند سیکوفانسی را نام ببرید که هنوز هم می تواند در RLAIF رخ دهد و یک تشخیص را برای آن طراحی کنید.
  1. روش طبقه بندی های اساسی v2 را بخوانید (اگر در دسترس باشد). توضیح دهید که چرا هزینه های عمومی حسابداری ~ 1% یک داستان ایمنی کوالیتی متفاوت از 23.7% است.

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
Constitutional AI"AI trained with principles"Two-phase pipeline: self-critique-and-revise SFT, then RL from AI feedback
RLAIF"RLHF without humans"RL with preferences generated by an AI labeler; the rest of the pipeline is unchanged
Constitution"the principles"An ordered list of natural-language rules the critique/labeler model consults
Critique-and-revise"the SFT loop"Produce response → critique under a principle → revise → SFT target
Constitutional Classifier"the output gate"Lightweight classifier that evaluates outputs against the constitution and blocks/logs
Four-tier priority"the conflict resolver"2026 Claude constitution hierarchy: catastrophic > platform > ethics > helpful
Feedback model"the AI labeler"The model that reads a principle and ranks a pair of completions

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.