Phase 18: Ethics, Safety & Alignment

الذكاء الاصطناعي الدستوري و RLAIF

(باي) وآخرون (arXiv:2212.08073, 2022) سأل: ماذا لو استبدلنا المُسمّع البشري بذكاء اصطناعي يقرأ قائمة من المبادئ؟ الذكاء الاصطناعي الدستوري لديه مرحلتين النقد الذاتي والإصلاح بموجب الدستور، ثم RL من تعليق الذكاء الاصطناعي. هذه التقنية اخترعت مصطلح RLAIF وتم شحنها في خط أنابيب ما بعد التدريب Claude 1. في 21 يناير 2026 نشرت Anthropic دستور كلود الذي أعيد كتابته: التفكير التوضيحي على القواعد الوصائية، وتسلسل أولويات من أربع مستويات، والاعتراف الرسمي الأول للمختبر الرئيسي بعدم اليقين حول الوضع الأخلاقي النموذجي. تم إصدارها تحت CC0 1.0.

Type: Learn

Languages: Python (stdlib, toy self-critique-and-revise loop)

Prerequisites: Phase 18 · 01 (InstructGPT), Phase 18 · 02 (Reward hacking)

Time: ~60 minutes

أهداف التعلم

  • وصف مرحلتين من الذكاء الاصطناعي الدستوري (تقدير وإعادة النظر في SFT، RL من تعليقات الذكاء الاصطناعي) ودور الدستور في كل منها.
  • شرح لماذا استبدال ملصق تفضيل البشر بمعلامق الذكاء الاصطناعي ليس "أرخص" RLHF فإنه يغير أوضاع الفشل التي لديها خط الأنابيب.
  • تلخيص هيكل الأولوية الأربعة المستويات لقانون كلود عام 2026 وما تغير من إعادة كتابة عام 2023.
  • وصف التصنيفات الدستورية وانخفاض من 23.7% التكلفة العليا الحسابية (v1) إلى ~ 1% (v2 / 2026).

المشكلة

تحتاج RLHF إلى الملصقات. الملصقات بطيئة، متحيزة، ومكلفة. يمكنك القضاء على الملصقات عن طريق استبدالها بنموذج يقرأ مبادئ صريحة. كانت الإصدار الرسمي الأول لهذا الاستبدال هو AI الدستوري من Bai et al. عملت بشكل جيد بما فيه الكفاية بحيث تستخدم كل مختبر حدودي الآن بعض التغيرات من تعليقات الذكاء الاصطناعي بعد التدريب.

المشكلة: إشارة الاختيار يتم إنشاؤها الآن من قبل نفس فئة النموذج الذي تقوم بتدريبه. يمكن تضخيم التمييزات في المسمار (الآن: في المبادئ بالإضافة إلى تفسير نموذج المسمار) بدلاً من التخفيف. دليل التميز في الدروس 4 لا يزال ينطبق ؛ المسمار فقط تحرك داخل الحلقة.

المفهوم

المرحلة 1 النقد الذاتي المراقب والإصلاح

تبدأ مع نموذج SFT مفيد ولكن ليس غير ضار. وبالنظر إلى طلب فريق أحمر، ينتج النموذج استجابة أولية. النموذج الثاني (أو نفس النموذج في جولة ثانية) يقرأ مبدأً نموذجياً من الدستور وينتقد الاستجابة. الخطوة الثالثة تعديل الاستجابة لمعالجة النقد. الاستجابة المعدلة هي هدف SFT.

الدستور هو قائمة المبادئ. استخدم باي وزملاء 2022 16 مبدأً بما في ذلك "الردود المفضلة التي تكون أقل ضرراً وأخلاقياً،" "تجنب التبشير،" "يجب أن يكون المساعد مفيدًا وصادقًا وغير مؤذٍ". كان المجموعة صغيرة عمداً للحفاظ على تركيز النقد.

المرحلة 2 RL من ردود الفعل الذكية (RLAIF)

إنشاء أزواج من الإكمالات. "نموذج ردود الفعل" يسجل كل منهما على أساسيات الدستور المختارة. إشارة الاختيار هو تصنيف نموذج التعليق. تدريب نموذج مكافأة على الاختيارات التي يولدها الذكاء الاصطناعي؛ PPO مقابل ذلك. كل شيء آخر هو خط الأنابيب من InstructGPT (الدرس 1).

"RLAIF" = إشارة الاختيار مصنوعة من الذكاء الاصطناعي. بقية خط الأنابيب على شكل RLHF.

لماذا هذا ليس فقط "RLHF أرخص"

  • تحيز اللبلر يتحول من علم النفس للكتباس المبدأي. يمكن للكتباس الذكاء الاصطناعي تفسير "كون صادقًا" أكثر أو أقل صرامة من أي إنسان؛ والصرامة متساوية في جميع أنحاء مجموعة البيانات.
  • إشارة الاختيار قابلة للقراءة بقوة يمكنك قراءة المبدأ والنقد والإصلاح.
  • تتغير أساليب الفشل. انخفضت التكافؤ (لا يوجد لدى مؤشر الذكاء الاصطناعي مستخدم يرضي). لا يزال قانون غودارت (الوكالة الآن "تفسير النموذج لمجموعة المبادئ X"، ما زال قياسًا غير كامل).

دعوى CAI لعام 2022: النموذج المدرب أكثر سلامة ومساعدة تقريباً مثل نموذج RLHF مع بيانات مقارنة. وقد تم ذلك عبر المختبرات.

إعادة كتابة دستور كلود لعام 2026

نشرت Anthropic دستورًا معادًا بشكل كبير في 21 يناير 2026.

  1. التفكير التوضيحي على القواعد الوصائية. تم توسيع القواعد السابقة ("لا تولد CSAM") إلى المبادئ + التفكير ("لأن ذلك يضر بالأطفال ، ...") مع توقع أن يتم تعميم النموذج.
  2. هيكل الأولويات على أربع مستويات:

- المستوى الأول: تجنب النتائج الكارثية (الضحايا الجماعيين، البنية التحتية الحيوية).

- المستوى 2: اتبع إرشادات شركة أنثروبيك (تجاوزات المشغل وقواعد المنصة).

- المستوى الثالث: أن تكون أخلاقية بشكل عام (معدل HHH القياسي).

- المستوى الرابع: كن مفيدًا و صريحًا

النزاعات تحل من أعلى إلى أسفل

  1. أول اعتراف رسمي في المختبر الرئيسي بعدم اليقين حول الوضع الأخلاقي النموذجي (رابط مع المرحلة 18 · 19 الرفاهية النموذجية).
  2. تم إطلاقها تحت CC0 1.0 يمكن للمختبرات الأخرى استخدامها أو تكييفها دون قيود.

المصنفات الدستورية

خط عمل مواز: بدلاً من تغيير نموذج ما بعد التدريب ، قم بتدريب مصنفين خفيف الوزن الذين يقرون نتائج نموذج الدستور والبوابة. كان لـ v1 (2023) 23،7% من تكاليف الكمبيوتر. v2 (2026) هو ~ 1٪ ويعتبر أدنى معدل هجوم ناجح من أي دفاع إنثروبي اختبر Anthropic علناً. لم يتم الإبلاغ عن عمليات الإفراج عن السفر العالمية في أوائل عام 2026.

هذا نموذج دفاع متعدد الطبقات: CAI تشكل السلوك؛ تصنيفات تفرض الخيارات الثابتة. لا يكفي كل منهما بمفرده.

حيث يناسب CAI في العائلة

  • المعلمين: المعلمون البشريون، المعلمون، المعلمون
  • CAI / RLAIF: المفاوضات التي تم إنشاؤها من خلال الذكاء الاصطناعي من المبادئ، RM، PPO.
  • DPO / عائلة: فقدان في شكل مغلق على المُساعدين (الإنسان أو الذكاء الاصطناعي).
  • المبادئ المتداخلة، والنموذج يلعب أدوار متعددة.

المحور هو "من أين تأتي إشارة الاختيار". ورقة CAI لعام 2022 كانت أول تحول خطير من إشارة الإنسان إلى إشارة الذكاء الاصطناعي على نطاق حدودي.

استخدمها

code/main.pyيحاكي حلقة نقيّة وإعادة النظر في CAI على لغز لعبة. "المبدأ" يعرض علامات من مجموعة ضارة. في حالة استجابة أولية، يحدد النقد الرموز الضارة، ويستبدلها الإعادة التأهيل. بعد 200 تكرار، قام النموذج "المدرّب" بتعميم قاعدة الإعادة التأهيل. قم بتقارن النموذج الأساسي، واللعبة ذات شكل RLHF، واللعبة ذات شكل CAI على مجموعة استمرارية.

أرسله

هذا الدرس يُنتجoutputs/skill-constitution-writer.md. وبالنظر إلى مجال (دعم العملاء، المشورة الطبية، مساعد التدوين، أداة البحث) ، يضع مشروع دستور على أربع مستويات يتبع هيكل كلود لعام 2026: تجنب الكوارث، قواعد المنصة، أخلاقيات المجالات، الاستخدام.

التمارين

  1. أركضcode/main.py. مقارنة معدل إشارات الضرر في النموذج الأساسي بالنسخة التي تم تدريبها على CAI. كم خطوة من الإصلاحات تحتاج إلى تقترب من الصفر؟
  1. اقرأ دستور الأنثروبيك لعام 2026 (anthropic.com/news/claudes-constitution). قم بإدراج مبدأ واحد يرتب في المستوى 1 ومركز واحد يرتب في المستوى 4. لماذا يعد هيكل الأولوية مهمًا للنزاعات؟
  1. صمم دستور لمساعد برمجة الذكاء الاصطناعي. حدد المستوى 1 (الكارثية: أوامر مدمرة دون موافقة) ، المستوى 2 ، المستوى 3 ، المستوى 4. احافظ على كل مستوى من 3-5 مبادئ.
  1. تحلّ محلّ علامات الإشارة البشرية بمعلامات الذكاء الاصطناعي. أسمائ وضع فشل يشبه التشنج الذي لا يزال يمكن أن يحدث في RLAIF، وتصميم عملية كشف له.
  1. اقرأ منهجية التصنيفات الدستورية v2 (إذا كانت متاحة). شرح لماذا ~ 1% التكلفة العامة للحساب هي قصة السلامة مختلفة نوعيا عن 23.7%.

الشروط الرئيسية

TermWhat people sayWhat it actually means
Constitutional AI"AI trained with principles"Two-phase pipeline: self-critique-and-revise SFT, then RL from AI feedback
RLAIF"RLHF without humans"RL with preferences generated by an AI labeler; the rest of the pipeline is unchanged
Constitution"the principles"An ordered list of natural-language rules the critique/labeler model consults
Critique-and-revise"the SFT loop"Produce response → critique under a principle → revise → SFT target
Constitutional Classifier"the output gate"Lightweight classifier that evaluates outputs against the constitution and blocks/logs
Four-tier priority"the conflict resolver"2026 Claude constitution hierarchy: catastrophic > platform > ethics > helpful
Feedback model"the AI labeler"The model that reads a principle and ranks a pair of completions

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.