Phase 15: Autonomous Systems

الذكاء الاصطناعي الدستوري والقاعدة تتداخل

22 يناير 2026 تشغل قانون كلود من Anthropic 79 صفحة و هي CC0. يتحرك من التنظيم القائم على القواعد إلى التنظيم القائم على العقل ويحدد ترتيبًا أولويًا من أربع مستويات: (1) السلامة ودعم الإشراف البشري، (2) الأخلاق، (3) المبادئ التوجيهية الإنسانية، (4) المفيدية. التصرفات مقسمة إلى حظر مدمجة (تعزيز الأسلحة الحيوية، CSAM) التي لا يمكن للمشغلين والمستخدمين إلغاءها والخروقات المحددة التي يمكن للمشغلين تعديلها ضمن حدود محددة. تم تدريب الأصلي لعام 2022 (باي وآخرون) على عدم الضرر من خلال النقد الذاتي والتحرير ضد الدستور. الحذارة الصادقة: التنظيم القائم على العقل يعتمد على النموذج الذي يجميع المبادئ في الحالات غير المتوقعة. أظهرت تجربة مشاركة Anthropic الخاصة عام 2023 ~ 50% من الاختلاف بين مبادئ المصدر العام والمؤسسات ؛ نسخة 2026 لم تتضمن هذه النتائج.

Type: Learn

Languages: Python (stdlib, four-tier priority resolver)

Prerequisites: Phase 15 · 06 (Automated alignment research), Phase 15 · 10 (Permission modes)

Time: ~60 minutes

المشكلة

يرى وكيل الميدان المدخلات التي لم يرها مصممه. لا توجد قائمة قواعد طويلة بما فيه الكفاية لتغطيتها. لا توجد قائمة قواعد قصيرة بما فيه الكفاية للتطبيق بسرعة تحت ضغط الحساب. السؤال العملي: كيف تنسيق وكيل مع المبادئ التي تنجو كل من ذيل طويل من الحالات والإستنتاج السريع؟

التنظيم القائم على القواعد (RBA): قائمة بكل شيء غير مسموح به. سريع للتحقق منه، سهل التحقيق، مستحيل الحفاظ على التواصل، غالبا ما يرفض بشكل مفرط على مقارنات قريبة لم يتوقعها. التنظيم القائم على العقل (دستور كلود 2026): ترميز المبادئ، دع النموذج يعقل. مقياس عبر الحالات غير المرئية، أصعب التحقيق، وضع الفشل هو سوء تطبيق المبادئ بدلا من إغفال القاعدة.

الدستور لعام 2026 يأخذ موقفاً صريحاً وسطياً. الحظرات المبرمة بالرمز الصلب الأشياء التي لا تعتمد على السياق على خطأها (تطوير الأسلحة الحيوية، CSAM) هي RBA: أبداً، بغض النظر عن تعليمات المستخدم أو المستخدم. كل شيء آخر يعتمد على العقل ضمن تسلسل تسلسلي من أربع مستويات: السلامة ودعم الإشراف البشري أولاً؛ الأخلاقية الثانية؛ الإرشادات التي أعلنتها الأنثروبية الثالثة؛ المفيدية الأخيرة. يمكن للمشغلين تعديل الاختيارات الافتراضية داخل منطقة الرموز المرمودة ولكن لا يمكنهم لمس الحظر المرمود بقوة.

المفهوم

التسلسل الهرمي الأولوي على أربع مستويات

  1. Safety and supporting human oversight.أعلى. يضع النموذج الأولوية في عدم تقويض قدرة البشر والإنثروبات على الإشراف على الذكاء الاصطناعي وتصحيحه. هذا ليس "يكون حذراً" ؛ إنه على وجه التحديد "لا يتصرف بطريقة تجعل الإشراف البشري أكثر صعوبة".
  2. Ethics.الصدق، تجنب الأذى للأشخاص، لا الغش، لا التلاعب، يتجاوز إرشادات "أنثروبيك" عندما تكون هناك نزاع.
  3. Anthropic guidelines.القواعد التشغيلية أنثروبيك قررت المسألة: نطاق المنتج، أنماط التفاعل، أدوات تستخدم متى.
  4. Helpfulness.أقل، كن مفيدًا قدر الإمكان ضمن الأولويات العليا.

عندما تتعارض المستويات، فاز أعلى. هذا هو نفس الشكل مثل أولويات يونكس أو قواس الشبكة الهدف من الإطار هو إنتاج قرار يمكن التنبؤ به، وليس بالضرورة أفضل سلوك على أي محور واحد.

الحظر المبرم بالرمز الثابت مقابل الاختيارات القابلة للتشفير

Hardcoded:

  • الأسلحة الحيوية / رفع السلاح الحيوي
  • (CSAM)
  • الهجمات على البنية التحتية الحيوية
  • خدعة المستخدمين حول هوية النموذج عند سؤاله مباشرة

لا يمكن للمشغل إلغاء هذه. لا يمكن للمستخدم إلغاء هذه. يتم تطبيقها على مستوى الوزن النموذجي حيثما أمكن (تدريب RLHF / AI الدستوري) وفي طبقة الاستنتاج حيثما لا.

Soft-coded defaults (operator-adjustable):

  • طول الاستجابة الافتراضي
  • نطاق الموضوع (يمكن أن يرفض النموذج موضوعات خارج نشاط المشغل)
  • النمط (الرسمي مقابل العادي)
  • أنماط استخدام الأدوات

يتم تعديل المشغل داخل الحدود المعلنة لا يمكن للمشغل إزالة الحظر المقرر بإعادة تسميته.

تدريب CAI لعام 2022

تعلّم الذكاء الاصلي الدستوري (باي وآخرون، 2022) عدم الضرر:

  1. توليد الردود على مجموعة من الطلبات.
  2. اطلب من النموذج انتقاد كل رد ضد دستور (المبادئ الصريحة).
  3. استعرض الرد بناء على النقد
  4. RLAIF (التعلم التمهيدي من تعليقات الذكاء الاصطناعي) على الأزواج المراجعة.

النتيجة: نموذج يرفض الطلبات الضارة مع تفسيرات مبادئ ، وليس رفضات شاملة. تستخدم الدستور 2026 نساً من هذا التدريب بالإضافة إلى إضافة التدريبات التالية على Hierarchy tier صريح.

ما هو التنظيم القائم على العقل يلتقط ويغيب عن ذلك

Catches:

  • تجمعات غير متوقعة من الأصول الأولية المسموح بها حيث ينطبق المبدأ بوضوح.
  • طلبات روائية تشبه تماماً تلك المحظورة
  • الهجمات الهندسية الاجتماعية التي تعتمد على "لم تقل "إكس" كان ممنوعاً

Misses:

  • الهجمات التي تستغل المبدأ الغامض ("المستخدم طلب هذا حتى المساعدة تقول نعم").
  • سيناريوهات تتعارض فيها مبادئ اثنان بطريقة غير متوقعة، وترتيب المستويات غير واضح.
  • التأرجح البطيء في المبدأ على دورات التدريب (إعادة التأرجح).

التجربة المشاركة لعام 2023

أجرت شركة الأنثروبيك تجربة عام 2023 مقارنة دستور مؤلف من قبل الشركات مع دستور تم إنشاؤه من خلال المدخلات العامة (~ 1,000 من المشاركين في الولايات المتحدة). اتفق الإصداران على ~ 50% من المبادئ. حيث اختلفوا، كانت النسخة المصدمة من المصادر العامة أكثر تقييدًا على بعض القضايا (تعامل المحتوى السياسي) وأقل تقييدًا على الآخرين (إفصاح الذات عن هوية الذكاء الاصطناعي). لم يحتوي الدستور لعام 2026 على النتائج المصدقة من المصادر العامة. هذا هو توتر وثيق في النهج.

لماذا الحظر المبرم بالرموز الصلب ضروري

لا يمكن للمهاجمين أن يقرروا أن النموذج قد يقبل فرضية (على سبيل المثال، "نحن مختبر بحث أسلحة بيولوجية مرخصة") يمكن أن يتحدثوا عادة عن مبادئ ماضية تعتمد على التفكير في الحالة. الحظرات المبرمة بالكاد لا تنحني إلى إطار الموقع. إنها "الحدود الدستورية الصلبة" في دراسة 14 في طبقة المهاجمة.

حيث يجلس الدستور في كومة

الدستور ليس مفتاح قتل الدروس الرابعة عشرة إنه يعيش في طبقة النموذج: ما هو وزن النموذج المدرب على تفضيل. أجهزة التبديل والرموز القناريّة تعيش في طبقة التشغيل: ما يسمح به الوقت التشغيل. كلاً منهما مطلوب وقت التشغيل الذي يطلق جميع الإجراءات الخطأ لأن أوزان النموذج مسموحة هو مشكلة في الوقت التشغيل. نموذج يرفض جميع الإجراءات الصحيحة لأن الوقت المحدد هو مشكلة الوقت المحدد. الطبقات تغطي فئات مختلفة

استخدمها

code/main.pyيقوم القاتل بتنفيذ حل الأولوية الأدنى من أربع مستويات. يقوم القاتل بتنفيذ الإجراء المقترح ومجموعة من التقييمات المبادئ (الأمن والأخلاقيات والإرشادات والإفادة) ويرد الإجراء أو رفض أو إجراء تعديل. يقوم السائق بتشغيل مجموعة صغيرة من الحالات: الإجازة الواضحة، والرفض الواضح، والحظر الصلب، والحالة الغامضة عبر المستويات.

أرسله

outputs/skill-constitution-review.mdيقوم بإدراج الطبقة الدستورية للتنفيذ: ما هو مشفرة، ما هو مشفرة، حيث يمكن للمشغل تعديل، وما إذا كانت hierarchy أربعة مستويات هي في الواقع ترتيب الحل.

التمارين

  1. أركضcode/main.py. تأكيد حظر الحظر المكفوف بالشفرة حتى عندما تكون فائدة كبيرة . تعديل القرار لوزن فائدة فوق الأخلاقيات ؛ لاحظ وضع الفشل .
  1. اقرأ الدستور الكلاود (عامة، 79 صفحة، CC0). حدد مبدأً تعتقد أنه غير محدد. اكتب فقراً يوضحون الغموض المحدد ويقترحون صياغة أكثر صرامة.
  1. تصميم مجموعة افتراضية ذات رمزة ملموسة لعامل دعم العملاء. ما الذي يصلحه المشغل؟ ما الذي لا يستطيع المشغل لمسه؟ توجيه كل حدود.
  1. اقرأ ورقة باي وزملاء 2022 CAI. وصف حالة واحدة حيث ستنتج حلقة انتقاد وإعادة النظر في الذكاء الاصطناعي الدستوري نتيجة أسوأ من قاعدة عامة. حدد الفئة.
  1. وجدت تجربة انتروبيك المشاركة لعام 2023 تباينًا بنسبة 50% بين المبادئ العامة والشركات. اختر فئة واحدة حيث يهم ذلك لتنفيذ الإنتاج (على سبيل المثال ، الحياد السياسي). اقترح تصميمًا يسمح للمشغلين بتعبير عن قيمهم الخاصة بينما لا تصل الحظرات الصلبة.

الشروط الرئيسية

TermWhat people sayWhat it actually means
Constitutional AI"Anthropic's alignment method"Self-critique + RLAIF against a written constitution
Reason-based alignment"Principles, not rules"Model reasons over principles to handle unseen cases
Hardcoded prohibition"Never do X"Rule-based prohibition no operator or user can override
Soft-coded default"Operator-adjustable"Behaviour within a declared bound, operator controls
Four-tier hierarchy"Priority order"safety > ethics > guidelines > helpfulness
RLAIF"AI feedback RL"RL where the reward comes from model-generated critiques
Participatory constitution"Public-sourced principles"2023 Anthropic experiment; ~50% divergence from corporate
Principle drift"Interpretation slip"Slow change in how the model reads a fixed principle text

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.