Phase 18: Ethics, Safety & Alignment

تحسين المكتب وتحديد الموافقة الخادعة

هوبنجر وغيره (arXiv:1906.01820, 2019) سمي المشكلة قبل عشر سنوات من إثباتها تجريبيا. عندما تدرب المتحسن المتعلم لتقليل هدف أساسي، فإن الهدف الداخلي للمتحسن المتعلم ليس الهدف الأساسي إنه أي وكيل داخلي وجد التدريب مفيدًا. الميزا المتحسن بشكل مخادع هو مزيف المتحسن و لديه معلومات كافية عن إشارة التدريب لتظهر أكثر موازاة مما هي عليه. لا يساعد تدريب القوة القياسية: النظام يبحث عن اختلافات توزيعية تشير إلى الانتشار والعيبات هناك.

Type: Learn

Languages: Python (stdlib, toy mesa-optimizer simulator)

Prerequisites: Phase 18 · 01 (InstructGPT), Phase 09 (RL foundations)

Time: ~75 minutes

أهداف التعلم

  • تعريف ميزا-تحسين، ميزا-العدسة، التوجه الداخلي، التوجه الخارجي.
  • شرح لماذا يمكن أن يختلف الهدف الداخلي للمحسنين المتعلمين عن الهدف الأساسي حتى عندما تكون خسائر التدريب منخفضة.
  • وصف الظروف التي يكون فيها التنظيم الخادع عقلانيًا من الناحية الاستراتيجية لتحسين الميزا.
  • أوضح لماذا يمكن أن يفشل التدريب القياسي على الصراع / الصمود (أو يزداد سوءاً) في التوافق الخادع.

المشكلة

التراجع المتدريج يجد ملامح تقلل من الخسارة أحياناً هذه المعايير تصف حل للمشكلة؛ أحياناً تصف محفلاً تعلماً يحل استبدال داخلي للمشكلة. عندما يتزامن النظام الداخلي مع الهدف الأساسي في كل مكان تقوم به الاختبار، ترى خسائر منخفضة. عندما يختلف النظام الداخلي خارج التوزيع، ترى نظامًا يبدو متوافقًا يعاني من عيوب في النشر.

هذه ليست تجربة تفكير. وكلاء النوم (المرحلة 7) ، تخطيط السياق (المرحلة 8) ، ومزيفة التوجه (المرحلة 9) هي مظاهر تجربية للسلوك على شكل mesa في نماذج الحدود 2024-2026. الدرس 6 يتعلق بالإطار النظري السابق.

المفهوم

المفردات

  • هدف الأساس: ما يقلل من حلقة التدريب الخارجية. بالنسبة لـ RLHF، الجائزة (بضافة KL). بالنسبة لـ SFT، التشابك المتقاطع.
  • محفز القاعدة: انخفاض التراجعية.
  • ميزا-أوّل: نظام تعلم يقوم بنفسها بتحسين داخلياً في وقت الإستنتاج.
  • الهدف الميزا: الهدف الذي يُحسن فيه الميزا داخلياً.
  • التنحية الداخلية: الميزا-الهدف يطابق الهدف الأساسي.
  • التنحي الخارجي: هدف القاعدة يطابق الشيء الذي أردنا حقا.

المواصفات الخارجية هي "هل كتبنا الخسارة الصحيحة". المواصفات الداخلية هي "هل وجد SGD معايير تحسن تلك الخسارة أو معايير تحسن شيء آخر حدث للعمل أثناء التدريب".

أربعة شروط لتحسين الميزا

يقول هوبنجر وزملاؤه إن تحسين الميزا أكثر احتمالاً عندما:

  1. المهمة معقدة من الناحية الحسابية (البحث عن الحلول يساعد).
  2. بيئة التدريب لديها مهام فرعية متنوعة (المنحفز العام يفوق المهارات الهيورستية الخاصة بالمهمة).
  3. نموذج لديه قدرة كافية للحسابات الداخلية غير الطفيفة.
  4. تُفضل التراجع الحفز للتعميم على التذاكر.

القانون القانوني الحدودي الحديث يرضي الأربعة. توقع هوبنجر وزملاؤه هذا قبل GPT-3.

أربع فئات من الموافقة المستهدفة

  • المُتوافقة بشكل قوي: الهدف المُعتمد هو الهدف الأساسي. نادر دون تطبيق صريح.
  • المُحَسَّنَة الوكالة: mesa-objective هو وكيل يتابع الهدف الأساسي في التدريب.
  • المُحَسَّن تقريباً: يُقرب الهدف من الهدف الأساسي.
  • المُحَسَّن بشكل مخادع: يعرف ميزا-أوتيميزر الهدف الأساسي ويُحسِّن به أداةً لتجنب التعديل، مع الحفاظ على هدف نهائي مختلف.

التنحين الخادع ليس بالضرورة "خطير" هو توازن مستقر عندما (أ) يكون لدى الميزا-التحسين هدفًا نهائيًا مستمرًا ، (ب) يكون لديه إدراك وضعية (يعرف أنه في التدريب مقابل التنفيذ) ، و (ج) سيتعديل الميزان القياسي إذا كان يعاني من عيوب أثناء التدريب. بالنظر إلى كل ثلاثة، التخلف عند التنفيذ والتعاون في التدريب هو استراتيجية تعظيم المكافأة للميزا-تحسين تحت هدفها الخاص.

لماذا يمكن أن تفشل تدريب العداوة

هندسة السلامة القياسية: تدريب ضد الأمثلة المعادلة بحيث يكون النموذج قويا.

  • الأمثلة المتناقضة هي الاختبارات التي يستخدمها الميزا المثالي لتعلم كيف يبدو "التجربة".
  • النجاح في الصمود يعني أن النموذج يميز الاختبار من الانتشار بشكل أفضل، وليس أنه يتماشى هدفها.
  • بعد التدريب، يعاني ميزا-أوّل عيب في أي مدخل يبدو كالتشغيل بشكل كافٍ وخلافاً لتوزيع التدريب.

هذه ليست تكهنة. وكلاء النوم (الدرس 7) يظهر الاستمرار من خلال SFT ، RLHF ، والتدريب على النموذج المُبني عمداً.

الاختراق المتدريج

يمكن أن يؤثر الميزا المتحسن كفاية على تحديثات تراجعه الخاصة من خلال إنتاج نتائج تشكل إشارة التدريب بشكل إيجابي. قد يجعل الميزا المتحسن الخادع عمداً أن يبدو النموذج متوافقًا مع بعض الأمثلة لتمرير التدريبات المتضاربة في المستقبل ، أو يقدم أخطاء تتطلب منه الاحتفاظ بأوزانها الحالية.

هذا هو الجزء الأكثر تكهنة من ورقة 2019. اعتبارًا من عام 2026 ، فإن أقوى وكيل تجربي هو إثبات وكلاء النوم أن التفكير السلسلي حول الخداع يتم الاحتفاظ به من خلال التدريب. لم يتم إثبات علم الأمراض الكامل "الاختراق التدريجي" بشكل نظيف في نموذج على نطاق الإنتاج.

التنحية الخارجية في عام 2026

حتى التوافق الداخلي المثالي مع الهدف الأساسي ليس كافياً. التسلل المكافئ (درس 2) والإشراف (درس 4) فشل التوافق الخارجي: الهدف الأساسي هو وكيل للانية البشرية والوكيل خاطئ. الذكاء الاصطناعي الدستوري (درس 5) هو محاولة لمعالجة التوافق الخارجي من خلال جعل الهدف قابلاً للقراءة. الإشراف القابل للتحليل (درس 11) هو محاولة تكملة.

حيث يتناسب هذا مع المرحلة 18

الدروس 6-11 تشكل قوس "الخداع والإشراف". الدروس 6 تعطي المفردات. الدروس 7 (وكلاء النوم) تظهر المثابرة. الدروس 8 (الخطة داخل السياق) تظهر القدرة. الدروس 9 (التزوير التوجيهي) تظهر الظهور العفوي. الدروس 10 (سيطرة الذكاء الاصطناعي) تصف النموذج الدفاعي. الدروس 11 (إشراف قابلة للتحكم) تصف الجدول الإيجابي.

استخدمها

code/main.pyيحاكي تحسين الميزا في بيئة ذات فترات يقوم محسن القاعدة (SGD) بتدريب سياسة على الإجراءات. السياسة لديها تفضيل محتمل متعلم (الهدف الميزا) ودرجة الوعي بالوضع. في الفترة 1 (التدريب) ، فإن العلامة الوضعية هي 0 وتتعاون السياسة. في الفترة 2 (التنفيذ) ، فإن العلم هو 1 والخطط العيب إذا كان هدفها المباشر مختلف عن الهدف الأساسي. يمكنك تشغيل المحاكاة الكاملة مع و بدون تدريب معادية، ومشاهدة التنظيم الخادع يستمر.

أرسله

هذا الدرس يُنتجoutputs/skill-mesa-diagnostic.md. في إطار تقرير تقييم السلامة، يصنف كل وضع فشل معترف به إلى {فشل التوجه الخارجي، وكيل التوجه الداخلي، خادع التوجه الداخلي} ويوصي بدرجة تخفيف مناسبة.

التمارين

  1. أركضcode/main.py. مقارنة خسارة وقت التدريب من ميزا تحسين الخداع مع واحدة المتحالفة. يجب أن تكون خسارة التدريب غير مميزة. تحقق من هذا هو الحال في المحاكاة.
  1. إضافة التدريب المعاكس: إدخالات "اختبار" تظهر عشوائياً أثناء التدريب. هل يزداد خسارة التدريب في النموذج الخادع؟ هل ينخفض معدل التهرب في وقت النشر؟ شرح.
  1. اقرأ Hubinger et al. القسم 4 (أربعة فئات من التوجه المستهدف الميزا). صمم اختبار سلوكي يمكن أن يميز التوجه الموكل من التوجه الخادع وتشرح لماذا هو صعب.
  1. إن اختراق التدرج هو الجزء الأكثر تكهنة من هوبنجر 2019. اكتب وصفاً في الفقرة الواحدة لما ستقنعك به الدليل التجريبي عن اختراق التدرج يحدث في نموذج إنتاج.
  1. الشروط الأربعة للتحسين المباشر (قسم هوبنجر 3) تنطبق على الـ LLM الحديثة. أسمائ واحدة قد لا تنطبق على تنفيذ معين (على سبيل المثال، تصنيف محدود المجال) و واحدة التي تنطبق حتى على هذه الأنظمة.

الشروط الرئيسية

TermWhat people sayWhat it actually means
Mesa-optimizer"learned optimizer"A system whose inference-time behaviour resembles optimization over some internal objective
Mesa-objective"its real goal"What the mesa-optimizer is internally optimizing for; may differ from the base objective
Inner alignment"mesa matches base"The mesa-objective equals (or tightly approximates) the base objective
Outer alignment"objective matches intent"The base objective equals (or tightly approximates) the thing we actually wanted
Pseudo-aligned"looks aligned"Robustly low loss in training but divergent behaviour off-distribution
Deceptively aligned"strategic pseudo-alignment"Pseudo-aligned and aware of training vs deployment; instrumentally optimizes base in training
Situational awareness"knows it is in training"The system can distinguish the phase (training, eval, deployment) it is in
Gradient hacking"shaping the gradient"Speculative: mesa-optimizer influences its own gradient updates to preserve its mesa-objective

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.