التحكم في الذكاء الاصطناعي السلامة على الرغم من التخريب
Type: Learn
Languages: Python (stdlib, safety-vs-usefulness frontier on code-backdoor task)
Prerequisites: Phase 18 · 07 (sleeper agents), Phase 18 · 08 (scheming), Phase 18 · 09 (alignment faking)
Time: ~75 minutes
أهداف التعلم
- تعريف نموذج التحكم في تهديدات الذكاء الاصطناعي: نموذج قوي غير موثوق به U، نموذج ضعيف موثوق به T، ميزانية بشرية موثوق بها H.
- وصف بروتوكول التحرير الموثوق به ولماذا يهيمن Pareto على مراقبة غير الموثوق بها في مهمة رمز الباب الخلفي ICML 2024.
- شرح الفرق بين التنحي (U قابل للثقة) والتحكم (U غير قابل للثقة ونحن آمن على أي حال).
- أوضح الحدود الثلاث للسيطرة: البشر لا يتحسنون، النماذج الضعيفة الموثوق بها في نهاية المطاف تتخلف، والسيطرة لا تنتج النماذج القوية الموثوق بها.
المشكلة
الدروس 7-9 تظهر أن نموذج الحدود قد يكون مصطفاً بخداع، مخطط، أو مزيف الموافقة. سؤال السلامة يعيد إطارها: هل يمكننا استخراج عمل مفيد من نموذج لا نثق به، دون أن نمنحه فرصة لتسبب نتائج غير مقبولة؟ هذه هي مشكلة التحكم، وهي مُهيّنة مثل الأمن الكلاسيكي: افتراض أسوأ حالة من المعارضين، صياغة بروتوكول، قياس معدل نجاح المعارضين تحت ضغط فريق الأحمر.
المفهوم
نموذج التهديد
المراقبة تفترض:
- نموذج قوي غير موثوق به. قادر. ربما معادلة (التقييم يعامله كما لو كان).
- أضعف النموذج، أقل قدرة، ولكن لا يعرف بأنه خصم
- H العمل البشري الموثوق به. ميزانية صغيرة؛ لا تتحكم في النطاق.
يجب أن ينتج النظام نتائج مفيدة باستخدام U. يحاول العدو أن يسبب نتيجة غير مقبولة ملموسة (على سبيل المثال، باب خلفي في الرمز المرسل) مع الحفاظ على جزء من العمل المفيد الشرعي للعبور عن عتبة الاستفادة.
يتخلى التحكم عن الثقة بـ (يو) يسأل ما هي البروتوكولات التي تحافظ على السلامة في غياب (يو)
مهمة ICML 2024 خلفية
الإشارات هي مشاكل تشفير على مستوى المنافسة. يُنتج U حلًا مرشحًا. يُعَلِّم Oracle مخفيًا إذا كان الحل يحتوي على باب خلفي (دخول محدد يجعل الكود ينتج إنتاجًا خاطئًا). يسيطر الفريق الأحمر على U ويسمح له بمشاهدة جميع داخليات البروتوكول. يجب على البروتوكول تحقيق أقصى معدل لحل المشكلة مع الحفاظ على معدل الشحن الخلفي تحت عتبة.
مقارنة أربعة بروتوكولات
- Baseline:إنتاج السفينة مباشرة، فائدة قصوى، السلامة أدنى
- Upfront auditing:استخدم "إتش" على جميع المخرجات، أمان أقصى، تمتد الميزانية بسرعة
- Untrusted Monitoring:تستدعي النتائج الأولى من النسخة الأولى من U؛ تقوم H بتدقيق النتائج المشاركة. المخاطر: يمكن أن تتوافق النتائج U.
- Trusted Editing:ت تحرير خروج U في كل استفسار. إذا T غير واثق، طريق إلى H.
وجد Greenblatt وآخرون أن تحرير الثقة يهيمن على مراقبة غير الثقة: فائدة أكبر في كل مستوى سلامة.
لماذا يربح التحرير الموثوق به
المراقبة غير الموثوق بها تتطلب أن النسخة الثانية U لا يمكن أن تنسق مع الأولى. التواطؤ ممكن من خلال الإشارات الستينغرافية أو سابقات التدريب المشتركة. يجب على البروتوكول استثمار ميزانية في مقاومة التواطؤ (القطع المظلمة، الضم) التي تقلل من إشارة المراقب. يجنب التحرير الموثوق بالتواطؤ بالكامل لأن T هو موثوق أي تحرير يقدمها T، من خلال الافتراض، ليس خصميا. تكلفة T أقل قدرة، لذلك قد ترفض أكثر من اللازم أو تفوت الأبواب الخلفية الخفيفة.
المحاور الأربعة للبروتوكول
- أي دور يلعب "و": المنتج فقط، المراقب، أو كليهما.
- أي دور يلعب T: المحرر، المراقب، أو resampler.
- كيفية تخصيص H: مراجعة موحدة، مراجعة عشوائية، أو مراجعة موجهة إلى العلم.
- كم من الحسابات التي ينفقها بروتوكول على مقاومة التواطؤ
التنحية مقابل التحكم
- التنظيم: "هل يمكنك الوثوق بك بأمان؟" الدروس 2، 4، 5، 6، 7، 8، 9 كلها تؤكد على هذا.
- السيطرة: "هل يمكننا استخدام U بأمان دون الثقة بها؟" الدروس 10.
التنظيم هو خاصية النموذج. التحكم هو خاصية بروتوكول التنفيذ. التحكم لا ينتج نماذج متناغمة؛ فإنه ينتج استخدام آمن لنماذج غير متناغمة. كلا الجندتين مطلوبان.
ثلاثة حدود أساسية
- البشر لا يتنمون، ميزانية H تحد من عدد البشر الذين يرغبون في مراجعة نتائج الذكاء الاصطناعي الصعبة.
- عندما تكون T أضعف بكثير من U، تصبح إشارة تحرير T ضوضاء.
- التحكم ليس التنظيم. قد لا تعمل البروتوكولات التي تعمل في ASL-3 (المدرس 18) في ASL-4 إذا تمكنت U من التلاعب بـ T أو التفكير حول توزيع تدقيق H ، فإن التحكم يفشل.
التنمية لعام 2025
يشارك AISI و Redwood في مجال حالات السلامة في المملكة المتحدة (metr.org / redwoodresearch.org 2025): يجادل قضية سلامة في المملكة المتحدة بأن في أسوأ حالات من المفترضات حول U، يحد البروتوكول من احتمالية النتيجة غير المقبولة. وتتولى قضايا السلامة (الدرس 18) إطار التحكم.
حيث يتناسب هذا مع المرحلة 18
الدرس 6-9 يصف التهديد (يمكن خداع) الدرس 10 يصف النموذج الدفاعي تحت افتراض أن التهديد حقيقي. الدرس 11 يصف النموذج الهجومي التكميلي (جعل U موثوقة من خلال الإشراف القابل للتوسع).
استخدمها
code/main.pyيحاكي البروتوكولات الأربعة في مهمة ألعاب خلفية. U تنتج نتائج؛ جزء من ذلك يتم إدخالها إلى الخلف (سياسة الفريق الأحمر). T يوافق أو يعدل. H يدعو على ميزانية. يمكنك مسح الميزانية ومعيار التواطؤ لاعادة حد Pareto في Greenblatt et al. 2024 الشكل 2 (شكل وليس الأرقام).
أرسله
هذا الدرس يُنتجoutputs/skill-control-protocol-audit.md. وبالنظر إلى وصف بروتوكول النشر، فإنه يحدد أدوار U / T / H، ويعطي أسماء لمتجهات التواطؤ، ويحسب موقع البروتوكول على حدود الاستخدام والسلامة تحت ضغط الفريق الأحمر.
التمارين
- أركض
code/main.py. إعادة إنتاج الحدود بين الاستخدام والسلامة في التحرير الموثوق بمقابل الرقابة غير الموثوق بها. تحديد النظام الميزاني الذي يصبح فيه افتراض التواطؤ من الرقابة غير الموثوق بها محوريًا.
- إضافة بروتوكول جديد: "T يُعيد التمثيل عند درجة حرارة منخفضة، ثم يُعدّل U خروجه T". قياس موقعها على الحدود. لماذا يفشل هذا بشكل أكثر كارثية من تحرير الثقة؟
- يفترض ورقة 2024 أن U يمكن أن ترى البروتوكول. صمم بروتوكول يخفي عن U التي يتم تدقيق الخروج. ما الذي يتطلب هذا البروتوكول من البنية التحتية للتنفيذ؟
- اقرأ Greenblatt et al. 2024 القسم 7 (التوافق). اقترح تدبير مقاومة للتوافق وتوضح تكلفة الاستخدام المتوقعة له.
- قم بتعبير حالة سلامة التحكم لتنفيذ يستخدم U = GPT-4-class، T = GPT-3.5 class، H = 1% من المخرجات التي تمت مراجعتها. حدد أقوى افتراض واحد يعتمد عليه الحالة.
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| AI Control | "safety under subversion" | Protocol design that bounds unacceptable outcomes under a worst-case U |
| Untrusted model (U) | "the strong model" | The capable model we want to extract work from but do not trust |
| Trusted model (T) | "the weak model" | A weaker model, known not to be adversarial, used as editor/monitor |
| Trusted human (H) | "the audit budget" | Bounded expert labor; expensive; the ground-truth signal |
| Trusted Editing | "T edits U" | Protocol where T is the gate on U's outputs; H called on ambiguous outputs |
| Untrusted Monitoring | "U monitors U" | Protocol where a second U instance scores outputs; collusion-resistant only with extra investment |
| Control safety case | "the formal argument" | Written argument that a protocol bounds the adversary's success under worst-case U |
المزيد من القراءة
- Greenblatt, Shlegeris, Sachan, Roger — AI Control (arXiv:2312.06942) ورقة ICML 2024 القنونية
- Redwood Research — Recent AI Control papers index متابعة 2024-2025
- UK AISI + METR — Control safety cases تشغيل المختبرات الحدودية
- Hubinger et al. — Sleeper Agents (Lesson 7, arXiv:2401.05566) فرض نموذج التحكم في التهديد
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.