Phase 18: Ethics, Safety & Alignment

إطاريات السلامة الحدودية RSP، PF، FSF

ثلاثة إطاريات مختبر رئيسية تحدد حوكمة الصناعة من قدرات الحدود عام 2026. سياسة التوسع المسؤول الإنساني v3.0 (فبراير 2026) تعرض مستويات السلامة الذكرية المرتبطة (ASL-1 إلى ASL-5+) ، على أساس مستويات السلامة الحيوية ، مع تنشيط ASL-3 في مايو 2025 للنماذج ذات الصلة بـ CBRN. يحدد إطار إعداد OpenAI v2 (أبريل 2025) خمس معايير للقدرات المتتبعة ويفرق تقارير القدرات عن تقارير الحماية. إطار السلامة الحدودية في DeepMind v3.0 (سبتمبر 2025) يقدم مستويات القدرة الحرجة بما في ذلك CCL الجديد للتلاعب الضار. كل ثلاثة الآن تشمل شروط تعديل المنافسة التي تسمح بالتأجيل إذا كانت المختبرات ذات الصلة تسافر دون ضمانات مماثلة. لا يزال التوجه عبر المختبر هيكليًا وليس مصطلحًا: "المعايير المتعلقة بالقدرة على العمل" "المعايير المتعلقة بالقدرة على العمل العالية" و"المستويات المتعلقة بالقدرة على العمل الحرجة" تعني بناءات مماثلة.

Type: Learn

Languages: none

Prerequisites: Phase 18 · 17 (WMDP), Phase 18 · 07-09 (deception failures)

Time: ~75 minutes

أهداف التعلم

  • وصف بنية مستوى ASL من Anthropic وما الذي ينشط ASL-3.
  • أسمائ معايير OpenAI Preparedness Framework v2 الخمسة للقدرات المتتبعة.
  • وصف بنية مستوى القدرة الحرجة في DeepMind و CCL التلاعب الضار.
  • شرح شروط تعديل المنافسة ولماذا هي مهمة لتنمية السباق.
  • تحديد حالة السلامة ووصف بنية ثلاث ركائز (المراقبة، عدم القراءة، عدم القدرة على القراءة).

المشكلة

الدروس 7-17 تثبت أن الخداع ممكن، وتوجد قدرة الاستخدام المزدوج، وتتمتع التقييم بالحدود. المختبر الذي يحتوي على نموذج قادر على الحدود يحتاج إلى هيكل حكم داخلي:

  • تحدد العدوان عند الحاجة إلى ضمانات جديدة.
  • يحدد التقييمات المطلوبة قبل التوسع.
  • يصف كيف تبدو قضية السلامة
  • يتعامل مع مشكلة ديناميكية السباق (إذا كان المنافسين يبحرون دون ضمانات، ماذا تفعلون؟)

الأطر الثلاثة 2025-2026 هي حالة الفن غير كاملة، تتطور، وتتوافق بما فيه الكفاية عبر المختبرات بحيث أن السؤال الحكم هو الآن ما إذا كانت الأطر كافية، وليس ما إذا كانت موجودة.

المفهوم

سياسة التوسع المسؤول عن الإنسان v3.0 (فبراير 2026)

هيكل ASL:

  • ASL-1: ليس نموذج حدودي (مجمّعًا بموجب خط أساسي أضعف من الحدود).
  • ASL-2: خط أساس الحدود الحالي؛ يتم نشرها مع الاحتياطات المعتادة.
  • ASL-3: خطر أكبر بشكل كبير من سوء الاستخدام الكارثي؛ القدرات ذات الصلة بالسي بي آر إن. تم تنشيطها في مايو 2025.
  • ASL-4: تحديد عتبة عبور البحث والتطوير الذكية؛ نماذج يمكن أن تتحرك أبحاث الذكاء الاصطناعي على مستوى الدخول.
  • ASL-5+: نماذج متقدمة لـ AI R&D التي تسريع بشكل كبير على التوسع الفعال.

جديد في v3.0:

  • خرائط الطريق للسلامة على الحدود (عامة في شكل مُحَرَّر).
  • تقارير المخاطر (كل ربع أشهر، بعضها يتم مراجعته خارجاً).
  • يتم تفريغ البحث والتطوير الذكاء الاصطناعي إلى البحث والتطوير الذكاء الاصطناعي R&D-2 و AI R&D-4.
  • بمجرد عبور AI R&D-4 ، مطلوب حالة سلامة إيجابية ، تحديد مخاطر عدم التوصل من النماذج التي تسعى إلى تحقيق أهداف غير متوافقة.

إطار إعداد OpenAI v2 (15 أبريل 2025)

خمس معايير لقدرات تتبع:

  • Plausible.هناك نموذج تهديد معقول
  • Measurable.تقييم تجربي ممكن
  • Severe.الأذى كبيرة
  • Net-new.ليس مخاطر سابقة قد زادت
  • Instantaneous-or-irremediable.الأذى يحدث بسرعة أو لا يمكن إصلاحها

القدرات التي تلتقي بكل الخمسة تتتبع.

هيكل PF v2 الآخر:

  • تقارير قدرات منفصلة (ما يمكن أن تفعله النموذج) من تقارير الضمانات (ما هي الضوابط الموجودة).
  • مراجعات مجموعة الاستشارات الأمنية
  • القيادة توافق على ذلك، وهيئة السلامة والأمن في المجلس تشرف على ذلك.
  • "نصيحة التكيف": قد تخفض OpenAI المتطلبات إذا كانت سفن مختبر أخرى لا توجد ضمانات مماثلة.

إطار السلامة الحدودية في DeepMind v3.0 (سبتمبر 2025)

مستويات القدرة الحرجة (CCL) حسب المجالات:

  • ارتفاع أسلحة الحيوية
  • التوسع الإلكتروني
  • ML تسريع البحث والتطوير
  • التلاعب الضار (جديد في v3.0): نماذج يمكن أن تغير بشكل كبير المعتقدات / السلوك في سياقات عالية المخاطر.

إضافة إطار إضافي لـ "مجموعة التنظيمات" (مجموعة التنظيمات)

التنحي بين المختبرات

  • "المعايير القادرة"
  • "مستويات القدرة الحرجة"
  • "المعدلات العالية للقدرة على العمل"

لا توجد مصطلحات قياسية للصناعة. متوافقة بناءً على الهيكل: ثلاثة مستويات من القدرة الحدودية مع معايير التقييم المنشورة. جميعها تتضمن شروط تعديل المنافسة (2025 وما يزال).

قضايا السلامة

حالة السلامة هي الحجة المكتوبة بأن النشر آمن بشكل مقبول في أسوأ حالات. يستهدف الهيكل القياسي ثلاثة ركائز:

  • Monitoring.هل يمكننا اكتشاف السلوك السيئ إذا حدث؟
  • Illegibility.هل النموذج يفتقر إلى القدرة على تنفيذ خطة متماسكة لتسبب الأذى؟
  • Incapability.هل النموذج يفتقر إلى القدرة على تسبب الضرر المحدد؟

تستهدف حالات السلامة المختلفة ركائز مختلفة. بالنسبة لحالة ASL-3 CBRN ، فإن الإعاقة (من خلال عدم التعلم) هي الهدف الأساسي. بالنسبة للتوافق الخادع ، والرصد وعدم القراءة أهداف. بالنسبة لرفع الإنترنت ، كل ثلاثة منها ذات صلة.

مشكلة ديناميكية السباق

إن شروط تعديل المنافسة مثيرة للجدل. يجادل النقاد أنها تخلق سبباً إلى الأسفل: إذا قللت كل المختبرات الثلاث المتطلبات عندما يعيب المنافس ، فإن التوازن يتحول نحو الهروب. يجادل المدافعون بأن البديل (الضمانات الأحادية) ينتج نتائج أسوأ إذا كان المختبر الهارب أقل وعياً بالسلامة.

المملكة المتحدة AISI، والولايات المتحدة CAISI، ومكتب الاتحاد الأوروبي الذكاء الاصطناعي (دروس 24) هي نظرائها الحوكمة الخارجية. الأطر المختبرية طوعية؛ الأطر التنظيمية تظهر.

حيث يتناسب هذا مع المرحلة 18

الدروس 17-18 هي طبقة القياس والحكم فوق التحليلات الخادعة والفريق الأحمر. تتناول الدروس 19-24 الرفاهية والتحيز والخصوصية والعلامة المائية والهيكل التنظيمي. تقوم الدروس 28 بخطط النظام البيئي للبحث (MATS و Redwood و Apollo و METR) الذي يعمل على التقييمات.

استخدمها

لا توجد رمز لهذا الدروس. اقرأ المصادر الأساسية الثلاثة: RSP v3.0، PF v2، FSF v3.0. خريطة هيكل المستويات لكل مختبر إلى الآخرين وتحديد عتبة تحدد كل مختبر غير الآخرين.

أرسله

هذا الدرس يُنتجoutputs/skill-framework-diff.md. في إطار السلامة أو مذكرة الإفراج، يُقارن تعريفات العدول والمقياسات المطلوبة، وهيكل الحالة الأمنية في الإطار مقابل RSP v3.0، PF v2، FSF v3.0، وفرق بين المختبرات.

التمارين

  1. اقرأ RSP v3.0 و PF v2 و FSF v3.0 قم بتجميع جدول من عتبة CBRN لكل مختبر وعتبة R&D الذكاء الاصطناعي لكل واحد، وتقييمات ما قبل الانتشار المطلوبة لكل واحد.
  1. شفرة تعديل المنافسة في جميع الإطار الثلاث (2025+). اكتب فقرة واحدة تدعوه؛ اكتب فقرة واحدة تدعوه. حدد الافتراض الذي يعتمد عليه كل موقف.
  1. صمم حالة سلامة لنموذج يتجاوز عتبة البحث والتطوير الذكية في الإنثروبات. أسمائ الدليل الذي يتطلبه كل من الأعمدة الثلاثة (المراقبة، عدم القدرة على القراءة، عدم القدرة على القراءة).
  1. تقدم FSF v3.0 من DeepMind CCL للتلاعب الضار. اقترح ثلاثة قياسات تجربية تشير إلى أن نموذج قد تجاوز هذا العد.
  1. اقرأ "عناصر مشتركة في سياسات السلامة الذكاء الاصطناعي الحدودي" (2025) من METR. أسماؤ ثلاثة أقوى التقارب بين المختبرات والانفصالين الأكبرين.

الشروط الرئيسية

TermWhat people sayWhat it actually means
RSP"Anthropic's framework"Responsible Scaling Policy; ASL tiers; v3.0 February 2026
PF"OpenAI's framework"Preparedness Framework; five criteria; v2 April 2025
FSF"DeepMind's framework"Frontier Safety Framework; CCLs; v3.0 September 2025
ASL-3"biosafety level 3-analog"Anthropic tier for CBRN-relevant capabilities; activated May 2025
CCL"critical capability level"DeepMind's threshold construct; per-domain
Safety case"the formal argument"Written argument that deployment is acceptably safe under worst-case U
Adjustment clause"competitor defection allowance"Framework provision for reducing requirements if competitors ship without comparable safeguards

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.