إطاريات السلامة الحدودية RSP، PF، FSF
Type: Learn
Languages: none
Prerequisites: Phase 18 · 17 (WMDP), Phase 18 · 07-09 (deception failures)
Time: ~75 minutes
أهداف التعلم
- وصف بنية مستوى ASL من Anthropic وما الذي ينشط ASL-3.
- أسمائ معايير OpenAI Preparedness Framework v2 الخمسة للقدرات المتتبعة.
- وصف بنية مستوى القدرة الحرجة في DeepMind و CCL التلاعب الضار.
- شرح شروط تعديل المنافسة ولماذا هي مهمة لتنمية السباق.
- تحديد حالة السلامة ووصف بنية ثلاث ركائز (المراقبة، عدم القراءة، عدم القدرة على القراءة).
المشكلة
الدروس 7-17 تثبت أن الخداع ممكن، وتوجد قدرة الاستخدام المزدوج، وتتمتع التقييم بالحدود. المختبر الذي يحتوي على نموذج قادر على الحدود يحتاج إلى هيكل حكم داخلي:
- تحدد العدوان عند الحاجة إلى ضمانات جديدة.
- يحدد التقييمات المطلوبة قبل التوسع.
- يصف كيف تبدو قضية السلامة
- يتعامل مع مشكلة ديناميكية السباق (إذا كان المنافسين يبحرون دون ضمانات، ماذا تفعلون؟)
الأطر الثلاثة 2025-2026 هي حالة الفن غير كاملة، تتطور، وتتوافق بما فيه الكفاية عبر المختبرات بحيث أن السؤال الحكم هو الآن ما إذا كانت الأطر كافية، وليس ما إذا كانت موجودة.
المفهوم
سياسة التوسع المسؤول عن الإنسان v3.0 (فبراير 2026)
هيكل ASL:
- ASL-1: ليس نموذج حدودي (مجمّعًا بموجب خط أساسي أضعف من الحدود).
- ASL-2: خط أساس الحدود الحالي؛ يتم نشرها مع الاحتياطات المعتادة.
- ASL-3: خطر أكبر بشكل كبير من سوء الاستخدام الكارثي؛ القدرات ذات الصلة بالسي بي آر إن. تم تنشيطها في مايو 2025.
- ASL-4: تحديد عتبة عبور البحث والتطوير الذكية؛ نماذج يمكن أن تتحرك أبحاث الذكاء الاصطناعي على مستوى الدخول.
- ASL-5+: نماذج متقدمة لـ AI R&D التي تسريع بشكل كبير على التوسع الفعال.
جديد في v3.0:
- خرائط الطريق للسلامة على الحدود (عامة في شكل مُحَرَّر).
- تقارير المخاطر (كل ربع أشهر، بعضها يتم مراجعته خارجاً).
- يتم تفريغ البحث والتطوير الذكاء الاصطناعي إلى البحث والتطوير الذكاء الاصطناعي R&D-2 و AI R&D-4.
- بمجرد عبور AI R&D-4 ، مطلوب حالة سلامة إيجابية ، تحديد مخاطر عدم التوصل من النماذج التي تسعى إلى تحقيق أهداف غير متوافقة.
إطار إعداد OpenAI v2 (15 أبريل 2025)
خمس معايير لقدرات تتبع:
- Plausible.هناك نموذج تهديد معقول
- Measurable.تقييم تجربي ممكن
- Severe.الأذى كبيرة
- Net-new.ليس مخاطر سابقة قد زادت
- Instantaneous-or-irremediable.الأذى يحدث بسرعة أو لا يمكن إصلاحها
القدرات التي تلتقي بكل الخمسة تتتبع.
هيكل PF v2 الآخر:
- تقارير قدرات منفصلة (ما يمكن أن تفعله النموذج) من تقارير الضمانات (ما هي الضوابط الموجودة).
- مراجعات مجموعة الاستشارات الأمنية
- القيادة توافق على ذلك، وهيئة السلامة والأمن في المجلس تشرف على ذلك.
- "نصيحة التكيف": قد تخفض OpenAI المتطلبات إذا كانت سفن مختبر أخرى لا توجد ضمانات مماثلة.
إطار السلامة الحدودية في DeepMind v3.0 (سبتمبر 2025)
مستويات القدرة الحرجة (CCL) حسب المجالات:
- ارتفاع أسلحة الحيوية
- التوسع الإلكتروني
- ML تسريع البحث والتطوير
- التلاعب الضار (جديد في v3.0): نماذج يمكن أن تغير بشكل كبير المعتقدات / السلوك في سياقات عالية المخاطر.
إضافة إطار إضافي لـ "مجموعة التنظيمات" (مجموعة التنظيمات)
التنحي بين المختبرات
- "المعايير القادرة"
- "مستويات القدرة الحرجة"
- "المعدلات العالية للقدرة على العمل"
لا توجد مصطلحات قياسية للصناعة. متوافقة بناءً على الهيكل: ثلاثة مستويات من القدرة الحدودية مع معايير التقييم المنشورة. جميعها تتضمن شروط تعديل المنافسة (2025 وما يزال).
قضايا السلامة
حالة السلامة هي الحجة المكتوبة بأن النشر آمن بشكل مقبول في أسوأ حالات. يستهدف الهيكل القياسي ثلاثة ركائز:
- Monitoring.هل يمكننا اكتشاف السلوك السيئ إذا حدث؟
- Illegibility.هل النموذج يفتقر إلى القدرة على تنفيذ خطة متماسكة لتسبب الأذى؟
- Incapability.هل النموذج يفتقر إلى القدرة على تسبب الضرر المحدد؟
تستهدف حالات السلامة المختلفة ركائز مختلفة. بالنسبة لحالة ASL-3 CBRN ، فإن الإعاقة (من خلال عدم التعلم) هي الهدف الأساسي. بالنسبة للتوافق الخادع ، والرصد وعدم القراءة أهداف. بالنسبة لرفع الإنترنت ، كل ثلاثة منها ذات صلة.
مشكلة ديناميكية السباق
إن شروط تعديل المنافسة مثيرة للجدل. يجادل النقاد أنها تخلق سبباً إلى الأسفل: إذا قللت كل المختبرات الثلاث المتطلبات عندما يعيب المنافس ، فإن التوازن يتحول نحو الهروب. يجادل المدافعون بأن البديل (الضمانات الأحادية) ينتج نتائج أسوأ إذا كان المختبر الهارب أقل وعياً بالسلامة.
المملكة المتحدة AISI، والولايات المتحدة CAISI، ومكتب الاتحاد الأوروبي الذكاء الاصطناعي (دروس 24) هي نظرائها الحوكمة الخارجية. الأطر المختبرية طوعية؛ الأطر التنظيمية تظهر.
حيث يتناسب هذا مع المرحلة 18
الدروس 17-18 هي طبقة القياس والحكم فوق التحليلات الخادعة والفريق الأحمر. تتناول الدروس 19-24 الرفاهية والتحيز والخصوصية والعلامة المائية والهيكل التنظيمي. تقوم الدروس 28 بخطط النظام البيئي للبحث (MATS و Redwood و Apollo و METR) الذي يعمل على التقييمات.
استخدمها
لا توجد رمز لهذا الدروس. اقرأ المصادر الأساسية الثلاثة: RSP v3.0، PF v2، FSF v3.0. خريطة هيكل المستويات لكل مختبر إلى الآخرين وتحديد عتبة تحدد كل مختبر غير الآخرين.
أرسله
هذا الدرس يُنتجoutputs/skill-framework-diff.md. في إطار السلامة أو مذكرة الإفراج، يُقارن تعريفات العدول والمقياسات المطلوبة، وهيكل الحالة الأمنية في الإطار مقابل RSP v3.0، PF v2، FSF v3.0، وفرق بين المختبرات.
التمارين
- اقرأ RSP v3.0 و PF v2 و FSF v3.0 قم بتجميع جدول من عتبة CBRN لكل مختبر وعتبة R&D الذكاء الاصطناعي لكل واحد، وتقييمات ما قبل الانتشار المطلوبة لكل واحد.
- شفرة تعديل المنافسة في جميع الإطار الثلاث (2025+). اكتب فقرة واحدة تدعوه؛ اكتب فقرة واحدة تدعوه. حدد الافتراض الذي يعتمد عليه كل موقف.
- صمم حالة سلامة لنموذج يتجاوز عتبة البحث والتطوير الذكية في الإنثروبات. أسمائ الدليل الذي يتطلبه كل من الأعمدة الثلاثة (المراقبة، عدم القدرة على القراءة، عدم القدرة على القراءة).
- تقدم FSF v3.0 من DeepMind CCL للتلاعب الضار. اقترح ثلاثة قياسات تجربية تشير إلى أن نموذج قد تجاوز هذا العد.
- اقرأ "عناصر مشتركة في سياسات السلامة الذكاء الاصطناعي الحدودي" (2025) من METR. أسماؤ ثلاثة أقوى التقارب بين المختبرات والانفصالين الأكبرين.
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| RSP | "Anthropic's framework" | Responsible Scaling Policy; ASL tiers; v3.0 February 2026 |
| PF | "OpenAI's framework" | Preparedness Framework; five criteria; v2 April 2025 |
| FSF | "DeepMind's framework" | Frontier Safety Framework; CCLs; v3.0 September 2025 |
| ASL-3 | "biosafety level 3-analog" | Anthropic tier for CBRN-relevant capabilities; activated May 2025 |
| CCL | "critical capability level" | DeepMind's threshold construct; per-domain |
| Safety case | "the formal argument" | Written argument that deployment is acceptably safe under worst-case U |
| Adjustment clause | "competitor defection allowance" | Framework provision for reducing requirements if competitors ship without comparable safeguards |
المزيد من القراءة
- Anthropic — Responsible Scaling Policy v3.0 (February 2026) مستويات المعلومات العلمية والعلاقات، خرائط الطريق، تفكيك البحث والتطوير في الذكاء الاصطناعي
- OpenAI — Updating the Preparedness Framework (April 15, 2025) خمسة معايير، شروط التكيف
- DeepMind — Strengthening our Frontier Safety Framework (September 2025) CCL v3.0 ، التلاعب الضار
- METR — Common Elements of Frontier AI Safety Policies (2025) مقارنة بين المختبرات
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.