Phase 15: Autonomous Systems

إطار إعداد OpenAI وإطار السلامة الحدودية في DeepMind

إطار إعداد OpenAI v2 (أبريل 2025) يقدم فئات البحث استقلالية طويلة المدى، رمال التخلف، النسخة الذاتية والتكيف، تقويض الحماية مختلفة عن الفئات المتتبعة. الفئات المتعقبة تُؤدي إلى تقارير القدرات بالإضافة إلى تقارير الحماية التي استعرضتها مجموعة الاستشارات في مجال السلامة. تطوير FSF v3 من DeepMind (سبتمبر 2025 ، مع إضافة مستويات القدرة المتتبعة في 17 أبريل 2026) الذاتية في مجالات ML R&D و Cyber (ML R&D المستوى الذاتي 1 = أتمتة كاملة لخط الأنابيب R&D AI بتكلفة تنافسية مقابل أدوات الإنسان + AI). يستهدف FSF v3 صراحة التنظيم الخادع عبر مراقبة آلية لمساءلة استخدام الأدوات. ملاحظة صادقة: فئات البحث في PF v2 (بما في ذلك الاستقلال الطويل المدى) لا تؤدي تلقائيا إلى التخفيفات؛ لغة السياسة "محتملة". يقول DeepMind نفسه أن المراقبة الآلية "لن تظل كافية على المدى الطويل" إذا تمكنت التفكير الأدائي من التوصل إلى قوة.

Type: Learn

Languages: Python (stdlib, three-framework decision-table diff tool)

Prerequisites: Phase 15 · 19 (Anthropic RSP)

Time: ~45 minutes

المشكلة

دراسة 19 قراءة سياسة التوسع من الأنثروبيك عن كثب. هذا الدروس يكمّل الصورة من خلال قراءة OpenAI و DeepMind. وثائق الثلاثة هي أثاث ابن عم يناقش نفس السؤال متى ينبغي لمختبر الحدود وقف أو البوابة نموذج ويتقارب على مجموعة صغيرة من الفئات ويتفاوت في أماكن محددة مهمة.

التقارب: كل ثلاثة تسمية الاستقلال الطويل المدى كفئة قدرات تستحق تتبعها. جميع الثلاثة تعترف بالسلوك الخادع (التزوير بالاتجاه، التخريب) كنوع محدد من المخاطر. كلّ الثلاثة لديهم هيئة مراجعة داخلية. الاختلاف: تقسم OpenAI الفئات إلى "متتبع" (التخفيف الإلزامي) و"البحث" (لا يوجد محفز تلقائي). يضع "ديب ميند" الاستقلال إلى مجالات مختلفة بدلاً من تسميته بشكل منفصل. يطلق على المختبر اسم Tracked vs Research، أو Critical vs Moderate، أو Tier-1 vs Tier-2؛ والنتيجة التشغيلية التي تعيش فيها قدرة مختلفة بين المختبرات.

القراءة معا هي التمرين المفيد. نفس القدرة يمكن أن تكون "التخفيف الإلزامي" في الأنثروبيك، "المراقبة ولكن لا تشغيل" في OpenAI، و"التتبع في مجال محدد" في DeepMind.

المفهوم

إطار إعداد OpenAI v2 (أبريل 2025)

الهيكل:

  • Tracked Categories: تقارير القدرات (ما يمكن أن يفعله النموذج) بالإضافة إلى تقارير الحماية (ما هي التخفيفات المطبقة).
  • Research Categories: القدرات النموذجية التي تتبعها المختبر ولكن لا تتعهد بعد بتخفيفات محددة. تشمل الاستقلال على المدى الطويل، التخفيض من الرمل، النسخة الذاتية والتكيف، وتقويض الاحتياطات.

الإطار الرئيسي في v2: فئات البحث لا تؤدي تلقائيا إلى التخفيف. لغة السياسة هي التخفيفات "المحتملة". هذه هي الدلتا المحددة التي يجب مشاهدتها: موقع الفئة في Tracked vs Research هو المزج بين "مفتوحة" و "ملاحظة".

إطار السلامة الحدودية في DeepMind v3 (سبتمبر 2025؛ إضافة مستويات القدرة على تتبع 17 أبريل 2026)

الهيكل:

  • Critical Capability Levels (CCLs): حدود القدرة على العمل في خمس مجالات: كيبير، بيولوجي، أبحاث وتطوير المواد المعدنية، CBRN، الذاتية (ملتصقة إلى أبحاث وتطوير المواد المعدنية والكيبير).
  • Tracked Capability Levels: إضافة التفاصيل الضخمة في أبريل 2026. مثال ملموس: ML R&D المستوى 1 = أتمتة كاملة لخط الأنابيب R&D الذكاء الاصطناعي بتكلفة تنافسية مقابل أدوات الإنسان + الذكاء الاصطناعي.
  • Deceptive alignment monitoring: التزام صريح بالتحقق الآلي لمراقبة سوء استخدام الأدوات.

يختلف إطار الاستقلال عن OpenAI. DeepMind لا تحتفظ "Autonomy" كمنطقة رفيعة المستوى؛ يتم طيّنها إلى المناطق التي قد تسبب فيها الاستقلال ضررًا (ML R&D و Cyber). الجدل هو أن الاستقلال دون نطاق هو القدرة دون مخاطر. الجدل المضاد هو أن الاستقلال عبر المناطق هو خطر كبير يجب أن يسميه الإطار.

ما تجمع الثلاثة

  • مجموعة الاستشارات في مجال السلامة الداخلية (تُسمى مجموعة الإنسانية SAG، OpenAI SAG، لجنة DeepMind الداخلية). مراجعة قبل نشر نماذج عالية القدرة.
  • ذكر صريح للتوافق الخادع / التوافق التزوير كفئة المخاطر.
  • الأثاث الثابتة على التسلسل المعلن (أنثروبوليك: خريطة طريق السلامة الحدودية، تقرير المخاطر؛ OpenAI: تقارير القدرات والضمانات؛ DeepMind: دورة تحديث FSF).
  • الاعتراف بأن الدفاعات التي تتعلق بالتحقق فقط لها سقف. DeepMind صريح: "التحقق الآلي لن يبقى كافياً على المدى الطويل".

حيث يختلفون

  • Anthropic: إزالة التزام التوقف في v3.0; عتبة AI R&D-4 هي البوابة التالية المسمية.
  • OpenAI: التتبع مقابل البحث؛ فئات البحث (بما في ذلك الاستقلال الطويل المدى) لا يتم إدخالها تلقائيا.
  • DeepMind: تطوير الحكم الذاتي إلى مجالات أخرى؛ مستويات القدرة المتتبعة تضيف التفاصيل في أبريل 2026.

التخلف من الرمل: قدرة محددة تعقد كل ثلاثة

يقع رمل الرمال (نموذج يحتوي على أداء ضعيف استراتيجي في التقييمات) في فئات البحوث في OpenAI. يستهدفه RSP v3.0 من Anthropic عبر فجوة التقييم والسياق (الدرس 1). يستهدفه DeepMind من خلال مراقبة التوجه الخادعة في FSF v3.

إذا كان نموذج كيس الرمل على التقييمات، يتم تقليل حدود القدرة لكل إطار. يعمل الإطار فقط إذا كان القياس يعمل. لهذا السبب القياس الخارجي (دروس 21، METR) والتقييم المتضاد ضروري بالإضافة إلى التقييم الذاتي المختبر.

مهارة قراءة السياسات

  • تحديد الموقع: كل قدرة تهتم بها يجب أن تكون قابلة للتعقب في السياسة. إذا لم تكن قابلة للتعقب، فإن السياسة لا تغطي ذلك.
  • تصنيف: هل يتم تتبعها (تسبب التخفيف) أو البحث (تتتبع ولكن لا يؤدي إلى التشغيل) ؟ OpenAI تسمى هذا؛ إنثروبيك وديب ميند لها ما يعادلها.
  • التوقيت: هل يتم تحديث السياسة في جدول أعمال مُعلن، أم فقط بعد أحداث محددة؟
  • الاستقلال: هل التحقق من المراجعة الخارجية إلزامياً أم اختيارياً؟ الشركاء الأنثروپيك مع أبوولو ومعهد السلامة الذكاء الاصطناعي الأمريكي؛ OpenAI مع METR؛ DeepMind مع SAG الداخلي بشكل أساسي.

استخدمها

code/main.pyيطبق أداة اختلاف صغيرة في جدول القرار. بالنظر إلى القدرة (الاستقلال الذاتي، التنظيم الخادع، أتمتة البحث والتطوير، رفع الإنترنت، إلخ) ، فإنه يخرج كيفية تصنيف كل من السياسات الثلاثة القدرة، وما الذي يؤدي إلى التخفيف. انها مساعدة لقراءة، وليس أداة سياسة.

أرسله

outputs/skill-cross-policy-diff.mdيقدم مقارنة بين السياسات لقدرة محددة، باستخدام الأطر الثلاثة كإشارة.

التمارين

  1. أركضcode/main.pyتأكد من أن إصدار أداة التفاوت يطابق السياسات لعدد إمكانيات على الأقل يمكنك التحقق منه من الوثائق المصدرة.
  1. اقرأ OpenAI Preparedness Framework v2 بالكامل. حدد كل فئة بحثية. لكل منها، اكتب جملة واحدة حول سبب وجودها في البحث بدلاً من التتبع.
  1. اقرأ DeepMind FSF v3 بالكامل، بالإضافة إلى تحديث مستويات القدرة المتتبعة في أبريل 2026. حدد معايير التقييم المحددة لمستوى 1 من استقلالية البحث والتطوير. كيف ستقييمها خارجيًا؟
  1. تقنية الرمل في فئات البحث في OpenAI. صمم تقييم يضطر نموذج تقنية الرمل إلى الكشف عن قدرته الفعلية. راجع دراسة 1 تقييم السياق-العاب.
  1. مقارنة السياسات الثلاثة على قدرة محددة (اختيارك). قم بتصنيف السياسة التي تجدها أكثر صرامة وأقل. توجيهها بالنص المصدر.

الشروط الرئيسية

TermWhat people sayWhat it actually means
Preparedness Framework"OpenAI's scaling policy"PF v2 (April 2025); Tracked vs Research categories
Tracked Category"Mandatory mitigation"Triggers Capabilities + Safeguards Reports; SAG review
Research Category"Monitored only"Tracked but no automatic mitigation; includes Long-range Autonomy
Frontier Safety Framework"DeepMind's scaling policy"FSF v3 (Sept 2025) + Tracked Capability Levels (Apr 2026)
CCL"Critical Capability Level"DeepMind threshold per domain (Cyber, Bio, ML R&D, CBRN)
ML R&D autonomy level 1"R&D automation"Fully automate AI R&D pipeline at competitive cost
Sandbagging"Strategic underperformance"Model underperforms on evals; in OpenAI Research Categories
Instrumental reasoning"Means-ends reasoning"Reasoning about how to achieve goals; target of DeepMind monitoring

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.