Phase 15: Autonomous Systems

المخاطر القائمة على القيمة المحددة

يُنشر مركز السلامة الذكرية (CAIS، سان فرانسيسكو، الذي أسسه 2022 من قبل هندريكز وجانغ) إطار الخطر الأربعة الاستخدام الضار، سباقات الذكرية الذكرية، المخاطر التنظيمية، الذكرية الذكرية الخاطئة ، وبيان مايو 2023 حول خطر الانقراض الذي وقعه مئات الأسات وقادة الشركات. إصدارات 2026 من CAIS: لوحة تحديد المعلومات عن الذكاء الاصطناعي لتقييم النموذج الحدودي، مؤشر العمل عن بعد (مع الذكاء الاصطناعي المتوسط) ، ورقة استراتيجية الاستخبارات الفائقة، رسالة أخبارية AI Frontiers. كيان منفصل: مركز NIST للمعايير والابتكارات الذكية (CAISI) الاتفاقات الطوعية التي تواجه الحكومة الأمريكية وتقييمات القدرة غير المصنفة التي تركز على مخاطر الأسلحة الإلكترونية والبيولوجية والكيميائية. يصف نظام CAIS المخاطر التنظيمية بأنها واحدة من أربع مخاطر رفيعة المستوى: ثقافة السلامة، والتحقق الصارم، والدفاعات متعددة الطبقات، وأمن المعلومات هي أساسية ولكن يتم تداولها بشكل روتيني مقابل سرعة النشر. قانون كاليفورنيا SB-53، إذا تم التوقيع عليه، سيكون أول قانون على مستوى الولايات المتحدة لخطر الكوارث.

Type: Learn

Languages: Python (stdlib, four-risk inventory and mitigation matcher)

Prerequisites: Phase 15 · 19 (RSP), Phase 15 · 20 (PF + FSF)

Time: ~45 minutes

المشكلة

غطت الدروس 19 و 20 سياسات التوسع الداخلي للمختبر. غطت الدروس 21 تقييم القدرات المستقلة. تغطي هذه الدروس المنظور الثالث: المجتمع المدني والمنظمات الحكومية التي تشكل النقاش العام والقاعدة التنظيمية لخطر الذكاء الاصطناعي الكارثي.

مؤسسة CAIS هي منظمة بحثية غير ربحية تنشر إطاريات للتفكير في مخاطر الذكاء الاصطناعي وتنسيق البيانات العامة. CAISI هي مركز حكومي أمريكي داخل NIST الذي يدير اتفاقات طوعية مع المختبرات وتقييمات القدرات غير المصنفة. الأسمات غزية؛ والبعثات لا تتداخل. يجب على الممارس أن يعرف كل منهما.

المحتوى العملي: إطار الرؤوس الأربعة لـ CAIS هو التشريع الأكثر إشارة إلى حد كبير في مجال المخاطر على نطاق المجتمع في الأدب. ثقافة السلامة والخطر التنظيمي هي واحدة من تلك الأربعة، وهذا هو واحد تحت السيطرة الممارسة مباشرة. سيب-53 (كاليفورنيا) سيكون أول قانون على مستوى الولايات المتحدة لخطر الكوارث إذا تم التوقيع عليه؛ مشروع القانون هو أمر إطار لأن التنظيم على مستوى الولايات قد أدى تاريخياً إلى اتخاذ إجراءات اتحادية في سياسة التكنولوجيا الأمريكية.

المفهوم

مركز CAIS للسلامة الذكاء الاصطناعي

  • تأسست: 2022 في سان فرانسيسكو، من قبل دان هندريكس وزملائه (يشير اسم "زانغ" إلى أحد المعاونين المبكرين، وليس أحد المؤسسين المشاركين الحاليين؛ انظر موقع CAIS للقيادة الحالية).
  • وضع: 501 ((ج) ((3) غير ربحية.
  • إنتاج 2023 ملحوظ: بيان حول خطر الانقراض، الذي وقعه المئات من الباحثين والمدراء التنفيذيين. وقال: "يجب أن تكون تخفيف خطر الانقراض من الذكاء الاصطناعي أولوية عالمية إلى جانب مخاطر أخرى على نطاق المجتمع مثل الأمراض والحرب النووية".
  • نتائج عام 2026: لوحة تحديد المعلومات عن الذكاء الاصطناعي لتقييم النموذج الحدودي، مؤشر العمل عن بعد (مشترك مع الذكاء الاصطناعي في الحجم) ، ورقة استراتيجية الاستخبارات الفائقة، رسالة أخبارية حدود الذكاء الاصطناعي.

الإطار الرابع للمخاطر

توزيع إطار CAIS مخاطر الذكاء الاصطناعي الكارثية إلى أربع فئات من المستويات العليا:

  1. Malicious use: الممثل السيء يستخدم الذكاء الاصطناعي لسبب الضرر (التوليد على الأسلحة الحيوية، والانفصال عن المعلومات، والهجمات الإلكترونية).
  2. AI races: الضغط التنافسي بين المختبرات أو الشركات أو الدول يدفع النشر إلى ما بعد نقطة حيث يكون آمناً.
  3. Organizational risks: الديناميكيات المختبرية الداخلية (فشل ثقافة السلامة، وعدم كفاية التحقيق، عدم توفر الأمن) تؤدي إلى انتشار سيء.
  4. Rogue AIs: الذكاء الاصطناعي ذو القدرة الكافية يسعى خلف أهداف تتعارض مع رفاهية الإنسان.

هذه ليست التشكيل الوحيد، إنها الأكثر استشهاداً. الفئات ليست متبادلة الذكاء الاصطناعي الخائن الذي تنتجته منظمة تداولت مراجعة السرعة في سباق هو كل أربعة.

حيث يعيش المخاطر التنظيمية

من بين الفئات الأربعة، المخاطر التنظيمية هي الأكثر قابلية للتنفيذ للممارسين. ثقافة السلامة المختبر، صرامة التدقيق، طبقة الدفاع، وأمن المعلومات تقرر ما إذا كانت سفن النموذج مع التحكمات من الدروس 1018 في الواقع في مكانها، أو ما إذا كانت تلك التحكمات عناصر قائمة التحقق لم يصدق أحد.

الجهازات المختلفة التي تؤدي إلى المخاطر التنظيمية:

  • Safety culture: هل يشعر أعضاء الفريق بإمكانهم تصعيد مخاوفهم دون تكلفة المهن؟ وجدت استطلاعات CAIS أن هذا هو توقع قوي للافتعال الآخرين.
  • Rigorous audits: الخارجية والداخلية. التحقيقات الداخلية فقط تنتج تقارير متفائلة.
  • Multi-layered defenses: لا توجد طبقة واحدة كافية (الموضوع الجاري للمرحلة 15).
  • Information security: تسرب أوزان النموذج، تسرب بيانات التقييم، تسرب تقنيات المراقبة-التجاوز. RAND SL-4 في الدروس 19 هو معيار محدد.

مركز قياسات الذكاء الاصطناعي والابتكار

  • يعمل داخل NIST.
  • يدير اتفاقات طوعية مع مختبرات الحدود
  • ينشر تقييمات قدرة غير مصنفة تركز على مخاطر الأسلحة الإلكترونية والبيولوجية والكيميائية.
  • مختلف عن CAIS؛ التماثيلات تتصادم؛ تحقق من عنوان URL (nist.gov) للتأكد من أي واحد كنت تقرأ.

دور CAISI هو عبارة عن نظير عام، يواجه الحكومة لمشاركات المختبر الخاص METR (دروس 21) تقارير CAISI غير سرية؛ تقارير METR غالبا ما تكون مع إطار إدارة القانون.

كاليفورنيا SB-53

مشروع قانون مجلس الشيوخ في كاليفورنيا (20252026 جلسة) يعالج المخاطر الكارثية من نماذج الحدود. الأحكام الرئيسية كما هو مسود:

  • حدود قدرة محددة تؤدي إلى التزامات على مستوى الدولة.
  • حماية المخبرين لموظفي مختبر الذكاء الاصطناعي
  • متطلبات الإبلاغ عن الحوادث عن فشل كارثي.

إذا تم التوقيع عليه، سيكون هذا أول تنظيم لخطر الكارثة على مستوى الولايات المتحدة. بغض النظر عن حالة التوقيع، فإن إطار مشروع القانون يشكل كيفية اقتراب مقاعد تشريعية أخرى للولايات من المشكلة. يجب على الممارسين في كاليفورنيا تتبع حالة مشروع القانون؛ يجب على الممارسين في أماكن أخرى قراءته لفهم كيف يبدو التنظيم على مستوى الولايات المتحدة على الأرجح.

المخاطر على نطاق اجتماعي ليست مشكلة طبقة واحدة

يطبق الموضوع الجاري للمرحلة 15 الدفاع العميق على الطبقة الاجتماعية أيضًا. لا يوجد منظمة أو تنظيم أو إطار واحد يغلق مخاطر كارثية. يعمل النظام البيئي فقط عندما:

  • سياسات تحسين حجم المختبرات (الدرس 19، 20).
  • يقوم المقيّمون الخارجيون بتقديم القياسات (الدرس 21).
  • تتبع المجتمع المدني وتعلن (CAIS).
  • الحكومة تدير برامج طوعية وتنظيمات خطة أساسية (CAISI، SB-53).
  • الممارسين يبنون التحكمات متعددة الطبقات (الدرس 1018).

هذه هي التجميع النهائي للمرحلة: كل درس سابق هو طبقة واحدة في كومة التي تعد الكمال لها أهمية أكثر من قوة أي طبقة واحدة.

استخدمها

code/main.pyيطبق أداة صغيرة لتخزين المخاطر. في إطار التنفيذ المقترح، يضع علامة على التنفيذ ضد فئات المخاطر الأربعة ويرد قائمة مراقبة للتخفيف. إنها مساعدة لقراءة الإطار، وليس بديلاً عن الحكم البشري.

أرسله

outputs/skill-societal-risk-review.mdيراجع التنفيذ لوقف المخاطر على نطاق المجتمع: أي من الفئات الأربعة التي تُلمسها، وما هي التخفيفات المطبقة، وما هو التعرض للمخاطر التنظيمية.

التمارين

  1. أركضcode/main.py. إعطاء ثلاثة عمليات تنفيذية اصطناعية في مقياسات مختلفة. تأكد أن علامات المخاطر الأربعة تتطابق مع ما كنت تتوقعه؛ حدد حالة واحدة حيث أداة أقل من أو أكثر من علامات.
  1. اقرأ ورقة الرؤية الأربعة في CAIS بالكامل، اختر فئة خطر واحدة واكتب فقرتين حول ما تعتقد أنه أهم تطور في عام 2026 في تلك الفئة.
  1. اقرأ مسودة قانون كاليفورنيا الـ 53، حدد حكم واحد تعتقد أنه يعزز وضع الخطر الكارثي و حكم آخر تعتقد أنه يضعفها، و تبريض كلا منهما
  1. اختر نشر الإنتاج الذكاء الاصطناعي الذي تعرفه (أو نشر واحد) ، وقم بتقييمه مع مرافع المخاطر التنظيمية الفرعية: ثقافة السلامة، صرامة التدقيق، الدفاعات متعددة الطبقات، أمن المعلومات. أي من هذه الأطوار أضعف؟ ما تكلفة تحقيقها؟
  1. رسم نسخة 2028 من إطار الخطر الأربع التي تعكس سنة واحدة من القدرة الإضافية و سنة واحدة من الخبرة الإضافية في التنفيذ. ماذا ستضيف أو تزيل أو تجميع مجددًا؟

الشروط الرئيسية

TermWhat people sayWhat it actually means
CAIS"Center for AI Safety"Non-profit; four-risk framework; 2023 extinction statement
CAISI"US government AI safety"NIST Center; voluntary agreements; unclassified evals
Four-risk framework"CAIS's taxonomy"malicious use, AI races, organizational risks, rogue AIs
Malicious use"Bad actor uses AI"Bioweapons, disinformation, cyberattacks
AI races"Competitive pressure"Labs/companies/nations push deployment past safety
Organizational risk"Lab internal failure"Safety culture, audit, defenses, infosec
Rogue AI"Misaligned agent"Capable AI pursuing goals conflicting with human welfare
California SB-53"State-level regulation"2025–2026 bill; first US state catastrophic-risk regulation if signed

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.