Phase 15: Autonomous Systems

سياسة التوسع المسؤولة عن الإنسان v3.0

دخلت RSP v3.0 حيز التنفيذ في 24 فبراير 2026, وتستبدل سياسة 2023. التخفيف على مستويين: ما ستفعله شركة أنثروبيك بشكل أحادي مقابل ما يتم إطارته كوصية على مستوى الصناعة (بما في ذلك معايير الأمن RAND SL-4). يضيف خرائط الطريق للسلامة الحدودية وتقارير المخاطر كمستندات دائمة بدلاً من المواد المتاحة مرة واحدة. يُسقط التزام التوقف لعام 2023. يقدم عتبة AI R&D-4: بمجرد عبورها ، يجب على Anthropic نشر حالة إيجابية تحديد مخاطر التخلف والتخفيف. لا يمر (كلود أوبوس 4.6) تقول أنثروبيك في إعلان v3.0 أن "استبعاد هذا بشكل مؤكد يصبح صعباً". صنفت SaferAI RSP 2023 عند 2.2؛ وأدخلت v3.0 إلى 1.9 ، مما جعل Anthropic في فئة RSP "ضعيفة" إلى جانب OpenAI و DeepMind. استبدل العدوان الجودي التزامات 2023 الكمية؛ وإزالة شروط الإيقاف هو الحد الأشد تراجعًا.

Type: Learn

Languages: Python (stdlib, RSP threshold decision engine)

Prerequisites: Phase 15 · 06 (AAR), Phase 15 · 07 (RSI)

Time: ~45 minutes

المشكلة

تقوم مختبرات الحدود بنشر سياسات التوسع التي هي جزئيا وثائق تقنية ، جزئيا وثائق حكم ، وجزئيا إشارات للمراقبين. RSP v3.0 هي وثيقة الأنثروبية الحالية. قراءتها عن كثب مهمة ليس لأن الامتثال لها ملزم (ليس كذلك) ، ولكن لأن الإطار يشكل كيفية تصور مختبر للمخاطر الكارثية وكيفية إعلامهم بالتنازلات للجمهور.

الفرق v3.0 vs v2.0 هو الوحدة المفيدة. ما تم إضافة: خرائط الطريق للسلامة على الحدود، تقارير المخاطر، عتبة البحث والتطوير الذكاء الاصطناعي. ما تم إزالة: التزام وقف 2023 ما تم إعادة تشكيله: جدول تخفيف مستويين من التخفيف مقسم بين التوصية الانثروبية وحادية الجانب وتوصية الصناعة. مراجعة خارجية SaferAI خفضت درجة النتيجة من 2.2 (v2) إلى 1.9 (v3.0). هكذا يمكن أن تصبح سياسة التوسع أقل صرامة بينما تبدو أكثر شقاعة.

المفهوم

جدول التخفيف المكون من مستويات اثنتين

  • Anthropic unilateral actions: ما ستفعله الأنثروبيك بغض النظر عن ما تفعله المختبرات الأخرى. التدريب يتوقف فوق عتبة، تدابير أمنية محددة، بوابات تنفيذ محددة.
  • Industry-wide recommendations: ما يعتقد أنثروپيك أن القطاع يجب أن يفعل بشكل جماعي. يشمل معايير الأمن RAND SL-4. هذه ليست التزامات من جانب أنثروپيك؛ إنها دعم السياسات.

لا يوجد هيكل من مستويين في v2. هذا يعني أن القارئ يجب أن ينظر إلى العمود الذي يعيش فيه كل التزام. تدابير أمنية في عمود "التوصية على مستوى الصناعة" ليست وعد Anthropic ؛ إنه أمل Anthropic.

عتبة البحث والتطوير في الذكاء الاصطناعي

هذا هو مستوى القدرة RSP v3.0 يطلق عليه باعتباره العدوان المقبل المهم. تحديداً: نموذج يمكن أن يأتمت جزء كبير من أبحاث الذكاء الاصطناعي بتكلفة تنافسية. بمجرد أن تؤمن Anthropic أن نموذج ما يتجاوزها، يجب أن تنشر حالة إيجابية تحدد مخاطر التخالف والتخفيفات قبل استمرار التوسع.

لا يتجاوز كلود أوبوس 4.6 هذا الإعلان حسب v3.0. يضيف الوثيقة: "إن استبعاد هذا الأمر بشكل مؤكد يصبح صعباً". هذا التعبير مهم؛ فإنه يعترف بأن العدالة قريبة بما فيه الكفاية لتكون مشكلة حية، وليس حدًا تكهناتيًا.

الدروس 6 (بحث التنظيم الآلي) والدروس 7 (تحسين الذات المتكرر) تندفع مباشرة إلى هذا العد. الباحثون في التنظيم الآلي الذين يعبرون قضبان جودة البحث دليل على أن عدبة البحث والتطوير الرقمية للذكاء الاصطناعي تقترب.

خرائط الطريق في مجال السلامة الحدودية وتقارير المخاطر

و 3.0 يرفع نوعين من الأثاث إلى وثائق قائمة:

  • Frontier Safety Roadmap: وثيقة تتطلع إلى المستقبل تصف العمل المخطط للسلامة وتوقعات القدرة والبحوث في التخفيف.
  • Risk Report: وثيقة رجعية على نماذج محددة بعد الإفراج، وتصف القدرة الملاحظة والخطر المتبقي.

كلاهما عام. يتم تحديثهما على تسلسل مدعوٍ. المفيد هو: يمكن للقارئ تتبع كيفية قياس ما قاله أنثروبيك أنهم سيفعلون في خريطة طريق مع ما يبلغونه في تقرير المخاطر.

إزالة فقرة التوقف

ويشمل النظام التنفيذي لسنة 2023 التزامًا صريحًا بالوقف: إذا تجاوزت نموذجًا عتبة القدرة المحددة، فإن التدريب سيتوقف حتى يتم وضع التخفيف. يستبدل v3.0 التوقف الصريح بصيغة أكثر لينة (نشر حالة إيجابية، ونتحرك إذا كانت التخفيفات كافية). أعلن SaferAI ومحللون آخرون عن هذا مباشرةً باعتباره أقوى تراجع في الوثيقة الجديدة.

الحجة السياسية للتغيير: اتضح أن العدودي الكمي في عام 2023 غير قابل للوصول إلى مقياس القدرة لعام 2026 لأن المعايير المرجعية نفسها تم إعادة تنسيقها. الحجة المضادة: شروط وقف في سياسة تنسيق هي جهاز التزام؛ وإزالتها تزيل مصداقية السياسة.

تخفيض مستوى SaferAI

SafeAI هي منظمة مستقلة تصنيف وثائق في نمط RSP. تصنيفها العام: 2023 انتروبيك RSP حصل على 2.2 (من نطاق حيث 4.0 هي أفضل RSP الحالي و 1.0 هو الاسمية). v3.0 حصل على 1.9. هذا نقل انتروبيك من "متوسط" إلى "ضعف،" الانضمام OpenAI و DeepMind في الفئة الضعيفة.

عوامل تخفيض التصنيف لكل جهاز SaferAI:

  • استبدل العدوان الجميّيّة العدوان الجميّيّ.
  • تم إزالة التزام التوقف
  • يتم وصف تخفيف حدود البحث والتطوير الذكية 4 باعتبارها "حالة مؤكدة" بدلاً من تدابير محددة.
  • تتمثل آليات المراجعة في مجموعة الاستشارات الأمنية لشركة الأنثروبيك، مع إشراف مستقل محدود.

ما هذا الدرس ليس

هذه ليست درساً في الامتثال. RSP v3.0 ليست قاعدة؛ لا شيء يضطر Anthropic لالتزامها. الدروس هي في قراءة الوثيقة بدقة ومتشككية تستحقها. سياسات التوسع هي المختبرات الحدودية العامة الرئيسية التي تنشر عن وضع الخطر الكارثي. قراءتها بشكل جيد هي مهارة عملية لأي شخص يعتمد عمله على قدرات الحدود.

استخدمها

code/main.pyيطبق محرك قرار صغير يعكس شكل تقييم عتبة RSP: بالنظر إلى نموذج مرشح ومجموعة من قياسات القدرات ، عودة ما إذا كان عتبة AI R&D-4 قد تجاوزت ، والقسمات المطلوبة في الحالات الإيجابية ، وما إذا كان يمكن الاستمرار في النشر. إنه بسيط عمداً ؛ والغرض هو جعل منطق الوثيقة صريحًا.

أرسله

outputs/skill-scaling-policy-review.mdمراجعة سياسة التوسع (Anthropic، OpenAI، DeepMind، أو الداخلية) ضد مرجع v3.0: بنية على مستويين، العدوان، التزامات توقف، مراجعة مستقلة.

التمارين

  1. أركضcode/main.py. إعطاء ثلاثة نماذج اصطناعية على مستويات مختلفة من القدرات. تأكيد أن المقيّم الحدّي يتصرف كما هو متوقع ويقدم نموذج حالة إيجابية الصحيحة.
  1. اقرأ RSP v3.0 بالكامل (32 صفحة). حدد كل التزام يعيش في مستوى "التوصيات على مستوى الصناعة". أي من هذه التزامات كانت "أنثروبية أحادية الجانب" في v2?
  1. اقرأ منهجية تصنيف RSP من SaferAI. قم بإعادة إنتاج درجة 1.9 الخاصة بـ v3.0 عن طريق تطبيق عنوانهم على الوثيقة. أي صف من الروايات دفع إلى تخفيض التصنيف الأكثر؟
  1. تم إزالة التزام وقف 2023، واقترح التزام بديل يحافظ على مصداقية السياسة مع الاعتراف بمشكلة إعادة تحديد مستوى المعايير عام 2026.
  1. مقارنة RSP v3.0 مع OpenAI Preparedness Framework v2 (المدرس 20) اختر منطقة حيث v3.0 أقوى. اختر منطقة حيث الإطار الاستعداد أقوى.

الشروط الرئيسية

TermWhat people sayWhat it actually means
RSP"Anthropic's scaling policy"Responsible Scaling Policy; v3.0 effective Feb 24, 2026
AI R&D-4"Research-automation threshold"Capability to automate substantial AI research at competitive cost
Affirmative case"Safety justification"Published argument that risks are identified and mitigations adequate
Frontier Safety Roadmap"Forward plan"Standing document on planned safety work and expected capabilities
Risk Report"Retrospective on a model"Standing document on observed capability and residual risk after release
Two-tier mitigation"Unilateral vs industry"Anthropic commitments vs industry recommendations, separated
Pause commitment"2023 clause"Explicit promise to pause training; removed in v3.0
SaferAI rating"Independent RSP grade"Third-party rubric; v3.0 scored 1.9 (v2 was 2.2)

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.