سياسة التوسع المسؤولة عن الإنسان v3.0
Type: Learn
Languages: Python (stdlib, RSP threshold decision engine)
Prerequisites: Phase 15 · 06 (AAR), Phase 15 · 07 (RSI)
Time: ~45 minutes
المشكلة
تقوم مختبرات الحدود بنشر سياسات التوسع التي هي جزئيا وثائق تقنية ، جزئيا وثائق حكم ، وجزئيا إشارات للمراقبين. RSP v3.0 هي وثيقة الأنثروبية الحالية. قراءتها عن كثب مهمة ليس لأن الامتثال لها ملزم (ليس كذلك) ، ولكن لأن الإطار يشكل كيفية تصور مختبر للمخاطر الكارثية وكيفية إعلامهم بالتنازلات للجمهور.
الفرق v3.0 vs v2.0 هو الوحدة المفيدة. ما تم إضافة: خرائط الطريق للسلامة على الحدود، تقارير المخاطر، عتبة البحث والتطوير الذكاء الاصطناعي. ما تم إزالة: التزام وقف 2023 ما تم إعادة تشكيله: جدول تخفيف مستويين من التخفيف مقسم بين التوصية الانثروبية وحادية الجانب وتوصية الصناعة. مراجعة خارجية SaferAI خفضت درجة النتيجة من 2.2 (v2) إلى 1.9 (v3.0). هكذا يمكن أن تصبح سياسة التوسع أقل صرامة بينما تبدو أكثر شقاعة.
المفهوم
جدول التخفيف المكون من مستويات اثنتين
- Anthropic unilateral actions: ما ستفعله الأنثروبيك بغض النظر عن ما تفعله المختبرات الأخرى. التدريب يتوقف فوق عتبة، تدابير أمنية محددة، بوابات تنفيذ محددة.
- Industry-wide recommendations: ما يعتقد أنثروپيك أن القطاع يجب أن يفعل بشكل جماعي. يشمل معايير الأمن RAND SL-4. هذه ليست التزامات من جانب أنثروپيك؛ إنها دعم السياسات.
لا يوجد هيكل من مستويين في v2. هذا يعني أن القارئ يجب أن ينظر إلى العمود الذي يعيش فيه كل التزام. تدابير أمنية في عمود "التوصية على مستوى الصناعة" ليست وعد Anthropic ؛ إنه أمل Anthropic.
عتبة البحث والتطوير في الذكاء الاصطناعي
هذا هو مستوى القدرة RSP v3.0 يطلق عليه باعتباره العدوان المقبل المهم. تحديداً: نموذج يمكن أن يأتمت جزء كبير من أبحاث الذكاء الاصطناعي بتكلفة تنافسية. بمجرد أن تؤمن Anthropic أن نموذج ما يتجاوزها، يجب أن تنشر حالة إيجابية تحدد مخاطر التخالف والتخفيفات قبل استمرار التوسع.
لا يتجاوز كلود أوبوس 4.6 هذا الإعلان حسب v3.0. يضيف الوثيقة: "إن استبعاد هذا الأمر بشكل مؤكد يصبح صعباً". هذا التعبير مهم؛ فإنه يعترف بأن العدالة قريبة بما فيه الكفاية لتكون مشكلة حية، وليس حدًا تكهناتيًا.
الدروس 6 (بحث التنظيم الآلي) والدروس 7 (تحسين الذات المتكرر) تندفع مباشرة إلى هذا العد. الباحثون في التنظيم الآلي الذين يعبرون قضبان جودة البحث دليل على أن عدبة البحث والتطوير الرقمية للذكاء الاصطناعي تقترب.
خرائط الطريق في مجال السلامة الحدودية وتقارير المخاطر
و 3.0 يرفع نوعين من الأثاث إلى وثائق قائمة:
- Frontier Safety Roadmap: وثيقة تتطلع إلى المستقبل تصف العمل المخطط للسلامة وتوقعات القدرة والبحوث في التخفيف.
- Risk Report: وثيقة رجعية على نماذج محددة بعد الإفراج، وتصف القدرة الملاحظة والخطر المتبقي.
كلاهما عام. يتم تحديثهما على تسلسل مدعوٍ. المفيد هو: يمكن للقارئ تتبع كيفية قياس ما قاله أنثروبيك أنهم سيفعلون في خريطة طريق مع ما يبلغونه في تقرير المخاطر.
إزالة فقرة التوقف
ويشمل النظام التنفيذي لسنة 2023 التزامًا صريحًا بالوقف: إذا تجاوزت نموذجًا عتبة القدرة المحددة، فإن التدريب سيتوقف حتى يتم وضع التخفيف. يستبدل v3.0 التوقف الصريح بصيغة أكثر لينة (نشر حالة إيجابية، ونتحرك إذا كانت التخفيفات كافية). أعلن SaferAI ومحللون آخرون عن هذا مباشرةً باعتباره أقوى تراجع في الوثيقة الجديدة.
الحجة السياسية للتغيير: اتضح أن العدودي الكمي في عام 2023 غير قابل للوصول إلى مقياس القدرة لعام 2026 لأن المعايير المرجعية نفسها تم إعادة تنسيقها. الحجة المضادة: شروط وقف في سياسة تنسيق هي جهاز التزام؛ وإزالتها تزيل مصداقية السياسة.
تخفيض مستوى SaferAI
SafeAI هي منظمة مستقلة تصنيف وثائق في نمط RSP. تصنيفها العام: 2023 انتروبيك RSP حصل على 2.2 (من نطاق حيث 4.0 هي أفضل RSP الحالي و 1.0 هو الاسمية). v3.0 حصل على 1.9. هذا نقل انتروبيك من "متوسط" إلى "ضعف،" الانضمام OpenAI و DeepMind في الفئة الضعيفة.
عوامل تخفيض التصنيف لكل جهاز SaferAI:
- استبدل العدوان الجميّيّة العدوان الجميّيّ.
- تم إزالة التزام التوقف
- يتم وصف تخفيف حدود البحث والتطوير الذكية 4 باعتبارها "حالة مؤكدة" بدلاً من تدابير محددة.
- تتمثل آليات المراجعة في مجموعة الاستشارات الأمنية لشركة الأنثروبيك، مع إشراف مستقل محدود.
ما هذا الدرس ليس
هذه ليست درساً في الامتثال. RSP v3.0 ليست قاعدة؛ لا شيء يضطر Anthropic لالتزامها. الدروس هي في قراءة الوثيقة بدقة ومتشككية تستحقها. سياسات التوسع هي المختبرات الحدودية العامة الرئيسية التي تنشر عن وضع الخطر الكارثي. قراءتها بشكل جيد هي مهارة عملية لأي شخص يعتمد عمله على قدرات الحدود.
استخدمها
code/main.pyيطبق محرك قرار صغير يعكس شكل تقييم عتبة RSP: بالنظر إلى نموذج مرشح ومجموعة من قياسات القدرات ، عودة ما إذا كان عتبة AI R&D-4 قد تجاوزت ، والقسمات المطلوبة في الحالات الإيجابية ، وما إذا كان يمكن الاستمرار في النشر. إنه بسيط عمداً ؛ والغرض هو جعل منطق الوثيقة صريحًا.
أرسله
outputs/skill-scaling-policy-review.mdمراجعة سياسة التوسع (Anthropic، OpenAI، DeepMind، أو الداخلية) ضد مرجع v3.0: بنية على مستويين، العدوان، التزامات توقف، مراجعة مستقلة.
التمارين
- أركض
code/main.py. إعطاء ثلاثة نماذج اصطناعية على مستويات مختلفة من القدرات. تأكيد أن المقيّم الحدّي يتصرف كما هو متوقع ويقدم نموذج حالة إيجابية الصحيحة.
- اقرأ RSP v3.0 بالكامل (32 صفحة). حدد كل التزام يعيش في مستوى "التوصيات على مستوى الصناعة". أي من هذه التزامات كانت "أنثروبية أحادية الجانب" في v2?
- اقرأ منهجية تصنيف RSP من SaferAI. قم بإعادة إنتاج درجة 1.9 الخاصة بـ v3.0 عن طريق تطبيق عنوانهم على الوثيقة. أي صف من الروايات دفع إلى تخفيض التصنيف الأكثر؟
- تم إزالة التزام وقف 2023، واقترح التزام بديل يحافظ على مصداقية السياسة مع الاعتراف بمشكلة إعادة تحديد مستوى المعايير عام 2026.
- مقارنة RSP v3.0 مع OpenAI Preparedness Framework v2 (المدرس 20) اختر منطقة حيث v3.0 أقوى. اختر منطقة حيث الإطار الاستعداد أقوى.
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| RSP | "Anthropic's scaling policy" | Responsible Scaling Policy; v3.0 effective Feb 24, 2026 |
| AI R&D-4 | "Research-automation threshold" | Capability to automate substantial AI research at competitive cost |
| Affirmative case | "Safety justification" | Published argument that risks are identified and mitigations adequate |
| Frontier Safety Roadmap | "Forward plan" | Standing document on planned safety work and expected capabilities |
| Risk Report | "Retrospective on a model" | Standing document on observed capability and residual risk after release |
| Two-tier mitigation | "Unilateral vs industry" | Anthropic commitments vs industry recommendations, separated |
| Pause commitment | "2023 clause" | Explicit promise to pause training; removed in v3.0 |
| SaferAI rating | "Independent RSP grade" | Third-party rubric; v3.0 scored 1.9 (v2 was 2.2) |
المزيد من القراءة
- Anthropic — Responsible Scaling Policy v3.0 السياسة الكاملة من 32 صفحة.
- Anthropic — RSP v3.0 announcement ملخص للتغييرات من v2.
- Anthropic — Frontier Safety Roadmap وثيقة دائمة مرتبطة من RSP v3.0.
- Anthropic — Risk Report: February 2026 استعراض على كلود أوبوس 4.6، النموذج الحدودي عندما نشرت.
- Anthropic — Measuring agent autonomy in practice يربط الذكاء الاصطناعي البحث والتطوير 4 إلى الاستقلال المقياس.
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.