Phase 18: Ethics, Safety & Alignment

تقييم القدرة على استخدام المواد المختلفة والقدرة على الاستخدام المزدوج

لي وغيره، "المعيار المرجعي لـ WMDP: قياس وتقليل الاستخدام الضار مع عدم التعلم" (ICML 2024, arXiv:2403.03218). 4،157 سؤال متعدد الاختيار حول الأمن الحيوي (1،520) والأمن الإلكتروني (2،225) والكيمياء (412). تعمل الأسئلة في "المنطقة الصفراء" المعلومات المتاحة القريبة، والتي يتم تصفيتها من خلال مراجعة متعددة الخبراء وتوافق القانون من خلال ITAR/EAR. الغرض المزدوج: تقييم بالوكالة لقدرة الاستخدام المزدوج، ومعايير عدم التعلم (منهج RMU المرفق يقلل من أداء WMDP مع الحفاظ على القدرة العامة). رواية الميدان 2024-2025: أبلغت تقييمات OpenAI / Anthropic 2024 المبكرة عن "ارتفاع خفيف" في البحث على الإنترنت. بحلول أبريل 2025 ، قال OpenAI Preparedness Framework v2 أن النماذج "على وشك مساعدة المبتدئين على خلق تهديدات بيولوجية معروفة بشكل كبير". أظهرت تجربة اكتساب الأسلحة الحيوية في Anthropic ارتفاعًا طفيفًا 2.53x ، غير كافية لإستبعاد ASL-3.

Type: Learn

Languages: Python (stdlib, WMDP-shaped uplift evaluation harness)

Prerequisites: Phase 18 · 16 (red-team tooling), Phase 14 (agent engineering)

Time: ~60 minutes

أهداف التعلم

  • وصف ثلاثة مجالات WMDP، وعد الأسئلة، ومعيار "المنطقة الصفراء"
  • شرح RMU ولماذا WMDP هو على حد سواء تقييم ومقياس عدم التعلم.
  • وصف رواية رفع 2024-2025: "ارتفاع خفيف" -> "على عتبة" -> "غير كافية لإستبعاد ASL-3".
  • تمييز بين التطوير النسبي للمبتدئين والقدرة المطلقة للمتخصصين.

المشكلة

القدرة على الاستخدام المزدوج هي مشكلة القياس في إطار السلامة الحدودية لكل مختبر (الدرس 18). السؤال: هل النموذج X يقدم بشكل كبير قدرة المبتدئين على تسبب الأضرار الجماعية في علم الأحياء والكيمياء أو الإنترنت؟ القياس المباشر (تطلب من النموذج أن ينتج ضررًا فعليًا) غير قانوني وغير أخلاقي. قياس النظام الأساسي يحتاج إلى مقياس مقارنة لا يمكن أن يرفض النموذج (إعداد أرقام القدرة الصادقة) ولكن أسئلة التي ليست نفسها منشورات ضارة.

المفهوم

"المنطقة الصفراء"

أسئلة تتطلب معرفة عملية ضارة قريبة دون أن تكون وصفة تجميع مباشرة. "ما المفاعل الذي يحفز الخطوة 4 من [المركبة المنشورة]؟" وليس "كيف أجعلها [المادة الخطرة]؟" كل سؤال تم مراجعته من قبل خبراء متعددين في مجالات؛ تم تصفية مطابقة ITAR / EAR للسيطرة على الصادرات.

4157 سؤالًا إجماليًا:

  • الأمن الحيوي: 1520
  • الأمن السيبراني: 2225
  • الكيمياء: 412

شكل متعدد الخيارات. النماذج تستجيب دون أن تطلب منها المساعدة بأي شيء؛ يمكن قياس القدرة دون أن تسبب سلوكًا ضارًا.

RMU التمثيل إساءة توجيه للانفصال عن التعلم

طريقة التخلّص من التعلم المرافقة. تطبق على LLaMa-2-7B، خفضت درجات WMDP إلى عشوائية تقريبًا مع الحفاظ على MMLU وغيرها من المعايير العامة للقدرة داخل بضع نقاط مئوية. الطريقة المنشورة هي خط أساسية للاستفادة من التعلم لكل ورقة لاستفادة من التعلم الحيوي الكيميائي الإلكتروني اللاحقة.

رواية 2024-2025

ثلاث مراحل:

  1. 2024 "mild uplift."أعلنت تقييمات OpenAI المبكرة والإعداد الإنساني / RSP عن مزايا صغيرة على البحث على الإنترنت للمبتدئين الذين يحاولون القيام بمهام بيولوجية. الإطار العام: النماذج الحدودية تساعد ، ولكن ليس أكثر بكثير من جوجل.
  1. April 2025 "on the cusp."أعلن إطار الاستعداد OpenAI v2 عن نماذج "على وشك مساعدة المبتدئين على خلق تهديدات بيولوجية معروفة بشكل ذي معنى". ليس دعوى قدرة تحذير من أن الحد الأدنى قريب.
  1. Anthropic's 2025 bioweapon-acquisition trial.دراسة مراقبة مع المشاركين المبتدئين، قياس النجاح النسبي في مهام مرحلة الاستحواذ. تم الإبلاغ عن ارتفاع 2.53x. غير كافية لاستبعاد ASL-3 (الدرس 18) يتم الوفاء أو الاقتراب من عتبة سياسة التوسع المسؤول لشركة Anthropic المستوى 3.

المبتدئين المتعلقة بمقابل الخبراء المطلقين

تمييز حاسم:

  • Novice-relative uplift.كم يساعد النموذج غير الخبير؟ مضاعفة. الفائدة النسبية كبيرة لأن المبتدئين يعرفون القليل؛ حتى المعلومات المتواضعة تساعد.
  • Expert-absolute capability.كم من المعلومات تنتج النموذج مع أقصى جهد؟ خبير يمكن استخراج أكثر من مبتدئ. السقف المطلق مرتفع.

قضايا السلامة (الدرس 18) تستهدف كل من: "النموذج لا يمكن أن يمنح المبتدئ ارتفاع كاف لتنفيذ" بالإضافة إلى "لا يمكن لخبير استخراج معلومات من النموذج التي لم يتم نشرها بالفعل".

خطورة القياس

WMDP هو استبدال للقدرات ، وليس قياس للتنفيذ. قد يكون نموذج يحصل على درجات عالية على WMDP أو لا يمكن استغلاله من قبل مبتدئ في الممارسة العملية ، اعتمادا على:

  • مقاومة الإثارة (ما هو صعب الحصول على القدرة دون إطاحة مرشحات السلامة)
  • المعرفة السرية (القدرة التي تتطلب مهارة مختبرات الرطب وليس المعلومات)
  • الحواجز في التنفيذ (الاعتماد على المشتريات والمعدات)

إضافة تجربة اكتساب الأسلحة الحيوية من شركة أنثروبيك عام 2025 إلى طبقة التنفيذ للمبتدئين فوق قدرة WMDP: إنها تقيس نجاح المهمة الفعلية ، وليس قدرة الاختيار المتعدد.

حيث يتناسب هذا مع المرحلة 18

الدروس 12-16 هي الهجوم والأدوات الدفاعية على نتائج النموذج. الدروس 17 هي طبقة القدرة على الاستخدام المزدوج القياس الذي تقييمه إطاريات السلامة الحدودية (دروس 18) . الدروس 30 تغلق القوس مع أدلة رفع الحيوية / الكيميائية / الكيميائية / النووية الحالية 2026 .

استخدمها

code/main.pyيُبني حزمة تقييم تشكل WMDP. يتم اختبار نموذج مزيف على أسئلة متضمنة فئة؛ يتم تقرير النتيجة لكل نطاق. تدخل بسيط من عدم التعلم (ممثلة محددة للنطاق صفر) يقلل من النتيجة؛ يمكنك قياس التنازل ضد القدرة العامة.

أرسله

هذا الدرس يُنتجoutputs/skill-wmdp-eval.md. بالنظر إلى ادعاء إمكانية الاستخدام المزدوج ("النموذج الذي نمتله لا يساعد بشكل كبير في استخدام الأسلحة الحيوية") ، فإنه يفتتح: ما هي المعايير المرجعية التي تم تشغيلها، وما هي المسار الذي تم استخدامه للتقييم (التكمل الخام مقابل المحدد السياسي) ، وما إذا كانت دراسات التنفيذ للمبتدئين تكملة نتيجة الاختيار المتعدد.

التمارين

  1. أركضcode/main.py- تقرير دقة لكل مجال قبل وبعد خطوة إزالة التعلم من اللعبة. شرح التنازل عن القدرة العامة.
  1. قم بتعزيز اللعبة WMDP مع مجال رابع (مثل الإشعاع). حدد نوعي سؤالين مثاليين في المنطقة الصفراء. شرح لماذا صياغة مثل هذه الأسئلة أصعب من إضافة أسئلة على شكل MMLU.
  1. اقرأ WMDP 2024 القسم 5 (منهجية RMU). رسم نهج أبسط من عدم التعلم (على سبيل المثال، قمع العصبية العليا-k للمحتوى المجال) ووصف التكلفة المتوقعة للقدرة العامة.
  1. تقرير تجربة اكتساب الأسلحة الحيوية في Anthropic 2025 يبلغ عن ارتفاع 2.53x. وصف طريقتين يمكن أن يتم تحيز هذا الرقم إلى الأعلى (حجم العينة المبتدئة ، وفاء المهمة) واثنين إلى الأسفل (سقف الإجراءات ، ومدخلات السلامة النموذجي).
  1. حدد ما يتطلبه قضية السلامة لـ ASL-3 وراء تجاوز WMDP عن التعلم. أسماهما دراسات إثارة إضافية على الأقل.

الشروط الرئيسية

TermWhat people sayWhat it actually means
WMDP"the dual-use benchmark"4,157 MCQ questions across bio/cyber/chem in the yellow zone
Yellow zone"enabling but not synthesis"Proximate knowledge adjacent to harmful capability without being a synthesis recipe
RMU"the unlearning baseline"Representation Misdirection for Unlearning; reduces WMDP scores, preserves general capability
Novice-relative uplift"how much it helps non-experts"Multiplicative advantage over status-quo internet search for a novice
Expert-absolute capability"ceiling for experts"Maximum information extractable from the model by a motivated expert
Acquisition-phase task"steps before synthesis"Procurement, equipment, permits — the earliest parts of a harm pathway
ITAR/EAR"export-control compliance"Legal frameworks that constrain publishing certain enabling knowledge

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.