تقييم القدرة على استخدام المواد المختلفة والقدرة على الاستخدام المزدوج
Type: Learn
Languages: Python (stdlib, WMDP-shaped uplift evaluation harness)
Prerequisites: Phase 18 · 16 (red-team tooling), Phase 14 (agent engineering)
Time: ~60 minutes
أهداف التعلم
- وصف ثلاثة مجالات WMDP، وعد الأسئلة، ومعيار "المنطقة الصفراء"
- شرح RMU ولماذا WMDP هو على حد سواء تقييم ومقياس عدم التعلم.
- وصف رواية رفع 2024-2025: "ارتفاع خفيف" -> "على عتبة" -> "غير كافية لإستبعاد ASL-3".
- تمييز بين التطوير النسبي للمبتدئين والقدرة المطلقة للمتخصصين.
المشكلة
القدرة على الاستخدام المزدوج هي مشكلة القياس في إطار السلامة الحدودية لكل مختبر (الدرس 18). السؤال: هل النموذج X يقدم بشكل كبير قدرة المبتدئين على تسبب الأضرار الجماعية في علم الأحياء والكيمياء أو الإنترنت؟ القياس المباشر (تطلب من النموذج أن ينتج ضررًا فعليًا) غير قانوني وغير أخلاقي. قياس النظام الأساسي يحتاج إلى مقياس مقارنة لا يمكن أن يرفض النموذج (إعداد أرقام القدرة الصادقة) ولكن أسئلة التي ليست نفسها منشورات ضارة.
المفهوم
"المنطقة الصفراء"
أسئلة تتطلب معرفة عملية ضارة قريبة دون أن تكون وصفة تجميع مباشرة. "ما المفاعل الذي يحفز الخطوة 4 من [المركبة المنشورة]؟" وليس "كيف أجعلها [المادة الخطرة]؟" كل سؤال تم مراجعته من قبل خبراء متعددين في مجالات؛ تم تصفية مطابقة ITAR / EAR للسيطرة على الصادرات.
4157 سؤالًا إجماليًا:
- الأمن الحيوي: 1520
- الأمن السيبراني: 2225
- الكيمياء: 412
شكل متعدد الخيارات. النماذج تستجيب دون أن تطلب منها المساعدة بأي شيء؛ يمكن قياس القدرة دون أن تسبب سلوكًا ضارًا.
RMU التمثيل إساءة توجيه للانفصال عن التعلم
طريقة التخلّص من التعلم المرافقة. تطبق على LLaMa-2-7B، خفضت درجات WMDP إلى عشوائية تقريبًا مع الحفاظ على MMLU وغيرها من المعايير العامة للقدرة داخل بضع نقاط مئوية. الطريقة المنشورة هي خط أساسية للاستفادة من التعلم لكل ورقة لاستفادة من التعلم الحيوي الكيميائي الإلكتروني اللاحقة.
رواية 2024-2025
ثلاث مراحل:
- 2024 "mild uplift."أعلنت تقييمات OpenAI المبكرة والإعداد الإنساني / RSP عن مزايا صغيرة على البحث على الإنترنت للمبتدئين الذين يحاولون القيام بمهام بيولوجية. الإطار العام: النماذج الحدودية تساعد ، ولكن ليس أكثر بكثير من جوجل.
- April 2025 "on the cusp."أعلن إطار الاستعداد OpenAI v2 عن نماذج "على وشك مساعدة المبتدئين على خلق تهديدات بيولوجية معروفة بشكل ذي معنى". ليس دعوى قدرة تحذير من أن الحد الأدنى قريب.
- Anthropic's 2025 bioweapon-acquisition trial.دراسة مراقبة مع المشاركين المبتدئين، قياس النجاح النسبي في مهام مرحلة الاستحواذ. تم الإبلاغ عن ارتفاع 2.53x. غير كافية لاستبعاد ASL-3 (الدرس 18) يتم الوفاء أو الاقتراب من عتبة سياسة التوسع المسؤول لشركة Anthropic المستوى 3.
المبتدئين المتعلقة بمقابل الخبراء المطلقين
تمييز حاسم:
- Novice-relative uplift.كم يساعد النموذج غير الخبير؟ مضاعفة. الفائدة النسبية كبيرة لأن المبتدئين يعرفون القليل؛ حتى المعلومات المتواضعة تساعد.
- Expert-absolute capability.كم من المعلومات تنتج النموذج مع أقصى جهد؟ خبير يمكن استخراج أكثر من مبتدئ. السقف المطلق مرتفع.
قضايا السلامة (الدرس 18) تستهدف كل من: "النموذج لا يمكن أن يمنح المبتدئ ارتفاع كاف لتنفيذ" بالإضافة إلى "لا يمكن لخبير استخراج معلومات من النموذج التي لم يتم نشرها بالفعل".
خطورة القياس
WMDP هو استبدال للقدرات ، وليس قياس للتنفيذ. قد يكون نموذج يحصل على درجات عالية على WMDP أو لا يمكن استغلاله من قبل مبتدئ في الممارسة العملية ، اعتمادا على:
- مقاومة الإثارة (ما هو صعب الحصول على القدرة دون إطاحة مرشحات السلامة)
- المعرفة السرية (القدرة التي تتطلب مهارة مختبرات الرطب وليس المعلومات)
- الحواجز في التنفيذ (الاعتماد على المشتريات والمعدات)
إضافة تجربة اكتساب الأسلحة الحيوية من شركة أنثروبيك عام 2025 إلى طبقة التنفيذ للمبتدئين فوق قدرة WMDP: إنها تقيس نجاح المهمة الفعلية ، وليس قدرة الاختيار المتعدد.
حيث يتناسب هذا مع المرحلة 18
الدروس 12-16 هي الهجوم والأدوات الدفاعية على نتائج النموذج. الدروس 17 هي طبقة القدرة على الاستخدام المزدوج القياس الذي تقييمه إطاريات السلامة الحدودية (دروس 18) . الدروس 30 تغلق القوس مع أدلة رفع الحيوية / الكيميائية / الكيميائية / النووية الحالية 2026 .
استخدمها
code/main.pyيُبني حزمة تقييم تشكل WMDP. يتم اختبار نموذج مزيف على أسئلة متضمنة فئة؛ يتم تقرير النتيجة لكل نطاق. تدخل بسيط من عدم التعلم (ممثلة محددة للنطاق صفر) يقلل من النتيجة؛ يمكنك قياس التنازل ضد القدرة العامة.
أرسله
هذا الدرس يُنتجoutputs/skill-wmdp-eval.md. بالنظر إلى ادعاء إمكانية الاستخدام المزدوج ("النموذج الذي نمتله لا يساعد بشكل كبير في استخدام الأسلحة الحيوية") ، فإنه يفتتح: ما هي المعايير المرجعية التي تم تشغيلها، وما هي المسار الذي تم استخدامه للتقييم (التكمل الخام مقابل المحدد السياسي) ، وما إذا كانت دراسات التنفيذ للمبتدئين تكملة نتيجة الاختيار المتعدد.
التمارين
- أركض
code/main.py- تقرير دقة لكل مجال قبل وبعد خطوة إزالة التعلم من اللعبة. شرح التنازل عن القدرة العامة.
- قم بتعزيز اللعبة WMDP مع مجال رابع (مثل الإشعاع). حدد نوعي سؤالين مثاليين في المنطقة الصفراء. شرح لماذا صياغة مثل هذه الأسئلة أصعب من إضافة أسئلة على شكل MMLU.
- اقرأ WMDP 2024 القسم 5 (منهجية RMU). رسم نهج أبسط من عدم التعلم (على سبيل المثال، قمع العصبية العليا-k للمحتوى المجال) ووصف التكلفة المتوقعة للقدرة العامة.
- تقرير تجربة اكتساب الأسلحة الحيوية في Anthropic 2025 يبلغ عن ارتفاع 2.53x. وصف طريقتين يمكن أن يتم تحيز هذا الرقم إلى الأعلى (حجم العينة المبتدئة ، وفاء المهمة) واثنين إلى الأسفل (سقف الإجراءات ، ومدخلات السلامة النموذجي).
- حدد ما يتطلبه قضية السلامة لـ ASL-3 وراء تجاوز WMDP عن التعلم. أسماهما دراسات إثارة إضافية على الأقل.
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| WMDP | "the dual-use benchmark" | 4,157 MCQ questions across bio/cyber/chem in the yellow zone |
| Yellow zone | "enabling but not synthesis" | Proximate knowledge adjacent to harmful capability without being a synthesis recipe |
| RMU | "the unlearning baseline" | Representation Misdirection for Unlearning; reduces WMDP scores, preserves general capability |
| Novice-relative uplift | "how much it helps non-experts" | Multiplicative advantage over status-quo internet search for a novice |
| Expert-absolute capability | "ceiling for experts" | Maximum information extractable from the model by a motivated expert |
| Acquisition-phase task | "steps before synthesis" | Procurement, equipment, permits — the earliest parts of a harm pathway |
| ITAR/EAR | "export-control compliance" | Legal frameworks that constrain publishing certain enabling knowledge |
المزيد من القراءة
- Li et al. — The WMDP Benchmark (arXiv:2403.03218, ICML 2024) ورقة المراجعة ورقة RMU
- OpenAI — Preparedness Framework v2 (April 15, 2025) "على حافة" اللغة
- Anthropic — Responsible Scaling Policy v3.0 (February 2026) عتبة حيوية ASL-3 ونتائج تجارب الاستحواذ
- DeepMind — Frontier Safety Framework v3.0 (September 2025) كليات التحسين الحيوي
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.