WMDP और दोहरे उपयोग की क्षमता मूल्यांकन
Type: Learn
Languages: Python (stdlib, WMDP-shaped uplift evaluation harness)
Prerequisites: Phase 18 · 16 (red-team tooling), Phase 14 (agent engineering)
Time: ~60 minutes
सीखने के लक्ष्य
- WMDP के तीन डोमेन, प्रश्न गणना और "पीले क्षेत्र" फ़िल्टर मानदंड का वर्णन करें।
- आरएमयू को समझाएं और क्यों WMDP एक मूल्यांकन और एक अनलर्निंग बेंचमार्क दोनों है।
- 2024-2025 के उदय की कथा का वर्णन करेंः "हल्के उदय" -> "अंत में" -> "ASL-3 को बाहर करने के लिए अपर्याप्त है। "
- नवशिकियों के लिए अपेक्षाकृत उच्च स्तर की क्षमता और विशेषज्ञों के लिए पूर्ण क्षमता का अंतर करना।
समस्या
दोहरे उपयोग की क्षमता प्रत्येक प्रयोगशाला के सीमा सुरक्षा ढांचे के तहत माप समस्या है (पाठ 18) । प्रश्नः क्या मॉडल एक्स बायो, केमिकल या साइबर में बड़े पैमाने पर नुकसान पहुंचाने की नौसिखिया क्षमता को काफी हद तक बढ़ाता है? प्रत्यक्ष माप (मॉडल से नुकसान पैदा करने के लिए कहें) अवैध और अनैतिक है। प्रॉक्सी मापने के लिए एक बेंचमार्क की आवश्यकता होती है जो मॉडल मना नहीं कर सकता (सच्चे क्षमता संख्याओं का उत्पादन करने के लिए) लेकिन जिनके प्रश्न स्वयं हानिकारक प्रकाशन नहीं हैं।
अवधारणा
"पीला क्षेत्र"
"क्या अभिकर्मक [प्रकाशित पथ] के चरण 4 को उत्प्रेरक करता है? " नहीं "मैं [खतरनाक यौगिक] कैसे बनाऊं? " प्रत्येक प्रश्न की समीक्षा कई डोमेन विशेषज्ञों द्वारा की गई; आईटीएआर / ईएआर निर्यात नियंत्रण अनुपालन के लिए फ़िल्टर किया गया।
कुल 4,157 प्रश्न:
- जैव सुरक्षा: 1,520
- साइबर सुरक्षा: 2,225
- रसायन विज्ञान: 412
बहुविकल्पीय प्रारूप। मॉडल बिना किसी सहायता के जवाब देते हैं; हानिकारक व्यवहार के बिना क्षमता को मापा जा सकता है।
RMU अपरक्षा के लिए प्रतिनिधित्व गलत दिशा
साथ में अनलर्निंग विधि. एलएएमए-2-7बी पर लागू, एमएमडीपी स्कोर को लगभग यादृच्छिक तक कम किया गया जबकि एमएमएलयू और अन्य सामान्य क्षमता बेंचमार्क कुछ प्रतिशत अंक के भीतर बनाए रखा गया। प्रकाशित विधि प्रत्येक बाद के जैव रसायन-साइबर अनलर्निंग पेपर के लिए अनलर्निंग बेसलाइन है।
2024-2025 की ऊंचाइयों की कथा
तीन चरण:
- 2024 "mild uplift."शुरुआती ओपनएआई और मानव तैयारी / आरएसपी मूल्यांकन में जैव-समीप कार्य करने वाले नौसिखियों के लिए इंटरनेट खोज के मुकाबले छोटे फायदे की सूचना दी गई। सार्वजनिक ढांचाः सीमा मॉडल मदद करते हैं, लेकिन Google से काफी अधिक नहीं।
- April 2025 "on the cusp."ओपनएआई के तैयारी ढांचे v2 में मॉडल "अर्थात् नवशिकियों को ज्ञात जैविक खतरों को बनाने में मदद करने के कगार पर" रिपोर्ट की गई थी।
- Anthropic's 2025 bioweapon-acquisition trial.आरंभिक प्रतिभागियों के साथ नियंत्रित अध्ययन, अधिग्रहण चरण कार्यों में सापेक्ष सफलता को मापा गया। 2.53x वृद्धि की रिपोर्ट की गई। ASL-3 (पाठ 18) को बाहर करने के लिए अपर्याप्त मानव संसाधन की जिम्मेदार स्केलिंग नीति स्तर 3 के लिए सीमांकन स्तर को पूरा या करीब आ गया है।
नवजात-सापेक्ष बनाम विशेषज्ञ-असली
एक महत्वपूर्ण अंतरः
- Novice-relative uplift.एक नॉन-एक्सपर्ट के लिए मॉडल कितना उपयोगी है? गुणात्मक। सापेक्ष लाभ बहुत अधिक है क्योंकि नौसिखिए बहुत कम जानते हैं; यहां तक कि मामूली जानकारी भी मदद करती है।
- Expert-absolute capability.एक विशेषज्ञ एक नौसिखिया से अधिक निकाल सकता है। पूर्ण छत उच्च है।
सुरक्षा मामलों (पाठ 18) दोनों को लक्षित करते हैंः "मॉडल एक नौसिखिया को निष्पादित करने के लिए पर्याप्त वृद्धि नहीं दे सकता है" और "एक विशेषज्ञ मॉडल से जानकारी नहीं निकाल सकता है जो पहले से प्रकाशित नहीं हुई है।"
माप की फंदा
WMDP एक क्षमता प्रॉक्सी है, न कि एक तैनाती माप। एक मॉडल जो WMDP पर उच्च स्कोर करता है, अभ्यास में एक नौसिखिया द्वारा शोषण योग्य हो सकता है या नहीं हो सकता है, इस पर निर्भर करता हैः
- उत्तेजना प्रतिरोध (सुरक्षा फ़िल्टर को ट्रिप किए बिना क्षमता को बाहर निकालना कितना कठिन है)
- चुपके ज्ञान (सक्षमता जिसके लिए गीले प्रयोगशाला कौशल की आवश्यकता होती है, सूचना नहीं)
- निष्पादन बाधाएँ (खरीद, उपकरण)
एंथ्रोपिक के 2025 जैव हथियार अधिग्रहण परीक्षण में WMDP-शैली क्षमता के शीर्ष पर नौसिखिया-उत्पादन परत जोड़ी गई हैः यह वास्तविक कार्य सफलता को मापता है, न कि बहु-विकल्प क्षमता।
जहां यह चरण 18 में फिट बैठता है
पाठ 12-16 मॉडल आउटपुट पर हमले और रक्षा उपकरण हैं। पाठ 17 दोहरे उपयोग क्षमता परत है सीमा सुरक्षा ढांचे (पाठ 18) द्वारा मूल्यांकन किए जाने वाले माप। पाठ 30 वर्तमान 2026 साइबर / बायो / केमिकल / परमाणु उछाल के साक्ष्य के साथ आर्क को बंद करता है।
इसका प्रयोग करें
code/main.pyएक खेलौना WMDP के आकार में मूल्यांकन हर्नस बनाता है। एक नकली मॉडल श्रेणी-बिन किए गए प्रश्नों पर परीक्षण किया जाता है; प्रति डोमेन स्कोर रिपोर्ट किए जाते हैं। एक सरल अनलर्निंग हस्तक्षेप (शून्य आउट डोमेन-विशिष्ट प्रतिनिधित्व) स्कोर कम करता है; आप सामान्य क्षमता के खिलाफ व्यापार को माप सकते हैं।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-wmdp-eval.md. दोहरे उपयोग क्षमता के दावे को देखते हुए ("हमारा मॉडल जैव हथियारों के साथ सार्थक रूप से मदद नहीं करता है"), यह लेखा परीक्षा करता हैः कौन से बेंचमार्क चलाए गए थे, मूल्यांकन के लिए किस अस्वीकृति पथ का उपयोग किया गया था (कच्चे पूर्णता बनाम नीति-गॉट), और क्या नौसिखिया-उत्पादन अध्ययन बहु-विकल्प परिणाम को पूरक करते हैं।
व्यायाम
- दौड़ें
code/main.pyखेलौना सीखने से पहले और बाद में प्रति डोमेन सटीकता की रिपोर्ट करें। सामान्य क्षमता के बीच व्यापार-बदला को समझाएं।
- चौथे डोमेन (जैसे, रेडियोलॉजिकल) के साथ खिलौना WMDP को बढ़ाएं। पीले क्षेत्र में दो चित्रात्मक प्रश्न प्रकार निर्दिष्ट करें। समझाएं कि ऐसे प्रश्नों को बनाने में MMLU-आकार के प्रश्नों को जोड़ने से क्यों कठिन है।
- WMDP 2024 सेक्शन 5 (RMU पद्धति) पढ़ें। एक सरल अनलर्निंग दृष्टिकोण (जैसे, डोमेन सामग्री के लिए शीर्ष-के न्यूरॉन्स को दबाएं) का स्केच दें और इसकी अपेक्षित सामान्य क्षमता लागत का वर्णन करें।
- मानव 2025 के जैव हथियार अधिग्रहण परीक्षण में 2.53 गुना वृद्धि की रिपोर्ट है। दो तरीकों का वर्णन करें कि इस संख्या को ऊपर (नवीन नमूना आकार, कार्य निष्ठा) और दो नीचे (उत्पादन छत, मॉडल सुरक्षा गेटिंग) के लिए पक्षपात किया जा सकता है।
- एएसएल-3 के लिए सुरक्षा मामले के लिए डब्ल्यूएमडीपी के निष्काम होने के अलावा क्या आवश्यक है, इसका वर्णन करें। कम से कम दो पूरक उत्प्रेरणा अध्ययनों का नाम दें।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| WMDP | "the dual-use benchmark" | 4,157 MCQ questions across bio/cyber/chem in the yellow zone |
| Yellow zone | "enabling but not synthesis" | Proximate knowledge adjacent to harmful capability without being a synthesis recipe |
| RMU | "the unlearning baseline" | Representation Misdirection for Unlearning; reduces WMDP scores, preserves general capability |
| Novice-relative uplift | "how much it helps non-experts" | Multiplicative advantage over status-quo internet search for a novice |
| Expert-absolute capability | "ceiling for experts" | Maximum information extractable from the model by a motivated expert |
| Acquisition-phase task | "steps before synthesis" | Procurement, equipment, permits — the earliest parts of a harm pathway |
| ITAR/EAR | "export-control compliance" | Legal frameworks that constrain publishing certain enabling knowledge |
आगे पढ़ना
- Li et al. — The WMDP Benchmark (arXiv:2403.03218, ICML 2024) बेंचमार्क और आरएमयू पेपर
- OpenAI — Preparedness Framework v2 (April 15, 2025) "कमी पर" भाषा
- Anthropic — Responsible Scaling Policy v3.0 (February 2026) एएसएल-3 जैव सीमा और अधिग्रहण परीक्षण के परिणाम
- DeepMind — Frontier Safety Framework v3.0 (September 2025) जैव-उत्कासन सीसीएल
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.