Phase 18: Ethics, Safety & Alignment

WMDP और दोहरे उपयोग की क्षमता मूल्यांकन

लि और अन्य, "डब्ल्यूएमडीपी बेंचमार्कः अनलर्निंग के साथ दुर्भावनापूर्ण उपयोग को मापना और कम करना" (ICML 2024, arXiv:2403.03218). जैव सुरक्षा (1,520), साइबर सुरक्षा (2,225) और रसायन विज्ञान (412) पर 4,157 बहुविकल्पीय प्रश्न। प्रश्न "पीले क्षेत्र" में कार्य करते हैं निकट ज्ञान सक्षम करने वाले प्रश्न, बहु-विशेषज्ञ समीक्षा और ITAR/EAR कानूनी अनुपालन द्वारा फ़िल्टर किए जाते हैं। दोहरे उद्देश्यः दोहरे उपयोग क्षमता का प्रॉक्सी मूल्यांकन, और अनलर्निंग बेंचमार्क (सहायक आरएमयू विधि सामान्य क्षमता को बनाए रखते हुए डब्ल्यूएमडीपी प्रदर्शन को कम करती है) । 2024-2025 फील्ड कथाः शुरुआती ओपनएआई / एंथ्रोपिक 2024 मूल्यांकन में इंटरनेट खोज पर "हल्के वृद्धि" की सूचना दी गई; अप्रैल 2025 तक, ओपनएआई के तैयारी ढांचे v2 ने कहा कि मॉडल "नवीन लोगों को ज्ञात जैविक खतरों को बनाने में सार्थक रूप से मदद करने की शुरुआत में हैं।" एंथ्रोपिक के जैविक हथियार अधिग्रहण परीक्षण में 2.53 गुना वृद्धि हुई, जो एएसएल -3 को बाहर करने के लिए पर्याप्त नहीं है।

Type: Learn

Languages: Python (stdlib, WMDP-shaped uplift evaluation harness)

Prerequisites: Phase 18 · 16 (red-team tooling), Phase 14 (agent engineering)

Time: ~60 minutes

सीखने के लक्ष्य

  • WMDP के तीन डोमेन, प्रश्न गणना और "पीले क्षेत्र" फ़िल्टर मानदंड का वर्णन करें।
  • आरएमयू को समझाएं और क्यों WMDP एक मूल्यांकन और एक अनलर्निंग बेंचमार्क दोनों है।
  • 2024-2025 के उदय की कथा का वर्णन करेंः "हल्के उदय" -> "अंत में" -> "ASL-3 को बाहर करने के लिए अपर्याप्त है। "
  • नवशिकियों के लिए अपेक्षाकृत उच्च स्तर की क्षमता और विशेषज्ञों के लिए पूर्ण क्षमता का अंतर करना।

समस्या

दोहरे उपयोग की क्षमता प्रत्येक प्रयोगशाला के सीमा सुरक्षा ढांचे के तहत माप समस्या है (पाठ 18) । प्रश्नः क्या मॉडल एक्स बायो, केमिकल या साइबर में बड़े पैमाने पर नुकसान पहुंचाने की नौसिखिया क्षमता को काफी हद तक बढ़ाता है? प्रत्यक्ष माप (मॉडल से नुकसान पैदा करने के लिए कहें) अवैध और अनैतिक है। प्रॉक्सी मापने के लिए एक बेंचमार्क की आवश्यकता होती है जो मॉडल मना नहीं कर सकता (सच्चे क्षमता संख्याओं का उत्पादन करने के लिए) लेकिन जिनके प्रश्न स्वयं हानिकारक प्रकाशन नहीं हैं।

अवधारणा

"पीला क्षेत्र"

"क्या अभिकर्मक [प्रकाशित पथ] के चरण 4 को उत्प्रेरक करता है? " नहीं "मैं [खतरनाक यौगिक] कैसे बनाऊं? " प्रत्येक प्रश्न की समीक्षा कई डोमेन विशेषज्ञों द्वारा की गई; आईटीएआर / ईएआर निर्यात नियंत्रण अनुपालन के लिए फ़िल्टर किया गया।

कुल 4,157 प्रश्न:

  • जैव सुरक्षा: 1,520
  • साइबर सुरक्षा: 2,225
  • रसायन विज्ञान: 412

बहुविकल्पीय प्रारूप। मॉडल बिना किसी सहायता के जवाब देते हैं; हानिकारक व्यवहार के बिना क्षमता को मापा जा सकता है।

RMU अपरक्षा के लिए प्रतिनिधित्व गलत दिशा

साथ में अनलर्निंग विधि. एलएएमए-2-7बी पर लागू, एमएमडीपी स्कोर को लगभग यादृच्छिक तक कम किया गया जबकि एमएमएलयू और अन्य सामान्य क्षमता बेंचमार्क कुछ प्रतिशत अंक के भीतर बनाए रखा गया। प्रकाशित विधि प्रत्येक बाद के जैव रसायन-साइबर अनलर्निंग पेपर के लिए अनलर्निंग बेसलाइन है।

2024-2025 की ऊंचाइयों की कथा

तीन चरण:

  1. 2024 "mild uplift."शुरुआती ओपनएआई और मानव तैयारी / आरएसपी मूल्यांकन में जैव-समीप कार्य करने वाले नौसिखियों के लिए इंटरनेट खोज के मुकाबले छोटे फायदे की सूचना दी गई। सार्वजनिक ढांचाः सीमा मॉडल मदद करते हैं, लेकिन Google से काफी अधिक नहीं।
  1. April 2025 "on the cusp."ओपनएआई के तैयारी ढांचे v2 में मॉडल "अर्थात् नवशिकियों को ज्ञात जैविक खतरों को बनाने में मदद करने के कगार पर" रिपोर्ट की गई थी।
  1. Anthropic's 2025 bioweapon-acquisition trial.आरंभिक प्रतिभागियों के साथ नियंत्रित अध्ययन, अधिग्रहण चरण कार्यों में सापेक्ष सफलता को मापा गया। 2.53x वृद्धि की रिपोर्ट की गई। ASL-3 (पाठ 18) को बाहर करने के लिए अपर्याप्त मानव संसाधन की जिम्मेदार स्केलिंग नीति स्तर 3 के लिए सीमांकन स्तर को पूरा या करीब आ गया है।

नवजात-सापेक्ष बनाम विशेषज्ञ-असली

एक महत्वपूर्ण अंतरः

  • Novice-relative uplift.एक नॉन-एक्सपर्ट के लिए मॉडल कितना उपयोगी है? गुणात्मक। सापेक्ष लाभ बहुत अधिक है क्योंकि नौसिखिए बहुत कम जानते हैं; यहां तक कि मामूली जानकारी भी मदद करती है।
  • Expert-absolute capability.एक विशेषज्ञ एक नौसिखिया से अधिक निकाल सकता है। पूर्ण छत उच्च है।

सुरक्षा मामलों (पाठ 18) दोनों को लक्षित करते हैंः "मॉडल एक नौसिखिया को निष्पादित करने के लिए पर्याप्त वृद्धि नहीं दे सकता है" और "एक विशेषज्ञ मॉडल से जानकारी नहीं निकाल सकता है जो पहले से प्रकाशित नहीं हुई है।"

माप की फंदा

WMDP एक क्षमता प्रॉक्सी है, न कि एक तैनाती माप। एक मॉडल जो WMDP पर उच्च स्कोर करता है, अभ्यास में एक नौसिखिया द्वारा शोषण योग्य हो सकता है या नहीं हो सकता है, इस पर निर्भर करता हैः

  • उत्तेजना प्रतिरोध (सुरक्षा फ़िल्टर को ट्रिप किए बिना क्षमता को बाहर निकालना कितना कठिन है)
  • चुपके ज्ञान (सक्षमता जिसके लिए गीले प्रयोगशाला कौशल की आवश्यकता होती है, सूचना नहीं)
  • निष्पादन बाधाएँ (खरीद, उपकरण)

एंथ्रोपिक के 2025 जैव हथियार अधिग्रहण परीक्षण में WMDP-शैली क्षमता के शीर्ष पर नौसिखिया-उत्पादन परत जोड़ी गई हैः यह वास्तविक कार्य सफलता को मापता है, न कि बहु-विकल्प क्षमता।

जहां यह चरण 18 में फिट बैठता है

पाठ 12-16 मॉडल आउटपुट पर हमले और रक्षा उपकरण हैं। पाठ 17 दोहरे उपयोग क्षमता परत है सीमा सुरक्षा ढांचे (पाठ 18) द्वारा मूल्यांकन किए जाने वाले माप। पाठ 30 वर्तमान 2026 साइबर / बायो / केमिकल / परमाणु उछाल के साक्ष्य के साथ आर्क को बंद करता है।

इसका प्रयोग करें

code/main.pyएक खेलौना WMDP के आकार में मूल्यांकन हर्नस बनाता है। एक नकली मॉडल श्रेणी-बिन किए गए प्रश्नों पर परीक्षण किया जाता है; प्रति डोमेन स्कोर रिपोर्ट किए जाते हैं। एक सरल अनलर्निंग हस्तक्षेप (शून्य आउट डोमेन-विशिष्ट प्रतिनिधित्व) स्कोर कम करता है; आप सामान्य क्षमता के खिलाफ व्यापार को माप सकते हैं।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-wmdp-eval.md. दोहरे उपयोग क्षमता के दावे को देखते हुए ("हमारा मॉडल जैव हथियारों के साथ सार्थक रूप से मदद नहीं करता है"), यह लेखा परीक्षा करता हैः कौन से बेंचमार्क चलाए गए थे, मूल्यांकन के लिए किस अस्वीकृति पथ का उपयोग किया गया था (कच्चे पूर्णता बनाम नीति-गॉट), और क्या नौसिखिया-उत्पादन अध्ययन बहु-विकल्प परिणाम को पूरक करते हैं।

व्यायाम

  1. दौड़ेंcode/main.pyखेलौना सीखने से पहले और बाद में प्रति डोमेन सटीकता की रिपोर्ट करें। सामान्य क्षमता के बीच व्यापार-बदला को समझाएं।
  1. चौथे डोमेन (जैसे, रेडियोलॉजिकल) के साथ खिलौना WMDP को बढ़ाएं। पीले क्षेत्र में दो चित्रात्मक प्रश्न प्रकार निर्दिष्ट करें। समझाएं कि ऐसे प्रश्नों को बनाने में MMLU-आकार के प्रश्नों को जोड़ने से क्यों कठिन है।
  1. WMDP 2024 सेक्शन 5 (RMU पद्धति) पढ़ें। एक सरल अनलर्निंग दृष्टिकोण (जैसे, डोमेन सामग्री के लिए शीर्ष-के न्यूरॉन्स को दबाएं) का स्केच दें और इसकी अपेक्षित सामान्य क्षमता लागत का वर्णन करें।
  1. मानव 2025 के जैव हथियार अधिग्रहण परीक्षण में 2.53 गुना वृद्धि की रिपोर्ट है। दो तरीकों का वर्णन करें कि इस संख्या को ऊपर (नवीन नमूना आकार, कार्य निष्ठा) और दो नीचे (उत्पादन छत, मॉडल सुरक्षा गेटिंग) के लिए पक्षपात किया जा सकता है।
  1. एएसएल-3 के लिए सुरक्षा मामले के लिए डब्ल्यूएमडीपी के निष्काम होने के अलावा क्या आवश्यक है, इसका वर्णन करें। कम से कम दो पूरक उत्प्रेरणा अध्ययनों का नाम दें।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
WMDP"the dual-use benchmark"4,157 MCQ questions across bio/cyber/chem in the yellow zone
Yellow zone"enabling but not synthesis"Proximate knowledge adjacent to harmful capability without being a synthesis recipe
RMU"the unlearning baseline"Representation Misdirection for Unlearning; reduces WMDP scores, preserves general capability
Novice-relative uplift"how much it helps non-experts"Multiplicative advantage over status-quo internet search for a novice
Expert-absolute capability"ceiling for experts"Maximum information extractable from the model by a motivated expert
Acquisition-phase task"steps before synthesis"Procurement, equipment, permits — the earliest parts of a harm pathway
ITAR/EAR"export-control compliance"Legal frameworks that constrain publishing certain enabling knowledge

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.