ارزیابی WMDP و قابلیت استفاده دوگانه
Type: Learn
Languages: Python (stdlib, WMDP-shaped uplift evaluation harness)
Prerequisites: Phase 18 · 16 (red-team tooling), Phase 14 (agent engineering)
Time: ~60 minutes
اهداف یادگیری
- سه دامنه WMDP، تعداد سوال و معیار فیلتر "زون زرد" را توصیف کنید.
- RMU را توضیح دهید و توضیح دهید که چرا WMDP هم یک ارزیابی و هم یک معیار غیر یادگیری است.
- روایت بلند کردن سال 2024 تا 2025 را توصیف کنید: "توسع خفیف" -> "در آستانه" -> "نکفایت برای حذف ASL-3".
- ارتقاء نسبت به مبتدی از توانایی مطلق متخصص را تشخیص دهید.
مشکل
قابلیت استفاده دوگانه مشکل اندازه گیری در چارچوب ایمنی مرزی هر آزمایشگاه است (درسی 18). سوال: آیا مدل X توانایی مبتدی را برای ایجاد آسیب های گسترده در زیست شناسی، شیمی یا سایبری به طور قابل توجهی افزایش می دهد؟ اندازه گیری مستقیم (تغییر از مدل برای ایجاد آسیب) غیرقانونی و غیر اخلاقی است. اندازه گیری نماینده نیاز به یک معیار است که مدل نمی تواند انکار کند (برای تولید اعداد قابلیت صادقانه) اما که سوالات خود را به عنوان انتشارات مضر نیست.
مفهوم
"مناطق زرد"
سوالات که نیاز به نزدیک بودن، اجازه می دهد دانش یک فرآیند مضر بدون اینکه یک ترکیب مستقیم باشد. "چه واکنشگر مرحله 4 [راه منتشر شده] را کاتالیز می کند؟" نه "چگونه [مجموعه خطرناک] را تهیه می کنم؟" هر سوال توسط کارشناسان حوزه های مختلف بررسی شده؛ فیلتر شده برای رعایت ITAR / EAR کنترل صادرات.
۴۱۵۷ سوال در مجموع:
- ایمنی زیستی: 1520
- امنیت سایبری: 2225
- شیمی: 412
فرمت چند گزینه ای. مدل ها بدون اینکه از آنها خواسته شود کمک کنند پاسخ می دهند؛ توانایی را می توان بدون ایجاد رفتار مضر اندازه گیری کرد.
RMU نمایندگی اشتباه جهت بی یادگیری
روش غیر یادگیری همراه. به LLaMa-2-7B اعمال شده، نمرات WMDP را به طور تصادفی کاهش داد در حالی که MMLU و سایر معیار های توانایی عمومی را در عرض چند درصد حفظ کرد. روش منتشر شده پایه غیر یادگیری برای هر مقاله بیولوژیک شیمیایی بعدی غیر یادگیری سایبری است.
داستان بلندگویی سال 2024 تا 2025
سه مرحله:
- 2024 "mild uplift."ارزیابی های اولیه OpenAI و Anthropic Preparedness / RSP گزارش مزایای کوچک نسبت به جستجوی اینترنت برای مبتدیان که تلاش می کنند کارهای زیست محیطی انجام دهند. چارچوب عمومی: مدل های مرزی کمک می کنند، اما به طور قابل توجهی بیشتر از گوگل نیستند.
- April 2025 "on the cusp."چارچوب آماده سازی OpenAI v2 گزارش مدل ها "در حال کمک به مبتدی ها برای ایجاد تهدیدات بیولوژیکی شناخته شده است".
- Anthropic's 2025 bioweapon-acquisition trial.مطالعه کنترل شده با شرکت کنندگان مبتدی، موفقیت نسبی در وظایف مرحله ی دستیابی را اندازه گیری کرد. افزایش 2.53 برابر گزارش شده است. برای حذف ASL-3 (درسی 18) حد حد برای سیاست مقیاس پذیری مسئولانه Anthropic سطح 3 برآورده شده یا نزدیک شده است.
مبتدی نسبت به متخصص مطلق
فرق مهم:
- Novice-relative uplift.این مدل چقدر به یک متخصص غیر متخصص کمک می کند؟ چند برابر. این مزیت نسبی زیاد است زیرا مبتدی ها کم می دانند؛ حتی اطلاعات متواضع نیز کمک می کند.
- Expert-absolute capability.با حداکثر تلاش، مدل چقدر اطلاعات تولید می کند؟ یک متخصص می تواند بیشتر از یک مبتدی استخراج کند. سقف مطلق بالا است.
موارد ایمنی (درسه 18) هدف هر دو است: "نمونه نمی تواند یک مبتدی را به اندازه کافی ارتقا دهد تا اجرا کند" و "یک متخصص نمی تواند اطلاعات را از مدل که قبلا منتشر نشده است استخراج کند".
خطای اندازه گیری
WMDP یک استازی قابلیت است، نه یک اندازه گیری انتشار. یک مدل که امتیاز بالا در WMDP دارد ممکن است یا ممکن است توسط یک مبتدی در عمل مورد استفاده قرار گیرد، بسته به:
- مقاومت در برابر تحریک (چقدر سخت است که قابلیت را بدون ضربه زدن فیلترهای ایمنی خارج کنید)
- دانش ساکت (قدرت که نیاز به مهارت آزمایشگاهی در حالت رطوبت دارد، نه اطلاعات)
- موانع اجرا (خرید، تجهیزات)
آزمایش اکایابی سلاح های زیستی Anthropic در سال 2025 لایه ایجاد مبتدی را بر روی قابلیت های سبک WMDP اضافه می کند: موفقیت واقعی وظیفه را اندازه گیری می کند، نه توانایی چند گزینه ای.
جایی که این در مرحله 18 قرار داره
درس 12-16 ابزار حمله و دفاعی در تولیدات مدل است. درس 17 لایه قابلیت دوگانه استفاده است اندازه گیری که چارچوب های ایمنی مرزی (درس 18) ارزیابی می کنند. درس 30 با شواهد فعلی 2026 سایبر / بیو / کیمیا / هسته ای ، قوس را می پوشاند.
ازش استفاده کن
code/main.pyیک مدل جعلی در سوالات مربوط به دسته بندی آزمایش می شود؛ امتیازات در هر دامنه گزارش می شود. یک مداخله ساده بی یادگیری (نمایه گذاری خاص دامنه صفر) امتیازات را کاهش می دهد؛ می توانید تعادل را با توانایی های عمومی اندازه گیری کنید.
-باده
این درس به ما کمک می کندoutputs/skill-wmdp-eval.mdبا توجه به ادعای قابلیت دوگانه استفاده ("نموذج ما به طور معنی ای در مورد سلاح های زیستی کمک نمی کند") ، بررسی می کند: کدام معیار های مرجع انجام شده، کدام مسیر رد برای ارزیابی استفاده شده است (تکمیل خام در مقابل سیاست) و آیا مطالعات ابتدایی برای ایجاد نتیجه چند انتخاب تکمیل می شود.
تمرینات
- فرار کن
code/main.py. گزارش دقت هر دامنه قبل و بعد از مرحله بی یادگیری بازی. توضیح دادن تعادل قابلیت های عمومی.
- WMDP را با یک دامنه چهارم (به عنوان مثال رادیولوژی) افزایش دهید. دو نوع سوال تصویری را در منطقه زرد مشخص کنید. توضیح دهید که چرا ایجاد چنین سوالات سخت تر از اضافه کردن سوالات به شکل MMLU است.
- بخش 5 (منهاد RMU) WMDP 2024 را بخوانید. یک رویکرد ساده تر از یادگیری را نشان دهید (به عنوان مثال، از سلول های عصبی top-k برای محتوای دامنه جلوگیری کنید) و هزینه های قابل انتظار قابلیت عمومی آن را توصیف کنید.
- آزمایش اکای سلاح های زیستی Anthropic 2025 گزارش 2.53x افزایش را نشان می دهد. دو راه را توصیف کنید که این عدد می تواند به سمت بالا (حجم نمونه مبتدی، وفاداری وظیفه) و دو راه به سمت پایین (سقف تولید، گات ایمنی مدل) تغییر کند.
- توضیح دهید که یک مورد ایمنی برای ASL-3 فراتر از گذر از WMDP غیر یادگیری چه نیاز دارد. حداقل دو مطالعه تکمیلی را نام ببرید.
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| WMDP | "the dual-use benchmark" | 4,157 MCQ questions across bio/cyber/chem in the yellow zone |
| Yellow zone | "enabling but not synthesis" | Proximate knowledge adjacent to harmful capability without being a synthesis recipe |
| RMU | "the unlearning baseline" | Representation Misdirection for Unlearning; reduces WMDP scores, preserves general capability |
| Novice-relative uplift | "how much it helps non-experts" | Multiplicative advantage over status-quo internet search for a novice |
| Expert-absolute capability | "ceiling for experts" | Maximum information extractable from the model by a motivated expert |
| Acquisition-phase task | "steps before synthesis" | Procurement, equipment, permits — the earliest parts of a harm pathway |
| ITAR/EAR | "export-control compliance" | Legal frameworks that constrain publishing certain enabling knowledge |
خواندن بیشتر
- Li et al. — The WMDP Benchmark (arXiv:2403.03218, ICML 2024) مقادیر مرجع و ورق RMU
- OpenAI — Preparedness Framework v2 (April 15, 2025) زبان "در حاشیه"
- Anthropic — Responsible Scaling Policy v3.0 (February 2026) آستانه بیولوژیکی ASL-3 و نتایج آزمایش های خرید
- DeepMind — Frontier Safety Framework v3.0 (September 2025) CCL با افزایش زیست شناسی
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.