گروه قرمز: حملات PAIR و خودکار
Type: Build
Languages: Python (stdlib, mock PAIR loop against a toy target)
Prerequisites: Phase 18 · 01 (instruction-following), Phase 14 (agent engineering)
Time: ~75 minutes
اهداف یادگیری
- الگوریتم PAIR را شرح دهید: سریع سیستم حمله کننده، اصلاح تکراری، بازخورد در زمینه.
- توضیح دهید که چرا PAIR در صورت هدف کردن جعبه سیاه، به طور دقیق کارآمدتر از GCG است.
- چهار خط پایه حمله خودکار دیگر (GCG، AutoDAN، TAP، PAP) را نام دهید و یک ویژگی متمایز برای هر یک از آنها را ذکر کنید.
- پروتکل های ارزیابی JailbreakBench و HarmBench را توصیف کنید و "سرمایه موفقیت حمله" در هر یک از آنها چه معنایی دارد.
مشکل
گروه قرمز قبلا یک فعالیت دستی بود. تعداد کمی از آزمایش کنندگان متخصص پیام های مخالف را ساختند و ردیابی کردند که کدام آنها کار می کردند. این مقیاس ندارد: نرخ موفقیت حمله به یک نمونه آماری نیاز دارد و هدف با هر نسخه مدل یک هدف متحرک است. PAIR گروه قرمز را به عنوان یک مشکل بهینه سازی با هدف جعبه سیاه عملیاتی می کند.
مفهوم
الگوریتم PAIR
ورودی:
- هدف LLM T (نمونه ای که ما حمله می کنیم)
- قاضی LLM J (در نتیجه پاسخ به یک پاسخ به jailbreak می باشد یا خیر)
- مهاجم LLM A (تعمیر کننده تیم قرمز)
- خط هدف G: "به [توجیه های مضر] پاسخ بده".
- بودجه K (معمولا 20 سوال)
لوپ، برای k در 1..K:
- A با هدف G و تاریخچه زوج های (سرعتی، پاسخ) تا کنون به دنبال می شود.
- A یک پیام جدید ارسال می کند.
- ارسال p_k به T؛ دریافت پاسخ r_k.
- ج امتیاز (p_k, r_k) در گل.
- اگر امتیاز >= حد، توقف jailbreak یافت.
- در غیر این صورت، (p_k، r_k) را به تاریخچه A اضافه کنید؛ ادامه دهید.
نتیجه تجربی (NeurIPS 2023): > 50% میزان موفقیت حمله در برابر GPT-3.5-توربو، Llama-2-7B-chat؛ متوسط سوالات موفقیت در محدوده 10-20.
چرا PAIR موثر است
GCG (Zou et al. 2023) به دنبال دنباله های متناقض توکن را به حسب گرادینت جستجو می کند؛ این نیاز به دسترسی به مدل جعبه سفید دارد و دنباله های غیر قابل خواندن را تولید می کند. PAIR جعبه سیاه است و حملات زبانی طبیعی را که در میان مدل ها انتقال می دهند تولید می کند. بازخورد در زمینه PAIR اجازه می دهد تا مهاجم از هر رد یاد بگیرد؛ GCG هیچ معادل (هر بروزرسانی توکن جدید باید پیشرفت قبلی را دوباره کشف کند) ندارد.
حملات خودکار مرتبط
- GCG (Zou et al. 2023, arXiv:2307.15043).جستجوی گرادینتی سطح توکن برای ضمیمهای مخالف. جعبه سفید، قابل انتقال، رشته های غیر قابل خواندن را تولید می کند.
- AutoDAN (Liu et al. 2023).جستجوی تکامل یافته در مورد پیامد ها، با هدایت یک هدف سلسله مراتبی.
- TAP (Mehrotra et al. 2024).درخت حمله با برش شاخه های چند طرح PAIR
- PAP (Zeng et al. 2024).پیام های ضد قانع کننده تکنیک های قانع کننده انسانی را به عنوان قالب های فوری رمزگذاری می کند.
"جيلبرک" و "هارم"
هر دو (2024) ارزیابی استاندارد:
- JailbreakBench (arXiv:2404.01318). 100 رفتار مضر در 10 دسته از سیاست های OpenAI. نرخ موفقیت حمله (ASR) به عنوان متریک اصلی. نیاز به یک قاضی (GPT-4-turbo، Llama Guard یا StrongREJECT) دارد.
- HarmBench (Mazeika و همکاران 2024). 510 رفتار در 7 دسته، با آزمایش های آسیب معنوی و عملکردی. مقایسه 18 حمله با 33 مدل.
ASR معمولاً با بودجه ی ثابت جستجو گزارش می شود. مقایسه حملات نیازمند تطابق بودجه ها است؛ ASR 90٪ در 200 جستجو قابل مقایسه با ASR 85٪ در 20 نیست.
دلیل اهمیت آن برای انتشار 2026
هر آزمایشگاه مرزی در حال حاضر با مدل های تولید قبل از انتشار PAIR و TAP را اجرا می کند. مسیرهای ASR در کارت های مدل (درس 26) و ضمیمه های مورد ایمنی (درس 18) ظاهر می شوند. حمله غریبی نیست این زیرساخت استاندارد است.
جایی که این در مرحله 18 قرار داره
درس 12 پایه ی حمله خودکار است. درس 13 (Jailbreaking Multi-Shot) یک بهره برداری طولانی مکمل است. درس 14 (ASCII Art / Visual) یک حمله کدگذاری است. درس 15 (Indirect Prompt Injection) سطح حمله تولید 2026 است. درس 16 بر همتایان ابزار دفاعی (Llama Guard, Garak, PyRIT) پوشش می دهد.
ازش استفاده کن
code/main.pyهدف یک طبقه بندی کننده جعلی است که از پیام های مضر "بیداری" (فلتور کلمات کلیدی) رد می کند. مهاجم یک پالایشگر مبتنی بر قوانین است که سعی می کند پارافرز، فریمینگ نقش و کدگذاری را انجام دهد. قاضی پاسخ را نمره می دهد. شما می بینید که مهاجم در ~5-15 تکرار در برابر فیلتر کلمات کلیدی موفق می شود و در برابر فیلتر معنوی شکست می خورد.
-باده
این درس به ما کمک می کندoutputs/skill-attack-audit.md. در نظر گرفتن گزارش ارزیابی گروه قرمز، آن را بررسی می کند: چه حملات انجام شده (PAIR، GCG، TAP، AutoDAN، PAP) ، هر کدام با چه بودجه، با چه قاضی، که در چه رفتار مضر تنظیم شده (JailbreakBench، HarmBench، داخلی).
تمرینات
- فرار کن
code/main.py. اندازه گیری متوسط سوالات برای موفقیت برای سه استراتژی مهاجم داخلی . توضیح دهید که هر یک از آنها چه فرضیه دفاعی هدف را به کار می گیرد .
- پیاده سازی یک استراتژی حمله کننده چهارم (به عنوان مثال ترجمه به زبان دیگر، کدگذاری base64) گزارش متوسط جدید سوالات موفقیت در برابر هدف فیلتر کلمات کلیدی و هدف فیلتر معنوی.
- Chao et al. 2023 شکل 5 (PAR vs GCG مقایسه) را بخوانید. دو سناریو را توصیف کنید که GCG با وجود مزیت بهره وری PAIR ترجیح داده می شود.
- JailbreakBench ASR را در برابر یک هدف ثابت گزارش می دهد. یک متریک اضافی طراحی کنید که تنوع حمله را اندازه گیری کند (تغییر در پیام های موفق). توضیح دهید که چرا تنوع برای ارزیابی دفاع مهم است.
- TAP (Mehrotra 2024) PAIR را با شاخه بندی + برش گسترش می دهد. یک تمدید سبک TAP را به
code/main.pyو مقایسه هزینه های محاسباتی با نرخ موفقیت را توصیف کنید.
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| PAIR | "automated jailbreak" | Prompt Automatic Iterative Refinement; attacker-LLM + judge-LLM loop |
| GCG | "gradient jailbreak" | White-box token-level gradient search for adversarial suffixes |
| Attack success rate (ASR) | "% jailbreaks at k queries" | Primary metric; must be reported with query budget and judge identity |
| Judge LLM | "the scorer" | LLM that grades whether a response satisfies the harmful goal |
| JailbreakBench | "the evaluation" | Standardized harmful-behaviour set with tagged categories |
| HarmBench | "the broader bench" | 510 behaviours, functional + semantic harm tests |
| TAP | "tree of attacks" | PAIR with branching + pruning; better ASR at higher compute |
خواندن بیشتر
- Chao et al. — Jailbreaking Black Box LLMs in Twenty Queries (arXiv:2310.08419) مقاله "پایر" ، "نور آیپس 2023"
- Zou et al. — Universal and Transferable Adversarial Attacks on Aligned LLMs (arXiv:2307.15043) کاغذ GCG
- Chao et al. — JailbreakBench (arXiv:2404.01318) ارزیابی استاندارد
- Mazeika et al. — HarmBench (ICML 2024) ارزیابی گسترده تر
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.