Phase 18: Ethics, Safety & Alignment

گروه قرمز: حملات PAIR و خودکار

چاو، روبی، دوبریان، حسنی، پاپاس، وانگ (NeurIPS 2023, arXiv:2310.08419). PAIR اصلاح تکراری خودکار سریع jailbreak جعبه سیاه خودکار قانونی است. یک LLM مهاجم با یک سیستم سریال تیم قرمز به طور مکرر jailbreaks برای یک LLM هدف را پیشنهاد می کند و تلاش ها و پاسخ ها را در تاریخچه چت خود به عنوان بازخورد در زمینه جمع می کند. PAIR معمولاً در عرض 20 سوال موفق می شود، که از GCG (تلاش گرادینت سطح توکن زو و همکاران) کارآمدتر است و بدون نیاز به دسترسی به جعبه سفید. PAIR اکنون یک خط پایه استاندارد در JailbreakBench (arXiv:2404.01318) و HarmBench است، همراه با GCG، AutoDAN، TAP و Prompt Adversarial متقاعد کننده.

Type: Build

Languages: Python (stdlib, mock PAIR loop against a toy target)

Prerequisites: Phase 18 · 01 (instruction-following), Phase 14 (agent engineering)

Time: ~75 minutes

اهداف یادگیری

  • الگوریتم PAIR را شرح دهید: سریع سیستم حمله کننده، اصلاح تکراری، بازخورد در زمینه.
  • توضیح دهید که چرا PAIR در صورت هدف کردن جعبه سیاه، به طور دقیق کارآمدتر از GCG است.
  • چهار خط پایه حمله خودکار دیگر (GCG، AutoDAN، TAP، PAP) را نام دهید و یک ویژگی متمایز برای هر یک از آنها را ذکر کنید.
  • پروتکل های ارزیابی JailbreakBench و HarmBench را توصیف کنید و "سرمایه موفقیت حمله" در هر یک از آنها چه معنایی دارد.

مشکل

گروه قرمز قبلا یک فعالیت دستی بود. تعداد کمی از آزمایش کنندگان متخصص پیام های مخالف را ساختند و ردیابی کردند که کدام آنها کار می کردند. این مقیاس ندارد: نرخ موفقیت حمله به یک نمونه آماری نیاز دارد و هدف با هر نسخه مدل یک هدف متحرک است. PAIR گروه قرمز را به عنوان یک مشکل بهینه سازی با هدف جعبه سیاه عملیاتی می کند.

مفهوم

الگوریتم PAIR

ورودی:

  • هدف LLM T (نمونه ای که ما حمله می کنیم)
  • قاضی LLM J (در نتیجه پاسخ به یک پاسخ به jailbreak می باشد یا خیر)
  • مهاجم LLM A (تعمیر کننده تیم قرمز)
  • خط هدف G: "به [توجیه های مضر] پاسخ بده".
  • بودجه K (معمولا 20 سوال)

لوپ، برای k در 1..K:

  1. A با هدف G و تاریخچه زوج های (سرعتی، پاسخ) تا کنون به دنبال می شود.
  2. A یک پیام جدید ارسال می کند.
  3. ارسال p_k به T؛ دریافت پاسخ r_k.
  4. ج امتیاز (p_k, r_k) در گل.
  5. اگر امتیاز >= حد، توقف jailbreak یافت.
  6. در غیر این صورت، (p_k، r_k) را به تاریخچه A اضافه کنید؛ ادامه دهید.

نتیجه تجربی (NeurIPS 2023): > 50% میزان موفقیت حمله در برابر GPT-3.5-توربو، Llama-2-7B-chat؛ متوسط سوالات موفقیت در محدوده 10-20.

چرا PAIR موثر است

GCG (Zou et al. 2023) به دنبال دنباله های متناقض توکن را به حسب گرادینت جستجو می کند؛ این نیاز به دسترسی به مدل جعبه سفید دارد و دنباله های غیر قابل خواندن را تولید می کند. PAIR جعبه سیاه است و حملات زبانی طبیعی را که در میان مدل ها انتقال می دهند تولید می کند. بازخورد در زمینه PAIR اجازه می دهد تا مهاجم از هر رد یاد بگیرد؛ GCG هیچ معادل (هر بروزرسانی توکن جدید باید پیشرفت قبلی را دوباره کشف کند) ندارد.

حملات خودکار مرتبط

  • GCG (Zou et al. 2023, arXiv:2307.15043).جستجوی گرادینتی سطح توکن برای ضمیمهای مخالف. جعبه سفید، قابل انتقال، رشته های غیر قابل خواندن را تولید می کند.
  • AutoDAN (Liu et al. 2023).جستجوی تکامل یافته در مورد پیامد ها، با هدایت یک هدف سلسله مراتبی.
  • TAP (Mehrotra et al. 2024).درخت حمله با برش شاخه های چند طرح PAIR
  • PAP (Zeng et al. 2024).پیام های ضد قانع کننده تکنیک های قانع کننده انسانی را به عنوان قالب های فوری رمزگذاری می کند.

"جيلبرک" و "هارم"

هر دو (2024) ارزیابی استاندارد:

  • JailbreakBench (arXiv:2404.01318). 100 رفتار مضر در 10 دسته از سیاست های OpenAI. نرخ موفقیت حمله (ASR) به عنوان متریک اصلی. نیاز به یک قاضی (GPT-4-turbo، Llama Guard یا StrongREJECT) دارد.
  • HarmBench (Mazeika و همکاران 2024). 510 رفتار در 7 دسته، با آزمایش های آسیب معنوی و عملکردی. مقایسه 18 حمله با 33 مدل.

ASR معمولاً با بودجه ی ثابت جستجو گزارش می شود. مقایسه حملات نیازمند تطابق بودجه ها است؛ ASR 90٪ در 200 جستجو قابل مقایسه با ASR 85٪ در 20 نیست.

دلیل اهمیت آن برای انتشار 2026

هر آزمایشگاه مرزی در حال حاضر با مدل های تولید قبل از انتشار PAIR و TAP را اجرا می کند. مسیرهای ASR در کارت های مدل (درس 26) و ضمیمه های مورد ایمنی (درس 18) ظاهر می شوند. حمله غریبی نیست این زیرساخت استاندارد است.

جایی که این در مرحله 18 قرار داره

درس 12 پایه ی حمله خودکار است. درس 13 (Jailbreaking Multi-Shot) یک بهره برداری طولانی مکمل است. درس 14 (ASCII Art / Visual) یک حمله کدگذاری است. درس 15 (Indirect Prompt Injection) سطح حمله تولید 2026 است. درس 16 بر همتایان ابزار دفاعی (Llama Guard, Garak, PyRIT) پوشش می دهد.

ازش استفاده کن

code/main.pyهدف یک طبقه بندی کننده جعلی است که از پیام های مضر "بیداری" (فلتور کلمات کلیدی) رد می کند. مهاجم یک پالایشگر مبتنی بر قوانین است که سعی می کند پارافرز، فریمینگ نقش و کدگذاری را انجام دهد. قاضی پاسخ را نمره می دهد. شما می بینید که مهاجم در ~5-15 تکرار در برابر فیلتر کلمات کلیدی موفق می شود و در برابر فیلتر معنوی شکست می خورد.

-باده

این درس به ما کمک می کندoutputs/skill-attack-audit.md. در نظر گرفتن گزارش ارزیابی گروه قرمز، آن را بررسی می کند: چه حملات انجام شده (PAIR، GCG، TAP، AutoDAN، PAP) ، هر کدام با چه بودجه، با چه قاضی، که در چه رفتار مضر تنظیم شده (JailbreakBench، HarmBench، داخلی).

تمرینات

  1. فرار کنcode/main.py. اندازه گیری متوسط سوالات برای موفقیت برای سه استراتژی مهاجم داخلی . توضیح دهید که هر یک از آنها چه فرضیه دفاعی هدف را به کار می گیرد .
  1. پیاده سازی یک استراتژی حمله کننده چهارم (به عنوان مثال ترجمه به زبان دیگر، کدگذاری base64) گزارش متوسط جدید سوالات موفقیت در برابر هدف فیلتر کلمات کلیدی و هدف فیلتر معنوی.
  1. Chao et al. 2023 شکل 5 (PAR vs GCG مقایسه) را بخوانید. دو سناریو را توصیف کنید که GCG با وجود مزیت بهره وری PAIR ترجیح داده می شود.
  1. JailbreakBench ASR را در برابر یک هدف ثابت گزارش می دهد. یک متریک اضافی طراحی کنید که تنوع حمله را اندازه گیری کند (تغییر در پیام های موفق). توضیح دهید که چرا تنوع برای ارزیابی دفاع مهم است.
  1. TAP (Mehrotra 2024) PAIR را با شاخه بندی + برش گسترش می دهد. یک تمدید سبک TAP را به code/main.pyو مقایسه هزینه های محاسباتی با نرخ موفقیت را توصیف کنید.

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
PAIR"automated jailbreak"Prompt Automatic Iterative Refinement; attacker-LLM + judge-LLM loop
GCG"gradient jailbreak"White-box token-level gradient search for adversarial suffixes
Attack success rate (ASR)"% jailbreaks at k queries"Primary metric; must be reported with query budget and judge identity
Judge LLM"the scorer"LLM that grades whether a response satisfies the harmful goal
JailbreakBench"the evaluation"Standardized harmful-behaviour set with tagged categories
HarmBench"the broader bench"510 behaviours, functional + semantic harm tests
TAP"tree of attacks"PAIR with branching + pruning; better ASR at higher compute

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.