التعاون الأحمر: الهجمات المزدوجة والآلية
Type: Build
Languages: Python (stdlib, mock PAIR loop against a toy target)
Prerequisites: Phase 18 · 01 (instruction-following), Phase 14 (agent engineering)
Time: ~75 minutes
أهداف التعلم
- وصف خوارزمية PAIR: نظام المهاجم على الفور، وتحسين التكرار، وردود الفعل في السياق.
- شرح لماذا PAIR أكثر كفاءة من GCG عندما يكون الهدف مربع أسود.
- أسمائ أربعة خطوط أساسية أخرى للهجوم الآلي (GCG، AutoDAN، TAP، PAP) وذكر ميزة مميزة لكل منها.
- وصف بروتوكولات تقييم JailbreakBench و HarmBench وما يعنيه "معدل نجاح الهجوم" تحت كل منهما.
المشكلة
كان التنظيم الأحمر نشاطًا يدويًا. قام عدد صغير من الاختباريين الخبراء ببناء طلبات معادلة وتتبع تلك التي عملت. هذا لا يتحكم في النطاق: تحتاج معدل نجاح الهجوم إلى عينة إحصائية ، والهدف هو هدف متحرك مع كل إصدار نموذج. تعمل PAIR على التنظيم الأحمر كمشكلة تحسين مع هدف صندوق أسود.
المفهوم
خوارزمية PAIR
المدخلات:
- الهدف LLM T (النموذج الذي نحن ننال منه).
- القاضي LLM J (يُسجل ما إذا كان الاستجابة هو اختراق السجن).
- المهاجم LLM A (الجهاز الأحمر المثالي).
- خط الهدف G: "استجيب [إرشادات ضارة]."
- الميزانية K (عادة 20 استفسار).
حلقة، ل k في 1..K:
- يتم تحفيز A مع الهدف G وتاريخ (السرعة، الاستجابة) أزواج حتى الآن.
- أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ أ
- إرسال p_k إلى T؛ استلام الإجابة r_k.
- تسجل (p_k، r_k) على الهدف.
- إذا كانت النتيجة >= عتبة، توقف jailbreak وجدت.
- وإلا، أضف (p_k، r_k) إلى تاريخ A؛ استمر.
النتيجة التجريبية (NeurIPS 2023): > 50% معدل نجاح الهجوم ضد GPT-3.5-turbo، Llama-2-7B-chat؛ متوسط الاستفسارات إلى النجاح في نطاق 10-20.
لماذا PAIR فعالة
يبحث GCG (Zou et al. 2023) عن ضفائح رمزية معادلة حسب التراجع؛ فإنه يتطلب وصول نموذج مربع أبيض ويجري ضفائح لا يمكن قراءتها. PAIR هي مربع أسود ويجري هجمات اللغة الطبيعية التي تنتقل عبر النماذج. تعود PAIR في السياق يسمح للمهاجم بالتعلم من كل رفض. GCG ليس لديها أي موازي (كل تحديث رمز جديد يجب أن يعيد اكتشاف التقدم السابق).
الهجمات الآلية ذات الصلة
- GCG (Zou et al. 2023, arXiv:2307.15043).البحث عن الإضافات المتناقضة على مستوى الرمز، الصندوق الأبيض، قابلة للتحويل، تنتج سلسلة لا يمكن قراءتها.
- AutoDAN (Liu et al. 2023).البحث التطوري عن الإرشادات، مدرجة من خلال هدف سلسلي
- TAP (Mehrotra et al. 2024).شجرة الهجمات مع قصة فروع متعددة تنفيذات في نمط PAIR.
- PAP (Zeng et al. 2024).تُرمز تقنيات الإقناع البشري كملفات إقناع.
" جيل بريك " بينخ و " هارم بينخ "
كلا (2024) تقييم قياسي:
- جيل بريك بنك (arXiv:2404.01318). 100 سلوك ضار عبر 10 فئات سياسة OpenAI. معدل نجاح الهجوم (ASR) كمقياس أساسي. يتطلب قاضيا (GPT-4-turbo ، Llama Guard ، أو StrongREJECT).
- برنامج HarmBench (Mazeika et al. 2024). 510 سلوك في 7 فئات، مع اختبارات الضرر التعريفي والعملي. مقارنة 18 هجوم ضد 33 نموذج.
يتم الإبلاغ عادة عن ASR بميزانية استفسار ثابتة. يتطلب مقارنة الهجمات مطابقة الميزانيات؛ 90% ASR عند 200 استفسار لا يمكن مقارنة مع 85% ASR عند 20.
السبب الذي يجعل الأمر مهمًا لتنفيذ 2026
يدير كل مختبر حدودي الآن PAIR و TAP ضد نماذج الإنتاج قبل الإصدار. تظهر مسارات ASR في بطاقات النموذج (درس 26) والإضافات لحالة السلامة (درس 18). الهجوم ليس غريبًا إنه بنية تحتية قياسية.
حيث يتناسب هذا مع المرحلة 18
الدروس 12 هي أساس الهجوم الآلي. الدروس 13 (تقاط السلاح متعدد الأغراض) هي استغلال طول مكمل. الدروس 14 (ASCII Art / Visual) هو هجوم تشفير. الدروس 15 (إدراج الإشارة غير المباشرة) هي سطح الهجوم الإنتاج 2026 . الدروس 16 تغطي نظرائها الأدوات الدفاعية (Llama Guard ، Garak ، PyRIT).
استخدمها
code/main.pyيُبني حلقة PAIR لعبة. الهدف هو تصنيف مزيف يرفض الإشارات الضارة "الوضوحية" (مصفح الكلمات الرئيسية). المهاجم هو مصفف قاعدة يُحاول التعبير عن الفصائل، وإطار اللعب، وتشفير. يحصي القاضي على الاستجابة. تراقب المهاجم ينجح في ~ 5-15 تكرار ضد مرشح الكلمات الرئيسية ويفشل ضد مرشح معنوي.
أرسله
هذا الدرس يُنتجoutputs/skill-attack-audit.md. في إطار تقرير تقييم فريق الأحمر، يقوم بالتحقق: أي هجمات تم تنفيذها (PAIR، GCG، TAP، AutoDAN، PAP) ، في أي ميزانية كل منهما، مع أي قاض، على أي سلوك ضار تم تنفيذها (JailbreakBench، HarmBench، داخلية).
التمارين
- أركض
code/main.py. قياس متوسط الأسئلة إلى النجاح لثلاث استراتيجيات المهاجم المدمجة. شرح أي افتراض دفاع الهدف كل استغلال.
- تنفيذ استراتيجية مهاجمة رابعة (مثل الترجمة إلى لغة أخرى، تشفير قاعدة64). تقرير متوسط الأسئلة الجديدة للنجاح ضد هدف تصفية الكلمات الرئيسية والهدف تصفية المفاهيم.
- اقرأ تشاو وزملاءه في الشكل 5 (مقارنة PAIR مقابل GCG) 2023 . وصف سيناريوهين يتم فيه تفضيل GCG على الرغم من ميزة كفاءة PAIR.
- يذكر "جيلبرك بينش" أن "أستر" تتعامل مع مجموعة من الأهداف الثابتة. صمم مقياس إضافي يقيس تنوع الهجوم (التباين في الإشارات الناجحة). شرح لماذا يعتبر التنوع مهمًا لتقييم الدفاع.
- تطبيق TAP (مهروترة 2024) يمتد PAIR مع التفرع + الحصن. رسم تمديد على شكل TAP إلى
code/main.pyووصف التكلفة الحاسوبية مقابل معدل النجاح.
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| PAIR | "automated jailbreak" | Prompt Automatic Iterative Refinement; attacker-LLM + judge-LLM loop |
| GCG | "gradient jailbreak" | White-box token-level gradient search for adversarial suffixes |
| Attack success rate (ASR) | "% jailbreaks at k queries" | Primary metric; must be reported with query budget and judge identity |
| Judge LLM | "the scorer" | LLM that grades whether a response satisfies the harmful goal |
| JailbreakBench | "the evaluation" | Standardized harmful-behaviour set with tagged categories |
| HarmBench | "the broader bench" | 510 behaviours, functional + semantic harm tests |
| TAP | "tree of attacks" | PAIR with branching + pruning; better ASR at higher compute |
المزيد من القراءة
- Chao et al. — Jailbreaking Black Box LLMs in Twenty Queries (arXiv:2310.08419)ورقة "باير" ، "نوريبس 2023"
- Zou et al. — Universal and Transferable Adversarial Attacks on Aligned LLMs (arXiv:2307.15043) ورق GCG
- Chao et al. — JailbreakBench (arXiv:2404.01318) تقييم موحد
- Mazeika et al. — HarmBench (ICML 2024)تقييم أوسع
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.