रेड-टीमिंगः पीएआईआर और स्वचालित हमले
Type: Build
Languages: Python (stdlib, mock PAIR loop against a toy target)
Prerequisites: Phase 18 · 01 (instruction-following), Phase 14 (agent engineering)
Time: ~75 minutes
सीखने के लक्ष्य
- PAIR एल्गोरिथ्म का वर्णन करेंः हमलावर प्रणाली शीघ्र, पुनरावर्ती परिष्करण, संदर्भ में प्रतिक्रिया।
- बताएं कि जब लक्ष्य ब्लैक बॉक्स होता है तो पीएआईआर जीसीजी की तुलना में अधिक कुशल क्यों होता है।
- स्वचालित हमले के चार अन्य आधार रेखाओं (जीसीजी, ऑटोडैन, टीएपी, पीएपी) का नाम दें और प्रत्येक की एक विशिष्ट विशेषता बताएं।
- जेलब्रेकबेंच और हार्मबेंच मूल्यांकन प्रोटोकॉल का वर्णन करें और प्रत्येक के तहत "हमलों की सफलता दर" का क्या अर्थ है।
समस्या
रेड-टीमिंग एक मैनुअल गतिविधि थी। कुछ विशेषज्ञ परीक्षकों ने प्रतिकूल संकेतों का निर्माण किया और ट्रैक किया कि कौन से काम करते हैं। यह पैमाने पर नहीं हैः हमले की सफलता दर को सांख्यिकीय नमूने की आवश्यकता होती है, और लक्ष्य प्रत्येक मॉडल रिलीज के साथ एक चल रहा लक्ष्य होता है। PAIR ब्लैक-बॉक्स लक्ष्य के साथ एक अनुकूलन समस्या के रूप में रेड-टीमिंग को परिचालन करता है।
अवधारणा
PAIR एल्गोरिथ्म
इनपुटः
- लक्ष्य LLM T (हम जिस मॉडल पर हमला कर रहे हैं) ।
- न्यायाधीश LLM J (स्कोर करता है कि क्या प्रतिक्रिया एक जेल ब्रेक है) ।
- हमलावर LLM ए (लाल टीम अनुकूलक) ।
- लक्ष्य स्ट्रिंग जी: " [हानिकारक निर्देश] के साथ प्रतिक्रिया दें।"
- बजट K (आमतौर पर 20 प्रश्न)
लूप, के के लिए 1..K:
- A को लक्ष्य G और (प्रोम्प्ट, प्रतिक्रिया) जोड़े के इतिहास के साथ प्रेरित किया जाता है।
- A एक नया संकेत p_k जारी करता है।
- T को p_k भेजें; प्रतिक्रिया r_k प्राप्त करें।
- जे गोल पर अंक (पीके, आरके) देता है।
- यदि स्कोर >= सीमा है, तो रोकें जेलब्रेक पाया गया।
- अन्यथा, ए के इतिहास में (p_k, r_k) जोड़ें; जारी रखें।
अनुभवजन्य परिणाम (न्यूरिपस 2023): जीपीटी-3.5-टर्बो, लामा-2-7बी-चैट के खिलाफ 50% से अधिक हमले की सफलता दर; 10-20 श्रेणी में सफलता के लिए औसत प्रश्न।
PAIR प्रभावी क्यों है
GCG (Zou et al. 2023) ग्रेडिएंट द्वारा प्रतिकूल टोकन प्रत्ययों पर खोज करता है; इसके लिए व्हाइट-बॉक्स मॉडल एक्सेस की आवश्यकता होती है और यह अवाचनीय प्रत्यय उत्पन्न करता है। PAIR ब्लैक-बॉक्स है और प्राकृतिक भाषा के हमलों का उत्पादन करता है जो मॉडल के बीच स्थानांतरित होते हैं। PAIR की संदर्भ में प्रतिक्रिया हमलावर को प्रत्येक अस्वीकृति से सीखने देती है; GCG का कोई समकक्ष नहीं है (प्रत्येक नए टोकन अपडेट को पूर्व प्रगति को फिर से खोजने की आवश्यकता होती है) ।
संबंधित स्वचालित हमले
- GCG (Zou et al. 2023, arXiv:2307.15043).प्रतिद्वंद्वी प्रत्ययों के लिए टोकन स्तर ग्रेडिएंट खोज। सफेद बॉक्स, स्थानांतरित, अवाचनीय स्ट्रिंग का उत्पादन करता है।
- AutoDAN (Liu et al. 2023).एक पदानुक्रमिक उद्देश्य द्वारा निर्देशित संकेतों पर विकासवादी खोज।
- TAP (Mehrotra et al. 2024).पीएआईआर शैली के कई रोलआउट के साथ कटाई शाखाओं के साथ हमले के पेड़।
- PAP (Zeng et al. 2024).सम्मोहक विरोधी प्रलोभन मानव सम्मोहक तकनीकों को शीघ्र टेम्पलेट के रूप में एन्कोड करता है।
जेलब्रेकबेंच और हार्मबेंच
दोनों (2024) मानकीकृत मूल्यांकनः
- जेलब्रेकबेंच (arXiv:2404.01318). 10 ओपनएआई-नीति श्रेणियों में 100 हानिकारक व्यवहार। प्राथमिक मीट्रिक के रूप में हमले की सफलता दर (एएसआर) । एक न्यायाधीश (जीपीटी -4-टर्बो, लामा गार्ड, या स्ट्रॉन्गरेजेक्ट) की आवश्यकता होती है।
- HarmBench (Mazeika et al. 2024). अर्थिक और कार्यात्मक हानियों के परीक्षण के साथ 7 श्रेणियों में 510 व्यवहार। 33 मॉडल के खिलाफ 18 हमलों की तुलना करता है।
ASR आमतौर पर एक निश्चित क्वेरी बजट पर रिपोर्ट किया जाता है। तुलनात्मक हमलों के लिए एक समान बजट की आवश्यकता होती है; 200 क्वेरी पर 90% ASR की तुलना में 20% ASR की तुलना में नहीं की जाती है।
2026 में तैनाती के लिए यह महत्वपूर्ण क्यों है
प्रत्येक सीमा प्रयोगशाला अब रिलीज से पहले उत्पादन मॉडल के खिलाफ PAIR और TAP चलाती है। एएसआर ट्रैक्टरी मॉडल कार्ड (पाठ 26) और सुरक्षा मामले परिशिष्ट (पाठ 18) में दिखाई देती है। हमला विदेशी नहीं है यह मानक बुनियादी ढांचा है।
जहां यह चरण 18 में फिट बैठता है
पाठ 12 स्वचालित-हमलों का आधार है। पाठ 13 (मल्टि-शॉट जेलब्रेकिंग) एक पूरक लंबाई-उत्पाद है। पाठ 14 (एएससीआईआई कला / दृश्य) एक एन्कोडिंग हमला है। पाठ 15 (अप्रत्यक्ष शीघ्र इंजेक्शन) 2026 उत्पादन हमले सतह है। पाठ 16 रक्षात्मक उपकरण समकक्षों (लामा गार्ड, गरक, पायआरआईटी) को कवर करता है।
इसका प्रयोग करें
code/main.pyएक खेलकूद PAIR लूप बनाता है। लक्ष्य एक नकली वर्गीकरणकर्ता है जो "स्पष्ट" हानिकारक संकेतों (कीवर्ड-फिल्टर) से इनकार करता है। हमलावर एक नियम-आधारित शोधक है जो पैराफ्रेसेस, भूमिका-प्ले-फ्रेमिंग और एन्कोडिंग का प्रयास करता है। न्यायाधीश प्रतिक्रिया को स्कोर करता है। आप हमलावर को खोजशब्द फ़िल्टर के खिलाफ ~ 5-15 पुनरावृत्ति में सफल होते हुए देखते हैं और अर्थपूर्ण फ़िल्टर के खिलाफ विफल होते हैं।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-attack-audit.md. रेड टीम मूल्यांकन रिपोर्ट को देखते हुए, यह लेखा परीक्षा करता हैः किस हमले को चलाया गया (PAIR, GCG, TAP, AutoDAN, PAP), प्रत्येक किस बजट पर, किस न्यायाधीश के साथ, किस हानिकारक व्यवहार पर सेट (JailbreakBench, HarmBench, आंतरिक) ।
व्यायाम
- दौड़ें
code/main.py. तीन अंतर्निहित हमलावर रणनीतियों के लिए औसत-सफलता के लिए प्रश्नों का माप करें. प्रत्येक लक्ष्य-रक्षा परिकल्पना का क्या उपयोग करता है, समझाएं।
- चौथी हमलावर रणनीति लागू करें (जैसे, दूसरी भाषा में अनुवाद, बेस 64 एन्कोडिंग) । कीवर्ड फ़िल्टर लक्ष्य और अर्थिक फ़िल्टर लक्ष्य के खिलाफ सफलता के लिए नए औसत प्रश्नों की रिपोर्ट करें।
- Chao et al. 2023 चित्र 5 (PAIR vs GCG तुलना) पढ़ें। दो परिदृश्यों का वर्णन करें जहां PAIR के दक्षता लाभ के बावजूद GCG को प्राथमिकता दी जाती है।
- जेलब्रेकबेंच एक निश्चित लक्ष्य सेट के खिलाफ एएसआर रिपोर्ट करता है। एक अतिरिक्त मीट्रिक डिज़ाइन करें जो हमले की विविधता (सफल संकेतों में भिन्नता) को मापता है। समझाएं कि रक्षा मूल्यांकन के लिए विविधता क्यों महत्वपूर्ण है।
- TAP (मेहराट्रा 2024) ने PAIR को शाखा + कटौती के साथ बढ़ाया है।
code/main.pyऔर गणनात्मक लागत बनाम सफलता दर के व्यापार-बदला का वर्णन करें।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| PAIR | "automated jailbreak" | Prompt Automatic Iterative Refinement; attacker-LLM + judge-LLM loop |
| GCG | "gradient jailbreak" | White-box token-level gradient search for adversarial suffixes |
| Attack success rate (ASR) | "% jailbreaks at k queries" | Primary metric; must be reported with query budget and judge identity |
| Judge LLM | "the scorer" | LLM that grades whether a response satisfies the harmful goal |
| JailbreakBench | "the evaluation" | Standardized harmful-behaviour set with tagged categories |
| HarmBench | "the broader bench" | 510 behaviours, functional + semantic harm tests |
| TAP | "tree of attacks" | PAIR with branching + pruning; better ASR at higher compute |
आगे पढ़ना
- Chao et al. — Jailbreaking Black Box LLMs in Twenty Queries (arXiv:2310.08419) पेयर पेपर, न्यूरआईपीएस 2023
- Zou et al. — Universal and Transferable Adversarial Attacks on Aligned LLMs (arXiv:2307.15043) GCG कागज
- Chao et al. — JailbreakBench (arXiv:2404.01318) मानकीकृत मूल्यांकन
- Mazeika et al. — HarmBench (ICML 2024) व्यापक मूल्यांकन
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.