Phase 18: Ethics, Safety & Alignment

रेड-टीमिंगः पीएआईआर और स्वचालित हमले

चाओ, रोबे, डोब्रिबान, हसन, पप्पा, वोंग (NeurIPS 2023, arXiv:2310.08419). PAIR त्वरित स्वचालित पुनरावर्ती परिष्करण काैनिक स्वचालित ब्लैक बॉक्स जेलब्रेक है। लाल-टीम सिस्टम प्रॉम्प्ट के साथ एक हमलावर LLM आवर्ती रूप से लक्षित LLM के लिए जेलब्रेक का प्रस्ताव देता है, जो अपने स्वयं के चैट इतिहास में संदर्भ में प्रतिक्रिया के रूप में प्रयासों और प्रतिक्रियाओं को जमा करता है। PAIR आमतौर पर 20 क्वेरी के भीतर सफलता प्राप्त करता है, जो कि GCG (ज़ू और अन्य के टोकन स्तर पर ग्रेडिएंट खोज) की तुलना में अधिक कुशल है और व्हाइट-बॉक्स एक्सेस की आवश्यकता नहीं है। PAIR अब जेलब्रेकबेंच (arXiv:2404.01318) और हार्मबेंच में एक मानक आधार रेखा है, जीसीजी, ऑटोडैन, टीएपी और आश्वस्त विरोधी प्रम्प्ट के साथ।

Type: Build

Languages: Python (stdlib, mock PAIR loop against a toy target)

Prerequisites: Phase 18 · 01 (instruction-following), Phase 14 (agent engineering)

Time: ~75 minutes

सीखने के लक्ष्य

  • PAIR एल्गोरिथ्म का वर्णन करेंः हमलावर प्रणाली शीघ्र, पुनरावर्ती परिष्करण, संदर्भ में प्रतिक्रिया।
  • बताएं कि जब लक्ष्य ब्लैक बॉक्स होता है तो पीएआईआर जीसीजी की तुलना में अधिक कुशल क्यों होता है।
  • स्वचालित हमले के चार अन्य आधार रेखाओं (जीसीजी, ऑटोडैन, टीएपी, पीएपी) का नाम दें और प्रत्येक की एक विशिष्ट विशेषता बताएं।
  • जेलब्रेकबेंच और हार्मबेंच मूल्यांकन प्रोटोकॉल का वर्णन करें और प्रत्येक के तहत "हमलों की सफलता दर" का क्या अर्थ है।

समस्या

रेड-टीमिंग एक मैनुअल गतिविधि थी। कुछ विशेषज्ञ परीक्षकों ने प्रतिकूल संकेतों का निर्माण किया और ट्रैक किया कि कौन से काम करते हैं। यह पैमाने पर नहीं हैः हमले की सफलता दर को सांख्यिकीय नमूने की आवश्यकता होती है, और लक्ष्य प्रत्येक मॉडल रिलीज के साथ एक चल रहा लक्ष्य होता है। PAIR ब्लैक-बॉक्स लक्ष्य के साथ एक अनुकूलन समस्या के रूप में रेड-टीमिंग को परिचालन करता है।

अवधारणा

PAIR एल्गोरिथ्म

इनपुटः

  • लक्ष्य LLM T (हम जिस मॉडल पर हमला कर रहे हैं) ।
  • न्यायाधीश LLM J (स्कोर करता है कि क्या प्रतिक्रिया एक जेल ब्रेक है) ।
  • हमलावर LLM ए (लाल टीम अनुकूलक) ।
  • लक्ष्य स्ट्रिंग जी: " [हानिकारक निर्देश] के साथ प्रतिक्रिया दें।"
  • बजट K (आमतौर पर 20 प्रश्न)

लूप, के के लिए 1..K:

  1. A को लक्ष्य G और (प्रोम्प्ट, प्रतिक्रिया) जोड़े के इतिहास के साथ प्रेरित किया जाता है।
  2. A एक नया संकेत p_k जारी करता है।
  3. T को p_k भेजें; प्रतिक्रिया r_k प्राप्त करें।
  4. जे गोल पर अंक (पीके, आरके) देता है।
  5. यदि स्कोर >= सीमा है, तो रोकें जेलब्रेक पाया गया।
  6. अन्यथा, ए के इतिहास में (p_k, r_k) जोड़ें; जारी रखें।

अनुभवजन्य परिणाम (न्यूरिपस 2023): जीपीटी-3.5-टर्बो, लामा-2-7बी-चैट के खिलाफ 50% से अधिक हमले की सफलता दर; 10-20 श्रेणी में सफलता के लिए औसत प्रश्न।

PAIR प्रभावी क्यों है

GCG (Zou et al. 2023) ग्रेडिएंट द्वारा प्रतिकूल टोकन प्रत्ययों पर खोज करता है; इसके लिए व्हाइट-बॉक्स मॉडल एक्सेस की आवश्यकता होती है और यह अवाचनीय प्रत्यय उत्पन्न करता है। PAIR ब्लैक-बॉक्स है और प्राकृतिक भाषा के हमलों का उत्पादन करता है जो मॉडल के बीच स्थानांतरित होते हैं। PAIR की संदर्भ में प्रतिक्रिया हमलावर को प्रत्येक अस्वीकृति से सीखने देती है; GCG का कोई समकक्ष नहीं है (प्रत्येक नए टोकन अपडेट को पूर्व प्रगति को फिर से खोजने की आवश्यकता होती है) ।

संबंधित स्वचालित हमले

  • GCG (Zou et al. 2023, arXiv:2307.15043).प्रतिद्वंद्वी प्रत्ययों के लिए टोकन स्तर ग्रेडिएंट खोज। सफेद बॉक्स, स्थानांतरित, अवाचनीय स्ट्रिंग का उत्पादन करता है।
  • AutoDAN (Liu et al. 2023).एक पदानुक्रमिक उद्देश्य द्वारा निर्देशित संकेतों पर विकासवादी खोज।
  • TAP (Mehrotra et al. 2024).पीएआईआर शैली के कई रोलआउट के साथ कटाई शाखाओं के साथ हमले के पेड़।
  • PAP (Zeng et al. 2024).सम्मोहक विरोधी प्रलोभन मानव सम्मोहक तकनीकों को शीघ्र टेम्पलेट के रूप में एन्कोड करता है।

जेलब्रेकबेंच और हार्मबेंच

दोनों (2024) मानकीकृत मूल्यांकनः

  • जेलब्रेकबेंच (arXiv:2404.01318). 10 ओपनएआई-नीति श्रेणियों में 100 हानिकारक व्यवहार। प्राथमिक मीट्रिक के रूप में हमले की सफलता दर (एएसआर) । एक न्यायाधीश (जीपीटी -4-टर्बो, लामा गार्ड, या स्ट्रॉन्गरेजेक्ट) की आवश्यकता होती है।
  • HarmBench (Mazeika et al. 2024). अर्थिक और कार्यात्मक हानियों के परीक्षण के साथ 7 श्रेणियों में 510 व्यवहार। 33 मॉडल के खिलाफ 18 हमलों की तुलना करता है।

ASR आमतौर पर एक निश्चित क्वेरी बजट पर रिपोर्ट किया जाता है। तुलनात्मक हमलों के लिए एक समान बजट की आवश्यकता होती है; 200 क्वेरी पर 90% ASR की तुलना में 20% ASR की तुलना में नहीं की जाती है।

2026 में तैनाती के लिए यह महत्वपूर्ण क्यों है

प्रत्येक सीमा प्रयोगशाला अब रिलीज से पहले उत्पादन मॉडल के खिलाफ PAIR और TAP चलाती है। एएसआर ट्रैक्टरी मॉडल कार्ड (पाठ 26) और सुरक्षा मामले परिशिष्ट (पाठ 18) में दिखाई देती है। हमला विदेशी नहीं है यह मानक बुनियादी ढांचा है।

जहां यह चरण 18 में फिट बैठता है

पाठ 12 स्वचालित-हमलों का आधार है। पाठ 13 (मल्टि-शॉट जेलब्रेकिंग) एक पूरक लंबाई-उत्पाद है। पाठ 14 (एएससीआईआई कला / दृश्य) एक एन्कोडिंग हमला है। पाठ 15 (अप्रत्यक्ष शीघ्र इंजेक्शन) 2026 उत्पादन हमले सतह है। पाठ 16 रक्षात्मक उपकरण समकक्षों (लामा गार्ड, गरक, पायआरआईटी) को कवर करता है।

इसका प्रयोग करें

code/main.pyएक खेलकूद PAIR लूप बनाता है। लक्ष्य एक नकली वर्गीकरणकर्ता है जो "स्पष्ट" हानिकारक संकेतों (कीवर्ड-फिल्टर) से इनकार करता है। हमलावर एक नियम-आधारित शोधक है जो पैराफ्रेसेस, भूमिका-प्ले-फ्रेमिंग और एन्कोडिंग का प्रयास करता है। न्यायाधीश प्रतिक्रिया को स्कोर करता है। आप हमलावर को खोजशब्द फ़िल्टर के खिलाफ ~ 5-15 पुनरावृत्ति में सफल होते हुए देखते हैं और अर्थपूर्ण फ़िल्टर के खिलाफ विफल होते हैं।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-attack-audit.md. रेड टीम मूल्यांकन रिपोर्ट को देखते हुए, यह लेखा परीक्षा करता हैः किस हमले को चलाया गया (PAIR, GCG, TAP, AutoDAN, PAP), प्रत्येक किस बजट पर, किस न्यायाधीश के साथ, किस हानिकारक व्यवहार पर सेट (JailbreakBench, HarmBench, आंतरिक) ।

व्यायाम

  1. दौड़ेंcode/main.py. तीन अंतर्निहित हमलावर रणनीतियों के लिए औसत-सफलता के लिए प्रश्नों का माप करें. प्रत्येक लक्ष्य-रक्षा परिकल्पना का क्या उपयोग करता है, समझाएं।
  1. चौथी हमलावर रणनीति लागू करें (जैसे, दूसरी भाषा में अनुवाद, बेस 64 एन्कोडिंग) । कीवर्ड फ़िल्टर लक्ष्य और अर्थिक फ़िल्टर लक्ष्य के खिलाफ सफलता के लिए नए औसत प्रश्नों की रिपोर्ट करें।
  1. Chao et al. 2023 चित्र 5 (PAIR vs GCG तुलना) पढ़ें। दो परिदृश्यों का वर्णन करें जहां PAIR के दक्षता लाभ के बावजूद GCG को प्राथमिकता दी जाती है।
  1. जेलब्रेकबेंच एक निश्चित लक्ष्य सेट के खिलाफ एएसआर रिपोर्ट करता है। एक अतिरिक्त मीट्रिक डिज़ाइन करें जो हमले की विविधता (सफल संकेतों में भिन्नता) को मापता है। समझाएं कि रक्षा मूल्यांकन के लिए विविधता क्यों महत्वपूर्ण है।
  1. TAP (मेहराट्रा 2024) ने PAIR को शाखा + कटौती के साथ बढ़ाया है।code/main.pyऔर गणनात्मक लागत बनाम सफलता दर के व्यापार-बदला का वर्णन करें।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
PAIR"automated jailbreak"Prompt Automatic Iterative Refinement; attacker-LLM + judge-LLM loop
GCG"gradient jailbreak"White-box token-level gradient search for adversarial suffixes
Attack success rate (ASR)"% jailbreaks at k queries"Primary metric; must be reported with query budget and judge identity
Judge LLM"the scorer"LLM that grades whether a response satisfies the harmful goal
JailbreakBench"the evaluation"Standardized harmful-behaviour set with tagged categories
HarmBench"the broader bench"510 behaviours, functional + semantic harm tests
TAP"tree of attacks"PAIR with branching + pruning; better ASR at higher compute

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.