रेड-टीम टूलिंग गाराक, लामा गार्ड, पायरिट
Type: Build
Languages: Python (stdlib, tool-architecture simulator and Llama Guard-style classifier mock)
Prerequisites: Phase 18 · 12-15 (jailbreaks and IPI)
Time: ~75 minutes
सीखने के लक्ष्य
- सुरक्षा स्टैक में Llama Guard 3/4 की स्थिति का वर्णन करेंः इनपुट वर्गीकरण, आउटपुट वर्गीकरण या दोनों।
- MLCommons के 14 जोखिम श्रेणियों का नाम दें और एक गैर-स्पष्ट (कोड व्याख्याता दुरुपयोग) का उल्लेख करें।
- गाराक के जांच वास्तुकला का वर्णन करेंः जांच, डिटेक्टर, हर्नर।
- पीआरआईटी की बहु-टर्न अभियान संरचना का वर्णन करें और यह गाराक जांच के साथ कैसे गठित होता है।
समस्या
पाठ 12-15 हमले की सतह को प्रस्तुत करते हैं। उत्पादन तैनाती को दोहराए जाने योग्य, स्केलेबल मूल्यांकन की आवश्यकता होती है। तीन उपकरण 2026 में हावी हैंः लामा गार्ड (रक्षा वर्गीकरण), गाराक (स्कैनर), पायआरआईटी (कैंपेन ऑर्केस्ट्रेटर) । प्रत्येक लाल टीम जीवन चक्र की एक अलग परत को लक्षित करता है।
अवधारणा
लामा गार्ड (मेटा)
Llama Guard 3 एक Llama-3.1-8B मॉडल है जो MLCommons AILuminate 14 श्रेणियों पर इनपुट/आउटपुट वर्गीकरण के लिए ठीक से समायोजित हैः
- हिंसा, हिंसा रहित अपराध, यौन संबंध, सीएसएएम, बदनामी
- विशेषज्ञ सलाह, गोपनीयता, आईपी, भेदभाव रहित हथियार, घृणा
- आत्महत्या/स्व-क्षति, यौन सामग्री, चुनाव, कोड-अंतरभाषकों का दुरुपयोग
8 भाषाओं का समर्थन करता है। उपयोगः एलएलएम (इनपुट मॉडरेशन), एलएलएम (आउटपुट मॉडरेशन) के बाद स्थान या दोनों। दोनों उपयोग अलग प्रशिक्षण वितरण उत्पन्न करते हैं।
Llama Guard 3-1B-INT4 (arXiv:2411.17713, 440MB, ~ 30 टोकन / सेकंड मोबाइल सीपीयू पर) क्वांटिज़्ड एज वेरिएंट है।
लामा गार्ड 4 (अप्रैल 2025) 12B है, मूल रूप से बहुमुखी, लामा 4 स्काउट से कटा हुआ है। यह 8B पाठ और 11B दृष्टि पूर्ववर्ती दोनों को एक वर्गीकरणकर्ता के साथ बदल देता है जो पाठ + छवियों को निगलता है।
गाराक (NVIDIA)
ओपन सोर्स भेद्यता स्कैनर. वास्तुकलाः
- Probes.हलुसिनाशन, डेटा लीक, प्रॉम्प्ट इंजेक्शन, विषाक्तता, जेलब्रेक के लिए हमला जनरेटर. स्थैतिक (फिक्स्ड प्रॉम्प्ट), गतिशील (जनरेट किए गए प्रॉम्प्ट), अनुकूलन (लक्ष्य आउटपुट के लिए प्रतिक्रिया करता है) ।
- Detectors.अपेक्षित विफलता मोड के खिलाफ स्कोर आउटपुट विषैले, लीक, जेलब्रेक।
- Harnesses.जांच-डिटेक्टर जोड़े का प्रबंधन करें, अभियान चलाएं, रिपोर्ट उत्पन्न करें।
TrustyAI ने गाराक को एलएमए-स्टैक शील्ड्स (प्रॉम्प्ट-गार्ड-86एम इनपुट वर्गीकरण, एलएमए-गार्ड-3-8बी आउटपुट वर्गीकरण) के साथ अंत-से-अंत शील्ड किए गए लक्ष्य मूल्यांकन के लिए एकीकृत किया। टियर-आधारित स्कोरिंग (टीबीएसए) द्विआधारी पास / विफलता को बदल देता है। एक मॉडल गंभीरता स्तर 3 पर पारित कर सकता है और उसी जांच पर गंभीरता स्तर 5 पर विफल हो सकता है।
पायरिट (माइक्रोसॉफ्ट)
पायथन जोखिम पहचान उपकरण किट. बहु-टर्न लाल टीम अभियान. के आसपास बनाया गयाः
- Converters.एक बीज संकेत को परिवर्तित करें पैराफ्रेस, एन्कोड, अनुवाद, भूमिका खेल।
- Orchestrators.अभियान चलाएं: Crescendo (उच्चरण), TAP (शाखा), RedTeaming (कस्टम लूप) ।
- Scoring.LLM-जैसे-जज या वर्गीकरणकर्ता-जैसे-जजज।
पाइरइट गाराक का भारी सा भाई है। गाराक हजारों एकल-टर्न जांच चलाता है; पाइरइट विशिष्ट विफलता मोड को तोड़ने के लिए डिज़ाइन किए गए गहरे बहु-टर्न अभियान चलाता है।
ढेर
मॉडल के दोनों तरफ लामा गार्ड लगाएं। प्रतिगमन के लिए हर रात गाराक चलाएं। प्री-रिलीज़ अभियानों के लिए पायरीट चलाएं। यह अधिकांश उत्पादन तैनाती के लिए 2026 डिफ़ॉल्ट कॉन्फ़िगरेशन है।
मूल्यांकन की बाधाएँ
- Judge identity.तीनों उपकरण एक LLM न्यायाधीश का उपयोग कर सकते हैं; न्यायाधीश माप ड्राइव रिपोर्ट ASRs (पाठ 12) उपकरण के साथ न्यायाधीश निर्दिष्ट करें।
- Probe staleness.गाराक जांचें उम्र के साथ-साथ मॉडल के साथ-साथ उनके साथ पैच किए जाते हैं। अनुकूलन जांच (पीएआईआर के आकार) स्थैतिक जांचों की तुलना में धीमी उम्र के होते हैं।
- Llama Guard FPR on benign content.प्रारंभिक लामा गार्ड संस्करणों में राजनीतिक और एलजीबीटीक्यू+ सामग्री के साथ अधिक ध्वज था; लामा गार्ड 3/4 माप में सुधार किया गया है लेकिन प्रति तैनाती माप नहीं किया गया है।
जहां यह चरण 18 में फिट बैठता है
पाठ 12-15 हमले के परिवार हैं। पाठ 16 उत्पादन उपकरण है। पाठ 17 (WMDP) दोहरे उपयोग क्षमता के लिए मूल्यांकन है। पाठ 18 सीमा सुरक्षा ढांचे है जो इन उपकरणों को एक नीति संरचना में लपेटते हैं।
इसका प्रयोग करें
code/main.pyएक खिलौना Llama गार्ड शैली वर्गीकरण (कीवर्ड + 14 श्रेणियों पर अर्थपूर्ण सुविधाओं), एक खिलौना Garak हर्न (सॉन्ड-डिटेक्टर लूप), और एक PyRIT शैली बहु-टर्न कनवर्टर श्रृंखला बनाता है। आप तीन उपकरणों को एक नकली लक्ष्य के खिलाफ चला सकते हैं और विभिन्न कवरेज हस्ताक्षरों का निरीक्षण कर सकते हैं।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-red-team-stack.md. एक तैनाती विवरण को देखते हुए, यह तीनों उपकरणों में से कौन से उपयुक्त हैं, प्रत्येक में क्या कॉन्फ़िगर किया जाना है, और कौन सा प्रतिगमन क्रम चलाया जाना है।
व्यायाम
- दौड़ें
code/main.py. एकल-टर्न बनाम बहु-टर्न हमलों पर लामा-गार्ड शैली वर्गीकरण की पहचान दर की तुलना करें।
- एक नया गाराक जांच लागू करेंः एक आधार 64 एन्कोड हानिकारक अनुरोध. Llama-गार्ड शैली वर्गीकरण द्वारा इसकी पता लगाने की माप.
- "फ्रांसीसी में अनुवाद, फिर पैराफ्रेज" कनवर्टर के साथ PyRIT शैली कनवर्टर श्रृंखला का विस्तार करें। हमले की सफलता को फिर से मापें।
- लामा गार्ड 3 की खतरे-श्रेणी सूची पढ़ें। दो श्रेणियों की पहचान करें जहां प्रशिक्षण डेटा यथार्थवादी रूप से वैध डेवलपर सामग्री पर उच्च झूठी सकारात्मक दर उत्पन्न करेगा।
- गाराक और पाइआरआईटी के डिजाइन सिद्धांतों की तुलना करें। एक तैनाती के लिए तर्क दें जहां प्रत्येक सही उपकरण है।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| Llama Guard | "the classifier" | Fine-tuned Llama-3.1-8B/4-12B safety classifier with 14 hazard categories |
| Garak | "the scanner" | NVIDIA open-source vulnerability scanner; probes, detectors, harnesses |
| PyRIT | "the campaign tool" | Microsoft multi-turn red-team orchestrator; converters, orchestrators, scoring |
| Prompt-Guard | "the small classifier" | Meta's 86M prompt-injection classifier, paired with Llama Guard |
| TBSA | "tier-based scoring" | Garak's tier-based pass/fail replacing binary outcomes |
| Converter chain | "paraphrase + encode + ..." | PyRIT composition primitive for building multi-step attacks |
| MLCommons hazard categories | "the 14 taxonomies" | Industry-standard taxonomy Llama Guard targets |
आगे पढ़ना
- Meta — Llama Guard 3 (in Llama 3 Herd paper, arXiv:2407.21783) 8बी वर्गीकरण
- Meta — Llama Guard 3-1B-INT4 (arXiv:2411.17713) क्वांटिज़्ड मोबाइल वर्गीकरण
- NVIDIA Garak — GitHub स्कैनर रेपो और प्रलेखन
- Microsoft PyRIT — GitHub अभियान उपकरण
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.