Phase 18: Ethics, Safety & Alignment

रेड-टीम टूलिंग गाराक, लामा गार्ड, पायरिट

तीन उत्पादन उपकरण 2026 लाल टीम स्टैक को फ्रेम करते हैं। लामा गार्ड (मेटा) एक लामा-3.1-8B वर्गीकरण 14 MLCommons खतरे श्रेणियों पर ठीक से समायोजित; 2025 लामा गार्ड 4 एक 12B मूल रूप से बहुआयामी वर्गीकरण है जो लामा 4 स्काउट से कटा हुआ है। गाराक (एनवीडीआईए) हाल्यूसिनैशन, डेटा लीक, शीघ्र इंजेक्शन, विषाक्तता और जेलब्रेक के लिए स्थैतिक, गतिशील और अनुकूलन जांच के साथ ओपन-सोर्स एलएलएम भेद्यता स्कैनर। PyRIT (Microsoft) गहन शोषण के लिए Crescendo, TAP, और कस्टम कनवर्टर श्रृंखलाओं के साथ मल्टी-टर्न रेड-टीम अभियान। लामा गार्ड 3 मेटा के "लामा 3 हर्ड ऑफ मॉडल्स" (arXiv:2407.21783) में प्रलेखित है; लामा गार्ड 3-1B-INT4 arXiv:2411.17713 में; गाराक की जांच वास्तुकला github.com/NVIDIA/garak में। ये उपकरण रेड-टीम रिसर्च (पाठ 12-15) और डिप्लोयमेंट (पाठ 17+) के बीच 2026 उत्पादन इंटरफ़ेस हैं।

Type: Build

Languages: Python (stdlib, tool-architecture simulator and Llama Guard-style classifier mock)

Prerequisites: Phase 18 · 12-15 (jailbreaks and IPI)

Time: ~75 minutes

सीखने के लक्ष्य

  • सुरक्षा स्टैक में Llama Guard 3/4 की स्थिति का वर्णन करेंः इनपुट वर्गीकरण, आउटपुट वर्गीकरण या दोनों।
  • MLCommons के 14 जोखिम श्रेणियों का नाम दें और एक गैर-स्पष्ट (कोड व्याख्याता दुरुपयोग) का उल्लेख करें।
  • गाराक के जांच वास्तुकला का वर्णन करेंः जांच, डिटेक्टर, हर्नर।
  • पीआरआईटी की बहु-टर्न अभियान संरचना का वर्णन करें और यह गाराक जांच के साथ कैसे गठित होता है।

समस्या

पाठ 12-15 हमले की सतह को प्रस्तुत करते हैं। उत्पादन तैनाती को दोहराए जाने योग्य, स्केलेबल मूल्यांकन की आवश्यकता होती है। तीन उपकरण 2026 में हावी हैंः लामा गार्ड (रक्षा वर्गीकरण), गाराक (स्कैनर), पायआरआईटी (कैंपेन ऑर्केस्ट्रेटर) । प्रत्येक लाल टीम जीवन चक्र की एक अलग परत को लक्षित करता है।

अवधारणा

लामा गार्ड (मेटा)

Llama Guard 3 एक Llama-3.1-8B मॉडल है जो MLCommons AILuminate 14 श्रेणियों पर इनपुट/आउटपुट वर्गीकरण के लिए ठीक से समायोजित हैः

  • हिंसा, हिंसा रहित अपराध, यौन संबंध, सीएसएएम, बदनामी
  • विशेषज्ञ सलाह, गोपनीयता, आईपी, भेदभाव रहित हथियार, घृणा
  • आत्महत्या/स्व-क्षति, यौन सामग्री, चुनाव, कोड-अंतरभाषकों का दुरुपयोग

8 भाषाओं का समर्थन करता है। उपयोगः एलएलएम (इनपुट मॉडरेशन), एलएलएम (आउटपुट मॉडरेशन) के बाद स्थान या दोनों। दोनों उपयोग अलग प्रशिक्षण वितरण उत्पन्न करते हैं।

Llama Guard 3-1B-INT4 (arXiv:2411.17713, 440MB, ~ 30 टोकन / सेकंड मोबाइल सीपीयू पर) क्वांटिज़्ड एज वेरिएंट है।

लामा गार्ड 4 (अप्रैल 2025) 12B है, मूल रूप से बहुमुखी, लामा 4 स्काउट से कटा हुआ है। यह 8B पाठ और 11B दृष्टि पूर्ववर्ती दोनों को एक वर्गीकरणकर्ता के साथ बदल देता है जो पाठ + छवियों को निगलता है।

गाराक (NVIDIA)

ओपन सोर्स भेद्यता स्कैनर. वास्तुकलाः

  • Probes.हलुसिनाशन, डेटा लीक, प्रॉम्प्ट इंजेक्शन, विषाक्तता, जेलब्रेक के लिए हमला जनरेटर. स्थैतिक (फिक्स्ड प्रॉम्प्ट), गतिशील (जनरेट किए गए प्रॉम्प्ट), अनुकूलन (लक्ष्य आउटपुट के लिए प्रतिक्रिया करता है) ।
  • Detectors.अपेक्षित विफलता मोड के खिलाफ स्कोर आउटपुट विषैले, लीक, जेलब्रेक।
  • Harnesses.जांच-डिटेक्टर जोड़े का प्रबंधन करें, अभियान चलाएं, रिपोर्ट उत्पन्न करें।

TrustyAI ने गाराक को एलएमए-स्टैक शील्ड्स (प्रॉम्प्ट-गार्ड-86एम इनपुट वर्गीकरण, एलएमए-गार्ड-3-8बी आउटपुट वर्गीकरण) के साथ अंत-से-अंत शील्ड किए गए लक्ष्य मूल्यांकन के लिए एकीकृत किया। टियर-आधारित स्कोरिंग (टीबीएसए) द्विआधारी पास / विफलता को बदल देता है। एक मॉडल गंभीरता स्तर 3 पर पारित कर सकता है और उसी जांच पर गंभीरता स्तर 5 पर विफल हो सकता है।

पायरिट (माइक्रोसॉफ्ट)

पायथन जोखिम पहचान उपकरण किट. बहु-टर्न लाल टीम अभियान. के आसपास बनाया गयाः

  • Converters.एक बीज संकेत को परिवर्तित करें पैराफ्रेस, एन्कोड, अनुवाद, भूमिका खेल।
  • Orchestrators.अभियान चलाएं: Crescendo (उच्चरण), TAP (शाखा), RedTeaming (कस्टम लूप) ।
  • Scoring.LLM-जैसे-जज या वर्गीकरणकर्ता-जैसे-जजज।

पाइरइट गाराक का भारी सा भाई है। गाराक हजारों एकल-टर्न जांच चलाता है; पाइरइट विशिष्ट विफलता मोड को तोड़ने के लिए डिज़ाइन किए गए गहरे बहु-टर्न अभियान चलाता है।

ढेर

मॉडल के दोनों तरफ लामा गार्ड लगाएं। प्रतिगमन के लिए हर रात गाराक चलाएं। प्री-रिलीज़ अभियानों के लिए पायरीट चलाएं। यह अधिकांश उत्पादन तैनाती के लिए 2026 डिफ़ॉल्ट कॉन्फ़िगरेशन है।

मूल्यांकन की बाधाएँ

  • Judge identity.तीनों उपकरण एक LLM न्यायाधीश का उपयोग कर सकते हैं; न्यायाधीश माप ड्राइव रिपोर्ट ASRs (पाठ 12) उपकरण के साथ न्यायाधीश निर्दिष्ट करें।
  • Probe staleness.गाराक जांचें उम्र के साथ-साथ मॉडल के साथ-साथ उनके साथ पैच किए जाते हैं। अनुकूलन जांच (पीएआईआर के आकार) स्थैतिक जांचों की तुलना में धीमी उम्र के होते हैं।
  • Llama Guard FPR on benign content.प्रारंभिक लामा गार्ड संस्करणों में राजनीतिक और एलजीबीटीक्यू+ सामग्री के साथ अधिक ध्वज था; लामा गार्ड 3/4 माप में सुधार किया गया है लेकिन प्रति तैनाती माप नहीं किया गया है।

जहां यह चरण 18 में फिट बैठता है

पाठ 12-15 हमले के परिवार हैं। पाठ 16 उत्पादन उपकरण है। पाठ 17 (WMDP) दोहरे उपयोग क्षमता के लिए मूल्यांकन है। पाठ 18 सीमा सुरक्षा ढांचे है जो इन उपकरणों को एक नीति संरचना में लपेटते हैं।

इसका प्रयोग करें

code/main.pyएक खिलौना Llama गार्ड शैली वर्गीकरण (कीवर्ड + 14 श्रेणियों पर अर्थपूर्ण सुविधाओं), एक खिलौना Garak हर्न (सॉन्ड-डिटेक्टर लूप), और एक PyRIT शैली बहु-टर्न कनवर्टर श्रृंखला बनाता है। आप तीन उपकरणों को एक नकली लक्ष्य के खिलाफ चला सकते हैं और विभिन्न कवरेज हस्ताक्षरों का निरीक्षण कर सकते हैं।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-red-team-stack.md. एक तैनाती विवरण को देखते हुए, यह तीनों उपकरणों में से कौन से उपयुक्त हैं, प्रत्येक में क्या कॉन्फ़िगर किया जाना है, और कौन सा प्रतिगमन क्रम चलाया जाना है।

व्यायाम

  1. दौड़ेंcode/main.py. एकल-टर्न बनाम बहु-टर्न हमलों पर लामा-गार्ड शैली वर्गीकरण की पहचान दर की तुलना करें।
  1. एक नया गाराक जांच लागू करेंः एक आधार 64 एन्कोड हानिकारक अनुरोध. Llama-गार्ड शैली वर्गीकरण द्वारा इसकी पता लगाने की माप.
  1. "फ्रांसीसी में अनुवाद, फिर पैराफ्रेज" कनवर्टर के साथ PyRIT शैली कनवर्टर श्रृंखला का विस्तार करें। हमले की सफलता को फिर से मापें।
  1. लामा गार्ड 3 की खतरे-श्रेणी सूची पढ़ें। दो श्रेणियों की पहचान करें जहां प्रशिक्षण डेटा यथार्थवादी रूप से वैध डेवलपर सामग्री पर उच्च झूठी सकारात्मक दर उत्पन्न करेगा।
  1. गाराक और पाइआरआईटी के डिजाइन सिद्धांतों की तुलना करें। एक तैनाती के लिए तर्क दें जहां प्रत्येक सही उपकरण है।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
Llama Guard"the classifier"Fine-tuned Llama-3.1-8B/4-12B safety classifier with 14 hazard categories
Garak"the scanner"NVIDIA open-source vulnerability scanner; probes, detectors, harnesses
PyRIT"the campaign tool"Microsoft multi-turn red-team orchestrator; converters, orchestrators, scoring
Prompt-Guard"the small classifier"Meta's 86M prompt-injection classifier, paired with Llama Guard
TBSA"tier-based scoring"Garak's tier-based pass/fail replacing binary outcomes
Converter chain"paraphrase + encode + ..."PyRIT composition primitive for building multi-step attacks
MLCommons hazard categories"the 14 taxonomies"Industry-standard taxonomy Llama Guard targets

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.