أدوات الفريق الأحمر جراك، حرس لاما، بيريت
Type: Build
Languages: Python (stdlib, tool-architecture simulator and Llama Guard-style classifier mock)
Prerequisites: Phase 18 · 12-15 (jailbreaks and IPI)
Time: ~75 minutes
أهداف التعلم
- وصف وضع جهاز حماية لاما 3/4 في كومة السلامة: تصنيف المدخلات، تصنيف الخروج، أو كليهما.
- أسمائ 14 فئة خطرة MLCommons وتذكر واحدة غير واضحة (إساءة تعبير الرمز).
- وصف بنية المكشوفة (غاراك): المكشوفات، الكشفات، الحبال.
- وصف بنية حملة متعددة التحولات في PyRIT وكيفية تكوينها مع صواريخ Garak.
المشكلة
تظهر الدروس 12-15 سطح الهجوم. تحتاج عمليات الإنتاج إلى تقييم قابل للتكرار. تهيمن ثلاثة أدوات على عام 2026: حرس اللاما (مصنف الدفاع) ، غاراك (الماسح) ، بيريت (مؤلف الحملة). يستهدف كل منها طبقة مختلفة من دورة حياة الفريق الأحمر.
المفهوم
حارس اللاما (ميتا)
إن Llama Guard 3 هو نموذج Llama-3.1-8B تم ضبطه بشكل جيد لتصنيف المدخلات / الخروج على MLCommons AILuminate 14 فئة:
- جرائم العنف، جرائم غير العنف، جنسي، CSAM، التشهير
- نصائح متخصصة، الخصوصية، الملكية الفكرية، الأسلحة العشوائية، الكراهية
- الانتحار/إيذاء الذات، المحتوى الجنسي، الانتخابات، إساءة استخدام مترجم الرمز
يدعم 8 لغات. استخدام: وضع قبل LLM (توسيع المدخلات) ، بعد LLM (توسيع الناتج) ، أو كليهما. تستخدم كلا الاستخدامين لتوليد توزيعات تدريب مختلفة سفن Llama Guard 3 كنموذج واحد يتعامل مع كليهما.
إن Llama Guard 3-1B-INT4 (arXiv:2411.17713, 440MB, ~ 30 رمزا/ ثانية على جهاز CPU المحمول) هو التغير الحدودي المعدني.
إن حرس إلاما 4 (أبريل 2025) هو 12B، متعدد الحركات الأصلية، تم قصه من إلاما 4 سكوت. إنه يحل محل كل من نص 8B والنسخة الرؤية 11B مع تصنيف واحد يتناول النص + الصور.
غاراك (NVIDIA)
مسح الضعف مفتوح المصدر.
- Probes.مولدات الهجوم للهلوسة، تسرب البيانات، حقن سريع، السموم، إزالة السرية. ثابتة (مطلوبات ثابتة) ، ديناميكية (مطلوبات مولدة) ، تكييفية (ترد على المخرج المستهدف).
- Detectors.نتائج النتائج مقابل أوضاع الفشل المتوقعة سمية، تسرب، jailbreak.
- Harnesses.إدارة أزواج الكشف عن المكثفات، تشغيل حملات، توليد التقارير.
يدمج TrustyAI Garak مع درع Llama-Stack (مصنف المدخل Prompt-Guard-86M ، تصنيف خروج Llama-Guard-3-8B) لتقييم الهدف المُحمي من النهاية إلى النهاية. تستبدل تسجيل مستوى (TBSA) المُستند إلى المستويات الثنائية من المُجازاة / الفشل. يمكن أن يمر نموذج في مستوى الحد 3 ويفشل في مستوى الحد 5 على نفس الص Sonda.
(مايكروسوفت)
مجموعة أدوات تحديد المخاطر في بايثون، حملات فريق أحمر متعددة التحولات، بنيت حول:
- Converters.تحويل طلب البذور إعادة التعبير، تشفير، ترجمة، لعب دور.
- Orchestrators.إدارة الحملة: Crescendo (التصاعد) ، TAP (الفرع) ، RedTeaming (حلقة مخصصة).
- Scoring.ماجستير في مجال القانون كقاضي أو مصنف في مجال القاضي
يدير "جراك" الآلاف من صواريخ ذات دورة واحدة؛ ويقوم "بايريت" بمسيرات عميقة متعددة التحولات مصممة لفك أنماط الفشل المحددة.
-المركبة
ضع حراسة إلاما على جانبي النموذج. تشغيل غاراك كل ليلة للتراجع. تشغيل PyRIT للحملات المسبقة للإصدار. هذا هو تكوين افتراضي 2026 لمعظم عمليات الإنتاج.
مشاكل التقييم
- Judge identity.يمكن لكل الأدوات الثلاث استخدام قاضي LLM؛ أجهزة تحديد الكليبرات للمحكم ذكرت ASRs (الدرس 12). تحديد القاضي جنبا إلى جنب مع الأداة.
- Probe staleness.تُعمر أجهزة جراك عندما يتم تصليح النماذج ضدها. تُعمر أجهزة جرافة قابلة للتكيف (شكل PAIR) أبطأ من أجهزة جرافة ثابتة.
- Llama Guard FPR on benign content.الإصدارات المبكرة من حرس إلاما كانت تحتوي على محتوى سياسي و LGBTQ + ؛ تم تحسين تصفيات حرس إلاما 3/4 ولكن لم يتم تصفيفها لكل نشر.
حيث يتناسب هذا مع المرحلة 18
الدروس 12-15 هي أفراد الهجوم. الدروس 16 هي أدوات الإنتاج. الدروس 17 (WMDP) هي تقييم القدرة على الاستخدام المزدوج. الدروس 18 هي إطار السلامة الحدودية التي تغلف هذه الأدوات في هيكل سياسة.
استخدمها
code/main.pyيُبني تصنيف لعبة على طراز Llama Guard (كلمة مفتاحة + ميزات معنوية على 14 فئة) ، وسلسلة Garak لعبة (حلقة كشف الصور) ، وسلسلة تحويل متعددة التحولات على طراز PyRIT. يمكنك تشغيل الأدوات الثلاثة ضد هدف مزيف ومراقبة توقيعات التغطية المختلفة.
أرسله
هذا الدرس يُنتجoutputs/skill-red-team-stack.md. في ظل وصف النشر، يذكر أي من الأدوات الثلاثة مناسبة، وما الذي يجب تكوينه في كل منها، وما هي سيرة التراجع التي يجب تشغيلها.
التمارين
- أركض
code/main.py. مقارنة معدل الكشف عن تصنيف "لاما-غارد" على الهجمات ذات التحول الواحد مقابل الهجمات المتعددة التحول
- قم بتنفيذ صفقة جديدة من "جراك": طلب ضار مرموز بنس 64، وقم بتحديد اكتشافه بواسطة تصنيف "لاما غارد".
- تمديد سلسلة محولات الطراز PyRIT مع محول "ترجمة إلى الفرنسية، ثم تعبير" إعادة قياس نجاح الهجوم.
- اقرأ قائمة فئات الخطر في Llama Guard 3. حدد فئتين حيث ستنتج بيانات التدريب بشكل واقعي معدلات إيجابية كاذبة عالية على محتوى المطور الشرعي.
- مقارنة مبادئ تصميم Garak و PyRIT.
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| Llama Guard | "the classifier" | Fine-tuned Llama-3.1-8B/4-12B safety classifier with 14 hazard categories |
| Garak | "the scanner" | NVIDIA open-source vulnerability scanner; probes, detectors, harnesses |
| PyRIT | "the campaign tool" | Microsoft multi-turn red-team orchestrator; converters, orchestrators, scoring |
| Prompt-Guard | "the small classifier" | Meta's 86M prompt-injection classifier, paired with Llama Guard |
| TBSA | "tier-based scoring" | Garak's tier-based pass/fail replacing binary outcomes |
| Converter chain | "paraphrase + encode + ..." | PyRIT composition primitive for building multi-step attacks |
| MLCommons hazard categories | "the 14 taxonomies" | Industry-standard taxonomy Llama Guard targets |
المزيد من القراءة
- Meta — Llama Guard 3 (in Llama 3 Herd paper, arXiv:2407.21783) تصنيف 8ب
- Meta — Llama Guard 3-1B-INT4 (arXiv:2411.17713) تصنيف محمول كمي
- NVIDIA Garak — GitHub إعادة التأمين والوثائق
- Microsoft PyRIT — GitHub مجموعة أدوات الحملة
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.