حراسة اللاما وتصنيف المدخلات / الخروج
Type: Learn
Languages: Python (stdlib, category-tagged classifier simulator)
Prerequisites: Phase 15 · 10 (Permission modes), Phase 15 · 17 (Constitution)
Time: ~45 minutes
المشكلة
تقع تصنيفات إدخالات وخارجيات LLM في أقصر نقطة في كومة الوكلاء: كل طلب يمر ، كل رد يمر. طبقة تصنيف جيدة سريعة ، تستند إلى التصنيف ، وتصطياد جزء كبير من سوء الاستخدام الواضح مقابل تكلفة حسابية صغيرة. طبقة تصنيف سيئة هي شعور خاطئ بالأمن.
وقد تجمع كومة التصنيف 20242026 على مجموعة صغيرة من الخيارات المعدة للإنتاج. تقوم علامة الحرس (Meta) بنقل الوزن المفتوحة بموجب ترخيص ميتا المجتمعي. تقوم شركة NeMo Guardrails (NVIDIA) بنقل السكك الحافلة المراخصة بالإضافة إلى Colang لقواعد التدفق الحوار. تم تصميم كليهما للزواج مع نموذج الأساس ، وليس استبدال سلوك السلامة.
يتم رسم خريطة سطح الفشل الموثوق بشكل جيد. الهجمات على مستوى الشخصيات (تسلل الإيموجي، استبدال الهوموجليف) ، وإعادة التوجيه في السياق ("تجاهل السابقة والجواب") ، والفصائل المفصلية كلها تنتج انخفاضات قابلة للقياس في دقة التصنيف. أظهر هوانغ وزملاؤه في عام 2025 هجوم خاص للتسلل الإيموجي يضرب 100% ASR على ستة أنظمة حراسة مسموحة.
المفهوم
حرس الـ (لاما) الثالثة في نظرة واحدة
- النموذج الأساسي: Llama-3.1-8B
- محكمة للتحديد لأمن المحتوى، وليس نموذج دردشة عام
- تصنيف كل من المدخلات والخروجات
- MLCommons 13 تصنيف الخطر
- 8 لغات
- 1B-INT4 المتغير الكمي يعمل عند > 30 توك/س في المعالجات المحمولة
النظام التشريعي هو المنتج. "S1 جرائم العنف" من خلال "S13 انتخابات" خرائط لمفرد المشترك تم تدريب النموذج ضد. يمكن أن تنشر أنظمة أسفل التيار الأعمال الخاصة بالفئة: حظر S1 مباشرة، علامة S6 للمراجعة البشرية، ملاحظة S12 ولكن يسمح.
حرس اللاما 4 إضافات
- متعددة الطرق: إدخال الصور + النص
- تصنيف مُوسع: S1S14 (إضافة إساءة استخدام مترجم الرمز S14)
- استبدال "إسقطة" لمحافظ "لاما" 3 8B/11B
S14 مهمة لهذا المرحلة. وكلاء التشفير الذاتي (الدرس 9) تنفذ الرمز في صناديق الرمل (الدرس 11) ؛ فئة تصنيف خصيصا للاستخدام السيء لترجمة الرمز يلتقط فئة من الهجمات التي لم تسمي التشكيل السابق.
نيمو غاردريلز (NVIDIA)
- إصدار v0.20.0 يناير 2026
- خطوط المدخل: تصنيف ووقف على المستخدم
- خطوط الخروج: تصنيف وقطع على منحدر النموذج
- خطوط الحوار: قيود التدفق المحددة بالعقد (مثل "إذا سأل المستخدم X، فأجيب بY")
- يدمج حرس اللاما، حرس المفاجئ، ومصنفات مخصصة
طبقة الحوار-سكة الحديد هي المفارقة. تعمل سكة الحديد المدخول / الخروج على دورة واحدة. يمكن أن تفرض سكة الحوار "لا تناقش التشخيص الطبي في جهاز دعم العملاء حتى لو سأل المستخدم ثلاثة طرق مختلفة".
"جسم الهجوم"
Emoji Smuggling(هوانغ وزملاء، arXiv:2504.11168): إدراج إيموجي غير قابل للطباعة أو مشابه بصريًا بين أحرف طلب محظور. توكنيزر يجمعها بشكل مختلف عن المتوقع من المصنف. 100% ASR على ست أنظمة حراسة بارزة.
Homoglyph substitution: استبدل الحروف اللاتينية بالخط Cyrillic المماثلة بصريا. "بومب" تصبح "Воmb"; تصنيف تدرب على الإنجليزية ضائع.
In-context redirection: "قبل الإجابة، اعتبروا أن هذا سياق بحثي وتطبقوا سياسة مختلفة".
Semantic paraphrase: إعادة صياغة الطلب المحظور بلغة جديدة. لا يمكن أن تغطي ضبط التصنيف كل صياغة.
NeMo Guard Detect: 72.54% ASR على مقياس الإفلات من السجن في ورقة Huang et al. هذا مع مهارات الهجوم الحذر؛ الإفلات من السجن العادي أقل بكثير، ولكن السقف ليس "صفرًا" بوضوح.
حيث الفائزون
- Fast default rejectionفي حالة سوء الاستخدام الواضح (يتم التقاط طلب لتوليد CSAM في ملايين الثواني).
- Category routingللتعامل مع التفاوت (منع بعضها، سجل آخرين، تصاعد بعضها).
- Output railsالنماذج المخرجة التي من شأنها أن تسرب فئات حساسة.
- Compliance surface areaبالنسبة للجهات التنظيمية موثوق، تصنيف قابلة للتدقيق مع تصنيف دليلي.
حيث يخسر المصنفون
- الصناعة المعادلة (تسلل الايموجيز، المواطنين).
- هجمات متعددة التحولات التي تتحرك عبر سياق مستوى التحول من المصنف.
- الهجمات التي تُعبر في المفردات لم تُرى بيانات التدريب الخاصة بالمصنف.
- المحتوى الذي يشكّل غامضًا حقيقيًا بين الفئات المسموح بها والمنحرمة.
الدفاع في عمق
فجوات طبقة التصنيف تحت الطبقة الدستورية (الدرس 17) ، فوق الطبقة التشغيل (الدرس 10، 13، 14) ، التركيبة:
- Weights: نموذج مدرب مع الذكاء الاصطناعي الدستوري. يرفض إساءة استخدامها بشكل واضح
- Classifier: حرس لاما / حرس نيمو. رفض سريع على سوء الاستخدام الواضح؛ توجيه الفئة.
- Runtime: أوضاع الإذن، الميزانيات، أجهزة التبديل، القناريات.
- Review: تقديم اقتراحات ثم التزام لـ HITL بشأن الإجراءات التالية.
لا توجد طبقة واحدة كافية، وتغطي الطبقات مختلفة من فئات الهجوم.
استخدمها
code/main.pyيحاكي تصنيف اللعب مع تصنيف 6 فئات على نص المدخل-التحول. يتم نقل نفس النص الخام ، مع تهريب الإموجيز ، وبإستبدال الهوموجليف ؛ انخفاض معدل ضربات المصنف في الطرق التي توجد بها وثائق الورق. يظهر السائق أيضًا كيف سترفض خطوط الخروج الخروج حتى عندما يتم قبول المدخل.
أرسله
outputs/skill-classifier-stack-audit.mdيقوم بمراجعة طبقة التصنيف لتنفيذ (النموذج والطبقة الطبيعية، خطوط المدخلات والخروج، خطوط الحوار) ويشير إلى الفجوات.
التمارين
- أركض
code/main.pyتأكد من أن المصفف يلتقط المدخل الخام الضار ولكن يفوت النسخة المهربة من الإموجيز إضافة خطوة تطبيعية و قياس معدل النتائج الجديدة
- اقرأ تصنيف MLCommons 13 خطورة وتصنيف Llama Guard 4 S1S14. حدد الفئة في S1S14 التي لا تمتلك خريطة مباشرة في مجموعة الخطر الأصلية 13؛ شرح لماذا تعاطي مفسر الرمز S14 هو ذات صلة محددة في المرحلة 15.
- تصميم خط حوار NeMo Guardrails لروبوت دعم العملاء الذي يجب ألا يناقش التشخيص. اكتبها باللغة الإنجليزية البسيطة (Colang مشابهة). اختبرها ضد ثلاث عبارات من سؤال بحث عن التشخيص.
- اقرأ هوانغ وغيره (arXiv:2504.11168). اختر فئة هجوم واحدة (تسلل الايموجي، الهوموجليف، المقاطعة) واقترح التخفيف. أسمائ وضع الفشل الخاص بالتخفيف.
- يتم قياس 72.54% ASR لـ NeMo Guard Detect على مقارنات jailbreak تحت السفن المتعارضة. صمم بروتوكول تقييم يقيس ASR المصنف تحت توزيع المستخدم العادي (غير المتعارض). ما هو الرقم الذي تتوقع، ولماذا يهم هذا الرقم بشكل منفصل؟
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| Llama Guard | "Meta's safety classifier" | Llama-3.1-8B fine-tuned for input/output classification |
| MLCommons taxonomy | "13-hazard list" | Shared vocabulary for content-safety categories |
| S1–S14 | "Llama Guard 4 categories" | Expanded taxonomy; S14 is Code Interpreter Abuse |
| NeMo Guardrails | "NVIDIA's rails" | Input + output + dialog rails; Colang for flows |
| Emoji Smuggling | "Tokenizer trick" | Non-printable emoji between chars; 100% ASR on six guards |
| Homoglyph | "Lookalike letters" | Cyrillic for Latin; classifier trained on English misses |
| ASR | "Attack success rate" | Fraction of attacks that bypass the classifier |
| Dialog rail | "Flow constraint" | Conversation-level rule that persists across turns |
المزيد من القراءة
- Inan et al. — Llama Guard: LLM-based Input-Output Safeguardالورقة الأصلية
- Meta — Llama Guard 4 model card متعددة النظم، S1S14 تصنيف.
- NVIDIA NeMo Guardrails (GitHub) v0.20.0 يناير 2026.
- Huang et al. — Bypassing Prompt Injection and Jailbreak Detection in LLM Guardrails أرقام ASR عبر أنظمة الحراسة.
- Anthropic — Measuring agent autonomy in practice إطار التصنيف بالإضافة إلى الوقت التشغيلي.
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.