أنظمة الاعتدال OpenAI, Perspective, Llama Guard
omni-moderation-latest(2024) مبني على GPT-4o يصنف النص + الصور في مكالمة واحدة؛ أفضل بنسبة 42% على مجموعة اختبار متعددة اللغات من الإصدار السابق؛ نظام الاستجابة يعيد 13 فئة بوليون التحرش / التهديد ، الكراهية / التهديد ، الكراهية / التهديد ، غير المشروعة ، غير المشروعة / العنيفة ، إيذاء الذات ، إيذاء الذات / النية ، إيذاء الذات / التعليمات ، الجنسية ، الجنسية / القصر ، العنف / الرسومية ؛ مجاني بالنسبة لمعظم المطورين. أنماط طبقاتية: تدبير المدخل (قبل الجيل) ، تدبير الخروج (بعد الجيل) ، تدبير مخصص (قواعد النطاق). مكالمات متوازية غير متزامنة تخفي تأخر؛ استجابات الموقع على العلم. حرس اللما 3/4 (المدرسة 16): 14 مخاطر من MLCommons، إساءة استخدام مترجم الرمز، 8 لغات (v3), متعددة الصور (v4). API المطلوبة (جوجل جيغسو): درجة السموم قبل موجة LLM كموسيط؛ السموم الأساسي الأبعاد الواحدة مع التغيرات السمومية الشديدة / الإهانة / الكلام السيء؛ خطة أساسية للبحوث المتوسطة المحتوى. التخفيف: تم إبطال منتظم محتوى Azure في فبراير 2024، وتقاعد في فبراير 2027, واستبدالها بأمان محتوى Azure AI.Type: Build
Languages: Python (stdlib, three-layer moderation harness)
Prerequisites: Phase 18 · 16 (Llama Guard / Garak / PyRIT)
Time: ~60 minutes
أهداف التعلم
- وصف تصنيف الفئة من API OpenAI Moderation وكيف تختلف عن مجموعة MLCommons من Llama Guard 3.
- وصف نمط الطبقة الثلاثة (المدخل، الخروج، التخصيص) وتسمية وضع فشل واحد لكل منها.
- وصف موقف API البصرية كخط أساسي قبل عصر LLM ولماذا لا يزال يستخدم في البحوث.
- إضافة خط زمني لتحديد التخلفات في Azure.
المشكلة
دروس 12-16 تصف الهجمات والأدوات الدفاعية. دروس 29 تغطي أنظمة الاعتدال المنشورة التي تعمل على الدفاعات في السطح الذي يلمسه فيه المستخدمون المنتج. النمط الثلاثي الطبقة هو تكوين 2026 الافتراضي.
المفهوم
API OpenAI معتدلة
omni-moderation-latest(2024). بنيت على GPT-4o. تصنف النص + الصور في مكالمة واحدة. مجاني لمعظم المطورين.
الفئات (13 بولين في مخطط الاستجابة):
- التحرش، التحرش/التهديد
- الكراهية، الكراهية/التهديد
- إيذاء الذات، إيذاء الذات/النوايا، إيذاء الذات/التعليمات
- الجنسية، الجنسية/الأطفال
- العنف، العنف/الرسومات
- غير مشروع، غير مشروع/عنيف
الدعم المتعدد الحسابات ينطبق على violence،self-harmوsexualلكن ليسsexual/minorsالبقية فقط نصية
لـ (مُسَمَعَةَ)code/main.pyنحن ننهار/threatening،/intent،/instructionsو/graphicوذلك من أجل سهولة التعليم. يجب أن يستخدم رمز الإنتاج مخطط 13 فئة كاملة.
42٪ أفضل في مجموعة اختبارات متعددة اللغات من نقطة نهاية الاعتدال السابقة.
حرس اللاما 3/4
تغطي دراسة 16. 14 فئات الخطر MLCommons (منظمة بشكل مختلف عن 13 خطة الاستجابة-الخطط البولية OpenAI). يدعم 8 لغات (v3). Llama Guard 4 (أبريل 2025) هو متعدد الطرق الأصلية، 12B.
تعتبر تقسيمات OpenAI وLlama Guard متداخلة ولكن تختلف. OpenAI لديها "غير مشروع" كفئة واسعة. تحتوي Llama Guard على "جرائم عنيفة" و "جرائم غير عنيفة" بشكل منفصل. يتم اختيار التنفيذات بناءً على تناسبها السياسة-التقسيم.
API المطلوب (جوجل جيغسو)
نظام دراسة السموم قبل موجة LLM-as-moderator (قبل عام 2020). فئات: السموم، السموم_السموم، الحوادث، الاحتقار، التهديد، الهوية_الاعتداء. دراسة أولية ذات ابعد واحد (السموم) مع اختلافات أجزاء.
يستخدم على نطاق واسع كخط أساس للبحث في الاعتدال المحتوى لأن API مستقرة وموثقة ولها سنوات من بيانات التصفية. بالنسبة لحالات الاستخدام الحديثة المجاورة لـ LLM ، فإن Llama Guard أو OpenAI Moderation عادة ما تكون مناسبة أفضل.
النمط ثلاثي الطبقات
- Input moderation.تصنيف طلب المستخدم قبل توليد. رفض إذا تم وضع علامة. تأخير: مكالمة تصنيف واحد.
- Output moderation.تصنيف خروج النموذج قبل التسليم. استبدل برفض إذا تم وضع علامة. تأخر: مكالمة تصنيفية واحدة بعد الجيل.
- Custom moderation.القواعد المحددة للسلطات (المرجع، القوائم المسموحة، سياسة الأعمال).
الطبقات الثلاث متسلسلة من حيث التصميم: يجب أن يتم تعديل المدخل قبل توليد، وتتدفق معدل الخروج بعد توليد. التوازي ينطبق داخل طبقة تشغيل مصنفات متعددة (على سبيل المثال، OpenAI Moderation + Llama Guard + Perspective) في وقت واحد على نفس النص يخفي تأخر لكل مصنف. كتحسين اختياري، يمكن عرض استجابة محفظة المواقع ("لحظة واحدة، التحقق...") بينما يتم إكمال تدبير المدخل وتأجيل تدفق التوقيت 1. سلوك العلم قابلة للتكوين: رفض، تصفية، تصاعد إلى مراجعة البشر.
أساليب الفشل
- Input only.لا يلتقط الهلوسات الخارجة (تدريبات التشفير 12-14 تفشل من تصنيفات المدخلات).
- Output only.يسمح لأي مدخل بالوصول إلى النموذج؛ يزيد من التكلفة؛ يظهر التفكير الداخلي للمهاجم.
- Custom only.ليس قوياً عبر الفئات، والريجكس هش.
طبقات هي الافتراضية، حزام ومعاقلات
إزالة Azure
منتظم محتوى Azure: انتهى من الصلاحية في فبراير 2024، تقاعد في فبراير 2027. استبدل من خلال Azure AI Content Safety، والتي تقوم على LLM وتتكامل مع Azure OpenAI. الهجرة هي مشروع على مستوى ميدان 2024-2027 لتطبيقات Azure.
حيث يتناسب هذا مع المرحلة 18
يتناول الدروس 16 أدوات الاعتدال في سياق الفريق الأحمر. يتناول الدروس 29 الاعتدال المنشط. يختتم الدروس 30 مع دليل القدرة على الاستخدام المزدوج الحالي.
استخدمها
code/main.pyيُبني حزمة تدبير ثلاث طبقات: مدير المدخل (كلمة رئيسية + درجة فئة) ، مدير الخروج (المصنف نفسه على الخروج) ، مدير مخصص (قواعد النطاق). يمكنك تشغيل المدخلات من خلال ومراقبة الطبقة التي تسلم ما.
أرسله
هذا الدرس يُنتجoutputs/skill-moderation-stack.md. في ظل التنفيذ، يوصي بتكوين كومة الاعتدال: أي تصنيف عند المدخل، أي عند الخروج، أي قواعد مخصصة، وما الذي يحكم في الحالات الحافة.
التمارين
- أركض
code/main.py- إشغال مدخلات خفيفة، حدودية، ضارة من خلال كلّ الطبقات الثلاثة، واطلاع على الطبقة التي تنطلق لكلّ منها
- تمديد الحزام مع تسجيل السموم على فئة معينة على النمط من Perspective-API. مقارنة سلوك العدالة له مع درجة الفئة.
- اقرأ وثائق API OpenAI Moderation و قائمة فئة Llama Guard 3. خريط كل فئة OpenAI إلى أقرب فئات Llama Guard. حدد ثلاث فئات لا خريط نظيف.
- صمم كومة تدبير لتطبيق مساعد البرمجة (مثل GitHub Copilot). حدد الفئات الأكثر أهمية وأقل أهمية واقترح قواعد مخصصة.
- يتقاعد منتظم محتوى Azure في فبراير 2027. خطط للهجرة إلى أزور AI Safety Content. حدد العنصر الأكثر مخاطرًا في الهجرة.
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| OpenAI Moderation | "omni-moderation-latest" | GPT-4o-based 13-category (text) classifier with partial multimodal support |
| Perspective API | "Google Jigsaw toxicity" | Pre-LLM-era toxicity scoring baseline |
| Llama Guard | "MLCommons 14-category" | Meta's hazard classifier (v3: 8B text, 8 langs; v4: 12B multimodal) |
| Input moderation | "pre-generation filter" | Classifier on user prompt before model call |
| Output moderation | "post-generation filter" | Classifier on model output before delivery |
| Custom moderation | "domain rules" | Deployment-specific rules (regex, allowlist, policy) |
| Layered moderation | "all three layers" | Standard production deployment pattern |
المزيد من القراءة
- OpenAI Moderation API docs نقطة نهاية التواضع المتعدد
- Meta PurpleLlama + Llama Guard إعادة تأهيل الحرس
- Google Jigsaw Perspective API تسجيل السموم
- Azure AI Content Safety استبدال Azure
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.