मॉडरेशन सिस्टम ओपनएआई, परिप्रेक्ष्य, लामा गार्ड
omni-moderation-latest(2024) जीपीटी-4o पर आधारित एक कॉल में पाठ + छवियों को वर्गीकृत करता है; पूर्व संस्करण की तुलना में बहुभाषी परीक्षण सेट पर 42% बेहतर; प्रतिक्रिया योजना 13 श्रेणी बुलियन लौटाता है उत्पीड़न, उत्पीड़न/धमका, घृणा, घृणा/धमका, अवैध, अवैध/हिंसा, आत्म-हानि, आत्म-हानि/उद्देश्य, आत्म-हानि/निर्देश, यौन, यौन/अवयोक्त, हिंसा, हिंसा/ग्राफिक; अधिकांश डेवलपर्स के लिए मुफ्त। परत पैटर्नः इनपुट मॉडरेशन (पूर्व-उत्पादन), आउटपुट मॉडरेशन (पश्चात-उत्पादन), कस्टम मॉडरेशन (डोमेन नियम) । असिनक समानांतर कॉल विलंबता छिपा; ध्वज पर स्थानधारक प्रतिक्रियाएं। लामा गार्ड 3/4 (पाठ 16): 14 एमएलसी कॉमन्स के खतरे, कोड इंटरप्रिटर दुरुपयोग, 8 भाषाएं (v3), मल्टी-इमेज (v4) । परिप्रेक्ष्य एपीआई (Google Jigsaw): एलएलएम-ए-मॉडरेटर लहर से पहले विषाक्तता स्कोरिंग; मुख्य रूप से गंभीर विषाक्तता/अपमान/शर्मनिष्ठा संस्करणों के साथ एकल आयामी विषाक्तता; सामग्री-मॉडरेशन अनुसंधान के लिए आधार। अवमूल्यनः Azure Content Moderator को फरवरी 2024 में समाप्त कर दिया गया, फरवरी 2027 में सेवानिवृत्त कर दिया गया, और Azure AI Content Safety द्वारा प्रतिस्थापित किया गया।Type: Build
Languages: Python (stdlib, three-layer moderation harness)
Prerequisites: Phase 18 · 16 (Llama Guard / Garak / PyRIT)
Time: ~60 minutes
सीखने के लक्ष्य
- ओपनएआई मॉडरेशन एपीआई की श्रेणी वर्गीकरण का वर्णन करें और यह लामा गार्ड 3 के एमएलसी कॉमन्स सेट से कैसे भिन्न है।
- तीन मॉडरेशन लेयर पैटर्न (इनपुट, आउटपुट, कस्टम) का वर्णन करें और प्रत्येक में एक विफलता मोड का नाम दें।
- एलएलएम-युग से पहले की आधारशिला के रूप में पर्सपेक्टिव एपीआई की स्थिति का वर्णन करें और इसका प्रयोग अनुसंधान में क्यों जारी है।
- Azure अवमूल्यन समयरेखा बताएँ।
समस्या
पाठ 12-16 में हमलों और रक्षा उपकरण का वर्णन किया गया है। पाठ 29 में तैनात मॉडरेशन सिस्टम शामिल हैं जो सतह पर रक्षा को संचालित करते हैं जहां उपयोगकर्ता उत्पाद को छूते हैं। तीन परत पैटर्न 2026 डिफ़ॉल्ट कॉन्फ़िगरेशन है।
अवधारणा
OpenAI मॉडरेशन एपीआई
omni-moderation-latest(2024). जीपीटी-4o पर बनाया गया। एक कॉल में पाठ + छवियों को वर्गीकृत करता है। अधिकांश डेवलपर्स के लिए मुफ्त।
श्रेणियाँ (13 प्रतिक्रिया योजना में बुलियन):
- उत्पीड़न, उत्पीड़न/धमका
- घृणा, घृणा/धमकी
- आत्म-हानि, आत्म-हानि/उद्देश्य, आत्म-हानि/निर्देश
- यौन, यौन/अन्यजाति
- हिंसा, हिंसा/ग्राफिक
- अवैध, अवैध/हिंसापूर्ण
बहुआयामी सहायता लागू होती है violence,self-harmऔर sexualलेकिन नहींsexual/minorsबाकी केवल पाठ के लिए हैं।
कोड हर्न के लिए code/main.pyहम ढह /threatening,/intent,/instructionsऔर /graphicशैक्षणिक सरलता के लिए उप-श्रेणियों को अपने शीर्ष स्तर के माता-पिता में रखा जाना चाहिए। उत्पादन कोड में 13 श्रेणियों की योजना का उपयोग करना चाहिए।
बहुभाषी परीक्षण सेट पर पूर्व-जनरेशन मॉडरेशन एंडपॉइंट की तुलना में 42% बेहतर। प्रति श्रेणी स्कोर; अनुप्रयोगों ने सीमाएं निर्धारित कीं।
लामा गार्ड 3/4
पाठ 16 में कवर किया गया। 14 एमएलसी कॉमन्स जोखिम श्रेणियां (ओपनएआई के 13 प्रतिक्रिया-स्कीम बुलियन से अलग तरीके से संगठित) । 8 भाषाओं (v3) का समर्थन करता है। लामा गार्ड 4 (अप्रैल 2025) मूल रूप से बहुआयामी है, 12 बी।
ओपनएआई और लामा गार्ड टैक्सोनोमी ओवरलैप होती हैं लेकिन भिन्न होती हैं। ओपनएआई में "अवैध" एक व्यापक श्रेणी के रूप में है; लामा गार्ड में "हिंसा अपराध" और "नॉन-हिंसा अपराध" अलग-अलग हैं। तैनाती उनकी नीति-टैक्सोनोमी फिट के आधार पर चुनते हैं।
परिप्रेक्ष्य एपीआई (Google Jigsaw)
एलएलएम-ए-मॉडरेटर लहर (पूर्व-2020) से पहले विषाक्तता स्कोरिंग प्रणाली। श्रेणियांः विषाक्तता, गंभीरता_विषाक्तता, आक्रमण, अज्ञानता, धमकी, पहचान_हमला। उप-आयामी संस्करणों के साथ एकल आयामी प्राथमिक स्कोर (विषाक्तता) ।
सामग्री-मध्यमता अनुसंधान आधार के रूप में व्यापक रूप से उपयोग किया जाता है क्योंकि एपीआई स्थिर, प्रलेखित और वर्षों के माप डेटा के साथ है। आधुनिक एलएलएम-समीपत्य उपयोग मामलों के लिए, लामा गार्ड या ओपनएआई मॉडरेशन आमतौर पर बेहतर फिट होता है।
तीन परत पैटर्न
- Input moderation.प्रयोक्ता के प्रॉम्प्ट को जनरेशन से पहले वर्गीकृत करें. यदि चिह्नित है तो अस्वीकार करें. लटेंसीः एक वर्गीकरण कॉल।
- Output moderation.डिलीवरी से पहले मॉडल के आउटपुट को वर्गीकृत करें। यदि चिह्नित है तो अस्वीकार के साथ प्रतिस्थापित करें। लटेंसीः पीढ़ी के बाद एक वर्गीकरण कॉल।
- Custom moderation.डोमेन-विशिष्ट नियम (रेजेक्स, अनुमतियों, व्यावसायिक नीति) । इनपुट या आउटपुट पर चलाया जाता है।
तीन परतें डिजाइन द्वारा अनुक्रमिक हैंः इनपुट मॉडरेशन को उत्पादन से पहले पूरा होना चाहिए, और आउटपुट मॉडरेशन पीढ़ी के बाद चलता है। समानांतर एक परत के भीतर लागू होता है कई वर्गीकरण (जैसे, ओपनएआई मॉडरेशन + लामा गार्ड + परिप्रेक्ष्य) एक ही पाठ पर एक साथ चल रहा है। वैकल्पिक अनुकूलन के रूप में, एक प्लेसहोल्डर प्रतिक्रिया ("एक क्षण, जांच ...") प्रदर्शित की जा सकती है जबकि इनपुट मॉडरेशन पूरा होता है और टोकन-1 स्ट्रीमिंग स्थगित की जाती है। ध्वज व्यवहार को कॉन्फ़िगर किया जा सकता हैः अस्वीकार, स्वच्छ, मानव समीक्षा के लिए बढ़ना।
विफलता मोड
- Input only.आउटपुट हल्यूसिनेशन को नहीं पकड़ता (पाठ 12-14 एन्कोडिंग हमले इनपुट वर्गीकरण को बायपास करते हैं) ।
- Output only.किसी भी प्रविष्टि को मॉडल तक पहुंचने की अनुमति देता है; लागत बढ़ाता है; हमलावर के लिए आंतरिक तर्क को सतह पर लाता है।
- Custom only.श्रेणियों के बीच मजबूत नहीं; रेजेक्स नाजुक हैं।
परतों में डिफ़ॉल्ट है बेल्ट और निलंबन.
Azure अवमूल्यन
Azure Content Moderator: अप्रचलित फरवरी 2024, सेवानिवृत्त फरवरी 2027. इसकी जगह Azure AI Content Safety ले ली गई है, जो LLM आधारित है और Azure OpenAI के साथ एकीकृत है। माइग्रेशन Azure तैनाती के लिए 2024-2027 के क्षेत्र स्तर की परियोजना है।
जहां यह चरण 18 में फिट बैठता है
पाठ 16 लाल टीम के संदर्भ में मॉडरेशन टूलिंग को कवर करता है। पाठ 29 तैनात मॉडरेशन को कवर करता है। पाठ 30 वर्तमान दोहरे उपयोग क्षमता साक्ष्य के साथ समाप्त होता है।
इसका प्रयोग करें
code/main.pyतीन परतों के मॉडरेशन हर्नस का निर्माण करता हैः इनपुट मॉडरेटर (कीवर्ड + श्रेणी स्कोर), आउटपुट मॉडरेटर (आउटपुट पर एक ही वर्गीकरण), कस्टम मॉडरेटर (डोमेन नियम) । आप इनपुट को चला सकते हैं और देख सकते हैं कि कौन सी परत क्या पकड़ती है।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-moderation-stack.md. एक तैनाती को देखते हुए, यह एक मॉडरेशन स्टैक कॉन्फ़िगरेशन की सिफारिश करता हैः कौन सा वर्गीकरण इनपुट पर, कौन सा आउटपुट पर, कौन सा कस्टम नियम, और किनारे मामलों के लिए कौन सा न्यायाधीश है।
व्यायाम
- दौड़ें
code/main.py. तीनों परतों में एक सौम्य, सीमा और हानिकारक इनपुट चलाएं. प्रत्येक परत के लिए किस परत की आग लगती है।
- किसी विशिष्ट श्रेणी पर पर्सपेक्टिव-एपीआई शैली की विषमता स्कोरिंग के साथ हर्नर का विस्तार करें। श्रेणी स्कोर के साथ इसकी सीमा व्यवहार की तुलना करें।
- OpenAI मॉडरेशन एपीआई डॉक्स और लामा गार्ड 3 श्रेणी सूची पढ़ें। प्रत्येक OpenAI श्रेणी को निकटतम लामा गार्ड श्रेणियों में मानचित्रित करें। तीन श्रेणियों की पहचान करें जो साफ-सुथरी मानचित्रण नहीं करते हैं।
- कोड-सहायक तैनाती (जैसे, GitHub Copilot) के लिए एक मॉडरेशन स्टैक डिजाइन करें। सबसे अधिक और कम से कम प्रासंगिक श्रेणियों की पहचान करें और कस्टम नियम प्रस्तावित करें।
- Azure Content Moderator फरवरी 2027 में सेवानिवृत्त हो जाएगा। Azure AI Content Safety में एक माइग्रेशन की योजना बनाएं। माइग्रेशन के उच्चतम जोखिम वाले तत्व की पहचान करें।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| OpenAI Moderation | "omni-moderation-latest" | GPT-4o-based 13-category (text) classifier with partial multimodal support |
| Perspective API | "Google Jigsaw toxicity" | Pre-LLM-era toxicity scoring baseline |
| Llama Guard | "MLCommons 14-category" | Meta's hazard classifier (v3: 8B text, 8 langs; v4: 12B multimodal) |
| Input moderation | "pre-generation filter" | Classifier on user prompt before model call |
| Output moderation | "post-generation filter" | Classifier on model output before delivery |
| Custom moderation | "domain rules" | Deployment-specific rules (regex, allowlist, policy) |
| Layered moderation | "all three layers" | Standard production deployment pattern |
आगे पढ़ना
- OpenAI Moderation API docs सर्व-मध्यमता अंत बिंदु
- Meta PurpleLlama + Llama Guard लामा गार्ड रेपो
- Google Jigsaw Perspective API विषाक्तता स्कोरिंग
- Azure AI Content Safety Azure प्रतिस्थापन
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.