Phase 18: Ethics, Safety & Alignment

मॉडरेशन सिस्टम ओपनएआई, परिप्रेक्ष्य, लामा गार्ड

उत्पादन विनियमन प्रणालियों ने पाठ 12-16 में परिभाषित सुरक्षा नीतियों को परिचालन में लाया।omni-moderation-latest(2024) जीपीटी-4o पर आधारित एक कॉल में पाठ + छवियों को वर्गीकृत करता है; पूर्व संस्करण की तुलना में बहुभाषी परीक्षण सेट पर 42% बेहतर; प्रतिक्रिया योजना 13 श्रेणी बुलियन लौटाता है उत्पीड़न, उत्पीड़न/धमका, घृणा, घृणा/धमका, अवैध, अवैध/हिंसा, आत्म-हानि, आत्म-हानि/उद्देश्य, आत्म-हानि/निर्देश, यौन, यौन/अवयोक्त, हिंसा, हिंसा/ग्राफिक; अधिकांश डेवलपर्स के लिए मुफ्त। परत पैटर्नः इनपुट मॉडरेशन (पूर्व-उत्पादन), आउटपुट मॉडरेशन (पश्चात-उत्पादन), कस्टम मॉडरेशन (डोमेन नियम) । असिनक समानांतर कॉल विलंबता छिपा; ध्वज पर स्थानधारक प्रतिक्रियाएं। लामा गार्ड 3/4 (पाठ 16): 14 एमएलसी कॉमन्स के खतरे, कोड इंटरप्रिटर दुरुपयोग, 8 भाषाएं (v3), मल्टी-इमेज (v4) । परिप्रेक्ष्य एपीआई (Google Jigsaw): एलएलएम-ए-मॉडरेटर लहर से पहले विषाक्तता स्कोरिंग; मुख्य रूप से गंभीर विषाक्तता/अपमान/शर्मनिष्ठा संस्करणों के साथ एकल आयामी विषाक्तता; सामग्री-मॉडरेशन अनुसंधान के लिए आधार। अवमूल्यनः Azure Content Moderator को फरवरी 2024 में समाप्त कर दिया गया, फरवरी 2027 में सेवानिवृत्त कर दिया गया, और Azure AI Content Safety द्वारा प्रतिस्थापित किया गया।

Type: Build

Languages: Python (stdlib, three-layer moderation harness)

Prerequisites: Phase 18 · 16 (Llama Guard / Garak / PyRIT)

Time: ~60 minutes

सीखने के लक्ष्य

  • ओपनएआई मॉडरेशन एपीआई की श्रेणी वर्गीकरण का वर्णन करें और यह लामा गार्ड 3 के एमएलसी कॉमन्स सेट से कैसे भिन्न है।
  • तीन मॉडरेशन लेयर पैटर्न (इनपुट, आउटपुट, कस्टम) का वर्णन करें और प्रत्येक में एक विफलता मोड का नाम दें।
  • एलएलएम-युग से पहले की आधारशिला के रूप में पर्सपेक्टिव एपीआई की स्थिति का वर्णन करें और इसका प्रयोग अनुसंधान में क्यों जारी है।
  • Azure अवमूल्यन समयरेखा बताएँ।

समस्या

पाठ 12-16 में हमलों और रक्षा उपकरण का वर्णन किया गया है। पाठ 29 में तैनात मॉडरेशन सिस्टम शामिल हैं जो सतह पर रक्षा को संचालित करते हैं जहां उपयोगकर्ता उत्पाद को छूते हैं। तीन परत पैटर्न 2026 डिफ़ॉल्ट कॉन्फ़िगरेशन है।

अवधारणा

OpenAI मॉडरेशन एपीआई

omni-moderation-latest(2024). जीपीटी-4o पर बनाया गया। एक कॉल में पाठ + छवियों को वर्गीकृत करता है। अधिकांश डेवलपर्स के लिए मुफ्त।

श्रेणियाँ (13 प्रतिक्रिया योजना में बुलियन):

  • उत्पीड़न, उत्पीड़न/धमका
  • घृणा, घृणा/धमकी
  • आत्म-हानि, आत्म-हानि/उद्देश्य, आत्म-हानि/निर्देश
  • यौन, यौन/अन्यजाति
  • हिंसा, हिंसा/ग्राफिक
  • अवैध, अवैध/हिंसापूर्ण

बहुआयामी सहायता लागू होती है violence,self-harmऔर sexualलेकिन नहींsexual/minorsबाकी केवल पाठ के लिए हैं।

कोड हर्न के लिए code/main.pyहम ढह /threatening,/intent,/instructionsऔर /graphicशैक्षणिक सरलता के लिए उप-श्रेणियों को अपने शीर्ष स्तर के माता-पिता में रखा जाना चाहिए। उत्पादन कोड में 13 श्रेणियों की योजना का उपयोग करना चाहिए।

बहुभाषी परीक्षण सेट पर पूर्व-जनरेशन मॉडरेशन एंडपॉइंट की तुलना में 42% बेहतर। प्रति श्रेणी स्कोर; अनुप्रयोगों ने सीमाएं निर्धारित कीं।

लामा गार्ड 3/4

पाठ 16 में कवर किया गया। 14 एमएलसी कॉमन्स जोखिम श्रेणियां (ओपनएआई के 13 प्रतिक्रिया-स्कीम बुलियन से अलग तरीके से संगठित) । 8 भाषाओं (v3) का समर्थन करता है। लामा गार्ड 4 (अप्रैल 2025) मूल रूप से बहुआयामी है, 12 बी।

ओपनएआई और लामा गार्ड टैक्सोनोमी ओवरलैप होती हैं लेकिन भिन्न होती हैं। ओपनएआई में "अवैध" एक व्यापक श्रेणी के रूप में है; लामा गार्ड में "हिंसा अपराध" और "नॉन-हिंसा अपराध" अलग-अलग हैं। तैनाती उनकी नीति-टैक्सोनोमी फिट के आधार पर चुनते हैं।

परिप्रेक्ष्य एपीआई (Google Jigsaw)

एलएलएम-ए-मॉडरेटर लहर (पूर्व-2020) से पहले विषाक्तता स्कोरिंग प्रणाली। श्रेणियांः विषाक्तता, गंभीरता_विषाक्तता, आक्रमण, अज्ञानता, धमकी, पहचान_हमला। उप-आयामी संस्करणों के साथ एकल आयामी प्राथमिक स्कोर (विषाक्तता) ।

सामग्री-मध्यमता अनुसंधान आधार के रूप में व्यापक रूप से उपयोग किया जाता है क्योंकि एपीआई स्थिर, प्रलेखित और वर्षों के माप डेटा के साथ है। आधुनिक एलएलएम-समीपत्य उपयोग मामलों के लिए, लामा गार्ड या ओपनएआई मॉडरेशन आमतौर पर बेहतर फिट होता है।

तीन परत पैटर्न

  1. Input moderation.प्रयोक्ता के प्रॉम्प्ट को जनरेशन से पहले वर्गीकृत करें. यदि चिह्नित है तो अस्वीकार करें. लटेंसीः एक वर्गीकरण कॉल।
  2. Output moderation.डिलीवरी से पहले मॉडल के आउटपुट को वर्गीकृत करें। यदि चिह्नित है तो अस्वीकार के साथ प्रतिस्थापित करें। लटेंसीः पीढ़ी के बाद एक वर्गीकरण कॉल।
  3. Custom moderation.डोमेन-विशिष्ट नियम (रेजेक्स, अनुमतियों, व्यावसायिक नीति) । इनपुट या आउटपुट पर चलाया जाता है।

तीन परतें डिजाइन द्वारा अनुक्रमिक हैंः इनपुट मॉडरेशन को उत्पादन से पहले पूरा होना चाहिए, और आउटपुट मॉडरेशन पीढ़ी के बाद चलता है। समानांतर एक परत के भीतर लागू होता है कई वर्गीकरण (जैसे, ओपनएआई मॉडरेशन + लामा गार्ड + परिप्रेक्ष्य) एक ही पाठ पर एक साथ चल रहा है। वैकल्पिक अनुकूलन के रूप में, एक प्लेसहोल्डर प्रतिक्रिया ("एक क्षण, जांच ...") प्रदर्शित की जा सकती है जबकि इनपुट मॉडरेशन पूरा होता है और टोकन-1 स्ट्रीमिंग स्थगित की जाती है। ध्वज व्यवहार को कॉन्फ़िगर किया जा सकता हैः अस्वीकार, स्वच्छ, मानव समीक्षा के लिए बढ़ना।

विफलता मोड

  • Input only.आउटपुट हल्यूसिनेशन को नहीं पकड़ता (पाठ 12-14 एन्कोडिंग हमले इनपुट वर्गीकरण को बायपास करते हैं) ।
  • Output only.किसी भी प्रविष्टि को मॉडल तक पहुंचने की अनुमति देता है; लागत बढ़ाता है; हमलावर के लिए आंतरिक तर्क को सतह पर लाता है।
  • Custom only.श्रेणियों के बीच मजबूत नहीं; रेजेक्स नाजुक हैं।

परतों में डिफ़ॉल्ट है बेल्ट और निलंबन.

Azure अवमूल्यन

Azure Content Moderator: अप्रचलित फरवरी 2024, सेवानिवृत्त फरवरी 2027. इसकी जगह Azure AI Content Safety ले ली गई है, जो LLM आधारित है और Azure OpenAI के साथ एकीकृत है। माइग्रेशन Azure तैनाती के लिए 2024-2027 के क्षेत्र स्तर की परियोजना है।

जहां यह चरण 18 में फिट बैठता है

पाठ 16 लाल टीम के संदर्भ में मॉडरेशन टूलिंग को कवर करता है। पाठ 29 तैनात मॉडरेशन को कवर करता है। पाठ 30 वर्तमान दोहरे उपयोग क्षमता साक्ष्य के साथ समाप्त होता है।

इसका प्रयोग करें

code/main.pyतीन परतों के मॉडरेशन हर्नस का निर्माण करता हैः इनपुट मॉडरेटर (कीवर्ड + श्रेणी स्कोर), आउटपुट मॉडरेटर (आउटपुट पर एक ही वर्गीकरण), कस्टम मॉडरेटर (डोमेन नियम) । आप इनपुट को चला सकते हैं और देख सकते हैं कि कौन सी परत क्या पकड़ती है।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-moderation-stack.md. एक तैनाती को देखते हुए, यह एक मॉडरेशन स्टैक कॉन्फ़िगरेशन की सिफारिश करता हैः कौन सा वर्गीकरण इनपुट पर, कौन सा आउटपुट पर, कौन सा कस्टम नियम, और किनारे मामलों के लिए कौन सा न्यायाधीश है।

व्यायाम

  1. दौड़ेंcode/main.py. तीनों परतों में एक सौम्य, सीमा और हानिकारक इनपुट चलाएं. प्रत्येक परत के लिए किस परत की आग लगती है।
  1. किसी विशिष्ट श्रेणी पर पर्सपेक्टिव-एपीआई शैली की विषमता स्कोरिंग के साथ हर्नर का विस्तार करें। श्रेणी स्कोर के साथ इसकी सीमा व्यवहार की तुलना करें।
  1. OpenAI मॉडरेशन एपीआई डॉक्स और लामा गार्ड 3 श्रेणी सूची पढ़ें। प्रत्येक OpenAI श्रेणी को निकटतम लामा गार्ड श्रेणियों में मानचित्रित करें। तीन श्रेणियों की पहचान करें जो साफ-सुथरी मानचित्रण नहीं करते हैं।
  1. कोड-सहायक तैनाती (जैसे, GitHub Copilot) के लिए एक मॉडरेशन स्टैक डिजाइन करें। सबसे अधिक और कम से कम प्रासंगिक श्रेणियों की पहचान करें और कस्टम नियम प्रस्तावित करें।
  1. Azure Content Moderator फरवरी 2027 में सेवानिवृत्त हो जाएगा। Azure AI Content Safety में एक माइग्रेशन की योजना बनाएं। माइग्रेशन के उच्चतम जोखिम वाले तत्व की पहचान करें।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
OpenAI Moderation"omni-moderation-latest"GPT-4o-based 13-category (text) classifier with partial multimodal support
Perspective API"Google Jigsaw toxicity"Pre-LLM-era toxicity scoring baseline
Llama Guard"MLCommons 14-category"Meta's hazard classifier (v3: 8B text, 8 langs; v4: 12B multimodal)
Input moderation"pre-generation filter"Classifier on user prompt before model call
Output moderation"post-generation filter"Classifier on model output before delivery
Custom moderation"domain rules"Deployment-specific rules (regex, allowlist, policy)
Layered moderation"all three layers"Standard production deployment pattern

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.