سیستم های اعتدال OpenAI، چشم انداز، نگهبان لامای
omni-moderation-latest(2024) بر اساس GPT-4o متن + تصاویر را در یک تماس طبقه بندی می کند؛ 42٪ بهتر در مجموعه تست چند زبانه از نسخه قبلی؛ طرح پاسخ 13 دسته از بولی ها را باز می گرداند آزار، آزار/ تهدید، نفرت، نفرت/ تهدید، غیرقانونی، غیرقانونی/ خشونت آمیز، خود آسیب، خود آسیب/ قصد، خود آسیب/ دستورالعمل، جنسی، جنسی/ ناچیز، خشونت، خشونت/ گرافیک؛ رایگان برای اکثر توسعه دهندگان. الگوهای لایه ای: تدبیر ورودی (پیش از تولید) ، تدبیر خروجی (پوست از تولید) ، تدبیر سفارشی (قواعد دامنه). تماس های موازی همگام تأخیر را پنهان می کنند؛ پاسخ های جای گیرنده در پرچم. نگهبان لامای 3/4 (درسی 16): 14 خطر MLCommons، سوء استفاده از مترجم کد، 8 زبان (v3) ، چند تصویر (v4). API چشم انداز (Google Jigsaw): امتیاز سمی قبل از موج LLM به عنوان مدراتور؛ سمی در درجه اول یک بعدی با انواع سمی شدید / تحقیر / بدخواهی؛ پایه برای تحقیقات اعتدال محتوا. کاهش: مدیر محتوا Azure در فوریه 2024 به پایان رسید، در فوریه 2027 بازنشسته شد و توسط امنیت محتوا Azure AI جایگزین شد.Type: Build
Languages: Python (stdlib, three-layer moderation harness)
Prerequisites: Phase 18 · 16 (Llama Guard / Garak / PyRIT)
Time: ~60 minutes
اهداف یادگیری
- طبقه بندی دسته بندی API OpenAI Moderation را توصیف کنید و نحوه تفاوت آن با مجموعه MLCommons Llama Guard 3 را توضیح دهید.
- سه مدل لایه اعتدال (دخول، خروجی، سفارشی) را توصیف کنید و یک حالت شکست را برای هر یک از آنها نام ببرید.
- موقعیت API چشم انداز را به عنوان یک خط پایه قبل از دوره LLM و اینکه چرا هنوز در تحقیقات مورد استفاده قرار می گیرد، توصیف کنید.
- جدول زمانی از کاهش قیمت Azure را بیان کنید.
مشکل
دروس 12-16 توصیف حملات و ابزار دفاعی. دروس 29 شامل سیستم های اعتدال استفاده شده است که سیستم های دفاعی را در سطح جایی که کاربران به محصول دست می دهند، عملیاتی می کنند. الگوی سه لایه پیکربندی پیش فرض 2026 است.
مفهوم
API OpenAI مودرات
omni-moderation-latest(2024). بنا شده بر روی GPT-4o. در یک تماس متن + تصاویر را طبقه بندی می کند. برای اکثر توسعه دهندگان رایگان است.
دسته ها (13 بولین در طرح پاسخ):
- آزار و اذیت، آزار و اذیت/تهدید
- نفرت، نفرت/ تهدید
- خود آسیب، خود آسیب/مقصد، خود آسیب/مراد
- جنسی، جنسی/غیرقانونی
- خشونت، خشونت/گرافیک
- غیرقانونی، غیرقانونی/جنگبار
حمایت چندرخی برای violence،self-harmوsexualاما نهsexual/minorsبقیه فقط به صورت متن میشن
براي رمزگشایی درcode/main.pyما سقوط مي کنيم/threatening،/intent،/instructionsو/graphicکدهای تولید باید از طرح 13 دسته استفاده کنند.
۴۲٪ در مجموعه آزمون چند زبانی بهتر از نقطه پایان اعتدال نسل قبلی است. نمرات در هر دسته، برنامه ها محدودیت های محدودی را تعیین می کنند.
نگهبان لاما 3/4
در درس 16 پوشش داده شده است. 14 MLCommons دسته های خطر (با تنظیم متفاوت از 13 پاسخ-شیما بولیان OpenAI). پشتیبانی از 8 زبان (v3). Llama Guard 4 (اپریل 2025) به طور بومی چند حالت، 12B است.
تگزینوم های OpenAI و Llama Guard همپوشیده اما متمایز هستند. OpenAI "غیرقانونی" را به عنوان یک دسته وسیع دارد. Llama Guard "جرم های خشونت آمیز" و "جرم های غیر خشونت آمیز" را به طور جداگانه دارد. تعینات بر اساس تگزینومیه سیاست خود انتخاب می شود.
API چشم انداز (گوگل جیگسا)
سیستم نمره گیری سمی که قبل از موج LLM-as-moderator (پیش از 2020) بود. دسته بندی ها: سمی، شدیدترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترترتر
به طور گسترده ای به عنوان یک پایه تحقیقاتی در مورد اعتدال محتوا استفاده می شود زیرا API پایدار، مستند و دارای سالها داده های کالیبریشن است. برای موارد استفاده مدرن LLM، Llama Guard یا OpenAI Moderation معمولا مناسب تر است.
الگوی سه لایه
- Input moderation.قبل از تولید، پرامپتر کاربر را طبقه بندی کنید. اگر علامت گذاری شده باشد رد کنید. تاخیر: یک تماس طبقه بندی کننده.
- Output moderation.محصول مدل را قبل از تحویل طبقه بندی کنید. اگر نشان داده شود با رد جایگزین کنید. تاخیر: یک طبقه بندی کننده بعد از تولید تماس می گیرد.
- Custom moderation.قوانین خاص دامنه (regex، allowlists، سیاست کسب و کار) در هر دو ورودی یا خروجی اجرا می شود.
سه لایه از نظر طراحی دنباله دار هستند: اعتدال ورودی باید قبل از تولید تکمیل شود و اعتدال خروجی بعد از تولید اجرا می شود. موازی در یک لایه که چندین طبقه بندی کننده (به عنوان مثال، OpenAI Moderation + Llama Guard + Perspective) را همزمان در همان متن اجرا می کند، در هر طبقه بندی، تاخیر پنهان می کند. به عنوان یک بهینه سازی اختیاری، یک پاسخ جای گیرنده ("یک لحظه، چک کردن...") ممکن است در حالی که معتدل سازی ورودی تکمیل می شود و جریان توکن-1 تعویق می شود، نشان داده شود. رفتار پرچم قابل تنظیم است: رد، پاکسازی، افزایش به بررسی انسانی.
حالت شکست
- Input only.هالوسیون های خروجی را نمی گیرد (درسه 12-14 حمله های کدگذاری طبقه بندی کننده های ورودی را دور می اندازد).
- Output only.اجازه می دهد هر گونه ورودی به مدل برسد، هزینه را افزایش می دهد، استدلال داخلی را به مهاجم می دهد.
- Custom only.در تمام دسته ها قوی نیست، ریگکس ها شکننده هستند.
طبقه بندی شده، به طور پیش فرض، کمربند و تعلیق کننده
کاهش قیمت Azure
مدیر محتوای Azure: فروری 2024، بازنشسته شده در فروری 2027. جایگزین شده توسط Azure AI Content Safety، که مبتنی بر LLM است و با Azure OpenAI ادغام می شود. مهاجرت یک پروژه سطح ساحی برای انتشار Azure 2024-2027 است.
جایی که این در مرحله 18 قرار داره
درس 16 ابزار اعتدال را در زمینه تیم قرمز پوشش می دهد. درس 29 اعتدال استفاده شده را پوشش می دهد. درس 30 با شواهد فعلی قابلیت استفاده دوگانه به پایان می رسد.
ازش استفاده کن
code/main.pyیک محافظ مودرات سه لایه را ایجاد می کند: مدراتور ورودی (کلمه کلیدی + امتیاز دسته بندی) ، مدراتور خروجی (هم طبقه بندی کننده در خروجی) ، مدراتور سفارشی (قواعد دامنه). شما می توانید ورودی را از طریق اجرا کنید و مشاهده کنید که کدام لایه چه چیزی را می گیرد.
-باده
این درس به ما کمک می کندoutputs/skill-moderation-stack.mdدر صورت استفاده، آن یک پیکربندی از پیکربندی های اعتدال را توصیه می کند: کدام طبقه بندی کننده در ورودی، کدام در خروجی، کدام قوانین سفارشی و کدام قضاوت برای موارد کناری.
تمرینات
- فرار کن
code/main.py.در هر سه لایه یک ورودی خفیف، مرزی و مضر را اجرا کنید . گزارش کنید که کدام لایه برای هر لایه ای آتش می زند
- استفاده از نمره سمیتی به سبک Perspective-API برای یک دسته خاص را گسترش دهید. رفتار حد آن را با نمره دسته مقایسه کنید.
- اسناد API OpenAI Moderation و لیست دسته بندی Llama Guard 3 را بخوانید. هر دسته بندی OpenAI را به نزدیک ترین دسته بندی Llama Guard نقشه بزنید. سه دستهایی را شناسایی کنید که به درستی نقشه برداری نمی کنند.
- یک استیک اعتدال برای یک پیاده سازی دستیار کد (به عنوان مثال، GitHub Copilot) طراحی کنید. دسته بندی های مرتبط و کمتر را شناسایی کنید و قوانین سفارشی را پیشنهاد دهید.
- مدیر محتوا Azure در فوریه 2027 بازنشسته می شود. یک مهاجرت به امنیت محتوا Azure AI را برنامه ریزی کنید. عنصر خطر بالا مهاجرت را شناسایی کنید.
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| OpenAI Moderation | "omni-moderation-latest" | GPT-4o-based 13-category (text) classifier with partial multimodal support |
| Perspective API | "Google Jigsaw toxicity" | Pre-LLM-era toxicity scoring baseline |
| Llama Guard | "MLCommons 14-category" | Meta's hazard classifier (v3: 8B text, 8 langs; v4: 12B multimodal) |
| Input moderation | "pre-generation filter" | Classifier on user prompt before model call |
| Output moderation | "post-generation filter" | Classifier on model output before delivery |
| Custom moderation | "domain rules" | Deployment-specific rules (regex, allowlist, policy) |
| Layered moderation | "all three layers" | Standard production deployment pattern |
خواندن بیشتر
- OpenAI Moderation API docs نقطه پایان همه اعتدال
- Meta PurpleLlama + Llama Guard لاما گارد ریپو
- Google Jigsaw Perspective API امتیاز سمی
- Azure AI Content Safety جایگزینی Azure
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.