Phase 18: Ethics, Safety & Alignment

ابزار گروه قرمز گاراک، نگهبان لاما، پیریت

سه ابزار توليدي به سمت گروه سرخ سال 2026 باز مي گردد. Llama Guard (Meta) یک طبقه بندی کننده Llama-3.1-8B که در 14 دسته خطر MLCommons تنظیم شده است؛ Llama Guard 4 2025 یک طبقه بندی کننده 12B مولتیمولدال بومی است که از Llama 4 Scout تهیه شده است. گراک (NVIDIA) اسکنر آسیب پذیری منبع باز LLM با ساند های ثابت، پویا و سازنده برای توهم، دزدی داده ها، تزریق سریع، سمی و jailbreaks. PyRIT (مایکروسافت) کمپین های تیم قرمز چند باری با Crescendo، TAP و زنجیره های تبدیل سفارشی برای بهره برداری عمیق. Llama Guard 3 در "Llama 3 Herd of Models" (arXiv:2407.21783) ؛ Llama Guard 3-1B-INT4 در arXiv:2411.17713؛ معماری ساند گراک در github.com/NVIDIA/garak مستند شده است. این ابزارها رابط تولید 2026 بین تحقیقات تیم قرمز (درسه 12-15) و انتشار (درسه 17+) هستند.

Type: Build

Languages: Python (stdlib, tool-architecture simulator and Llama Guard-style classifier mock)

Prerequisites: Phase 18 · 12-15 (jailbreaks and IPI)

Time: ~75 minutes

اهداف یادگیری

  • موقعیت Llama Guard 3/4 را در دسته ایمنی توصیف کنید: طبقه بندی کننده ورودی، طبقه بندی کننده خروجی یا هر دو.
  • ۱۴ دسته خطر MLCommons را نام ببرید و یکی از آنها را که آشکار نیست (تجاوز تفسیر کد) ذکر کنید.
  • معماری سوند گاراک را توصیف کنید: سوند ها، آشکارسازها، زره ها.
  • ساختار کمپین چند دور PyRIT را و نحوه ترکیب آن با سوند های Garak را توصیف کنید.

مشکل

دروس 12-15 سطح حمله را ارائه می دهند. انتشار تولید نیاز به ارزیابی تکراری و مقیاس پذیر دارد. سه ابزار در سال 2026 تسلط دارند: Llama Guard (صنفی دفاعی) ، Garak (سکنر) ، PyRIT (ورستراتور کمپین). هر یک از آنها لایه های متفاوتی از چرخه زندگی تیم قرمز را هدف قرار می دهد.

مفهوم

نگهبان لاما (میتا)

Llama Guard 3 یک مدل Llama-3.1-8B است که برای طبقه بندی ورودی/خروجی در MLCommons AILuminate 14 دسته بندی شده است:

  • جنایت های خشونت آمیز، جنایت های غیر خشونت آمیز، جنایت مرتبط، CSAM، تباه
  • مشاوره تخصصی، حریم خصوصی، مالکیت مالکیت، سلاح های بی تفاوتی، نفرت
  • خودکشی/خودکشی، محتوای جنسی، انتخابات، سوء استفاده از مترجم کد

پشتیبانی از 8 زبان. استفاده: قرار دادن قبل از LLM (درآمدی اعتدال) ، پس از LLM (درآمدی اعتدال) ، یا هر دو. دو استفاده تولید توزیع آموزشی متفاوت Llama Guard 3 کشتی به عنوان یک مدل واحد اداره هر دو.

Llama Guard 3-1B-INT4 (arXiv:2411.17713, 440MB, ~ 30 توکن / ثانیه در CPU موبایل) یک نوع کناری کوانتزی است.

Llama Guard 4 (اپریل 2025) 12B است، که در اصل چند مدل است، از Llama 4 Scout استفاده شده است. این هر دو متن 8B و پیشرو دید 11B را با یک طبقه بندی کننده جایگزین می کند که متن + تصاویر را جذب می کند.

گراک (NVIDIA)

اسکنر آسیب پذیری منبع باز. معماری:

  • Probes.ژنراتورهای حمله برای توهم، لیک اطلاعات، تزریق فوری، سمی، jailbreaks. جامد (تزامات ثابت) ، پویا (تزامات تولید شده) ، سازنده (به خروجی هدف پاسخ می دهد).
  • Detectors.نمره های خروجی در برابر حالت های شکست انتظار می رود سمی، دزدیده شده، jailbroken.
  • Harnesses.چندتا از زيراندازه ها رو اداره کنين، کمپین ها رو اجرا کنين، گزارش ها رو تولید کنين.

TrustyAI Garak را با سپرد های Llama-Stack (پروخت گارد-86M، Llama-Guard-3-8B) برای ارزیابی هدف های محافظت شده از پایان به پایان ادغام می کند. امتیاز مبتنی بر سطح (TBSA) جایگزین عبور / شکست دوگانه می شود. یک مدل می تواند در سطح شدت 3 عبور کند و در سطح شدت 5 در همان سوند شکست یابد.

PyRIT (مایکروسافت)

ابزار شناسایی ریسک پایتون، کمپین های چند مرحله ای از تیم قرمز

  • Converters.تبدیل یک پیامک زراعی پارافرز، کد، ترجمه، بازی نقش
  • Orchestrators.کمپین را اجرا کنید: Crescendo (ترقی), TAP (شروع), RedTeaming (لپ سفارشی).
  • Scoring.LLM به عنوان قاضی یا طبقه بندی کننده به عنوان قاضی

پیریت برادرزاده سنگین تر گراک است. گراک هزاران بار از سوند های یک باری را اجرا می کند؛ پیریت کمپین های عمیق چند باری را اجرا می کند که برای شکستن حالت های شکست خاص طراحی شده است.

-پايک

نگهبان للاما را در هر دو طرف مدل قرار دهید. برای بازگشت شبانه Garak اجرا کنید. برای کمپین های پیش از انتشار PyRIT اجرا کنید. این پیکربندی پیش فرض 2026 برای اکثر انتشار تولید است.

خطرهای ارزیابی

  • Judge identity.هر سه ابزار می توانند از یک قاضی LLM استفاده کنند؛ درایو های کالیبریشن قاضی گزارش ASR (درس 12) ، قاضی را در کنار ابزار مشخص کنید.
  • Probe staleness.گراک از زمان که مدل ها با آن ها بسته می شوند، سن می گیرد. ساند های سازگار (به شکل PAIR) از ساند های جامد آهسته تر سن می گیرند.
  • Llama Guard FPR on benign content.نسخه های اولیه لاما گارد محتوای سیاسی و LGBTQ + را بیش از حد نشان می دهد؛ کالیبراسیون لاما گارد 3/4 بهبود یافته است اما در هر انتشار کالیبر نمی شود.

جایی که این در مرحله 18 قرار داره

درس 12-15 خانواده های حمله است. درس 16 ابزار تولید است. درس 17 (WMDP) ارزیابی توانایی دوگانه استفاده است. درس 18 چارچوب های امنیتی مرزی است که این ابزارها را در یک ساختار سیاست پیچیده می کند.

ازش استفاده کن

code/main.pyیک دسته بندی کننده سبک بازی Llama Guard (کلمه کلیدی + ویژگی های معنوی بیش از 14 دسته) ، یک آستین بازی Garak (لپول کشف کننده سونو) و یک زنجیره تبدیل چند نوبت به سبک PyRIT را ایجاد می کند. شما می توانید سه ابزار را در برابر یک هدف جعلی اجرا کنید و امضای پوشش مختلف را مشاهده کنید.

-باده

این درس به ما کمک می کندoutputs/skill-red-team-stack.md. در صورت ارائه یک توضیحات، این فهرست مشخص می کند که کدام از سه ابزار مناسب است، چه چیزی را در هر یک از آنها تنظیم می کند و کدام کادنس بازگشت را اجرا می کند.

تمرینات

  1. فرار کنcode/main.py. نرخ تشخیص طبقه بندی کننده سبک Llama-Guard را در حملات یک باری با چندین باری مقایسه کنید
  1. یک ساند گاراک جدید اجرا کنید: یک درخواست مضر کد Base64
  1. زنجیره تبدیل به سبک PyRIT را با یک "ترجم به فرانسه، سپس پارافرز" تبدیل کنید. موفقیت حمله را دوباره اندازه گیری کنید.
  1. لیست دسته خطر Llama Guard 3 را بخوانید. دو دسته را شناسایی کنید که در آن داده های آموزش واقع بینانه نرخ مثبت دروغین بالایی را در محتوای سازنده مشروع تولید می کنند.
  1. اصول طراحی گاراک و PyRIT را مقایسه کنید. برای یک پیاده سازی که هر کدام ابزار مناسب باشد، استدلال کنید.

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
Llama Guard"the classifier"Fine-tuned Llama-3.1-8B/4-12B safety classifier with 14 hazard categories
Garak"the scanner"NVIDIA open-source vulnerability scanner; probes, detectors, harnesses
PyRIT"the campaign tool"Microsoft multi-turn red-team orchestrator; converters, orchestrators, scoring
Prompt-Guard"the small classifier"Meta's 86M prompt-injection classifier, paired with Llama Guard
TBSA"tier-based scoring"Garak's tier-based pass/fail replacing binary outcomes
Converter chain"paraphrase + encode + ..."PyRIT composition primitive for building multi-step attacks
MLCommons hazard categories"the 14 taxonomies"Industry-standard taxonomy Llama Guard targets

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.