تعصب و آسیب نمایندگی در LLM
Type: Build
Languages: Python (stdlib, toy embedding-based bias probe)
Prerequisites: Phase 05 (word embeddings), Phase 18 · 01 (instruction following)
Time: ~60 minutes
اهداف یادگیری
- آسیب های نمایندگی و اختصاصی را تعریف کنید و یک مثال از هر یک را در یک برنامه LLM ارائه دهید.
- سه دسته ارزیابی متریکی را از Gallegos و همکارانش در سال 2024 نام ببرید و یک متریک از هر یک را توصیف کنید.
- تعدد بین بخش ها را شرح دهید و اینکه چرا اندازه گیری عدالت مبتنی بر عدم اطمینان WinoIdentity شکاف های ارزیابی تعصب یک محور را حل می کند.
- دو روش مکانیکی تفسیر قابل تعصب را توصیف کنید (نورون های جنسیت، ویژگی های SAE، دستکاری سر توجه).
مشکل
دروس قبلی شامل آسیب های عمدی (جیل بریک، نقشه برداری) و مدیریت ایمنی است. تعصب آسیب هایی است که بدون قصد از طریق توزیع داده ها، از چارچوبی سریع، از انتخاب های طراحی جمع آوری شده به وجود می آید. اندازه گیری و کاهش آن یک چالش روش شناسی مشخص از ثبات خصومت است.
مفهوم
نمایندگی در مقابل اختصاص
- Representational harm.استریوتایپ ها، حذف، تصویرهای تحقیر کننده، یک LLM که پرستاران را به طور انحصاری زنانه نشان می دهد، آسیب های نمایندگی را ایجاد می کند.
- Allocational harm.نتایج متناظر نامساوی. یک LLM که نمره رزومه متقاضیان سیاه پوست را به طور سیستماتیک پایین تر می آورد، آسیب های اختصاصی را ایجاد می کند.
این دو مورد یکسان نیستند. یک مدل می تواند "غیر طرفدار است" (تصاویر متنوعی را تولید می کند) در حالی که "تجزیه ای طرفدار است" (وصایات نامساوی را ایجاد می کند). ارزیابی ها باید هر دو را اندازه گیری کنند.
سه دسته ارزیابی متریکی (Gallegos و همکاران 2024)
- Embedding-based.آزمون های سبک WEAT در پیوند های قبل از RLHF. روابط آماری بین اصطلاحات هویت و اصطلاحات صفات را اندازه گیری می کند. محدود: نشان دهنده را اندازه گیری می کند نه رفتار.
- Probability-based.احتمال ثبت ثبت تکمیلات تایید کننده استریوتیپ در مقابل نقض استریوتیپ اندازه گیری طرف دیکوتر برخی تعصب رفتاری را ضبط می کند
- Generated-text-based.اندازه گیری وظیفه در جریان در متن تولید شده. امتیاز رزومه، نوشتن توصیه ها، گفتگوها. بیشتر از نظر زیست محیطی معتبر؛ سخت ترین برای تولید.
متقاطعیت
ارزیابی تعصب در مورد "جنس" تعصب را که فقط بر روی زوج های (جنس، نژاد) می سوزاند، از دست می دهد. یک مطالعه ای در سال 2025 نشان داد که GPT-4o زنان سیاه پوست را در رزومه خود مجازات می کند که به طور جداگانه امتیاز بیشتری نسبت به مردان سیاه پوست و زنان سفید پوست دارند. ارزیابی واحد محور نمی تواند این موضوع را ثبت کند.
WinoIdentity (COLM 2025) انصاف میان بخش مبتنی بر عدم اطمینان را معرفی می کند. این اندازه گیری می کند که آیا عدم اطمینان مدل در مورد نتایج در دو تپل هویت میان بخش متفاوت است نه فقط پیش بینی نقطه. این موارد را درمی گیرد که مدل در گروه ها به همان اندازه اشتباه است اما برای برخی غیر یقینی تر است ، که باعث ایجاد رفتار توزیع پایین تر می شود.
رویکردهای مکانیکی
کار تفسیر 2024-2025 تعصب را برای مداخله مکانیستی باز می کند:
- Gender neurons (Yu & Ananiadou 2025).نورون های خاص MLP با رفتارهای جنسیتی مرتبط هستند. حذف این نورون ها میزان شکاف جنسیتی را با هزینه های محدود توانایی کاهش می دهد.
- Clinical racial bias via SAEs (Ahsan & Wallace 2025).ویژگی های خودکار کد Sparse نشان دهنده داخلی را به ابعاد قابل تفسیر تجزیه می کند؛ ویژگی های مرتبط با نژاد می توانند شناسایی و سرکوب شوند.
- UniBias (Zhou et al. 2024).دستکاری سر توجه برای دیبیازینگ صفر شات. سر های خاص حساسیت کلاس هویت را تقویت می کنند؛ صفر کردن یا وزن مجدد این سر ها تعصب را بدون تنظیم دقیق کاهش می دهد.
متاکریتیک
بررسی ادبیات 10 ساله (arXiv:2508.11067, 2025) نشان می دهد که این زمینه به طور نامتناسبی بر تعصب دوجنس متمرکز است. محور های دیگر - معلولیت، مذهب، وضعیت مهاجرت، هویت چند زبانی - توجه بسیار کمتری را دریافت می کنند. متاکریتیک استدلال می کند که تمرکز تنگ می تواند به گروه های بی طرف شده با نادیده گرفتن آسیب برساند: یک مدل با تعصب خوب بر روی جنسیت دوجنس ممکن است در ابعاد که هیچ کس بررسی نکرده است به شدت تعصب داشته باشد.
جایی که این در مرحله 18 قرار داره
دروس 20-21 به صورت رسمی تعصب و عدالت را پوشش می دهد. دروس 22 به خصوصیت را پوشش می دهد. دروس 23 به آبیاری مربوط می شود. این لایه های آسیب به کاربر است که به لایه های قبلی فریب / ایمنی تکمیل می کنند.
ازش استفاده کن
code/main.pyیک ساند تعصب مبتنی بر ادغام بازیچه را ایجاد می کند: فاصله بین اصطلاحات هویت و اصطلاحات صفات را در یک ادغام هم وقوع ساده اندازه گیری کنید. شما می توانید یک تعصب را تزریق کنید و آتش متریک را مشاهده کنید؛ یک عملیات ساده از دست دادن و مشاهده بازیابی جزئی را اعمال کنید.
-باده
این درس به ما کمک می کندoutputs/skill-bias-eval.md. در نظر گرفتن یک کارت مدل یا ادعای عدالت، ارزیابی در سه دسته متریکی (درگیری، احتمال، متن تولید شده) ، پوشش میان بخش ها و مکانیسم هر مداخله بی نقص را بررسی می کند.
تمرینات
- فرار کن
code/main.py. گزارش نمره های تعصب سبک WEAT قبل و بعد از مرحله تباه سازی. توضیح دهید که چرا متریک به صفر نمی رسد.
- آزمایش را با یک آزمون متقاطع (جنس، نژاد) x (کار، خانواده) گسترش دهید. نمرات تعصب در اعماق مختلف را گزارش کنید.
- مطالعه An et al. 2025 (PNAS Nexus) دو اثر متقاطع را شناسایی کنید که گزارش می کنند ارزیابی جنسیتی یک محور را از دست می دهد.
- یو و آنانیادو ۲۰۲۵ نورون های جنسیتی را شناسایی می کنند. یک آزمایش جعلی را نشان می دهند که "این نورون ها باعث تعصب جنسیتی می شوند" را از "این نورون ها با تعصب جنسیتی ارتباط دارند" تشخیص می دهد.
- متاکریتیک استدلال می کند که این زمینه به طور بسیار محدود بر جنسیت دوگانه تمرکز دارد. یک محور زیر مطالعه را انتخاب کنید و یک پروتکل اندازه گیری آسیب های نمایندگی را برای آن توصیف کنید.
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| Representational harm | "stereotypes / erasure" | Biased portrayal of a group |
| Allocational harm | "unequal decisions" | Biased material outcome for a group |
| WEAT | "the embedding test" | Word Embedding Association Test; co-occurrence-based bias probe |
| Intersectionality | "combined identity effects" | Bias that emerges at the intersection of multiple identity axes |
| Gender neurons | "MLP bias neurons" | Specific neurons whose activations correlate with gender-specific behaviour |
| SAE feature | "interpretable dimension" | Sparse-autoencoder-identified feature; useful for mechanistic bias analysis |
| UniBias | "attention-head debiasing" | Zero-shot debiasing by reweighting attention heads |
خواندن بیشتر
- Gallegos et al. — Bias and Fairness in LLMs: A Survey (arXiv:2309.00770, Computational Linguistics 2024) بررسی های کَنُنی
- An et al. — Intersectional resume-evaluation bias (PNAS Nexus, March 2025) مطالعه پنج مدل متقاطع
- WinoIdentity — uncertainty-based intersectional fairness (arXiv:2508.07111, COLM 2025) معیار جدید
- UniBias — attention-head manipulation (Zhou et al. 2024, ACL) تخفیف صفر شوت
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.