LLM में पूर्वाग्रह और प्रतिनिधित्व संबंधी हानि
Type: Build
Languages: Python (stdlib, toy embedding-based bias probe)
Prerequisites: Phase 05 (word embeddings), Phase 18 · 01 (instruction following)
Time: ~60 minutes
सीखने के लक्ष्य
- प्रतिनिधित्व बनाम आवंटन हानि को परिभाषित करें और LLM तैनाती में प्रत्येक का एक उदाहरण दें।
- गैलेगोस एवं अन्य के तीन मूल्यांकन-मीट्रिक श्रेणियों का नाम दें और प्रत्येक में से एक मीट्रिक का वर्णन करें।
- अंतर-खंडात्मकता का वर्णन करें और क्यों WinoIdentity के अनिश्चितता आधारित निष्पक्षता माप से एकल-अक्ष पूर्वाग्रह मूल्यांकन में अंतराल दूर होते हैं।
- पूर्वाग्रह के दो तंत्रिकीय-अर्थ व्याख्यात्मक दृष्टिकोणों का वर्णन करें (लिंग न्यूरॉन्स, एसएई विशेषताएं, ध्यान-उपचार हेरफेर) ।
समस्या
पिछले पाठों में जानबूझकर नुकसान (जेलब्रेक, योजना) और सुरक्षा शासन शामिल हैं। पूर्वाग्रह वह नुकसान है जो बिना इरादे के उत्पन्न होता है प्रशिक्षण डेटा वितरण से, त्वरित रूपरेखा से, संचित डिजाइन विकल्पों से। इसका माप और कम करना प्रतिकूलता की मजबूती से एक अलग पद्धतिगत चुनौती है।
अवधारणा
प्रतिनिधि बनाम आवंटन
- Representational harm.एक LLM जो नर्सों को विशेष रूप से महिला के रूप में दर्शाता है प्रतिनिधित्व हानि पैदा कर रहा है।
- Allocational harm.एक LLM जो काले आवेदकों के जीवनशैली को व्यवस्थित रूप से कम स्कोर करता है आवंटन नुकसान पैदा कर रहा है।
ये एक ही नहीं हैं। एक मॉडल "प्रतिनिधात्मक रूप से निष्पक्ष" हो सकता है (विविध चित्रण का उत्पादन करता है) जबकि "वैकल्पिक रूप से पक्षपातपूर्ण" हो सकता है (असमान सिफारिशें करता है) । मूल्यांकन दोनों को मापने की आवश्यकता होती है।
तीन मूल्यांकन-मीट्रिक श्रेणियां (गैलेगोस एट अल. 2024)
- Embedding-based.आरएलएचएफ से पहले एम्बेडेड पर WEAT शैली के परीक्षण। पहचान शब्दों और विशेषता शब्दों के बीच सांख्यिकीय संबंध मापता है। सीमितः प्रतिनिधित्व को मापता है, व्यवहार को नहीं।
- Probability-based.स्टेरियोटाइप-पहचान बनाम स्टेरियोटाइप-पहचान पूर्णता की लॉग-संभावना। डिकोडर-साइड माप। कुछ व्यवहार पूर्वाग्रह को कैप्चर करता है।
- Generated-text-based.उत्पन्न पाठ पर डाउनस्ट्रीम-कार्य माप. रिज्यूमे स्कोरिंग, सिफारिश लेखन, संवाद. सबसे पारिस्थितिक रूप से मान्य; सबसे कठिन पुनः उत्पन्न करने के लिए।
अंतर-भागिता
"लिंग" पर पूर्वाग्रह मूल्यांकन पूर्वाग्रह को याद करता है जो केवल (लिंग, नस्ल) जोड़े पर फायर करता है। एक एट एट 2025 निष्कर्ष GPT-4o ब्लैक महिलाओं को अलग से काले पुरुषों और सफेद महिलाओं की तुलना में अधिक अंक प्राप्त करने वाले रिज्यूमे में दंडित करता है। एकल अक्ष मूल्यांकन इसे कैप्चर नहीं कर सकता है।
WinoIdentity (COLM 2025) अनिश्चितता आधारित पारखण्डीय निष्पक्षता पेश करता है। यह मापता है कि क्या अंतःकरणीय पहचान टप्पे पर मॉडल की अनिश्चितता भिन्न होती है न केवल बिंदु भविष्यवाणी। यह ऐसे मामलों को पकड़ता है जहां मॉडल समूहों के बीच समान रूप से गलत है लेकिन कुछ के लिए अधिक अनिश्चित है, जो विभिन्न डाउनस्ट्रीम आवंटन व्यवहार का उत्पादन करता है।
तंत्रिकीय दृष्टिकोण
2024-2025 के लिए व्याख्यात्मक कार्य तंत्रवादी हस्तक्षेप के लिए पूर्वाग्रह खोलता हैः
- Gender neurons (Yu & Ananiadou 2025).विशिष्ट एमएलपी न्यूरॉन्स लिंग-विशिष्ट व्यवहारों के साथ सहसंबंधित हैं। इन न्यूरॉन्स को हटाकर लिंग अंतर माप को सीमित क्षमता लागत के साथ कम किया जाता है।
- Clinical racial bias via SAEs (Ahsan & Wallace 2025).स्पर ऑटोकोडर सुविधाएँ आंतरिक प्रतिनिधित्व को व्याख्या योग्य आयामों में विघटित करती हैं; दौड़-संबंधित सुविधाओं की पहचान और दबाया जा सकता है।
- UniBias (Zhou et al. 2024).शून्य-शॉट डिब्यूइज़िंग के लिए ध्यान-हेड हेरफेर। विशिष्ट हेड पहचान-वर्ग की संवेदनशीलता को बढ़ाता है; इन हेड को शून्य या फिर से वजन करना बिना किसी ठीक-ठीक के पूर्वाग्रह को कम करता है।
मेटा-आलोचना
10 साल की साहित्य समीक्षा (arXiv:2508.11067, 2025) में पाया गया है कि क्षेत्र द्विआधारी लिंग पूर्वाग्रह पर असमान रूप से केंद्रित है। अन्य अक्ष विकलांगता, धर्म, प्रवासन स्थिति, बहुभाषी पहचान को बहुत कम ध्यान दिया जाता है। मेटा-आलोचना का तर्क है कि उपेक्षा द्वारा संकीर्ण ध्यान हाशिए पर समूहों को नुकसान पहुंचा सकता हैः द्विआधारी लिंग पर अच्छी तरह से विचलित मॉडल किसी ने भी जांच किए गए आयामों पर बुरी तरह से पक्षपातपूर्ण हो सकता है।
जहां यह चरण 18 में फिट बैठता है
पाठ 20-21 औपचारिक रूप से पूर्वाग्रह और निष्पक्षता को कवर करता है। पाठ 22 गोपनीयता को कवर करता है। पाठ 23 वॉटरमार्किंग को कवर करता है। ये पहले के धोखाधड़ी/सुरक्षा परत को पूरक करने वाले उपयोगकर्ता-हानिकारक परत हैं।
इसका प्रयोग करें
code/main.pyएक खिलौना एम्बेडिंग आधारित पूर्वाग्रह जांच का निर्माण करता हैः एक साधारण सह-प्रकृति एम्बेडिंग में पहचान शब्दों और विशेषता शब्दों के बीच WEAT शैली की दूरी को मापें। आप एक पूर्वाग्रह इंजेक्ट कर सकते हैं और मीट्रिक आग का निरीक्षण कर सकते हैं; एक सरल डिबिसिंग ऑपरेशन लागू करें और आंशिक वसूली का निरीक्षण करें।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-bias-eval.md. एक मॉडल कार्ड या निष्पक्षता का दावा करते हुए, यह तीन मीट्रिक श्रेणियों (एम्बेडिंग, संभावना, उत्पन्न पाठ), अंतर-खंडात्मकता कवरेज और किसी भी अवैध हस्तक्षेप की तंत्र के माध्यम से मूल्यांकन का लेखा-परीक्षण करता है।
व्यायाम
- दौड़ें
code/main.py. वेट शैली के पूर्वाग्रह स्कोर की रिपोर्ट करें, जो कि डेब्यूइज़िंग स्टेप से पहले और बाद में है. समझाएं कि मेट्रिक शून्य तक क्यों नहीं गिरती है.
- जांच को एक इंटरसेक्शनल टेस्ट के साथ बढ़ाएंः (लिंग, जाति) x (कार्रियर, परिवार) । क्रॉस-अक्ष पूर्वाग्रह स्कोर रिपोर्ट करें।
- एन एट एल. 2025 (PNAS नेक्सस) पढ़ें। वे दो पारस्परिक प्रभावों की पहचान करें जो वे रिपोर्ट करते हैं कि एकल अक्ष लैंगिक मूल्यांकन में चूक जाएगा।
- यू और अनन्याडु 2025 लिंग न्यूरॉन्स की पहचान करें। एक झूठी प्रयोग की रेखाचित्र बनाएं जो "ये न्यूरॉन्स लिंग पूर्वाग्रह का कारण बनते हैं" को "ये न्यूरॉन्स लिंग पूर्वाग्रह के साथ सहसंबंधित हैं" से अलग करेगा।
- मेटा-आलोचना का तर्क है कि क्षेत्र द्विआधारी लिंग पर बहुत संकीर्ण रूप से केंद्रित है। एक अक्षा का चयन करें जिसका अध्ययन किया गया है और इसके लिए एक प्रतिनिधित्व-क्षति माप प्रोटोकॉल का वर्णन करें।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| Representational harm | "stereotypes / erasure" | Biased portrayal of a group |
| Allocational harm | "unequal decisions" | Biased material outcome for a group |
| WEAT | "the embedding test" | Word Embedding Association Test; co-occurrence-based bias probe |
| Intersectionality | "combined identity effects" | Bias that emerges at the intersection of multiple identity axes |
| Gender neurons | "MLP bias neurons" | Specific neurons whose activations correlate with gender-specific behaviour |
| SAE feature | "interpretable dimension" | Sparse-autoencoder-identified feature; useful for mechanistic bias analysis |
| UniBias | "attention-head debiasing" | Zero-shot debiasing by reweighting attention heads |
आगे पढ़ना
- Gallegos et al. — Bias and Fairness in LLMs: A Survey (arXiv:2309.00770, Computational Linguistics 2024) कैनोनिक सर्वेक्षण
- An et al. — Intersectional resume-evaluation bias (PNAS Nexus, March 2025) पांच मॉडल इंटरसेक्शनल स्टडी
- WinoIdentity — uncertainty-based intersectional fairness (arXiv:2508.07111, COLM 2025) नया बेंचमार्क
- UniBias — attention-head manipulation (Zhou et al. 2024, ACL) शून्य शॉट डेबिसिंग
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.