Phase 18: Ethics, Safety & Alignment

LLM में पूर्वाग्रह और प्रतिनिधित्व संबंधी हानि

गैलेगोस, रॉसी, बारो, तंजिम, किम, डर्ननकोर्ट, यु, झांग, अहमद (कंपुटेशनल लिंग्विस्टिक्स 2024, arXiv:2309.00770). फाउंडेशनल 2024 सर्वेक्षण, जो प्रतिनिधित्व संबंधी नुकसान (मूर्ती, मिटाना) को आवंटन संबंधी नुकसान (असमान संसाधन वितरण) से अलग करता है और मूल्यांकन मेट्रिक्स को एम्बेडिंग-आधारित, संभावना-आधारित या उत्पन्न-पाठ-आधारित के रूप में वर्गीकृत करता है। 2024-2025 अनुभवजन्य: एट अल. (PNAS नेक्सस, मार्च 2025) 20 प्रवेश स्तर की नौकरियों के लिए स्वचालित रिज्यूमे मूल्यांकन पर GPT-3.5 टर्बो, GPT-4o, Gemini 1.5 फ्लैश, क्लाउड 3.5 सोनट, Llama 3-70B पर अंतर-खंडीय लिंग एक्स दौड़ पूर्वाग्रह को मापें। WinoIdentity (COLM 2025, arXiv:2508.07111) अंतर-खंडीय पहचानों के लिए अनिश्चितता आधारित निष्पक्षता मूल्यांकन की शुरूआत करता है। यू और अनन्याडु 2025 एमएलपी परतों में लिंग न्यूरॉन्स की पहचान करते हैं; अहसान और वालेस 2025 नैदानिक नस्लीय पूर्वाग्रहों को उजागर करने के लिए एसएई का उपयोग करते हैं; ज़ोउ और अन्य। 2024 (UniBias) ध्यान के सिरों को डिबिसिंग के लिए हेरफेर करता है। मेटा-आलोचना (arXiv:2508.11067): 10 साल का साहित्य द्विआधारी लिंग पूर्वाग्रह पर असमान रूप से केंद्रित है।

Type: Build

Languages: Python (stdlib, toy embedding-based bias probe)

Prerequisites: Phase 05 (word embeddings), Phase 18 · 01 (instruction following)

Time: ~60 minutes

सीखने के लक्ष्य

  • प्रतिनिधित्व बनाम आवंटन हानि को परिभाषित करें और LLM तैनाती में प्रत्येक का एक उदाहरण दें।
  • गैलेगोस एवं अन्य के तीन मूल्यांकन-मीट्रिक श्रेणियों का नाम दें और प्रत्येक में से एक मीट्रिक का वर्णन करें।
  • अंतर-खंडात्मकता का वर्णन करें और क्यों WinoIdentity के अनिश्चितता आधारित निष्पक्षता माप से एकल-अक्ष पूर्वाग्रह मूल्यांकन में अंतराल दूर होते हैं।
  • पूर्वाग्रह के दो तंत्रिकीय-अर्थ व्याख्यात्मक दृष्टिकोणों का वर्णन करें (लिंग न्यूरॉन्स, एसएई विशेषताएं, ध्यान-उपचार हेरफेर) ।

समस्या

पिछले पाठों में जानबूझकर नुकसान (जेलब्रेक, योजना) और सुरक्षा शासन शामिल हैं। पूर्वाग्रह वह नुकसान है जो बिना इरादे के उत्पन्न होता है प्रशिक्षण डेटा वितरण से, त्वरित रूपरेखा से, संचित डिजाइन विकल्पों से। इसका माप और कम करना प्रतिकूलता की मजबूती से एक अलग पद्धतिगत चुनौती है।

अवधारणा

प्रतिनिधि बनाम आवंटन

  • Representational harm.एक LLM जो नर्सों को विशेष रूप से महिला के रूप में दर्शाता है प्रतिनिधित्व हानि पैदा कर रहा है।
  • Allocational harm.एक LLM जो काले आवेदकों के जीवनशैली को व्यवस्थित रूप से कम स्कोर करता है आवंटन नुकसान पैदा कर रहा है।

ये एक ही नहीं हैं। एक मॉडल "प्रतिनिधात्मक रूप से निष्पक्ष" हो सकता है (विविध चित्रण का उत्पादन करता है) जबकि "वैकल्पिक रूप से पक्षपातपूर्ण" हो सकता है (असमान सिफारिशें करता है) । मूल्यांकन दोनों को मापने की आवश्यकता होती है।

तीन मूल्यांकन-मीट्रिक श्रेणियां (गैलेगोस एट अल. 2024)

  • Embedding-based.आरएलएचएफ से पहले एम्बेडेड पर WEAT शैली के परीक्षण। पहचान शब्दों और विशेषता शब्दों के बीच सांख्यिकीय संबंध मापता है। सीमितः प्रतिनिधित्व को मापता है, व्यवहार को नहीं।
  • Probability-based.स्टेरियोटाइप-पहचान बनाम स्टेरियोटाइप-पहचान पूर्णता की लॉग-संभावना। डिकोडर-साइड माप। कुछ व्यवहार पूर्वाग्रह को कैप्चर करता है।
  • Generated-text-based.उत्पन्न पाठ पर डाउनस्ट्रीम-कार्य माप. रिज्यूमे स्कोरिंग, सिफारिश लेखन, संवाद. सबसे पारिस्थितिक रूप से मान्य; सबसे कठिन पुनः उत्पन्न करने के लिए।

अंतर-भागिता

"लिंग" पर पूर्वाग्रह मूल्यांकन पूर्वाग्रह को याद करता है जो केवल (लिंग, नस्ल) जोड़े पर फायर करता है। एक एट एट 2025 निष्कर्ष GPT-4o ब्लैक महिलाओं को अलग से काले पुरुषों और सफेद महिलाओं की तुलना में अधिक अंक प्राप्त करने वाले रिज्यूमे में दंडित करता है। एकल अक्ष मूल्यांकन इसे कैप्चर नहीं कर सकता है।

WinoIdentity (COLM 2025) अनिश्चितता आधारित पारखण्डीय निष्पक्षता पेश करता है। यह मापता है कि क्या अंतःकरणीय पहचान टप्पे पर मॉडल की अनिश्चितता भिन्न होती है न केवल बिंदु भविष्यवाणी। यह ऐसे मामलों को पकड़ता है जहां मॉडल समूहों के बीच समान रूप से गलत है लेकिन कुछ के लिए अधिक अनिश्चित है, जो विभिन्न डाउनस्ट्रीम आवंटन व्यवहार का उत्पादन करता है।

तंत्रिकीय दृष्टिकोण

2024-2025 के लिए व्याख्यात्मक कार्य तंत्रवादी हस्तक्षेप के लिए पूर्वाग्रह खोलता हैः

  • Gender neurons (Yu & Ananiadou 2025).विशिष्ट एमएलपी न्यूरॉन्स लिंग-विशिष्ट व्यवहारों के साथ सहसंबंधित हैं। इन न्यूरॉन्स को हटाकर लिंग अंतर माप को सीमित क्षमता लागत के साथ कम किया जाता है।
  • Clinical racial bias via SAEs (Ahsan & Wallace 2025).स्पर ऑटोकोडर सुविधाएँ आंतरिक प्रतिनिधित्व को व्याख्या योग्य आयामों में विघटित करती हैं; दौड़-संबंधित सुविधाओं की पहचान और दबाया जा सकता है।
  • UniBias (Zhou et al. 2024).शून्य-शॉट डिब्यूइज़िंग के लिए ध्यान-हेड हेरफेर। विशिष्ट हेड पहचान-वर्ग की संवेदनशीलता को बढ़ाता है; इन हेड को शून्य या फिर से वजन करना बिना किसी ठीक-ठीक के पूर्वाग्रह को कम करता है।

मेटा-आलोचना

10 साल की साहित्य समीक्षा (arXiv:2508.11067, 2025) में पाया गया है कि क्षेत्र द्विआधारी लिंग पूर्वाग्रह पर असमान रूप से केंद्रित है। अन्य अक्ष विकलांगता, धर्म, प्रवासन स्थिति, बहुभाषी पहचान को बहुत कम ध्यान दिया जाता है। मेटा-आलोचना का तर्क है कि उपेक्षा द्वारा संकीर्ण ध्यान हाशिए पर समूहों को नुकसान पहुंचा सकता हैः द्विआधारी लिंग पर अच्छी तरह से विचलित मॉडल किसी ने भी जांच किए गए आयामों पर बुरी तरह से पक्षपातपूर्ण हो सकता है।

जहां यह चरण 18 में फिट बैठता है

पाठ 20-21 औपचारिक रूप से पूर्वाग्रह और निष्पक्षता को कवर करता है। पाठ 22 गोपनीयता को कवर करता है। पाठ 23 वॉटरमार्किंग को कवर करता है। ये पहले के धोखाधड़ी/सुरक्षा परत को पूरक करने वाले उपयोगकर्ता-हानिकारक परत हैं।

इसका प्रयोग करें

code/main.pyएक खिलौना एम्बेडिंग आधारित पूर्वाग्रह जांच का निर्माण करता हैः एक साधारण सह-प्रकृति एम्बेडिंग में पहचान शब्दों और विशेषता शब्दों के बीच WEAT शैली की दूरी को मापें। आप एक पूर्वाग्रह इंजेक्ट कर सकते हैं और मीट्रिक आग का निरीक्षण कर सकते हैं; एक सरल डिबिसिंग ऑपरेशन लागू करें और आंशिक वसूली का निरीक्षण करें।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-bias-eval.md. एक मॉडल कार्ड या निष्पक्षता का दावा करते हुए, यह तीन मीट्रिक श्रेणियों (एम्बेडिंग, संभावना, उत्पन्न पाठ), अंतर-खंडात्मकता कवरेज और किसी भी अवैध हस्तक्षेप की तंत्र के माध्यम से मूल्यांकन का लेखा-परीक्षण करता है।

व्यायाम

  1. दौड़ेंcode/main.py. वेट शैली के पूर्वाग्रह स्कोर की रिपोर्ट करें, जो कि डेब्यूइज़िंग स्टेप से पहले और बाद में है. समझाएं कि मेट्रिक शून्य तक क्यों नहीं गिरती है.
  1. जांच को एक इंटरसेक्शनल टेस्ट के साथ बढ़ाएंः (लिंग, जाति) x (कार्रियर, परिवार) । क्रॉस-अक्ष पूर्वाग्रह स्कोर रिपोर्ट करें।
  1. एन एट एल. 2025 (PNAS नेक्सस) पढ़ें। वे दो पारस्परिक प्रभावों की पहचान करें जो वे रिपोर्ट करते हैं कि एकल अक्ष लैंगिक मूल्यांकन में चूक जाएगा।
  1. यू और अनन्याडु 2025 लिंग न्यूरॉन्स की पहचान करें। एक झूठी प्रयोग की रेखाचित्र बनाएं जो "ये न्यूरॉन्स लिंग पूर्वाग्रह का कारण बनते हैं" को "ये न्यूरॉन्स लिंग पूर्वाग्रह के साथ सहसंबंधित हैं" से अलग करेगा।
  1. मेटा-आलोचना का तर्क है कि क्षेत्र द्विआधारी लिंग पर बहुत संकीर्ण रूप से केंद्रित है। एक अक्षा का चयन करें जिसका अध्ययन किया गया है और इसके लिए एक प्रतिनिधित्व-क्षति माप प्रोटोकॉल का वर्णन करें।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
Representational harm"stereotypes / erasure"Biased portrayal of a group
Allocational harm"unequal decisions"Biased material outcome for a group
WEAT"the embedding test"Word Embedding Association Test; co-occurrence-based bias probe
Intersectionality"combined identity effects"Bias that emerges at the intersection of multiple identity axes
Gender neurons"MLP bias neurons"Specific neurons whose activations correlate with gender-specific behaviour
SAE feature"interpretable dimension"Sparse-autoencoder-identified feature; useful for mechanistic bias analysis
UniBias"attention-head debiasing"Zero-shot debiasing by reweighting attention heads

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.