التحيزات والضرر التمثيلي في القانون القانوني
Type: Build
Languages: Python (stdlib, toy embedding-based bias probe)
Prerequisites: Phase 05 (word embeddings), Phase 18 · 01 (instruction following)
Time: ~60 minutes
أهداف التعلم
- حدد الأضرار التمثيلية مقابل التخصيص وتعطي مثالًا على كل منها في نشر LLM.
- أسمائ الفئات المقاييس التقييمية الثلاثة من غاليغوس وزملاء 2024 واصف مقياس واحد من كل منها.
- وصف التقاطعية ولماذا قياس العدالة القائم على عدم اليقين من WinoIdentity يعالج الفجوات في تقييم التحيز على محور واحد.
- وصف طريقتين من طراز الميكانيكية للتفسير للتحيز (خلايا العصبية من نوع الجنس، وصفات SAE، وتلاعب رأس الانتباه).
المشكلة
وتتناول الدروس السابقة الضرر المتعمد (الوقوع في السجن، التخطيط) والحكم على السلامة. تعصب هو الضرر الذي يظهر دون قصد من توزيع البيانات التدريبية، من الإطار السريع، من خيارات التصميم المتراكمة. قياس وتقليصه هو تحدي منهجي متميز من صمود العداوة.
المفهوم
التمثيل مقابل التخصيص
- Representational harm.النماذج النمطية، التمرير، التصورات المهينة، ماجستير في مجال التدريب الذي يصور الممرضات كمرأة حصريًا،
- Allocational harm.نتائج مادي غير متساوية، ماجستير في مجال حقوق العلوم الذي يضع درجات طلبة السود من سيرانهم بشكل منهجي يسبب ضرر في التخصيص.
هذه ليست نفسها. يمكن أن يكون النموذج "غير متحيزًا من الناحية التمثيلية" (ينتج صورًا متنوعة) بينما يكون "متحيزًا من الناحية التخصيصية" (يقدم توصيات غير متساوية). يجب على التقييمات قياس كلا.
ثلاث فئات قياسية (Gallegos et al. 2024)
- Embedding-based.اختبارات في نمط WEAT على التوابل التي كانت موجودة قبل RLHF. تقيس العلاقات الإحصائية بين مصطلحات الهوية ومصطلحات الصفات. محدودة: تقيس التمثيل وليس السلوك.
- Probability-based.احتمالات التسجيل من التأكيد على النمط مقابل الانتهاءات التي تنتهك النمط القياس من جانب المفكّر
- Generated-text-based.قياس المهام المتدفقة على النص المولود. تسجيل النتائج، كتابة التوصيات، الحوار. الأكثر صداقة بيئيًا؛ أصعب إعادة إنتاجها.
التقاطعية
يفتقد تقييم التحيز على "الجين" التحيز الذي يطلق النار فقط على أزواج (الجين، العرق) . وجدت جبت -4o 2025 أن النساء السود في سير الذكر يعاقبن على الدوام أكثر من الرجال السود وأكثر من النساء البيض بشكل منفصل. لا يمكن التقييم على محور واحد التقاط هذا.
يقدم WinoIdentity (COLM 2025) العدالة المتقاطعة القائمة على عدم اليقين. يقيس ما إذا كانت عدم اليقين النموذج على النتائج تختلف عبر أضعاف الهوية المتقاطعة ليس فقط التنبؤ بالنقطة. هذا يلتقط الحالات التي يكون فيها النموذج خاطئًا على قدم المساواة بين المجموعات ولكن أكثر عدم اليقين بالنسبة لبعضهم ، مما ينتج سلوكًا مختلفًا للتخصيص في النهر التالي.
المقاربات الآلية
العمل على التفسير 2024-2025 يفتح التحيز على التدخل الآلي:
- Gender neurons (Yu & Ananiadou 2025).تتصل الخلايا العصبية المحددة لـ MLP بالسلوكيات المحددة للجنس. إزالة هذه الخلايا العصبية يقلل من قياسات الفجوة بين الجنسين مع تكلفة قدرة محدودة.
- Clinical racial bias via SAEs (Ahsan & Wallace 2025).تتميز ميزات إعادة تشفير الذاتية من خلال Sparse التمثيل الداخلي إلى أبعاد قابلة للتفسير؛ يمكن تحديد الميزات المتعلقة بالعرق والقمع.
- UniBias (Zhou et al. 2024).التلاعب بالرأس الاهتمام لتخريب الصفر. الرؤوس المحددة تعزز حساسية فئة الهوية. يقلل الصفر أو إعادة الوزن من التحيز دون ضبط جيد.
النقد المنتظم
يجد مراجعة الأدب لمدة 10 سنوات (arXiv:2508.11067, 2025) أن هذا المجال يركز بشكل غير متناسب على التحيز الثنائي الجنسي. تتلقى المحاور الأخرى الإعاقة والدين وحالة الهجرة والهوية متعددة اللغات اهتمامًا أقل بكثير. يجادل النقد الأساسي بأن التركيز الضيق يمكن أن يضر بالجماعات المهمشة عن طريق الإهمال: قد يكون نموذجًا يتحيز بشكل جيد على الجنس الثنائي متحيزًا بشكل كبير على الأبعاد التي لم يحقق منها أحد.
حيث يتناسب هذا مع المرحلة 18
تتناول الدروس 20-21 التحيز والعدالة بشكل رسمي. تتناول الدروس 22 الخصوصية. تتناول الدروس 23 علامات المياه. هذه هي طبقة الضرر المستخدم التي تكمل طبقة الخداع / السلامة السابقة.
استخدمها
code/main.pyيقوم ببناء صوّة التحيز القائمة على إدراج الألعاب: قياس المسافة على النمط WEAT بين مصطلحات الهوية ومصطلحات الصفات في إدراج مشترك بسيط. يمكنك حقن تحيز ومراقبة النار الميترية؛ تطبيق عملية تحريف بسيطة ومراقبة التعافي الجزئي.
أرسله
هذا الدرس يُنتجoutputs/skill-bias-eval.md. في ظل بطاقة نموذجية أو ادعاء نزاهة، فإنه يقوم بمراجعة التقييم في جميع الفئات الميترية الثلاثة (الترابط، والاحتمال، والنص المولد) ، وتغطية التقاطعات، وآلية أي تدخل منخفض.
التمارين
- أركض
code/main.py. إبلاغ درجات التحيز على النمط الويت قبل وبعد خطوة التخفيض. شرح لماذا لا تنخفض المقياس إلى الصفر.
- تمديد المسح باستخدام اختبار متقاطع: (جنس، عرق) x (مهنة، عائلة).
- اقرأ An et al. 2025 (PNAS Nexus). حدد اثنين من الآثار المتقاطعة التي يبلغون عنها التي لن يتم تقييمها على النسخة الواحدة.
- يوو وأنانادو 2025 تحديد الخلايا العصبية من نوع الجنس. رسم تجربة التزوير التي ستتميز "هذه الخلايا العصبية تسبب التحيز الجنسي" من "هذه الخلايا العصبية تتصل مع التحيز الجنسي".
- يجادل المنتقد المنتقد بأن الحقل يركز بشكل ضيق جدا على الجنس الثنائي. اختر محور واحد لم يتم دراسته وتصف بروتوكول قياس الضرر التمثيلي له.
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| Representational harm | "stereotypes / erasure" | Biased portrayal of a group |
| Allocational harm | "unequal decisions" | Biased material outcome for a group |
| WEAT | "the embedding test" | Word Embedding Association Test; co-occurrence-based bias probe |
| Intersectionality | "combined identity effects" | Bias that emerges at the intersection of multiple identity axes |
| Gender neurons | "MLP bias neurons" | Specific neurons whose activations correlate with gender-specific behaviour |
| SAE feature | "interpretable dimension" | Sparse-autoencoder-identified feature; useful for mechanistic bias analysis |
| UniBias | "attention-head debiasing" | Zero-shot debiasing by reweighting attention heads |
المزيد من القراءة
- Gallegos et al. — Bias and Fairness in LLMs: A Survey (arXiv:2309.00770, Computational Linguistics 2024) الاستقصاء القنوني
- An et al. — Intersectional resume-evaluation bias (PNAS Nexus, March 2025) دراسة متقاطعة من خمسة نماذج
- WinoIdentity — uncertainty-based intersectional fairness (arXiv:2508.07111, COLM 2025) مقياس جديد
- UniBias — attention-head manipulation (Zhou et al. 2024, ACL) إصدارات المعلومات
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.