Phase 18: Ethics, Safety & Alignment

निष्पक्षता के मानदंड समूह, व्यक्तिगत, विपरीत

तीन परिवारों ने न्याय साहित्य का निर्माण किया। समूह निष्पक्षताः जनसांख्यिकीय समानता, समता प्राप्त संभावनाएं, सशर्त उपयोग सटीकता समानता संरक्षित समूहों के बीच औसत समान दरें। व्यक्तिगत निष्पक्षता (Dwork et al. 2012): समान व्यक्तियों को समान निर्णय प्राप्त होते हैं; निर्णय मानचित्र पर लिप्सकिट्ज़ की स्थिति। विपरीत निष्पक्षता (Kusner et al. 2017): एक निर्णय व्यक्ति के प्रति निष्पक्ष है यदि यह अपरिवर्तित है जब संवेदनशील गुणों को विपरीत रूप से बदला जाता है। 2024 सैद्धांतिक परिणाम (NeurIPS 2024): एक अंतर्निहित CF- बनाम सटीकता व्यापार-बदला है; एक मॉडल-अज्ञानी विधि एक अनुकूल-लेकिन-असाध्य पूर्वानुमान को सीमित सटीकता हानि वाले CF में परिवर्तित करती है। बैकट्रैकिंग काउंटरफैक्टुअल्स (arXiv:2401.13935, जनवरी 2024): एक नया पैराडैग्मा जो कानूनी रूप से संरक्षित गुणों पर हस्तक्षेप की आवश्यकता से बचता है। दार्शनिक मेल (ICLR Blogposts 2024): कारणों के ग्राफ के साथ, समूह निष्पक्षता के कुछ उपायों को पूरा करने के लिए विपरीत निष्पक्षता शामिल है।

Type: Learn

Languages: Python (stdlib, three-criteria comparison)

Prerequisites: Phase 18 · 20 (bias), Phase 02 (classical ML)

Time: ~60 minutes

सीखने के लक्ष्य

  • समूह निष्पक्षता के तीन मानदंड (जनसांख्यिकीय समानता, समता प्राप्त संभावना, सशर्त उपयोग सटीकता समानता) और एक असंभवता परिणाम बताएं।
  • Dwork et al. 2012 लिप्सकिट्ज़ सूत्र के माध्यम से व्यक्तिगत निष्पक्षता का वर्णन करें।
  • विपरीत तथ्य निष्पक्षता और इसके कारण-ग्राफ निर्भरता का वर्णन करें।
  • पीछे हटने वाले विपरीत कारणों को समझाएं और वे हस्तक्षेप-पर-सुरक्षित विशेषता समस्या से क्यों बचते हैं।

समस्या

पाठ 20 पूर्वाग्रह को मापने के बारे में था। पाठ 21 मापने के लिए निष्पक्षता मानक को परिभाषित करने के बारे में है। तीन परिवार संरचनात्मक रूप से अलग-अलग मानक देते हैं। एक मॉडल समूह-साधक और व्यक्तिगत-अन्यायपूर्ण, विपरीत रूप से निष्पक्ष और समूह-अन्यायपूर्ण हो सकता है। एक मानक का चयन एक नीतिगत निर्णय है; कोई मानक सार्वभौमिक रूप से अनुकूल नहीं है।

अवधारणा

समूह निष्पक्षता

  • Demographic parity.सभी समूहों के लिए समान स्वीकृति दरें।
  • Equalized odds.P Y=1 Y = y, A=a) = P Y=1 Y = y, A=a') समूहों के बीच TPR और FPR समान है।
  • Conditional use accuracy equality.P Y y = y , A = a) = P Y y , Y = y , A = a') समूहों के बीच समान भविष्यवाणिक मूल्य।

असंभवता (चौल्डेकोवा, क्लेनबर्ग-मुल्लाइनाथन-राघवन 2017): असमान आधार दरों के तहत इन तीनों को एक साथ पूरा नहीं किया जा सकता है।

व्यक्तिगत न्याय

Dwork et al. 2012. एक निर्णय मानचित्र f एक कार्य-विशिष्ट समानता मीट्रिक के संबंध में व्यक्तिगत रूप से निष्पक्ष है d यदि f(x) - f(x') <= L * d(x, x') के लिए कुछ लिप्सचिट्ज़ निरंतर L. समान व्यक्तियों को समान निर्णय प्राप्त होते हैं।

नीतिगत प्रश्न, सांख्यिकीय नहीं।

वस्तुतः निष्पक्षता

कुस्नर और सहयोगियों 2017. एक निर्णय व्यक्ति के लिए विपरीत रूप से निष्पक्ष है i यदि, जनसंख्या के कारण मॉडल के तहत, निर्णय अपरिवर्तित है i संवेदनशील गुणों को विपरीत रूप से बदल दिया जाता है।

एक कारण DAG की आवश्यकता होती है। DAG एक मॉडलिंग विकल्प है। काउंटरफैक्टल निष्पक्षता केवल DAG के रूप में उचित है।

CF बनाम सटीकता के बीच की तुलना

न्यूरआईपीएस 2024 सैद्धांतिकः काउंटरफैक्टल निष्पक्षता और भविष्यवाणात्मक सटीकता के बीच एक अंतर्निहित व्यापार है। एक मॉडल-अज्ञानी विधि एक सीमित सटीकता लागत पर एक अनुकूल-लेकिन-असामान्य भविष्यवाणीकर्ता को एक सीएफ में बदल सकती है। सटीकता लागत अनुकूल-असामान्य भविष्यवाणीकर्ता में संवेदनशील-गुण गुणांक के परिमाण पर निर्भर करती है।

पीछे हटाने के प्रतिफल

arXiv:2401.13935 (जनवरी 2024). पारंपरिक प्रतिकूलताओं के लिए संवेदनशील विशेषता पर हस्तक्षेप की आवश्यकता होती है "यदि यह व्यक्ति एक अलग लिंग होता तो निर्णय बदल जाएगा।" कानूनी रूप से, यह समस्याग्रस्त हैः वर्गीकरण कानून में संरक्षित गुणों पर हस्तक्षेप नहीं किया जा सकता है।

बैकट्रैक करने वाले काउंटरफैक्टुअल्स दिशा बदल देते हैंः विशेषता पर हस्तक्षेप करने के बजाय, पूछें कि व्यक्ति की वास्तविक विशेषताओं का क्या संयोजन विपरीत परिणाम उत्पन्न करेगा। यह कानूनी आपत्ति से बचता है।

दार्शनिक मेलमिलाप

आईसीएलआर ब्लॉगपोस्ट्स 2024। हाथ में एक कारणात्मक ग्राफ के साथ, समूह-साधना के कुछ उपायों को पूरा करने के लिए विरोधाभासी निष्पक्षता शामिल है। तीन परिवार orthogonal नहीं हैं; वे एक ही अंतर्निहित कारणात्मक संरचना के विभिन्न पहलु हैं।

यह असंभवता प्रमेय को हल नहीं करता है (असमान आधार दरें अभी भी समकालिक समूह निष्पक्षता को रोकती हैं) लेकिन यह "समूह" और "व्यक्तिगत / विरोधाभासी" के बीच स्पष्ट विरोध को आंशिक रूप से कारण मॉडल के बारे में स्पष्ट नहीं होने का एक कलाकृत्य दिखाता है।

जहां यह चरण 18 में फिट बैठता है

पाठ 20 पूर्वाग्रह माप है। पाठ 21 निष्पक्षता की परिभाषा है। पाठ 22 गोपनीयता (विभेदक गोपनीयता) है। पाठ 23 वॉटरमार्किंग है। ये आवंटन-समीपवर्ती पाठ हैं जो धोखा-समीपवर्ती पाठ 7-11 को पूरक करते हैं।

इसका प्रयोग करें

code/main.pyएक साधारण वर्गीकरणकर्ता पर जनसांख्यिकीय समानता, समताबद्ध संभावनाएं और सशर्त उपयोग सटीकता समानता की गणना करें। तीन मीट्रिकों को असहमत होने पर ध्यान दें। जनसांख्यिकीय समानता के लिए एक पुनः वजन लागू करें और अन्य दो पर इसकी लागत का निरीक्षण करें।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-fairness-criterion.md. एक निष्पक्षता दावों या नीति को देखते हुए, यह पता चलता है कि कौन सा मापदंड दावों को पूरा कर रहा है, क्या मॉडल दावों के तहत शेष मापदंडों को पूरा कर सकता है असमान आधार दरें, और क्या कारण DAG दावों पर निर्भर करता है।

व्यायाम

  1. दौड़ेंcode/main.py. डिफ़ॉल्ट डेटा पर तीन समूह मीट्रिक रिपोर्ट करें. जनसांख्यिकीय समानता के लिए लक्षित पुनः वजन और पुनः रिपोर्ट करें.
  1. गैर-संवेदनशील विशेषताओं पर L2 का उपयोग करके Dwork et al. 2012 व्यक्तिगत निष्पक्षता मीट्रिक को लागू करें। रिपोर्ट करें कि कितने जोड़े निरंतर L=1 के साथ लिप्सकिट्ज़ का उल्लंघन करते हैं।
  1. कुस्नर और सहयोगियों 2017 पढ़ें। फिर से स्कोर करने के लिए एक सरल दो-गुणात्मक कारण DAG का निर्माण करें और इसका अंतर्निहित विपरीत-साधनात्मक स्थिति की पहचान करें।
  1. 2024 के प्रति-परक तथ्य पेपर में संरक्षित गुणों पर हस्तक्षेप से बचना है। एक ऐसी स्थिति का वर्णन करें जहां यह कानूनी अनुपालन के लिए मायने रखता है।
  1. आईसीएलआर 2024 के मेलमिलाप का तर्क है कि समूह और विरोधाभासी निष्पक्षता एक ही संरचना के पहलू हैं।code/main.pyऔर कारण धारणा बताएं जो उन्हें समकक्ष बनाती है।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
Demographic parity"equal rates"P(Y=1
Equalized odds"equal TPR/FPR"Equal true-positive and false-positive rates across groups
Conditional use accuracy"equal PPV/NPV"Equal predictive values across groups
Individual fairness"Lipschitz condition"Similar individuals get similar decisions
Counterfactual fairness"causal alteration invariance"Decision unchanged under counterfactual attribute alteration
Backtracking counterfactual"explain via actuals"Counterfactual reasoned backward from outcome, not forward from attribute
Impossibility theorem"the three conflict"Chouldechova / KMR 2017: group criteria mutually exclusive under unequal base rates

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.