Phase 18: Ethics, Safety & Alignment

LLM के लिए अंतर गोपनीयता

डीपी-एसजीडी मानक शोर-इंजेक्शन ग्रेडिएंट अपडेट के रूप में बनी रहती है। गणना, स्मृति और उपयोगिता में ओवरहेड काफी है; पैरामीटर-कुशल डीपी सूक्ष्म-ट्यूनिंग (लोरा + डीपी-एसजीडी) आम 2025 विन्यास (एसीएम 2025) है। तनाव में दो साक्ष्य निकायोंः कैनरी आधारित सदस्यता निष्कर्ष (ड्यूआन एट एल, 2024) भाषा मॉडल के खिलाफ सीमित सफलता की रिपोर्ट करता है; प्रशिक्षण-डेटा निष्कर्षण (कार्लिनी एट एल, 2021; नासर एट एल, 2025) पर्याप्त शाब्दिक यादृच्छिकता को पुनर्प्राप्त करता है। संकल्प (arXiv:2503.06808, मार्च 2025): अंतर मापा गया है सम्मिलित कैनरी बनाम "सबसे निष्कर्षण योग्य" डेटा में है। नए कैनरी डिजाइन बिना छाया मॉडल के नुकसान आधारित एमआईए को सक्षम बनाते हैं और वास्तविक डेटा पर प्रशिक्षित एलएलएम के पहले गैर-नाजुक डीपी ऑडिट का परिणाम होते हैं, जिसमें यथार्थवादी डीपी गारंटी होती है। विकल्पः PMixED (arXiv:2403.15638) अगले टोकन वितरण पर विशेषज्ञों के मिश्रण के माध्यम से निष्कर्ष समय पर निजी भविष्यवाणी; डीपी सिंथेटिक डेटा जनरेशन (Google अनुसंधान 2024). उभरते हुए हमले: एलएलएम प्रतिक्रिया के माध्यम से अंतरपूर्ण गोपनीयता उलटण विश्वास स्कोर लीक।

Type: Build

Languages: Python (stdlib, DP-SGD noise-injection and ε-δ accountant demonstration)

Prerequisites: Phase 01 · 09 (information theory), Phase 10 · 01 (large-model training)

Time: ~60 minutes

सीखने के लक्ष्य

  • (एप्सिलन, डेल्टा) -विभेदक गोपनीयता को परिभाषित करें और डीपी-एसजीडी नुस्खा बताएं।
  • 2024-2025 के तनाव की व्याख्या करेंः कैनरी एमआईए बनाम प्रशिक्षण-डेटा निष्कर्षण अलग-अलग चित्र देते हैं।
  • PMixED का वर्णन करें और क्यों निष्कर्ष-समय निजी भविष्यवाणी डीपी प्रशिक्षण का विकल्प है।
  • एलएलएम प्रतिक्रिया हमले के माध्यम से अंतरपूर्ण गोपनीयता उलट का वर्णन करें।

समस्या

एलएलएम याद रखें। कार्लिनी और सहयोगियों ने 2021 में दिखाया कि उत्पादन भाषा मॉडल मांग पर शाब्दिक प्रशिक्षण पाठ को पुनः पेश करते हैं। डीपी औपचारिक रक्षा हैः प्रशिक्षण ताकि आउटपुट किसी भी एकल प्रशिक्षण उदाहरण के प्रति असुरक्षित हो। 2024-2025 के साक्ष्य बताते हैं कि डीपी-एसजीडी आवश्यक है लेकिन तैनात ε मान खतरे के मॉडल से मेल नहीं खा सकते हैं।

अवधारणा

(ε, δ) - अंतर गोपनीयता

एक यादृच्छिक एल्गोरिथ्म M (ε, δ) -DP है यदि किसी भी एक उदाहरण और किसी भी घटना में भिन्न दो डेटासेट के लिए S:

P(M(D) में S) <= e^ε * P(M(D') में S) + δ.

व्याख्याः आउटपुट वितरण पर्याप्त रूप से निकट है ( ε द्वारा पैरामीटर) कि किसी भी एकल व्यक्ति के योगदान का विश्वसनीय रूप से अनुमान नहीं लगाया जा सकता है, सिवाय संभावना δ के साथ।

डीपी-एसजीडी

Abadi et al. 2016. मानक नुस्खाः

  1. एक मिनी बैच का नमूना लें।
  2. प्रति उदाहरण ग्रेडिएंट की गणना करें।
  3. प्रत्येक उदाहरण प्रति ग्रेडिएंट को सी सीमा तक क्लिप करें।
  4. कटौती gradients योग और std σ * C के साथ गौशियन शोर जोड़ें.
  5. पैरामीटर को अपडेट करने के लिए शोर राशि का उपयोग करें।

गोपनीयता लागत को एक लेखाकार (मॉमेंट्स लेखाकार, रेनी डीपी लेखाकार) द्वारा ट्रैक किया जाता है। एलएलएम साहित्य में रिपोर्ट किए गए ε मान खतरे के मॉडल, डेटा संवेदनशीलता और उपयोगिता लक्ष्य के अनुसार व्यापक रूप से भिन्न होते हैं; कोई सार्वभौमिक रूप से "सुरक्षित" डिफ़ॉल्ट ε नहीं है। प्रकाशित उदाहरण कुछ LLM प्रशिक्षण सेटिंग्स में लगभग ε ≈ 110 पर span करते हैं, लेकिन ये उदाहरण हैं अनुशंसित डिफ़ॉल्ट नहीं हैं। कम ε को आम तौर पर अधिक शोर की आवश्यकता होती है और उपयोगिता हानि को बढ़ा सकती है।

लोरा + डीपी-एसजीडी

सीमा मॉडल का पूर्ण डीपी-एसजीडी प्रतिबंधात्मक है। लोरा (हु एट अल. 2022) ग्रेडिएंट अपडेट को छोटे एडाप्टर तक सीमित करता है, प्रति उदाहरण ग्रेडिएंट भंडारण को कम करता है। लोरा + डीपी-एसजीडी आम 2025 विन्यास है। एडाप्टर पर डीपी गारंटी लागू होती है; आधार मॉडल को तय रखा जाता है।

2024-2025 की तनाव

दो साक्ष्य रेखाएँ:

  • Canary MIA (Duan et al. 2024).प्रशिक्षण डेटा में अद्वितीय कैनरी डालें, मापें कि क्या एक सदस्यता-उपयोग हमलावर उन्हें पहचान सकता है। भाषा मॉडल पर सीमित सफलता की रिपोर्ट करता है। सुझाव MIA कठिन है।
  • Training-data extraction (Carlini 2021, Nasr et al. 2025).मॉडल को एक पूर्वावलोकन के साथ प्रमोशन करें; मापें कि क्या यह प्रशिक्षण से शाब्दिक पाठ को पुनर्प्राप्त करता है। महत्वपूर्ण यादृच्छिकता की रिपोर्ट करता है। MIA को प्रासंगिक अर्थ में आसान बताता है।

मार्च 2025 संकल्प (arXiv:2503.06808): दो अलग-अलग चीजें मापते हैं। एमआईए ने पूछा "क्या उदाहरण ई डाली गई कैनरी पर D में है? " निष्कर्षण पूछता है "मैं D से क्या पुनर्प्राप्त कर सकता हूं? " "सबसे अधिक निष्कर्षण योग्य" उदाहरण गोपनीयता के लिए मायने रखता है; कैनरी इसे कम रिपोर्ट करते हैं क्योंकि उन्हें निष्कर्षण योग्य होने के लिए अनुकूलित नहीं किया गया है।

नए कैनरी डिजाइन, बिना छाया मॉडल के नुकसान आधारित एमआईए, वास्तविक डेटा के साथ वास्तविक डीपी गारंटी के साथ एलएलएम के पहले गैर-व्यर्थ डीपी ऑडिट।

डीपी प्रशिक्षण के विकल्प

  • PMixED (arXiv:2403.15638).निष्कर्ष के समय निजी भविष्यवाणी। अगले टोकन वितरण पर विशेषज्ञों का मिश्रण; प्रत्येक विशेषज्ञ प्रशिक्षण डेटा का एक टुकड़ा देखता है; एकत्रीकरण डीपी के लिए शोर जोड़ता है। डीपी प्रशिक्षण से पूरी तरह से बचना।
  • DP synthetic data generation (Google Research 2024).डीपी-एसजीडी के साथ लोरा-फाइन-ट्यूनिंग, नमूना सिंथेटिक डेटा, सिंथेटिक डेटा पर एक डाउनस्ट्रीम वर्गीकरण को प्रशिक्षित करें।

दोनों ही एक अलग खतरे के मॉडल की कीमत पर पूर्ण डीपी प्रशिक्षण की उपयोगिता लागत से बचते हैं।

एलएलएम प्रतिक्रिया के माध्यम से अंतरपूर्ण गोपनीयता उलट

2025 के उभरते हमले. व्यक्तियों की पहचान करने के लिए डीपी-प्रशिक्षित मॉडल के आत्मविश्वास स्कोर का उपयोग करें। यहां तक कि जब आउटपुट लीक नहीं होते हैं, तब भी आत्मविश्वास वितरण कर सकते हैं।

रक्षाः रहस्यों को उजागर न करें, या उजागर होने से पहले उन्हें छोटा/क्वांटिज़ करें। यह (ε, δ) -डीपी प्रशिक्षण से परे एक अतिरिक्त आवश्यकता है।

जहां यह चरण 18 में फिट बैठता है

पाठ 20-21 पक्षपात/ निष्पक्षता है। पाठ 22 गोपनीयता है। पाठ 23 वॉटरमार्किंग के माध्यम से प्रवासन है। पाठ 27 नियामक डेटा-प्रवासन परत को कवर करता है।

इसका प्रयोग करें

code/main.pyएक खिलौना द्विआधारी वर्गीकरण डेटासेट पर DP-SGD का अनुकरण करता है। आप शोर गुणक σ और क्लिपिंग मानदंड C को झाड़ सकते हैं और (ε, δ) बजट और सटीकता लागत को ट्रैक कर सकते हैं। एक "कैनरी हमले" एक अद्वितीय प्रशिक्षण उदाहरण सम्मिलित करता है और मापता है कि क्या एक लॉग-लॉस परीक्षण इसे DP से पहले और बाद में पता लगा सकता है।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-dp-audit.md. भाषा मॉडल के उपयोग पर डीपी के दावे को देखते हुए, यह ऑडिट करता हैः (ε, δ) मान, उपयोग किया गया लेखाकार, एमआईए मूल्यांकन प्रोटोकॉल, और क्या विश्वास-एक्सपोजर वेक्टरों का मूल्यांकन किया गया है।

व्यायाम

  1. दौड़ेंcode/main.py. {0.5, 1.0, 2.0} में σ को स्पाइक करें और (ε, δ) सटीकता के व्यापार-बदला की रिपोर्ट करें। उस बिंदु की पहचान करें जहां उपयोगिता टूट जाती है।
  1. एक कैनरी सम्मिलन और लॉग-लॉस टेस्ट को लागू करें। DP-SGD से पहले और बाद में σ = 1.0 पर पता लगाने की दर मापें।
  1. प्रशिक्षण-डेटा निष्कर्षण पर Nasr et al. 2025 पढ़ें। मध्यम ε के तहत निष्कर्षण सफलता क्यों नहीं गिरती है? इसका अर्थ क्या है कि MIA-as-evaluation के बारे में?
  1. PMixED (arXiv:2403.15638) का उपयोग करके एक तैनाती डिजाइन करें जो निष्कर्ष के समय पूरी तरह से काम करता है। PMixED द्वारा संबोधित किए गए खतरे का मॉडल क्या है जो DP-SGD नहीं करता है?
  1. एलएलएम फीडबैक हमले के माध्यम से डीपी रिवर्स को स्केच करें। एक काउंटरमेज डिज़ाइन करें जो विश्वास स्कोर लीक को सीमित करता है और इसकी तैनाती लागत का अनुमान लगाता है।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
DP"(ε, δ)-differential privacy"Formal privacy: output distribution close under neighbouring-dataset change
DP-SGD"noise-injected SGD"Gradient clipping + Gaussian noise addition; standard DP training
LoRA + DP-SGD"efficient private fine-tune"DP-SGD on low-rank adapters; standard 2025 configuration
MIA"membership inference"Attack that determines whether an example was in training data
Canary"inserted watermark example"Unique training example used to measure DP leakage
PMixED"private inference mixture"Inference-time DP via mixture-of-experts on next-token distributions
DP Reversal"confidence leakage attack"Attack that uses a model's confidence as an oracle for re-identification

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.