LLM के लिए अंतर गोपनीयता
Type: Build
Languages: Python (stdlib, DP-SGD noise-injection and ε-δ accountant demonstration)
Prerequisites: Phase 01 · 09 (information theory), Phase 10 · 01 (large-model training)
Time: ~60 minutes
सीखने के लक्ष्य
- (एप्सिलन, डेल्टा) -विभेदक गोपनीयता को परिभाषित करें और डीपी-एसजीडी नुस्खा बताएं।
- 2024-2025 के तनाव की व्याख्या करेंः कैनरी एमआईए बनाम प्रशिक्षण-डेटा निष्कर्षण अलग-अलग चित्र देते हैं।
- PMixED का वर्णन करें और क्यों निष्कर्ष-समय निजी भविष्यवाणी डीपी प्रशिक्षण का विकल्प है।
- एलएलएम प्रतिक्रिया हमले के माध्यम से अंतरपूर्ण गोपनीयता उलट का वर्णन करें।
समस्या
एलएलएम याद रखें। कार्लिनी और सहयोगियों ने 2021 में दिखाया कि उत्पादन भाषा मॉडल मांग पर शाब्दिक प्रशिक्षण पाठ को पुनः पेश करते हैं। डीपी औपचारिक रक्षा हैः प्रशिक्षण ताकि आउटपुट किसी भी एकल प्रशिक्षण उदाहरण के प्रति असुरक्षित हो। 2024-2025 के साक्ष्य बताते हैं कि डीपी-एसजीडी आवश्यक है लेकिन तैनात ε मान खतरे के मॉडल से मेल नहीं खा सकते हैं।
अवधारणा
(ε, δ) - अंतर गोपनीयता
एक यादृच्छिक एल्गोरिथ्म M (ε, δ) -DP है यदि किसी भी एक उदाहरण और किसी भी घटना में भिन्न दो डेटासेट के लिए S:
P(M(D) में S) <= e^ε * P(M(D') में S) + δ.
व्याख्याः आउटपुट वितरण पर्याप्त रूप से निकट है ( ε द्वारा पैरामीटर) कि किसी भी एकल व्यक्ति के योगदान का विश्वसनीय रूप से अनुमान नहीं लगाया जा सकता है, सिवाय संभावना δ के साथ।
डीपी-एसजीडी
Abadi et al. 2016. मानक नुस्खाः
- एक मिनी बैच का नमूना लें।
- प्रति उदाहरण ग्रेडिएंट की गणना करें।
- प्रत्येक उदाहरण प्रति ग्रेडिएंट को सी सीमा तक क्लिप करें।
- कटौती gradients योग और std σ * C के साथ गौशियन शोर जोड़ें.
- पैरामीटर को अपडेट करने के लिए शोर राशि का उपयोग करें।
गोपनीयता लागत को एक लेखाकार (मॉमेंट्स लेखाकार, रेनी डीपी लेखाकार) द्वारा ट्रैक किया जाता है। एलएलएम साहित्य में रिपोर्ट किए गए ε मान खतरे के मॉडल, डेटा संवेदनशीलता और उपयोगिता लक्ष्य के अनुसार व्यापक रूप से भिन्न होते हैं; कोई सार्वभौमिक रूप से "सुरक्षित" डिफ़ॉल्ट ε नहीं है। प्रकाशित उदाहरण कुछ LLM प्रशिक्षण सेटिंग्स में लगभग ε ≈ 110 पर span करते हैं, लेकिन ये उदाहरण हैं अनुशंसित डिफ़ॉल्ट नहीं हैं। कम ε को आम तौर पर अधिक शोर की आवश्यकता होती है और उपयोगिता हानि को बढ़ा सकती है।
लोरा + डीपी-एसजीडी
सीमा मॉडल का पूर्ण डीपी-एसजीडी प्रतिबंधात्मक है। लोरा (हु एट अल. 2022) ग्रेडिएंट अपडेट को छोटे एडाप्टर तक सीमित करता है, प्रति उदाहरण ग्रेडिएंट भंडारण को कम करता है। लोरा + डीपी-एसजीडी आम 2025 विन्यास है। एडाप्टर पर डीपी गारंटी लागू होती है; आधार मॉडल को तय रखा जाता है।
2024-2025 की तनाव
दो साक्ष्य रेखाएँ:
- Canary MIA (Duan et al. 2024).प्रशिक्षण डेटा में अद्वितीय कैनरी डालें, मापें कि क्या एक सदस्यता-उपयोग हमलावर उन्हें पहचान सकता है। भाषा मॉडल पर सीमित सफलता की रिपोर्ट करता है। सुझाव MIA कठिन है।
- Training-data extraction (Carlini 2021, Nasr et al. 2025).मॉडल को एक पूर्वावलोकन के साथ प्रमोशन करें; मापें कि क्या यह प्रशिक्षण से शाब्दिक पाठ को पुनर्प्राप्त करता है। महत्वपूर्ण यादृच्छिकता की रिपोर्ट करता है। MIA को प्रासंगिक अर्थ में आसान बताता है।
मार्च 2025 संकल्प (arXiv:2503.06808): दो अलग-अलग चीजें मापते हैं। एमआईए ने पूछा "क्या उदाहरण ई डाली गई कैनरी पर D में है? " निष्कर्षण पूछता है "मैं D से क्या पुनर्प्राप्त कर सकता हूं? " "सबसे अधिक निष्कर्षण योग्य" उदाहरण गोपनीयता के लिए मायने रखता है; कैनरी इसे कम रिपोर्ट करते हैं क्योंकि उन्हें निष्कर्षण योग्य होने के लिए अनुकूलित नहीं किया गया है।
नए कैनरी डिजाइन, बिना छाया मॉडल के नुकसान आधारित एमआईए, वास्तविक डेटा के साथ वास्तविक डीपी गारंटी के साथ एलएलएम के पहले गैर-व्यर्थ डीपी ऑडिट।
डीपी प्रशिक्षण के विकल्प
- PMixED (arXiv:2403.15638).निष्कर्ष के समय निजी भविष्यवाणी। अगले टोकन वितरण पर विशेषज्ञों का मिश्रण; प्रत्येक विशेषज्ञ प्रशिक्षण डेटा का एक टुकड़ा देखता है; एकत्रीकरण डीपी के लिए शोर जोड़ता है। डीपी प्रशिक्षण से पूरी तरह से बचना।
- DP synthetic data generation (Google Research 2024).डीपी-एसजीडी के साथ लोरा-फाइन-ट्यूनिंग, नमूना सिंथेटिक डेटा, सिंथेटिक डेटा पर एक डाउनस्ट्रीम वर्गीकरण को प्रशिक्षित करें।
दोनों ही एक अलग खतरे के मॉडल की कीमत पर पूर्ण डीपी प्रशिक्षण की उपयोगिता लागत से बचते हैं।
एलएलएम प्रतिक्रिया के माध्यम से अंतरपूर्ण गोपनीयता उलट
2025 के उभरते हमले. व्यक्तियों की पहचान करने के लिए डीपी-प्रशिक्षित मॉडल के आत्मविश्वास स्कोर का उपयोग करें। यहां तक कि जब आउटपुट लीक नहीं होते हैं, तब भी आत्मविश्वास वितरण कर सकते हैं।
रक्षाः रहस्यों को उजागर न करें, या उजागर होने से पहले उन्हें छोटा/क्वांटिज़ करें। यह (ε, δ) -डीपी प्रशिक्षण से परे एक अतिरिक्त आवश्यकता है।
जहां यह चरण 18 में फिट बैठता है
पाठ 20-21 पक्षपात/ निष्पक्षता है। पाठ 22 गोपनीयता है। पाठ 23 वॉटरमार्किंग के माध्यम से प्रवासन है। पाठ 27 नियामक डेटा-प्रवासन परत को कवर करता है।
इसका प्रयोग करें
code/main.pyएक खिलौना द्विआधारी वर्गीकरण डेटासेट पर DP-SGD का अनुकरण करता है। आप शोर गुणक σ और क्लिपिंग मानदंड C को झाड़ सकते हैं और (ε, δ) बजट और सटीकता लागत को ट्रैक कर सकते हैं। एक "कैनरी हमले" एक अद्वितीय प्रशिक्षण उदाहरण सम्मिलित करता है और मापता है कि क्या एक लॉग-लॉस परीक्षण इसे DP से पहले और बाद में पता लगा सकता है।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-dp-audit.md. भाषा मॉडल के उपयोग पर डीपी के दावे को देखते हुए, यह ऑडिट करता हैः (ε, δ) मान, उपयोग किया गया लेखाकार, एमआईए मूल्यांकन प्रोटोकॉल, और क्या विश्वास-एक्सपोजर वेक्टरों का मूल्यांकन किया गया है।
व्यायाम
- दौड़ें
code/main.py. {0.5, 1.0, 2.0} में σ को स्पाइक करें और (ε, δ) सटीकता के व्यापार-बदला की रिपोर्ट करें। उस बिंदु की पहचान करें जहां उपयोगिता टूट जाती है।
- एक कैनरी सम्मिलन और लॉग-लॉस टेस्ट को लागू करें। DP-SGD से पहले और बाद में σ = 1.0 पर पता लगाने की दर मापें।
- प्रशिक्षण-डेटा निष्कर्षण पर Nasr et al. 2025 पढ़ें। मध्यम ε के तहत निष्कर्षण सफलता क्यों नहीं गिरती है? इसका अर्थ क्या है कि MIA-as-evaluation के बारे में?
- PMixED (arXiv:2403.15638) का उपयोग करके एक तैनाती डिजाइन करें जो निष्कर्ष के समय पूरी तरह से काम करता है। PMixED द्वारा संबोधित किए गए खतरे का मॉडल क्या है जो DP-SGD नहीं करता है?
- एलएलएम फीडबैक हमले के माध्यम से डीपी रिवर्स को स्केच करें। एक काउंटरमेज डिज़ाइन करें जो विश्वास स्कोर लीक को सीमित करता है और इसकी तैनाती लागत का अनुमान लगाता है।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| DP | "(ε, δ)-differential privacy" | Formal privacy: output distribution close under neighbouring-dataset change |
| DP-SGD | "noise-injected SGD" | Gradient clipping + Gaussian noise addition; standard DP training |
| LoRA + DP-SGD | "efficient private fine-tune" | DP-SGD on low-rank adapters; standard 2025 configuration |
| MIA | "membership inference" | Attack that determines whether an example was in training data |
| Canary | "inserted watermark example" | Unique training example used to measure DP leakage |
| PMixED | "private inference mixture" | Inference-time DP via mixture-of-experts on next-token distributions |
| DP Reversal | "confidence leakage attack" | Attack that uses a model's confidence as an oracle for re-identification |
आगे पढ़ना
- Abadi et al. — DP-SGD (arXiv:1607.00133) मानक डीपी प्रशिक्षण एल्गोरिथ्म
- Carlini et al. — Extracting Training Data (arXiv:2012.07805) कैनोनिक निकासी कागज
- Duan et al. — Canary MIA on LLMs (arXiv:2402.07841, 2024) सीमित सफलता वाली एमआईए
- Kowalczyk et al. — Auditing DP for LLMs (arXiv:2503.06808, March 2025) तनाव का समाधान
- PMixED (arXiv:2403.15638) इन्फरेन्स-टाइम प्राइवेट प्रेडिक्शन
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.