حریم خصوصی متمایز برای LLM
Type: Build
Languages: Python (stdlib, DP-SGD noise-injection and ε-δ accountant demonstration)
Prerequisites: Phase 01 · 09 (information theory), Phase 10 · 01 (large-model training)
Time: ~60 minutes
اهداف یادگیری
- خصوصیت (epsilon، delta) - تفاوت را تعریف کنید و دستور DP-SGD را بیان کنید.
- تنش 2024-2025 را توضیح دهید: MIA کاناری در مقابل استخراج داده های آموزشی تصاویر متفاوتی را ارائه می دهد.
- PMixED را شرح دهید و توضیح دهید که چرا پیش بینی خصوصی زمان نتیجه گیری جایگزین آموزش DP است.
- بازپسین حریم خصوصی متمایز را از طریق حمله بازخورد LLM توصیف کنید.
مشکل
LLM ها یاد می گیرند. کارلین و همکاران در سال 2021 نشان دادند که مدل های زبان تولید متن آموزش لفظی را بر اساس تقاضا تولید می کنند. DP دفاع رسمی است: آموزش به طوری که تولید به طور قابل اثبات نسبت به هر مثال آموزشی واحد بی حس است. شواهد 2024-2025 نشان می دهد DP-SGD ضروری است اما ارزش های استفاده شده ε ممکن است با مدل تهدید مطابقت نداشته باشد.
مفهوم
(ε, δ) - حریم خصوصی متفاوت
یک الگوریتم تصادفی M (ε، δ) -DP است اگر برای هر دو مجموعه داده ای که در یک مثال و هر رویداد متفاوت است S:
P(M(D) در S) <= e^ε * P(M(D') در S) + δ.
تفسیر: توزیع خروجی به اندازه کافی نزدیک است (برامتر شده با ε) که مشارکت هر فرد واحد را نمی توان به طور قابل اعتماد برداشت کرد، مگر با احتمال δ.
DP-SGD
ابادی و همکاران 2016. دستور استاندارد:
- يه دسته کوچولو رو آزمايش کن
- تراز هر نمونه را محاسبه کنید.
- هر گرادینت در هر نمونه را به یک حد C برش دهید.
- ترازیدهای کپی شده را جمع کنید و صداهای گاوسی را با std σ * C اضافه کنید.
- از مقدار شورش برای بروزرسانی پارامترها استفاده کنید.
هزینه های حریم خصوصی توسط یک حسابدار ( حسابدار لحظه ها، حسابدار Rényi DP) پیگیری می شود. گزارش شده ε ارزش ها در ادبیات LLM به طور گسترده ای با توجه به مدل تهدید، حساسیت داده ها و هدف مفید متفاوت است؛ هیچ استاندارد "امنی" جهانی ε وجود ندارد. نمونه های منتشر شده تقریباً ε ≈ 110 در برخی از تنظیمات آموزش LLM هستند، اما این موارد نشان دهنده هستند پیش فرض توصیه نمی شود. پایین ε معمولاً به شور بیشتری نیاز دارد و می تواند از دست دادن قابلیت های کاربردی را افزایش دهد.
LoRA + DP-SGD
DP-SGD کامل یک مدل مرزی ممنوع است. LoRA (Hu et al. 2022) به روزرسانی های گرادیانت را به یک آداپتور کوچک محدود می کند و ذخیره سازی گرادیانت را در هر نمونه کاهش می دهد. LoRA + DP-SGD پیکربندی رایج 2025 است. تضمین DP برای آداپتور اعمال می شود؛ مدل پایه ثابت است.
تنش 2024 تا 2025
دو تا دليل:
- Canary MIA (Duan et al. 2024).وارد کردن کاناری های منحصر به فرد به داده های آموزش، اندازه گیری اینکه آیا یک مهاجم عضویت-تضعیف می تواند آنها را شناسایی کند. گزارش موفقیت محدود در مدل های زبان. نشان می دهد MIA سخت است.
- Training-data extraction (Carlini 2021, Nasr et al. 2025).مدل را با یک پیشگویی به سرعت نشان دهید؛ اندازه گیری کنید که آیا متن لفظی را از آموزش بازیافت می کند. گزارش حافظه قابل توجهی را گزارش می دهد. نشان می دهد MIA در معنای مربوطه آسان است.
در ماه مارس 2025 قطعنامه (arXiv:2503.06808): دو اندازه گیری چیزهای متفاوت. MIA می پرسد "مثال e در D است؟" در کاناری های وارد شده. استخراج می پرسد "چه چیزی می توانم از D بازیابی کنم؟" مثال "زیادترین استخراج" چیزی است که برای حریم خصوصی اهمیت دارد؛ کاناری ها این را گزارش نمی دهند زیرا بهینه سازی نشده اند تا قابل استخراج باشند.
طرح های جدید کاناری. MIA مبتنی بر خسارت بدون مدل سایه. اولین حسابرسی DP غیر معمولی یک LLM بر روی داده های واقعی با تضمین های DP واقع بینانه.
جایگزین آموزش DP
- PMixED (arXiv:2403.15638).پیش بینی خصوصی در زمان نتیجه گیری. ترکیبی از کارشناسان در توزیع توکن بعدی؛ هر متخصص یک شکه از داده های آموزش را می بیند؛ جمع آوری برای DP صدا اضافه می کند. آموزش DP را به طور کامل اجتناب می کند.
- DP synthetic data generation (Google Research 2024).LoRA- fine-tune با DP-SGD، نمونه داده های مصنوعی، آموزش طبقه بندی کننده زیر جریان در داده های مصنوعی.
هر دو هزینه های کاربردی آموزش کامل DP را با هزینه مدل تهدیدی متفاوت دور می برند.
تغییر تفاوت حریم خصوصی از طریق بازخورد LLM
حمله 2025 ظهور می کند. از نمرات اعتماد مدل آموزش دیده به عنوان یک فالگو برای شناسایی مجدد افراد استفاده کنید. حتی وقتی محصول ها نرفتند، توزیع اعتماد می تواند.
دفاع: نه افشا کردن اعتماد به نفس، یا کوتاه کردن / کمی آنها قبل از افشا کردن. این یک نیاز اضافی فراتر از آموزش (ε، δ) -DP است.
جایی که این در مرحله 18 قرار داره
درس 20-21 تعصب/عدالت است. درس 22 خصوصیت است. درس 23 از طریق آبیاری است. درس 27 پوشش داده های تنظیم کننده را پوشش می دهد.
ازش استفاده کن
code/main.pyشبیه سازی DP-SGD در مجموعه داده های طبقه بندی دوگانه اسباب بازی. شما می توانید ضربگر شور σ و استاندارد برش C را پاک کنید و بودجه (ε، δ) و هزینه دقت را ردیابی کنید. یک "هجوم کاناری" یک مثال آموزشی منحصر به فرد را وارد می کند و اندازه گیری می کند که آیا یک آزمایش از دست دادن روزنامه می تواند آن را قبل و بعد از DP تشخیص دهد.
-باده
این درس به ما کمک می کندoutputs/skill-dp-audit.md. در نظر گرفتن ادعای DP در مورد استفاده از یک مدل زبان، آن را بررسی می کند: (ε، δ) ارزش ها، حسابدار مورد استفاده، پروتکل ارزیابی MIA و اینکه آیا متری های اعتماد و قرار گرفتن در معرض خطر ارزیابی شده است.
تمرینات
- فرار کن
code/main.py. σ را در {0.5، 1.0, 2.0} بررسی کنید و تعادل دقت (ε، δ) را گزارش کنید. نقطه ای را که در آن کاربری سقوط می کند شناسایی کنید.
- یک ورودی کاناری و یک آزمایش از دست دادن روزنامه را اجرا کنید. میزان تشخیص قبل و بعد از DP-SGD را در σ = 1.0 اندازه گیری کنید.
- Nasr et al. 2025 در مورد استخراج اطلاعات آموزشی را بخوانید. چرا موفقیت استخراج در حالت متوسط ε فرو نمی رود؟ این چه معنایی در مورد MIA به عنوان ارزیابی دارد؟
- طراحی یک پیاده سازی با استفاده از PMixED (arXiv:2403.15638) که به طور کامل در زمان نتیجه گیری کار می کند. مدل تهدیدی که PMixED به آن اشاره می کند که DP-SGD انجام نمی دهد چیست؟
- طرح بازپسین DP را از طریق حمله بازخورد LLM طراحی کنید. یک اقدام معادلی را طراحی کنید که باعث محدود کردن انتشار امتیاز اعتماد شود و هزینه های انتشار آن را تخمین زده کنید.
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| DP | "(ε, δ)-differential privacy" | Formal privacy: output distribution close under neighbouring-dataset change |
| DP-SGD | "noise-injected SGD" | Gradient clipping + Gaussian noise addition; standard DP training |
| LoRA + DP-SGD | "efficient private fine-tune" | DP-SGD on low-rank adapters; standard 2025 configuration |
| MIA | "membership inference" | Attack that determines whether an example was in training data |
| Canary | "inserted watermark example" | Unique training example used to measure DP leakage |
| PMixED | "private inference mixture" | Inference-time DP via mixture-of-experts on next-token distributions |
| DP Reversal | "confidence leakage attack" | Attack that uses a model's confidence as an oracle for re-identification |
خواندن بیشتر
- Abadi et al. — DP-SGD (arXiv:1607.00133) الگوریتم استاندارد آموزش DP
- Carlini et al. — Extracting Training Data (arXiv:2012.07805) کاغذ استخراج کانونیکی
- Duan et al. — Canary MIA on LLMs (arXiv:2402.07841, 2024) MIA با موفقیت محدود
- Kowalczyk et al. — Auditing DP for LLMs (arXiv:2503.06808, March 2025) حل تنش
- PMixED (arXiv:2403.15638) پیش بینی خصوصی زمان نتیجه گیری
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.