Phase 18: Ethics, Safety & Alignment

حریم خصوصی متمایز برای LLM

DP-SGD همچنان استاندارد است بروزرسانی های گرادینت تزریق شده با صدا تضمین رسمی (epsilon، delta) را فراهم می کند. هزینه های عمومی در محاسبات، حافظه و بهره وری قابل توجه است؛ تنظیم دقیق DP (LoRA + DP-SGD) با پارامتر موثر، پیکربندی رایج 2025 (ACM 2025) است. دو بدن شواهد در تنش: نتیجه گیری عضویت مبتنی بر کاناری (Duan و همکارانش، 2024) موفقیت محدود در برابر مدل های زبان را گزارش می دهد؛ استخراج داده های آموزشی (Carlini و همکارانش، 2021؛ Nasr و همکارانش، 2025) حافظه لفظی قابل توجهی را بازیابی می کند. قطعنامه (arXiv:2503.06808, مارس 2025): شکاف در آنچه اندازه گیری شده است وارد شده کاناری ها در مقابل "بهترین استخراج" داده ها است. طرح های جدید کاناری MIA مبتنی بر خسارت را بدون مدل های سایه امکان می دهد و اولین حسابرسی DP غیر معمولی یک LLM را با داده های واقعی و تضمین های DP واقعی آموزش می دهد. گزینه های دیگر: PMixED (arXiv:2403.15638) پیش بینی خصوصی در زمان نتیجه گیری از طریق ترکیبی از کارشناسان در توزیع توکن بعدی؛ تولید داده های مصنوعی DP (Google Research 2024). حمله جدید: تغییر حریم خصوصی متفاوت از طریق بازخورد LLM نفوذ نمره اعتماد.

Type: Build

Languages: Python (stdlib, DP-SGD noise-injection and ε-δ accountant demonstration)

Prerequisites: Phase 01 · 09 (information theory), Phase 10 · 01 (large-model training)

Time: ~60 minutes

اهداف یادگیری

  • خصوصیت (epsilon، delta) - تفاوت را تعریف کنید و دستور DP-SGD را بیان کنید.
  • تنش 2024-2025 را توضیح دهید: MIA کاناری در مقابل استخراج داده های آموزشی تصاویر متفاوتی را ارائه می دهد.
  • PMixED را شرح دهید و توضیح دهید که چرا پیش بینی خصوصی زمان نتیجه گیری جایگزین آموزش DP است.
  • بازپسین حریم خصوصی متمایز را از طریق حمله بازخورد LLM توصیف کنید.

مشکل

LLM ها یاد می گیرند. کارلین و همکاران در سال 2021 نشان دادند که مدل های زبان تولید متن آموزش لفظی را بر اساس تقاضا تولید می کنند. DP دفاع رسمی است: آموزش به طوری که تولید به طور قابل اثبات نسبت به هر مثال آموزشی واحد بی حس است. شواهد 2024-2025 نشان می دهد DP-SGD ضروری است اما ارزش های استفاده شده ε ممکن است با مدل تهدید مطابقت نداشته باشد.

مفهوم

(ε, δ) - حریم خصوصی متفاوت

یک الگوریتم تصادفی M (ε، δ) -DP است اگر برای هر دو مجموعه داده ای که در یک مثال و هر رویداد متفاوت است S:

P(M(D) در S) <= e^ε * P(M(D') در S) + δ.

تفسیر: توزیع خروجی به اندازه کافی نزدیک است (برامتر شده با ε) که مشارکت هر فرد واحد را نمی توان به طور قابل اعتماد برداشت کرد، مگر با احتمال δ.

DP-SGD

ابادی و همکاران 2016. دستور استاندارد:

  1. يه دسته کوچولو رو آزمايش کن
  2. تراز هر نمونه را محاسبه کنید.
  3. هر گرادینت در هر نمونه را به یک حد C برش دهید.
  4. ترازیدهای کپی شده را جمع کنید و صداهای گاوسی را با std σ * C اضافه کنید.
  5. از مقدار شورش برای بروزرسانی پارامترها استفاده کنید.

هزینه های حریم خصوصی توسط یک حسابدار ( حسابدار لحظه ها، حسابدار Rényi DP) پیگیری می شود. گزارش شده ε ارزش ها در ادبیات LLM به طور گسترده ای با توجه به مدل تهدید، حساسیت داده ها و هدف مفید متفاوت است؛ هیچ استاندارد "امنی" جهانی ε وجود ندارد. نمونه های منتشر شده تقریباً ε ≈ 110 در برخی از تنظیمات آموزش LLM هستند، اما این موارد نشان دهنده هستند پیش فرض توصیه نمی شود. پایین ε معمولاً به شور بیشتری نیاز دارد و می تواند از دست دادن قابلیت های کاربردی را افزایش دهد.

LoRA + DP-SGD

DP-SGD کامل یک مدل مرزی ممنوع است. LoRA (Hu et al. 2022) به روزرسانی های گرادیانت را به یک آداپتور کوچک محدود می کند و ذخیره سازی گرادیانت را در هر نمونه کاهش می دهد. LoRA + DP-SGD پیکربندی رایج 2025 است. تضمین DP برای آداپتور اعمال می شود؛ مدل پایه ثابت است.

تنش 2024 تا 2025

دو تا دليل:

  • Canary MIA (Duan et al. 2024).وارد کردن کاناری های منحصر به فرد به داده های آموزش، اندازه گیری اینکه آیا یک مهاجم عضویت-تضعیف می تواند آنها را شناسایی کند. گزارش موفقیت محدود در مدل های زبان. نشان می دهد MIA سخت است.
  • Training-data extraction (Carlini 2021, Nasr et al. 2025).مدل را با یک پیشگویی به سرعت نشان دهید؛ اندازه گیری کنید که آیا متن لفظی را از آموزش بازیافت می کند. گزارش حافظه قابل توجهی را گزارش می دهد. نشان می دهد MIA در معنای مربوطه آسان است.

در ماه مارس 2025 قطعنامه (arXiv:2503.06808): دو اندازه گیری چیزهای متفاوت. MIA می پرسد "مثال e در D است؟" در کاناری های وارد شده. استخراج می پرسد "چه چیزی می توانم از D بازیابی کنم؟" مثال "زیادترین استخراج" چیزی است که برای حریم خصوصی اهمیت دارد؛ کاناری ها این را گزارش نمی دهند زیرا بهینه سازی نشده اند تا قابل استخراج باشند.

طرح های جدید کاناری. MIA مبتنی بر خسارت بدون مدل سایه. اولین حسابرسی DP غیر معمولی یک LLM بر روی داده های واقعی با تضمین های DP واقع بینانه.

جایگزین آموزش DP

  • PMixED (arXiv:2403.15638).پیش بینی خصوصی در زمان نتیجه گیری. ترکیبی از کارشناسان در توزیع توکن بعدی؛ هر متخصص یک شکه از داده های آموزش را می بیند؛ جمع آوری برای DP صدا اضافه می کند. آموزش DP را به طور کامل اجتناب می کند.
  • DP synthetic data generation (Google Research 2024).LoRA- fine-tune با DP-SGD، نمونه داده های مصنوعی، آموزش طبقه بندی کننده زیر جریان در داده های مصنوعی.

هر دو هزینه های کاربردی آموزش کامل DP را با هزینه مدل تهدیدی متفاوت دور می برند.

تغییر تفاوت حریم خصوصی از طریق بازخورد LLM

حمله 2025 ظهور می کند. از نمرات اعتماد مدل آموزش دیده به عنوان یک فالگو برای شناسایی مجدد افراد استفاده کنید. حتی وقتی محصول ها نرفتند، توزیع اعتماد می تواند.

دفاع: نه افشا کردن اعتماد به نفس، یا کوتاه کردن / کمی آنها قبل از افشا کردن. این یک نیاز اضافی فراتر از آموزش (ε، δ) -DP است.

جایی که این در مرحله 18 قرار داره

درس 20-21 تعصب/عدالت است. درس 22 خصوصیت است. درس 23 از طریق آبیاری است. درس 27 پوشش داده های تنظیم کننده را پوشش می دهد.

ازش استفاده کن

code/main.pyشبیه سازی DP-SGD در مجموعه داده های طبقه بندی دوگانه اسباب بازی. شما می توانید ضربگر شور σ و استاندارد برش C را پاک کنید و بودجه (ε، δ) و هزینه دقت را ردیابی کنید. یک "هجوم کاناری" یک مثال آموزشی منحصر به فرد را وارد می کند و اندازه گیری می کند که آیا یک آزمایش از دست دادن روزنامه می تواند آن را قبل و بعد از DP تشخیص دهد.

-باده

این درس به ما کمک می کندoutputs/skill-dp-audit.md. در نظر گرفتن ادعای DP در مورد استفاده از یک مدل زبان، آن را بررسی می کند: (ε، δ) ارزش ها، حسابدار مورد استفاده، پروتکل ارزیابی MIA و اینکه آیا متری های اعتماد و قرار گرفتن در معرض خطر ارزیابی شده است.

تمرینات

  1. فرار کنcode/main.py. σ را در {0.5، 1.0, 2.0} بررسی کنید و تعادل دقت (ε، δ) را گزارش کنید. نقطه ای را که در آن کاربری سقوط می کند شناسایی کنید.
  1. یک ورودی کاناری و یک آزمایش از دست دادن روزنامه را اجرا کنید. میزان تشخیص قبل و بعد از DP-SGD را در σ = 1.0 اندازه گیری کنید.
  1. Nasr et al. 2025 در مورد استخراج اطلاعات آموزشی را بخوانید. چرا موفقیت استخراج در حالت متوسط ε فرو نمی رود؟ این چه معنایی در مورد MIA به عنوان ارزیابی دارد؟
  1. طراحی یک پیاده سازی با استفاده از PMixED (arXiv:2403.15638) که به طور کامل در زمان نتیجه گیری کار می کند. مدل تهدیدی که PMixED به آن اشاره می کند که DP-SGD انجام نمی دهد چیست؟
  1. طرح بازپسین DP را از طریق حمله بازخورد LLM طراحی کنید. یک اقدام معادلی را طراحی کنید که باعث محدود کردن انتشار امتیاز اعتماد شود و هزینه های انتشار آن را تخمین زده کنید.

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
DP"(ε, δ)-differential privacy"Formal privacy: output distribution close under neighbouring-dataset change
DP-SGD"noise-injected SGD"Gradient clipping + Gaussian noise addition; standard DP training
LoRA + DP-SGD"efficient private fine-tune"DP-SGD on low-rank adapters; standard 2025 configuration
MIA"membership inference"Attack that determines whether an example was in training data
Canary"inserted watermark example"Unique training example used to measure DP leakage
PMixED"private inference mixture"Inference-time DP via mixture-of-experts on next-token distributions
DP Reversal"confidence leakage attack"Attack that uses a model's confidence as an oracle for re-identification

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.