الخصوصية المختلفة لشركات القانون
Type: Build
Languages: Python (stdlib, DP-SGD noise-injection and ε-δ accountant demonstration)
Prerequisites: Phase 01 · 09 (information theory), Phase 10 · 01 (large-model training)
Time: ~60 minutes
أهداف التعلم
- تحديد (epsilon، delta) - الخصوصية المختلفة وتصريح وصفة DP-SGD.
- شرح التوتر في الفترة من 2024 إلى 2025: تقديم الصور المختلفة بين إدارة البيانات المتعلقة بالفحشات القناريية و استخراج البيانات المتعلقة بالتدريب.
- وصف PMixED ولماذا التنبؤ الخاص بفترة الاستنتاج هو بديل للتدريب على DP.
- وصف عكس الخصوصية المختلفة عبر هجوم ردود الفعل في الـ LLM.
المشكلة
يذكر LLM. أظهر Carlini et al. 2021 أن نماذج اللغة الإنتاجية تنتج نصًا تدريبيًا حرفيًا عند الطلب. DP هو الدفاع الرسمي: تدريب بحيث يكون الإنتاج غير حساسًا لأي مثال تدريبي واحد. يظهر الأدلة 2024-2025 أن DP-SGD ضرورية ولكن القيم ε المنشورة قد لا تتطابق مع نموذج التهديد.
المفهوم
(ε, δ) - الخصوصية المختلفة
خوارزمية عشوائية M هي (ε, δ) -DP إذا كان لأي مجموعتين من بيانات مختلفة في مثال واحد وأي حدث S:
P(M(D) في S) <= e^ε * P(M(D') في S) + δ.
تفسير: توزيع الخروج قريب بما فيه الكفاية (مُعَدَّد ب ε) بحيث لا يمكن استنباط مساهمة أي فرد واحد بشكل موثوق، إلا مع احتمال δ.
دبي-سجيد
عبادي وآخرون 2016. وصفة قياسية:
- عينة صغيرة من اللحظة
- احسب التراجع لكل مثال
- قم بتصنيف كل تراجع لكل نموذج إلى عتبة C.
- قم بجمع التراجعات المقطوعة و أضف ضجيج غوسيان مع std σ * C.
- استخدم المبلغ الضوضاء لتحديث المعلمات.
يتم تتبع تكلفة الخصوصية من قبل محاسب (حاسبة اللحظات، محاسبة ريني دي). تقرير ε القيم في أدب LLM تختلف على نطاق واسع حسب نموذج التهديد ، حساسية البيانات ، والهدف المفيد ؛ لا يوجد افتراض "أمن" عالميا ε. تم نشر أمثلة تتراوح حوالي ε ≈ 110 في بعض إعدادات تدريب LLM، ولكن هذه هي مثليات لا يوصى بتخلفات. يطلب ε أقل عموماً المزيد من الضوضاء ويمكن أن يزيد من فقدان المستخدم.
(لورا) + (دي بي-إس جي دي)
يُعتبر نظام التشغيل المكثف للنظام التشغيل المكثف للنظام التشغيل المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف.
التوتر من 2024 إلى 2025
اثنين من الأدلة:
- Canary MIA (Duan et al. 2024).إدراج القناريات الفريدة في بيانات التدريب، قياس ما إذا كان مهاجم إدراك العضوية يمكن تحديده. تقارير محدودة النجاح على نماذج اللغة. يفترض أن MIA صعبة.
- Training-data extraction (Carlini 2021, Nasr et al. 2025).إضافة نموذج مع مقدمة؛ قياس ما إذا كان يسترد النص حرفيا من التدريب. تقرير حفظ جوهري. يفترض MIA هو سهل في المعنى المعني.
قرار مارس 2025 (arXiv:2503.06808): قياس الأشياء المختلفة. يسأل MIA "هل مثال e في D؟" على القناريات المضافة. يسأل الاستخراج "ما الذي يمكنني استعادة منه D؟" مثال "الأغلب الاستخراج" هو ما يهم الخصوصية. تقرير القناريات هذا لأن لا يتم تحسينها لاستخراجها.
تصميمات جديدة للقناريات، إدارة معدل الخسائر بدون نماذج الظل، أول تدقيق غير بسيط للدبليو إلكتروني لشركة ماجستير في العلوم على بيانات حقيقية مع ضمانات دبليو واقعية.
البدائل للتدريب على المهارات
- PMixED (arXiv:2403.15638).التنبؤ الخاص في وقت الاستنتاج. مزيج من الخبراء في توزيعات الشيطان التالي؛ كل خبير يرى شظيفة من بيانات التدريب؛ الجمع يضيف الضوضاء لـ DP. يتجنب تدريب DP بالكامل.
- DP synthetic data generation (Google Research 2024).تحديد المعلومات المختلفة مع البيانات المختلفة، وتدريب المصفوفات التدريجية على البيانات المختلفة.
كلاهما يتجنب تكلفة المرافق للتدريب الكامل على الموظفين على حساب نموذج تهديد مختلف.
عكس الخصوصية المختلفة عبر تعليقات الـ LLM
الهجوم الناشئ 2025، استخدم درجات الثقة من نموذج مدرب على DP كحديث لإعادة تحديد الأفراد. حتى عندما لا تسرب الخروج، يمكن توزيع الثقة.
الدفاع: لا تعرض الأسرار، أو تقسيمها / الكمية قبل التعرض. هذا هو متطلب إضافي خارج تدريب (ε، δ) -DP.
حيث يتناسب هذا مع المرحلة 18
الدروس 20-21 هي التحيز / العدالة. الدروس 22 هي الخصوصية. الدروس 23 هي المواصلة عن طريق علامة المياه. الدروس 27 تغطي طبقة البيانات التنظيمية-المواصلة.
استخدمها
code/main.pyيحاكي DP-SGD على مجموعة بيانات تصنيف ثنائي لعبة. يمكنك مسح مضاعف الضوضاء σ والمعيار القصص C وتتبع ميزانية (ε، δ) وتكلفة الدقة. يضيف "هجوم القناري" مثالًا فريدًا للتدريب ويقيس ما إذا كان اختبار خسارة السجل يمكن اكتشافه قبل وبعد DP.
أرسله
هذا الدرس يُنتجoutputs/skill-dp-audit.md. في إطار ادعاءات الـ DP بشأن تنفيذ نموذج لغوي، فإنه يقوم بمراجعة: قيم (ε، δ) ، والمحاسب المستخدم، بروتوكول تقييم MIA، وما إذا تم تقييم متجهات التعرض للثقة.
التمارين
- أركض
code/main.py. مسح σ في {0.5، 1.0, 2.0} وتقديم تقرير عن التنازل عن دقة (ε، δ) وتحديد نقطة انهيار المرافق.
- إجراء إدخال القناري واختبار فقدان السجل. قياس معدل الكشف قبل وبعد DP-SGD عند σ = 1.0.
- اقرأ Nasr et al. 2025 حول استخراج البيانات التدريبية. لماذا لا ينهي نجاح استخراج تحت متوسط ε؟ ما الذي يعني هذا عن MIA-as-evaluation؟
- تصميم نشر باستخدام PMixED (arXiv:2403.15638) الذي يعمل بالكامل في وقت الاستنتاج. ما هو نموذج التهديد الذي يعالجه PMixED الذي لا يعمله DP-SGD؟
- رسم عكس DP عبر هجوم LLM Feedback. صمم تدبير مضاد يحد من تسرب درجة الثقة وتقدير تكلفة نشرها.
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| DP | "(ε, δ)-differential privacy" | Formal privacy: output distribution close under neighbouring-dataset change |
| DP-SGD | "noise-injected SGD" | Gradient clipping + Gaussian noise addition; standard DP training |
| LoRA + DP-SGD | "efficient private fine-tune" | DP-SGD on low-rank adapters; standard 2025 configuration |
| MIA | "membership inference" | Attack that determines whether an example was in training data |
| Canary | "inserted watermark example" | Unique training example used to measure DP leakage |
| PMixED | "private inference mixture" | Inference-time DP via mixture-of-experts on next-token distributions |
| DP Reversal | "confidence leakage attack" | Attack that uses a model's confidence as an oracle for re-identification |
المزيد من القراءة
- Abadi et al. — DP-SGD (arXiv:1607.00133) خوارزمية تدريب الدبلوماسي القياسية
- Carlini et al. — Extracting Training Data (arXiv:2012.07805) ورقة الاستخراج القنوني
- Duan et al. — Canary MIA on LLMs (arXiv:2402.07841, 2024) إصابة معدل إصابة محدودة
- Kowalczyk et al. — Auditing DP for LLMs (arXiv:2503.06808, March 2025) تحديد التوتر
- PMixED (arXiv:2403.15638) توقعات خاصة في وقت الإستنتاج
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.