Phase 18: Ethics, Safety & Alignment

الخصوصية المختلفة لشركات القانون

يظل DP-SGD هو الوضع القياسي تحديثات التدفقات التي يتم حقنها بالضوضاء توفر ضمانات رسمية (إكسيلون، دلتا). التكلفة العامة في الحوسبة والذاكرة والخدمات كبيرة؛ تعديل دبي رفيع التكيف مع المعايير (LoRA + DP-SGD) هو التكوين الشائع 2025 (ACM 2025). اثنين من الجماعات من الأدلة في التوتر: استنتاج العضوية القناري (دوان وزملاؤه، 2024) يبلغ عن نجاح محدود ضد نماذج اللغة؛ استخراج البيانات التدريبية (كارليني وزملاؤه، 2021؛ نصر وزملاؤه، 2025) يسترد التذاكر الكبيرة حرفيا. القرار (arXiv:2503.06808, مارس 2025): الفجوة في ما يتم قياسه البيانات القناريات المضافة مقابل "أكثر البيانات قابلة للتصدير". تصميمات القناري الجديدة تسمح بتقديم إعلانات إعلامية قائمة على الخسارة دون نماذج الظل وتنتج أول تدقيق غير بسيط للدبليوترز في شركة حقوقية تدرب على بيانات حقيقية مع ضمانات دبليوترزز واقعية. البدائل: PMixED (arXiv:2403.15638) التنبؤ الخاص في وقت الاستنتاج عن طريق مزيج من الخبراء في توزيعات الوهم التالي ؛ إنتاج بيانات DP الاصطناعية (Google Research 2024). الهجوم الناشئ: عكس الخصوصية التفاضلي عبر تقرير القانون القانوني تسرب درجة الثقة.

Type: Build

Languages: Python (stdlib, DP-SGD noise-injection and ε-δ accountant demonstration)

Prerequisites: Phase 01 · 09 (information theory), Phase 10 · 01 (large-model training)

Time: ~60 minutes

أهداف التعلم

  • تحديد (epsilon، delta) - الخصوصية المختلفة وتصريح وصفة DP-SGD.
  • شرح التوتر في الفترة من 2024 إلى 2025: تقديم الصور المختلفة بين إدارة البيانات المتعلقة بالفحشات القناريية و استخراج البيانات المتعلقة بالتدريب.
  • وصف PMixED ولماذا التنبؤ الخاص بفترة الاستنتاج هو بديل للتدريب على DP.
  • وصف عكس الخصوصية المختلفة عبر هجوم ردود الفعل في الـ LLM.

المشكلة

يذكر LLM. أظهر Carlini et al. 2021 أن نماذج اللغة الإنتاجية تنتج نصًا تدريبيًا حرفيًا عند الطلب. DP هو الدفاع الرسمي: تدريب بحيث يكون الإنتاج غير حساسًا لأي مثال تدريبي واحد. يظهر الأدلة 2024-2025 أن DP-SGD ضرورية ولكن القيم ε المنشورة قد لا تتطابق مع نموذج التهديد.

المفهوم

(ε, δ) - الخصوصية المختلفة

خوارزمية عشوائية M هي (ε, δ) -DP إذا كان لأي مجموعتين من بيانات مختلفة في مثال واحد وأي حدث S:

P(M(D) في S) <= e^ε * P(M(D') في S) + δ.

تفسير: توزيع الخروج قريب بما فيه الكفاية (مُعَدَّد ب ε) بحيث لا يمكن استنباط مساهمة أي فرد واحد بشكل موثوق، إلا مع احتمال δ.

دبي-سجيد

عبادي وآخرون 2016. وصفة قياسية:

  1. عينة صغيرة من اللحظة
  2. احسب التراجع لكل مثال
  3. قم بتصنيف كل تراجع لكل نموذج إلى عتبة C.
  4. قم بجمع التراجعات المقطوعة و أضف ضجيج غوسيان مع std σ * C.
  5. استخدم المبلغ الضوضاء لتحديث المعلمات.

يتم تتبع تكلفة الخصوصية من قبل محاسب (حاسبة اللحظات، محاسبة ريني دي). تقرير ε القيم في أدب LLM تختلف على نطاق واسع حسب نموذج التهديد ، حساسية البيانات ، والهدف المفيد ؛ لا يوجد افتراض "أمن" عالميا ε. تم نشر أمثلة تتراوح حوالي ε ≈ 110 في بعض إعدادات تدريب LLM، ولكن هذه هي مثليات لا يوصى بتخلفات. يطلب ε أقل عموماً المزيد من الضوضاء ويمكن أن يزيد من فقدان المستخدم.

(لورا) + (دي بي-إس جي دي)

يُعتبر نظام التشغيل المكثف للنظام التشغيل المكثف للنظام التشغيل المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف المكثف.

التوتر من 2024 إلى 2025

اثنين من الأدلة:

  • Canary MIA (Duan et al. 2024).إدراج القناريات الفريدة في بيانات التدريب، قياس ما إذا كان مهاجم إدراك العضوية يمكن تحديده. تقارير محدودة النجاح على نماذج اللغة. يفترض أن MIA صعبة.
  • Training-data extraction (Carlini 2021, Nasr et al. 2025).إضافة نموذج مع مقدمة؛ قياس ما إذا كان يسترد النص حرفيا من التدريب. تقرير حفظ جوهري. يفترض MIA هو سهل في المعنى المعني.

قرار مارس 2025 (arXiv:2503.06808): قياس الأشياء المختلفة. يسأل MIA "هل مثال e في D؟" على القناريات المضافة. يسأل الاستخراج "ما الذي يمكنني استعادة منه D؟" مثال "الأغلب الاستخراج" هو ما يهم الخصوصية. تقرير القناريات هذا لأن لا يتم تحسينها لاستخراجها.

تصميمات جديدة للقناريات، إدارة معدل الخسائر بدون نماذج الظل، أول تدقيق غير بسيط للدبليو إلكتروني لشركة ماجستير في العلوم على بيانات حقيقية مع ضمانات دبليو واقعية.

البدائل للتدريب على المهارات

  • PMixED (arXiv:2403.15638).التنبؤ الخاص في وقت الاستنتاج. مزيج من الخبراء في توزيعات الشيطان التالي؛ كل خبير يرى شظيفة من بيانات التدريب؛ الجمع يضيف الضوضاء لـ DP. يتجنب تدريب DP بالكامل.
  • DP synthetic data generation (Google Research 2024).تحديد المعلومات المختلفة مع البيانات المختلفة، وتدريب المصفوفات التدريجية على البيانات المختلفة.

كلاهما يتجنب تكلفة المرافق للتدريب الكامل على الموظفين على حساب نموذج تهديد مختلف.

عكس الخصوصية المختلفة عبر تعليقات الـ LLM

الهجوم الناشئ 2025، استخدم درجات الثقة من نموذج مدرب على DP كحديث لإعادة تحديد الأفراد. حتى عندما لا تسرب الخروج، يمكن توزيع الثقة.

الدفاع: لا تعرض الأسرار، أو تقسيمها / الكمية قبل التعرض. هذا هو متطلب إضافي خارج تدريب (ε، δ) -DP.

حيث يتناسب هذا مع المرحلة 18

الدروس 20-21 هي التحيز / العدالة. الدروس 22 هي الخصوصية. الدروس 23 هي المواصلة عن طريق علامة المياه. الدروس 27 تغطي طبقة البيانات التنظيمية-المواصلة.

استخدمها

code/main.pyيحاكي DP-SGD على مجموعة بيانات تصنيف ثنائي لعبة. يمكنك مسح مضاعف الضوضاء σ والمعيار القصص C وتتبع ميزانية (ε، δ) وتكلفة الدقة. يضيف "هجوم القناري" مثالًا فريدًا للتدريب ويقيس ما إذا كان اختبار خسارة السجل يمكن اكتشافه قبل وبعد DP.

أرسله

هذا الدرس يُنتجoutputs/skill-dp-audit.md. في إطار ادعاءات الـ DP بشأن تنفيذ نموذج لغوي، فإنه يقوم بمراجعة: قيم (ε، δ) ، والمحاسب المستخدم، بروتوكول تقييم MIA، وما إذا تم تقييم متجهات التعرض للثقة.

التمارين

  1. أركضcode/main.py. مسح σ في {0.5، 1.0, 2.0} وتقديم تقرير عن التنازل عن دقة (ε، δ) وتحديد نقطة انهيار المرافق.
  1. إجراء إدخال القناري واختبار فقدان السجل. قياس معدل الكشف قبل وبعد DP-SGD عند σ = 1.0.
  1. اقرأ Nasr et al. 2025 حول استخراج البيانات التدريبية. لماذا لا ينهي نجاح استخراج تحت متوسط ε؟ ما الذي يعني هذا عن MIA-as-evaluation؟
  1. تصميم نشر باستخدام PMixED (arXiv:2403.15638) الذي يعمل بالكامل في وقت الاستنتاج. ما هو نموذج التهديد الذي يعالجه PMixED الذي لا يعمله DP-SGD؟
  1. رسم عكس DP عبر هجوم LLM Feedback. صمم تدبير مضاد يحد من تسرب درجة الثقة وتقدير تكلفة نشرها.

الشروط الرئيسية

TermWhat people sayWhat it actually means
DP"(ε, δ)-differential privacy"Formal privacy: output distribution close under neighbouring-dataset change
DP-SGD"noise-injected SGD"Gradient clipping + Gaussian noise addition; standard DP training
LoRA + DP-SGD"efficient private fine-tune"DP-SGD on low-rank adapters; standard 2025 configuration
MIA"membership inference"Attack that determines whether an example was in training data
Canary"inserted watermark example"Unique training example used to measure DP leakage
PMixED"private inference mixture"Inference-time DP via mixture-of-experts on next-token distributions
DP Reversal"confidence leakage attack"Attack that uses a model's confidence as an oracle for re-identification

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.