Phase 18: Ethics, Safety & Alignment

إصدار البيانات والتدريب - إدارة البيانات

قانون الاتحاد الأوروبي للاستخدام الذكي يتطلب أن تكون المعايير القابلة للقراءة الآلية للخروج من GPAI بحلول أغسطس 2025 (بإستثناءات الاتحاد الأوروبي للاستثمارات النووية في حقوق الطبع والنشر). كاليفورنيا AB 2013 (وقعت 2024) شفافية التدريب على البيانات حول الذكاء الاصطناعي التوليدية تتطلب من المطورين نشر ملخص لمجموعات البيانات التي تحتوي على 12 حقلًا مرموزة. 2025 تنسيق DPA على المصالح المشروعة: DPC الأيرلندية (21 مايو 2025) تقبل تدريب META على محتوى البالغين في الاتحاد الأوروبي / المنطقة الاقتصادية الأوروبية من الطرف الأول مع ضمانات بعد رأي EDPB؛ قامت محكمة كولونيا الإقليمية العليا (23 مايو 2025) برفض الرفض القاضي؛ هامبرغ DPA يقلل من الطوارئ؛ ICO في المملكة المتحدة (23 سبتمبر 2025) أصدر ردًا تنظيميًا إيجابيًا على ضمانات تدريب الذكاء الاصطناعي لشركة LinkedIn (الشفافية والإفراج المبسط والانصارات الممتدة) وواصل المراقبة ليس تصريحًا رسميًا. أعلنت الهيئة الوطنية للبحث والتنمية البرازيلية (2 يوليو 2024) تعليق معالجة Meta بسبب عدم كفاية شفافية المعلومات؛ تم رفع التدابير الوقائية في 30 أغسطس 2024 بعد أن قدم Meta خطة الامتثال. مشكلة القبول الرئيسي: تم تصميم إطاريات موافقة الكوكيز للتتبع في الوقت الحقيقي والعكسية؛ بمجرد أن تكون البيانات في أوزان النموذج، يكون مسح الجراحي مستحيلا لا توجد حق عملية في حذف GDPR للشبكات العصبية المدربة. نافذة التوافق في وقت جمع مبادرة إصدار البيانات (dataprovenance.org، Longpre، Mahari، Lee et al., "Consent in Crisis"، يوليو 2024): تشير مراجعة واسعة النطاق إلى تراجع سريع في مجتمع البيانات الذكية الذكية مع إضافة الناشرين إلى قيود روبوتات.

Type: Learn

Languages: Python (stdlib, 12-field California AB 2013 scaffolding generator)

Prerequisites: Phase 18 · 24 (regulatory), Phase 18 · 26 (cards)

Time: ~60 minutes

أهداف التعلم

  • وصف 12 مجالاً مُرَضَاةً لـ California AB 2013 للتدريب على الذكاء الاصطناعي التوليدي - شفافية البيانات.
  • أوضح موقف DPA عام 2025 بشأن تدريب القانون المتمثل في مصلحة مشروعة (DPC الأيرلندية، ICO في المملكة المتحدة، هامبورغ، كولونيا).
  • وصف مشكلة عدم الاحتفاظ بها: لماذا حق الحذف في GDPR لا يمثل بمثابة عملية لشبكات عصبية تدربة.
  • أوضح نتائج مبادرة إصدار البيانات "الموافقة في الأزمة".

المشكلة

إدارة البيانات التدريبية هي المبدأ المتقدم لكل بطاقة نموذجية (درس 26) والتزامات تنظيمية (درس 24) ، في عام 2024-2025 ، يتم توحيد المشهد التنظيمي على ثلاثة مبادئ: البنية التحتية الامتناع عن الخروج ، وكشف كل مجموعة بيانات ، وتسوية المصالح المشروعة للبيانات المتاحة للجمهور. لا يمكن للمقدمين الذين لا يتوافقون في وقت جمعها التعويضات التدريجية.

المفهوم

كاليفورنيا AB 2013

توقيع 2024. يجب نشر الوثائق في أو قبل 1 يناير 2026 للأنظمة التي تم إطلاقها في أو بعد 1 يناير 2022. يطلب القسم 3111 ((أ) من المطورين نشر ملخص رفيع المستوى لمجموعات البيانات المستخدمة في التدريب مع 12 نقطة قانونية:

  1. مصادر أو أصحاب مجموعات البيانات
  2. وصف كيفية تعزيز مجموعات البيانات الغرض المقصود لنظام الذكاء الاصطناعي.
  3. عدد نقاط البيانات في مجموعات البيانات (المناطق العامة المقبولة؛ التقديرات لمجموعات البيانات الديناميكية).
  4. وصف أنواع نقاط البيانات (أنواع العلامات لمجموعات البيانات المعلنة؛ والخصائص العامة لمجموعات البيانات غير المعلنة).
  5. سواء كانت مجموعات البيانات تشمل أي بيانات محمية بحقوق النشر أو العلامة التجارية أو براءة اختراع، أو أنها في المجال العام بالكامل.
  6. سواء تم شراء مجموعات البيانات أو الحصول على ترخيص.
  7. ما إذا كانت مجموعات البيانات تشمل معلومات شخصية (وفقاً لقانون كاليفورنيا رقم 1798.140 ((v)).
  8. ما إذا كانت مجموعات البيانات تشمل معلومات مجمعة للمستهلكين (وفقاً لقانون كاليفورنيا رقم 1798.140 ((ب)).
  9. التنظيف أو المعالجة أو التعديل الآخر من قبل المطور، بهدف مقصود.
  10. المدة التي تم جمع البيانات خلالها، مع إشعار إذا كان جمعها مستمرًا.
  11. التواريخ التي استخدمتها مجموعات البيانات لأول مرة أثناء تطويرها.
  12. ما إذا كان النظام يستخدم أو يستخدم بشكل مستمر توليد البيانات الاصطناعية.

البند 12 (البيانات الاصطناعية) جديد بالنسبة لصفحات البيانات Gebru et al. 2018. البند 7 (المعلومات الشخصية) يؤدي إلى التزامات قانون حقوق الخصوصية (CPRA). يفرض القانون الحماية / النزاهة ، وتشغيل الطائرات ، وأنظمة الأمن القومي الاتحادية فقط (القسم 3111 ((ب)).

قانون الاتحاد الأوروبي لذكاء الذكاء الاصطناعي (درس 24) والإفراج عن التطبيقات التجارية

يسمح استثناءات التوجيهات الاوراق والبيانات من الاتحاد الأوروبي لتحقيق حقوق النشر بتدريب على المحتوى المتوفر للجمهور ما لم يختار صاحب الحق. قانون الاتحاد الأوروبي للاستخدام الذكي الاصطناعي GPAI قانون الممارسة حقوق النشر يتطلب من مقدمي GPAI احترام إشارات الاختيار القابلة للقراءة الآلية (robots.txt، دعوى C2PA "لا تدريب الذكي الاصطناعي" إلخ).

2025 التقارب في الميزانية المحددة على المصالح المشروعة

المكتب المركزي الأيرلندي (21 مايو 2025): خطة ميتا لتدريب محتوى المستخدمين البالغين في الاتحاد الأوروبي / المنطقة الاقتصادية الأوروبية من قبل الطرف الأول، والتي تم قبولها مع ضمانات بعد رأي مجلس إدارة الأوروبا. قامت المحكمة الإقليمية العليا في كولونيا (23 مايو 2025) بإلغاء أمر الاحتجاز ضد Meta: يكفي الامتناع عن الاحتجاز. إدارة هامبورغ للصحة تتوقف عن إجراءات الطوارئ من أجل التماسك على مستوى الاتحاد الأوروبي. أصدرت ICO في المملكة المتحدة (23 سبتمبر 2025) ردًا تنظيميًا إيجابيًا ليس تصريحًا رسميًا إلى استئناف LinkedIn للتدريب على الذكاء الاصطناعي مع ضمانات مماثلة ومراقبة مستمرة.

مبدأ التقارب: يمكن أن يبرر المصالح المشروعة التدريب على المحتوى المتاحة للجمهور من قبل الطرف الأول مع الرفض.

الـ ANPD البرازيلي (يونيو 2024)

تعليق معالجة Meta لبيانات المستخدم البرازيلية للتدريب على الذكاء الاصطناعي بسبب عدم كفاية شفافية المعلومات. نتيجة مختلفة عن اتفاقيات الاتحاد الأوروبي DPAs ANPD أولويت الشفافية على قبول المصالح المشروعة.

مشكلة عدم الإعادة

تم تصميم موافقت الكوكي للتتبع في الوقت الحقيقي والعكسية. البيانات التدريبية مختلفة: بمجرد دخول البيانات إلى أوزان النموذج، لا يمكن حذفها الجراحيا. إعادة التدريب من الصفر هي الإصلاح الكامل الوحيد، وهو مكلف للغاية.

التعويضات الجزئية:

  • Unlearning.إزالة تقريرية، مقاسة بواسطة MIA (دروس 22).
  • Influence function-based localization.تحديد الأوزان الأكثر تأثيراً بالبيانات؛ تحديثاً انتقاداً.
  • Fine-tune-suppression.تدريب النموذج على رفض الخروج المستمد من البيانات.

لا أحد يحل المشكلة بالكامل، نافذة التوافق في وقت جمعها

مبادرة إصدار البيانات

dataprovenance.org لونغبري، ماهاري، لي وغيرهم "إجماع في الأزمة" (يوليو 2024): مراجعة واسعة النطاق لمجموعة بيانات تدريب الذكاء الاصطناعي. العثور: يضيف الناشرون قيود على robots.txt بمعدل متسارع. المواطنين الذين يمكن تدريبهم بشكل مفتوح يتقلصون بسرعة 2023 -> 2024 شهدت حوالي 25% من مصادر التدريب العليا إضافة بعض القيود. التداخل: تتوفر مستقبل البيانات المتعلقة بالتدريب يعتمد على نموذجات الاستحواذ الجديدة (التراخيص، وتوليد الاصطناعي، والمشاركة المحفزة).

حيث يتناسب هذا مع المرحلة 18

الدروس 26 هي الوثائق على مستوى النموذج. الدروس 27 هي الحوكمة على مستوى مجموعة البيانات. معاً يحددون طبقة الشفافية. الدروس 28 تقوم بتخريط النظام البحثي الذي يعمل على هذه الأسئلة.

استخدمها

code/main.pyيُولد قاعدة بيانات 12 حقل مطابقة لـ California AB 2013 لمجموعة بيانات ألعاب. يمكنك ملء الحقول ومراقبة تلك التي تؤدي إلى التزامات الخصوصية أو حقوق النشر.

أرسله

هذا الدرس يُنتجoutputs/skill-provenance-check.md. بالنظر إلى مجموعة البيانات المستخدمة في التدريب، فإنه يراقب تغطية AB 2013 في 12 مجال، وفقاً للبنية التحتية التي لا ترغب في الامتثال، وتحقيق التوازن مع DPA، وتقييم المخاطر المتعلقة بالعدم الاحتفاظ بها.

التمارين

  1. أركضcode/main.py. قم بإعداد ملخص من 12 حقل لجميع بيانات الألعاب وتحديد الحقول التي لم يتم تحديدها بشكل جيد.
  1. إن إشعار الاختيار من الاتحاد الأوروبي للاستبعاد من الاتحاد الأوروبي من حقوق الطبع والنشر يمكن قراءته بواسطة آلة. اقترح شكلًا قياسيًا للإشارة الاختيار من الاتحاد الأوروبي ومقارنةها مع robots.txt و C2PA "لا تدريب على الذكاء الاصطناعي".
  1. اقرأ مبادرة "إجماع في الأزمة" (يوليو 2024) من مبادرة "مصادرة البيانات". وصف ثلاث فئات محتويات تفرض أقرب قيود وتجادل عن عواقب اقتصادية واحدة.
  1. إن تحديد الميزات المباشرة لـ 2025 يقبل مصلحة مشروعة للتدريب على المحتوى العام. إنشاء سيناريو لا يكفي فيه مصلحة مشروعة وتحديد الأساس القانوني الذي يحتاجه مقدم الميزات بدلاً من ذلك.
  1. رسم بيان بياني عن إدارة التدريبات والبيانات التي تتكون من حقل AB 2013 وسلسلة إدارة مؤكدة من C2PA لكل مجموعة بيانات. حدد حاجزًا فنيًا واحداً واحداً قانونيًا.

الشروط الرئيسية

TermWhat people sayWhat it actually means
AB 2013"the California law"Generative AI training-data transparency; 12 mandated fields
TDM exception"text-and-data-mining"EU Copyright Directive training-data exception with opt-out
Legitimate interest"the EU basis"GDPR Article 6 basis that may justify training on public content
Opt-out signal"machine-readable no-train"robots.txt, C2PA "No AI Training," TDM.Reservation
Irreversibility"cannot un-train"Data in model weights is not surgically removable
Unlearning"approximate removal"Post-training interventions to reduce model dependence on specific data
Consent in Crisis"the DPI audit"July 2024 finding of accelerating robots.txt restrictions

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.