Phase 18: Ethics, Safety & Alignment

डेटा उत्पत्ति और प्रशिक्षण-डेटा गवर्नेंस

यूरोपीय संघ के एआई अधिनियम में अगस्त 2025 तक जीपीएआई के लिए मशीन-पठनीय ऑप्ट-आउट मानकों की आवश्यकता है (यूरोपीय संघ के कॉपीराइट निर्देश TDM अपवाद के माध्यम से) । कैलिफोर्निया एबी 2013 (सौनी 2024) जनरेटिव एआई प्रशिक्षण-डेटा पारदर्शिता डेवलपर्स को 12 अनिवार्य क्षेत्रों के साथ डेटा सेट का सारांश प्रकाशित करने की आवश्यकता है। 2025 वैध हित पर डीपीए संरेखणः आयरिश डीपीसी (21 मई 2025) ने ईडीपीबी की राय के बाद सुरक्षा के साथ पहली पार्टी सार्वजनिक यूरोपीय संघ / ईईए वयस्क सामग्री पर मेटा के एलएलएम प्रशिक्षण को स्वीकार किया; कोलून उच्च क्षेत्रीय अदालत (23 मई 2025) ने आदेश को खारिज कर दिया; हैम्बर्ग डीपीए ने तत्कालता को कम कर दिया; यूके आईसीओ (23 सितंबर 2025) ने लिंक्डइन के एआई प्रशिक्षण सुरक्षा उपायों (पारदर्शिता, सरल ऑप्ट-आउट, विस्तारित आपत्ति विंडो) के लिए सकारात्मक नियामक प्रतिक्रिया जारी की और निगरानी जारी रखी औपचारिक मंजूरी नहीं। ब्राजील के ANPD (2 जुलाई 2024) ने अपर्याप्त सूचना पारदर्शिता के कारण मेटा के प्रसंस्करण को निलंबित कर दिया; मेटा ने एक अनुपालन योजना प्रस्तुत करने के बाद 30 अगस्त 2024 को रोकथाम उपाय को हटा दिया गया। मुख्य अपरिवर्तनीयता समस्याः कुकी सहमति ढांचे वास्तविक समय, reversible ट्रैकिंग के लिए डिज़ाइन किए गए हैं; एक बार डेटा मॉडल वजन में है, सर्जिकल मिटाने असंभव है प्रशिक्षित तंत्रिका नेटवर्क के लिए कोई व्यावहारिक GDPR अधिकार नहीं मिटाने के लिए। अनुपालन विंडो संग्रह के समय है। डेटा प्रवेवेंस पहल (dataprovenance.org, Longpre, Mahari, Lee et al., "संकट में सहमति", जुलाई 2024): बड़े पैमाने पर ऑडिट में एआई डेटा कॉमन की तेजी से गिरावट दिखाई देती है क्योंकि प्रकाशक robots.txt प्रतिबंध जोड़ते हैं।

Type: Learn

Languages: Python (stdlib, 12-field California AB 2013 scaffolding generator)

Prerequisites: Phase 18 · 24 (regulatory), Phase 18 · 26 (cards)

Time: ~60 minutes

सीखने के लक्ष्य

  • जनरेटिव एआई प्रशिक्षण-डेटा पारदर्शिता के लिए कैलिफोर्निया एबी 2013 के 12 अनिवार्य क्षेत्रों का वर्णन करें।
  • वैध हितों के LLM प्रशिक्षण पर 2025 DPA की स्थिति बताएं (आयरलैंड DPC, UK ICO, Hamburg, Cologne) ।
  • अपरिवर्तनीयता की समस्या का वर्णन करेंः क्यों GDPR के मिटाने के अधिकार का प्रशिक्षित तंत्रिका नेटवर्क के लिए कोई व्यावहारिक समकक्ष नहीं है।
  • डेटा प्रवेवेंस पहल के "संकट में सहमति" निष्कर्ष का वर्णन करें।

समस्या

प्रशिक्षण-डेटा शासन प्रत्येक मॉडल कार्ड (पाठ 26) और नियामक दायित्व (पाठ 24) के पूर्ववर्ती है। 2024-2025 में, नियामक परिदृश्य तीन सिद्धांतों पर समेकित हुआः ऑप्ट-आउट बुनियादी ढांचे, प्रति डेटासेट प्रकटीकरण, और सार्वजनिक रूप से उपलब्ध डेटा के लिए वैध हित समायोजन। प्रदाताओं जो संग्रह के समय अनुपालन नहीं करते हैं, वे डाउनस्ट्रीम को ठीक नहीं कर सकते।

अवधारणा

कैलिफोर्निया एबी 2013

1 जनवरी 2022 को या उसके बाद जारी किए गए सिस्टम के लिए दस्तावेज 1 जनवरी 2026 को या उससे पहले पोस्ट किया जाना चाहिए। धारा 3111 (a) के अनुसार डेवलपर्स को प्रशिक्षण में उपयोग किए जाने वाले डेटासेट का एक उच्च स्तरीय सारांश प्रकाशित करना चाहिए जिसमें 12 वैधानिक बिंदु शामिल हैंः

  1. डेटा सेट के स्रोत या मालिक।
  2. डेटासेट AI प्रणाली के नियत उद्देश्य को कैसे आगे बढ़ाते हैं, इसका विवरण।
  3. डेटा सेट में डेटा बिंदुओं की संख्या (सामान्य रेंज स्वीकार्य; गतिशील डेटा सेट के लिए अनुमान) ।
  4. डेटा बिंदुओं के प्रकारों का विवरण (लेबलित डेटासेट के लिए लेबल प्रकार; अनलेबलित के लिए सामान्य विशेषताएं) ।
  5. चाहे डेटासेट में कॉपीराइट, ट्रेडमार्क या पेटेंट द्वारा संरक्षित कोई डेटा शामिल हो या पूरी तरह से सार्वजनिक डोमेन में हो।
  6. डेटा सेट खरीदे गए या लाइसेंस प्राप्त किए गए।
  7. क्या डेटासेट में व्यक्तिगत जानकारी शामिल है (कैलोरी सिविल कोड §1798.140 ((v)) ।
  8. क्या डेटा सेट में उपभोक्ता की समग्र जानकारी शामिल है (कैलोरी सिविल कोड §1798.140 ((बी)) ।
  9. नियत उद्देश्य के साथ विकासकर्ता द्वारा सफाई, प्रसंस्करण या अन्य संशोधन।
  10. समय अवधि जिसके दौरान डेटा एकत्र किया गया था, यदि संग्रह जारी है तो सूचना के साथ।
  11. डेट डेटस के सेट का विकास के दौरान पहली बार उपयोग किया गया था।
  12. चाहे सिस्टम सिंथेटिक डेटा जनरेशन का उपयोग करता हो या लगातार।

यह डेटा शीट 2018 के संबंध में नया है। यह डेटा शीट के लिए नया है। यह डेटा शीट के लिए नया है। यह डेटा शीट के लिए नया है। यह डेटा शीट के लिए नया है। यह डेटा शीट के लिए नया है। यह डेटा शीट के लिए नया है। यह डेटा शीट के लिए नया है। यह डेटा शीट के लिए नया है। यह डेटा शीट के लिए नया है। यह डेटा शीट के लिए नया है। यह डेटा शीट के लिए नया है। यह डेटा शीट के लिए नया है। यह डेटा शीट के लिए नया है। यह डेटा शीट के लिए नया है। यह डेटा शीट के लिए नया है। यह डेटा शीट के लिए नया है। यह डेटा शीट के लिए नया है। यह डेटा शीट के लिए नया है। यह डेटा शीट के लिए नया है। यह डेटा शीट के लिए नया है। यह डेटा शीट के लिए नया है। यह डेटा शीट के लिए नया है। यह डेटा शीट के लिए नया है। यह डेटा शीट के लिए नया है।

यूरोपीय संघ के AI अधिनियम (पाठ 24) और TDM से बाहर निकलना

यूरोपीय संघ के कॉपीराइट निर्देश में पाठ और डेटा खनन के लिए अपवाद सार्वजनिक रूप से उपलब्ध सामग्री पर प्रशिक्षण की अनुमति देता है, जब तक कि अधिकार धारक बाहर नहीं होता। यूरोपीय संघ के AI अधिनियम जीपीएआई अभ्यास संहिता कॉपीराइट अध्याय जीपीएआई प्रदाताओं को मशीन-पठनीय ऑप्ट-आउट संकेतों का सम्मान करने की आवश्यकता है (रोबोट्स.टीएक्सटी, सी 2 पीए "कोई एआई प्रशिक्षण" दावा, आदि) ।

वैध हित पर 2025 डीपीए अभिसरण

आयरलैंड डीपीसी (21 मई 2025): ईडीबीबी की राय के बाद सुरक्षा उपायों के साथ स्वीकार किए गए यूरोपीय संघ/ईईएई वयस्क उपयोगकर्ताओं के लिए प्रथम-पक्ष सार्वजनिक सामग्री पर प्रशिक्षण की मेटा की योजना। कोलून उच्च क्षेत्रीय न्यायालय (23 मई 2025) ने मेटा के खिलाफ आदेश को खारिज कर दियाः अप्ट आउट पर्याप्त है। हम्बर्ग डीपीए ने पूरे यूरोपीय संघ में एकीकरण के लिए तत्काल प्रक्रिया को समाप्त कर दिया है। यूके ICO (23 सितंबर 2025) ने इसी तरह के सुरक्षा उपायों और निरंतर निगरानी के साथ लिंक्डइन के एआई प्रशिक्षण को फिर से शुरू करने के लिए एक सकारात्मक नियामक प्रतिक्रिया जारी की।

अभिसरण सिद्धांतः वैध हित सार्वजनिक रूप से उपलब्ध प्रथम पक्ष सामग्री पर प्रशिक्षण को उचित ठहरा सकता है। सहमति की आवश्यकता नहीं है।

ब्राजील एएनपीडी (जून 2024)

यूरोपीय संघ के डीपीए से अलग परिणाम एएनपीडी ने वैध हितों की स्वीकार्यता पर पारदर्शिता को प्राथमिकता दी।

अपरिवर्तनीयता समस्या

कुकी-सहमति को वास्तविक समय, reversible ट्रैकिंग के लिए डिज़ाइन किया गया था। प्रशिक्षण डेटा अलग हैः एक बार डेटा मॉडल वजन में प्रवेश करता है, सर्जिकल मिटाने संभव नहीं है। खरोंच से पुनः प्रशिक्षण एकमात्र पूर्ण सुधार है, और यह निषेधात्मक रूप से महंगा है।

आंशिक उपचारः

  • Unlearning.लगभग हटाना; एमआईए (पाठ 22) द्वारा मापा गया।
  • Influence function-based localization.डेटा से सबसे अधिक प्रभावित वजन की पहचान करें; चयनात्मक रूप से अद्यतन करें।
  • Fine-tune-suppression.मॉडल को डेटा से प्राप्त आउटपुट को अस्वीकार करने के लिए प्रशिक्षित करें।

कोई भी पूरी तरह से समस्या का समाधान नहीं है। अनुपालन खिड़की संग्रह के समय है।

डेटा उत्पत्ति पहल

डेटाप्रोवीनेंस.org। लॉन्गप्रे, महरि, ली आदि। "संकट में सहमति" (जुलाई 2024): एआई प्रशिक्षण डेटा कॉमन का बड़े पैमाने पर लेखा परीक्षा। खोजः प्रकाशक तेजी से robots.txt प्रतिबंध जोड़ रहे हैं। खुले तौर पर प्रशिक्षित-अप कॉमन तेजी से संकुचित हो रहा है। 2023 -> 2024 में शीर्ष प्रशिक्षण स्रोतों में से लगभग 25% ने कुछ प्रतिबंध जोड़ने के लिए देखा। सम्प्रदायः भविष्य में प्रशिक्षण-डेटा उपलब्धता नए अधिग्रहण प्रतिमानों (लाइसेंसिंग, सिंथेटिक जनरेशन, प्रोत्साहनित भागीदारी) पर निर्भर करती है।

जहां यह चरण 18 में फिट बैठता है

पाठ 26 मॉडल स्तर पर प्रलेखन है। पाठ 27 डेटासेट स्तर पर शासन है। वे एक साथ पारदर्शिता परत को परिभाषित करते हैं। पाठ 28 शोध पारिस्थितिकी तंत्र का नक्शा बनाता है जो इन सवालों पर काम करता है।

इसका प्रयोग करें

code/main.pyखेलौना डेटासेट के लिए कैलिफोर्निया एबी 2013 के अनुरूप 12 फ़ील्ड डेटासेट सारांश स्टफल्ड उत्पन्न करता है। आप फ़ील्ड भर सकते हैं और देख सकते हैं कि कौन से फ़ील्ड गोपनीयता या कॉपीराइट अनुवर्ती दायित्वों को ट्रिगर करते हैं।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-provenance-check.md. प्रशिक्षण में इस्तेमाल किए गए डेटासेट को देखते हुए, यह एबी 2013 के 12 क्षेत्र कवरेज, ऑप्ट-आउट इन्फ्रास्ट्रक्चर अनुपालन, डीपीए संरेखण और अपरिवर्तनीयता जोखिम मूल्यांकन की जांच करता है।

व्यायाम

  1. दौड़ेंcode/main.py. खिलौना डेटासेट के लिए 12 फ़ील्ड सारांश तैयार करें और पहचानें कि कौन से फ़ील्ड कम निर्दिष्ट हैं।
  1. यूरोपीय संघ के कॉपीराइट निर्देश TDM ऑप्ट-आउट मशीन-पठनीय है। ऑप्ट-आउट सिग्नल के लिए एक मानक प्रारूप का प्रस्ताव दें और इसे robots.txt और C2PA "कोई एआई प्रशिक्षण नहीं" के साथ तुलना करें।
  1. डेटा प्रवेणेंस पहल की "संकट में सहमति" (जुलाई 2024) पढ़ें। तीन सबसे तेजी से प्रतिबंधित सामग्री श्रेणियों का वर्णन करें और एक आर्थिक परिणाम का तर्क दें।
  1. 2025 डीपीए संरेखण सार्वजनिक सामग्री प्रशिक्षण के लिए वैध हित को स्वीकार करता है। एक परिदृश्य का निर्माण करें जिसमें वैध हित पर्याप्त नहीं होगा और इसके बजाय एक प्रदाता को आवश्यक कानूनी आधार की पहचान करें।
  1. प्रत्येक डेटासेट के लिए एबी 2013 फ़ील्ड और सी 2 पीए से हस्ताक्षरित उत्पत्ति श्रृंखला के साथ एक प्रशिक्षण-डेटा-प्रोवेंस मैनिफेस्ट स्केच करें। एक तकनीकी और एक कानूनी बाधा की पहचान करें।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
AB 2013"the California law"Generative AI training-data transparency; 12 mandated fields
TDM exception"text-and-data-mining"EU Copyright Directive training-data exception with opt-out
Legitimate interest"the EU basis"GDPR Article 6 basis that may justify training on public content
Opt-out signal"machine-readable no-train"robots.txt, C2PA "No AI Training," TDM.Reservation
Irreversibility"cannot un-train"Data in model weights is not surgically removable
Unlearning"approximate removal"Post-training interventions to reduce model dependence on specific data
Consent in Crisis"the DPI audit"July 2024 finding of accelerating robots.txt restrictions

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.