Phase 18: Ethics, Safety & Alignment

वाटरमार्किंग SynthID, स्थिर हस्ताक्षर, C2PA

तीन प्रौद्योगिकियों का संरचना 2026 एआई-जनित सामग्री उत्पत्ति। SynthID (Google DeepMind) छवि वॉटरमार्किंग अगस्त 2023 में लॉन्च की गई, पाठ + वीडियो मई 2024 (जेमिनी + वीओ), पाठ ओपन सोर्स अक्टूबर 2024 के माध्यम से जिम्मेदार जेएनएआई टूलकिट, जेमिनी 3 प्रो के साथ नवंबर 2025 में एकीकृत मल्टी-मीडिया डिटेक्टर। पाठ वॉटरमार्किंग अगले टोकन के नमूने लेने की संभावनाओं को अपरिहार्य रूप से समायोजित करता है; छवि/वीडियो वॉटरमार्क संपीड़न, काटने, फ़िल्टर, फ्रेम-रेट परिवर्तनों से बचते हैं। स्थिर हस्ताक्षर (फर्नान्डेज और अन्य, आईसीसीवी 2023, arXiv:2303.15435) लटेंट विसारण डिकोडर को ठीक से ट्यून करें ताकि प्रत्येक आउटपुट में एक निश्चित संदेश हो; क्रॉप (10% सामग्री) उत्पन्न छवियों का पता लगाया गया >90% FPR<1e-6. अनुवर्ती "स्थिर हस्ताक्षर अस्थिर है" (arXiv:2405.07145, मई 2024) सूक्ष्म-ट्यूनिंग गुणवत्ता को बनाए रखते हुए वॉटरमार्क को हटा देता है। C2PA क्रिप्टोग्राफिक रूप से हस्ताक्षरित, छेड़छाड़ के लिए स्पष्ट मेटाडेटा मानक (C2PA 2.2 Explainer 2025). वॉटरमार्किंग और C2PA पूरक हैंः मेटाडेटा को हटाया जा सकता है लेकिन अधिक समृद्ध उत्पत्ति है; ट्रांसकोडिंग के माध्यम से वॉटरमार्क बरकरार रहते हैं लेकिन कम जानकारी ले जाते हैं।

Type: Build

Languages: Python (stdlib, token-watermark embed + detect)

Prerequisites: Phase 10 · 04 (sampling), Phase 01 · 09 (information theory)

Time: ~75 minutes

सीखने के लक्ष्य

  • टोकन स्तर के वॉटरमार्किंग (SynthID-text style) और उस तंत्र का वर्णन करें जिसके द्वारा यह पता लगाया जा सकता है।
  • स्थिर हस्ताक्षर और 2024 हटाने हमले का वर्णन करें जो इसे तोड़ दिया।
  • राज्य C2PA की भूमिका और यह वाटरमार्किंग के पूरक क्यों है।
  • मुख्य सीमाओं का वर्णन करेंः मॉडल विशिष्ट संकेत, पैराफ्रेसेस के तहत मजबूतता, और अर्थ-संरक्षण हमले (arXiv:2508.20228) ।

समस्या

2023-2024 में डीपफैक्स और एआई-जनरेट की गई सामग्री को बड़े पैमाने पर राजनीतिक और उपभोक्ता संदर्भों में प्रवेश किया गया। वाटरमार्किंग प्रस्तावित तकनीकी उत्पत्ति संकेत हैः निर्माण के समय पीढ़ियों को चिह्नित करें, बाद में उनका पता लगाएं। 2025 सबूतः कोई वाटरमार्क बिना शर्त मजबूत नहीं है, लेकिन सी 2 पीए मेटाडेटा के साथ परतबद्ध संयोजन एक प्रयोज्य उत्पत्ति कहानी प्रदान करता है।

अवधारणा

पाठ वॉटरमार्किंग (SynthID-text शैली)

किर्चेनबायर एट अल. 2023 तंत्र, गूगल द्वारा निर्मितः

  1. प्रत्येक डिकोडिंग चरण में, "हरे" और "लाल" सेटों में शब्दावली के एक छद्म यादृच्छिक विभाजन को उत्पन्न करने के लिए पिछले K टोकन को हैश करें।
  2. हरे रंग के सेट की ओर पूर्वाग्रह नमूनाकरण हरे रंग के लॉजिट में δ जोड़कर।
  3. इस पीढ़ी में अधिक हरे रंग के टोकन होते हैं जो कि आकस्मिकता से उत्पन्न होते हैं।

पता लगानाः प्रत्येक पूर्वावलोकन को फिर से दोहराएं, पीढ़ी में हरे टोकन गिनें, एक z-स्कोर की गणना करें। z-स्कोर पानी के चिह्नित पाठ के लिए >0 है, ~0 मानव पाठ के लिए।

गुण:

  • पाठकों के लिए अप्राप्य (δ पर्याप्त रूप से छोटा है कि गुणवत्ता हानि मामूली है) ।
  • शब्दावली विभाजन फ़ंक्शन तक पहुँच के साथ पता लगाया जा सकता है।
  • पाठ को फिर से लिखना संकेत को नष्ट कर देता है।

SynthID-text Google के Responsible GenAI Toolkit के माध्यम से अक्टूबर 2024 में ओपन सोर्स है।

स्थिर हस्ताक्षर (छवि)

Fernandez et al. ICCV 2023. लटेंट फैलाव डिकोडर को ठीक से ट्यून करें ताकि प्रत्येक उत्पन्न छवि में लटेंट प्रतिनिधित्व में एम्बेडेड एक फिक्स्ड बाइनरी संदेश हो। पता लगाने को एक तंत्रिका डिकोडर के साथ लटेंट से डिकोड किया जाता है। क्रॉप (सामग्री के 10% तक) छवियों का पता लगाया जाता है >90% FPR<1e-6.

मई 2024 "स्थिर हस्ताक्षर अस्थिर है" (arXiv:2405.07145): डीकोडर को ठीक से ट्यूनिंग करने से छवि गुणवत्ता को बनाए रखते हुए वॉटरमार्क हटा दिया जाता है। प्रतिकूल पोस्ट-जनरेशन ठीक से ट्यूनिंग सस्ती है; वॉटरमार्क की प्रतिकूल मजबूती सीमित है।

SynthID एकीकृत डिटेक्टर (नवंबर 2025)

जेमिनी 3 प्रो के साथः एक मल्टीमीडिया डिटेक्टर जो एक एपीआई में पाठ, छवि, ऑडियो और वीडियो से सिंटिड सिग्नल पढ़ता है। Google उत्पत्ति स्टैक को एकीकृत करता है।

सी 2 पी ए

सामग्री उत्पत्ति और प्रामाणिकता के लिए गठबंधन. क्रिप्टोग्राफिक रूप से हस्ताक्षरित छेड़छाड़-प्रमाणित मेटाडेटा मानक। C2PA 2.2 स्पष्टकर्ता (2025). एक C2PA मैनिफेस्ट उत्पत्ति के दावे (किसने बनाए, कब, कौन से परिवर्तन) रिकॉर्ड करता है। निर्माता की कुंजी द्वारा हस्ताक्षरित।

वाटरमार्किंग के पूरक:

  • मेटाडेटा को हटाया जा सकता है; वॉटरमार्क (सुलभ रूप से) नहीं कर सकते हैं।
  • मेटाडेटा समृद्ध है (पूरी मूल श्रृंखला); वॉटरमार्क बिट्स ले जाते हैं।
  • C2PA प्लेटफार्म के अपनाने पर निर्भर करता है; वॉटरमार्क स्वचालित रूप से एम्बेड होते हैं।

गूगल खोज, विज्ञापन और "इस छवि के बारे में" दोनों को एकीकृत करता है।

सीमाएँ

  • Model-specific.SynthID-सक्षम मॉडल से SynthID वॉटरमार्क पीढ़ी। SynthID के बिना मॉडल से एक पीढ़ी वॉटरमार्क नहीं है, इसलिए "कोई SynthID संकेत" प्रामाणिकता का प्रमाण नहीं है।
  • Paraphrase.पाठ वाटरमार्क अर्थ-रक्षक पैराफ्रेसेस से बच नहीं सकते।
  • Transformation attacks.arXiv:2508.20228 (2025) में अर्थ-संरक्षण हमले दिखाए गए हैं जो पाठ वॉटरमार्क और कई छवि वॉटरमार्क दोनों को नष्ट करते हैं।
  • Fine-tune removal."स्थिर हस्ताक्षर अस्थिर है", पोस्ट-जनरेशन बारीक-ट्यूनिंग एम्बेडेड वॉटरमार्क को हटा देता है।

यूरोपीय संघ के AI अधिनियम अनुच्छेद 50

एआई द्वारा उत्पन्न सामग्री लेबलिंग के लिए पारदर्शिता कोड (पहला मसौदा दिसंबर 2025, दूसरा मसौदा मार्च 2026, अंतिम जून 2026 के लिए अपेक्षित)European Commission status page) कोड अप्रैल 2026 से प्रारूप में है और समयरेखा बदल सकती है। तकनीकी परत की आवश्यकता वाले नियामक परत। डीपफैक्स को लेबल किया जाना चाहिए।

जहां यह चरण 18 में फिट बैठता है

पाठ 22-23 में मॉडल के बारे में बताया गया है कि यह क्या उत्सर्जित करता है (निजी डेटा, मूल संकेत) । पाठ 27 में प्रशिक्षण-डेटा शासन शामिल है। पाठ 24 में नियामक ढांचा है जो इन तकनीकी उपायों की आवश्यकता है।

इसका प्रयोग करें

code/main.pyएक डिटेक्टर हरी-संदिग्धता के आंकड़े की गणना करता है। आप 1000 टोकन पीढ़ियों पर पता लगाने का अवलोकन कर सकते हैं, सिग्नल को नष्ट करने के लिए पैराफ्रेसेस देख सकते हैं, और मानव पाठ पर झूठी सकारात्मक दर माप सकते हैं।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-provenance-audit.md. मूल के दावे के साथ सामग्री तैनाती को देखते हुए, यह ऑडिट करता हैः वाटरमार्क तंत्र (यदि कोई हो), C2PA हस्ताक्षर श्रृंखला (यदि कोई हो), प्रत्येक की प्रतिकूलता की मजबूती, और प्रति-मौदाता कवरेज।

व्यायाम

  1. दौड़ेंcode/main.py. वॉटरमार्क 1000 टोकन जनरेशन बनाम मानव-लेखित पाठ के लिए z-स्कोर रिपोर्ट करें. 95% विश्वास सीमा पर झूठी सकारात्मकता दर की पहचान करें.
  1. एक पैराफ्रेज हमले को लागू करें जो 30% टोकन को पर्यायवाची के साथ बदल देता है। z-स्कोर को फिर से मापें।
  1. किर्चेनबायर और सहयोगियों 2023 धारा 6 पर मजबूती पढ़ें। पाठ वॉटरमार्क पैराफ्रेज के तहत विफल क्यों होते हैं लेकिन छवि वॉटरमार्क काटने में जीवित रहते हैं?
  1. एक तैनाती डिजाइन करें जो SynthID-text + C2PA मेटाडेटा का उपयोग करता है। उपभोक्ता द्वारा देखी जाने वाली मूल श्रृंखला का वर्णन करें। प्रत्येक घटक के एक विफलता मोड की पहचान करें।
  1. 2024 "स्थिर हस्ताक्षर अस्थिर है" परिणाम दिखाता है कि ठीक-ठाक छवि वॉटरमार्क को हटा देता है। एक तैनाती नियंत्रण डिजाइन करें जो इस हमले को सीमित करता है। उदाहरण के लिए, ठीक-ठाक चेकपोइंट के हस्ताक्षरित रिलीज़ की आवश्यकता होती है।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
SynthID"Google's watermark"Cross-modal provenance signal; text, image, audio, video
Token watermark"Kirchenbauer-style"Biased-sampling text watermark detectable via green-token z-score
Stable Signature"image watermark"Fine-tuned-decoder watermark; ICCV 2023
C2PA"the metadata standard"Cryptographically signed tamper-evident provenance metadata
Paraphrase robustness"does rewording break it"Text watermark property; currently limited
Fine-tune removal"adversarial unwatermark"Attack that removes image watermark via decoder fine-tuning
Cross-modal detector"unified SynthID"November 2025 unified API across modalities

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.