Phase 18: Ethics, Safety & Alignment

علامة المياه SynthID, توقيع مستقرة, C2PA

ثلاث تقنيات هياكل 2026 منشأ المحتوى الذي تم إنشاؤه بواسطة الذكاء الاصطناعي. أطلقت SynthID (Google DeepMind) علامة مائية الصور في أغسطس 2023 ، النص + الفيديو مايو 2024 (جيميني + فيو) ، النص مفتوح المصدر أكتوبر 2024 عبر مجموعة أدوات جين إي المسؤولة ، الكشف متعدد الوسائط الموحدة في نوفمبر 2025 جنبا إلى جنب مع جيمين 3 برو. تعديل علامات المياه النصية احتمالات أخذ العينات التالية بشكل غير واضح؛ علامات المياه الصورة / الفيديو تتعافى من الضغط والقطع والمرشحات وتغيرات معدل الإطار. التوقيع المستقر (Fernandez et al., ICCV 2023, arXiv:2303.15435) تحسينات مفكّر التوزيع الخاطئ بحيث تحتوي كل خروج على رسالة ثابتة؛ الصور المقطوعة (10٪ من المحتوى) التي تم الكشف عنها > 90% عند FPR<1e-6. متابعة "توقيع مستقر غير مستقر" (arXiv:2405.07145, مايو 2024) ضبط دقيقة يزيل علامة المياه مع الحفاظ على الجودة. معيار البيانات المعدنية المختلفة الموقع على شفرة C2PA (C2PA 2.2 Explainer 2025). علامات المياه و C2PA تكملان بعضها البعض: يمكن إزالة البيانات المعدنية ولكن تحمل مصدر أكثر غنى. علامات المياه تستمر من خلال الترانسكود ولكن تحمل معلومات أقل.

Type: Build

Languages: Python (stdlib, token-watermark embed + detect)

Prerequisites: Phase 10 · 04 (sampling), Phase 01 · 09 (information theory)

Time: ~75 minutes

أهداف التعلم

  • وصف علامة المياه على مستوى الرمز (طريقة SynthID-text) والآلية التي يمكن بها اكتشافها.
  • وصف توقيع مستقر وهجوم إزالة 2024 الذي كسرها.
  • دور الحكومة C2PA ولماذا هو مكملة للتسمية المائية.
  • وصف القيود الرئيسية: إشارة نموذجية محددة، وقوة تحت المقاطعة، وهجمات الحفاظ على المعنى (arXiv:2508.20228).

المشكلة

2023-2024 شهدت المعلومات المزيفة العميقة والمحتوى المولد من الذكاء الاصطناعي دخول السياقات السياسية والمستهلكية على نطاق واسع. علامة المياه هي إشارة المقترح التقني للمصدر: علامة الأجيال في وقت إنشاءها، وتكتشافها في وقت لاحق. دليل 2025: لا توجد علامة المياه قوية بلا قيد أو شرط، ولكن مع طبقات البيانات المعدنية C2PA توفر الجمع قصة مصدرية قابلة للاستخدام.

المفهوم

علامة مياه النص (طريقة SynthID-text)

آلية كيرشنباور وآخرين 2023، التي أنتجتها جوجل:

  1. في كل خطوة من مراحل فك الكشف، قم بتجميع رموز K السابقة لإنتاج قسم غير عشوائي من المفردات إلى مجموعات "خضراء" و"حمراء".
  2. عينة تعصبية نحو مجموعة الخضراء عن طريق إضافة δ إلى اللوغات الخضراء.
  3. هذا الجيل يحتوي على أكثر رموز خضراء من المحتمل أن تنتج.

الكشف: إعادة تحديد كل إضافة، احتساب الرموز الخضراء في الجيل، حساب نقطة z. نقطة z هي >0 للنص المُعبر بالماء، ~0 للنص البشري.

الخصائص:

  • غير قابل للنظر للقراء (δ صغير بما فيه الكفاية بحيث يكون فقدان الجودة طفيفاً).
  • يمكن اكتشافها مع الوصول إلى وظيفة تقسيم المفردات.
  • لا يُمكن أن يُعبر عن النص

يتم توفير SynthID-text مفتوحًا في أكتوبر 2024 عبر مجموعة أدوات Google Responsible GenAI.

توقيع ثابت (الصورة)

فيرناندز وزملاءه ICCV 2023. ضبط ديكودر الانتشار الخاطئ بحيث تحتوي كل صورة تم إنشاؤها على رسالة ثنائية ثابتة مدمجة في التمثيل الخاطئ. يتم فك رموز الكشف من الخاطئ باستخدام مُقرر عصبي. يتم كشف الصور المقطوعة (حتى 10% من المحتوى) >90% عند FPR<1e-6.

مايو 2024 "توقيع مستقر غير مستقر" (arXiv:2405.07145): ضبط دقيق يقوم بتحويل علامة المياه مع الحفاظ على جودة الصورة. التوضيح الدقيق المتعارض بعد الجيل رخيص؛ وقوة علامة المياه المتعارضة محدودة.

الكشف الموحد عن SynthID (نوفمبر 2025)

إلى جانب جيميني 3 برو: كاشف متعدد الوسائط الذي يقرأ إشارات SynthID من النص والصورة والصوت والفيديو في API واحدة. يوحد كومة Google من أصل.

(C2PA)

التحالف من أجل إصدار المحتوى والصداقية. معيار البيانات المختلفة المختلفة الموقع بشكل رمزي. C2PA 2.2 شرح (2025). سجل C2PA مظاهر ادعاءات الأصل (من الذي خلق، متى، أي تحولات) الموقع من قبل مفتاح المبدع.

إضافة إلى علامة المياه:

  • يمكن إزالة البيانات المعدنية، لا يمكن (بسهولة) إزالة علامات المياه.
  • البيانات المعدنية غنية (سلسلة كاملة من أصل) ؛ علامات المياه تحمل البط.
  • يعتمد C2PA على اعتماد المنصة؛ علامات المياه مدمجة تلقائيا.

يدمج جوجل كل من البحث والإعلانات و "عن هذه الصورة".

القيود

  • Model-specific.علامات مياه SynthID من الأجيال التي تمكن من SynthID. لا يتم وضع علامات مياه على جيل من نموذج بدون SynthID ، لذلك "لا إشارة SynthID" ليست دليل على أصالة.
  • Paraphrase.علامات المياه النصية لا تبقى من المقاطع التي تحافظ على المعنى.
  • Transformation attacks.arXiv:2508.20228 (2025) يظهر هجمات الحفاظ على المعنى التي تدمر كل من علامات المياه النصية والعديد من علامات المياه الصورة.
  • Fine-tune removal.في حالة "توقيع مستقر غير مستقر"، إزالة التنسيقات الدقيقة بعد الجيل علامات المائية المضمنة.

قانون الاتحاد الأوروبي للاستخبارات الذكية المادة 50

قانون الشفافية لتسمية المحتوى الذي يتم إنشاؤه بواسطة الذكاء الاصطناعي (المسودة الأولى ديسمبر 2025، والمسودة الثانية مارس 2026، المتوقع أن تنتهي يونيو 2026 بحسب الموقعEuropean Commission status pageيظل المدونة في مشروعها اعتبارا من أبريل 2026، ويخضع الخط الزمني للتغيير. الطبقة التنظيمية التي تتطلب الطبقة التقنية. يجب وضع علامة على الملفات العميقة.

حيث يتناسب هذا مع المرحلة 18

الدروس 22-23 تتعلق بما ينبعه النموذج (بيانات خاصة، إشارة من أصل). الدروس 27 تغطي إدارة البيانات التدريبية. الدروس 24 هي الإطار التنظيمي الذي يتطلب هذه التدابير التقنية.

استخدمها

code/main.pyيُبني علامة مائية لوحة اللعب. الوهم هي أرقام كاملة 0..N-1؛ تخصيص العينات المُعَلَّمَة بالماء نحو مجموعة الخضراء المحددة بواسطة الهاش. يقوم جهاز كشف بحساب علامة ز-نقطة الوهم الأخضر. يمكنك مراقبة الكشف في 1000 جيل من الوهم، ومشاهدة تدمير الإشارة، وقياس معدل الإيجابية الخاطئة على النص البشري.

أرسله

هذا الدرس يُنتجoutputs/skill-provenance-audit.md. في ظل نشر المحتوى مع ادعاء عن المصل، فإنه يقوم بمراجعة: آلية علامة المياه (إن وجدت) ، سلسلة توقيع C2PA (إن وجدت) ، وقوة كل منها، وتغطية كل طريقة.

التمارين

  1. أركضcode/main.py. إعداد نقاط z للإنتاج 1000 رمز مع علامة مياه مقابل النص الذي كتبه الإنسان. تحديد معدل الإيجابية الخاطئة عند عتبة الائتمان بنسبة 95%.
  1. تنفيذ هجوم إعادة التعبير الذي يحل محل 30% من الرموز مع مرادف.
  1. اقرأ كيرشنباور وزملاء 2023 القسم 6 حول الصمود. لماذا تفشل علامات المائية النصية تحت المقاطع ولكن علامات المائية الصورة تبقى في الانقطاع؟
  1. تصميم تنفيذ يستخدم SynthID-text + C2PA البيانات المعدنية. وصف سلسلة الأصل التي يراه المستهلك. حدد وضع فشل واحد لكل مكون.
  1. نتيجة 2024 "توقيع مستقر غير مستقر" تظهر التنسيق الدقيق يزيل علامة المائية الصورة. تصميم جهاز تحكم النشر الذي يحد من هذا الهجوم على سبيل المثال، يتطلب إصدارات موقعة من نقاط التفتيش المنسقة.

الشروط الرئيسية

TermWhat people sayWhat it actually means
SynthID"Google's watermark"Cross-modal provenance signal; text, image, audio, video
Token watermark"Kirchenbauer-style"Biased-sampling text watermark detectable via green-token z-score
Stable Signature"image watermark"Fine-tuned-decoder watermark; ICCV 2023
C2PA"the metadata standard"Cryptographically signed tamper-evident provenance metadata
Paraphrase robustness"does rewording break it"Text watermark property; currently limited
Fine-tune removal"adversarial unwatermark"Attack that removes image watermark via decoder fine-tuning
Cross-modal detector"unified SynthID"November 2025 unified API across modalities

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.