Phase 18: Ethics, Safety & Alignment

آبیاری SynthID، امضا پایدار، C2PA

سه تکنولوژی ساختار 2026 تولید محتوا AI-محصول. SynthID (گوگل DeepMind) آبی نشان تصویر در اوت 2023 راه اندازی شد، متن + ویدئو در ماه مه 2024 (جیمینی + ویو) ، متن منبع باز در اکتبر 2024 از طریق GenAI Toolkit مسئول، آشکارساز چند رسانه ای متحد در نوامبر 2025 در کنار Gemini 3 Pro. آبی نشان متن احتمال نمونه گیری توکن بعدی را به طور غیر قابل تشخیص تنظیم می کند. آبی نشان های تصویر / ویدیو از فشرده سازی، برش، فیلترها، تغییرات نرخ فریم زنده می مانند. امضا پایدار (Fernandez et al., ICCV 2023, arXiv:2303.15435) تنظیم دقیق دیکودر انتشار پنهان به طوری که هر خروجی حاوی یک پیام ثابت است؛ تصاویر برش شده (10٪ از محتوای) تولید شده در FPR<1e-6 >90٪ شناسایی شده است. پیگیری "توقيع پایدار نامثبت است" (arXiv:2405.07145, مه 2024) تنظیم دقیق علامت آب را در حالی که کیفیت را حفظ می کند حذف می کند. استاندارد متاداتا C2PA با امضاء رمزنگاری شده، آشکار است که با نقض آن ها دستخط شده است (C2PA 2.2 Explainer 2025). آبی نشان و C2PA مکمل هستند: متاداتا می تواند حذف شود اما دارای منبع غنی تر است. آبی نشان از طریق ترانسکوڈنگ باقی می ماند اما اطلاعات کمتری را در خود دارد.

Type: Build

Languages: Python (stdlib, token-watermark embed + detect)

Prerequisites: Phase 10 · 04 (sampling), Phase 01 · 09 (information theory)

Time: ~75 minutes

اهداف یادگیری

  • آبیاری در سطح توکن (سلسل متن SynthID) و مکانیسم شناسایی آن را توصیف کنید.
  • امضا مستقر و حمله حذف 2024 رو که شکستش داد رو شرح بده
  • نقش C2PA دولت و اینکه چرا این نقش مکمل آبیاری است.
  • محدودیت های اصلی را شرح دهید: سیگنال خاص مدل، قوی بودن تحت پارافرز و حملات حفظ معنی (arXiv:2508.20228).

مشکل

در سال های 2023 تا 2024، deepfakes و محتوای تولید شده توسط هوش مصنوعی به طور گسترده ای به زمینه های سیاسی و مصرف کننده وارد می شوند. آبی نشان دادن سیگنال اصلی فنی پیشنهادی است: نسل ها را در زمان ایجاد نشان دهید، آنها را بعدا تشخیص دهید. شواهد 2025: هیچ آبی نشان بدون شرط قوی نیست، اما با متاداتا C2PA لایه ای ترکیب یک داستان اصلی قابل استفاده را فراهم می کند.

مفهوم

آبیاری متن (سلسل متن SynthID)

مکانیسم Kirchenbauer و همکاران 2023، تولید شده توسط گوگل:

  1. در هر مرحله رمزگذاری، توکن های K قبلی را هاش کنید تا یک قسمت نامعقول و تصادفی از لغات را به مجموعه های "سبز" و " قرمز" ایجاد کنید.
  2. نمونه گیری تعصب به سمت مجموعه سبز با اضافه کردن δ به logits سبز.
  3. نسل شامل توکن های سبز بیشتری از آنچه که تصادف تولید می کند است.

تشخیص: هر پیشگویی را دوباره تکرار کنید، نمادهای سبز را در نسل شمارش کنید، نمره z را محاسبه کنید. نمره z برای متن آبی نشان شده >0، برای متن انسانی ~0 است.

خواص:

  • برای خوانندگان غیر قابل تشخیص (δ به اندازه کافی کوچک است که از دست دادن کیفیت جزئی باشد).
  • قابل تشخیص با دسترسی به تابع پارتیشن لغات
  • که به طور قابل پیش فرض نیست نوشتن متن دوباره سیگنال را نابود می کند.

SynthID-text در اکتبر 2024 از طریق ابزار GenAI مسئول گوگل به منبع باز است.

امضا پایدار (تصویر)

فرناندیز و همکارانش ICCV 2023. decoder انتشار غش را به گونه ای تنظیم کنید که هر تصویر تولید شده حاوی یک پیام دوگانه ثابت در نمایش غش است. تشخیص از غش با یک decoder عصبی رمزگذاری می شود. تصاویر برش شده (تا 10٪ از محتوای) در FPR<1e-6 >90٪ شناسایی می شود.

مه 2024 "توقيع پایدار نامثبت است" (arXiv:2405.07145): تنظیم دقیق کدگر آبی را در حالی که کیفیت تصویر را حفظ می کند حذف می کند. تنظیم دقیق بعد از نسل مخالف ارزان است؛ ثبات ضد آب نشان محدود است.

آشکارساز یکپارچه SynthID (نومبر 2025)

در کنار جمینی 3 پرو: یک آشکارساز چند رسانه ای که سیگنال های SynthID را از متن، تصویر، صوتی و ویدیو در یک API می خواند.

C2PA

ائتلاف برای اصل و مصداق محتوا. استاندارد متاداتا آشکار با دستخط رمزنگاری شده. C2PA 2.2 توضیح دهنده (2025) . یک C2PA آشکار ادعا های مربوط به اصل (چه کسی ایجاد کرد، چه زمانی، چه تحولاتی) را ثبت می کند که توسط کلید سازنده امضا شده است.

مکمل های آبی:

  • میتادیتا می تواند حذف شود؛ آبی نشان نمی تواند (به راحتی)
  • متاداتا غنی است (سلسلۀ کامل اصلی؛ نشانه های آب بایت ها را حمل می کنند.
  • C2PA بستگی به پذیرش پلتفرم دارد؛ آبی نشان ها به طور خودکار گنجانده می شوند.

گوگل هر دو را در جستجو، تبلیغات و "بزرگ درباره این تصویر" ادغام می کند.

محدودیت ها

  • Model-specific.SynthID آبی نشان نسل از مدل های فعال SynthID. یک نسل از یک مدل بدون SynthID آبی نشان نمی شود، بنابراین "هیچ سیگنال SynthID" اثبات مصداقیت نیست.
  • Paraphrase.آگهی های آبی متن از پارافرزایی که معنای آن را حفظ می کند، زنده نمی مانند.
  • Transformation attacks.arXiv:2508.20228 (2025) نشان می دهد حملات حفظ معنی که هر دو آبی نشان متن و بسیاری از آبی نشان تصاویر را نابود می کند.
  • Fine-tune removal.برای "توقيع مستحکم نامستقیم است"، تنظیمات دقیق بعد از نسل، نشانه های آبی گنجانده را حذف می کند.

قانون هوش مصنوعی اتحادیه اروپا ماده 50

کد شفافیت برای برچسب گذاری محتوا تولید شده توسط هوش مصنوعی (اولین طرح دسامبر 2025, دومین طرح مارس 2026, انتظار می رود پایان ژوئن 2026 در سال 2020European Commission status page) این قانون از آوریل 2026 در حال تهیه است و جدول زمانی در حال تغییر است. لایه نظارتی که لایه فنی را مورد نیاز است.

جایی که این در مرحله 18 قرار داره

درس 22-23 درباره آنچه مدل منتشر می کند (داده های خصوصی، سیگنال اصلی) است. درس 27 شامل مدیریت اطلاعات آموزشی است. درس 24 چارچوب نظارتی است که این اقدامات فنی را مورد نیاز قرار می دهد.

ازش استفاده کن

code/main.pyیک آشکارساز نمره z-نمره سبز را محاسبه می کند. شما می توانید تشخیص را در 1000 نسل نمره مشاهده کنید، پارافرز را تماشا کنید سیگنال را نابود کنید و نرخ مثبت دروغ را در متن انسانی اندازه گیری کنید.

-باده

این درس به ما کمک می کندoutputs/skill-provenance-audit.md. در نظر گرفتن یک انتشار محتوا با ادعای منشاء، آن را حسابرسی: مکانیسم آبی نشان (اگر وجود دارد) ، زنجیره امضا C2PA (اگر وجود دارد) ، قوی بودن مخالف هر یک از آنها و پوشش هر نوع.

تمرینات

  1. فرار کنcode/main.py. گزارش نمرات z برای 1000 توکن تولید با علامت آب در مقابل متن نوشته شده توسط انسان. نرخ مثبت دروغین را در حد اعتماد 95٪ شناسایی کنید.
  1. حمله ي پارافرازي رو اجرا کن که 30 درصد از توکن ها رو با مترادف ها عوض کنه
  1. Kirchenbauer et al. 2023 بخش 6 در مورد ثبات. چرا نشانه های آب متن در پارافرز شکست می خورند اما نشانه های آب تصویر در برش زنده می مانند؟
  1. طراحی یک پیاده سازی که از متادای SynthID-text + C2PA استفاده می کند. زنجیره اصلی را که مصرف کننده می بیند توصیف کنید. یک حالت شکست هر قطعه را شناسایی کنید.
  1. نتایج 2024 "موقع ثابت غیر مستحکم است" نشان می دهد که تنظیم دقیق علامت آب تصویر را حذف می کند. طراحی یک کنترل انتشار که این حمله را محدود می کند به عنوان مثال، نیاز به انتشار امضا شده از نقاط بازرسی تنظیم شده است.

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
SynthID"Google's watermark"Cross-modal provenance signal; text, image, audio, video
Token watermark"Kirchenbauer-style"Biased-sampling text watermark detectable via green-token z-score
Stable Signature"image watermark"Fine-tuned-decoder watermark; ICCV 2023
C2PA"the metadata standard"Cryptographically signed tamper-evident provenance metadata
Paraphrase robustness"does rewording break it"Text watermark property; currently limited
Fine-tune removal"adversarial unwatermark"Attack that removes image watermark via decoder fine-tuning
Cross-modal detector"unified SynthID"November 2025 unified API across modalities

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.