Phase 12: Multimodal AI

انتقال: متن تخفیف + تصویر انتشار در یک ترانسفورماتور

"چاملون" و "ايمو3" همه چيز رو به توکن هاي متفرقه شرط مي بندن آنها کار می کنند، اما گلو شکنی کوانتایی قابل مشاهده است سطح بالای کیفیت تصویر زیر مدل های انتشار فضای مداوم. پیوند (Meta, Zhou et al., اوت 2024) شرط مخالف را می گیرد: تصاویر را به طور مداوم نگه دارید، VQ-VAE را به طور کامل رها کنید و یک ترانسفورماتور را با دو ضرر آموزش دهید. توکن های متن پیش بینی توکن بعدی را دریافت می کنند. پیچ های تصویر یک ضایعات جریان / انتشار را از دست می دهند. هر دو هدف وزن مشابهی را بهینه می کنند. معماری زیربنایی Stable Diffusion 3 (MMDiT) یک پسر عموی نزدیک است. این درس پایان نامه ی پیوند را می خواند، یک مربی دو بازو بازی را می سازد و ماسک توجه را ردیابی می کند که به یک ترانسفورماتور اجازه می دهد هر دو کار را انجام دهد.

Type: Build

Languages: Python (stdlib, two-loss trainer on MNIST-scale toy)

Prerequisites: Phase 12 · 11 (Chameleon), Phase 8 (Generative AI)

Time: ~180 minutes

اهداف یادگیری

  • یک ترانسفارمر که دو خروجی (NTP در توکن های متن، MSE انتشار در پچ های تصویر) را روی یک ستون فقرات اجرا می کند، سیم کشی کنید.
  • توضیح دهید چرا توجه دو جهت در میان تکه های تصویر به علاوه توجه عللوی در مورد نشانه های متن انتخاب ماسک مناسب است.
  • مقایسه سبک ترانسفوز (تصاویر مداوم، از دست دادن انتشار) با سبک شاملیون (تصاویر متمایز، NTP) در محاسبه، کیفیت و پیچیدگی کد.
  • سهم MMDiT را نام دهید: وزنه های خاص به هر بلوک، توجه مشترک در جریان باقیمانده.

مشکل

بحث توکن های تصویر متمایز در مقابل مداوم از LLM قدیمی تر است. نمایش های مداوم (پیکسل های خام، VAE پنهان) جزئیات را حفظ می کنند. توکن های متمایز (نندسه های VQ) با لغت بومی ترانسفورماتور مطابقت دارند اما جزئیات را در مرحله کوانتاسیون از دست می دهند.

Chameleon / Emu3 رفت متمایز: یک ضرر، یک معماری، اما وفاداری تصویر توسط کیفیت توکنز محدود شده است.

مدل های انتشار مداوم: کیفیت تصویر استثنایی، اما یک مدل جداگانه از LLM، مهندسی برنامه های شور پیچیده و هیچ ادغام تمیز با تولید متن.

پیوند می پرسد: آیا می توانیم هر دو را داشته باشیم؟ تصاویر را به طور مداوم نگه دارید، هنوز یک مدل را آموزش دهید، از دو ضایعات استفاده کنید که به یک مرحله گرادینت متصل شده اند.

مفهوم

معماری دو بازده

یک ترانسفورماتور تنها با یک دیکودر یک دنباله را پردازش می کند که حاوی:

  • توکن های متن (متفصّل، از لغت BPE).
  • پیچ های تصویر (بلاک های 16x16 پیکسل مداوم که از طریق ادغام خطی به عنوان ورودی یک کدگر ViT به صورت پنهان در حال حرکت هستند).
  • <image>و</image>برچسب هایی که نشان دهنده محل زندگی پیچ های مداوم است.

گذرگاه پیش رو یک بار اجرا می شود. خسارت یکی از دو سر را در هر توکن انتخاب می کند:

  • برای توکن های متن: انترپی متقابل استاندارد در سر لغات-logits.
  • برای پیچ های تصویر: از دست دادن انتشار در پیچ های مداوم پیش بینی صدا که به هر پیچ اضافه شده است.

گرادینت از طریق بدن ترانسفورماتور مشترک جریان می یابد. هر دو از دست دادن وزن مشترک را همزمان بهبود می بخشد.

ماسک توجه: متن علت + تصویر دو جهت

توکن های متن باید علل باشند نمی توانید اجازه دهید یک توکن متن به متن آینده توجه کند یا معلم وقفه ای را مجبور کند. با این حال، پیچ های تصویر یک عکس فوری را نشان می دهند؛ آنها باید در یک بلوک تصویر دو جهت به یکدیگر توجه کنند.

ماسک:

M[i, j] = 1 if:
  (i is text and j is text and j <= i)   # causal for text
  OR (i is image and j is image and same_image_block(i, j))   # bidirectional within image
  OR (i is text and j is image and j < i_image_end)   # text attends to previous images
  OR (i is image and j is text and j < i_image_start)   # image attends to preceding text

به عنوان یک ماسک قطبی بلوک در آموزش و نتیجه گیری استفاده می شود.

از دست دادن انتشار در داخل ترانسفورماتور

ضایع انتشار استاندارد است: صدا را به یک پیچ تصویر اضافه کنید، از مدل بخواهید تا صدا را پیش بینی کند (یا پیچ تمیز، به طور معادل). نسخه انتقال از تطابق جریان استفاده می کند میدان سرعت را از صدا به تمیز پیش بینی کنید.

در طول آموزش:

  1. برای هر پیچ تصویر x0، یک مرحله زمانی تصادفی t را نمونه کنید.
  2. نمونه ی صدا ε، محاسبه xt = (1-t) x0 + t ε (تقاطع خطی برای تطابق جریان).
  3. ترانسفورماتور v_theta(xt، t) ، از دست دادن = MSE(v_theta(xt، t) ، ε - x0 را پیش بینی می کند.
  4. پشتپروپ در کنار متن NTP از دست دادن از همان ترتیب.

در نتیجه، نسل:

  • توکن های متن: نمونه گیری استاندارد خودکشی.
  • پیچ های تصویر: حلقه نمونه گیری انتشار (تایپی 10-30 مرحله) که بر روی توکن های متن قبلی مشروط است.

MMDiT: ویرانه Stable Diffusion 3

Stable Diffusion 3 (Esser et al., مارس 2024) MMDiT (متعدد فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فرش فر فر فر فر فرش فرش فر فر فر فرش فرش فر فر فر فر فرش فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر فر

تفاوت های اصلی MMDiT:

  • وزن های خاص به هر بلوک. هر بلوک ترانسفورماتور دارای وزن های Q، K، V و MLP جداگانه برای توکن های متن در مقابل پچ های تصویر است. توجه مشترک است (تقاطع حالت) ؛ همه چیز دیگر خاص به حالت است.
  • آموزش جریان اصلاح شده. یک نوع تطابق جریان خاص با نمونه گیری شناخته شده و ریاضی ساده تر از DDPM.
  • مقیاس. MMDiT ستون فقرات SD3 (فارق پارامای 2B و 8B) است. مقیاس کاغذی تزریق به 7B.

هر دو بر روی یک ایده اصلی همگام می شوند: یک ترانسفورماتور NTP را در متن و انتشار را در نمایشگرهای تصویر مداوم اجرا می کند.

چرا اين از سبک شامليون بهتره

شکاف کیفیت بین انتشار مداوم و NTP متمایز در تولید تصویر قابل اندازه گیری است. گزارش های کاغذی پیوند:

  • در 7B پارام، مدل مشابه مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل مدل F3
  • آموزش توکنایزر لازم نیست کدگر تصویر ساده تر است (پیش بینی خطی به پنهان، همان طور که لایه ورودی ViT است).
  • انفرنس می تواند به طور متوازمی از نشان دادن پیچ تصویر، برخلاف توکن های تصویر خودکشی را نشان دهد.

منفی: انتقال خون یک مدل دوگانه است که دینامیک آموزش را پیچیده تر می کند. وزن کاهش نیاز به تنظیم دارد. عدم مطابقت برنامه بین NTP و انتشار می تواند باعث شود یک سر تسلط داشته باشد.

چه چیزی در زیر رود می رود

Janus-Pro (درسه 12.15) ایده Transfusion را با جدا کردن کدگر بینایی برای درک و تولید SigLIP برای یکی، VQ برای دیگری در حالی که بدن ترانسفورم را به اشتراک می گذارد، بهبود می بخشد. Show-o (درسه 12.14) انتشار را برای انتشار متمایز (پیش بینی ماسک) تغییر می دهد. خانواده نسل یکپارچه پس از Transfusion به سرعت شاخه می شود.

VLM تولید 2026 که تصاویر را منتشر می کند Gemini 3 Pro، GPT-5, مسیر تولید تصویر Claude Opus 4.7 تقریباً مطمئناً از برخی از فرزندان این خانواده استفاده می کنند. جزئیات اختصاصی هستند.

ازش استفاده کن

code/main.pyساخت یک اسباب بازی Transfusion بر روی یک مشکل کوچک شبیه MNIST:

  • عنوانات متن، دنباله های کوتاه عدد کامل است که یک رقم (0-9) را توصیف می کند.
  • تصاویر شبکه های 4x4 بایت هستند.
  • یک جفت از پروژکتورهای خطی با وزن مشترک به عنوان جایگزین ترانسفورماتور عمل می کنند. از دست دادن NTP در متن، از دست دادن MSE در پیچ های سر و صدا.
  • حلقات آموزش دو ضرر رو متناوب ميکنه، ماسک توجه رو واضح ميکنه
  • نسل یک متن زیرنویس و یک تصویر 4x4 را در یک گذرگاه پیش تولید می کند.

ترانسفورماتور يه اسباب بازي است. لوله هاي دو ضرر، ساخت ماسک توجه و حلقه نتيجه آثار واقعي هستند.

-باده

این درس به ما کمک می کندoutputs/skill-two-loss-trainer-designer.mdبا توجه به یک وظیفه آموزشی چند مدل جدید (متن + تصویر، متن + صوتی، متن + ویدئو) ، این برنامه دو کاهش (وزن کاهش، شکل ماسک، بلوک های مشترک در مقابل مواردی) را طراحی می کند و خطرات پیاده سازی را نشان می دهد.

تمرینات

  1. یک مدل سبک انتقال 70٪ توکن های متن و 30٪ تکه های تصویر را آموزش می دهد. از دست دادن انتشار تصویر ~ 10 برابر از دست دادن NTP متن در شدت است. چه وزن از دست دادن آنها را تعادل می کند؟
  1. ماسک قطبی قطبی را برای یک ترتیب اجرا کنید: [T, T, <image>, P, P, P, P, </image>, T]هر ورودی را 0 یا 1 نشان دهید.
  1. MMDiT دارای وزن QKV خاص به روش است. این اضافه کننده چه پارامتر را به نسبت ترانسفوزن کاملا مشترک اضافه می کند؟ در پارامتر 7B، آیا ارزش آن را دارد؟
  1. نسل: با یک پیام پیامک، مدل NTP را برای 50 توکن اجرا می کند، سپس می کشد <image>بعد از اين، در طول 20 مرحله از بيان، در 256 تکه پخش مي شود.
  1. مقاله SD3 را در بخش 3 بخوانید. جریان اصلاح شده را توصیف کنید و چرا در مراحل نتیجه گیری کمتر از DDPM به هم می پیوندد.

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
Two-loss training"NTP + diffusion"A single transformer optimizes both cross-entropy on text tokens and MSE on continuous image patches in the same gradient step
Flow matching"Rectified flow"Diffusion variant that predicts a velocity field from noise to clean data; simpler math than DDPM
MMDiT"Multimodal DiT"Stable Diffusion 3's architecture: joint attention, modality-specific MLPs and norms
Block-triangular mask"Causal text + bidirectional image"Attention mask that is causal across text but bidirectional within image regions
Continuous image representation"No VQ"Image patches as real-valued vectors, not integer codebook indices
Velocity prediction"v-parameterization"Network output is the velocity field between noise and data, not the noise itself

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.