Phase 12: Multimodal AI

النقل: النص السريع + صورة الانتشار في محول واحد

(كاميليون) و (إيمو3) راهنوا على كل شيء على رموز منفصلة إنهم يعملون، ولكن عقدة التكيف الكمي واضحة مرتفعات جودة الصورة تحت نماذج انتشار الفضاء المستمر. يستخدم النقل (Meta, Zhou et al., أغسطس 2024) الرهان المعاكس: الحفاظ على الصور مستمرة، إسقاط VQ-VAE بالكامل، وتدريب محول واحد مع خسائر. الـ"توكين" النصي يحصل على التنبؤ بالـ"توكين" التالي تُحصل مساحات الصورة على فقدان التطابق / التوزيع. كلا الهدفين يضمنان نفس الوزن الهندسة المعمارية التي تقوم على انتشار مستقر 3 (MMDiT) هي قريبة من القريب. هذه الدروس تقرأ أطروحة الغسيل، وتصنع مدربة لعبة خسارة اثنين، وتتبع قناع الاهتمام الذي يسمح للمتحول واحد القيام بكلتا الوظائف.

Type: Build

Languages: Python (stdlib, two-loss trainer on MNIST-scale toy)

Prerequisites: Phase 12 · 11 (Chameleon), Phase 8 (Generative AI)

Time: ~180 minutes

أهداف التعلم

  • سلك محول يعمل بخسارتين (NTP على رموز النص، MSE التنشر على تصميمات الصورة) على العمود الفقري واحد.
  • شرح لماذا الاهتمام المقابل بين مساحات الصورة بالإضافة إلى الاهتمام السببي على رموز النص هو الخيار الصحيح لقناع.
  • مقارنة نمط النقل (الصور المستمرة، فقدان الانتشار) مع نمط الكاميليون (الصور المختلفة، NTP) على الحساب والجودة، وتعقيد الكود.
  • أسمائ مساهمة MMDiT: الوزن المحدد للطريقة في كل كتلة، والاهتمام المشترك في التدفق المتبقي.

المشكلة

النقاش حول رموز الصورة المتفصلة مقابل المتواصلة قديم أكثر من LLM. تمثيلات متواصلة (بيكسلات خامة ، VAE متخفية) تحافظ على التفاصيل. تتوافق رموز التفاصيل (مؤشرات VQ) مع المفردات الأصلية للمتحول ولكن تفاصيلها تفقد في خطوة الكميات.

خيميلون / Emu3 ذهب متفرقة: خسارة واحدة، بنية واحدة، ولكن الصورة وفاء حد من قبل جودة tokenizer.

كانت نماذج التوزيع مستمرة: جودة الصورة استثنائية، ولكن نموذج منفصل عن ماجستير في التكنولوجيا، هندسة جدول الضوضاء المعقدة، وعدم وجود تكامل نظيف مع توليد النص.

النقل يسأل: هل يمكننا الحصول على كليهما؟ أبقي الصور مستمرة، لا تزال تدريب نموذج واحد، استخدم خسارتين خياطة في خطوة تراجع واحدة.

المفهوم

معمارية الخسارة الثنائية

محول واحد فقط للكشف يعالج تسلسلًا يحتوي على:

  • رموز نصية (مختلفة، من لغة BPE).
  • معطيات الصورة (متواصلة، كتلة 16 × 16 بكسلات تم إلقاءها في ضوء مخفي عن طريق إضافة خطية نفس المدخل من مرموز ViT).
  • <image>و</image>علامات تعريفة حيث تعيش المكالمات المستمرة.

المخططات الأمامية تنطلق مرة واحدة، الخسارة تختار واحدة من رأسين لكل رمز:

  • بالنسبة لرموز النص: الإنتروبي المتقاطع القياسي على رأس اللغات الفصلية.
  • بالنسبة لمصطلحات الصورة: فقدان التوزيع على المصطلحات المستمرة توقع الضجيج الذي تم إضافة كل مصطلح.

التدفق يتدفق عبر جسم المحول المشترك كل من الخسائر تحسن الوزن المشترك في وقت واحد

قناع الانتباه: نص السبب + صورة ثنائية الاتجاه

لا يمكن السماح لوضع رمز نصي في نص مستقبلي، أو إجبار المعلم على الراحة. ومع ذلك، تمثل شاحنات الصورة صورة واحدة؛ يجب أن تلتحق ببعضها البعض في اتجاهين داخل نفس كتلة الصورة.

القناع:

M[i, j] = 1 if:
  (i is text and j is text and j <= i)   # causal for text
  OR (i is image and j is image and same_image_block(i, j))   # bidirectional within image
  OR (i is text and j is image and j < i_image_end)   # text attends to previous images
  OR (i is image and j is text and j < i_image_start)   # image attends to preceding text

يتم تنفيذها كقناع مثلثي حجر في التدريب والإستنتاج.

فقدان الانتشار داخل المحول

الخسارة التوزيعية هي قياسية: إضافة الضوضاء إلى مساحة الصورة، اطلب من النموذج التنبؤ بالضوضاء (أو المساحة النظيفة، بمعادل ذلك). تستخدم نسخة الغسالة مطابقة التدفق التنبؤ بمجال السرعة من الضوضاء إلى النظافة.

أثناء التدريب:

  1. لكل إصدار صورة x0، عينة خطوة زمنية عشوائية t.
  2. نموذج الضجيج ε، حساب xt = (1-t) x0 + t ε (التقاطع الخطى لتطابق التدفق).
  3. المحول يتنبأ v_theta(xt، t) ؛ الخسارة = MSE(v_theta(xt، t) ، ε - x0).
  4. التكلفة الخلفية جنبا إلى جنب مع النص فقدان NTP من نفس التسلسل.

عند الاستنتاج، الجيل هو:

  • رموز النص: أخذ عينات قياسية ذات التراجع.
  • تصفيح الصورة: حلقة أخذ العينات التفريقية (10-30 خطوة نموذجية) مشروطة على رموز النص السابقة.

MMDiT: فارنتة مستقر الانتشار 3

أرسلت شركة Stable Diffusion 3 (Esser et al., مارس 2024) MMDiT (متحول Diffusion Multimodal) في نفس الوقت تقريباً مع Transfusion.

الاختلافات الرئيسية في MMDiT:

  • الوزن المحدد للطريقة لكل كتلة. كل كتلة محول لها وزن Q و K و V و MLP منفصلة للشعارات النصية مقابل مساحات الصورة. الاهتمام مشترك (تقاطع الوسائل). كل شيء آخر هو محدد للطريقة.
  • تدريب تدفق معدل. تغير محدد لتطابق التدفق مع أخذ العينات المعروفة والرياضيات أبسط من DDPM.
  • المقياس. MMDiT هي العمود الفقري ل SD3 (2B و 8B فاريانات المعلمات).

كلاهما يتحرك على نفس الفكرة الأساسية: واحد من المحولين يعمل NTP على النص والانتشار على تمثيلات الصورة المستمرة.

لماذا هذا يفوق نمط الكاميليون

فجوة الجودة بين الانتشار المستمر و NTP المتفرد في توليد الصور قابلة للقياس. تقارير ورقة الغسالة:

  • في 7B، يتغلب على نموذج في نفس الحجم على FID بنسبة 3-5 نقاط.
  • لا يتطلب تدريب رمزية إنكودر الصورة أبسط (التنبيه الخطي إلى الخفي، نفس طبقة المدخل في ViT).
  • يمكن أن تكون الإستدلال موازية مع إصدار علامات تصويرية، على عكس رموز الصورة ذات التراجع.

الجانب السلبي: النقل هو نموذج ضاعف مزدوج، مما يجعل ديناميكية التدريب أكثر صعوبة. تحتاج الأوزان الخسارة إلى ضبط. عدم مطابقة الجدول الزمني بين NTP والانفجار يمكن أن يسبب سيطرة رأس واحد.

ما يجلس أسفل التيار

يصلح يانوس برو (دروس 12.15) فكرة Transfusion عن طريق فصل مبرمج الرؤية لفهم وتوليد SigLIP لواحد ، و VQ لواحد أثناء مشاركة جسم المحول. يغير Show-o (دروس 12.14) التوزيع للتوزيع المتفصّل (التنبؤ المُخفي). تتفرق أسرة الجيل الموحد بسرعة بعد Transfusion.

2026 إنتاج VLMs التي تنبعث الصور Gemini 3 Pro، GPT-5, Claude Opus 4.7 طريق توليد الصور تقريبا بالتأكيد استخدام بعض نذور هذه العائلة. التفاصيل هي خاصة.

استخدمها

code/main.pyيُبني لعبة "ضمير" على مشكلة صغيرة مثل "منست":

  • العناوين الرسمية هي تسلسلات قصيرة من الأعداد الكاملة التي تصف رقم (0-9).
  • الصور هي شبكات 4x4 من البايت.
  • يعمل زوج من التنبؤات الخطية المشتركة في الوزن كمتكيف مع المحول؛ فقدان NTP على النص، وفقدان MSE على المزيفات الضوضاء.
  • حلقة التدريب تتناوب بين الخسائر، قناع الاهتمام صريح.
  • إنتاج الجيل تصنيف نصي وصورة 4x4 في مرور واحد إلى الأمام.

المحول هو لعبة، إنّ المياه المضادة للخسارة، وبناء قناع الاهتمام، وخطوط التخمين هي الأثاث الحقيقية.

أرسله

هذا الدرس يُنتجoutputs/skill-two-loss-trainer-designer.md. نظراً لمهمة تدريب متعددة الطرق الجديدة (نص + صورة ، نص + صوت ، نص + فيديو) ، فإنه يصمم جدول الخسائر الثنائية (وزن الخسارة ، شكل القناع ، كتلة مشتركة مقابل كتلة محددة للطريقة) ويشير إلى مخاطر تنفيذها.

التمارين

  1. نموذج النموذج النموذجي يستخدم 70٪ من رموز النص و 30٪ من معطيات الصورة. فقدان انتشار الصورة هو ~ 10x فقدان النص NTP في الحجم. ما هي أوزان الخسارة التي توازن بينها؟
  1. تنفيذ قناع قطاع ثلاثي للسلسلة: [T, T, <image>, P, P, P, P, </image>, T]. قم بتسجيل كل مدخل 0 أو 1.
  1. MMDiT لديه وزن QKV محدد للطريقة. ما هي المعايير التي يضيفها هذا مقابل محول Transfusion المشترك بالكامل؟ عند 7B، هل يستحق ذلك؟
  1. التوليد: إعطاء طلب نصي، يقوم النموذج بتشغيل NTP لـ 50 رمزا، ثم يضرب <image>ثم يقوم بتوزيع 256 مساحة على 20 خطوة للتخفيض. كم عدد الممرات إلى الأمام إجمالاً؟
  1. اقرأ ورقة SD3 القسم 3. وصف التدفق المصلح ولماذا يتقارب في أقل خطوات استنتاج من DDPM.

الشروط الرئيسية

TermWhat people sayWhat it actually means
Two-loss training"NTP + diffusion"A single transformer optimizes both cross-entropy on text tokens and MSE on continuous image patches in the same gradient step
Flow matching"Rectified flow"Diffusion variant that predicts a velocity field from noise to clean data; simpler math than DDPM
MMDiT"Multimodal DiT"Stable Diffusion 3's architecture: joint attention, modality-specific MLPs and norms
Block-triangular mask"Causal text + bidirectional image"Attention mask that is causal across text but bidirectional within image regions
Continuous image representation"No VQ"Image patches as real-valued vectors, not integer codebook indices
Velocity prediction"v-parameterization"Network output is the velocity field between noise and data, not the noise itself

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.