Phase 12: Multimodal AI

Emu3: التنبؤات المقبلة للتوليد الصوري والفيديو

Emu3 من BAAI (وانغ وآخرون ، سبتمبر 2024) هو نتيجة 2024 التي كان ينبغي أن تنتهي من النقاش الانتشار مقابل الانتقال الذاتي. محول واحد لـ Llama-style decoder-only ، المدرب فقط على هدف التنبؤ التالي للتوقيع ، عبر المفرد الموحد من النص + رموز الصورة VQ + رموز الفيديو VQ 3D ، يضرب SDXL على إنتاج الصورة و LLaVA-1.6 على الإدراك. لا خسارة في المراقبة لا جدول الإنتشار يستخدم الإرشاد الخالي من التصنيف في الاستنتاج للجودة، ولكن الهدف الأساسي للتدريب هو التنبؤ بالبرنامج التالي مع إجبار المعلم. نشرت في مجلة الطبيعة هذه الدروس تقرأ أطروحة Emu3 لماذا أفضل tokenizer زائد مقياس هو كل ما تحتاجه وتتناقض مع نهج التوزيع.

Type: Learn

Languages: Python (stdlib, 3D video tokenizer math + autoregressive sampler skeleton)

Prerequisites: Phase 12 · 11 (Chameleon)

Time: ~120 minutes

أهداف التعلم

  • شرح لماذا يعمل هدف إيمو3 التالي للبرمجة ذات الخسارة الواحدة على الرغم من الافتراض القديم بأن التوزيع مطلوب لجودة الصورة.
  • وصف رمز الفيديو ثلاثي الأبعاد: كيف يبدو كتاب VQ الفضائي-الوقتي، لماذا تتجاوز المكالمات الوقت.
  • مقارنة Emu3 مقابل مستقر التفريق XL على (حساب التدريب، تكلفة الاستنتاج، السقف الجودة).
  • أسمائ الدورات الثلاثة التي تلعبها نفس نموذج Emu3: Emu3-Gen (جين الصورة) ، Emu3-Chat (الاندفاع) ، Emu3-Stage2 (جين الفيديو).

المشكلة

الحكمة التقليدية حتى 2024: إنتاج الصور يحتاج إلى انتشار. الحجة: رموز الصورة المفصلة تفقد الكثير من المعلومات لإعادة بناء التفاصيل، والعينة السريعة تتراكم الخطأ عبر آلاف الرموز. (الإنفجار المستقر) (DALL- E 3) (Imagen) ( Midjourney) (كلّها تستخدم شكل من أشكال الانفجار) كَفَرَ Chameleon (درسة 12.11) هذا جزئياً على نطاق صغير ولكن لم يُطابق SDXL على الجودة.

هاجم Emu3 الحجة مباشرة. الادعاء: أفضل رمز بصري + حجم كاف + خسارة رمز التالي = إنتاج صورة تضرب الانتشار في نفس النموذج الذي يستخدم أيضًا الإدراك.

كان الرهان مثيرا للجدل عندما نشرته. بعد عامين، أصبحت عائلة الجيل الموحد المفتوح (Emu3 ، Show-o ، Janus-Pro ، Transfusion) مسارًا افتراضيًا للبحث. يبدو أن نماذج الحدود الإنتاجية تستخدم بعض التنوعات.

المفهوم

الـ " إيمو 3 "

المكون الرئيسي هو الوهم البصري. Emu3 تدرب الوهم المخصص من فئة IBQ (Inverse Bottleneck Quantizer ، SBER-MoVQGAN عائلة) عند 8x8 تقليل القرار لكل رمز. تصبح صورة 512x512 64x64 = 4096 رمزا في حجم كتاب التعليمات 32768.

هذا أكبر من 1024 رمز من Chameleon لكل 512x512 في K = 8192 ولكن أرخص لكل رمز (بحثات كودكوب أصغر، كودك أبسط). المقياس الرئيسي: إعادة بناء PSNR عند 30.5 ديبل، تنافسية مع مساحة مستمرة التشويش المتواصلة في 32 ديبل.

للفيديو: رمز التوجيهية 3D VQ يرمز إصلاحًا فضائيًا زمنيًا (4x4x4 بكسلات) إلى رقم واحد كامل. clip 4s عند 8 FPS يحتوي على 32 إطارًا ؛ عند 256x256 مع تقليل 4x فضائيًا و 4x زمنيًا ، يبلغ عدد التوجيهيات (256/4) (256/4) (32/4) = 64 64 8 = 32,768 رمزًا.

جودة الـ Tokenizer هي السقف. مساهمة Emu3 هي جزئيا "لقد تدربنا على Tokenizer جيد جدا".

تدريبات خسارة واحدة

يستخدم Emu3 هدفًا واحدًا: التنبؤ بالرمز التالي على المفرد المشترك عبر رموز النص ، رموز الصورة 2D ، ورموز الفيديو 3D. يتم تضاعف الأوزان بالعوامل المحددة للطرق أثناء التدريب لتوازن المساهمة ، ولكن وظيفة الخسارة هي نفسها.

القطار على مزيج من:

  • صورة: <text caption> <image> image_tokens </image>
  • إدراك الصورة: <image> image_tokens </image> <question> text_tokens
  • فيديو جن: <text caption> <video> video_tokens </video>
  • تصور الفيديو: مماثل
  • النص فقط: NTP القياسية.

يتعلم النموذج متى ينبعث رموز الصورة مقابل رموز نصية من توزيع البيانات. يظهر الجيل من النموذج الذي يتوقع رموز الصورة بعد التسجيل.<image>-أجل

التوجيهات والدرجة الحرارة بدون تصنيف

تصنيف الصور السريعة يحصل على أفضل بكثير مع توجيه خالي من المصنف (CFG) عند الاستنتاج. يستخدم Emu3 ذلك: توليد مرتين ، مرة واحدة مع العنوان الكامل ، مرة واحدة مع عنوان فارغ ، مزج اللوجيتات مع وزن توجيه (معتاد 3.0-7.0).

درجة الحرارة مهمة جداً، الأثاث، منخفضة جداً، انهيار الوضع، درجة حرارة الموصى بها من Emu3 هي 1.0 للاستشعار، 0.8 لإنتاج الصور.

ثلاثة أدوار، نموذج واحد

سفن Emu3 على أنها ثلاث APIs متباينة وظيفيا ولكن مجموعة وزن واحدة أساسية:

  • إيمو 3 جنرال توليد الصور نص إدخال وصور إخراج
  • إيمو3-تشات. VQA والقسم الأسطواني. صورة إدخال (الرموز) ، نص الخروج.
  • Emu3-Stage2. إنتاج الفيديو و VQA الفيديو. إدخال النص أو الفيديو، النص أو الفيديو الخارجي.

لا توجد رؤوس محددة للمهمة، مجرد نماذج مختلفة للمساعدة، نفس نقطة التفتيش.

علامات الاستعراض

من ورقة Emu3 (سبتمبر 2024):

  • إنتاج الصور: يضرب SDXL على MJHQ-30K FID (5.4 مقابل 5.6) ، GenEval بشكل عام (0.54 مقابل 0.55 ربط إحصائي) ، و Deep-Eval المركب على المساواة.
  • ادراك الصورة: يتغلب على LLaVA-1.6 على VQAv2 (75.1 مقابل 72.4) وتطابق تقريبًا على MMMU.
  • إنتاج الفيديو: جودة المقطع في 4 ثوان في FVD التنافسية مع الطرازات المرجعية للعامة في عصر Sora.

الأرقام لا تفوز دائما Emu3 تداول نقطة هنا ل نقطة هناك ولكن الادعاء "التنبؤ التابع هو كل ما تحتاجه" يمكن الدفاع عنه عبر الطرق.

تكلفة الحساب

تم تدريب Emu3 على ~ 300 مليار رمز متعدد الحركات مع نموذج 7B. ساعات GPU مقارنة تقريبًا مع تدريب Llama-2-7B قبل التدريب (2k-4k GPU-سنوات على السيليكون من فئة A100). تم تدريب نماذج التوزيع مثل Stable Diffusion 3 في ميزانيات مماثلة ولكن تحتاج إلى مرموز نص منفصلة وأنابيب أنابيب أكثر تعقيدا.

عند الاستنتاج، Emu3 أبطأ من SDXL لكل صورة: 4096 رمزاً للصورة عند 30 tok/s = ~ 2 دقائق لكل صورة 512x512، مقابل 2-5 ثانية لـ SDXL. تنخفض التشفير المضاربة وتحسين الاحتفاظ بالخزنة KV الفجوة ولكن لا تغلقها.

لماذا يهم

مساهمة Emu3 العميقة مفهومية. إذا كانت مقياس التنبؤ التالي للتوقعات تتطابق مع التوزيع على إنتاج الصور، فإن مسار النموذج الموحد (خسارة واحدة، وعظمة واحدة، أي طريقة) قابل للحياة. لا تحتاج النماذج المستقبلية إلى مرموز نص منفصلين، وخطط التوزيع منفصلة، و VAEs منفصلة. محول واحد، tokenizer واحد لكل طريقة، مقياس.

تشو أو، يانوس برو، وإينترفيل يو جميعها تبني على هذه الدرجة أو تحدّها. المختبرات الصينية (BAAI، DeepSeek) تنشر بشكل أكثر عدوانية في هذا الاتجاه من المختبرات الأمريكية حتى عام 2025.

استخدمها

code/main.pyيُبني قطعتين من الألعاب:

  • آلة حساب إعداد الوهم 2D vs 3D VQ: معينة (القرار، اللمسة، طول المقطع، FPS) ، حساب إعداد الوهم لصور vs الفيديو.
  • عينة مصورة ذات الرمز التراجعي مع توجيه بدون تصنيف في درجة الحرارة.

تنفيذ CFG يطابق وصفة Emu3 مزيج من اللوجات المشروطة وغير المشروطة مع وزن توجيه.

أرسله

هذا الدرس يُنتجoutputs/skill-token-gen-cost-analyzer.md. بالنظر إلى مواصفات المنتج التوليد (الصورة أو الفيديو، والقرار المستهدف، مستوى الجودة، ميزانية التأخير) ، فإنه يحسب عدد الرموز، وتكلفة الاستنتاج، ويحدد Emu3 عائلة مقابل انتشار.

التمارين

  1. إنتاج Emu3 4096 رمزا لكل صورة 512x512 عند تقليل 8x8. احسب ما يعادل 1024x1024 و 2048x2048. ماذا يحدث لتخفيف الاستنتاج؟
  1. اقرأ Emu3 القسم 3.3 على رمز الفيديو. وصف شكل ملصق VQ 3D ولماذا هو 4x4x4 وليس 8x8x1.
  1. وزن التوجيه الخالي من التصنيف 5.0 مقابل 3.0: ما التأثير البصري؟ تتبع الرياضيات في code/main.py. . .
  1. قم بتحساب FLOP للتدريب على Emu3-7B عند 300B توكنات و قم بالمقارنة مع Diffusion 3 المستقر.
  1. يضرب Emu3 SDXL على FID ولكن ليس على VQAv2 مقابل VLMs المتخصصة. شرح لماذا يظهر نهج الخسارة الموحدة نقاط قوة مختلفة مقابل المتخصصين على مقاييس مختلفة.

الشروط الرئيسية

TermWhat people sayWhat it actually means
Next-token prediction"NTP"Standard autoregressive loss: predict token[i+1] given token[0..i]; works for every modality when tokenized
IBQ tokenizer"Inverse bottleneck quantizer"A class of VQ-VAE with larger codebooks (32768+) and better reconstruction than Chameleon's
3D VQ"Spatiotemporal quantizer"Codebook indexed by (time, row, col); one token covers a 4x4x4 pixel cube
Classifier-free guidance"CFG"Mix conditional and unconditional logits with weight gamma; boosts image quality at inference
Unified vocabulary"Shared tokens"Text + image + video all draw from the same integer space; model predicts whichever modality comes next
MJHQ-30K"Image gen benchmark"Midjourney-quality benchmark with 30k prompts; Emu3 reports FID here

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.