Phase 12: Multimodal AI

MIO و أي من أي التدفقات النماذج متعددة الحركات

يُرسل GPT-4o منتجًا لا يمكن أن تكرره العديد من النماذج المفتوحة: وكيلًا يسمع الصوت، يرى الفيديو، ويتحدث مرة أخرى في الوقت الحقيقي. وكانت الإجابة على النظام البيئي المفتوح بحلول أواخر عام 2024 MIO (وانغ وزملاؤه، سبتمبر 2024). تُرمز MIO النص والصورة والكلام والموسيقى، وتدرب محولًا سببيًا واحدًا على التسلسلات المتداخلة، وتولد أي طريقة لأي طريقة. أي جي بي تي (زان وزملاء ، فبراير 2024) كان دليل على المفهوم ؛ MIO هو التوسع ؛ Unified-IO 2 (ألن AI ، ديسمبر 2023) هو ابن عم مع رؤية + العمل الأرض. هذه الدروس تقرأ نمط أي إلى أي أربعة tokenizers، محول واحد، التشريح التدفقية.

Type: Learn

Languages: Python (stdlib, four-modality token allocator + streaming decode loop)

Prerequisites: Phase 12 · 11 (Chameleon), Phase 6 (Speech and Audio)

Time: ~120 minutes

أهداف التعلم

  • صمم مجموعة من الكلمات المشتركة التي تستضيف نص، الصورة، الخطاب، والموسيقى دون اصطدام.
  • مقارنة SEED- Tokenizer (الصور) و SpeechTokenizer بقية- VQ (الحديث) على ضغط + إعادة الإعمار التداول.
  • شرح المنهج الدراسي الذي يتكون من أربع مراحل يُنشئ أيّ جيل إلى أيّ جيل.
  • أسمائ الوصفات الثلاثة المفتوحة لأي شخص و التنازلات الرئيسية بينها: MIO، AnyGPT، Unified-IO 2.

المشكلة

نموذج متعدد الطرق موحد سهل المطالبة وصعب بناءه على نطاق واسع. تم تشكيل معظم أنظمة "أي شخص إلى أي شخص" حتى عام 2024: نموذج الرؤية → تمثيل النص → نموذج الكلام → صوت. كل طرفة تفقد المعلومات، ويزيد من التأخير، وتعقد التدريب. أظهر فيديو تجريبي GPT-4o بديل نموذج واحد مع استجابة ثانوية؛ أنظمة مفتوحة تتبعه بأشهر.

التحديات الهندسية:

  • يجب أن توكنيزر موجودة لكل طريقة، ويقمع دون خسائر - بما فيه الكفاية لإعادة الإعمار، وإنتاج توكنات بمعدلات يمكن أن يستهلكها المحول.
  • يجب أن تخصص المفردات الفردية مساحة للنص (32k+) والصورة (16k+) والكلام (4k+) والموسيقى (8k+).
  • يجب أن تغطي بيانات التدريب كل زوج من المدخلات والخروج (نص→صورة، صورة→حديث، خطاب→صورة، إلخ.) أو يجب أن يكوّن النموذج.
  • يجب أن تدفق إشارات الإخراج بسرعة كافية للتخفيف المفاوضي (<500ms وقت إلى أول بايت صوتي).

المفهوم

أربعة توكيينز ل أربعة طرق

كومة الـ "MIO" للـ "tokenizer stack":

  • النص: BPE القياسية، الكلمة ~32000.
  • صورة: SEED-Tokenizer (2023) VAE المعدني مع كتاب رمز منفصل، 4096 إدخال، 32x32 رموز لكل صورة.
  • الخطاب: SpeechTokenizer residual-VQ (2023) يرمز شكل موجة 16kHz إلى 8 كتب رمزية رتبة؛ المستوى الأول هو المحتوى الخام، والستويات اللاحقة تضيف البروسودي والهوية المتحدث.
  • الموسيقى: بقايا مشابهة-VQ (عائلة Meta MusicGen / Encodec) ، 4-8 كتب رمزية.

كل طريقة تنتج رموز كاملة. تمتلك الرموز نطاقات هوية منفصلة في المفرد المشترك:

text:   0..31999
image:  32000..36095  (4096 image tokens)
speech: 36096..40191  (4096 speech base tokens, plus residual layers)
music:  40192..48383  (8192 music tokens)
sep:    48384..48390  (<image>, <speech>, <music>, </...>, etc.)

إجمالي: ~ 48k المفردات. إدخال إدخال وتقديم الإخراج يمتد كل ذلك.

إفصاح التدفق

إن توليد الكلام يستخدم VQ المتبقية. يتوقع المحول رموز الكلام القاعدة (طبقة 0) ؛ يقوم الكميس المزدوج المتوازي بتنبؤ بالطبقات اللاحقة. كل رموز طبقة 0 حوالي 50ms من الصوت عند 16kHz.

نمط التدفق:

  1. يتحدث المستخدم إلى الميكروفون؛ إصدار رمز الصوت في الوقت الحقيقي رموز الكلام كل 50ms.
  2. يستهلك MIO الرموز أثناء وصولها (مواصلة التميز + تقدم متزايد).
  3. تسريق رموز الخروج كما تم إنشاؤها؛ قناع الكلام المتوازي يحولها إلى عينات صوتية مع تأخر ~ 50-150ms.
  4. وقت إلى أول بايت صوتي: ~ 300-500ms في ورقة MIO ، يقترب من ~ 250ms GPT-4o.

ميني-أومني (arXiv:2408.16725) ، GLM-4-صوت (arXiv:2412.02612) ، وموشي (arXiv:2410.00037) هي تصاميم تلفظية متكاملة لتدفق الهاتف.

المناهج الدراسية في أربع مراحل

برنامج تدريب المعهد:

  1. المرحلة 1 التنحين. جُزْء من الجُزْء النمطي على نطاق واسع: الصورة النصية، الخطاب النصي، الموسيقى النصية. كل زوج يستخدم قطاع له من المفردات التجريبية. تدرب المفردات المشتركة.
  2. المرحلة 2 متداخلة. وثائق متعددة الطرق متداخلة (مدونات مع الصور + الفيديو، البودكاستات مع النصوص، إلخ.).
  3. المرحلة 3 تحسين الكلام. بيانات صوتية إضافية لرفع جودة الكلام دون فقدان القدرة على النص.
  4. المرحلة 4 SFT. التنسيق التعليمي عبر الطرق: VQA، الترجمة، التروي، الحوار من الكلام إلى الكلام.

إن غياب مرحلة يقلل من القدرات المحددة: تخطي المرحلة 2 والنموذج يفقد السياق المتبادل؛ تخطي المرحلة 3 والخطاب ضعيف.

سلسلة الفكر البصري

يقدم MIO سلسلة التفكير البصري: يقوم النموذج بإصدار رموز الصورة المتوسطة كخطوة للتفكير.

  1. الإصدارات<image>الوهمات التي تعطي المشهد (من الصورة المدخلة أو الرسم).
  2. يُصدر رسالة تحليل الرسم
  3. يُصدّر الإجابة النهائية.

الصورة المتوسطة المقدمة تعمل كمسحوق. تحسن علامات التقييم في مهام التفكير الفضائي. تعكس الفكرة سلسلة التفكير للتفكير في النص.

المنافسين في أي من أي

  • أيGPT (arXiv:2402.12226): 4 طرق (نص، صورة، خطاب، موسيقى) ، تصميم مماثل.
  • إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضافة إضضضضضضضضضضضضضضضضضضضضضض
  • NExT-GPT (arXiv:2309.05519): LLM + مُشفرات انتشار محددة في الطراز. ليس نهجًا نموذجًا واحدًا.
  • كودى (arXiv:2305.11846): انتشار قابل للتكوين؛ أي إلى أي عبر غامض مشترك.

MIO هو أقرب إلى أي رمز من أي شيء. AnyGPT هو أسلافه المفاهيمية.

ميزانية التأخير

بالنسبة لمنتج محادثات، تأخر كل مكون مهم:

  • ميكروفون إلى رموز الصوت: ~ 50ms.
  • إعداد مسبق (الرموز الصوتية + التاريخ): ~ 100ms على نموذج 8B.
  • أول رمز خروج: ~ 50ms.
  • المُعَدِّد الصوت المتوازي المتبقي-VQ +: ~ 100-150ms.

إجمالي الوقت إلى أول بايت صوتي: ~ 300ms أدنى. GPT-4o تدعي ~ 250ms. Moshi تدعي 160ms. MIO / AnyGPT في نطاق 400-600ms لكل مقارنات عامة.

لماذا أي شخص يبقى صعب

حتى في عام 2026، ستجد نماذج مفتوحة من أي نموذج تتبع تلك المغلقة على محورين:

  • جودة الكلام. الـ VQ المتبقية هي خاسرة؛ الكلام المحادث يبدوا روبوتيا مقارنة بصوتات فئة ElevenLabs.
  • التفكير عبر الطرق: سؤال النموذج "غناء عن ما ترى" لا يزال يفشل أكثر من مهام الرؤية البحتة.

هذه مشاكل بحث مفتوحة. Qwen3-Omni (دراسة 12.20) هي المحاولة المفتوحة الأكثر تقدما في عام 2025.

استخدمها

code/main.py:

  • يحدد تخصيص المفردات من أربع طرق ويقوم بطبعها.
  • توجيه قائمة المدخلات المتعددة الطرق (النص، الصورة، المقطع الصوتي، الموسيقى) من خلال جهاز توجيه الجهاز.
  • يحاكي تشكيل التشغيل لتردد النص إلى الكلام مع حساب التأخير.
  • يحسب الوقت المتوقع من أول بايت صوتي مع إعطاء التخفيفات في تشفير، والإعدادات المسبقة، وقطع الكتب.

أرسله

هذا الدرس يُنتجoutputs/skill-any-to-any-pipeline-auditor.md. بالنظر إلى مواصفات المنتج المحادثة (الطرق في، والطرق خارج، والهدف التأخير) ، فإنه يراجع خيارات تصميم عائلة MIO ويحسب ميزانية التأخير.

التمارين

  1. إن منتجك يقبل إدخال الكلام ويرد إخراج الكلام ما هو هدف ميزانية التأخير من نهاية إلى نهاية؟ قم بإدراج المكونات التي تستغرق الوقت.
  1. يتستخدم SpeechTokenizer residual-VQ 8 كتب رمزية. اقترح لماذا يتم تشفير المستويات المتبقية بالتوازي (على نحو متسلسل) وما هي التوفيرات المتأخرة التي تجلبها.
  1. قاموسك لديه 32K نص + 4K صورة + 4K خطاب. أضف 8K الموسيقى و ~ 10 مفصلين. ما هو تكلفة معايير المصفوفة التضمين في مخفي dim 4096؟
  1. سلسلة الفكر البصري تنشر صورة متوسطة. ما هي أنواع الأسئلة التي تستفيد؟ ما هي الأنواع التي تؤذي من قبل الرموز الإضافية؟
  1. اقرأ موشي (arXiv:2410.00037). وصف تقنيتها "الوحيدة الداخلية" ومقارنة سلسلة الفكر البصري في MIO.

الشروط الرئيسية

TermWhat people sayWhat it actually means
Any-to-any"Multimodal in/out"A single model that accepts and emits text, image, speech, and music in any direction
Residual-VQ"Speech tokenizer stack"Multi-codebook tokenization where each layer adds information; base layer is content, later layers are prosody
SEED-Tokenizer"Image codes"Discrete image tokenizer with 4096-entry codebook used by MIO
Chain-of-visual-thought"Visual scratchpad"The model generates an intermediate image as a reasoning step before its final answer
Time-to-first-audio-byte"TTFAB"Latency from user voice to first audio output; <500ms for conversational feel
Four-stage curriculum"Training recipe"Alignment -> interleaved -> speech-enhanced -> SFT, in that order

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.