Phase 12: Multimodal AI

الدراسة الفنية: التدريب المشترك

كل VLM مفتوح قبل InternVL3 اتبع نفس وصفة ثلاث خطوات: تأخذ نص LLM تدرب على تريليونات رموز نصية، هذا يعمل ولكن لديه ديون التنظيم النص LLM قد أنفقت ميزانية قبل التدريب كاملة على النص النقي ولا يفهم بصرياً بطبيعة الحال. عندما تضيف الرؤية بعد المرحلة، يجب على ماجستير التدريس أن يدرك مرة أخرى كيفية ربط المدخلات البصرية مع معقلها النصي دون أن ينسى النص. يرفض InternVL3 (Zhu et al., أبريل 2025) النهج بعد التدريب: ركض واحد قبل التدريب، نص ومجموعة متعددة الطرق متداخلة من الخطوة الأولى. النتيجة تطابق مع جيميني 2.5 برو على MMMU-برو عند 78B المعلمات مفتوحة. هذا الدروس يقرأ قضية التدريب المسبق الأصلي وما يتغير عندما تقوم به.

Type: Learn

Languages: Python (stdlib, training-corpus mixer)

Prerequisites: Phase 12 · 05, Phase 12 · 07 (recipes)

Time: ~120 minutes

أهداف التعلم

  • شرح لماذا تتراكم تدريبات VLM بعد التدريب في المجال التنفيذي ديون التنظيم، باستخدام الأعراض الثلاثة القابلة للقياس (نسيان كارثي، تجرف الإجابة، عدم الاتساق بين النص البصري).
  • وصف مزيج الدراسات المسبقة للتدريب الأصلي لـ InternVL3 ولماذا يعتبر نسبة النص : متداخلة: أسطح مهمة.
  • مقارنة V2PE (تشفير الموقف البصري المتغير) مع Qwen2-VL M-RoPE.
  • أسمائ التنفيذات المكشوفة لتحديد البصر (ViR) و لغة الرؤية المفصلة (DvD).

المشكلة

التدريب بعد التدريب هو التعريف الافتراضي. LLaVA، BLIP-2, Qwen-VL، Idefics جميعها تأخذ ماجستيرًا في التدريبات القديمة (Llama، Vicuna، Qwen، Mistral) وتضيف الرؤية.

  1. التجميد LLM + التجميد مرموز الرؤية + المُرسلة قابلة للتدريب، تدرب على أزواج من الأسماء لتواء التوابل.
  2. إفراز ماجستير في التدريب، تدريب على بيانات التعليم (LLaVA-Instruct، ShareGPT4V).
  3. تحديد المهام الخاصة بشكل اختياري

ثلاثة أعراض للديون المتحالفة تظهر:

  • النسيان الكارثي، النسخة بعد التدريب النقدي تنسى مهارات النص فقط، النتيجة في GSM8K تنخفض بنسبة 5-10 نقطة، النتيجة في Hellaswag تنخفض، وكلاء النص النقي ينخفضون.
  • الجواب: التجريد. العبارات الصغيرة لنفس السؤال المرئي تحصل على إجابات مختلفة. رمز الرؤية يربط مع الجامعة مع روابط أضعف من رموز الجامعة نفسها.
  • عدم الاتساق بين النص والبصري. يمكن لـ VLM وصف صورة بشكل صحيح ثم الإجابة على سؤال يتناقض مع وصفها. لا تشارك الرموز البصرية في التحققات الداخلية للتوافق في LLM بنفس الطريقة التي يقوم بها النص.

هذه الأعراض موثقة جيداً، ويقوم قسم MM1.5 4 بتعريفها كمية، وتشير إزالة LLaVA-OneVision إليها.

المفهوم

التدريب المشترك المحلي

يتدرب InternVL3 من الصفر على جسم يتسم بالمتعدد الحركات الأصلية من الخطوة الأولى.

  • 40% من البيانات النصية فقط (FineWeb، Proof-Pile-2، إلخ)
  • 35% بيانات الصورة والنص المتداخلة (OBELICS، نمط MMC4)
  • 20% بيانات الترجمة الصورة المزدوجة
  • 5% بيانات فيديو نص

علامات الرؤية، علامات النص، والتفاعلات المتقاطعة المودال جميعها تشارك في نفس الخسارة من الخطوة الأولى التدريبي. لا وجود للتدريب المسبق، لا مرحلة تجميد المضرب، لا نسيان كارثي للتعافي من.

التدريب هو مرحلة واحدة للنموذج الأساسي. يتبع ضبط التعليمات، ولكن النموذج الأساسي يفهم بالفعل الرموز البصرية كمواطنين من الدرجة الأولى.

V2PE (تشفير الموقف البصري المتغير)

تستخدم Qwen2-VL M-RoPE مع تخصيص محور ثابت. Introduces InternVL3 V2PE: تشفير الموقف يختلف حسب نوع الطريقه (نص، صورة، فيديو) مع التوسع القابل للتعلم. في الممارسة العملية:

  • الـ "توكينات النص" تحصل على وضع 1D (مؤشر النص).
  • تصفح الصور تحصل على وضع 2D (خط، ثنائي).
  • الأطر الفيديو تحصل على وضع 3D (الوقت، الصف، الجدول).

يشارك الثلاثة نفس قاعدة ترددات روبي، ولكن تخصيص الغطاء الخفي لكل شريط هو مبرمج تعلم بدلا من الانقسام الثابت. الحرية في التبادل مع قرار ترددات زمنية مقابل فضائية أثناء التدريب.

دعوى V2PE عن التخلص: 1-2 نقطة على مقارنات الفيديو على M-RoPE في نفس الحساب. ليس ثورة، ولكن أكثر نظافة.

جهاز توجيه القرار البصري (ViR)

تحسين النشر. ليست جميع الصور بحاجة إلى تشفير القرار الكامل. تصويراً مع كائن واحد في التفاصيل المنخفضة ينفذ الرموز عند تشفيرها في 1280px الأصلي. ViR هو تصنيف صغير يتوقع الحد الأدنى من القرار اللازم للإجابة على السؤال ، قبل تشفير.

توجد ثلاث مستويات: القيود المنخفضة (256 رمزًا) ، والمتوسطة (576) ، والعالية (2048+). بالنسبة لـ 60% من الاستفسارات في حركة الإنتاج ، فإن القليل أو المتوسطة كافية. النتائج الصافية: 2-3x التوصيل عند نفس الجودة.

تنفيذ اللغة الرؤية المفصلة (DvD)

عندما تقوم بتقديم خدمة VLM كبيرة، يعمل مرموز الرؤية مرة واحدة لكل صورة ولكن LLM يعمل بشكل مستقل لكل رمز خروج. يحتوي المكونان على ضغوط زجاجة مختلفة (الرؤية = عرض النطاق ذاكرة GPU لـ conv + الاهتمام ؛ LLM = KV cache). تقسم DvDها إلى GPU منفصلة مع التدفق بينها.

بالنسبة لنموذج مرموز 8B + 400M ، يضاعف DvD تقريبًا معدل الإنتاج لكل عقد مقابل الموقع المشترك.

نوعية مرحلة واحدة مقابل متعددة المراحل

الدعوة المرجعية الرئيسية لل InternVL3: عند 78B، تطابق مع Gemini 2.5 Pro MMMU-Pro. عند 38B، تطابق مع GPT-4o. عند 8B، تقود قائمة المفتوحة-8B. كل ذلك على وصفة واحدة من قبل التدريب + التعليمات.

فرضية الالتزام بالتحديد قابلة للقياس: InternVL3-8B يفقد نقاط مقياس النص أقل (MMLU ، GSM8K) من Qwen2.5-VL-7B لكل وحدة من مكاسب المقياس الرؤية. النموذج هو أكثر من عامة لأن التدريب كان قطعة واحدة وليس اثنتين.

الدراسة الدراسية

يُقيم InternVL3.5 (أغسطس 2025) الوصفة. نفس النهج المحلي قبل التدريب، المزيد من البيانات، المزيد من المعلمات. تحسينات MMMU تدريجية.

يضيف InternVL-U (2026) إنتاج صورة من الجيل الموحد عبر رؤوس MMDiT فوق نفس العمود الفقري. تعني "U" "الفهم + الجيل،" مطاردة النماذج الموحدة في نمط التضخم (دروس 12.13). يدعم نفس العمود الفقري المحلي من قبل التدريب رؤوس الفهم والجيل.

التداول بين التدريبات السابقة للمواطنين

التدريب المسبق للأطفال الأصلي ليس مجاناً

  • الحساب. تدريب VLM الجديد من الصفر يكلف نفس تدريب LLM نص ملايين ساعات GPU. تعديل بعد الحاق يستخدم ثقيلة LLM الحالية، ويرخص معظم التكلفة.
  • البيانات. هيئة الصور والنص المتداخلة على نطاق نادرة. OBELICS هي 141 مليون وثيقة؛ MMC4 هي 571 مليون. النص وحده يُرسَل عند رموز 15T. النقص في البيانات المتعددة الحجم قبل التدريب هو قيود صعب.
  • إعادة استخدام الـLLM الأساسية. التدريب المسبق الأصلي يتخلى عن خيار تسليم الـLLM الجديد في وقت لاحق. بعد التدريب يسمح لك بتبادل Llama-3.1 لـ Llama-4 من خلال إعادة تدريب المعدل فقط.

الرهان الذي يقدمها InternVL3: ديون التنظيم أسوأ من خسارة إعادة الاستخدام. المؤشرات المرجعية تؤيد المطالبة. تكلفة الإنتاج تحظر المختبرات المستقبلية من النسخة الرخيصة. ستبقى VLMs بعد التنظيم قائمة لأنها تظل أرخص بالنسبة لمعظم المشاريع.

استخدمها

code/main.pyهو مزاج التدريب والمركز التجاري و محاكاة جهاز التوجيه ViR.

  • يأخذ مزيج من الجهاز المستهدف (% النص، % المتقاطع، % العنوان، % الفيديو) ويحسب الخطوات المتوقعة لكل طريقة.
  • يحاكي توجيه ViR على مجموعة من الاستفسارات (توزيع: 50% منخفض التفاصيل، 30% متوسط، 20% من التفاصيل العالية) ويعطي متوسط عدد الرموز.
  • تقرير تقديرات DvD المتوسط المقدمة عن المُرمّد مقابل FLOPs LLM.
  • يطبق جنبا إلى جنب مع التدريبات السابقة بعد الحركة مقابل التدريبات الأصلية في الحسابات والبيانات وأعراض الديون المتوقعة.

أرسله

هذا الدرس يُنتجoutputs/skill-native-vs-posthoc-auditor.md. في ضوء خطة تدريبية مقترحة لشركة التنمية الفنية، فإنها تقوم بمراجعة ما إذا كان يجب أن يكون محلياً أو بعد التنمية، وتحدد مخاطر التوصل إلى خطة الديون، وتوصي بمزيج كوربوس. استخدمها عند تحديد حجم مشروع جديد لشركة التنمية الفنية المفتوحة وتحتياجك إلى اختيار استراتيجية التدريب.

التمارين

  1. تقدير دلتا الحساب بين InternVL3-8B (مقبل التدريب الأصلي) و LLaVA-OneVision-7B (ما بعد التدريب). نسبة ساعات GPU تقريبًا؟ ما الذي يفسر الفجوة؟
  1. تقرير InternVL3 40% نص / 35% متداخل / 20% عنوان / 5% فيديو. إذا كانت مهمتك الهادفة ثقيلة فيديو، اقترح نسبة جديدة وتجادل لماذا ما زال النموذج الأساسي يحتاج إلى بيانات نصية ومؤلفة كبيرة.
  1. اقرأ MM1.5 القسم 4 حول النسيان. اسم المعيار الدقيق حيث أظهرت التدريب بعد التدريب الرجعي أكبر. كم تكلفة الرجعة؟
  1. يقوم ViR بتوجيه 60% من حركة المرور إلى تشفير القرارات المنخفضة. ما أنواع الأسئلة التي يضللها (يرسل إلى القرارات المنخفضة عندما تكون القرارات العالية مطلوبة) ؟ اقترح ثلاثة أوضاع فشل الجهاز التوجيه.
  1. تقسم DvD الرؤية و LLM إلى أجهزة GPU منفصلة. تحت أي نمط حركة المرور يؤذي DvD التوصيل بدلاً من المساعدة؟

الشروط الرئيسية

TermWhat people sayWhat it actually means
Native multimodal pretraining"From scratch together"Text + image + video tokens participate in the loss from step 1, not bolted on later
Alignment debt"Post-hoc penalty"Measurable regression in text skills and answer consistency that comes from bolting vision onto a frozen LLM
V2PE"Variable visual pos encoding"Per-modality learnable position encoding allocation; InternVL3's M-RoPE successor
ViR"Resolution router"Small classifier that picks minimum resolution needed per query before encoding, saving inference tokens
DvD"Decoupled deployment"Vision encoder on one GPU, LLM on another, with stream handoff; doubles throughput for large VLMs
InternVL-U"Unified understanding + generation"2026 follow-up that adds image-generation heads to the native-pretrain backbone
Interleaved corpus"OBELICS / MMC4"Documents with text and images in natural reading order; the raw material for native pretraining

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.