Phase 12: Multimodal AI

LLaVA-OneVision: صورة واحدة، صورة متعددة، فيديو في نموذج واحد

قبل LLaVA-OneVision (Li et al., أغسطس 2024) كان عالم VLM المفتوح ذو نسب منفصلة: LLaVA-1.5 للصور الفردية، نماذج متعددة الصور مثل Mantis و VILA، نماذج الفيديو مثل Video-LLaVA و Video-LLaMA. كل واحد فاز بمعاييره و فشل في الآخرين جادلت LLaVA-OneVision بأن منهج واحد يمكن تدريب نموذج واحد على السيطرة على السيناريوهات الثلاثة، وأن تأثيرات نقل المهام الناشئة (مهارات الصورة الواحدة المصدرة إلى الفيديو، التفكير متعدد الصور المصدرة إلى الصورة الواحدة) تفوق مجموع المتخصصين. الوصفة بسيطة بشكل مخادع: ميزانية رمزية بصرية تبقى ثابتة عبر السيناريوهات، بالإضافة إلى منهج نصائي صريح ينتقل من صورة واحدة إلى OneVision (متعددة الصور) إلى الفيديو. هذا الدروس يقرأ الميزانية، المناهج الدراسية، والسلوكيات الناشئة.

Type: Build

Languages: Python (stdlib, token budget solver + curriculum planner)

Prerequisites: Phase 12 · 05 (LLaVA), Phase 12 · 06 (any-resolution)

Time: ~180 minutes

أهداف التعلم

  • تصميم ميزانية رمزية بصرية تحافظ على ثابتة عبر مدخلات الصورة الواحدة والصورة المتعددة والفيديو.
  • طلب منهج تدريب ينقل المهارات من صورة واحدة إلى الفيديو دون أن تنسى كارثيا.
  • شرح لماذا نموذج واحد يفوق المتخصصين في نفس العدد من المعايير عندما يتم إعداد المناهج الدراسية بشكل صحيح.
  • أسمائ القدرات الناشئة الثلاثة التي ذكرتها LLaVA-OneVision: التفكير متعدد الكاميرات، تحفيز مجموعة من العلامات، وكيل تصوير الشاشة لـ iPhone.

المشكلة

الصورة والصور المتعددة والفيديو كل منها يضغط على نموذج مختلف.

الصورة الواحدة تحتاج إلى رموز عالية الدقة (AnyRes، ~ 2880 رموز بصرية) لالتقاط OCR والتفاصيل الدقيقة. ميزانية لكل عينة: صورة واحدة، 2880 رمزا.

تريد الصور المتعددة عدة صور بمقارنة الدقة (~ 576 رمزاً لكل منها) لذلك يتناسب التفكير عبر الصور في السياق. ميزانية لكل عينة: 4-8 صور ، 576 رمزاً لكل منها ، 2300-4600 رمزاً.

ويريد الفيديو العديد من الإطارات بمقارنة منخفضة (~ 196 رمزا لكل إطار بعد جمعها) لالتقاط الديناميكيات الزمنية. ميزانية لكل عينة: 8-32 إطار، 196 لكل، 1600-6200 رمزا.

إذا كنت تدرب على نماذج منفصلة، تختار ميزانية واحدة. إذا كنت تدرب على نموذج واحد، تحتاج إلى ميزانية لتتناسب معقولة عبر السيناريوهات دون أن تنفجر السياق.

قبل OneVision ، كانت الإجابة الافتراضية "تدريب سيناريو واحد ، تجاهل الآخرين". قام Video-LLaVA بتعديل الفيديو على نموذج صورة مع مراحل تدريب إضافية. أضاف LLaVA-NeXT دعم متعدد الصور مع التبليط. لم يتعامل أحد مع الثلاثة نظيفة.

المفهوم

ميزانية رمزية OneVision

تختار LLaVA-OneVision ميزانية موحدة للبرمجة المرئية من حوالي 3000-4000 برمجة لكل عينة، يتم تخصيصها بشكل مختلف لكل سيناريو:

  • صورة واحدة: AnyRes-9 (3x3 طلاء + تمنيال) ، كل طلاء في 384 مع 729 ملصق ، تجمع ثنائي خطي عدواني 2x2 → 182 لكل طلاء. إجمالي: 9 * 182 + 182 = 1820 رمزا. أو AnyRes-4 في 729- لكل طلاء = 2916 + 729.
  • صورة متعددة: كل صورة بمقارنة الدقة (384، لا توزيع) ، 729 رمزا دون جمع. ميزانية 6 صور → 4374 رمزا.
  • الفيديو: 32 إطارًا بمقرر 384 مع مجموعة ثنائية خطية 3x3 عدوانية → 81 رمزاً لكل إطار. إجمالي: 32 * 81 = 2592 رمزاً.

الحصص الحافظة على مجموعات الوهم ثابتة تقريبًا. لا يرى LLM أبداً مجموعة تفجر سياقها. إن المُرمز ينتج هندسة مختلفة لكل سيناريو، ولكن LLM يستهلك نفس الميزانية.

المناهج الدراسية الثلاثة مراحل

القطارات LLaVA-OneVision في ثلاث مراحل:

  1. صورة واحدة SFT (مرحلة SI). جميع البيانات صورة واحدة زائد نص. تدريب على دخول AnyRes عالية القرار. هذا يعلم الإدراك، OCR، والفهم الدقيق. يستخدم بيانات LLaVA-NeXT بالإضافة إلى بيانات صورة واحدة محددة لOneVision.
  2. OneVision SFT (مرحلة OV). مزج صورة واحدة + صورة متعددة + فيديو (إطارات عينات موحدة). تدريب على ميزانية رمز موحدة. هذا يعلم النموذج التعامل مع أشكال دفعات متفرقة. لا يوجد إعادة تعيين وزن مستمرة من المرحلة SI.
  3. نقل المهام (مرحلة TT). استمر في مزيج المهام المستهدفة، عادةً ما يكون أكثر ثقافة على الصور أو الفيديو المتعددة اعتماداً على المنتج. تحسينات اخيارية للتنفيذ.

الحرج: ترتيب المناهج مهمة. تدريب الفيديو أولا أو صورة متعددة أولا ينتج أداء صورة أسوأ من صورة واحدة أولا، حتى مع نفس البيانات.

لماذا يعمل المنهج الدراسي

تدريب الصورة الواحدة يبني القاعدة الإدراكية. تحمل رموز الباتش ميزات بصرية دقيقة؛ يتعلم ماجستير في التدريب الجامعي دمجها مع النص. تعرض الصورة المتعددة والفيديو للتحديات الهيكلية (ما هي الصورة ، ما حدث أولاً) التي يصعب تعلمها دون قاعدة إدراكية قوية.

إذا تم تدريب جميع السيناريوهات من الصفر معاً، فإن النموذج لا يتناسب مع التصور (بيانات صورة واحدة محدودة لكل دفعة) وتركيب أكثر من اللازم (كثير من بيانات متعدد الصور / الفيديو). النتيجة: نموذج يتبع أنماط التفكير عبر الصورة ولكن هو سطحي بصريًا.

ترتيب المناهج يعطيك قوة الإدراك من المرحلة SI، ثم التفكير التركيبي/الزمني من المرحلة OV، دون فقدان أي منهما.

مهارات متناظرة للسيناريوهات

ورقة LLaVA-OneVision تقرير ثلاثة قدرات ناشئة:

  1. التفكير متعدد الكاميرات. تدرب على صور متعددة + فيديو بشكل منفصل؛ عند الاستنتاج ، طلب من التفكير حول مشهد قيادة متعدد الكاميرات. يدمج النموذج وجهات النظر بشكل صحيح على الرغم من عدم رؤية هذا النموذج الدقيق في التدريب.
  2. تحذير مجموعة من العلامات. يلاحظ المستخدم الأشياء في الصورة مع علامات رقمية؛ ويعبر النموذج عن "ما الذي يفعله علامة 3 بالنسبة إلى علامة 7." تم تدريبها على لا علامات ولا ملاحظات؛ تعلم من مزيج من التأريض المكاني + مرجع الصورة المتعددة.
  3. وكيل تصوير الشاشة من جهاز iPhone. يوفر المستخدم صورة شاشة من شاشة iPhone وطلب من الخطة النقر التالي. تدرب على صور الشاشة من واجهة المستخدم، فيديو من سير العمل المستخدم، ومتعدد الصور قبل / بعد أزواج. يجميع إلى حالة استخدام وكيل.

هذه ليست مهام تدريبية؛ إنها تنبع من الهيكل التكويني للبرنامج الدراسي.

تجمع رموز بصرية

يتطلب ميزانية الوهم المشترك. تستخدم OneVision التقاطع المزدوج على شبكة المفاتيح 2D: 24 × 24 = 576 ملصق يصبح 12 × 12 = 144 (2x عامل) أو 8 × 8 = 64 (3x عامل). يتم التقاطع المشترك في مساحة الشبكة المشتركة ، وليس مساحة الوهم ، للحفاظ على الموقع.

اختيار عامل التجميع لكل سيناريو هو نفسه مُعيار خارجي. أقل تجميع = المزيد من الرموز = تمثيل أكثر غنى. أكثر تجميع = أقل رموز = أكثر إطارات / صور تناسب.

LLaVA-OneVision-1.5

تمت إعدادات التتابع 2025 (LLaVA-OneVision-1.5, arXiv 2509.23661) "مفتوحة بالكامل" في بيانات التدريب وزرات النموذج والرقم. يطابق الفجوة الملكية على بعض المعايير ويديمقراطية الوصفة. نفس المناهج الدراسية، المزيد من البيانات، أفضل قاعدة LLM. لا تغيير في الهندسة المعمارية.

التناقض مع Qwen2.5VL

Qwen2.5-VL (دروس 12.09) يختار مختلفة. يستخدم M-RoPE و FPS الديناميكي بدلاً من التجميع الثابت. يستخدم ميزاناته الميزانية مع المدخل فيديو لمدة دقيقة واحدة أكثر من فيديو لمدة 5 ثوان. يصلح LLaVA-OneVision الميزانية ويقياس التجميع. يعمل كلاهما؛ فإنهما يتبادلان التكوين مقابل التنبؤ.

استخدمها

code/main.pyهو خطة دراسية ومخطط ميزانية لـ VLM على نمط OneVision. بالنظر إلى ميزانية رمزية لكل عينة ومزيج سيناريوهات هدفي (قول 40% صورة واحدة، 30% صورة متعددة، 30% فيديو):

  • يخصص القرار، عامل التجميع، والإطار لكل سيناريو.
  • تحقق من ان كل سيناريو يناسب الميزانية المشتركة
  • تقارير عدد الوهام المتوقعة، وخطوط التخطيط المشترك، والسيناريوهات التي هي أقل من الوهام.
  • يطبخ جدول تدريبات مرحلة بعد مرحلة

استخدمها للتخطيط لمكافحة OneVision أو للتحقق من الصحة العقلية تكلفة تنفيذ VLM لكل طلب

أرسله

هذا الدرس يُنتجoutputs/skill-onevision-budget-planner.md. بالنظر إلى توزيع المهام المستهدفة وميزانية لكل عينة، فإنه يُصدِّر عامل AnyRes، وتجميع لكل إطار، وعدد الإطار الفيديو، وزيادة مراحل المناهج الدراسية. استخدم هذا كلما تدربت أو قمت بتحسين سيناريو VLM موحد.

التمارين

  1. إن منتجك يدعم 80% صورة واحدة، 10% صورة متعددة (2-4 صور) ، 10% فيديو (8-16 إطار). تصميم ميزانية الرمز. أين ستضع الميزانية الإضافية التي توفرها من عدم القيام بالصور متعددة ثقيلة؟
  1. اقرأ قسم LLaVA-OneVision 4.3 (قدرات الناشئة). اقترح مهارة جديدة رابعة من المحتمل أن يتم فتحها في المناهج الدراسية ولكن الصحيفة لم تقرر.
  1. تغيير ترتيب المناهج الدراسية التدريب على الصورة المتعددة أولاً ، ثم الصورة الواحدة ، ثم الفيديو. توقع أي معايير الاستعمار تتدهور ولماذا.
  1. تقرير تقرير المراجع الفيديو تدرب على 8 إطارات فقط لكل عينة. هل هذا يجميع إلى 30 ثانية فيديو عند الاستنتاج؟ ما الذي يكسر أولا ميزانية رمزية أو التفكير الزمني؟
  1. تجمع ثنائي خط من 24 × 24 المفاتيح إلى 12 × 12 هو خفض 4 × لكل dim. تنفيذ تجمع في stdlib Python وتحقق من أن المتوسط على كل كتلة 2 × 2 يطابق الخروج الثنائي.

الشروط الرئيسية

TermWhat people sayWhat it actually means
OneVision scenario"Single-image, multi-image, or video"One of three input shapes the unified VLM handles; the budget stays constant across
Token budget"How many tokens per sample"Total visual tokens the LLM sees per training / inference sample, typically 3000-4000
Curriculum"Training order"Stage ordering (single-image → multi-image → video) chosen for emergent transfer
Bilinear pooling"Token shrink"Applying bilinear interpolation to the patch grid (2D) to reduce token count while preserving locality
Emergent skill"Not trained, still works"Capability that appears at inference without matching training data, due to curriculum composition
AnyRes-k"k-tile setup"k sub-tiles of fixed resolution plus one thumbnail, typical k ∈ {4, 9}
Task transfer"Cross-scenario generalization"Skills learned on single-image that apply to video (and vice versa) via shared backbone

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.