Phase 12: Multimodal AI

وصفات VLM مفتوحة الوزن: ما يهم في الواقع

الأدب المفتوح للوزن VLM 2024-2026 هو غابة من جداول التخلص. اختبر MM1 من شركة آبل 13 مزيج من مرموز الصورة والاتصال ومزيج البيانات. أثبتت "مولمو" من "آلن إيه آي" أنّ الرسوم البشرية المفصلة تفوق عملية تصفية "جي بي تي - 4 في". قام كامبريان-1 بمقارنة أكثر من 20 مرموز أعلنت Idefics2 مساحة التصميم الخمسة المحاور. مقارنة VLMs Prismatic 27 وصفات التدريب على مقياس مقيّد. من كل هذا الضجيج، مجموعة صغيرة من النتائج تستمر على الورق: رمز الصورة مهم أكثر من بنية الصلة، خليط البيانات مهم أكثر من أي من، والقوائم البشرية المفصلة تفوق البيانات الاصطناعية المقطوعة. هذا الدرس يقرأ تلك الجداول حتى لا تضطر إلى ذلك.

Type: Learn + lab

Languages: Python (stdlib, ablation table parser + recipe picker)

Prerequisites: Phase 12 · 05 (LLaVA baseline)

Time: ~180 minutes

أهداف التعلم

  • أسمائ مساحة تصميم VLM الخمسة المحاور: مرموز الصورة، المتصل، LLM، مزيج البيانات، جدول القرار.
  • اقرأ جدول إزالة MM1 / Idefics2 / Cambrian-1 وتنبؤ بأي كحاف تحرك مقياس معين.
  • اختر وصفة (مؤشر، وصل، بيانات، قرار) لـ VLM الجديد مع ميزانية الحساب ومزيج المهام.
  • شرح لماذا التسجيلات البشرية المفصلة تفوق عملية التقطير GPT-4V في نفس العدد.

المشكلة

هناك مئات من أجهزة VLM مفتوحة الوزن. معظم الفجوة بين "جيد" و "أحدث" ليست الهندسة المعمارية. إنها البيانات، وتخطيط القرار، واختيار الممثل. معرفة أي زر يجب أن تلتفت أولاً عندما يكون نموذجك ضعيف الأداء يوفّر لك خطأ 5 ملايين ساعة من GPU.

الموجة 2023 (LLaVA-1.5 ، InstructBLIP ، MiniGPT-4) أجريت على زوج من التدريبات السابقة + LLaVA-Instruct-150k. خط أساسي جيد. تجاوزت حول MMMU 35٪.

امتدت موجة 2024 (MM1 ، Idefics2 ، Molmo ، Cambrian-1 ، Prismatic VLMs) إزالة شاملة. كانت النتائج مفاجئة وعملية.

المفهوم

مساحة التصميم الخمسة المحاور

أطلق على Idefics2 (Laurençon et al., 2024) أسماء المحاور:

  1. مُرمّع الصور. CLIP ViT-L/14, SigLIP SO400m/14, DINOv2 ViT-g/14, InternViT-6B. يختلف المُرمّع في حجم اللصوص، والقرار، والهدف المسبق للتدريب.
  2. الوصول إلى المصلحة: MLP (2-4 طبقات) ، Q-Former (32 استفسار + التقاطع-attn) ، Perceiver Resampler (64 استفسار) ، C-Abstractor (التجميع المتطور + المزدوج.
  3. نموذج اللغة. Llama-3 8B / 70B، Mistral 7B، Phi-3، Gemma-2، Qwen2.5. حجم LLM هو الميزة المهيمنة.
  4. بيانات التدريب: أزواج العنوان (CC3M، LAION) ، المتداخلة (OBELICS، MMC4), التعليم (LLaVA-Instruct، ShareGPT4V، PixMo، Cauldron).
  5. جدول القرارات ثابت 224/336/448، أيريس، ديناميكي محلي، راميدر أثناء التدريب أو ثابت

كل إنتاج VLM يختار على كل محور. معظم التباين في درجات MMMU يتم تفسيرها من خلال المحورات 1 ، 4 و 5 وليس من خلال أي رابط اخترت.

المحور 1: مرموز > وصل

MM1 أظهر القسم 3.2: إعادة التبادل من CLIP ViT-L/14 إلى SigLIP SO400m/14 أضاف 3 نقاط MMMU. إعادة التبادل من MLP إلى جهاز استنتاج إعادة تقديم نموذج أضاف أقل من 1 نقطة. تم تكرار الأفكار 2: SigLIP > CLIP، Q-Former ≈ MLP ≈ مستنتاج عند نفس العدد.

قام كامبريان-1 "مطابقة مبرمجيات الرؤية الكامبريانية" (تونغ وغيره ، 2024) بتشغيل 20 + مرمجيًا على مقياس مركز على الرؤية (CV-Bench). أعلى قائمة اللائحة هو مزيج من DINOv2 و SigLIP. CLIP في منتصف الحزمة. ImageBind و ViT-MAE أقل. الفجوة من CLIP ViT-L إلى DINOv2 ViT-g/14 هي ~ 5-7 نقاط على CV-Bench.

إن مُشفّر افتراضي 2026 للسيارات الفنية المفتوحة هو SigLIP 2 SO400m/14 للميزات الترجمية + الكثافة، أحياناً يُقَترن مع ميزات DINOv2 ViT-g/14 (يُفعل ذلك "مجموعة الرؤية الفضائية" كامبريان).

المحور 2: تصميم الدخول هو غسيل

وصل MM1، Idefics2، Prismatic، وMM-Interleaved جميعا إلى نفس الاستنتاج: عند عدد مؤقت من الرموز البصرية، لا يهم بناء الصلة بالكاد. يعمل MLP ذو 2 طبقات على اللقطات المتوسطة في نطاق نقطة واحدة من Q-Former الذي يطلب 32 سؤالًا بنفس ميزانية الرموز.

ما يهم هو عدد الرموز. المزيد من الرموز البصرية = حسابات LLM = أداء أفضل حتى نقطة ، ثم انخفاض العائدات. 64 رمزا لكل صورة هو قليل جدا ل OCR. 576-1024 رمزا هو نقطة حلوة لمعظم VLMs مفتوحة. 2048 + يساعد فقط للوثائق والخطط.

Q-Former vs MLP هو سؤال تكلفة ، وليس سؤال جودة: Q-Former يحدد الرموز عند 32-64 بغض النظر عن قرار الصورة ؛ MLP ينبعث من جميع الرموز المزقة. بالنسبة إلى مدخلات عالية الوضوح ، Q-Former يحتفظ بمناطق LLM ؛ بالنسبة إلى القرارات المنخفضة ، فإن الفرق هو الضوضاء.

المحور الثالث: حجم LLM يحدد السقف

تضاعف ماجستير في العلوم من 7B إلى 13B يضيف بثقة 2-4 نقاط على MMMU في كل ورقة VLM. في 70B تشبث معظم المعايير. سقف التفكير متعدد الطرق في VLM هو سقف التفكير النصي في LLM يمكن للمؤلفة المرئية فقط تغذيتها ، وليس السبب لها.

هذا هو السبب في أن Qwen2.5VL-72B وClaude Opus 4.7 يضربون MMMU-Pro و ScreenSpot-Pro: الدماغ اللغوي هائل. لا يمكن أن يستبدل 7B VLM 70B VLM من خلال تصميم وصل ذكي.

المحور 4: البيانات التفاصيل البشرية ضرب التقطير

مولمو + بيكسمو (ديتك وزملاء 2024) هو النتيجة 2024 التي يجب أن يقرأها الجميع. كان لدى آلن AI الملاحظين البشريين وصف الصور في 1-3 دقيقة كثيفة من الخطاب إلى النص ، مما أدى إلى 712K صوراً مكتوبة تحت العنوان. لا يوجد نزيف GPT-4V في أي مكان في بيانات التدريب.

فاز مولمو-72B بـ Llama-3.2-90B-Vision على 11 من 11 مقياسًا. ليست الدلتا هي الهندسة المعمارية إنها جودة الترجمة. تحتوي الرسوم البشرية التفصيلية على 5-10 مرات من المعلومات لكل صورة من الرسوم البشرية القصيرة وتبقى على أرض الواقع حيث تتلوي الهلوسة من التقطير GPT-4V.

تبع ShareGPT4V (Chen et al., 2023) و Cauldron (Idefics2) نفس الكتاب الموسيقي مع مخلوطات من البشر + GPT-4V. الاتجاه واضح: بالنسبة إلى الحدود 2026، كثافة الرسوم > كمية الرسوم > سهولة التطهير.

المحور 5: القرار و جدول أعماله

إضافة: 384 -> 448 يضيف 1-2 نقاط. 448 -> 980 مع تقسيم الصورة (AnyRes) يضيف 3-5 أخرى على مقاييس OCR. مرتفعات تدريب القرارات السطحية بدقة متوسطة.

قام كامبريان 1 بتداول القرار مقابل الرموز: عند الحساب الثابت ، يمكنك الحصول على المزيد من الرموز عند القرار المنخفض أو أقل الرموز عند القرار الأعلى. يفوز القرار الأعلى لـ OCR ؛ يفوز أقل القرار مع المزيد من الرموز لفهم المشهد العام.

وصفة الإنتاج 2026: القطار المرحلة 1 عند 384 ثابتة، المرحلة 2 مع ارتفاع الديناميكي إلى 1280 للمهام الثقيلة OCR.

المقارنة المتحكم بها من Prismatic

قراءة القواعد القياسية (Karamcheti et al., 2024) هي الورقة التي تحكم جميع المحاور. نفس 13B LLM ، نفس بيانات التعليم ، نفس التقييم يتغير محور واحد فقط في وقت واحد. النتائج:

  • عدد الرمز البصري لكل صورة يفسر ~ 60% من التباين.
  • اختيار المُشفّر يفسر ~20%.
  • معمارة الاتصال تفسر ~ 5٪.
  • كل شيء آخر (مزيج البيانات، المخطط، LR) الباقي ~15٪.

هذا تفكيك قاسي، لكنه أجوبة أكثر نظافة على "ما الذي يجب أن أفرض أولا" في الأدب.

"مُختار" لعام 2026

بالنظر إلى الأدلة، وصفة افتراضية مفتوحة لـ VLM لمشروع جديد في عام 2026:

  • رمز: SigLIP 2 SO400m/14 في قرار محلي مع NaFlex ، متواصل مع DINOv2 ViT-g/14 للميزات الكثيفة إذا كنت بحاجة إلى التقسيم / التأريخ.
  • وصل: 2 طبقات MLP على رموز الإصلاح. تخطي Q-Former ما لم تكن معقودا في رموز.
  • الـ LLM: Qwen2.5 / Llama-3.1 / Gemma 2, 7B للتكلفة، 70B للجودة، يتم اختيارها حسب التأخير المستهدف.
  • البيانات: PixMo + ShareGPT4V + Cauldron، مع إضافة بيانات تعليمات محددة للمهمة.
  • القرار: ديناميكي (دقائق 256، أقصى 1280 بكسل لكل جانب طويل).
  • الجدول: المرحلة الأولى من التنظيم (المصوير فقط) ، المرحلة الثانية من التنظيم الكامل، المرحلة الثالثة من التنظيم الكامل المحدد للمهمة.

كل هذه الاختلالات تعود إلى التخفيض المقاس في الأوراق المذكورة في نهاية هذا الدروس.

استخدمها

code/main.pyهو تحليل جدول التشويش ومختار الوصفات. إنه يرمز جداول التشويش MM1 و Idefics2 (مضغوطة) ويسمح لك بإجراء استفسار:

  • "نظراً للميزانية "إكس" والمهام "ي" أي وصفة تفوز؟"
  • "إذا قمت بتبادل سيجليب مقابل كليب على 7B لامة، ما هو المتوقع ديلتا MMMU؟"
  • "أي محور يجب أن أضع أولاً للحصول على إجابة ثقة بنسبة 80٪؟"

الناتج هو قائمة وصفات مرتبة مع النقش المرجح المرجح والوصية "أولًا".

أرسله

هذا الدرس يُنتجoutputs/skill-vlm-recipe-picker.md. بالنظر إلى مزيج مهمة هدف، وميزانية حسابية، ومستهدف تأخير، فإنه يصدر وصفة كاملة (مؤشر، رابط، LLM، مزيج البيانات، جدول القرار) مع اقتباسات إلى التبرير الذي يبرر كل اختيار. يمنع المهندسين من إعادة اختراع جدول التبريد Idefics2 كل مرة تبدأ مشروع VLM جديد.

التمارين

  1. قراءة MM1 القسم 3.2. بالنسبة لـ 2B LLM ثابتة في ميزانية 50 مليون صورة، أي مرموز يفوز؟ هل الإجابة تلتفت في 13B LLM؟ لماذا؟
  1. يجد كامبريان 1 أن سلسلة DINOv2 + SigLIP تتفوق على النتائج سواء وحدها على مقارنات تركز على الرؤية ولكن لا تضيف إشارة على MMMU. توقع أي مقارنات تتحسن والتي تبقى ثابتة.
  1. هدفك هو وكيل واجهة المستخدم المحمولة على درجة 2B LLM. اختر رمز، وصل، قرار، ومزيج البيانات. تبرير كل خيار مع جدول تحويل محدد.
  1. مولمو سفن النماذج 4B و 72B. 4B تنافس مع مغلقة 7B VLMs؛ 72B تفوق Llama-3.2-90B-Vision على 11/11 مقارنات. ماذا يخبرك ذلك عن فرضية مستوى LLM؟
  1. صمم جدول التخريب لتحديد جودة خليط البيانات من جودة المرموز على جهاز VLM 7B. كم عدد عمليات التدريب الحد الأدنى؟ اقترح إعدادات الأربعة المحورات.

الشروط الرئيسية

TermWhat people sayWhat it actually means
Ablation"Turning one knob"Training multiple runs that differ in exactly one design-space axis, holding everything else constant
Connector"Bridge" / "projector"Trainable module that maps vision encoder output into the LLM's token space (MLP, Q-Former, Perceiver)
Detailed human caption"Dense caption"A multi-sentence human-written description (typically 80-300 tokens) richer than a web alt text
Distillation"GPT-4V captions"Training data generated by a stronger proprietary VLM; convenient but prone to inherited hallucination
AnyRes / dynamic res"High-res path"Strategy to feed images larger than the encoder's native resolution via tiling or M-RoPE
Resolution ramp"Curriculum"Training schedule that starts low-resolution and increases, speeding alignment learning
Vision-centric bench"CV-Bench / BLINK"Evaluation that stresses fine-grained visual perception rather than language-heavy reasoning
PixMo"Molmo's data"Allen AI's 712K densely-captioned image dataset; human speech transcribed into dense captions

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.