Phase 12: Multimodal AI

دستورات VLM با وزن باز: آنچه واقعا مهم است

ادبیات VLM با وزن باز سال 2024 تا 2026 جنگل از جدول های آبلاسیون است. MM1 اپل 13 ترکیب کدگر تصویر، کانکتور و مخلوط داده را آزمایش کرد. مولمو AI آلن ثابت کرد که عناوین انسانی دقیق تر از جفت-4 وی استیلشن غلبه دارند. کامبریان ۱ 20+ مقایسه کدرها را اجرا کرد. Idefics2 فضای طراحی پنج محور را رسمی کرد. VLM های پرسماتیک 27 دستورات آموزشی را بر اساس یک معیار کنترل شده مقایسه کردند. از این همه صدا، مجموعه ای کوچک از نتایج در سراسر کاغذ ها برقرار است: کدگر تصویر مهم تر از معماری کانکتور، مخلوط داده مهم تر از هر دو است، و عناوین انسانی دقیق تر از داده های مصنوعی مستقیم است. این درس این جدول ها را می خواند تا مجبور نشوید.

Type: Learn + lab

Languages: Python (stdlib, ablation table parser + recipe picker)

Prerequisites: Phase 12 · 05 (LLaVA baseline)

Time: ~180 minutes

اهداف یادگیری

  • فضای طراحی VLM پنج محور را نام دهید: کدر تصویر، کانکتور، LLM، ترکیب داده ها، برنامه رزولوشن.
  • جدول ابلاسیون MM1 / Idefics2 / Cambrian-1 را بخوانید و پیش بینی کنید که کدام دکمه یک معیار داده شده را حرکت می دهد.
  • یک دستور (اینکودر، کانکتور، داده ها، رزولوشن) برای یک VLM جدید را انتخاب کنید که بودجه و ترکیب وظایف محاسبه شده باشد.
  • توضیح بده چرا عناوین انسانی دقیق تر از جفت ۴ وی در همان تعداد توکن ها بیشتر میشن.

مشکل

صدها VLM با وزن باز وجود دارد. بیشتر شکاف بین "خوب" و "حال جدید" معماری نیست. این داده ها، برنامه رزولوشن و انتخاب کدرها است. دانستن اینکه کدام دکمه را برای اولین بار در هنگام عملکرد ضعیف مدل شما می توانید یک اشتباه 5 میلیون GPU-ساعت را از دست دهید.

موج 2023 (LLaVA-1.5، InstructBLIP، MiniGPT-4) بر روی پیش تمرین زوج عنوان + LLaVA-Instruct-150k اجرا شد. خط پایه خوب. حدود 35٪ MMMU را ترک کرد.

موج 2024 (MM1 ، Idefics2 ، Molmo ، Cambrian-1 ، Prismatic VLMs) از طریق حذف های کامل انجام شد. نتایج شگفت انگیز و عملی بود.

مفهوم

فضای طراحی پنج محور

Idefics2 (Laurençon و همکارانش، 2024) محور ها را نامگذاری کرد:

  1. کدگر تصویر: CLIP ViT-L/14, SigLIP SO400m/14, DINOv2 ViT-g/14, InternViT-6B. کدگرها با اندازه پیچ، وضوح و هدف پیش از آموزش متفاوت هستند.
  2. اتصال دهنده: MLP (2-4 لایه) ، Q-Former (32 سوال + cross-attn) ، Perceiver Resampler (64 سوال) ، C-Abstractor (مجموعه سازی کنولوشن + بیلینیر).
  3. مدل زبان: Llama-3 8B / 70B، Mistral 7B، Phi-3, Gemma-2, Qwen2.5
  4. داده های آموزش: جفت های زیرنویس (CC3M، LAION) ، متقابل (OBELICS، MMC4), آموزش (LLaVA-Instruct، ShareGPT4V، PixMo، Cauldron).
  5. برنامه حلش ثابت 224/336/448 AnyRes، پديده اصلي در طول آموزش يا ثابت

هر تولید VLM در هر محور انتخاب می کند. اکثر تفاوت در نمرات MMMU توسط محورهای 1، 4 و 5 توضیح داده می شود نه توسط رابطی که انتخاب کرده اید.

محور 1: کدگر > اتصال

MM1 بخش 3.2 نشان داد: تغییر از CLIP ViT-L/14 به SigLIP SO400m/14 3+ امتیاز MMMU اضافه کرد. تغییر از اتصال از MLP به گیرنده Resampler کمتر از 1 امتیاز اضافه کرد. ایده ها 2 تکرار شد: SigLIP > CLIP, Q-Former ≈ MLP ≈ گیرنده در همان تعداد توکن.

کامبریان ۱ "Cambrian Vision Encoders Match-Up" (Tong et al., 2024) 20+ کدگر را بر روی یک معیار متمرکز بر دید (CV-Bench) اجرا کرد. بالای جدول رتبه بندی ترکیبی از DINOv2 و SigLIP است؛ CLIP در وسط بسته قرار دارد؛ ImageBind و ViT-MAE پایین تر هستند. شکاف از CLIP ViT-L به DINOv2 ViT-g/14 در CV-Bench ~ 5-7 امتیاز است.

کدگر پیش فرض 2026 برای VLM های باز SigLIP 2 SO400m/14 برای ویژگی های معنوی + کثیف است، گاهی اوقات با ویژگی های DINOv2 ViT-g/14 متصل می شود (Cambrian's "Spacial Vision Aggregator" این کار را می کند).

محور دوم: طراحی اتصال یک شستشو است

MM1، Idefics2، Prismatic و MM-Interleaved همه به یک نتیجه رسیدند: در یک تعداد ثابت از توکن های بصری، معماری اتصال به سختی اهمیت دارد. یک MLP دو لایه در پچ های متوسط به کار می رود در عرض 1 نقطه از یک Q-Former 32 سوال با همان بودجه توکن.

مهم است تعداد توکن ها. توکن های بصری بیشتر = محاسبه LLM بیشتر = عملکرد بهتر تا یک نقطه، سپس بازده کاهش می یابد. 64 توکن در هر تصویر برای OCR بسیار کم است. توکن های 576-1024 نقطه شیرین برای اکثر VLM های باز است. 2048+ فقط برای اسناد و نمودار ها کمک می کند.

Q-Former vs MLP یک سوال هزینه است، نه یک سوال کیفیت: Q-Former توکن ها را در 32-64 قطع نظر از رزولوشن تصویر محدود می کند؛ MLP تمام توکن های پچ را صادر می کند. برای ورودی های رزوشن بالا، Q-Former زمینه LLM را ذخیره می کند؛ برای رزوشن پایین، تفاوت در شور است.

محور سوم: اندازه LLM سقف را تعیین می کند

دو برابر کردن LLM از 7B تا 13B به طور قابل اعتماد 2-4 امتیاز در MMMU در هر مقاله VLM اضافه می کند. در 70B شما اکثر معیار را پر می کنید. سقف استدلال چندمودال VLM سقف استدلال متن LLM است کدگر بصری فقط می تواند آن را تغذیه کند، نه دلیل برای آن.

به همین دلیل Qwen2.5VL-72B و Claude Opus 4.7 MMMU-Pro و ScreenSpot-Pro را شکست می دهند: مغز زبان بسیار بزرگ است. یک VLM 7B نمی تواند جایگزین VLM 70B شود از طریق طراحی رابط هوشمند.

محور 4: داده ها عناوین انسانی دقیق تر از لوله

مولمو + پیکسمو (Deitke و همکاران، 2024) نتیجه 2024 است که همه باید بخوانند. آلن AI دارای نوتاژورهای انسانی بود که تصاویر را در گذرگاه های فشرده گفتار به متن 1-3 دقیقه توصیف می کند، که 712K تصویر با سرشناس فشرده را به ارمغان می آورد. هیچ جا از جپ تی - 4 وی در داده های آموزش نیست.

مولمو-72B در 11 مورد از 11 معیار Llama-3.2-90B-Vision غلبه کرد. دلتا معماری نیست کیفیت عنوان است. عناوین انسانی مفصل حاوی 5-10 برابر اطلاعات بیشتر از هر تصویر از عناوین وب کوتاه است و در جایی که هالوسین های تخلیه GPT-4V واقع می شوند، به طور واقعی مبتنی بر زمین باقی می ماند.

ShareGPT4V (Chen et al., 2023) و Cauldron (Idefics2) همان کتاب بازی را با عنوان های مخلوط انسان + GPT-4V دنبال کردند. روند واضح است: برای مرز 2026، تراکم عنوان > مقدار عنوان > راحتی تزریق.

محور 5: قطعنامه و برنامه آن

آباژور های Idefics2: 384 -> 448 1-2 امتیاز اضافه می کند. 448 -> 980 با تقسیم تصویر (AnyRes) 3-5 مورد دیگر را در معیار OCR اضافه می کند. سطحه های آموزش با وضوح متوسط؛ ریمپنگ وضوح (از 224 شروع، 448 یا بومی) قطار ها سریعتر و بالاتر می پایانند.

کامبریان ۱ یک معامله با وضوح در مقابل توکن ها را اجرا کرد: در محاسبات ثابت، شما می توانید توکن های بیشتری را با وضوح پایین تر یا توکن های کمتری را با وضوح بالاتر داشته باشید. وضوح بالاتر برای OCR برنده می شود؛ کم تر از وضوح بیشتر توکن ها برای درک صحنه عمومی برنده می شود.

نسخه تولید 2026: قطار مرحله 1 در 384 ثابت، مرحله 2 با رزولوشن پویا تا 1280 برای وظایف سنگین OCR.

مقایسه کنترل شده Prismatic

برجامی VLMs (Karamcheti et al., 2024) مقاله ای است که تمام محورها را کنترل می کند. همان 13B LLM، داده های دستورالعمل مشابه، ارزیابی مشابه تنها یک محور در یک زمان متفاوت است. نتایج:

  • تعداد نماد های بینایی در هر تصویر، حدود 60 درصد تفاوت را توضیح می دهد.
  • انتخاب کدرها توضیح میده ~20٪
  • معماری اتصال توضیح میده ~5%
  • همه چیز دیگر (مکس داده ها، برنامه نویس، LR) باقی مانده ~15٪.

این یک تجزیه خشن است، اما این پاک ترین پاسخ به "چه چیزی را باید اول حذف کنم" در ادبیات است.

یک انتخاب کننده برای سال 2026

با توجه به شواهد، دستور العمل افتتاح VLM برای یک پروژه جدید در سال 2026:

  • کدرها: SigLIP 2 SO400m/14 در رزولوشن بومی با NaFlex، با DINOv2 ViT-g/14 برای ویژگی های کثیف اگر نیاز به بخش بندی / زمین سازی دارید.
  • اتصال: 2 لایه MLP در توکن های پیچ. Q-Former را حذف کنید مگر اینکه توکن محدود باشد.
  • LLM: Qwen2.5 / Llama-3.1 / Gemma 2, 7B برای هزینه، 70B برای کیفیت، انتخاب شده توسط تاخیر هدف.
  • داده ها: PixMo + ShareGPT4V + کاسه، با داده های دستورالعمل خاص به کار تکمیل شده است.
  • رزولوشن: پویا (منتی 256، حداکثر 1280 پیکسل در هر طرف طولانی)
  • جدول: مرحله ی اول (تنها برای پروژکتور) ، مرحله ی دوم، کامل، مرحله ی سوم، دقیق و دقیق برای وظایف خاص.

هر یک از این معیارهای به یک اندازه گیری در مقالات ذکر شده در پایان این درس برمی گردد.

ازش استفاده کن

code/main.pyاین یک تحلیلگر جدول آبلاسیون و انتخاب کننده دستورات است. این جدول MM1 و Idefics2 آبلاسیون را کدگذاری می کند (کدست) و به شما اجازه می دهد سوال کنید:

  • "با توجه به بودجه X و وظیفه Y، کدام دستور برنده می شود؟"
  • "اگر من سیگلپ رو به کلیپ در یک لاما ۷ بی عوض کنم، دلتا MMMU انتظار می رود چه چیزی باشه؟"
  • "چه محور اول بايد براي پاسخ 80 درصد اعتماد به نفس از بين برم؟"

محصول یک لیست مرتب شده از دستورات با دلتاهای معیاری انتظار می رود و توصیه "اولین شکل" است.

-باده

این درس به ما کمک می کندoutputs/skill-vlm-recipe-picker.md. با توجه به یک ترکیب وظایف هدف، بودجه محاسباتی و یک هدف تاخیر، این نسخه کامل (کودر، کنتاکتور، LLM، ترکیب داده ها، برنامه رزولوشن) با نقل قول به آبلاسیون که هر انتخاب را توجیه می کند، منتشر می شود. مهندس ها را از ایجاد مجدد جدول آبلاسیون Idefics2 در هر زمان که یک پروژه VLM جدید آغاز شود، متوقف می کند.

تمرینات

  1. برای یک LLM ثابت 2B با بودجه 50 میلیون تصویر، کدام کدور برنده می شود؟ آیا پاسخ به LLM 13B تغییر می کند؟ چرا؟
  1. کامبریان ۱ دریافت که ترکیب DINOv2 + SigLIP تنها در معیار های مروری متمرکز بهتر است اما هیچ سیگنال در MMMU اضافه نمی کند. پیش بینی کنید که کدام معیار های مروری افزایش می یابد و کدام ثابت باقی می ماند.
  1. هدف شما یک عامل UI موبایل در یک 2B LLM است. کدر، اتصال، رزولوشن و مخلوط داده را انتخاب کنید. هر انتخاب را با یک جدول آبلاسیون خاص توجیه کنید.
  1. مولمو مدل های 4B و 72B را عرضه می کند. 4B با مدل های بسته 7B VLM رقابتی است؛ 72B بر Llama-3.2-90B-Vision در معیار 11/11 غلبه می کند. این چه چیزی را در مورد فرضیه سطح بالا اندازه LLM به شما می گوید؟
  1. یک جدول آبلاسیون طراحی کنید تا کیفیت مخلوط داده ها را از کیفیت کدرها در یک VLM 7B جدا کند. حداقل چند بار آموزش؟ چهار تنظیم محور را پیشنهاد کنید.

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
Ablation"Turning one knob"Training multiple runs that differ in exactly one design-space axis, holding everything else constant
Connector"Bridge" / "projector"Trainable module that maps vision encoder output into the LLM's token space (MLP, Q-Former, Perceiver)
Detailed human caption"Dense caption"A multi-sentence human-written description (typically 80-300 tokens) richer than a web alt text
Distillation"GPT-4V captions"Training data generated by a stronger proprietary VLM; convenient but prone to inherited hallucination
AnyRes / dynamic res"High-res path"Strategy to feed images larger than the encoder's native resolution via tiling or M-RoPE
Resolution ramp"Curriculum"Training schedule that starts low-resolution and increases, speeding alignment learning
Vision-centric bench"CV-Bench / BLINK"Evaluation that stresses fine-grained visual perception rather than language-heavy reasoning
PixMo"Molmo's data"Allen AI's 712K densely-captioned image dataset; human speech transcribed into dense captions

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.