खुले वजन वाली वीएलएम रेसिपीः वास्तव में क्या मायने रखता है
Type: Learn + lab
Languages: Python (stdlib, ablation table parser + recipe picker)
Prerequisites: Phase 12 · 05 (LLaVA baseline)
Time: ~180 minutes
सीखने के लक्ष्य
- पांच अक्षीय वीएलएम डिजाइन स्थान का नाम देंः छवि एन्कोडर, कनेक्टर, एलएलएम, डेटा मिक्स, संकल्प अनुसूची।
- MM1 / Idefics2 / Cambrian-1 क्षरण तालिका को पढ़ें और भविष्यवाणी करें कि कौन सा बटन किसी दिए गए बेंचमार्क को आगे बढ़ाता है।
- एक नए VLM के लिए एक नुस्खा (एन्कोडर, कनेक्टर, डेटा, रिज़ॉल्यूशन) चुनें, एक गणना बजट और कार्य मिश्रण को देखते हुए।
- वर्णन करें कि मानव की विस्तृत कैप्शन जीपीटी-4वी डिस्टिलैशन को समान टोकन गिनती पर क्यों हराती है।
समस्या
सैकड़ों ओपन-वेट VLM मौजूद हैं। "अच्छी" और "अंतिम" के बीच का अधिकांश अंतर वास्तुकला नहीं है। यह डेटा, रिज़ॉल्यूशन शेड्यूल और एन्कोडर विकल्प है। जब आपका मॉडल खराब प्रदर्शन करता है तो कौन सा बटन पहले चालू करना है, यह जानना आपको 5 मिलियन जीपीयू-घंटे की गलती से बचाता है।
2023 की लहर (एलएलएवीए-1.5, इंस्ट्रक्टब्लिप, मिनीजीपीटी-4) कैप्शन-पियर प्री-ट्रेनिंग + एलएलएवीए-इंस्ट्रक्ट-150k पर चली। अच्छी बेसलाइन। एमएमएमयू के आसपास 35% के पार।
2024 की लहर (एमएम 1, आइडिएफिक्स 2, मोल्मो, कैंब्रियन-1, प्रिस्मैटिक वीएलएम) ने पूरी तरह से विघटन किया। परिणाम आश्चर्यजनक और व्यावहारिक थे।
अवधारणा
पांच अक्षीय डिजाइन स्थान
आइडेफिक्स2 (लॉरेनसन एट अल, 2024) ने अक्षों का नाम दियाः
- छवि एन्कोडर. CLIP ViT-L/14, SigLIP SO400m/14, DINOv2 ViT-g/14, InternViT-6B. पैच आकार, संकल्प और पूर्व प्रशिक्षण उद्देश्य में एन्कोडर भिन्न होते हैं।
- कनेक्टर: एमएलपी (2-4 परतें), क्यू-फॉर्मर (32 क्वेरी + क्रॉस-एटएन), प्रेक्षक पुनः नमूना (64 क्वेरी), सी-अवशिष्ट (संवर्ती + द्विआधारी पूलिंग) ।
- भाषा मॉडल. Llama-3 8B / 70B, Mistral 7B, Phi-3, Gemma-2, Qwen2.5। LLM आकार प्रमुख पैरामीटर लागत है।
- प्रशिक्षण डेटाः कैप्शन जोड़े (CC3M, LAION), परस्पर (OBELICS, MMC4), निर्देश (LLaVA-Instruct, ShareGPT4V, PixMo, Cauldron) ।
- संकल्प अनुसूची. फिक्स्ड 224/336/448, AnyRes, मूल गतिशील. प्रशिक्षण के दौरान रैंप या निरंतर.
प्रत्येक उत्पादन VLM प्रत्येक अक्ष पर एक विकल्प बनाता है। MMMU स्कोर में अधिकांश भिन्नता को आपके द्वारा चुने गए कनेक्टर द्वारा नहीं, अक्ष 1, 4 और 5 द्वारा समझाया जाता है।
अक्ष 1: एन्कोडर > कनेक्टर
MM1 धारा 3.2 में दिखाया गयाः CLIP ViT-L/14 से SigLIP SO400m/14 में स्विच करने से 3+ अंक MMMU जोड़ा गया। MLP से कनेक्टर को प्रतिबिंबित करने वाले रिसेम्प्लर में स्विच करने से 1 अंक से कम जोड़ा गया। Idefics2 ने दोहरायाः SigLIP > CLIP, Q-Former ≈ MLP ≈ प्रतिबिंबित उसी टोकन गिनती पर।
कैंब्रियन -1 के "कैम्ब्रियन विजन एन्कोडर मैच-अप" (टोंग एट अल, 2024) ने दृष्टि-केंद्रित बेंचमार्क (सीवी-बेंच) पर 20+ एन्कोडर चलाए। रैंकिंग बोर्ड का शीर्ष DINOv2 और SigLIP का मिश्रण है; CLIP पैक के बीच में है; ImageBind और ViT-MAE कम हैं। CLIP ViT-L से DINOv2 ViT-g/14 तक का अंतर सीवी-बेंच पर ~ 5-7 अंक है।
खुले VLMs के लिए 2026 डिफ़ॉल्ट एन्कोडर सिग्लिप 2 SO400m/14 है, जो अर्थिक + घने सुविधाओं के लिए है, कभी-कभी DINOv2 ViT-g/14 सुविधाओं के साथ संरेखित होता है (कैम्ब्रियन का "स्पेसियल विजन एग्रीगेटर" ऐसा करता है) ।
धुरी 2: कनेक्टर डिजाइन एक धोने है
MM1, Idefics2, Prismatic और MM-Interleaved सभी एक ही निष्कर्ष पर पहुंचेः एक निश्चित दृश्य-टोकन गिनती पर, कनेक्टर वास्तुकला मुश्किल से मायने रखती है। औसत-पूल किए गए पैचों पर 2-परत MLP एक ही टोकन बजट पर 32-प्रश्न Q-Former के 1 बिंदु के भीतर प्रदर्शन करता है।
जो मायने रखता है वह है टोकन की संख्या। अधिक दृश्य टोकन = अधिक एलएलएम गणना = एक बिंदु तक बेहतर प्रदर्शन, फिर घटती रिटर्न। प्रति छवि 64 टोकन ओसीआर के लिए बहुत कम है। 576-1024 टोकन अधिकांश खुले वीएलएम के लिए मीठा स्थान है। 2048+ केवल दस्तावेजों और चार्ट के लिए मदद करता है।
Q-Former बनाम MLP एक लागत प्रश्न है, गुणवत्ता प्रश्न नहींः Q-Former छवि संकल्प के बावजूद 32-64 पर टोकन को कैप करता है; MLP सभी पैच टोकन जारी करता है। उच्च-रिज़ॉल्यूशन इनपुट के लिए, Q-Former LLM संदर्भ को बचाता है; कम-रिज़ॉल्यूशन के लिए, अंतर शोर है।
अक्ष 3: LLM आकार सीमा निर्धारित करता है
7B से 13B तक LLM को दोगुना करने से VLM के प्रत्येक पेपर में MMMU पर 2-4 अंक विश्वसनीय रूप से जोड़े जाते हैं। 70B पर आप अधिकांश बेंचमार्क संतृप्त करते हैं। VLM की बहुआयामी तर्क छत LLM की पाठ तर्क छत है दृश्य एन्कोडर इसे केवल खिला सकता है, इसका कारण नहीं है।
यही कारण है कि Qwen2.5VL-72B और क्लाउड ओपस 4.7 MMMU-Pro और ScreenSpot-Pro को कुचलने के लिएः भाषा मस्तिष्क विशाल है। एक 7B VLM स्मार्ट कनेक्टर डिजाइन के माध्यम से 70B VLM को प्रतिस्थापित नहीं कर सकता है।
अक्ष 4: डेटा विस्तृत मानव कैप्शन डिस्टिलशन से अधिक
मोल्मो + पिक्स्मो (डेटके एट अल, 2024) 2024 का परिणाम है जिसे हर किसी को पढ़ना चाहिए। एलेन एआई ने मानव एनोटेटरों को 1-3 मिनट के घने भाषण-से-पाठ पास में छवियों का वर्णन करने के लिए कहा, जिससे 712K घने कैप्शन वाली छवियां मिलती हैं। प्रशिक्षण डेटा में कहीं भी जीपीटी-4वी डिस्टिलैशन नहीं है।
मोल्मो-72बी 11 बेंचमार्क में से 11 पर Llama-3.2-90B-Vision को हराता है। डेल्टा वास्तुकला नहीं है यह कैप्शन गुणवत्ता है। विस्तृत मानव कैप्शन में प्रति छवि 5-10 गुना अधिक जानकारी होती है।
ShareGPT4V (Chen et al., 2023) और Cauldron (Idefics2) ने एक ही प्लेबुक के साथ मिश्रित मानव + GPT-4V कैप्शन के साथ अनुसरण किया। प्रवृत्ति स्पष्ट हैः 2026 सीमा के लिए, कैप्शन घनत्व > कैप्शन मात्रा > डिस्टिलिशन सुविधा।
अक्ष 5: संकल्प और उसका समय सारिणी
Idefics2 के अपवर्तनः 384 -> 448 1-2 अंक जोड़ता है। 448 -> 980 छवि विभाजन (AnyRes) के साथ OCR बेंचमार्क पर एक और 3-5 जोड़ता है। मध्यम सटीकता पर फ्लैट रिज़ॉल्यूशन प्रशिक्षण पठार; रिज़ॉल्यूशन रैंपिंग (शुरू 224, समाप्त 448 या मूल) ट्रेनें तेजी से और उच्च समाप्त होती हैं।
कैम्ब्रियन -1 ने संकल्प बनाम टोकन व्यापार कियाः निश्चित गणना में, आपके पास कम संकल्प पर अधिक टोकन या उच्च संकल्प पर कम टोकन हो सकते हैं। ओसीआर के लिए उच्च संकल्प जीतता है; सामान्य दृश्य समझ के लिए कम-रिज़ॉल्यूशन-अधिक टोकन जीतता है।
2026 उत्पादन नुस्खाः ओसीआर भारी कार्यों के लिए गतिशील संकल्प के साथ चरण 1 384 पर स्थिर, चरण 2 1280 तक।
प्रिस्मेटिक नियंत्रित तुलना
प्रिस्मेटिक वीएलएम (करमचेती और सहयोगियों, 2024) सभी अक्षों को नियंत्रित करने वाला पेपर है। वही 13 बी एलएलएम, समान निर्देश डेटा, समान मूल्यांकन एक समय में केवल एक अक्ष भिन्न होता है। परिणामः
- प्रति छवि दृश्य-टोकन गणना ~ 60% भिन्नता की व्याख्या करता है।
- एन्कोडर विकल्प ~ 20% की व्याख्या करता है।
- कनेक्टर वास्तुकला ~ 5% की व्याख्या करता है।
- बाकी सब कुछ (डेटा मिक्स, शेड्यूलर, LR) शेष ~ 15%।
यह एक कठोर विघटन है, लेकिन यह साहित्य में "मैं पहले क्या हटाऊं" का सबसे साफ जवाब है।
2026 के लिए एक चयनकर्ता
सबूतों को देखते हुए, 2026 में एक नई परियोजना के लिए डिफ़ॉल्ट ओपन-वीएलएम नुस्खाः
- एन्कोडरः सिगलिप 2 SO400m/14 नेटिव रेज़ॉल्यूशन में NaFlex के साथ, यदि आपको सेगमेंटेशन/ग्राउंडिंग की आवश्यकता है तो घने फीचर्स के लिए DINOv2 ViT-g/14 के साथ कॉनकेटेड।
- कनेक्टरः पैच टोकन पर 2-परत MLP. Q-Former छोड़ें जब तक आप टोकन प्रतिबंधित नहीं हैं.
- LLM: Qwen2.5 / Llama-3.1 / Gemma 2, लागत के लिए 7B, गुणवत्ता के लिए 70B, लक्षित विलंबता के आधार पर चुना गया।
- डेटाः पिक्स्मो + शेयरजीपीटी 4 वी + कैटलर, कार्य-विशिष्ट निर्देश डेटा के साथ पूरक।
- रिज़ॉल्यूशनः गतिशील (मिनेट 256, अधिकतम 1280 पिक्सल प्रति लंबाई पक्ष) ।
- अनुसूचीः चरण 1 संरेखण (केवल प्रोजेक्टर), चरण 2 पूर्ण ठीक-ठाक, चरण 3 कार्य-विशिष्ट ठीक-ठाक।
इन डिफ़ॉल्टों में से प्रत्येक इस पाठ के अंत में उद्धृत पत्रों में मापा गया अपवर्तन के लिए वापस जाता है।
इसका प्रयोग करें
code/main.pyयह एक ablation तालिका पार्सर और नुस्खा पिकर है. यह MM1 और Idefics2 ablation तालिकाओं को कोड (संकटित) और आप पूछने देता हैः
- "बजट X और कार्य Y को देखते हुए, कौन सा नुस्खा जीतता है?
- "यदि मैं 7B लामा पर सीजीएलआईपी को क्लिप के लिए बदल देता हूं, तो अपेक्षित एमएमयूयू डेल्टा क्या है?
- "मैं 80% आत्मविश्वास के लिए किस धुरी को पहले हटाऊं?
आउटपुट अपेक्षित बेंचमार्क डेल्टा और एक "एब्लेट फर्स्ट" सिफारिश के साथ एक रैंकिंग रेसिपी सूची है।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-vlm-recipe-picker.md. एक लक्ष्य कार्य मिश्रण, एक गणना बजट और एक विलंबता लक्ष्य को देखते हुए, यह प्रत्येक विकल्प को सही ठहराने वाले अपघटन के उद्धरणों के साथ एक पूर्ण नुस्खा (एन्कोडर, कनेक्टर, एलएलएम, डेटा मिश्रण, संकल्प अनुसूची) जारी करता है। यह इंजीनियरों को हर बार एक नई वीएलएम परियोजना शुरू होने पर आइडिएफिक्स2 अपघटन तालिका को फिर से आविष्कार करने से रोकता है।
व्यायाम
- MM1 धारा 3.2 पढ़ें. बजट 50M छवियों पर फिक्स्ड 2B LLM के लिए, कौन सा एन्कोडर जीतता है? क्या उत्तर 13B LLM पर फ्लिप होगा? क्यों?
- कैम्ब्रियन-1 का निष्कर्ष है कि DINOv2 + SigLIP को संयोजन करने से दृष्टि-केंद्रित बेंचमार्क पर अकेले या तो बेहतर प्रदर्शन होता है लेकिन MMMU पर कोई संकेत नहीं होता है। भविष्यवाणी करें कि कौन से बेंचमार्क बढ़ते हैं और कौन सा स्थिर रहते हैं।
- आपका लक्ष्य 2B LLM पर एक मोबाइल UI एजेंट है. एन्कोडर, कनेक्टर, संकल्प, और डेटा मिश्रण चुनें. एक विशिष्ट ablation तालिका के साथ प्रत्येक विकल्प को सही ठहराने.
- मोल्मो 4 बी और 72 बी मॉडल जहाजों। 4 बी बंद 7 बी VLMs के साथ प्रतिस्पर्धी है; 72 बी 11/11 बेंचमार्क पर Llama-3.2-90B-Vision से बेहतर है। यह आपको LLM आकार के पठार परिकल्पना के बारे में क्या बताता है?
- 7B VLM पर एन्कोडर गुणवत्ता से डेटा मिश्रण गुणवत्ता को अलग करने के लिए एक एब्लेशन तालिका डिजाइन करें। न्यूनतम कितने प्रशिक्षण रन हैं? चार अक्ष सेटिंग्स का प्रस्ताव करें।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| Ablation | "Turning one knob" | Training multiple runs that differ in exactly one design-space axis, holding everything else constant |
| Connector | "Bridge" / "projector" | Trainable module that maps vision encoder output into the LLM's token space (MLP, Q-Former, Perceiver) |
| Detailed human caption | "Dense caption" | A multi-sentence human-written description (typically 80-300 tokens) richer than a web alt text |
| Distillation | "GPT-4V captions" | Training data generated by a stronger proprietary VLM; convenient but prone to inherited hallucination |
| AnyRes / dynamic res | "High-res path" | Strategy to feed images larger than the encoder's native resolution via tiling or M-RoPE |
| Resolution ramp | "Curriculum" | Training schedule that starts low-resolution and increases, speeding alignment learning |
| Vision-centric bench | "CV-Bench / BLINK" | Evaluation that stresses fine-grained visual perception rather than language-heavy reasoning |
| PixMo | "Molmo's data" | Allen AI's 712K densely-captioned image dataset; human speech transcribed into dense captions |
आगे पढ़ना
- McKinzie et al. — MM1 (arXiv:2403.09611)
- Laurençon et al. — Idefics2 / What matters building VLMs (arXiv:2405.02246)
- Deitke et al. — Molmo and PixMo (arXiv:2409.17146)
- Tong et al. — Cambrian-1 (arXiv:2406.16860)
- Karamcheti et al. — Prismatic VLMs (arXiv:2402.07865)
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.