इंटरवीएल3: मूल बहुआयामी पूर्व प्रशिक्षण
Type: Learn
Languages: Python (stdlib, training-corpus mixer)
Prerequisites: Phase 12 · 05, Phase 12 · 07 (recipes)
Time: ~120 minutes
सीखने के लक्ष्य
- स्पष्ट करें कि पोस्ट-होक वीएलएम प्रशिक्षण में संरेखण ऋण क्यों जमा होता है, तीन मापने योग्य लक्षणों (विपत् भूल, उत्तर बहाव, दृश्य-पाठ असंगति) का उल्लेख करते हुए।
- InternVL3 के मूल पूर्व प्रशिक्षण कॉर्पस मिश्रण का वर्णन करें और पाठ के अनुपातः इंटरलेटेडः कैप्शन क्यों मायने रखता है।
- Qwen2-VL के M-RoPE के साथ V2PE (भयावह दृश्य स्थिति एन्कोडिंग) की तुलना करें।
- विज़ुअल रिज़ॉल्यूशन राउटर (ViR) और डिकोप्ल्ड विजन-भाषा (DvD) तैनाती अनुकूलन का नाम दें।
समस्या
पोस्ट-होक वीएलएम प्रशिक्षण डिफ़ॉल्ट है। एलएलएवीए, बीएलआईपी-2, क्यूवेन-वीएल, आइडियाफिक्स सभी पहले से ही पूर्व-प्रशिक्षित एलएलएम (लामा, विकुना, क्यूवेन, मिस्ट्रल) लेते हैं और दृष्टि जोड़ते हैं। प्रशिक्षण चरण आमतौर पर इस तरह दिखते हैंः
- जमे हुए एलएलएम + जमे हुए दृष्टि एन्कोडर + प्रशिक्षित प्रोजेक्टर, एम्बेडमेंट्स को संरेखित करने के लिए कैप्शन जोड़े पर प्रशिक्षित।
- अनफ्रीज LLM, प्रशिक्षण के डेटा पर प्रशिक्षण (LLaVA-Instruct, ShareGPT4V) ।
- वैकल्पिक कार्य-विशिष्ट सूक्ष्म-ट्यूनिंग।
संरेखण ऋण के तीन लक्षण प्रकट होते हैंः
- विनाशकारी भूलना. पोस्ट-हॉक VLM केवल पाठ कौशल भूल जाता है. GSM8K स्कोर 5-10 अंक गिर जाता है. हेलस्वाग स्कोर गिर जाता है. शुद्ध पाठ एजेंटों में गिरावट.
- उत्तर बहाव। एक ही दृश्य प्रश्न के छोटे वाक्यांशों को अलग-अलग उत्तर मिलते हैं। दृष्टि एन्कोडर LLM के अपने टोकन की तुलना में कम कमजोर बंधन के साथ LLM से जुड़ता है।
- दृश्य-पाठ असंगति। VLM एक छवि का सही ढंग से वर्णन कर सकता है और फिर अपने स्वयं के विवरण के विपरीत एक प्रश्न का उत्तर दे सकता है। दृश्य टोकन एलएलएम के आंतरिक स्थिरता जांच में भाग नहीं लेते हैं।
ये लक्षण अच्छी तरह से प्रलेखित हैं। एमएम 1.5 धारा 4 उन्हें मात्राबद्ध करती है। एलएवीए-वनविज़न के अवशेष उन्हें संकेत देते हैं। मूल पूर्व प्रशिक्षण इसका जवाब है।
अवधारणा
मूल बहुआयामी पूर्व प्रशिक्षण
इंटरवीएल 3 एक कोरपस पर खरोंच से ट्रेन करता है जो मूल मल्टीमोडल है। मिश्रण हैः
- 40% केवल पाठ डेटा (फाइनवेब, प्रूफ-पाइल-2 आदि)
- 35% परस्पर चित्र-पाठ डेटा (OBELICS, MMC4-शैली)
- 20% जोड़ी छवि कैप्शन डेटा
- 5% वीडियो पाठ डेटा
दृष्टि टोकन, पाठ टोकन और क्रॉस-मोडल इंटरैक्शन सभी पहले ग्रेडिएंट चरण से एक ही नुकसान में भाग लेते हैं। कोई संरेखण पूर्व प्रशिक्षण, कोई प्रोजेक्टर जमे हुए चरण, कोई आपदा नहीं भूलना।
प्रशिक्षण मूल मॉडल के लिए एक एकल चरण है। निर्देश ट्यूनिंग का अनुसरण करता है, लेकिन मूल मॉडल पहले से ही प्रथम श्रेणी के नागरिकों के रूप में दृश्य टोकन को समझता है।
V2PE (भारीब दृश्य स्थिति एन्कोडिंग)
Qwen2-VL M-RoPE का उपयोग फिक्स्ड एक्सिस आवंटन के साथ करता है। InternVL3 V2PE को पेश करता हैः स्थिति एन्कोडिंग सीखने योग्य स्केलिंग के साथ मोडलिटी प्रकार (पाठ, छवि, वीडियो) के अनुसार भिन्न होती है।
- पाठ टोकन 1D स्थिति प्राप्त (पाठ सूचकांक) ।
- छवि पैच 2D स्थिति प्राप्त (पंक्ति, कॉल) ।
- वीडियो फ्रेम 3D स्थिति (समय, पंक्ति, कॉल) प्राप्त करते हैं।
तीनों में एक ही RoPE आवृत्ति आधार होता है, लेकिन प्रत्येक बैंड पर छिपे हुए-डिम आवंटन एक निश्चित विभाजन के बजाय एक सीखा पैरामीटर है। पूर्व-प्रशिक्षण के दौरान समय और स्थानिक आवृत्ति संकल्प के साथ व्यापार करने की स्वतंत्रता।
V2PE के ablation दावाः एक ही गणना पर M-RoPE पर वीडियो बेंचमार्क पर 1-2 अंक. एक क्रांति नहीं, लेकिन स्वच्छ.
दृश्य संकल्प राउटर (ViR)
तैनाती अनुकूलन. सभी छवियों को पूर्ण-रिज़ॉल्यूशन एन्कोडिंग की आवश्यकता नहीं है। कम विवरण पर एक वस्तु के साथ एक फोटो 1280px नेटिव में एन्कोड होने पर टोकन बर्बाद करती है। ViR एक छोटा वर्गीकरण है जो एन्कोडिंग से पहले प्रश्न का उत्तर देने के लिए आवश्यक न्यूनतम संकल्प की भविष्यवाणी करता है।
रूटिंग में तीन स्तर हैंः कम-रिज़ॉल्यूशन (256 टोकन), मध्यम (576), उच्च (2048+) । उत्पादन यातायात में 60% क्वेरी के लिए, कम या मध्यम पर्याप्त है। शुद्ध प्रभावः 2-3x समान गुणवत्ता पर पारगमन।
विजन-भाषा (डीवीडी) डिस्कॉप्ल्ड डिप्लोयमेंट
जब आप एक बड़े VLM की सेवा करते हैं, तो विजन एन्कोडर प्रति छवि एक बार चलता है लेकिन LLM प्रत्येक आउटपुट टोकन के लिए ऑटोरेग्रेसिव रूप से चलता है। दोनों घटकों में अलग-अलग बोतल की खाई होती है (विजन = GPU मेमोरी बैंडविड्थ के लिए conv + ध्यान; LLM = KV कैश) । डीवीडी उन्हें अलग-अलग GPU पर विभाजित करता है।
8B + 400M एन्कोडर मॉडल के लिए, डीवीडी लगभग प्रति नोड आउटपुट बनाम सह-स्थानिककरण को दोगुना करता है।
एकल-चरण बनाम बहु-चरण गुणवत्ता
इंटरवीएल 3 का प्राथमिक बेंचमार्क दावाः 78 बी पैरामेड पर, जेमिनी 2.5 प्रो के एमएमएमयू-प्रो से मेल खाता है। 38 बी पर, जीपीटी-4ओ से मेल खाता है। 8 बी पर, ओपन-8 बी लीडरबोर्ड का नेतृत्व करता है। सभी एक एकल चरण प्री-ट्रेन + निर्देश-ट्यूनिंग नुस्खा पर।
संरेखण-ऋण परिकल्पना मापी जा सकती हैः इंटरवीएल 3-8बी प्रति दृष्टि-बेंचमार्क लाभ इकाई की तुलना में कम पाठ-बेंचमार्क अंक (एमएमएलयू, जीएसएम 8 के) खोता है। मॉडल अधिक सामान्यवादी है क्योंकि प्रशिक्षण एक टुकड़ा था, न कि दो।
इंटरव्यूएल3.5 और इंटरव्यूएल-यू
इंटरवीएल 3.5 (अगस्त 2025) नुस्खा को स्केल करता है। समान मूल-पूर्व-प्रशिक्षण दृष्टिकोण, अधिक डेटा, अधिक पैरामेट्स। एमएमयू में सुधार क्रमिक हैं।
InternVL-U (2026) एक ही रीढ़ की हड्डी के ऊपर MMDiT हेड के माध्यम से एकीकृत पीढ़ी छवि आउटपुट जोड़ता है। "U" "U" के लिए खड़ा है, "Understanding + generation", ट्रांसफ्यूजन-शैली के एकीकृत मॉडल (लेक्शन 12.13) का पीछा करता है। एक ही मूल-पूर्व-प्रशिक्षित रीढ़ की हड्डी दोनों को समझने और पीढ़ी के हेड का समर्थन करती है।
मूल पूर्व प्रशिक्षण के व्यापारिक अंतर
मूल पूर्व प्रशिक्षण निःशुल्क नहीं हैः
- कम्प्यूटिंग. नए वीएलएम को खरोंच से प्रशिक्षित करने की लागत पाठ एलएलएम को प्रशिक्षित करने के समान है लाखों जीपीयू-घंटे। पोस्ट-हॉक अनुकूलन मौजूदा एलएलएम वजन का पुनः उपयोग करता है, अधिकांश लागत को बचाता है।
- डेटा. पैमाने पर इंटरलेवेड छवि-पाठ कॉर्पो दुर्लभ हैं। ओबेलिक्स 141M दस्तावेज है; एमएमसी 4 571M है। अकेले पाठ 15T टोकन पर जहाज करता है। मल्टीमोडल प्रीट्रेनिंग डेटा की कमी एक कठिन प्रतिबंध है।
- मूल-एलएलएम पुनः उपयोग. मूल पूर्व प्रशिक्षण बाद में एक नया एलएलएम छोड़ने का विकल्प देता है। पोस्ट-हॉक आपको केवल एडाप्टर को पुनः प्रशिक्षित करके एलएमए-3.1 को एलएमए-4 के लिए बदल देता है।
इंटरवीएल 3 का दांव हैः संरेखण ऋण पुनः उपयोग हानि से भी बदतर है। बेंचमार्क दावा का समर्थन करते हैं। उत्पादन लागत भविष्य की प्रयोगशालाओं को सस्ते में प्रतिकृति से रोकती है। पोस्ट-हॉक वीएलएम अस्तित्व में रहेंगे क्योंकि वे अधिकांश परियोजनाओं के लिए सस्ते बने रहेंगे।
इसका प्रयोग करें
code/main.pyएक प्रशिक्षण-कर्पस मिक्सर और वीआर राउटर सिम्युलेटर है। यहः
- लक्ष्य कॉर्पस मिश्रण (% पाठ, % अंतराल, % उपशीर्षक, % वीडियो) लेता है और modality के अनुसार अपेक्षित चरणों की गणना करता है।
- एक बैच के सवालों पर ViR राउटिंग का अनुकरण करता है (वितरणः 50% कम विवरण, 30% मध्यम, 20% उच्च विवरण) और टोकन औसत संख्या की रिपोर्ट करता है।
- एनकोडर बनाम एलएलएम फ्लोप दिए गए डीवीडी आउटपुट अनुमानों की रिपोर्ट करता है।
- पैरामेट्स, कम्प्यूटिंग, डेटा और अपेक्षित संरेखण-ऋण लक्षणों में पोस्ट-होक बनाम मूल पूर्व प्रशिक्षण का एक साथ प्रिंट करता है।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-native-vs-posthoc-auditor.md. एक प्रस्तावित वीएलएम प्रशिक्षण योजना को देखते हुए, यह ऑडिट करता है कि क्या इसे मूल या पोस्ट-होक करना है, संरेखण-ऋण जोखिम को चिह्नित करता है, और एक कॉर्पस मिश्रण की सिफारिश करता है।
व्यायाम
- इंटरव्यूएल 3-8बी (नेटिव प्रीट्रेन) और एलएलएवीए-वनविज़न 7बी (पोस्ट हॉक) के बीच गणना डेल्टा का अनुमान लगाएं। GPU-घंटे का अनुपात लगभग? अंतर क्या है?
- InternVL3 40% पाठ / 35% इंटरलेवेड / 20% कैप्शन / 5% वीडियो रिपोर्ट करता है। यदि आपका लक्ष्य कार्य वीडियो भारी है, तो एक नया अनुपात प्रस्तावित करें और तर्क दें कि मूल मॉडल को अभी भी पर्याप्त पाठ और कैप्शन डेटा की आवश्यकता क्यों है।
- भूलने पर एमएम 1.5 सेक्शन 4 पढ़ें. पोस्ट-होक प्रशिक्षण में सबसे बड़ी गिरावट दिखाई गई सटीक बेंचमार्क का नाम दें। गिरावट की लागत कितनी थी?
- ViR 60% ट्रैफ़िक को निम्न-रिज़ॉल्यूशन एन्कोडिंग को रूट करता है। यह किस प्रकार के क्वेरी को गलत तरीके से भेजता है (जब उच्च-रिज़ॉल्यूशन की आवश्यकता होती है तो कम-रिज़ॉल्यूशन को भेजता है)? तीन रूटर-फेल मोड प्रस्तावित करें।
- डीवीडी विजन और एलएलएम को अलग-अलग जीपीयू में विभाजित करता है। किस ट्रैफिक पैटर्न के तहत डीवीडी मदद करने के बजाय आउटपुट को नुकसान पहुंचाता है?
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| Native multimodal pretraining | "From scratch together" | Text + image + video tokens participate in the loss from step 1, not bolted on later |
| Alignment debt | "Post-hoc penalty" | Measurable regression in text skills and answer consistency that comes from bolting vision onto a frozen LLM |
| V2PE | "Variable visual pos encoding" | Per-modality learnable position encoding allocation; InternVL3's M-RoPE successor |
| ViR | "Resolution router" | Small classifier that picks minimum resolution needed per query before encoding, saving inference tokens |
| DvD | "Decoupled deployment" | Vision encoder on one GPU, LLM on another, with stream handoff; doubles throughput for large VLMs |
| InternVL-U | "Unified understanding + generation" | 2026 follow-up that adds image-generation heads to the native-pretrain backbone |
| Interleaved corpus | "OBELICS / MMC4" | Documents with text and images in natural reading order; the raw material for native pretraining |
आगे पढ़ना
- Chen et al. — InternVL 1 (arXiv:2312.14238)
- Zhu et al. — InternVL3 (arXiv:2504.10479)
- InternVL3.5 (arXiv:2508.18265)
- InternVL-U (arXiv:2603.09877)
- Zhang et al. — MM1.5 (arXiv:2409.20566)
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.