Phase 12: Multimodal AI

इंटरवीएल3: मूल बहुआयामी पूर्व प्रशिक्षण

InternVL3 से पहले हर खुला VLM ने तीन चरणों के एक ही नुस्खा का पालन कियाः एक पाठ LLM ले लो जो ट्रिलियन पाठ टोकन पर प्रशिक्षित है, एक दृष्टि एन्कोडर पर बोल्ट करें, फिर सीम को ठीक से ट्यून करें। यह काम करता है लेकिन संरेखण ऋण है पाठ LLM ने शुद्ध पाठ पर अपने पूर्ण पूर्व प्रशिक्षण बजट खर्च किया है और मूल रूप से दृश्य टोकन को नहीं समझता है। जब आप पोस्ट-होक दृष्टि जोड़ते हैं, तो एलएलएम को पाठ को भूलकर भी पाठ के तर्क से दृश्य प्रविष्टि को कैसे जोड़ना है, उसे फिर से सीखना होगा। इंटरवीएल3 (ज़ू एट एले, अप्रैल 2025) पोस्ट-होक दृष्टिकोण को खारिज करता हैः एक पूर्व-प्रशिक्षण रन, पाठ और मल्टीमोडल चरण एक से अंतःस्थापित। परिणाम 78B पर खुले एमएमएमयू-प्रो पर मिथुन 2.5 प्रो से मेल खाता है। यह सबक मूल पूर्व प्रशिक्षण के मामले को पढ़ता है और जब आप इसे करते हैं तो क्या बदलता है।

Type: Learn

Languages: Python (stdlib, training-corpus mixer)

Prerequisites: Phase 12 · 05, Phase 12 · 07 (recipes)

Time: ~120 minutes

सीखने के लक्ष्य

  • स्पष्ट करें कि पोस्ट-होक वीएलएम प्रशिक्षण में संरेखण ऋण क्यों जमा होता है, तीन मापने योग्य लक्षणों (विपत् भूल, उत्तर बहाव, दृश्य-पाठ असंगति) का उल्लेख करते हुए।
  • InternVL3 के मूल पूर्व प्रशिक्षण कॉर्पस मिश्रण का वर्णन करें और पाठ के अनुपातः इंटरलेटेडः कैप्शन क्यों मायने रखता है।
  • Qwen2-VL के M-RoPE के साथ V2PE (भयावह दृश्य स्थिति एन्कोडिंग) की तुलना करें।
  • विज़ुअल रिज़ॉल्यूशन राउटर (ViR) और डिकोप्ल्ड विजन-भाषा (DvD) तैनाती अनुकूलन का नाम दें।

समस्या

पोस्ट-होक वीएलएम प्रशिक्षण डिफ़ॉल्ट है। एलएलएवीए, बीएलआईपी-2, क्यूवेन-वीएल, आइडियाफिक्स सभी पहले से ही पूर्व-प्रशिक्षित एलएलएम (लामा, विकुना, क्यूवेन, मिस्ट्रल) लेते हैं और दृष्टि जोड़ते हैं। प्रशिक्षण चरण आमतौर पर इस तरह दिखते हैंः

  1. जमे हुए एलएलएम + जमे हुए दृष्टि एन्कोडर + प्रशिक्षित प्रोजेक्टर, एम्बेडमेंट्स को संरेखित करने के लिए कैप्शन जोड़े पर प्रशिक्षित।
  2. अनफ्रीज LLM, प्रशिक्षण के डेटा पर प्रशिक्षण (LLaVA-Instruct, ShareGPT4V) ।
  3. वैकल्पिक कार्य-विशिष्ट सूक्ष्म-ट्यूनिंग।

संरेखण ऋण के तीन लक्षण प्रकट होते हैंः

  • विनाशकारी भूलना. पोस्ट-हॉक VLM केवल पाठ कौशल भूल जाता है. GSM8K स्कोर 5-10 अंक गिर जाता है. हेलस्वाग स्कोर गिर जाता है. शुद्ध पाठ एजेंटों में गिरावट.
  • उत्तर बहाव। एक ही दृश्य प्रश्न के छोटे वाक्यांशों को अलग-अलग उत्तर मिलते हैं। दृष्टि एन्कोडर LLM के अपने टोकन की तुलना में कम कमजोर बंधन के साथ LLM से जुड़ता है।
  • दृश्य-पाठ असंगति। VLM एक छवि का सही ढंग से वर्णन कर सकता है और फिर अपने स्वयं के विवरण के विपरीत एक प्रश्न का उत्तर दे सकता है। दृश्य टोकन एलएलएम के आंतरिक स्थिरता जांच में भाग नहीं लेते हैं।

ये लक्षण अच्छी तरह से प्रलेखित हैं। एमएम 1.5 धारा 4 उन्हें मात्राबद्ध करती है। एलएवीए-वनविज़न के अवशेष उन्हें संकेत देते हैं। मूल पूर्व प्रशिक्षण इसका जवाब है।

अवधारणा

मूल बहुआयामी पूर्व प्रशिक्षण

इंटरवीएल 3 एक कोरपस पर खरोंच से ट्रेन करता है जो मूल मल्टीमोडल है। मिश्रण हैः

  • 40% केवल पाठ डेटा (फाइनवेब, प्रूफ-पाइल-2 आदि)
  • 35% परस्पर चित्र-पाठ डेटा (OBELICS, MMC4-शैली)
  • 20% जोड़ी छवि कैप्शन डेटा
  • 5% वीडियो पाठ डेटा

दृष्टि टोकन, पाठ टोकन और क्रॉस-मोडल इंटरैक्शन सभी पहले ग्रेडिएंट चरण से एक ही नुकसान में भाग लेते हैं। कोई संरेखण पूर्व प्रशिक्षण, कोई प्रोजेक्टर जमे हुए चरण, कोई आपदा नहीं भूलना।

प्रशिक्षण मूल मॉडल के लिए एक एकल चरण है। निर्देश ट्यूनिंग का अनुसरण करता है, लेकिन मूल मॉडल पहले से ही प्रथम श्रेणी के नागरिकों के रूप में दृश्य टोकन को समझता है।

V2PE (भारीब दृश्य स्थिति एन्कोडिंग)

Qwen2-VL M-RoPE का उपयोग फिक्स्ड एक्सिस आवंटन के साथ करता है। InternVL3 V2PE को पेश करता हैः स्थिति एन्कोडिंग सीखने योग्य स्केलिंग के साथ मोडलिटी प्रकार (पाठ, छवि, वीडियो) के अनुसार भिन्न होती है।

  • पाठ टोकन 1D स्थिति प्राप्त (पाठ सूचकांक) ।
  • छवि पैच 2D स्थिति प्राप्त (पंक्ति, कॉल) ।
  • वीडियो फ्रेम 3D स्थिति (समय, पंक्ति, कॉल) प्राप्त करते हैं।

तीनों में एक ही RoPE आवृत्ति आधार होता है, लेकिन प्रत्येक बैंड पर छिपे हुए-डिम आवंटन एक निश्चित विभाजन के बजाय एक सीखा पैरामीटर है। पूर्व-प्रशिक्षण के दौरान समय और स्थानिक आवृत्ति संकल्प के साथ व्यापार करने की स्वतंत्रता।

V2PE के ablation दावाः एक ही गणना पर M-RoPE पर वीडियो बेंचमार्क पर 1-2 अंक. एक क्रांति नहीं, लेकिन स्वच्छ.

दृश्य संकल्प राउटर (ViR)

तैनाती अनुकूलन. सभी छवियों को पूर्ण-रिज़ॉल्यूशन एन्कोडिंग की आवश्यकता नहीं है। कम विवरण पर एक वस्तु के साथ एक फोटो 1280px नेटिव में एन्कोड होने पर टोकन बर्बाद करती है। ViR एक छोटा वर्गीकरण है जो एन्कोडिंग से पहले प्रश्न का उत्तर देने के लिए आवश्यक न्यूनतम संकल्प की भविष्यवाणी करता है।

रूटिंग में तीन स्तर हैंः कम-रिज़ॉल्यूशन (256 टोकन), मध्यम (576), उच्च (2048+) । उत्पादन यातायात में 60% क्वेरी के लिए, कम या मध्यम पर्याप्त है। शुद्ध प्रभावः 2-3x समान गुणवत्ता पर पारगमन।

विजन-भाषा (डीवीडी) डिस्कॉप्ल्ड डिप्लोयमेंट

जब आप एक बड़े VLM की सेवा करते हैं, तो विजन एन्कोडर प्रति छवि एक बार चलता है लेकिन LLM प्रत्येक आउटपुट टोकन के लिए ऑटोरेग्रेसिव रूप से चलता है। दोनों घटकों में अलग-अलग बोतल की खाई होती है (विजन = GPU मेमोरी बैंडविड्थ के लिए conv + ध्यान; LLM = KV कैश) । डीवीडी उन्हें अलग-अलग GPU पर विभाजित करता है।

8B + 400M एन्कोडर मॉडल के लिए, डीवीडी लगभग प्रति नोड आउटपुट बनाम सह-स्थानिककरण को दोगुना करता है।

एकल-चरण बनाम बहु-चरण गुणवत्ता

इंटरवीएल 3 का प्राथमिक बेंचमार्क दावाः 78 बी पैरामेड पर, जेमिनी 2.5 प्रो के एमएमएमयू-प्रो से मेल खाता है। 38 बी पर, जीपीटी-4ओ से मेल खाता है। 8 बी पर, ओपन-8 बी लीडरबोर्ड का नेतृत्व करता है। सभी एक एकल चरण प्री-ट्रेन + निर्देश-ट्यूनिंग नुस्खा पर।

संरेखण-ऋण परिकल्पना मापी जा सकती हैः इंटरवीएल 3-8बी प्रति दृष्टि-बेंचमार्क लाभ इकाई की तुलना में कम पाठ-बेंचमार्क अंक (एमएमएलयू, जीएसएम 8 के) खोता है। मॉडल अधिक सामान्यवादी है क्योंकि प्रशिक्षण एक टुकड़ा था, न कि दो।

इंटरव्यूएल3.5 और इंटरव्यूएल-यू

इंटरवीएल 3.5 (अगस्त 2025) नुस्खा को स्केल करता है। समान मूल-पूर्व-प्रशिक्षण दृष्टिकोण, अधिक डेटा, अधिक पैरामेट्स। एमएमयू में सुधार क्रमिक हैं।

InternVL-U (2026) एक ही रीढ़ की हड्डी के ऊपर MMDiT हेड के माध्यम से एकीकृत पीढ़ी छवि आउटपुट जोड़ता है। "U" "U" के लिए खड़ा है, "Understanding + generation", ट्रांसफ्यूजन-शैली के एकीकृत मॉडल (लेक्शन 12.13) का पीछा करता है। एक ही मूल-पूर्व-प्रशिक्षित रीढ़ की हड्डी दोनों को समझने और पीढ़ी के हेड का समर्थन करती है।

मूल पूर्व प्रशिक्षण के व्यापारिक अंतर

मूल पूर्व प्रशिक्षण निःशुल्क नहीं हैः

  • कम्प्यूटिंग. नए वीएलएम को खरोंच से प्रशिक्षित करने की लागत पाठ एलएलएम को प्रशिक्षित करने के समान है लाखों जीपीयू-घंटे। पोस्ट-हॉक अनुकूलन मौजूदा एलएलएम वजन का पुनः उपयोग करता है, अधिकांश लागत को बचाता है।
  • डेटा. पैमाने पर इंटरलेवेड छवि-पाठ कॉर्पो दुर्लभ हैं। ओबेलिक्स 141M दस्तावेज है; एमएमसी 4 571M है। अकेले पाठ 15T टोकन पर जहाज करता है। मल्टीमोडल प्रीट्रेनिंग डेटा की कमी एक कठिन प्रतिबंध है।
  • मूल-एलएलएम पुनः उपयोग. मूल पूर्व प्रशिक्षण बाद में एक नया एलएलएम छोड़ने का विकल्प देता है। पोस्ट-हॉक आपको केवल एडाप्टर को पुनः प्रशिक्षित करके एलएमए-3.1 को एलएमए-4 के लिए बदल देता है।

इंटरवीएल 3 का दांव हैः संरेखण ऋण पुनः उपयोग हानि से भी बदतर है। बेंचमार्क दावा का समर्थन करते हैं। उत्पादन लागत भविष्य की प्रयोगशालाओं को सस्ते में प्रतिकृति से रोकती है। पोस्ट-हॉक वीएलएम अस्तित्व में रहेंगे क्योंकि वे अधिकांश परियोजनाओं के लिए सस्ते बने रहेंगे।

इसका प्रयोग करें

code/main.pyएक प्रशिक्षण-कर्पस मिक्सर और वीआर राउटर सिम्युलेटर है। यहः

  • लक्ष्य कॉर्पस मिश्रण (% पाठ, % अंतराल, % उपशीर्षक, % वीडियो) लेता है और modality के अनुसार अपेक्षित चरणों की गणना करता है।
  • एक बैच के सवालों पर ViR राउटिंग का अनुकरण करता है (वितरणः 50% कम विवरण, 30% मध्यम, 20% उच्च विवरण) और टोकन औसत संख्या की रिपोर्ट करता है।
  • एनकोडर बनाम एलएलएम फ्लोप दिए गए डीवीडी आउटपुट अनुमानों की रिपोर्ट करता है।
  • पैरामेट्स, कम्प्यूटिंग, डेटा और अपेक्षित संरेखण-ऋण लक्षणों में पोस्ट-होक बनाम मूल पूर्व प्रशिक्षण का एक साथ प्रिंट करता है।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-native-vs-posthoc-auditor.md. एक प्रस्तावित वीएलएम प्रशिक्षण योजना को देखते हुए, यह ऑडिट करता है कि क्या इसे मूल या पोस्ट-होक करना है, संरेखण-ऋण जोखिम को चिह्नित करता है, और एक कॉर्पस मिश्रण की सिफारिश करता है।

व्यायाम

  1. इंटरव्यूएल 3-8बी (नेटिव प्रीट्रेन) और एलएलएवीए-वनविज़न 7बी (पोस्ट हॉक) के बीच गणना डेल्टा का अनुमान लगाएं। GPU-घंटे का अनुपात लगभग? अंतर क्या है?
  1. InternVL3 40% पाठ / 35% इंटरलेवेड / 20% कैप्शन / 5% वीडियो रिपोर्ट करता है। यदि आपका लक्ष्य कार्य वीडियो भारी है, तो एक नया अनुपात प्रस्तावित करें और तर्क दें कि मूल मॉडल को अभी भी पर्याप्त पाठ और कैप्शन डेटा की आवश्यकता क्यों है।
  1. भूलने पर एमएम 1.5 सेक्शन 4 पढ़ें. पोस्ट-होक प्रशिक्षण में सबसे बड़ी गिरावट दिखाई गई सटीक बेंचमार्क का नाम दें। गिरावट की लागत कितनी थी?
  1. ViR 60% ट्रैफ़िक को निम्न-रिज़ॉल्यूशन एन्कोडिंग को रूट करता है। यह किस प्रकार के क्वेरी को गलत तरीके से भेजता है (जब उच्च-रिज़ॉल्यूशन की आवश्यकता होती है तो कम-रिज़ॉल्यूशन को भेजता है)? तीन रूटर-फेल मोड प्रस्तावित करें।
  1. डीवीडी विजन और एलएलएम को अलग-अलग जीपीयू में विभाजित करता है। किस ट्रैफिक पैटर्न के तहत डीवीडी मदद करने के बजाय आउटपुट को नुकसान पहुंचाता है?

प्रमुख शर्तें

TermWhat people sayWhat it actually means
Native multimodal pretraining"From scratch together"Text + image + video tokens participate in the loss from step 1, not bolted on later
Alignment debt"Post-hoc penalty"Measurable regression in text skills and answer consistency that comes from bolting vision onto a frozen LLM
V2PE"Variable visual pos encoding"Per-modality learnable position encoding allocation; InternVL3's M-RoPE successor
ViR"Resolution router"Small classifier that picks minimum resolution needed per query before encoding, saving inference tokens
DvD"Decoupled deployment"Vision encoder on one GPU, LLM on another, with stream handoff; doubles throughput for large VLMs
InternVL-U"Unified understanding + generation"2026 follow-up that adds image-generation heads to the native-pretrain backbone
Interleaved corpus"OBELICS / MMC4"Documents with text and images in natural reading order; the raw material for native pretraining

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.