InternVL3: آموزش های پیش از راه اندازی مولتیمولد بومی
Type: Learn
Languages: Python (stdlib, training-corpus mixer)
Prerequisites: Phase 12 · 05, Phase 12 · 07 (recipes)
Time: ~120 minutes
اهداف یادگیری
- توضیح دهید که چرا آموزش پس از عمل در VLM بدهی های تعاونی را جمع می کند و سه نشانه قابل اندازه گیری را بیان کنید (هوشناک فراموشی، جواب گیری، عدم سازگاری بینایی و متن).
- ترکیب کورپوس پیش از آموزش InternVL3 را توصیف کنید و چرا نسبت متن: متقابل: عنوان مهم است.
- مقایسه V2PE (تعدیل موقعیت بینایی متغیر) با M-RoPE Qwen2-VL.
- نام روتر رزولوشن بصری (ViR) و بهینه سازی های انتشار زبان دید (DvD) را نام دهید.
مشکل
آموزش پس از دوره VLM به طور پیش فرض است. LLaVA، BLIP-2, Qwen-VL، Idefics همه یک LLM پیش از آموزش (Llama، Vicuna، Qwen، Mistral) را می گیرند و چشم را اضافه می کنند. مراحل آموزش معمولا شبیه به:
- فریز LLM + کدگر بینایی منجمد + پروژکتور قابل آموزش، آموزش داده شده در جفت های عنوان برای هماهنگی گنجانده شده.
- غیرجمرگی LLM، آموزش در داده های آموزش (LLaVA-Instruct، ShareGPT4V).
- تنظیمات خاص به وظایف
سه نشانه بدهی های تعادل ظاهر می شود:
- فراموشي فاجعه بار، وي اِل اِم اِم بعد از هُک، مهارت هاي فقط متن را فراموش مي کند، نمرات GSM8K 5-10 نمره کاهش می یابد، نمرات هِلَس واگ کاهش می یابد، عوامل متن خالص بازپسین می شوند.
- جواب درفت. عبارت های کوچک از یک سوال بصری پاسخ های متفاوتی را دریافت می کنند. کدر بینایی با اتصال ضعیف تر به LLM نسبت به توکن های LLM خود متصل می شود.
- عدم مطابقت بینایی متن. VLM می تواند یک تصویر را به درستی توصیف کند و سپس به یک سوال که با توصیف خود متناقض است پاسخ دهد. توکن های بینایی در چک های منسجمیت داخلی LLM به همان شیوه که متن انجام می دهد شرکت نمی کنند.
این علائم به خوبی مستند شده است. بخش MM1.5 آنها را مقداری می کند. LLaVA-OneVision از آنها اشاره دارد. پیش از آموزش بومی پاسخ است.
مفهوم
پیش آموزش مولتی مدال بومی
InternVL3 از ابتدا در یک کورپوس که از مرحله اول مولتیمول است، قطار می کند.
- ۴۰٪ اطلاعات تنها متن (FineWeb، Proof-Pile-2 و غیره)
- ۳۵٪ داده های متقابل تصویر (OBELICS، سبک MMC4)
- ۲۰٪ داده های جفت بندی تصویر
- ۵٪ داده های ویدئویی
توکن های بینایی، توکن های متن و تعاملات متقابل همه از مرحله اول گرادیانت به همان ضرر شرکت می کنند. هیچ تعدیل قبل از تمرین، هیچ مرحله ی یخ زدن پروژکتور، هیچ فراموشی فاجعه بار برای بازیابی از.
آموزش برای مدل پایه یک مرحله است. تنظیم دستورالعمل بعد می آید، اما مدل پایه از قبل به عنوان شهروندان درجه اول توکن های بصری را درک می کند.
V2PE (تعدیل موقعیت بینایی متغیر)
Qwen2-VL از M-RoPE با تخصیص محور ثابت استفاده می کند. InternVL3 V2PE را معرفی می کند: کدگذاری موقعیت در هر نوع روش (متن، تصویر، ویدیو) با مقیاس سازی قابل یادگیری متفاوت است. در عمل:
- توکن های متن موقعیت یک بعدی (نندکس متن) را دریافت می کنند.
- پیچ های تصویر موقعیت 2D را (خط، ستون) دریافت می کنند.
- فریم های ویدیویی موقعیت 3D (زمان، صف، کول) را دریافت می کنند.
سه تا از این گروه ها پایه ی فرکانس RoPE را دارند، اما توزیع پنهان-dim در هر باند یک پارامتر آموخته شده است نه یک تقسیم ثابت. آزادی برای معامله با قطعنامه فرکانس زمانی در طول تمرین.
ادعای آبلاسیون V2PE: 1-2 امتیاز در معیار های ویدیویی نسبت به M-RoPE در همان محاسبه. نه یک انقلاب، بلکه تمیز تر.
روتر با وضوح بصری (ViR)
بهینه سازی انتشار. همه تصاویر نیاز به کدگذاری با وضوح کامل ندارند. یک عکس با یک شی در جزئیات کم توکن ها را از بین می برد وقتی در 1280px بومی کدگذاری می شود. ViR یک طبقه بندی کننده کوچک است که پیش بینی حداقل وضوح مورد نیاز برای پاسخ به سوال قبل از کدگذاری می کند.
مسیر به سه سطح تقسیم می شود: کم وضوح (256 توکن) ، متوسط (576) و بالا (2048+). برای 60٪ از سوالات در ترافیک تولید، کم یا متوسط کافی است. اثر خالص: 2-3x تولید با کیفیت برابر.
استفاده از زبان دید و غیر متصل (DvD)
هنگامی که شما یک VLM بزرگ را خدمت می کنید، کدگر بینایی یک بار در هر تصویر اجرا می شود اما LLM به صورت خودکار برای هر توکن خروجی اجرا می شود. دو قطعه دارای گلوهای مختلف هستند (بین = عرض باند حافظه GPU برای conv + توجه؛ LLM = KV cache). DvD آنها را به GPU های جداگانه با جریان بین آنها تقسیم می کند.
برای یک مدل کدرها 8B + 400M، DvD تقریباً دو برابر تولید در هر گره نسبت به محل قرار دارد.
کیفیت یک مرحله در مقابل چند مرحله
ادعای اصلی InternVL3: در 78B پارام، با MMMU-Pro Gemini 2.5 Pro مطابقت دارد. در 38B، با GPT-4o مطابقت دارد. در 8B، برتری open-8B را بر سر می گذارد. همه بر روی یک مرحله پیش از آموزش + دستورات ترکیب.
فرضیه بدهی خط بندی قابل اندازه گیری است: InternVL3-8B از دست دادن نقاط معیار متنی کمتر (MMLU، GSM8K) از Qwen2.5-VL-7B در هر واحد از افزایش شاخص بینایی است. مدل بیشتر از یک عمومی است زیرا آموزش یک قطعه بود نه دو.
InternVL3.5 و InternVL-U
InternVL3.5 (آگوست 2025) دستور العمل را مقیاس بندی می کند. همان رویکرد پیش آموزش بومی، داده های بیشتر، پارام های بیشتر. بهبود MMMU تدریجی است.
InternVL-U (2026) از طریق MMDiT سر ها در بالای یک ستون فقرات، تولید تصاویر یک نسل را اضافه می کند. "U" برای "فهمی + نسل" است که به دنبال مدل های یکپارچه سبک ترانسفوزن است (درسی 12.13). همان ستون فقرات پیش آموزش بومی هم از درک و هم از نسل پشتیبانی می کند.
تعادلات پیش آموزش بومی
آموزش پیش از آموزش بومی رایگان نیست:
- محاسبه. آموزش یک VLM جدید از ابتدا هزینه های مشابه آموزش یک متن LLM میلیون ساعت GPU است. سازگاری پس از پس از کار دوباره وزن LLM موجود را استفاده می کند، بیشتر هزینه ها را صرفه جویی می کند.
- داده ها. کارپوریتی های متناوب تصویر-متن در مقیاس نادر هستند. OBELICS 141M اسناد است؛ MMC4 571M. تنها متن در توکن های 15T ارسال می شود. کمبود داده های قبل از آموزش چندمودال یک محدودیت سخت است.
- استفاده مجدد از LLM پایه. پیش آموزش بومی گزینه ای را برای ورود به LLM جدید در آینده رها می کند. پس از عمل به شما امکان می دهد Llama-3.1 را با تغییر دادن فقط آداپتور به Llama-4 تغییر دهید.
شرط InternVL3: بدهی تعاونی بدتر از خسارت استفاده مجدد است. معیارها ادعا را پشت سر می گذارند. هزینه تولید آزمایشگاه های آینده را از تکرار ارزان جلوگیری می کند. VLM های پس از تعاونی همچنان وجود خواهند داشت زیرا برای اکثر پروژه ها ارزان تر هستند.
ازش استفاده کن
code/main.pyیک مخلوط کننده آموزش و کارپوس و شبیه ساز روتر ViR است.
- یک ترکیب corpus هدف (% متن، % interleaved، %caption، %video) را می گیرد و مراحل انتظار شده را به صورت روش محاسبه می کند.
- شبیه سازی مسیر ViR در یک دسته از سوالات (توزین: 50٪ کم جزئیات، 30٪ متوسط، 20٪ بالا جزئیات) و گزارش متوسط تعداد توکن.
- گزارش تخمین های تولید DvD داده شده در مورد کدگر در مقابل FLOP LLM.
- یک برنامه پیش از آموزش پس از بازی و پیش از آموزش در پارام، محاسبات، داده ها و علائم انتظار می رود.
-باده
این درس به ما کمک می کندoutputs/skill-native-vs-posthoc-auditor.mdدر نظر گرفتن یک طرح آموزش VLM پیشنهادی، آن بررسی می کند که آیا باید به صورت بومی یا پس از دوره، خطری را از تعادل و بدهی نشان می دهد و ترکیبی corpus را توصیه می کند.
تمرینات
- در واقع، در این مورد، در نظر گرفته می شود که در حال حاضر در این زمینه، در حال بررسی و بررسی است.
- InternVL3 گزارش 40% متن / 35% متقابل / 20% عنوان / 5% ویدئو. اگر وظیفه هدف شما سنگین ویدئو است، نسبت جدیدی را پیشنهاد کنید و استدلال کنید که چرا مدل پایه هنوز به داده های متن و عنوان نیاز دارد.
- بخش 4 درباره فراموش کردن را بخوانید. شاخص دقیق را که در آن آموزش پس از هک بیشترین بازگشت را نشان داد، نام ببرید. هزینه بازگشت چقدر بود؟
- ViR ۶۰ درصد ترافیک را به کد گذاری با رزولوشن پایین هدایت می کند. چه نوع سوالاتی را اشتباه هدایت می کند (در زمان نیاز به رزولوشن بالا به رزولوشن پایین می فرستد) ؟ سه حالت شکست روتر را پیشنهاد کنید.
- DvD بینایی و LLM را به GPU های جداگانه تقسیم می کند. در چه الگوی ترافیک DvD به جای کمک به تولید آسیب می رساند؟
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| Native multimodal pretraining | "From scratch together" | Text + image + video tokens participate in the loss from step 1, not bolted on later |
| Alignment debt | "Post-hoc penalty" | Measurable regression in text skills and answer consistency that comes from bolting vision onto a frozen LLM |
| V2PE | "Variable visual pos encoding" | Per-modality learnable position encoding allocation; InternVL3's M-RoPE successor |
| ViR | "Resolution router" | Small classifier that picks minimum resolution needed per query before encoding, saving inference tokens |
| DvD | "Decoupled deployment" | Vision encoder on one GPU, LLM on another, with stream handoff; doubles throughput for large VLMs |
| InternVL-U | "Unified understanding + generation" | 2026 follow-up that adds image-generation heads to the native-pretrain backbone |
| Interleaved corpus | "OBELICS / MMC4" | Documents with text and images in natural reading order; the raw material for native pretraining |
خواندن بیشتر
- Chen et al. — InternVL 1 (arXiv:2312.14238)
- Zhu et al. — InternVL3 (arXiv:2504.10479)
- InternVL3.5 (arXiv:2508.18265)
- InternVL-U (arXiv:2603.09877)
- Zhang et al. — MM1.5 (arXiv:2409.20566)
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.