Phase 12: Multimodal AI

LLaVA-OneVision: یک تصویر، چند تصویر، ویدیو در یک مدل

قبل از LLaVA-OneVision (Li و همکارانش، اوت 2024) دنیای باز VLM دارای نسب های جداگانه بود: LLaVA-1.5 برای تصاویر تک، مدل های چند تصویر مانند Mantis و VILA، مدل های ویدئویی مانند Video-LLaVA و Video-LLaMA. هرکدوم از آنها برنده شدند و در مقابل بقیه شکست خوردند. LLaVA-OneVision استدلال کرد که یک برنامه درسی واحد می تواند یک مدل را برای تسلط بر سه سناریو آموزش دهد و اثرات جدید انتقال وظایف (مهارتی یک تصویر به ویدئو صادر می شود، استدلال چند تصویر به یک تصویر صادر می شود) از مجموع متخصصان برتر است. این دستور کار به طرز فریبنده ای ساده است: بودجه ای از نشانه های بصری که در هر سناریو ثابت می ماند، به علاوه یک برنامه آموزشی صریح که از یک تصویر به OneVision (مجموعه ای از تصاویر) به ویدئو حرکت می کند. این درس بودجه، برنامه آموزشی و رفتارهای جدید را می خواند.

Type: Build

Languages: Python (stdlib, token budget solver + curriculum planner)

Prerequisites: Phase 12 · 05 (LLaVA), Phase 12 · 06 (any-resolution)

Time: ~180 minutes

اهداف یادگیری

  • بودجه ای از نشانه های بصری طراحی کنید که در ورودی های یک تصویر، چند تصویر و ویدیو ثابت باشد.
  • برنامه آموزشی سفارش بده که مهارت ها رو از یک عکس به ویدیو بدون فراموشی فاجعه بار انتقال بده
  • توضیح بده که چرا یک مدل تنها وقتی برنامه آموزشی درست انجام می شود، از متخصصین با تعداد پارامترهای مشابه بر می گردد.
  • سه قابلیت جدید را که توسط LLaVA-OneVision گزارش شده است نام دهید: استدلال چند دوربین، درخواست نشان دادن، عامل عکس صفحه نمایش آیفون.

مشکل

تصویر، چند تصویر و ویدئو هر کدام یک مدل را به طور متفاوتی تاکید می کنند.

یک تصویر نیاز به توکن های با وضوح بالا (AnyRes، ~ 2880 توکن های بصری) برای گرفتن OCR و جزئیات دقیق دارد. بودجه برای هر نمونه: یک تصویر، 2880 توکن.

چند تصویر می خواهد چندین تصویر با وضوح متوسط (~ 576 توکن هر) بنابراین استدلال در میان تصاویر متناسب با زمینه است. بودجه هر نمونه: 4-8 تصویر، 576 هر، 2300-4600 توکن.

ویدیو نیاز به بسیاری از فریم ها در رزولوشن پایین (~ 196 توکن در هر فریم پس از جمع آوری) برای ضبط پویایی زمانی دارد. بودجه هر نمونه: 8-32 فریم، 196 هر، 1600-6200 توکن.

اگر مدل های جداگانه را آموزش دهید، بودجه ای را انتخاب می کنید. اگر یک مدل را آموزش دهید، نیاز به بودجه ای دارید که بدون اینکه زمینه را خراب کنید، به طور منطقی در هر سناریو مقیاس بندی شود.

قبل از OneVision، پاسخ پیش فرض "در یک سناریو آموزش دهید، دیگران را نادیده بگیرید". Video-LLaVA ویدیو را به یک مدل تصویر با مراحل آموزش اضافی به کار برد. LLaVA-NeXT پشتیبانی از تصاویر چندگانه را با کاشی اضافه کرد. هیچ یک از سه حالت را تمیز اداره نکرد.

مفهوم

بودجه توکن وان ویژن

LLaVA-OneVision بودجه یکپارچه توکن های بصری را از حدود 3000 تا 4000 توکن در هر نمونه انتخاب می کند که به طور متفاوت در هر سناریو اختصاص داده می شود:

  • تصویر واحد: AnyRes-9 (3x3 کاشی + تمنیل) ، هر کاشی در 384 با 729 پچ، جمع بندی بی خطی تهاجمی 2x2 → 182 به هر کاشی. مجموع: 9 * 182 + 182 = 1820 توکن. یا AnyRes-4 در 729- به هر کاشی = 2916 + 729.
  • چند تصویر: هر تصویر با وضوح متوسط (384، بدون تایلینگ) ، 729 توکن بدون جمع بندی. بودجه 6 تصویر → 4374 توکن.
  • ویدیو: 32 فریم با 384 رزولوشن با 3x3 بیلینر پرجوش → 81 توکن در هر فریم. مجموع: 32 * 81 = 2592 توکن.

اختصاص تقریباً کل توکن ها را ثابت نگه می دارد. LLM هرگز یک دسته را نمی بیند که زمینه آن را نشان دهد. کدگر هندسه های مختلف را برای هر سناریو تولید می کند، اما LLM بودجه مشابهی مصرف می کند.

برنامه درسی سه مرحله ای

قطار های LLaVA-OneVision در سه مرحله:

  1. SFT یک تصویر (در مرحله SI). تمام داده ها یک تصویر و متن هستند. آموزش در ورودی AnyRes با وضوح بالا. این آموزش درک، OCR و درک نخود. از داده های LLaVA-NeXT و داده های یک تصویر خاص OneVision استفاده می کند.
  2. OneVision SFT ( مرحله OV). یک تصویر + چند تصویر + ویدئو (برم های نمونه ای یکسانی) را مخلوط کنید. بودجه توکن های یکپارچه را تمرین کنید. این به مدل یاد می دهد تا شکل های دسته های متغیر را اداره کند. هیچ تنظیم مجدد وزن از مرحله SI ادامه ندارد.
  3. انتقال وظایف ( مرحله TT). با یک ترکیب وظایف هدف ادامه دهید، معمولاً در تصاویر چندگانه یا ویدیو بسته به محصول سنگین تر است. تنظیم دقیق برای انتشار اختیاری.

مهم: نظم برنامه آموزشی مهم است. آموزش ویدئو اول یا چند تصویر اول عملکرد تصویر بدتر از یک تصویر اول را تولید می کند، حتی با داده های مشابه. مقاله به طور صریح این را حذف می کند.

چرا برنامه ی آموزشی کار می کند

آموزش یک تصویر پایه درک را ایجاد می کند. توکن های پیچ دارای ویژگی های بصری نازک هستند؛ LLM یاد می گیرد که آنها را با متن ادغام کند. تصاویر چندگانه و ویدئو چالش های ساختاری را (چه تصویر است که چه چیزی است، چه اتفاقی است که در ابتدا افتاد) که بدون پایه درک قوی دشوار است، معرفی می کند.

اگر همه سناریوهای را از ابتدا به هم آموزش دهید، مدل درک (داده های محدود یک تصویر در هر دسته) و ساختار بیش از حد (داده های چند تصویر / ویدیو) را زیرنظر می گیرد. نتیجه: یک مدل که از الگوهای استدلال تصویر عبور می کند اما بصری سطحه است.

ترتیب برنامه درسی به شما قدرت درک از مرحله SI، سپس استدلال ترکیب/زمان از مرحله OV می دهد، بدون اینکه هر دو را از دست بدهید.

مهارت های جدید در زمینه سناریو

مقاله LLaVA-OneVision سه قابلیت جدید را گزارش می دهد:

  1. استدلال چند دوربین. آموزش داده شده در چند تصویر + ویدیو به طور جداگانه؛ در نتیجه، از شما خواسته شده تا در مورد یک صحنه رانندگی چند دوربین استدلال کنید. مدل به درستی دیدگاه ها را با وجود اینکه هرگز در آموزش آن فرمت دقیق را ندیده است، به طور صحیح ادغام می کند.
  2. درخواست نشان دادن مجموعه. کاربر با علامت های شماره گذاری شده، اشیاء را در یک تصویر یادداشت می کند؛ مدل استدلال می کند که "نمره 3 نسبت به نمره 7 چه می کند". آموزش داده شده است که نه بر روی علامت ها و نه به خاطراتی؛ از ترکیب زمین گذاری فضایی + مرجع چند تصویر یاد گرفته شده است.
  3. آدرس صفحه نمایش آیفون. کاربر یک صفحه نمایش صفحه نمایش آیفون را ارائه می دهد و از شما می خواهد کلیک بعدی را برنامه ریزی کنید. آموزش در صفحه نمایش UI، ویدیو از جریان کار کاربر و چند تصویر قبل / بعد از جفت ها. به صورت استفاده از آدرس عمومی می شود.

این ها وظایف آموزش دیده نیستند، بلکه از ساختار ترکیب برنامه درسی می آیند.

جمع آوری نشانه های بصری

بودجه توکن نیازمند جمع آوری است. OneVision از بین بردن دو خطی در شبکه پچ 2D استفاده می کند: 24x24 = 576 تکه به 12x12 = 144 (2x فاکتور) یا 8x8 = 64 (3x فاکتور) تبدیل می شود. جمع آوری در فضای تکه-تکه انجام می شود، نه فضای توکن، برای حفظ محل.

انتخاب عامل جمع بندی در هر سناریو خود یک پارامتر فوق العاده است. جمع بندی کمتر = توکن های بیشتر = نمایش غنی تر. جمع بندی بیشتر = توکن های کمتر = فریم های بیشتر / تصاویر مناسب.

LLaVA-OneVision-1.5

در سال 2025 پیگیری (LLaVA-OneVision-1.5, arXiv 2509.23661) "به طور کامل باز" در داده های آموزشی، وزن مدل و کد است. تفاوت مالکیت در برخی معیارها را مطابقت می دهد و دستور را دموکراتیک می کند. برنامه آموزشی مشابه، داده های بیشتر، پایه LLM بهتر است. هیچ تغییر معماری نیست.

مقایسه با Qwen2.5 - VL

Qwen2.5-VL (درسی 12.09) انتخاب های مختلفی را انجام می دهد. این از M-RoPE و FPS پویا به جای جمع بندی ثابت استفاده می کند. مقیاس بودجه آن با ورودی یک ویدیو 1 دقیقه ای از توکن های بیشتری نسبت به یک ویدیو 5 ثانیه استفاده می کند. LLaVA-OneVision بودجه را تنظیم می کند و جمع بندی را مقیاس می دهد. هر دو کار می کنند؛ آنها پیکربندی را برای پیش بینی می کنند.

ازش استفاده کن

code/main.pyیک برنامه درسی و برنامه ریزی بودجه برای یک VLM سبک OneVision است. با توجه به بودجه توکن در هر نمونه و ترکیبی سناریوی هدف (به عنوان مثال 40٪ یک تصویر، 30٪ چند تصویر، 30٪ ویدیو) ، این:

  • رزولوشن، عامل جمع آوری و فریم ها را به هر سناریو اختصاص می دهد.
  • بررسی می کند که هر سناریو در بودجه مشترک قرار دارد.
  • گزارش ها تعداد انتظار شده توکن ها، FLOP های LLM و سناریوهای زیر توکن شده را ارائه می دهند.
  • برنامه آموزش مرحله به مرحله چاپ می کند.

ازش براي برنامه ريزي کردن يک تعديل خوب OneVision استفاده کن يا براي بررسی عقل و عقل هزینه هر درخواست براي تعيين VLM

-باده

این درس به ما کمک می کندoutputs/skill-onevision-budget-planner.md. با توجه به توزیع وظایف هدف و بودجه هر نمونه، آن فاکتور AnyRes، جمع بندی هر فریم، تعداد فریم های ویدیو و وزن مراحل برنامه در هر زمان که شما آموزش و یا تنظیم دقیق یک سناریو VLM.

تمرینات

  1. محصول شما از 80٪ یک تصویر، 10٪ چند تصویر (2-4 تصویر) ، 10٪ ویدئو (8-16 فریم) پشتیبانی می کند. بودجه توکن را طراحی کنید. بودجه اضافی را که از انجام چند تصویر سنگین صرفه جویی می کنید کجا می گذارید؟
  1. بخش 4.3 (قدرات نوظهور) LLaVA-OneVision را بخوانید. یک مهارت نوظهور چهارم را پیشنهاد کنید که برنامه درسی احتمالاً باز خواهد کرد اما مقاله گزارش نکرده است.
  1. ترتیب برنامه درسی را تغییر دهید ابتدا چند تصویر را آموزش دهید، سپس یک تصویر، سپس ویدیو. پیش بینی کنید که کدام معیارها کاهش می یابد و چرا.
  1. این مقاله گزارش می دهد که معیار های ویدیویی که تنها با 8 فریم در هر نمونه آموزش دیده اند، منتشر شده است. آیا این به ویدیوهای 30 ثانیه ای در نتیجه عام می شود؟ چه چیزی ابتدا از بودجه توکن یا استدلال زمانی شکسته می شود؟
  1. جمع بندی دو خطی از 24×24 پیچ به 12×12 کاهش 4x در هر dim است. جمع بندی را در stdlib Python اجرا کنید و بررسی کنید که متوسط هر بلوک 2×2 با محصول دو خطی مطابقت دارد.

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
OneVision scenario"Single-image, multi-image, or video"One of three input shapes the unified VLM handles; the budget stays constant across
Token budget"How many tokens per sample"Total visual tokens the LLM sees per training / inference sample, typically 3000-4000
Curriculum"Training order"Stage ordering (single-image → multi-image → video) chosen for emergent transfer
Bilinear pooling"Token shrink"Applying bilinear interpolation to the patch grid (2D) to reduce token count while preserving locality
Emergent skill"Not trained, still works"Capability that appears at inference without matching training data, due to curriculum composition
AnyRes-k"k-tile setup"k sub-tiles of fixed resolution plus one thumbnail, typical k ∈ {4, 9}
Task transfer"Cross-scenario generalization"Skills learned on single-image that apply to video (and vice versa) via shared backbone

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.