Phase 12: Multimodal AI

مدل های زبان ویدیویی: نشانه های زمانی و زمین سازی

ویدیو یه دسته عکس نیست یک کلیپ ۵ ثانیه دارای ترتیب علت، فعل های عمل و زمان وقوع رویدادها است که یک مدل تصویر نمی تواند نشان دهد. ویدیو-ایللاما (ژانگ و همکارانش، ژوئن 2023) اولین ویدیو-ایللامی باز با زمین سازی بصری را ارسال کرد. ویدئو چت و ویدئو-لاوا این الگوی را افزایش دادند. تا سال 2025 TMRoPE Qwen2.5VL با مدل های مخصوص مرز را ببندد. هر سیستم توکن های زمانی را به طور متفاوتی حل می کند Q-former در هر کلیپ، concat-pool در هر فریم، TMRoPE در هر توکن. این درس الگوها را می خواند، نمونه گیری قابی یکسره و متحرک را ایجاد می کند و وظایف زمینی زمانی را ارزیابی می کند.

Type: Build

Languages: Python (stdlib, frame sampler + temporal-grounding evaluator)

Prerequisites: Phase 12 · 08 (LLaVA-OneVision)

Time: ~180 minutes

اهداف یادگیری

  • توضیح دهید که چرا کدگذاری موقعیت زمانی عملکرد VLM ویدیو را مستقل از کدگر بینایی تغییر می دهد.
  • مقایسه نمونه گیری قاب های یکسره، پویا و متحرک FPS و مبتنی بر رویداد در توکن ها در ثانیه با دقت زمین گیری.
  • طرح های Q-former-per-clip (Video-LLaMA) vs pooled-per-frame (Video-LLaVA) vs M-RoPE-per-token (Qwen2.5-VL) را توصیف کنید.
  • چهار معیار ویدیویی را ذکر کنید: VideoMME، TempCompass، EgoSchema، Video-MMMU.

مشکل

یک ویدیو یک دقیقه ای در 30 FPS 1800 فریم است. در 196 توکن بصری در هر فریم (ViT-B در 224) ، که 352k توکن است بزرگتر از هر زمینه LLM عصر 2024 است.

سه استراتژی کاهش وجود دارد:

  1. فریم های نمونه فرعی (1-8 FPS بسته به محتوای آن).
  2. توپ های پیچ هر قاب را به صورت تهاجمی (3x3 یا 4x4 pool bilinear) جمع کنید.
  3. از طریق یک Q-former فشرده کنید که یک کلیپ 16 فریم را می گیرد و 64 توکن را خارج می کند.

هر معامله متفاوت است. نمونه گیری زیر جزئیات زمانی را از دست می دهد. جمع بندی جزئیات فضایی را از دست می دهد. Q-former هر دو را کمی از دست می دهد اما توکن ها را ذخیره می کند.

کدگذاری موقعیت زمانی محور دیگر است: چگونه مدل می داند که فریم 5 قبل از فریم 6 آمده است؟ گزینه ها شامل RoPE زمانی 1D ساده (Video-LLaMA) ، گنجانده شدن زمانی آموخته (Video-LLaVA) و TMRoPE (Qwen2.5-VL، 3D کامل) است.

مفهوم

ویدیو-LLaMA: Q-former در هر کلیپ + شاخه صوتی

Video-LLaMA (2023) اولین ویدیو-LLM باز بود. معماری:

  • کلیپ 16 فریم در 2 FPS (پس 8 ثانیه)
  • ویژگی های ViT هر فریم -> Q-former ویدئویی که در تمام 16 فریم به هم می رسد -> 32 سوال آموخته -> LLM.
  • شاخه صوتی موازی: شکل موج -> کدگر صوتی ImageBind -> Audio Q-former -> 32 سوال -> LLM.

قدرت: استدلال مشترک بصری و صوتی ضعف: طول کلیپ ثابت، بدون زمان تعسفی

ویدیو چت و ویدیو-LLaVA

VideoChat ایده Video-LLaMA را حفظ کرد اما صدا و ساده سازی را رها کرد. Video-LLaVA (Lin و همکارانش، 2023) یک کدگر بصری واحد را در هر دو تصویر و فریم ویدیویی ("تحسیم قبل از نمایش") آموزش داد. هر دو کدگر CLIP منجمد + MLP + LLM هستند.

هر دو از آنها به صورت 8-16 فریم سیستم هستند

Qwen2.5-VL و TMRoPE

Qwen2.5VL TMRoPE Temporal-Modality Rotary Position Embedding را معرفی کرد. هر نماد پیچ دارای موقعیت (t، h، w) است که t نشان زمان واقعی (نه شاخص فریم) است.

تفاوت های کلیدی از ادغام ساده زمانی:

  • زمان مطلق، نه شاخص، مدل "در 4.2 ثانیه" را می بیند نه "در فریم 15"
  • هر توکن به صورت مستقل از زمان خود دور می شود.
  • با FPS پویا سازگار است. اگر شما در 2 FPS اینجا و 4 FPS آنجا نمونه را، TMRoPE با فاصله نامساوی به طور بومی.

TMRoPE قابل است "در چه ثانیه گربه پر می شود؟" سوال. مدل می تواند "در 4.2 ثانیه". ویدیو-LLaMA فقط می تواند بگوید "در اوایل کلیپ".

استراتژی های نمونه گیری چارچوب

یکسره: نمونه N به طور مساوی در طول طول طول می کشد. ساده، از دست می دهد حرکت اوج.

FPS پویا: نمونه ای که به طور سازگار بر اساس شدت حرکت است. جریان یا فرقه ی فولاد، قطعات حرکت بالا را برای نمونه گیری کثافت تر انتخاب می کند. Qwen2.5VL بر روی این قطار می چرخد.

با توجه به اتفاقات: یک آشکارساز سبک وزن اجرا کنید، نمونه های بیشتری در جایی که عمل اتفاق می افتد.

کلید + زمینه: نمونه در مرزهای عکس + چند فریم مجاور. برای محتوای سینما استفاده می شود.

جمع بندی در هر قاب

با 1 FPS و 576 توکن در هر فریم، یک کلیپ 5 دقیقه ای 172,800 توکن است. با زمینه 128k Qwen2.5-VL-72B قابل انجام است اما گران است.

3x3 بیلینیر پول کاهش می یابد تا 64 توکن در هر فریم -> 19,200 توکن برای 5 دقیقه. نقطه شیرین برای اکثر وظایف.

جمع آوری با شدت بیشتری (6x6 -> 16 توکن در هر فریم) برای جریان کار عامل که جزئیات فضایی کمتر اهمیت دارد.

چهار معیار ویدیویی

  • ویدئوMME: درک کامل ویدئو، کوتاه + متوسط + طولانی.
  • TempCompass: استدلال زماني با حيواني، سوال "قبل" / "پس"
  • اگو اسکیما: ویدئو بلندفکر از شخص اول
  • ویدیو-MMMU: سوالات ویدیویی چند رشته ای چند راه

یک ارزیابی کامل ویدئو-VLM به چهار طرف می رسد. آنها بر محور های مختلف تاکید می کنند TempCompass همه چیز در مورد سفارش است، EgoSchema حدود 3 دقیقه استدلال است، VideoMME مدت زمان را پوشش می دهد.

فرمت های تولید زمین

فرمت های خروجی برای زمین سازی زمانی:

  • متن رایگان: " گربه در حدود 4 ثانیه می پرسه "
  • ساختار JSON: {"event": "jump", "start": 4.1, "end": 4.3}.کوين2.5 و 5 و 5 ول اين رو ترنر ميکنه
  • بر اساس توکن: ویژه<time>4.1</time>توکن ها با جواب متقابل هستند.

مبتنی بر توکن برای استفاده در جریان پایین دقیق ترین است. Qwen2.5 VL فارمت JSON محصول را مستقیماً تجزیه و تحلیل می کند.

2026 بهترین شیوه ها

برای VLM های ویدیویی در سال 2026:

  • کدرها: SigLIP 2 با M-RoPE یا TMRoPE (Qwen2.5-VL).
  • نمونه گیری فریم: FPS پویا (بعد از حرکت ۱ تا ۴) با حداکثر فریم.
  • جمع بندی هر فریم: 3×3 بیلینیر
  • خروجی: JSON ساختار یافته با زمینه های زمان + رویداد.
  • معیار: ویدئو و کوچک و متوسط + TempCompass برای عمومی؛ EgoSchema برای افق بلند.

ازش استفاده کن

code/main.pyشامل:

  • نمونه های قاب فدراسیون یکسره و پویا
  • یک ارزیابی کننده زمان سنجی: با توجه به یک رویداد "حقایق اساسی" در زمان T و یک محصول مدل، دقت با تحمل را ارزیابی کنید.
  • مقایسه بین Video-LLaMA (16 فریم، Q-former) ، Video-LLaVA (8 فریم، MLP) ، Qwen2.5-VL (FPS پویا + TMRoPE)

-باده

این درس به ما کمک می کندoutputs/skill-video-vlm-frame-planner.md. در نظر گرفتن یک کار ویدئویی (مراقب، تشخیص عمل، زمین گذاری زمانی، خلاصه سازی) ، نمونه گیری قاب، عامل جمع آوری، فرمت خروجی و سطح دقت انتظار می رود را انتخاب می کند.

تمرینات

  1. براي 3 دقيقه تيمو پختن، انتخاب يک لباس مقابل FPS پيكر و توجيه با تعداد توکن
  1. TMRoPE اضافه می کند که دقیقاً چه چیزی را یک جدول ساده گنجاندن زمانی نمی تواند انجام دهد؟
  1. یک طرح JSON برای زمین گذاری زمانی بنویسید که یک VLM می تواند یاد بگیرد. موارد خطا را شامل کنید.
  1. بخش 3 Video-LLaVA را در مورد "توافق قبل از نمایش" بخوانید چرا این بهتر از آموزش کدرهای تصویری و ویدیویی جداگانه است؟
  1. با توجه به جدول رتبه بندی VideoMME، تفاوت بین مدل برتر باز و مدل برتر اختصاصی در سال 2026 چیست؟ چقدر این تفاوت به کدگذاری زمانی نسبت به مقیاس LLM پایه مربوط است؟

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
Temporal grounding"Time-localized answers"VLM outputs a specific timestamp range for when an event happens
TMRoPE"Time-Multimodal RoPE"3D rotary position with absolute timestamps, used by Qwen2.5-VL
Dynamic FPS"Motion-aware sampling"Sample more frames in high-motion segments, fewer in static ones
Frame pooling"Spatial compress per frame"Reduce patches per frame with bilinear interpolation before the LLM
Video Q-former"Clip compressor"Cross-attention bottleneck mapping N frames to K learned queries
VideoMME"Video bench"Comprehensive short/medium/long video benchmark, 2500+ samples

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.