Phase 12: Multimodal AI

درک ویدیوی طولانی در زمینه میلیون ها زبان

یک ساعت ویدیوی 4K با 24 FPS، پیچ و ورق شده، به ترتیب 60 میلیون توکن تولید می کند. يک قسمت دو ساعته از پوکاست که نقل شده 30 هزار توکن است یک فیلم فلمی بلو رایی کامل، حتی با جمع بندی پرخاشگری فشرده شده، صدها هزار توکن است. جمینی 1.5 گوگل (مارس 2024) این عصر را با یک زمینه 10 میلیون توکن آغاز کرد، که به طور قابل اعتماد از نوار در یک تکه شین در طول یک ساعت ویدیو بازپس می آورد. LWM (Liu et al., فوریه 2024) مسیر مقیاس توجه حلقه را نشان داد. LongVILA و Video- XL مصرف را بیشتر افزایش دادند. "ویدیوآژنت" متن خام رو به "استفاده از طریق آژانس" عوض کرد. هر رویکرد یک معامله متفاوت در مورد محاسبه، یادآوری و پیچیدگی مهندسی است. اين درس به هم ميخواد

Type: Build

Languages: Python (stdlib, needle-in-haystack simulator + agentic-retrieval router)

Prerequisites: Phase 12 · 17 (video temporal tokens)

Time: ~180 minutes

اهداف یادگیری

  • محاسبه کل تعداد توکن های بصری برای ویدیو های طولانی با FPS و جمع بندی متفاوت.
  • سه مسیر مقیاس بندی را توضیح دهید: زمینه خام (Gemini 1.5) ، توجه حلقه (LWM) ، فشرده سازی توکن (LongVILA / Video-XL).
  • مقایسه VLMs ویدیو در زمینه خام با VLMs ویدیو بازیافت کننده ای (VideoAgent) در دقت و تاخیر.
  • یک آزمایش سوزن در یک تکه شین برای یک ویدیو ۳۰ دقیقه ای طراحی کنید و در یک دقیقه مشخص یادآوری را اندازه گیری کنید.

مشکل

یک فریم واحد از پچ های اندازه Qwen2.5VL با 384 رزولوشن بومی حدود 729 توکن است. در 3x3 جمع آوری این 81 توکن در هر فریم است. یک کلیپ 30 دقیقه ای با 1 FPS = 1800 فریم = 145,800 توکن. قابل انجام در سال 2025 VLM های باز، تنگ. در 2 FPS، 291,600 توکن فقط زمینه های بزرگ مناسب است.

یک فیلم 2 ساعته با 1 FPS 583k توکن است. فراتر از اکثر مدل های باز 2026؛ نیاز به جمینی 2.5 پرو یا جمع آوری به طور پرعکاسانه تر.

سه راه پله اي ظاهر شد

مفهوم

مسیر 1: زمینه خشن (Gemini 1.5، Claude Opus)

سخت افزار رو به مشکل بزنيد، زمینه رو به ميليون ها توکن ميزنيد، همه چيز رو در يک گذرگاه پيش رو پردازش کنيد.

جیمنی 1.5 پرو با 1M توکن ها راه اندازی شد؛ جیمنی 1.5 التر به 10M؛ جیمنی 2.5 پرو در 2026 ساعت های ویدیو را با اطمینان انجام می دهد. کاغذ (arXiv:2403.05530) گزارش می دهد که نوار در یک تکه شین به 99.7% تا ~ 9.5M توکن ها باز می گردد.

مهندسی: یک پیاده سازی توجه سفارشی با سلسله مراتب حافظه (مقامی + جهانی + نادر) به علاوه مسیریابی متخصص MoE برای بهره وری طولانی زمینه. به طور کامل منتشر نشده است. منبع باز نیست.

مسیر 2: توجه به حلقه (LWM، LongVILA)

توجه حلقه ای سلسله های طولانی را در دستگاه های " حلقه ای " توزیع می کند که هر دستگاه یک قطعه را در آن نگه می دارد. توجه در سراسر سلسله کامل با ارسال هر دستگاه قطعه خود به بعدی در یک الگوی حلقه ، محاسبه توجه جزئی و جمع آوری اتفاق می افتد.

LWM (Liu et al., 2024) یک مدل زمینه 1M-توکن را به این ترتیب آموزش داد. آموزش مقیاس های محاسباتی خطی با زمینه، نه مربع است.

LongVILA (arXiv:2408.10188) الگوی را به VLM ها تطبیق داد. فیلم های 1400 فریم در 192 توکن در هر فریم = 268k زمینه، با توجه به حلقه در موازی 8 راه آموزش دیده است.

مسیر 3: فشرده سازی توکن (Video-XL, LongVA)

ارزان تر از زمینه خام: قبل از اینکه LLM دنباله را ببیند، به شدت فشرده کنید.

Video-XL (arXiv:2409.14485) از یک توکن خلاصه بصری استفاده می کند: هر کلیپ از فریم های N یک توکن "تاریخ" واحد تولید می کند که در N حضور دارد. در نتیجه، LLM یک توکن خلاصه را در هر کلیپ می بیند، که به شدت زمینه را کوچک می کند.

LongVA زمینه LLM را از 200k به 2M با تکنیک "انتقال زمینه طولانی" گسترش می دهد. آموزش در متن زمینه طولانی، انتقال به ویدیو زمینه طولانی از طریق نمایندگی مشترک.

فشرده سازی توکن به خاطر آوردن زمان مشخصی برای مقیاس پذیری معامله می کند. مدل معمولا می داند چه اتفاقی افتاده اما گاهی اوقات فریم های دقیق را از دست می دهد.

راه 4: بازیافت آژانتک (آژانت ویدیویی)

به جای آن، ویدیو را به عنوان یک پایگاه داده و از یک LLM برای جستجو استفاده کنید.

ویدیوآژنت (arXiv:2403.10517):

  1. ماجرا تحصیلی سوال رو میخواد
  2. LLM از یک ابزار بازیافت برای کلیپ های مربوطه ("به من بخش هایی را با گربه نشان دهید") می خواهد.
  3. ابزار به زمان نامه های کلیپ ها مربوطه میرسد.
  4. "اللم" اون کلیپ ها رو از طریق "وی ام" میخواد
  5. LLM پاسخ را مرتب می کند یا سوالات پیگیری را می پرسد.

این الگوی LLM به عنوان عامل برای ویدیو های طولانی اعمال می شود. نتیجه گیری ارزان تر (تنها کلیپ های مربوطه کدگذاری شده) ، مهندسی سخت تر (کوالتی بازیافت می شود گلو شکنی).

معیار های مرزی سوزن در یک تکه شین

تست استاندارد متن طولانی: یک نشانگر بصری یا متنی منحصر به فرد را در یک نقطه تصادفی در ویدیو وارد کنید، سپس یک سوال را که نیاز به یادآوری آن دارد، بپرسید.

متریک: Recall@k در طول ویدئو و موقعیت نشانگر.

امتیاز جمینی 2.5 پرو >99٪ یادآوری در ویدئوهای تا 90 دقیقه ای. مدل های باز 72B (Qwen2.5-VL-72B، InternVL3-78B) در 30 دقیقه امتیاز ~85-90% و پس از 60 کاهش می یابد.

VideoAgent می تواند مدل های زمینه خام را در 2 ساعت یا بیشتر مطابقت دهد یا شکست دهد زیرا بازیافت اگر ابزار خوب باشد به سوزن می رسد.

چه راهي رو انتخاب کنم

برای یک کلیپ 15 دقیقه ای با دقت مرزی: ۷۲ بی + open native context معمولا کار می کند. Qwen2.5-VL-72B را انتخاب کنید.

برای محتوای ۳۰ دقیقه تا ۱ ساعت: LongVILA یا Video-XL برای باز؛ Gemini 2.5 Pro برای بسته.

برای محتوای 2 ساعت بیشتر: VideoAgent یا الگوهای بازیافت مشابه. به طور جایگزین، به قطعات کوچکتر خلاصه کنید و خلاصه های سلسله مراتبی را تغذیه کنید.

مدل تولید 2026

در عمل، لوله های تولید ویدئو طولانی ترکیبی هستند:

  1. نمونه گیری پویا FPS + جمع آوری پرخاشگری را در کل ویدیو اجرا کنید (نمایه جهانی 100k- توکن را بدست آورید).
  2. به یک 72B VLM برای خلاصه جهانی منتقل کنید.
  3. اگر کاربر سوالات مفصل را مطرح کند، از جمع بندی به عنوان شاخص استفاده کنید.

این ترکیب یک زمینه خام برای درک جهانی و بازیافت جزئیات محلی است.

ازش استفاده کن

code/main.py:

  • بودجه های توکن برای فیلم ها را از 1 دقیقه تا 3 ساعت با FPS + جمع آوری متفاوت محاسبه می کند.
  • شبیه سازی یک حرکت سوزن در یک تکه خیار: تزریق یک نشانگر در یک تایم استیمپ تصادفی، پرسیدن یک سوال، یادآوری امتیاز.
  • شامل یک شبیه ساز روتر بازیافت عامل است که کلیپ های خاص را برای تغذیه به یک VLM زیر جریان انتخاب می کند.

ميز ميزاني رو اجرا کن و شکاف در مقیاس رو حس کن

-باده

این درس به ما کمک می کندoutputs/skill-long-video-strategy-planner.mdبا توجه به طول و مدت ویدیو و پیچیدگی سوال، بین زمینه خام، فشرده سازی و بازیافت عامل انتخاب می کند و انتظارات تاخیر + کیفیت را محاسبه می کند.

تمرینات

  1. 45 دقیقه سخنرانی با 1 FPS 81 توکن در هر فریم
  1. یک آزمایش سوزن در یک تکه شین طراحی کنید: در چه دقیقه ای نشانگر را تزریق می کنید و فرمت دقیق سوال چیست؟
  1. مقایسه Qwen2.5-VL-72B (80k زمینه) با VideoAgent (Claude 3.5 + بازیابی) در یک ویدیو یک ساعته. کدام برنده در بازپسردن است؟ کدام برنده در تاخیر؟
  1. هزینه حافظه گوشه توجه به صورت خطی در طول ردیف و خطی در تعداد دستگاه است. توضیح دهید که چرا و چه چیزی اگر مرحله چرخش گوشه را رها کنید شکست می خورد.
  1. دوقلوها 1.5 بخش 5 در مورد سوزن در یک تکه شین مطالعه کنید. روزنامه در مورد بازنگری در مرز 1M در مقابل 10M نشان داده است؟

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
Brute context"Just more tokens"Scale LLM context to millions of tokens; process everything in one pass
Ring attention"LWM-style parallel"Distributed attention pattern where each device holds a chunk and rotates
Token compression"Summary tokens"Reduce per-clip tokens via a learned compressor before the LLM
Needle-in-haystack"NIH test"Insert a unique marker at a random point, ask model to recall it at test time
Agentic retrieval"LLM as query planner"LLM asks a retrieval tool for relevant clips, reads them via a VLM, composes answer
VideoAgent"Retrieval pattern for video"Canonical agentic-retrieval design: question -> tool -> clip -> answer

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.