Phase 12: Multimodal AI

वीडियो-भाषा मॉडलः अस्थायी टोकन और ग्राउंडिंग

वीडियो तस्वीरों का ढेर नहीं है। 5 सेकंड के क्लिप में कारण क्रम, क्रिया क्रिया और घटना समय है जिसे छवि मॉडल प्रतिनिधित्व नहीं कर सकता है। वीडियो-एलएएमए (जंग एट अल., जून 2023) ने ऑडियो-विजुअल ग्राउंडिंग के साथ पहला खुला वीडियो-एलएलएम शिप किया। वीडियोचैट और वीडियो-एलएवीए ने पैटर्न को बढ़ाया। 2025 तक Qwen2.5-VL का TMRoPE सीमा स्वामित्व वाले मॉडल के साथ अंतर को बंद कर देता है। प्रत्येक प्रणाली ने अलग-अलग तरीके से समय टोकन हल किए प्रति क्लिप Q-former, प्रति फ्रेम concat-pool, प्रति टोकन TMRoPE। यह पाठ पैटर्न पढ़ता है, एक समान बनाम गतिशील फ्रेम नमूना बनाता है, और समय ग्राउंडिंग कार्यों पर मूल्यांकन करता है।

Type: Build

Languages: Python (stdlib, frame sampler + temporal-grounding evaluator)

Prerequisites: Phase 12 · 08 (LLaVA-OneVision)

Time: ~180 minutes

सीखने के लक्ष्य

  • समय स्थिति एन्कोडिंग वीडियो वीएलएम प्रदर्शन को दृष्टि एन्कोडर से स्वतंत्र रूप से क्यों बदलती है, इसका वर्णन करें।
  • टोकन-प्रति सेकंड बनाम ग्राउंडिंग सटीकता पर समान, गतिशील-एफपीएस और घटना-चालित फ्रेम नमूनाकरण की तुलना करें।
  • Q-former-per-clip (Video-LLaMA) बनाम pooled-per-frame (Video-LLaVA) बनाम M-RoPE-per-token (Qwen2.5-VL) डिजाइनों का वर्णन करें।
  • चार वीडियो बेंचमार्क का नाम दें: वीडियोएमएमई, टेम्पकॉम्पस, इगोस्केमा, वीडियो-एमएमयू।

समस्या

30 एफपीएस पर 1 मिनट का वीडियो 1800 फ्रेम है। प्रति फ्रेम 196 दृश्य टोकन (ViT-B 224) पर, जो कि 2024 युग के किसी भी एलएलएम संदर्भ से 352k टोकन बड़ा है।

तीन कटौती रणनीतियाँ हैंः

  1. उप-समुदा फ्रेम (1-8 एफपीएस सामग्री के आधार पर) ।
  2. प्रत्येक फ्रेम के पैच टोकन को आक्रामक रूप से (3x3 या 4x4 द्विआधारी पूल) में मिलाएं।
  3. एक Q-former के माध्यम से संपीड़ित जो 16 फ्रेम क्लिप लेता है और 64 टोकन आउटपुट करता है।

प्रत्येक व्यापार अलग है. उप-सैंपलिंग समय का विवरण खो देता है. पूलिंग स्थानिक विवरण खो देता है. क्यू-पूर्व दोनों थोड़ा खो देता है लेकिन टोकन बचाता है.

समय स्थिति एन्कोडिंग दूसरी धुरी हैः मॉडल फ्रेम 5 फ्रेम 6 से पहले कैसे जानता है? विकल्पों में सरल 1 डी temporal RoPE (वीडियो-LLaMA), सीखे गए temporal embeddings (वीडियो-LLaVA), और TMRoPE (Qwen2.5-VL, पूर्ण 3D) शामिल हैं।

अवधारणा

वीडियो-एलएएमएः प्रति क्लिप + ऑडियो शाखा के लिए क्यू-former

वीडियो-एलएलएमए (2023) पहला ओपन वीडियो-एलएलएम था। वास्तुकलाः

  • 16 फ्रेम क्लिप 2 FPS (तो 8 सेकंड) पर।
  • प्रति फ्रेम ViT सुविधाएँ -> वीडियो Q-former जो सभी 16 फ्रेम पर क्रॉस-एटेंस्ट करता है -> 32 सीखे गए प्रश्न -> LLM।
  • समानांतर ऑडियो शाखाः तरंग स्वरूप -> छविबंद ऑडियो एन्कोडर -> ऑडियो क्यू-पूर्व -> 32 प्रश्न -> एलएलएम।

बलः ऑडियो-विजुअल संयुक्त तर्क। कमजोरीः तय क्लिप लंबाई, कोई मनमानी समय जमीनीकरण नहीं।

वीडियोचैट और वीडियो-एलएवीए

वीडियोचैट ने वीडियो-एलएएमए विचार को बरकरार रखा लेकिन ऑडियो और सरलता को छोड़ दिया। वीडियो-एलएवीए (लिन एट अल, 2023) ने छवियों और वीडियो फ्रेम दोनों पर एक एकल दृश्य एन्कोडर ("प्रक्षेपण से पहले संरेखण") को प्रशिक्षित किया, जिससे एक एकीकृत प्रतिनिधित्व दिया गया। दोनों जमे हुए-सीएलआईपी-एंकोडर + एमएलपी + एलएलएम हैं।

दोनों 8-16 फ्रेम सिस्टम हैं।

Qwen2.5-VL और TMRoPE

Qwen2.5-VL ने TMRoPE Temporal-Modality Rotary Position Embedding पेश किया। प्रत्येक पैच टोकन में एक (t, h, w) स्थिति होती है जहां t वास्तविक समय टिकट (फ्रेम इंडेक्स नहीं) होता है।

सरल समयबद्ध सम्मिलन से मुख्य अंतरः

  • मॉडल "4.2 सेकंड" नहीं "फ्रेम 15" देखता है।
  • प्रति टोकन घूर्णन, प्रति क्लिप नहीं. प्रत्येक दृश्य टोकन स्वतंत्र रूप से अपने समय टिकट द्वारा घूमता है.
  • गतिशील FPS के साथ संगत. यदि आप 2 FPS यहाँ और 4 FPS वहाँ पर नमूना, TMRoPE नेटिव रूप से असमान अंतर को संभालता है.

TMRoPE "क्या सेकंड में बिल्ली कूदता है? " प्रश्न सक्षम करता है। मॉडल "4.2 सेकंड में" आउटपुट कर सकता है। "वीडियो-एलएएमए केवल क्लिप में "शुरुआती" कह सकता है।

नमूना लेने की रणनीति

समानः नमूना N फ्रेम समरूप रूप से अवधि के दौरान। सरल, गति शिखर खो देता है।

गतिशील एफपीएसः गति तीव्रता के आधार पर नमूना अनुकूलन। ऑप्टिकल प्रवाह या फ्रेम अंतर घने नमूने लेने के लिए उच्च गति वाले खंडों का चयन करता है। Qwen2.5-VL इस पर ट्रेन करता है।

घटना-चालितः एक हल्के डिटेक्टर चलाएं, कार्रवाई होने पर अधिक नमूना।

Keyframe + Context: शॉट सीमाओं पर नमूना + कुछ आसन्न फ्रेम। सिनेमाई सामग्री के लिए उपयोग किया जाता है।

प्रति फ्रेम को मिलाकर

1 FPS और 576 टोकन प्रति फ्रेम पर, 5 मिनट का क्लिप 172,800 टोकन है। Qwen2.5-VL-72B के 128k संदर्भ के साथ संभव है लेकिन महंगा है।

3x3 द्विआधारी पूल प्रति फ्रेम 64 टोकन -> 5 मिनट के लिए 19,200 टोकन तक कम हो जाता है। अधिकांश कार्यों के लिए मीठा स्थान।

एजेंट वर्कफ़्लो के लिए अधिक आक्रामक रूप से (6x6 -> 16 टोकन प्रति फ्रेम) को संकलित करें जहां स्थानिक विवरण कम मायने रखता है।

चार वीडियो बेंचमार्क

  • वीडियोएमईएमः व्यापक वीडियो समझ, लघु + मध्यम + लंबा।
  • TempCompass: बारीक-खोलकर समय पर विचार करना, "पूर्व" / "पश्चात" प्रश्न।
  • इगोस्केमा: लंबी दूरी के पहले व्यक्ति वीडियो।
  • वीडियो-एमएमयूः बहुआयामी बहु-अनुशासनात्मक वीडियो प्रश्न।

एक पूर्ण वीडियो-वीएलएम मूल्यांकन सभी चार को हिट करता है। वे विभिन्न अक्षों पर जोर देते हैं टेम्पकॉम्पस आदेश देने के बारे में है, इगोस्केमा लगभग 3+ मिनट तर्क है, वीडियोएमएमई अवधि को कवर करता है।

ग्राउंडिंग आउटपुट प्रारूप

समय पर जमीनीकरण के लिए आउटपुट प्रारूपः

  • मुक्त पाठः " बिल्ली 4 सेकंड के निशान के चारों ओर कूदती है। " विश्लेषण करने में आसान लेकिन अस्पष्ट।
  • संरचित JSON: {"event": "jump", "start": 4.1, "end": 4.3}Qwen2.5VL इस को प्रशिक्षित करता है।
  • टोकन आधारितः विशेष <time>4.1</time>Qwen2.5VL के आंतरिक प्रारूप.

टोकन आधारित डाउनस्ट्रीम उपयोग के लिए सबसे सटीक है। Qwen2.5-VL का JSON आउटपुट प्रारूप सीधे पार्स करता है।

2026 सर्वोत्तम प्रथा

2026 में वीडियो वीएलएम के लिएः

  • एन्कोडरः M-RoPE या TMRoPE (Qwen2.5-VL) के साथ SigLIP 2।
  • फ्रेम नमूनाकरणः गतिशील एफपीएस (1-4 गति के आधार पर) अधिकतम फ्रेम कैप के साथ।
  • प्रति फ्रेम पूलिंगः 3x3 द्विआधारी।
  • आउटपुटः समय + घटना क्षेत्रों के साथ संरचित JSON।
  • बेंचमार्क: वीडियोएमएमई + टेम्पकॉम्पस सामान्य के लिए; ईगोस्कीमा दीर्घकालिक के लिए।

इसका प्रयोग करें

code/main.pyइसमें शामिल हैंः

  • समान और गतिशील-एफपीएस फ्रेम नमूना।
  • एक खिलौना समय-भूमिकांकन मूल्यांकनकर्ताः समय T पर एक "भूमिका सत्य" घटना और एक मॉडल आउटपुट को देखते हुए, सहिष्णुता के साथ सटीकता को स्कोर करें।
  • वीडियो-एलएएमए (16 फ्रेम, क्यू-पूर्व), वीडियो-एलएवीए (8 फ्रेम, एमएलपी), क्यूवेन2.5-वीएल (डायनामिक एफपीएस + टीएमआरओपीई) के बीच तुलना।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-video-vlm-frame-planner.md. एक वीडियो कार्य (निरीक्षण, क्रिया पहचान, समय स्थलांतर, संक्षेप) को देखते हुए, यह फ्रेम नमूना, पूलिंग कारक, आउटपुट प्रारूप और अपेक्षित सटीकता स्तर का चयन करता है।

व्यायाम

  1. 3 मिनट के खाना पकाने के प्रदर्शन के लिए, वर्दी बनाम गतिशील FPS चुनें. टोकन गिनती के साथ सही ठहराना.
  1. TMRoPE जोड़े कि क्या विशेष रूप से एक सरल समय एम्बेडिंग तालिका नहीं कर सकते हैं?
  1. समय के ग्राउंडिंग के लिए एक JSON योजना लिखें जिसे एक VLM उत्सर्जित करना सीख सकता है। त्रुटि मामलों को शामिल करें।
  1. वीडियो-एलएवीए के "प्रोजेक्शन से पहले संरेखण" पर अनुभाग 3 पढ़ें। यह अलग-अलग छवि और वीडियो एन्कोडर को प्रशिक्षित करने से बेहतर क्यों है?
  1. वीडियोएमएमई रैंकिंग बोर्ड को देखते हुए, 2026 तक शीर्ष ओपन मॉडल और शीर्ष स्वामित्व मॉडल के बीच अंतर क्या है? उस अंतर का कितना हिस्सा temporal encoding vs base LLM scale के लिए जिम्मेदार है?

प्रमुख शर्तें

TermWhat people sayWhat it actually means
Temporal grounding"Time-localized answers"VLM outputs a specific timestamp range for when an event happens
TMRoPE"Time-Multimodal RoPE"3D rotary position with absolute timestamps, used by Qwen2.5-VL
Dynamic FPS"Motion-aware sampling"Sample more frames in high-motion segments, fewer in static ones
Frame pooling"Spatial compress per frame"Reduce patches per frame with bilinear interpolation before the LLM
Video Q-former"Clip compressor"Cross-attention bottleneck mapping N frames to K learned queries
VideoMME"Video bench"Comprehensive short/medium/long video benchmark, 2500+ samples

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.