Phase 12: Multimodal AI

लाखों लोगों के संदर्भ में वीडियो को समझना

24 फ्लिपस पर एक घंटे का 4K वीडियो, पैच और एम्बेड, 60 मिलियन टोकन के आदेश पर उत्पन्न करता है। एक 2 घंटे का पॉडकास्ट एपिसोड 30,000 टोकन का है। एक पूर्ण ब्लू-रे फीचर फिल्म, यहां तक कि आक्रामक पूलिंग के साथ संपीड़ित, सैकड़ों हजारों टोकन है। गूगल के मिथुन 1.5 (मार्च 2024) ने 10 मिलियन टोकन के संदर्भ के साथ इस युग को खोला, एक घंटे के वीडियो के दौरान एक विश्वसनीय सुई-इन-ए-हेस्टैक रिकॉल किया। LWM (Liu et al., फरवरी 2024) ने रिंग ध्यान के स्केलिंग पथ को दिखाया। LongVILA और Video- XL ने सेवन को और बढ़ाया। वीडियोएजेंट ने कच्चे संदर्भ को एजेंटिक रिट्रीव के लिए आदान-प्रदान किया। प्रत्येक दृष्टिकोण गणना, याद और इंजीनियरिंग जटिलता पर एक अलग व्यापार है। यह सबक उन्हें एक साथ पढ़ता है।

Type: Build

Languages: Python (stdlib, needle-in-haystack simulator + agentic-retrieval router)

Prerequisites: Phase 12 · 17 (video temporal tokens)

Time: ~180 minutes

सीखने के लक्ष्य

  • विभिन्न एफपीएस और बंडलिंग पर लंबे रूप के वीडियो के लिए कुल दृश्य टोकन की गणना करें।
  • तीन स्केलिंग पथों को समझाएंः क्रूड संदर्भ (जेमिनी 1.5), रिंग ध्यान (एलडब्ल्यूएम), टोकन संपीड़न (लॉन्गवीला / वीडियो-एक्सएल) ।
  • सटीकता और विलंबता पर कच्चे संदर्भ वीडियो VLMs बनाम एजेंटिक-रिकवरी वीडियो VLMs (VideoAgent) की तुलना करें।
  • 30 मिनट के वीडियो के लिए एक सुई-इन-ए-हेमस्टैक परीक्षण डिजाइन करें और एक विशिष्ट मिनट में याद करने का माप करें।

समस्या

Qwen2.5-VL आकार के पैचों का एक एकल फ्रेम 384 मूल संकल्प पर ~729 टोकन है। 3x3 पूलिंग पर यह प्रति फ्रेम 81 टोकन है। 1 FPS = 1800 फ्रेम = 145,800 टोकन पर 30 मिनट का क्लिप। 2025 तक खुला VLMs, तंग। 2 FPS पर, 291,600 टोकन केवल सबसे बड़े संदर्भ फिट।

एक 2 घंटे की फिल्म 1 FPS पर 583k टोकन है। 2026 के अधिकांश खुले मॉडल के परे; जेमिनी 2.5 प्रो या अधिक आक्रामक रूप से बंडलिंग की आवश्यकता है।

तीन पैदल मार्गों ने उभरते हुए देखा।

अवधारणा

पथ 1: क्रूर संदर्भ (जिमिनी 1.5, क्लाउड ओपस)

समस्या पर हार्डवेयर फेंकें, संदर्भ को लाखों टोकन तक स्केल करें, एक आगे के पास में सब कुछ संसाधित करें।

जेमिनी 1.5 प्रो 1M टोकन के साथ लॉन्च किया गया; जेमिनी 1.5 अल्ट्रा से 10M; जेमिनी 2.5 प्रो 2026 में वीडियो के घंटे विश्वसनीय रूप से करता है। पेपर (arXiv:2403.05530) 99.7% तक ~ 9.5M टोकन तक सुई-इन-ए-हेयस्टैक याद करने का दस्तावेज करता है।

इंजीनियरिंगः मेमोरी पदानुक्रम (स्थानीय + वैश्विक + दुर्लभ) के साथ एक कस्टम ध्यान कार्यान्वयन और दीर्घ-संदर्भ दक्षता के लिए एमओई विशेषज्ञ रूटिंग। पूर्ण विवरण में प्रकाशित नहीं किया गया। खुला स्रोत नहीं।

पथ 2: रिंग ध्यान (एलडब्ल्यूएम, लॉन्गवीला)

रिंग ध्यान एक "रिंग" में उपकरणों के बीच लंबे अनुक्रमों को वितरित करता है जहां प्रत्येक डिवाइस एक टुकड़ा रखता है। पूरे अनुक्रम पर ध्यान प्रत्येक डिवाइस द्वारा एक रिंग पैटर्न में अगले को अपना टुकड़ा भेजकर, आंशिक ध्यान की गणना करके और एकत्र करके होता है।

LWM (Liu et al., 2024) ने इस तरह से 1M-टोकन संदर्भ मॉडल को प्रशिक्षित किया। प्रशिक्षण संदर्भ के साथ रैखिक रूप से गणना करता है, चतुर्भुज नहीं।

LongVILA (arXiv:2408.10188) ने VLMs के लिए पैटर्न को अनुकूलित किया। 1400-फ्रेम वीडियो 192 टोकन प्रति फ्रेम = 268k संदर्भ पर, 8-तरफा समानांतरता पर रिंग ध्यान के साथ प्रशिक्षित।

पथ 3: टोकन संपीड़न (वीडियो-एक्सएल, लॉन्गवीए)

क्रूर संदर्भ से सस्ताः एलएलएम अनुक्रम को देखने से पहले आक्रामक रूप से संपीड़न करें।

वीडियो-एक्सएल (arXiv:2409.14485) एक दृश्य सारांश टोकन का उपयोग करता हैः N फ्रेम के प्रत्येक क्लिप में एक एकल "सारांश" टोकन उत्पन्न होता है जो N पर उपस्थित होता है। निष्कर्ष पर, एलएलएम प्रति क्लिप एक सारांश टोकन देखता है, जो संदर्भ को काफी छोटा करता है।

LongVA "लंबे संदर्भ हस्तांतरण" तकनीक के साथ 200k से 2M तक LLM संदर्भ का विस्तार करता है।

टोकन संपीड़न स्केलेबिलिटी के लिए विशिष्ट समय स्टैम्प पर याद करने से व्यापार करता है। मॉडल आमतौर पर जानता है कि क्या हुआ लेकिन कभी-कभी सटीक फ्रेम याद करता है।

पथ 4: एजेंटिक रिट्रीव (वीडियोएजेंट)

पूर्ण वीडियो को LLM को फ़ीड न करें, इसके बजाय वीडियो को डेटाबेस के रूप में देखें और इसे क्वेरी करने के लिए LLM का उपयोग करें।

वीडियोएजेंट (arXiv:2403.10517):

  1. LLM प्रश्न पढ़ता है।
  2. LLM संबंधित क्लिप के लिए एक पुनर्प्राप्ति उपकरण का अनुरोध करता है ("एक बिल्ली के साथ मुझे खंड दिखाएं") ।
  3. उपकरण क्लिप समय टिकटों के साथ मेल खाता है।
  4. एलएलएम एक वीएलएम के माध्यम से उन क्लिप पढ़ता है।
  5. एमएलएल उत्तर लिखता है या अनुवर्ती प्रश्न पूछता है।

यह लंबे वीडियो पर लागू एलएलएम-एजेंट पैटर्न है। सस्ता निष्कर्ष (केवल प्रासंगिक क्लिप एन्कोड किए गए), कठिन इंजीनियरिंग (पुनर्प्राप्त गुणवत्ता बोतल की खाई बन जाती है) ।

सुई-इन-ए-हेमस्टैक बेंचमार्क

मानक दीर्घ संदर्भ परीक्षणः वीडियो में एक यादृच्छिक बिंदु पर एक अद्वितीय दृश्य या पाठ मार्कर डालें, फिर एक क्वेरी पूछें जिसमें इसे याद करना आवश्यक हो।

मीट्रिकः वीडियो लंबाई और मार्कर स्थिति पर Recall@k।

जेमिनी 2.5 प्रो 90 मिनट तक के वीडियो पर 99% यादगार स्कोर करता है। ओपन 72 बी मॉडल (क्यूवेन2.5 - वीएल-72 बी, इंटरनवीएल3 - 78 बी) 30 मिनट पर ~ 85-90% स्कोर करते हैं और 60 से अधिक घटते हैं।

वीडियोएजेंट 2+ घंटे में कच्चे संदर्भ मॉडल से मेल खा सकता है या हरा सकता है क्योंकि उपकरण अच्छा है तो पुनर्प्राप्ति सुई को हिट करती है।

कौन सा रास्ता चुनना है

सीमा सटीकता पर 15 मिनट के क्लिप के लिएः खुला 72B + मूल संदर्भ आमतौर पर काम करता है। Qwen2.5-VL-72B चुनें।

30 मिनट से 1 घंटे तक सामग्री के लिएः लॉन्गविला या वीडियो-एक्सएल खुले के लिए; जेमिनी 2.5 प्रो बंद के लिए। गुणवत्ता पट्टी मायने रखती है सीमा बंद हो जाती है।

2 घंटे से अधिक सामग्री के लिएः वीडियोएजेंट या इसी तरह के पुनर्प्राप्ति पैटर्न। वैकल्पिक रूप से, छोटे टुकड़ों में सारांशित करें और पदानुक्रम संक्षेप फ़ीड करें।

2026 उत्पादन पैटर्न

व्यवहार में, उत्पादन लंबी वीडियो पाइपलाइन हाइब्रिड हैंः

  1. पूरे वीडियो पर गतिशील-FPS नमूना + आक्रामक बंडलिंग चलाएं (100k टोकन का वैश्विक प्रतिनिधित्व प्राप्त करें) ।
  2. एक वैश्विक सारांश के लिए एक 72B VLM पास।
  3. यदि उपयोगकर्ता विस्तृत प्रश्न पूछता है, तो संक्षेप को सूचकांक के रूप में उपयोग करके एजेंटिक रिट्रीव चलाएं।

यह वैश्विक समझ के लिए कच्चे संदर्भ और स्थानीय विवरण के लिए पुनर्प्राप्ति को जोड़ता है।

इसका प्रयोग करें

code/main.py:

  • विभिन्न एफपीएस + बंडलिंग पर 1 मिनट से 3 घंटे तक वीडियो के लिए टोकन बजट की गणना करता है।
  • एक सुई-इन-एक-शेम स्टैक रन अनुकरणः एक यादृच्छिक समय टिकट पर एक मार्कर इंजेक्ट, एक सवाल पूछने, स्कोर याद करने के लिए।
  • इसमें एक एजेंटिक-रिकवरी राउटर सिम्युलेटर शामिल है जो एक डाउनस्ट्रीम VLM को फ़ीड करने के लिए विशिष्ट क्लिप चुनता है।

बजट तालिका चलाओ और पैमाने के अंतर को महसूस करें।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-long-video-strategy-planner.md. वीडियो की अवधि और क्वेरी की जटिलता को देखते हुए, यह कच्चे संदर्भ, संपीड़न और एजेंटिक रिकवरी के बीच चुनता है, और विलंबता + गुणवत्ता अपेक्षाओं की गणना करता है।

व्यायाम

  1. एक 45 मिनट की व्याख्यान 1 FPS, 81 टोकन प्रति फ्रेम. कुल टोकन? कौन से मॉडल के संदर्भ में फिट?
  1. एक सुई-इन-ए-हेस्टैक परीक्षण डिजाइन करेंः आप मार्कर को किस मिनट में इंजेक्ट करते हैं, और सटीक क्वेरी प्रारूप क्या है?
  1. 1 घंटे के वीडियो पर कच्चे संदर्भ Qwen2.5-VL-72B (80k संदर्भ) की तुलना वीडियोएजेंट (क्लाउड 3.5 + पुनर्प्राप्ति) पर करें। याद करने पर कौन जीता? कौन विलंबता पर जीता?
  1. रिंग ध्यान की स्मृति लागत अनुक्रम लंबाई में रैखिक रूप से और डिवाइस की संख्या में रैखिक रूप से पैमाने। यदि आप रिंग-रोटेशन चरण छोड़ते हैं तो क्यों और क्या विफल होता है, तो समझाएं।
  1. मिथुन 1.5 सेक्शन 5 पर पढ़िए। 1M बनाम 10M टोकन सीमा पर याद करने के बारे में अखबार ने क्या पाया?

प्रमुख शर्तें

TermWhat people sayWhat it actually means
Brute context"Just more tokens"Scale LLM context to millions of tokens; process everything in one pass
Ring attention"LWM-style parallel"Distributed attention pattern where each device holds a chunk and rotates
Token compression"Summary tokens"Reduce per-clip tokens via a learned compressor before the LLM
Needle-in-haystack"NIH test"Insert a unique marker at a random point, ask model to recall it at test time
Agentic retrieval"LLM as query planner"LLM asks a retrieval tool for relevant clips, reads them via a VLM, composes answer
VideoAgent"Retrieval pattern for video"Canonical agentic-retrieval design: question -> tool -> clip -> answer

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.