Phase 12: Multimodal AI

فهم الفيديو الطويل في سياق مليون كلمة

فيديو 4K لمدة ساعة واحدة عند 24 فبص، معصمة ودمج، تنتج على ترتيب 60 مليون رمز. حلقة البودكاست لمدة ساعتين تم نقلها هي 30 ألف رمز فيلم كامل بليو راي، حتى المضغوط مع تجميع عدواني، هو مئات الآلاف من الرموز. أطلقت جوجل جيمين 1.5 (مارس 2024) هذه الحقبة مع سياق 10 ملايين رمز، والقيام بإستدعاء موثوق بالبرع في كومة العشب على مدار مقاطع الفيديو التي تستغرق ساعة. أظهرت LWM (Liu et al., فبراير 2024) مسار تراكم اهتمام الحلقة. LongVILA و Video- XL قد زادت من استهلاكها. "فيديو" قام بتبادل السياق الخام مقابل الاستعراض الوكلي كل منهج هو تغيير مختلف في الحوسبة، التذكير، والهندسة المعقدة. هذه الدروس تقرأهم جنبا إلى جنب

Type: Build

Languages: Python (stdlib, needle-in-haystack simulator + agentic-retrieval router)

Prerequisites: Phase 12 · 17 (video temporal tokens)

Time: ~180 minutes

أهداف التعلم

  • احسب إجمالي عدد الرموز البصرية للفيديو الطويل في مختلف FPS والجمع.
  • شرح ثلاثة مسارات التوسع: السياق الخام (جيميني 1.5) ، انتباه الحلق (LWM) ، ضغط الرمز (LongVILA / Video-XL).
  • مقارنة VLMs الفيديو في السياق الخام مقابل VLMs الفيديو في الاسترداد الجنسي (VideoAgent) على الدقة والتمدد.
  • صمم اختبار إبرة في كومة من العشب لفيديو لمدة 30 دقيقة وقاس استدعاء في دقيقة معينة.

المشكلة

إطار واحد من المفاتيح بحجم Qwen2.5VL عند 384 قرار محلي هو ~ 729 رمزا. عند 3x3 تجمع هذا هو 81 رمزا لكل إطار. كليب 30 دقيقة في 1 FPS = 1800 إطار = 145,800 رمزا. يمكن القيام بحلول 2025 VLMs مفتوحة، ضيقة. عند 2 FPS، 291,600 رمزا فقط أكبر السياقات تناسب.

فيلم لمدة ساعتين في 1 فب.س تبلغ 583k توكنات. خارج معظم طرازات 2026 مفتوحة؛ يتطلب Gemini 2.5 Pro أو تجمع أكثر عدوانية.

ثلاثة مسارات تسلق ظهرت.

المفهوم

المسار 1: السياق البشع (جيمين 1.5، كلود أوبوس)

ألقوا الأجهزة على المشكلة، قموا بتحويل السياق إلى ملايين الرموز، و معالجوا كل شيء في مرور واحد إلى الأمام.

تم إطلاق Gemini 1.5 Pro مع 1M رموز؛ Gemini 1.5 Ultra إلى 10M؛ Gemini 2.5 Pro في 2026 يقوم بتسجيل ساعات من الفيديو بشكل موثوق. وثيقة (arXiv:2403.05530) توثيق الإبرة في كومة الشواش التذكير عند 99.7% حتى ~ 9.5M رموز.

الهندسة: تنفيذ إهتمامات مخصصة مع ترتيب الذاكرة (المحلي + العالمي + نادر) بالإضافة إلى توجيه خبراء MoE لفعالية السياق الطويل. لم يتم نشر التفاصيل الكاملة. ليس مفتوح المصدر.

الطريق 2: انتباه الحلقة (LWM، LongVILA)

ينتشر الاهتمام بالخاتم تسلسلات طويلة عبر الأجهزة في "الحلقة" حيث يحمل كل جهاز قطعة. يحدث الاهتمام عبر التسلسل الكامل عندما يرسل كل جهاز قطعه إلى التالي في نمط حلقة ، ويحسب الاهتمام الجزئي ، ويتم تجميعه.

تدرب LWM (Liu et al., 2024) نموذج سياق 1M-token بهذه الطريقة. تدريب الحسابات على النطاقات خطيا مع السياق، وليس مربعا ضرب مربع على الاهتمام يتم تسديد عبر أجهزة الحلقة.

LongVILA (arXiv:2408.10188) تكيّف النمط إلى VLMs. أشرطة الفيديو 1400 إطار في 192 رمزا لكل إطار = 268k سياق، تدرب مع الاهتمام الحلقائي عبر التوازي الثامن الاتجاه.

الطريق 3: ضغط الرمز (فيديو-XL، LongVA)

أرخص من السياق الخام: قم بتضغط بشكل عنيف قبل أن يرى ماجستير القانون التسلسل.

يستخدم الفيديو-XL (arXiv:2409.14485) رمز ملخص بصري: كل مقطع من إطارات N ينتج رمز "موجّه" واحد يشارك فوق N. عند الاستنتاج، يرى LLM رمز ملخص واحد لكل مقطع، مما يقلل بشكل كبير من السياق.

تمتد LongVA سياق LLM من 200 ألف إلى 2 مليون باستخدام تقنية "انتقال السياق الطويل". تدريب على نص السياق الطويل، الانتقال إلى فيديو السياق الطويل عن طريق التمثيل المشترك.

يتم تجارة ضغط الرمز عن التذكر في طوابع زمنية محددة للتوسع. يعرف النموذج بشكل عام ما حدث ولكن في بعض الأحيان يفوت الإطارات الدقيقة.

الطريق الرابع: استرداد العملاء (مكتب الفيديو)

لا تُطعم الفيديو الكامل إلى ماجستير في العلوم، بدلاً من ذلك، تعامل الفيديو كمستند قاعدة بيانات واستخدم ماجستير في العلوم لإجراء استفسارات عليها.

(مُسجل فيديو) (arXiv:2403.10517):

  1. ماجستير في العلوم يقرأ السؤال
  2. يطلب ماجستير في مجال التعليمات العليا أداة لاسترداد المقاطع ذات الصلة ("أرني قطاعات مع قطة").
  3. أداة تعيد مطابقة مع علامات الوقت المقطع.
  4. يقرأ (إل إل إم) تلك المقاطع عبر جهاز (فيلم)
  5. يقوم ماجستير في التعليمات العليا بتكوين الإجابة أو طرح أسئلة متابعة.

هذا هو نمط LLM- كوكيل يطبق على الفيديو الطويل. استنتاج أرخص (مشاركات ذات الصلة فقط مرمومة) ، هندسة أصعب (جودة الاسترداد تصبح عقدة الزجاجة).

معايير الإبر في كومة الخشب

اختبار السياق الطويل القياسي: إدراج علامة بصرية أو نصية فريدة في نقطة عشوائية في الفيديو، ثم طرح استفسار يتطلب تذكره.

الميتر: Recall@k عبر طول الفيديو وموقف المؤشر.

تقدم Gemini 2.5 Pro >99٪ من التذكير في مقاطع الفيديو لمدة تصل إلى 90 دقيقة. النماذج المفتوحة 72B (Qwen2.5-VL-72B ، InternVL3-78B) تقدم ~ 85-90% في 30 دقيقة وتحلل من بعد 60.

يمكن لـ VideoAgent أن يطابق أو يفوق نماذج السياق الخام في 2 ساعات أو أكثر لأن الاسترداد يضرب الإبرة إذا كانت الأداة جيدة.

أي طريق يجب أن تختار

لقطة 15 دقيقة على دقة الحدود: مفتوحة 72B + سياق الأصلي عادة ما يعمل. اختر Qwen2.5-VL-72B.

للمحتوى 30 دقيقة إلى ساعة واحدة: LongVILA أو Video-XL مفتوحة؛ Gemini 2.5 Pro مغلقة. شريط الجودة مهم الحدود تغلق.

للمحتوى الذي يستغرق أكثر من ساعتين: VideoAgent أو أنماط استرداد مماثلة. بدلاً من ذلك، قم بتجميع المحتويات إلى قطع أصغر وتغذية المحتويات الهيرواركية.

نمط الإنتاج 2026

في الممارسة العملية، خطوط الإنتاج الموسيقية طويلة هي هجينة:

  1. قم بتشغيل عينة متحركة من FPS + تجمع عدواني على الفيديو بأكمله (حصل على تمثيل عالمي من 100k token).
  2. إذهب إلى جهاز 72B لتحقيق الموجة العالمية
  3. إذا سأل المستخدم أسئلة مفصلة، قم بإجراء عملية استرداد وكالة باستخدام الموجب كإندكس.

هذا يجمع بين السياق الخام لفهم عالمي واسترداد التفاصيل المحلية.

استخدمها

code/main.py:

  • يحسب ميزانيات الرمز للفيديوهات من دقيقة إلى ثلاث ساعات عند مجموعة مختلفة من FPS +.
  • يحاكي عملية إبرة في كومة من العشب: حقن علامة على علامة زمنية عشوائية، أسأل سؤال، تسجل استدعاء.
  • يتضمن جهاز محاكاة جهاز التوجيه للإنعاش الوكلي الذي يختار مقاطع محددة لتغذية VLM أسفل التيار.

إشغل جدول الميزانية و اشعر بفجوة الميزانية

أرسله

هذا الدرس يُنتجoutputs/skill-long-video-strategy-planner.mdنظراً لفترة الفيديو وتعقيد استفسارها، فإنه يختار بين السياق الخام، الضغط، والحصول على الجهاز، ويحسب توقعات التأخير + الجودة.

التمارين

  1. محاضرة مدتها 45 دقيقة في 1 فبص، 81 رمزا لكل إطار. مجموع رمزا؟
  1. تصميم اختبار الإبر في كومة العشب: في أي دقيقة تقوم بإدخال العلامة، وما هو شكل الاستفسار الدقيق؟
  1. مقارنة Qwen2.5-VL-72B (80K سياق) مع VideoAgent (Claude 3.5 + استرداد) على فيديو لمدة ساعة واحدة. ما يفوز في التذكير؟ ما يفوز في التأخير؟
  1. تكلفة الذاكرة في الاهتمام باللقب تتراوح خطياً في طول التسلسل وخطياً في عدد الجهاز. شرح لماذا وما الذي يفشل إذا ألقيت مرحلة دوران الحلقة.
  1. اقرأ التوأم 1.5 القسم 5 حول الإبر في كومة الشواخ ماذا وجدت الصحيفة عن التذكير عند حدود رمزية 1M مقابل 10M؟

الشروط الرئيسية

TermWhat people sayWhat it actually means
Brute context"Just more tokens"Scale LLM context to millions of tokens; process everything in one pass
Ring attention"LWM-style parallel"Distributed attention pattern where each device holds a chunk and rotates
Token compression"Summary tokens"Reduce per-clip tokens via a learned compressor before the LLM
Needle-in-haystack"NIH test"Insert a unique marker at a random point, ask model to recall it at test time
Agentic retrieval"LLM as query planner"LLM asks a retrieval tool for relevant clips, reads them via a VLM, composes answer
VideoAgent"Retrieval pattern for video"Canonical agentic-retrieval design: question -> tool -> clip -> answer

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.