Phase 12: Multimodal AI

نماذج فيديو اللغة: علامات مؤقتة و إرسال الأرض

الفيديو ليس كومة من الصور شريط 5 ثواني لديه ترتيب سببي، وعبارات العمل، وتوقيت الحدث الذي لا يمكن أن يمثل نموذج الصورة. فيديو-LLaMA (Zhang et al., يونيو 2023) شحنت أول فيديو-LLM مفتوح مع التأريخ الصوتي-البصري. و "فيديو تشات" و "فيديو لافا" قاموا بتحسين النمط بحلول عام 2025، تمكنت TMRoPE من Qwen2.5-VL من إغلاق الفجوة مع الطرازات المخصصة للحدود. حل كل نظام رموز زمنية بشكل مختلف Q-former لكل كليب ، concat-pool لكل إطار ، TMRoPE لكل رمزا. هذا الدروس يقرأ الأنماط، و يبنّي عينة إطار متواحدة مقابل ديناميكية، و يقيّم على مهام التأريخ الزمني.

Type: Build

Languages: Python (stdlib, frame sampler + temporal-grounding evaluator)

Prerequisites: Phase 12 · 08 (LLaVA-OneVision)

Time: ~180 minutes

أهداف التعلم

  • شرح لماذا تغير التشفير الموضعي الزمني أداء VLM الفيديو بشكل مستقل عن مشفير الرؤية.
  • مقارنة عينات الإطار الموحدة، الديناميكية-FPS، والحدث القيادة على الرموز على كل ثانية مقابل دقة التأريخ.
  • وصف تصاميم Q-former-per-clip (فيديو-LLaMA) مقابل جمع-per-frame (فيديو-LLaVA) مقابل M-RoPE-per-token (Qwen2.5-VL).
  • أسمائها أربعة معايير الفيديو: VideoMME، TempCompass، EgoSchema، Video-MMMU.

المشكلة

فيديو لمدة دقيقة واحدة عند 30 FPS هو 1800 إطار. عند 196 رمزاً بصرياً لكل إطار (ViT-B عند 224) ، وهذا يعادل 352k رمزاً أكبر من أي سياق LLM في عصر 2024.

هناك ثلاث استراتيجيات للحد من التهابات:

  1. الإطارات الفرعية (1-8 FPS حسب المحتوى).
  2. تجمع رموز اللمسات لكل إطار بشكل عدواني (3x3 أو 4x4 تجمع مليوني).
  3. قم بتضغطها عبر Q-former الذي يأخذ شريط 16 إطار وتخرج 64 رمزا.

كل تعديل مختلف، الخيارات الثنائية تفقد التفاصيل الزمنية، التجميع تفقد التفاصيل المكانية، Q- السابق يفقد كل منهما قليلا، ولكن يوفّر الرموز.

التشفير الموضعي الزمني هو المحور الآخر: كيف يعرف النموذج أن الإطار 5 جاء قبل الإطار 6؟ الخيارات تشمل روبي زمني 1D البسيط (فيديو-LLaMA) ، التوابل المعلمة (فيديو-LLaVA) ، و TMRoPE (Qwen2.5-VL، 3D كامل).

المفهوم

الفيديو-LLaMA: Q-former لكل شريط + فرع صوتي

كان الفيديو-LLaMA (2023) أول برنامج مفتوح فيديو-LLM.

  • مقاطع 16 إطارًا في 2 فبص (حتى 8 ثواني).
  • ميزات ViT لكل إطار -> فيديو Q-former التي تصل على جميع الأطر 16 -> 32 استفسار تعلم -> LLM.
  • فرع الصوت المتوازي: شكل الموجات -> مرموز الصوت ImageBind -> صوت Q-former -> 32 استفسار -> LLM.

القوة: التفكير المشترك الصوتي-البصري، الضعف: طول المقطع ثابت، لا توجد تأسيس وقت تعسفي.

الفيديو دردشة و الفيديو-LLaVA

حافظت فيديو تشات على فكرة فيديو-إللاما ولكن أسقطت الصوت وتبسيطت. تدرب فيديو-إللافا (لين وآخرون ، 2023) مرموزًا بصريًا واحدًا على الصور والإطارات الفيديو ("التواء قبل الاستطلاع") ، مما يعطي تمثيلاً موحدًا. كلاهما مرموزًا CLIP-مبرموزًا + MLP + LLM.

لا يتعامل أي منها مع الفيديو الطويل كلاهما هو نظام 8-16 إطار

Qwen2.5-VL وTMRoPE

قوان2.5VL قدمت TMRoPE التثبيت المتحرك للموقف التجاري للطريقة الزمنية. يحمل كل رمز إصطحاف موقع (t، h، w) حيث t هو العلامة الزمنية الفعلية (ليس مؤشر الإطار).

الاختلافات الرئيسية عن التوابل العصبي البسيط:

  • الوقت المطلق، ليس المؤشر النموذج يرى "في 4.2 ثانية" وليس "في الإطار 15".
  • تدور لكل رمز وليس لكل شريط كل رمز بصري يتدور بشكل مستقل عن طريق طابع الوقت
  • متوافق مع FPS ديناميكي. إذا قمت بعمل عينات عند 2 FPS هنا و 4 FPS هناك، TMRoPE يتعامل مع الفاصل غير متساوية بشكل طبيعي.

تمكّن TMRoPE من استفسارات "في أي ثانية تقفز القط؟" يمكن أن يخرج النموذج "في 4.2 ثانية". يمكن أن تقول فيديو-LLaMA فقط "في وقت مبكر في المقطع".

استراتيجيات الإطار للاستعراض

متوحدة: نموذج N الإطارات بالتساوي على مدار مدة. بسيطة، تفقد قمم الحركة.

FPS الديناميكي: عينة تكييفية بناء على كثافة الحركة. التدفق البصري أو التفريق الإطار يختار قطاعات عالية الحركة للاختيار الكثيف. Qwen2.5VL القطارات على هذا.

القيادة على الأحداث: تشغيل جهاز كشف خفيف الوزن، عينة أكثر حيث يحدث العمل.

كيبريم + سياق: عينة في حدود التصوير + بعض الإطارات المجاورة. يستخدم للمحتوى السينمائي.

تجميع لكل إطار

عند 1 FPS و 576 رمزا لكل إطار، كليب 5 دقائق هو 172,800 رمزا. ممكن مع قوانين2.5-VL-72B 128k سياق ولكن مكلفة.

تجمع مليوني 3 × 3 يقلل إلى 64 رمزا لكل إطار -> 19200 رمزا لمدة 5 دقائق. نقطة حلوة لمعظم المهام.

تجمع أكثر عدوانية (6 × 6 -> 16 رمزا لكل إطار) لأجراء عمل العميل حيث تفاصيل المكان أقل أهمية.

المعايير الأربعة للفيديو

  • الفيديو: فهم الفيديو الشامل، قصير + متوسط + طويل.
  • TempCompass: التفكير الزائم من الحجم الدقيق، "قبل" / "بعد" الأسئلة.
  • "إيغو شيما": فيديو طويل من شخص واحد
  • الفيديو-MMMU: أسئلة فيديو متعددة التخصصات متعددة الطرق.

تقييم كامل فيديو-VLM يضرب الأربعة. يؤكدون على محور مختلفة TempCompass هو كل شيء عن الطلب، EgoSchema حوالي 3 + دقيقة التفكير، ويديوMME يمتد مدة.

تنسيقات الإخراجات

تنسيقات المخرجات للتأريخ الزمني:

  • النص المجانى: " القط يقفز حول علامة 4 ثوان " سهل التحليل ولكن غير دقيق.
  • JSON المهيكلة: {"event": "jump", "start": 4.1, "end": 4.3}قوان2.5 فولت تدرب هذا.
  • القائمة على الرمز: خاصة <time>4.1</time>الـ (توكينز) المتداخلة مع الجواب.

القاعدة على الوهم هي الأكثر دقة لاستخدامها في التيار التيار. قوان 2.5 - VL تنشئ تنسيقات JSON مباشرة.

2026 أفضل الممارسات

لـ VLMs فيديو في عام 2026:

  • مُشفّر: SigLIP 2 مع M-RoPE أو TMRoPE (Qwen2.5-VL).
  • عينة الإطار: FPS الديناميكي (1-4 حسب الحركة) مع أقصى كأس الإطار.
  • التجميع لكل إطار: 3x3 مليوني
  • الناتج: JSON المهيكل مع حقل الزمن + الأحداث.
  • المقاييس: الفيديو للمشروعات الصغيرة والمتوسطة + TempCompass للعامة؛ EgoSchema للقائمة الطويلة الأفق.

استخدمها

code/main.pyيتضمن:

  • عينة عينة واحدة و ديناميكية من إطار FPS.
  • مقياس التأثيرات الزمنية: بالنظر إلى حدث "الحقيقة الأساسية" في الوقت T ومخرج النموذج، تقدم الدقة مع التسامح.
  • مقارنة بين Video-LLaMA (16 إطار ، Q- سابق) ، Video-LLaVA (8 إطار ، MLP) ، Qwen2.5-VL (FPS ديناميكي + TMRoPE).

أرسله

هذا الدرس يُنتجoutputs/skill-video-vlm-frame-planner.md. في إطار مهمة الفيديو (المراقبة، وتعرف على الإجراءات، التأريخ الزمني، التجميع) ، فإنه يختار عينة الإطار، وفرص التجميع، وفرمطة الخروج، ومستوى الدقة المتوقع.

التمارين

  1. لثلاث دقائق من عرض الطبخ، اختر المواصفات مقابل المواصفات الديناميكية
  1. ويقول TMRoPE ماذا يمكن أن تفعل جدول إضافة زمنية بسيط؟
  1. اكتب مخطط JSON للتأريخ الزمني الذي يمكن لـ VLM أن يتعلم إصداره.
  1. اقرأ القسم الثالث من الفيديو-LLaVA حول "التنظيم قبل التقاط. " لماذا هذا أفضل من تدريب مبرمجي الصور والفيديو منفصلين؟
  1. بالنظر إلى قائمة مؤسسات الفيديو، ما هي الفجوة بين النموذج المفتوح الأعلى والنموذج الملكي الأعلى اعتبارا من عام 2026؟ كم من هذه الفجوة يمكن أن تُسسب إلى التشفير الزمني مقابل مقياس LLM الأساسي؟

الشروط الرئيسية

TermWhat people sayWhat it actually means
Temporal grounding"Time-localized answers"VLM outputs a specific timestamp range for when an event happens
TMRoPE"Time-Multimodal RoPE"3D rotary position with absolute timestamps, used by Qwen2.5-VL
Dynamic FPS"Motion-aware sampling"Sample more frames in high-motion segments, fewer in static ones
Frame pooling"Spatial compress per frame"Reduce patches per frame with bilinear interpolation before the LLM
Video Q-former"Clip compressor"Cross-attention bottleneck mapping N frames to K learned queries
VideoMME"Video bench"Comprehensive short/medium/long video benchmark, 2500+ samples

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.