Phase 12: Multimodal AI

من CLIP إلى BLIP-2 Q-Former كجسر التنقل

CLIP يصف الصورة والنص ولكن لا يمكن أن تولد العناوين الرئيسية أو الإجابة على الأسئلة أو إجراء محادثة. حل BLIP-2 (Salesforce، 2023) ذلك مع جسر صغير قابل للتدريب: 32 متجهة استفسار قابلة للتعلم تلتحق بميزات ViT المجمدة عن طريق الانتباه المتقاطع، ثم يقع مباشرة في تدفق مدخل LLM المجمد. 188 مليون مبرمير من الجسر ربط 11B LLM إلى ViT-g/14. كل VLM القائم على المكيّف حتى 2026 MiniGPT-4, InstructBLIP، أقارب LLaVA هو نَسْل. هذه الدروس تقرأ بنية Q-Former ، وتفسير تدريبها المرحليين ، وبناء نسخة لعبة التي تغذي الرموز المرئية في جهاز تشكيل نص تجمد.

Type: Build

Languages: Python (stdlib, cross-attention + learnable-query demo)

Prerequisites: Phase 12 · 02 (CLIP), Phase 7 (Transformers)

Time: ~180 minutes

أهداف التعلم

  • شرح لماذا تعطي حلقة زجاجة قابلة للتدريب بين مرموز الرؤية المجمدة والترميز القانوني المجمد التكلفة والثبات.
  • تنفيذ كتلة الانتباه المتقاطع حيث تتمكن مجموعة ثابتة من الأسئلة القابلة للتعلم من الاهتمام بميزات الصورة الخارجية.
  • تمر عبر التدريب المسبق للمرحلتين في BLIP-2: التمثيل (ITC + ITM + ITG) ثم التوليد (خسارة LM مع المفكّر المجمد).
  • مقارنة Q-Former مع مشروع MLP الأبسط المستخدم في LLaVA وتجادل عندما يفوز كل خيار.

المشكلة

لديك ViT المجمد الذي ينتج 256 رمزة ملصق من dim 1408 لكل صورة. لديك 7B LLM المجمد الذي يتوقع إدخال رمز من dim 4096. الجسر الواضح طبقة خطية من 1408 إلى 4096 يعمل، ولكن تغذية جميع 256 رمزة ملصق في سياق LLM تكلف 256 رمزة إضافية لكل صورة. أكثر من 32 صورة التي 8192 رمز تستهلك من قبل الوسيلة البصرية وحدها.

سؤال BLIP-2: هل يمكنك ضغط تمثيل الصورة من 256 رمز إلى عدد أقل بكثير من الرموز (قول 32) مع الحفاظ على معلومات كافية لشركة ماجستير في التدريس لترتيب، والإجابة على الأسئلة، والحجة حول الصورة؟ ويمكنك تدريب هذه الجسر دون لمس العظام الفقرية المجمدة، والحفاظ على تكلفة التدريب في معايير الجسر فقط؟

الإجابة: Q-Former. 32 متجه "سؤال" يمكن التعلم الذي يشارك في إشارات اللمسات في ViT ، مما ينتج ملخصًا بصريًا 32 إشارة استهلكت LLM. 188 مليون معلم إجماليًا. تم تدريبهم على أهداف مُقارنة ومُطابقة وتوليد قبل أن يلمسوا LLM.

المفهوم

الأسئلة التي يمكن تعلمها

خدعة Q-Former الأساسية: بدلاً من السماح لبرامج النص في LLM بالعمل على تصفيح الصور، قم بتقديم مجموعة جديدة من 32 متجه استفسار قابل للتعلم Qوالسؤال هو معايير النموذج يتم تعلمها أثناء التدريب و تستخدم نفس 32 سؤالا لكل صورة.

بعد الانتباه المتبادل، يحمل كل استفسار ملخص ضغط للصورة "وصف الموضوع الرئيسي"، "وصف الخلفية"، "عد الأشياء"، إلخ. لا تتخصص الاستفسارات حرفيا على اللبكات المفصلية؛ فإنها تتعلم أي رمزية تجعل الخسائر التدريجية تراجع.

الهندسة المعمارية

Q-Former هو محول صغير (12 طبقة، ~ 100M بارام) مع طريقتين:

  1. مسار الاستفسار: 32 متجه استفسار يتدفق من خلال الاهتمام الذاتي (بين بعضها البعض) ، ثم الاهتمام المتقاطع على رموز اللمسات المجمدة في تي، ثم FFN.
  2. مسار النص: يشارك رمز النص مثل BERT الاهتمام الذاتي وزرات FFN مع مسار الاستفسار. يتم تعطيل الاهتمام المتقاطع لمسار النص.

في وقت التدريب تعمل كلا الطرقين. تتفاعل الاستفسارات والنص من خلال الاهتمام الذاتي المشترك ، مما يعني أن الاستفسارات يمكن أن تتأهل على النص للمهام التي تحتاج إليه (ITM ، ITG). في وقت الاستنتاج للتسليم VLM ، تتدفق فقط الاستفسارات ، مما يؤدي إلى 32 رمزاً بصرياً.

تدريب في مرحلتين

التدريبات المسبقة للـ BLIP-2 في مرحلتين:

المرحلة الأولى: تعلم التمثيل (لا ماجستير في التدريب)

  • ITC (تصوير-نص متناقض): متناقض على النمط CLIP بين رموز استفسار مجتمعة ورمز CLS النصي.
  • ITM (مطابقة الصورة والنص): المصنف الثنائي هل هذا زوج الصورة والنص متطابق؟ صعبة-النفي-المتعدد.
  • إيه تي جي (إنتاج نص على أساس الصورة): إدارة LM السببية على النص ، مشروطة على الاستفسارات. يضطر الاستفسارات إلى تشفير المحتوى الذي يمكن إنشاؤه من النص.

القطارات القديمة فقط، ويتجمد، لا يوجد ماجستير في العلوم

المرحلة 2: التعلم التوليدي. ضم مقياس التدريس المجمد (OPT-2.7B أو Flan-T5-XL ، إلخ). عرض 32 خروجاً من المفاوضات إلى ضوء إدراج القواعد التدريبية من خلال طبقة خطية صغيرة. استعد لهم إلى عرض النص. تدريب فقط التدريب الخطي والشكل Q على فقدان LM على تسلسل التدريب المشترك + الصورة + عنوان.

بعد المرحلة 2 ، يكون التنبيه Q-Former + هو المعدل البصري الكامل. عند الاستنتاج: الصورة → ViT → Q-Former → المشاريع الخطية → المعلقة إلى النص → التجميد LLM تنبعث.

الاقتصاد المعلم

BLIP-2 مع ViT-g/14 (1.1B ، المجمد) + OPT-6.7B (6.7B ، المجمد) + Q-Former (188M ، مدرب) = 8B إجمالي ، 188M مدرب. Q-Former وحده هو ~ 2.4% من معايير كومة كاملة. تكلفة التدريب تعكس هذا: أيام على حفنة من A100s مقابل أسابيع للنهاية إلى النهاية.

الجودة: BLIP-2 يطابق أو يفوق Flamingo-80B على VQA بدون إطلاق النار بينما هو أصغر بنسبة 50 مرة.

إنستكتبليب والإرشادات القياسية

يمتد InstructBLIP (2023) Q-Former مع مدخل إضافي: نص التعليم نفسه. في وقت الانتباه المتبادل ، يمكن للمسائل الآن الوصول إلى كل من تصفيات الصورة والإرشاد. يمكن للمسائل التخصص لكل تعليم ("احص السيارات" ، "وصف المزاج") بدلاً من تعلم ملخص ثابت واحد. يكتسب مؤشر الاستعراض على المهام المتبقية.

ميني جي بي تي 4 و النهج المضرب فقط

احتفظت ميني جي بي تي 4 بـ Q-Former ولكن تدربت فقط على التنبيه الخطري للخروج مع تجميد كل شيء آخر. رخيص ، ولكن التكلفة هي الجودة كانت الاستفسارات من BLIP-2 ، وليس لك. جيد للتكرار السريع ، وليس أفضل الهندسة المعمارية.

لماذا أصبح LLaVA أبسط

استبدل LLaVA (2023, الدروس 12.05) Q-Former بمسطح MLP بسيط ذو 2 طبقات يرمز كل رمز معططط ViT إلى مساحة LLM 576 رمز لكل صورة لشبكة 24 × 24, كل ما يتم إمداده إلى LLM. ضغط أسوأ لكن يسمح للماجستير بالذهاب أكثر من المزقات الخام في ذلك الوقت كان هذا مثيرا للجدل؛ بحلول أواخر عام 2023 كان سيطراً لأن بيانات التعليم البصري (LLaVA-Instruct-150k) أثبتت أن MLP يمكن تدريبها للحفاظ على إشارة كافية. التنازل: يملأ سياق LLaVA أسرع، لكنه يتكلف بشكل طبيعي للكثير من الصور والفيديو.

بحلول عام 2026 تمت تقسيم المجال: يبقى Q-Former حياً حيث يعتبر ميزانية الوهم (فيديو طويل، العديد من الصور) ؛ يهيمن مشروع MLP حيث تكون الجودة الخام لكل رمز أولوية.

الاهتمام المتقاطع: فلامينغو، الجدول

فلامينغو (دراسة 12.04) قبل BLIP-2 واستخدم نفس فكرة الانتباه المتقاطع ولكن في كل طبقة LLM المجمدة ، وليس كجسر واحد. أظهر BLIP-2 أنه يمكنك الضغط على طبقة المدخل فقط ومازال تعمل. الجماعية و Idefics يجمع بينهما: رموز المدخل المتقاطعة بالإضافة إلى الاهتمام المتقاطع المفتوح الاختياري لعدد قليل من اللقطات في السياق.

نَسَلَ 2026

  • Q- سابق: BLIP-2، InstructBLIP، MiniGPT-4، ومعظم نماذج اللغة الفيديو لأسباب ميزانية رمزية.
  • إعادة تقييم العينات: فلامينغو (دراسة 12.04) ، عائلة إيديفيكس، قزح، OmniMAE.
  • مُرِّيّة MLP: LLaVA، LLaVA-NeXT، LLaVA-OneVision، Cambrian-1.
  • "مجموعة الإنتباه" "فيلا" و "بالي جيما"

كلّها صحيحة، السؤال الحاسم هو ما إذا كنت مقيدًا على ميزانية الوهم أو على الجودة لكل رمز.

استخدمها

code/main.pyيُبني إهتمام متقاطع على شكل Q-Former:

  1. محاكاة 256 رمز تصويب الصورة (dim 128).
  2. إعداد 32 استفسارًا يمكن التعلم (المحط 128).
  3. تشغيل الاهتمام المتبادل بين النقاط المتوسطة والمنتج (Q من الاستفسارات، K/V من المزادات).
  4. المشروع إلى LLM-dim (512) عبر طبقة خطية.
  5. أخرج 32 رمزاً بصرياً جاهزة لـ "إل إل إم".

جميع الرياضيات في بيثون النقي (حلقات مستقرة فوق المتجهات). اللعبة ولكن الشكل الصحيح. يتم طباعة المصفوفة الوزن الاهتمام حتى تتمكن من رؤية أي معجون كل استفسار تم استخراجها من.

أرسله

هذا الدرس يُنتجoutputs/skill-modality-bridge-picker.md. بالنظر إلى تكوين VLM المستهدف (عدد رموز تشفير الرؤية، ميزانية سياق LLM، قيود التنفيذ، هدف الجودة) ، فإنه يوصي Q-Former vs MLP vs Perceiver resampler مع توجيه قصير وتقدير عدد المعلمات لكل جسر.

التمارين

  1. تنفيذ كتلة الانتباه المتقاطع في PyTorch. التحقق من أن مع 32 استفسار و 256 مفتاح / قيم، المصفوفة الوزن الانتباه هو 32 × 256 وكل صف يصل إلى 1 بعد softmax.
  1. في مرحلة BLIP-2 1 يقوم Q-Former بتشغيل ثلاثة خسائر في وقت واحد: ITC ، ITM ، ITG. اكتب توقيعًا إلى الأمام لكل منها في رمز مزيف. أي من هذه تتطلب مسار تشفير النص أن يكون نشطًا؟
  1. مقارنة معدل العد: Q-Former (12 طبقة، 768 مخفية) مقابل مشهد MLP ذو 2 طبقات (1408 → 4096 ، طبقتين). في أي نطاق LLM يعود تكلفة 188M Q-Former في كفاءة التدريب؟
  1. اقرأ القسم 3.2 من ورقة BLIP-2 (arXiv:2301.12597) حول كيفية تشغيل Q-Former. شرح لماذا تشغيل من قاعدة BERT (ليس عشوائية) يسرع التقارب.
  1. للفيديو لمدة 10 دقائق عند 1 FPS تم اختباره إلى 60 إطارًا ، احسب تكلفة رمز لكل إطار عند (Q-Former → 32 رمزا / إطار) مقابل (مُرسل MLP → 576 رمزا / إطار). أي منها يناسب نافذة سياق LLM ذات رمزا 128k؟

الشروط الرئيسية

TermWhat people sayWhat it actually means
Q-Former"Querying transformer"Small transformer with 32 learnable query vectors that cross-attend to frozen ViT features
Learnable queries"Soft prompt for vision"A fixed set of parameters that serve as the query side of cross-attention; learned per model, shared across all inputs
Cross-attention"Q from here, K/V from there"Attention where query, key, and value come from different sources; how the queries pull from ViT patches
ITC"Image-text contrastive"CLIP-style loss applied to Q-Former pooled queries vs text CLS
ITM"Image-text matching"Binary classifier on hard-negative-mined pairs; forces the queries to discriminate fine-grained mismatches
ITG"Image-grounded text generation"Causal LM loss where text is generated conditioned on queries; forces queries to encode text-decodable content
Two-stage pretraining"Representation then generative"Stage 1 trains Q-Former alone (ITC/ITM/ITG); Stage 2 attaches frozen LLM and trains only the projection + Q-Former
Frozen backbone"Do not finetune"The vision encoder and LLM weights are fixed; only the bridge trains
Projection head"Linear to LLM dim"Final linear layer mapping Q-Former output to the LLM's embedding dimension
Perceiver resampler"Flamingo's version"Similar learnable-query cross-attention, used by Flamingo at every layer rather than as a single bridge

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.