من CLIP إلى BLIP-2 Q-Former كجسر التنقل
Type: Build
Languages: Python (stdlib, cross-attention + learnable-query demo)
Prerequisites: Phase 12 · 02 (CLIP), Phase 7 (Transformers)
Time: ~180 minutes
أهداف التعلم
- شرح لماذا تعطي حلقة زجاجة قابلة للتدريب بين مرموز الرؤية المجمدة والترميز القانوني المجمد التكلفة والثبات.
- تنفيذ كتلة الانتباه المتقاطع حيث تتمكن مجموعة ثابتة من الأسئلة القابلة للتعلم من الاهتمام بميزات الصورة الخارجية.
- تمر عبر التدريب المسبق للمرحلتين في BLIP-2: التمثيل (ITC + ITM + ITG) ثم التوليد (خسارة LM مع المفكّر المجمد).
- مقارنة Q-Former مع مشروع MLP الأبسط المستخدم في LLaVA وتجادل عندما يفوز كل خيار.
المشكلة
لديك ViT المجمد الذي ينتج 256 رمزة ملصق من dim 1408 لكل صورة. لديك 7B LLM المجمد الذي يتوقع إدخال رمز من dim 4096. الجسر الواضح طبقة خطية من 1408 إلى 4096 يعمل، ولكن تغذية جميع 256 رمزة ملصق في سياق LLM تكلف 256 رمزة إضافية لكل صورة. أكثر من 32 صورة التي 8192 رمز تستهلك من قبل الوسيلة البصرية وحدها.
سؤال BLIP-2: هل يمكنك ضغط تمثيل الصورة من 256 رمز إلى عدد أقل بكثير من الرموز (قول 32) مع الحفاظ على معلومات كافية لشركة ماجستير في التدريس لترتيب، والإجابة على الأسئلة، والحجة حول الصورة؟ ويمكنك تدريب هذه الجسر دون لمس العظام الفقرية المجمدة، والحفاظ على تكلفة التدريب في معايير الجسر فقط؟
الإجابة: Q-Former. 32 متجه "سؤال" يمكن التعلم الذي يشارك في إشارات اللمسات في ViT ، مما ينتج ملخصًا بصريًا 32 إشارة استهلكت LLM. 188 مليون معلم إجماليًا. تم تدريبهم على أهداف مُقارنة ومُطابقة وتوليد قبل أن يلمسوا LLM.
المفهوم
الأسئلة التي يمكن تعلمها
خدعة Q-Former الأساسية: بدلاً من السماح لبرامج النص في LLM بالعمل على تصفيح الصور، قم بتقديم مجموعة جديدة من 32 متجه استفسار قابل للتعلم Qوالسؤال هو معايير النموذج يتم تعلمها أثناء التدريب و تستخدم نفس 32 سؤالا لكل صورة.
بعد الانتباه المتبادل، يحمل كل استفسار ملخص ضغط للصورة "وصف الموضوع الرئيسي"، "وصف الخلفية"، "عد الأشياء"، إلخ. لا تتخصص الاستفسارات حرفيا على اللبكات المفصلية؛ فإنها تتعلم أي رمزية تجعل الخسائر التدريجية تراجع.
الهندسة المعمارية
Q-Former هو محول صغير (12 طبقة، ~ 100M بارام) مع طريقتين:
- مسار الاستفسار: 32 متجه استفسار يتدفق من خلال الاهتمام الذاتي (بين بعضها البعض) ، ثم الاهتمام المتقاطع على رموز اللمسات المجمدة في تي، ثم FFN.
- مسار النص: يشارك رمز النص مثل BERT الاهتمام الذاتي وزرات FFN مع مسار الاستفسار. يتم تعطيل الاهتمام المتقاطع لمسار النص.
في وقت التدريب تعمل كلا الطرقين. تتفاعل الاستفسارات والنص من خلال الاهتمام الذاتي المشترك ، مما يعني أن الاستفسارات يمكن أن تتأهل على النص للمهام التي تحتاج إليه (ITM ، ITG). في وقت الاستنتاج للتسليم VLM ، تتدفق فقط الاستفسارات ، مما يؤدي إلى 32 رمزاً بصرياً.
تدريب في مرحلتين
التدريبات المسبقة للـ BLIP-2 في مرحلتين:
المرحلة الأولى: تعلم التمثيل (لا ماجستير في التدريب)
- ITC (تصوير-نص متناقض): متناقض على النمط CLIP بين رموز استفسار مجتمعة ورمز CLS النصي.
- ITM (مطابقة الصورة والنص): المصنف الثنائي هل هذا زوج الصورة والنص متطابق؟ صعبة-النفي-المتعدد.
- إيه تي جي (إنتاج نص على أساس الصورة): إدارة LM السببية على النص ، مشروطة على الاستفسارات. يضطر الاستفسارات إلى تشفير المحتوى الذي يمكن إنشاؤه من النص.
القطارات القديمة فقط، ويتجمد، لا يوجد ماجستير في العلوم
المرحلة 2: التعلم التوليدي. ضم مقياس التدريس المجمد (OPT-2.7B أو Flan-T5-XL ، إلخ). عرض 32 خروجاً من المفاوضات إلى ضوء إدراج القواعد التدريبية من خلال طبقة خطية صغيرة. استعد لهم إلى عرض النص. تدريب فقط التدريب الخطي والشكل Q على فقدان LM على تسلسل التدريب المشترك + الصورة + عنوان.
بعد المرحلة 2 ، يكون التنبيه Q-Former + هو المعدل البصري الكامل. عند الاستنتاج: الصورة → ViT → Q-Former → المشاريع الخطية → المعلقة إلى النص → التجميد LLM تنبعث.
الاقتصاد المعلم
BLIP-2 مع ViT-g/14 (1.1B ، المجمد) + OPT-6.7B (6.7B ، المجمد) + Q-Former (188M ، مدرب) = 8B إجمالي ، 188M مدرب. Q-Former وحده هو ~ 2.4% من معايير كومة كاملة. تكلفة التدريب تعكس هذا: أيام على حفنة من A100s مقابل أسابيع للنهاية إلى النهاية.
الجودة: BLIP-2 يطابق أو يفوق Flamingo-80B على VQA بدون إطلاق النار بينما هو أصغر بنسبة 50 مرة.
إنستكتبليب والإرشادات القياسية
يمتد InstructBLIP (2023) Q-Former مع مدخل إضافي: نص التعليم نفسه. في وقت الانتباه المتبادل ، يمكن للمسائل الآن الوصول إلى كل من تصفيات الصورة والإرشاد. يمكن للمسائل التخصص لكل تعليم ("احص السيارات" ، "وصف المزاج") بدلاً من تعلم ملخص ثابت واحد. يكتسب مؤشر الاستعراض على المهام المتبقية.
ميني جي بي تي 4 و النهج المضرب فقط
احتفظت ميني جي بي تي 4 بـ Q-Former ولكن تدربت فقط على التنبيه الخطري للخروج مع تجميد كل شيء آخر. رخيص ، ولكن التكلفة هي الجودة كانت الاستفسارات من BLIP-2 ، وليس لك. جيد للتكرار السريع ، وليس أفضل الهندسة المعمارية.
لماذا أصبح LLaVA أبسط
استبدل LLaVA (2023, الدروس 12.05) Q-Former بمسطح MLP بسيط ذو 2 طبقات يرمز كل رمز معططط ViT إلى مساحة LLM 576 رمز لكل صورة لشبكة 24 × 24, كل ما يتم إمداده إلى LLM. ضغط أسوأ لكن يسمح للماجستير بالذهاب أكثر من المزقات الخام في ذلك الوقت كان هذا مثيرا للجدل؛ بحلول أواخر عام 2023 كان سيطراً لأن بيانات التعليم البصري (LLaVA-Instruct-150k) أثبتت أن MLP يمكن تدريبها للحفاظ على إشارة كافية. التنازل: يملأ سياق LLaVA أسرع، لكنه يتكلف بشكل طبيعي للكثير من الصور والفيديو.
بحلول عام 2026 تمت تقسيم المجال: يبقى Q-Former حياً حيث يعتبر ميزانية الوهم (فيديو طويل، العديد من الصور) ؛ يهيمن مشروع MLP حيث تكون الجودة الخام لكل رمز أولوية.
الاهتمام المتقاطع: فلامينغو، الجدول
فلامينغو (دراسة 12.04) قبل BLIP-2 واستخدم نفس فكرة الانتباه المتقاطع ولكن في كل طبقة LLM المجمدة ، وليس كجسر واحد. أظهر BLIP-2 أنه يمكنك الضغط على طبقة المدخل فقط ومازال تعمل. الجماعية و Idefics يجمع بينهما: رموز المدخل المتقاطعة بالإضافة إلى الاهتمام المتقاطع المفتوح الاختياري لعدد قليل من اللقطات في السياق.
نَسَلَ 2026
- Q- سابق: BLIP-2، InstructBLIP، MiniGPT-4، ومعظم نماذج اللغة الفيديو لأسباب ميزانية رمزية.
- إعادة تقييم العينات: فلامينغو (دراسة 12.04) ، عائلة إيديفيكس، قزح، OmniMAE.
- مُرِّيّة MLP: LLaVA، LLaVA-NeXT، LLaVA-OneVision، Cambrian-1.
- "مجموعة الإنتباه" "فيلا" و "بالي جيما"
كلّها صحيحة، السؤال الحاسم هو ما إذا كنت مقيدًا على ميزانية الوهم أو على الجودة لكل رمز.
استخدمها
code/main.pyيُبني إهتمام متقاطع على شكل Q-Former:
- محاكاة 256 رمز تصويب الصورة (dim 128).
- إعداد 32 استفسارًا يمكن التعلم (المحط 128).
- تشغيل الاهتمام المتبادل بين النقاط المتوسطة والمنتج (Q من الاستفسارات، K/V من المزادات).
- المشروع إلى LLM-dim (512) عبر طبقة خطية.
- أخرج 32 رمزاً بصرياً جاهزة لـ "إل إل إم".
جميع الرياضيات في بيثون النقي (حلقات مستقرة فوق المتجهات). اللعبة ولكن الشكل الصحيح. يتم طباعة المصفوفة الوزن الاهتمام حتى تتمكن من رؤية أي معجون كل استفسار تم استخراجها من.
أرسله
هذا الدرس يُنتجoutputs/skill-modality-bridge-picker.md. بالنظر إلى تكوين VLM المستهدف (عدد رموز تشفير الرؤية، ميزانية سياق LLM، قيود التنفيذ، هدف الجودة) ، فإنه يوصي Q-Former vs MLP vs Perceiver resampler مع توجيه قصير وتقدير عدد المعلمات لكل جسر.
التمارين
- تنفيذ كتلة الانتباه المتقاطع في PyTorch. التحقق من أن مع 32 استفسار و 256 مفتاح / قيم، المصفوفة الوزن الانتباه هو 32 × 256 وكل صف يصل إلى 1 بعد softmax.
- في مرحلة BLIP-2 1 يقوم Q-Former بتشغيل ثلاثة خسائر في وقت واحد: ITC ، ITM ، ITG. اكتب توقيعًا إلى الأمام لكل منها في رمز مزيف. أي من هذه تتطلب مسار تشفير النص أن يكون نشطًا؟
- مقارنة معدل العد: Q-Former (12 طبقة، 768 مخفية) مقابل مشهد MLP ذو 2 طبقات (1408 → 4096 ، طبقتين). في أي نطاق LLM يعود تكلفة 188M Q-Former في كفاءة التدريب؟
- اقرأ القسم 3.2 من ورقة BLIP-2 (arXiv:2301.12597) حول كيفية تشغيل Q-Former. شرح لماذا تشغيل من قاعدة BERT (ليس عشوائية) يسرع التقارب.
- للفيديو لمدة 10 دقائق عند 1 FPS تم اختباره إلى 60 إطارًا ، احسب تكلفة رمز لكل إطار عند (Q-Former → 32 رمزا / إطار) مقابل (مُرسل MLP → 576 رمزا / إطار). أي منها يناسب نافذة سياق LLM ذات رمزا 128k؟
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| Q-Former | "Querying transformer" | Small transformer with 32 learnable query vectors that cross-attend to frozen ViT features |
| Learnable queries | "Soft prompt for vision" | A fixed set of parameters that serve as the query side of cross-attention; learned per model, shared across all inputs |
| Cross-attention | "Q from here, K/V from there" | Attention where query, key, and value come from different sources; how the queries pull from ViT patches |
| ITC | "Image-text contrastive" | CLIP-style loss applied to Q-Former pooled queries vs text CLS |
| ITM | "Image-text matching" | Binary classifier on hard-negative-mined pairs; forces the queries to discriminate fine-grained mismatches |
| ITG | "Image-grounded text generation" | Causal LM loss where text is generated conditioned on queries; forces queries to encode text-decodable content |
| Two-stage pretraining | "Representation then generative" | Stage 1 trains Q-Former alone (ITC/ITM/ITG); Stage 2 attaches frozen LLM and trains only the projection + Q-Former |
| Frozen backbone | "Do not finetune" | The vision encoder and LLM weights are fixed; only the bridge trains |
| Projection head | "Linear to LLM dim" | Final linear layer mapping Q-Former output to the LLM's embedding dimension |
| Perceiver resampler | "Flamingo's version" | Similar learnable-query cross-attention, used by Flamingo at every layer rather than as a single bridge |
المزيد من القراءة
- Li et al. — BLIP-2 (arXiv:2301.12597)الورق الأساسي
- Li et al. — BLIP (arXiv:2201.12086) السلف مع ثلاثة ITC/ITM/ITG.
- Li et al. — ALBEF (arXiv:2107.07651) "التحديد قبل التضخم" الجدول المفاهيمي للتدريب المرحلة 1
- Dai et al. — InstructBLIP (arXiv:2305.06500) ق-مصمم مطلع على التعليمات.
- Zhu et al. — MiniGPT-4 (arXiv:2304.10592) النهج المُسجل فقط.
- Jaegle et al. — Perceiver IO (arXiv:2107.14795) الهندسة المعمارية العامة للتعلم-البحث المتبادل.
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.