الـ RAG المتعددة الحركات والـ Cross-Modal Retrieval
Type: Build
Languages: Python (stdlib, cross-modal retriever with fusion + grounded generator)
Prerequisites: Phase 12 · 23 (ColPali), Phase 11 (RAG basics)
Time: ~180 minutes
أهداف التعلم
- تصميم الاستعراض عبر الطرق: النص → الصورة، الصورة → النص، الصوت → الفيديو، إلخ.
- مقارنة ثلاث استراتيجيات الاندماج: الاندماج النتائج، الاندماج القائم على الاهتمام، الاندماج من الايطال.
- شرح تأسيس الجيل: كيف يبدو "تذكر مصادرك" عندما تكون المصادر مزيجًا من الطرق.
- أسمائ ثلاثة استطلاعات RAG متعددة الحركات القنونية لعام 2025 وتصنيفها للشكل الفرعي للمشاكل.
المشكلة
RAG ذات طريقة واحدة هو نمط حل: إدراج استفسار، إدراج قطع، استرداد، الأشياء في LLM.
- رؤوس الاستخدام المتعددة (كل طريقة تحتاج إلى إدخال في مساحة متوافقة).
- الاندماج بين نتائج الاسترداد عبر الطرق.
- التجميع الذي يذكر المصادر عبر الطرق.
- مقاييس التقييم التي تغطي الإشارة المتقاطعة.
كل استطلاعات عام 2025 تصل إلى نفس التصنيف.
المفهوم
الاستعراض المتقاطع
استرداد وثائق النمط (ب) مع استفسار النمط (أ) ثلاثة أنماط:
- مساحة إدخال مشتركة. تنتج CLIP و CLAP إدخالات نصية + صورة / نصية + صوتية في مساحة مشتركة. تشابه الكوزين عبر الطرق يعمل مباشرة. محدودة إلى أزواج مدربة على CLIP.
- مُخترع المُتَحَرِّف + الترجمة. مُخترع النص + مُخترع الصورة + خريطة وحدات مترجم صغيرة بين الفواض. Sen2Sen من قبل غوبتا وغيرهم. ومصممة 2024 الأخرى. مرنة ولكنها تضيف تعقيدًا.
- استخدام الحالات الخفية لـ VLM كمثابة الاسترداد أي طريقة تدعمها VLM تعمل.
الخيار: CLIP / SigLIP 2 للنص + الصورة؛ CLAP للنص + الصوت؛ VLM-متخفي-حالات للطريقة المتقاطعة في جودة الحدود.
استراتيجيات الاندماج
لقد استعادت 10 نتائج: 5 صور، 3 نصوص، 2 مقاطع صوتية. كيف تجمع؟
تركيب النقاط (أرخص). كل طريقة لها استرداد خاص بها، كل يعود النقاط. عادي النقاط داخل طريقة ثم جمع. بسيط، غالبا ما يعمل.
تركيب الاهتمام، تحكم كل العناصر التي تم استردادها، دع شبكة صغيرة من الاهتمام تعزنهم.
مزيج MOE. فتح طرق الشبكة إلى خبراء محددين في الوسائل. أنواع الاستفسارات المختلفة تتوجّه بشكل مختلف سؤال بصري يزن الصور أعلى.
افتراض الإنتاج: الاندماج مع تحيز طفيف نحو طريقة الاستفسار المهيمنة. قم بتحديث إلى MoE إذا أظهرت A / B أرباح واضحة على مجالك.
التأريخ في الجيل
يجب على الهيئة القضائية الإشارة إلى البند الذي تم استرداده الذي دفع كل مطالبة.
- مصدر النص: اقتباس قياسي
[1]. . . - مصدر الصورة:
[img 3]مع عنوان قصير - الصوت:
[audio 2 at 0:34]. . .
تدريب المولد مع بيانات مدروسة: يتم وضع علامة على كل ادعاء في هدف التدريب مع مؤشر المصدر. عند الاستنتاج، فإن النموذج ينشر بطبيعته اقتباسات.
استطلاعات عام 2025
Abootorabi et al. (arXiv:2502.08826، "سأل في أي طريقة"): تصنيف لـ RAG متعدد الحركات. يغطي الاسترداد والانكماش والإنتاج. تغطية أوسع.
ميه وآخرون (arXiv:2504.08748 ، "مسح لـ RAG متعدد الحركات"): يركز على معايير المهام الفرعية وأوضاع الفشل. مفيد لتصميم التقييم.
تشاو وآخرون (arXiv:2503.18016): مسح تركز على الرؤية. قوي على عمل عائلة كولبالي.
قراءة كل ثلاثة من هذه المعلومات تعطيك حالة الفن اعتبارا من ربيع 2025، معظم المشاكل الفرعية لا تزال مفتوحة.
المراج ورقة الأساس
تم استرداد الصورة + النص من KB متعدد الحركات ، وتوليد الإجابات. أظهرت الجدوى قبل موجة VLM. تقوم الأنظمة الحديثة (REACT ، VisRAG ، M3DocRAG) على ذلك.
مثال على خطة رحلة الإنتاج
سؤال: "اجد لي غداء نباتي هادئ مع الضوء الطبيعي".
خط الأنابيب:
- إزالة الاستفسار. كلمة رئيسية "هدوء" → صوت / مراجعة؛ "مأكولات نباتية" → عنصر القائمة؛ "ضوء طبيعي" → ميزة الصورة.
- الوصول إلى الموقع:
- استرداد النص على المراجعات: "خمر نباتي، جو هادئ".
- استعادة الصورة على صور المطعم: "ضوء طبيعي، هوائي".
- استرداد الصوت على مقاطع الصوت المحيطي: "بطيئة الديسيبل، لا موسيقى".
- كل مطعم لديه نتيجة مركبة
- المطاعم العليا مع كل الأدلة
هذا يتجاوز بكثير النص-RAG. كل طريقة يضيف إشارة التي النص وحده يفتقد.
الـ RAG المتعددة الوسائل
التداول المتعدد: إذا لم يعود الاستجابة الأولى إلى إجابات ذات ثقة عالية، فإن ماجستير في العلوم العليا يقوم بإعادة صياغة وتسترداد مرة أخرى. تنطبق الأنماط الراغية الوكالة من المرحلة 14 هنا. أمثلة:
- استعادة العاشرة الأولى → طلبات ماجستير في العلوم "ضوضاء جدا، تصفية ل <40 دبي" → استعادة.
- استعادة الصور → LLM يرى واحد لديه قائمة → استعادة نص قائمة → الإجابة.
يضيف التعقيد لكنه يدير استفسارات لا يمكن استردادها بمقطعة واحدة
التقييم
التقييم المتبادل لا يزال غير ناضج.
- إعادة التذكر لكل طريقة
- دقة عالية من الـ "ك"
- تقدير البشر الرضا من نهاية إلى نهاية.
- محددة المهمة (حجزات مكتملة، وشراءات تمت).
لا توجد مقياس مقياس قياسي يشمّل جميع الطرق. معظم الأوراق تقييم على مهام محددة في مجال.
استخدمها
code/main.py:
- ثلاثة محركات استرداد مزيفة (نص، صورة، صوت) تعمل على مجموعة مشتركة من المطاعم.
- الاندماج بين النتائج التي تجمع بين النتائج التي يتم تحديدها مع الوزن المُتهيّد.
- أوراق توليد الكهرباء التي تنشر إجابة نهائية مع اقتباسات
- حلقة عملية بسيطة تقوم بإعادة صياغة السؤال إذا كان الثقة منخفضاً.
أرسله
هذا الدرس يُنتجoutputs/skill-multimodal-rag-designer.md. نظرا لمواصفات المنتج مع تدفق استفسار متعدد الحركات، تصميمات الاحتياطيات، الاندماج، المولدات، والتقييم.
التمارين
- اقترحين RAG متعدد الطرق الطبية: استفسار = صورة الإصابة + أعراض النص. ما هي الطرق التي تستخرج من أي KB؟
- الاندماج هو مبلغ بسيط وزن. ما هي وضع الفشل الذي يجنبه الاندماج من الـ MoE؟
- اقرأ تصنيف Abootorabi et al. (الجزء 3) ما هي المشاكل الفرعية القنونية الثلاثة وكيف تتصل بمنتجك المختار؟
- تصميم تحديد تقييم لمخطط رحلة متعددة الطرق RAG. ما هي المعايير التي تغطي استدعاء الصورة، استدعاء الصوت، وصلة المركب؟
- تمتلك وكالة RAG متعددة المكالمات ضريبة على التأخير لكل رحلة ذهاب وإياب. في أي صعوبة استفسار يبرر مكاسب الدقة التأخير؟
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| Cross-modal retrieval | "Query one modality, retrieve another" | Text query retrieves images; image query retrieves text; requires a shared space or translator |
| Score fusion | "Combine scores" | Weighted sum of per-modality retrieval scores; simplest fusion |
| MoE fusion | "Modality-routed experts" | Gating network picks which modality's scores to trust per query |
| Grounded generation | "Cite your sources" | Each claim in the answer tagged with the source index |
| MuRAG | "First multimodal RAG" | 2022 paper that established the multimodal RAG pattern |
| Agentic multi-hop | "Reformulate and retry" | LLM re-queries retrievers when first-pass confidence is low |
المزيد من القراءة
- Abootorabi et al. — Ask in Any Modality (arXiv:2502.08826)
- Mei et al. — A Survey of Multimodal RAG (arXiv:2504.08748)
- Zhao et al. — Vision RAG Survey (arXiv:2503.18016)
- Chen et al. — MuRAG (arXiv:2210.02928)
- Liu et al. — REACT (arXiv:2301.10382)
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.