मल्टीमोडल आरएजी और क्रॉस-मोडल रिट्रीवल
Type: Build
Languages: Python (stdlib, cross-modal retriever with fusion + grounded generator)
Prerequisites: Phase 12 · 23 (ColPali), Phase 11 (RAG basics)
Time: ~180 minutes
सीखने के लक्ष्य
- डिजाइन क्रॉस-मोडल रिट्रीवः पाठ → छवि, छवि → पाठ, ऑडियो → वीडियो, आदि
- तीन संलयन रणनीतियों की तुलना करें: स्कोर संलयन, ध्यान आधारित संलयन, एमओई संलयन।
- पीढ़ी के आधार को समझाएंः जब स्रोतों में विभिन्न तरीकों का मिश्रण होता है तो "अपने स्रोतों का हवाला दें" कैसा दिखता है।
- 2025 के तीन कैनोनिक मल्टीमोडल आरएजी सर्वेक्षणों और उनके उप-समस्या वर्गीकरण का नाम बताइए।
समस्या
एकल-मोडलिटी आरएजी एक हल पैटर्न हैः एम्बेड क्वेरी, एम्बेड टुकड़े, रिट्रीव, एलएलएम में सामान। मल्टीमोडल आरएजी की आवश्यकता हैः
- कई रिट्रीवल हेड (प्रत्येक मोडलिटी को एक संगत स्थान में एम्बेड करने की आवश्यकता होती है) ।
- विभिन्न तरीकों में प्राप्ति परिणामों का विलय।
- पीढ़ी की जमीनीकरण जो विभिन्न तरीकों के स्रोतों का उल्लेख करती है।
- आकलन माप जो क्रॉस-मोडल सिग्नल को कवर करते हैं।
2025 के सर्वेक्षण सभी एक ही वर्गीकरण पर आते हैं।
अवधारणा
क्रॉस-मोडल रिट्रीव
मोडलिटी ए के क्वेरी के बाद मोडलिटी बी के दस्तावेज प्राप्त करें। तीन पैटर्नः
- साझा एम्बेडिंग स्पेस. CLIP और CLAP साझा अंतरिक्ष में पाठ + छवि / पाठ + ऑडियो एम्बेडिंग उत्पन्न करते हैं। मोडलिटी के बीच कॉसिन समानता सीधे काम करती है। CLIP-प्रशिक्षित जोड़ों तक सीमित है।
- प्रति-मौजूदाता एन्कोडर + अनुवाद। पाठ एन्कोडर + छवि एन्कोडर + अंतरिक्ष के बीच एक छोटा अनुवादक मॉड्यूल मानचित्रण। गुप्ता और अन्य द्वारा Sen2Sen और अन्य 2024 डिजाइन। लचीला लेकिन जटिलता जोड़ता है।
- VLM को एन्कोडर के रूप में उपयोग करें। VLM के छिपे हुए राज्यों का उपयोग करें। किसी भी मोड को समर्थन करता है। उच्च गुणवत्ता, अधिक महंगा।
विकल्पः पाठ + छवि के लिए CLIP / SigLIP 2; पाठ + ऑडियो के लिए CLAP; सीमा गुणवत्ता वाले क्रॉस-मोडल के लिए VLM-छिपे-राज्य।
विलय रणनीतियाँ
आप 10 परिणाम प्राप्तः 5 छवियों, 3 पाठ मार्ग, 2 ऑडियो क्लिप. आप कैसे मिलाते हैं?
स्कोर फ्यूजन (सस्ते में) प्रत्येक मोडलिटी का अपना रिट्रीवर होता है, प्रत्येक स्कोर देता है। मोडलिटी के भीतर स्कोर को सामान्य बनाएं और फिर योग करें। सरल, अक्सर काम करता है।
ध्यान आधारित संलयन. सभी प्राप्त वस्तुओं को संयोजित, एक छोटे ध्यान नेटवर्क उन्हें वजन. प्रशिक्षण की जरूरत है.
MoE संलयन. मोडलिटी-विशिष्ट विशेषज्ञों के लिए नेटवर्क मार्गों को गेट करना। विभिन्न क्वेरी प्रकार अलग-अलग मार्ग हैं एक दृश्य प्रश्न छवियों का वजन अधिक करता है।
उत्पादन डिफ़ॉल्टः क्वेरी की प्रमुख पद्धति की ओर थोड़ा पूर्वाग्रह के साथ स्कोर फ़्यूजन। यदि ए / बी आपके डोमेन पर स्पष्ट जीत दिखाता है तो MoE में अपग्रेड करें।
पीढ़ी की जमीनीकरण
LLM को यह उल्लेख करना चाहिए कि किस प्राप्त आइटम ने प्रत्येक दावे को प्रेरित किया। बहु-मोडल के लिएः
- पाठ स्रोत: मानक उद्धरण
[1]. . - छवि स्रोत:
[img 3]एक संक्षिप्त उपशीर्षक के साथ। - ऑडियोः
[audio 2 at 0:34]. .
प्रशिक्षण लक्ष्य में प्रत्येक दावे को स्रोत सूचकांक के साथ टैग किया गया है। निष्कर्ष पर, मॉडल स्वाभाविक रूप से उद्धरण जारी करता है।
2025 के सर्वेक्षण
Abootorabi et al. (arXiv:2502.08826, "Ask in Any Modality"): मल्टीमोडल आरएजी के लिए वर्गीकरण। पुनर्प्राप्ति, संलयन, पीढ़ी को कवर करता है। व्यापक कवरेज।
Mei et al. (arXiv:2504.08748, "ए सर्वे ऑफ मल्टीमोडल आरएजी"): उप-कार्य बेंचमार्क और विफलता मोड पर ध्यान केंद्रित करता है। मूल्यांकन डिजाइन के लिए उपयोगी।
झाओ और अन्य (arXiv:2503.18016): दृष्टि केंद्रित सर्वेक्षण। कोलपाली परिवार के काम पर मजबूत।
इन तीनों को पढ़कर आपको वसंत 2025 तक की तकनीक का हाल पता चल जाएगा। अधिकांश उप-समस्या अभी भी खुली हैं।
मुराग आधारभूत पत्र
MuRAG (चेन एट अल, 2022) पहला मल्टीमोडल RAG था। मल्टीमोडल KB से छवि + पाठ प्राप्त किया गया, उत्तर उत्पन्न किए गए। VLM लहर से पहले व्यवहार्यता दिखाई गई। आधुनिक सिस्टम (REACT, VisRAG, M3DocRAG) इस पर निर्माण करते हैं।
उत्पादन यात्रा नियोजक का उदाहरण
प्रश्नः "मुझे प्राकृतिक प्रकाश के साथ शांत शाकाहारी ब्रंच ढूंढें। "
पाइपलाइनः
- क्वेरी को तोड़ दें. "quiet" → ऑडियो / समीक्षा कीवर्ड; "vegan brunch" → मेनू आइटम; "प्राकृतिक प्रकाश" → छवि सुविधा।
- प्रति मोडलिटी निकालनाः
- समीक्षाओं पर पाठ निकालनाः "वेगन ब्रंच, शांत वातावरण।"
- रेस्तरां की तस्वीरों पर छवि पुनर्प्राप्तीः "प्राकृतिक प्रकाश, वायुपूर्ण।"
- परिवेश ध्वनि क्लिप पर ऑडियो निकालनाः "कम डेसिबल, कोई संगीत नहीं।"
- प्रत्येक रेस्तरां में एक समग्र स्कोर होता है।
- शीर्ष-के रेस्तरां → सभी सबूतों के साथ VLM जनरेटर → उद्धरणों के साथ जवाब।
यह पाठ-आरएजी से बहुत आगे है. प्रत्येक मोडलिटी संकेत जोड़ती है कि पाठ अकेले याद आती है।
एजेंटिक मल्टीमोडल आरएजी
मल्टी-हॉपः यदि पहली खोज उच्च आत्मविश्वास वाले उत्तर नहीं देती है, तो एलएलएम फिर से पुनः तैयार करता है और फिर से प्राप्त करता है। यहां चरण 14 से एजेंटिक आरएजी पैटर्न लागू होते हैं। उदाहरणः
- प्रारंभिक शीर्ष 10 → LLM "बहुत शोर, <40 dB के लिए फ़िल्टर" → पुनः प्राप्त करने के लिए कहता है।
- चित्र प्राप्त करें → LLM देखता है एक मेनू है → मेनू पाठ प्राप्त करें → उत्तर।
जटिलता जोड़ता है लेकिन एकल शॉट पुनर्प्राप्ति नहीं कर सकते हैं कि क्वेरी को संभालता है।
मूल्यांकन
क्रॉस-मोडल मूल्यांकन अभी भी अपरिपक्व है।
- प्रति मोडलिटी को याद करें।
- फ्यूज्ड टॉप-के सटीकता.
- मानव-आधारित अंत-से-अंत संतुष्टि।
- कार्य-विशिष्ट (पुस्तक पूरा, खरीदारी की गई)
कोई भी मानक बेंचमार्क सभी तरीकों को कवर नहीं करता है। अधिकांश पेपर डोमेन-विशिष्ट कार्यों पर मूल्यांकन करते हैं।
इसका प्रयोग करें
code/main.py:
- तीन नकली रिट्रीवर (पाठ, छवि, ऑडियो) जो रेस्तरां के साझा कॉर्पस पर काम करते हैं।
- स्कोर फ्यूजन जो मोडलिटी स्कोर को कॉन्फ़िगरेबल वज़न के साथ जोड़ता है।
- एक जनरेटर स्टब जो उद्धरणों के साथ अंतिम उत्तर देता है।
- एक सरल एजेंटिक लूप जो यदि आत्मविश्वास कम है तो क्वेरी को फिर से तैयार करता है।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-multimodal-rag-designer.md. बहुआयामी क्वेरी प्रवाह के साथ उत्पाद विनिर्देश को देखते हुए, रिट्रीवर्स, फ़्यूजन, जनरेटर और मूल्यांकन डिजाइन करें।
व्यायाम
- एक चिकित्सा-त्रयण बहुआयामी आरएजी प्रस्तावित करेंः क्वेरी = चोट की तस्वीर + पाठ लक्षण। किस KB से कौन से मोडलिटी प्राप्त करें?
- स्कोर फ्यूजन एक सरल भारित राशि है. यह किस विफलता मोड है कि MoE फ्यूजन से बचाता है?
- Abootorabi et al. के वर्गीकरण (धारा 3) को पढ़ें। तीन कैनोनिकल उप-समस्याएँ क्या हैं और वे आपके चुने हुए उत्पाद के लिए कैसे मैप करते हैं?
- ट्रिप प्लानर मल्टीमोडल आरएजी के लिए एक मूल्यांकन विनिर्देश डिजाइन करें। छवि याद, ऑडियो याद और समग्र सटीकता को कवर करने वाले कौन से माप हैं?
- एजेंटिक मल्टी-हॉप RAG में प्रति ट्रिप और ट्रिप में लेटेंसी टैक्स है। किस क्वेरी कठिनाई पर सटीकता वृद्धि लेटेंसी को सही ठहराती है?
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| Cross-modal retrieval | "Query one modality, retrieve another" | Text query retrieves images; image query retrieves text; requires a shared space or translator |
| Score fusion | "Combine scores" | Weighted sum of per-modality retrieval scores; simplest fusion |
| MoE fusion | "Modality-routed experts" | Gating network picks which modality's scores to trust per query |
| Grounded generation | "Cite your sources" | Each claim in the answer tagged with the source index |
| MuRAG | "First multimodal RAG" | 2022 paper that established the multimodal RAG pattern |
| Agentic multi-hop | "Reformulate and retry" | LLM re-queries retrievers when first-pass confidence is low |
आगे पढ़ना
- Abootorabi et al. — Ask in Any Modality (arXiv:2502.08826)
- Mei et al. — A Survey of Multimodal RAG (arXiv:2504.08748)
- Zhao et al. — Vision RAG Survey (arXiv:2503.18016)
- Chen et al. — MuRAG (arXiv:2210.02928)
- Liu et al. — REACT (arXiv:2301.10382)
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.