Phase 12: Multimodal AI

मल्टीमोडल आरएजी और क्रॉस-मोडल रिट्रीवल

दृष्टि-निवासी दस्तावेज RAG एक स्लाइस है। उत्पादन मल्टीमोडल RAG व्यापक हो जाता है यात्रा योजना ("मुझे प्राकृतिक प्रकाश के साथ शांत शाकाहारी ब्रंच ढूंढें"), चिकित्सा triage ("इस तस्वीर + इन नोट्स से कौन सी चोट मेल खाती है"), ई-कॉमर्स ("इस सेल्फी के समान पोशाक, मेरे आकार में"), और फील्ड सेवा ("इस इंजन ध्वनि और भाग की तस्वीर के साथ निदान करें") जैसे कार्यप्रवाहों के लिए पाठ, छवियों, ऑडियो और वीडियो को पुनर्प्राप्त करना। तीन 2025 सर्वेक्षण Abootorabi et al., Mei et al., Zhao et al. उप-समस्याओं को संकलित किया गयाः क्रॉस-मोडल रिट्रीवल, रिट्रीवल फ्यूजन, जनरेशन ग्राउंडिंग, मल्टीमोडल मूल्यांकन। इस पाठ में सर्वेक्षणों को पढ़ा जाता है और उत्पादन पाइपलाइन का डिजाइन किया जाता है।

Type: Build

Languages: Python (stdlib, cross-modal retriever with fusion + grounded generator)

Prerequisites: Phase 12 · 23 (ColPali), Phase 11 (RAG basics)

Time: ~180 minutes

सीखने के लक्ष्य

  • डिजाइन क्रॉस-मोडल रिट्रीवः पाठ → छवि, छवि → पाठ, ऑडियो → वीडियो, आदि
  • तीन संलयन रणनीतियों की तुलना करें: स्कोर संलयन, ध्यान आधारित संलयन, एमओई संलयन।
  • पीढ़ी के आधार को समझाएंः जब स्रोतों में विभिन्न तरीकों का मिश्रण होता है तो "अपने स्रोतों का हवाला दें" कैसा दिखता है।
  • 2025 के तीन कैनोनिक मल्टीमोडल आरएजी सर्वेक्षणों और उनके उप-समस्या वर्गीकरण का नाम बताइए।

समस्या

एकल-मोडलिटी आरएजी एक हल पैटर्न हैः एम्बेड क्वेरी, एम्बेड टुकड़े, रिट्रीव, एलएलएम में सामान। मल्टीमोडल आरएजी की आवश्यकता हैः

  1. कई रिट्रीवल हेड (प्रत्येक मोडलिटी को एक संगत स्थान में एम्बेड करने की आवश्यकता होती है) ।
  2. विभिन्न तरीकों में प्राप्ति परिणामों का विलय।
  3. पीढ़ी की जमीनीकरण जो विभिन्न तरीकों के स्रोतों का उल्लेख करती है।
  4. आकलन माप जो क्रॉस-मोडल सिग्नल को कवर करते हैं।

2025 के सर्वेक्षण सभी एक ही वर्गीकरण पर आते हैं।

अवधारणा

क्रॉस-मोडल रिट्रीव

मोडलिटी ए के क्वेरी के बाद मोडलिटी बी के दस्तावेज प्राप्त करें। तीन पैटर्नः

  1. साझा एम्बेडिंग स्पेस. CLIP और CLAP साझा अंतरिक्ष में पाठ + छवि / पाठ + ऑडियो एम्बेडिंग उत्पन्न करते हैं। मोडलिटी के बीच कॉसिन समानता सीधे काम करती है। CLIP-प्रशिक्षित जोड़ों तक सीमित है।
  1. प्रति-मौजूदाता एन्कोडर + अनुवाद। पाठ एन्कोडर + छवि एन्कोडर + अंतरिक्ष के बीच एक छोटा अनुवादक मॉड्यूल मानचित्रण। गुप्ता और अन्य द्वारा Sen2Sen और अन्य 2024 डिजाइन। लचीला लेकिन जटिलता जोड़ता है।
  1. VLM को एन्कोडर के रूप में उपयोग करें। VLM के छिपे हुए राज्यों का उपयोग करें। किसी भी मोड को समर्थन करता है। उच्च गुणवत्ता, अधिक महंगा।

विकल्पः पाठ + छवि के लिए CLIP / SigLIP 2; पाठ + ऑडियो के लिए CLAP; सीमा गुणवत्ता वाले क्रॉस-मोडल के लिए VLM-छिपे-राज्य।

विलय रणनीतियाँ

आप 10 परिणाम प्राप्तः 5 छवियों, 3 पाठ मार्ग, 2 ऑडियो क्लिप. आप कैसे मिलाते हैं?

स्कोर फ्यूजन (सस्ते में) प्रत्येक मोडलिटी का अपना रिट्रीवर होता है, प्रत्येक स्कोर देता है। मोडलिटी के भीतर स्कोर को सामान्य बनाएं और फिर योग करें। सरल, अक्सर काम करता है।

ध्यान आधारित संलयन. सभी प्राप्त वस्तुओं को संयोजित, एक छोटे ध्यान नेटवर्क उन्हें वजन. प्रशिक्षण की जरूरत है.

MoE संलयन. मोडलिटी-विशिष्ट विशेषज्ञों के लिए नेटवर्क मार्गों को गेट करना। विभिन्न क्वेरी प्रकार अलग-अलग मार्ग हैं एक दृश्य प्रश्न छवियों का वजन अधिक करता है।

उत्पादन डिफ़ॉल्टः क्वेरी की प्रमुख पद्धति की ओर थोड़ा पूर्वाग्रह के साथ स्कोर फ़्यूजन। यदि ए / बी आपके डोमेन पर स्पष्ट जीत दिखाता है तो MoE में अपग्रेड करें।

पीढ़ी की जमीनीकरण

LLM को यह उल्लेख करना चाहिए कि किस प्राप्त आइटम ने प्रत्येक दावे को प्रेरित किया। बहु-मोडल के लिएः

  • पाठ स्रोत: मानक उद्धरण [1]. .
  • छवि स्रोत: [img 3]एक संक्षिप्त उपशीर्षक के साथ।
  • ऑडियोः [audio 2 at 0:34]. .

प्रशिक्षण लक्ष्य में प्रत्येक दावे को स्रोत सूचकांक के साथ टैग किया गया है। निष्कर्ष पर, मॉडल स्वाभाविक रूप से उद्धरण जारी करता है।

2025 के सर्वेक्षण

Abootorabi et al. (arXiv:2502.08826, "Ask in Any Modality"): मल्टीमोडल आरएजी के लिए वर्गीकरण। पुनर्प्राप्ति, संलयन, पीढ़ी को कवर करता है। व्यापक कवरेज।

Mei et al. (arXiv:2504.08748, "ए सर्वे ऑफ मल्टीमोडल आरएजी"): उप-कार्य बेंचमार्क और विफलता मोड पर ध्यान केंद्रित करता है। मूल्यांकन डिजाइन के लिए उपयोगी।

झाओ और अन्य (arXiv:2503.18016): दृष्टि केंद्रित सर्वेक्षण। कोलपाली परिवार के काम पर मजबूत।

इन तीनों को पढ़कर आपको वसंत 2025 तक की तकनीक का हाल पता चल जाएगा। अधिकांश उप-समस्या अभी भी खुली हैं।

मुराग आधारभूत पत्र

MuRAG (चेन एट अल, 2022) पहला मल्टीमोडल RAG था। मल्टीमोडल KB से छवि + पाठ प्राप्त किया गया, उत्तर उत्पन्न किए गए। VLM लहर से पहले व्यवहार्यता दिखाई गई। आधुनिक सिस्टम (REACT, VisRAG, M3DocRAG) इस पर निर्माण करते हैं।

उत्पादन यात्रा नियोजक का उदाहरण

प्रश्नः "मुझे प्राकृतिक प्रकाश के साथ शांत शाकाहारी ब्रंच ढूंढें। "

पाइपलाइनः

  1. क्वेरी को तोड़ दें. "quiet" → ऑडियो / समीक्षा कीवर्ड; "vegan brunch" → मेनू आइटम; "प्राकृतिक प्रकाश" → छवि सुविधा।
  2. प्रति मोडलिटी निकालनाः

- समीक्षाओं पर पाठ निकालनाः "वेगन ब्रंच, शांत वातावरण।"

- रेस्तरां की तस्वीरों पर छवि पुनर्प्राप्तीः "प्राकृतिक प्रकाश, वायुपूर्ण।"

- परिवेश ध्वनि क्लिप पर ऑडियो निकालनाः "कम डेसिबल, कोई संगीत नहीं।"

  1. प्रत्येक रेस्तरां में एक समग्र स्कोर होता है।
  2. शीर्ष-के रेस्तरां → सभी सबूतों के साथ VLM जनरेटर → उद्धरणों के साथ जवाब।

यह पाठ-आरएजी से बहुत आगे है. प्रत्येक मोडलिटी संकेत जोड़ती है कि पाठ अकेले याद आती है।

एजेंटिक मल्टीमोडल आरएजी

मल्टी-हॉपः यदि पहली खोज उच्च आत्मविश्वास वाले उत्तर नहीं देती है, तो एलएलएम फिर से पुनः तैयार करता है और फिर से प्राप्त करता है। यहां चरण 14 से एजेंटिक आरएजी पैटर्न लागू होते हैं। उदाहरणः

  • प्रारंभिक शीर्ष 10 → LLM "बहुत शोर, <40 dB के लिए फ़िल्टर" → पुनः प्राप्त करने के लिए कहता है।
  • चित्र प्राप्त करें → LLM देखता है एक मेनू है → मेनू पाठ प्राप्त करें → उत्तर।

जटिलता जोड़ता है लेकिन एकल शॉट पुनर्प्राप्ति नहीं कर सकते हैं कि क्वेरी को संभालता है।

मूल्यांकन

क्रॉस-मोडल मूल्यांकन अभी भी अपरिपक्व है।

  • प्रति मोडलिटी को याद करें।
  • फ्यूज्ड टॉप-के सटीकता.
  • मानव-आधारित अंत-से-अंत संतुष्टि।
  • कार्य-विशिष्ट (पुस्तक पूरा, खरीदारी की गई)

कोई भी मानक बेंचमार्क सभी तरीकों को कवर नहीं करता है। अधिकांश पेपर डोमेन-विशिष्ट कार्यों पर मूल्यांकन करते हैं।

इसका प्रयोग करें

code/main.py:

  • तीन नकली रिट्रीवर (पाठ, छवि, ऑडियो) जो रेस्तरां के साझा कॉर्पस पर काम करते हैं।
  • स्कोर फ्यूजन जो मोडलिटी स्कोर को कॉन्फ़िगरेबल वज़न के साथ जोड़ता है।
  • एक जनरेटर स्टब जो उद्धरणों के साथ अंतिम उत्तर देता है।
  • एक सरल एजेंटिक लूप जो यदि आत्मविश्वास कम है तो क्वेरी को फिर से तैयार करता है।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-multimodal-rag-designer.md. बहुआयामी क्वेरी प्रवाह के साथ उत्पाद विनिर्देश को देखते हुए, रिट्रीवर्स, फ़्यूजन, जनरेटर और मूल्यांकन डिजाइन करें।

व्यायाम

  1. एक चिकित्सा-त्रयण बहुआयामी आरएजी प्रस्तावित करेंः क्वेरी = चोट की तस्वीर + पाठ लक्षण। किस KB से कौन से मोडलिटी प्राप्त करें?
  1. स्कोर फ्यूजन एक सरल भारित राशि है. यह किस विफलता मोड है कि MoE फ्यूजन से बचाता है?
  1. Abootorabi et al. के वर्गीकरण (धारा 3) को पढ़ें। तीन कैनोनिकल उप-समस्याएँ क्या हैं और वे आपके चुने हुए उत्पाद के लिए कैसे मैप करते हैं?
  1. ट्रिप प्लानर मल्टीमोडल आरएजी के लिए एक मूल्यांकन विनिर्देश डिजाइन करें। छवि याद, ऑडियो याद और समग्र सटीकता को कवर करने वाले कौन से माप हैं?
  1. एजेंटिक मल्टी-हॉप RAG में प्रति ट्रिप और ट्रिप में लेटेंसी टैक्स है। किस क्वेरी कठिनाई पर सटीकता वृद्धि लेटेंसी को सही ठहराती है?

प्रमुख शर्तें

TermWhat people sayWhat it actually means
Cross-modal retrieval"Query one modality, retrieve another"Text query retrieves images; image query retrieves text; requires a shared space or translator
Score fusion"Combine scores"Weighted sum of per-modality retrieval scores; simplest fusion
MoE fusion"Modality-routed experts"Gating network picks which modality's scores to trust per query
Grounded generation"Cite your sources"Each claim in the answer tagged with the source index
MuRAG"First multimodal RAG"2022 paper that established the multimodal RAG pattern
Agentic multi-hop"Reformulate and retry"LLM re-queries retrievers when first-pass confidence is low

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.