Phase 12: Multimodal AI

بازیافت RAG چند مدل و کراس مدل

سند رو به صورت رواني RAG يه قطعه هست تولید RAG چند مدل گسترده تر است بازیافت متن، تصاویر، صوتی و ویدیو برای جریان های کاری مانند برنامه ریزی سفر ("برای من یک شام آرام و گیاهی با نور طبیعی پیدا کنید") ، triage پزشکی ("چه آسیب با این عکس + این یادداشت ها مطابقت دارد") ، تجارت الکترونیکی ("لباس های مشابه این سلفی، در اندازه من") و خدمات ساحی ("این صدا موتور را تشخیص دهید و عکس قطعه را ببینید"). سه نظرسنجی سال 2025 Abootorabi و همکاران، Mei و همکاران، Zhao و همکاران زیرمصائبات: بازیافت متقابل، ادغام بازیافت، زمین سازی تولید، ارزیابی چندمودال را رمزنگاری کرد. این درس بررسی ها را می خواند و یک خط تولید را طراحی می کند.

Type: Build

Languages: Python (stdlib, cross-modal retriever with fusion + grounded generator)

Prerequisites: Phase 12 · 23 (ColPali), Phase 11 (RAG basics)

Time: ~180 minutes

اهداف یادگیری

  • بازیافت متقابل طراحی: متن → تصویر، تصویر → متن، صوتی → ویدیو و غیره
  • سه استراتژی فیوژن را مقایسه کنید: فیوژن امتیاز، فیوژن مبتنی بر توجه، فیوژن MoE.
  • پایه گذاری نسل را توضیح دهید: "تحت اشاره به منابع خود" چه شکلی است وقتی که منابع ترکیبی از روش ها هستند.
  • سه بررسی را در سال 2025 و طبقه بندی زیر مشکل آنها را نام دهید.

مشکل

RAG یک راه حل حل است: درخواست های گنجانده شده، قطعات گنجانده شده، بازیافت، چیزهای به LLM. RAG چند راه حل نیاز به:

  1. چندین سر بازیافت (هر روش نیاز به گنجانده شدن در یک فضای سازگار دارد).
  2. ترکیب نتایج بازیافت در میان روش ها.
  3. زمین سازی نسل که منابع را در میان روش ها ذکر می کند.
  4. متریک ارزیابی که سیگنال های متقابل را پوشش می دهد.

بررسی های سال 2025 همه به یک طبقه بندی مشابه می رسند.

مفهوم

بازیافت متقابل

دریافت اسناد روش B با دریافت یک سوال روش A. سه الگوی:

  1. فضای ادغام مشترک. CLIP و CLAP در فضای مشترک ادغام متن + تصویر / متن + صوتی را تولید می کنند. شباهت کوسین بین روش ها مستقیما کار می کند. محدود به زوج های آموزش CLIP است.
  1. کدرسنده ی هر نوعیت + ترجمه. کدرسنده ی متن + کدرسنده ی تصویر + نقشه برداری ماژول مترجم کوچک بین فضاهای. Sen2Sen توسط گپتا و همکاران و سایر طرح های 2024 . انعطاف پذیر اما پیچیدگی را اضافه می کند.
  1. VLM به عنوان کدگر استفاده کنید. از حالت های پنهان VLM به عنوان نمایش بازیابی استفاده کنید. هر روش VLM پشتیبانی می کند کار می کند. کیفیت بالاتر، گران تر است.

گزینه: CLIP / SigLIP 2 برای متن + تصویر؛ CLAP برای متن + صوتی؛ VLM-hidden-states برای cross-modal در کیفیت مرزی.

استراتژی های ادغام

شما 10 تا نتیجه رو بدست آوردید: 5 تا تصویر، 3 تا متن، 2 تا آڈیو کلیپ. چطور می تونید ادغام کنید؟

ترکیب نمره ( ارزان ترین) هر روش دارای بازیافت کننده خاص خود است، هر یک نمره را باز می آورد. نمره را در حالت معمول پس از جمع بندی. ساده، اغلب کار می کند.

مرکب توجه، تمام موارد بازیافت شده را جمع آوری کنید، اجازه دهید شبکه توجه کوچک وزن آنها را. نیاز به آموزش.

ترکیب MoE. راه های شبکه را به کارشناسان خاص روش می دهد. انواع مختلف سوال مسیر متفاوت است یک سوال بصری وزن تصاویر بالاتر است.

پیش فرض تولید: ترکیب امتیاز با یک تعصب جزئی نسبت به روش غالب جستجو. اگر A / B برندهای واضح در دامنه شما را نشان دهد به MoE ارتقا دهید.

زمین سازی نسل

LLM باید اشاره کند که کدام عنصر بازیافت شده هر ادعا را تحریک کرده است.

  • منبع متن: نقل قول استاندارد [1]. .
  • منبع تصویر: [img 3]با عنوان کوتاه
  • صدا: [audio 2 at 0:34]. .

ژنراتور را با داده های آگاه به زمین آموزش دهید: هر ادعای در هدف آموزش با شاخص منبع برچسب گذاری شده است. در نتیجه، مدل به طور طبیعی نقل قول می کند.

بررسی های سال 2025

Abootorabi و همکاران (arXiv:2502.08826، "به هر نوع درخواست کنید"): تاکسونومی برای RAG چند مودالی. شامل بازیافت، ادغام، تولید می شود. گسترده ترین پوشش.

Mei et al. (arXiv:2504.08748، "یک بررسی از RAG چند مدل"): بر معیار های فرعی و حالت شکست تمرکز می کند. برای طراحی ارزیابی مفید است.

ژائو و همکاران (arXiv:2503.18016): نظرسنجی متمرکز بر دید.

خواندن سه تا به شما در بهار 2025 به حالت هنر می دهد. بیشتر زیرمشکل ها هنوز باز هستند.

MuRAG مقاله اساسی

MuRAG (Chen et al., 2022) اولین RAG چندرنگ بود. تصویر + متن را از KB چندرنگ باز یافت و پاسخها را تولید کرد. قبل از موج VLM امکان پذیر بودن را نشان داد. سیستم های مدرن (REACT، VisRAG، M3DocRAG) بر روی آن ساخته شده اند.

یک مثال از برنامه ریزی سفر تولید

سوال: "من رو يه شام آرام و بي گياه با نور طبيعي پيدا کن".

خط لوله:

  1. جستجو را تجزیه کنید. کلمه کلیدی "سکوت" → صدا / بررسی؛ "برنش گیاهخوار" → قطعه مینو؛ "روش طبیعی" → ویژگی تصویر.
  2. بازیافت در هر روش:

- بازیافت متن در بررسی ها: "برنش گیاهخوار، فضای آرام".

- بازیافت تصویر در عکس رستوران: "نور طبیعی، هوا".

- بازیافت صدا در کلیپ های صدا محیطی: "دسیبل پایین، هیچ موسیقی".

  1. نمرهاي فوز هر رستوران نمرهاي ترکیبی داره
  2. رستوران های برتر → ژنراتور VLM با تمام شواهد → پاسخ با نقل قول.

این فراتر از متن-RAG است. هر روش سیگنال اضافه می کند که متن به تنهایی از دست می دهد.

RAG چند مودیال آژانتک

چند رکود: اگر اولین بازرسی پاسخ های با اطمینان بالا را به دست نیاورد، LLM دوباره شکل می دهد و بازمی گیرد. الگوهای RAG اجنتیک از مرحله 14 در اینجا اعمال می شود. نمونه:

  • اولین 10 تا را بازپس بگیرید → LLM از "خیلی سر و صدا، فیلتر برای <40 dB" می خواهد → دوباره بازپس بگیرید.
  • تصاویر را بازیافت کنید → LLM می بیند که یک منو وجود دارد → متن منو را بازیافت کنید → پاسخ.

پیچیدگی اضافه می کند اما سوالات را که بازیافت یک شات نمی تواند انجام دهد.

ارزیابی

ارزیابی متقابل هنوز نپخته است.

  • به هر روش یادآوری کنید.
  • دقت بالا-ک همگشته شده
  • از نظر انسان رضایت کامل
  • وظایف خاص (حجزات تکمیل شده، خرید انجام شده)

هیچ معیار استاندارد شامل همه روش ها نیست. اکثر مقالات بر روی وظایف خاص حوزه ارزیابی می کنند.

ازش استفاده کن

code/main.py:

  • سه دستگاه بازیافت کننده ساختگی (متن، تصویر، صوتی) که روی یک مجموعه مشترک رستوران ها کار می کنند.
  • ترکیب نمره ای که نمره های حالت را با وزنه های قابل تنظیم ترکیب می کند.
  • یک پخته ژنراتور که با نقل قول پاسخ نهایی را ارسال می کند.
  • یک حلقه ساده ای که سوال را اگر اعتماد کم باشد دوباره شکل می دهد.

-باده

این درس به ما کمک می کندoutputs/skill-multimodal-rag-designer.md. به عنوان مشخصات محصول با جریان سوالات چندمودال، طراحی بازیافت کننده ها، فیوژن، ژنراتور و ارزیابی.

تمرینات

  1. یک RAG چند حالت پزشکی را پیشنهاد کنید: سوال = عکس آسیب + علائم متن. چه روش هایی را از کدام KB بازمی یابیم؟
  1. ترکیب نمره یک مبلغ ساده وزن شده است. چه حالت شکست دارد که ترکیب MoE از آن اجتناب می کند؟
  1. تاکسونومی Abootorabi و همکاران را بخوانید (قسم 3) . سه زیرمسئله کانونیک چیست و چگونه به محصول انتخاب شده شما نقشه می کشند؟
  1. یک مشخصات ارزیابی برای یک RAG چند حالت برنامه ریزی سفر طراحی کنید. کدام متریک ها شامل یادآوری تصویر، یادآوری صوتی و دقت ترکیب می شوند؟
  1. RAG چندپای آژانتک مالیات تاخیر در هر سفر برگشت دارد. در چه مشکل سوال افزایش دقت تاخیر را توجیه می کند؟

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
Cross-modal retrieval"Query one modality, retrieve another"Text query retrieves images; image query retrieves text; requires a shared space or translator
Score fusion"Combine scores"Weighted sum of per-modality retrieval scores; simplest fusion
MoE fusion"Modality-routed experts"Gating network picks which modality's scores to trust per query
Grounded generation"Cite your sources"Each claim in the answer tagged with the source index
MuRAG"First multimodal RAG"2022 paper that established the multimodal RAG pattern
Agentic multi-hop"Reformulate and retry"LLM re-queries retrievers when first-pass confidence is low

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.