Phase 12: Multimodal AI

مدل های زبان صوتی: همس به صوتی فلامینگو 3 آرک

Whisper (Radford et al., دسامبر 2022) تشخیص گفتار را حل کرد 680k ساعت گفتار چند زبانی ضعیف نظارت شده، یک ترانسفورماتور کدگذاری-دکودر ساده، یک معیار که باعث شد هر نسخه ASR بعدی آن را نقل کند. اما شناخت استدلال نیست سوال "چه ساز هایی در این ضبط است" یا "چه احساسی سخنران بیان می کند" یا "چه اتفاقی در دقیقه ۳ افتاد" نیاز به درک صوتی دارد، نه نقل. Qwen-Audio، SALMONN، LTU و NVIDIA Audio Flamingo 3 (AF3 جولای 2025) به تدریج این استیک را ساختند: کدر های کلاس Whisper را نگه دارید، روی Q-formers حرکت دهید، روی داده های دستورالعمل های صوتی متن آموزش دهید، استدلال زنجیره ای را اضافه کنید. اين درس به طول مي رود

Type: Build

Languages: Python (stdlib, log-Mel spectrogram + audio Q-former skeleton)

Prerequisites: Phase 6 (Speech and Audio), Phase 12 · 03 (Q-Former)

Time: ~180 minutes

اهداف یادگیری

  • طیف نامه ی Log-Mel را از شکل موج محاسبه کنید: پنجره، FFT، بانک های فیلتر، تغییر log.
  • گزینه های کدگر را مقایسه کنید: کدگر همس، BEATs، AF-Whisper hybrid. هر کدام برنده می شوند.
  • یک Q-former صوتی بسازید: N سوالات قابل یادگیری که به پیچ های طیف افزونه ها کمک می کند.
  • آموزش های Cascaded (Whisper-then-LLM) در مقابل آموزش های Audio-LLM از انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای انتهای

مشکل

تشخیص گفتار توسط Whisper حل شد. OCR از صدا یک کالای است. اما " کالای " در نقل توقف می کند. اگر مدل نمی تواند استدلال کند که چه چیزی را شنیده است زمان، سخنرانان، احساسات، ساختار موسیقی، صداهای محیطی نقل به تنهایی نمی تواند ویژگی های محصول را هدایت کند.

سه راه واضح:

  1. Cascade: Whisper نقل می کند، LLM استدلال بر روی نقل می کند. برای سناریوهای خالص صحبت کار می کند. برای موسیقی، صدا محیط زیست، تعادل چند سخنران، احساسات شکست می خورد.
  1. آڈیو-LLM پایان به پایان: یک کدگر صوتی به طور مستقیم توکن های صوتی را به LLM می دهد، نقل را نادیده می گیرد. اطلاعات صوتی (عاطفه، سخنران، محیط) را حفظ می کند. به داده های آموزشی جدید نیاز دارد.
  1. ترکیبی: کدگر صوتی + کدگر متن که می تواند هم نقل و نقل و استدلال کند. Qwen-Audio و Audio Flamingo این مسیر را انتخاب می کنند.

مفهوم

طیف نامه Log-Mel: ویژگی ورودی

هر کدگر صوتی با یک ویژگی شروع می شود: طیف سنجی Log-Mel.

  1. نمونه ي جديد به 16 kHz
  2. فروريه کوتاه مدت با پنجره 25ms، 10ms hop
  3. اندازه ی نتیجه FFT را در نظر بگیرید.
  4. به طور معمول 80 فیلتر با فاصله ی 0-8000 هرتز) برای انحراف به فرکانس درک استفاده کنید.
  5. فشرده سازی لاگ (log(1 + x)) برای محدوده پویا.

نتیجه: یک آرایه شکل 2D (T، 80) که T تعداد فریم های زمانی است. برای یک کلیپ 30 ثانیه با سرعت فریم 100 هرتز: (3000، 80).

کدگر "ویسپر"

کدگر Whisper یک ترانسفورماتور 12 لایه است که طیف های نوار و میل را به عنوان یک سلسله از فریم های زمانی پردازش می کند.

برای ASR، کدگر Whisper یک ترانسفورماتور توجه متقابل است که توکن های متن را که بر روی خروجی کدگر مشروط است تولید می کند. کدگر استاندارد کدگر-دکودر.

برای ALMs (آدیو-LLMs) ، شما می خواهید که کدگر به عنوان ورودی به یک LLM مختلف. الگوی: کدگر همسفر منجمد، Q-former قابل آموزش، LLM منجمد یا تنظیم شده است.

BEAT ها و کدرهای صوتی خاص

Whisper بر اساس داده های غالب گفتار آموزش دیده است. برای موسیقی و صداهای محیط ضعیف تر است.

BEATs (Chen et al., 2022) یک ترانسفورماتور خود نظارت شده است که در AudioSet آموزش دیده است. موسیقی و صداهای محیطی را بهتر از Whisper در همان تعداد پارامتر ضبط می کند.

AF-Whisper (هائبرید آڈیو فلامینگو 3): Whisper + BEATs به عنوان ورودی صوتی ویژگی دارد. Whisper سیگنال زبانی را حمل می کند، BEATs سیگنال صوتی را حمل می کند.

صوتی Q-former

همان الگوی Q-former بصری BLIP-2 است. تعداد ثابت از سوالات قابل یادگیری (معمولا 32 یا 64) در چارچوب های خروجی کدرس صدا حضور دارند. سوالات تبدیل به توکن های صوتی می شوند که توسط LLM مصرف می شود.

مرحله تعویض آموزش: Q-former تنها، تضاد + از دست دادن عنوان در زوج های آڈیو متن (AudioCaps، Clotho). مرحله آموزش: پایان به پایان، LLM فریز، آموزش در داده های آموزش.

قوس SALMONN، Qwen-Audio، AF3

سالمون (Tang و همکاران 2023): Whisper + BEATs + Q-former + LLaMA. اولین LLM آڈیو باز با توانایی استدلال جدی. معیار در MMAU نشان می دهد ~ 0.55 ترکیب.

Qwen-Audio (Chu et al., 2023): معماری مشابهی، آموزش داده شده بر روی مجموعه داده های غنی تر، تنظیم شده برای گفتگوهای چند دور. MMAU ~ 0.60.

LTU گوش دادن، فکر کردن، درک کردن (Gong et al., 2023): داده های استدلال صریح، تمرکز بر زنجیره تفکر بر روی کلیپ های صوتی. کوچکتر اما متمرکز تر.

آڈیو فلامینگو 3 (گول و همکاران، جولای 2025): SOTA باز فعلی. 8B LLM ستون فقرات (Qwen2 7B) ، Whisper- بزرگ کدگر concat BEATs، 64 سوال Q-former، آموزش در 1M + زوج های آموزش صوتی متن. MMAU 0.72, مطابقت با مرزهای اختصاصی در برخی از زیر وظایف.

AF3 همچنین زنجیره تفکر در مورد تقاضا برای صوتی را معرفی می کند: مدل می تواند به صورت اختیاری توکن های تفکر را قبل از پاسخ نهایی منتشر کند ("به من اجازه دهید ابزارها را شناسایی کنم: ..."). دقت در وظایف استدلال پیچیده 3-5 امتیاز را افزایش می دهد.

آبشار در مقابل پایان تا پایان

لوله های آبشار:

  1. Whisper متن صوتی → متن را نقل می کند.
  2. دلایل LLM بر روی متن

براي "تخمير دادن اين پوکاست" به طور کامل کار ميکنه

  • "حال این آهنگ چیه؟" حال این صداست نه کلمات.
  • "کدام حرف می زنند، آلیس یا باب؟" نیاز به شناسایی سخنران دارد.
  • "فجر چه لحظه اتفاق می افتد؟" "موقع زماني در متن گم شده است".
  • "آیا این صدا واقعی است یا تولید شده است؟" تشخیص عمیق دروغ نیاز به ویژگی های صوتی دارد.

Qwen-Audio و AF3 موسیقی، محیط و احساسات را به صورت بومی اداره می کنند.

2026 دستور تهیه

برای یک محصول جدید برای درک صوتی:

  • اگر: نقل نامه هدف است، هیچ موسیقی، هیچ نتیجه گیری عاطفی.
  • AF3 / Qwen-Audio-family اگر: موسیقی، احساسات، چند سخنران یا استدلال پیچیده صوتی.

Cascaded ارزان تر و ساده تر است. آخر به آخر قادر تر است.

MMAU معیار استدلال صوتی

MMAU (فهم شنیدن آڈیو چند مودالی گسترده) معیار استدلال آڈیو 2024-2025 است:

  • 10 هزار جفت از صداي متن در ارتباط با صداي، موسيقي، صداي هاي بيايي
  • طبقه بندی، استدلال زمانی، استدلال علنی، QA باز.
  • آزمایش می کند که خطوط لوله های زیر آب به طور سیستماتیک از دست می دهند.

SOTA باز (AF3) در 0.72; مرز اختصاصی ~0.78 (Gemini 2.5 Pro، Claude Opus 4.7). شکاف کوچکتر از دلتا باز به مقابل بسته VideoMME است، که نشان می دهد LLM های صوتی در حال پختگی هستند.

ازش استفاده کن

code/main.py:

  • محاسبه طیف سنجی log-Mel را در stdlib پیاده سازی می کند: پنجره سازی، DFT ساده، Mel filter-bank.
  • اسکلوت قبلی Q: فریم های خروجی کدگر داده شده، Q، K، V، توجه را محاسبه کنید و نمادهای N را ارسال کنید.
  • مقایسه با یک بازی با یک بازی

-باده

این درس به ما کمک می کندoutputs/skill-audio-llm-pipeline-picker.md. در نظر گرفتن یک کار صوتی (ترانسکریپشن، برچسب گذاری موسیقی، نتیجه گیری احساسات، روزانه سازی چند سخنران، طبقه بندی محیط) ، آن را انتخاب می کند، فاز، پایان به پایان AF3، یا ترکیبی.

تمرینات

  1. اندازه طیف ترازوی Log-Mel را برای یک کلیپ 30 ثانیه در 16kHz، پنجره 25ms، 10ms hop، 80 Mel bin محاسبه کنید. این چگونه در 48kHz تغییر می کند؟
  1. چرا Whisper در موسیقی عملکرد کمتری دارد؟
  1. آڈیو Q-former با 64 سوال در مقابل 32: در چه کار پیچیده ای 64 سود می برد؟ 32 ذخیره محاسبه برای چه؟
  1. بخش 4 AF3 را در مورد تفکر در مورد تقاضا بخوانید. سه کار صوتی را پیشنهاد کنید که زنجیره تفکر بیشترین کمک را می کند.
  1. از طریق خروجی AF3 یک خط لوله ی روزانه سازی کوچک پیاده سازی کنید.

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
Log-Mel spectrogram"Mel features"2D (time, frequency) array of log-magnitude values after Mel filter banks
Audio Q-former"Audio Perceiver"Cross-attention bottleneck from audio encoder output to fixed-length queries feeding the LLM
Cascaded"ASR-then-LLM"Pipeline where Whisper transcribes and a text LLM reasons; loses acoustic information
End-to-end"Audio-LLM"Audio features enter the LLM directly via Q-former; preserves acoustic signal
BEATs"Audio AudioSet encoder"SSL transformer trained on AudioSet; strong on music + environmental sounds
MMAU"Audio reasoning bench"10k QA pairs across speech, music, environment; 2024 eval standard
On-demand thinking"Audio CoT"Model can optionally emit reasoning tokens before final answer, lifts accuracy 3-5 pts

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.