Phase 12: Multimodal AI

ऑडियो-भाषा मॉडलः ऑडियो फ्लैमिंगो 3 आर्क को चुप्पी

विस्पर (राडफोर्ड एट अल, दिसंबर 2022) ने कम से कम पर्यवेक्षित बहुभाषी भाषण के 680k घंटे की भाषण पहचान को व्यवस्थित किया, एक सरल एन्कोडर-डेकोडर ट्रांसफार्मर, एक बेंचमार्क जिसने प्रत्येक बाद में एएसआर रिलीज को इसका हवाला दिया। लेकिन पहचान तर्क नहीं है। "इस रिकॉर्डिंग में कौन से वाद्ययंत्र हैं" या "स्पीकर क्या भावना व्यक्त कर रहा है" या "मिनट 3 में क्या हुआ था" पूछने के लिए ऑडियो समझ की आवश्यकता होती है, न कि प्रतिलिपि। क्यूवेन-ऑडियो, सल्मोन, एलटीयू और एनवीआईडीए के ऑडियो फ्लेमिंगो 3 (एएफ 3, जुलाई 2025) ने धीरे-धीरे उस स्टैक को बनायाः व्हिस्पर-क्लास एन्कोडर बनाए रखें, क्यू-फॉर्मर पर बोल्ट करें, ऑडियो-टेक्स्ट निर्देश डेटा पर प्रशिक्षण दें, विचार श्रृंखला तर्क जोड़ें। यह सबक एक लम्बी दूरी पर है।

Type: Build

Languages: Python (stdlib, log-Mel spectrogram + audio Q-former skeleton)

Prerequisites: Phase 6 (Speech and Audio), Phase 12 · 03 (Q-Former)

Time: ~180 minutes

सीखने के लक्ष्य

  • एक लहर के रूप से लॉग-मेल स्पेक्ट्रोग्राम की गणना करेंः खिड़की, एफएफटी, फिल्टर बैंकों, लॉग परिवर्तन।
  • एन्कोडर विकल्पों की तुलना करेंः विस्पर एन्कोडर, बीएटीएस, एएफ-विस्पर हाइब्रिड। जब प्रत्येक जीतता है।
  • एक ऑडियो Q-former बनाएंः N स्पेक्ट्रोग्राम पैचों को पार-सहायता करने वाले सीखने योग्य क्वेरी।
  • अंत-से-अंत ऑडियो-एलएलएम प्रशिक्षण के मुकाबले कैस्केड (विस्पर-तो-एलएलएम) को समझाएंः तर्क के लिए अंत-से-अंत स्केल बेहतर क्यों हैं।

समस्या

वाणी पहचान विस्पर द्वारा हल की गई थी। ऑडियो का ओसीआर एक वस्तु है। लेकिन "सामग्री" ट्रांसक्रिप्शन पर रुक जाती है। यदि मॉडल यह नहीं समझ सकता कि उसने क्या सुना है समय, स्पीकर, भावना, संगीत संरचना, पर्यावरण की आवाज़ अकेले ट्रांसक्रिप्शन उत्पाद सुविधाओं को चला नहीं सकता है।

तीन स्पष्ट मार्गः

  1. कैस्केडः विस्पर ट्रांसक्रिप्ट, एलएलएम ट्रांसक्रिप्ट पर तर्क। शुद्ध भाषण परिदृश्यों के लिए काम करता है। संगीत, पर्यावरण ऑडियो, मल्टी-स्पीकर ओवरलैप, भावना के लिए विफलता।
  1. एंड-टू-एंड ऑडियो-एलएलएमः एक ऑडियो एन्कोडर ऑडियो टोकन को सीधे एलएलएम में फ़ीड करता है, ट्रांसक्रिप्शन को छोड़ता है। ध्वनिक जानकारी (भावना, स्पीकर, वातावरण) को संरक्षित करता है। नए प्रशिक्षण डेटा की आवश्यकता होती है।
  1. हाइब्रिडः ऑडियो एन्कोडर + टेक्स्ट डेकोडर जो ट्रांसक्रिप्ट और तर्क दोनों कर सकता है। क्यूवेन-ऑडियो और ऑडियो फ्लेमिंगो इस मार्ग को चुनते हैं।

अवधारणा

लॉग-मेल स्पेक्ट्रोग्रामः इनपुट सुविधा

प्रत्येक ऑडियो एन्कोडर एक ही सुविधा से शुरू होता हैः एक लॉग-मेल स्पेक्ट्रोग्राम।

  1. 16 kHz पर पुनः नमूना।
  2. 25ms खिड़कियों के साथ अल्पकालिक फ़ूरियर परिवर्तन, 10ms कूद.
  3. एफएफटी परिणाम की परिमाण लें।
  4. मेल फिल्टर बैंकों (आमतौर पर लॉग-स्पेस 0-8000 हर्ट्ज के 80 फिल्टर) को धारणा आवृत्ति पर विरूपण के लिए लागू करें।
  5. गतिशील सीमा के लिए लॉग कंप्रेस (log(1 + x))

परिणामः आकार का 2D सरणी (T, 80) जहां T समय फ्रेम की संख्या है। 100 हर्ट्ज फ्रेम रेट पर 30 सेकंड के क्लिप के लिएः (3000, 80).

विस्पर का एन्कोडर

विस्पर का एन्कोडर एक 12-परत ViT शैली ट्रांसफार्मर है जो लॉग-मेल स्पेक्ट्रोग्राम को समय फ्रेम के अनुक्रम के रूप में संसाधित करता है। आउटपुटः प्रति समय फ्रेम एक छिपा हुआ-राज्य वेक्टर।

एएसआर के लिए, व्हिस्पर का डिकोडर एक क्रॉस-एटेंशन ट्रांसफार्मर है जो कोड आउटपुट पर संबद्ध टेक्स्ट टोकन उत्पन्न करता है। मानक कोड-डिकोडर।

एएलएम (ऑडियो-एलएलएम) के लिए, आप एक अलग एलएलएम में इनपुट के रूप में एन्कोडर आउटपुट चाहते हैं। पैटर्नः विस्पर एन्कोडर जमे हुए, क्यू-पूर्व प्रशिक्षित, एलएलएम जमे हुए या ट्यून किए गए।

बीईएटी और ऑडियो-विशिष्ट एन्कोडर

विस्पर को भाषण-प्रमुख डेटा पर प्रशिक्षित किया गया था। यह संगीत और पर्यावरण ऑडियो के लिए कमजोर है।

बीएटीएस (चेन एट अल, 2022) एक ऑडियोसेट पर प्रशिक्षित स्व-निरीक्षण ट्रांसफार्मर है। यह उसी पैरामीटर की गिनती पर व्हिस्पर की तुलना में बेहतर संगीत और पर्यावरण की आवाज़ को कैप्चर करता है।

AF-Whisper (ऑडियो फ्लेमिंगो 3 का हाइब्रिड): कॉनकाट Whisper + BEATs ऑडियो इनपुट के रूप में कार्य करता है। Whisper भाषाई संकेत ले जाता है, BEATs ध्वनिक संकेत ले जाता है।

ऑडियो Q-former

BLIP-2 के दृश्य Q-former के समान पैटर्न। ऑडियो एन्कोडर के आउटपुट फ्रेम पर एक निश्चित संख्या में सीखने योग्य क्वेरी (अक्सर 32 या 64) क्रॉस-एटेंचर होती हैं। क्वेरी एलएलएम द्वारा खपत किए जाने वाले ऑडियो टोकन बन जाती हैं।

प्रशिक्षण संरेखण चरणः अकेले क्यू-पूर्व, ऑडियो-टेक्स्ट जोड़े पर विपरीत + कैप्शन हानि (ऑडियोकैप्स, क्लोटो) ।

धनुष SALMONN, Qwen-Audio, AF3

सल्मन (टंग एट अल, 2023): व्हिस्पर + बीट्स + क्यू-पूर्व + एलएएमए। गंभीर तर्क क्षमता के साथ पहला खुला ऑडियो-एलएलएम। एमएमएयू पर बेंचमार्क ~ 0.55 समग्र दिखाते हैं।

क्यूवेन-ऑडियो (चु एट अल, 2023): समान वास्तुकला, समृद्ध डेटासेट पर प्रशिक्षित, बहु-टर्न संवाद के लिए ट्यून। एमएमएयू ~ 0.60।

LTU सुनो, सोचो, समझो (Gong et al., 2023): स्पष्ट तर्क डेटा, ऑडियो क्लिप पर सोच श्रृंखला पर ध्यान केंद्रित करें। छोटा लेकिन अधिक केंद्रित।

ऑडियो फ्लेमिंगो 3 (गोएल एट अल, जुलाई 2025): वर्तमान खुला SOTA. 8B LLM रीढ़ (क्यूवेन2 7B), व्हिस्पर-बड़ी एन्कोडर कॉन्टैक्ट बीएटी, 64-क्वेरी क्यू-पूर्व, 1M+ ऑडियो-टेक्स्ट निर्देश जोड़े पर प्रशिक्षण। एमएमएयू 0.72, कुछ उप-कार्यों पर मालिकाना सीमा से मेल खाता है।

AF3 ऑडियो के लिए ऑन-डिमांड सोच श्रृंखला भी पेश करता हैः मॉडल अंतिम उत्तर से पहले वैकल्पिक रूप से सोच टोकन ("मुझे पहले उपकरणों की पहचान करने दोः ...") जारी कर सकता है। जटिल तर्क कार्यों पर सटीकता सोच सक्षम होने पर 3-5 अंक बढ़ जाती है।

सिंक बनाम अंत-से-अंत

पानी में गिरने वाली पाइपलाइनः

  1. विस्पर ऑडियो → पाठ को ट्रांसक्रिप्ट करता है।
  2. पाठ पर LLM कारणों।

"इस पॉडकास्ट को सारांशित करें" के लिए एकदम सही काम करता है।

  • "इस गीत का मूड क्या है? " मूड ध्वनि में है, शब्दों में नहीं।
  • "कौन बोल रहा है, एलिस या बॉब? " स्पीकर की पहचान की आवश्यकता होती है।
  • "विस्फोट किस समय होता है? " पाठ में समय के आधार खो गया।
  • "क्या यह वास्तविक या उत्पन्न ऑडियो है? " डीपफैक का पता लगाने के लिए ध्वनिक सुविधाओं की आवश्यकता होती है।

Qwen-Audio और AF3 संगीत, वातावरण और भावनाओं को मूल रूप से संभालते हैं।

2026 उत्पादन नुस्खा

एक नए ऑडियो-समझने वाले उत्पाद के लिएः

  • यदि: प्रतिलेखन लक्ष्य है, कोई संगीत, कोई भावना inference नहीं.
  • AF3 / Qwen-Audio-family यदिः संगीत, भावना, बहुभाषी, या जटिल ऑडियो तर्क।

Cascaded सस्ता और सरल है. अंत से अंत अधिक सक्षम है.

एमएमएयू ऑडियो तर्क मानदंड

एमएमएयू (मॉसिव मल्टीमोडल ऑडियो समझ) 2024-2025 के ऑडियो तर्क का बेंचमार्क हैः

  • 10,000 ऑडियो-टेक्स्ट QA जोड़े भाषण, संगीत, पर्यावरण ध्वनियों के माध्यम से।
  • वर्गीकरण, समय तर्क, कारण तर्क, खुला-समाप्त QA को शामिल करता है।
  • यह परीक्षण करता है कि क्या cascaded पाइपलाइनों व्यवस्थित रूप से चूक जाते हैं।

ओपन SOTA (AF3) 0.72; स्वामित्व सीमा ~0.78 (जेमिनी 2.5 प्रो, क्लाउड ओपस 4.7) । अंतर वीडियोएमएमई के ओपन- बनाम क्लोज्ड डेल्टा से छोटा है, जो ऑडियो-एलएलएम की परिपक्वता का संकेत देता है।

इसका प्रयोग करें

code/main.py:

  • stdlib में लॉग-मेल स्पेक्ट्रोग्राम गणना लागू करता हैः विंडोइंग, साफ़ डीएफटी, मेल फ़िल्टर-बैंक।
  • ऑडियो क्यू-पूर्व कंकालः दिए गए एन्कोडर आउटपुट फ्रेम, गणना क्यू, के, वी, ध्यान, और emit N टोकन।
  • एक खिलौना कार्य पर एक सील बनाम अंत-से-अंत तुलना।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-audio-llm-pipeline-picker.md. एक ऑडियो कार्य (अनुवाद, संगीत टैगिंग, भावनाओं का अनुमान लगाना, बहु-स्पीकर डायरीकरण, पर्यावरण वर्गीकरण) को देखते हुए, यह कैस्केड, एंड-टू-एंड एएफ3 या हाइब्रिड चुनता है।

व्यायाम

  1. 16kHz, 25ms खिड़की, 10ms कूद, 80 Mel डिब्बे पर 30 सेकंड क्लिप के लिए लॉग-मेल स्पेक्ट्रोग्राम आयाम की गणना करें। यह 48kHz पर कैसे बदलता है?
  1. बीएटीएस में कौन सी ऑडियो सुविधाएं हैं जो विस्पर नहीं करती हैं?
  1. 64 प्रश्नों के साथ ऑडियो क्यू-पूर्व बनाम 32: किस कार्य की जटिलता पर 64 भुगतान करता है? 32 क्या के लिए गणना सहेजें?
  1. AF3 धारा 4 को पढ़िए, "ऑन-डिमांड थिंकिंग" के बारे में। तीन ऑडियो कार्य प्रस्तावित करें, जहां सोच श्रृंखला सबसे अधिक मदद करती है।
  1. AF3 के आउटपुट का उपयोग करके एक न्यूनतम डायरीकरण पाइपलाइन लागू करें। आप स्पीकर परिवर्तनों को कैसे संकेत देते हैं?

प्रमुख शर्तें

TermWhat people sayWhat it actually means
Log-Mel spectrogram"Mel features"2D (time, frequency) array of log-magnitude values after Mel filter banks
Audio Q-former"Audio Perceiver"Cross-attention bottleneck from audio encoder output to fixed-length queries feeding the LLM
Cascaded"ASR-then-LLM"Pipeline where Whisper transcribes and a text LLM reasons; loses acoustic information
End-to-end"Audio-LLM"Audio features enter the LLM directly via Q-former; preserves acoustic signal
BEATs"Audio AudioSet encoder"SSL transformer trained on AudioSet; strong on music + environmental sounds
MMAU"Audio reasoning bench"10k QA pairs across speech, music, environment; 2024 eval standard
On-demand thinking"Audio CoT"Model can optionally emit reasoning tokens before final answer, lifts accuracy 3-5 pts

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.