ऑडियो-भाषा मॉडलः ऑडियो फ्लैमिंगो 3 आर्क को चुप्पी
Type: Build
Languages: Python (stdlib, log-Mel spectrogram + audio Q-former skeleton)
Prerequisites: Phase 6 (Speech and Audio), Phase 12 · 03 (Q-Former)
Time: ~180 minutes
सीखने के लक्ष्य
- एक लहर के रूप से लॉग-मेल स्पेक्ट्रोग्राम की गणना करेंः खिड़की, एफएफटी, फिल्टर बैंकों, लॉग परिवर्तन।
- एन्कोडर विकल्पों की तुलना करेंः विस्पर एन्कोडर, बीएटीएस, एएफ-विस्पर हाइब्रिड। जब प्रत्येक जीतता है।
- एक ऑडियो Q-former बनाएंः N स्पेक्ट्रोग्राम पैचों को पार-सहायता करने वाले सीखने योग्य क्वेरी।
- अंत-से-अंत ऑडियो-एलएलएम प्रशिक्षण के मुकाबले कैस्केड (विस्पर-तो-एलएलएम) को समझाएंः तर्क के लिए अंत-से-अंत स्केल बेहतर क्यों हैं।
समस्या
वाणी पहचान विस्पर द्वारा हल की गई थी। ऑडियो का ओसीआर एक वस्तु है। लेकिन "सामग्री" ट्रांसक्रिप्शन पर रुक जाती है। यदि मॉडल यह नहीं समझ सकता कि उसने क्या सुना है समय, स्पीकर, भावना, संगीत संरचना, पर्यावरण की आवाज़ अकेले ट्रांसक्रिप्शन उत्पाद सुविधाओं को चला नहीं सकता है।
तीन स्पष्ट मार्गः
- कैस्केडः विस्पर ट्रांसक्रिप्ट, एलएलएम ट्रांसक्रिप्ट पर तर्क। शुद्ध भाषण परिदृश्यों के लिए काम करता है। संगीत, पर्यावरण ऑडियो, मल्टी-स्पीकर ओवरलैप, भावना के लिए विफलता।
- एंड-टू-एंड ऑडियो-एलएलएमः एक ऑडियो एन्कोडर ऑडियो टोकन को सीधे एलएलएम में फ़ीड करता है, ट्रांसक्रिप्शन को छोड़ता है। ध्वनिक जानकारी (भावना, स्पीकर, वातावरण) को संरक्षित करता है। नए प्रशिक्षण डेटा की आवश्यकता होती है।
- हाइब्रिडः ऑडियो एन्कोडर + टेक्स्ट डेकोडर जो ट्रांसक्रिप्ट और तर्क दोनों कर सकता है। क्यूवेन-ऑडियो और ऑडियो फ्लेमिंगो इस मार्ग को चुनते हैं।
अवधारणा
लॉग-मेल स्पेक्ट्रोग्रामः इनपुट सुविधा
प्रत्येक ऑडियो एन्कोडर एक ही सुविधा से शुरू होता हैः एक लॉग-मेल स्पेक्ट्रोग्राम।
- 16 kHz पर पुनः नमूना।
- 25ms खिड़कियों के साथ अल्पकालिक फ़ूरियर परिवर्तन, 10ms कूद.
- एफएफटी परिणाम की परिमाण लें।
- मेल फिल्टर बैंकों (आमतौर पर लॉग-स्पेस 0-8000 हर्ट्ज के 80 फिल्टर) को धारणा आवृत्ति पर विरूपण के लिए लागू करें।
- गतिशील सीमा के लिए लॉग कंप्रेस (log(1 + x))
परिणामः आकार का 2D सरणी (T, 80) जहां T समय फ्रेम की संख्या है। 100 हर्ट्ज फ्रेम रेट पर 30 सेकंड के क्लिप के लिएः (3000, 80).
विस्पर का एन्कोडर
विस्पर का एन्कोडर एक 12-परत ViT शैली ट्रांसफार्मर है जो लॉग-मेल स्पेक्ट्रोग्राम को समय फ्रेम के अनुक्रम के रूप में संसाधित करता है। आउटपुटः प्रति समय फ्रेम एक छिपा हुआ-राज्य वेक्टर।
एएसआर के लिए, व्हिस्पर का डिकोडर एक क्रॉस-एटेंशन ट्रांसफार्मर है जो कोड आउटपुट पर संबद्ध टेक्स्ट टोकन उत्पन्न करता है। मानक कोड-डिकोडर।
एएलएम (ऑडियो-एलएलएम) के लिए, आप एक अलग एलएलएम में इनपुट के रूप में एन्कोडर आउटपुट चाहते हैं। पैटर्नः विस्पर एन्कोडर जमे हुए, क्यू-पूर्व प्रशिक्षित, एलएलएम जमे हुए या ट्यून किए गए।
बीईएटी और ऑडियो-विशिष्ट एन्कोडर
विस्पर को भाषण-प्रमुख डेटा पर प्रशिक्षित किया गया था। यह संगीत और पर्यावरण ऑडियो के लिए कमजोर है।
बीएटीएस (चेन एट अल, 2022) एक ऑडियोसेट पर प्रशिक्षित स्व-निरीक्षण ट्रांसफार्मर है। यह उसी पैरामीटर की गिनती पर व्हिस्पर की तुलना में बेहतर संगीत और पर्यावरण की आवाज़ को कैप्चर करता है।
AF-Whisper (ऑडियो फ्लेमिंगो 3 का हाइब्रिड): कॉनकाट Whisper + BEATs ऑडियो इनपुट के रूप में कार्य करता है। Whisper भाषाई संकेत ले जाता है, BEATs ध्वनिक संकेत ले जाता है।
ऑडियो Q-former
BLIP-2 के दृश्य Q-former के समान पैटर्न। ऑडियो एन्कोडर के आउटपुट फ्रेम पर एक निश्चित संख्या में सीखने योग्य क्वेरी (अक्सर 32 या 64) क्रॉस-एटेंचर होती हैं। क्वेरी एलएलएम द्वारा खपत किए जाने वाले ऑडियो टोकन बन जाती हैं।
प्रशिक्षण संरेखण चरणः अकेले क्यू-पूर्व, ऑडियो-टेक्स्ट जोड़े पर विपरीत + कैप्शन हानि (ऑडियोकैप्स, क्लोटो) ।
धनुष SALMONN, Qwen-Audio, AF3
सल्मन (टंग एट अल, 2023): व्हिस्पर + बीट्स + क्यू-पूर्व + एलएएमए। गंभीर तर्क क्षमता के साथ पहला खुला ऑडियो-एलएलएम। एमएमएयू पर बेंचमार्क ~ 0.55 समग्र दिखाते हैं।
क्यूवेन-ऑडियो (चु एट अल, 2023): समान वास्तुकला, समृद्ध डेटासेट पर प्रशिक्षित, बहु-टर्न संवाद के लिए ट्यून। एमएमएयू ~ 0.60।
LTU सुनो, सोचो, समझो (Gong et al., 2023): स्पष्ट तर्क डेटा, ऑडियो क्लिप पर सोच श्रृंखला पर ध्यान केंद्रित करें। छोटा लेकिन अधिक केंद्रित।
ऑडियो फ्लेमिंगो 3 (गोएल एट अल, जुलाई 2025): वर्तमान खुला SOTA. 8B LLM रीढ़ (क्यूवेन2 7B), व्हिस्पर-बड़ी एन्कोडर कॉन्टैक्ट बीएटी, 64-क्वेरी क्यू-पूर्व, 1M+ ऑडियो-टेक्स्ट निर्देश जोड़े पर प्रशिक्षण। एमएमएयू 0.72, कुछ उप-कार्यों पर मालिकाना सीमा से मेल खाता है।
AF3 ऑडियो के लिए ऑन-डिमांड सोच श्रृंखला भी पेश करता हैः मॉडल अंतिम उत्तर से पहले वैकल्पिक रूप से सोच टोकन ("मुझे पहले उपकरणों की पहचान करने दोः ...") जारी कर सकता है। जटिल तर्क कार्यों पर सटीकता सोच सक्षम होने पर 3-5 अंक बढ़ जाती है।
सिंक बनाम अंत-से-अंत
पानी में गिरने वाली पाइपलाइनः
- विस्पर ऑडियो → पाठ को ट्रांसक्रिप्ट करता है।
- पाठ पर LLM कारणों।
"इस पॉडकास्ट को सारांशित करें" के लिए एकदम सही काम करता है।
- "इस गीत का मूड क्या है? " मूड ध्वनि में है, शब्दों में नहीं।
- "कौन बोल रहा है, एलिस या बॉब? " स्पीकर की पहचान की आवश्यकता होती है।
- "विस्फोट किस समय होता है? " पाठ में समय के आधार खो गया।
- "क्या यह वास्तविक या उत्पन्न ऑडियो है? " डीपफैक का पता लगाने के लिए ध्वनिक सुविधाओं की आवश्यकता होती है।
Qwen-Audio और AF3 संगीत, वातावरण और भावनाओं को मूल रूप से संभालते हैं।
2026 उत्पादन नुस्खा
एक नए ऑडियो-समझने वाले उत्पाद के लिएः
- यदि: प्रतिलेखन लक्ष्य है, कोई संगीत, कोई भावना inference नहीं.
- AF3 / Qwen-Audio-family यदिः संगीत, भावना, बहुभाषी, या जटिल ऑडियो तर्क।
Cascaded सस्ता और सरल है. अंत से अंत अधिक सक्षम है.
एमएमएयू ऑडियो तर्क मानदंड
एमएमएयू (मॉसिव मल्टीमोडल ऑडियो समझ) 2024-2025 के ऑडियो तर्क का बेंचमार्क हैः
- 10,000 ऑडियो-टेक्स्ट QA जोड़े भाषण, संगीत, पर्यावरण ध्वनियों के माध्यम से।
- वर्गीकरण, समय तर्क, कारण तर्क, खुला-समाप्त QA को शामिल करता है।
- यह परीक्षण करता है कि क्या cascaded पाइपलाइनों व्यवस्थित रूप से चूक जाते हैं।
ओपन SOTA (AF3) 0.72; स्वामित्व सीमा ~0.78 (जेमिनी 2.5 प्रो, क्लाउड ओपस 4.7) । अंतर वीडियोएमएमई के ओपन- बनाम क्लोज्ड डेल्टा से छोटा है, जो ऑडियो-एलएलएम की परिपक्वता का संकेत देता है।
इसका प्रयोग करें
code/main.py:
- stdlib में लॉग-मेल स्पेक्ट्रोग्राम गणना लागू करता हैः विंडोइंग, साफ़ डीएफटी, मेल फ़िल्टर-बैंक।
- ऑडियो क्यू-पूर्व कंकालः दिए गए एन्कोडर आउटपुट फ्रेम, गणना क्यू, के, वी, ध्यान, और emit N टोकन।
- एक खिलौना कार्य पर एक सील बनाम अंत-से-अंत तुलना।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-audio-llm-pipeline-picker.md. एक ऑडियो कार्य (अनुवाद, संगीत टैगिंग, भावनाओं का अनुमान लगाना, बहु-स्पीकर डायरीकरण, पर्यावरण वर्गीकरण) को देखते हुए, यह कैस्केड, एंड-टू-एंड एएफ3 या हाइब्रिड चुनता है।
व्यायाम
- 16kHz, 25ms खिड़की, 10ms कूद, 80 Mel डिब्बे पर 30 सेकंड क्लिप के लिए लॉग-मेल स्पेक्ट्रोग्राम आयाम की गणना करें। यह 48kHz पर कैसे बदलता है?
- बीएटीएस में कौन सी ऑडियो सुविधाएं हैं जो विस्पर नहीं करती हैं?
- 64 प्रश्नों के साथ ऑडियो क्यू-पूर्व बनाम 32: किस कार्य की जटिलता पर 64 भुगतान करता है? 32 क्या के लिए गणना सहेजें?
- AF3 धारा 4 को पढ़िए, "ऑन-डिमांड थिंकिंग" के बारे में। तीन ऑडियो कार्य प्रस्तावित करें, जहां सोच श्रृंखला सबसे अधिक मदद करती है।
- AF3 के आउटपुट का उपयोग करके एक न्यूनतम डायरीकरण पाइपलाइन लागू करें। आप स्पीकर परिवर्तनों को कैसे संकेत देते हैं?
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| Log-Mel spectrogram | "Mel features" | 2D (time, frequency) array of log-magnitude values after Mel filter banks |
| Audio Q-former | "Audio Perceiver" | Cross-attention bottleneck from audio encoder output to fixed-length queries feeding the LLM |
| Cascaded | "ASR-then-LLM" | Pipeline where Whisper transcribes and a text LLM reasons; loses acoustic information |
| End-to-end | "Audio-LLM" | Audio features enter the LLM directly via Q-former; preserves acoustic signal |
| BEATs | "Audio AudioSet encoder" | SSL transformer trained on AudioSet; strong on music + environmental sounds |
| MMAU | "Audio reasoning bench" | 10k QA pairs across speech, music, environment; 2024 eval standard |
| On-demand thinking | "Audio CoT" | Model can optionally emit reasoning tokens before final answer, lifts accuracy 3-5 pts |
आगे पढ़ना
- Radford et al. — Whisper (arXiv:2212.04356)
- Chu et al. — Qwen-Audio (arXiv:2311.07919)
- Goel et al. — Audio Flamingo 3 (arXiv:2507.08128)
- Tang et al. — SALMONN (arXiv:2310.13289)
- Gong et al. — LTU (arXiv:2305.10790)
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.