نماذج اللغة الصوتية: السمس إلى صوت فلامينغو 3 آرك
Type: Build
Languages: Python (stdlib, log-Mel spectrogram + audio Q-former skeleton)
Prerequisites: Phase 6 (Speech and Audio), Phase 12 · 03 (Q-Former)
Time: ~180 minutes
أهداف التعلم
- احسب طيف الموجات من شكل موجة: النوافذ، FFT، بنوك التصفية، تحويل الموجات.
- مقارنة خيارات المُشفّر: مُشفّر فُسّر، مُفَرّد، مُختلفة من AF-Whisper.
- بناء صوت Q-former: N استفسارات قابلة للتعلم تتواصل مع معدات الطيف.
- شرح التدريب الصوتي-LLM المتسلسل (Whisper-then-LLM) مقابل التدريب الصوتي-LLM من النهاية: لماذا يتسنى التدريب من النهاية إلى النهاية للتفكير.
المشكلة
تم حل التعرف على الكلام بواسطة Whisper. OCR-of-audio هو سلعة. ولكن "سلعة" تتوقف عند النسخة. إذا لم يتمكن النموذج من التفكير فيما سمع التوقيت، المتحدثين، العاطفة، بنية الموسيقى، الأصوات البيئية النسخة وحدها لا يمكن أن تدفع ميزات المنتج.
ثلاثة طرق واضحة:
- كاسكيد: فيسبر ينسخ، ماجستير في التدريس يبرر النص. يعمل للسيناريوهات النقية للخطاب. يفشل للموسيقى، الصوت البيئي، التداخل متعدد المتحدثين، العاطفة.
- اختتام إلى نهاية الصوت-LLM: مرموز الصوت يطعم رموز الصوت مباشرة إلى LLM ، وتتفاجأ عن النسخة. يحفظ المعلومات الصوتية (العاطفة ، المتحدث ، البيئة). يحتاج إلى بيانات تدريبية جديدة.
- الهجين: مرموز صوت + مرموز نص يمكن أن تكون كل من النسخ والسبب. قوان-آويو وأوديوه فلامينغو اختيار هذا الطريق.
المفهوم
طيف المعلومات: ميزة المدخل
كل مرموز صوت يبدأ بنفس الميزة: طيف الميل.
- إعادة العينة إلى 16 كيلوهرتز
- تحويل فوريه قصير الأجل مع نوافذ 25ms، 10ms قفزة.
- خذ حجم نتيجة FFT.
- تطبيق بنوك فلتر Mel (عادةً 80 مرشحًا في نطاق التسجيل 0-8000 هرتز) لتحريف التردد الإدراكي.
- مضغط السجل (log(1 + x)) للمدى الديناميكي.
النتيجة: صف 2D من الشكل (T، 80) حيث T هو عدد الإطارات الزمنية. لقطة 30 ثانية عند سرعة 100 هرتز: (3000، 80).
مُشفّر "سيسبر"
إن مُشفّر Whisper هو محول فيكتور في نوع 12 طبقة يعالج طيف التطبيقات التنميرية مثل سلسلة من الإطارات الزمنية.
بالنسبة إلى ASR، فإن مُشعري Whisper هو محول انتباه متعدد يُولد رموز نصية مشروطة على إصدار المُشعري.
بالنسبة لـ ALM (الآذا-LLM) ، تريد إنتاج المُشفّر كمدخول إلى LLM مختلف. النمط: مُشفّر الهمس المجمد، ق- سابق قابل للتدريب، LLM المجمد أو المُصَحَّح.
"بيت" و "مبرمجيات صوتية محددة"
تم تدريب "سيسبر" على بيانات السيطرة على الكلام. هو أضعف للموسيقى والصوت البيئي.
بيتس (تشين وآخرون ، 2022) هو محول ذاتي الإشراف تدرب على أوديوسيت. يلتقط الموسيقى والصوت البيئي أفضل من وسبر في نفس عدد المعلمات.
AF-Whisper (المتجانس في أوديوفلامينغو 3): يتميز Whisper + BEATs بالتقاطع كمدخل صوتي. يحمل Whisper إشارة لغوية ، و BEATs إشارة صوتية.
صوت Q-former
نفس النمط مثل Q-former البصري في BLIP-2. عدد ثابت من الاستفسارات القابلة للتعلم (غالبا 32 أو 64) تتواجد عبر إطارات إنتاج مرموز الصوت. تصبح الاستفسارات رموز صوتية تستهلكها LLM.
مرحلة التنظيم التدريبي: Q-former وحدها، خسائر التناقض + الترجمة على أزواج النص الصوتي (AudioCaps، Clotho). مرحلة التعليم: نهاية إلى نهاية، فك التجميد LLM، تدريب على بيانات التعليم.
القوس SALMONN، Qwen-Audio، AF3
سالمون (تانغ وزملاء، 2023): فيسبر + بياتز + كيو-سابق + LLaMA. أول أوسيو-LLM مفتوحة مع قدرة على التفكير الجاد. علامات قياسية على MMAU تظهر ~ 0.55 مركبة.
Qwen-Audio (Chu et al., 2023): بنية مماثلة ، تدرب على مجموعة بيانات أكثر غنى ، مصممة للحوار متعدد التحولات. MMAU ~ 0.60.
LTU الاستماع، التفكير، الفهم (Gong et al., 2023): بيانات التفكير الصريحة، التركيز على سلسلة التفكير على مقاطع الصوت. أصغر ولكن أكثر تركيزا.
أوديوه فلامينغو 3 (غول وآخرون ، يوليو 2025): SOTA المفتوحة الحالية. 8B LLM العمود الفقري (Qwen2 7B) ، Whisper-large encoder concat BEATs ، 64 Q-former ، تدريب على 1M + أزواج تعليمات النص الصوتي. MMAU 0.72, يطابق الحدود الملكية على بعض المهام الفرعية.
يقدم AF3 أيضًا سلسلة التفكير على الطلب للصوت: يمكن للنموذج إصدار رموز التفكير بشكل اختياري ("دعني أحدد الأدوات أولاً: ...") قبل الإجابة النهائية. تحصل الدقة على مهام التفكير المعقدة على 3-5 نقاط عند تمكين التفكير.
التسرب مقابل نهاية إلى نهاية
خط الأنابيب المسبق:
- ويشبر ينسخ الصوت → النص.
- أسباب ماجستير في العلوم على النص
يعمل بشكل مثالي لـ "استجابة هذا البودكاست".
- "ما هو مزاج هذه الأغنية؟" "المزاج هو في الصوت، وليس الكلمات".
- "من يتحدث، أليس أو بوب؟" يتطلب تحديد هويت المتحدث.
- "في أي ثانية يحدث الانفجار؟" "التربية الزمنية ضائعة في النص".
- "هل هذا الصوت حقيقي أم تم إنتاجه؟" الكشف عن الفكاكس العميقة يحتاج إلى ميزات صوتية.
يحتفظ جهاز Qwen-Audio و AF3 بالموسيقى والبيئة والعواطف بشكل طبيعي.
وصفة إنتاج 2026
لإنتاج منتج جديد للتفهم الصوتي:
- إن كان النسخ هو الهدف، لا موسيقى، لا إستنتاج عاطفي.
- AF3 / Qwen-Audio-family إذا: الموسيقى، العاطفة، المتحدثين المتعددين، أو التفكير الصوتي المعقد.
التسرب هو أرخص و أبسط، التسريب من نهاية إلى نهاية هو أكثر قدرة
MMAU مقياس التفكير الصوتي
المملكة المتحدة للصوت (MMAU) (التفاهم المكثف في الصوت المتعدد الحجم) هو معيار التفكير الصوتي 2024-2025:
- 10,000 زوج من النص الصوتي QA عبر الكلام والموسيقى والصوت البيئي.
- تغطي التصنيف والحكم الزمني والحكم العامل والحكم المفتوح.
- يختبر ما يفتقده خطوط الأنابيب المتصاعدة بشكل منهجي
افتتاح SOTA (AF3) عند 0.72; حدود الملكية ~ 0.78 (جيميني 2.5 برو، كلود أوبوس 4.7). الفجوة أصغر من دلتا مفتوح مقابل مغلق فيديو مي، مما يدل على أن أدويو-LLM يتقدم.
استخدمها
code/main.py:
- ينفذ حسابات الطيف المخطط لـ log-Mel في stdlib: windowswing، DFT البديهي، فلتر-bank Mel.
- الهيكل العظمي السابق للصوت Q: إطارات إنتاج المُرمّح معينة، وحساب Q، K، V، الاهتمام، وإصدار رموز N.
- مقارنة في حالة طائفة مقابل نهاية إلى نهاية في مهمة لعبة
أرسله
هذا الدرس يُنتجoutputs/skill-audio-llm-pipeline-picker.md. في ظل مهمة صوتية (ترانسكتابة، وضع علامات الموسيقى، استنتاج العواطف، تحديث اليوميات متعددة المتحدثين، تصنيف البيئة) ، فإنه يختار القصص، AF3 من نهاية إلى نهاية، أو هجين.
التمارين
- احسب طول الطيف الموقع-المل لقطة 30 ثانية عند 16 كيلوهرتز، ونفذة 25ms، 10ms قفز، 80 مل حاويات. كيف يتغير هذا عند 48 كيلوهرتز؟
- لماذا يقدم Whisper أداءً ضعيفًا في الموسيقى؟ ما هي الميزات الصوتية التي يحتوي عليها Beat التي لا يحتوي عليها Whisper؟
- أودي Q-former مع 64 استفسارات مقابل 32: في أي معقدة المهمة 64 يدفع؟ 32 حفظ الحوسبة لماذا؟
- اقرأ القسم 4 من القسم AF3 حول التفكير على الطلب اقترح ثلاث مهام صوتية حيث تساعد سلسلة التفكير أكثر.
- تنفيذ خط أنابيب يومية بسيطة باستخدام خروج AF3 كيف تشير إلى تغييرات مكبر الصوت؟
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| Log-Mel spectrogram | "Mel features" | 2D (time, frequency) array of log-magnitude values after Mel filter banks |
| Audio Q-former | "Audio Perceiver" | Cross-attention bottleneck from audio encoder output to fixed-length queries feeding the LLM |
| Cascaded | "ASR-then-LLM" | Pipeline where Whisper transcribes and a text LLM reasons; loses acoustic information |
| End-to-end | "Audio-LLM" | Audio features enter the LLM directly via Q-former; preserves acoustic signal |
| BEATs | "Audio AudioSet encoder" | SSL transformer trained on AudioSet; strong on music + environmental sounds |
| MMAU | "Audio reasoning bench" | 10k QA pairs across speech, music, environment; 2024 eval standard |
| On-demand thinking | "Audio CoT" | Model can optionally emit reasoning tokens before final answer, lifts accuracy 3-5 pts |
المزيد من القراءة
- Radford et al. — Whisper (arXiv:2212.04356)
- Chu et al. — Qwen-Audio (arXiv:2311.07919)
- Goel et al. — Audio Flamingo 3 (arXiv:2507.08128)
- Tang et al. — SALMONN (arXiv:2310.13289)
- Gong et al. — LTU (arXiv:2305.10790)
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.