Phase 12: Multimodal AI

نماذج اللغة الصوتية: السمس إلى صوت فلامينغو 3 آرك

ويشبر (رادفورد وزملاء، ديسمبر 2022) تسوية التعرف على الكلام 680k ساعة من الكلام متعددة اللغات الضعيفة الإشراف، محول رمزية بسيطة-مصطلحات تعريف، وهو مقياس جعل كل إصدار ASR اللاحق اقتباسها. لكن الاعتراف ليس التفكير السؤال عن "ما هي الأدوات التي في هذا التسجيل" أو "ما هو العاطفة التي يعبر عنها المتحدث" أو "ما حدث في الدقيقة 3" يتطلب فهم الصوت، وليس النسخة. قوان-آوديو، SALMONN، LTU، وNVIDIA أوديو فلامينغو 3 (AF3 يوليو 2025) بنيت تدريجيا تلك الدرجة: الحفاظ على مبرمجي فئة فيسبر، والقبض على Q-formers، تدريب على بيانات تعليمات النص الصوتي، إضافة سلسلة من التفكير. هذه الدروس تتحرك في القوس.

Type: Build

Languages: Python (stdlib, log-Mel spectrogram + audio Q-former skeleton)

Prerequisites: Phase 6 (Speech and Audio), Phase 12 · 03 (Q-Former)

Time: ~180 minutes

أهداف التعلم

  • احسب طيف الموجات من شكل موجة: النوافذ، FFT، بنوك التصفية، تحويل الموجات.
  • مقارنة خيارات المُشفّر: مُشفّر فُسّر، مُفَرّد، مُختلفة من AF-Whisper.
  • بناء صوت Q-former: N استفسارات قابلة للتعلم تتواصل مع معدات الطيف.
  • شرح التدريب الصوتي-LLM المتسلسل (Whisper-then-LLM) مقابل التدريب الصوتي-LLM من النهاية: لماذا يتسنى التدريب من النهاية إلى النهاية للتفكير.

المشكلة

تم حل التعرف على الكلام بواسطة Whisper. OCR-of-audio هو سلعة. ولكن "سلعة" تتوقف عند النسخة. إذا لم يتمكن النموذج من التفكير فيما سمع التوقيت، المتحدثين، العاطفة، بنية الموسيقى، الأصوات البيئية النسخة وحدها لا يمكن أن تدفع ميزات المنتج.

ثلاثة طرق واضحة:

  1. كاسكيد: فيسبر ينسخ، ماجستير في التدريس يبرر النص. يعمل للسيناريوهات النقية للخطاب. يفشل للموسيقى، الصوت البيئي، التداخل متعدد المتحدثين، العاطفة.
  1. اختتام إلى نهاية الصوت-LLM: مرموز الصوت يطعم رموز الصوت مباشرة إلى LLM ، وتتفاجأ عن النسخة. يحفظ المعلومات الصوتية (العاطفة ، المتحدث ، البيئة). يحتاج إلى بيانات تدريبية جديدة.
  1. الهجين: مرموز صوت + مرموز نص يمكن أن تكون كل من النسخ والسبب. قوان-آويو وأوديوه فلامينغو اختيار هذا الطريق.

المفهوم

طيف المعلومات: ميزة المدخل

كل مرموز صوت يبدأ بنفس الميزة: طيف الميل.

  1. إعادة العينة إلى 16 كيلوهرتز
  2. تحويل فوريه قصير الأجل مع نوافذ 25ms، 10ms قفزة.
  3. خذ حجم نتيجة FFT.
  4. تطبيق بنوك فلتر Mel (عادةً 80 مرشحًا في نطاق التسجيل 0-8000 هرتز) لتحريف التردد الإدراكي.
  5. مضغط السجل (log(1 + x)) للمدى الديناميكي.

النتيجة: صف 2D من الشكل (T، 80) حيث T هو عدد الإطارات الزمنية. لقطة 30 ثانية عند سرعة 100 هرتز: (3000، 80).

مُشفّر "سيسبر"

إن مُشفّر Whisper هو محول فيكتور في نوع 12 طبقة يعالج طيف التطبيقات التنميرية مثل سلسلة من الإطارات الزمنية.

بالنسبة إلى ASR، فإن مُشعري Whisper هو محول انتباه متعدد يُولد رموز نصية مشروطة على إصدار المُشعري.

بالنسبة لـ ALM (الآذا-LLM) ، تريد إنتاج المُشفّر كمدخول إلى LLM مختلف. النمط: مُشفّر الهمس المجمد، ق- سابق قابل للتدريب، LLM المجمد أو المُصَحَّح.

"بيت" و "مبرمجيات صوتية محددة"

تم تدريب "سيسبر" على بيانات السيطرة على الكلام. هو أضعف للموسيقى والصوت البيئي.

بيتس (تشين وآخرون ، 2022) هو محول ذاتي الإشراف تدرب على أوديوسيت. يلتقط الموسيقى والصوت البيئي أفضل من وسبر في نفس عدد المعلمات.

AF-Whisper (المتجانس في أوديوفلامينغو 3): يتميز Whisper + BEATs بالتقاطع كمدخل صوتي. يحمل Whisper إشارة لغوية ، و BEATs إشارة صوتية.

صوت Q-former

نفس النمط مثل Q-former البصري في BLIP-2. عدد ثابت من الاستفسارات القابلة للتعلم (غالبا 32 أو 64) تتواجد عبر إطارات إنتاج مرموز الصوت. تصبح الاستفسارات رموز صوتية تستهلكها LLM.

مرحلة التنظيم التدريبي: Q-former وحدها، خسائر التناقض + الترجمة على أزواج النص الصوتي (AudioCaps، Clotho). مرحلة التعليم: نهاية إلى نهاية، فك التجميد LLM، تدريب على بيانات التعليم.

القوس SALMONN، Qwen-Audio، AF3

سالمون (تانغ وزملاء، 2023): فيسبر + بياتز + كيو-سابق + LLaMA. أول أوسيو-LLM مفتوحة مع قدرة على التفكير الجاد. علامات قياسية على MMAU تظهر ~ 0.55 مركبة.

Qwen-Audio (Chu et al., 2023): بنية مماثلة ، تدرب على مجموعة بيانات أكثر غنى ، مصممة للحوار متعدد التحولات. MMAU ~ 0.60.

LTU الاستماع، التفكير، الفهم (Gong et al., 2023): بيانات التفكير الصريحة، التركيز على سلسلة التفكير على مقاطع الصوت. أصغر ولكن أكثر تركيزا.

أوديوه فلامينغو 3 (غول وآخرون ، يوليو 2025): SOTA المفتوحة الحالية. 8B LLM العمود الفقري (Qwen2 7B) ، Whisper-large encoder concat BEATs ، 64 Q-former ، تدريب على 1M + أزواج تعليمات النص الصوتي. MMAU 0.72, يطابق الحدود الملكية على بعض المهام الفرعية.

يقدم AF3 أيضًا سلسلة التفكير على الطلب للصوت: يمكن للنموذج إصدار رموز التفكير بشكل اختياري ("دعني أحدد الأدوات أولاً: ...") قبل الإجابة النهائية. تحصل الدقة على مهام التفكير المعقدة على 3-5 نقاط عند تمكين التفكير.

التسرب مقابل نهاية إلى نهاية

خط الأنابيب المسبق:

  1. ويشبر ينسخ الصوت → النص.
  2. أسباب ماجستير في العلوم على النص

يعمل بشكل مثالي لـ "استجابة هذا البودكاست".

  • "ما هو مزاج هذه الأغنية؟" "المزاج هو في الصوت، وليس الكلمات".
  • "من يتحدث، أليس أو بوب؟" يتطلب تحديد هويت المتحدث.
  • "في أي ثانية يحدث الانفجار؟" "التربية الزمنية ضائعة في النص".
  • "هل هذا الصوت حقيقي أم تم إنتاجه؟" الكشف عن الفكاكس العميقة يحتاج إلى ميزات صوتية.

يحتفظ جهاز Qwen-Audio و AF3 بالموسيقى والبيئة والعواطف بشكل طبيعي.

وصفة إنتاج 2026

لإنتاج منتج جديد للتفهم الصوتي:

  • إن كان النسخ هو الهدف، لا موسيقى، لا إستنتاج عاطفي.
  • AF3 / Qwen-Audio-family إذا: الموسيقى، العاطفة، المتحدثين المتعددين، أو التفكير الصوتي المعقد.

التسرب هو أرخص و أبسط، التسريب من نهاية إلى نهاية هو أكثر قدرة

MMAU مقياس التفكير الصوتي

المملكة المتحدة للصوت (MMAU) (التفاهم المكثف في الصوت المتعدد الحجم) هو معيار التفكير الصوتي 2024-2025:

  • 10,000 زوج من النص الصوتي QA عبر الكلام والموسيقى والصوت البيئي.
  • تغطي التصنيف والحكم الزمني والحكم العامل والحكم المفتوح.
  • يختبر ما يفتقده خطوط الأنابيب المتصاعدة بشكل منهجي

افتتاح SOTA (AF3) عند 0.72; حدود الملكية ~ 0.78 (جيميني 2.5 برو، كلود أوبوس 4.7). الفجوة أصغر من دلتا مفتوح مقابل مغلق فيديو مي، مما يدل على أن أدويو-LLM يتقدم.

استخدمها

code/main.py:

  • ينفذ حسابات الطيف المخطط لـ log-Mel في stdlib: windowswing، DFT البديهي، فلتر-bank Mel.
  • الهيكل العظمي السابق للصوت Q: إطارات إنتاج المُرمّح معينة، وحساب Q، K، V، الاهتمام، وإصدار رموز N.
  • مقارنة في حالة طائفة مقابل نهاية إلى نهاية في مهمة لعبة

أرسله

هذا الدرس يُنتجoutputs/skill-audio-llm-pipeline-picker.md. في ظل مهمة صوتية (ترانسكتابة، وضع علامات الموسيقى، استنتاج العواطف، تحديث اليوميات متعددة المتحدثين، تصنيف البيئة) ، فإنه يختار القصص، AF3 من نهاية إلى نهاية، أو هجين.

التمارين

  1. احسب طول الطيف الموقع-المل لقطة 30 ثانية عند 16 كيلوهرتز، ونفذة 25ms، 10ms قفز، 80 مل حاويات. كيف يتغير هذا عند 48 كيلوهرتز؟
  1. لماذا يقدم Whisper أداءً ضعيفًا في الموسيقى؟ ما هي الميزات الصوتية التي يحتوي عليها Beat التي لا يحتوي عليها Whisper؟
  1. أودي Q-former مع 64 استفسارات مقابل 32: في أي معقدة المهمة 64 يدفع؟ 32 حفظ الحوسبة لماذا؟
  1. اقرأ القسم 4 من القسم AF3 حول التفكير على الطلب اقترح ثلاث مهام صوتية حيث تساعد سلسلة التفكير أكثر.
  1. تنفيذ خط أنابيب يومية بسيطة باستخدام خروج AF3 كيف تشير إلى تغييرات مكبر الصوت؟

الشروط الرئيسية

TermWhat people sayWhat it actually means
Log-Mel spectrogram"Mel features"2D (time, frequency) array of log-magnitude values after Mel filter banks
Audio Q-former"Audio Perceiver"Cross-attention bottleneck from audio encoder output to fixed-length queries feeding the LLM
Cascaded"ASR-then-LLM"Pipeline where Whisper transcribes and a text LLM reasons; loses acoustic information
End-to-end"Audio-LLM"Audio features enter the LLM directly via Q-former; preserves acoustic signal
BEATs"Audio AudioSet encoder"SSL transformer trained on AudioSet; strong on music + environmental sounds
MMAU"Audio reasoning bench"10k QA pairs across speech, music, environment; 2024 eval standard
On-demand thinking"Audio CoT"Model can optionally emit reasoning tokens before final answer, lifts accuracy 3-5 pts

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.