جامبا محول SSM الهجري
Type: Learn
Languages: Python (stdlib, layer-mix calculator)
Prerequisites: Phase 10 · 14 (open-model architectures), Phase 10 · 17 (native sparse attention)
Time: ~60 minutes
أهداف التعلم
- شرح الأسباب الأولية الثلاثة في كتلة جامبا طبقات المحول، طبقات مامبا، مو إيه و وصفة 1:7: حتى ترك بينهما.
- أوضح كيف تبدو تكرار SSM على مستوى عال ولماذا يسمح بإستنتاج ذاكرة ثابتة.
- قم بحساب بصمة الكشيف KV لنموذج Jamba في سياق 256k ومقارنة ما سيحتاجه نموذج Transformer النقي.
- أسمائ ثلاثة ابتكارات Mamba-3 (التخفيف التراسبيزي التراسبيزي، تحديث الحالة ذات القيمة المعقدة، MIMO) والمشكلة التي تهدف إليها كل منها.
المشكلة
الانتباه مربع في طول التسلسل. نماذج الفضاء الحكومية خطية. هذا الفرق مركبات: عند 256k رموز، خريطة الانتباه Transformer هو 65B إدخالات لكل رأس. حالة SSM المتكررة هي ثابتة بغض النظر عن طول التسلسل.
نموذجات SSM النقية (Mamba، Mamba-2) تتطابق مع تعقيدات المحولات على نطاق صغير ولكن تتأخر عن مهام تتبع الحالة وتفشل في بعض فئات الاستعراض داخل السياق. الاندماج: SSM تضغط التاريخ إلى حالة ثابتة، وعندما يكون التاريخ طويلًا، تتسرب المعلومات. الاهتمام يتذكر كل شيء بالضبط ولكن يدفع تكلفة مربعة.
الحل الواضح: استخدم الاثنين ضع طبقات من Transformer حيث التذكر الدقيق مهم. استخدم طبقات SSM في مكان آخر -أصطف النسبة جامبا هو أول نموذج في مستوى الإنتاج الذي قام بنقل هذه الوصفة الهجينة على نطاق واسع (52B إجمالي ، 12B نشط ، إطار 256k ، GPU واحد 80GB). تمدد Jamba 1.5 العائلة إلى 398B إجمالي / 94B نشط. Mamba-3 (ICLR 2026) هو أفضل خط أساسي للـ SSM النقي الذي يمكن إعادة بناء الهجائر حول.
هذه الدروس تقرأ جميع الأوراق الثلاثة وتنتج النموذج العقلي ل"اختر النسبة الصحيحة".
المفهوم
إرسال رسالة في صفحة واحدة
نموذج الفضاء الحالي يعالج تسلسلx_1, ..., x_Nعبر حالة ذات حجم ثابتh:
h_t = A h_{t-1} + B x_t
y_t = C h_tفي كل خطوة تتطور الحالة عبر ديناميكية خطيةA، يستغرق المدخلاتB x_t، ويعمل على إصدارC h_t. .A, B, Cيمكن أن تتعلم. لاحظ الخصية الحاسوبية: الحوسبة y_tاحتياجات فقطh_{t-1}وx_t، ليس من قبلxالذاكرة ثابتة، الإستدلال هو O 1 لكل رمز
الخدعة لجودة النموذج هي بنيةA. S4 (Gu 2021) استخدم ماتريسا مهيكلة للغاية يمكن تقييمها بكفاءة كالتحويل الطويل أثناء التدريب.A, B, Cمع تلك التي تعتمد على البيانات (الجزء "المتخذي"). Mamba-2 (2024) أبسطت الهيكل بشكل أكبر. Mamba-3 (2026) يضيف تعقيدًا في أماكن محددة.
الخصائص الرئيسية: بالنسبة لـ LLM المفكّر، فإن طبقة SSM هي بديل متدفق لطبقة الاهتمام، مع حالة طبقة ذات حجم ثابت بدلاً من كاش كوي متزايد.
"بلوك "جامبا
كتلة جامبا تتقاطع الطبقات وفقا لأرقام:
l: نسبة الاهتمام إلى مامبا.l = 8، أي طبقة واحدة من المتحول لكل 7 طبقات مناما (7 مناما + 1 انتباه = 8 طبقات لكل مجموعة).e: تردد MoE. يستخدم Jambae = 2، مما يعني أن كل طبقة أخرى تنطبق على الـ "مو إي".
تسلسل الطبقة داخل كتلة:
M M M M M M M A (7 Mamba + 1 Attention)
| M | M | M | M (where | marks MoE applied)كل كتلة جامبا هي 8 طبقات. عند 4 كتلة عميقة (32 طبقة في الإجمال) ، تحصل على 28 من ممبا و 4 طبقات الانتباه. 16 من تلك تستخدم MoE.
لماذا نسبة 1: 7
أجرى AI21 إزالة: ما هو النسبة من الاهتمام إلى الماما التي تعطى أفضل الارتباك لكل معيار و التذكير في السياق على تقييمات السياق الطويل؟
- الاهتمام الكبير (1:1): يزداد الجودة ولكن الذاكرة والسرعة تتدهور.
- القليل جدا من الاهتمام (1:15): الذاكرة كبيرة ولكن استرداد في السياق يفشل.
- نقطة حلوة: 1:7 أو 1:8.
الاندماج: طبقات المحول تتعامل مع التذكر الدقيق وتتبع الحالة الطبقات منamba تتعامل مع الجزء الرخيص من المعالجة.
التشفير الموضعي
طبقات مامبا هي نفسها مدركة للموقف (من خلال التكرار). طبقات الاهتمام في الهجائر الأصلية المستندة إلى مامبا لم تستخدم روبي قدمت الطبقات SSM معلومات الموقف. يضيف جامبا 1.5 روبي إلى طبقات الاهتمام لتعميم السياق الطويل ، وهو تصفيف ما بعد الحاق بناءً على تقييم تجربي للمناطق الطويلة.
ميزانية الذاكرة
بالنسبة لشكل جامبا-1 (32 طبقة: 28 ممبا + 4 انتباه، مخفي 4096, 32 رأس انتباه):
- الاحتفاظ بالخلفية (قوائم الاهتمام فقط):
2 4 32 128 256k * 2 = 8.4 GBفي 256k BF16 فقط 4 طبقات الاهتمام تساهم. - حالة نظام التأمين:
28 hidden state_sizeفي كل علامة، ولكن هذا هو حجم ثابت لكل طبقة، وليس مقياس مع طول التسلسل. حالة ممبا النموذجية هي 16 لكل ميزة، مخفية 4096:28 4096 16 * 2 = 3.7 MBإجمالي
مقارنة مع محول نقي في 32 طبقة، نفس المخفي، كامل MHA في 32 رأس:2 32 32 128 256k 2 = 128 GBفي 256k BF16. انخفاض 8x في الاحتفاظ KV. حتى ضد GQA ((8) خط الأساسية معظم طراز 2024 استخدام (2 32 8 128 256k 2 = 32 GB(جامبا) الهجينة 1: 7 في 16 جيجا غيغابايت هي لا تزال أصغر بمقدار 2x.
هذا ما يعنيه AI21 بـ "256k سياق على GPU واحد 80GB". لن يتناسب مخزن KV من Transformer خالص كامل MHA. حتى خط أساسي GQA لا يترك أي مساحة للوزن والتنشيط.
مامبا-3: خط أساسي للسيطرة النظيفة في عام 2026
يقدم Mamba-3 (ICLR 2026, arXiv:2603.15569) ثلاثة ابتكارات على جانب SSM النقي:
- Exponential-trapezoidal discretization.يبدل طريقة أويلر من التخفيف في Mamba-2 بتكرار أكثر تعبيرًا. يتم تطبيق عملية تشبه التخفيف على مدخل الحالة داخل التكرار الأساسي ، بدلاً من كونها تحفيف خارجي على
x_t. . .
- Complex-valued state update.خفض Mamba السابقة ماتريكية الدولة من المعقدة (S4) إلى المقطع الحقيقي (Mamba) إلى الهوية المتوسطة (Mamba-2). Mamba-3 إعادة إضافة القيم المعقدة المُتساوية لتضمين دوران يعتمد على البيانات على الدولة. هذا يعيد قدرات تتبع الدولة التي تكلفة التبسيطات الحقيقية السابقة.
- Multi-input multi-output (MIMO) projections.بدلاً من التنبؤات المتوسطة لكل ميزة، استخدم التنبؤات ذات القيمة المصفوفة. يحسن قدرة النمذجة واستخدام الأجهزة في وقت الاستنتاج دون زيادة تأخر فك التشفير.
عند معايير 1.5B، تحسن Mamba-3 متوسط دقة التدفق التدريجي بنسبة 0.6 نقطة على Gated DeltaNet؛ يضيف فارق MIMO 1.2 نقطة أخرى لتحقيق مكاسب إجمالية 1.8 نقطة. عند نفس حجم الحالة، يطابق Mamba-3 Mamba-2 مع نصف الحالة.
لم يتم شحن Mamba-3 بعد في سيارة هجينة الإنتاج على نطاق واسع ولكنه مرشح واضح للجانب SSM للنموذج القادم من فئة Jamba.
متى يجب الوصول إلى الهجين
الفائزين الهجراء عندما:
- السياق طويل بما فيه الكفاية حتى يصبح التخزين الكهربائي لـ Transformer KV الصافي مؤلمًا (64k +).
- المهام تخلط بنية قصيرة المدى (جيدة ل SSM) مع استدعاء طويل المدى (احتياجات المحول).
- تريد نشر على ميزانيات الذاكرة من GPU واحد حيث لن يناسب متخزن KV Transformer وحده.
الخسارة في الحيوانات الهجينة عندما:
- السياق قصير (أقل من 16K). تم إهدار تكاليف SSM ، المحول النقي جيد.
- المهام تحتاج إلى اهتمام في كل مكان (الاعتقاد العميق، الإشارة المتقاطعة متعددة الوثائق).
- أنت تتحرك إلى طرازات الحدود التي تبلغ تريليونات المعلمات. Pure-Transformer + MLA + MoE (طراز DeepSeek-V3) يفوز حالياً بالسباق في القدرة.
المناظر الطبيعية التنافسية
| Model | Family | Scale | Unique claim |
|---|---|---|---|
| Mamba-2 | pure SSM | 3B | linear time, constant memory |
| Jamba | hybrid | 52B/12B | 256k on 80GB |
| Jamba 1.5 Large | hybrid | 398B/94B | enterprise-grade long-context |
| Mamba-3 | pure SSM | 1.5B (paper) | state-tracking restored |
| DeepSeek-V3 | pure Transformer + MoE | 671B/37B | frontier capability |
المشهد 2026: يهيمن على الحدود من خلال التحولات الصافية ، ولكن المواصلات الهجينة تمتلك مكانة السياق الإضافية 256k. قد تدفع انتصارات Mamba-3 في تعقب الحالة النسب الهجينة إلى أدنى مستوى (مزيد من SSM ، أقل اهتماما) في الجيل التالي.
استخدمها
code/main.pyهو محاسبة ذاكرة للهندسة المعمارية الهجينة. بالنظر إلى نسبة SSM-Transformer وتكوين حجم مخفي / عدد الطبقات ، فإنه يحسب:
- الاحتفاظ بمسح الجهاز في سياق الهدف
- الذاكرة في حالة SSM.
- الذاكرة الإجمالية في السياق N لمجموعة من أشكال النموذج.
الحاسبة تدعم:
- خط أساسي لـ Pure- Transformer (تزداد مخزن KV مع N).
- طراز جامبا: 1،7 هجين
- نظام سلمي خالص (لا يوجد مخزن كيه في الجهاز)
الأرقام هي مباشرة من أوراق جامبا-1 وجامبا-1.5 للأشكال المنشورة واستقطب للخيارات الفرضية.
اعتبارات التكامل لتنفيذ حقيقي:
- معظم خوادم استنتاج الإنتاج (vLLM، SGLang) تدعم Jamba و Mamba. تحقق من الإصدار المحدد.
- في سياق 256k، تظهر ميزة ذاكرة Jamba في التوصيل المتزامن لطلب. على نفس VRAM يمكنك تثبيت أكثر من تسلسل Jamba من تسلسل Transformer.
- Mamba-3 كنموذج مستقل لم يتم شحنها بعد في الإنتاج البحث الافتراضي في 1.5B.
أرسله
هذا الدرس يُنتجoutputs/skill-hybrid-picker.md. بالنظر إلى تحديد حجم العمل (ملف طول السياق، مزيج المهام، ميزانية الذاكرة) ، فإنه يوصي بين محول نقي، هجين في نمط جامبا، و SSM نقي، مع التفكير صريح حول الذاكرة والجودة التنازلات.
التمارين
- أركض
code/main.pyلتحساب cache KV في سياق 256k لـ 32 طبقة من Transformer النقي (خفية 4096 رأس 32) و لـ Jamba-1 هجين من نفس الشكل. التحقق من ~ 8x تقليل الذاكرة التي تدعي ورقة AI21.
- تعديل جهاز الحاسب لتصميم نموذج هجين 1: 3 (4 Mamba: 1 Attention) و هجين 1: 15 (14 Mamba: 1 Attention). تعدد مخزن KV مقابل النسبة. في أي نسبة يساوي مخزن KV ذاكرة حالة SSM؟
- اقرأ القسم 3 من ورقة جامبا (arXiv: 2403.19887). شرح لماذا يستخدم AI21 Mamba-1 بدلا من Mamba-2 على الرغم من أن Mamba-2 أسرع.
- قم بحساب المعيار فوق الصفوف من MoE-كل طبقة أخرى في Jamba 1.5 Large (398B إجمالي، 94B نشط). مقارنة النسبة النشطة مع DeepSeek-V3 (37B/671B) وشرح لماذا تعزز بنية Jamba النسبة النشطة أعلى.
- اقرأ القسم 3 من ورقة Mamba-3 (arXiv:2603.15569). شرح في ثلاث جملات لماذا تحديث حالة ذات قيمة معقدة يعادل إدخال دوران يعتمد على البيانات. ربط الإجابة باستثناء RoPE في المرحلة 7 · الدروس 04.
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| State space model (SSM) | "Recurrence with a fixed state" | A layer with a learned recurrence h_t = A h_{t-1} + B x_t; constant memory per token |
| Selective SSM | "Mamba's trick" | Data-dependent A, B, C parameters that give the model gating-like selectivity at linear time |
| Attention-to-Mamba ratio | "How many attention layers" | In Jamba, l = 8 means 1 attention layer per 7 Mamba layers |
| Jamba block | "The 8-layer group" | One attention + seven Mamba + MoE on alternate positions |
| SSM state | "The hidden buffer" | Fixed-size per-layer state that replaces the KV cache for Mamba layers |
| 256k context | "Jamba's flagship number" | The sequence length Jamba-1 fits on a single 80GB GPU; pure Transformer cannot at that size |
| Mamba-3 | "2026 pure SSM" | Current-best pure-SSM architecture with complex state + MIMO; the baseline hybrids rebuild around |
| MIMO | "Multi-input multi-output" | Mamba-3 innovation using matrix-valued projections instead of scalar per-feature |
| Exponential-trapezoidal discretization | "Mamba-3's recurrence" | More expressive recurrence that subsumes Mamba-2's Euler-method discretization |
| Hybrid architecture | "Mix attention and SSM" | Any model that interleaves Transformer and SSM layers; Jamba is the production archetype |
المزيد من القراءة
- Lieber et al. — Jamba: A Hybrid Transformer-Mamba Language Model (arXiv:2403.19887) ورقة جامبا الأصلية، إضفاءات النسب، دعوى سياق 256k
- AI21 — Jamba 1.5: Hybrid Transformer-Mamba at Scale (arXiv:2408.12570) العائلة الموسعة، 398B/94B و 12B/52B الإفصاحات العامة
- Gu, Dao — Mamba: Linear-Time Sequence Modeling with Selective State Spaces (arXiv:2312.00752) ورقة SSM انتقائية يبنيها Jamba
- Dao, Gu — Mamba-2 (arXiv:2405.21060) خليفة الفضاء المُبني المُبني
- Lahoti et al. — Mamba-3 (arXiv:2603.15569, ICLR 2026) الدولة ذات القيمة المعقدة، MIMO، الحدود 2026
- Gu et al. — Efficiently Modeling Long Sequences with Structured State Spaces (arXiv:2111.00396) ورقة S4، نقطة انطلاق لعائلة SSM للدرجات العليا
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.