Jamba ترانسفورماتور SSM هیبریدی
Type: Learn
Languages: Python (stdlib, layer-mix calculator)
Prerequisites: Phase 10 · 14 (open-model architectures), Phase 10 · 17 (native sparse attention)
Time: ~60 minutes
اهداف یادگیری
- سه نوع ابتدایی را در یک بلوک جامبا توضیح دهید: لایه های ترانسفورماتور، لایه های مامبا، MoE و نسخه 1:7: حتی ترک کردن.
- تکرار یک SSM در سطح بالا چگونه است و چرا این امکان نتیجه گیری حافظه ثابت را فراهم می کند.
- نقش حافظه KV مدل Jamba را در زمینه 256k محاسبه کنید و با آنچه که یک مدل خالص ترانسفورمر نیاز دارد مقایسه کنید.
- سه نوآوری Mamba-3 (تراپیزوئیدال تعدد، بروزرسانی وضعیت با ارزش پیچیده، MIMO) و مشکل هر یک را نام ببرید.
مشکل
توجه در طول ردیف مربع است. مدل های فضایی حالت خطی هستند. این تفاوت ترکیب می شود: در توکن های 256k، یک نقشه توجه ترانسفورم 65B در هر سر است؛ حالت مکرر یک SSM اندازه ثابت است بدون توجه به طول ردیف.
مدل های خالص SSM (Mamba، Mamba-2) با پیچیدگی ترانسفورم در مقیاس های کوچک مطابقت دارند اما در وظایف ردیابی وضعیت عقب مانده و در برخی از دسته های بازیافت در زمینه شکست می خورند. حس: SSM ها تاریخ را به حالت ثابت فشرده می کنند و وقتی تاریخ طولانی است، اطلاعات دزدیده می شوند. توجه همه چیز را دقیقا به یاد می آورد اما هزینه مربع را پرداخت می کند.
راه حل واضح: از هر دو استفاده کن لايه هاي ترانسفورمر رو در جايي که به ياد آوردن دقیق مهم باشه قرار بده از لایه های SSM در جای دیگه ای استفاده کن نسبت رو تنظیم کن Jamba اولین مدل تولید است که این نسخه ترکیبی را در مقیاس (52B کل، 12B فعال، 256k زمینه، GPU واحد 80GB) ارسال می کند. Jamba 1.5 خانواده را به 398B کل / 94B فعال گسترش می دهد. Mamba-3 (ICLR 2026) بهترین پایه خالص SSM فعلی است که می تواند در اطراف آن همجنس ها بازسازی شود.
این درس سه مقاله را می خواند و مدل ذهنی را برای "تعداد مناسب" تولید می کند.
مفهوم
یک SSM در یک صفحه
یک مدل فضایی حالت یک دنباله را پردازش می کندx_1, ..., x_Nاز طریق حالت اندازه ثابتh:
h_t = A h_{t-1} + B x_t
y_t = C h_tدر هر مرحله اي دولت از طريق ديناميك خطي تکامل مي پذيرهA، واردات ميکنهB x_t، و تولیدات را منتشر می کندC h_t.A, B, Cتوجه داشته باشید که ویژگی مهم: محاسباتy_tفقط نیاز دارهh_{t-1}وx_t، نه قبل ترxحافظه ثابت است. تعادل O (۱) در هر توکن
ترفند برای کیفیت مدل سازی ساختار استA. S4 (Gu 2021) یک ماتریس بسیار ساختار یافته را استفاده کرد که می تواند به طور موثر به عنوان یک کنولسیون طولانی در طول آموزش ارزیابی شود.A, B, CMamba-2 (2024) ساختار را ساده تر کرد. Mamba-3 (2026) پیچیدگی را در مکان های خاص دوباره اضافه می کند.
ویژگی کلیدی: برای یک کدگر LLM، یک لایه SSM جایگزین قطبی برای یک لایه توجه است، با حالت هر لایه با اندازه ثابت به جای یک کش KV در حال رشد.
بلوک جامبا
یک بلوک جامبا لایه ها را با دو عدد متقابل می کند:
l: نسبت توجه به مامبا.l = 8، یعنی یک لایه ترانسفورماتور برای هر 7 لایه مابان (7 Mamba + 1 توجه = 8 لایه در هر گروه).e. فرکانس MoEe = 2، به این معنی که هر لایه دیگری از MoE استفاده می کند.
تسلسل لایه در یک بلوک:
M M M M M M M A (7 Mamba + 1 Attention)
| M | M | M | M (where | marks MoE applied)هر بلوک جامبا 8 لایه است. در عمق 4 بلوک (32 لایه در مجموع) شما 28 Mamba و 4 لایه توجه را دریافت می کنید. 16 از آنها از MoE استفاده می کنند.
چرا نسبت 1: 7
AI21 ابلاسیون ها را اجرا کرد: کدام نسبت توجه به مامبا بهترین تعصب در هر پارامتر و در زمینه به یاد آوردن در ارزیابی های طولانی مدت آنها را می دهد؟
- توجه بیش از حد (1:1): کیفیت افزایش می یابد اما حافظه و سرعت کاهش می یابد.
- توجه بسیار کمی (1:15): حافظه عالی است اما بازیافت در زمینه شکست می خورد.
- نقطه خوش: 1:7 یا 1:8.
حواسم: لایه های ترانسفورماتور به دنبال کردن دقیق و حالت را انجام می دهند. لایه های مامبا به اندازه کافی هزینه های ارزان را انجام می دهند.
کدگذاری موقعیت
لایه های ممبا خود از موقعیت آگاه هستند (به وسیله تکرار). لایه های توجه در هجرهای اصلی مبتنی بر ممبا از RoPE استفاده نمی کردند. لایه های SSM اطلاعات موقعیت را ارائه می دهند. Jamba 1.5 RoPE را برای کلی سازی بیشتر زمینه اضافه می کند.
بودجه حافظه
برای شکل Jamba-1 (32 لایه: 28 Mamba + 4 توجه، 4096، 32 سر توجه پنهان):
- KV cache (تنها لایه های توجه):
2 4 32 128 256k * 2 = 8.4 GBدر 256k BF16 فقط 4 لایه توجه کمک می کند. - حالت SSM:
28 hidden state_sizeدر هر پیشگویی توکن، اما این یک اندازه ثابت در هر لایه است، نه مقیاس با طول دنباله. حالت معمولی Mamba 16 در هر ویژگی، پنهان 4096:28 4096 16 * 2 = 3.7 MBکل
با يک ترانسفورماتور خالص در 32 لايه، همان مخفي، MHA کامل در 32 سر:2 32 32 128 256k 2 = 128 GBبا 256k BF16، کاهش 8x در KV حافظه. حتی در مقایسه با GQA ((8) خط پایه اکثر مدل های 2024 استفاده می کنند (2 32 8 128 256k 2 = 32 GB), هجين هايي که با 16 گيبايت به اندازه 1: 7 Jamba داره هنوز دو برابر کوچکتره
این چیزی است که AI21 با "تواضع 256k در یک GPU 80GB واحد" معنی دارد. "کاش KV یک ترانسفارمر خالص کامل MHA مناسب نخواهد بود؛ حتی یک خط پایه GQA هیچ جا برای وزن و فعال سازی را ترک نمی کند؛ Jamba's می کند.
Mamba-3: خط پایه خالص SSM در سال 2026
Mamba-3 (ICLR 2026, arXiv:2603.15569) سه نوآوری را در سمت خالص SSM معرفی می کند:
- Exponential-trapezoidal discretization.جایگزین تخفیف روش ایلر در Mamba-2 با تکرار بیانگر تر می شود. عملیات شبیه کنولسیون روی ورودی حالت در تکرار هسته ای اعمال می شود، نه به عنوان کنولسیون خارجی در
x_t. .
- Complex-valued state update.Mamba-3 ارزش های پیچیده را به حالت اضافه می کند که معادل یک ورودی گردشگر وابسته به داده ها است. این قابلیت ردیابی حالت را که هزینه های ساده سازی های واقعی قبلی را می دهد، باز می کند.
- Multi-input multi-output (MIMO) projections.به جای پروژکتورهای مقیاس در هر ویژگی، از پروژکتورهای با ارزش ماتریک استفاده کنید. توان مدل سازی و استفاده از سخت افزار زمان نتیجه گیری را بدون افزایش تاخیر کد بهبود می بخشد.
در پارامترهای 1.5B، Mamba-3 دقت متوسط زیر جریان را 0.6 امتیاز نسبت به Gated DeltaNet بهبود می بخشد؛ ویرانت MIMO 1.2 امتیاز بیشتر برای افزایش 1.8 امتیاز اضافه می کند. در همان اندازه حالت، Mamba-3 با Mamba-2 با نیمی از حالت مطابقت دارد.
Mamba-3 هنوز در یک تولید هیبریدی در مقیاس ارسال نشده است اما این کاندیدای واضح برای سمت SSM مدل بعدی Jamba-class است.
چه زمانی باید برای یک هیبرید دست پیدا کنیم
هائبرید ها برنده می شوند وقتی:
- متن به اندازه کافی طولانی است که حافظه cache KV خالص تبدیل به دردناک (64k +) شود.
- وظایف ساختار کوتاه مدت (خوب برای SSM) را با بازپس گرفتن طولانی مدت (حاجت ترانسفارمر) ترکیب می کنند.
- شما می خواهید در بودجه های حافظه ی یک GPU استفاده کنید که تنها حافظه کش KV ترانسفورماتور در آن قرار نمی گیرد.
هیبرید ها وقتی از دست می دهند:
- متن کوتاه است (کمتر از 16k). هزینه های بالای SSM ضایع می شود؛ ترانسفورماتور خالص خوب است.
- وظایف نیاز به توجه همه جا-به همه جا (بررسی عمیق، مرجع متقابل چند سند) دارد.
- شما در حال مقیاس بندی به مدل های مرز تراشمی هستید. Pure-Transformer + MLA + MoE (طریقه DeepSeek-V3) در حال حاضر مسابقه توانایی را برنده می شود.
منظره رقابتی
| Model | Family | Scale | Unique claim |
|---|---|---|---|
| Mamba-2 | pure SSM | 3B | linear time, constant memory |
| Jamba | hybrid | 52B/12B | 256k on 80GB |
| Jamba 1.5 Large | hybrid | 398B/94B | enterprise-grade long-context |
| Mamba-3 | pure SSM | 1.5B (paper) | state-tracking restored |
| DeepSeek-V3 | pure Transformer + MoE | 671B/37B | frontier capability |
چشم انداز 2026: پاک ترانسفارمر MoE بر مرز تسلط دارد، اما هیبرید ها دارای 256k-plus زمینه هستند. پیروزی های ردیابی حالت Mamba-3 ممکن است نسبت های هیبریدی را در نسل بعدی پایین تر (SSM بیشتر، توجه کمتر) قرار دهد.
ازش استفاده کن
code/main.pyیک ماشین حساب حافظه برای معماری های هیبریدی است. با توجه به نسبت SSM-Transformer و پیکربندی اندازه پنهان / تعداد لایه ها، آن را محاسبه می کند:
- KV cache در زمینه هدف
- حافظه حالت SSM
- حافظه کل در زمینه N برای طیف وسیعی از اشکال مدل.
ماشین حساب پشتیبانی می کند:
- خط پایه Pure-Transformer (KV cache با N افزایش می یابد).
- يه هجين با مدل جامبا 1:7
- پاک-SSM (هیچ KV حافظه حافظه در همه).
این اعداد مستقیما از مقالات Jamba-1 و Jamba-1.5 برای اشکال منتشر شده و برای انواع فرضی استخراج شده اند.
ملاحظات ادغام برای یک پیاده سازی واقعی:
- اکثر سرورهای نتیجه گیری تولید (vLLM، SGLang) از Jamba و Mamba پشتیبانی می کنند. نسخه خاص را بررسی کنید.
- در زمینه 256k، مزیت حافظه Jamba در تولید درخواست همزمان ظاهر می شود. در همان VRAM شما دنباله های Jamba را بیشتر از دنباله های ترانسفورمتر قرار می دهید.
- Mamba-3 به عنوان یک مدل مستقل هنوز در تولید نیست پیش نمایش تحقیقات در 1.5B.
-باده
این درس به ما کمک می کندoutputs/skill-hybrid-picker.md. با توجه به مشخصات بار کاری (پروفیل طول زمینه، ترکیب وظایف، بودجه حافظه) ، بین یک ترانسفارمر خالص، یک هیبرید سبک Jamba و یک SSM خالص، با استدلال صریح در مورد حافظه و کیفیت تعادل توصیه می شود.
تمرینات
- فرار کن
code/main.pyبرای محاسبه KV cache در 256k زمینه برای یک 32 لایه خالص ترانسفورماتور (خفی 4096, 32 سر) و برای یک جمبا-1 هیبریدی از همان شکل. تایید ~ 8x کاهش حافظه AI21 ادعا می کند.
- تغییر ماشین حساب برای مدل یک هائبرید 1:3 (4 Mamba: 1 توجه) و یک هائبرید 1:15 (14 Mamba: 1 توجه). نسبت KV مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن مخزن
- بخش 3 مقاله جامبا را بخوانید (arXiv: 2403.19887). توضیح دهید که چرا AI21 Mamba-1 را به جای Mamba-2 استفاده می کند در حالی که Mamba-2 سریع تر است.
- پارامتر بالای MoE-هر لایه دیگر را در Jamba 1.5 Large محاسبه کنید (398B کل، 94B فعال). نسبت فعال را با DeepSeek-V3 (37B/671B) مقایسه کنید و توضیح دهید که چرا معماری Jamba نسبت فعال را بالاتر می کند.
- بخش 3 مقاله Mamba-3 را بخوانید (arXiv:2603.15569). در سه جمله توضیح دهید که چرا یک بروزرسانی وضعیت با ارزش پیچیده معادل یک گنجاندن روتاری وابسته به داده است. پاسخ را به مشتق RoPE مرحله 7 · درس 04 متصل کنید.
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| State space model (SSM) | "Recurrence with a fixed state" | A layer with a learned recurrence h_t = A h_{t-1} + B x_t; constant memory per token |
| Selective SSM | "Mamba's trick" | Data-dependent A, B, C parameters that give the model gating-like selectivity at linear time |
| Attention-to-Mamba ratio | "How many attention layers" | In Jamba, l = 8 means 1 attention layer per 7 Mamba layers |
| Jamba block | "The 8-layer group" | One attention + seven Mamba + MoE on alternate positions |
| SSM state | "The hidden buffer" | Fixed-size per-layer state that replaces the KV cache for Mamba layers |
| 256k context | "Jamba's flagship number" | The sequence length Jamba-1 fits on a single 80GB GPU; pure Transformer cannot at that size |
| Mamba-3 | "2026 pure SSM" | Current-best pure-SSM architecture with complex state + MIMO; the baseline hybrids rebuild around |
| MIMO | "Multi-input multi-output" | Mamba-3 innovation using matrix-valued projections instead of scalar per-feature |
| Exponential-trapezoidal discretization | "Mamba-3's recurrence" | More expressive recurrence that subsumes Mamba-2's Euler-method discretization |
| Hybrid architecture | "Mix attention and SSM" | Any model that interleaves Transformer and SSM layers; Jamba is the production archetype |
خواندن بیشتر
- Lieber et al. — Jamba: A Hybrid Transformer-Mamba Language Model (arXiv:2403.19887) کاغذ اصلی جامبا، نسبت های حذف شده، ادعای کنستکس 256k
- AI21 — Jamba 1.5: Hybrid Transformer-Mamba at Scale (arXiv:2408.12570) خانواده گسترده، 398B/94B و 12B/52B انتشار عمومی
- Gu, Dao — Mamba: Linear-Time Sequence Modeling with Selective State Spaces (arXiv:2312.00752) کاغذ انتخابی SSM که Jamba بر روی آن ساخته شده است
- Dao, Gu — Mamba-2 (arXiv:2405.21060) جانشین فضای ساختار یافته ای
- Lahoti et al. — Mamba-3 (arXiv:2603.15569, ICLR 2026) وضعیت با ارزش پیچیده، MIMO، مرز 2026 خالص SSM
- Gu et al. — Efficiently Modeling Long Sequences with Structured State Spaces (arXiv:2111.00396) مقاله S4، نقطه شروع سلسله ی SSM برای LLM
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.