जाम्बा हाइब्रिड एसएसएम-ट्रांसफॉर्मर
Type: Learn
Languages: Python (stdlib, layer-mix calculator)
Prerequisites: Phase 10 · 14 (open-model architectures), Phase 10 · 17 (native sparse attention)
Time: ~60 minutes
सीखने के लक्ष्य
- जाम्बा ब्लॉक में तीन आदिम तत्वों को समझाएं ट्रांसफार्मर परतें, माम्बा परतें, एमओई और 1:7: यहां तक कि इंटरलेविंग नुस्खा।
- एक SSM की पुनरावृत्ति उच्च स्तर पर कैसी दिखती है और यह निरंतर स्मृति अनुमान को क्यों सक्षम बनाता है, इसका वर्णन करें।
- 256k संदर्भ पर एक Jamba मॉडल के KV कैश पदचिह्न की गणना करें और एक शुद्ध-ट्रांसफॉर्मर मॉडल की आवश्यकता के साथ तुलना करें।
- तीन Mamba-3 नवाचारों (उत्पादक-ट्रैपेज़ोइडल विघटन, जटिल-मूल्यवान राज्य अद्यतन, MIMO) और प्रत्येक समस्या का नाम दें।
समस्या
ध्यान अनुक्रम लंबाई में चतुर्भुज है। राज्य अंतरिक्ष मॉडल रैखिक हैं। यह अंतर यौगिक हैः 256k टोकन पर, एक ट्रांसफार्मर ध्यान नक्शा प्रति सिर 65B प्रविष्टियों है; एक एसएसएम की आवर्ती स्थिति अनुक्रम लंबाई के बावजूद निश्चित आकार है।
शुद्ध-एसएसएम मॉडल (मम्बा, मम्बा-2) छोटे पैमाने पर ट्रांसफार्मर की जटिलता से मेल खाते हैं लेकिन राज्य ट्रैकिंग कार्यों पर पीछे रहते हैं और संदर्भ में पुनर्प्राप्ति की कुछ श्रेणियों पर विफल रहते हैं। अंतर्ज्ञानः एसएसएम इतिहास को एक निश्चित राज्य में संपीड़ित करते हैं, और जब इतिहास लंबा होता है, तो जानकारी लीक होती है। ध्यान सब कुछ ठीक से याद रखता है लेकिन क्वाड्रैटिक लागत का भुगतान करता है।
स्पष्ट समाधानः दोनों का उपयोग करें। ट्रांसफार्मर परतों को जहां सटीक याद रखने के लिए मायने रखता है. SSM परतों का उपयोग कहीं और करें। अनुपात को समायोजित करें। Jamba इस हाइब्रिड नुस्खा को पैमाने पर शिप करने वाला पहला उत्पादन-ग्रेड मॉडल है (52B कुल, 12B सक्रिय, 256k संदर्भ, एकल 80GB GPU) । Jamba 1.5 परिवार को 398B कुल / 94B सक्रिय करने के लिए बढ़ाता है। मम्बा-3 (ICLR 2026) वर्तमान में सर्वश्रेष्ठ शुद्ध एसएसएम बेसलाइन है जिसके आसपास हाइब्रिड को पुनर्निर्माण किया जा सकता है।
इस पाठ में तीनों पेपर पढ़े जाते हैं और "सही अनुपात चुनें" के लिए मानसिक मॉडल तैयार किया जाता है।
अवधारणा
एक पृष्ठ में एक SSM
एक राज्य अंतरिक्ष मॉडल एक अनुक्रम को संसाधित करता है x_1, ..., x_Nएक निश्चित आकार की स्थिति के माध्यम से h:
h_t = A h_{t-1} + B x_t
y_t = C h_tप्रत्येक चरण में राज्य एक रैखिक गतिशीलता के माध्यम से विकसित होता है A, इनपुट लेता है B x_t, और आउटपुट उत्सर्जन करता है C h_t. .A, B, Cमहत्वपूर्ण गुण ध्यान देंः कंप्यूटिंगy_tकेवल आवश्यकताएँ h_{t-1}और x_t, पहले नहीं xस्मृति निरंतर है. इन्फेरेंस प्रति टोकन O (1) है.
मॉडलिंग गुणवत्ता के लिए चाल संरचना है A. S4 (Gu 2021) ने एक अत्यधिक संरचित मैट्रिक्स का उपयोग किया जिसे प्रशिक्षण के दौरान एक लंबे समय तक घुमाव के रूप में कुशलतापूर्वक मूल्यांकन किया जा सकता था।A, B, CMamba-2 (2024) ने संरचना को और सरल बनाया। Mamba-3 (2026) विशिष्ट स्थानों में जटिलता को फिर से जोड़ता है।
मुख्य गुणः एक डिकोडर एलएलएम के लिए, एक एसएसएम परत एक ध्यान परत के लिए एक ड्रॉप-इन प्रतिस्थापन है, जो बढ़ते केवी कैश के बजाय प्रति परत स्थिर आकार की स्थिति के साथ है।
जाम्बा ब्लॉक
एक जाम्बा ब्लॉक दो संख्याओं के अनुसार परतों को पार करता हैः
l: ध्यान-मम्बा अनुपात।l = 8, यानी प्रत्येक 7 मम्बा परतों (7 मम्बा + 1 ध्यान = 8 परतें प्रति समूह) के लिए 1 ट्रांसफार्मर परत।eJamba का उपयोग करता हैe = 2, जिसका अर्थ है कि हर अन्य परत MoE लागू होता है.
एक ब्लॉक के भीतर परत अनुक्रमः
M M M M M M M A (7 Mamba + 1 Attention)
| M | M | M | M (where | marks MoE applied)प्रत्येक जाम्बा ब्लॉक में 8 परतें होती हैं। 4 ब्लॉक गहराई पर (कुल 32 परतें) आपको 28 माम्बा और 4 ध्यान परतें मिलती हैं। इनमें से 16 में मोईई का उपयोग किया जाता है।
1:7 अनुपात क्यों
AI21 ने एब्लेशन चलाएः ध्यान-मंगा अनुपात में कौन सा दीर्घ-संदर्भ मूल्यांकन पर पैरामीटर-प्रति-कंपलेक्सता और संदर्भ में सबसे अच्छा याद दिलाता है?
- बहुत अधिक ध्यान (1:1): गुणवत्ता बढ़ जाती है लेकिन स्मृति और गति घटती है।
- बहुत कम ध्यान (1:15): स्मृति महान है लेकिन संदर्भ में पुनर्प्राप्ति विफल रहता है।
- 1: 7 या 1: 8।
अंतर्ज्ञानः ट्रांसफार्मर परतें सटीक याद और स्थिति ट्रैकिंग संभालती हैं।
स्थिति कोडिंग
मम्बा परतें स्वयं स्थिति-जागरूक हैं (पुनरावृत्ति के माध्यम से) । मूल मम्बा आधारित हाइब्रिड में ध्यान परतों में RoPE का उपयोग नहीं किया गया था। SSM परतों ने स्थिति जानकारी प्रदान की। Jamba 1.5 लंबे संदर्भ सामान्यीकरण के लिए ध्यान परतों में RoPE जोड़ता है, जो अनुभवजन्य दीर्घ संदर्भ मूल्यांकन पर आधारित एक पोस्ट-होक परिष्करण है।
स्मृति बजट
जाम्बा-1 आकार के लिए (32 परतेंः 28 माम्बा + 4 ध्यान, छिपा 4096, 32 ध्यान सिर):
- KV कैश (केवल ध्यान परतें):
2 4 32 128 256k * 2 = 8.4 GB256k BF16 पर केवल 4 ध्यान परतों योगदान. - एसएसएम की स्थितिः
28 hidden state_sizeप्रति टोकन पूर्वावलोकन, लेकिन यह प्रति परत एक निश्चित आकार है, अनुक्रम लंबाई के साथ स्केल नहीं है। आम मंबा राज्य प्रति विशेषता 16 है, छिपा 4096:28 4096 16 * 2 = 3.7 MBकुल।
32 परतों पर शुद्ध ट्रांसफार्मर की तुलना करें, वही छिपा हुआ, 32 सिरों पर पूर्ण एमएचएः 2 32 32 128 256k 2 = 128 GB256k BF16 पर KV कैश में 8 गुना कमी। GQA (8) के आधार रेखा के मुकाबले भी अधिकांश 2024 मॉडल उपयोग करते हैं (2 32 8 128 256k 2 = 32 GB), 16 जीबी पर जाम्बा का 1:7 हाइब्रिड अभी भी 2 गुना छोटा है।
यही AI21 का मतलब है "एक 80GB GPU पर 256k संदर्भ।" पूर्ण-MHA शुद्ध ट्रांसफार्मर का KV कैश फिट नहीं होगा; यहां तक कि एक GQA बेसलाइन वजन और सक्रियण के लिए कोई जगह नहीं छोड़ती है; Jamba की है।
Mamba-3: 2026 में शुद्ध एसएसएम आधार
Mamba-3 (ICLR 2026, arXiv:2603.15569) शुद्ध एसएसएम पक्ष पर तीन नवाचारों की शुरूआत करता हैः
- Exponential-trapezoidal discretization.Mamba-2 में Euler-method discretization को एक अधिक अभिव्यक्तिपूर्ण पुनरावृत्ति के साथ बदल देता है। कोर पुनरावृत्ति के भीतर राज्य-इनपुट पर लागू कन्वॉल्यूशन-जैसा ऑपरेशन, बजाय बाहरी कन्वॉल्यूशन के रूप में पर
x_t. .
- Complex-valued state update.पिछले Mambas ने राज्य मैट्रिक्स को जटिल (S4) से वास्तविक विकर्ण (Mamba) तक स्केल पहचान (Mamba-2) तक कम कर दिया। Mamba-3 ने जटिल मानों को राज्य पर डेटा-निर्भर रोटरी एम्बेडिंग के बराबर पुनः जोड़ा। यह राज्य ट्रैकिंग क्षमताओं को बहाल करता है जो पिछले वास्तविक-मूल्य सरलीकरणों की लागत है।
- Multi-input multi-output (MIMO) projections.प्रति फीचर स्केलर प्रोजेक्शन के बजाय, मैट्रिक्स-मूल्य वाले प्रोजेक्शन का उपयोग करें। यह डिकोडिंग विलंबता को बढ़ाए बिना मॉडलिंग शक्ति और निष्कर्ष-समय हार्डवेयर उपयोग में सुधार करता है।
1.5B मापदंडों पर, Mamba-3 ने गेटड डेल्टानेट की तुलना में औसत डाउनस्ट्रीम सटीकता में 0.6 अंक की सुधार की; MIMO संस्करण कुल 1.8 अंक की वृद्धि के लिए 1.2 और जोड़ता है। उसी राज्य आकार पर, Mamba-3 Mamba-2 से आधा राज्य मेल खाता है।
Mamba-3 अभी तक एक उत्पादन हाइब्रिड में पैमाने पर शिपिंग नहीं कर रहा है लेकिन यह अगले Jamba-class मॉडल के SSM पक्ष के लिए स्पष्ट उम्मीदवार है।
हाइब्रिड की तलाश कब की जाए
हाइब्रिड जीतते हैं जबः
- संदर्भ इतना लंबा है कि शुद्ध ट्रांसफार्मर केवी कैश दर्दनाक हो जाता है (64k+).
- कार्य लघु दूरी संरचना (एसएसएम के लिए अच्छा) को लंबी दूरी के रिकॉल (ट्रान्सफार्मर की आवश्यकता) के साथ मिलाएं।
- आप एकल-जीपीयू मेमोरी बजट पर तैनात करना चाहते हैं जहां ट्रांसफार्मर केवी कैश अकेले फिट नहीं होगा।
हाइब्रिड खोते हैं जबः
- संदर्भ छोटा है (16k से नीचे) SSM ओवरहेड व्यर्थ है; शुद्ध ट्रांसफार्मर ठीक है।
- कार्य को हर जगह-हर जगह ध्यान देने की आवश्यकता होती है (गहन तर्क, बहु-दस्तावेज क्रॉस-रेफरेंस) हाइब्रिड में ध्यान की कम परतें चोट लगाती हैं।
- आप ट्रिलियन पैरामीटर फ्रंटियर मॉडल तक स्केल कर रहे हैं। शुद्ध-ट्रांसफॉर्मर + एमएलए + एमओई (डीपसेक-वी3 शैली) वर्तमान में क्षमता दौड़ जीत रहा है।
प्रतिस्पर्धी परिदृश्य
| Model | Family | Scale | Unique claim |
|---|---|---|---|
| Mamba-2 | pure SSM | 3B | linear time, constant memory |
| Jamba | hybrid | 52B/12B | 256k on 80GB |
| Jamba 1.5 Large | hybrid | 398B/94B | enterprise-grade long-context |
| Mamba-3 | pure SSM | 1.5B (paper) | state-tracking restored |
| DeepSeek-V3 | pure Transformer + MoE | 671B/37B | frontier capability |
2026 परिदृश्यः शुद्ध-ट्रांसफॉर्मर एमओई सीमा पर हावी है, लेकिन हाइब्रिड 256k प्लस संदर्भ आला के मालिक हैं। मंबा -3 की राज्य ट्रैकिंग जीत अगली पीढ़ी में हाइब्रिड अनुपात को कम (अधिक एसएसएम, कम ध्यान) कर सकती है।
इसका प्रयोग करें
code/main.pyएक SSM-ट्रांसफॉर्मर अनुपात और एक छिपे हुए आकार / परत-गणना कॉन्फ़िग को देखते हुए, यह गणना करता हैः
- लक्ष्य संदर्भ में KV कैश।
- SSM राज्य स्मृति.
- मॉडल आकारों की एक श्रृंखला के लिए संदर्भ N पर कुल स्मृति।
कैलकुलेटर का समर्थन करता हैः
- शुद्ध-ट्रांसफॉर्मर बेसलाइन (केवी कैश N के साथ बढ़ता है)
- जाम्बा शैली 1: 7 हाइब्रिड।
- शुद्ध-एसएसएम (कोई KV कैश नहीं)
प्रकाशित रूपों के लिए संख्याएं जाम्बा-1 और जाम्बा-1.5 पत्रों से सीधे हैं और परिकल्पनात्मक संस्करणों के लिए निकाली गई हैं।
वास्तविक तैनाती के लिए एकीकरण विचारः
- अधिकांश उत्पादन निष्कर्ष सर्वर (vLLM, SGLang) Jamba और Mamba का समर्थन करते हैं। विशिष्ट संस्करण की जांच करें।
- 256k संदर्भ में, Jamba की स्मृति लाभ समवर्ती अनुरोध पारगमन में दिखाई देता है। एक ही VRAM पर आप Transformer अनुक्रमों की तुलना में अधिक Jamba अनुक्रमों फिट।
- Mamba-3 एक स्टैंडअलोन मॉडल के रूप में अभी तक उत्पादन में शिपिंग नहीं है अनुसंधान पूर्वावलोकन 1.5B पर।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-hybrid-picker.md. कार्यभार विनिर्देश (संदर्भ लंबाई प्रोफ़ाइल, कार्य मिश्रण, मेमोरी बजट) को देखते हुए, यह शुद्ध ट्रांसफार्मर, जाम्बा शैली के हाइब्रिड और शुद्ध एसएसएम के बीच सिफारिश करता है, जिसमें मेमोरी और गुणवत्ता के बीच स्पष्ट तर्क दिया जाता है।
व्यायाम
- दौड़ें
code/main.py32 परत शुद्ध ट्रांसफार्मर (छिपे हुए 4096, 32 हेड) और एक ही आकार के जाम्बा -1 हाइब्रिड के लिए 256k संदर्भ पर KV कैश की गणना करने के लिए। AI21 पेपर का दावा है कि ~ 8x मेमोरी कमी सत्यापित करें।
- 1. कैलकुलेटर को 1:3 हाइब्रिड (4 Mamba: 1 Attention) और 1:15 हाइब्रिड (14 Mamba: 1 Attention) के मॉडल के रूप में संशोधित करें। प्लॉट KV कैश बनाम अनुपात। किस अनुपात में KV कैश SSM स्टेट मेमोरी के बराबर है?
- जाम्बा पेपर (arXiv:2403.19887) के खंड 3 को पढ़ें। समझाएं कि एमएम्बा-2 तेज होने के बावजूद एआई21 ने मम्बा-2 के बजाय मम्बा-1 का उपयोग क्यों किया। सुझावः हाइब्रिड एब्लेशन खंड इस पर दस्तावेज बनाता है।
- Jamba 1.5 Large में MoE-every-other-layer के पैरामीटर ओवरहेड की गणना करें (398B कुल, 94B सक्रिय) । सक्रिय अनुपात की तुलना DeepSeek-V3 (37B/671B) से करें और समझाएं कि Jamba की वास्तुकला सक्रिय अनुपात को क्यों बढ़ाती है।
- Mamba-3 पेपर के खंड 3 (arXiv:2603.15569) को पढ़ें। तीन वाक्य में समझाएं कि क्यों एक जटिल-मूल्यवान राज्य अद्यतन डेटा-निर्भर घूर्णन एम्बेडिंग के बराबर है। उत्तर को चरण 7 · पाठ 04 के RoPE व्युत्पन्न से जोड़ें।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| State space model (SSM) | "Recurrence with a fixed state" | A layer with a learned recurrence h_t = A h_{t-1} + B x_t; constant memory per token |
| Selective SSM | "Mamba's trick" | Data-dependent A, B, C parameters that give the model gating-like selectivity at linear time |
| Attention-to-Mamba ratio | "How many attention layers" | In Jamba, l = 8 means 1 attention layer per 7 Mamba layers |
| Jamba block | "The 8-layer group" | One attention + seven Mamba + MoE on alternate positions |
| SSM state | "The hidden buffer" | Fixed-size per-layer state that replaces the KV cache for Mamba layers |
| 256k context | "Jamba's flagship number" | The sequence length Jamba-1 fits on a single 80GB GPU; pure Transformer cannot at that size |
| Mamba-3 | "2026 pure SSM" | Current-best pure-SSM architecture with complex state + MIMO; the baseline hybrids rebuild around |
| MIMO | "Multi-input multi-output" | Mamba-3 innovation using matrix-valued projections instead of scalar per-feature |
| Exponential-trapezoidal discretization | "Mamba-3's recurrence" | More expressive recurrence that subsumes Mamba-2's Euler-method discretization |
| Hybrid architecture | "Mix attention and SSM" | Any model that interleaves Transformer and SSM layers; Jamba is the production archetype |
आगे पढ़ना
- Lieber et al. — Jamba: A Hybrid Transformer-Mamba Language Model (arXiv:2403.19887) मूल जाम्बा पेपर, अनुपात अपवर्तन, 256k संदर्भ दावा
- AI21 — Jamba 1.5: Hybrid Transformer-Mamba at Scale (arXiv:2408.12570) विस्तारित परिवार, 398B/94B और 12B/52B सार्वजनिक विमोचन
- Gu, Dao — Mamba: Linear-Time Sequence Modeling with Selective State Spaces (arXiv:2312.00752) चयनात्मक एसएसएम पेपर जिस पर जाम्बा का निर्माण होता है
- Dao, Gu — Mamba-2 (arXiv:2405.21060) सरलीकृत संरचित राज्य-अंतरिक्ष उत्तराधिकारी
- Lahoti et al. — Mamba-3 (arXiv:2603.15569, ICLR 2026) जटिल मूल्य राज्य, MIMO, 2026 शुद्ध-एसएसएम सीमा
- Gu et al. — Efficiently Modeling Long Sequences with Structured State Spaces (arXiv:2111.00396) एस4 पेपर, एसएसएम वंशावली के लिए LLM के लिए प्रारंभिक बिंदु
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.