Phase 10: LLMs from Scratch

जाम्बा हाइब्रिड एसएसएम-ट्रांसफॉर्मर

राज्य अंतरिक्ष मॉडल (एसएसएम) और ट्रांसफार्मर अलग-अलग चीजें चाहते हैं। ट्रांसफार्मर क्वालिटी को ध्यान से क्वाड्रैटिक लागत पर खरीदते हैं। एसएसएम एक पुनरावृत्ति के माध्यम से रैखिक समय निष्कर्षण और निरंतर स्मृति खरीदते हैं लेकिन गुणवत्ता में देरी होती है। AI21 के Jamba (मार्च 2024) और Jamba 1.5 (अगस्त 2024) उन्हें एक ही मॉडल में डालते हैंः प्रत्येक 7 Mamba परतों के लिए 1 ट्रांसफार्मर परत, प्रत्येक अन्य ब्लॉक पर MoE, और एक 256k संदर्भ विंडो जो एक एकल 80GB GPU पर फिट बैठती है। Mamba-3 (ICLR 2026) जटिल-मूल्यवान राज्य स्थानों और MIMO अनुमानों के साथ SSM पक्ष को कसता है। यह पाठ दोनों वास्तुकलाओं को अंत से अंत तक पढ़ता है और यह समझाता है कि हाइब्रिड नुस्खा तीन साल के पैमाने पर क्यों जीवित रहा है जब शुद्ध-एसएसएम और शुद्ध-ट्रांसफॉर्मर लंबे संदर्भ के प्रयासों ने नहीं किया है।

Type: Learn

Languages: Python (stdlib, layer-mix calculator)

Prerequisites: Phase 10 · 14 (open-model architectures), Phase 10 · 17 (native sparse attention)

Time: ~60 minutes

सीखने के लक्ष्य

  • जाम्बा ब्लॉक में तीन आदिम तत्वों को समझाएं ट्रांसफार्मर परतें, माम्बा परतें, एमओई और 1:7: यहां तक कि इंटरलेविंग नुस्खा।
  • एक SSM की पुनरावृत्ति उच्च स्तर पर कैसी दिखती है और यह निरंतर स्मृति अनुमान को क्यों सक्षम बनाता है, इसका वर्णन करें।
  • 256k संदर्भ पर एक Jamba मॉडल के KV कैश पदचिह्न की गणना करें और एक शुद्ध-ट्रांसफॉर्मर मॉडल की आवश्यकता के साथ तुलना करें।
  • तीन Mamba-3 नवाचारों (उत्पादक-ट्रैपेज़ोइडल विघटन, जटिल-मूल्यवान राज्य अद्यतन, MIMO) और प्रत्येक समस्या का नाम दें।

समस्या

ध्यान अनुक्रम लंबाई में चतुर्भुज है। राज्य अंतरिक्ष मॉडल रैखिक हैं। यह अंतर यौगिक हैः 256k टोकन पर, एक ट्रांसफार्मर ध्यान नक्शा प्रति सिर 65B प्रविष्टियों है; एक एसएसएम की आवर्ती स्थिति अनुक्रम लंबाई के बावजूद निश्चित आकार है।

शुद्ध-एसएसएम मॉडल (मम्बा, मम्बा-2) छोटे पैमाने पर ट्रांसफार्मर की जटिलता से मेल खाते हैं लेकिन राज्य ट्रैकिंग कार्यों पर पीछे रहते हैं और संदर्भ में पुनर्प्राप्ति की कुछ श्रेणियों पर विफल रहते हैं। अंतर्ज्ञानः एसएसएम इतिहास को एक निश्चित राज्य में संपीड़ित करते हैं, और जब इतिहास लंबा होता है, तो जानकारी लीक होती है। ध्यान सब कुछ ठीक से याद रखता है लेकिन क्वाड्रैटिक लागत का भुगतान करता है।

स्पष्ट समाधानः दोनों का उपयोग करें। ट्रांसफार्मर परतों को जहां सटीक याद रखने के लिए मायने रखता है. SSM परतों का उपयोग कहीं और करें। अनुपात को समायोजित करें। Jamba इस हाइब्रिड नुस्खा को पैमाने पर शिप करने वाला पहला उत्पादन-ग्रेड मॉडल है (52B कुल, 12B सक्रिय, 256k संदर्भ, एकल 80GB GPU) । Jamba 1.5 परिवार को 398B कुल / 94B सक्रिय करने के लिए बढ़ाता है। मम्बा-3 (ICLR 2026) वर्तमान में सर्वश्रेष्ठ शुद्ध एसएसएम बेसलाइन है जिसके आसपास हाइब्रिड को पुनर्निर्माण किया जा सकता है।

इस पाठ में तीनों पेपर पढ़े जाते हैं और "सही अनुपात चुनें" के लिए मानसिक मॉडल तैयार किया जाता है।

अवधारणा

एक पृष्ठ में एक SSM

एक राज्य अंतरिक्ष मॉडल एक अनुक्रम को संसाधित करता है x_1, ..., x_Nएक निश्चित आकार की स्थिति के माध्यम से h:

h_t = A h_{t-1} + B x_t
y_t = C h_t

प्रत्येक चरण में राज्य एक रैखिक गतिशीलता के माध्यम से विकसित होता है A, इनपुट लेता है B x_t, और आउटपुट उत्सर्जन करता है C h_t. .A, B, Cमहत्वपूर्ण गुण ध्यान देंः कंप्यूटिंगy_tकेवल आवश्यकताएँ h_{t-1}और x_t, पहले नहीं xस्मृति निरंतर है. इन्फेरेंस प्रति टोकन O (1) है.

मॉडलिंग गुणवत्ता के लिए चाल संरचना है A. S4 (Gu 2021) ने एक अत्यधिक संरचित मैट्रिक्स का उपयोग किया जिसे प्रशिक्षण के दौरान एक लंबे समय तक घुमाव के रूप में कुशलतापूर्वक मूल्यांकन किया जा सकता था।A, B, CMamba-2 (2024) ने संरचना को और सरल बनाया। Mamba-3 (2026) विशिष्ट स्थानों में जटिलता को फिर से जोड़ता है।

मुख्य गुणः एक डिकोडर एलएलएम के लिए, एक एसएसएम परत एक ध्यान परत के लिए एक ड्रॉप-इन प्रतिस्थापन है, जो बढ़ते केवी कैश के बजाय प्रति परत स्थिर आकार की स्थिति के साथ है।

जाम्बा ब्लॉक

एक जाम्बा ब्लॉक दो संख्याओं के अनुसार परतों को पार करता हैः

  • l: ध्यान-मम्बा अनुपात।l = 8, यानी प्रत्येक 7 मम्बा परतों (7 मम्बा + 1 ध्यान = 8 परतें प्रति समूह) के लिए 1 ट्रांसफार्मर परत।
  • eJamba का उपयोग करता हैe = 2, जिसका अर्थ है कि हर अन्य परत MoE लागू होता है.

एक ब्लॉक के भीतर परत अनुक्रमः

M  M  M  M  M  M  M  A    (7 Mamba + 1 Attention)
|  M  |  M  |  M  |  M    (where | marks MoE applied)

प्रत्येक जाम्बा ब्लॉक में 8 परतें होती हैं। 4 ब्लॉक गहराई पर (कुल 32 परतें) आपको 28 माम्बा और 4 ध्यान परतें मिलती हैं। इनमें से 16 में मोईई का उपयोग किया जाता है।

1:7 अनुपात क्यों

AI21 ने एब्लेशन चलाएः ध्यान-मंगा अनुपात में कौन सा दीर्घ-संदर्भ मूल्यांकन पर पैरामीटर-प्रति-कंपलेक्सता और संदर्भ में सबसे अच्छा याद दिलाता है?

  • बहुत अधिक ध्यान (1:1): गुणवत्ता बढ़ जाती है लेकिन स्मृति और गति घटती है।
  • बहुत कम ध्यान (1:15): स्मृति महान है लेकिन संदर्भ में पुनर्प्राप्ति विफल रहता है।
  • 1: 7 या 1: 8।

अंतर्ज्ञानः ट्रांसफार्मर परतें सटीक याद और स्थिति ट्रैकिंग संभालती हैं।

स्थिति कोडिंग

मम्बा परतें स्वयं स्थिति-जागरूक हैं (पुनरावृत्ति के माध्यम से) । मूल मम्बा आधारित हाइब्रिड में ध्यान परतों में RoPE का उपयोग नहीं किया गया था। SSM परतों ने स्थिति जानकारी प्रदान की। Jamba 1.5 लंबे संदर्भ सामान्यीकरण के लिए ध्यान परतों में RoPE जोड़ता है, जो अनुभवजन्य दीर्घ संदर्भ मूल्यांकन पर आधारित एक पोस्ट-होक परिष्करण है।

स्मृति बजट

जाम्बा-1 आकार के लिए (32 परतेंः 28 माम्बा + 4 ध्यान, छिपा 4096, 32 ध्यान सिर):

  • KV कैश (केवल ध्यान परतें): 2 4 32 128 256k * 2 = 8.4 GB256k BF16 पर केवल 4 ध्यान परतों योगदान.
  • एसएसएम की स्थितिः 28 hidden state_sizeप्रति टोकन पूर्वावलोकन, लेकिन यह प्रति परत एक निश्चित आकार है, अनुक्रम लंबाई के साथ स्केल नहीं है। आम मंबा राज्य प्रति विशेषता 16 है, छिपा 4096: 28 4096 16 * 2 = 3.7 MBकुल।

32 परतों पर शुद्ध ट्रांसफार्मर की तुलना करें, वही छिपा हुआ, 32 सिरों पर पूर्ण एमएचएः 2 32 32 128 256k 2 = 128 GB256k BF16 पर KV कैश में 8 गुना कमी। GQA (8) के आधार रेखा के मुकाबले भी अधिकांश 2024 मॉडल उपयोग करते हैं (2 32 8 128 256k 2 = 32 GB), 16 जीबी पर जाम्बा का 1:7 हाइब्रिड अभी भी 2 गुना छोटा है।

यही AI21 का मतलब है "एक 80GB GPU पर 256k संदर्भ।" पूर्ण-MHA शुद्ध ट्रांसफार्मर का KV कैश फिट नहीं होगा; यहां तक कि एक GQA बेसलाइन वजन और सक्रियण के लिए कोई जगह नहीं छोड़ती है; Jamba की है।

Mamba-3: 2026 में शुद्ध एसएसएम आधार

Mamba-3 (ICLR 2026, arXiv:2603.15569) शुद्ध एसएसएम पक्ष पर तीन नवाचारों की शुरूआत करता हैः

  1. Exponential-trapezoidal discretization.Mamba-2 में Euler-method discretization को एक अधिक अभिव्यक्तिपूर्ण पुनरावृत्ति के साथ बदल देता है। कोर पुनरावृत्ति के भीतर राज्य-इनपुट पर लागू कन्वॉल्यूशन-जैसा ऑपरेशन, बजाय बाहरी कन्वॉल्यूशन के रूप में पर x_t. .
  1. Complex-valued state update.पिछले Mambas ने राज्य मैट्रिक्स को जटिल (S4) से वास्तविक विकर्ण (Mamba) तक स्केल पहचान (Mamba-2) तक कम कर दिया। Mamba-3 ने जटिल मानों को राज्य पर डेटा-निर्भर रोटरी एम्बेडिंग के बराबर पुनः जोड़ा। यह राज्य ट्रैकिंग क्षमताओं को बहाल करता है जो पिछले वास्तविक-मूल्य सरलीकरणों की लागत है।
  1. Multi-input multi-output (MIMO) projections.प्रति फीचर स्केलर प्रोजेक्शन के बजाय, मैट्रिक्स-मूल्य वाले प्रोजेक्शन का उपयोग करें। यह डिकोडिंग विलंबता को बढ़ाए बिना मॉडलिंग शक्ति और निष्कर्ष-समय हार्डवेयर उपयोग में सुधार करता है।

1.5B मापदंडों पर, Mamba-3 ने गेटड डेल्टानेट की तुलना में औसत डाउनस्ट्रीम सटीकता में 0.6 अंक की सुधार की; MIMO संस्करण कुल 1.8 अंक की वृद्धि के लिए 1.2 और जोड़ता है। उसी राज्य आकार पर, Mamba-3 Mamba-2 से आधा राज्य मेल खाता है।

Mamba-3 अभी तक एक उत्पादन हाइब्रिड में पैमाने पर शिपिंग नहीं कर रहा है लेकिन यह अगले Jamba-class मॉडल के SSM पक्ष के लिए स्पष्ट उम्मीदवार है।

हाइब्रिड की तलाश कब की जाए

हाइब्रिड जीतते हैं जबः

  • संदर्भ इतना लंबा है कि शुद्ध ट्रांसफार्मर केवी कैश दर्दनाक हो जाता है (64k+).
  • कार्य लघु दूरी संरचना (एसएसएम के लिए अच्छा) को लंबी दूरी के रिकॉल (ट्रान्सफार्मर की आवश्यकता) के साथ मिलाएं।
  • आप एकल-जीपीयू मेमोरी बजट पर तैनात करना चाहते हैं जहां ट्रांसफार्मर केवी कैश अकेले फिट नहीं होगा।

हाइब्रिड खोते हैं जबः

  • संदर्भ छोटा है (16k से नीचे) SSM ओवरहेड व्यर्थ है; शुद्ध ट्रांसफार्मर ठीक है।
  • कार्य को हर जगह-हर जगह ध्यान देने की आवश्यकता होती है (गहन तर्क, बहु-दस्तावेज क्रॉस-रेफरेंस) हाइब्रिड में ध्यान की कम परतें चोट लगाती हैं।
  • आप ट्रिलियन पैरामीटर फ्रंटियर मॉडल तक स्केल कर रहे हैं। शुद्ध-ट्रांसफॉर्मर + एमएलए + एमओई (डीपसेक-वी3 शैली) वर्तमान में क्षमता दौड़ जीत रहा है।

प्रतिस्पर्धी परिदृश्य

ModelFamilyScaleUnique claim
Mamba-2pure SSM3Blinear time, constant memory
Jambahybrid52B/12B256k on 80GB
Jamba 1.5 Largehybrid398B/94Benterprise-grade long-context
Mamba-3pure SSM1.5B (paper)state-tracking restored
DeepSeek-V3pure Transformer + MoE671B/37Bfrontier capability

2026 परिदृश्यः शुद्ध-ट्रांसफॉर्मर एमओई सीमा पर हावी है, लेकिन हाइब्रिड 256k प्लस संदर्भ आला के मालिक हैं। मंबा -3 की राज्य ट्रैकिंग जीत अगली पीढ़ी में हाइब्रिड अनुपात को कम (अधिक एसएसएम, कम ध्यान) कर सकती है।

इसका प्रयोग करें

code/main.pyएक SSM-ट्रांसफॉर्मर अनुपात और एक छिपे हुए आकार / परत-गणना कॉन्फ़िग को देखते हुए, यह गणना करता हैः

  • लक्ष्य संदर्भ में KV कैश।
  • SSM राज्य स्मृति.
  • मॉडल आकारों की एक श्रृंखला के लिए संदर्भ N पर कुल स्मृति।

कैलकुलेटर का समर्थन करता हैः

  • शुद्ध-ट्रांसफॉर्मर बेसलाइन (केवी कैश N के साथ बढ़ता है)
  • जाम्बा शैली 1: 7 हाइब्रिड।
  • शुद्ध-एसएसएम (कोई KV कैश नहीं)

प्रकाशित रूपों के लिए संख्याएं जाम्बा-1 और जाम्बा-1.5 पत्रों से सीधे हैं और परिकल्पनात्मक संस्करणों के लिए निकाली गई हैं।

वास्तविक तैनाती के लिए एकीकरण विचारः

  • अधिकांश उत्पादन निष्कर्ष सर्वर (vLLM, SGLang) Jamba और Mamba का समर्थन करते हैं। विशिष्ट संस्करण की जांच करें।
  • 256k संदर्भ में, Jamba की स्मृति लाभ समवर्ती अनुरोध पारगमन में दिखाई देता है। एक ही VRAM पर आप Transformer अनुक्रमों की तुलना में अधिक Jamba अनुक्रमों फिट।
  • Mamba-3 एक स्टैंडअलोन मॉडल के रूप में अभी तक उत्पादन में शिपिंग नहीं है अनुसंधान पूर्वावलोकन 1.5B पर।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-hybrid-picker.md. कार्यभार विनिर्देश (संदर्भ लंबाई प्रोफ़ाइल, कार्य मिश्रण, मेमोरी बजट) को देखते हुए, यह शुद्ध ट्रांसफार्मर, जाम्बा शैली के हाइब्रिड और शुद्ध एसएसएम के बीच सिफारिश करता है, जिसमें मेमोरी और गुणवत्ता के बीच स्पष्ट तर्क दिया जाता है।

व्यायाम

  1. दौड़ेंcode/main.py32 परत शुद्ध ट्रांसफार्मर (छिपे हुए 4096, 32 हेड) और एक ही आकार के जाम्बा -1 हाइब्रिड के लिए 256k संदर्भ पर KV कैश की गणना करने के लिए। AI21 पेपर का दावा है कि ~ 8x मेमोरी कमी सत्यापित करें।
  1. 1. कैलकुलेटर को 1:3 हाइब्रिड (4 Mamba: 1 Attention) और 1:15 हाइब्रिड (14 Mamba: 1 Attention) के मॉडल के रूप में संशोधित करें। प्लॉट KV कैश बनाम अनुपात। किस अनुपात में KV कैश SSM स्टेट मेमोरी के बराबर है?
  1. जाम्बा पेपर (arXiv:2403.19887) के खंड 3 को पढ़ें। समझाएं कि एमएम्बा-2 तेज होने के बावजूद एआई21 ने मम्बा-2 के बजाय मम्बा-1 का उपयोग क्यों किया। सुझावः हाइब्रिड एब्लेशन खंड इस पर दस्तावेज बनाता है।
  1. Jamba 1.5 Large में MoE-every-other-layer के पैरामीटर ओवरहेड की गणना करें (398B कुल, 94B सक्रिय) । सक्रिय अनुपात की तुलना DeepSeek-V3 (37B/671B) से करें और समझाएं कि Jamba की वास्तुकला सक्रिय अनुपात को क्यों बढ़ाती है।
  1. Mamba-3 पेपर के खंड 3 (arXiv:2603.15569) को पढ़ें। तीन वाक्य में समझाएं कि क्यों एक जटिल-मूल्यवान राज्य अद्यतन डेटा-निर्भर घूर्णन एम्बेडिंग के बराबर है। उत्तर को चरण 7 · पाठ 04 के RoPE व्युत्पन्न से जोड़ें।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
State space model (SSM)"Recurrence with a fixed state"A layer with a learned recurrence h_t = A h_{t-1} + B x_t; constant memory per token
Selective SSM"Mamba's trick"Data-dependent A, B, C parameters that give the model gating-like selectivity at linear time
Attention-to-Mamba ratio"How many attention layers"In Jamba, l = 8 means 1 attention layer per 7 Mamba layers
Jamba block"The 8-layer group"One attention + seven Mamba + MoE on alternate positions
SSM state"The hidden buffer"Fixed-size per-layer state that replaces the KV cache for Mamba layers
256k context"Jamba's flagship number"The sequence length Jamba-1 fits on a single 80GB GPU; pure Transformer cannot at that size
Mamba-3"2026 pure SSM"Current-best pure-SSM architecture with complex state + MIMO; the baseline hybrids rebuild around
MIMO"Multi-input multi-output"Mamba-3 innovation using matrix-valued projections instead of scalar per-feature
Exponential-trapezoidal discretization"Mamba-3's recurrence"More expressive recurrence that subsumes Mamba-2's Euler-method discretization
Hybrid architecture"Mix attention and SSM"Any model that interleaves Transformer and SSM layers; Jamba is the production archetype

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.