ब्लैकवेल पर हार्डवेयर-स्पेशलाइज्ड इन्फेरेंस संकलन FP8 और NVFP4
Type: Learn
Languages: Python (stdlib, toy FP8/NVFP4 memory and cost calculator)
Prerequisites: Phase 17 · 04 (Serving Engine Internals), Phase 10 · 13 (Quantization)
Time: ~75 minutes
सीखने के लक्ष्य
- बताएं कि जब NVFP4 में वजन होता है तब भी KV कैश और ध्यान के लिए FP8 महत्वपूर्ण क्यों रहता है।
- BF16, FP8 और NVFP4 के तहत सीमा मॉडल के HBM पदचिह्न की गणना करें और बचत कहां से आती है, इसका कारण बताएं।
- ब्लैकवेल विशिष्ट सुविधाओं TRT-LLM शोषण का नाम दें (दिन-0 FP4, MTP, विघटित सेवा, सभी-से-सब आदिम) ।
- निर्णय लें कि TRT-LLM के NVIDIA-लॉक के लिए हॉपर पर 7 गुना लागत अंतर बनाम vLLM के लायक कब है।
समस्या
2026 में निष्कर्ष अर्थशास्त्र की सीमा "प्रति डॉलर कितने टोकन हैं" है। उत्तर चार ढेर विकल्पों पर निर्भर करता हैः हार्डवेयर पीढ़ी (हॉपर H100/H200 बनाम ब्लैकवेल B200/GB200), सटीकता (BF16 → FP8 → NVFP4), सेवा इंजन (vLLM बनाम SGLang बनाम TRT-LLM), और ऑर्केस्ट्रेशन (सादा बनाम विखंडित बनाम डायनामो) ।
VLLM के साथ हॉपर पर, एक 120B MoE ~ पर चलता है$0.09 per million tokens. On Blackwell with TRT-LLM + Dynamo, the same model runs at ~$0.012 7 गुना सस्ता। कुछ अंतर हार्डवेयर है (ब्लैकवेल 11-15x प्रति जीपीयू एलएलएम आउटपुट बनाम हॉपर) । कुछ स्टैक हैः एफपी 4 वजन, एमटीपी ड्राफ्ट, विघटित प्रीफिल / डिकोड, और एमओई विशेषज्ञ संचार के लिए एनवीलिंक 5 सर्व-टू-सर्व।
आप एनवीडीआईए के स्टैक के बाहर इसे दोहरा नहीं सकते। यह अर्थशास्त्र के लिए व्यापार है। यह समझना कि स्टैक विकल्प किस अंतर का हिस्सा देते हैं, इस सबक का मुद्दा है।
अवधारणा
क्यों FP8 अभी भी KV कैश के लिए मंजिल है
2026 में एक आम गलतीः मान लें कि NVFP4 हर जगह लागू होता है। यह नहीं करता है। KV कैश को FP8 (8-बिट फ्लोटिंग प्वाइंट) की आवश्यकता होती है क्योंकि यह ध्यान कुंजी और मानों को संग्रहीत करता है जो एक व्यापक गतिशील रेंज को कवर करते हैं। KV को FP4 में मात्राबद्ध करने से विनाशकारी सटीकता का नुकसान होता है।
NVFP4 (2025-2026) भार और सक्रियण पर लागू होता है। माइक्रोस्केलिंगः भार के प्रत्येक ब्लॉक का अपना पैमाने कारक होता है ताकि छोटे ब्लॉक प्रति-टेंसर पैमाने के नुकसान के बिना विभिन्न गतिशील रेंज को कवर कर सकें। सक्रियण के लिए, FP4 पकड़ता है क्योंकि सक्रियण एक परत के भीतर छोटी सीमा है।
ब्लैकवेल की विशिष्ट संरचनाः
- भारः NVFP4 (4-बिट माइक्रोस्केलिंग)
- सक्रियण: NVFP4.
- केवी कैशः एफपी8
- ध्यान संचयक: FP32 (मॉफ्टमैक्स स्थिरता)
ब्लैकवेल विशिष्ट आदिम TRT-LLM उपयोग करता है
- Day-0 FP4 weights: मॉडल प्रदाताओं सीधे FP4 वजन भेजने; प्रशिक्षण के बाद रूपांतरण के बिना TRT-LLM भार। FP4 के लिए कोई AWQ / GPTQ कदम नहीं।
- Multi-token prediction (MTP): ईगल (चरण 17 · 05) के समान विचार है, लेकिन TRT-LLM निर्माण में एकीकृत है।
- Disaggregated serving: अलग-अलग GPU पूल पर प्रीफिल और डिकोड, NVLink या InfiniBand पर KV कैश स्थानांतरित।
- All-to-all communication primitives: NVLink 5 ने 3x बनाम हॉपर द्वारा MoE विशेषज्ञ संचार विलंबता को कम किया। TRT-LLM के MoE कर्नेल इसके लिए ट्यून किए गए हैं।
- NVFP4 + MXFP8 microscaling: ब्लैकवेल Tensor कोर पर हार्डवेयर-एक्सेलेरेटेड स्केल-फैक्टर हैंडलिंग।
संख्याओं को आप याद रखना चाहिए
- जीपीटी-ओएसएस-120बी पर $0.02 / एम टोकन पर एचजीएक्स बी 200 टीआरटी-एलएलएम के माध्यम से।
- जीबी200 एनवीएल72 $0.012/एम टोकन के माध्यम से डायनामो (ऑर्केस्ट्रेटिंग TRT-LLM) ।
- H100 + vLLM ≈ $0.09/M टोकन तुलनात्मक कार्यभार पर।
- TRT-LLM अपडेट (2026) के तीन महीने में 2.8 गुना बढ़ोतरी।
- 11-15x प्रति GPU LLM पारगमन, ब्लैकवेल बनाम हॉपर.
- MLPerf इन्फरेंस v6.0 (अप्रैल 2026): ब्लैकवेल हर प्रस्तुत कार्य पर हावी है।
गुणवत्ता में एफपी4 की वास्तविक लागत
NVFP4 आक्रामक है। तर्क-भारी कार्यभार (विचार श्रृंखला, गणित, लंबे संदर्भ के साथ कोड-जन) पर, FP4 वजन दृश्यमान रूप से गिरावट आती है। प्रति ब्लॉक माप कम करता है लेकिन समाप्त नहीं करता है। टीमों द्वारा तर्क मॉडल अक्सर समझौता के रूप में FP8 वजन + FP4 सक्रियण का उपयोग करते हैं, या पूरे FP8 के साथ H200 पर चिपके रहते हैं।
नियमः NVFP4 वजन पर प्रतिबद्ध करने से पहले हमेशा अपने मूल्यांकन सेट पर कार्य गुणवत्ता को मान्य करें।
यह एनवीडीआईए लॉक निर्णय क्यों है
TRT-LLM C++ + CUDA + बंद-स्रोत के कर्नेल है। मॉडल को एक विशिष्ट GPU SKU के लिए संकलित करने की आवश्यकता है। कोई AMD, कोई इंटेल, कोई ARM नहीं। यदि आपकी इन्फ्रा रणनीति मल्टी-वेंडर है, तो TRT-LLM TRT-LLM-सेवा की गई परत के लिए एक गैर-स्टार्टर है। आप अभी भी मिश्रित हार्डवेयर पर vLLM से सेवा कर सकते हैं। यदि आप केवल NVIDIA हैं, तो 7x अंतर लॉक के लिए भुगतान करता है।
2026 व्यावहारिक नुस्खा
$ 100M + वार्षिक निष्कर्ष बिल के लिए, हॉपर + वीएलएलएम पर चलना टेबल पर 7-10x छोड़ देता है। ब्लैकवेल + टीआरटी-एलएलएम + डायनामो में लागत-अग्रणी कार्यभार को माइग्रेट करें। मॉडल पुनरावृत्ति गति के लिए एच 100 + वीएलएलएम पर प्रयोग स्तर बनाए रखें। उत्पादन से पहले प्रत्येक एनवीएफपी 4 परिवर्तित मॉडल पर गुणवत्ता को मान्य करें।
विखंडन बोनस
टीआरटी-एलएलएम की विघटित सेवा (अलग प्रीफिल और डिकोड पूल) को चरण 17 · 20 में गहराई से कवर किया गया है। ब्लैकवेल पर, गुणक ढेरः एफपी 4 वजन × एमटीपी गति × विघटित प्लेसमेंट × कैश-जाहिर रूटिंग। 7x संख्या इस पूर्ण ढेर का अनुमान करती है।
इसका प्रयोग करें
code/main.pyHBM पदचिह्न, डिकोड पारगमन (मेमोरी-बाउंड शासन) और $ / M-टोकन की गणना करता है तीन स्टैक के माध्यम से मॉडल के लिएः H100 + BF16 + vLLM, H100 + FP8 + vLLM, B200 + NVFP4/FP8 + TRT-LLM। इसे मिश्रण प्रभाव और प्रत्येक परिवर्तन के अंतर का हिस्सा देखने के लिए चलाएं।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-trtllm-blackwell-advisor.md. कार्यभार, मॉडल आकार और वार्षिक टोकन मात्रा को देखते हुए, यह तय करता है कि ब्लैकवेल + टीआरटी-एलएलएम स्टैक एनवीआईडीआई लॉक के लायक है या नहीं।
व्यायाम
- दौड़ें
code/main.py. 30% सक्रिय मापदंडों के साथ 120B MoE पर, H100 BF16, H100 FP8, और B200 NVFP4/FP8 पर मेमोरी-बैंडविड्थ-सीमित डिकोड आउटपुट की गणना करें। सबसे बड़ी छलांग कहां से आती है? - एक ग्राहक H100 + vLLM पर $ 2M / वर्ष खर्च करता है। 7x आर्थिक अंतर को देखते हुए 12 महीने में TRT-LLM पर प्रवास को निरस्त करने के लिए उन्हें ब्लैकवेल जीपीयू की ब्रीक-ईव संख्या कितनी है?
- NVFP4 वजन रूपांतरण के बाद आप MATH पर सटीकता में 3 अंक की गिरावट देखेंगे। दो वसूली पथों का नाम देंः एक गुणवत्ता-पहले (एफपी8 वजन बनाए रखें) और एक लागत-पहले (डोमेन में डेटा के साथ मापें) ।
- एमएलपरफ v6.0 निष्कर्ष परिणाम पढ़ें. कौन सा कार्य सबसे छोटा ब्लैकवेल-ओवर-हॉपर अंतर है, और क्यों?
- एनवीएफपी 4 वज़न पर 405 बी मॉडल के लिए आवश्यक एचबीएम की गणना करें + 128k संदर्भ पर एफपी 8 केवी कैश। क्या यह एक एकल जीबी 200 एनवीएल 72 नोड पर फिट बैठता है?
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| FP8 | "eight-bit float" | 8-bit floating point; used for KV cache and attention due to dynamic range |
| NVFP4 | "four-bit micro" | NVIDIA's 4-bit microscaling FP format; weights and activations on Blackwell |
| MXFP8 | "MX eight" | Microscaling FP8 variant; hardware-accelerated on Blackwell Tensor Cores |
| Day-0 FP4 | "ship FP4 weights" | Model providers release weights already in FP4; no post-train conversion step |
| MTP | "multi-token prediction" | TRT-LLM's integrated speculative-decoding draft (Phase 17 · 05) |
| Disaggregated serving | "split prefill/decode" | Prefill and decode on separate GPU pools; KV transferred over NVLink/IB |
| All-to-all | "MoE expert comm" | Communication pattern routing tokens to expert GPUs; NVLink 5 cuts 3x |
| InferenceX | "SemiAnalysis inference bench" | The 2026 industry-accepted cost-per-token benchmark |
आगे पढ़ना
- NVIDIA — Blackwell Ultra MLPerf Inference v6.0 अप्रैल 2026 एमएलपीआरएफ परिणाम।
- NVIDIA — MoE Inference on Blackwell NVLink 5 सर्व-सर्व और MoE कर्नल।
- TensorRT-LLM Overview आधिकारिक इंजन प्रलेखन।
- NVIDIA — Introducing Dynamo TRT-LLM के ऊपर विखंडित ऑर्केस्ट्रेशन।
- MLPerf Inference बेंचमार्क सूट जो ब्लैकवेल संख्याओं को प्रकाशित करता है।
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.