Phase 17: Infrastructure & Production

ब्लैकवेल पर हार्डवेयर-स्पेशलाइज्ड इन्फेरेंस संकलन FP8 और NVFP4

हार्डवेयर-विशेष inference compilation throughput के लिए पोर्टेबिलिटी का व्यापार करता है, और TensorRT-LLM केवल NVIDIA, Blackwell के लिए ट्यून किया गया व्यापार के भुगतान का सबसे स्पष्ट उदाहरण है।$0.012 per million tokens on a 120B model in Q1-Q2 2026, against $0.09/M पर H100 + vLLM 7 गुना आर्थिक अंतर। स्टैक तीन फ्लोटिंग-पॉइंट रीजिमों में शामिल हैः एफपी 8 केवी कैश और ध्यान कर्नेल के लिए महत्वपूर्ण रहता है क्योंकि इसमें उनकी आवश्यकता की गतिशील सीमा है; एनवीएफपी 4 (4-बिट माइक्रोस्केलिंग) वजन और सक्रियण को संभालता है; मल्टी-टोकन भविष्यवाणी (एमटीपी) और विघटित प्रीफिल / डिकोड शीर्ष पर एक और 2-3x जोड़ता है। दिन-0 मॉडल समर्थन सीधे FP4 वजन को बिना प्रशिक्षण के बाद रूपांतरण के लोड करता है। 2026 इंजीनियरिंग टीमों के लिए पकड़ः TRT-LLM ओपन सोर्स है लेकिन NVIDIA- विशिष्ट CUDA- और ब्लैकवेल- विशेष इसलिए इसे अपनाने से पारगमन के लिए पोर्टेबिलिटी का व्यापार होता है। प्रतिबद्ध करने से पहले अपने मॉडल और हार्डवेयर के मिश्रण पर गणित चलाएं।

Type: Learn

Languages: Python (stdlib, toy FP8/NVFP4 memory and cost calculator)

Prerequisites: Phase 17 · 04 (Serving Engine Internals), Phase 10 · 13 (Quantization)

Time: ~75 minutes

सीखने के लक्ष्य

  • बताएं कि जब NVFP4 में वजन होता है तब भी KV कैश और ध्यान के लिए FP8 महत्वपूर्ण क्यों रहता है।
  • BF16, FP8 और NVFP4 के तहत सीमा मॉडल के HBM पदचिह्न की गणना करें और बचत कहां से आती है, इसका कारण बताएं।
  • ब्लैकवेल विशिष्ट सुविधाओं TRT-LLM शोषण का नाम दें (दिन-0 FP4, MTP, विघटित सेवा, सभी-से-सब आदिम) ।
  • निर्णय लें कि TRT-LLM के NVIDIA-लॉक के लिए हॉपर पर 7 गुना लागत अंतर बनाम vLLM के लायक कब है।

समस्या

2026 में निष्कर्ष अर्थशास्त्र की सीमा "प्रति डॉलर कितने टोकन हैं" है। उत्तर चार ढेर विकल्पों पर निर्भर करता हैः हार्डवेयर पीढ़ी (हॉपर H100/H200 बनाम ब्लैकवेल B200/GB200), सटीकता (BF16 → FP8 → NVFP4), सेवा इंजन (vLLM बनाम SGLang बनाम TRT-LLM), और ऑर्केस्ट्रेशन (सादा बनाम विखंडित बनाम डायनामो) ।

VLLM के साथ हॉपर पर, एक 120B MoE ~ पर चलता है$0.09 per million tokens. On Blackwell with TRT-LLM + Dynamo, the same model runs at ~$0.012 7 गुना सस्ता। कुछ अंतर हार्डवेयर है (ब्लैकवेल 11-15x प्रति जीपीयू एलएलएम आउटपुट बनाम हॉपर) । कुछ स्टैक हैः एफपी 4 वजन, एमटीपी ड्राफ्ट, विघटित प्रीफिल / डिकोड, और एमओई विशेषज्ञ संचार के लिए एनवीलिंक 5 सर्व-टू-सर्व।

आप एनवीडीआईए के स्टैक के बाहर इसे दोहरा नहीं सकते। यह अर्थशास्त्र के लिए व्यापार है। यह समझना कि स्टैक विकल्प किस अंतर का हिस्सा देते हैं, इस सबक का मुद्दा है।

अवधारणा

क्यों FP8 अभी भी KV कैश के लिए मंजिल है

2026 में एक आम गलतीः मान लें कि NVFP4 हर जगह लागू होता है। यह नहीं करता है। KV कैश को FP8 (8-बिट फ्लोटिंग प्वाइंट) की आवश्यकता होती है क्योंकि यह ध्यान कुंजी और मानों को संग्रहीत करता है जो एक व्यापक गतिशील रेंज को कवर करते हैं। KV को FP4 में मात्राबद्ध करने से विनाशकारी सटीकता का नुकसान होता है।

NVFP4 (2025-2026) भार और सक्रियण पर लागू होता है। माइक्रोस्केलिंगः भार के प्रत्येक ब्लॉक का अपना पैमाने कारक होता है ताकि छोटे ब्लॉक प्रति-टेंसर पैमाने के नुकसान के बिना विभिन्न गतिशील रेंज को कवर कर सकें। सक्रियण के लिए, FP4 पकड़ता है क्योंकि सक्रियण एक परत के भीतर छोटी सीमा है।

ब्लैकवेल की विशिष्ट संरचनाः

  • भारः NVFP4 (4-बिट माइक्रोस्केलिंग)
  • सक्रियण: NVFP4.
  • केवी कैशः एफपी8
  • ध्यान संचयक: FP32 (मॉफ्टमैक्स स्थिरता)

ब्लैकवेल विशिष्ट आदिम TRT-LLM उपयोग करता है

  • Day-0 FP4 weights: मॉडल प्रदाताओं सीधे FP4 वजन भेजने; प्रशिक्षण के बाद रूपांतरण के बिना TRT-LLM भार। FP4 के लिए कोई AWQ / GPTQ कदम नहीं।
  • Multi-token prediction (MTP): ईगल (चरण 17 · 05) के समान विचार है, लेकिन TRT-LLM निर्माण में एकीकृत है।
  • Disaggregated serving: अलग-अलग GPU पूल पर प्रीफिल और डिकोड, NVLink या InfiniBand पर KV कैश स्थानांतरित।
  • All-to-all communication primitives: NVLink 5 ने 3x बनाम हॉपर द्वारा MoE विशेषज्ञ संचार विलंबता को कम किया। TRT-LLM के MoE कर्नेल इसके लिए ट्यून किए गए हैं।
  • NVFP4 + MXFP8 microscaling: ब्लैकवेल Tensor कोर पर हार्डवेयर-एक्सेलेरेटेड स्केल-फैक्टर हैंडलिंग।

संख्याओं को आप याद रखना चाहिए

  • जीपीटी-ओएसएस-120बी पर $0.02 / एम टोकन पर एचजीएक्स बी 200 टीआरटी-एलएलएम के माध्यम से।
  • जीबी200 एनवीएल72 $0.012/एम टोकन के माध्यम से डायनामो (ऑर्केस्ट्रेटिंग TRT-LLM) ।
  • H100 + vLLM ≈ $0.09/M टोकन तुलनात्मक कार्यभार पर।
  • TRT-LLM अपडेट (2026) के तीन महीने में 2.8 गुना बढ़ोतरी।
  • 11-15x प्रति GPU LLM पारगमन, ब्लैकवेल बनाम हॉपर.
  • MLPerf इन्फरेंस v6.0 (अप्रैल 2026): ब्लैकवेल हर प्रस्तुत कार्य पर हावी है।

गुणवत्ता में एफपी4 की वास्तविक लागत

NVFP4 आक्रामक है। तर्क-भारी कार्यभार (विचार श्रृंखला, गणित, लंबे संदर्भ के साथ कोड-जन) पर, FP4 वजन दृश्यमान रूप से गिरावट आती है। प्रति ब्लॉक माप कम करता है लेकिन समाप्त नहीं करता है। टीमों द्वारा तर्क मॉडल अक्सर समझौता के रूप में FP8 वजन + FP4 सक्रियण का उपयोग करते हैं, या पूरे FP8 के साथ H200 पर चिपके रहते हैं।

नियमः NVFP4 वजन पर प्रतिबद्ध करने से पहले हमेशा अपने मूल्यांकन सेट पर कार्य गुणवत्ता को मान्य करें।

यह एनवीडीआईए लॉक निर्णय क्यों है

TRT-LLM C++ + CUDA + बंद-स्रोत के कर्नेल है। मॉडल को एक विशिष्ट GPU SKU के लिए संकलित करने की आवश्यकता है। कोई AMD, कोई इंटेल, कोई ARM नहीं। यदि आपकी इन्फ्रा रणनीति मल्टी-वेंडर है, तो TRT-LLM TRT-LLM-सेवा की गई परत के लिए एक गैर-स्टार्टर है। आप अभी भी मिश्रित हार्डवेयर पर vLLM से सेवा कर सकते हैं। यदि आप केवल NVIDIA हैं, तो 7x अंतर लॉक के लिए भुगतान करता है।

2026 व्यावहारिक नुस्खा

$ 100M + वार्षिक निष्कर्ष बिल के लिए, हॉपर + वीएलएलएम पर चलना टेबल पर 7-10x छोड़ देता है। ब्लैकवेल + टीआरटी-एलएलएम + डायनामो में लागत-अग्रणी कार्यभार को माइग्रेट करें। मॉडल पुनरावृत्ति गति के लिए एच 100 + वीएलएलएम पर प्रयोग स्तर बनाए रखें। उत्पादन से पहले प्रत्येक एनवीएफपी 4 परिवर्तित मॉडल पर गुणवत्ता को मान्य करें।

विखंडन बोनस

टीआरटी-एलएलएम की विघटित सेवा (अलग प्रीफिल और डिकोड पूल) को चरण 17 · 20 में गहराई से कवर किया गया है। ब्लैकवेल पर, गुणक ढेरः एफपी 4 वजन × एमटीपी गति × विघटित प्लेसमेंट × कैश-जाहिर रूटिंग। 7x संख्या इस पूर्ण ढेर का अनुमान करती है।

इसका प्रयोग करें

code/main.pyHBM पदचिह्न, डिकोड पारगमन (मेमोरी-बाउंड शासन) और $ / M-टोकन की गणना करता है तीन स्टैक के माध्यम से मॉडल के लिएः H100 + BF16 + vLLM, H100 + FP8 + vLLM, B200 + NVFP4/FP8 + TRT-LLM। इसे मिश्रण प्रभाव और प्रत्येक परिवर्तन के अंतर का हिस्सा देखने के लिए चलाएं।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-trtllm-blackwell-advisor.md. कार्यभार, मॉडल आकार और वार्षिक टोकन मात्रा को देखते हुए, यह तय करता है कि ब्लैकवेल + टीआरटी-एलएलएम स्टैक एनवीआईडीआई लॉक के लायक है या नहीं।

व्यायाम

  1. दौड़ेंcode/main.py. 30% सक्रिय मापदंडों के साथ 120B MoE पर, H100 BF16, H100 FP8, और B200 NVFP4/FP8 पर मेमोरी-बैंडविड्थ-सीमित डिकोड आउटपुट की गणना करें। सबसे बड़ी छलांग कहां से आती है?
  2. एक ग्राहक H100 + vLLM पर $ 2M / वर्ष खर्च करता है। 7x आर्थिक अंतर को देखते हुए 12 महीने में TRT-LLM पर प्रवास को निरस्त करने के लिए उन्हें ब्लैकवेल जीपीयू की ब्रीक-ईव संख्या कितनी है?
  3. NVFP4 वजन रूपांतरण के बाद आप MATH पर सटीकता में 3 अंक की गिरावट देखेंगे। दो वसूली पथों का नाम देंः एक गुणवत्ता-पहले (एफपी8 वजन बनाए रखें) और एक लागत-पहले (डोमेन में डेटा के साथ मापें) ।
  4. एमएलपरफ v6.0 निष्कर्ष परिणाम पढ़ें. कौन सा कार्य सबसे छोटा ब्लैकवेल-ओवर-हॉपर अंतर है, और क्यों?
  5. एनवीएफपी 4 वज़न पर 405 बी मॉडल के लिए आवश्यक एचबीएम की गणना करें + 128k संदर्भ पर एफपी 8 केवी कैश। क्या यह एक एकल जीबी 200 एनवीएल 72 नोड पर फिट बैठता है?

प्रमुख शर्तें

TermWhat people sayWhat it actually means
FP8"eight-bit float"8-bit floating point; used for KV cache and attention due to dynamic range
NVFP4"four-bit micro"NVIDIA's 4-bit microscaling FP format; weights and activations on Blackwell
MXFP8"MX eight"Microscaling FP8 variant; hardware-accelerated on Blackwell Tensor Cores
Day-0 FP4"ship FP4 weights"Model providers release weights already in FP4; no post-train conversion step
MTP"multi-token prediction"TRT-LLM's integrated speculative-decoding draft (Phase 17 · 05)
Disaggregated serving"split prefill/decode"Prefill and decode on separate GPU pools; KV transferred over NVLink/IB
All-to-all"MoE expert comm"Communication pattern routing tokens to expert GPUs; NVLink 5 cuts 3x
InferenceX"SemiAnalysis inference bench"The 2026 industry-accepted cost-per-token benchmark

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.