उत्पादन मात्रा AWQ, GPTQ, GGUF K-क्वांट, FP8, MXFP4/NVFP4
Type: Learn
Languages: Python (stdlib, toy memory and throughput comparison across formats)
Prerequisites: Phase 10 · 13 (Quantization foundations), Phase 17 · 04 (Serving Engine Internals)
Time: ~75 minutes
सीखने के लक्ष्य
- 2026 में छह उत्पादन क्वांटिज़ेशन प्रारूपों और उनके मीठे स्थानों का नाम बताइए।
- हार्डवेयर (CPU बनाम GPU, हॉपर बनाम ब्लैकवेल), इंजन (vLLM, TRT-LLM, llama.cpp) और वर्कलोड (रॉटीन चैट, तर्क, मल्टी-लोरा) के लिए एक प्रारूप चुनें।
- सहेजे गए वजन मेमोरी की गणना करें और चयनित प्रारूप के लिए KV कैश को अछूता छोड़ दें।
- डोमेन ट्रैफ़िक पर क्वांटिज़्ड मॉडल को गिरा देने वाले कैलिब्रेशन-डेटासेट फेल का नाम दें।
समस्या
क्वांटिज़ेशन मेमोरी और एचबीएम बैंडविड्थ को कम करता है, जो कि ठीक वही है जो डिकोड की आवश्यकता है। एक एफपी 16 70 बी मॉडल में 140 जीबी वजन होता है। INT4 (एडब्ल्यूक्यू या जीपीटीक्यू) में वजन को क्वांटिज़ करें और मॉडल 35 जीबी है। यह एक एच 100 में फिट बैठता है जिसमें केवी कैश के लिए जगह है, जो मायने रखता है क्योंकि 2 के संदर्भ के साथ 128 समवर्ती अनुक्रमों में, केवी कैश अकेले 20-30 जीबी है।
लेकिन क्वांटिज़ेशन मुफ्त नहीं है. आक्रामक क्वांटिज़ेशन गुणवत्ता को कम करता है, खासकर तर्क-भारी कार्यों पर। विभिन्न प्रारूप विभिन्न इंजनों के साथ काम करते हैं। विभिन्न हार्डवेयर मूल रूप से विभिन्न सटीकताओं का समर्थन करता है। 2026 प्रारूप चिड़ियाघर वास्तविक है और आप किसी और के विकल्प को कॉपी नहीं कर सकते हैं। आपको अपने स्टैक के आधार पर चुनना होगा।
अवधारणा
छह प्रारूप
| Format | Bits | Sweet spot | Engines |
|---|---|---|---|
| GGUF Q4_K_M / Q5_K_M | 4-5 | CPU, edge, laptops | llama.cpp, Ollama |
| GPTQ | 4-8 | Multi-LoRA on vLLM | vLLM, TGI |
| AWQ | 4 | Datacenter GPU production | vLLM (Marlin-AWQ), TGI |
| FP8 | 8 | Hopper/Ada/Blackwell datacenter | vLLM, TRT-LLM, SGLang |
| MXFP4 | 4 | Blackwell multi-user | TRT-LLM |
| NVFP4 | 4 | Blackwell multi-user | TRT-LLM |
GGUF डिफ़ॉल्ट CPU/एज
GGUF एक फ़ाइल प्रारूप है, स्वयं एक क्वांटिज़ेशन योजना नहीं है यह एक कंटेनर में K-क्वांट वैरिएंट (Q2_K, Q3_K_M, Q4_K_M, Q5_K_M, Q6_K, Q8_0) को बंडल करता है। Q4_K_M और Q5_K_M उत्पादन डिफ़ॉल्ट हैं लगभग BF16 गुणवत्ता 4-5 बिट्स पर। CPU या किनारे सेवा के लिए सबसे अच्छा विकल्प क्योंकि llama.cpp सबसे तेज CPU निष्कर्ष इंजन है।
vLLM में थ्रूपुट पेनाल्टीः ~93 tok/s 7B पर प्रारूप GPU कर्नेल के लिए अनुकूलित नहीं है। जब तैनाती लक्ष्य CPU/edge है तो GGUF का उपयोग करें। अन्यथा नहीं।
GPTQ vLLM में मल्टी-लोरा
जीपीटीक्यू एक पोस्ट-ट्रेनिंग क्वांटिज़ेशन एल्गोरिदम है जिसमें एक कैलिब्रेशन पास है। मार्लिन कर्नेल इसे GPU पर (2.6x स्पीडअप बनाम गैर-मार्लिन जीपीटीक्यू) तेज बनाते हैं। ~712 tok/s 7B पर।
अद्वितीय जीतः GPTQ-Int4 vLLM में LoRA एडाप्टर का समर्थन करता है। यदि आप एक मूल मॉडल और 10-50 बारीक-ट्यूनीकृत संस्करणों (प्रत्येक एक LoRA के रूप में) की सेवा कर रहे हैं, तो GPTQ आपका रास्ता है। NVFP4 अभी तक 2026 की शुरुआत से LoRA का समर्थन नहीं करता है।
AWQ डेटा सेंटर GPU डिफ़ॉल्ट
सक्रियण-जागरूक वजन मात्रा। मात्राकरण के दौरान ~ 1% सबसे उत्कृष्ट वजन की रक्षा करता है। मार्लिन-एडब्ल्यूक्यू कर्नेलः 10.9x गति बनाम साफ़। ~ 7B पर 741 टोक / सेकंड, INT4 प्रारूपों में सर्वश्रेष्ठ पास@1।
नए GPU सेवा के लिए AWQ चुनें जब तक कि आपको मल्टी-लोरा (GPTQ) या आक्रामक ब्लैकवेल FP4 (NVFP4) की आवश्यकता नहीं है।
FP8 विश्वसनीय मध्य
8-बिट फ्लोटिंग प्वाइंट. लगभग हानि रहित. व्यापक रूप से समर्थित. हॉपर टेंसर कोर FP8 को मूल रूप से गति देते हैं। ब्लैकवेल विरासत में देता है। FP8 सुरक्षित 2026 डिफ़ॉल्ट है जब गुणवत्ता गैर-negotiable (विनय, चिकित्सा, कोड-जन) है। मेमोरी बचत INT4 का आधा है लेकिन गुणवत्ता जोखिम बहुत कम है।
MXFP4 / NVFP4 ब्लैकवेल आक्रामक
माइक्रोस्केलिंग FP4. वजन के प्रत्येक ब्लॉक का अपना स्केल फैक्टर होता है। ब्लैकवेल Tensor कोर पर आक्रामक लेकिन हार्डवेयर-एक्सेलेरेटेड। प्रति टोकन बाइट्स को FP8 के मुकाबले आधा करना चरण 17 · 07 में आर्थिक जीत।
गुफाएँ
- अभी तक (2026 की शुरुआत) कोई लोरा समर्थन नहीं है।
- तर्क-वितर्क से भरे काम के भार पर गुणवत्ता में गिरावट दिखाई देती है।
- प्रति मॉडल अपने मूल्यांकन सेट पर मान्य करें।
माप जाल
AWQ और GPTQ के लिए एक कैलिब्रेशन डेटासेट की आवश्यकता होती है आमतौर पर C4 या WikiText। डोमेन मॉडल (कोड, चिकित्सा, कानूनी) के लिए, सामान्य वेब पाठ पर कैलिब्रेशन एल्गोरिथ्म को यह निर्णय लेने की अनुमति देता है कि किस वजन को संरक्षित करना है। HumanEval पर Pass@1 कई अंक गिर सकता है।
फिक्सः डोमेन में डेटा पर मापें. डोमेन के सैकड़ों नमूने आमतौर पर पर्याप्त है. शिपिंग से पहले मूल्यांकन सेट पर परीक्षण.
KV कैश जाल
AWQ वजन को 4 बिट तक कम करता है। KV कैश अलग है और FP16/FP8 पर रहता है। AWQ के साथ 70B मॉडल के लिएः
- वजनः ~ 35 जीबी (INT4 140 जीबी से) ।
- 128 समवर्ती × 2k संदर्भ पर KV कैशः ~20 GB।
- सक्रियणः ~ 5 जीबी।
- कुलः ~ 60 जीबी H100 80 जीबी पर फिट बैठता है।
"मैंने अपने मॉडल को 4 जीबी तक क्वांटिफाई किया" अन्य 30-50 जीबी को भूल जाता है। बजट एचबीएम समग्र रूप से।
अलग से, केवी कैश क्वांटिज़ेशन (एफपी 8 केवी या INT8 केवी) अपने स्वयं के व्यापार के साथ एक अलग विकल्प है यह ध्यान सटीकता को सीधे प्रभावित करता है और एक मुक्त जीत नहीं है।
AWQ INT4 तर्क के लिए खतरनाक है
विचार श्रृंखला, गणित, लंबे संदर्भ वाले कोड-जन ये आक्रामक मात्रा से स्पष्ट रूप से पीड़ित होते हैं। AWQ INT4 MATH पर ~ 3-5 अंक खो देता है। तर्क-भारी कार्यभार के लिए, FP8 या BF16 जहाज; मेमोरी लागत स्वीकार करें।
2026 चुनने का मार्गदर्शिका
- सीपीयू/एज सर्विसः GGUF Q4_K_M। किया गया।
- जीपीयू सेवा, नियमित चैट, कोई लॉरा नहीं।
- जीपीयू सेवा, बहु-लोरा: जीपीटीक्यू Marlin के साथ.
- तर्क कार्यभारः एफपी8
- ब्लैकवेल डेटा सेंटर, सत्यापित गुणवत्ताः NVFP4 + FP8 KV।
- अस्पष्टः प्रत्येक उम्मीदवार प्रारूप पर 1,000 नमूना मूल्यांकन चलाएं।
इसका प्रयोग करें
code/main.pyमॉडल आकारों की एक श्रृंखला के लिए छह प्रारूपों में मेमोरी पदचिह्न (वेट + KV + सक्रियण) और सापेक्ष आउटपुट की गणना करता है। यह दिखाता है कि KV कैश कहां हावी है, वजन संपीड़न कहां भुगतान करता है, और जहां FP8 सुरक्षित विकल्प है।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-quantization-picker.md. हार्डवेयर, मॉडल आकार, कार्यभार प्रकार और गुणवत्ता सहिष्णुता को देखते हुए, एक प्रारूप चुनता है और एक माप/मान्यीकरण योजना तैयार करता है।
व्यायाम
- दौड़ें
code/main.py. एक 70B मॉडल के लिए 128 समवर्ती 2k संदर्भ के साथ, प्रत्येक प्रारूप के लिए कुल HBM गणना. कौन सा प्रारूप आप एक H100 80GB पर फिट करने की अनुमति देता है? - आप एक 7B कोडिंग मॉडल है. एक प्रारूप चुनें और सही ठहराने. आप गुणवत्ता सहिष्णुता के बारे में गलत थे, तो वसूली का रास्ता क्या है?
- मेडिकल डोमेन मॉडल के लिए AWQ को कैलिब्रेट करने के लिए आवश्यक कैलिब्रेशन-डेटासेट आकार की गणना करें। अधिक डेटा हमेशा बेहतर क्यों नहीं होता है?
- मार्लिन-एडब्ल्यूक्यू केर्नेल पेपर या रिलीज नोट्स पढ़ें। तीन वाक्य में समझाएं कि AWQ 7B पर 741 tok/s पर क्यों पहुंचता है जबकि कच्चे GPTQ ~712 पर पहुंचता है।
- जब यह FP8 KV कैश के साथ AWQ वजन संयुक्त करने के लिए समझ में आता है बनाम BF16 पर KV रखने के लिए?
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| GGUF | "llama.cpp format" | File format bundling K-quant variants; CPU/edge default |
| Q4_K_M | "Q4 K M" | 4-bit K-quant medium; the production GGUF default |
| GPTQ | "gee pee tee q" | Post-train INT4 with calibration; supports LoRA in vLLM |
| AWQ | "a w q" | Activation-aware INT4; Marlin kernels; best Pass@1 at INT4 |
| Marlin kernels | "fast INT4 kernels" | Custom CUDA kernels for INT4 on Hopper; 10x speedup |
| FP8 | "eight-bit float" | Safe precision default on Hopper/Ada/Blackwell |
| MXFP4 / NVFP4 | "microscaling four" | Blackwell 4-bit FP with per-block scale factors |
| Calibration dataset | "cal data" | Input text used to pick quantization parameters; must match domain |
| KV cache quantization | "KV INT8" | Separate choice from weights; affects attention accuracy |
आगे पढ़ना
- VRLA Tech — LLM Quantization 2026 तुलनात्मक बेंचमार्क।
- Jarvis Labs — vLLM Quantization Complete Guide प्रारूप द्वारा आउटपुट संख्याएँ।
- PremAI — GGUF vs AWQ vs GPTQ vs bitsandbytes 2026 प्रारूप-दर-आकार चयन।
- vLLM docs — Quantization समर्थित प्रारूप और ध्वज।
- AWQ paper (arXiv:2306.00978) मूल AWQ सूत्र।
- GPTQ paper (arXiv:2210.17323) मूल GPTQ सूत्र।
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.