Phase 17: Infrastructure & Production

उत्पादन मात्रा AWQ, GPTQ, GGUF K-क्वांट, FP8, MXFP4/NVFP4

क्वांटिज़ेशन प्रारूप सार्वभौमिक विकल्प नहीं है यह हार्डवेयर, सेवा इंजन और कार्यभार का कार्य है। GGUF Q4_K_M या Q5_K_M CPU और किनारे के मालिक हैं, जिसे llama.cpp और Ollama के माध्यम से वितरित किया जाता है। GPTQ VLLM के अंदर जीतता है जब आप एक ही आधार पर बहु-लोरा की जरूरत है। मार्लिन-एडब्ल्यूक्यू कर्नल के साथ AWQ 7B वर्ग मॉडल पर ~741 tok/s प्रदान करता है, जिसमें सबसे अच्छा पास@1 INT4 पर है। एफपी8 हॉपर, एडा और ब्लैकवेल पर मध्यस्थता में रहता है लगभग नुकसान रहित और व्यापक रूप से समर्थित। NVFP4 और MXFP4 (ब्लैकवेल माइक्रोस्केलिंग) आक्रामक हैं और प्रति ब्लॉक सत्यापन की आवश्यकता होती है। दो जाल काटने की टीमेंः कैलिब्रेशन डेटासेट को तैनाती डोमेन से मेल खाना चाहिए, और KV कैश वजन क्वांटिज़ेशन से अलग है AWQ पाठ "मेरा मॉडल अब 4 GB है" उत्पादन बैच आकार पर 10-30 GB KV कैश को भूल जाता है।

Type: Learn

Languages: Python (stdlib, toy memory and throughput comparison across formats)

Prerequisites: Phase 10 · 13 (Quantization foundations), Phase 17 · 04 (Serving Engine Internals)

Time: ~75 minutes

सीखने के लक्ष्य

  • 2026 में छह उत्पादन क्वांटिज़ेशन प्रारूपों और उनके मीठे स्थानों का नाम बताइए।
  • हार्डवेयर (CPU बनाम GPU, हॉपर बनाम ब्लैकवेल), इंजन (vLLM, TRT-LLM, llama.cpp) और वर्कलोड (रॉटीन चैट, तर्क, मल्टी-लोरा) के लिए एक प्रारूप चुनें।
  • सहेजे गए वजन मेमोरी की गणना करें और चयनित प्रारूप के लिए KV कैश को अछूता छोड़ दें।
  • डोमेन ट्रैफ़िक पर क्वांटिज़्ड मॉडल को गिरा देने वाले कैलिब्रेशन-डेटासेट फेल का नाम दें।

समस्या

क्वांटिज़ेशन मेमोरी और एचबीएम बैंडविड्थ को कम करता है, जो कि ठीक वही है जो डिकोड की आवश्यकता है। एक एफपी 16 70 बी मॉडल में 140 जीबी वजन होता है। INT4 (एडब्ल्यूक्यू या जीपीटीक्यू) में वजन को क्वांटिज़ करें और मॉडल 35 जीबी है। यह एक एच 100 में फिट बैठता है जिसमें केवी कैश के लिए जगह है, जो मायने रखता है क्योंकि 2 के संदर्भ के साथ 128 समवर्ती अनुक्रमों में, केवी कैश अकेले 20-30 जीबी है।

लेकिन क्वांटिज़ेशन मुफ्त नहीं है. आक्रामक क्वांटिज़ेशन गुणवत्ता को कम करता है, खासकर तर्क-भारी कार्यों पर। विभिन्न प्रारूप विभिन्न इंजनों के साथ काम करते हैं। विभिन्न हार्डवेयर मूल रूप से विभिन्न सटीकताओं का समर्थन करता है। 2026 प्रारूप चिड़ियाघर वास्तविक है और आप किसी और के विकल्प को कॉपी नहीं कर सकते हैं। आपको अपने स्टैक के आधार पर चुनना होगा।

अवधारणा

छह प्रारूप

FormatBitsSweet spotEngines
GGUF Q4_K_M / Q5_K_M4-5CPU, edge, laptopsllama.cpp, Ollama
GPTQ4-8Multi-LoRA on vLLMvLLM, TGI
AWQ4Datacenter GPU productionvLLM (Marlin-AWQ), TGI
FP88Hopper/Ada/Blackwell datacentervLLM, TRT-LLM, SGLang
MXFP44Blackwell multi-userTRT-LLM
NVFP44Blackwell multi-userTRT-LLM

GGUF डिफ़ॉल्ट CPU/एज

GGUF एक फ़ाइल प्रारूप है, स्वयं एक क्वांटिज़ेशन योजना नहीं है यह एक कंटेनर में K-क्वांट वैरिएंट (Q2_K, Q3_K_M, Q4_K_M, Q5_K_M, Q6_K, Q8_0) को बंडल करता है। Q4_K_M और Q5_K_M उत्पादन डिफ़ॉल्ट हैं लगभग BF16 गुणवत्ता 4-5 बिट्स पर। CPU या किनारे सेवा के लिए सबसे अच्छा विकल्प क्योंकि llama.cpp सबसे तेज CPU निष्कर्ष इंजन है।

vLLM में थ्रूपुट पेनाल्टीः ~93 tok/s 7B पर प्रारूप GPU कर्नेल के लिए अनुकूलित नहीं है। जब तैनाती लक्ष्य CPU/edge है तो GGUF का उपयोग करें। अन्यथा नहीं।

GPTQ vLLM में मल्टी-लोरा

जीपीटीक्यू एक पोस्ट-ट्रेनिंग क्वांटिज़ेशन एल्गोरिदम है जिसमें एक कैलिब्रेशन पास है। मार्लिन कर्नेल इसे GPU पर (2.6x स्पीडअप बनाम गैर-मार्लिन जीपीटीक्यू) तेज बनाते हैं। ~712 tok/s 7B पर।

अद्वितीय जीतः GPTQ-Int4 vLLM में LoRA एडाप्टर का समर्थन करता है। यदि आप एक मूल मॉडल और 10-50 बारीक-ट्यूनीकृत संस्करणों (प्रत्येक एक LoRA के रूप में) की सेवा कर रहे हैं, तो GPTQ आपका रास्ता है। NVFP4 अभी तक 2026 की शुरुआत से LoRA का समर्थन नहीं करता है।

AWQ डेटा सेंटर GPU डिफ़ॉल्ट

सक्रियण-जागरूक वजन मात्रा। मात्राकरण के दौरान ~ 1% सबसे उत्कृष्ट वजन की रक्षा करता है। मार्लिन-एडब्ल्यूक्यू कर्नेलः 10.9x गति बनाम साफ़। ~ 7B पर 741 टोक / सेकंड, INT4 प्रारूपों में सर्वश्रेष्ठ पास@1।

नए GPU सेवा के लिए AWQ चुनें जब तक कि आपको मल्टी-लोरा (GPTQ) या आक्रामक ब्लैकवेल FP4 (NVFP4) की आवश्यकता नहीं है।

FP8 विश्वसनीय मध्य

8-बिट फ्लोटिंग प्वाइंट. लगभग हानि रहित. व्यापक रूप से समर्थित. हॉपर टेंसर कोर FP8 को मूल रूप से गति देते हैं। ब्लैकवेल विरासत में देता है। FP8 सुरक्षित 2026 डिफ़ॉल्ट है जब गुणवत्ता गैर-negotiable (विनय, चिकित्सा, कोड-जन) है। मेमोरी बचत INT4 का आधा है लेकिन गुणवत्ता जोखिम बहुत कम है।

MXFP4 / NVFP4 ब्लैकवेल आक्रामक

माइक्रोस्केलिंग FP4. वजन के प्रत्येक ब्लॉक का अपना स्केल फैक्टर होता है। ब्लैकवेल Tensor कोर पर आक्रामक लेकिन हार्डवेयर-एक्सेलेरेटेड। प्रति टोकन बाइट्स को FP8 के मुकाबले आधा करना चरण 17 · 07 में आर्थिक जीत।

गुफाएँ

  • अभी तक (2026 की शुरुआत) कोई लोरा समर्थन नहीं है।
  • तर्क-वितर्क से भरे काम के भार पर गुणवत्ता में गिरावट दिखाई देती है।
  • प्रति मॉडल अपने मूल्यांकन सेट पर मान्य करें।

माप जाल

AWQ और GPTQ के लिए एक कैलिब्रेशन डेटासेट की आवश्यकता होती है आमतौर पर C4 या WikiText। डोमेन मॉडल (कोड, चिकित्सा, कानूनी) के लिए, सामान्य वेब पाठ पर कैलिब्रेशन एल्गोरिथ्म को यह निर्णय लेने की अनुमति देता है कि किस वजन को संरक्षित करना है। HumanEval पर Pass@1 कई अंक गिर सकता है।

फिक्सः डोमेन में डेटा पर मापें. डोमेन के सैकड़ों नमूने आमतौर पर पर्याप्त है. शिपिंग से पहले मूल्यांकन सेट पर परीक्षण.

KV कैश जाल

AWQ वजन को 4 बिट तक कम करता है। KV कैश अलग है और FP16/FP8 पर रहता है। AWQ के साथ 70B मॉडल के लिएः

  • वजनः ~ 35 जीबी (INT4 140 जीबी से) ।
  • 128 समवर्ती × 2k संदर्भ पर KV कैशः ~20 GB।
  • सक्रियणः ~ 5 जीबी।
  • कुलः ~ 60 जीबी H100 80 जीबी पर फिट बैठता है।

"मैंने अपने मॉडल को 4 जीबी तक क्वांटिफाई किया" अन्य 30-50 जीबी को भूल जाता है। बजट एचबीएम समग्र रूप से।

अलग से, केवी कैश क्वांटिज़ेशन (एफपी 8 केवी या INT8 केवी) अपने स्वयं के व्यापार के साथ एक अलग विकल्प है यह ध्यान सटीकता को सीधे प्रभावित करता है और एक मुक्त जीत नहीं है।

AWQ INT4 तर्क के लिए खतरनाक है

विचार श्रृंखला, गणित, लंबे संदर्भ वाले कोड-जन ये आक्रामक मात्रा से स्पष्ट रूप से पीड़ित होते हैं। AWQ INT4 MATH पर ~ 3-5 अंक खो देता है। तर्क-भारी कार्यभार के लिए, FP8 या BF16 जहाज; मेमोरी लागत स्वीकार करें।

2026 चुनने का मार्गदर्शिका

  • सीपीयू/एज सर्विसः GGUF Q4_K_M। किया गया।
  • जीपीयू सेवा, नियमित चैट, कोई लॉरा नहीं।
  • जीपीयू सेवा, बहु-लोरा: जीपीटीक्यू Marlin के साथ.
  • तर्क कार्यभारः एफपी8
  • ब्लैकवेल डेटा सेंटर, सत्यापित गुणवत्ताः NVFP4 + FP8 KV।
  • अस्पष्टः प्रत्येक उम्मीदवार प्रारूप पर 1,000 नमूना मूल्यांकन चलाएं।

इसका प्रयोग करें

code/main.pyमॉडल आकारों की एक श्रृंखला के लिए छह प्रारूपों में मेमोरी पदचिह्न (वेट + KV + सक्रियण) और सापेक्ष आउटपुट की गणना करता है। यह दिखाता है कि KV कैश कहां हावी है, वजन संपीड़न कहां भुगतान करता है, और जहां FP8 सुरक्षित विकल्प है।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-quantization-picker.md. हार्डवेयर, मॉडल आकार, कार्यभार प्रकार और गुणवत्ता सहिष्णुता को देखते हुए, एक प्रारूप चुनता है और एक माप/मान्यीकरण योजना तैयार करता है।

व्यायाम

  1. दौड़ेंcode/main.py. एक 70B मॉडल के लिए 128 समवर्ती 2k संदर्भ के साथ, प्रत्येक प्रारूप के लिए कुल HBM गणना. कौन सा प्रारूप आप एक H100 80GB पर फिट करने की अनुमति देता है?
  2. आप एक 7B कोडिंग मॉडल है. एक प्रारूप चुनें और सही ठहराने. आप गुणवत्ता सहिष्णुता के बारे में गलत थे, तो वसूली का रास्ता क्या है?
  3. मेडिकल डोमेन मॉडल के लिए AWQ को कैलिब्रेट करने के लिए आवश्यक कैलिब्रेशन-डेटासेट आकार की गणना करें। अधिक डेटा हमेशा बेहतर क्यों नहीं होता है?
  4. मार्लिन-एडब्ल्यूक्यू केर्नेल पेपर या रिलीज नोट्स पढ़ें। तीन वाक्य में समझाएं कि AWQ 7B पर 741 tok/s पर क्यों पहुंचता है जबकि कच्चे GPTQ ~712 पर पहुंचता है।
  5. जब यह FP8 KV कैश के साथ AWQ वजन संयुक्त करने के लिए समझ में आता है बनाम BF16 पर KV रखने के लिए?

प्रमुख शर्तें

TermWhat people sayWhat it actually means
GGUF"llama.cpp format"File format bundling K-quant variants; CPU/edge default
Q4_K_M"Q4 K M"4-bit K-quant medium; the production GGUF default
GPTQ"gee pee tee q"Post-train INT4 with calibration; supports LoRA in vLLM
AWQ"a w q"Activation-aware INT4; Marlin kernels; best Pass@1 at INT4
Marlin kernels"fast INT4 kernels"Custom CUDA kernels for INT4 on Hopper; 10x speedup
FP8"eight-bit float"Safe precision default on Hopper/Ada/Blackwell
MXFP4 / NVFP4"microscaling four"Blackwell 4-bit FP with per-block scale factors
Calibration dataset"cal data"Input text used to pick quantization parameters; must match domain
KV cache quantization"KV INT8"Separate choice from weights; affects attention accuracy

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.