كمية الإنتاج AWQ، GPTQ، GGUF K-quants، FP8, MXFP4/NVFP4
Type: Learn
Languages: Python (stdlib, toy memory and throughput comparison across formats)
Prerequisites: Phase 10 · 13 (Quantization foundations), Phase 17 · 04 (Serving Engine Internals)
Time: ~75 minutes
أهداف التعلم
- أسمي ستة أشكال تصنيف الكميات الإنتاج وأماكنها المثيرة في عام 2026.
- اختر شكلًا معينًا للأجهزة (CPU vs GPU ، Hopper vs Blackwell) ، المحرك (vLLM ، TRT-LLM ، llama.cpp) ، والحمق العمل (رداد روتينية ، التفكير ، متعددة LoRA).
- احسب الذاكرة الوزن المحفوظة والكاش KV لم تُلمس لتنسيق المختار.
- أسمائ خطورة مجموعة بيانات التصفية التي تخلل النماذج الكمية على حركة المرور في النطاق.
المشكلة
يقلل التكميل من الذاكرة و عرض النطاق HBM ، وهو بالضبط ما يحتاجه فك التشفير. نموذج FP16 70B هو 140 غيغابايت من الوزن. قم بتكميل الوزن إلى INT4 (AWQ أو GPTQ) والنموذج هو 35 غيغابايت يناسب في H100 مع مساحة لخزنة KV ، وهو ما يهم لأنه في 128 تسلسل متزامن مع سياق 2k ، خزنة KV وحدها هي 20-30 غيغابايت.
لكن الكمية ليست مجانية. الكمية العدوانية تؤدي إلى تدهور الجودة، خاصة في المهام الثقيلة للتفكير. تنشطات مختلفة تعمل مع محركات مختلفة. الأجهزة المختلفة تدعم دقة مختلفة بشكل طبيعي. حديقة الحيوان في شكل 2026 حقيقية ولا يمكنك نسخ خيار شخص آخر. عليك اختيار بناءً على كومةك.
المفهوم
الأشكال الستة
| Format | Bits | Sweet spot | Engines |
|---|---|---|---|
| GGUF Q4_K_M / Q5_K_M | 4-5 | CPU, edge, laptops | llama.cpp, Ollama |
| GPTQ | 4-8 | Multi-LoRA on vLLM | vLLM, TGI |
| AWQ | 4 | Datacenter GPU production | vLLM (Marlin-AWQ), TGI |
| FP8 | 8 | Hopper/Ada/Blackwell datacenter | vLLM, TRT-LLM, SGLang |
| MXFP4 | 4 | Blackwell multi-user | TRT-LLM |
| NVFP4 | 4 | Blackwell multi-user | TRT-LLM |
GGUF المحرك المركزي / الحافة الافتراضية
GGUF هو شكل ملف ، وليس مخطط كمية في حد ذاته يجمع فوارق K الكمية (Q2_K ، Q3_K_M ، Q4_K_M ، Q5_K_M ، Q6_K ، Q8_0) في حاوية واحدة. Q4_K_M و Q5_K_M هي الاختيارات الافتراضية الإنتاج قريبا من BF16 الجودة في 4-5 بتات. أفضل خيار لسي بي يو أو الحافة الخدمة لأن llama.cpp هو أبعد محرك استنتاج لسي بي يو بسرعة.
عقوبة التشغيل في vLLM: ~93 tok/s على 7B لا يتم تحسين النموذج لبنات GPU. استخدم GGUF عندما يكون هدف التنفيذ هو CPU/edge. ليس خلاف ذلك.
GPTQ متعددة الـ LORA في vLLM
GPTQ هو خوارزمية كمية بعد التدريب مع مرور تحديد. أجزاء مارلين تجعلها أسرع على GPU (2.6x سرعة مقابل غير مارلين GPTQ). ~ 712 tok / s على 7B.
الفوز الفريد: يدعم GPTQ-Int4 مكيّفات LoRA في vLLM. إذا كنت تخدم نموذج أساسي بالإضافة إلى 10-50 فاريان دقيقة (كل منها كLoRA) ، فإن GPTQ هو طريقك. NVFP4 لا تدعم LoRA بعد في أوائل عام 2026.
AWQ GPU مركز البيانات الافتراضي
تحميل الوزن الكمي خلال عملية الكميات. أجزاء مارلين-AWQ: 10.9x speedup vs naive. ~741 tok/s على 7B، أفضل Pass@1 بين تنسيقات INT4.
اختر AWQ لنظام GPU الجديد ما لم تكن بحاجة إلى مجموعة متعددة LoRA (GPTQ) أو Blackwell FP4 (NVFP4) عدوانية.
فترة 8 الوسط الموثوق به
نقطة عائمة 8 بتات. لا تخسير تقريبًا. مدعومة على نطاق واسع. أجزاء هوبر تنسور تسريع FP8 بشكل طبيعي. يرث بلاكويل. FP8 هي الاختيار القانوني الآمن 2026 عندما تكون الجودة غير قابلة للتفاوض (الاعتقاد ، الطبية ، الجينات الكودية). توفير الذاكرة هو نصف INT4 ولكن مخاطر الجودة أقل بكثير.
MXFP4 / NVFP4 بلاكويل عدواني
التوسيع الدقيق في FP4. كل كتلة من الأوزان لها عامل مقياس خاص بها. عدواني ولكن متسارع بالأجهزة على أجزاء التنسور بلاكويل. خفض بنصف البايتات لكل رمز مقابل FP8 الفوز الاقتصادي في المرحلة 17 · 07.
الكهوف:
- لا يوجد دعم لـ LoRA بعد (أوائل 2026).
- انخفاض الجودة مرئي على عبء العمل الثقيل.
- تأكيد على مجموعة تقييمك لكل نموذج
فخّ التصفية
تتطلب AWQ و GPTQ مجموعة بيانات تحديد الميزات عادة C4 أو WikiText. بالنسبة لنماذج النطاقات (رمز، طبية، قانونية) ، تسمح تحديد الميزات على النص الويب العام للخوارزمية بإجراء قرارات خاطئة حول الأوزان التي يجب حمايتها. Pass@1 على HumanEval يمكن أن تسقط عدة نقاط.
الإصلاح: تحديد على بيانات في النطاق. مئات عينات النطاق عادة ما يكون كافيا. اختبار على مجموعة تقييم قبل الشحن.
فخ الـ KV
يقلل AWQ من الوزن إلى 4 بتات. يتم إزالة مخزن KV منفصلًا ويبقى عند FP16 / FP8. بالنسبة لنموذج 70B مع AWQ:
- الوزن: ~ 35 جيجا غيترا (INT4 من 140 جيجا غيترا).
- كش كيف في 128 مواطن متزامن × 2k: ~ 20 جيجابايت.
- التفعيل: ~ 5 جيجابايت
- إجمالي: ~ 60 جيجابايت يناسب H100 80 جيجابايت.
"لقد قمت بتحديد نموذجي إلى 4 جيجا غايت" تنسى ما يقرب من 30 إلى 50 جيجا غايت
بشكل منفصل ، تعد كوانتية الاحتفاظ بالخزنة في KV (FP8 KV أو INT8 KV) خيارًا مختلفًا مع تعادلاتها الخاصة فإنه يؤثر على دقة الاهتمام مباشرة وليس فوزًا حرًا.
AWQ INT4 خطير للتفكير
سلسلة الفكر والرياضيات والجينات المشفرة ذات السياق الطويل هذه تعاني بشكل واضح من الكمياتية العدوانية. AWQ INT4 تفقد ~ 3-5 نقاط على MATH. بالنسبة لحملات العمل الثقيلة للتفكير ، أرسل FP8 أو BF16 ؛ تقبل تكلفة الذاكرة.
2026 دليل التقط
- خدمة CPU/Edge: GGUF Q4_K_M. انتهى.
- خدمة الجيبو، دردشة روتينية، لا توجد لورا:
- خدمة الجيبو، متعددة اللورا: GPTQ مع مارلين.
- عبء العمل في التفكير: ف.ب.8.
- مركز بيانات بلاكويل، جودة معتمدة: NVFP4 + FP8 KV.
- غامض: إجراء تقييم من 1000 عينة على كل تنسيق مرشح.
استخدمها
code/main.pyيحسب بصمة الذاكرة (الوزن + KV + التفعيلات) والعبور النسبي عبر التنسيقات الست لمجموعة من أحجام النموذج. يظهر أين يهيمن ذاكرة الاحتفاظ KV ، حيث يدفع ضغط الوزن ، و حيث FP8 هو اختيار آمن.
أرسله
هذا الدرس يُنتجoutputs/skill-quantization-picker.md. بالنظر إلى الأجهزة والحجم النموذجي ونوع عبء العمل والتسامح مع الجودة، يختار شكلًا ويضع خطة قياس/تصديق.
التمارين
- أركض
code/main.pyبالنسبة لنموذج 70B عند 128 متزامن مع سياق 2k، احسب إجمالي HBM لكل تنسيق. أي تنسيق يسمح لك بالتناسب على H100 80GB؟ - لديك نموذج تشفير 7B، اختر شكل وتبرير إذا كنت مخطئاً بشأن التسامح الجودة، ما هو طريق التعافي؟
- حساب حجم مجموعة بيانات التصفية اللازمة لتصفية AWQ لنموذج مجال الطب. لماذا ليست المزيد من البيانات أفضل دائما؟
- اقرأ ورقة جوهر مارلين-AWQ أو ملاحظات الإفراج. شرح في ثلاث جمل لماذا AWQ يصل إلى 741 tok/s على 7B بينما GPTQ الخام يصل إلى ~ 712.
- متى يكون من المنطقي أن تجمع معدات AWQ مع FP8 KV cache مقابل الحفاظ على KV في BF16؟
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| GGUF | "llama.cpp format" | File format bundling K-quant variants; CPU/edge default |
| Q4_K_M | "Q4 K M" | 4-bit K-quant medium; the production GGUF default |
| GPTQ | "gee pee tee q" | Post-train INT4 with calibration; supports LoRA in vLLM |
| AWQ | "a w q" | Activation-aware INT4; Marlin kernels; best Pass@1 at INT4 |
| Marlin kernels | "fast INT4 kernels" | Custom CUDA kernels for INT4 on Hopper; 10x speedup |
| FP8 | "eight-bit float" | Safe precision default on Hopper/Ada/Blackwell |
| MXFP4 / NVFP4 | "microscaling four" | Blackwell 4-bit FP with per-block scale factors |
| Calibration dataset | "cal data" | Input text used to pick quantization parameters; must match domain |
| KV cache quantization | "KV INT8" | Separate choice from weights; affects attention accuracy |
المزيد من القراءة
- VRLA Tech — LLM Quantization 2026 مقارنة معايير.
- Jarvis Labs — vLLM Quantization Complete Guide أرقام النمو حسب الشكل.
- PremAI — GGUF vs AWQ vs GPTQ vs bitsandbytes 2026 اختيار النموذج حسب النموذج.
- vLLM docs — Quantization أشكال ودعامات مدعومة.
- AWQ paper (arXiv:2306.00978) صيغة AWQ الأصلية.
- GPTQ paper (arXiv:2210.17323) صيغة GPTQ الأصلية.
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.