Phase 17: Infrastructure & Production

كمية الإنتاج AWQ، GPTQ، GGUF K-quants، FP8, MXFP4/NVFP4

إن شكل الكمية ليس خيارًا عالميًا إنه وظيفة من الأجهزة ومحرك الخدمة والحمق العامل. تمتلك GGUF Q4_K_M أو Q5_K_M CPU والحافة ، والتي يتم تسليمها من خلال llama.cpp و Ollama. (جبتك) يفوز داخل (فلم) عندما تحتاج إلى (لورا) متعددة على نفس القاعدة AWQ مع أجزاء من Marlin-AWQ يقدم ~ 741 tok/s على نموذج فئة 7B مع أفضل Pass@1 في INT4 افتراض 2026 لإنتاج مركز البيانات. فبرنامج 8 يبقى في المنتصف على هوبر، أدا، وبلاكويل تقريبا دون خسائر ودعم واسع. NVFP4 و MXFP4 (الجهاز الضئيل لـ Blackwell) عدوانية و تتطلب التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق من التحقق. فرق اثنين من الفخاخ: يجب أن تتطابق مجموعة بيانات التصفية مع مجال التنفيذ ، و KV cache منفصلة عن كمية الوزن درس AWQ "نموذجي هو 4 GB الآن" ينسى 10-30 GB KV cache في حجم البطاقات الإنتاجية.

Type: Learn

Languages: Python (stdlib, toy memory and throughput comparison across formats)

Prerequisites: Phase 10 · 13 (Quantization foundations), Phase 17 · 04 (Serving Engine Internals)

Time: ~75 minutes

أهداف التعلم

  • أسمي ستة أشكال تصنيف الكميات الإنتاج وأماكنها المثيرة في عام 2026.
  • اختر شكلًا معينًا للأجهزة (CPU vs GPU ، Hopper vs Blackwell) ، المحرك (vLLM ، TRT-LLM ، llama.cpp) ، والحمق العمل (رداد روتينية ، التفكير ، متعددة LoRA).
  • احسب الذاكرة الوزن المحفوظة والكاش KV لم تُلمس لتنسيق المختار.
  • أسمائ خطورة مجموعة بيانات التصفية التي تخلل النماذج الكمية على حركة المرور في النطاق.

المشكلة

يقلل التكميل من الذاكرة و عرض النطاق HBM ، وهو بالضبط ما يحتاجه فك التشفير. نموذج FP16 70B هو 140 غيغابايت من الوزن. قم بتكميل الوزن إلى INT4 (AWQ أو GPTQ) والنموذج هو 35 غيغابايت يناسب في H100 مع مساحة لخزنة KV ، وهو ما يهم لأنه في 128 تسلسل متزامن مع سياق 2k ، خزنة KV وحدها هي 20-30 غيغابايت.

لكن الكمية ليست مجانية. الكمية العدوانية تؤدي إلى تدهور الجودة، خاصة في المهام الثقيلة للتفكير. تنشطات مختلفة تعمل مع محركات مختلفة. الأجهزة المختلفة تدعم دقة مختلفة بشكل طبيعي. حديقة الحيوان في شكل 2026 حقيقية ولا يمكنك نسخ خيار شخص آخر. عليك اختيار بناءً على كومةك.

المفهوم

الأشكال الستة

FormatBitsSweet spotEngines
GGUF Q4_K_M / Q5_K_M4-5CPU, edge, laptopsllama.cpp, Ollama
GPTQ4-8Multi-LoRA on vLLMvLLM, TGI
AWQ4Datacenter GPU productionvLLM (Marlin-AWQ), TGI
FP88Hopper/Ada/Blackwell datacentervLLM, TRT-LLM, SGLang
MXFP44Blackwell multi-userTRT-LLM
NVFP44Blackwell multi-userTRT-LLM

GGUF المحرك المركزي / الحافة الافتراضية

GGUF هو شكل ملف ، وليس مخطط كمية في حد ذاته يجمع فوارق K الكمية (Q2_K ، Q3_K_M ، Q4_K_M ، Q5_K_M ، Q6_K ، Q8_0) في حاوية واحدة. Q4_K_M و Q5_K_M هي الاختيارات الافتراضية الإنتاج قريبا من BF16 الجودة في 4-5 بتات. أفضل خيار لسي بي يو أو الحافة الخدمة لأن llama.cpp هو أبعد محرك استنتاج لسي بي يو بسرعة.

عقوبة التشغيل في vLLM: ~93 tok/s على 7B لا يتم تحسين النموذج لبنات GPU. استخدم GGUF عندما يكون هدف التنفيذ هو CPU/edge. ليس خلاف ذلك.

GPTQ متعددة الـ LORA في vLLM

GPTQ هو خوارزمية كمية بعد التدريب مع مرور تحديد. أجزاء مارلين تجعلها أسرع على GPU (2.6x سرعة مقابل غير مارلين GPTQ). ~ 712 tok / s على 7B.

الفوز الفريد: يدعم GPTQ-Int4 مكيّفات LoRA في vLLM. إذا كنت تخدم نموذج أساسي بالإضافة إلى 10-50 فاريان دقيقة (كل منها كLoRA) ، فإن GPTQ هو طريقك. NVFP4 لا تدعم LoRA بعد في أوائل عام 2026.

AWQ GPU مركز البيانات الافتراضي

تحميل الوزن الكمي خلال عملية الكميات. أجزاء مارلين-AWQ: 10.9x speedup vs naive. ~741 tok/s على 7B، أفضل Pass@1 بين تنسيقات INT4.

اختر AWQ لنظام GPU الجديد ما لم تكن بحاجة إلى مجموعة متعددة LoRA (GPTQ) أو Blackwell FP4 (NVFP4) عدوانية.

فترة 8 الوسط الموثوق به

نقطة عائمة 8 بتات. لا تخسير تقريبًا. مدعومة على نطاق واسع. أجزاء هوبر تنسور تسريع FP8 بشكل طبيعي. يرث بلاكويل. FP8 هي الاختيار القانوني الآمن 2026 عندما تكون الجودة غير قابلة للتفاوض (الاعتقاد ، الطبية ، الجينات الكودية). توفير الذاكرة هو نصف INT4 ولكن مخاطر الجودة أقل بكثير.

MXFP4 / NVFP4 بلاكويل عدواني

التوسيع الدقيق في FP4. كل كتلة من الأوزان لها عامل مقياس خاص بها. عدواني ولكن متسارع بالأجهزة على أجزاء التنسور بلاكويل. خفض بنصف البايتات لكل رمز مقابل FP8 الفوز الاقتصادي في المرحلة 17 · 07.

الكهوف:

  • لا يوجد دعم لـ LoRA بعد (أوائل 2026).
  • انخفاض الجودة مرئي على عبء العمل الثقيل.
  • تأكيد على مجموعة تقييمك لكل نموذج

فخّ التصفية

تتطلب AWQ و GPTQ مجموعة بيانات تحديد الميزات عادة C4 أو WikiText. بالنسبة لنماذج النطاقات (رمز، طبية، قانونية) ، تسمح تحديد الميزات على النص الويب العام للخوارزمية بإجراء قرارات خاطئة حول الأوزان التي يجب حمايتها. Pass@1 على HumanEval يمكن أن تسقط عدة نقاط.

الإصلاح: تحديد على بيانات في النطاق. مئات عينات النطاق عادة ما يكون كافيا. اختبار على مجموعة تقييم قبل الشحن.

فخ الـ KV

يقلل AWQ من الوزن إلى 4 بتات. يتم إزالة مخزن KV منفصلًا ويبقى عند FP16 / FP8. بالنسبة لنموذج 70B مع AWQ:

  • الوزن: ~ 35 جيجا غيترا (INT4 من 140 جيجا غيترا).
  • كش كيف في 128 مواطن متزامن × 2k: ~ 20 جيجابايت.
  • التفعيل: ~ 5 جيجابايت
  • إجمالي: ~ 60 جيجابايت يناسب H100 80 جيجابايت.

"لقد قمت بتحديد نموذجي إلى 4 جيجا غايت" تنسى ما يقرب من 30 إلى 50 جيجا غايت

بشكل منفصل ، تعد كوانتية الاحتفاظ بالخزنة في KV (FP8 KV أو INT8 KV) خيارًا مختلفًا مع تعادلاتها الخاصة فإنه يؤثر على دقة الاهتمام مباشرة وليس فوزًا حرًا.

AWQ INT4 خطير للتفكير

سلسلة الفكر والرياضيات والجينات المشفرة ذات السياق الطويل هذه تعاني بشكل واضح من الكمياتية العدوانية. AWQ INT4 تفقد ~ 3-5 نقاط على MATH. بالنسبة لحملات العمل الثقيلة للتفكير ، أرسل FP8 أو BF16 ؛ تقبل تكلفة الذاكرة.

2026 دليل التقط

  • خدمة CPU/Edge: GGUF Q4_K_M. انتهى.
  • خدمة الجيبو، دردشة روتينية، لا توجد لورا:
  • خدمة الجيبو، متعددة اللورا: GPTQ مع مارلين.
  • عبء العمل في التفكير: ف.ب.8.
  • مركز بيانات بلاكويل، جودة معتمدة: NVFP4 + FP8 KV.
  • غامض: إجراء تقييم من 1000 عينة على كل تنسيق مرشح.

استخدمها

code/main.pyيحسب بصمة الذاكرة (الوزن + KV + التفعيلات) والعبور النسبي عبر التنسيقات الست لمجموعة من أحجام النموذج. يظهر أين يهيمن ذاكرة الاحتفاظ KV ، حيث يدفع ضغط الوزن ، و حيث FP8 هو اختيار آمن.

أرسله

هذا الدرس يُنتجoutputs/skill-quantization-picker.md. بالنظر إلى الأجهزة والحجم النموذجي ونوع عبء العمل والتسامح مع الجودة، يختار شكلًا ويضع خطة قياس/تصديق.

التمارين

  1. أركضcode/main.pyبالنسبة لنموذج 70B عند 128 متزامن مع سياق 2k، احسب إجمالي HBM لكل تنسيق. أي تنسيق يسمح لك بالتناسب على H100 80GB؟
  2. لديك نموذج تشفير 7B، اختر شكل وتبرير إذا كنت مخطئاً بشأن التسامح الجودة، ما هو طريق التعافي؟
  3. حساب حجم مجموعة بيانات التصفية اللازمة لتصفية AWQ لنموذج مجال الطب. لماذا ليست المزيد من البيانات أفضل دائما؟
  4. اقرأ ورقة جوهر مارلين-AWQ أو ملاحظات الإفراج. شرح في ثلاث جمل لماذا AWQ يصل إلى 741 tok/s على 7B بينما GPTQ الخام يصل إلى ~ 712.
  5. متى يكون من المنطقي أن تجمع معدات AWQ مع FP8 KV cache مقابل الحفاظ على KV في BF16؟

الشروط الرئيسية

TermWhat people sayWhat it actually means
GGUF"llama.cpp format"File format bundling K-quant variants; CPU/edge default
Q4_K_M"Q4 K M"4-bit K-quant medium; the production GGUF default
GPTQ"gee pee tee q"Post-train INT4 with calibration; supports LoRA in vLLM
AWQ"a w q"Activation-aware INT4; Marlin kernels; best Pass@1 at INT4
Marlin kernels"fast INT4 kernels"Custom CUDA kernels for INT4 on Hopper; 10x speedup
FP8"eight-bit float"Safe precision default on Hopper/Ada/Blackwell
MXFP4 / NVFP4"microscaling four"Blackwell 4-bit FP with per-block scale factors
Calibration dataset"cal data"Input text used to pick quantization parameters; must match domain
KV cache quantization"KV INT8"Separate choice from weights; affects attention accuracy

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.