اختيار الخدمات المضيفة الذاتية تطابق المحرك مع الأجهزة والقياس
Type: Learn
Languages: Python (stdlib, engine-decision tree walker)
Prerequisites: All Phase 17 lessons covering engines (04, 06, 07, 09, 18)
Time: ~45 minutes
أهداف التعلم
- اختر محرك معين الأجهزة (CPU / AMD / NVIDIA Hopper / Blackwell) ، والحجم (1 مستخدم / 100 / 10,000) ، والحمل العمل (التحدث العام / وكيل / السياق الطويل).
- أسمي حالة وضع الصيانة TGI لعام 2026 (11 ديسمبر 2025) ولماذا تحيز المشاريع الجديدة نحو vLLM أو SGLang.
- وصف خط الأنابيب التطوير/التصميم/التصميم، بما في ذلك حيث يتم تحويل GGUF إلى أسلوب الجهازات الأمانية بين المراحل.
- شرح لماذا يشير "CPU-first" إلى llama.cpp و"AMD" يستبعد TRT-LLM.
المشكلة
فريقك يبدأ مشروع جديد للدرجة العليا المضيفة الذاتية. يقول مهندس واحد أولاما، يقول مهندس آخر vLLM، يقول ثالث "هل لا تعمل TGI فقط خارج الصندوق؟" كل ثلاثة مناسبة لاقياصات مختلفة. لا واحد مناسب للجميع.
في عام 2026 فإن شجرة الخيار مهمة: الأجهزة أولاً، والحجم الثاني، والحمية العمل الثالثة. وحدث محدد واحد في عام 2025 تدخل TGI وضع الصيانة 11 ديسمبر تغير الافتراض للمشاريع الجديدة.
المفهوم
المحركات الخمسة
| Engine | Best for | Notes |
|---|---|---|
| llama.cpp | CPU / edge / minimal deps / widest model support | Fastest on CPU, full control |
| Ollama | Dev laptops, single user, one-command install | 15-30% slower than llama.cpp; 3x prod throughput gap |
| TGI | HF ecosystem, regulated industries | Maintenance mode Dec 11, 2025 |
| vLLM | General-purpose production, 100+ users | Broad production default; v0.15.1 Feb 2026 |
| SGLang | Agentic multi-turn, prefix-heavy workloads | 400,000+ GPUs in production |
القرار الأول عن الأجهزة
CPU-firstلا يوجد محرك آخر قادر على المنافسة على المعالجة المركزية
AMD GPU→ vLLM هو أقوى مسار مدعوم (عملية AMD ROCm). يعمل SGLang أيضا. TRT-LLM مغلق من NVIDIA، لذلك هو خارج.
NVIDIA Hopper (H100 / H200)-إنهُم الثلاثة من الدرجة الأولى
NVIDIA Blackwell (B200 / GB200)→ TRT-LLM هو قائد التدفق (مرحلة 17 · 07). vLLM و SGLang تتبع قريبًا.
Apple Silicon (M-series)- لاما. سي بي (المعدنية) - أولاما يلف هذا
قرار على المستوى الثاني
1 user / local devأوليما، أوامر واحدة، أول رمز في ثواني.
10-100 users / small team-الـ"VLLM" بـ"GPU"
100-10k users / production→ مجموعة إنتاج vLLM (مرحلة 17 · 18) أو SGLang.
10k+ users / enterprise→ vLLM - مستوى الإنتاج + مقسم (مرحلة 17 · 17) + LMCache (مرحلة 17 · 18).
ثالث قرار - عبء العمل
General chat / Q&Aفوز vLLM على الاختلافات الواسعة
Agentic multi-turn (tools, planning, memory)تهيمن "RadixAttention" (المرحلة 17 · 06) من SGLang.
RAG with heavy prefix reuse-إلى (سجلانغ)
Code generation→ vLLM بخير؛ SGLang أفضل قليلا على التخزين.
Long context (128K+)→ vLLM + إعادة التعبئة المزروعة؛ SGLang + KV المرتبة.
فخّ الصيانة TGI
دخلت Hugging Face TGI وضع الصيانة 11 ديسمبر 2025 فقط تصحيحات الأخطاء في المستقبل. تاريخيا: قابلية مراقبة على المستوى العالي ، أفضل في الفئة HF-التنمية التكامل (بطاقات النموذج ، أدوات السلامة) ، قليلاً خلف vLLM على الانتقال الخام.
بالنسبة للمشاريع الجديدة في عام 2026: الافتراض بعيدا عن TGI. يمكن استمرار نشر TGI الموجودة ولكن يجب أن تنتقل في نهاية المطاف. SGLang و vLLM هي الافتراضات الأكثر أمانا.
نمط خط الأنابيب
Dev (Ollama) → staging (llama.cpp) → prod (vLLM). تأخذ المحركات تنسيقات وزن مختلفة GGUF لعائلة llama.cpp ، HF safetensors لمحركات GPU بحيث يمكن أن يكون تحويل النمط بين المراحل. يقوم المهندسون بالتكرار بسرعة على أجهزة الكمبيوتر المحمولة. تعكس المرايا المرحلة كمية الإنتاج.
تحذير أولاما
أولاما عظيمة لـ dev. لا تناسب الإنتاج المشترك: إضافة التسلسلات HTTP إلى التكلفة العليا، وإدارة التزامن أبسط من vLLM، تأخيرات دعم OpenTelemetry. استخدم أولاما حيث يضيء مستخدم واحد، أوامر واحدة والتحول إلى vLLM للمشاركة.
المضيف الذاتي مقابل المدير هو قرار منفصل
المرحلة 17 · 01 (مدارات المعدلات المضخمة) · 02 (مواقع الإضفاء) تغطية إدارة. هذا الدروس يفترض أنك قررت بالفعل استضافة الذات. أسباب الاستضافة الذاتية: إقامة البيانات، تحسينات مخصصة، امتلاك التكلفة الإجمالية على النطاق، نموذج النطاق غير متوفر على المضيف.
أرقام يجب أن تتذكر
- وضع الصيانة TGI: 11 ديسمبر 2025.
- vLLM v0.15.1: فبراير 2026; PyTorch 2.10؛ دعم بلاكويل SM120.
- أثر إنتاج SGLang: 400،000+ GPU.
- فجوة التوصيل في Ollama مقابل llama.cpp: 15-30% أبطأ؛ 3x تحت الحمل الإضافي.
استخدمها
code/main.pyهو المشي في شجرة القرار: مع إعطاء الأجهزة + الحجم + عبء العمل، يختار المحرك ويوضح السبب.
أرسله
هذا الدرس يُنتجoutputs/skill-engine-picker.mdوبالنظر إلى القيود، يختار محركاً ويكتب خطة الهجرة
التمارين
- أركض
code/main.pyمع أجهزة / حجم / عبء العمل الخاص بك. هل الخروج يطابق بديهيتك؟ - إنفرانتيك 12 H100s و 8 MI300X AMD أي محرك؟ لماذا ترت-LLM خارج الطاولة؟
- فريق يريد استخدام TGI في عام 2026 لأن "هذا ما نعرفه".
- أولاما ديف إلى vLLM prod: ما هي التغييرات في الكمية، التكوين، واللاحظية؟
- منتج RAG مع طول المرفق الأول P99 8K واستخدام عالي بين المستأجرين. اختيار محرك ووضعها مع المرحلة 17 · 11 + 18.
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| llama.cpp | "the CPU one" | Widest model support, fastest on CPU |
| Ollama | "the laptop one" | One-command install, dev-grade throughput |
| TGI | "HF's serving" | Maintenance mode since Dec 2025 |
| vLLM | "the default" | Broad production baseline 2026 |
| SGLang | "the agentic one" | Prefix-heavy, RadixAttention |
| TRT-LLM | "NVIDIA-locked" | Blackwell throughput leader, NVIDIA only |
| GGUF | "llama.cpp format" | Bundled K-quant variants |
| Production-stack | "vLLM K8s" | Phase 17 · 18 reference deployment |
| Pipeline pattern | "dev→stage→prod" | Ollama → llama.cpp → vLLM; weight formats differ per engine |
المزيد من القراءة
- AI Made Tools — vLLM vs Ollama vs llama.cpp vs TGI 2026
- Morph — llama.cpp vs Ollama 2026
- n1n.ai — Comprehensive LLM Inference Engine Comparison
- PremAI — 10 Best vLLM Alternatives 2026
- TGI maintenance announcement إطلاق الملاحظات.
- vLLM v0.15.1 release notes
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.