Sélection de serveur auto-hébergé Moteur adapté au matériel et à l'échelle
Type: Learn
Languages: Python (stdlib, engine-decision tree walker)
Prerequisites: All Phase 17 lessons covering engines (04, 06, 07, 09, 18)
Time: ~45 minutes
Objectifs d'apprentissage
- Choisissez un moteur donné (CPU / AMD / NVIDIA Hopper / Blackwell), l'échelle (1 utilisateur / 100 / 10,000) et la charge de travail (chat général / agent / long-context).
- Nommez le statut de mode d'entretien TGI 2026 (11 décembre 2025) et pourquoi il fausse les nouveaux projets vers vLLM ou SGLang.
- Décrire le pipeline de développement/étape/production, y compris où une conversion en format GGUF en séfétensors se situe entre les étapes.
- Expliquez pourquoi "CPU-first" pointe vers llama.cpp et "AMD" exclut TRT-LLM.
Le problème
Votre équipe commence un nouveau projet de LLM auto-hébergé. Un ingénieur dit Ollama, un autre dit vLLM, un troisième dit " TGI ne fonctionne pas juste hors de boîte ? " Les trois sont bons pour différents contextes. Aucun n'est bon pour tous.
En 2026, l'arbre de choix compte: le matériel d'abord, la deuxième dimension, la troisième charge de travail.
Le concept
Les cinq moteurs
| Engine | Best for | Notes |
|---|---|---|
| llama.cpp | CPU / edge / minimal deps / widest model support | Fastest on CPU, full control |
| Ollama | Dev laptops, single user, one-command install | 15-30% slower than llama.cpp; 3x prod throughput gap |
| TGI | HF ecosystem, regulated industries | Maintenance mode Dec 11, 2025 |
| vLLM | General-purpose production, 100+ users | Broad production default; v0.15.1 Feb 2026 |
| SGLang | Agentic multi-turn, prefix-heavy workloads | 400,000+ GPUs in production |
Décision de première main sur le matériel
CPU-firstIl fonctionne aussi mais est plus lent. Aucun autre moteur n'est compétitif sur le processeur.
AMD GPU→ vLLM est le chemin le plus soutenu (support ROCm AMD). SGLang fonctionne également. TRT-LLM est verrouillé par NVIDIA, donc il est hors service.
NVIDIA Hopper (H100 / H200)→ VLLM ou SGLang ou TRT-LLM. Les trois sont de premier rang.
NVIDIA Blackwell (B200 / GB200)→ TRT-LLM est le leader du débit (phase 17 · 07). vLLM et SGLang suivent de près.
Apple Silicon (M-series)Il est enveloppé dans le métal.
Décision de deuxième échelle
1 user / local devUne commande, le premier jeton en quelques secondes.
10-100 users / small team→ VLLM à un seul GPU.
100-10k users / production→ vLLM production-stack (phase 17 · 18) ou SGLang.
10k+ users / enterprise→ vLLM production-stack + décomposé (phase 17 · 17) + LMCache (phase 17 · 18).
La troisième décision
General chat / Q&A→ vLLM gagne sur le défaut large.
Agentic multi-turn (tools, planning, memory)→ L'attention radicale de SGLang (phase 17 · 06) est la principale.
RAG with heavy prefix reuse→ SGLang.
Code generation→ VLLM bien; SGLang légèrement mieux sur le cache.
Long context (128K+)→ VLLM + pré-remplissage en morceaux; SGLang + KV en couches.
Le piège de maintenance TGI
Hugging Face TGI est entré en mode maintenance le 11 décembre 2025 seulement les corrections de bugs à l'avenir.
Pour les nouveaux projets en 2026: défaut loin de TGI. Les déploiements existants de TGI peuvent se poursuivre mais devraient éventuellement migrer.
Le modèle du pipeline
Dev (Ollama) → staging (llama.cpp) → prod (vLLM). Les moteurs prennent différents formats de poids GGUF pour la famille llama.cpp, HF safetensors pour les moteurs GPU afin qu'une conversion de format puisse être effectuée entre les étapes. Les ingénieurs itérent rapidement sur les ordinateurs portables; la staging reflète la quantification de la production; prod est la cible de service.
Avertissement d'Olama
Ollama est idéal pour le développement. Il n'est pas idéal pour la production partagée: la sérialisation HTTP Go ajoute des coûts généraux, la gestion de la concurrence est plus simple que vLLM, le support OpenTelemetry est en retard. Utilisez Ollama où il brille un utilisateur, une commande et passez à vLLM pour le partage.
L'hébergement personnel et la gestion sont une décision séparée .
La phase 17 · 01 (hyperscalers gérés), · 02 (plateformes d'inférence) couvre géré. Cette leçon suppose que vous avez déjà décidé d'auto-héberger. Les raisons d'auto-héberger: résidence des données, ajustement personnalisé, propriété totale des coûts à l'échelle, modèle de domaine non disponible sur hébergé.
Les chiffres que vous devriez vous rappeler
- Mode de maintenance TGI: 11 décembre 2025.
- vLLM v0.15.1: février 2026; PyTorch 2.10; support Blackwell SM120.
- L'empreinte de production de SGLang: plus de 400 000 GPU.
- L'écart de débit d'Ollama par rapport à llama.cpp: 15 à 30% plus lent; 3 fois moins de charge de prod.
Utilisez-le
code/main.pyest un marcheur de l'arbre de décision: compte tenu du matériel + de l'échelle + de la charge de travail, il choisit un moteur et explique pourquoi.
La faire partir
Cette leçon produit outputs/skill-engine-picker.mdIl choisit un moteur et écrit le plan de migration.
Exercices
- On court .
code/main.pyLa sortie correspond-elle à votre intuition ? - Votre infra est de 12 H100 et 8 MI300X AMD.
- Une équipe veut utiliser TGI en 2026 parce que "c'est ce que nous savons".
- Ollama dev à vLLM prod: quels changements dans la quantification, la configuration et l'observabilité ?
- Produit RAG avec un préfixe P99 de longueur 8K et une réutilisation élevée entre les locataires.
Les termes clés
| Term | What people say | What it actually means |
|---|---|---|
| llama.cpp | "the CPU one" | Widest model support, fastest on CPU |
| Ollama | "the laptop one" | One-command install, dev-grade throughput |
| TGI | "HF's serving" | Maintenance mode since Dec 2025 |
| vLLM | "the default" | Broad production baseline 2026 |
| SGLang | "the agentic one" | Prefix-heavy, RadixAttention |
| TRT-LLM | "NVIDIA-locked" | Blackwell throughput leader, NVIDIA only |
| GGUF | "llama.cpp format" | Bundled K-quant variants |
| Production-stack | "vLLM K8s" | Phase 17 · 18 reference deployment |
| Pipeline pattern | "dev→stage→prod" | Ollama → llama.cpp → vLLM; weight formats differ per engine |
Pour en savoir plus
- AI Made Tools — vLLM vs Ollama vs llama.cpp vs TGI 2026
- Morph — llama.cpp vs Ollama 2026
- n1n.ai — Comprehensive LLM Inference Engine Comparison
- PremAI — 10 Best vLLM Alternatives 2026
- TGI maintenance announcement notes de délivrance.
- vLLM v0.15.1 release notes
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.