Ingénierie du chaos pour la production de LLM
Type: Learn
Languages: Python (stdlib, toy chaos experiment runner)
Prerequisites: Phase 17 · 23 (SRE for AI), Phase 17 · 13 (Observability)
Time: ~60 minutes
Objectifs d'apprentissage
- Nombre des cinq prérequis de l'ingénierie du chaos (SLI/SLO, observabilité, réouverture, runbooks, on-call) et explique pourquoi sauter n'importe quelle pratique est une violation de la pratique.
- Décrire les quatre plans (contrôle, cible, sécurité, observabilité) et la boucle de rétroaction dans le SLO.
- Enumérez cinq expériences spécifiques à la LLM (surchargement de mémoire, défaillance du réseau, panne du fournisseur, prompt malformé, tempête d'évacuation de KV).
- Choisissez un outil Harness, LitmusChaos, Chaos Mesh donné pile.
Le problème
Les stacks LLM ajoutent de nouveaux modes d'échec. Un prompt de jeton 4K avec un caractère toxique arrête le jeton pendant 12 secondes. Un fournisseur en amont 429s; vos entrées de retrait; vos OOMs de service sur la simultanée amplifiée à la répétition. Une tempête d'évacuation de cache KV sous charge de débordement provoque des cascades de remplissage qui saturent le calcul.
Aucun de ces tests n'apparaît dans les tests unitaires.
Le concept
Préalabilités
Ne provoquez pas de chaos dans la production sans:
- SLI/SLO définir des indicateurs et des objectifs de niveau de service.
- Observability Traces, métriques, journaux, câblées à des tableaux de bord.
- Automated rollback Phase 17 · 20 - Réouverture du programme de politique de réforme.
- Runbooks structurée, phase 17 · 23.
- On-call quelqu'un pour répondre.
Le manque de tout moyen, le chaos devient un véritable incident.
Quatre avions + rétroaction
Control plane programmeur d'expériences (flux de travail Litmus, programme Chaos Mesh, interface utilisateur Harness).
Target plane services, capsules, nœuds, équilibrateurs de charge, stockage de données.
Safety plane commutateur de compression, fenêtres de suppression, limites de rayon d'explosion, portes de budget d'erreur.
Observability plane des mesures normales + corrélation trace-ID pour distinguer les défaillances induites par le chaos des défaillances naturelles.
Feedback loop Les résultats se rapportent à l'ajustement du SLO, aux mises à jour des coordonnées, aux corrections de code.
Les barreaux sont obligatoires
- Burn-rate alert: l'expérience de pause si le budget d'erreur quotidien dépasse le double prévu.
- Suppression windows: silence des alertes non expérimentales dans le rayon d'explosion pendant l'expérience.
- Trace-ID correlation: toutes les erreurs induites par l'expérience sont marquées de manière à pouvoir être déduites sur appel.
Cinq expériences spécifiques à la LLM
- Memory overload forcer une tempête de préemption de cache KV en envoyant des requêtes de long contexte avec une grande simultanéité.
- Network failure coupure de connectivité entre la passerelle d'inférence et le fournisseur.
- Provider outage simulation 100% 429 de OpenAI. Observez: le routage fait-il une défaillance vers Anthropic? (phase 17 · 16, 19)
- Malformed prompt injecter une charge utile pour l'installation de jetons (par exemple, unicode profondément niché, un codepoint UTF-8 énorme).
- KV eviction storm expulsion forcée par saturation du budget de bloc VLLM. Observez: le LMCache se rétablit-il ou le service se dégrade-t-il?
Cadence
- Weekly petites expériences canaries en mise en scène, peut-être 5% de prod.
- Monthly jour de jeu prévu dans un scénario spécifique; présence entre équipes; post mortem.
- Quarterly Audit de la résilience entre équipes; mise à jour de la carte de la dépendance.
Les outils
- Harness Chaos Engineering commercial; recommandations d'expériences dérivées de l'IA; réduction de l'échelle du rayon d'explosion; intégration des outils MCP.
- LitmusChaos Gradué du CNCF; basé sur le flux de travail Kubernetes.
- Chaos Mesh Sandbox CNCF; style CRD natif des Kubernètes.
- Gremlin commercial; large soutien.
- AWS FIS- Je suis là .Azure Chaos Studio Offres gérées dans le cloud.
Commencez petit
Première expérience: décodez une copie sous un trafic constant, observez le redirigement et la récupération, si cela fonctionne et semble sûr, passez au chaos du réseau.
Première expérience spécifique à la LLM: injecter un fournisseur 429 pendant 5 minutes. Observez le retrait. La plupart des équipes découvrent que leur retrait n'a pas été entièrement testé.
Les chiffres que vous devriez vous rappeler
- Quatre avions: contrôle, cible, sécurité, observabilité.
- Pause de taux de brûlure: 2 fois le budget quotidien prévu.
- Cadence: canary hebdomadaire, jour de jeu mensuel, audit trimestriel.
- Cinq expériences de LLM: mémoire, réseau, fournisseur, prompt malformé, KV tempête.
Utilisez-le
code/main.pyIl simule trois expériences de chaos avec des portes de sécurité, qui pourraient faire trébucher le taux de brûlure.
La faire partir
Cette leçon produit outputs/skill-chaos-plan.md- Compte tenu de sa taille et de sa maturité, il choisit les trois premières expériences et l'outillage.
Exercices
- On court .
code/main.pyQuelle expérience défonce la porte de la vitesse de combustion et pourquoi ? - Conceptez les cinq premières expériences de chaos pour un service RAG basé sur vLLM. Incluez des critères de réussite.
- Votre alerte a interrompu une expérience.
- Discutez si le chaos doit se produire dans la production ou seulement en scène.
- Nombre de trois modes de défaillance spécifiques à la MLL que le chaos du réseau générique ne peut reproduire.
Les termes clés
| Term | What people say | What it actually means |
|---|---|---|
| SLI / SLO | "service targets" | Indicator + objective; required prerequisite |
| Blast radius | "scope" | Set of services / users affected by experiment |
| Burn-rate alert | "budget gate" | Fires when error-budget burn rate > 2x expected |
| Game day | "monthly drill" | Scheduled cross-team chaos exercise |
| LitmusChaos | "CNCF workflow" | Graduated CNCF Kubernetes chaos tool |
| Chaos Mesh | "CNCF CRD" | CNCF sandbox Kubernetes-native chaos |
| Harness CE | "commercial AI-assisted" | Harness chaos with AI recommendations |
| Malformed prompt | "tokenizer bomb" | Input that stalls tokenization |
| KV eviction storm | "preemption cascade" | Mass eviction triggering re-prefills |
Pour en savoir plus
- DevSecOps School — Chaos Engineering 2026 Guide
- Ankush Sharma — Observability for LLMs (book)
- LitmusChaos (CNCF)
- Chaos Mesh (CNCF)
- Harness Chaos Engineering
- AWS FIS
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.