Les modes d'échec MAST, pensée de groupe, monoculture, erreurs en cascade
Type: Learn
Languages: Python (stdlib)
Prerequisites: Phase 16 · 13 (Shared Memory), Phase 16 · 14 (Consensus and BFT), Phase 16 · 15 (Voting and Debate Topology)
Time: ~75 minutes
Problème
Les systèmes multi-agents échouent 41 à 86,7% du temps sur des tâches réelles (Cemri et coll. 2025 ont mesuré cela sur 7 MAS open-source). Cela ne peut pas être débogable par " juste ajouter plus d'agents. " Les défaillances ont des causes structurelles. La taxonomie MAST vous donne les catégories. Cette leçon cartographique chaque catégorie à un modèle de détection, de diagnostic et d'atténuation concret afin que les chiffres cessent d'être arbitraires.
La pratique de production 2026 consiste à traiter les modes d'échec comme des entrées de conception.
Concept
Catégories MAST
Specification Problems (41.77% of failures).La tâche de l'agent n'a pas été définie assez étroitement.
- Ambigüité de rôle: deux agents pensent tous deux qu'ils sont le critique.
- La tâche a été sous-déclarée: "récapituler ceci" lorsque l'utilisateur voulait un angle spécifique.
- Critères de réussite implicites: l'agent ne peut pas dire si elle a réussi.
Les atténuations:
- Écrivez des contrats explicites de rôle.
- Avant de commencer, définissez "fait ressemble à X".
- Vérifie des spécifications avant vol: un agent séparé examine la définition de la tâche avant l'expédition.
Coordination Failures (36.94%).Les communications ou les échecs d'état.
Les exemples:
- Deux agents mettent à jour l'état partagé sans synchronisation.
- Message perdu entre les agents (failure de file d'attente, délai de résiliation).
- Départ de l'état: l'agent A pense que la tâche est terminée; l'agent B est toujours en train d'exécuter.
Les atténuations:
- L'état partagé de version avec une synchronisation optimiste.
- Reconnaissance explicite des messages critiques (retrait jusqu'à ce qu'ils soient accrus).
- Les points de contrôle de synchronisation d'état sont périodiques. Détecter la dérive tôt.
Verification Gaps (21.30%).Aucune vérification indépendante des sorties.
Les exemples:
- Un agent prétend réussir, personne ne le confirme.
- Chaque chaîne d'agents fait confiance à la production du précurseur.
- Des tests manquant sur le comportement composé émergent.
Les atténuations:
- Agents de vérification indépendants (leçon 13).
- Contract explicite de remise: "La sortie d'A doit passer le contrôleur C avant que B ne démarre".
- L'enregistrement des résultats pour l'analyse post-hoc.
La famille de la pensée de groupe (arXiv:2508.05687)
Cinq défaillances liées lorsque les agents homogénéisent ou s'imitent:
Monoculture collapse.Les mêmes données de base ou de formation → erreurs corrélatives.
Conformity bias.Les agents s'adaptent au plus fort ou le plus confiant de leurs pairs, même quand ils se trompent.
Deficient ToM.Les agents ne peuvent pas modéliser les croyances de l'autre; la coordination tombe en panne (leçon 18).
Mixed-motive dynamics.Les agents avec des incitations partiellement alignées dérivent vers le compromis, ce qui ne satisfait personne.
Cascading reliability failures.Le modèle d'erreur d'un composant déclenche des modèles d'erreur dans les composants dépendants.
Exemple en cascade la tempête de réessayer
Un modèle classique d'incidents de 2026:
payment service fails 10% of requests
↓
order agent retries payment (exponential backoff but naive)
↓
each retry is a new order-inventory check
↓
inventory service sees 2x normal load
↓
inventory service starts timing out
↓
every order retries inventory check
↓
inventory service sees 10x normal load
↓
cluster goes downLa solution est classique:circuit breakers- lorsque le taux d'erreur en aval dépasse le seuil, courts-circuits avec des résultats en cache ou par défaut.
Les interrupteurs de circuit sont l'une des rares mesures d'atténuation des défaillances multi-agents que vous empruntez directement à des systèmes distribués sans modification.
Poison de mémoire (revisé)
La leçon 13 est que l'hallucination d'un agent devient un fait de mémoire partagée, les agents en aval raisonnent sur le fait empoisonné.
Le symptôme est une dégradation progressive de la précision.
L'atténuation: journal de l'annexe, provenance, vérificateur non rédigé.
STRATUS agents spécialisés pour la détection des défaillances
STRATUS (NeurIPS 2025) rapporte une amélioration de 1,5 fois du succès de l'atténuation lorsque vous déployez:
- Detection agent.Observation des symptômes (contradiction élevée, augmentation des tentatives, dérive de précision).
- Diagnosis agent.Compte tenu des symptômes, il est probable qu'il en résulte une cause profonde de la taxonomie MAST.
- Validation agent.Après l'atténuation, vérifiez si les symptômes disparaissent.
C'est une réponse à des incidents de style SRE, appliquée aux systèmes d'agents.
L'audit en mode défaillance
Une meilleure pratique pour 2026 est un audit annuel (ou par version majeure) en mode défaillance:
- Trace sample.Ramassez 1000 traces d'exécution réelles.
- Categorize.Pour chaque défaillance de la trace, carte des catégories MAST + Groupthink.
- Compute failure-by-category rate.Quelles catégories dominent votre système ?
- Rank mitigations.Quel remède éliminerait le plus de défaillances ?
- Pick 2-3 mitigations.Mise en œuvre; réaudit au trimestre prochain.
La discipline est plus importante que les choix spécifiques. Sans audits, les échecs se mélangent au bruit et ne sont jamais traités de manière systématique.
Quand les systèmes échouent silencieusement
La catégorie de défaillance la plus dangereuse est la catégorie de défaillance de la correction silencieuse. Un système qui échoue fortement (crash, exception, alerte) peut être surveillé. Un système qui produit des sorties plausibles mais erronées ne peut pas être détecté par les journaux d'exception. C'est pourquoi les lacunes de vérification sont la catégorie la plus chère par défaillance même si elles ne sont que 21,30% par compte.
Investir dans:
- Révision humaine basée sur des échantillons.
- Des tests de régression de l'ensemble de données doré.
- Contrôle croisé entre agents sur des résultats importants.
Échec par rapport à échec lent
Certains échecs sont immédiats; certains sont lents. Les échecs immédiats (délais de mise en œuvre, désaccord de schéma, erreur d'auteur) sont peu coûteux à détecter.
Le mouvement d'ingénierie de 2026: les proxies de défaillance lente de l'instrument afin que vous puissiez attraper la dérive avant qu'elle ne devienne une erreur visible.
Faites-le
code/main.pyles implémentations:
FailureTaxonomyclasse les incidents simulés en catégories MAST + Groupthink.CircuitBreakermodèle classique; s'ouvre lorsque le taux d'erreur dépasse le seuil.RetryStormSimulatormontre la défaillance en cascade; allume/éteint le disjoncteur.DetectionAgentmatcheur de symptômes de style STRATUS.
Je vais courir .
python3 code/main.pyRésultats attendus:
- tempête de reprise sans interrupteur: les erreurs d'inventaire explosent (simulées).
- avec interrupteur: plaquette au seuil; réponse en mode dégradé fournie.
- l'agent de détection marque le motif et nomme la catégorie MAST.
Utilisez-le
outputs/skill-mast-auditor.mdeffectue un audit de mode défaillance de type MAST sur un système multi-agents.
La faire partir
Discipline en mode défaillance dans la production:
- MAST audit per quarter.Les catégories changent à mesure que votre système grandit.
- Circuit breakers everywhere.Chaque appel sortant vers un service dépendant.
- Golden datasets.Petit, de haute qualité, vérifié à la main, test de régression contre eux chaque semaine.
- STRATUS trio.Les agents de détection + diagnostic + validation surveillent la production. Commencez par le seul agent de détection; ajoutez le diagnostic lorsque les symptômes sont bruyants.
- Failure budget.Expliquer explicitement le taux de défaillance par catégorie.
Exercices
- On court .
code/main.pyConfirmez que le circuit est coupé, que la tempête est réinitialisée, modifiez le seuil de défaillance et observez le compromis. - La mise en œuvre d'une slow-failure proxyLe taux d'accords entre trois agents parallèles. Lorsqu'il baisse fortement, déclenchez une alerte. Simuler une dérive de monocultures en corrélation progressive des sorties d'agents.
- Lisez Cemri et collègues (arXiv:2503.13657). Choisissez l'un de leurs 7 systèmes MAS et cartez ses 3 principales catégories de défaillance.
- Lisez le document Groupthink (arXiv:2508.05687). Identifiez lequel des cinq modèles est le plus difficile à détecter dans la production.
- Conceptez un trio de détection-diagnostic-validation de style STRATUS pour un système multi-agents spécifique que vous connaissez. Quels symptômes la détection surveille-t-elle? Quelles atténuations le diagnostic recommande-t-il? Comment la validation confirme-t-elle qu'ils fonctionnent?
Les termes clés
| Term | What people say | What it actually means |
|---|---|---|
| MAST | "The 2026 taxonomy" | Cemri 2025; 3 root categories + 14 sub-types of failures. |
| Specification Problem | "Role ambiguity" | Task or role under-defined; agents do not know what to do. |
| Coordination Failure | "State drift" | Communication or sync breakdown between agents. |
| Verification Gap | "No one checked" | Outputs accepted without independent validation. |
| Groupthink family | "Homogeneity failures" | Monoculture, conformity, deficient ToM, mixed-motive, cascading. |
| Monoculture collapse | "Same model, same hallucinations" | Correlated errors from shared base model or training data. |
| Retry storm | "Cascading error amplification" | One failure triggers retries which amplify load downstream. |
| Circuit breaker | "Fail fast on error rate" | Open when error rate exceeds threshold; short-circuit with default. |
| STRATUS | "Incident response trio" | Detection + diagnosis + validation agents. 1.5x mitigation success. |
| Memory poisoning | "Hallucinations propagate" | Shared-memory fact tainted; downstream agents reason on poison. |
Pour en savoir plus
- Cemri et al. — Why Do Multi-Agent LLM Systems Fail? Taxonomie MAST, NeurIPS 2025
- Groupthink failures in multi-agent LLMs monoculture, conformité et taxonomie des cinq familles
- STRATUS — specialized agents for MAS incident response Entrée dans la procédure NeurIPS 2025 (détection + diagnostic + validation)
- Release It! — stability patterns (Nygard) la référence canonique du disjoncteur
- Anthropic — Multi-agent research system Notes de défaillance de la production
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.