Sélection de la pile d'observabilité du LLM
Type: Learn
Languages: Python (stdlib, toy trace-sampling simulator)
Prerequisites: Phase 17 · 08 (Inference Metrics), Phase 14 (Agent Engineering)
Time: ~60 minutes
Objectifs d'apprentissage
- Distinguer les plateformes de développement (agrégées en valeurs: évaluations + invitations + sessions) des outils de passerelle/télémétrie (seulement traces + métriques).
- Mettez en page six outils majeurs (Langfuse, LangSmith, Phoenix, Arize AX, Helicone, Opik) pour les licences, les prix et les cas d'utilisation des points doux.
- Expliquez le modèle d'enclos OpenTelemetry qui vous permet de combiner un outil de passerelle avec une plateforme d'évaluation distincte.
- Nommez le différenciateur de coûts de 2026 (approche zéro copie d'Arize AX par rapport à l'ingestion monolithique) et indiquez le multiplicateur de 100x approximatif.
Le problème
Vous avez envoyé une fonctionnalité de LLM. Elle fonctionne. Vous n'avez pas de visibilité sur les pannes rapides, les boucles d'outils, les régressions de latence, les pics de coûts ou le taux de succès de la mise en cache rapide. Vous recherchez "l'observabilité de LLM" et obtenez huit outils tous prétendant résoudre le même problème à trois prix différents.
Ils ne résolvent pas le même problème. LangSmith répond: "Pourquoi cette exécution LangGraph a-t-elle échoué?" Phoenix répond: "Mon pipeline RAG dérive-t-elle?" Helicone répond: "Quelle application brûle des jetons?" Langfuse répond: "Peut-on auto-héberger l'ensemble?"
Le choix implique quatre axes: stack (longchain? raw SDK? multi-vendor?), tolérance aux licences (m.t. seulement? élastique OK? fine commerciale?), budget (niveau gratuit? $100/mo? $1000/mo?), et l'hébergeur (deux ?
Le concept
Deux catégories
Development platformsVous pouvez faire des expériences, voir quel prompt a fonctionné, régression d'un nouveau prompt contre d'anciens gagnants.
Gateway/telemetry toolsLes appels d'infrastructure sont des appels prompt, réponse, jetons, latence, modèle, coût. Helicone, SigNoz, OpenLLMetry, Phoenix. Minimaliste. Peut être combiné avec un outil d'évaluation séparé via OpenTelemetry.
Langfuse équilibre de l'OSS
- Licence Apache / MIT; hébergeur automatique via Docker.
- Le niveau gratuit dans le cloud: 50 000 événements par mois.
- Evals, gestion rapide, traces, ensembles de données, couverture raisonnable des quatre fonctionnalités de la plateforme de développement.
- Bon point: vous voulez des fonctionnalités de la classe LangSmith mais vous devez vous héberger ou rester sous licence OSS.
Phoenix (Arize) Télémétrie-première, OpenTélémétrie-native
- Licence élastique 2.0; auto-hébergeur trivial.
- Excellent pour la visualisation RAG et la dérive.
- Non conçu comme un backend de production persistant principalement observable au cours du développement.
- Bon point: développement de pipelines RAG, débogage à dérive, paires avec une passerelle séparée pour la production.
Arize AX le jeu de l'échelle
- Intégration de la mer de données à copie zéro via Iceberg/Parquet.
- Les mathématiques: vous stockez des traces dans votre propre parc sur S3; Arize lit directement.
- Bon point: > 10 millions de traces par jour, lac de données existant, veulent des tableaux de bord spécifiques à la LLM sans tarification Datadog.
LangSmith LangChain/LangGraph d'abord
- Commercial, 39 $ par mois, hébergeur personnel sur Enterprise.
- Le meilleur de sa catégorie pour les piles LangChain et LangGraph.
- Un groupe engagé dans LangChain, prêt à payer.
Helicone minimum viable à base de proxy
- 15 à 30 minutes de configuration en échangeant votre
OPENAI_API_BASEà un proxy de l'hélicone. - Licence MIT; 100 000 requêtes par mois gratuites, payées 20 $ par mois+.
- Inclut le failover, le caching, les limites de tarifs agit également comme une passerelle.
- Moins de profondeur sur les traces d'agent / multi-étape.
- Bon point: démarrage rapide, application à pile unique, besoin de passerelle + observabilité en un.
Opik (Comet) Plateforme de développement OSS
- Apache 2.0, entièrement sous réserve d'exploitation.
- Une caractéristique similaire à Langfuse avec héritage de la comète.
- Les équipes de ML qui sont déjà sur Comet veulent l'observabilité de la LLM dans le même panneau.
SigNoz OpenTelemetry-first APM complet
- Apache 2.0 gère l'APM général plus le LLM via OpenTelemetry.
- Un point positif: une observabilité unifiée entre les services et les appels de LLM.
La colle: OpenTelemetry + conventions sémantiques GenAI
OpenTelemetry a publié des conventions sémantiques de GenAI fin 2025 (gen_ai.system- Je suis là .gen_ai.request.model- Je suis là .gen_ai.usage.input_tokensLes outils qui consomment OTel peuvent interagir.
- Émettez OTel avec les conventions de GenAI à chaque appel de LLM.
- Route vers la passerelle (Helicone / Portkey) pour le quotidien.
- Dual-ship à évaluer la plateforme (Phoenix / Langfuse) pour les régressions.
- Archivage dans le lac de données (Iceberg) pour une analyse à long terme via Arize AX ou DuckDB.
Le piège: instrumentation dans la mauvaise couche
L'instrumentation à l'intérieur de votre framework d'agent (par exemple, l'ajout de traces LangSmith) vous associe à ce framework.
On ne peut pas tout garder.
Pour les demandes de plus de 1 million par jour, la rétention complète coûte plus cher que les appels de LLM. échantillon par règles: 100% d'erreurs, 100% de coûts élevés, 5% de succès.
Les chiffres que vous devriez vous rappeler
- Nuage Langfuse gratuit: 50 000 événements par mois.
- LangSmith: 39 $ par mois.
- Helicone gratuite: 100 000 réactifs par mois.
- Arize AX revendique: ~ 100 fois moins cher que le monolithique à l'échelle.
- Conventions de l'OpenTelemetry GenAI: 2025 navigation, 2026 largement adopté.
Utilisez-le
code/main.pySimulation d'une journée de 1M sur les stratégies de rétention (100% ingestion, prélèvement, prélèvement + erreurs).
La faire partir
Cette leçon produit outputs/skill-observability-stack.md. Compte tenu de la pile, de l'échelle, du budget, de la posture de licence, choisit l'outil (s).
Exercices
- Votre équipe sur LangChain veut une observation auto-hébergée par OSS.
- À 5M traces par jour avec Datadog citées 150K $ par mois, calculer l'équilibre pour Arize AX.
- Conception d'un attribut OpenTelemetry GenAI fixé par la directive de votre organisation devrait être mandaté à chaque appel de LLM.
- Discutez si Phoenix est suffisant pour la production.
- L'hélicone est de 20 ms. à P99 TTFT 300 ms, est-ce acceptable ?
Les termes clés
| Term | What people say | What it actually means |
|---|---|---|
| OpenLLMetry | "OTel for LLMs" | Open-source OpenTelemetry instrumentation for LLMs |
| GenAI conventions | "OTel attributes" | Standard OTel attribute names for LLM calls |
| LangSmith | "LangChain observability" | Commercial platform bundled with LangChain ecosystem |
| Langfuse | "OSS LangSmith" | MIT OSS with similar feature set |
| Phoenix | "Arize dev tool" | OpenTelemetry-native dev/eval platform |
| Arize AX | "scale observability" | Commercial zero-copy Iceberg/Parquet observability |
| Helicone | "proxy observability" | HTTP proxy collecting LLM telemetry + gateway features |
| Opik | "Comet LLM" | Apache 2.0 OSS dev platform from Comet |
| Session replay | "trace rerun" | Replay a full agent session with tool calls |
| Eval | "offline test" | Running candidate model/prompt over labeled dataset |
Pour en savoir plus
- SigNoz — Top LLM Observability Tools 2026
- Langfuse — Arize AX Alternative analysis
- PremAI — Setting Up Langfuse, LangSmith, Helicone, Phoenix
- OpenTelemetry GenAI Semantic Conventions
- Arize Phoenix docs
- Helicone docs
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.