LLM अवलोकनशीलता स्टैक चयन
Type: Learn
Languages: Python (stdlib, toy trace-sampling simulator)
Prerequisites: Phase 17 · 08 (Inference Metrics), Phase 14 (Agent Engineering)
Time: ~60 minutes
सीखने के लक्ष्य
- विकास प्लेटफार्मों (बंडलः evals + prompts + sessions) को गेटवे/टेलीमेट्री टूल (केवल traces + metrics) से अलग करें।
- छह प्रमुख उपकरणों (लैंगफ्यूज, लैंगस्मिथ, फीनिक्स, एरीज़ एएक्स, हेलिकोन, ओपिक) को लाइसेंसिंग, मूल्य निर्धारण और स्वीट-स्पॉट उपयोग मामलों के लिए नक्शा करें।
- OpenTelemetry-गोंद पैटर्न की व्याख्या करें जो आपको एक गेटवे टूल को एक अलग मूल्यांकन मंच के साथ जोड़ने की अनुमति देता है।
- 2026 लागत अंतरक का नाम दें (Arize AX का शून्य प्रतिलिपि दृष्टिकोण बनाम एकाग्र उपभोग) और लगभग 100x गुणक बताएं।
समस्या
आप एक LLM सुविधा भेज दिया है. यह काम करता है. आप कोई दृश्यता है शीघ्र विफलताओं, उपकरण लूप, विलंबता प्रतिगमन, लागत spikes, या शीघ्र कैश हिट दर. आप गूगल "LLM अवलोकन" और प्राप्त आठ उपकरण सभी का दावा करते हैं कि वे तीन अलग-अलग मूल्य बिंदुओं पर एक ही समस्या को हल करते हैं.
वे एक ही समस्या का समाधान नहीं करते हैं। लैंगस्मिथ जवाब देता है "यह लैंगग्राफ रन क्यों विफल रहा है?" फीनिक्स जवाब देता है "क्या मेरी आरएजी पाइपलाइन बह रही है?" हेलिकोन जवाब देता है "कौन सा ऐप टोकन जल रहा है?" लैंगफ्यूज जवाब देता है "क्या मैं पूरी बात को स्वयं होस्ट कर सकता हूं? " विभिन्न उपकरण, विभिन्न दर्शकों।
चयन में चार अक्ष शामिल हैंः स्टैक (लंगचेन? कच्चे एसडीके? मल्टी-वेंडर?), लाइसेंस सहिष्णुता (केवल एमआईटी? लोचदार ठीक? वाणिज्यिक ठीक?), बजट (मुक्त स्तर? $100/mo? $1000/mo?), और स्वयं-होस्ट (क्या करना चाहिए? अच्छा-के लिए? कभी नहीं?
अवधारणा
दो श्रेणियाँ
Development platformsआप प्रयोग चलाते हैं, देखें कि कौन सा प्रॉम्प्ट काम किया, डेटासेट-रिग्रेशन पुराने विजेताओं के खिलाफ एक नया प्रॉम्प्ट। लैंगस्मिथ, लैंगफ्यूज, कॉमेट ओपिक।
Gateway/telemetry toolsउपकरण निष्कर्ष कॉल शीघ्र, प्रतिक्रिया, टोकन, विलंबता, मॉडल, लागत. हेलिकोन, SigNoz, OpenLLMetry, फीनिक्स. न्यूनतम. OpenTelemetry के माध्यम से एक अलग मूल्यांकन उपकरण के साथ संयुक्त किया जा सकता है.
Langfuse OSS संतुलन
- कोर अपाचे / एमआईटी लाइसेंस; डॉकर के माध्यम से स्वयं होस्ट।
- क्लाउड फ्री लेवल: 50 हजार इवेंट्स/महीना. भुगतानः $29/महीना टीम के लिए.
- समता, शीघ्र प्रबंधन, निशान, डेटा सेट. सभी चार डेवलपर मंच सुविधाओं के लिए उचित कवरेज.
- मिठाई का स्थानः आप लैंगस्मिथ क्लास सुविधाएं चाहते हैं लेकिन आपको स्वयं होस्ट करना होगा या ओएसएस लाइसेंस पर रहना होगा।
फ़ीनिक्स (अरीज़) टेलीमेट्री-पहला, ओपनटेलिमेट्री-नेटिव
- लचीला लाइसेंस 2.0; स्व-होस्ट तुच्छ.
- RAG और बहाव दृश्य में उत्कृष्ट. एम्बेडिंग अंतरिक्ष-खारदार भूखंडों के रूप में पहली श्रेणी के जहाज.
- निरंतर उत्पादन बैक-एंड के रूप में डिज़ाइन नहीं किया गया मुख्य रूप से विकास समय में अवलोकन योग्य।
- मिठाई का स्थानः आरएजी पाइपलाइन विकास, ड्रिफ्ट डिबगिंग, उत्पादन के लिए एक अलग गेटवे के साथ जोड़े।
Arize AX पैमाने खेल
- वाणिज्यिक. शून्य प्रतिलिपि डेटा झील के माध्यम से एकीकरण आइसबर्ग / पार्केट.
- एक मोनोलिथिक अवलोकन क्षमता (डाटाडॉग-क्लास) के पैमाने पर ~ 100 गुना सस्ता दावा करता है। गणितः आप अपने स्वयं के पार्केट में S3 पर निशान संग्रहीत करते हैं; एरीज़ सीधे पढ़ता है।
- < 10M ट्रैक/दिन, मौजूदा डेटा झील, बिना Datadog मूल्य निर्धारण के एलएलएम विशिष्ट डैशबोर्ड चाहते हैं।
LangSmith LangChain/LangGraph पहले
- वाणिज्यिक, $ 39 / उपयोगकर्ता / महीने. केवल एंटरप्राइज पर स्व-होस्ट.
- लैंगचेन और लैंगग्राफ स्टैक के लिए सबसे अच्छा। यदि आप दोनों पर नहीं हैं, तो यह कम आकर्षक है।
- मिठाई का स्थानः लैंगचेन के लिए प्रतिबद्ध टीम, भुगतान करने के लिए तैयार।
हेलिकोन प्रॉक्सी आधारित न्यूनतम व्यवहार्य
- अपने आदान-प्रदान से 15-30 मिनट की सेटिंग
OPENAI_API_BASEहेलिकोन प्रॉक्सी के लिए. - MIT लाइसेंस प्राप्त; 100K प्रति माह निःशुल्क, भुगतान $20 प्रति माह +।
- इसमें फेलओवर, कैशिंग, दर सीमाएँ शामिल हैं एक गेटवे के रूप में भी कार्य करता है।
- एजेंट / बहु-चरण निशान पर कम गहराई।
- मीठा स्थानः त्वरित प्रारंभ, एकल-स्टैक ऐप, गेटवे की आवश्यकता + एक में अवलोकनशीलता।
ओपिक (कॉमेट) ओएसएस डेवलपमेंट प्लेटफॉर्म
- Apache 2.0, पूरी तरह से OSS.
- कॉमेट विरासत के साथ लैंगफ्यूज के लिए समान विशेषता सेट।
- मिठाई बिंदुः एमएल टीमों पहले से ही धूमकेतु पर, एक ही पैनल में एलएलएम अवलोकन चाहते हैं।
SigNoz ओपनटेलीमेट्री-पहला पूर्ण एपीएम
- Apache 2.0 ओपनटेलीमेट्री के माध्यम से सामान्य एपीएम प्लस एलएलएम को संभालता है।
- स्वीट स्पॉटः सेवाओं और LLM कॉल के बीच एक एकीकृत अवलोकन।
चिपकने वाला: ओपनटेलीमेट्री + जेएनएआई सेमेटिक कन्वेंशन
OpenTelemetry ने 2025 के अंत में GenAI सेमेटिक सम्मेलन प्रकाशित किए (gen_ai.system,gen_ai.request.model,gen_ai.usage.input_tokens) ओटीएल का उपभोग करने वाले उपकरण परस्पर काम कर सकते हैं। उत्पादन पैटर्न उभर रहा हैः
- हर LLM कॉल से GenAI सम्मेलनों के साथ OTel जारी करें।
- दिन-प्रतिदिन के लिए गेटवे (हेलिकोन/पोर्टकी) मार्ग।
- पुनरावृत्ति के लिए दो-शिप-टू-एवल प्लेटफॉर्म (फीनिक्स / लैंगफ्यूज)
- Arize AX या DuckDB के माध्यम से दीर्घकालिक विश्लेषण के लिए डेटा झील (Iceberg) में संग्रह।
जालः गलत परत पर उपकरण बनाना
अपने एजेंट फ्रेमवर्क के अंदर उपकरण (उदाहरण के लिए, लैंगस्मिथ ट्रैक जोड़ना) आपको उस फ्रेमवर्क से जोड़ता है। HTTP / OpenAI-SDK परत (ओपनएलएलएमट्ररी या आपके गेटवे के माध्यम से) पर उपकरण पोर्टेबल है।
नमूनाकरण आप सब कुछ नहीं रख सकते
एक दिन में 1 मिलियन से अधिक अनुरोधों पर, पूर्ण-ट्रैक प्रतिधारण की लागत एलएलएम कॉल की तुलना में अधिक है। नियमों द्वारा नमूनाः 100% त्रुटियां, 100% उच्च लागत, 5% सफलता। हमेशा सामूहिक रखें; लंबे समय तक कच्चे रखें।
संख्याओं को याद रखना चाहिए
- लैंगफ्यूज फ्री क्लाउडः 50 हजार इवेंट/महीना।
- लैंगस्मिथ: $ 39 / उपयोगकर्ता / महीने।
- हेलिकोन मुक्त: 100K req/महीना.
- आरआईज़ एएक्स दावाः मोनोलिथिक पैमाने की तुलना में ~ 100 गुना सस्ता।
- ओपनटेलीमेट्री जनरल एआई सम्मेलनः 2025 शिपिंग, 2026 व्यापक रूप से अपनाया गया।
इसका प्रयोग करें
code/main.pyप्रतिधारण रणनीतियों (100% सेवन, नमूना, नमूना + त्रुटियां) के माध्यम से 1M-ट्रेस दिन का अनुकरण करता है। भंडारण लागत और प्रत्येक के तहत क्या खो गया है।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-observability-stack.md. स्टैक, स्केल, बजट, लाइसेंस की स्थिति को देखते हुए, उपकरण का चयन करें।
व्यायाम
- LangChain पर आपकी टीम ओएसएस स्वयं होस्ट की जा सकती है।
- 5M ट्रैक / दिन के साथ Datadog $ 150K / महीने को उद्धृत करता है, Arize AX के लिए गणना टूटने के लिए।
- एक OpenTelemetry GenAI विशेषता सेट अपने संगठन के दिशानिर्देश हर LLM कॉल पर अनिवार्य करना चाहिए डिजाइन करें।
- यह तर्क दें कि क्या फ़ीनिक्स अकेले उत्पादन के लिए पर्याप्त है।
- हेलिकोन 20ms प्रॉक्सी ओवरहेड है. P99 TTFT 300ms पर, यह स्वीकार्य है? क्या अगर SLA 100ms है?
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| OpenLLMetry | "OTel for LLMs" | Open-source OpenTelemetry instrumentation for LLMs |
| GenAI conventions | "OTel attributes" | Standard OTel attribute names for LLM calls |
| LangSmith | "LangChain observability" | Commercial platform bundled with LangChain ecosystem |
| Langfuse | "OSS LangSmith" | MIT OSS with similar feature set |
| Phoenix | "Arize dev tool" | OpenTelemetry-native dev/eval platform |
| Arize AX | "scale observability" | Commercial zero-copy Iceberg/Parquet observability |
| Helicone | "proxy observability" | HTTP proxy collecting LLM telemetry + gateway features |
| Opik | "Comet LLM" | Apache 2.0 OSS dev platform from Comet |
| Session replay | "trace rerun" | Replay a full agent session with tool calls |
| Eval | "offline test" | Running candidate model/prompt over labeled dataset |
आगे पढ़ना
- SigNoz — Top LLM Observability Tools 2026
- Langfuse — Arize AX Alternative analysis
- PremAI — Setting Up Langfuse, LangSmith, Helicone, Phoenix
- OpenTelemetry GenAI Semantic Conventions
- Arize Phoenix docs
- Helicone docs
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.