एजेंट अवलोकनः लैंगफ्यूज, फीनिक्स, ओपिक
Type: Learn
Languages: Python (stdlib)
Prerequisites: Phase 14 · 23 (OTel GenAI)
Time: ~45 minutes
सीखने के लक्ष्य
- तीन शीर्ष ओपन-सोर्स एजेंट अवलोकन प्लेटफार्मों और उनके लाइसेंस का नाम दें।
- यह अलग करें कि प्रत्येक में क्या सबसे मजबूत हैः लैंगफ्यूज (प्रोम्प्ट एमजीएमटी + सत्र), फिनिक्स (RAG + ऑटो-इंस्ट्रूमेंटेशन), ओपिक (अनुकूलन + गार्डरेल्स) ।
- बताएं कि 2026 तक 89% संगठनों में एजेंटों की निगरानी क्यों की जा सकती है।
- LLM-जज्यूज मूल्यांकन के साथ एक stdlib ट्रैक-टू-डैशबोर्ड पाइपलाइन लागू करें।
समस्या
OTel GenAI (Lection 23) आपको योजना देता है। आपको अभी भी उस प्लेटफॉर्म की आवश्यकता है जो स्पैन को निगलता है, मूल्यांकन चलाता है, त्वरित संस्करणों को संग्रहीत करता है, और पृष्ठों पर प्रतिगमन करता है। तीन प्रतियोगियों में से प्रत्येक जीवन चक्र के विभिन्न हिस्सों पर जोर देता है।
अवधारणा
लैंगफ्यूज (एमआईटी)
- 6M+ SDK स्थापना / महीने, 19k+ GitHub सितारों।
- विशेषताएंः ट्रैकिंग, संस्करण + खेल मैदान के साथ त्वरित प्रबंधन, मूल्यांकन (LLM-जैसे-जिज, उपयोगकर्ता प्रतिक्रिया, कस्टम), सत्र प्रतिस्थापन।
- जून 2025: पूर्व में वाणिज्यिक मॉड्यूल (LLM-as-a-judge, टिप्पणी कतारें, शीघ्र प्रयोग, खेल मैदान) MIT के तहत ओपन सोर्स किए गए।
- सबसे मजबूतः अंत-से-अंत अवलोकनशीलता के साथ तंग शीघ्र-प्रबंधन लूप।
एरिज़ फीनिक्स (ईलास्टिक लाइसेंस 2.0)
- अधिक गहन एजेंट-विशिष्ट मूल्यांकनः निशान क्लस्टरिंग, विसंगतियों का पता लगाना, आरएजी के लिए पुनर्प्राप्ति प्रासंगिकता।
- मूल ओपन इन्फरेन्स ऑटो-इंस्ट्रूमेंटेशन।
- उत्पादन के लिए प्रबंधित एरीज़ एएक्स के साथ जोड़े।
- कोई शीघ्र संस्करण नहीं व्यापक प्लेटफार्मों के साथ एक बहाव/व्यवहार-प्रतिगमन उपकरण के रूप में तैनात।
- सबसे मजबूत के लिएः RAG प्रासंगिकता, व्यवहारिक बहाव, विसंगतियों का पता लगाने.
उपग्रह ओपिक (अपाचे 2.0)
- ए/बी प्रयोगों के माध्यम से स्वचालित शीघ्र अनुकूलन।
- सुरक्षा पट्टी (पीआईआई को संपादित करना, स्थानीय प्रतिबंध)
- एलएलएम-जज hallucination पता लगाने.
- Comet के अपने माप से बेंचमार्कः 23.44s vs Langfuse 327.15s में Opik लॉग + evals (~14x gap) विक्रेता बेंचमार्क को दिशात्मक मानते हैं।
- सबसे मजबूत के लिएः अनुकूलन लूप, स्वचालित प्रयोग, गार्डरेल प्रवर्तन.
उद्योग के आंकड़े
मैक्सिम (2026 फील्ड एनालिसिस): 89% संगठनों में एजेंटों की निगरानी की क्षमता है; गुणवत्ता के मुद्दे उत्पादन में सबसे बड़ी बाधा हैं (32% उत्तरदाताओं ने उन्हें उद्धृत किया) ।
एक चुनना
| Need | Pick |
|---|---|
| All-in-one with prompt management | Langfuse |
| Deep RAG evaluation + drift | Phoenix |
| Automated optimization + guardrails | Opik |
| Open licensing, no ELv2 | Langfuse (MIT) or Opik (Apache 2.0) |
| Datadog / New Relic integration | Any — they all export OTel |
जहां यह पैटर्न गलत हो जाता है
- No eval strategy.बिना मूल्यांकन के ट्रैक करना सिर्फ महंगा लॉगिंग है।
- Self-rolled LLM-judge without grounding.आलोचनात्मक पैटर्न (पाठ 05) लागू होता है न्यायाधीशों को तथ्यों की सत्यापन के लिए बाहरी उपकरणों की आवश्यकता होती है।
- Prompt versions not tied to traces.जब प्रूड रिग्रेस होता है, तो आप उस संकेत को काट नहीं सकते जो इसे पैदा करता है।
इसे बनाओ
code/main.pyएक स्टडीलिब ट्रैस कलेक्टर + एलएलएम-जजज मूल्यांकनकर्ता को लागू करता हैः
- GenAI के आकार के स्पैन का सेवन करें।
- सत्र द्वारा समूह, टैग विफल रन (गार्ड्रेल यात्राएं, कम आत्मविश्वास मूल्यांकन) ।
- एक स्क्रिप्ट LLM-जिज जो एक rubric पर एजेंट प्रतिक्रियाओं को स्कोर करता है।
- डैशबोर्ड जैसा सारांशः विफलता दर, शीर्ष विफलता कारण, मूल्यांकन स्कोर वितरण।
इसे चलाओः
python3 code/main.pyआउटपुटः प्रति सत्र मूल्यांकन स्कोर और विफलता वर्गीकरण जो लैंगफ्यूज/फीनिक्स/ओपिक दिखाता है उससे मेल खाता है।
इसका प्रयोग करें
- Langfuseस्वयं होस्ट या क्लाउड; ओटीएल या उनके एसडीके के माध्यम से वायर।
- Arize Phoenixस्व-होस्ट; ऑटो-इंस्ट्रूमेंट ओपनइंफरेन्स।
- Comet Opikस्व-होस्ट या क्लाउड; स्वचालित अनुकूलन लूप।
- Datadog LLM Observabilityमिश्रित ऑपरेशन + एमएल टीमों के लिए जो पहले से ही Datadog चला रहे हैं।
इसे भेजें
outputs/skill-obs-platform-wiring.mdएक मंच चुनता है और मौजूदा एजेंट में ट्रैक + evals + शीघ्र संस्करणों के तारों।
व्यायाम
- Langfuse बादल (मुक्त स्तर) में OTel के निशान का एक सप्ताह निर्यात. कौन से सत्र विफल रहे?
- अपने डोमेन के लिए एक LLM-जजिस rubric लिखें (वास्तविकता, स्वर, दायरा अनुपालन) 50 निशान पर परीक्षण करें।
- फीनिक्स के निशान क्लस्टर के साथ लैंगफ्यूज त्वरित संस्करण की तुलना करें। जो आपको बताता है कि सबसे तेजी से क्या टूट गया?
- ओपिक के गार्डरेल दस्तावेज पढ़ें, अपने एजेंटों में से एक को एक पीआईडी संपादन गार्डरेल वायर.
- अपने शरीर पर तीनों को बेंचमार्क करें, विक्रेता द्वारा प्रकाशित संख्याओं को अनदेखा करें, अपना खुद का मापें।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| Tracing | "Spans collector" | Ingest OTel / SDK spans; index by session |
| Prompt management | "Prompt CMS" | Versioned prompts tied to traces |
| LLM-as-judge | "Automated eval" | Separate LLM scores agent output against a rubric |
| Session replay | "Trace playback" | Step through past runs for debugging |
| RAG relevancy | "Retrieval quality" | Does the retrieved context match the query |
| Trace clustering | "Behavioral grouping" | Cluster similar runs for drift detection |
| Guardrail enforcement | "Policy at log time" | PII/toxicity/scope checks on logged content |
आगे पढ़ना
- Langfuse docs ट्रैकिंग, मूल्यांकन, शीघ्र एमजीएमटी
- Arize Phoenix docs ऑटो-इंस्ट्रूमेंटेशन, ड्रिफ्ट
- Comet Opik अनुकूलन + गार्डरेल्स
- OpenTelemetry GenAI semantic conventions योजना तीनों खपत
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.