Phase 14: Agent Engineering

एजेंट अवलोकनः लैंगफ्यूज, फीनिक्स, ओपिक

तीन ओपन-सोर्स एजेंट अवलोकन प्लेटफॉर्म 2026 में हावी हैं। लैंगफ्यूज (MIT) 6M+ इंस्टॉल / महीने, ट्रैकिंग + प्रॉम्प्ट मैनेजमेंट + एवलस + सत्र रीप्ले। एरिज़ फ़ीनिक्स (ईलास्टिक 2.0) गहन एजेंट-विशिष्ट मूल्यांकन, आरएजी प्रासंगिकता, ओपनइंफरेन्स ऑटो-इंस्ट्रूमेंटेशन। कॉमेट ओपिक (अपाचे 2.0) स्वचालित प्रॉम्प्ट अनुकूलन, गार्डरेल्स, एलएलएम-ज्यूज हलूसिनेशन डिटेक्शन।

Type: Learn

Languages: Python (stdlib)

Prerequisites: Phase 14 · 23 (OTel GenAI)

Time: ~45 minutes

सीखने के लक्ष्य

  • तीन शीर्ष ओपन-सोर्स एजेंट अवलोकन प्लेटफार्मों और उनके लाइसेंस का नाम दें।
  • यह अलग करें कि प्रत्येक में क्या सबसे मजबूत हैः लैंगफ्यूज (प्रोम्प्ट एमजीएमटी + सत्र), फिनिक्स (RAG + ऑटो-इंस्ट्रूमेंटेशन), ओपिक (अनुकूलन + गार्डरेल्स) ।
  • बताएं कि 2026 तक 89% संगठनों में एजेंटों की निगरानी क्यों की जा सकती है।
  • LLM-जज्यूज मूल्यांकन के साथ एक stdlib ट्रैक-टू-डैशबोर्ड पाइपलाइन लागू करें।

समस्या

OTel GenAI (Lection 23) आपको योजना देता है। आपको अभी भी उस प्लेटफॉर्म की आवश्यकता है जो स्पैन को निगलता है, मूल्यांकन चलाता है, त्वरित संस्करणों को संग्रहीत करता है, और पृष्ठों पर प्रतिगमन करता है। तीन प्रतियोगियों में से प्रत्येक जीवन चक्र के विभिन्न हिस्सों पर जोर देता है।

अवधारणा

लैंगफ्यूज (एमआईटी)

  • 6M+ SDK स्थापना / महीने, 19k+ GitHub सितारों।
  • विशेषताएंः ट्रैकिंग, संस्करण + खेल मैदान के साथ त्वरित प्रबंधन, मूल्यांकन (LLM-जैसे-जिज, उपयोगकर्ता प्रतिक्रिया, कस्टम), सत्र प्रतिस्थापन।
  • जून 2025: पूर्व में वाणिज्यिक मॉड्यूल (LLM-as-a-judge, टिप्पणी कतारें, शीघ्र प्रयोग, खेल मैदान) MIT के तहत ओपन सोर्स किए गए।
  • सबसे मजबूतः अंत-से-अंत अवलोकनशीलता के साथ तंग शीघ्र-प्रबंधन लूप।

एरिज़ फीनिक्स (ईलास्टिक लाइसेंस 2.0)

  • अधिक गहन एजेंट-विशिष्ट मूल्यांकनः निशान क्लस्टरिंग, विसंगतियों का पता लगाना, आरएजी के लिए पुनर्प्राप्ति प्रासंगिकता।
  • मूल ओपन इन्फरेन्स ऑटो-इंस्ट्रूमेंटेशन।
  • उत्पादन के लिए प्रबंधित एरीज़ एएक्स के साथ जोड़े।
  • कोई शीघ्र संस्करण नहीं व्यापक प्लेटफार्मों के साथ एक बहाव/व्यवहार-प्रतिगमन उपकरण के रूप में तैनात।
  • सबसे मजबूत के लिएः RAG प्रासंगिकता, व्यवहारिक बहाव, विसंगतियों का पता लगाने.

उपग्रह ओपिक (अपाचे 2.0)

  • ए/बी प्रयोगों के माध्यम से स्वचालित शीघ्र अनुकूलन।
  • सुरक्षा पट्टी (पीआईआई को संपादित करना, स्थानीय प्रतिबंध)
  • एलएलएम-जज hallucination पता लगाने.
  • Comet के अपने माप से बेंचमार्कः 23.44s vs Langfuse 327.15s में Opik लॉग + evals (~14x gap) विक्रेता बेंचमार्क को दिशात्मक मानते हैं।
  • सबसे मजबूत के लिएः अनुकूलन लूप, स्वचालित प्रयोग, गार्डरेल प्रवर्तन.

उद्योग के आंकड़े

मैक्सिम (2026 फील्ड एनालिसिस): 89% संगठनों में एजेंटों की निगरानी की क्षमता है; गुणवत्ता के मुद्दे उत्पादन में सबसे बड़ी बाधा हैं (32% उत्तरदाताओं ने उन्हें उद्धृत किया) ।

एक चुनना

NeedPick
All-in-one with prompt managementLangfuse
Deep RAG evaluation + driftPhoenix
Automated optimization + guardrailsOpik
Open licensing, no ELv2Langfuse (MIT) or Opik (Apache 2.0)
Datadog / New Relic integrationAny — they all export OTel

जहां यह पैटर्न गलत हो जाता है

  • No eval strategy.बिना मूल्यांकन के ट्रैक करना सिर्फ महंगा लॉगिंग है।
  • Self-rolled LLM-judge without grounding.आलोचनात्मक पैटर्न (पाठ 05) लागू होता है न्यायाधीशों को तथ्यों की सत्यापन के लिए बाहरी उपकरणों की आवश्यकता होती है।
  • Prompt versions not tied to traces.जब प्रूड रिग्रेस होता है, तो आप उस संकेत को काट नहीं सकते जो इसे पैदा करता है।

इसे बनाओ

code/main.pyएक स्टडीलिब ट्रैस कलेक्टर + एलएलएम-जजज मूल्यांकनकर्ता को लागू करता हैः

  • GenAI के आकार के स्पैन का सेवन करें।
  • सत्र द्वारा समूह, टैग विफल रन (गार्ड्रेल यात्राएं, कम आत्मविश्वास मूल्यांकन) ।
  • एक स्क्रिप्ट LLM-जिज जो एक rubric पर एजेंट प्रतिक्रियाओं को स्कोर करता है।
  • डैशबोर्ड जैसा सारांशः विफलता दर, शीर्ष विफलता कारण, मूल्यांकन स्कोर वितरण।

इसे चलाओः

python3 code/main.py

आउटपुटः प्रति सत्र मूल्यांकन स्कोर और विफलता वर्गीकरण जो लैंगफ्यूज/फीनिक्स/ओपिक दिखाता है उससे मेल खाता है।

इसका प्रयोग करें

  • Langfuseस्वयं होस्ट या क्लाउड; ओटीएल या उनके एसडीके के माध्यम से वायर।
  • Arize Phoenixस्व-होस्ट; ऑटो-इंस्ट्रूमेंट ओपनइंफरेन्स।
  • Comet Opikस्व-होस्ट या क्लाउड; स्वचालित अनुकूलन लूप।
  • Datadog LLM Observabilityमिश्रित ऑपरेशन + एमएल टीमों के लिए जो पहले से ही Datadog चला रहे हैं।

इसे भेजें

outputs/skill-obs-platform-wiring.mdएक मंच चुनता है और मौजूदा एजेंट में ट्रैक + evals + शीघ्र संस्करणों के तारों।

व्यायाम

  1. Langfuse बादल (मुक्त स्तर) में OTel के निशान का एक सप्ताह निर्यात. कौन से सत्र विफल रहे?
  2. अपने डोमेन के लिए एक LLM-जजिस rubric लिखें (वास्तविकता, स्वर, दायरा अनुपालन) 50 निशान पर परीक्षण करें।
  3. फीनिक्स के निशान क्लस्टर के साथ लैंगफ्यूज त्वरित संस्करण की तुलना करें। जो आपको बताता है कि सबसे तेजी से क्या टूट गया?
  4. ओपिक के गार्डरेल दस्तावेज पढ़ें, अपने एजेंटों में से एक को एक पीआईडी संपादन गार्डरेल वायर.
  5. अपने शरीर पर तीनों को बेंचमार्क करें, विक्रेता द्वारा प्रकाशित संख्याओं को अनदेखा करें, अपना खुद का मापें।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
Tracing"Spans collector"Ingest OTel / SDK spans; index by session
Prompt management"Prompt CMS"Versioned prompts tied to traces
LLM-as-judge"Automated eval"Separate LLM scores agent output against a rubric
Session replay"Trace playback"Step through past runs for debugging
RAG relevancy"Retrieval quality"Does the retrieved context match the query
Trace clustering"Behavioral grouping"Cluster similar runs for drift detection
Guardrail enforcement"Policy at log time"PII/toxicity/scope checks on logged content

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.