Phase 14: Agent Engineering

الملاحظة العملية: لانغفوز، فينيكس، أوبيك

ثلاث منصات مراقبة وكلاء مفتوحة المصدر تهيمن على عام 2026. لانغفوز (MIT) 6 ملايين إعداد / شهر ، تتبع + إدارة الاستعلام + تقييمات + إعادة إعادة إعادة جلسة. أريز فينيكس (Elastic 2.0) تقييمات عميقة محددة للوكلاء ، أهمية RAG ، أوتو-استعلام OpenInference. كوميت أوبيك (أباتشي 2.0) تحسين الاستعلام الآلي ، حواف ، اكتشاف الهلوسة القضائية LLM.

Type: Learn

Languages: Python (stdlib)

Prerequisites: Phase 14 · 23 (OTel GenAI)

Time: ~45 minutes

أهداف التعلم

  • أسمائهم ثلاثة أفضل منصات مراقبة وكلاء مفتوح المصدر و تراخيصهم.
  • تمييز ما هو أقوى في كل واحد منهم: Langfuse (أقسام mgmt + فورية) ، فينيكس (RAG + أدوات تلقائية) ، أوبيك (التحسين + الحواجز).
  • شرح لماذا 89% من المنظمات تقرير وجود الملاحظة العاملة في مكان بحلول عام 2026.
  • تنفيذ خط أنابيب التتبع إلى لوحة المعلومات مع تقييم القاضي الجامعي.

المشكلة

يتيح لك OTel GenAI (دروس 23) النظام التخطيطي. لا تزال بحاجة إلى منصة تتناول المدة، وتشغيل التقييمات، وتخزين الإصدارات السريعة، وتسطح التراجع. كل من المتنافسين الثلاثة يؤكد على أجزاء مختلفة من دورة الحياة.

المفهوم

لاندفوز (MIT)

  • 6M + SDK تثبيت / شهر، 19k + نجوم GitHub.
  • الميزات: تتبع، إدارة السرعة مع إصدار + ملعب اللعب، التقييمات (LLM- كقاضي، ردود الفعل المستخدمة، المخصصة) ، إعادة جلسات.
  • يونيو 2025: وحدات تجارية سابقة (LLM-as-a-judge، صفوف التعليقات، تجارب سريعة، ساحة اللعب) مفتوحة المصدر تحت إطار MIT.
  • أقوى لل: قابلية مراقبة من نهاية إلى نهاية مع حلقة ضيقة لإدارة التسجيل.

أريز فينيكس (مرخصة مرنة 2.0)

  • تقييم أكثر عمقاً للاجهزة: تجميع الأثر، اكتشاف الانحرافات، أهمية الاستعراض لـ RAG.
  • أداة ذاتية مفتوحة محلية
  • أزواج مع أريز إكس المدارة للإنتاج.
  • لا يوجد إصدار سريع يُوضع كوسيلة للتحرك/التراجع السلوكي إلى جانب منصات أوسع.
  • أقوى من أجل: ملاءمة الجرعات السريعة، التحرك السلوكي، اكتشاف الانحرافات.

المذنب (أوبيك) (أباتشي 2.0)

  • تحسينات فورية تلقائية من خلال تجارب A / B.
  • الحراسة (تحرير المعلومات الشخصية، القيود المحلية).
  • الاكتشاف الهلوسة من القاضي
  • مقياسات المقاييس من قياس الكوميتا: سجلات أوبيك + تقييمات في 23.44s مقابل Langfuse 327.15s (~ 14x الفجوة) تأخذ مقاييس البائع على أنها اتجاهية.
  • أقوى من أجل: حلقة تحسين، التجربة الآلية، إنفاذ الحواجز

بيانات الصناعة

في ماكسم (2026 تحليل ميدان): 89% من المنظمات لديها قابلية للملاحظة من قبل العاملين؛ قضايا الجودة هي العائق الأعلى في الإنتاج (32% من المشاركين يشاركون إليها).

أختار واحدة

NeedPick
All-in-one with prompt managementLangfuse
Deep RAG evaluation + driftPhoenix
Automated optimization + guardrailsOpik
Open licensing, no ELv2Langfuse (MIT) or Opik (Apache 2.0)
Datadog / New Relic integrationAny — they all export OTel

حيث يذهب هذا النمط خطأ

  • No eval strategy.التتبع دون تقييم هو مجرد التقطيع الثمينة.
  • Self-rolled LLM-judge without grounding.يطبق نمط النقدي (الدرس 05) يحتاج القضاة إلى أدوات خارجية للتحقق من الحقائق.
  • Prompt versions not tied to traces.عندما يتراجع الإصابة، لا يمكنك أن تقطع إلى الإشارة التي تسببت بها.

بناءها

code/main.pyينفذ مستخدماً لجمع الأثر في مجال التدريب + تقييم القاضي في مجال القانون القانوني:

  • إبتلاع المفاصل على شكل GenAI
  • مجموعة حسب الجلسة، علامة فشل الركضات (رحلات الحراسة، تقييمات منخفضة الثقة).
  • قاضي ماجستير في العلوم الذي يقرر استجابات العملاء على عنوان
  • ملخص مثل لوحة التحكم: معدل الفشل، أهم أسباب الفشل، توزيع درجة التقييم.

إشغله

python3 code/main.py

الناتج: درجات تقييم لكل جلسة وتصنيف الفشل مما يطابق ما ستظهر به Langfuse/Phoenix/Opik.

استخدمها

  • Langfuseالمضيف الذاتي أو السحابة؛ عبر OTel أو SDK الخاص بهم.
  • Arize Phoenixالمضيفة الذاتية؛ الأداة الذاتية OpenInference.
  • Comet Opikالمضيف الذاتي أو السحابة؛ حلقة تحسين آلية.
  • Datadog LLM Observabilityلفرق العمليات المختلطة + الملفات التي تدير بالفعل Datadog.

أرسله

outputs/skill-obs-platform-wiring.mdيختار منصة ويحول التتبع + التقييم + الإصدارات السريعة إلى وكيل موجود.

التمارين

  1. إصدار أسبوع من آثار OTel إلى سحابة Langfuse (مستوى مجاني) أي جلسات فشلت؟ لماذا؟
  2. اكتب عنوان القاضي في القانون لسيطرتك (صوابية حقيقية، النغمة، الامتثال للمجال) اختبار على 50 علامة.
  3. مقارنة إصدارات (لانغفوز) السريعة مع مجموعة (فينكس) التي تخبرك ما الذي سينتهي أسرع؟
  4. اقرأ وثائق حراسة أوبيك، و قم بتوصيل حراسة تحرير المعلومات إلى أحد عملائك
  5. قم بتقييم ثلاثة في جسمك، تجاهل الأرقام المنشورة من البائع، وقاس نفسك.

الشروط الرئيسية

TermWhat people sayWhat it actually means
Tracing"Spans collector"Ingest OTel / SDK spans; index by session
Prompt management"Prompt CMS"Versioned prompts tied to traces
LLM-as-judge"Automated eval"Separate LLM scores agent output against a rubric
Session replay"Trace playback"Step through past runs for debugging
RAG relevancy"Retrieval quality"Does the retrieved context match the query
Trace clustering"Behavioral grouping"Cluster similar runs for drift detection
Guardrail enforcement"Policy at log time"PII/toxicity/scope checks on logged content

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.