الملاحظة العملية: لانغفوز، فينيكس، أوبيك
Type: Learn
Languages: Python (stdlib)
Prerequisites: Phase 14 · 23 (OTel GenAI)
Time: ~45 minutes
أهداف التعلم
- أسمائهم ثلاثة أفضل منصات مراقبة وكلاء مفتوح المصدر و تراخيصهم.
- تمييز ما هو أقوى في كل واحد منهم: Langfuse (أقسام mgmt + فورية) ، فينيكس (RAG + أدوات تلقائية) ، أوبيك (التحسين + الحواجز).
- شرح لماذا 89% من المنظمات تقرير وجود الملاحظة العاملة في مكان بحلول عام 2026.
- تنفيذ خط أنابيب التتبع إلى لوحة المعلومات مع تقييم القاضي الجامعي.
المشكلة
يتيح لك OTel GenAI (دروس 23) النظام التخطيطي. لا تزال بحاجة إلى منصة تتناول المدة، وتشغيل التقييمات، وتخزين الإصدارات السريعة، وتسطح التراجع. كل من المتنافسين الثلاثة يؤكد على أجزاء مختلفة من دورة الحياة.
المفهوم
لاندفوز (MIT)
- 6M + SDK تثبيت / شهر، 19k + نجوم GitHub.
- الميزات: تتبع، إدارة السرعة مع إصدار + ملعب اللعب، التقييمات (LLM- كقاضي، ردود الفعل المستخدمة، المخصصة) ، إعادة جلسات.
- يونيو 2025: وحدات تجارية سابقة (LLM-as-a-judge، صفوف التعليقات، تجارب سريعة، ساحة اللعب) مفتوحة المصدر تحت إطار MIT.
- أقوى لل: قابلية مراقبة من نهاية إلى نهاية مع حلقة ضيقة لإدارة التسجيل.
أريز فينيكس (مرخصة مرنة 2.0)
- تقييم أكثر عمقاً للاجهزة: تجميع الأثر، اكتشاف الانحرافات، أهمية الاستعراض لـ RAG.
- أداة ذاتية مفتوحة محلية
- أزواج مع أريز إكس المدارة للإنتاج.
- لا يوجد إصدار سريع يُوضع كوسيلة للتحرك/التراجع السلوكي إلى جانب منصات أوسع.
- أقوى من أجل: ملاءمة الجرعات السريعة، التحرك السلوكي، اكتشاف الانحرافات.
المذنب (أوبيك) (أباتشي 2.0)
- تحسينات فورية تلقائية من خلال تجارب A / B.
- الحراسة (تحرير المعلومات الشخصية، القيود المحلية).
- الاكتشاف الهلوسة من القاضي
- مقياسات المقاييس من قياس الكوميتا: سجلات أوبيك + تقييمات في 23.44s مقابل Langfuse 327.15s (~ 14x الفجوة) تأخذ مقاييس البائع على أنها اتجاهية.
- أقوى من أجل: حلقة تحسين، التجربة الآلية، إنفاذ الحواجز
بيانات الصناعة
في ماكسم (2026 تحليل ميدان): 89% من المنظمات لديها قابلية للملاحظة من قبل العاملين؛ قضايا الجودة هي العائق الأعلى في الإنتاج (32% من المشاركين يشاركون إليها).
أختار واحدة
| Need | Pick |
|---|---|
| All-in-one with prompt management | Langfuse |
| Deep RAG evaluation + drift | Phoenix |
| Automated optimization + guardrails | Opik |
| Open licensing, no ELv2 | Langfuse (MIT) or Opik (Apache 2.0) |
| Datadog / New Relic integration | Any — they all export OTel |
حيث يذهب هذا النمط خطأ
- No eval strategy.التتبع دون تقييم هو مجرد التقطيع الثمينة.
- Self-rolled LLM-judge without grounding.يطبق نمط النقدي (الدرس 05) يحتاج القضاة إلى أدوات خارجية للتحقق من الحقائق.
- Prompt versions not tied to traces.عندما يتراجع الإصابة، لا يمكنك أن تقطع إلى الإشارة التي تسببت بها.
بناءها
code/main.pyينفذ مستخدماً لجمع الأثر في مجال التدريب + تقييم القاضي في مجال القانون القانوني:
- إبتلاع المفاصل على شكل GenAI
- مجموعة حسب الجلسة، علامة فشل الركضات (رحلات الحراسة، تقييمات منخفضة الثقة).
- قاضي ماجستير في العلوم الذي يقرر استجابات العملاء على عنوان
- ملخص مثل لوحة التحكم: معدل الفشل، أهم أسباب الفشل، توزيع درجة التقييم.
إشغله
python3 code/main.pyالناتج: درجات تقييم لكل جلسة وتصنيف الفشل مما يطابق ما ستظهر به Langfuse/Phoenix/Opik.
استخدمها
- Langfuseالمضيف الذاتي أو السحابة؛ عبر OTel أو SDK الخاص بهم.
- Arize Phoenixالمضيفة الذاتية؛ الأداة الذاتية OpenInference.
- Comet Opikالمضيف الذاتي أو السحابة؛ حلقة تحسين آلية.
- Datadog LLM Observabilityلفرق العمليات المختلطة + الملفات التي تدير بالفعل Datadog.
أرسله
outputs/skill-obs-platform-wiring.mdيختار منصة ويحول التتبع + التقييم + الإصدارات السريعة إلى وكيل موجود.
التمارين
- إصدار أسبوع من آثار OTel إلى سحابة Langfuse (مستوى مجاني) أي جلسات فشلت؟ لماذا؟
- اكتب عنوان القاضي في القانون لسيطرتك (صوابية حقيقية، النغمة، الامتثال للمجال) اختبار على 50 علامة.
- مقارنة إصدارات (لانغفوز) السريعة مع مجموعة (فينكس) التي تخبرك ما الذي سينتهي أسرع؟
- اقرأ وثائق حراسة أوبيك، و قم بتوصيل حراسة تحرير المعلومات إلى أحد عملائك
- قم بتقييم ثلاثة في جسمك، تجاهل الأرقام المنشورة من البائع، وقاس نفسك.
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| Tracing | "Spans collector" | Ingest OTel / SDK spans; index by session |
| Prompt management | "Prompt CMS" | Versioned prompts tied to traces |
| LLM-as-judge | "Automated eval" | Separate LLM scores agent output against a rubric |
| Session replay | "Trace playback" | Step through past runs for debugging |
| RAG relevancy | "Retrieval quality" | Does the retrieved context match the query |
| Trace clustering | "Behavioral grouping" | Cluster similar runs for drift detection |
| Guardrail enforcement | "Policy at log time" | PII/toxicity/scope checks on logged content |
المزيد من القراءة
- Langfuse docs تتبع، تقييمات، إرسال المعلومات
- Arize Phoenix docs الاستعمال الذاتي، التجول
- Comet Opik التحسين + الحراسة
- OpenTelemetry GenAI semantic conventions النظام كل ثلاثة استهلك
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.