SRE لذكاء الاصطناعي استجابة الحوادث متعددة الوكلاء، كتب التشغيل، الكشف التنبؤي
Type: Learn
Languages: Python (stdlib, toy multi-agent incident triage simulator)
Prerequisites: Phase 17 · 13 (Observability), Phase 17 · 24 (Chaos Engineering)
Time: ~60 minutes
أهداف التعلم
- رسم رسم معمارة AI SRE متعددة الوكلاء: المشرف + وكلاء متخصصون (مجلات، مقاييس، كتب التشغيل) + بوابة موافقة البشر.
- شرح لماذا التعويض الآلي ضيق (إعادة تشغيل القنبلة، إعادة نشر) بدلاً من الواسع (خدمة إعادة التصميم).
- أسمائ نمط تقييم معارض (نيو بيرد هوكي): نموذجين متفقين = الثقة؛ عدم الوفاق = التصعيد.
- أذكر نتائج الكشف المبكر بنسبة 89% من معهد MIT والقيود التشغيلية: التنبؤات دون تشغيل هي مجرد لوحة التحكم.
المشكلة
يُطلب من مهندس في المكالمة في الساعة الثالثة صباحاً "معدل الأخطاء العالي في التحقق". يقومون بفحص Datadog، Loki، ثلاثة كتب تشغيل، سجل التنفيذ. بعد 30 دقيقة يدركون أن السبب الجذري هو VLLM OOM من قمة cache KV. يقومون بإعادة تشغيل القنبلة؛ يتم تصفيح الخطأ.
في عام 2026 تكون الدقائق الـ 20 الأولى من هذا التحقيق قابلة للتلقائي. تجميع السجلات حسب الخدمة، والتنسيق مع الانتشارات الأخيرة، والتنسيق مع الكتب القادمة كل ذلك هو استخدام الأدوات RAG +. يمكن للعميل المراقب القيام بتجريب أول مرور وتقديم فرضية قبل فتح البشر Datadog.
إعادة تشغيل القنبلة: آمنة. مجموعة GPU: آمنة إذا سمحت السياسة. إعادة تصميم الخدمة: لا مطلقا. الانضباط يرسم الخط الضيق.
المفهوم
معمارة متعددة الوكلاء
Incident
│
▼
Supervisor
/ | \
▼ ▼ ▼
Log agent Metric agent Runbook agent
│ │ │
└─────┴─────┘
│
▼
Hypothesis + evidence
│
▼
Human approval
│
▼
Action (narrow set)يقوم المشرف بتقسيم الحادث إلى أسئلة فرعية. لدى العملاء المتخصصين إمكانية الوصول إلى الأدوات (بحث السجل، PromQL، استرداد الوثائق). يقوم المشرف بتجميع، ويقدم الفرضية + الأدلة للبشر. يوافق البشر أو يعيد توجيههم.
نطاق التعويضات الآلية
Safe (narrow): إعادة تشغيل القنبلة، إعادة نشر محدد، مجموعة درجة داخل الحدود المعتمدة مسبقا، تمكين علامة الميزات المعتمدة مسبقا.
Not safe (broad): تغيير أوضاع الخدمات، تغيير حدود الموارد، نشر رمز جديد، تغيير IAM، تغيير قواعد البيانات.
أي شخص يبيع "ضعها ونساها" هو تبيع مبالغ فيه. مجموعة الخزنة تنمو مع بلوغ AI SRE، ولكن الحدود حقيقية.
التقييم المتعثر (نيو بيرد هوكي)
النماذج تدرس نفس الحادث بشكل مستقل. إذا اتفقتا على السبب الجذري، فإن الثقة مرتفعة. إذا لم يتفقوا، تصاعد إلى الإنسان مع وجود الفرضيتين الواضحة. النمط البسيط، مرشح فعال ضد الأسباب الجذرية الهلوسة.
الذاكرة التشغيلية
تدور أعمال الفريق هو قتل صامت من ورقات المعرفة القبلية التقليدية SRE . تخزين AI SRE كتب الدوران + ما بعد الموت في DB المتجهة؛ العاملين استرداد على كل حادثة جديدة. عندما ينضم مهندسون جدد، فإن AI لديه تاريخ كامل.
التنبؤات السابقة للحادث
بحث MIT 2025: ماجستير في التدريب على السجلات التاريخية، درجات حرارة الجيبو، أنماط الخطأ API توقع 89٪ من الانقطاعات قبل 10-15 دقيقة من حدوثها على مجموعة الاختبار.
التحقق من الواقع: التنبؤات دون تشغيل هي لوحة التحكم. السؤال التشغيلي هو "عندما نتنبأ، ماذا نفعل؟" التصرف الوقائي؟ الصفحة؟ التقييم الآلي؟ الإجابة محددة للسياسة.
المنتجات في عام 2026
- Datadog Bits AIتم إدارة الطيار المشارك في "ديتادوج"
- Azure SRE Agent-أصلي (أزور)
- NeuBird Hawkeye تقييم معادلة + ذاكرة تشغيل
- PagerDuty AIOps التقسيم + التخفيض
- Incident.io Autopilotقائد الحادث + تنسيق
كتب التشغيل كرمز
تتطور الكتب التشغيلية من صفحات Confluence إلى إصدارات التسجيل مع أقسام مهيكلة (العلامة ، الفرضية ، التحقق ، التصرف). الكتب التشغيلية المهيكلة تغذية أفضل استرداد RAG. ابدأ أي تطوير AI-SRE عن طريق تحويل الكتب التشغيلية غير المهيكلة إلى المهيكلة.
أرقام يجب أن تتذكر
- الكشف المبكر عن معهد ماساتشوستس للتكنولوجيا: 89% من الانقطاعات، 10-15 دقيقة وقت الإتصال.
- التقييم متعدد الوكلاء: المشرف + (سجلات، مقاييس، كتب التشغيل) + البشر.
- مجموعة آمنة للتعويض الآلي: إعادة تشغيل القنبلة، إعادة نشر، وتحقيق النطاق داخل الحدود.
- التقييم المتعارض: نموذجين مستقلين؛ الاتفاق = الثقة.
استخدمها
code/main.pyيحاكي التجديد متعدد الوكلاء: وكيل السجل يجد خطأ، وكيل المقاييس يجد أعلى مستوى من CPU، وكيل كتاب التشغيل يطابق مشكلة معروفة. المشرف يرتب الفرضيات.
أرسله
هذا الدرس يُنتجoutputs/skill-ai-sre-plan.mdبالنظر إلى الحالة الحالية على المكالمة، حجم الحوادث، نضج الفريق، تصميم تنفيذ AI SRE.
التمارين
- أركض
code/main.pyماذا لو كان وكلاء السجلات والمقاييس لا يتفقون؟ كيف يصل المشرف؟ - حدد ثلاث إجراءات "آمنة" للتعويض الذاتي لخدمتك.
- اكتب نموذجًا منظمًا للكتاب المباشر: القسمات والحقول المطلوبة وأوامر التحقق.
- إطلاق النار التنبؤية في 12 دقيقة من الرصاص ما هي سياستك؟
- نقاش ما إذا كان يجب على فريق من 3 أشخاص تبني AI SRE في 2026 أو الانتظار.
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| AI SRE | "agent for on-call" | LLM-backed incident investigation + coordination |
| Supervisor agent | "the orchestrator" | Top-level agent breaking incidents into sub-queries |
| Specialized agent | "domain agent" | Sub-agent with tool access (logs, metrics, runbooks) |
| Auto-remediation | "AI fixes it" | Narrow pre-approved action; NOT broad re-architecture |
| Operational memory | "vector runbooks" | Post-mortems + runbooks in vector DB for RAG |
| Adversarial eval | "two-model check" | Independent analyses; agreement = confidence |
| NeuBird Hawkeye | "the adversarial one" | Product with adversarial-eval + memory pattern |
| Bits AI | "Datadog's SRE agent" | Datadog-managed AI SRE |
| Pre-incident prediction | "early detection" | 10-15 min lead time on outage prediction |
المزيد من القراءة
- incident.io — AI SRE Complete Guide 2026
- InfoQ — Human-Centred AI for SRE
- DZone — AI in SRE 2026
- Datadog Bits AI
- NeuBird Hawkeye
- awesome-ai-sre
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.