Phase 17: Infrastructure & Production

SRE لذكاء الاصطناعي استجابة الحوادث متعددة الوكلاء، كتب التشغيل، الكشف التنبؤي

تستخدم AI SRE LLM القائمة على بيانات البنية التحتية (سجلات، كتب التشغيل، أوضاع الخدمات) عبر RAG لتلقيح مراحل التحقيق والوثائق والتنسيق. نمط الهندسة المعمارية لعام 2026 هو تشكيل وكلاء متعددين وكلاء متخصصين (سجلات، مقاييس، كتب تشغيل) يتم تنسيقها من قبل المشرف؛ تقترح الذكاء الاصطناعي الفرضيات والسؤالات، والإنسان يوافق على دعوات الحكم. "داتادوج بيتس" و "أزور" "سري" يقومون بتسليم هذه المنتجات كمواد مديرة تطور الكتب التشغيلية: تستخدم نيوبيرد هاوكي تقييم معارض (تتحلل النماذجتان نفس الحادث؛ الاتفاق = الثقة، الخلاف = عدم اليقين) ؛ تتواصل الذاكرة التشغيلية عبر تغييرات الفريق. الوصول إلى العلاج الذاتي يبقى حذراً: يقتترح الذكاء الاصطناعي، يوافق البشر. العمل المستقل بالكامل ضيق (إعادة تشغيل القنبلة، إعادة نشر محدد) مع الحواجز الضيقة أي شخص يبيع "وضعها ونساها" هو البيع المفرط. الحدود الناشئة: التنبؤ قبل الحادث تقرير بحث MIT تقرير LLM تدرب على السجلات التاريخية + معدل GPU + أنماط الخطأ API توقع 89٪ من الانقطاع 10-15 دقيقة مبكرا. التوقعات: 95٪ من الشركات القانونية التجارية لديها إعادة التأهيل الآلي بحلول نهاية عام 2026.

Type: Learn

Languages: Python (stdlib, toy multi-agent incident triage simulator)

Prerequisites: Phase 17 · 13 (Observability), Phase 17 · 24 (Chaos Engineering)

Time: ~60 minutes

أهداف التعلم

  • رسم رسم معمارة AI SRE متعددة الوكلاء: المشرف + وكلاء متخصصون (مجلات، مقاييس، كتب التشغيل) + بوابة موافقة البشر.
  • شرح لماذا التعويض الآلي ضيق (إعادة تشغيل القنبلة، إعادة نشر) بدلاً من الواسع (خدمة إعادة التصميم).
  • أسمائ نمط تقييم معارض (نيو بيرد هوكي): نموذجين متفقين = الثقة؛ عدم الوفاق = التصعيد.
  • أذكر نتائج الكشف المبكر بنسبة 89% من معهد MIT والقيود التشغيلية: التنبؤات دون تشغيل هي مجرد لوحة التحكم.

المشكلة

يُطلب من مهندس في المكالمة في الساعة الثالثة صباحاً "معدل الأخطاء العالي في التحقق". يقومون بفحص Datadog، Loki، ثلاثة كتب تشغيل، سجل التنفيذ. بعد 30 دقيقة يدركون أن السبب الجذري هو VLLM OOM من قمة cache KV. يقومون بإعادة تشغيل القنبلة؛ يتم تصفيح الخطأ.

في عام 2026 تكون الدقائق الـ 20 الأولى من هذا التحقيق قابلة للتلقائي. تجميع السجلات حسب الخدمة، والتنسيق مع الانتشارات الأخيرة، والتنسيق مع الكتب القادمة كل ذلك هو استخدام الأدوات RAG +. يمكن للعميل المراقب القيام بتجريب أول مرور وتقديم فرضية قبل فتح البشر Datadog.

إعادة تشغيل القنبلة: آمنة. مجموعة GPU: آمنة إذا سمحت السياسة. إعادة تصميم الخدمة: لا مطلقا. الانضباط يرسم الخط الضيق.

المفهوم

معمارة متعددة الوكلاء

          Incident
             │
             ▼
        Supervisor
        /    |    \
       ▼     ▼     ▼
  Log agent  Metric agent  Runbook agent
       │     │     │
       └─────┴─────┘
             │
             ▼
        Hypothesis + evidence
             │
             ▼
        Human approval
             │
             ▼
        Action (narrow set)

يقوم المشرف بتقسيم الحادث إلى أسئلة فرعية. لدى العملاء المتخصصين إمكانية الوصول إلى الأدوات (بحث السجل، PromQL، استرداد الوثائق). يقوم المشرف بتجميع، ويقدم الفرضية + الأدلة للبشر. يوافق البشر أو يعيد توجيههم.

نطاق التعويضات الآلية

Safe (narrow): إعادة تشغيل القنبلة، إعادة نشر محدد، مجموعة درجة داخل الحدود المعتمدة مسبقا، تمكين علامة الميزات المعتمدة مسبقا.

Not safe (broad): تغيير أوضاع الخدمات، تغيير حدود الموارد، نشر رمز جديد، تغيير IAM، تغيير قواعد البيانات.

أي شخص يبيع "ضعها ونساها" هو تبيع مبالغ فيه. مجموعة الخزنة تنمو مع بلوغ AI SRE، ولكن الحدود حقيقية.

التقييم المتعثر (نيو بيرد هوكي)

النماذج تدرس نفس الحادث بشكل مستقل. إذا اتفقتا على السبب الجذري، فإن الثقة مرتفعة. إذا لم يتفقوا، تصاعد إلى الإنسان مع وجود الفرضيتين الواضحة. النمط البسيط، مرشح فعال ضد الأسباب الجذرية الهلوسة.

الذاكرة التشغيلية

تدور أعمال الفريق هو قتل صامت من ورقات المعرفة القبلية التقليدية SRE . تخزين AI SRE كتب الدوران + ما بعد الموت في DB المتجهة؛ العاملين استرداد على كل حادثة جديدة. عندما ينضم مهندسون جدد، فإن AI لديه تاريخ كامل.

التنبؤات السابقة للحادث

بحث MIT 2025: ماجستير في التدريب على السجلات التاريخية، درجات حرارة الجيبو، أنماط الخطأ API توقع 89٪ من الانقطاعات قبل 10-15 دقيقة من حدوثها على مجموعة الاختبار.

التحقق من الواقع: التنبؤات دون تشغيل هي لوحة التحكم. السؤال التشغيلي هو "عندما نتنبأ، ماذا نفعل؟" التصرف الوقائي؟ الصفحة؟ التقييم الآلي؟ الإجابة محددة للسياسة.

المنتجات في عام 2026

  • Datadog Bits AIتم إدارة الطيار المشارك في "ديتادوج"
  • Azure SRE Agent-أصلي (أزور)
  • NeuBird Hawkeye تقييم معادلة + ذاكرة تشغيل
  • PagerDuty AIOps التقسيم + التخفيض
  • Incident.io Autopilotقائد الحادث + تنسيق

كتب التشغيل كرمز

تتطور الكتب التشغيلية من صفحات Confluence إلى إصدارات التسجيل مع أقسام مهيكلة (العلامة ، الفرضية ، التحقق ، التصرف). الكتب التشغيلية المهيكلة تغذية أفضل استرداد RAG. ابدأ أي تطوير AI-SRE عن طريق تحويل الكتب التشغيلية غير المهيكلة إلى المهيكلة.

أرقام يجب أن تتذكر

  • الكشف المبكر عن معهد ماساتشوستس للتكنولوجيا: 89% من الانقطاعات، 10-15 دقيقة وقت الإتصال.
  • التقييم متعدد الوكلاء: المشرف + (سجلات، مقاييس، كتب التشغيل) + البشر.
  • مجموعة آمنة للتعويض الآلي: إعادة تشغيل القنبلة، إعادة نشر، وتحقيق النطاق داخل الحدود.
  • التقييم المتعارض: نموذجين مستقلين؛ الاتفاق = الثقة.

استخدمها

code/main.pyيحاكي التجديد متعدد الوكلاء: وكيل السجل يجد خطأ، وكيل المقاييس يجد أعلى مستوى من CPU، وكيل كتاب التشغيل يطابق مشكلة معروفة. المشرف يرتب الفرضيات.

أرسله

هذا الدرس يُنتجoutputs/skill-ai-sre-plan.mdبالنظر إلى الحالة الحالية على المكالمة، حجم الحوادث، نضج الفريق، تصميم تنفيذ AI SRE.

التمارين

  1. أركضcode/main.pyماذا لو كان وكلاء السجلات والمقاييس لا يتفقون؟ كيف يصل المشرف؟
  2. حدد ثلاث إجراءات "آمنة" للتعويض الذاتي لخدمتك.
  3. اكتب نموذجًا منظمًا للكتاب المباشر: القسمات والحقول المطلوبة وأوامر التحقق.
  4. إطلاق النار التنبؤية في 12 دقيقة من الرصاص ما هي سياستك؟
  5. نقاش ما إذا كان يجب على فريق من 3 أشخاص تبني AI SRE في 2026 أو الانتظار.

الشروط الرئيسية

TermWhat people sayWhat it actually means
AI SRE"agent for on-call"LLM-backed incident investigation + coordination
Supervisor agent"the orchestrator"Top-level agent breaking incidents into sub-queries
Specialized agent"domain agent"Sub-agent with tool access (logs, metrics, runbooks)
Auto-remediation"AI fixes it"Narrow pre-approved action; NOT broad re-architecture
Operational memory"vector runbooks"Post-mortems + runbooks in vector DB for RAG
Adversarial eval"two-model check"Independent analyses; agreement = confidence
NeuBird Hawkeye"the adversarial one"Product with adversarial-eval + memory pattern
Bits AI"Datadog's SRE agent"Datadog-managed AI SRE
Pre-incident prediction"early detection"10-15 min lead time on outage prediction

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.