Phase 17: Infrastructure & Production

एआई के लिए एसआरई मल्टी-एजेंट इन्सेंट रिस्पॉन्स, रनबुक, पूर्वानुमानात्मक डिटेक्शन

एआई एसआरई अनुसंधान, प्रलेखन और समन्वय चरणों को स्वचालित करने के लिए आरएजी के माध्यम से बुनियादी ढांचे के डेटा (लॉग, रनबुक, सेवा टॉपलॉजी) में आधारित एलएलएम का उपयोग करता है। 2026 वास्तुकला पैटर्न बहु-एजेंट ऑर्केस्ट्रेशन है एक पर्यवेक्षक द्वारा समन्वयित विशेष एजेंट (लॉग, मीट्रिक, रनबुक); एआई परिकल्पनाओं और प्रश्नों का प्रस्ताव करता है, मनुष्य निर्णय कॉल को मंजूरी देते हैं। Datadog बिट्स एआई और Azure SRE एजेंट इसे प्रबंधित उत्पादों के रूप में जहाज। रनबुक विकसित हो रहे हैंः न्यूबर्ड हॉकीए प्रतिकूल मूल्यांकन का उपयोग करता है (दो मॉडल एक ही घटना का विश्लेषण करते हैं; सहमति = विश्वास, असहमति = अनिश्चितता); टीम परिवर्तनों के दौरान परिचालन स्मृति बनी रहती है। ऑटो-रेमेडिएशन सावधानी से किया जाता हैः एआई सुझाव देता है, मनुष्य अनुमोदन करते हैं। पूरी तरह से स्वायत्त कार्रवाई संकीर्ण है (पुनः आरंभ कक्ष, रोलबैक विशिष्ट तैनाती) के साथ तंग गार्डरेल्स कोई भी "सेट करें और इसे भूलें" बेच रहा है ओवरसेलिंग है। उभरती हुई सीमाः घटना से पहले भविष्यवाणी। एमआईटी अनुसंधान रिपोर्ट में कहा गया है कि ऐतिहासिक लॉग + जीपीयू समय + एपीआई त्रुटि पैटर्न पर प्रशिक्षित एक एलएलएम ने 10-15 मिनट पहले 89% आउटेज की भविष्यवाणी की। अनुमानः वर्ष 2026 के अंत तक 95 प्रतिशत उद्यम LLM में स्वचालित विफलता होगी।

Type: Learn

Languages: Python (stdlib, toy multi-agent incident triage simulator)

Prerequisites: Phase 17 · 13 (Observability), Phase 17 · 24 (Chaos Engineering)

Time: ~60 minutes

सीखने के लक्ष्य

  • मल्टी-एजेंट एआई एसआरई वास्तुकला का आरेखः पर्यवेक्षक + विशेष एजेंट (लॉग, मीट्रिक, रनबुक) + मानव अनुमोदन गेट।
  • स्पष्ट करें कि ऑटो-रेमेडिकेशन व्यापक (पुनः वास्तुकला सेवा) की बजाय संकीर्ण (पुनः आरंभ कक्ष, पुनः तैनाती) क्यों है।
  • प्रतिकूल मूल्यांकन पैटर्न का नाम दें (न्यूबर्ड हॉकी): दो मॉडल सहमत = विश्वास; असहमत = बढ़ते हैं।
  • MIT 89% प्रारंभिक पता लगाने के परिणाम और परिचालन प्रतिबंध का उल्लेख करेंः निष्पादन के बिना भविष्यवाणियां केवल डैशबोर्ड हैं।

समस्या

एक कॉल इंजीनियर को 3 बजे "चेकआउट में उच्च त्रुटि दर" के लिए बुलाया जाता है। वे डेटाडॉग, लोकी, तीन रनबुक, तैनाती लॉग की जांच करते हैं। 30 मिनट बाद उन्हें पता चलता है कि मूल कारण KV कैश स्पाइक से एक vLLM OOM है। वे कैप को पुनरारंभ करते हैं; त्रुटि साफ हो जाती है।

2026 में उस जांच के पहले 20 मिनट स्वचालित हैं। हाल ही में तैनात किए गए कार्यों के अनुरूप, रनबुक के साथ मेल खाने वाले, हाल ही में तैनात किए गए लॉग को समूहबद्ध करना सभी RAG + उपकरण-उपयोग हैं। एक पर्यवेक्षित एजेंट पहले पास ट्रायल कर सकता है और मानव डेटाडॉग खोलने से पहले एक परिकल्पना प्रस्तुत कर सकता है।

पूरी तरह से स्वायत्त सुधार एक अलग समस्या है. पॉड पुनरारंभः सुरक्षित. स्केल GPU पूलः सुरक्षित यदि नीति अनुमति देती है. सेवा को फिर से डिजाइनः बिल्कुल नहीं. अनुशासन संकीर्ण रेखा खींच रहा है।

अवधारणा

बहु-एजेंट वास्तुकला

          Incident
             │
             ▼
        Supervisor
        /    |    \
       ▼     ▼     ▼
  Log agent  Metric agent  Runbook agent
       │     │     │
       └─────┴─────┘
             │
             ▼
        Hypothesis + evidence
             │
             ▼
        Human approval
             │
             ▼
        Action (narrow set)

पर्यवेक्षक घटना को उप-प्रश्न में विभाजित करता है। विशेषज्ञ एजेंटों के पास उपकरण पहुंच (लॉग खोज, प्रोमक्यूएल, डॉक पुनर्प्राप्ति) है। पर्यवेक्षक मानव को परिकल्पना + सबूत प्रस्तुत करता है। मानव अनुमोदन या पुनर्निर्देशित करता है।

स्व-समाधान की सीमा

Safe (narrow): पुनः आरंभ कक्ष, विशिष्ट तैनाती को वापस, पूर्व-अनुमोदित सीमाओं के भीतर पैमाने पूल, पूर्व-अनुमोदित विशेषता ध्वज सक्षम करें।

Not safe (broad): सेवा टोपोलॉजी में बदलाव, संसाधन सीमाओं में बदलाव, नए कोड को तैनात करना, आईएएम में बदलाव, डेटाबेस में बदलाव करना।

जो कोई भी "सेट और भूल जाओ" बेचता है वह ओवरसेलिंग है। एआई एसआरई के परिपक्व होने के साथ-साथ सुरक्षित सेट बढ़ता है, लेकिन सीमा वास्तविक है।

प्रतिकूल मूल्यांकन (न्यूबर्ड हॉकीए)

दो मॉडल एक ही घटना का स्वतंत्र रूप से विश्लेषण करते हैं। यदि वे मूल कारण पर सहमत हैं, तो विश्वास उच्च है। यदि वे असहमत हैं, तो दोनों परिकल्पनाओं के दृश्यमान होने के साथ मानव तक बढ़ें। सरल पैटर्न, भ्रामक मूल कारणों के खिलाफ प्रभावी फ़िल्टर।

परिचालन स्मृति

टीम टर्नओवर पारंपरिक एसआरई आदिवासी ज्ञान पत्तियों की चुप्पी मारना है। एआई एसआरई रनबुक + पोस्ट-मॉर्टम को वेक्टर डीबी में संग्रहीत करता है; एजेंट हर नई घटना पर पुनर्प्राप्त करते हैं। जब नए इंजीनियर शामिल होते हैं, तो एआई का पूरा इतिहास होता है।

घटना से पूर्व भविष्यवाणी

MIT 2025 अनुसंधानः ऐतिहासिक लॉग, GPU तापमान, API त्रुटि पैटर्न पर प्रशिक्षित LLM ने परीक्षण सेट पर होने से 10-15 मिनट पहले 89% आउटेज की भविष्यवाणी की।

वास्तविकता जांचः निष्क्रियता के बिना भविष्यवाणियां डैशबोर्ड हैं। परिचालन प्रश्न है "जब हम भविष्यवाणी करते हैं, तो हम क्या करते हैं? निवारक निकासी? पृष्ठ? ऑटो-स्केल? जवाब नीति-विशिष्ट है।

2026 में उत्पाद

  • Datadog Bits AI Datadog के अंदर प्रबंधित SRE सह पायलट.
  • Azure SRE Agent Azure-निवासी।
  • NeuBird Hawkeye प्रतिकूल मूल्यांकन + परिचालन स्मृति।
  • PagerDuty AIOps triage + deduplication।
  • Incident.io Autopilot घटना कमांडर + समन्वय।

कोड के रूप में रनबुक

रनबुक कन्फ्लूएंस पृष्ठों से संरचित अनुभागों (संकेत, परिकल्पना, सत्यापित, कार्य) के साथ संस्करणित मार्कडाउन तक विकसित होते हैं। संरचित रनबुक बेहतर आरएजी पुनर्प्राप्ति को खिलाते हैं। किसी भी एआई-एसआरई रोलआउट को अनर्गठित रनबुक को संरचित में बदलकर शुरू करें।

संख्याओं को याद रखना चाहिए

  • एमआईटी प्रारंभिक पता लगानेः 89% विराम, 10-15 मिनट नेतृत्व समय।
  • बहु-एजेंट triage: पर्यवेक्षक + (लॉग, मेट्रिक्स, रनबुक) + मानव।
  • सुरक्षित ऑटो-रिमेडिएशन सेटः कैप्सूल को पुनरारंभ करें, पुनः तैनात करें, सीमाओं के भीतर स्केल करें।
  • प्रतिकूल मूल्यांकनः दो स्वतंत्र मॉडल; सहमति = विश्वास।

इसका प्रयोग करें

code/main.pyएक बहु-एजेंट triage अनुकरणः लॉग एजेंट त्रुटि पाता है, मीट्रिक एजेंट सीपीयू स्पाइक पाता है, रनबुक एजेंट ज्ञात समस्या से मेल खाता है। पर्यवेक्षक परिकल्पनाओं को रैंक करता है।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-ai-sre-plan.md. वर्तमान कॉल पर, घटनाओं की मात्रा, टीम परिपक्वता को देखते हुए, एक एआई एसआरई रोलआउट डिजाइन करता है।

व्यायाम

  1. दौड़ेंcode/main.pyयदि लॉग और मेट्रिक एजेंट सहमत नहीं हैं तो कैसे पर्यवेक्षक हल करता है?
  2. अपनी सेवा के लिए तीन "सुरक्षित" ऑटो-रिमेडियम कार्य को परिभाषित करें। प्रत्येक को सही ठहराना।
  3. एक संरचित रनबुक टेम्पलेट लिखेंः अनुभाग, आवश्यक फ़ील्ड, सत्यापन कमांड।
  4. 12 मिनट की लीड पर पूर्वानुमानात्मक पता लगाने की आग। आपकी नीति क्या है?
  5. तर्क दें कि 3 व्यक्ति की टीम को 2026 में एआई एसआरई को अपनाना चाहिए या इंतजार करना चाहिए। परिपक्वता, मात्रा, जोखिम पर विचार करें।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
AI SRE"agent for on-call"LLM-backed incident investigation + coordination
Supervisor agent"the orchestrator"Top-level agent breaking incidents into sub-queries
Specialized agent"domain agent"Sub-agent with tool access (logs, metrics, runbooks)
Auto-remediation"AI fixes it"Narrow pre-approved action; NOT broad re-architecture
Operational memory"vector runbooks"Post-mortems + runbooks in vector DB for RAG
Adversarial eval"two-model check"Independent analyses; agreement = confidence
NeuBird Hawkeye"the adversarial one"Product with adversarial-eval + memory pattern
Bits AI"Datadog's SRE agent"Datadog-managed AI SRE
Pre-incident prediction"early detection"10-15 min lead time on outage prediction

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.