एआई के लिए एसआरई मल्टी-एजेंट इन्सेंट रिस्पॉन्स, रनबुक, पूर्वानुमानात्मक डिटेक्शन
Type: Learn
Languages: Python (stdlib, toy multi-agent incident triage simulator)
Prerequisites: Phase 17 · 13 (Observability), Phase 17 · 24 (Chaos Engineering)
Time: ~60 minutes
सीखने के लक्ष्य
- मल्टी-एजेंट एआई एसआरई वास्तुकला का आरेखः पर्यवेक्षक + विशेष एजेंट (लॉग, मीट्रिक, रनबुक) + मानव अनुमोदन गेट।
- स्पष्ट करें कि ऑटो-रेमेडिकेशन व्यापक (पुनः वास्तुकला सेवा) की बजाय संकीर्ण (पुनः आरंभ कक्ष, पुनः तैनाती) क्यों है।
- प्रतिकूल मूल्यांकन पैटर्न का नाम दें (न्यूबर्ड हॉकी): दो मॉडल सहमत = विश्वास; असहमत = बढ़ते हैं।
- MIT 89% प्रारंभिक पता लगाने के परिणाम और परिचालन प्रतिबंध का उल्लेख करेंः निष्पादन के बिना भविष्यवाणियां केवल डैशबोर्ड हैं।
समस्या
एक कॉल इंजीनियर को 3 बजे "चेकआउट में उच्च त्रुटि दर" के लिए बुलाया जाता है। वे डेटाडॉग, लोकी, तीन रनबुक, तैनाती लॉग की जांच करते हैं। 30 मिनट बाद उन्हें पता चलता है कि मूल कारण KV कैश स्पाइक से एक vLLM OOM है। वे कैप को पुनरारंभ करते हैं; त्रुटि साफ हो जाती है।
2026 में उस जांच के पहले 20 मिनट स्वचालित हैं। हाल ही में तैनात किए गए कार्यों के अनुरूप, रनबुक के साथ मेल खाने वाले, हाल ही में तैनात किए गए लॉग को समूहबद्ध करना सभी RAG + उपकरण-उपयोग हैं। एक पर्यवेक्षित एजेंट पहले पास ट्रायल कर सकता है और मानव डेटाडॉग खोलने से पहले एक परिकल्पना प्रस्तुत कर सकता है।
पूरी तरह से स्वायत्त सुधार एक अलग समस्या है. पॉड पुनरारंभः सुरक्षित. स्केल GPU पूलः सुरक्षित यदि नीति अनुमति देती है. सेवा को फिर से डिजाइनः बिल्कुल नहीं. अनुशासन संकीर्ण रेखा खींच रहा है।
अवधारणा
बहु-एजेंट वास्तुकला
Incident
│
▼
Supervisor
/ | \
▼ ▼ ▼
Log agent Metric agent Runbook agent
│ │ │
└─────┴─────┘
│
▼
Hypothesis + evidence
│
▼
Human approval
│
▼
Action (narrow set)पर्यवेक्षक घटना को उप-प्रश्न में विभाजित करता है। विशेषज्ञ एजेंटों के पास उपकरण पहुंच (लॉग खोज, प्रोमक्यूएल, डॉक पुनर्प्राप्ति) है। पर्यवेक्षक मानव को परिकल्पना + सबूत प्रस्तुत करता है। मानव अनुमोदन या पुनर्निर्देशित करता है।
स्व-समाधान की सीमा
Safe (narrow): पुनः आरंभ कक्ष, विशिष्ट तैनाती को वापस, पूर्व-अनुमोदित सीमाओं के भीतर पैमाने पूल, पूर्व-अनुमोदित विशेषता ध्वज सक्षम करें।
Not safe (broad): सेवा टोपोलॉजी में बदलाव, संसाधन सीमाओं में बदलाव, नए कोड को तैनात करना, आईएएम में बदलाव, डेटाबेस में बदलाव करना।
जो कोई भी "सेट और भूल जाओ" बेचता है वह ओवरसेलिंग है। एआई एसआरई के परिपक्व होने के साथ-साथ सुरक्षित सेट बढ़ता है, लेकिन सीमा वास्तविक है।
प्रतिकूल मूल्यांकन (न्यूबर्ड हॉकीए)
दो मॉडल एक ही घटना का स्वतंत्र रूप से विश्लेषण करते हैं। यदि वे मूल कारण पर सहमत हैं, तो विश्वास उच्च है। यदि वे असहमत हैं, तो दोनों परिकल्पनाओं के दृश्यमान होने के साथ मानव तक बढ़ें। सरल पैटर्न, भ्रामक मूल कारणों के खिलाफ प्रभावी फ़िल्टर।
परिचालन स्मृति
टीम टर्नओवर पारंपरिक एसआरई आदिवासी ज्ञान पत्तियों की चुप्पी मारना है। एआई एसआरई रनबुक + पोस्ट-मॉर्टम को वेक्टर डीबी में संग्रहीत करता है; एजेंट हर नई घटना पर पुनर्प्राप्त करते हैं। जब नए इंजीनियर शामिल होते हैं, तो एआई का पूरा इतिहास होता है।
घटना से पूर्व भविष्यवाणी
MIT 2025 अनुसंधानः ऐतिहासिक लॉग, GPU तापमान, API त्रुटि पैटर्न पर प्रशिक्षित LLM ने परीक्षण सेट पर होने से 10-15 मिनट पहले 89% आउटेज की भविष्यवाणी की।
वास्तविकता जांचः निष्क्रियता के बिना भविष्यवाणियां डैशबोर्ड हैं। परिचालन प्रश्न है "जब हम भविष्यवाणी करते हैं, तो हम क्या करते हैं? निवारक निकासी? पृष्ठ? ऑटो-स्केल? जवाब नीति-विशिष्ट है।
2026 में उत्पाद
- Datadog Bits AI Datadog के अंदर प्रबंधित SRE सह पायलट.
- Azure SRE Agent Azure-निवासी।
- NeuBird Hawkeye प्रतिकूल मूल्यांकन + परिचालन स्मृति।
- PagerDuty AIOps triage + deduplication।
- Incident.io Autopilot घटना कमांडर + समन्वय।
कोड के रूप में रनबुक
रनबुक कन्फ्लूएंस पृष्ठों से संरचित अनुभागों (संकेत, परिकल्पना, सत्यापित, कार्य) के साथ संस्करणित मार्कडाउन तक विकसित होते हैं। संरचित रनबुक बेहतर आरएजी पुनर्प्राप्ति को खिलाते हैं। किसी भी एआई-एसआरई रोलआउट को अनर्गठित रनबुक को संरचित में बदलकर शुरू करें।
संख्याओं को याद रखना चाहिए
- एमआईटी प्रारंभिक पता लगानेः 89% विराम, 10-15 मिनट नेतृत्व समय।
- बहु-एजेंट triage: पर्यवेक्षक + (लॉग, मेट्रिक्स, रनबुक) + मानव।
- सुरक्षित ऑटो-रिमेडिएशन सेटः कैप्सूल को पुनरारंभ करें, पुनः तैनात करें, सीमाओं के भीतर स्केल करें।
- प्रतिकूल मूल्यांकनः दो स्वतंत्र मॉडल; सहमति = विश्वास।
इसका प्रयोग करें
code/main.pyएक बहु-एजेंट triage अनुकरणः लॉग एजेंट त्रुटि पाता है, मीट्रिक एजेंट सीपीयू स्पाइक पाता है, रनबुक एजेंट ज्ञात समस्या से मेल खाता है। पर्यवेक्षक परिकल्पनाओं को रैंक करता है।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-ai-sre-plan.md. वर्तमान कॉल पर, घटनाओं की मात्रा, टीम परिपक्वता को देखते हुए, एक एआई एसआरई रोलआउट डिजाइन करता है।
व्यायाम
- दौड़ें
code/main.pyयदि लॉग और मेट्रिक एजेंट सहमत नहीं हैं तो कैसे पर्यवेक्षक हल करता है? - अपनी सेवा के लिए तीन "सुरक्षित" ऑटो-रिमेडियम कार्य को परिभाषित करें। प्रत्येक को सही ठहराना।
- एक संरचित रनबुक टेम्पलेट लिखेंः अनुभाग, आवश्यक फ़ील्ड, सत्यापन कमांड।
- 12 मिनट की लीड पर पूर्वानुमानात्मक पता लगाने की आग। आपकी नीति क्या है?
- तर्क दें कि 3 व्यक्ति की टीम को 2026 में एआई एसआरई को अपनाना चाहिए या इंतजार करना चाहिए। परिपक्वता, मात्रा, जोखिम पर विचार करें।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| AI SRE | "agent for on-call" | LLM-backed incident investigation + coordination |
| Supervisor agent | "the orchestrator" | Top-level agent breaking incidents into sub-queries |
| Specialized agent | "domain agent" | Sub-agent with tool access (logs, metrics, runbooks) |
| Auto-remediation | "AI fixes it" | Narrow pre-approved action; NOT broad re-architecture |
| Operational memory | "vector runbooks" | Post-mortems + runbooks in vector DB for RAG |
| Adversarial eval | "two-model check" | Independent analyses; agreement = confidence |
| NeuBird Hawkeye | "the adversarial one" | Product with adversarial-eval + memory pattern |
| Bits AI | "Datadog's SRE agent" | Datadog-managed AI SRE |
| Pre-incident prediction | "early detection" | 10-15 min lead time on outage prediction |
आगे पढ़ना
- incident.io — AI SRE Complete Guide 2026
- InfoQ — Human-Centred AI for SRE
- DZone — AI in SRE 2026
- Datadog Bits AI
- NeuBird Hawkeye
- awesome-ai-sre
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.