SRE برای AI پاسخ به حوادث چند عامل، کتاب های اجرا، تشخیص پیش بینی
Type: Learn
Languages: Python (stdlib, toy multi-agent incident triage simulator)
Prerequisites: Phase 17 · 13 (Observability), Phase 17 · 24 (Chaos Engineering)
Time: ~60 minutes
اهداف یادگیری
- طراحی معماری AI SRE چند عامل: نظارت کننده + عوامل تخصصی (لوج، متریک، کتاب های اجرا) + دروازه تأیید انسانی.
- توضیح دهید که چرا خودبخشی محدود است (پدول بازخورد، بازخورد) و نه گسترده (خدمات بازسازی).
- الگوی ارزیابی متناقض را نام دهید (NeuBird Hawkeye): دو مدل موافق = اعتماد به نفس؛ مخالف = افزایش.
- نتایج تشخیص اولیه MIT 89 درصد و محدودیت عملیاتی را ذکر کنید: پیش بینی های بدون فعال سازی فقط داشبورد هستند.
مشکل
یک مهندس در تماس در ساعت 3 صبح به "درای خطا بالا در چک کردن" زنگ می زند. آنها Datadog، Loki، سه کتاب اجرا، روزنامه انتشار را بررسی می کنند. 30 دقیقه بعد متوجه می شوند که علت اصلی یک vLLM OOM از یک KV کیش است. آنها از نو شروع می کنند. خطا پاک می شود.
در سال 2026 اولین 20 دقیقه از این تحقیق خودکار است. گروه بندی روزنامه ها به واسطه خدمات، مرتبط با انتشارات اخیر، مطابقت با کتاب های اجرا همه RAG + ابزار استفاده است. یک عامل تحت نظارت می تواند اولین گذر triage انجام دهد و پیش از انسان باز کردن Datadog فرضیه ارائه دهد.
اصلاح کاملاً مستقل مشکل دیگری است. بازپرداخت قاب: امن. مقیاس GPU: امن اگر سیاست اجازه می دهد. بازسازی سرویس: مطلقاً نه. نظم خط تنگ را کشیده است.
مفهوم
معماری چند عامل
Incident
│
▼
Supervisor
/ | \
▼ ▼ ▼
Log agent Metric agent Runbook agent
│ │ │
└─────┴─────┘
│
▼
Hypothesis + evidence
│
▼
Human approval
│
▼
Action (narrow set)نظارتگر این حادثه را به زیرسوالها تقسیم می کند. ماموران تخصصی دسترسی به ابزار ( جستجوی روزنامه، PromQL، بازیافت اسناد) دارند. نظارتگر فرضیه را ترکیب می کند، شواهد را به انسان ارائه می دهد. انسان تأیید یا هدایت مجدد می کند.
دامنه اصلاحات خودکار
Safe (narrow): بازخوردن قاب، بازخوردن تعینات خاص، جمع بندی مقیاس در حدود پیش از تصویب، فعال کردن پرچم ویژگی های پیش از تصویب.
Not safe (broad): تغییر توپولوژی سرویس، تغییر محدودیت منابع، انتشار کد جدید، تغییر IAM، تغییر پایگاه داده ها.
هرکس که "بذار و فراموشش کن" رو بفروشه، بیش از حد فروش داره. با رشد هوش مصنوعی، سرویس رشد ميکنه، اما مرزها واقعی هستن.
ارزیابی مخالف (نوی برید هاکئی)
دو مدل به طور مستقل یک حادثه را تجزیه و تحلیل می کنند. اگر آنها در مورد علت اصلی توافق کنند، اعتماد به نفس بالا است. اگر آنها با اختلاف نظر باشند، به انسان با هر دو فرضیه قابل مشاهده افزایش می یابد. الگوی ساده، فیلتر موثر در برابر علل اصلی توهم.
حافظه عملیاتی
گردش تیم، قتل خاموشی برگ های دانش قبیلی سنتی SRE است. AI SRE کتاب های اجرا + پست-مورتم را در یک DB ویکتور ذخیره می کند؛ عوامل در هر حادثه جدید بازمی گردند. هنگامی که مهندسان جدید به آن پیوستند، AI دارای تاریخ کامل است.
پیش بینی پیش از وقوع حادثه
تحقیقات MIT 2025: LLM آموزش داده شده بر روی تاریخچه ها، دمای GPU، الگوهای خطا API پیش بینی 89٪ از قطع 10 تا 15 دقیقه قبل از آن اتفاق می افتد در مجموعه آزمایش.
بررسی واقعیت: پیش بینی بدون فعال سازی داشبورد است. سوال عملیاتی این است که "وقتی پیش بینی می کنیم، چه می کنیم؟" تخلیه پیشگیری؟ صفحه؟ مقیاس خودکار؟ پاسخ خاص سیاست است.
محصولات در سال 2026
- Datadog Bits AI با هم پلوتی SRE در داخل Datadog مدیریت شده
- Azure SRE Agent بومی ازور
- NeuBird Hawkeye ارزیابی متناقض + حافظه عملیاتی
- PagerDuty AIOps تسهیل + تخفیف
- Incident.io Autopilot فرمانده حادثه + هماهنگي
کتابهای اجرا به عنوان کد
کتابهای اجرا از صفحات کنفلوانس به ورژن های مشخص شده با بخش های ساختاری (علامت، فرضیه، تایید، عمل) تکامل می یابند. کتابهای اجرا ساختاری تغذیه از بازیافت بهتر RAG می کنند. هر طرح AI-SRE را با تبدیل کردن کتاب های اجرا غیر ساختاری به ساختاری آغاز کنید.
شماره هایی که باید به یاد داشته باشی
- تشخیص زودرس MIT: 89 درصد از قطع برق، 10-15 دقیقه زمان پیش بینی
- دسته بندی چند عامل: نظارت کننده + (ژغ ها، متریک ها، کتابهای اجرا) + انسان.
- مجموعه ایمنی خود اصلاح: بازخوردن قاب، بازخوردن، مقیاس در حدود.
- ارزیابی متناقض: دو مدل مستقل؛ توافق = اعتماد.
ازش استفاده کن
code/main.pyشبیه سازی یک دسته بندی چند عامل: عامل ثبت خطا پیدا می کند، عامل متریک پکیک CPU پیدا می کند، عامل رن بوک با مشکل شناخته شده مطابقت دارد. نظارتگر فرضیه ها را رتبه بندی می کند.
-باده
این درس به ما کمک می کندoutputs/skill-ai-sre-plan.mdبا توجه به زمان تماس، حجم حوادث، بلوغ تیم، طرح یک راه اندازی AI SRE.
تمرینات
- فرار کن
code/main.pyاگه عوامل ثبت و سنجش با هم اختلاف کنن چطور کارگزار حلش ميکنه؟ - سه اقدام "امنی" خود اصلاحي براي خدمتتون تعریف کنيد و هر يک را توجيه کنيد
- یک قالب runbook ساختاری بنویسید: بخش ها، زمینه های مورد نیاز، دستورات تأیید.
- با 12 دقیقه پیش بینی آتش نشاني چه سیاست هایی دارید؟
- بحث کنید که آیا یک تیم سه نفری باید AI SRE را در سال 2026 اتخاذ کند یا صبر کنید.
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| AI SRE | "agent for on-call" | LLM-backed incident investigation + coordination |
| Supervisor agent | "the orchestrator" | Top-level agent breaking incidents into sub-queries |
| Specialized agent | "domain agent" | Sub-agent with tool access (logs, metrics, runbooks) |
| Auto-remediation | "AI fixes it" | Narrow pre-approved action; NOT broad re-architecture |
| Operational memory | "vector runbooks" | Post-mortems + runbooks in vector DB for RAG |
| Adversarial eval | "two-model check" | Independent analyses; agreement = confidence |
| NeuBird Hawkeye | "the adversarial one" | Product with adversarial-eval + memory pattern |
| Bits AI | "Datadog's SRE agent" | Datadog-managed AI SRE |
| Pre-incident prediction | "early detection" | 10-15 min lead time on outage prediction |
خواندن بیشتر
- incident.io — AI SRE Complete Guide 2026
- InfoQ — Human-Centred AI for SRE
- DZone — AI in SRE 2026
- Datadog Bits AI
- NeuBird Hawkeye
- awesome-ai-sre
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.