Phase 17: Infrastructure & Production

SRE برای AI پاسخ به حوادث چند عامل، کتاب های اجرا، تشخیص پیش بینی

AI SRE از LLM هایی که از داده های زیرساخت (لگ ها، کتابهای اجرا، توپولوژی خدمات) از طریق RAG استفاده می کند تا مراحل تحقیق، مستند سازی و هماهنگی را خودکار کند، استفاده می کند. مدل معماری 2026، آرکیستراتور چند عامل است عوامل تخصصی (لوج، متریک، کتابهای اجرا) توسط یک سرپرست هماهنگ می شوند؛ هوش مصنوعی فرضیه ها و سوالات را پیشنهاد می کند، انسان ها دعوتات قضاوت را تأیید می کنند. اطلاعات مربوط به داده ها و Azure SRE Agent این را به عنوان محصولات مدیریت شده ارسال می کنند. کتاب های اجرا در حال تکامل هستند: NeuBird Hawkeye از ارزیابی متضاد استفاده می کند (دو مدل یک حادثه را تجزیه و تحلیل می کنند؛ توافق = اعتماد، اختلاف = عدم اطمینان) ؛ حافظه عملیاتی در طول تغییرات تیم باقی می ماند. خودبخشی با احتیاط باقی می ماند: هوش مصنوعی پیشنهاد می کند، انسان ها تایید می کنند. عمل کاملا مستقل باریک است (پد بازخورد، رول بیک مخصوص انتشار) با محافظ های محکم هر کسی که "آن را تنظیم کنید و فراموش کنید" را می فروشد بیش از حد است. مرز تازه: پیش بینی پیش از حوادث تحقیقات MIT گزارش می دهد که یک LLM آموزش دیده در تاریخچه ثبت نام + GPU زمان + API خطا الگوهای پیش بینی 89٪ از قطع 10-15 دقیقه زودتر. پیش بینی: 95 درصد از LLM های شرکت تا پایان سال 2026 به صورت خودکار شکست خورده اند.

Type: Learn

Languages: Python (stdlib, toy multi-agent incident triage simulator)

Prerequisites: Phase 17 · 13 (Observability), Phase 17 · 24 (Chaos Engineering)

Time: ~60 minutes

اهداف یادگیری

  • طراحی معماری AI SRE چند عامل: نظارت کننده + عوامل تخصصی (لوج، متریک، کتاب های اجرا) + دروازه تأیید انسانی.
  • توضیح دهید که چرا خودبخشی محدود است (پدول بازخورد، بازخورد) و نه گسترده (خدمات بازسازی).
  • الگوی ارزیابی متناقض را نام دهید (NeuBird Hawkeye): دو مدل موافق = اعتماد به نفس؛ مخالف = افزایش.
  • نتایج تشخیص اولیه MIT 89 درصد و محدودیت عملیاتی را ذکر کنید: پیش بینی های بدون فعال سازی فقط داشبورد هستند.

مشکل

یک مهندس در تماس در ساعت 3 صبح به "درای خطا بالا در چک کردن" زنگ می زند. آنها Datadog، Loki، سه کتاب اجرا، روزنامه انتشار را بررسی می کنند. 30 دقیقه بعد متوجه می شوند که علت اصلی یک vLLM OOM از یک KV کیش است. آنها از نو شروع می کنند. خطا پاک می شود.

در سال 2026 اولین 20 دقیقه از این تحقیق خودکار است. گروه بندی روزنامه ها به واسطه خدمات، مرتبط با انتشارات اخیر، مطابقت با کتاب های اجرا همه RAG + ابزار استفاده است. یک عامل تحت نظارت می تواند اولین گذر triage انجام دهد و پیش از انسان باز کردن Datadog فرضیه ارائه دهد.

اصلاح کاملاً مستقل مشکل دیگری است. بازپرداخت قاب: امن. مقیاس GPU: امن اگر سیاست اجازه می دهد. بازسازی سرویس: مطلقاً نه. نظم خط تنگ را کشیده است.

مفهوم

معماری چند عامل

          Incident
             │
             ▼
        Supervisor
        /    |    \
       ▼     ▼     ▼
  Log agent  Metric agent  Runbook agent
       │     │     │
       └─────┴─────┘
             │
             ▼
        Hypothesis + evidence
             │
             ▼
        Human approval
             │
             ▼
        Action (narrow set)

نظارتگر این حادثه را به زیرسوالها تقسیم می کند. ماموران تخصصی دسترسی به ابزار ( جستجوی روزنامه، PromQL، بازیافت اسناد) دارند. نظارتگر فرضیه را ترکیب می کند، شواهد را به انسان ارائه می دهد. انسان تأیید یا هدایت مجدد می کند.

دامنه اصلاحات خودکار

Safe (narrow): بازخوردن قاب، بازخوردن تعینات خاص، جمع بندی مقیاس در حدود پیش از تصویب، فعال کردن پرچم ویژگی های پیش از تصویب.

Not safe (broad): تغییر توپولوژی سرویس، تغییر محدودیت منابع، انتشار کد جدید، تغییر IAM، تغییر پایگاه داده ها.

هرکس که "بذار و فراموشش کن" رو بفروشه، بیش از حد فروش داره. با رشد هوش مصنوعی، سرویس رشد ميکنه، اما مرزها واقعی هستن.

ارزیابی مخالف (نوی برید هاکئی)

دو مدل به طور مستقل یک حادثه را تجزیه و تحلیل می کنند. اگر آنها در مورد علت اصلی توافق کنند، اعتماد به نفس بالا است. اگر آنها با اختلاف نظر باشند، به انسان با هر دو فرضیه قابل مشاهده افزایش می یابد. الگوی ساده، فیلتر موثر در برابر علل اصلی توهم.

حافظه عملیاتی

گردش تیم، قتل خاموشی برگ های دانش قبیلی سنتی SRE است. AI SRE کتاب های اجرا + پست-مورتم را در یک DB ویکتور ذخیره می کند؛ عوامل در هر حادثه جدید بازمی گردند. هنگامی که مهندسان جدید به آن پیوستند، AI دارای تاریخ کامل است.

پیش بینی پیش از وقوع حادثه

تحقیقات MIT 2025: LLM آموزش داده شده بر روی تاریخچه ها، دمای GPU، الگوهای خطا API پیش بینی 89٪ از قطع 10 تا 15 دقیقه قبل از آن اتفاق می افتد در مجموعه آزمایش.

بررسی واقعیت: پیش بینی بدون فعال سازی داشبورد است. سوال عملیاتی این است که "وقتی پیش بینی می کنیم، چه می کنیم؟" تخلیه پیشگیری؟ صفحه؟ مقیاس خودکار؟ پاسخ خاص سیاست است.

محصولات در سال 2026

  • Datadog Bits AI با هم پلوتی SRE در داخل Datadog مدیریت شده
  • Azure SRE Agent بومی ازور
  • NeuBird Hawkeye ارزیابی متناقض + حافظه عملیاتی
  • PagerDuty AIOps تسهیل + تخفیف
  • Incident.io Autopilot فرمانده حادثه + هماهنگي

کتابهای اجرا به عنوان کد

کتابهای اجرا از صفحات کنفلوانس به ورژن های مشخص شده با بخش های ساختاری (علامت، فرضیه، تایید، عمل) تکامل می یابند. کتابهای اجرا ساختاری تغذیه از بازیافت بهتر RAG می کنند. هر طرح AI-SRE را با تبدیل کردن کتاب های اجرا غیر ساختاری به ساختاری آغاز کنید.

شماره هایی که باید به یاد داشته باشی

  • تشخیص زودرس MIT: 89 درصد از قطع برق، 10-15 دقیقه زمان پیش بینی
  • دسته بندی چند عامل: نظارت کننده + (ژغ ها، متریک ها، کتابهای اجرا) + انسان.
  • مجموعه ایمنی خود اصلاح: بازخوردن قاب، بازخوردن، مقیاس در حدود.
  • ارزیابی متناقض: دو مدل مستقل؛ توافق = اعتماد.

ازش استفاده کن

code/main.pyشبیه سازی یک دسته بندی چند عامل: عامل ثبت خطا پیدا می کند، عامل متریک پکیک CPU پیدا می کند، عامل رن بوک با مشکل شناخته شده مطابقت دارد. نظارتگر فرضیه ها را رتبه بندی می کند.

-باده

این درس به ما کمک می کندoutputs/skill-ai-sre-plan.mdبا توجه به زمان تماس، حجم حوادث، بلوغ تیم، طرح یک راه اندازی AI SRE.

تمرینات

  1. فرار کنcode/main.pyاگه عوامل ثبت و سنجش با هم اختلاف کنن چطور کارگزار حلش ميکنه؟
  2. سه اقدام "امنی" خود اصلاحي براي خدمتتون تعریف کنيد و هر يک را توجيه کنيد
  3. یک قالب runbook ساختاری بنویسید: بخش ها، زمینه های مورد نیاز، دستورات تأیید.
  4. با 12 دقیقه پیش بینی آتش نشاني چه سیاست هایی دارید؟
  5. بحث کنید که آیا یک تیم سه نفری باید AI SRE را در سال 2026 اتخاذ کند یا صبر کنید.

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
AI SRE"agent for on-call"LLM-backed incident investigation + coordination
Supervisor agent"the orchestrator"Top-level agent breaking incidents into sub-queries
Specialized agent"domain agent"Sub-agent with tool access (logs, metrics, runbooks)
Auto-remediation"AI fixes it"Narrow pre-approved action; NOT broad re-architecture
Operational memory"vector runbooks"Post-mortems + runbooks in vector DB for RAG
Adversarial eval"two-model check"Independent analyses; agreement = confidence
NeuBird Hawkeye"the adversarial one"Product with adversarial-eval + memory pattern
Bits AI"Datadog's SRE agent"Datadog-managed AI SRE
Pre-incident prediction"early detection"10-15 min lead time on outage prediction

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.