Phase 17: Infrastructure & Production

مهندسی آشفته برای تولید LLM

مهندسی آشفتگی برای LLM رشته خودش در سال 2026 است. پیش نیاز قبل از اجرای آزمایشات در تولید: SLI/SLO تعریف شده، قابل مشاهده بودن ردیابی+متریکی+لگ، بازگشت خودکار، کتابهای اجرا، در زمان تماس. معماری دارای چهار سطح است: کنترل (تجربه برنامه ریزی کننده) ، هدف (خدمات، زیربنایی، ذخیره داده ها) ، ایمنی (حراس + توقف + فیلتر ترافیک) ، مشاهده (متریک + ردیابی + ثبت) ، بازخورد (در تنظیمات SLO). محافظان اجباری هستند: هشدارهای میزان سوختگی آزمایش ها را متوقف می کند اگر انتظار می رود روزانه سوختن خطای بودجه > 2 برابر باشد؛ پنجره های سرکوب + ارتباط ردیابی-ID از صدا هشدار داده شود. زمان: بررسی هفتگی از قناری کوچک + SLO؛ روز بازی ماهانه + پس از مرگ؛ حسابرسی انعطاف پذیری تیم های سه ماهه + نقشه برداری وابسته. آزمایشات خاص LLM: اضافه کردن حافظه، شکست شبکه، قطع سرویس دهنده، پیام های اشتباه، طوفان اخراج KV. ابزار: مهندسی هرج و مرج را استفاده کنید (وصایح ناشی از LLM، کاهش شعاع انفجار، ادغام ابزار MCP) ؛ LitmusChaos (CNCF) ؛ Chaos Mesh (CNCF Kubernetes- بومی).

Type: Learn

Languages: Python (stdlib, toy chaos experiment runner)

Prerequisites: Phase 17 · 23 (SRE for AI), Phase 17 · 13 (Observability)

Time: ~60 minutes

اهداف یادگیری

  • پنج شرط پیش فرض مهندسی آشفتگی را نام ببرید (SLI/SLO، قابل مشاهده، رول بیک، runbooks، on call) و توضیح دهید که چرا تخفیف از هر نوع تخفیف از این روش است.
  • چهار خط (کنترول، هدف، ایمنی، قابل مشاهده) و حلقه بازخورد را به SLO رسم کنید.
  • پنج آزمایش خاص LLM را ذکر کنید (مدفوع بیش از حد حافظه، شکست شبکه، قطع سرویس دهنده، پیام غلط، طوفان اخراج KV).
  • یک ابزار را انتخاب کنید هارنس، لیتموس، آشفتگی، آشفتگی یک دسته داده شده.

مشکل

آزمایش هرج و مرج در استیک های سنتی ایجاد شده است. استیک های LLM حالت های شکست جدیدی را اضافه می کنند. یک پیام 4K-توکن با یک کاراکتر سم دهنده برای 12 ثانیه توکن را متوقف می کند. یک ارائه دهنده پیش رو 429s؛ دروازه شما دوباره آزمایش می شود؛ OOM های سرویس شما در همزمان تقویت شده دوباره. طوفان اخراج کش KV تحت بار انفجار باعث ایجاد دوباره پر کردن کاسکدهای که محاسبات را اشباع می کنند.

هیچکدام از این موارد در آزمایشات واحد ظاهر نمی شوند. مهندسی آشفتگی این است که شما آنها را قبل از کاربران کشف می کنید.

مفهوم

شرط های پیش فرض

بدون اينکه:

  1. SLI/SLO شاخص ها و اهداف سطح خدمات مشخص شده است.
  2. Observability ردیابی، متریک، دفترچه، به داشبوردها متصل شده
  3. Automated rollback مرحله 17 · 20 بازگشت به سیاست های پرچم
  4. Runbooks ساختار یافته، مرحله 17 · 23.
  5. On-call کسی که جواب بده

از دست دادن هر وسیله ای، هرج و مرج به یک حادثه واقعی تبدیل می شود.

چهار تا هواپیما + بازخورد

Control plane برنامه ریزی آزمایش (تدفق کار Litmus، برنامه Chaos Mesh، UI Harness).

Target planeخدمات، پویدل ها، گره ها، ترازنده های بار، ذخیره سازی داده ها

Safety plane سوئیچ خاموش کردن، پنجره های سرکوب، محدوده شعاع انفجار، دروازه های بودجه خطا

Observability plane متریک های عادی + ارتباط ردیابی-آید برای تشخیص آشفتگی ناشی از شکست های طبیعی.

Feedback loop یافته ها به تنظیم SLO، به روزرسانی کتاب راه اندازی، اصلاحات کد باز می گردند.

ريل هاي نگهباني اجباري هستند

  • Burn-rate alert: آزمایش توقف اگر سوختن روزانه خطا- بودجه بیش از 2 برابر انتظار می رود.
  • Suppression windows: خاموش کردن هشدارهای غیر تجربی در شعاع انفجار در طول آزمایش.
  • Trace-ID correlation: تمام اشتباهات ناشی از آزمایش دارای برچسب است تا در تماس می تواند نتیجه گیری کند.

پنج آزمایش خاص LLM

  1. Memory overload با ارسال درخواست های بلند زمینه با همزمانی بالا، طوفان پیشگیری از کش KV را ایجاد کنید. مشاهده کنید: آیا سرویس با زیبایی از بین می رود یا خراب می شود؟
  1. Network failure قطع اتصال بین دروازه نتیجه گیری و ارائه دهنده مشاهده کنید: آیا بازگشت در SLA شروع می شود؟ (فاز 17 · 19)
  1. Provider outage simulation 100% 429 از OpenAI. مشاهده کنید: آیا روت کردن به Anthropic ناکام می شود؟ (فاز 17 · 16, 19)
  1. Malformed prompt بار مفید نصب توکنایزر تزریق کنید (به عنوان مثال یونیکود عمیق، کد UTF-8 بزرگ). مشاهده کنید: آیا یک درخواست یک کارگر را قفل می کند؟
  1. KV eviction storm اخراج اجباری با پر کردن بودجه بلاک vLLM مشاهده کنید: آیا LMCache بهبود می یابد یا خدمات کاهش می یابد؟

کادنس

  • Weekly آزمایشات کوچک کاناری در مرحله بندی، شاید 5 درصد
  • Monthly روز بازی برنامه ریزی شده در یک سناریو خاص؛ حضور بین تیم ها؛ پس از مرگ.
  • Quarterly حسابرسی انعطاف پذیری تیم ها؛ به روز رسانی نقشه وابستگی ها

ابزار

  • Harness Chaos Engineering تجاری؛ توصیه های آزمایش ناشی از هوش مصنوعی؛ کاهش در طول شعاع انفجار؛ ادغام ابزار MCP.
  • LitmusChaos CNCF فارغ التحصیل؛ بر اساس جریان کار Kubernetes.
  • Chaos Mesh جعبه شن CNCF؛ سبک CRD بومی Kubernetes.
  • Gremlin تجارت؛ حمایت گسترده
  • AWS FIS-Azure Chaos Studio ارائه های مدیریت شده ابر

شروع کردن از کوچک

اولين تجربه: يک نسخه از کد را در سيستم ترافيک ثابت بکشيد. بازيگردان و بازپرداخت را مشاهده كنيد. اگر اين کار مي كند و به نظر امن مي رسد، به آشفتگي شبکه ميرسه.

اولين تجربه خاص LLM: تزريق به يک ارائه دهنده 429 براي 5 دقيقه. مشاهدات عقب نشيني. اکثر تیم ها متوجه شدند که عقب نشيني آنها به طور كامل تست نشده است.

شماره هایی که باید به یاد داشته باشی

  • چهار تا هواپیما: کنترل، هدف، ایمنی، مشاهده
  • توقف میزان سوختن: دو برابر سوختن روزانه پیش بینی شده.
  • زمان: هفتگی کاناری، ماهانه روز بازی، ترفیه وار
  • پنج آزمایش LLM: حافظه، شبکه، ارائه دهنده، پیامک اشتباه، طوفان KV

ازش استفاده کن

code/main.pyسه آزمایش هرج و مرج با دروازه های هواپیماهای ایمنی شبیه سازی می کند. گزارش هایی که آزمایشات می تواند مانع از توقف سوختگی شود.

-باده

این درس به ما کمک می کندoutputs/skill-chaos-plan.mdبا توجه به تعداد و رشد، سه آزمایش اول و ابزار را انتخاب می کند.

تمرینات

  1. فرار کنcode/main.pyچه تجربه ای دروازه سوختگی را خراب می کند و چرا؟
  2. پنج آزمایش اول آشفتگی را برای یک سرویس RAG مبتنی بر vLLM طراحی کنید. معیارهای موفقیت را شامل کنید.
  3. خبرتون از سوختن، آزمایش رو متوقف کرد
  4. بحث کنید که آیا باید در تولید هرج و مرج رخ دهد یا فقط صحنه سازی.
  5. سه حالت شکست خاص LLM را که آشوب شبکه عمومی نمی تواند تکرار کند، نام ببرید.

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
SLI / SLO"service targets"Indicator + objective; required prerequisite
Blast radius"scope"Set of services / users affected by experiment
Burn-rate alert"budget gate"Fires when error-budget burn rate > 2x expected
Game day"monthly drill"Scheduled cross-team chaos exercise
LitmusChaos"CNCF workflow"Graduated CNCF Kubernetes chaos tool
Chaos Mesh"CNCF CRD"CNCF sandbox Kubernetes-native chaos
Harness CE"commercial AI-assisted"Harness chaos with AI recommendations
Malformed prompt"tokenizer bomb"Input that stalls tokenization
KV eviction storm"preemption cascade"Mass eviction triggering re-prefills

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.