مهندسی آشفته برای تولید LLM
Type: Learn
Languages: Python (stdlib, toy chaos experiment runner)
Prerequisites: Phase 17 · 23 (SRE for AI), Phase 17 · 13 (Observability)
Time: ~60 minutes
اهداف یادگیری
- پنج شرط پیش فرض مهندسی آشفتگی را نام ببرید (SLI/SLO، قابل مشاهده، رول بیک، runbooks، on call) و توضیح دهید که چرا تخفیف از هر نوع تخفیف از این روش است.
- چهار خط (کنترول، هدف، ایمنی، قابل مشاهده) و حلقه بازخورد را به SLO رسم کنید.
- پنج آزمایش خاص LLM را ذکر کنید (مدفوع بیش از حد حافظه، شکست شبکه، قطع سرویس دهنده، پیام غلط، طوفان اخراج KV).
- یک ابزار را انتخاب کنید هارنس، لیتموس، آشفتگی، آشفتگی یک دسته داده شده.
مشکل
آزمایش هرج و مرج در استیک های سنتی ایجاد شده است. استیک های LLM حالت های شکست جدیدی را اضافه می کنند. یک پیام 4K-توکن با یک کاراکتر سم دهنده برای 12 ثانیه توکن را متوقف می کند. یک ارائه دهنده پیش رو 429s؛ دروازه شما دوباره آزمایش می شود؛ OOM های سرویس شما در همزمان تقویت شده دوباره. طوفان اخراج کش KV تحت بار انفجار باعث ایجاد دوباره پر کردن کاسکدهای که محاسبات را اشباع می کنند.
هیچکدام از این موارد در آزمایشات واحد ظاهر نمی شوند. مهندسی آشفتگی این است که شما آنها را قبل از کاربران کشف می کنید.
مفهوم
شرط های پیش فرض
بدون اينکه:
- SLI/SLO شاخص ها و اهداف سطح خدمات مشخص شده است.
- Observability ردیابی، متریک، دفترچه، به داشبوردها متصل شده
- Automated rollback مرحله 17 · 20 بازگشت به سیاست های پرچم
- Runbooks ساختار یافته، مرحله 17 · 23.
- On-call کسی که جواب بده
از دست دادن هر وسیله ای، هرج و مرج به یک حادثه واقعی تبدیل می شود.
چهار تا هواپیما + بازخورد
Control plane برنامه ریزی آزمایش (تدفق کار Litmus، برنامه Chaos Mesh، UI Harness).
Target planeخدمات، پویدل ها، گره ها، ترازنده های بار، ذخیره سازی داده ها
Safety plane سوئیچ خاموش کردن، پنجره های سرکوب، محدوده شعاع انفجار، دروازه های بودجه خطا
Observability plane متریک های عادی + ارتباط ردیابی-آید برای تشخیص آشفتگی ناشی از شکست های طبیعی.
Feedback loop یافته ها به تنظیم SLO، به روزرسانی کتاب راه اندازی، اصلاحات کد باز می گردند.
ريل هاي نگهباني اجباري هستند
- Burn-rate alert: آزمایش توقف اگر سوختن روزانه خطا- بودجه بیش از 2 برابر انتظار می رود.
- Suppression windows: خاموش کردن هشدارهای غیر تجربی در شعاع انفجار در طول آزمایش.
- Trace-ID correlation: تمام اشتباهات ناشی از آزمایش دارای برچسب است تا در تماس می تواند نتیجه گیری کند.
پنج آزمایش خاص LLM
- Memory overload با ارسال درخواست های بلند زمینه با همزمانی بالا، طوفان پیشگیری از کش KV را ایجاد کنید. مشاهده کنید: آیا سرویس با زیبایی از بین می رود یا خراب می شود؟
- Network failure قطع اتصال بین دروازه نتیجه گیری و ارائه دهنده مشاهده کنید: آیا بازگشت در SLA شروع می شود؟ (فاز 17 · 19)
- Provider outage simulation 100% 429 از OpenAI. مشاهده کنید: آیا روت کردن به Anthropic ناکام می شود؟ (فاز 17 · 16, 19)
- Malformed prompt بار مفید نصب توکنایزر تزریق کنید (به عنوان مثال یونیکود عمیق، کد UTF-8 بزرگ). مشاهده کنید: آیا یک درخواست یک کارگر را قفل می کند؟
- KV eviction storm اخراج اجباری با پر کردن بودجه بلاک vLLM مشاهده کنید: آیا LMCache بهبود می یابد یا خدمات کاهش می یابد؟
کادنس
- Weekly آزمایشات کوچک کاناری در مرحله بندی، شاید 5 درصد
- Monthly روز بازی برنامه ریزی شده در یک سناریو خاص؛ حضور بین تیم ها؛ پس از مرگ.
- Quarterly حسابرسی انعطاف پذیری تیم ها؛ به روز رسانی نقشه وابستگی ها
ابزار
- Harness Chaos Engineering تجاری؛ توصیه های آزمایش ناشی از هوش مصنوعی؛ کاهش در طول شعاع انفجار؛ ادغام ابزار MCP.
- LitmusChaos CNCF فارغ التحصیل؛ بر اساس جریان کار Kubernetes.
- Chaos Mesh جعبه شن CNCF؛ سبک CRD بومی Kubernetes.
- Gremlin تجارت؛ حمایت گسترده
- AWS FIS-Azure Chaos Studio ارائه های مدیریت شده ابر
شروع کردن از کوچک
اولين تجربه: يک نسخه از کد را در سيستم ترافيک ثابت بکشيد. بازيگردان و بازپرداخت را مشاهده كنيد. اگر اين کار مي كند و به نظر امن مي رسد، به آشفتگي شبکه ميرسه.
اولين تجربه خاص LLM: تزريق به يک ارائه دهنده 429 براي 5 دقيقه. مشاهدات عقب نشيني. اکثر تیم ها متوجه شدند که عقب نشيني آنها به طور كامل تست نشده است.
شماره هایی که باید به یاد داشته باشی
- چهار تا هواپیما: کنترل، هدف، ایمنی، مشاهده
- توقف میزان سوختن: دو برابر سوختن روزانه پیش بینی شده.
- زمان: هفتگی کاناری، ماهانه روز بازی، ترفیه وار
- پنج آزمایش LLM: حافظه، شبکه، ارائه دهنده، پیامک اشتباه، طوفان KV
ازش استفاده کن
code/main.pyسه آزمایش هرج و مرج با دروازه های هواپیماهای ایمنی شبیه سازی می کند. گزارش هایی که آزمایشات می تواند مانع از توقف سوختگی شود.
-باده
این درس به ما کمک می کندoutputs/skill-chaos-plan.mdبا توجه به تعداد و رشد، سه آزمایش اول و ابزار را انتخاب می کند.
تمرینات
- فرار کن
code/main.pyچه تجربه ای دروازه سوختگی را خراب می کند و چرا؟ - پنج آزمایش اول آشفتگی را برای یک سرویس RAG مبتنی بر vLLM طراحی کنید. معیارهای موفقیت را شامل کنید.
- خبرتون از سوختن، آزمایش رو متوقف کرد
- بحث کنید که آیا باید در تولید هرج و مرج رخ دهد یا فقط صحنه سازی.
- سه حالت شکست خاص LLM را که آشوب شبکه عمومی نمی تواند تکرار کند، نام ببرید.
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| SLI / SLO | "service targets" | Indicator + objective; required prerequisite |
| Blast radius | "scope" | Set of services / users affected by experiment |
| Burn-rate alert | "budget gate" | Fires when error-budget burn rate > 2x expected |
| Game day | "monthly drill" | Scheduled cross-team chaos exercise |
| LitmusChaos | "CNCF workflow" | Graduated CNCF Kubernetes chaos tool |
| Chaos Mesh | "CNCF CRD" | CNCF sandbox Kubernetes-native chaos |
| Harness CE | "commercial AI-assisted" | Harness chaos with AI recommendations |
| Malformed prompt | "tokenizer bomb" | Input that stalls tokenization |
| KV eviction storm | "preemption cascade" | Mass eviction triggering re-prefills |
خواندن بیشتر
- DevSecOps School — Chaos Engineering 2026 Guide
- Ankush Sharma — Observability for LLMs (book)
- LitmusChaos (CNCF)
- Chaos Mesh (CNCF)
- Harness Chaos Engineering
- AWS FIS
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.