Phase 17: Infrastructure & Production

FinOps برای LLM اقتصاد واحد و اختصاص چند مستاجر

FinOps سنتی در هزینه LLM شکسته است. هزینه ها معامله های توکن هستند، نه زمان استفاده از منابع. برچسب ها نقشه نمی کشند یک تماس API یک معامله است، نه یک دارایی. تصمیمات مهندسی (تکنیک فوری، پنجره زمینه، طول خروجی) تصمیمات مالی هستند. کتاب بازی 2026 سه ابعاد انتساب به ابزار را در روز اول دارد: به هر کاربر (user_id) برای قیمت گذاری صندلی و گسترش، در هر وظیفه (task_id+ route) برای هزینه سطح محصول و اولویت بندی، در هر مستاجر (tenant_id) برای اقتصاد واحد و تجدید. چهار لایه رمزنگاري prompt، tool، memory، response یک سطل پوشیده هزینه می کند. پله اجرای برای محصولات چند مستاجر: محدودیت نرخ هر مستاجر (2-3 برابر حداکثر انتظار می رود، 429 + پس از تلاش مجدد) ؛ حد روزانه هزینه (1.5-3 برابر سقف قرارداد؛ باعث افزایش نرخ + هشدار) ؛ سوئیچ های خاموش در هزینه z-score > 4 (توقف خودکار + صفحه در تماس). الگوهای انتساب: برچسب و جمع آوری، همراهی از تله متری (تراسک ID → صورتحساب؛ بالاترین دقت) ، نمونه گیری و استخراج، اختصاص مبتنی بر مدل، منبع رویداد، پخش در زمان واقعی. متریک واحد: هزینه در هر سوال حل شده، هزینه در هر آرتیفکت تولید شده نه توکن $/M. برچسب گذاری بازخودی همیشه از دست می رود؛ ابزار ایجاد در صورت درخواست.

Type: Learn

Languages: Python (stdlib, toy cost-attribution simulator with kill switch)

Prerequisites: Phase 17 · 13 (Observability), Phase 17 · 14 (Caching)

Time: ~60 minutes

اهداف یادگیری

  • توضیح دهید که چرا FinOps سنتی (تگ ها + سطوح) در هزینه های LLM شکسته و سه ابعاد جدید اختصاص را نام دهید.
  • چهار لایه رمزنگاری (سریع، ابزار، حافظه، پاسخ) را لیست کنید و چرا صورتحساب یک سطل هزینه را پنهان می کند.
  • یک پله اجرای (سعر → محدودیت هزینه → سوئیچ کشتن) برای یک محصول چند مستاجر طراحی کنید.
  • یک واحد متریک ( هزینه در هر سوال حل شده / آرتیفاکت) را به جای توکن های $ / M انتخاب کنید.

مشکل

صورت حسابت ۴۰ هزار دلار ميگه

  • اون مستاجر چي بود که خرجش کرد
  • چه ویژگی محصولی باعث شد
  • اینکه آیا هر کاربر فردی به خشونت رسانی مرتکب شده است.
  • چه به سرعت بلوت، تماس ابزار، یا تقویت حافظه گناهکار بود.

برچسب و جمع آوری در طرف ارائه دهنده برای منابع ابر (EC2 ، S3) کار می کند که در آن برچسب ها به موارد خط گسترش می یابد. تماس های LLM API به طور خودکار برچسب نمی شوند.

مفهوم

سه ابعاد اختصاصی

Per-user(user_id): چه کسی چه هزینه ای دارد. قیمت صندلی ها را تعیین می کند، مکالمات گسترش را انجام می دهد، کاربران برق را شناسایی می کند.

Per-task(task_id+ routeدرایو ها دارای اولویت بندی، تصمیم گیری های مرگ و میر-مفت هزینه.

Per-tenant(tenant_id): کدام مشتری سودآور است. اقتصاد واحد، قیمت تجدید، حد سطح را هدایت می کند.

سه تا ابزار در موقع تماس در روز اول

چهار لایه رمز

LayerExampleTypical % of total
Promptsystem + user input40-60%
Tooltool-call results fed back20-40% (agent workloads)
Memoryprior conversation / retrieved docs10-30%
Responsemodel output10-30%

با هم جمع کردن چهار مورد باعث می شود بهینه سازی کور شود. آنها را در طرح انتساب خود تجزیه کنید.

پله اجرای

  1. Rate limitهر کس که به اجاره رفته، دو تا سه برابر حداکثر انتظارش رو دارهRetry-After. کرایه دار در مقابل تعریق می بیند ، هیچ فروزه ای نیست
  1. Daily spend capهر کس که مستاجر هست، 1.5-3 برابر سقف قرارداد شده است. محرک: حد نرخ تشدید + هشدار به موفقیت مشتری.
  1. Kill switchدر هزینه ز-نمره > 4 نسبت به خط اصلی مستاجر. خود مختار توقف مستاجر؛ صفحه در تماس؛ افزایش به عملیات + CS.

الگوهای انتساب

  • Tag-and-aggregate: سرپرستی متاداتا؛ جمع آوری بعد. ساده؛ خشن.
  • Telemetry joiner: از طریق شناسه های ردیابی، ردیابی را به صورت صورت صورتحساب متصل کنید.
  • Sampling + extrapolation: نمونه 5-10% ضرب. هزینه موثر برای هزینه های خشن؛ رد می کند.
  • Model-based allocation: بازگشت به نتیجه گیری راننده هزینه. برای داده های قدیمی بدون برچسب.
  • Event-sourced: هزینه به عنوان رویدادهای در یک جریان (Kafka / Kinesis).
  • Real-time streaming: بروز رسانی های داشبورد زیر ثانیه

هزینه در هر X واحد متریک است

توکن های $/M حرف فروشنده است.

  • هزینه هر بلیط پشتیبانی حل شده
  • هزینه هر ماده تولید شده
  • هزینه هر وظیفه موفق مامور
  • هزینه در هر دقیقه جلسه کاربر

هزینه را با نتیجه محصول مرتبط کنید، در غیر این صورت بهینه سازی غیرقابل تایید است.

شکل ردیابی نسبت هزینه

trace_id: abc123
  user_id: u_42
  tenant_id: t_7
  task_id: task_classify_doc
  route: model_haiku
  layers:
    prompt_tokens: 1800
    tool_tokens: 600
    memory_tokens: 400
    response_tokens: 150
  cost_usd: 0.0135
  cached_input: true
  batch: false

هر تماس رو ارسال کن، در دریاچه داده ها نگه دار، به هر ابعاد جمع کن، مرحله 17 · 13 استیک مشاهده ای جایی است که این زندگی می کند.

مخزن مخلوط پس انداز

ستک: کش + دسته + مسیر + دروازه. با همه چهار:

  • Cache L2 (فاز 17 · 14): ~ 10 برابر ارزان تر ورودی.
  • دسته (فاز 17 · 15): 50 درصد تخفیف
  • مسیر به مدل ارزان (فاز 17 · 16): کاهش هزینه 60٪
  • بهره وری دروازه (فاز 17 · 19): تخفیف + تلاش مجدد.

بهترین موارد: 5-10% از خط پایه ساده. اکثر تیم ها 2-3 اهرم را درگیر می کنند؛ تعداد کمی همه چهار را جمع می کنند.

شماره هایی که باید به یاد داشته باشی

  • ابعاد اختصاص: به هر کاربر، به هر وظیفه، به هر مستاجر.
  • چهار لایه رمز: پرامپ، ابزار، حافظه، پاسخ.
  • کلید کشتن: از نظر امتیاز z> 4 استفاده کنید.
  • متریک واحد: هزینه برای هر سوال حل شده، نه توکن $/M.
  • بهینه سازی های دسته بندی شده: ~ 5-10% از خط پایه ممکن است.

ازش استفاده کن

code/main.pyیک سرویس LLM چند مستاجر را با سه سطح پله اجرای شبیه سازی می کند. یک مستاجر بدسلوکی را تزریق می کند و نشان می دهد که کلید کشتن شلیک می کند.

-باده

این درس به ما کمک می کندoutputs/skill-finops-plan.md. با توجه به محصول و مقیاس، طرح طرح اختصاص و پله اجرای را طراحی می کند.

تمرینات

  1. فرار کنcode/main.py. در چه نقطه ای سوئیچ کشتن میگیرن؟
  2. يه داشبورد هزینه هاي هر مزرعه رو تصميم بدي اول 5 تا منظره چي مي سازي؟
  3. بزرگترین مستاجر شما اقتصاد واحد منفی است پیشنهاد سه مداخلات را به ترتیب تاثیر مشتری ارائه دهید
  4. هزینه هر بلیط حل شده برای یک محصول پشتیبانی محاسبه کنید: 3M توکن/ بلیط، ~800 بلیط/روز، نرخ ذخیره شده GPT-5.
  5. بحث کنید که آیا برچسب گذاری برگشت پذیری می تواند تا به حال کار کند.

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
Per-user attribution"user-level cost"user_id stamped on every call
Per-task attribution"feature cost"task_id + route identify product surface
Per-tenant attribution"customer cost"tenant_id; drives unit economics
Four token layers"cost layers"prompt + tool + memory + response
Rate limit"429 guard"Per-tenant ceiling enforced at gateway
Daily spend cap"daily ceiling"Tenant-scoped budget with alert
Kill switch"auto-pause"Spend z-score > 4 triggers auto-suspension
Cost per resolved"product unit metric"Cost tied to product outcome, not tokens
Telemetry joiner"trace-to-billing"Highest-accuracy attribution pattern
Stacked optimization"cache+batch+route+gateway"Compounding savings to ~5-10% baseline

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.