FinOps برای LLM اقتصاد واحد و اختصاص چند مستاجر
user_id) برای قیمت گذاری صندلی و گسترش، در هر وظیفه (task_id+ route) برای هزینه سطح محصول و اولویت بندی، در هر مستاجر (tenant_id) برای اقتصاد واحد و تجدید. چهار لایه رمزنگاري prompt، tool، memory، response یک سطل پوشیده هزینه می کند. پله اجرای برای محصولات چند مستاجر: محدودیت نرخ هر مستاجر (2-3 برابر حداکثر انتظار می رود، 429 + پس از تلاش مجدد) ؛ حد روزانه هزینه (1.5-3 برابر سقف قرارداد؛ باعث افزایش نرخ + هشدار) ؛ سوئیچ های خاموش در هزینه z-score > 4 (توقف خودکار + صفحه در تماس). الگوهای انتساب: برچسب و جمع آوری، همراهی از تله متری (تراسک ID → صورتحساب؛ بالاترین دقت) ، نمونه گیری و استخراج، اختصاص مبتنی بر مدل، منبع رویداد، پخش در زمان واقعی. متریک واحد: هزینه در هر سوال حل شده، هزینه در هر آرتیفکت تولید شده نه توکن $/M. برچسب گذاری بازخودی همیشه از دست می رود؛ ابزار ایجاد در صورت درخواست.Type: Learn
Languages: Python (stdlib, toy cost-attribution simulator with kill switch)
Prerequisites: Phase 17 · 13 (Observability), Phase 17 · 14 (Caching)
Time: ~60 minutes
اهداف یادگیری
- توضیح دهید که چرا FinOps سنتی (تگ ها + سطوح) در هزینه های LLM شکسته و سه ابعاد جدید اختصاص را نام دهید.
- چهار لایه رمزنگاری (سریع، ابزار، حافظه، پاسخ) را لیست کنید و چرا صورتحساب یک سطل هزینه را پنهان می کند.
- یک پله اجرای (سعر → محدودیت هزینه → سوئیچ کشتن) برای یک محصول چند مستاجر طراحی کنید.
- یک واحد متریک ( هزینه در هر سوال حل شده / آرتیفاکت) را به جای توکن های $ / M انتخاب کنید.
مشکل
صورت حسابت ۴۰ هزار دلار ميگه
- اون مستاجر چي بود که خرجش کرد
- چه ویژگی محصولی باعث شد
- اینکه آیا هر کاربر فردی به خشونت رسانی مرتکب شده است.
- چه به سرعت بلوت، تماس ابزار، یا تقویت حافظه گناهکار بود.
برچسب و جمع آوری در طرف ارائه دهنده برای منابع ابر (EC2 ، S3) کار می کند که در آن برچسب ها به موارد خط گسترش می یابد. تماس های LLM API به طور خودکار برچسب نمی شوند.
مفهوم
سه ابعاد اختصاصی
Per-user(user_id): چه کسی چه هزینه ای دارد. قیمت صندلی ها را تعیین می کند، مکالمات گسترش را انجام می دهد، کاربران برق را شناسایی می کند.
Per-task(task_id+ routeدرایو ها دارای اولویت بندی، تصمیم گیری های مرگ و میر-مفت هزینه.
Per-tenant(tenant_id): کدام مشتری سودآور است. اقتصاد واحد، قیمت تجدید، حد سطح را هدایت می کند.
سه تا ابزار در موقع تماس در روز اول
چهار لایه رمز
| Layer | Example | Typical % of total |
|---|---|---|
| Prompt | system + user input | 40-60% |
| Tool | tool-call results fed back | 20-40% (agent workloads) |
| Memory | prior conversation / retrieved docs | 10-30% |
| Response | model output | 10-30% |
با هم جمع کردن چهار مورد باعث می شود بهینه سازی کور شود. آنها را در طرح انتساب خود تجزیه کنید.
پله اجرای
- Rate limitهر کس که به اجاره رفته، دو تا سه برابر حداکثر انتظارش رو داره
Retry-After. کرایه دار در مقابل تعریق می بیند ، هیچ فروزه ای نیست
- Daily spend capهر کس که مستاجر هست، 1.5-3 برابر سقف قرارداد شده است. محرک: حد نرخ تشدید + هشدار به موفقیت مشتری.
- Kill switchدر هزینه ز-نمره > 4 نسبت به خط اصلی مستاجر. خود مختار توقف مستاجر؛ صفحه در تماس؛ افزایش به عملیات + CS.
الگوهای انتساب
- Tag-and-aggregate: سرپرستی متاداتا؛ جمع آوری بعد. ساده؛ خشن.
- Telemetry joiner: از طریق شناسه های ردیابی، ردیابی را به صورت صورت صورتحساب متصل کنید.
- Sampling + extrapolation: نمونه 5-10% ضرب. هزینه موثر برای هزینه های خشن؛ رد می کند.
- Model-based allocation: بازگشت به نتیجه گیری راننده هزینه. برای داده های قدیمی بدون برچسب.
- Event-sourced: هزینه به عنوان رویدادهای در یک جریان (Kafka / Kinesis).
- Real-time streaming: بروز رسانی های داشبورد زیر ثانیه
هزینه در هر X واحد متریک است
توکن های $/M حرف فروشنده است.
- هزینه هر بلیط پشتیبانی حل شده
- هزینه هر ماده تولید شده
- هزینه هر وظیفه موفق مامور
- هزینه در هر دقیقه جلسه کاربر
هزینه را با نتیجه محصول مرتبط کنید، در غیر این صورت بهینه سازی غیرقابل تایید است.
شکل ردیابی نسبت هزینه
trace_id: abc123
user_id: u_42
tenant_id: t_7
task_id: task_classify_doc
route: model_haiku
layers:
prompt_tokens: 1800
tool_tokens: 600
memory_tokens: 400
response_tokens: 150
cost_usd: 0.0135
cached_input: true
batch: falseهر تماس رو ارسال کن، در دریاچه داده ها نگه دار، به هر ابعاد جمع کن، مرحله 17 · 13 استیک مشاهده ای جایی است که این زندگی می کند.
مخزن مخلوط پس انداز
ستک: کش + دسته + مسیر + دروازه. با همه چهار:
- Cache L2 (فاز 17 · 14): ~ 10 برابر ارزان تر ورودی.
- دسته (فاز 17 · 15): 50 درصد تخفیف
- مسیر به مدل ارزان (فاز 17 · 16): کاهش هزینه 60٪
- بهره وری دروازه (فاز 17 · 19): تخفیف + تلاش مجدد.
بهترین موارد: 5-10% از خط پایه ساده. اکثر تیم ها 2-3 اهرم را درگیر می کنند؛ تعداد کمی همه چهار را جمع می کنند.
شماره هایی که باید به یاد داشته باشی
- ابعاد اختصاص: به هر کاربر، به هر وظیفه، به هر مستاجر.
- چهار لایه رمز: پرامپ، ابزار، حافظه، پاسخ.
- کلید کشتن: از نظر امتیاز z> 4 استفاده کنید.
- متریک واحد: هزینه برای هر سوال حل شده، نه توکن $/M.
- بهینه سازی های دسته بندی شده: ~ 5-10% از خط پایه ممکن است.
ازش استفاده کن
code/main.pyیک سرویس LLM چند مستاجر را با سه سطح پله اجرای شبیه سازی می کند. یک مستاجر بدسلوکی را تزریق می کند و نشان می دهد که کلید کشتن شلیک می کند.
-باده
این درس به ما کمک می کندoutputs/skill-finops-plan.md. با توجه به محصول و مقیاس، طرح طرح اختصاص و پله اجرای را طراحی می کند.
تمرینات
- فرار کن
code/main.py. در چه نقطه ای سوئیچ کشتن میگیرن؟ - يه داشبورد هزینه هاي هر مزرعه رو تصميم بدي اول 5 تا منظره چي مي سازي؟
- بزرگترین مستاجر شما اقتصاد واحد منفی است پیشنهاد سه مداخلات را به ترتیب تاثیر مشتری ارائه دهید
- هزینه هر بلیط حل شده برای یک محصول پشتیبانی محاسبه کنید: 3M توکن/ بلیط، ~800 بلیط/روز، نرخ ذخیره شده GPT-5.
- بحث کنید که آیا برچسب گذاری برگشت پذیری می تواند تا به حال کار کند.
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| Per-user attribution | "user-level cost" | user_id stamped on every call |
| Per-task attribution | "feature cost" | task_id + route identify product surface |
| Per-tenant attribution | "customer cost" | tenant_id; drives unit economics |
| Four token layers | "cost layers" | prompt + tool + memory + response |
| Rate limit | "429 guard" | Per-tenant ceiling enforced at gateway |
| Daily spend cap | "daily ceiling" | Tenant-scoped budget with alert |
| Kill switch | "auto-pause" | Spend z-score > 4 triggers auto-suspension |
| Cost per resolved | "product unit metric" | Cost tied to product outcome, not tokens |
| Telemetry joiner | "trace-to-billing" | Highest-accuracy attribution pattern |
| Stacked optimization | "cache+batch+route+gateway" | Compounding savings to ~5-10% baseline |
خواندن بیشتر
- FinOps Foundation — FinOps for AI Overview
- FinOps School — Cost per Unit 2026 Guide
- Digital Applied — LLM Agent Cost Attribution 2026
- PointFive — Managed LLMs in Azure OpenAI
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.