التدريبات النهائية للدرجات العليا اقتصاد الوحدة وتخصيص المستأجرين المتعددين
user_id) لتحديد أسعار المقاعد وتوسيعها، لكل مهمة (task_id+ route) لتكلفة سطح المنتج وتحديد الأولويات، لكل مستأجر (tenant_id) للاقتصاد الوحدية والتجديد. أربعة طبقات رمزية التسجيل، الأداة، الذاكرة، الاستجابة تنفق علبة واحدة تخفي. سلم التنفيذ للمنتجات متعددة المستأجرين: حدود أسعار المستأجرين (2-3x ذروة متوقعة، 429 + إعادة التجربة بعد التنفيذ) ؛ حد الإنفاق اليومي (1.5-3x السقف المشترك؛ محفزات التشديد + التحذير؛ أيقاف التبديلات على النفقات + 4 (توقف تلقائي + صفحة على الدعوة). أنماط التخصيص: التجديد والجمع، المشترك في التلفاز (التتبع-الجهاز التعرفي → الفواتير؛ أعلى دقة) ، أخذ العينات واستقطابها، وتخصيص القائم على النموذج، ومصدر الأحداث، وتداول في الوقت الحقيقي. مقياس الوحدة: تكلفة لكل استفسار حل، تكلفة لكل عنصر تم إنشاؤه لا توكنات $/M. التسمية الاحتياطية دائماً تفتقر؛ أداة بناء على الطلب.Type: Learn
Languages: Python (stdlib, toy cost-attribution simulator with kill switch)
Prerequisites: Phase 17 · 13 (Observability), Phase 17 · 14 (Caching)
Time: ~60 minutes
أهداف التعلم
- شرح لماذا تقع التطبيقات التقليدية في فن أوب (التوابل + المستويات) على الإنفاق على ماجستير في إدارة الأعمال وتسمية الأبعاد الثلاثة الجديدة للتخصيص.
- قم بإدراج أربعة طبقات الرمز (السرعة، الأداة، الذاكرة، الاستجابة) ولماذا تكلفة الفواتير الواحدة الباقي تخفي.
- تصميم سلم التنفيذ (سعر → حد الإنفاق → مبدل قتل) لمنتج متعدد المستأجرين.
- اختر مقياس الوحدة (تكلفة لكل استفسار / عنصر حل) بدلا من رموز $ / M.
المشكلة
فاتورتك تقول 40 ألف دولار
- أي مستأجر أنفقها
- أي ميزة منتج قادتها.
- ما إذا كان أي مستخدم فردي كان إساءة.
- سواء كان التورم السريع، أو مكالمات الأدوات، أو تعزيز الذاكرة هو المذنب.
تعمل التسمية والجمع على جانب المقدم للموارد السحابية (EC2 ، S3) حيث تتكاثر التسميات إلى عناصر الخط. لا يتم تسمية مكالمات LLM API تلقائيًا عليك ختم المستخدم / المهمة / المستأجر في موقع الدعوة والتحمل. تخصيص التراجعية يفوت دائمًا الحالات الحافة.
المفهوم
ثلاثة أبعاد التخصيص
Per-user(user_id): من الذي يكلف ما. يقود أسعار المقاعد، محادثات التوسع، تحديد مستخدمي الطاقة.
Per-task(task_id+ route): أي سطح المنتج ما تكلفة.
Per-tenant(tenant_id): أي عميل مربح. يدير اقتصاد الوحدة، تسعير التجديد، عتبة المستويات.
أداة كلّ الثلاثة في موقع المكالمة في اليوم الأول
أربعة طبقات رمزية
| Layer | Example | Typical % of total |
|---|---|---|
| Prompt | system + user input | 40-60% |
| Tool | tool-call results fed back | 20-40% (agent workloads) |
| Memory | prior conversation / retrieved docs | 10-30% |
| Response | model output | 10-30% |
إضافة كلّ الأربعة معاً تجعل التكيف أعمى. فكّرهم في مخطط التخصيص الخاص بك.
سلم التنفيذ
- Rate limitفي المستأجرين، 2-3x المتوقع ذروة. العودة 429 مع
Retry-Afterالمستأجر يرى الاحتكاك، لا فاتورة مفاجأة.
- Daily spend capالسقف المشترك 1.5-3x، المحفز: حد حد السعر + تحذير نجاح العميل.
- Kill switchعلى النتائج الز-نسبة > 4 بالنسبة لمستأجر القاعدة. توقف تلقائي المستأجر؛ الصفحة على المكالمة؛ تصاعد إلى عمليات + CS.
أنماط التخصيص
- Tag-and-aggregate: العناوين البيانات المعدنية البطاقة؛ جمعها لاحقا. بسيطة؛ قاسية.
- Telemetry joiner: إضافة أثر إلى الفواتير عبر أوراق تعريف أثر أعلى دقة. ما تقوم به فرق ناضجة.
- Sampling + extrapolation: العينة 5-10% ، مضاعفة. فعالة من حيث التكلفة لإنفاق قاسي.
- Model-based allocation: التراجع لإستعراض مدفع التكلفة. للبيانات القديمة دون علامات.
- Event-sourced: التكلفة كحدث في تيار (Kafka / Kinesis).
- Real-time streaming: تحديثات لوحة التحكم في الفرق الثانية.
تكلفة لكل X هي المقياس الوحد
الـ $/M هو الـ "بيع الكلام"
- تكلفة كل تذكرة دعم حل
- تكلفة كل مادة تم إنتاجها
- تكلفة لكل مهمة من العملاء الناجحين
- تكلفة لكل دقيقة من جلسة المستخدم
ربط التكلفة بالنتائج المنتجية وإلا فإن التحسين غير متكامل
شكل تعقب إصدار التكلفة
trace_id: abc123
user_id: u_42
tenant_id: t_7
task_id: task_classify_doc
route: model_haiku
layers:
prompt_tokens: 1800
tool_tokens: 600
memory_tokens: 400
response_tokens: 150
cost_usd: 0.0135
cached_input: true
batch: falseإصدار في كل مكالمة. تخزين في بحيرة البيانات. جمع لكل بعد. مرحلة 17 · 13 كومة ملاحظة هو حيث يعيش هذا.
كومة التوفيرات المركبة
كومة: الاحتفاظ + الحزمة + الطريق + البوابة. مع كل أربعة:
- الاحتفاظ L2 (مرحلة 17 · 14): ~ 10 مرات أدخول أرخص.
- الحزمة (المرحلة 17 · 15): خصم بنسبة 50٪.
- الطريق إلى النموذج الرخيص (مرحلة 17 · 16): تخفيض تكلفة 60٪.
- كفاءة البوابة (مرحلة 17 · 19): إفراط + محاولات إعادة.
أفضل حالة تم تجميعها: ~ 5-10٪ من خط الأساس البديل. معظم الفرق لديها 2-3 مؤامرات مصروفة؛ قلة تجميع كل أربعة.
أرقام يجب أن تتذكر
- أبعاد التخصيص: لكل مستخدم، لكل مهمة، لكل مستأجر.
- أربعة طبقات رمزية: الإستعلام، الأداة، الذاكرة، الاستجابة.
- أطفئ المفتاح: إضافة نقطة z > 4.
- مقياس الوحدة: تكلفة لكل استفسار حل، وليس رموز $/M.
- تحسينات متزايدة: ~ 5-10٪ من خط الأساس ممكن.
استخدمها
code/main.pyيحاكي خدمة القانون لعدة مستأجرين مع سلم التنفيذ ثلاث مستويات. يحقق مستأجرًا يسيء الإستجابة ويعرض إطلاق النار على مفتاح القتل.
أرسله
هذا الدرس يُنتجoutputs/skill-finops-plan.md. مع إعطاء المنتج والقياس، تصميم مخطط التخصيص وسلسلة التنفيذ.
التمارين
- أركض
code/main.pyفي أي نقطة يطلق المفتاح القاتل؟ كيف تحدد العد؟ - تصميم لوحة تحديد تكاليف المستأجر الواحد، ما هي المشاهد الخمسة التي تقوم ببناءها أولاً؟
- أكبر مستأجر لديك هو إقتصاد وحدة سلبي اقترح ثلاث تدخلات حسب تأثير العملاء
- حساب تكلفة كل تذكرة حل لمنتج دعم: 3M توكنات/تذكرة، ~800 تذكرة/يوم، GPT-5 سعر مخزن.
- تحدّثوا عن ما إذا كان التسمية التأجيلية يمكن أن تعمل يوماً ما. متى يكون مقبولًا؟
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| Per-user attribution | "user-level cost" | user_id stamped on every call |
| Per-task attribution | "feature cost" | task_id + route identify product surface |
| Per-tenant attribution | "customer cost" | tenant_id; drives unit economics |
| Four token layers | "cost layers" | prompt + tool + memory + response |
| Rate limit | "429 guard" | Per-tenant ceiling enforced at gateway |
| Daily spend cap | "daily ceiling" | Tenant-scoped budget with alert |
| Kill switch | "auto-pause" | Spend z-score > 4 triggers auto-suspension |
| Cost per resolved | "product unit metric" | Cost tied to product outcome, not tokens |
| Telemetry joiner | "trace-to-billing" | Highest-accuracy attribution pattern |
| Stacked optimization | "cache+batch+route+gateway" | Compounding savings to ~5-10% baseline |
المزيد من القراءة
- FinOps Foundation — FinOps for AI Overview
- FinOps School — Cost per Unit 2026 Guide
- Digital Applied — LLM Agent Cost Attribution 2026
- PointFive — Managed LLMs in Azure OpenAI
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.