اقتصاد پلتفرم های تعبیر آتش بازی، با هم، باستین، مودال، تکرار، هر مقیاس
Type: Learn
Languages: Python (stdlib, toy per-call economics comparator)
Prerequisites: Phase 17 · 01 (Managed LLM Platforms), Phase 17 · 04 (Serving Engine Internals)
Time: ~60 minutes
اهداف یادگیری
- سه بخش بازار را نام دهید (سیلیکون سفارشی، پلتفرم های GPU، API-اول) و هر فروشنده را به یک بخش نقشه بزنید.
- توضیح دهید که چرا مدل قیمت گذاری API "به صورت هر توکن" به جهت منحنی هزینه موتور خدمت کننده فشرده می شود نه به سمت منحنی قیمت سخت افزار.
- هزینه های موثر را در هر درخواست در حداقل سه فروشنده محاسبه کنید و توضیح دهید که در هر دقیقه (Baseten، Modal) در هر توکن چه زمانی می شود.
- مشخص کنید که کدام سیستم عامل برای یک بار کاری مشخص (سرور بدون انفجار، تولید بالا ثابت، انواع دقیق، چند حالت) مناسب است.
مشکل
شما ارزیابی سیستم عامل های مدیریت شده هایپرسکلر. شما تصمیم گرفتید که شما نیاز به یک ارائه دهنده باریک تر و سریع تر دارید آتشفشان برای تاخیر، با هم برای عرض، Baseten برای یک مدل سفارشی دقیق. حالا شما شش گزینه واقعی دارید و صفحات قیمت گذاری صف بندی نمی شوند. آتشفشان نشان می دهد $/M tokens; Baseten shows $/دقيقه؛ نمایش های مودا$/second; Replicate shows $بدون مدل کردن بار کار نمیتونی با هم مقایسه کنی
بدتر از همه، مدل کسب و کار پشت هر صفحه قیمت گذاری متفاوت است. آتشفشان موتور سفارشی خود را (FireAttention) در GPU های مشترک اجرا می کند؛ نرخ هر توکن منعکس کننده منحنی استفاده آنها است. باستین به شما GPU های اختصاصی Truss + می دهد؛ هر دقیقه انحصاری را منعکس می کند. Modal درست است Python serverless در ثانیه با شروع سرد زیر ثانیه. همان محصول (پاسخ LLM) ، سه عملکرد هزینه متفاوت.
این درس مدل شش را می سازد و می گوید هر کدام چه زمانی برنده می شوند.
مفهوم
سه بخش
Custom silicon Groq (LPU), Cerebras (WSE), SambaNova (RDU). معمولا 5-10 برابر سریعتر از یک کلستر مبتنی بر GPU در همان مدل رمزگذاری می شود. قیمت بالاتر در هر توکن (Groq در اواخر سال 2025 در Llama-70B ~ 0.99 $ / M بود) اما برای موارد استفاده حساس به تاخیر قابل پیروز نیست. Groq انتخاب تولید برای عوامل صوتی و ترجمه در زمان واقعی است.
GPU platforms Baseten, Together, Fireworks, Modal, Anyscale. روی NVIDIA (H100, H200, B200 در سال 2026) یا گاهی اوقات AMD اجرا می شود. لایه اقتصادی بین " اجاره GPU خام " (RunPod, Lambda) و " سرویس مدیریت هایپرکالر " (Bedrock) است.
API-first marketplaces تکرار، DeepInfra، OpenRouter، Fal. کاتالوگ گسترده، پرداخت در هر پیش بینی یا پرداخت در هر ثانیه، بر زمان اولین تماس تاکید کنید.
آتش بازی پلتفرم GPU بهینه سازی تاخیر
- موتور FireAttention (تعمیر) ؛ به عنوان 4 برابر کمتر از vLLM در پیکربندی های معادل در بازار عرضه می شود.
- سطح دسته در ~ 50% از نرخ بدون سرور برای بار کاری غیرمتقابل عمل.
- مدل دقیق به همان میزان مدل پایه یک تفاوت واقعی در مقابل ارائه دهندگان که هزینه ای برای LoRA خود را دریافت می کنند.
- اواسط سال 2026: افزایش اجاره GPU در صورت تقاضا 1 دلار / ساعت با اثر 1 مه 2026 . قیمت حجم قابل مذاکره در مقیاس.
- سیگنال مالی: ارزش گذاری 4 میلیارد دلار، 10T+ توکن در روز اداره می شود.
با هم بهینه سازی گسترده
- 200+ مدل از جمله انتشارات منبع باز در عرض چند روز از انتشار پیش از آن.
- 50-70% ارزان تر از نسخه های مشابه LLM موقعیت "AI Native Cloud" حجم و کاتالوگ است.
- تعبیر + تنظیم دقیق + آموزش در یک API
Baseten بهینه سازی برای شرکت ها
- چارچوب Truss: بسته بندی مدل با وابستگی ها، اسرار، خدمت کردن config در یک مانیف.
- GPU از T4 تا B200 با صورتحساب هر دقیقه با کاهش قابل ملاحظه ای شروع سرد
- SOC 2 نوع II، HIPAA آماده.
- $5B valuation, January 2026 Series E ($300 ميليون دلار از CapitalG، IVP، NVIDIA)
مودائل بهینه سازی بومی پایتون
- زیرساخت به عنوان کد در پایتون خالص. یک تابع را با
@modal.function(gpu="A100")و با یک فرمان به کار برسانید - صورتحساب در ثانیه. سرد شروع می شود 2-4s با پیش گرم کردن؛ <1s برای مدل های کوچک.
- $87M Series B at $1.1B ارزیابی (2025) قوی ترین امتیاز تجربه توسعه دهندگان در نظرسنجی های مستقل.
تکرار عرض چند مودالی
- پيش بيني پرداخت به صورت پيش بيني براي مدل هاي تصويري، ويديو و صوتی
- اکوسیستم های ادغام (زاپیر، ورسل، افزونه های CMS).
- در نرخ های LLM در هر توکن رقابت کمتری دارد اما در تنوع چند مودالی برنده می شود.
هر مقیاس تابش بومی
- ساخته شده بر روی ری؛ RayTurbo موتور استناد انحصاری Anyscale است (با vLLM رقابت می کند).
- بهترین برای بار کاری توزیع شده پایتون که مرحله نتیجه گیری یک گره در یک نمودار بزرگتر است.
- گروه های راي را مدیریت کرد، ادغام محکم با Ray AIR و Ray Serve
هر توکن در مقابل هر دقیقه وقتی هر کدام برنده می شوند
هر توکن وقتی کارش ضعیفی است و در حال تنفس است، فقط برای آنچه استفاده می کنید پول می دهید. هر دقیقه وقتی استفاده زیاد و قابل پیش بینی است، منطقی است.
قانون خشن: برای بار کاری بالاتر از ~ 30% استفاده پایدار از یک GPU اختصاصی، هر دقیقه (Baseten، Modal) شروع به ضرب هر توکن (Fireworks، Together) می کند. در زیر آن، هر توکن برنده می شود زیرا شما از پرداخت بیکار جلوگیری می کنید.
موتور سفارشی، خندق واقعی است
هر پلت فرم فوق vLLM و SGLang ادعا می کند موتور سفارشی دارد. FireAttention، RayTurbo، استیک نتیجه گیری Baseten. موتور سفارشی ادعا می کند که بازاریابی سایه است. چارچوب صادقانه این است که vLLM + SGLang حدود 80٪ از نتیجه گیری منبع باز تولید را نشان می دهد و متمایز کننده های لایه پلت فرم DX، انتساب و SLA هستند.
شماره هایی که باید به یاد داشته باشی
- اجاره گپيو هاي آتشفشان: 1 دلار افزایش 1 ساعت با اثر 1 مايو 2026
- ادعای آتش سوزی: 4 برابر کم تر از vLLM در پیکربندی های معادل.
- با هم: 50-70 درصد ارزان تر از Replicate در LLM
- ارزش گذاری پایه: $5B (Series E, Jan 2026, $300 ميتر دور)
- ارزش گذاری سرمایه: 1.1 میلیارد دلار (سلسلۀ B، 2025)
- ضربات در هر دقیقه در هر توکن بالاتر از ~ 30% استفاده پایدار.
ازش استفاده کن
code/main.pyمقایسه شش فروشنده در یک بار کاری مصنوعی در میان مدل های قیمت گذاری. گزارش ها $/day and effective $توکن هاي M رو اجرا کن تا بين هر توکن و هر دقيقه تعادل پيدا کني
-باده
این درس به ما کمک می کندoutputs/skill-inference-platform-picker.md. با توجه به پروفایل بار کاری، SLA و بودجه، پلتفرم اصلی نتیجه گیری را انتخاب می کند و نامزد دوم را می نامد.
تمرینات
- فرار کن
code/main.pyبا چه استفاده پایدار Baseten (در هر دقیقه) از آتش بازی (در هر توکن) برای یک مدل 70B در یک H100؟ - محصول شما تولید تصویر و چت و گفتار به متن را ارائه می دهد. برای هر روش پلتفرم را انتخاب کنید و الگوی دروازه ای را نام دهید که آنها را متحد می کند.
- آتش بازی ها قیمت ها را با یک دلار در ساعت در مورد مدل اصلی شما افزایش می دهد. مدل تاثیر هزینه های مخلوط را اگر 40٪ از ترافیک شما به سطح دسته (50٪ تخفیف) منتقل شود.
- یک مشتری تنظیم شده نیاز به GPU های اختصاصی SOC 2 نوع II + HIPAA + دارد. کدام سه پلت فرم قابل اجرا هستند و کدام یک در FinOps برنده می شوند؟
- با قیمت هر 1000 پیش بینی برای Llama 3.1 70B در Fireworks serverless، Together on demand، Baseten dedicated و Replicate API مقایسه کنید. کدام پیش بینی در 10 پیش بینی در روز ارزان تر است؟ در 10,000؟
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| Custom silicon | "non-GPU chips" | Groq LPU, Cerebras WSE, SambaNova RDU — optimized for decode |
| FireAttention | "Fireworks engine" | Custom attention kernel; marketed at 4x lower latency than vLLM |
| Truss | "Baseten's format" | Model packaging manifest; dependencies + secrets + serving config |
| Per-token | "API pricing" | Charge by tokens consumed; pay for no idle |
| Per-minute | "dedicated pricing" | Charge by wall-clock GPU time; wins at high utilization |
| Per-prediction | "Replicate pricing" | Charge per model invocation; common for image/video |
| RayTurbo | "Anyscale engine" | Proprietary inference on Ray; competes with vLLM on Ray clusters |
| Batch tier | "50% off" | Non-interactive queue at reduced rate; common on Fireworks, OpenAI |
| Fine-tuned at base rate | "Fireworks LoRA" | Charge LoRA-served requests at base model's rate (differentiator) |
خواندن بیشتر
- Fireworks Pricing نرخ هر توکن، سطح دسته، اجاره GPU
- Baseten Pricing نرخ هر دقیقه، ظرفیت تعهد، سطوح شرکت.
- Modal Pricing سرعت GPU در ثانیه و سطح آزاد
- Together AI Pricing کتاگ مدل و نرخ هر توکن
- Anyscale Pricing ری توربو و مدیریت قیمت گذاری ری
- Northflank — Fireworks AI Alternatives ارزیابی مقایسه ای
- Infrabase — AI Inference API Providers 2026 منظره فروشنده
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.