Phase 17: Infrastructure & Production

اقتصاد پلتفرم های تعبیر آتش بازی، با هم، باستین، مودال، تکرار، هر مقیاس

بازار نتیجه گیری 2026 دیگر اجاره زمان GPU نیست. این به سیلیکون سفارشی (Groq، Cerebras، SambaNova) ، سیستم عامل های GPU (Baseten، Together، Fireworks، Modal) و بازار های API-اول (Replicate، DeepInfra) تقسیم می شود. آتش بازی قیمت را افزایش می دهد $1/hr per GPU on May 1, 2026, and $ارزش گذاری 4B در 10T+ توکن/روز به شما نشان می دهد که مدل حجم محرک کار می کند.$300M Series E at $5B در ژانویه 2026 قانون موقعیت گذاری رقابتی ساده است: آتش بازی بهینه سازی تاخیر، با هم بهینه سازی گسترده کتالوگ، Baseten بهینه سازی شرکت پالش، Modal بهینه سازی پایتون بومی DX، تکرار بهینه سازی دسترسی چند مدل، Anyscale بهینه سازی توزیع پایتون. این درس به شما یک ماتریس می دهد که شما می توانید به یک بنیان گذار.

Type: Learn

Languages: Python (stdlib, toy per-call economics comparator)

Prerequisites: Phase 17 · 01 (Managed LLM Platforms), Phase 17 · 04 (Serving Engine Internals)

Time: ~60 minutes

اهداف یادگیری

  • سه بخش بازار را نام دهید (سیلیکون سفارشی، پلتفرم های GPU، API-اول) و هر فروشنده را به یک بخش نقشه بزنید.
  • توضیح دهید که چرا مدل قیمت گذاری API "به صورت هر توکن" به جهت منحنی هزینه موتور خدمت کننده فشرده می شود نه به سمت منحنی قیمت سخت افزار.
  • هزینه های موثر را در هر درخواست در حداقل سه فروشنده محاسبه کنید و توضیح دهید که در هر دقیقه (Baseten، Modal) در هر توکن چه زمانی می شود.
  • مشخص کنید که کدام سیستم عامل برای یک بار کاری مشخص (سرور بدون انفجار، تولید بالا ثابت، انواع دقیق، چند حالت) مناسب است.

مشکل

شما ارزیابی سیستم عامل های مدیریت شده هایپرسکلر. شما تصمیم گرفتید که شما نیاز به یک ارائه دهنده باریک تر و سریع تر دارید آتشفشان برای تاخیر، با هم برای عرض، Baseten برای یک مدل سفارشی دقیق. حالا شما شش گزینه واقعی دارید و صفحات قیمت گذاری صف بندی نمی شوند. آتشفشان نشان می دهد $/M tokens; Baseten shows $/دقيقه؛ نمایش های مودا$/second; Replicate shows $بدون مدل کردن بار کار نمیتونی با هم مقایسه کنی

بدتر از همه، مدل کسب و کار پشت هر صفحه قیمت گذاری متفاوت است. آتشفشان موتور سفارشی خود را (FireAttention) در GPU های مشترک اجرا می کند؛ نرخ هر توکن منعکس کننده منحنی استفاده آنها است. باستین به شما GPU های اختصاصی Truss + می دهد؛ هر دقیقه انحصاری را منعکس می کند. Modal درست است Python serverless در ثانیه با شروع سرد زیر ثانیه. همان محصول (پاسخ LLM) ، سه عملکرد هزینه متفاوت.

این درس مدل شش را می سازد و می گوید هر کدام چه زمانی برنده می شوند.

مفهوم

سه بخش

Custom silicon Groq (LPU), Cerebras (WSE), SambaNova (RDU). معمولا 5-10 برابر سریعتر از یک کلستر مبتنی بر GPU در همان مدل رمزگذاری می شود. قیمت بالاتر در هر توکن (Groq در اواخر سال 2025 در Llama-70B ~ 0.99 $ / M بود) اما برای موارد استفاده حساس به تاخیر قابل پیروز نیست. Groq انتخاب تولید برای عوامل صوتی و ترجمه در زمان واقعی است.

GPU platforms Baseten, Together, Fireworks, Modal, Anyscale. روی NVIDIA (H100, H200, B200 در سال 2026) یا گاهی اوقات AMD اجرا می شود. لایه اقتصادی بین " اجاره GPU خام " (RunPod, Lambda) و " سرویس مدیریت هایپرکالر " (Bedrock) است.

API-first marketplaces تکرار، DeepInfra، OpenRouter، Fal. کاتالوگ گسترده، پرداخت در هر پیش بینی یا پرداخت در هر ثانیه، بر زمان اولین تماس تاکید کنید.

آتش بازی پلتفرم GPU بهینه سازی تاخیر

  • موتور FireAttention (تعمیر) ؛ به عنوان 4 برابر کمتر از vLLM در پیکربندی های معادل در بازار عرضه می شود.
  • سطح دسته در ~ 50% از نرخ بدون سرور برای بار کاری غیرمتقابل عمل.
  • مدل دقیق به همان میزان مدل پایه یک تفاوت واقعی در مقابل ارائه دهندگان که هزینه ای برای LoRA خود را دریافت می کنند.
  • اواسط سال 2026: افزایش اجاره GPU در صورت تقاضا 1 دلار / ساعت با اثر 1 مه 2026 . قیمت حجم قابل مذاکره در مقیاس.
  • سیگنال مالی: ارزش گذاری 4 میلیارد دلار، 10T+ توکن در روز اداره می شود.

با هم بهینه سازی گسترده

  • 200+ مدل از جمله انتشارات منبع باز در عرض چند روز از انتشار پیش از آن.
  • 50-70% ارزان تر از نسخه های مشابه LLM موقعیت "AI Native Cloud" حجم و کاتالوگ است.
  • تعبیر + تنظیم دقیق + آموزش در یک API

Baseten بهینه سازی برای شرکت ها

  • چارچوب Truss: بسته بندی مدل با وابستگی ها، اسرار، خدمت کردن config در یک مانیف.
  • GPU از T4 تا B200 با صورتحساب هر دقیقه با کاهش قابل ملاحظه ای شروع سرد
  • SOC 2 نوع II، HIPAA آماده.
  • $5B valuation, January 2026 Series E ($300 ميليون دلار از CapitalG، IVP، NVIDIA)

مودائل بهینه سازی بومی پایتون

  • زیرساخت به عنوان کد در پایتون خالص. یک تابع را با @modal.function(gpu="A100")و با یک فرمان به کار برسانید
  • صورتحساب در ثانیه. سرد شروع می شود 2-4s با پیش گرم کردن؛ <1s برای مدل های کوچک.
  • $87M Series B at $1.1B ارزیابی (2025) قوی ترین امتیاز تجربه توسعه دهندگان در نظرسنجی های مستقل.

تکرار عرض چند مودالی

  • پيش بيني پرداخت به صورت پيش بيني براي مدل هاي تصويري، ويديو و صوتی
  • اکوسیستم های ادغام (زاپیر، ورسل، افزونه های CMS).
  • در نرخ های LLM در هر توکن رقابت کمتری دارد اما در تنوع چند مودالی برنده می شود.

هر مقیاس تابش بومی

  • ساخته شده بر روی ری؛ RayTurbo موتور استناد انحصاری Anyscale است (با vLLM رقابت می کند).
  • بهترین برای بار کاری توزیع شده پایتون که مرحله نتیجه گیری یک گره در یک نمودار بزرگتر است.
  • گروه های راي را مدیریت کرد، ادغام محکم با Ray AIR و Ray Serve

هر توکن در مقابل هر دقیقه وقتی هر کدام برنده می شوند

هر توکن وقتی کارش ضعیفی است و در حال تنفس است، فقط برای آنچه استفاده می کنید پول می دهید. هر دقیقه وقتی استفاده زیاد و قابل پیش بینی است، منطقی است.

قانون خشن: برای بار کاری بالاتر از ~ 30% استفاده پایدار از یک GPU اختصاصی، هر دقیقه (Baseten، Modal) شروع به ضرب هر توکن (Fireworks، Together) می کند. در زیر آن، هر توکن برنده می شود زیرا شما از پرداخت بیکار جلوگیری می کنید.

موتور سفارشی، خندق واقعی است

هر پلت فرم فوق vLLM و SGLang ادعا می کند موتور سفارشی دارد. FireAttention، RayTurbo، استیک نتیجه گیری Baseten. موتور سفارشی ادعا می کند که بازاریابی سایه است. چارچوب صادقانه این است که vLLM + SGLang حدود 80٪ از نتیجه گیری منبع باز تولید را نشان می دهد و متمایز کننده های لایه پلت فرم DX، انتساب و SLA هستند.

شماره هایی که باید به یاد داشته باشی

  • اجاره گپيو هاي آتشفشان: 1 دلار افزایش 1 ساعت با اثر 1 مايو 2026
  • ادعای آتش سوزی: 4 برابر کم تر از vLLM در پیکربندی های معادل.
  • با هم: 50-70 درصد ارزان تر از Replicate در LLM
  • ارزش گذاری پایه: $5B (Series E, Jan 2026, $300 ميتر دور)
  • ارزش گذاری سرمایه: 1.1 میلیارد دلار (سلسلۀ B، 2025)
  • ضربات در هر دقیقه در هر توکن بالاتر از ~ 30% استفاده پایدار.

ازش استفاده کن

code/main.pyمقایسه شش فروشنده در یک بار کاری مصنوعی در میان مدل های قیمت گذاری. گزارش ها $/day and effective $توکن هاي M رو اجرا کن تا بين هر توکن و هر دقيقه تعادل پيدا کني

-باده

این درس به ما کمک می کندoutputs/skill-inference-platform-picker.md. با توجه به پروفایل بار کاری، SLA و بودجه، پلتفرم اصلی نتیجه گیری را انتخاب می کند و نامزد دوم را می نامد.

تمرینات

  1. فرار کنcode/main.pyبا چه استفاده پایدار Baseten (در هر دقیقه) از آتش بازی (در هر توکن) برای یک مدل 70B در یک H100؟
  2. محصول شما تولید تصویر و چت و گفتار به متن را ارائه می دهد. برای هر روش پلتفرم را انتخاب کنید و الگوی دروازه ای را نام دهید که آنها را متحد می کند.
  3. آتش بازی ها قیمت ها را با یک دلار در ساعت در مورد مدل اصلی شما افزایش می دهد. مدل تاثیر هزینه های مخلوط را اگر 40٪ از ترافیک شما به سطح دسته (50٪ تخفیف) منتقل شود.
  4. یک مشتری تنظیم شده نیاز به GPU های اختصاصی SOC 2 نوع II + HIPAA + دارد. کدام سه پلت فرم قابل اجرا هستند و کدام یک در FinOps برنده می شوند؟
  5. با قیمت هر 1000 پیش بینی برای Llama 3.1 70B در Fireworks serverless، Together on demand، Baseten dedicated و Replicate API مقایسه کنید. کدام پیش بینی در 10 پیش بینی در روز ارزان تر است؟ در 10,000؟

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
Custom silicon"non-GPU chips"Groq LPU, Cerebras WSE, SambaNova RDU — optimized for decode
FireAttention"Fireworks engine"Custom attention kernel; marketed at 4x lower latency than vLLM
Truss"Baseten's format"Model packaging manifest; dependencies + secrets + serving config
Per-token"API pricing"Charge by tokens consumed; pay for no idle
Per-minute"dedicated pricing"Charge by wall-clock GPU time; wins at high utilization
Per-prediction"Replicate pricing"Charge per model invocation; common for image/video
RayTurbo"Anyscale engine"Proprietary inference on Ray; competes with vLLM on Ray clusters
Batch tier"50% off"Non-interactive queue at reduced rate; common on Fireworks, OpenAI
Fine-tuned at base rate"Fireworks LoRA"Charge LoRA-served requests at base model's rate (differentiator)

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.