इन्फरेन्स प्लेटफॉर्म इकोनॉमिक्स आतिशबाजी, साथ में, बेसेट, मॉडल, प्रतिकृति, किसी भी पैमाने पर
Type: Learn
Languages: Python (stdlib, toy per-call economics comparator)
Prerequisites: Phase 17 · 01 (Managed LLM Platforms), Phase 17 · 04 (Serving Engine Internals)
Time: ~60 minutes
सीखने के लक्ष्य
- तीन बाजार खंडों (कस्टम सिलिकॉन, GPU प्लेटफार्म, API-first) का नाम दें और प्रत्येक विक्रेता को एक खंड में मानचित्रित करें।
- बताएं कि "प्रति टोकन" एपीआई मूल्य निर्धारण मॉडल सेवा इंजन की लागत वक्र की ओर क्यों संपीड़ित होता है, हार्डवेयर की नहीं।
- कम से कम तीन विक्रेताओं के प्रति अनुरोध प्रभावी लागत की गणना करें और बताएं कि प्रति मिनट (बेस्टेन, मॉडल) प्रति टोकन कब होता है।
- किसी दिए गए कार्यभार के लिए कौन सा प्लेटफॉर्म सही डिफ़ॉल्ट है (सेवरलेस फट, स्थिर उच्च-प्रोफ्यूट, ठीक-ट्यून किए गए वेरिएंट, मल्टीमोडल) की पहचान करें।
समस्या
आपने प्रबंधित हाइपरस्केलर प्लेटफार्मों का मूल्यांकन किया। आपने फैसला किया कि आपको एक संकीर्ण, तेज़ प्रदाता की आवश्यकता है विलंबता के लिए फायरवॉक्स, चौड़ाई के लिए एक साथ, एक बारीकी से समायोजित कस्टम मॉडल के लिए बासेटन। अब आपके पास छह वास्तविक विकल्प हैं और मूल्य निर्धारण पृष्ठ लाइन नहीं हैं। फायरवॉक्स दिखाता है $/M tokens; Baseten shows $/मिनट; मोडल शो $/second; Replicate shows $आप काम के भार का मॉडल बिना उन्हें सिर से सिर की तुलना नहीं कर सकते.
इससे भी बदतर, प्रत्येक मूल्य निर्धारण पृष्ठ के पीछे का व्यवसाय मॉडल अलग है। आतिशबाजी साझा जीपीयू पर अपना स्वयं का कस्टम इंजन (फायरएटेंशन) चलाती है; प्रति टोकन दर उनके उपयोग वक्र को दर्शाता है। Baseten आपको Truss + समर्पित GPUs देता है; प्रति मिनट विशेषता को दर्शाता है। मोडल सच है पायथन सर्वरलेस प्रति सेकंड बिलिंग उप-सेकंड ठंड शुरू के साथ। एक ही आउटपुट (एलएलएम प्रतिक्रिया), तीन अलग-अलग लागत कार्य।
यह पाठ छक्के का मॉडल है और आपको बताता है कि प्रत्येक कब जीतता है।
अवधारणा
तीनों खंड
Custom silicon Groq (LPU), Cerebras (WSE), SambaNova (RDU). आमतौर पर एक ही मॉडल पर GPU- आधारित क्लस्टर की तुलना में 5-10 गुना तेज़ डिकोड। उच्च प्रति टोकन मूल्य (Llama-70B पर Groq ~ $ 0.99 / M था 2025) लेकिन लटेंसी-संवेदनशील उपयोग मामलों के लिए अपराजेय है। Groq वॉयस एजेंटों और वास्तविक समय अनुवाद के लिए उत्पादन विकल्प है।
GPU platforms बेसटन, एक साथ, फायरवर्क, मोडल, Anyscale. एनवीआईडीआईए (एच 100, एच 200, बी 200 में 2026) या कभी-कभी एएमडी पर चलाएं। "कच्चे जीपीयू किराए पर लेने" (रनपॉड, लैम्ब्डा) और "हाइपरस्केल प्रबंधित सेवा" (बेड्रॉक) के बीच आर्थिक परत।
API-first marketplaces प्रतिकृति, डीपइन्फ्रा, ओपनरॉटर, फाल. व्यापक कैटलॉग, प्रति-अनुमान या प्रति-सेकंड भुगतान, समय-से-पहली कॉल पर जोर दें।
आतिशबाजी लटेंसी-ऑप्टिमाइज़्ड जीपीयू प्लेटफॉर्म
- FireAttention इंजन (कस्टम); समकक्ष कॉन्फ़िग पर vLLM की तुलना में 4 गुना कम लटेंसी के रूप में विपणन किया जाता है।
- गैर-आंतरिक कार्यभार के लिए सर्वर रहित दर के ~50% पर बैच स्तर।
- ठीक-ठीक मॉडल मूल मॉडल के समान दर पर सेवा की एक वास्तविक भेदभाव बनाम प्रदाताओं जो आपके LoRA के लिए प्रीमियम चार्ज करते हैं।
- मध्य 2026: 1 मई 2026 से ऑन-डिमांड जीपीयू किराए में 1 डॉलर की वृद्धि हुई। मात्रा मूल्य निर्धारण पैमाने पर बातचीत योग्य है।
- वित्तीय संकेतः $ 4B मूल्यांकन, 10T + टोकन / दिन संभाल लिया।
एक साथ चौड़ाई अनुकूलित
- 200+ मॉडल, जिसमें अपस्ट्रीम प्रकाशन के कुछ दिनों के भीतर ओपन-सोर्स रिलीज़ शामिल हैं।
- 50-70% सस्ता है समकक्ष LLM मॉडल पर प्रतिकृति "एआई नेटिव क्लाउड" स्थिति मात्रा और कैटलॉग है।
- एक एपीआई में इन्फरेन्स + फाइन ट्यूनिंग + ट्रेनिंग।
बेसेटन उद्यम-पोलिश-अनुकूलित
- ट्रस फ्रेमवर्कः निर्भरता, रहस्यों के साथ मॉडल पैकेजिंग, एक मैनिफेस्ट में सेवा कॉन्फिग।
- GPU T4 से B200 तक की सीमा है। प्रति मिनट बिलिंग को ठंडे स्टार्ट में उचित कम करने के साथ।
- SOC 2 प्रकार II, HIPAA- तैयार. सामान्य fintech और स्वास्थ्य देखभाल विकल्प.
- $5B valuation, January 2026 Series E ($300M CapitalG, IVP, NVIDIA से) ।
मोडल पायथन-नेटिव-ऑप्टिमाइज़्ड
- शुद्ध पायथन में कोड के रूप में बुनियादी ढांचा। के साथ एक समारोह सजाने
@modal.function(gpu="A100")और एक ही आदेश के साथ तैनात करें। - प्रति सेकंड बिलिंग. ठंड प्री-थर्मिंग के साथ 2-4 से शुरू होती है; छोटे मॉडल के लिए <1 से।
- $87M Series B at $1.1B मूल्यांकन (2025) स्वतंत्र सर्वेक्षणों में सबसे मजबूत डेवलपर अनुभव स्कोर।
प्रतिकृति बहुआयामी चौड़ाई
- प्रति भविष्यवाणी भुगतान. छवि, वीडियो और ऑडियो मॉडल के लिए डिफ़ॉल्ट मंच।
- एकीकरण पारिस्थितिकी तंत्र (जापीयर, वर्सेल, सीएमएस प्लगइन्स)
- प्रति टोकन दरों पर कम प्रतिस्पर्धी LLM लेकिन मल्टीमोडल विविधता पर जीतता है।
किसी भी पैमाने रे-नेटिव
- रे पर बनाया गया; RayTurbo Anyscale का स्वामित्व वाला अनुमान लगाने वाला इंजन है (वीएलएलएम के साथ प्रतिस्पर्धा करता है) ।
- वितरित पायथन वर्कलोड के लिए सबसे अच्छा जहां निष्कर्ष चरण एक बड़े ग्राफ में एक नोड है।
- रे एयर और रे सर्व के साथ घनिष्ठ एकीकरण।
प्रति टोकन बनाम प्रति मिनट जब प्रत्येक जीतता है
प्रति टोकन तब समझ में आता है जब वर्कलोड लटेंसी-असंवेदनशील और फटा हुआ होता है आप केवल इसके लिए भुगतान करते हैं जो आप उपयोग करते हैं. प्रति मिनट समझ में आता है जब उपयोग उच्च और पूर्वानुमान योग्य होता है आप प्रति टोकन को एक बार पीजीपी संतृप्त करते समय हराते हैं।
कठोर नियमः ~ 30% समर्पित GPU के निरंतर उपयोग से ऊपर के कार्यभार के लिए, प्रति मिनट (बेस्टेन, मोडल) प्रति टोकन (फायरवर्क, साथ में) को हराता है। इसके नीचे, प्रति टोकन जीतता है क्योंकि आप निष्क्रिय के लिए भुगतान करने से बचते हैं।
कस्टम इंजन असली खाई है
vLLM और SGLang के ऊपर प्रत्येक प्लेटफॉर्म एक कस्टम इंजन का दावा करता है। फायरएटेंशन, रेटर्बो, बेसेटन का निष्कर्ष स्टैक। कस्टम इंजन का दावा छाया विपणन ईमानदार फ्रेमिंग यह है कि vLLM + SGLang उत्पादन के लगभग 80% खुले स्रोत निष्कर्ष का प्रतिनिधित्व करता है, और प्लेटफॉर्म परत पर अंतरकर्ता DX, श्रेय और SLA हैं।
संख्याओं को याद रखना चाहिए
- आतिशबाजी जीपीयू किराएः 1 मई 2026 से $ 1 / घंटा की वृद्धि।
- अग्निशमन दावाः समकक्ष कॉन्फ़िग पर vLLM की तुलना में 4 गुना कम विलंबता।
- एक साथ: LLM पर Replicate की तुलना में 50-70% सस्ता।
- बेसेटन मूल्यांकन: $5B (Series E, Jan 2026, $300 मीटर दौर) ।
- मौद्रिक मूल्य निर्धारणः $1.1B (सीरीज बी, 2025) ।
- प्रति मिनट प्रति टोकन ~ 30% निरंतर उपयोग से ऊपर है।
इसका प्रयोग करें
code/main.pyमूल्य निर्धारण मॉडल के बीच सिंथेटिक कार्यभार पर छह विक्रेताओं की तुलना करता है।$/day and effective $प्रति टोकन और प्रति मिनट के बीच ब्रेक-ईव खोजने के लिए इसे चलाएं।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-inference-platform-picker.md. कार्यभार प्रोफ़ाइल, एसएलए और बजट को देखते हुए, प्राथमिक निष्कर्ष मंच का चयन करता है और उपविजेता का नाम लेता है।
व्यायाम
- दौड़ें
code/main.py. एक H100 पर 70B मॉडल के लिए बासेटन (प्रति मिनट) फायरवर्क्स (प्रति टोकन) को किस निरंतर उपयोग पर हराता है? क्रॉसओवर को स्वयं से प्राप्त करें और अंगूठे के नियम की तुलना करें। - आपके उत्पाद में छवि निर्माण और चैट और भाषण-से-पाठ की सेवा है। प्रत्येक मोडलिटी के लिए प्लेटफार्म चुनें और गेटवे पैटर्न का नाम दें जो उन्हें एकजुट करता है।
- आतिशबाजी आपके प्राथमिक मॉडल पर कीमतों में $ 1 प्रति घंटे की वृद्धि करती है। यदि आपके 40% ट्रैफ़िक बैच स्तर (50% छूट) पर चले जाते हैं तो मिश्रित लागत प्रभाव का मॉडल बनाएं।
- एक विनियमित ग्राहक को SOC 2 टाइप II + HIPAA + समर्पित GPU की आवश्यकता होती है। कौन से तीन प्लेटफॉर्म व्यवहार्य हैं और कौन से एक FinOps पर जीतता है?
- आग के लिए प्रति 1,000 भविष्यवाणियों की तुलना करें लामा 3.1 70B पर सर्वरलेस, एक साथ ऑन-डिमांड, बेसेटन समर्पित, और प्रतिकृति एपीआई। 10 भविष्यवाणियों / दिन पर कौन सा सबसे सस्ता है? 10,000?
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| Custom silicon | "non-GPU chips" | Groq LPU, Cerebras WSE, SambaNova RDU — optimized for decode |
| FireAttention | "Fireworks engine" | Custom attention kernel; marketed at 4x lower latency than vLLM |
| Truss | "Baseten's format" | Model packaging manifest; dependencies + secrets + serving config |
| Per-token | "API pricing" | Charge by tokens consumed; pay for no idle |
| Per-minute | "dedicated pricing" | Charge by wall-clock GPU time; wins at high utilization |
| Per-prediction | "Replicate pricing" | Charge per model invocation; common for image/video |
| RayTurbo | "Anyscale engine" | Proprietary inference on Ray; competes with vLLM on Ray clusters |
| Batch tier | "50% off" | Non-interactive queue at reduced rate; common on Fireworks, OpenAI |
| Fine-tuned at base rate | "Fireworks LoRA" | Charge LoRA-served requests at base model's rate (differentiator) |
आगे पढ़ना
- Fireworks Pricing प्रति टोकन दरें, बैच स्तर, GPU किराए पर लेना।
- Baseten Pricing प्रति मिनट दरें, प्रतिबद्ध क्षमता, उद्यम स्तर।
- Modal Pricing प्रति सेकंड GPU दर और मुक्त स्तर।
- Together AI Pricing मॉडल कैटलॉग और प्रति टोकन दरें।
- Anyscale Pricing रे टर्बो और रे मूल्य निर्धारण प्रबंधित किया।
- Northflank — Fireworks AI Alternatives तुलनात्मक मूल्यांकन।
- Infrabase — AI Inference API Providers 2026 विक्रेता परिदृश्य।
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.