Phase 17: Infrastructure & Production

इन्फरेन्स प्लेटफॉर्म इकोनॉमिक्स आतिशबाजी, साथ में, बेसेट, मॉडल, प्रतिकृति, किसी भी पैमाने पर

2026 के अनुमान बाजार में अब GPU समय किराए पर नहीं है। यह कस्टम सिलिकॉन (Groq, Cerebras, SambaNova), GPU प्लेटफार्मों (Baseten, Together, Fireworks, Modal) और API-first बाजारों (Replicate, DeepInfra) में विभाजित है। आतिशबाजी ने कीमत बढ़ा दी।$1/hr per GPU on May 1, 2026, and $10T+ टोकन/दिन पर 4B मूल्यांकन आपको मात्रा-चालित मॉडल काम बताता है।$300M Series E at $5B जनवरी 2026 में प्रतिस्पर्धी स्थिति निर्धारण नियम सरल हैः फायरवर्क्स विलंबता को अनुकूलित करता है, साथ में कैटलॉग चौड़ाई को अनुकूलित करता है, बेसेट एंटरप्राइज पॉलिश को अनुकूलित करता है, मॉडल पायथन-नेटिव डीएक्स को अनुकूलित करता है, प्रतिकृति बहु-मॉडल पहुंच को अनुकूलित करता है, एनिस्केल पायथन को वितरित करता है। यह पाठ आपको एक मैट्रिक्स देता है जिसे आप एक संस्थापक को सौंप सकते हैं।

Type: Learn

Languages: Python (stdlib, toy per-call economics comparator)

Prerequisites: Phase 17 · 01 (Managed LLM Platforms), Phase 17 · 04 (Serving Engine Internals)

Time: ~60 minutes

सीखने के लक्ष्य

  • तीन बाजार खंडों (कस्टम सिलिकॉन, GPU प्लेटफार्म, API-first) का नाम दें और प्रत्येक विक्रेता को एक खंड में मानचित्रित करें।
  • बताएं कि "प्रति टोकन" एपीआई मूल्य निर्धारण मॉडल सेवा इंजन की लागत वक्र की ओर क्यों संपीड़ित होता है, हार्डवेयर की नहीं।
  • कम से कम तीन विक्रेताओं के प्रति अनुरोध प्रभावी लागत की गणना करें और बताएं कि प्रति मिनट (बेस्टेन, मॉडल) प्रति टोकन कब होता है।
  • किसी दिए गए कार्यभार के लिए कौन सा प्लेटफॉर्म सही डिफ़ॉल्ट है (सेवरलेस फट, स्थिर उच्च-प्रोफ्यूट, ठीक-ट्यून किए गए वेरिएंट, मल्टीमोडल) की पहचान करें।

समस्या

आपने प्रबंधित हाइपरस्केलर प्लेटफार्मों का मूल्यांकन किया। आपने फैसला किया कि आपको एक संकीर्ण, तेज़ प्रदाता की आवश्यकता है विलंबता के लिए फायरवॉक्स, चौड़ाई के लिए एक साथ, एक बारीकी से समायोजित कस्टम मॉडल के लिए बासेटन। अब आपके पास छह वास्तविक विकल्प हैं और मूल्य निर्धारण पृष्ठ लाइन नहीं हैं। फायरवॉक्स दिखाता है $/M tokens; Baseten shows $/मिनट; मोडल शो $/second; Replicate shows $आप काम के भार का मॉडल बिना उन्हें सिर से सिर की तुलना नहीं कर सकते.

इससे भी बदतर, प्रत्येक मूल्य निर्धारण पृष्ठ के पीछे का व्यवसाय मॉडल अलग है। आतिशबाजी साझा जीपीयू पर अपना स्वयं का कस्टम इंजन (फायरएटेंशन) चलाती है; प्रति टोकन दर उनके उपयोग वक्र को दर्शाता है। Baseten आपको Truss + समर्पित GPUs देता है; प्रति मिनट विशेषता को दर्शाता है। मोडल सच है पायथन सर्वरलेस प्रति सेकंड बिलिंग उप-सेकंड ठंड शुरू के साथ। एक ही आउटपुट (एलएलएम प्रतिक्रिया), तीन अलग-अलग लागत कार्य।

यह पाठ छक्के का मॉडल है और आपको बताता है कि प्रत्येक कब जीतता है।

अवधारणा

तीनों खंड

Custom silicon Groq (LPU), Cerebras (WSE), SambaNova (RDU). आमतौर पर एक ही मॉडल पर GPU- आधारित क्लस्टर की तुलना में 5-10 गुना तेज़ डिकोड। उच्च प्रति टोकन मूल्य (Llama-70B पर Groq ~ $ 0.99 / M था 2025) लेकिन लटेंसी-संवेदनशील उपयोग मामलों के लिए अपराजेय है। Groq वॉयस एजेंटों और वास्तविक समय अनुवाद के लिए उत्पादन विकल्प है।

GPU platforms बेसटन, एक साथ, फायरवर्क, मोडल, Anyscale. एनवीआईडीआईए (एच 100, एच 200, बी 200 में 2026) या कभी-कभी एएमडी पर चलाएं। "कच्चे जीपीयू किराए पर लेने" (रनपॉड, लैम्ब्डा) और "हाइपरस्केल प्रबंधित सेवा" (बेड्रॉक) के बीच आर्थिक परत।

API-first marketplaces प्रतिकृति, डीपइन्फ्रा, ओपनरॉटर, फाल. व्यापक कैटलॉग, प्रति-अनुमान या प्रति-सेकंड भुगतान, समय-से-पहली कॉल पर जोर दें।

आतिशबाजी लटेंसी-ऑप्टिमाइज़्ड जीपीयू प्लेटफॉर्म

  • FireAttention इंजन (कस्टम); समकक्ष कॉन्फ़िग पर vLLM की तुलना में 4 गुना कम लटेंसी के रूप में विपणन किया जाता है।
  • गैर-आंतरिक कार्यभार के लिए सर्वर रहित दर के ~50% पर बैच स्तर।
  • ठीक-ठीक मॉडल मूल मॉडल के समान दर पर सेवा की एक वास्तविक भेदभाव बनाम प्रदाताओं जो आपके LoRA के लिए प्रीमियम चार्ज करते हैं।
  • मध्य 2026: 1 मई 2026 से ऑन-डिमांड जीपीयू किराए में 1 डॉलर की वृद्धि हुई। मात्रा मूल्य निर्धारण पैमाने पर बातचीत योग्य है।
  • वित्तीय संकेतः $ 4B मूल्यांकन, 10T + टोकन / दिन संभाल लिया।

एक साथ चौड़ाई अनुकूलित

  • 200+ मॉडल, जिसमें अपस्ट्रीम प्रकाशन के कुछ दिनों के भीतर ओपन-सोर्स रिलीज़ शामिल हैं।
  • 50-70% सस्ता है समकक्ष LLM मॉडल पर प्रतिकृति "एआई नेटिव क्लाउड" स्थिति मात्रा और कैटलॉग है।
  • एक एपीआई में इन्फरेन्स + फाइन ट्यूनिंग + ट्रेनिंग।

बेसेटन उद्यम-पोलिश-अनुकूलित

  • ट्रस फ्रेमवर्कः निर्भरता, रहस्यों के साथ मॉडल पैकेजिंग, एक मैनिफेस्ट में सेवा कॉन्फिग।
  • GPU T4 से B200 तक की सीमा है। प्रति मिनट बिलिंग को ठंडे स्टार्ट में उचित कम करने के साथ।
  • SOC 2 प्रकार II, HIPAA- तैयार. सामान्य fintech और स्वास्थ्य देखभाल विकल्प.
  • $5B valuation, January 2026 Series E ($300M CapitalG, IVP, NVIDIA से) ।

मोडल पायथन-नेटिव-ऑप्टिमाइज़्ड

  • शुद्ध पायथन में कोड के रूप में बुनियादी ढांचा। के साथ एक समारोह सजाने@modal.function(gpu="A100")और एक ही आदेश के साथ तैनात करें।
  • प्रति सेकंड बिलिंग. ठंड प्री-थर्मिंग के साथ 2-4 से शुरू होती है; छोटे मॉडल के लिए <1 से।
  • $87M Series B at $1.1B मूल्यांकन (2025) स्वतंत्र सर्वेक्षणों में सबसे मजबूत डेवलपर अनुभव स्कोर।

प्रतिकृति बहुआयामी चौड़ाई

  • प्रति भविष्यवाणी भुगतान. छवि, वीडियो और ऑडियो मॉडल के लिए डिफ़ॉल्ट मंच।
  • एकीकरण पारिस्थितिकी तंत्र (जापीयर, वर्सेल, सीएमएस प्लगइन्स)
  • प्रति टोकन दरों पर कम प्रतिस्पर्धी LLM लेकिन मल्टीमोडल विविधता पर जीतता है।

किसी भी पैमाने रे-नेटिव

  • रे पर बनाया गया; RayTurbo Anyscale का स्वामित्व वाला अनुमान लगाने वाला इंजन है (वीएलएलएम के साथ प्रतिस्पर्धा करता है) ।
  • वितरित पायथन वर्कलोड के लिए सबसे अच्छा जहां निष्कर्ष चरण एक बड़े ग्राफ में एक नोड है।
  • रे एयर और रे सर्व के साथ घनिष्ठ एकीकरण।

प्रति टोकन बनाम प्रति मिनट जब प्रत्येक जीतता है

प्रति टोकन तब समझ में आता है जब वर्कलोड लटेंसी-असंवेदनशील और फटा हुआ होता है आप केवल इसके लिए भुगतान करते हैं जो आप उपयोग करते हैं. प्रति मिनट समझ में आता है जब उपयोग उच्च और पूर्वानुमान योग्य होता है आप प्रति टोकन को एक बार पीजीपी संतृप्त करते समय हराते हैं।

कठोर नियमः ~ 30% समर्पित GPU के निरंतर उपयोग से ऊपर के कार्यभार के लिए, प्रति मिनट (बेस्टेन, मोडल) प्रति टोकन (फायरवर्क, साथ में) को हराता है। इसके नीचे, प्रति टोकन जीतता है क्योंकि आप निष्क्रिय के लिए भुगतान करने से बचते हैं।

कस्टम इंजन असली खाई है

vLLM और SGLang के ऊपर प्रत्येक प्लेटफॉर्म एक कस्टम इंजन का दावा करता है। फायरएटेंशन, रेटर्बो, बेसेटन का निष्कर्ष स्टैक। कस्टम इंजन का दावा छाया विपणन ईमानदार फ्रेमिंग यह है कि vLLM + SGLang उत्पादन के लगभग 80% खुले स्रोत निष्कर्ष का प्रतिनिधित्व करता है, और प्लेटफॉर्म परत पर अंतरकर्ता DX, श्रेय और SLA हैं।

संख्याओं को याद रखना चाहिए

  • आतिशबाजी जीपीयू किराएः 1 मई 2026 से $ 1 / घंटा की वृद्धि।
  • अग्निशमन दावाः समकक्ष कॉन्फ़िग पर vLLM की तुलना में 4 गुना कम विलंबता।
  • एक साथ: LLM पर Replicate की तुलना में 50-70% सस्ता।
  • बेसेटन मूल्यांकन: $5B (Series E, Jan 2026, $300 मीटर दौर) ।
  • मौद्रिक मूल्य निर्धारणः $1.1B (सीरीज बी, 2025) ।
  • प्रति मिनट प्रति टोकन ~ 30% निरंतर उपयोग से ऊपर है।

इसका प्रयोग करें

code/main.pyमूल्य निर्धारण मॉडल के बीच सिंथेटिक कार्यभार पर छह विक्रेताओं की तुलना करता है।$/day and effective $प्रति टोकन और प्रति मिनट के बीच ब्रेक-ईव खोजने के लिए इसे चलाएं।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-inference-platform-picker.md. कार्यभार प्रोफ़ाइल, एसएलए और बजट को देखते हुए, प्राथमिक निष्कर्ष मंच का चयन करता है और उपविजेता का नाम लेता है।

व्यायाम

  1. दौड़ेंcode/main.py. एक H100 पर 70B मॉडल के लिए बासेटन (प्रति मिनट) फायरवर्क्स (प्रति टोकन) को किस निरंतर उपयोग पर हराता है? क्रॉसओवर को स्वयं से प्राप्त करें और अंगूठे के नियम की तुलना करें।
  2. आपके उत्पाद में छवि निर्माण और चैट और भाषण-से-पाठ की सेवा है। प्रत्येक मोडलिटी के लिए प्लेटफार्म चुनें और गेटवे पैटर्न का नाम दें जो उन्हें एकजुट करता है।
  3. आतिशबाजी आपके प्राथमिक मॉडल पर कीमतों में $ 1 प्रति घंटे की वृद्धि करती है। यदि आपके 40% ट्रैफ़िक बैच स्तर (50% छूट) पर चले जाते हैं तो मिश्रित लागत प्रभाव का मॉडल बनाएं।
  4. एक विनियमित ग्राहक को SOC 2 टाइप II + HIPAA + समर्पित GPU की आवश्यकता होती है। कौन से तीन प्लेटफॉर्म व्यवहार्य हैं और कौन से एक FinOps पर जीतता है?
  5. आग के लिए प्रति 1,000 भविष्यवाणियों की तुलना करें लामा 3.1 70B पर सर्वरलेस, एक साथ ऑन-डिमांड, बेसेटन समर्पित, और प्रतिकृति एपीआई। 10 भविष्यवाणियों / दिन पर कौन सा सबसे सस्ता है? 10,000?

प्रमुख शर्तें

TermWhat people sayWhat it actually means
Custom silicon"non-GPU chips"Groq LPU, Cerebras WSE, SambaNova RDU — optimized for decode
FireAttention"Fireworks engine"Custom attention kernel; marketed at 4x lower latency than vLLM
Truss"Baseten's format"Model packaging manifest; dependencies + secrets + serving config
Per-token"API pricing"Charge by tokens consumed; pay for no idle
Per-minute"dedicated pricing"Charge by wall-clock GPU time; wins at high utilization
Per-prediction"Replicate pricing"Charge per model invocation; common for image/video
RayTurbo"Anyscale engine"Proprietary inference on Ray; competes with vLLM on Ray clusters
Batch tier"50% off"Non-interactive queue at reduced rate; common on Fireworks, OpenAI
Fine-tuned at base rate"Fireworks LoRA"Charge LoRA-served requests at base model's rate (differentiator)

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.