Phase 17: Infrastructure & Production

إضفاء الاستثمارات الاقتصادية منصة الألعاب النارية، معا، الباسيطان، موداول، النسخة، أي نطاق

لم يعد سوق استنتاج 2026 استئجار وقت GPU. يختلف إلى سليكون مخصص (Groq ، Cerebras ، SambaNova) ، منصات GPU (Baseten ، Together ، Fireworks ، Modal) ، وأسواق API-أول (Replicate ، DeepInfra). ارتفعت أسعار الألعاب النارية $1/hr per GPU on May 1, 2026, and $تقييم 4B على 10T+ رموز/يوم يخبرك عن العملات النموذج القيادة على الحجم.$300M Series E at $5B في يناير 2026. قاعدة وضع المنافسة بسيطة: الألعاب النارية تحسن التأخير، معًا تحسن عرض الكتالوج، باستن تحسن تشوية المؤسسة، مودال تحسن Python-أصل DX، النسخ تحسن الوصول متعدد الوسائل، أي مقياس تحسن Python الموزع. هذا الدروس يمنحك ماتريكس يمكنك تسليم مؤسس.

Type: Learn

Languages: Python (stdlib, toy per-call economics comparator)

Prerequisites: Phase 17 · 01 (Managed LLM Platforms), Phase 17 · 04 (Serving Engine Internals)

Time: ~60 minutes

أهداف التعلم

  • أسمائ قطاعات السوق الثلاثة (السيليكون المخصص، منصات GPU، API-first) ووضع خريطة لكل بائع إلى قطاع.
  • شرح لماذا نموذج أسعار API "لليلي" يضغط نحو منحنى تكلفة محرك الخدمة وليس منحنى الأجهزة.
  • احسب التكلفة الفعالة لكل طلب عبر ثلاثة بائع على الأقل وشرح متى يتغلب الفاتورة في الدقيقة (الباسيتين، مودال) على كل رمز.
  • تحديد المنصة التي هي المعتمدة المناسبة لحمل عمل معين (منتشر بدون خادم، مستمر عالي التدفق، المتغيرات المعدلة، المتعددة).

المشكلة

لقد قمت بتقييم منصات المعدلات المضخمة المدارة. قررت أنك بحاجة إلى مزود أصغر وأسرع الألعاب النارية للتأخير، مع بعضها البعض للوضوح، باستن لنموذج مخصص محدد. الآن لديك ست خيارات حقيقية و صفحات التسعير لا تتوافق. ألعاب النارية تظهر $/M tokens; Baseten shows $/ دقيقة ؛ عرضات مودا$/second; Replicate shows $لا يمكنك مقارنةهم رأساً على رأس دون أن تقوم بتصميم الحمل

والأسوأ من ذلك، أن نموذج الأعمال وراء كل صفحة تسعير مختلف. تعمل الألعاب النارية محركها المخصص الخاص (FireAttention) على أجهزة البيانات المعالجة المشتركة؛ وتعكس معدل كل رمز منحنى الاستخدام. يقدم لك Baseten GPUات Truss + المخصصة؛ لكل دقيقة يعكس حصرية. مودال صحيح Python serverless في الثانية التفويض مع بدايات الباردة في الثانية الفرعية. نفس الناتج (ردة LLM) ، ثلاثة وظائف تكلفة مختلفة.

هذه الدروس تعكس الستة وتخبرك متى يفوز كل واحد.

المفهوم

القطاعات الثلاثة

Custom silicon Groq (LPU) ، Cerebras (WSE) ، SambaNova (RDU). عادةً 5-10x أسرع من تشكيل مجموعة مبنية على GPU على نفس النموذج. سعر أعلى لكل رمز (Groq كان ~ 0.99 $ / M على Llama-70B في أواخر 2025) ولكن لا يُغلب على حالات الاستخدام الحساسة بالتكسّف. Groq هو اختيار الإنتاج لعاملات الصوت وتقديم الترجمة في الوقت الحقيقي.

GPU platforms Baseten, Together, Fireworks, Modal, Anyscale. تشغيل على NVIDIA (H100, H200, B200 في عام 2026) أو أحيانا AMD. الطبقة الاقتصادية بين "إيجار GPU خام" (RunPod, Lambda) و "خدمة إدارة مستويات فائقة" (Bedrock).

API-first marketplaces النسخة، DeepInfra، OpenRouter، Fal. الكتالوج واسع، دفع لكل تنبؤ أو دفع لكل ثانية، يؤكد على وقت أول مكالمة.

الألعاب النارية منصة GPU المثبتة للتأخير

  • محرك FireAttention (تخصصي) ؛ يتم تسويقها بأنها 4 مرات أقل تأخيرًا من vLLM على تشكيلات مساوية.
  • مستوى الحزمة عند ~ 50% من معدل عدم وجود خادم لحملات عمل غير تفاعلية.
  • نموذج محسن خدم بنفس المعدل الذي يقدم به النموذج الأساسي مُختلف حقيقي مقابل مقدمي الخدمات الذين يتقاضون قسطاً من قيمة المبلغ المُسجل في الموقع.
  • منتصف عام 2026: رفع تأجير الجيبو على الطلب 1 دولار للساعة اعتبارا من 1 مايو 2026.
  • إشارة مالية: تقييم 4 مليارات دولار، 10T + رموز / يوم معالجة.

معاً تحسينات على الوساط

  • 200+ نموذج بما في ذلك الإصدارات مفتوحة المصدر في غضون أيام من نشرها في وقت سابق.
  • 50-70% أرخص من النسخة على نماذج LLM الموازية "AI Native Cloud" وضع هو حجم وكتالوج.
  • الإستدلال + التنسيق الدقيق + التدريب في API واحدة.

الباسيتين المحسنة للشركات

  • إطار ترس: إغلاع النموذج مع الاعتمادات، السر، خدمة التجميع في مذكرة واحدة.
  • مجموعة من GPU من T4 إلى B200، فاتورة لكل دقيقة مع تخفيف معقول من بدء البرد.
  • (SOC 2 نوع الثاني، جاهز للقانون (هيبا
  • $5B valuation, January 2026 Series E ($300 مليون من كابيتال جي، إيف بي، نفيديا).

مودال محسنة في Python

  • البنية التحتية كرمز في Python النقي. أزياء وظيفة مع @modal.function(gpu="A100")و أنشروا بأمر واحد
  • الفواتير في الثانية. البرد يبدأ 2-4s مع التدفئة المسبقة؛ <1s للنماذج الصغيرة.
  • $87M Series B at $1.1B تقييم (2025) أقوى درجة من خبرة المطورين في استطلاعات مستقلة.

النسخة عرض متعدد الحركات

  • الدفع لكل تنبؤ، منصة افتراضية لنماذج الصور والفيديو والصوت
  • نظام إيكولوجي التكامل (زايبير، ورسل، مضخات CMS).
  • أقل تنافسية على أسعار الـ LLM لكل رمز ولكن تفوز على مجموعة متنوعة متعددة الطرق.

أي نطاق الأشعة الأصلية

  • بنيت على راي؛ راي توربو هو محرك استنتاج خاص لأينسكال (يتنافس مع vLLM).
  • أفضل لتحملات عمل Python الموزعة حيث خطوة الاستنتاج هي عقدة واحدة في الرسم البياني الأكبر.
  • إدارة مجموعة راي، التكامل الوثيق مع راي إير و راي خدمة.

لكل رمز مقابل لكل دقيقة عندما يفوز كل واحد

كل رمز يكون منطقيا عندما يكون حجم العمل غير حساس للضغط والفجر تدفع فقط لما تستخدمه. كل دقيقة يكون منطقيا عندما يكون الاستخدام مرتفعًا ويمكن التنبؤ به تضرب كل رمز بمجرد اكتفاء الجيبيو.

قاعدة قاسية: بالنسبة لأحملات العمل فوق ~ 30% الاستخدام المستمر لـ GPU مخصصة ، تبدأ الدقيقة (باسيطان ، مودال) في ضرب كل رمز (فاير ووركس ، معًا). أقل من ذلك ، يفوز كل رمز لأنك تتجنب دفع ثمن العاطفة.

المحرك المخصص هو الحفر الحقيقي

كل منصة فوق vLLM و SGLang تدعي محركًا مخصصًا. FireAttention ، RayTurbo ، كومة استنتاج Baseten. مدعومة محركات مخصصة تدعي تسويق الظلال الإطار الصادق هو أن vLLM + SGLang يمثل حوالي 80% من استنتاج استنتاج المصدر المفتوح ، والتمييزات في طبقة المنصة هي DX ، التخصيص ، و SLAs.

أرقام يجب أن تتذكر

  • إيرادات المواد النارية: 1 دولار في الساعة، اعتبارا من 1 مايو 2026.
  • دعوى الألعاب النارية: تأخير أقل بنسبة 4x من vLLM على التكوينات المتكافئة.
  • معاً: 50-70% أرخص من Replicate على LLM.
  • تقييم الباسيطين: $5B (Series E, Jan 2026, $300 ميلاً)
  • تقييم الأصول: 1.1 مليار دولار (سلسلة ب، 2025).
  • ضربات لكل دقيقة لكل رمز فوق ~ 30% الاستخدام المستمر.

استخدمها

code/main.pyيُقارن البائعين الستين على عبء عمل صناعي عبر نماذج التسعير.$/day and effective $أوراق الـ (م) ، قم بتشغيلها للعثور على التوازن بين الـ (ر) و (ر)

أرسله

هذا الدرس يُنتجoutputs/skill-inference-platform-picker.md. بالنظر إلى ملف عبء العمل، SLA، وال ميزانية، يختار منصة الاستنتاج الأساسية ويعد المرتبة الثانية.

التمارين

  1. أركضcode/main.pyفي أي استخدام مستمر يضرب باستين (في الدقيقة) النارية (في الرمز) لنموذج 70B على H100؟ استنتاج التقاطع بنفسك ومقارنة مع قاعدة الإبهام.
  2. منتجك يخدم إنتاج الصور بالإضافة إلى الدردشة بالإضافة إلى الخطاب إلى النص. اختر منصات لكل طريقة وسمي نمط البوابة التي توحدها.
  3. الألعاب النارية تزيد الأسعار بنحو دولار في الساعة على النموذج الأساسي. قم بتصميم تأثير التكلفة المختلطة إذا انتقلت 40٪ من حركة المرور إلى مستوى البطاقات (50٪ خصم).
  4. يتطلب العميل المنظم نظام SOC 2 نوع II + HIPAA + GPU المخصصة. أي منصات ثلاثية قابلة للتطبيق والتي تفوز في FinOps؟
  5. مقارنة التكلفة لكل 1000 توقعات للاما 3.1 70B على مضاد النار بدون خادم، معا على الطلب، الباصيتين المخصصة، ونسخ API. أي من هو أرخص عند 10 توقعات / يوم؟ في 10,000؟

الشروط الرئيسية

TermWhat people sayWhat it actually means
Custom silicon"non-GPU chips"Groq LPU, Cerebras WSE, SambaNova RDU — optimized for decode
FireAttention"Fireworks engine"Custom attention kernel; marketed at 4x lower latency than vLLM
Truss"Baseten's format"Model packaging manifest; dependencies + secrets + serving config
Per-token"API pricing"Charge by tokens consumed; pay for no idle
Per-minute"dedicated pricing"Charge by wall-clock GPU time; wins at high utilization
Per-prediction"Replicate pricing"Charge per model invocation; common for image/video
RayTurbo"Anyscale engine"Proprietary inference on Ray; competes with vLLM on Ray clusters
Batch tier"50% off"Non-interactive queue at reduced rate; common on Fireworks, OpenAI
Fine-tuned at base rate"Fireworks LoRA"Charge LoRA-served requests at base model's rate (differentiator)

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.