Phase 17: Infrastructure & Production

راه اندازی مدل به عنوان یک ابتدایی برای کاهش هزینه

یک دلال پویا هر درخواست (نوع کار، طول توکن، شباهت گنجانده، اعتماد) را ارزیابی می کند و سوالات ساده را به یک مدل ارزان ارسال می کند، و سوالات پیچیده را به یک مدل مرز افزوده می کند. همچنین به عنوان مدل کاسکید نامیده می شود. مطالعات موردی تولید نشان می دهد که کاهش هزینه ها در iso-quality در سراسر ایالات متحده / انگلستان / اتحادیه اروپا کاهش می یابد؛ بهبود بهره وری رویتینگ 30٪ در SaaS حجم بالا به پس انداز سالانه شش رقمی تبدیل می شود. در سال 2026، قیمت نتیجه گیری LLM در سال 10 برابر کاهش یافته است.$20/M to ~$0.40/M از اواخر سال 2022 تا 2026 بیشتر از این کاهش بهتر است که به دسته ها (فاز 17 · 04-09) خدمت کند، نه به سخت افزار. روتینگ این است که چگونه شما آن کاهش قیمت را به مارجین بدون بازگشت محصول تبدیل می کنید. حالت شکست، حرکت مدل ارزان است: مسیر 40 درصد را به مدل ضعیف تر فشار می دهد، کیفیت در وظایف استدلال 3 تا 5 درصد کاهش می یابد، هیچ کس یک چهارم متوجه نمی شود. مسیرهای دروازه توسط معیار های کیفیت آنلاین، نه فقط مجموعه های ارزیابی آفلاین.

Type: Learn

Languages: Python (stdlib, toy cascading router simulator)

Prerequisites: Phase 17 · 01 (Managed LLM Platforms), Phase 17 · 19 (AI Gateways)

Time: ~60 minutes

اهداف یادگیری

  • مدل های پراکنده را توضیح دهید: ارزان اول با بررسی اعتماد، افزایش اعتماد در کم اعتماد.
  • چهار سیگنال رویتینگ را ذکر کنید (صنفی کردن کار، طول سریع، شباهت با مجموعه سخت شناخته شده، اعتماد به نفس از اولین عبور).
  • هزینه های مخلوط انتظار می رود را در تقسیم مسیر هدف و تحمل از دست دادن کیفیت محاسبه کنید.
  • متریک نظارت بر حرکت (دروازه کیفیت آنلاین) را که مدل ارزان را می گیرد، نام دهید.

مشکل

خدمات شما هزینه 80 هزار دلار در ماه در GPT-5 است. تحلیل شما نشان می دهد که 70 درصد از سوالات ساده هستند: " ساعت چه زمانی در پاریس است؟" "این جمله را تغییر دهید". یک مدل کلاس هایکو به طور کامل با 3 درصد از هزینه آنها را اداره می کند. 30 درصد نیاز به استدلال GPT-5 کدگذاری، ریاضیات، برنامه ریزی چند مرحله ای.

اگر شما راه اندازی 70% به ارزان و 30% به گران قیمت، صورتحساب شما کاهش ~ 65% در همان کیفیت محصول است. این راه اندازی است. ترفند ساخت دلال بدون کاهش کیفیت است.

مفهوم

چهار سیگنال رویتینگ

  1. Task classification: ساده / پیچیده / کدگ / ریاضی / چت. می تواند یک طبقه بندی مبتنی بر قوانین ، یک LLM کوچک (کلاس هایکو در 0.25 $ / M) یا شبیه سازی با سطل های برچسب شده باشد. محصول: مسیر = ارزان / متعادل / مرز.
  1. Prompt length: پیام های فوری > 4K توکن اغلب نیاز به مرز برای پیوستگی. پیام های <500 توکن معمولا نمی کنند.
  1. Embedding similarity to known-hard set: اگر سوال نزدیک (کوسین > 0.88) به یک سطل سخت شناخته شده باشد، به طور مستقیم به مرز حرکت کنید.
  1. Self-confidence from first-pass: ارسال به ارزان؛ اگر تست های سوابق مدل اعتماد کم نشان دهند یا آن را رد کند یا زبان پوشش را بازخورد، دوباره در مرز تلاش کنید. اضافه می کند P95 تاخیر در ~ 10% از ترافیک اما صرفه جویی 50% + در 90٪ دیگر.

سه الگوی

Pre-route(در طبقه بندی بالا): ~ 5-10ms تاخیر اضافه شده؛ سریع ترین در مجموع.

Cascade(بزرگترين، بالا رفتن در مورد اعتماد کم): ~1.2x متوسط تاخير (بزرگترين اجرا و تایید) ~2x در بالا رفتن.

Ensemble route(در برابر نمونه، انتخاب مدل پاداش، ارزان و مرز اجرا می شود): بالاترین کیفیت، بالاترین هزینه؛ تنها برای A/B های حیاتی استفاده می شود.

اجرای

دروازه های هوش مصنوعی (فاز 17 · 19) رویتینگ را نشان می دهند.routerپورتکی دارای محافظ + روتینگ است. کنگ گیتوی AI روتینگ مبتنی بر افزونه ای دارد. بازار مدل OpenRouter یک API توصیه را افشا می کند.

منبع باز: RouteLLM (LMSYS) ، نه الماس (تجاری) ، Prompt Mule.

منحنی قیمت 2026

Model classLate 20222026Change
GPT-4-level quality~$20/M~$0.40/M50x cheaper
Frontier (GPT-5, Claude 4)—~$3-10/Mnew tier

بیشتر پیشرفت ها در خدمت با بهره وری است درس های اصلی در مرحله 17 · 04-09 به کاهش هزینه های طرف ارائه دهنده تبدیل شده است. روتینگ به شما امکان می دهد این دستاوردها را در لایه برنامه ها ضبط کنید به جای انتظار همه کاربران خود را برای مهاجرت به سطح ارزان.

انحراف خطر واقعی است

مسیر شما ۴۰ درصد را به مدل ارزان تر می فرستد. در طول شش ماه، توزیع وظایف تغییر می کند (کاربران پیچیده تر می شوند، سوالات طولانی تر می پرسند). روتر متوجه نمی شود زیرا طبقه بندی کننده آن بر اساس داده های Q1 آموزش دیده است. کیفیت به طور ساکت کاهش می یابد. هیچ کس به اندازه کافی بلند شکایت نمی کند. شما در یک معیار رقبایی متوجه می شوید که از دست داده اید.

مسیرهای دروازه با توجه به معیار کیفیت آنلاین:

  • استفاده از انگشت های انگشت بالا/ پایین در هر مسیر
  • قضاوت خودکار LLM بر روی نمونه ای که در طول مدت انجام شده است (۵٪) در هر مسیر.
  • نرخ ارتفاع: اگر آب و هوا در مسیر بالا > 30% حرکت می کند، مدل ارزان قیمت بیش از حد هدایت می شود.
  • نرخ رد در هر مسیر

شماره هایی که باید به یاد داشته باشی

  • 2026 صرفه جویی در مسیر با کیفیت ایزو: 20-60% مطالعات موردی.
  • کاهش قیمت LLM 2022-2026: ~ 10 برابر در سال مجموع
  • GPT-4 سطح 2022 در مقابل 2026: ~$20/M → ~$0.40/م
  • تاثیر تاخیر در آب: ~ 1.2x متوسط، ~ 2x افزایش یافته (~ 10٪ ترافیک).

ازش استفاده کن

code/main.pyشبیه سازی پیش رو، آب و هوا و مجموعه در یک بار کار مخلوط. گزارش هزینه های مخلوط، از دست دادن کیفیت و نرخ افزایش.

-باده

این درس به ما کمک می کندoutputs/skill-router-plan.mdبا توجه به حجم کار و بودجه کیفیت، الگوی مسیر و سیگنال ها را انتخاب می کند.

تمرینات

  1. فرار کنcode/main.pyدر چه طبقه اي که آبشار از مسیر قبل عبور ميکنه؟
  2. پایگاه کاربران شما ۳۰ درصد شرکت (سوال های پیچیده) و ۷۰ درصد سطح رایگان (ساده) است. تقسیم روتینگ را طراحی کنید. چه اندازه گیری آنلاین آن را دروازه می کند؟
  3. یک مسیر کیفیت را 2 درصد کاهش می دهد اما 40 درصد را صرفه جویی می کند. آیا این یک کشتی است؟ بستگی به محصول دارد.
  4. از طریق بررسی اعتبار با استفاده از logprobs از OpenAI / APIs انسان شناسی انجام دهید.
  5. در طول شش ماه، میزان تصعيد از 8 درصد به 22 درصد افزایش می یابد. سه علت و درمان هر یک را تشخیص دهید.

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
Model routing"cost broker"Dynamic choice of model per request
Model cascade"cheap-first escalate"Run cheap, fall through to frontier on low confidence
Pre-route"classify first"Classifier up front; no re-run
Ensemble route"parallel pick"Run multiple, reward-model picks best
Escalation rate"uprouted %"Fraction of cascade requests that escalated
RouteLLM"LMSYS router"OSS router library
Not Diamond"commercial router"SaaS model-routing product
Drift"cheap creep"Distribution shift without router noticing
Online quality gate"live check"Automated LLM-judge sampling live traffic

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.