راه اندازی مدل به عنوان یک ابتدایی برای کاهش هزینه
Type: Learn
Languages: Python (stdlib, toy cascading router simulator)
Prerequisites: Phase 17 · 01 (Managed LLM Platforms), Phase 17 · 19 (AI Gateways)
Time: ~60 minutes
اهداف یادگیری
- مدل های پراکنده را توضیح دهید: ارزان اول با بررسی اعتماد، افزایش اعتماد در کم اعتماد.
- چهار سیگنال رویتینگ را ذکر کنید (صنفی کردن کار، طول سریع، شباهت با مجموعه سخت شناخته شده، اعتماد به نفس از اولین عبور).
- هزینه های مخلوط انتظار می رود را در تقسیم مسیر هدف و تحمل از دست دادن کیفیت محاسبه کنید.
- متریک نظارت بر حرکت (دروازه کیفیت آنلاین) را که مدل ارزان را می گیرد، نام دهید.
مشکل
خدمات شما هزینه 80 هزار دلار در ماه در GPT-5 است. تحلیل شما نشان می دهد که 70 درصد از سوالات ساده هستند: " ساعت چه زمانی در پاریس است؟" "این جمله را تغییر دهید". یک مدل کلاس هایکو به طور کامل با 3 درصد از هزینه آنها را اداره می کند. 30 درصد نیاز به استدلال GPT-5 کدگذاری، ریاضیات، برنامه ریزی چند مرحله ای.
اگر شما راه اندازی 70% به ارزان و 30% به گران قیمت، صورتحساب شما کاهش ~ 65% در همان کیفیت محصول است. این راه اندازی است. ترفند ساخت دلال بدون کاهش کیفیت است.
مفهوم
چهار سیگنال رویتینگ
- Task classification: ساده / پیچیده / کدگ / ریاضی / چت. می تواند یک طبقه بندی مبتنی بر قوانین ، یک LLM کوچک (کلاس هایکو در 0.25 $ / M) یا شبیه سازی با سطل های برچسب شده باشد. محصول: مسیر = ارزان / متعادل / مرز.
- Prompt length: پیام های فوری > 4K توکن اغلب نیاز به مرز برای پیوستگی. پیام های <500 توکن معمولا نمی کنند.
- Embedding similarity to known-hard set: اگر سوال نزدیک (کوسین > 0.88) به یک سطل سخت شناخته شده باشد، به طور مستقیم به مرز حرکت کنید.
- Self-confidence from first-pass: ارسال به ارزان؛ اگر تست های سوابق مدل اعتماد کم نشان دهند یا آن را رد کند یا زبان پوشش را بازخورد، دوباره در مرز تلاش کنید. اضافه می کند P95 تاخیر در ~ 10% از ترافیک اما صرفه جویی 50% + در 90٪ دیگر.
سه الگوی
Pre-route(در طبقه بندی بالا): ~ 5-10ms تاخیر اضافه شده؛ سریع ترین در مجموع.
Cascade(بزرگترين، بالا رفتن در مورد اعتماد کم): ~1.2x متوسط تاخير (بزرگترين اجرا و تایید) ~2x در بالا رفتن.
Ensemble route(در برابر نمونه، انتخاب مدل پاداش، ارزان و مرز اجرا می شود): بالاترین کیفیت، بالاترین هزینه؛ تنها برای A/B های حیاتی استفاده می شود.
اجرای
دروازه های هوش مصنوعی (فاز 17 · 19) رویتینگ را نشان می دهند.routerپورتکی دارای محافظ + روتینگ است. کنگ گیتوی AI روتینگ مبتنی بر افزونه ای دارد. بازار مدل OpenRouter یک API توصیه را افشا می کند.
منبع باز: RouteLLM (LMSYS) ، نه الماس (تجاری) ، Prompt Mule.
منحنی قیمت 2026
| Model class | Late 2022 | 2026 | Change |
|---|---|---|---|
| GPT-4-level quality | ~$20/M | ~$0.40/M | 50x cheaper |
| Frontier (GPT-5, Claude 4) | — | ~$3-10/M | new tier |
بیشتر پیشرفت ها در خدمت با بهره وری است درس های اصلی در مرحله 17 · 04-09 به کاهش هزینه های طرف ارائه دهنده تبدیل شده است. روتینگ به شما امکان می دهد این دستاوردها را در لایه برنامه ها ضبط کنید به جای انتظار همه کاربران خود را برای مهاجرت به سطح ارزان.
انحراف خطر واقعی است
مسیر شما ۴۰ درصد را به مدل ارزان تر می فرستد. در طول شش ماه، توزیع وظایف تغییر می کند (کاربران پیچیده تر می شوند، سوالات طولانی تر می پرسند). روتر متوجه نمی شود زیرا طبقه بندی کننده آن بر اساس داده های Q1 آموزش دیده است. کیفیت به طور ساکت کاهش می یابد. هیچ کس به اندازه کافی بلند شکایت نمی کند. شما در یک معیار رقبایی متوجه می شوید که از دست داده اید.
مسیرهای دروازه با توجه به معیار کیفیت آنلاین:
- استفاده از انگشت های انگشت بالا/ پایین در هر مسیر
- قضاوت خودکار LLM بر روی نمونه ای که در طول مدت انجام شده است (۵٪) در هر مسیر.
- نرخ ارتفاع: اگر آب و هوا در مسیر بالا > 30% حرکت می کند، مدل ارزان قیمت بیش از حد هدایت می شود.
- نرخ رد در هر مسیر
شماره هایی که باید به یاد داشته باشی
- 2026 صرفه جویی در مسیر با کیفیت ایزو: 20-60% مطالعات موردی.
- کاهش قیمت LLM 2022-2026: ~ 10 برابر در سال مجموع
- GPT-4 سطح 2022 در مقابل 2026: ~$20/M → ~$0.40/م
- تاثیر تاخیر در آب: ~ 1.2x متوسط، ~ 2x افزایش یافته (~ 10٪ ترافیک).
ازش استفاده کن
code/main.pyشبیه سازی پیش رو، آب و هوا و مجموعه در یک بار کار مخلوط. گزارش هزینه های مخلوط، از دست دادن کیفیت و نرخ افزایش.
-باده
این درس به ما کمک می کندoutputs/skill-router-plan.mdبا توجه به حجم کار و بودجه کیفیت، الگوی مسیر و سیگنال ها را انتخاب می کند.
تمرینات
- فرار کن
code/main.pyدر چه طبقه اي که آبشار از مسیر قبل عبور ميکنه؟ - پایگاه کاربران شما ۳۰ درصد شرکت (سوال های پیچیده) و ۷۰ درصد سطح رایگان (ساده) است. تقسیم روتینگ را طراحی کنید. چه اندازه گیری آنلاین آن را دروازه می کند؟
- یک مسیر کیفیت را 2 درصد کاهش می دهد اما 40 درصد را صرفه جویی می کند. آیا این یک کشتی است؟ بستگی به محصول دارد.
- از طریق بررسی اعتبار با استفاده از logprobs از OpenAI / APIs انسان شناسی انجام دهید.
- در طول شش ماه، میزان تصعيد از 8 درصد به 22 درصد افزایش می یابد. سه علت و درمان هر یک را تشخیص دهید.
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| Model routing | "cost broker" | Dynamic choice of model per request |
| Model cascade | "cheap-first escalate" | Run cheap, fall through to frontier on low confidence |
| Pre-route | "classify first" | Classifier up front; no re-run |
| Ensemble route | "parallel pick" | Run multiple, reward-model picks best |
| Escalation rate | "uprouted %" | Fraction of cascade requests that escalated |
| RouteLLM | "LMSYS router" | OSS router library |
| Not Diamond | "commercial router" | SaaS model-routing product |
| Drift | "cheap creep" | Distribution shift without router noticing |
| Online quality gate | "live check" | Automated LLM-judge sampling live traffic |
خواندن بیشتر
- AbhyashSuchi — Model Routing LLM 2026 Best Practices
- Lukas Brunner — Rise of Inference Optimization 2026
- RouteLLM paper / code
- Not Diamond — model routing
- OpenRouter دروازه چند مدل با رویتینگ ابتدایی
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.