लागत-कमीकरण के रूप में मॉडल रूटिंग आदिम
Type: Learn
Languages: Python (stdlib, toy cascading router simulator)
Prerequisites: Phase 17 · 01 (Managed LLM Platforms), Phase 17 · 19 (AI Gateways)
Time: ~60 minutes
सीखने के लक्ष्य
- मॉडल कैस्केडिंग की व्याख्या करेंः सस्ता-पहले विश्वास जांच के साथ, कम विश्वास पर बढ़ोतरी।
- चार रूटिंग सिग्नल (कार्य वर्गीकरण, शीघ्र लंबाई, ज्ञात-हार्ड सेट के समानता को एम्बेड करना, पहले पास से आत्मविश्वास) को सूचीबद्ध करें।
- लक्ष्य रूटिंग विभाजन और गुणवत्ता हानि सहिष्णुता पर अपेक्षित मिश्रित लागत की गणना करें।
- ड्रिफ्ट-मॉनिटरिंग मेट्रिक (ऑनलाइन क्वालिटी गेट) का नाम बताइए जो कि सस्ते मॉडल के क्रैप को पकड़ता है।
समस्या
आपकी सेवा की लागत GPT-5 पर $80k/महीना है। आपके विश्लेषण से पता चलता है कि 70% प्रश्न सरल हैंः "पेरिस में समय कितना है?" "इस वाक्य को फिर से लिखें।" एक हाइकु-क्लास मॉडल लागत के 3% पर उन्हें पूरी तरह से संभालता है। 30% को GPT-5 के तर्क की आवश्यकता है कोडिंग, गणित, बहु-चरण योजना।
यदि आप 70% को सस्ते और 30% को महंगे को रूट करते हैं, तो आपके बिल में समान उत्पाद गुणवत्ता पर ~ 65% की गिरावट आती है। यह रूटिंग है। ट्रिक गुणवत्ता में गिरावट के बिना ब्रोकर का निर्माण है।
अवधारणा
चार रूटिंग सिग्नल
- Task classification: सरल/संक्रामक/कोडेन/गणित/चैट। यह एक नियम आधारित वर्गीकरण, एक छोटा LLM (हेकु-क्लास $0.25/M) या लेबल वाले बाल्टियों के समानता को एम्बेड कर सकता है। आउटपुटः मार्ग = सस्ता / संतुलित / सीमा।
- Prompt length: प्रम्प्ट्स >4K टोकन को अक्सर स्थिरता के लिए सीमा की आवश्यकता होती है। <500 टोकन आमतौर पर नहीं करते हैं।
- Embedding similarity to known-hard set: यदि क्वेरी ज्ञात कठोर बाल्टी के निकट (कोसिन > 0.88) है, तो सीधे सीमा तक बढ़ें।
- Self-confidence from first-pass: सस्ते में भेजें; यदि मॉडल के लॉग-सर्वेक्षण कम विश्वसनीयता दिखाते हैं OR यह अस्वीकार करता है OR हेजिंग भाषा आउटपुट, सीमा पर पुनः प्रयास करें। ~ 10% ट्रैफ़िक पर P95 विलंबता जोड़ता है लेकिन शेष 90% पर 50% + बचाता है।
तीन पैटर्न
Pre-route(प्रदानकर्ता अग्रिम): ~5-10ms विलंबता जोड़ा; सबसे तेजी से समग्र।
Cascade(सस्ते-पहले, कम विश्वसनीयता पर बढ़ते): ~1.2x औसत विलंबता (सस्ते रन प्लस सत्यापित), ~2x बढ़ते पर। सबसे अच्छी गुणवत्ता तल।
Ensemble route(समुच्चन के लिए सस्ते और सीमा पार समानांतर में चलाएं, पुरस्कार मॉडल चुनें): उच्चतम गुणवत्ता, उच्चतम लागत; केवल महत्वपूर्ण ए/बी के लिए उपयोग करें।
कार्यान्वयन
एआई गेटवे (चरण 17 · 19) रूटिंग को उजागर करते हैं।routerपोर्टकी में गार्ड + राउटिंग है। कॉंग एआई गेटवे में प्लगइन आधारित राउटिंग है। ओपनरॉटर के मॉडल मार्केटप्लेस में एक सिफारिश एपीआई उजागर होता है।
ओपन सोर्सः रूटएलएलएम (एलएमएसवाईएस), डायमंड नहीं (व्यापारिक), प्रॉम्प्ट म्यूले।
2026 की मूल्य वक्र
| Model class | Late 2022 | 2026 | Change |
|---|---|---|---|
| GPT-4-level quality | ~$20/M | ~$0.40/M | 50x cheaper |
| Frontier (GPT-5, Claude 4) | — | ~$3-10/M | new tier |
अधिकांश सुधार दक्षता की सेवा कर रहा है चरण 17 · 04-09 में मुख्य सबक प्रदाता-पक्ष लागत में गिरावट में बदल गया। रूटिंग आपको उन लाभों को ऐप परत पर कैप्चर करने की अनुमति देता है बजाय आपके सभी उपयोगकर्ताओं के सस्ते स्तर पर माइग्रेट करने की प्रतीक्षा करने के लिए।
ड्रिफ्ट वास्तविक जोखिम है
आपका मार्ग सस्ते मॉडल पर 40% भेजता है। छह महीने के दौरान, कार्य वितरण बदल जाता है (उपयोगकर्ता अधिक परिष्कृत होते हैं, लंबे प्रश्न पूछते हैं) । राउटर नोटिस नहीं करता है क्योंकि इसका वर्गीकरण Q1 डेटा पर प्रशिक्षित किया गया था। गुणवत्ता चुपचाप गिरती है। कोई भी जोर से पर्याप्त शिकायत नहीं करता है। आप प्रतियोगी बेंचमार्क में पता करते हैं कि आप हार गए हैं।
ऑनलाइन गुणवत्ता माप के अनुसार गेट रूटः
- प्रत्येक मार्ग पर उपयोगकर्ता को ऊपर/नीचे उंगली।
- प्रति मार्ग एक प्रतिरोधित नमूना (5%) पर स्वचालित LLM-आधारित न्यायकर्ता।
- वृद्धि दरः यदि पंखुड़ी ऊपर की ओर बढ़ रही है तो 30% से अधिक, सस्ता मॉडल ओवरराइट किया जा रहा है।
- प्रति मार्ग अस्वीकार दर।
संख्याओं को याद रखना चाहिए
- 2026 रूटिंग बचत iso-quality: 20-60% केस स्टडीज।
- एलएलएम की कीमत में गिरावट 2022-2026: प्रति वर्ष कुल मिलाकर 10 गुना।
- जीपीटी-4 स्तर 2022 बनाम 2026: ~$20/M → ~$0.40/एम।
- कैस्केड लेटेन्सी प्रभावः ~1.2x मध्यम, ~2x बढ़ गया (~10% ट्रैफ़िक) ।
इसका प्रयोग करें
code/main.pyएक मिश्रित कार्यभार पर पूर्व-मार्ग, झरना और समूह का अनुकरण करता है। लागत, गुणवत्ता हानि और वृद्धि दर के मिश्रित रिपोर्ट।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-router-plan.md. कार्यभार और गुणवत्ता बजट को देखते हुए, एक रूटिंग पैटर्न और संकेत चुनता है।
व्यायाम
- दौड़ें
code/main.py. किस सटीकता मंजिल पर झरना पूर्व मार्ग से आगे निकलता है? - आपके उपयोगकर्ता आधार 30% उद्यम (कम्प्लेक्स क्वेरी), 70% मुक्त स्तर (सरल) है। रूटिंग विभाजन डिजाइन. क्या ऑनलाइन मीट्रिक इसे गेट करता है?
- एक मार्ग गुणवत्ता 2% तक गिरता है लेकिन 40% बचाता है। यह एक जहाज है? उत्पाद पर निर्भर करता है दोनों तर्क।
- ओपनएआई / मानव एपीआई से लॉगप्रोब का उपयोग करके विश्वसनीयता जांच करें। आप किस सीमा से शुरू करते हैं?
- छह महीने में, वृद्धि दर 8% से बढ़कर 22% हो जाती है। तीन कारणों का निदान करें और प्रत्येक के लिए समाधान।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| Model routing | "cost broker" | Dynamic choice of model per request |
| Model cascade | "cheap-first escalate" | Run cheap, fall through to frontier on low confidence |
| Pre-route | "classify first" | Classifier up front; no re-run |
| Ensemble route | "parallel pick" | Run multiple, reward-model picks best |
| Escalation rate | "uprouted %" | Fraction of cascade requests that escalated |
| RouteLLM | "LMSYS router" | OSS router library |
| Not Diamond | "commercial router" | SaaS model-routing product |
| Drift | "cheap creep" | Distribution shift without router noticing |
| Online quality gate | "live check" | Automated LLM-judge sampling live traffic |
आगे पढ़ना
- AbhyashSuchi — Model Routing LLM 2026 Best Practices
- Lukas Brunner — Rise of Inference Optimization 2026
- RouteLLM paper / code
- Not Diamond — model routing
- OpenRouter रूटिंग आदिम के साथ बहु-मॉडल गेटवे।
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.