Phase 17: Infrastructure & Production

लागत-कमीकरण के रूप में मॉडल रूटिंग आदिम

एक गतिशील ब्रोकर प्रत्येक अनुरोध (कार्य प्रकार, टोकन लंबाई, एम्बेडिंग समानता, विश्वास) का मूल्यांकन करता है और सस्ते मॉडल में सरल प्रश्न भेजता है, सीमा मॉडल में जटिल प्रश्नों को बढ़ता है। इसे मॉडल कैस्केडिंग भी कहा जाता है। उत्पादन केस स्टडीज से पता चलता है कि अमेरिका/ब्रिटेन/ईयू के तैनाती में आईसो-क्वालिटी पर 20-60% लागत में कमी; उच्च मात्रा के SaaS पर 30% रूटिंग दक्षता में सुधार छह अंकों की वार्षिक बचत में बदल जाता है। 2026 के संदर्भ में LLM inference की कीमतें ~ 10x प्रति वर्ष गिर गई हैं एक GPT-4 वर्ग टोकन से चला गया $20/M to ~$2022 के अंत से 2026 तक 0.40/M। अधिकांश गिरावट हार्डवेयर की नहीं, बल्कि स्टैक (चरण 17 · 04-09) की बेहतर सेवा है। रूटिंग यह है कि आप उत्पाद प्रतिगमन के बिना मार्जिन में उस मूल्य गिरावट को कैसे परिवर्तित करते हैं। विफलता मोड सस्ते मॉडल के बहाव हैः मार्ग 40% को कमजोर मॉडल पर धकेलता है, तर्क कार्य पर गुणवत्ता 3-5% गिर जाती है, कोई भी एक तिमाही के लिए नोटिस नहीं करता है। ऑनलाइन गुणवत्ता माप द्वारा गेट मार्ग, न केवल ऑफ़लाइन मूल्यांकन सेट।

Type: Learn

Languages: Python (stdlib, toy cascading router simulator)

Prerequisites: Phase 17 · 01 (Managed LLM Platforms), Phase 17 · 19 (AI Gateways)

Time: ~60 minutes

सीखने के लक्ष्य

  • मॉडल कैस्केडिंग की व्याख्या करेंः सस्ता-पहले विश्वास जांच के साथ, कम विश्वास पर बढ़ोतरी।
  • चार रूटिंग सिग्नल (कार्य वर्गीकरण, शीघ्र लंबाई, ज्ञात-हार्ड सेट के समानता को एम्बेड करना, पहले पास से आत्मविश्वास) को सूचीबद्ध करें।
  • लक्ष्य रूटिंग विभाजन और गुणवत्ता हानि सहिष्णुता पर अपेक्षित मिश्रित लागत की गणना करें।
  • ड्रिफ्ट-मॉनिटरिंग मेट्रिक (ऑनलाइन क्वालिटी गेट) का नाम बताइए जो कि सस्ते मॉडल के क्रैप को पकड़ता है।

समस्या

आपकी सेवा की लागत GPT-5 पर $80k/महीना है। आपके विश्लेषण से पता चलता है कि 70% प्रश्न सरल हैंः "पेरिस में समय कितना है?" "इस वाक्य को फिर से लिखें।" एक हाइकु-क्लास मॉडल लागत के 3% पर उन्हें पूरी तरह से संभालता है। 30% को GPT-5 के तर्क की आवश्यकता है कोडिंग, गणित, बहु-चरण योजना।

यदि आप 70% को सस्ते और 30% को महंगे को रूट करते हैं, तो आपके बिल में समान उत्पाद गुणवत्ता पर ~ 65% की गिरावट आती है। यह रूटिंग है। ट्रिक गुणवत्ता में गिरावट के बिना ब्रोकर का निर्माण है।

अवधारणा

चार रूटिंग सिग्नल

  1. Task classification: सरल/संक्रामक/कोडेन/गणित/चैट। यह एक नियम आधारित वर्गीकरण, एक छोटा LLM (हेकु-क्लास $0.25/M) या लेबल वाले बाल्टियों के समानता को एम्बेड कर सकता है। आउटपुटः मार्ग = सस्ता / संतुलित / सीमा।
  1. Prompt length: प्रम्प्ट्स >4K टोकन को अक्सर स्थिरता के लिए सीमा की आवश्यकता होती है। <500 टोकन आमतौर पर नहीं करते हैं।
  1. Embedding similarity to known-hard set: यदि क्वेरी ज्ञात कठोर बाल्टी के निकट (कोसिन > 0.88) है, तो सीधे सीमा तक बढ़ें।
  1. Self-confidence from first-pass: सस्ते में भेजें; यदि मॉडल के लॉग-सर्वेक्षण कम विश्वसनीयता दिखाते हैं OR यह अस्वीकार करता है OR हेजिंग भाषा आउटपुट, सीमा पर पुनः प्रयास करें। ~ 10% ट्रैफ़िक पर P95 विलंबता जोड़ता है लेकिन शेष 90% पर 50% + बचाता है।

तीन पैटर्न

Pre-route(प्रदानकर्ता अग्रिम): ~5-10ms विलंबता जोड़ा; सबसे तेजी से समग्र।

Cascade(सस्ते-पहले, कम विश्वसनीयता पर बढ़ते): ~1.2x औसत विलंबता (सस्ते रन प्लस सत्यापित), ~2x बढ़ते पर। सबसे अच्छी गुणवत्ता तल।

Ensemble route(समुच्चन के लिए सस्ते और सीमा पार समानांतर में चलाएं, पुरस्कार मॉडल चुनें): उच्चतम गुणवत्ता, उच्चतम लागत; केवल महत्वपूर्ण ए/बी के लिए उपयोग करें।

कार्यान्वयन

एआई गेटवे (चरण 17 · 19) रूटिंग को उजागर करते हैं।routerपोर्टकी में गार्ड + राउटिंग है। कॉंग एआई गेटवे में प्लगइन आधारित राउटिंग है। ओपनरॉटर के मॉडल मार्केटप्लेस में एक सिफारिश एपीआई उजागर होता है।

ओपन सोर्सः रूटएलएलएम (एलएमएसवाईएस), डायमंड नहीं (व्यापारिक), प्रॉम्प्ट म्यूले।

2026 की मूल्य वक्र

Model classLate 20222026Change
GPT-4-level quality~$20/M~$0.40/M50x cheaper
Frontier (GPT-5, Claude 4)—~$3-10/Mnew tier

अधिकांश सुधार दक्षता की सेवा कर रहा है चरण 17 · 04-09 में मुख्य सबक प्रदाता-पक्ष लागत में गिरावट में बदल गया। रूटिंग आपको उन लाभों को ऐप परत पर कैप्चर करने की अनुमति देता है बजाय आपके सभी उपयोगकर्ताओं के सस्ते स्तर पर माइग्रेट करने की प्रतीक्षा करने के लिए।

ड्रिफ्ट वास्तविक जोखिम है

आपका मार्ग सस्ते मॉडल पर 40% भेजता है। छह महीने के दौरान, कार्य वितरण बदल जाता है (उपयोगकर्ता अधिक परिष्कृत होते हैं, लंबे प्रश्न पूछते हैं) । राउटर नोटिस नहीं करता है क्योंकि इसका वर्गीकरण Q1 डेटा पर प्रशिक्षित किया गया था। गुणवत्ता चुपचाप गिरती है। कोई भी जोर से पर्याप्त शिकायत नहीं करता है। आप प्रतियोगी बेंचमार्क में पता करते हैं कि आप हार गए हैं।

ऑनलाइन गुणवत्ता माप के अनुसार गेट रूटः

  • प्रत्येक मार्ग पर उपयोगकर्ता को ऊपर/नीचे उंगली।
  • प्रति मार्ग एक प्रतिरोधित नमूना (5%) पर स्वचालित LLM-आधारित न्यायकर्ता।
  • वृद्धि दरः यदि पंखुड़ी ऊपर की ओर बढ़ रही है तो 30% से अधिक, सस्ता मॉडल ओवरराइट किया जा रहा है।
  • प्रति मार्ग अस्वीकार दर।

संख्याओं को याद रखना चाहिए

  • 2026 रूटिंग बचत iso-quality: 20-60% केस स्टडीज।
  • एलएलएम की कीमत में गिरावट 2022-2026: प्रति वर्ष कुल मिलाकर 10 गुना।
  • जीपीटी-4 स्तर 2022 बनाम 2026: ~$20/M → ~$0.40/एम।
  • कैस्केड लेटेन्सी प्रभावः ~1.2x मध्यम, ~2x बढ़ गया (~10% ट्रैफ़िक) ।

इसका प्रयोग करें

code/main.pyएक मिश्रित कार्यभार पर पूर्व-मार्ग, झरना और समूह का अनुकरण करता है। लागत, गुणवत्ता हानि और वृद्धि दर के मिश्रित रिपोर्ट।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-router-plan.md. कार्यभार और गुणवत्ता बजट को देखते हुए, एक रूटिंग पैटर्न और संकेत चुनता है।

व्यायाम

  1. दौड़ेंcode/main.py. किस सटीकता मंजिल पर झरना पूर्व मार्ग से आगे निकलता है?
  2. आपके उपयोगकर्ता आधार 30% उद्यम (कम्प्लेक्स क्वेरी), 70% मुक्त स्तर (सरल) है। रूटिंग विभाजन डिजाइन. क्या ऑनलाइन मीट्रिक इसे गेट करता है?
  3. एक मार्ग गुणवत्ता 2% तक गिरता है लेकिन 40% बचाता है। यह एक जहाज है? उत्पाद पर निर्भर करता है दोनों तर्क।
  4. ओपनएआई / मानव एपीआई से लॉगप्रोब का उपयोग करके विश्वसनीयता जांच करें। आप किस सीमा से शुरू करते हैं?
  5. छह महीने में, वृद्धि दर 8% से बढ़कर 22% हो जाती है। तीन कारणों का निदान करें और प्रत्येक के लिए समाधान।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
Model routing"cost broker"Dynamic choice of model per request
Model cascade"cheap-first escalate"Run cheap, fall through to frontier on low confidence
Pre-route"classify first"Classifier up front; no re-run
Ensemble route"parallel pick"Run multiple, reward-model picks best
Escalation rate"uprouted %"Fraction of cascade requests that escalated
RouteLLM"LMSYS router"OSS router library
Not Diamond"commercial router"SaaS model-routing product
Drift"cheap creep"Distribution shift without router noticing
Online quality gate"live check"Automated LLM-judge sampling live traffic

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.