نموذج التوجيه كطريقة بدائية للحد من التكاليف
Type: Learn
Languages: Python (stdlib, toy cascading router simulator)
Prerequisites: Phase 17 · 01 (Managed LLM Platforms), Phase 17 · 19 (AI Gateways)
Time: ~60 minutes
أهداف التعلم
- شرح نموذج التسلسل: رخيص أولاً مع التحقق من الثقة، تصاعد على انخفاض الثقة.
- قم بإدراج إشارات التوجيه الأربعة (صنف المهمة، طول المكالمة، وضمان التشابه مع مجموعة الصلبة المعروفة، الثقة بالنفس من أول مرور).
- الحساب المتوقع التكلفة المختلطة عند توزيع التوجيهات المستهدفة وتسامح الخسائر في الجودة.
- أسمي مقياس مراقبة التجرف (بوابة الجودة عبر الإنترنت) التي تلتقط المتنقل النموذج الرخيص.
المشكلة
تكلفة خدمةك 80 ألف دولار في الشهر على GPT-5 تحليلك يظهر أن 70% من الأسئلة بسيطة: "ما هو الوقت في باريس؟" "اعيد صياغة هذه الجملة". نموذج درجة هايكو يتعامل مع هذه بشكل مثالي عند 3% من التكلفة.
إذا قمت بتوجيه 70% إلى رخيص و 30% إلى مكلف، فإن فاتورتك تنخفض بنسبة 65% بنفس نوعية المنتج. هذا هو التوجيه. الخدعة هي بناء الوسيط دون تراجع الجودة.
المفهوم
أربعة إشارات توجيه
- Task classification: بسيط/معقد/مدون/رياضيات/رداء. يمكن أن يكون تصنيفًا قائمًا على القواعد ، أو ماجستير في التدريس (درجة هايكو عند 0.25 دولارًا / مليون دولار) ، أو تضمين شبيهة مع علبات معينة. الناتج: الطريق = رخيص / متوازن / حدود.
- Prompt length: الإشارات > 4K توكنات غالبا ما تحتاج إلى الحدود للاستمرار. الإشارات < 500 توكنات عادة لا.
- Embedding similarity to known-hard set: إذا كان البحث قريب (كوزين > 0.88) من سطل صلب معروف، تصاعد إلى الحدود مباشرة.
- Self-confidence from first-pass: إرسال إلى رخيص؛ إذا أظهرت أبحاث السجلات الخاصة بالنموذج ثقة منخفضة أو رفض أو أخرج لغة التحوط، حاول مرة أخرى على الحدود. يضيف تأخير P95 على ~ 10% من حركة المرور ولكن يوفر 50% + على 90٪ الأخرى.
ثلاثة أنماط
Pre-route(مصنف في الأمام): ~ 5-10ms تأخر إضافة؛ أسرع بشكل عام.
Cascade(رخيص أولاً، يتصاعد عند انخفاض الثقة): ~ 1.2x متوسط تأخير (تشغيل رخيص زائد التحقق) ~ 2x عند التصاعد. أفضل نوعية الأرض.
Ensemble route(تجري على السعر الرخيص والحدود بالتوازي لمتطلبات العينة، اختيار نموذج مكافأة): أعلى جودة، أعلى تكلفة؛ استخدام فقط لتحديد النتائج الحرجة.
التنفيذ
بوابات الذكاء الاصطناعي (المرحلة 17 · 19) تعرض التوجيه.routerالتشغيل مع التراجع والمسار التكلفة. Portkey لديه الحراس + التوجيه. Kong AI Gateway لديه التوجيه القائم على المكونات التضخمية. موقع OpenRouter للأسواق نموذج يعرض API التوصية.
المصدر المفتوح: RouteLLM (LMSYS) ، ليس الماس (التجارية) ، المُسجلة المُساعدة.
منحنى الأسعار لعام 2026
| Model class | Late 2022 | 2026 | Change |
|---|---|---|---|
| GPT-4-level quality | ~$20/M | ~$0.40/M | 50x cheaper |
| Frontier (GPT-5, Claude 4) | — | ~$3-10/M | new tier |
معظم التحسينات هي خدمة الكفاءة الدروس الأساسية في المرحلة 17 · 04-09 تحولت إلى انخفاضات في تكاليف جانب المزود. يتيح لك التوجيه التقاط تلك المكاسب في طبقة التطبيق بدلاً من الانتظار لجميع مستخدميك للهجرة إلى المستوى الرخيص.
التدفق هو المخاطر الحقيقية
يرسل طريقك 40% إلى النموذج الرخيص. على مدى ستة أشهر، تتغير توزيع المهام (يتطور المستخدمون، يطرحون أسئلة أطول). لا يلاحظ الجهاز التوجيهي لأن مصنفه تم تدريبه على بيانات Q1. ينخفض الجودة بصمت. لا أحد يشكو بصوت عال بما فيه الكفاية. تكتشف في مقياس منافس أنك خسرت.
طرق البوابة حسب مقاييس الجودة عبر الإنترنت:
- إبهام المستخدم / إبهام أسفل على كل طريق
- القاضي الآلي لـ LLM على عينة تمت الاحتفاظ بها (5%) لكل طريق.
- معدل التصعيد: إذا كانت الصقوط تتحرك في الطريق الصعودي > 30% ، فإن النموذج الرخيص يتم تجاوز الطريق.
- معدل الرفض لكل طريق
أرقام يجب أن تتذكر
- 2026 توفيرات التوجيه عند الجودة المتفردة: 20-60% من دراسات الحالة.
- انخفاض أسعار ماجستير في مجال التعليمات العليا 2022-2026: ~ 10x في السنة إجماليًا.
- مستوى GPT-4 2022 مقابل 2026: ~$20/M → ~$0.40/م
- تأثير التخفيف في حالة الطقس: ~ 1.2x المتوسط ، ~ 2x تصاعد (~ 10% من حركة المرور).
استخدمها
code/main.pyيحاكي المخططات السابقة والمركبات والجميع على عبء عمل مختلط. يبلغ عن تكلفة مختلطة وفقدان الجودة ومعدل التصعيد.
أرسله
هذا الدرس يُنتجoutputs/skill-router-plan.mdنظراً لفترة العمل والفائدة، يختار نمط التوجيه والإشارات.
التمارين
- أركض
code/main.pyفي أي طابق دقيق تتجاوز الصقيع المسبق؟ - قاعدة المستخدمين الخاصة بك هي 30٪ المؤسسة (الطلبات المعقدة) ، 70٪ مجانا المستوى (بسيطة). تصميم التقسيم التوجيه. ما المقاييس عبر الإنترنت بوابات ذلك؟
- إنّ طريقًا يقلل من جودة بنسبة 2% لكنه يوفّر 40%. هل هذه سفينة؟
- تنفيذ فحص ثقة باستخدام أجهزة التحقق من OpenAI / APIs Anthropic. ما هو العد الذي تبدأ به؟
- خلال ستة أشهر، ارتفع معدل التصعيد من 8% إلى 22%. تشخيص ثلاثة أسباب وتحديدها لكل منها.
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| Model routing | "cost broker" | Dynamic choice of model per request |
| Model cascade | "cheap-first escalate" | Run cheap, fall through to frontier on low confidence |
| Pre-route | "classify first" | Classifier up front; no re-run |
| Ensemble route | "parallel pick" | Run multiple, reward-model picks best |
| Escalation rate | "uprouted %" | Fraction of cascade requests that escalated |
| RouteLLM | "LMSYS router" | OSS router library |
| Not Diamond | "commercial router" | SaaS model-routing product |
| Drift | "cheap creep" | Distribution shift without router noticing |
| Online quality gate | "live check" | Automated LLM-judge sampling live traffic |
المزيد من القراءة
- AbhyashSuchi — Model Routing LLM 2026 Best Practices
- Lukas Brunner — Rise of Inference Optimization 2026
- RouteLLM paper / code
- Not Diamond — model routing
- OpenRouterبوابة متعددة النماذج مع أسباب التوجيه.
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.