एआई गेटवे लाइटएलएम, पोर्टकी, कांग एआई गेटवे, बिफ्रोस्ट
Type: Learn
Languages: Python (stdlib, toy gateway-routing simulator)
Prerequisites: Phase 17 · 01 (Managed LLM Platforms), Phase 17 · 16 (Model Routing)
Time: ~60 minutes
सीखने के लक्ष्य
- छह मुख्य गेटवे सुविधाओं (रूटिंग, बैकअप, रीट्री, रेट लिमिट, सिक्रेट, ऑब्जर्वेबिलिटी, गार्डरेल्स) को सूचीबद्ध करें।
- छतों और उपयोग के मामलों को स्केल करने के लिए 2026 तक चार गेटवे (LiteLLM, Portkey, Kong AI, Bifrost) का नक्शा बनाएं।
- कॉंग बेंचमार्क (228% बनाम पोर्टकी, 859% बनाम लाइटएलएलएम) का उल्लेख करें और बताएं कि यह 500 आरपीएस के लिए क्यों मायने रखता है।
- डेटा निवास और संचालन बजट के अनुसार स्वयं होस्ट बनाम प्रबंधित चुनें।
समस्या
आपके उत्पाद में OpenAI, Anthropic और एक स्वयं होस्ट किया गया Llama है। प्रत्येक प्रदाता के पास एक अलग SDK, त्रुटि मॉडल, दर सीमा और auth योजना है। आप एक विफलता चाहते हैं (यदि OpenAI 429s, Anthropic का प्रयास करें), एक एकल क्रेडेंशियल स्टोर, एकीकृत अवलोकन और प्रति किरायेदार दर सीमाएं।
ऐप लेयर पर इसे फिर से आविष्कार करना प्रत्येक सेवा को प्रत्येक प्रदाता से जोड़ता है। एक गेटवे लेयर इसे एक एपीआई (आमतौर पर ओपनएआई-संगत) के साथ एक प्रक्रिया में समेकित करता है जो प्रदाताओं को फैन्स करता है।
अवधारणा
छह मुख्य विशेषताएं
- Provider routing एक एपीआई के पीछे ओपनएआई, एंथ्रोपिक, मिथुन, स्व-होस्टिंग आदि।
- Fallback 429, 5xx पर, या गुणवत्ता विफलता, फिर से कहीं और प्रयास करें।
- Retries घातीय बैकऑफ, सीमित प्रयास।
- Rate limits प्रति किरायेदार, प्रति कुंजी, प्रति मॉडल।
- Secret references रनटाइम (ऐप में कभी नहीं) पर वॉल्ट से क्रेडेंशियल निकालें।
- Observability OTel + GenAI विशेषताएं (चरण 17 · 13) + लागत निर्धारण।
- Guardrails पीआईआई संवर्धन, जेलब्रेक पता लगाना, अनुमत विषय फ़िल्टर।
LiteLLM MIT OSS, पायथन
- 100+ प्रदाता, ओपनएआई संगत, राउटर कॉन्फ़िग, बैकअप, बुनियादी अवलोकनशीलता।
- Kong के बेंचमार्क में लगभग 2000 आरपीएस टूटता है; 8 जीबी मेमोरी फुटप्रिंट, निरंतर लोड के तहत कैस्केडिंग विफलताएं।
- सबसे अच्छा फिटः पायथन ऐप, <500 आरपीएस, डेवलपमेंट/स्टेजिंग गेटवे, प्रयोगात्मक रूटिंग।
- लागतः ओएसएस के लिए $0; क्लाउड मुक्त स्तर मौजूद है।
पोर्टकी नियंत्रण विमान की स्थिति
- मार्च 2026 तक अपाचे 2.0 ओएसएस। गार्डरेल्स, पीआईआई संपादन, जेलब्रेक पता लगाना, ऑडिट ट्रेल।
- 20-40 ms प्रति अनुरोध विलंब ओवरहेड।
- प्रति माह $49 प्रति उत्पादन स्तर के लिए प्रतिधारण + SLA के साथ।
- सबसे अच्छा फिटः विनियमित उद्योगों को सुरक्षा रैलियों + अवलोकन क्षमता बंडल की आवश्यकता होती है।
Kong AI गेटवे पैमाने खेल
- Kong Gateway पर बनाया गया (प्रबुद्ध एपीआई गेटवे उत्पाद, lua+OpenResty) ।
- 12 सीपीयू समकक्ष पर Kong का स्वयं का बेंचमार्कः पोर्टकी से 228% तेज, LiteLLM से 859% तेज।
- मूल्य निर्धारणः $ 100 / मॉडल / महीने, प्लस स्तर पर अधिकतम 5।
- सबसे अच्छा फिटः पहले से ही Kong पर; > 1000 RPS; लाइसेंस देने के लिए तैयार।
द्वि-मुद्रा (मैक्सिम एआई)
- कॉन्फ़िगरेबल बैकऑफ के साथ स्वचालित पुनः प्रयास।
- ओपनएआई 429 पर मानव विज्ञान पर वापसी एक वैदिक नुस्खा है।
- नए आवेदक; वाणिज्यिक.
क्लाउडफ्लेयर एआई गेटवे / वर्सेल एआई गेटवे
- प्रबंधित, शून्य-ऑपरेशन, बुनियादी पुनः प्रयास और अवलोकनशीलता.
- सबसे अच्छा फिटः क्लाउडफ्लेयर/वर्सेल पर एज-सेवा वाले जावास्क्रिप्ट ऐप।
- रैलियों और दर सीमाओं पर Kong/Portkey की तुलना में सीमित।
स्वयं होस्ट बनाम प्रबंधित
डेटा निवास बल कार्य है। स्वास्थ्य और वित्त डिफ़ॉल्ट स्वयं-होस्ट (LiteLLM या Portkey OSS या Kong) । उपभोक्ता उत्पादों डिफ़ॉल्ट प्रबंधित (Cloudflare AI गेटवे) या मध्य-स्तरीय (Portkey प्रबंधित) । हाइब्रिडः विनियमित किरायेदार के लिए स्वयं-होस्ट, दूसरों के लिए प्रबंधित।
विलंबता बजट
- लोटलमः 5-15 एमएस ओवरहेड सामान्य।
- पोर्टकीः 20-40 एमएस ओवरहेड।
- 3.8 ms ओवरहेड.
- Cloudflare/Vercel: 1-3 ms ओवरहेड (एज फायदा)
गेटवे लटेंसी सीधे TTFT में जोड़ता है। TTFT P99 के लिए < 100 ms SLA, Kong या Cloudflare। P99 < 500 ms के लिए, कोई भी।
दर-सीमा अर्थशास्त्र विषय
सरल टोकन-बकेट मध्यम पैमाने पर काम करता है। मल्टी-रिटेनेंट स्लाइडिंग-विंडो + बर्फ allowance + प्रति किरायेदार टायरिंग की आवश्यकता होती है। LiteLLM टोकन-बकेट जहाजों; कॉंग जहाजों स्लाइडिंग-विंडो; पोर्टकी जहाजों स्तरित।
गेटवे + अवलोकनशीलता + रूटिंग रचना
चरण 17 · 13 (निरीक्षण) + 16 (मॉडल रूटिंग) + 19 (गेटवेज) उत्पादन में एक ही परत हैं। तीनों को कवर करने वाला एक उपकरण चुनें या उन्हें ध्यान से तार करेंः अधिकांश 2026 तैनाती हेलिकोन (निरीक्षण) या पोर्टकी (गार्ड्रेल) को विभाजित भूमिकाओं के लिए कॉंग (पैमाना) के साथ जोड़ती हैं।
संख्याओं को याद रखना चाहिए
- LiteLLM: ~ 2000 RPS पर टूटता है, 8 जीबी मेमोरी।
- पोर्टकीः 20-40 एमएस ओवरहेड; मार्च 2026 से अपाचे 2.0।
- कॉंग: पोर्टकी से 228% तेज, लाइटएलएम से 859% तेज।
- कॉंग मूल्य निर्धारणः $ 100 / मॉडल / महीने, प्लस स्तर पर 5 अधिकतम।
- Cloudflare/Vercel: कगार पर 1-3 ms ओवरहेड।
इसका प्रयोग करें
code/main.py429/5xx इंजेक्शन के तहत 3 प्रदाताओं के बीच फॉलबैक के साथ गेटवे रूटिंग का अनुकरण करता है। विलंबता, पुनः प्रयास दर और फॉलबैक हिट दर की रिपोर्ट करता है।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-gateway-picker.md. आकार, परिचालन स्थिति, अनुपालन, विलंबता बजट को देखते हुए, एक गेटवे चुनता है.
व्यायाम
- दौड़ें
code/main.py. OpenAI→Anthropic→स्व-होस्ट से बैकअप कॉन्फ़िगर करें. 5% प्रदाता त्रुटि दर पर अपेक्षित हिट दर क्या है? - आपके SLA TTFT P99 < 200 ms है 300 ms बेसलाइन पर. कौन से गेटवे बजट के भीतर रहते हैं?
- एक स्वास्थ्य सेवा ग्राहक को स्वयं होस्ट + पीआईआई संपादन + लेखा परीक्षा की आवश्यकता होती है। पोर्टकी ओएसएस या कॉंग चुनें।
- LiteLLM vs Kong की तुलना करेंः टीम को किस आरपीएस सीमा पर प्रवास करना चाहिए?
- बहु-आवासीय सास के लिए दर सीमा नीति डिजाइन करेंः मुफ्त स्तर, परीक्षण स्तर, भुगतान स्तर। टोकन-बकेट या स्लाइडिंग-विंडो?
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| Gateway | "API broker" | Process sitting between apps and providers |
| LiteLLM | "the MIT one" | Python OSS, 100+ providers, breaks at 2K RPS |
| Portkey | "guardrails gateway" | Control plane + observability, Apache 2.0 |
| Kong AI Gateway | "the scale one" | Built on Kong Gateway, benchmark leader |
| Bifrost | "Maxim's gateway" | Retries + Anthropic fallback recipe |
| Cloudflare AI Gateway | "edge managed" | Edge-deployed managed gateway, zero-ops |
| PII redaction | "data scrub" | Regex + NER mask before sending to model |
| Jailbreak detection | "prompt injection guard" | Classifier on user input |
| Audit trail | "regulated log" | Immutable record of every LLM call |
| Token-bucket | "simple rate limit" | Refill-based rate limiter |
| Sliding-window | "precise rate limit" | Time-windowed rate limiter; better fairness |
आगे पढ़ना
- Kong AI Gateway Benchmark
- TrueFoundry — AI Gateways 2026 Comparison
- Techsy — Top LLM Gateway Tools 2026
- LiteLLM GitHub
- Portkey GitHub
- Kong AI Gateway docs
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.