Phase 17: Infrastructure & Production

एआई गेटवे लाइटएलएम, पोर्टकी, कांग एआई गेटवे, बिफ्रोस्ट

आपके ऐप और मॉडल प्रदाताओं के बीच एक गेटवे स्थित है। मुख्य विशेषताएं प्रदाता रूटिंग, बैकअप, रीट्री, रेट लिमिटिंग, गुप्त संदर्भ, अवलोकन, गार्डरेल्स हैं। 2026 में बाजार विभाजनः LiteLLMयह 100 से अधिक प्रदाताओं के साथ MIT OSS है, OpenAI के साथ संगत है, लेकिन ~ 2000 RPS (8 GB मेमोरी, प्रकाशित बेंचमार्क में कैस्केडिंग विफलता) के आसपास टूट जाता है; पायथन के लिए सबसे अच्छा, <500 RPS, डेवलपमेंट / प्रोटोटाइपिंग। Portkeyनियंत्रण-स्तर पर स्थित है (गार्ड्रेल, पीआईआई संपादन, जेलब्रेक पता लगाने, ऑडिट ट्रेल), Apache 2.0 ओपन-सोर्स मार्च 2026 में चला गया, 20-40 ms विलंब ओवरहेड, $49/mo production tier. Kong AI Gateway built on Kong Gateway — Kong's own benchmark on same 12 CPUs: 228% faster than Portkey, 859% faster than LiteLLM; $100/मॉडल/महीने की कीमत (प्लस लेयर पर अधिकतम 5); यदि आप पहले से ही Kong पर हैं तो उद्यम के लिए उपयुक्त। Bifrost(मैक्सिम एआई) स्वचालित बैकऑफ के साथ पुनः प्रयास, ओपनएआई 429 पर मानवतावादी में वापसी। Cloudflare / Vercel AI Gateways प्रबंधित, शून्य-ऑप्स, बुनियादी पुनः प्रयास। डेटा निवास स्वयं-होस्ट निर्णय को चलाता है; पोर्टकी और कांग ऑप्टिकल प्रबंधित के साथ बीच में बैठे हैं।

Type: Learn

Languages: Python (stdlib, toy gateway-routing simulator)

Prerequisites: Phase 17 · 01 (Managed LLM Platforms), Phase 17 · 16 (Model Routing)

Time: ~60 minutes

सीखने के लक्ष्य

  • छह मुख्य गेटवे सुविधाओं (रूटिंग, बैकअप, रीट्री, रेट लिमिट, सिक्रेट, ऑब्जर्वेबिलिटी, गार्डरेल्स) को सूचीबद्ध करें।
  • छतों और उपयोग के मामलों को स्केल करने के लिए 2026 तक चार गेटवे (LiteLLM, Portkey, Kong AI, Bifrost) का नक्शा बनाएं।
  • कॉंग बेंचमार्क (228% बनाम पोर्टकी, 859% बनाम लाइटएलएलएम) का उल्लेख करें और बताएं कि यह 500 आरपीएस के लिए क्यों मायने रखता है।
  • डेटा निवास और संचालन बजट के अनुसार स्वयं होस्ट बनाम प्रबंधित चुनें।

समस्या

आपके उत्पाद में OpenAI, Anthropic और एक स्वयं होस्ट किया गया Llama है। प्रत्येक प्रदाता के पास एक अलग SDK, त्रुटि मॉडल, दर सीमा और auth योजना है। आप एक विफलता चाहते हैं (यदि OpenAI 429s, Anthropic का प्रयास करें), एक एकल क्रेडेंशियल स्टोर, एकीकृत अवलोकन और प्रति किरायेदार दर सीमाएं।

ऐप लेयर पर इसे फिर से आविष्कार करना प्रत्येक सेवा को प्रत्येक प्रदाता से जोड़ता है। एक गेटवे लेयर इसे एक एपीआई (आमतौर पर ओपनएआई-संगत) के साथ एक प्रक्रिया में समेकित करता है जो प्रदाताओं को फैन्स करता है।

अवधारणा

छह मुख्य विशेषताएं

  1. Provider routing एक एपीआई के पीछे ओपनएआई, एंथ्रोपिक, मिथुन, स्व-होस्टिंग आदि।
  2. Fallback 429, 5xx पर, या गुणवत्ता विफलता, फिर से कहीं और प्रयास करें।
  3. Retries घातीय बैकऑफ, सीमित प्रयास।
  4. Rate limits प्रति किरायेदार, प्रति कुंजी, प्रति मॉडल।
  5. Secret references रनटाइम (ऐप में कभी नहीं) पर वॉल्ट से क्रेडेंशियल निकालें।
  6. Observability OTel + GenAI विशेषताएं (चरण 17 · 13) + लागत निर्धारण।
  7. Guardrails पीआईआई संवर्धन, जेलब्रेक पता लगाना, अनुमत विषय फ़िल्टर।

LiteLLM MIT OSS, पायथन

  • 100+ प्रदाता, ओपनएआई संगत, राउटर कॉन्फ़िग, बैकअप, बुनियादी अवलोकनशीलता।
  • Kong के बेंचमार्क में लगभग 2000 आरपीएस टूटता है; 8 जीबी मेमोरी फुटप्रिंट, निरंतर लोड के तहत कैस्केडिंग विफलताएं।
  • सबसे अच्छा फिटः पायथन ऐप, <500 आरपीएस, डेवलपमेंट/स्टेजिंग गेटवे, प्रयोगात्मक रूटिंग।
  • लागतः ओएसएस के लिए $0; क्लाउड मुक्त स्तर मौजूद है।

पोर्टकी नियंत्रण विमान की स्थिति

  • मार्च 2026 तक अपाचे 2.0 ओएसएस। गार्डरेल्स, पीआईआई संपादन, जेलब्रेक पता लगाना, ऑडिट ट्रेल।
  • 20-40 ms प्रति अनुरोध विलंब ओवरहेड।
  • प्रति माह $49 प्रति उत्पादन स्तर के लिए प्रतिधारण + SLA के साथ।
  • सबसे अच्छा फिटः विनियमित उद्योगों को सुरक्षा रैलियों + अवलोकन क्षमता बंडल की आवश्यकता होती है।

Kong AI गेटवे पैमाने खेल

  • Kong Gateway पर बनाया गया (प्रबुद्ध एपीआई गेटवे उत्पाद, lua+OpenResty) ।
  • 12 सीपीयू समकक्ष पर Kong का स्वयं का बेंचमार्कः पोर्टकी से 228% तेज, LiteLLM से 859% तेज।
  • मूल्य निर्धारणः $ 100 / मॉडल / महीने, प्लस स्तर पर अधिकतम 5।
  • सबसे अच्छा फिटः पहले से ही Kong पर; > 1000 RPS; लाइसेंस देने के लिए तैयार।

द्वि-मुद्रा (मैक्सिम एआई)

  • कॉन्फ़िगरेबल बैकऑफ के साथ स्वचालित पुनः प्रयास।
  • ओपनएआई 429 पर मानव विज्ञान पर वापसी एक वैदिक नुस्खा है।
  • नए आवेदक; वाणिज्यिक.

क्लाउडफ्लेयर एआई गेटवे / वर्सेल एआई गेटवे

  • प्रबंधित, शून्य-ऑपरेशन, बुनियादी पुनः प्रयास और अवलोकनशीलता.
  • सबसे अच्छा फिटः क्लाउडफ्लेयर/वर्सेल पर एज-सेवा वाले जावास्क्रिप्ट ऐप।
  • रैलियों और दर सीमाओं पर Kong/Portkey की तुलना में सीमित।

स्वयं होस्ट बनाम प्रबंधित

डेटा निवास बल कार्य है। स्वास्थ्य और वित्त डिफ़ॉल्ट स्वयं-होस्ट (LiteLLM या Portkey OSS या Kong) । उपभोक्ता उत्पादों डिफ़ॉल्ट प्रबंधित (Cloudflare AI गेटवे) या मध्य-स्तरीय (Portkey प्रबंधित) । हाइब्रिडः विनियमित किरायेदार के लिए स्वयं-होस्ट, दूसरों के लिए प्रबंधित।

विलंबता बजट

  • लोटलमः 5-15 एमएस ओवरहेड सामान्य।
  • पोर्टकीः 20-40 एमएस ओवरहेड।
  • 3.8 ms ओवरहेड.
  • Cloudflare/Vercel: 1-3 ms ओवरहेड (एज फायदा)

गेटवे लटेंसी सीधे TTFT में जोड़ता है। TTFT P99 के लिए < 100 ms SLA, Kong या Cloudflare। P99 < 500 ms के लिए, कोई भी।

दर-सीमा अर्थशास्त्र विषय

सरल टोकन-बकेट मध्यम पैमाने पर काम करता है। मल्टी-रिटेनेंट स्लाइडिंग-विंडो + बर्फ allowance + प्रति किरायेदार टायरिंग की आवश्यकता होती है। LiteLLM टोकन-बकेट जहाजों; कॉंग जहाजों स्लाइडिंग-विंडो; पोर्टकी जहाजों स्तरित।

गेटवे + अवलोकनशीलता + रूटिंग रचना

चरण 17 · 13 (निरीक्षण) + 16 (मॉडल रूटिंग) + 19 (गेटवेज) उत्पादन में एक ही परत हैं। तीनों को कवर करने वाला एक उपकरण चुनें या उन्हें ध्यान से तार करेंः अधिकांश 2026 तैनाती हेलिकोन (निरीक्षण) या पोर्टकी (गार्ड्रेल) को विभाजित भूमिकाओं के लिए कॉंग (पैमाना) के साथ जोड़ती हैं।

संख्याओं को याद रखना चाहिए

  • LiteLLM: ~ 2000 RPS पर टूटता है, 8 जीबी मेमोरी।
  • पोर्टकीः 20-40 एमएस ओवरहेड; मार्च 2026 से अपाचे 2.0।
  • कॉंग: पोर्टकी से 228% तेज, लाइटएलएम से 859% तेज।
  • कॉंग मूल्य निर्धारणः $ 100 / मॉडल / महीने, प्लस स्तर पर 5 अधिकतम।
  • Cloudflare/Vercel: कगार पर 1-3 ms ओवरहेड।

इसका प्रयोग करें

code/main.py429/5xx इंजेक्शन के तहत 3 प्रदाताओं के बीच फॉलबैक के साथ गेटवे रूटिंग का अनुकरण करता है। विलंबता, पुनः प्रयास दर और फॉलबैक हिट दर की रिपोर्ट करता है।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-gateway-picker.md. आकार, परिचालन स्थिति, अनुपालन, विलंबता बजट को देखते हुए, एक गेटवे चुनता है.

व्यायाम

  1. दौड़ेंcode/main.py. OpenAI→Anthropic→स्व-होस्ट से बैकअप कॉन्फ़िगर करें. 5% प्रदाता त्रुटि दर पर अपेक्षित हिट दर क्या है?
  2. आपके SLA TTFT P99 < 200 ms है 300 ms बेसलाइन पर. कौन से गेटवे बजट के भीतर रहते हैं?
  3. एक स्वास्थ्य सेवा ग्राहक को स्वयं होस्ट + पीआईआई संपादन + लेखा परीक्षा की आवश्यकता होती है। पोर्टकी ओएसएस या कॉंग चुनें।
  4. LiteLLM vs Kong की तुलना करेंः टीम को किस आरपीएस सीमा पर प्रवास करना चाहिए?
  5. बहु-आवासीय सास के लिए दर सीमा नीति डिजाइन करेंः मुफ्त स्तर, परीक्षण स्तर, भुगतान स्तर। टोकन-बकेट या स्लाइडिंग-विंडो?

प्रमुख शर्तें

TermWhat people sayWhat it actually means
Gateway"API broker"Process sitting between apps and providers
LiteLLM"the MIT one"Python OSS, 100+ providers, breaks at 2K RPS
Portkey"guardrails gateway"Control plane + observability, Apache 2.0
Kong AI Gateway"the scale one"Built on Kong Gateway, benchmark leader
Bifrost"Maxim's gateway"Retries + Anthropic fallback recipe
Cloudflare AI Gateway"edge managed"Edge-deployed managed gateway, zero-ops
PII redaction"data scrub"Regex + NER mask before sending to model
Jailbreak detection"prompt injection guard"Classifier on user input
Audit trail"regulated log"Immutable record of every LLM call
Token-bucket"simple rate limit"Refill-based rate limiter
Sliding-window"precise rate limit"Time-windowed rate limiter; better fairness

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.