Phase 17: Infrastructure & Production

प्रबंधित LLM प्लेटफार्म बेड्रॉक, वर्टेक्स एआई, अज़ूर ओपनएआई

तीन हाइपरस्केलर्स, तीन अलग-अलग रणनीतियों. AWS बेड्रॉक एक एपीआई के पीछे एक मॉडल बाजार है क्लाउड, लामा, टाइटन, स्थिरता, सहसंबंध। Azure OpenAI एक विशेष OpenAI साझेदारी है और समर्पित क्षमता के लिए प्रदत्त थ्रूपुट यूनिट (PTU) है। वर्टेक्स एआई सबसे अच्छा दीर्घ संदर्भ और बहुमुखी कहानी के साथ जुड़वां-पहला है। 2026 में आर्टिफिशियल एनालिसिस ने एज़्यूर ओपनएआई को ~ 50 एमएस मीडियन और बेड्रॉक को ~ 75 एमएस पर एलम्मा 3.1 405 बी समकक्षों पर मापा है पीटीयू इस अंतर की व्याख्या करते हैं क्योंकि समर्पित क्षमता मांग पर साझा क्षमता से अधिक है। निर्णय का नियम "कौन सबसे तेज़ है" नहीं है, बल्कि "कौन से मॉडल कैटलॉग और FinOps सतह मेरे उत्पाद से मेल खाती है।" यह सबक आपको सिखाता है कि आप वाइब्स के बजाय लिखित रूप में बांटने के साथ चुनें।

Type: Learn

Languages: Python (stdlib, toy cost-and-latency comparator)

Prerequisites: Phase 11 (LLM Engineering), Phase 13 (Tools & Protocols)

Time: ~60 minutes

सीखने के लक्ष्य

  • तीन प्लेटफॉर्म रणनीतियों का नाम दें (बाजार बनाम विशेष बनाम जुड़वां-पहला) और प्रत्येक को उत्पाद उपयोग के मामले से मेल खाएं।
  • Azure OpenAI में आपको क्या Provisioned Throughput Units (PTU) खरीदते हैं, और क्यों ऑन-डिमांड बेड्रॉक आमतौर पर 405B स्केल पर ~ 25 ms धीमा पढ़ता है, समझाएं।
  • प्रत्येक प्लेटफॉर्म के लिए FinOps एट्रिब्यूशन सतह का आरेख (बेड्रॉक एप्लिकेशन इन्फरेंस प्रोफाइल बनाम वर्टेक्स प्रोजेक्ट-पर-टीम बनाम Azure स्कोप + PTU आरक्षण) ।
  • "दो प्रदाता न्यूनतम" नीति लिखें और समझाएं कि 2026 में एकल विक्रेता लॉक-इन क्यों महंगी गलती है।

समस्या

आपने अपने उत्पाद के लिए क्लाउड 3.7 सोनेट चुना है। अब आपको इसे सेवा देने की आवश्यकता है। आप सीधे मानव एपीआई को कॉल कर सकते हैं, या आप इसे AWS बेड्रॉक के माध्यम से कॉल कर सकते हैं, या आप एक गेटवे के माध्यम से जा सकते हैं। प्रत्यक्ष एपीआई सबसे सरल है; बेड्रॉक बीएए, वीपीसी एंडपॉइंट, आईएएम और क्लाउडवॉच एट्रिब्यूशन जोड़ता है। गेटवे प्रदाताओं के बीच फेलओवर, एकीकृत बिलिंग और दर सीमाओं को जोड़ता है।

गहरी सवाल कैटलॉग है. यदि आपको एक ही उत्पाद में क्लाउड और लामा और जुड़वां की आवश्यकता है, तो आप उन्हें एक ही स्थान से नहीं खरीद सकते जब तक कि वह स्थान एक साथ बेड्रॉक प्लस वर्टेक्स प्लस अज़ूर ओपनएआई नहीं है। हाइपरस्केलर विनिमेय नहीं हैं उन्होंने प्रत्येक मॉडल परत के मालिक पर एक अलग शर्त लगाई।

इस पाठ में तीन दांवों का नक्शा है, विलंबता अंतर, FinOps अंतर, और लॉक-इन जोखिम.

अवधारणा

तीन रणनीतियाँ

AWS Bedrock बाजार. क्लाउड (एंट्रोपिक), लामा (मेटा), टाइटन (एडब्ल्यूएस प्रथम पक्ष), स्थिरता (छवि), कोहरे (इम्बेडिंग), मिस्ट्रल, प्लस छवि और एम्बेडिंग उप-कैटलॉग। एक एपीआई, एक आईएएम सतह, एक क्लाउडवॉच निर्यात। बेड्रॉक का दांव है कि ग्राहक एक मॉडल की तुलना में अधिक वैकल्पिकता चाहते हैं।

Azure OpenAI विशेष साझेदारी. आपको Azure डेटा सेंटर में GPT-4/4o/5o-सीरीज, DALL·E, Whisper और OpenAI मॉडल के ठीक-ठीक ट्यूनिंग मिलते हैं। "Azure OpenAI सेवा" कैटलॉग में कोई गैर-OpenAI मॉडल नहीं हैं वे Azure AI फोंडरी (अलग उत्पाद) में जाते हैं। Azure का दांव है कि OpenAI सीमा बनी रहती है और ग्राहक उस विशिष्ट संबंध पर उद्यम नियंत्रण चाहते हैं।

Vertex AI मिथुन पहले, बाकी सब कुछ दूसरे. मिथुन 1.5 / 2.0 / 2.5 फ्लैश और प्रो, प्लस मॉडल गार्डन (तीसरे पक्ष) । वर्टेक्स की शर्त बहुआयामी लंबी-संदर्भ है 1M-टोकन मिथुन संदर्भ अंतर है।

पैमाने पर विलंबता अंतर

कृत्रिम विश्लेषण निरंतर बेंचमार्क चलाता है। समकक्ष Llama 3.1 405B तैनाती (आवश्यकता पर साझा) पर, Azure OpenAI मध्य प्रथम टोकन विलंबता लगभग 50 ms है; बेड्रॉक लगभग 75 ms है। अंतर AWS विफलता नहीं है यह क्षमता मॉडल अंतर है। Azure PTU (प्रदानित थ्रूपुट इकाइयां) बेचता है, जो आपके किरायेदार के लिए GPU क्षमता आरक्षित करता है। बेड्रॉक का समकक्ष (प्रदानित पारगमन) मौजूद है लेकिन प्रति इकाई $21 / घंटे के आसपास शुरू होता है, और अधिकांश ग्राहक साझा ऑन-डिमांड पर रहते हैं।

ऑन-डिमांड साझा क्षमता प्रत्येक अन्य ग्राहक के ट्रैफ़िक के साथ प्रतिस्पर्धा करती है। समर्पित क्षमता नहीं। यदि आपका उत्पाद SLA P99 पर TTFT < 100 ms है, तो आप या तो Azure पर PTU खरीदते हैं, Bedrock Provisioned Throughput खरीदते हैं, या डिफ़ॉल्ट भिन्नता स्वीकार करते हैं।

आपूर्ति पारगमन अर्थव्यवस्था

Azure PTUs: अनुमानित गणना का एक आरक्षित ब्लॉक। अनुमानित कार्यभार के लिए ~ 70% तक की बचत बनाम ऑन-डिमांड। ट्रैफ़िक की परवाह किए बिना प्रति घंटे तय लागत आप आरक्षित के लिए भुगतान करते हैं, भले ही निष्क्रिय हो। ब्रेक-ईव आमतौर पर 40-60% सतत उपयोग के आसपास होता है।

बेडरोक से प्रदान किया गया पारगमनः $21-$मॉडल और क्षेत्र के आधार पर प्रति घंटे 50। इसी तरह के गणित ब्रेक-ईवन लगभग आधा पीक उपयोग है। मासिक प्रतिबद्धता की आवश्यकता है।

वर्टेक्स की आपूर्ति की गई क्षमता को प्रति जेमिनी SKU बेचा जाता है; कीमत मॉडल और क्षेत्र के अनुसार भिन्न होती है और कम सार्वजनिक रूप से विज्ञापित होती है।

FinOps सतह वास्तविक भेद

Bedrock Application Inference Profiles team,product,feature; इसके माध्यम से सभी मॉडल इंक्रीमेंट को मार्ग; क्लाउडवॉच पोस्ट-प्रोसेसिंग के बिना प्रति प्रोफ़ाइल लागत को तोड़ता है। 2025 में जोड़ा गया, अभी भी सबसे अधिक क्षुद्र हाइपरस्केलर मूल।

Vertexविशेषता है परियोजना प्रति टीम प्लस लेबल-हर जगह. आप प्रत्येक टीम को एक GCP परियोजना के रूप में मॉडल, प्रत्येक संसाधन पर लेबल डालते हैं, और उपयोग BigQuery बिलिंग निर्यात + डेटा स्टूडियो rollups के लिए. अधिक काम, लेकिन BigQuery आप की कीमत डेटा पर मनमानी SQL देता है.

Azureटैग संसाधन समूहों से विरासत में आते हैं, अनुरोध नहीं, इसलिए प्रति अनुरोध श्रेणियों के लिए एप्लिकेशन इनसाइट्स कस्टम मीट्रिक या एक गेटवे की आवश्यकता होती है जो हेडरों को स्टैम्प करता है।

पैटर्नः बेड्रॉक सबसे साफ मूल है, वर्टेक्स बिगक्वेरी के माध्यम से सबसे लचीला है, अज़ूर सबसे अस्पष्ट है जब तक आप उपकरण नहीं बनाते हैं।

2026 में लॉक-इन होने का खतरा है

एक हाइपरस्केलर प्रतिबद्धता एक मॉडल पर हावी होने पर ठीक थी। 2026 में सीमा मासिक क्लाउड 3.7 एक तिमाही, मिथुन 2.5 अगले तिमाही, जीपीटी-5 तिमाही के बाद स्थानांतरित होती है। एक मंच पर लॉक करने से आपको सीमा के दो तिहाई से बाहर रखा जाता है।

पैटर्न काम करने वाली टीमें अपनाती हैंः किसी भी उत्पाद-महत्वपूर्ण एलएलएम कॉल के लिए दो प्रदाता न्यूनतम। बेड्रॉक प्लस एज़्यूर ओपनएआई एक से क्लाउड, दूसरे से जीपीटी, उनके बीच विफलता, एक ही गेटवे के बीच आम जोड़ी है। लागत वृद्धि नगण्य है क्योंकि गेटवे मार्ग अनुकूल हैं; आउटेज के दौरान उपलब्धता वृद्धि (जैसे एज़्यूर ओपनएआई जनवरी 2025 घटना, AWS यूएस-ईस्ट-1 आउटेज) निर्णायक है।

डेटा रेजिडेंसी, बीएए और विनियमित उद्योग

बेडरोकः अधिकांश क्षेत्रों में बीएए; वीपीसी एंडपॉइंट; गार्डरेल्स. आम फिनटेक डिफ़ॉल्ट।

Azure OpenAI: HIPAA, SOC 2, ISO 27001; EU डेटा रेजिडेंसी; उद्यम विनियमित डिफ़ॉल्ट।

वर्टेक्स: HIPAA, GDPR, क्षेत्र प्रति डेटा निवास; Google क्लाउड का अनुपालन स्टैक।

तीनों मूल चेकबॉक्स को पूरा करते हैं। अंतर डेटा भंडारण नीतियों में हैं, लॉग को कैसे संभाला जाता है, और क्या दुरुपयोग निगरानी आपके ट्रैफ़िक को पढ़ती है (प्राथमिक रूप से अधिकांश पर ऑप्ट-इन; ऑप्ट-आउट उपलब्ध उद्यम के लिए) ।

संख्याओं को याद रखना चाहिए

  • Azure OpenAI मध्य TTFT Llama 3.1 405B समकक्षों परः ~50 ms (PTU के साथ) ।
  • बेडरोक मध्य TTFT ऑन-डिमांडः ~75 ms.
  • बेडरोक से प्रदान किया गया पारगमनः $21-$प्रति इकाई 50/घंटा।
  • Azure PTU ब्रेक-ईवेंसः ~ 40-60% सतत उपयोग।
  • उच्च उपयोग पर पीटीयू बचत बनाम मांग परः 70% तक।

इसका प्रयोग करें

code/main.pyयह एक सिंथेटिक वर्कलोड पर तीन प्लेटफार्मों की तुलना करता है यह ऑन-डिमांड बनाम पीटीयू अर्थव्यवस्था, टीटीएफटी वैरिएंसी और लागत श्रेय निष्ठा का मॉडल बनाता है। यह देखने के लिए चलाएं कि पीटीयू कहां भुगतान करते हैं और बाजार के मॉडल चौड़ाई TTFT अंतर से कहीं अधिक है।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-managed-platform-picker.md. कार्यभार प्रोफ़ाइल (आवश्यक मॉडल, TTFT SLA, दैनिक मात्रा, अनुपालन आवश्यकताओं) को देखते हुए, यह एक प्राथमिक मंच, एक बैकअप और एक FinOps उपकरण योजना की सिफारिश करता है।

व्यायाम

  1. दौड़ेंcode/main.py. Azure PTU 70B वर्ग मॉडल के लिए मांग पर किस सतत उपयोग पर हराता है? ब्रेक-ईव की गणना करें और विज्ञापन 40-60% बैंड की तुलना करें।
  2. आपके उत्पाद को क्लाउड 3.7 सोनेट और जीपीटी-4o की आवश्यकता है। दो प्रदाता तैनाती डिजाइन करें जो किस हाइपरस्केलर पर जाता है, कौन सा गेटवे सामने बैठता है, विफलता नीति क्या है?
  3. एक विनियमित स्वास्थ्य सेवा ग्राहक को BAAs, US-East डेटा निवास, और sub-100ms P99 TTFT की आवश्यकता होती है। एक मंच चुनें और तीन विशिष्ट सुविधाओं के साथ सही ठहरें।
  4. आप पता लगाएँ कि इस महीने आपके बेड्रॉक बिल में 4 गुना वृद्धि हुई है यातायात परिवर्तन के बिना। बिना आवेदन इन्फरेंस प्रोफाइल, आप दोषी कैसे खोजेंगे? प्रोफाइल के साथ, यह कितना समय लेता है?
  5. Azure OpenAI और Bedrock की मूल्य निर्धारण पृष्ठ पढ़ें। 100M-टोकन / महीने क्लाउड वर्कलोड के लिए, जो सस्ता है प्रत्यक्ष मानव एपीआई, Bedrock ऑन-डिमांड, या Bedrock प्रदान पारगमन?

प्रमुख शर्तें

TermWhat people sayWhat it actually means
Bedrock"AWS LLM service"Model marketplace across Claude, Llama, Titan, Mistral, Cohere
Azure OpenAI"Azure's ChatGPT"Exclusive OpenAI models in Azure datacenters with enterprise controls
Vertex AI"Google's LLM"Gemini-first platform with Model Garden for third-party models
PTU"dedicated capacity"Provisioned Throughput Unit — reserved inference GPUs, priced per hour
Application Inference Profile"Bedrock tagging"Per-product cost/usage profile with tags, CloudWatch-native
Model Garden"Vertex catalog"Vertex AI's third-party model section, separate from Gemini
Two-provider minimum"LLM redundancy"Policy of running every critical LLM path across ≥2 hyperscalers
BAA"HIPAA paperwork"Business Associate Agreement; required for PHI; provided by all three
Abuse monitoring"the log watcher"Provider-side safety scan on prompts/outputs; opt-out in enterprise

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.