प्रबंधित LLM प्लेटफार्म बेड्रॉक, वर्टेक्स एआई, अज़ूर ओपनएआई
Type: Learn
Languages: Python (stdlib, toy cost-and-latency comparator)
Prerequisites: Phase 11 (LLM Engineering), Phase 13 (Tools & Protocols)
Time: ~60 minutes
सीखने के लक्ष्य
- तीन प्लेटफॉर्म रणनीतियों का नाम दें (बाजार बनाम विशेष बनाम जुड़वां-पहला) और प्रत्येक को उत्पाद उपयोग के मामले से मेल खाएं।
- Azure OpenAI में आपको क्या Provisioned Throughput Units (PTU) खरीदते हैं, और क्यों ऑन-डिमांड बेड्रॉक आमतौर पर 405B स्केल पर ~ 25 ms धीमा पढ़ता है, समझाएं।
- प्रत्येक प्लेटफॉर्म के लिए FinOps एट्रिब्यूशन सतह का आरेख (बेड्रॉक एप्लिकेशन इन्फरेंस प्रोफाइल बनाम वर्टेक्स प्रोजेक्ट-पर-टीम बनाम Azure स्कोप + PTU आरक्षण) ।
- "दो प्रदाता न्यूनतम" नीति लिखें और समझाएं कि 2026 में एकल विक्रेता लॉक-इन क्यों महंगी गलती है।
समस्या
आपने अपने उत्पाद के लिए क्लाउड 3.7 सोनेट चुना है। अब आपको इसे सेवा देने की आवश्यकता है। आप सीधे मानव एपीआई को कॉल कर सकते हैं, या आप इसे AWS बेड्रॉक के माध्यम से कॉल कर सकते हैं, या आप एक गेटवे के माध्यम से जा सकते हैं। प्रत्यक्ष एपीआई सबसे सरल है; बेड्रॉक बीएए, वीपीसी एंडपॉइंट, आईएएम और क्लाउडवॉच एट्रिब्यूशन जोड़ता है। गेटवे प्रदाताओं के बीच फेलओवर, एकीकृत बिलिंग और दर सीमाओं को जोड़ता है।
गहरी सवाल कैटलॉग है. यदि आपको एक ही उत्पाद में क्लाउड और लामा और जुड़वां की आवश्यकता है, तो आप उन्हें एक ही स्थान से नहीं खरीद सकते जब तक कि वह स्थान एक साथ बेड्रॉक प्लस वर्टेक्स प्लस अज़ूर ओपनएआई नहीं है। हाइपरस्केलर विनिमेय नहीं हैं उन्होंने प्रत्येक मॉडल परत के मालिक पर एक अलग शर्त लगाई।
इस पाठ में तीन दांवों का नक्शा है, विलंबता अंतर, FinOps अंतर, और लॉक-इन जोखिम.
अवधारणा
तीन रणनीतियाँ
AWS Bedrock बाजार. क्लाउड (एंट्रोपिक), लामा (मेटा), टाइटन (एडब्ल्यूएस प्रथम पक्ष), स्थिरता (छवि), कोहरे (इम्बेडिंग), मिस्ट्रल, प्लस छवि और एम्बेडिंग उप-कैटलॉग। एक एपीआई, एक आईएएम सतह, एक क्लाउडवॉच निर्यात। बेड्रॉक का दांव है कि ग्राहक एक मॉडल की तुलना में अधिक वैकल्पिकता चाहते हैं।
Azure OpenAI विशेष साझेदारी. आपको Azure डेटा सेंटर में GPT-4/4o/5o-सीरीज, DALL·E, Whisper और OpenAI मॉडल के ठीक-ठीक ट्यूनिंग मिलते हैं। "Azure OpenAI सेवा" कैटलॉग में कोई गैर-OpenAI मॉडल नहीं हैं वे Azure AI फोंडरी (अलग उत्पाद) में जाते हैं। Azure का दांव है कि OpenAI सीमा बनी रहती है और ग्राहक उस विशिष्ट संबंध पर उद्यम नियंत्रण चाहते हैं।
Vertex AI मिथुन पहले, बाकी सब कुछ दूसरे. मिथुन 1.5 / 2.0 / 2.5 फ्लैश और प्रो, प्लस मॉडल गार्डन (तीसरे पक्ष) । वर्टेक्स की शर्त बहुआयामी लंबी-संदर्भ है 1M-टोकन मिथुन संदर्भ अंतर है।
पैमाने पर विलंबता अंतर
कृत्रिम विश्लेषण निरंतर बेंचमार्क चलाता है। समकक्ष Llama 3.1 405B तैनाती (आवश्यकता पर साझा) पर, Azure OpenAI मध्य प्रथम टोकन विलंबता लगभग 50 ms है; बेड्रॉक लगभग 75 ms है। अंतर AWS विफलता नहीं है यह क्षमता मॉडल अंतर है। Azure PTU (प्रदानित थ्रूपुट इकाइयां) बेचता है, जो आपके किरायेदार के लिए GPU क्षमता आरक्षित करता है। बेड्रॉक का समकक्ष (प्रदानित पारगमन) मौजूद है लेकिन प्रति इकाई $21 / घंटे के आसपास शुरू होता है, और अधिकांश ग्राहक साझा ऑन-डिमांड पर रहते हैं।
ऑन-डिमांड साझा क्षमता प्रत्येक अन्य ग्राहक के ट्रैफ़िक के साथ प्रतिस्पर्धा करती है। समर्पित क्षमता नहीं। यदि आपका उत्पाद SLA P99 पर TTFT < 100 ms है, तो आप या तो Azure पर PTU खरीदते हैं, Bedrock Provisioned Throughput खरीदते हैं, या डिफ़ॉल्ट भिन्नता स्वीकार करते हैं।
आपूर्ति पारगमन अर्थव्यवस्था
Azure PTUs: अनुमानित गणना का एक आरक्षित ब्लॉक। अनुमानित कार्यभार के लिए ~ 70% तक की बचत बनाम ऑन-डिमांड। ट्रैफ़िक की परवाह किए बिना प्रति घंटे तय लागत आप आरक्षित के लिए भुगतान करते हैं, भले ही निष्क्रिय हो। ब्रेक-ईव आमतौर पर 40-60% सतत उपयोग के आसपास होता है।
बेडरोक से प्रदान किया गया पारगमनः $21-$मॉडल और क्षेत्र के आधार पर प्रति घंटे 50। इसी तरह के गणित ब्रेक-ईवन लगभग आधा पीक उपयोग है। मासिक प्रतिबद्धता की आवश्यकता है।
वर्टेक्स की आपूर्ति की गई क्षमता को प्रति जेमिनी SKU बेचा जाता है; कीमत मॉडल और क्षेत्र के अनुसार भिन्न होती है और कम सार्वजनिक रूप से विज्ञापित होती है।
FinOps सतह वास्तविक भेद
Bedrock Application Inference Profiles team,product,feature; इसके माध्यम से सभी मॉडल इंक्रीमेंट को मार्ग; क्लाउडवॉच पोस्ट-प्रोसेसिंग के बिना प्रति प्रोफ़ाइल लागत को तोड़ता है। 2025 में जोड़ा गया, अभी भी सबसे अधिक क्षुद्र हाइपरस्केलर मूल।
Vertexविशेषता है परियोजना प्रति टीम प्लस लेबल-हर जगह. आप प्रत्येक टीम को एक GCP परियोजना के रूप में मॉडल, प्रत्येक संसाधन पर लेबल डालते हैं, और उपयोग BigQuery बिलिंग निर्यात + डेटा स्टूडियो rollups के लिए. अधिक काम, लेकिन BigQuery आप की कीमत डेटा पर मनमानी SQL देता है.
Azureटैग संसाधन समूहों से विरासत में आते हैं, अनुरोध नहीं, इसलिए प्रति अनुरोध श्रेणियों के लिए एप्लिकेशन इनसाइट्स कस्टम मीट्रिक या एक गेटवे की आवश्यकता होती है जो हेडरों को स्टैम्प करता है।
पैटर्नः बेड्रॉक सबसे साफ मूल है, वर्टेक्स बिगक्वेरी के माध्यम से सबसे लचीला है, अज़ूर सबसे अस्पष्ट है जब तक आप उपकरण नहीं बनाते हैं।
2026 में लॉक-इन होने का खतरा है
एक हाइपरस्केलर प्रतिबद्धता एक मॉडल पर हावी होने पर ठीक थी। 2026 में सीमा मासिक क्लाउड 3.7 एक तिमाही, मिथुन 2.5 अगले तिमाही, जीपीटी-5 तिमाही के बाद स्थानांतरित होती है। एक मंच पर लॉक करने से आपको सीमा के दो तिहाई से बाहर रखा जाता है।
पैटर्न काम करने वाली टीमें अपनाती हैंः किसी भी उत्पाद-महत्वपूर्ण एलएलएम कॉल के लिए दो प्रदाता न्यूनतम। बेड्रॉक प्लस एज़्यूर ओपनएआई एक से क्लाउड, दूसरे से जीपीटी, उनके बीच विफलता, एक ही गेटवे के बीच आम जोड़ी है। लागत वृद्धि नगण्य है क्योंकि गेटवे मार्ग अनुकूल हैं; आउटेज के दौरान उपलब्धता वृद्धि (जैसे एज़्यूर ओपनएआई जनवरी 2025 घटना, AWS यूएस-ईस्ट-1 आउटेज) निर्णायक है।
डेटा रेजिडेंसी, बीएए और विनियमित उद्योग
बेडरोकः अधिकांश क्षेत्रों में बीएए; वीपीसी एंडपॉइंट; गार्डरेल्स. आम फिनटेक डिफ़ॉल्ट।
Azure OpenAI: HIPAA, SOC 2, ISO 27001; EU डेटा रेजिडेंसी; उद्यम विनियमित डिफ़ॉल्ट।
वर्टेक्स: HIPAA, GDPR, क्षेत्र प्रति डेटा निवास; Google क्लाउड का अनुपालन स्टैक।
तीनों मूल चेकबॉक्स को पूरा करते हैं। अंतर डेटा भंडारण नीतियों में हैं, लॉग को कैसे संभाला जाता है, और क्या दुरुपयोग निगरानी आपके ट्रैफ़िक को पढ़ती है (प्राथमिक रूप से अधिकांश पर ऑप्ट-इन; ऑप्ट-आउट उपलब्ध उद्यम के लिए) ।
संख्याओं को याद रखना चाहिए
- Azure OpenAI मध्य TTFT Llama 3.1 405B समकक्षों परः ~50 ms (PTU के साथ) ।
- बेडरोक मध्य TTFT ऑन-डिमांडः ~75 ms.
- बेडरोक से प्रदान किया गया पारगमनः $21-$प्रति इकाई 50/घंटा।
- Azure PTU ब्रेक-ईवेंसः ~ 40-60% सतत उपयोग।
- उच्च उपयोग पर पीटीयू बचत बनाम मांग परः 70% तक।
इसका प्रयोग करें
code/main.pyयह एक सिंथेटिक वर्कलोड पर तीन प्लेटफार्मों की तुलना करता है यह ऑन-डिमांड बनाम पीटीयू अर्थव्यवस्था, टीटीएफटी वैरिएंसी और लागत श्रेय निष्ठा का मॉडल बनाता है। यह देखने के लिए चलाएं कि पीटीयू कहां भुगतान करते हैं और बाजार के मॉडल चौड़ाई TTFT अंतर से कहीं अधिक है।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-managed-platform-picker.md. कार्यभार प्रोफ़ाइल (आवश्यक मॉडल, TTFT SLA, दैनिक मात्रा, अनुपालन आवश्यकताओं) को देखते हुए, यह एक प्राथमिक मंच, एक बैकअप और एक FinOps उपकरण योजना की सिफारिश करता है।
व्यायाम
- दौड़ें
code/main.py. Azure PTU 70B वर्ग मॉडल के लिए मांग पर किस सतत उपयोग पर हराता है? ब्रेक-ईव की गणना करें और विज्ञापन 40-60% बैंड की तुलना करें। - आपके उत्पाद को क्लाउड 3.7 सोनेट और जीपीटी-4o की आवश्यकता है। दो प्रदाता तैनाती डिजाइन करें जो किस हाइपरस्केलर पर जाता है, कौन सा गेटवे सामने बैठता है, विफलता नीति क्या है?
- एक विनियमित स्वास्थ्य सेवा ग्राहक को BAAs, US-East डेटा निवास, और sub-100ms P99 TTFT की आवश्यकता होती है। एक मंच चुनें और तीन विशिष्ट सुविधाओं के साथ सही ठहरें।
- आप पता लगाएँ कि इस महीने आपके बेड्रॉक बिल में 4 गुना वृद्धि हुई है यातायात परिवर्तन के बिना। बिना आवेदन इन्फरेंस प्रोफाइल, आप दोषी कैसे खोजेंगे? प्रोफाइल के साथ, यह कितना समय लेता है?
- Azure OpenAI और Bedrock की मूल्य निर्धारण पृष्ठ पढ़ें। 100M-टोकन / महीने क्लाउड वर्कलोड के लिए, जो सस्ता है प्रत्यक्ष मानव एपीआई, Bedrock ऑन-डिमांड, या Bedrock प्रदान पारगमन?
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| Bedrock | "AWS LLM service" | Model marketplace across Claude, Llama, Titan, Mistral, Cohere |
| Azure OpenAI | "Azure's ChatGPT" | Exclusive OpenAI models in Azure datacenters with enterprise controls |
| Vertex AI | "Google's LLM" | Gemini-first platform with Model Garden for third-party models |
| PTU | "dedicated capacity" | Provisioned Throughput Unit — reserved inference GPUs, priced per hour |
| Application Inference Profile | "Bedrock tagging" | Per-product cost/usage profile with tags, CloudWatch-native |
| Model Garden | "Vertex catalog" | Vertex AI's third-party model section, separate from Gemini |
| Two-provider minimum | "LLM redundancy" | Policy of running every critical LLM path across ≥2 hyperscalers |
| BAA | "HIPAA paperwork" | Business Associate Agreement; required for PHI; provided by all three |
| Abuse monitoring | "the log watcher" | Provider-side safety scan on prompts/outputs; opt-out in enterprise |
आगे पढ़ना
- AWS Bedrock Pricing प्रामाणिक दर कार्ड और प्रदान किए गए पारगमन मूल्य निर्धारण।
- Azure OpenAI Service Pricing पीटीयू अर्थशास्त्र और दर कार्ड।
- Vertex AI Generative AI Pricing मिथुन स्तर और मॉडल गार्डन अधिभार।
- Artificial Analysis LLM Leaderboard प्रदाताओं के बीच निरंतर विलंबता और पारगमन बेंचमार्क।
- The AI Journal — AWS Bedrock vs Azure OpenAI CTO Guide 2026 उद्यम निर्णय ढांचा।
- Finout — Bedrock vs Vertex vs Azure FinOps गुणन यांत्रिकी एक-दूसरे के साथ।
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.