سیستم عامل های مدیریت LLM Bedrock, Vertex AI, Azure OpenAI
Type: Learn
Languages: Python (stdlib, toy cost-and-latency comparator)
Prerequisites: Phase 11 (LLM Engineering), Phase 13 (Tools & Protocols)
Time: ~60 minutes
اهداف یادگیری
- سه استراتژی پلتفرم را نام دهید (بازار مقابل انحصاری و جمینی-اول) و هر یک را با یک مورد استفاده از محصول مطابقت دهید.
- توضیح دهید که واحد های تولید فراهم شده (PTU) در Azure OpenAI چه چیزی را برای شما می خریدند و چرا Bedrock در مورد تقاضا معمولاً در مقیاس 405B ~ 25 ms کندتر می خواند.
- سطح انتساب FinOps را برای هر پلتفرم (پروفیل های تعبیر برنامه Bedrock vs Vertex پروژه در هر تیم vs دامنه های Azure + رزروهای PTU) نمودار کنید.
- یک سیاست "دوی ارائه دهنده حداقل" را بنویسید و توضیح دهید که چرا قفل کردن یک فروشنده اشتباه گران قیمت در سال 2026 است.
مشکل
شما کلاود 3.7 سونت را برای محصول خود انتخاب کرده اید. اکنون شما باید آن را به خدمت بدهید. شما می توانید به طور مستقیم API Anthropic را فرا بگیرید، یا می توانید از طریق AWS Bedrock را فرا بگیرید، یا می توانید از طریق یک دروازه بروید. API مستقیم ساده ترین است؛ Bedrock BAAs، نقاط پایان VPC، IAM و CloudWatch را اضافه می کند. دروازه اضافه می کند فایلور، صورتحساب یکپارچه و محدودیت نرخ بین ارائه دهندگان.
سوال عمیق تر این است که کاتالوگ. اگر شما نیاز به کلاود و لاما و جمیانی در یک محصول، شما نمی توانید آنها را از یک مکان به جز آن محل Bedrock به علاوه ورتاکس به علاوه Azure OpenAI به طور همزمان خریداری کنید. hyperscalers قابل تعویض نیستند هر یک آنها شرط متفاوتی را در مورد مالکیت لایه مدل انجام دادند.
این درس نقشه سه شرط، شکاف تاخیر، شکاف FinOps و خطر قفل در می دهد.
مفهوم
سه استراتژی
AWS Bedrockکلود (انترروپک) ، لاما (میتا) ، تیتان (AWS اولین طرف) ، ثبات (تصاویر) ، Cohere (درساختان) ، Mistral، به علاوه تصویر و درساختن زیر کاتالوگ ها. یک API، یک سطح IAM، یک صادرات CloudWatch. شرط Bedrock این است که مشتریان بیشتر از اینکه یک مدل واحد را می خواهند، گزینه ای را می خواهند.
Azure OpenAI مشارکت انحصاری. شما GPT-4 / 4o / 5 / o سری، DALL·E، Whisper و تنظیم دقیق مدل های OpenAI در مراکز داده Azure را دریافت می کنید. هیچ مدل غیر OpenAI در کاتالوگ "Azure OpenAI Service" نیست. آنها به Azure AI Foundry (نتایج جداگانه) می روند. شرط Azure این است که OpenAI همچنان مرز است و مشتریان کنترل های شرکتی را در این رابطه خاص می خواهند.
Vertex AI دوقلوها اول، همه چیز دیگر دوم. دوقلوها 1.5 / 2.0 / 2.5 فلش و پرو، به علاوه مدل باغ (طرف سوم). شرط Vertex چند مدل طولانی زمینه 1M-توکن دوقلوها زمینه تفاوت است.
فاصله تاخیر در مقیاس
تحلیل مصنوعی معیار های ثابت را اجرا می کند. در تعینات معادل Llama 3.1 405B (تعمیر شده در صورت تقاضا) ، متوسط تاخیر اولین توکن Azure OpenAI حدود 50 ms است؛ Bedrock حدود 75 ms است. شکاف یک شکست AWS نیست این یک تفاوت مدل ظرفیت است. آذر PTU ها را می فروشد (یگانۀ تولید فراهم شده) که ظرفیت GPU را برای مستاجر شما ذخیره می کند. معادل Bedrock (توانایی فراهم شده) وجود دارد اما در حدود 21 دلار / ساعت در هر واحد شروع می شود و اکثر مشتریان در اشتراک گذاری در تقاضا باقی می مانند.
ظرفیت مشترک در تقاضا با هر ترافیک مشتری دیگر رقابت می کند. ظرفیت اختصاصی اینگونه نیست. اگر SLA محصول شما TTFT < 100 ms در P99 باشد، شما یا PTU ها را در Azure خریداری می کنید، یا Bedrock Provisioned Throughput را خریداری می کنید، یا متغیر پیش فرض را قبول می کنید.
اقتصاد تولید فراهم شده
PTU های Azure: یک بلوک ذخیره شده از محاسبات نتیجه گیری. تا ~ 70% پس انداز در مقابل تقاضا برای بار کاری قابل پیش بینی. هزینه های ثابت در هر ساعت بدون توجه به ترافیک شما برای رزرو حتی در زمان بیکار پرداخت می کنید. تخفیف معمولاً حدود 40-60% استفاده پایدار است.
خروجی در بستر: $21-$50 در ساعت بسته به مدل و منطقه. ریاضیات مشابه Break-Even حدود نیمی از حداکثر استفاده است. تعهد ماهانه مورد نیاز است.
ظرفیت ورتاکس در هر SKU Gemini فروخته می شود؛ قیمت گذاری با توجه به مدل و منطقه متفاوت است و کمتر به صورت عمومی تبلیغ می شود.
سطح FinOps فرقی واقعی
Bedrock Application Inference Profiles. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .team،product،feature; تمام درخواست های مدل را از طریق آن هدایت کنید; CloudWatch هزینه هر پروفایل را بدون پردازش بعد از خود شکسته است. اضافه شده 2025, هنوز هم گران ترین هائپر اسکالر بومی.
Vertexنسبت پروژه به تیم و برچسب ها در همه جا است. شما هر تیم را به عنوان یک پروژه GCP مدل می کنید، در هر منبع برچسب می دهید و از BigQuery Billing Export + DataStudio برای رول اپ استفاده می کنید. کار بیشتر، اما BigQuery به شما SQL تعسفی در داده های هزینه می دهد.
Azureبرچسب ها از گروه های منابع به ارث می آیند، نه درخواست ها، بنابراین نسبت هر درخواست نیاز به متریک های سفارشی Application Insights یا یک دروازه ای دارد که سرنخ ها را مهر می کند.
الگوی: Bedrock تمیز ترین بومی است، Vertex انعطاف پذیر ترین از طریق BigQuery، Azure بیش از همه شفاف است مگر اینکه شما ابزار.
قفل شدن خطر 2026
تعهد به یک مدل هائپر اسکالر خوب بود. در سال 2026 مرز هر ماه حرکت می کند کلاود 3.7 یک ربع، دوقلوها 2.5 به ربع بعدی، GPT-5 به ربع بعد. قفل به یک سیستم عامل شما را از دو سوم از مرز قفل می کند.
تیم های کار با الگوی: حداقل دو ارائه دهنده برای هر تماس LLM مهم محصول. Bedrock به علاوه Azure OpenAI جفت مشترک است کلاود از یک، GPT از دیگری، شکست بین آنها، دروازه یکسان. افزایش هزینه به دلیل راه های دروازه مطلوب است. افزایش دسترسی در هنگام قطع (مانند حادثه Azure OpenAI ژانویه 2025, AWS us-east-1 قطع) تعیین کننده است.
اقامت داده ها، BAAs و صنایع تنظیم شده
بستر: BAAs در اکثر مناطق؛ نقاط پایان VPC؛ محافظ. پیش فرض فن تکنالوژی رایج.
Azure OpenAI: HIPAA، SOC 2، ISO 27001؛ اقامت داده های اتحادیه اروپا؛ پیش فرض تنظیم شده توسط شرکت.
ورتاکس: HIPAA، GDPR، اقامت داده ها در هر منطقه؛ Google Cloud استیک موافقت.
هر سه مورد با جعبه چک اساسی مطابقت دارند. تفاوت ها در سیاست های حفظ داده ها، نحوه مدیریت روزنامه ها و اینکه آیا نظارت بر سوء استفاده از ترافیک شما را می خواند (پیش فرض انتخاب بیشتر؛ گزینه خارج از دسترس برای شرکت).
شماره هایی که باید به یاد داشته باشی
- میانگین TTFT Azure OpenAI در معادل Llama 3.1 405B: ~ 50 ms (با PTU ها).
- متوسط TTFT بستر در صورت تقاضا: ~ 75 ms.
- خروجی در بستر: $21-$50/ساعت در هر واحد
- ازایزور PTU: 40 تا 60 درصد استفاده پایدار
- پس انداز PTU در مقابل تقاضا در زمان استفاده بالا: تا 70٪
ازش استفاده کن
code/main.pyاین مدل مدل مدل های اقتصادی در مقابل PTU، تفرق TTFT و وفاداری نسبت هزینه را مقایسه می کند. آن را اجرا کنید تا ببینید که PTU ها در کجا سود می برند و در کجا عرض مدل بازار از شکاف TTFT بیشتر است.
-باده
این درس به ما کمک می کندoutputs/skill-managed-platform-picker.md. با توجه به یک پروفایل بار کاری (نمادها مورد نیاز، TTFT SLA، حجم روزانه، الزامات رعایت) ، یک سیستم عامل اصلی، یک بازپسین و یک برنامه ابزار FinOps را توصیه می کند.
تمرینات
- فرار کن
code/main.pyدر چه استفاده پایدار از Azure PTU در مورد یک مدل کلاس 70B در مورد تقاضا بهتر است؟ - محصول شما به کلاود 3.7 سونت و GPT-4o نیاز دارد. یک برنامه دو ارائه دهنده طراحی کنید که به کدام هیپر اسکالر می رود، دروازه ای که در مقابل قرار دارد، سیاست شکست چیست؟
- یک مشتری مراقبت های بهداشتی تنظیم شده نیاز به BAAs، اقامت داده های ایالات متحده شرقی و زیر-100ms P99 TTFT دارد. یک پلتفرم را انتخاب کنید و با سه ویژگی خاص توجیه کنید.
- بدون پروفایل های درخواست، چطور می تونید مجرم رو پیدا کنید؟ با پروفایل ها، چقدر طول می کشد؟
- صفحه قیمت گذاری Azure OpenAI و Bedrock را بخوانید. برای یک بار کاری کلاود 100M-توکن / ماه، که ارزان تر است API انتروپک مستقیم، Bedrock در تقاضا یا Bedrock Provisioned Throughput؟
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| Bedrock | "AWS LLM service" | Model marketplace across Claude, Llama, Titan, Mistral, Cohere |
| Azure OpenAI | "Azure's ChatGPT" | Exclusive OpenAI models in Azure datacenters with enterprise controls |
| Vertex AI | "Google's LLM" | Gemini-first platform with Model Garden for third-party models |
| PTU | "dedicated capacity" | Provisioned Throughput Unit — reserved inference GPUs, priced per hour |
| Application Inference Profile | "Bedrock tagging" | Per-product cost/usage profile with tags, CloudWatch-native |
| Model Garden | "Vertex catalog" | Vertex AI's third-party model section, separate from Gemini |
| Two-provider minimum | "LLM redundancy" | Policy of running every critical LLM path across ≥2 hyperscalers |
| BAA | "HIPAA paperwork" | Business Associate Agreement; required for PHI; provided by all three |
| Abuse monitoring | "the log watcher" | Provider-side safety scan on prompts/outputs; opt-out in enterprise |
خواندن بیشتر
- AWS Bedrock Pricing کارت نرخ معتبر و قیمت گذاری تولید فراهم شده.
- Azure OpenAI Service Pricingاقتصاد PTU و کارت های نرخ
- Vertex AI Generative AI Pricing سطوح دوقلوها و هزینه های اضافی باغ مدل
- Artificial Analysis LLM Leaderboard شاخص های مرزی تاخیر و تولید مداوم در بین ارائه دهندگان.
- The AI Journal — AWS Bedrock vs Azure OpenAI CTO Guide 2026 چارچوب تصمیم گیری شرکت
- Finout — Bedrock vs Vertex vs Azure FinOps مکانیک های اختصاصی در کنار هم.
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.