Phase 17: Infrastructure & Production

منصات القانون المدارة Bedrock، Vertex AI، Azure OpenAI

ثلاثة متفرجين، ثلاثة استراتيجيات مختلفة. AWS Bedrock هو سوق نموذج كلود، لامة، تيتان، الاستقرار، التماسك وراء API واحدة. أزور أوبن آي آي هي شراكة أوبن آي حصرية بالإضافة إلى وحدات النتائج المقدمة (PTU) للقدرة المخصصة. (فيرتكس إيه إيه) هي (جيميني) الأولى بأفضل قصة طويلة الأصل والمتعددة الطرق. في عام 2026 ، يقياس التحليل الاصطناعي Azure OpenAI عند ~ 50 ms في المتوسط و Bedrock عند ~ 75 ms على Llama 3.1 405B المكافئ PTUs تفسير الفجوة لأن القدرة المخصصة تغلب على المشاركة على الطلب. قاعدة القرار ليست "أي هو أسرع" ولكن "أي نموذج الكتالوج و FinOps سطح مطابقة منتج بلدي". هذا الدروس يعلمك للاختيار مع التعادلات مكتوبة، وليس الاهتزازات.

Type: Learn

Languages: Python (stdlib, toy cost-and-latency comparator)

Prerequisites: Phase 11 (LLM Engineering), Phase 13 (Tools & Protocols)

Time: ~60 minutes

أهداف التعلم

  • أسمائ استراتيجيات المنصة الثلاثة (السوق مقابل حصرية مقابل جيميني-أول) و تطابق كل منها مع حالة استخدام المنتج.
  • شرح ما تشتري لك وحدات التشغيل المقدمة (PTU) في Azure OpenAI ولماذا تقرأ Bedrock على الطلب عادةً ~ 25 ms أبطأ على مقياس 405B.
  • رسم رسم السطح التخصيصي لـ FinOps لكل منصة (ملفات تعريف التطبيقات في Bedrock مقابل Vertex من خلال المشاريع لكل فريق مقابل نطاقات Azure + حجزات PTU).
  • اكتب سياسة "أقل مزودين" و اشرح لماذا إغلاق بائع واحد هو الخطأ المكلف في عام 2026.

المشكلة

لقد اخترت كلود 3.7 سونيت لمنتجك. الآن تحتاج إلى تقديم خدمة. يمكنك الاتصال بشبكة الإنسانية API مباشرة، أو يمكنك الاتصال بها من خلال AWS Bedrock، أو يمكنك الذهاب من خلال بوابة. API المباشرة هي أبسط؛ Bedrock يضيف BAAs، نقاط نهاية VPC، IAM، و CloudWatch التخصيص. بوابة يضيف إعاقة، فاتورة موحدة، ومحدود معدلات عبر مزودي.

السؤال الأعمق هو الكتالوج. إذا كنت بحاجة إلى كلود ولاما وجميني في نفس المنتج، لا يمكنك شراءهم جميعا من مكان واحد إلا إذا كان ذلك المكان Bedrock زائد Vertex زائد Azure OpenAI في نفس الوقت.

هذه الدروس تظهر الرهانات الثلاثة فجوة التأخير فجوة التخفيضات و خطر الإغلاق

المفهوم

ثلاثة استراتيجيات

AWS Bedrock السوق. كلود (أنثروبوليك) ، لاما (ميتا) ، تيتان (أو إس فورت-بارت) ، الاستقرار (الصورة) ، كوهير (التركيبات) ، ميسرال، بالإضافة إلى الصورة والتركيب الفرعي الكتالوجات. واحد API، واحدة سطح IAM، واحدة CloudWatch تصدير. رهان Bedrock هو أن العملاء يريدون الخيارات أكثر من ما يريدون نموذج واحد.

Azure OpenAI الشراكة الحصرية. تحصل على سلسلة GPT-4 / 4o / 5 / o ، DALL·E ، Whisper ، وتحسين نماذج OpenAI في مراكز بيانات Azure. لا توجد نماذج غير OpenAI في كاتالوج "Azure OpenAI Service" تلك تذهب إلى Azure AI Foundry (منتج منفصل). رهان Azure هو أن OpenAI تظل الحدود والعملاء يريدون التحكم المؤسساتي على هذه العلاقة المحددة.

Vertex AI جملة أولاً ، كل شيء آخر ثانياً. جملة 1.5 / 2.0 / 2.5 فلاش و برو ، بالإضافة إلى Model Garden (الجهة الثالثة). رهان Vertex هو متعدد الحركات السياق الطويل 1M- توكن سياق جملة هو المميز.

فجوة التأخير في المقياس

التحليل الاصطناعي يدير مقاييس مستمرة. على التنفيذات المُتوازية للاما 3.1 405B (المشاركة بناء على الطلب) ، يبلغ متوسط تأخير أول رمز Azure OpenAI حوالي 50 ms؛ وBedrock حوالي 75 ms. الفجوة ليست فشل AWS انها اختلاف نموذج القدرة. يُبيع Azure وحدات التوصيل المُقدمة، والتي تحفظ قدرة GPU للمستأجر. يوجد ما يعادله بيدروك (التوصيل المزود) ولكن يبدأ حوالي 21 دولارًا في الساعة لكل وحدة ، ويبقى معظم العملاء على الطلب المشترك.

القدرة المشتركة على الطلب تتنافس مع حركة مرور كل عميل آخر. القدرة المخصصة لا. إذا كان SLA منتجك TTFT < 100 ms في P99, إما شراء PTUs على Azure، شراء Bedrock Provisioned Throughput، أو قبول التباين الافتراضي.

اقتصاد الناتج المقدم

أزور PTUs: كتلة محجوزة من الحسابات الاستنتاجية. حتى ~ 70% التوفير مقابل الطلب على أحملات عمل يمكن التنبؤ بها. تكاليف ثابتة بالساعة بغض النظر عن حركة المرور تدفع للحجز حتى عندما تكون عديمة الفائدة. عادة ما تكون التوازن حول 40-60% الاستخدام المستدام.

المكملات المقدمة من السرير: $21-$50 في الساعة اعتمادا على النموذج والمنطقة. نفس الرياضيات وقف حتى هو حوالي نصف استخدام ذروة. التزام شهري مطلوب.

يتم بيع القدرة المخصصة لشركة Vertex لكل SKU من Gemini؛ وتختلف الأسعار حسب النموذج والمنطقة وتتوافر أقل إعلانًا علنيًا.

سطح FinOps المفارقات الحقيقية

Bedrock Application Inference Profilesأطهر وصف في السوق.team،product،feature· توجيه جميع دعوات النموذج من خلالها؛ CloudWatch ينفصل التكلفة لكل ملف دون معالجة بعد. إضافة 2025, لا يزال أكثر الكمية من المعدلات المعدنية الحصرية الأصلية.

Vertexالتخصيص هو مشروع لكل فريق بالإضافة إلى العلامات - في كل مكان. يمكنك أن نموذج كل فريق كمشروع GCP، وضع العلامات على كل مصدر، واستخدام BigQuery تصدير الفواتير + DataStudio لتحويلات. المزيد من العمل، ولكن BigQuery يعطيك SQL التعسفي على بيانات التكلفة.

Azureيعتمد على نطاقات الاشتراك / مجموعة الموارد بالإضافة إلى علامات ، مع حجزات PTU كشيء من التكلفة من الدرجة الأولى. يتم تراث علامات من مجموعات الموارد ، وليس الطلبات ، لذلك تتطلب خصيصات كل طلب تقييمات Application Insights المخصصة أو بوابة تعطي الرؤوس.

النمط: Bedrock هو النظيف الأصلي، Vertex هو الأكثر مرونة من خلال BigQuery، Azure هو الأكثر غامضة ما لم تكن أداة.

الإغلاق هو خطر 2026

كان التزام المعدل المتسلسل الواحد جيدًا عندما كان نموذجًا واحدًا يهيمن عليه. في عام 2026 يتحرك الحدود شهريًا كلود 3.7 ربعًا ، جيميني 2.5 الربع التالي ، جي بي تي 5 الربع التالي. إغلاقك على منصة واحدة يمنعك من ثلثي الحدود.

تتبنى فرق العمل النمط: الحد الأدنى من مزودي مزدوجين لأي اتصال LLM حاسم للمنتج. بيدروك بالإضافة إلى Azure OpenAI هو الزوج المشترك كلود من واحد ، GPT من الآخر ، فشل بينهما ، نفس البوابة. يُهمل رفع التكلفة لأن طرق البوابة مثالية ؛ يُحسن رفع الوصول أثناء الانقطاعات (مثل حادثة Azure OpenAI يناير 2025 ، انقطاع AWS us-east-1) هو الحاسم.

إقامة البيانات، ووكالات التأمين والصناعات المنظمة

"بيدروك": إدارات إدارة الأعمال في معظم المناطق؛ نقاط نهاية VPC؛ حواجز الحراسة. افتراض تقنية التكنولوجيا المالية الشائعة.

أزور أوبن آي: HIPAA، SOC 2، ISO 27001؛ إقامة البيانات في الاتحاد الأوروبي؛ الاختيار الافتراضي المنظم من قبل المؤسسة.

ورتكس: HIPAA، GDPR، إقامة البيانات لكل منطقة؛ كومة الامتثال في Google Cloud.

جميع الثلاثة تلتزم بالربطة التحققية الأساسية. الاختلافات هي في سياسات الاحتفاظ بالبيانات، وكيفية التعامل مع السجلات، وما إذا كان مراقبة الإساءة يقرأ حركة المرور الخاصة بك (التخلي عن الاشتراك الافتراضي على معظم المواقع؛ الاختيار المتاحة للشركات).

أرقام يجب أن تتذكر

  • متوسط TTFT في Azure OpenAI على مكافئ Llama 3.1 405B: ~ 50 ms (مع PTUs).
  • متوسط TTFT على الطلب: ~ 75 ms.
  • المكملات المقدمة من السرير: $21-$50 ساعة لكل وحدة
  • توازن في PTU Azure: 40-60% استمرار الاستخدام.
  • توفيرات PTU مقابل الطلب عند الاستخدام العالي: ما يصل إلى 70%.

استخدمها

code/main.pyيُقارن المنصات الثلاثة على عبء عمل اصطناعي فإنه يُقَدِّم الاقتصاد على الطلب مقابل PTU، وتباين TTFT، وفادية إخصاب التكاليف.

أرسله

هذا الدرس يُنتجoutputs/skill-managed-platform-picker.md. بالنظر إلى نموذج حمل العمل (الموديلات المطلوبة، TTFT SLA، الحجم اليومي، متطلبات الامتثال) ، فإنه يوصي بمنصة رئيسية، وخطة إعادة التأهيل، وخطة أدوات FinOps.

التمارين

  1. أركضcode/main.pyفي أي مستوى مستدام يضرب Azure PTU على الطلب لنموذج فئة 70B؟ حساب التوازن وتقارن مع الشريط المعلن 40-60٪.
  2. إن منتجك يحتاج إلى كلود 3.7 سونيت و GPT-4o. تصميم نشر مزودين الذي يذهب إلى أي متسلسل، ما البوابة التي تقع أمام، ما هي سياسة الإفشل؟
  3. يتطلب عميل الرعاية الصحية المنظمة BAAs، إقامة البيانات في الولايات المتحدة الشرقية، و sub-100ms P99 TTFT. اختيار منصة وتبرير مع ثلاثة ميزات محددة.
  4. اكتشفت أن فاتورتك في "بيدروك" ارتفعت أربع مرات هذا الشهر بدون تغيير في حركة المرور، بدون ملفات تعريف التطبيقات، كيف ستجد الجاني؟
  5. اقرأ صفحات أسعار Azure OpenAI و Bedrock. ل 100 مليون رمز / شهر Claude عبء عمل، الذي هو أرخص مباشرة API الأنثروبيك، Bedrock على الطلب، أو Bedrock Provisioned Throughput؟

الشروط الرئيسية

TermWhat people sayWhat it actually means
Bedrock"AWS LLM service"Model marketplace across Claude, Llama, Titan, Mistral, Cohere
Azure OpenAI"Azure's ChatGPT"Exclusive OpenAI models in Azure datacenters with enterprise controls
Vertex AI"Google's LLM"Gemini-first platform with Model Garden for third-party models
PTU"dedicated capacity"Provisioned Throughput Unit — reserved inference GPUs, priced per hour
Application Inference Profile"Bedrock tagging"Per-product cost/usage profile with tags, CloudWatch-native
Model Garden"Vertex catalog"Vertex AI's third-party model section, separate from Gemini
Two-provider minimum"LLM redundancy"Policy of running every critical LLM path across ≥2 hyperscalers
BAA"HIPAA paperwork"Business Associate Agreement; required for PHI; provided by all three
Abuse monitoring"the log watcher"Provider-side safety scan on prompts/outputs; opt-out in enterprise

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.