Phase 17: Infrastructure & Production

خيارات إدارة المجموعات تخفيض بنسبة 50٪ كمعيار صناعي

كل مزود رئيسي يرسل API اللحظة غير المزامن مع خصم 50٪ وتحويل 24 ساعة. أوبن إي آي، أنتروبيك، جوجل، ومعظم منصات الاستنتاج (فاير ووركس مستوى دفعة، دفعة معا) تنفيذ نفس النمط. الحزمة مع التخزين السريع والخطوط الأنبوبية خلال الليل تنخفض إلى ~ 10% من التكلفة المزمنة غير المزودة. القاعدة بسيطة للغاية: إذا لم تكن تفاعلية، فهي تنتمي إلى اللحم. خطوط إنتاج المحتوى، تصنيف الوثائق، استخراج البيانات، إنتاج التقارير، وضع علامات كتلة، وضع علامات الكتالوج أي شيء يتسامح مع تأخر 24 ساعة هو المال الذي يبقى على الطاولة حتى ينتقل إلى اللحظة. نمط الإنتاج لعام 2026 هو تقسيم كل حمولة عمل جديدة لـ LLM إلى ثلاث خطوط: تفاعلية (متزامنة مع التخزين الآلي) ، شبه تفاعلية (موافقة صف مع الخلف الآلي) ، سلسلة (بمرور الليل ، مدخل مخزن الآلي). تحميلات العمل التي تتظاهر أنها تفاعلية ولكنها تتسامح مع دقائق من التأخير هي الأكثر إهداراً

Type: Learn

Languages: Python (stdlib, toy batch-vs-sync cost simulator)

Prerequisites: Phase 17 · 14 (Prompt & Semantic Caching)

Time: ~45 minutes

أهداف التعلم

  • أسمائ ثلاثة مرفقين مجموعة من APIs (OpenAI، Anthropic، Google) والخفض المشترك بنسبة 50% + ضمانات التحول 24 ساعة.
  • احسب تكلفة تخزين اللحظة + المدخلات المتخزنة على عبء عمل تصنيف ليلاً وتقارنها مع خط الأساس المتزامن غير المتخزن.
  • قم بتقسيم عبء عمل إلى مجموعة تفاعلية / شبه تفاعلية / مجموعة وتبرير المسار.
  • أسمائ اثنين من الفخاخ: التفاعل الجزئي (يتوقع المستخدم أسرع من 24 ساعة) واندفاع النظام الخارجي (تختلف شكل ملفات المجموعة لكل مزود).

المشكلة

فريقك يُرسل خط أنبوب لتوليد التقارير الليلية. 50 ألف وثيقة، تلخيص كل منها، تجمع الموجبات، وصياغة الموجبات التنفيذية. التشغيل بالتزامن يستغرق 4 ساعات عند 2000 دولار/ليلة.

المجموعة تحصل على 50% من خصم. يمكنك أيضا تمكين التخزين المحفظي على طلب النظام (مشاركة على جميع 50k المكالمات). يتم تجميعها، ينخفض الفاتورة إلى 180 $ / ليلة ~ 9% من الخط الأساسي. نفس الأنابيب، ثلاثة تغييرات التكوين.

اللحظة هي أرخص الرافعة في مجموعة أدوات تكلفة ماجستير في التدريس التي لا يسحبها أحد. السبب هو في الغالب التنظيمي: الفرق تفكر "في الوقت الحقيقي" عندما يكون SLA في الواقع "في الصباح". هذا الدروس هو حول عدم ترك 90% من الفاتورة على الطاولة.

المفهوم

المجموعة الثلاثة من إدارة المعلومات

OpenAI Batch API: تحميل ملف JSONL مع قائمة الطلبات. التحول الموعود لمدة 24 ساعة (عادة ~ 2-8 ساعات في الممارسة العملية). خصم بنسبة 50% على رموز الدخول والخروج. /v1/batchesنقطة نهاية. المدخلات المؤهلة للحفظ في الاحتفاظ أيضاً الحصول على الأسعار المضافة في الاحتفاظ بالأحتفاظ.

Anthropic Message Batchesتحميل JSONL، 24 ساعة التحول، خصم 50٪. يدعم cache_control كتابات التخزين المضبوطة صريحة، القراءة تحدث تلقائيا داخل المجموعة.

Google Vertex AI Batch Prediction: BigQuery أو مدخلات GCS. تخفيض مماثل بنسبة 50% بالنسبة لجمل. يدمج مع خطوط الأنابيب Vertex.

المفاهيم: غير متزامن، ليس بطيء

البطاقة هي "أعدك بالعودة خلال 24 ساعة" ليس "هذا سيستغرق 24 ساعة". البطاقة النموذجية P50 هي 2-6 ساعات. يقوم مزود بتعيين البطاقة الخاصة بك خلال النوافذ خارج الذروة عندما يتم استخدام مخزون GPU بشكل غير مناسب.

التجميع مع التخزين

خلاصة 50K من الوثائق مع نفس نظام 4K رموز طلب:

  • غير مسجلة بالتزامن: 50000 × ($input × 4000 + $الناتج × 200) عند معدلات كاملة.
  • التخزين المتزامن: يتم تخزين طلب النظام بعد الكتابة الأولى؛ والباقي 49999 الحصول على مدخل أرخص 10x.
  • الحزمة المحفوظة: كل ما سبق بالإضافة إلى خصم بنسبة 50٪ على القراءة والكتابة.

كومة: مجموعة + التخزين = ~ 10% من الفاتورة المزامنة غير المتخزين. أي حمولة عمل تعمل على مدار الليل ولها طلب نظام مشترك يجب استخدام هذا.

التقسيم للحمق العمل

Interactiveالمستخدم ينتظر الإجابة. TTFT مهمة. مكالمة متزامنة مع التخزين السريع. لا يمكن أن الجماعات.

Semi-interactive يقوم المستخدم بإرسال مهمة، يتحقق من العودة في دقائق. صف التزام التزامن مع fallback للتزامن إذا لم تكن الحزمة متاحة. فكر في إندكس RAG الحجم المتوسط.

Batch يتوقع المستخدم نتائج "في الصباح" أو "الساعة القادمة". خطوط المحتوى، التصنيف على نطاق واسع، تحليل خارج الإنترنت. دائماً الحزمة، دائماً التخزين الآلي.

خطأ شائع: تصنيف كل شيء كفاعلي لأن خط الأنابيب هو الإنتاج. إنتاج ليس تحديد التأخير SLA هو.

فخ التفاعلية الجزئية

بعض الميزات تبدو تفاعلية ولكنها تتسامح مع 5-10 دقائق. مثال: تقرير صحي للعملاء ليلا مع زر "تجديد". النقر على المستخدم التجديد؛ إنتظر 10 دقائق هو بخير. الشركة شحنها متزامن. 50 التجديدات المتزامن تكلف 10 مرات ما يكلف المجموعة وتسليم عبر البريد الإلكتروني.

السؤال الذي يجب طرحه: "ما الذي يعني 24 ساعة لهذا المستخدم؟" إذا كانت الإجابة "لن يلاحظوا" ، قم بتعبئة ذلك.

فخ الخروج-الخطة

تنسيقات ملفات الحزمة تختلف لكل مزود:

  • OpenAI: JSONL، طلب واحد لكل سطر.
  • الأنثروبي: JSONL ، رسالة واحدة لكل سطر ؛ تنسيق الرد مدمج.
  • Vertex: جدول BigQuery أو مقدمة GCS مع TFRecord.

كتابة "عميل دفعة واحدة" عبر مزودي يعني رمز المعدل لكل مزود. البوابات التي تعلن عن دفعة متعددة المزودين (Portkey ، LiteLLM في بعض المستويات) لا تزال تغلف الفورمات الخام.

أرقام يجب أن تتذكر

  • خصم الحزم بين المقدمين: 50٪ ثابتة على المدخل + الخروج.
  • إعادة التأمين على التداول: 24 ساعة مضمونة، 2-6 ساعات عادةً P50.
  • المجموعة المكتظة + المدخل المحفظ: ~ 10% من تكلفة المزامن غير المحفظ.
  • قاعدة تحديد الحمل: إذا كان تأخير 24 ساعة مقبولًا، ففي كل مرة تكون هناك مجموعة.

استخدمها

code/main.pyيحسب التكاليف عبر المزامنة، المزامنة + الاحتياطي، اللحظة، واللحظة + الاحتياطي لعبء عمل 50k وثيقة. يبلغ عن التوفير في $ و٪.

أرسله

هذا الدرس يُنتجoutputs/skill-batch-triager.md. بالنظر إلى خصائص عبء العمل، يتم تقسيمها إلى مجموعة تفاعلية/نصفية/بارت وتقديرات التوفير.

التمارين

  1. أركضcode/main.py. بالنسبة لخط أنابيب 100K-doc مع 3K- Token نظام محاولة وتخرج 500- Token، حساب مدخرات كومة كاملة (بث + التخزين الآلي) مقابل التزام الموازنة خط أساسي.
  2. اختر ثلاثة ميزات في منتج حقيقي تعرفه، قم بتقسيم كل منها إلى مجموعة تفاعلية أو شبه أو مجموعة.
  3. يشتكي مستخدمٌ من أن تقريره استغرق 3 ساعات هل كان خطأً في التجربة أو تفاعلاً شرعيًّا؟
  4. إعادة API الخاص بك مجموعة SLA هو 24 ساعة ولكن P99 هو 20 ساعة. كيف يمكنك التواصل مع هذا للمستخدم ما هو سلوك النظام التدريجي على الحافة القضية؟
  5. الحسابات التوازن: في أي طول المشاركة من المشاريع تصبح المجموعة + التخزين أقل تكلفة من تشغيل بين عشية وضحاها على جهاز GPU الخاص بك المحجوز؟

الشروط الرئيسية

TermWhat people sayWhat it actually means
Batch API"async discount"50% off with 24h turnaround
JSONL"batch format"One JSON request per line; OpenAI/Anthropic standard
Message Batches"Anthropic batch"Anthropic's batch API product name
Batch prediction"Vertex batch"Vertex AI's batch API product
Turnaround SLA"24h promise"Guarantee, not typical; typical is 2-6h
Workload triage"interactivity decision"Interactive / semi / batch routing decision
Output schema"response format"Per-provider JSONL layout; not portable
Stacked discount"batch + cache"~10% of uncached sync bill when both apply

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.