Phase 17: Infrastructure & Production

API های دسته بندی تخفیف 50٪ به عنوان استاندارد صنعت

هر ارائه دهنده بزرگ یک API دسته ای با تخفیف 50٪ و 24 ساعت برگشت می فرستد. OpenAI، Anthropic، Google و اکثر سیستم عامل های نتیجه گیری (Fireworks batch tier، Together batch) همان الگوی را اجرا می کنند. دسته بندی با ذخیره سازی سریع و خطوط لوله در طول شب به ~ 10٪ از هزینه های متزامن بدون ذخیره کاهش می یابد. قانون خیلی ساده است: اگر تعاملی نباشد، باید به دسته بندی تعلق داشته باشد. خطوط تولید محتوا، طبقه بندی اسناد، استخراج داده ها، تولید گزارش، برچسب گذاری کلان، برچسب گذاری کاتالوگ هر چیزی که تحمل تاخیر 24 ساعته را دارد، پول باقی مانده است تا زمانی که به دسته منتقل شود. مدل تولید 2026 این است که هر بار کاری جدید LLM را به سه خط تقسیم کند: تعاملی (همزاد با کیش) ، نیمه تعاملی (صف غیرمنقضی با عقب نشینی) ، دسته (در شب، ورودی ذخیره شده). بار کاری که تظاهر می کنند تعاملی هستند اما به مدت چند دقیقه تاخیر تحمل می کنند بیشتر از همه تلف می شوند.

Type: Learn

Languages: Python (stdlib, toy batch-vs-sync cost simulator)

Prerequisites: Phase 17 · 14 (Prompt & Semantic Caching)

Time: ~45 minutes

اهداف یادگیری

  • سه API دسته ارائه دهنده (OpenAI، Anthropic، Google) و تضمین های مشترک تخفیف 50٪ + 24 ساعت را نام ببرید.
  • هزینه های جمع آوری دسته + ورودی ذخیره شده را در یک بار کاری طبقه بندی شبانه محاسبه کنید و با خط اصلی بدون ذخیره سازی هم زمان مقایسه کنید.
  • یک بار کار را به دسته ای تعاملی / نیمه تعاملی / دسته ای تقسیم کنید و مسیر را توجیه کنید.
  • دو تله را نام دهید: تعامل جزئی (کاربری انتظارات سریعتر از 24 ساعت را دارد) و حرکت طرح خروجی (فورمات فایل دسته بندی از هر ارائه دهنده متفاوت است).

مشکل

تیم شما یک خط تولید گزارش شبانه ارسال می کند. 50 هزار سند، هر یک را خلاصه کنید، خلاصه ها را جمع آوری کنید، یک خلاصه اجرایی را تهیه کنید. اجرا همزمان 4 ساعت در $2000 / شب طول می کشد. شما در مورد API های دسته ای شنیده اید.

این دسته شما را 50 درصد تخفیف می دهد. شما همچنین به سرعت ذخیره سازی پرامپ را در پرامپت سیستم (به اشتراک گذاشته شده در تمام 50k تماس) فعال می کنید. بسته شده، صورتحساب به 180 $ / شب کاهش می یابد ~ 9% از خط اصلی. همان خط، سه تغییر پیکربندی.

دسته ارزان ترین اهرم در ابزار هزینه LLM است که هیچ کس نمی کشد. دلیل بیشتر سازمانی است: تیم ها فکر می کنند "در زمان واقعی" زمانی که SLA در واقع "در صبح" است. این درس در مورد عدم ترک 90% از مشمولات روی میز است.

مفهوم

سه دسته API

OpenAI Batch API: JSONL فایل بارگذاری با یک لیست از درخواست ها. وعده 24 ساعت بازگشت (معمولا 2-8 ساعت در عمل). تخفیف 50٪ در توکن های ورودی و خروجی. /v1/batchesورودی های واجد شرایط ذخیره سازی نیز قیمت گذاری ورودی ذخیره شده را در بالا می گیرند.

Anthropic Message Batches: JSONL اپلود، 24 ساعته بازيابي، تخفيضي 50 درصدcache_control نوشته های پیشگیر شده صریح هستند، خواندن ها به طور خودکار در دسته اتفاق می افتد.

Google Vertex AI Batch Prediction: BigQuery یا ورودی GCS. مشابه تخفیف 50٪ برای جمینی. با خطوط لوله ورتیکس ادغام می شود.

معنی: غیر هماهنگ، نه کند

دسته "من به 24 ساعت برمی گردم" نه "این 24 ساعت طول می کشد".P50 معمولی 2-6 ساعت است. ارائه دهنده دسته شما را در طول پنجره های خارج از اوج برنامه ریزی می کند وقتی موجود GPU استفاده کم است.

با ذخیره سازی ذخیره سازی

خلاصه ی 50 هزار سند با همان پیام 4K:

  • بدون ذخیره سازی متزامن: 50000 × ($input × 4000 + $تولید × 200) در سرعت کامل.
  • ذخیره سازی متزامن: پیام سیستم پس از اولین نوشتن ذخیره شده؛ 49999 باقی مانده 10 برابر ارزان تر وارد می شوند.
  • دسته بندی: همه موارد بالا به علاوه تخفیف 50٪ در هر دو خواندن و نوشتن.

دسته: دسته + کش = ~ 10% از sync uncached bill. هر بار کاری که در طول شب اجرا می شود و یک پیام سیستم مشترک دارد باید از این استفاده کند.

دسته بندی بار کاری

Interactive کاربر منتظر پاسخ است. TTFT مهم است. تماس هم زمان با پیشگیری سریع. نمی تواند دسته بندی شود.

Semi-interactive کاربر یک کار را ارسال می کند، در عرض چند دقیقه بازبینی می کند. صف همگام سازی با fallback برای همگام سازی اگر دسته در دسترس نباشد. فکر کنید شاخص سازی RAG حجم متوسط.

Batch کاربر انتظار نتایج "در صبح" یا "ساعت بعدی". خطوط محتوای، طبقه بندی در مقیاس، تجزیه و تحلیل غیر فعال. همیشه دسته بندی، همیشه ذخیره سازی ذخیره سازی.

اشتباه رایج: طبقه بندی همه چیز به عنوان تعاملی چون لوله تولید است. تولید یک مشخصات تاخیر نیست SLA است.

تله تعامل جزئی

برخی از ویژگی ها تعاملی به نظر می رسند اما 5-10 دقیقه تحمل می کنند. مثال: یک گزارش سلامتی مشتری شبانه با دکمه "تازه سازی" . کاربر کلیک می کند تازه سازی؛ صبر کنید 10 دقیقه خوب است. تیم آن را به عنوان هم زمان ارسال می کند. 50 تازه سازی همزمان هزینه 10 برابر هزینه دسته بندی و تحویل از طریق ایمیل خواهد بود.

سوال: "24 ساعت برای این کاربر چه معنایی دارد؟" اگر پاسخ این است که "آنها متوجه نمی شوند"، آن را دسته بندی کنید.

خط خط خط تولید

فرمت های فایل دسته ای در هر ارائه دهنده متفاوت است:

  • OpenAI: JSONL، یک درخواست در هر خط
  • انسان شناسی: JSONL، یک پیام در هر خط؛ قالب پاسخ دربرگیرنده.
  • ورکتکس: جدول BigQuery یا پیشگویی GCS با TFRecord.

نوشتن "یک کالا مشتری" در بین ارائه دهندگان به معنای کد آداپتور در هر ارائه دهنده است. دروازه هایی که به دسته های چند ارائه دهنده (Portkey، LiteLLM برخی سطوح) تبلیغ می کنند هنوز هم قالب خام را پیچیده می کنند.

شماره هایی که باید به یاد داشته باشی

  • تخفیف دسته ای بین ارائه دهندگان: 50٪ ثابت در ورودی + خروجی.
  • SLA برگشت: 24 ساعت تضمین شده، 2-6 ساعت معمول P50.
  • دسته بندی شده + ورودی ذخیره شده: ~10٪ از هزینه های همگام سازی بدون ذخیره سازی.
  • قانون تحریف بار کاری: اگر تاخیر 24 ساعت قابل قبول باشد، همیشه دسته بندی کنید.

ازش استفاده کن

code/main.pyهزینه های همگام سازی، همگام سازی+کیش، دسته بندی و دسته بندی+کیش را برای یک بار کاری 50 هزار سند محاسبه می کند. پس انداز در دلار و درصد گزارش می دهد.

-باده

این درس به ما کمک می کندoutputs/skill-batch-triager.md. با توجه به ویژگی های بار کاری، به دسته بندی های تعاملی/ نیمه/ دسته بندی و تخمین های صرفه جویی.

تمرینات

  1. فرار کنcode/main.pyبرای یک خط لوله 100k-doc با 3K-توکن سیستم فوری و 500-توکن خروجی، محاسبه صرفه جویی از کامل دسته (بچ + کیش) در مقابل هم وقت سازی خط پایه.
  2. سه ویژگی را در یک محصول واقعی که می شناسید انتخاب کنید. هر یک را به دسته ای تعاملی / نیمه / دسته بندی کنید.
  3. يه کاربر از گزارششون شکایت ميکنه که سه ساعت طول کشيده بود. اين يه اشتباه دسته اي بود يا يه تعامل مشروع؟
  4. SLA بازگشت API دسته شما 24 ساعت است اما P99 20 ساعت است. چگونه شما این را به کاربر ارتباط دهید رفتار سیستم زیر جریان در قاب حاشیه چیست؟
  5. محاسبه توازن: در چه طولی از پیش فرض مشترک، دسته + کش ارزان تر از اجرای یک شبه در GPU ذخیره شده خود می شود؟

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
Batch API"async discount"50% off with 24h turnaround
JSONL"batch format"One JSON request per line; OpenAI/Anthropic standard
Message Batches"Anthropic batch"Anthropic's batch API product name
Batch prediction"Vertex batch"Vertex AI's batch API product
Turnaround SLA"24h promise"Guarantee, not typical; typical is 2-6h
Workload triage"interactivity decision"Interactive / semi / batch routing decision
Output schema"response format"Per-provider JSONL layout; not portable
Stacked discount"batch + cache"~10% of uncached sync bill when both apply

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.