Phase 17: Infrastructure & Production

बैच एपीआई उद्योग मानक के रूप में 50% छूट

प्रत्येक प्रमुख प्रदाता 50% छूट और ~ 24 घंटे के टर्नअराउंड के साथ एक असिनक्रोनस बैच एपीआई भेजता है। ओपनएआई, मानव, गूगल और अधिकांश निष्कर्ष मंच (फायरवर्क्स बैच टियर, Together बैच) एक ही पैटर्न लागू करते हैं। त्वरित कैशिंग के साथ स्टैक बैच और रातोंरात पाइपलाइनें समवर्ती-अंकैश लागत के ~10% तक गिरती हैं। नियम बेहद सरल हैः यदि यह इंटरैक्टिव नहीं है, तो यह बैच पर आता है। सामग्री उत्पादन पाइपलाइन, दस्तावेज़ वर्गीकरण, डेटा निष्कर्षण, रिपोर्ट निर्माण, बल्क लेबलिंग, कैटलॉग टैगिंग 24 घंटे की विलंबता के लिए सहिष्णु कुछ भी पैसा है जो बैच में जाने तक मेज पर छोड़ दिया जाता है। 2026 के उत्पादन पैटर्न में प्रत्येक नए एलएलएम कार्यभार को तीन लेन में वर्गीकृत किया जाना हैः इंटरैक्टिव (कैशिंग के साथ सिंक्रोनस), अर्ध-इंटरैक्टिव (फालबैक के साथ असिनक्रोनस कतार), बैच (रात भर, कैश किए गए इनपुट स्टैक किए गए) । कार्यभार जो परस्पर व्यवहार करने का नाटक करते हैं लेकिन मिनटों की देरी को सहन करते हैं, वे सबसे अधिक बर्बाद करते हैं।

Type: Learn

Languages: Python (stdlib, toy batch-vs-sync cost simulator)

Prerequisites: Phase 17 · 14 (Prompt & Semantic Caching)

Time: ~45 minutes

सीखने के लक्ष्य

  • तीन प्रदाता बैच एपीआई (ओपनएआई, एंथ्रोपिक, गूगल) और सामान्य 50% छूट + 24 घंटे की टर्नअराउंड गारंटी का नाम दें।
  • रात भर वर्गीकरण कार्यभार पर बैच स्टैपिंग + कैश इनपुट की लागत की गणना करें और सिंक्रोनस-अनकैश बेसलाइन की तुलना करें।
  • कार्यभार को इंटरैक्टिव/अर्ध-इंटरैक्टिव/बैच में क्रमबद्ध करें और लेन को सही ठहराएं।
  • दो जाल का नाम देंः आंशिक अन्तरक्रियाशीलता (उपयोगकर्ता 24 घंटे से अधिक तेजी से उम्मीद करता है) और आउटपुट-स्केम बहाव (बैच फ़ाइल प्रारूप प्रत्येक प्रदाता के अनुसार भिन्न होता है) ।

समस्या

आपकी टीम एक रात में रिपोर्ट उत्पन्न करने की पाइपलाइन भेजती है 50,000 दस्तावेज, प्रत्येक का सारांश, संक्षेप को समूहीकृत करना, एक कार्यकारी संक्षिप्त पत्र तैयार करना. समवर्ती रूप से चलना $2,000 / रात पर 4 घंटे लेता है। आप बैच एपीआई के बारे में सुनते हैं।

बैच आपको 50% छूट देता है. आप सिस्टम प्रॉम्प्ट पर भी त्वरित कैशिंग सक्षम करते हैं (सभी 50k कॉल पर साझा किया जाता है) । ढेर में, बिल मूल लाइन के $ 180 / रात ~ 9% तक गिर जाता है। एक ही पाइपलाइन, तीन कॉन्फ़िग परिवर्तन।

बैच LLM लागत उपकरण में सबसे सस्ता लीवर है कि कोई भी खींचता है। कारण ज्यादातर संगठनात्मक हैः टीमों को लगता है "वास्तविक समय में" जब SLA वास्तव में है "सवेरे तक।" इस सबक के बारे में है तालिका पर बिल का 90% नहीं छोड़ने के बारे में है।

अवधारणा

तीन बैच एपीआई

OpenAI Batch API: अनुरोधों की सूची के साथ JSONL फ़ाइल अपलोड. 24 घंटे के टर्नअराउंड का वादा किया गया (आमतौर पर अभ्यास में ~ 2-8 घंटे) । इनपुट और आउटपुट टोकन पर 50% छूट। /v1/batchesकैश योग्य इनपुट भी कैश इनपुट मूल्य निर्धारण ऊपर मिलता है।

Anthropic Message Batches: JSONL अपलोड. 24 घंटे टर्नअराउंड. 50% छूट. समर्थन cache_control कैश लिखता है स्पष्ट हैं, पाठ बैच के भीतर स्वचालित रूप से होता है.

Google Vertex AI Batch Prediction: बिगक्वेरी या जीसीएस इनपुट. मिथुन के लिए समान 50% छूट. वर्टेक्स पाइपलाइन के साथ एकीकृत।

अर्थशास्त्रः असिनक्रोनस, धीमा नहीं

बैच "मैं 24 घंटे के भीतर वापस आने का वादा करता हूं" है नहीं "इसमें 24 घंटे लगेंगे।" सामान्य पी 50 2-6 घंटे है। प्रदाता पीक विंडो के दौरान आपके बैच को शेड्यूल करता है जब GPU इन्वेंट्री का उपयोग कम होता है।

कैशिंग के साथ ढेर

एक ही 4K टोकन प्रणाली के साथ 50k दस्तावेज सारांशः

  • समवर्ती कैश न किया गयाः 50000 × ($input × 4000 + $पूर्ण दरों पर आउटपुट × 200) ।
  • समवर्ती कैशः सिस्टम प्रॉम्प्ट को पहले लिखने के बाद कैश किया जाता है; शेष 49999 को 10 गुना सस्ता इनपुट मिलता है।
  • बैच कैशः उपरोक्त सभी प्लस 50% छूट दोनों पढ़ने और लिखने पर।

स्टैकः बैच + कैश = ~ 10% सिंक्रनाइज़ किए गए कैश किए गए बिल का। किसी भी वर्कलोड जो रात भर चलता है और जिसमें साझा सिस्टम प्रॉम्प्ट है, को इस का उपयोग करना चाहिए।

कार्यभार का वर्गीकरण

Interactive उपयोगकर्ता प्रतिक्रिया का इंतजार कर रहा है. TTFT मायने रखता है. समकालिक कॉल के साथ त्वरित कैशिंग. बैच नहीं हो सकता.

Semi-interactive उपयोगकर्ता एक कार्य प्रस्तुत करता है, मिनटों में वापस जांचता है। बैच उपलब्ध नहीं है तो सिंक्रनाइज़ करने के लिए fallback के साथ असिनक्रनाइज़ कतार। मध्यम मात्रा RAG अनुक्रमणिका सोचें।

Batch उपयोगकर्ता परिणाम "सवेरे" या "अगले घंटे" तक उम्मीद करता है। सामग्री पाइपलाइन, पैमाने पर वर्गीकरण, ऑफ़लाइन विश्लेषण। हमेशा बैच, हमेशा स्टैक कैशिंग।

सामान्य त्रुटिः सब कुछ इंटरैक्टिव के रूप में वर्गीकृत करना क्योंकि पाइपलाइन उत्पादन है। उत्पादन एक विलंबता विनिर्देश नहीं है एसएलए है।

आंशिक-संक्रियता जाल

कुछ सुविधाएँ इंटरैक्टिव लगती हैं लेकिन 5-10 मिनट तक सहन करती हैं। उदाहरणः "फ्रेश" बटन के साथ एक रात की ग्राहक स्वास्थ्य रिपोर्ट। उपयोगकर्ता ताज़ा क्लिक करता है; प्रतीक्षा 10 मिनट ठीक है। टीम इसे समवर्ती के रूप में भेजती है। 50 समवर्ती ताज़ा होने की लागत 10 गुना है जो बैच-और-डिलीवर-इमेल द्वारा लागत होगी।

यदि उत्तर "वे नहीं देखेंगे" है तो इसे बैच करें।

आउटपुट-स्केम जाल

बैच फ़ाइल प्रारूप प्रदाता के अनुसार भिन्न होते हैंः

  • JSONL, प्रति पंक्ति एक अनुरोध।
  • मानवः JSONL, प्रति पंक्ति एक संदेश; उत्तर प्रारूप एम्बेड किया गया।
  • वर्टेक्सः बिगक्वेरी तालिका या TFRecord के साथ GCS पूर्वावलोकन।

"एक बैच क्लाइंट" को विभिन्न प्रदाताओं में लिखना प्रत्येक प्रदाता के लिए एडाप्टर कोड का मतलब है। बहु-प्रदाता बैच (पोर्टकी, लाइटएलएम कुछ स्तरों) का विज्ञापन करने वाले गेटवे अभी भी कच्चे प्रारूप को पतला-पैक करते हैं।

संख्याओं को याद रखना चाहिए

  • प्रदाताओं के बीच बैच छूटः 50% इनपुट + आउटपुट पर फ्लैट।
  • टर्नअराउंड एसएलएः 24 घंटे गारंटी, 2-6 घंटे सामान्य P50.
  • स्टैक बैच + कैश इनपुटः ~10% सिंक्रनाइज़ेड अनकैश लागत।
  • कार्यभार क्रमबद्ध नियमः यदि 24 घंटे की विलंबता स्वीकार्य है, तो हमेशा बैच करें।

इसका प्रयोग करें

code/main.py50k दस्तावेज़ कार्यभार के लिए सिंक्रनाइज़ेशन, सिंक्रनाइज़ेशन + कैश, बैच और बैच + कैश पर लागत की गणना करता है। $ और प्रतिशत में बचत की रिपोर्ट करता है।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-batch-triager.md. कार्यभार की विशेषताओं को देखते हुए, इंटरैक्टिव/सेमी/बैच में वर्गीकृत किया जाता है और बचत का अनुमान लगाया जाता है।

व्यायाम

  1. दौड़ेंcode/main.py. 3K- टोकन सिस्टम प्रॉम्प्ट और 500- टोकन आउटपुट के साथ 100k-doc पाइपलाइन के लिए, पूर्ण स्टैक (बैच + कैश) बनाम सिंक बेसलाइन की बचत की गणना करें।
  2. एक वास्तविक उत्पाद में तीन विशेषताएं चुनें जिन्हें आप जानते हैं। प्रत्येक को इंटरैक्टिव/सेमी/बैच में ट्रियाज करें।
  3. एक उपयोगकर्ता शिकायत करता है कि उनकी रिपोर्ट में 3 घंटे लगे। क्या यह एक बैच गलत ट्रीगेज था या एक वैध इंटरैक्टिव? निर्णय मानदंड लिखें।
  4. आपके बैच एपीआई रिटर्न एसएलए 24h है लेकिन पी 99 20 घंटे है. आप इसे उपयोगकर्ता को कैसे संचारित करते हैं किनारे मामले पर डाउनस्ट्रीम सिस्टम व्यवहार क्या है?
  5. गणना ब्रेक-ईवेंसः अपने स्वयं के आरक्षित GPU पर रातोंरात चलने की तुलना में बैच + कैश कितना कम लागत में होता है?

प्रमुख शर्तें

TermWhat people sayWhat it actually means
Batch API"async discount"50% off with 24h turnaround
JSONL"batch format"One JSON request per line; OpenAI/Anthropic standard
Message Batches"Anthropic batch"Anthropic's batch API product name
Batch prediction"Vertex batch"Vertex AI's batch API product
Turnaround SLA"24h promise"Guarantee, not typical; typical is 2-6h
Workload triage"interactivity decision"Interactive / semi / batch routing decision
Output schema"response format"Per-provider JSONL layout; not portable
Stacked discount"batch + cache"~10% of uncached sync bill when both apply

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.