बैच एपीआई उद्योग मानक के रूप में 50% छूट
Type: Learn
Languages: Python (stdlib, toy batch-vs-sync cost simulator)
Prerequisites: Phase 17 · 14 (Prompt & Semantic Caching)
Time: ~45 minutes
सीखने के लक्ष्य
- तीन प्रदाता बैच एपीआई (ओपनएआई, एंथ्रोपिक, गूगल) और सामान्य 50% छूट + 24 घंटे की टर्नअराउंड गारंटी का नाम दें।
- रात भर वर्गीकरण कार्यभार पर बैच स्टैपिंग + कैश इनपुट की लागत की गणना करें और सिंक्रोनस-अनकैश बेसलाइन की तुलना करें।
- कार्यभार को इंटरैक्टिव/अर्ध-इंटरैक्टिव/बैच में क्रमबद्ध करें और लेन को सही ठहराएं।
- दो जाल का नाम देंः आंशिक अन्तरक्रियाशीलता (उपयोगकर्ता 24 घंटे से अधिक तेजी से उम्मीद करता है) और आउटपुट-स्केम बहाव (बैच फ़ाइल प्रारूप प्रत्येक प्रदाता के अनुसार भिन्न होता है) ।
समस्या
आपकी टीम एक रात में रिपोर्ट उत्पन्न करने की पाइपलाइन भेजती है 50,000 दस्तावेज, प्रत्येक का सारांश, संक्षेप को समूहीकृत करना, एक कार्यकारी संक्षिप्त पत्र तैयार करना. समवर्ती रूप से चलना $2,000 / रात पर 4 घंटे लेता है। आप बैच एपीआई के बारे में सुनते हैं।
बैच आपको 50% छूट देता है. आप सिस्टम प्रॉम्प्ट पर भी त्वरित कैशिंग सक्षम करते हैं (सभी 50k कॉल पर साझा किया जाता है) । ढेर में, बिल मूल लाइन के $ 180 / रात ~ 9% तक गिर जाता है। एक ही पाइपलाइन, तीन कॉन्फ़िग परिवर्तन।
बैच LLM लागत उपकरण में सबसे सस्ता लीवर है कि कोई भी खींचता है। कारण ज्यादातर संगठनात्मक हैः टीमों को लगता है "वास्तविक समय में" जब SLA वास्तव में है "सवेरे तक।" इस सबक के बारे में है तालिका पर बिल का 90% नहीं छोड़ने के बारे में है।
अवधारणा
तीन बैच एपीआई
OpenAI Batch API: अनुरोधों की सूची के साथ JSONL फ़ाइल अपलोड. 24 घंटे के टर्नअराउंड का वादा किया गया (आमतौर पर अभ्यास में ~ 2-8 घंटे) । इनपुट और आउटपुट टोकन पर 50% छूट। /v1/batchesकैश योग्य इनपुट भी कैश इनपुट मूल्य निर्धारण ऊपर मिलता है।
Anthropic Message Batches: JSONL अपलोड. 24 घंटे टर्नअराउंड. 50% छूट. समर्थन cache_control कैश लिखता है स्पष्ट हैं, पाठ बैच के भीतर स्वचालित रूप से होता है.
Google Vertex AI Batch Prediction: बिगक्वेरी या जीसीएस इनपुट. मिथुन के लिए समान 50% छूट. वर्टेक्स पाइपलाइन के साथ एकीकृत।
अर्थशास्त्रः असिनक्रोनस, धीमा नहीं
बैच "मैं 24 घंटे के भीतर वापस आने का वादा करता हूं" है नहीं "इसमें 24 घंटे लगेंगे।" सामान्य पी 50 2-6 घंटे है। प्रदाता पीक विंडो के दौरान आपके बैच को शेड्यूल करता है जब GPU इन्वेंट्री का उपयोग कम होता है।
कैशिंग के साथ ढेर
एक ही 4K टोकन प्रणाली के साथ 50k दस्तावेज सारांशः
- समवर्ती कैश न किया गयाः 50000 × ($input × 4000 + $पूर्ण दरों पर आउटपुट × 200) ।
- समवर्ती कैशः सिस्टम प्रॉम्प्ट को पहले लिखने के बाद कैश किया जाता है; शेष 49999 को 10 गुना सस्ता इनपुट मिलता है।
- बैच कैशः उपरोक्त सभी प्लस 50% छूट दोनों पढ़ने और लिखने पर।
स्टैकः बैच + कैश = ~ 10% सिंक्रनाइज़ किए गए कैश किए गए बिल का। किसी भी वर्कलोड जो रात भर चलता है और जिसमें साझा सिस्टम प्रॉम्प्ट है, को इस का उपयोग करना चाहिए।
कार्यभार का वर्गीकरण
Interactive उपयोगकर्ता प्रतिक्रिया का इंतजार कर रहा है. TTFT मायने रखता है. समकालिक कॉल के साथ त्वरित कैशिंग. बैच नहीं हो सकता.
Semi-interactive उपयोगकर्ता एक कार्य प्रस्तुत करता है, मिनटों में वापस जांचता है। बैच उपलब्ध नहीं है तो सिंक्रनाइज़ करने के लिए fallback के साथ असिनक्रनाइज़ कतार। मध्यम मात्रा RAG अनुक्रमणिका सोचें।
Batch उपयोगकर्ता परिणाम "सवेरे" या "अगले घंटे" तक उम्मीद करता है। सामग्री पाइपलाइन, पैमाने पर वर्गीकरण, ऑफ़लाइन विश्लेषण। हमेशा बैच, हमेशा स्टैक कैशिंग।
सामान्य त्रुटिः सब कुछ इंटरैक्टिव के रूप में वर्गीकृत करना क्योंकि पाइपलाइन उत्पादन है। उत्पादन एक विलंबता विनिर्देश नहीं है एसएलए है।
आंशिक-संक्रियता जाल
कुछ सुविधाएँ इंटरैक्टिव लगती हैं लेकिन 5-10 मिनट तक सहन करती हैं। उदाहरणः "फ्रेश" बटन के साथ एक रात की ग्राहक स्वास्थ्य रिपोर्ट। उपयोगकर्ता ताज़ा क्लिक करता है; प्रतीक्षा 10 मिनट ठीक है। टीम इसे समवर्ती के रूप में भेजती है। 50 समवर्ती ताज़ा होने की लागत 10 गुना है जो बैच-और-डिलीवर-इमेल द्वारा लागत होगी।
यदि उत्तर "वे नहीं देखेंगे" है तो इसे बैच करें।
आउटपुट-स्केम जाल
बैच फ़ाइल प्रारूप प्रदाता के अनुसार भिन्न होते हैंः
- JSONL, प्रति पंक्ति एक अनुरोध।
- मानवः JSONL, प्रति पंक्ति एक संदेश; उत्तर प्रारूप एम्बेड किया गया।
- वर्टेक्सः बिगक्वेरी तालिका या TFRecord के साथ GCS पूर्वावलोकन।
"एक बैच क्लाइंट" को विभिन्न प्रदाताओं में लिखना प्रत्येक प्रदाता के लिए एडाप्टर कोड का मतलब है। बहु-प्रदाता बैच (पोर्टकी, लाइटएलएम कुछ स्तरों) का विज्ञापन करने वाले गेटवे अभी भी कच्चे प्रारूप को पतला-पैक करते हैं।
संख्याओं को याद रखना चाहिए
- प्रदाताओं के बीच बैच छूटः 50% इनपुट + आउटपुट पर फ्लैट।
- टर्नअराउंड एसएलएः 24 घंटे गारंटी, 2-6 घंटे सामान्य P50.
- स्टैक बैच + कैश इनपुटः ~10% सिंक्रनाइज़ेड अनकैश लागत।
- कार्यभार क्रमबद्ध नियमः यदि 24 घंटे की विलंबता स्वीकार्य है, तो हमेशा बैच करें।
इसका प्रयोग करें
code/main.py50k दस्तावेज़ कार्यभार के लिए सिंक्रनाइज़ेशन, सिंक्रनाइज़ेशन + कैश, बैच और बैच + कैश पर लागत की गणना करता है। $ और प्रतिशत में बचत की रिपोर्ट करता है।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-batch-triager.md. कार्यभार की विशेषताओं को देखते हुए, इंटरैक्टिव/सेमी/बैच में वर्गीकृत किया जाता है और बचत का अनुमान लगाया जाता है।
व्यायाम
- दौड़ें
code/main.py. 3K- टोकन सिस्टम प्रॉम्प्ट और 500- टोकन आउटपुट के साथ 100k-doc पाइपलाइन के लिए, पूर्ण स्टैक (बैच + कैश) बनाम सिंक बेसलाइन की बचत की गणना करें। - एक वास्तविक उत्पाद में तीन विशेषताएं चुनें जिन्हें आप जानते हैं। प्रत्येक को इंटरैक्टिव/सेमी/बैच में ट्रियाज करें।
- एक उपयोगकर्ता शिकायत करता है कि उनकी रिपोर्ट में 3 घंटे लगे। क्या यह एक बैच गलत ट्रीगेज था या एक वैध इंटरैक्टिव? निर्णय मानदंड लिखें।
- आपके बैच एपीआई रिटर्न एसएलए 24h है लेकिन पी 99 20 घंटे है. आप इसे उपयोगकर्ता को कैसे संचारित करते हैं किनारे मामले पर डाउनस्ट्रीम सिस्टम व्यवहार क्या है?
- गणना ब्रेक-ईवेंसः अपने स्वयं के आरक्षित GPU पर रातोंरात चलने की तुलना में बैच + कैश कितना कम लागत में होता है?
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| Batch API | "async discount" | 50% off with 24h turnaround |
| JSONL | "batch format" | One JSON request per line; OpenAI/Anthropic standard |
| Message Batches | "Anthropic batch" | Anthropic's batch API product name |
| Batch prediction | "Vertex batch" | Vertex AI's batch API product |
| Turnaround SLA | "24h promise" | Guarantee, not typical; typical is 2-6h |
| Workload triage | "interactivity decision" | Interactive / semi / batch routing decision |
| Output schema | "response format" | Per-provider JSONL layout; not portable |
| Stacked discount | "batch + cache" | ~10% of uncached sync bill when both apply |
आगे पढ़ना
- OpenAI Batch API JSONL प्रारूप और
/v1/batchesअर्थशास्त्र। - Anthropic Message Batches बैच प्रारूप और
cache_controlबातचीत। - Vertex AI Batch Prediction मिथुन बैच अर्थशास्त्र।
- Finout — OpenAI vs Anthropic API Pricing 2026
- Zen Van Riel — LLM API Cost Comparison 2026
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.