Phase 17: Infrastructure & Production

त्वरित कैशिंग और अर्थिक कैशिंग अर्थशास्त्र

Pricing snapshot dated 2026-04.नीचे दिए गए संख्यात्मक दावे इस पाठ के प्रकाशन में कैप्चर किए गए विक्रेता दर कार्ड को दर्शाते हैं; नीचे दिए गए लिंक किए गए डॉक्स के साथ सत्यापित करें।

कैशिंग दो परतों पर होती है। L2 (प्रोवाइडर-लेवल) प्रॉम्प्ट/प्रिफिक्स कैशिंग दोहराए गए प्रीफिक्स के लिए ध्यान KV का उपयोग करता है एंथ्रोपिक के प्रॉम्प्ट-कैशिंग डॉक्स में 90% तक लागत में कमी और लंबे प्रॉम्प्ट पर 85% देरी में कमी का विज्ञापन होता है; क्लाउड 3.5 सोनेट कैश रीड्स के लिए $0.30/M vs $3.00/M ताजा 5 मिनट के TTL और 1 घंटे के TTL विकल्प के लिए 2x लेखन प्रीमियम के साथ (docs.anthropic.com, 2026-04) । ओपनएआई प्रॉम्प्ट कैशिंग स्वचालित रूप से प्रॉम्प्ट ≥1024 टोकन और कीमतों के लिए लागू होता है कैश इनपुट लगभग 90% छूट बनाम ताजा (platform.openai.com, 2026-04); प्रति मॉडल सटीक कैश दर लाइव रेट कार्ड पर निर्भर करती है। L1 (ऐप-स्तर) सेमँटिक कैशिंग LLM को पूरी तरह से समानता हिट को एम्बेड करने पर छोड़ देता है। विक्रेता "95% सटीकता" से मेल खाने की सटीकता, हिट दर नहीं रिपोर्ट किए गए उत्पादन हिट दर 10% (खुले चैट) से 70% (संरचित FAQ) तक है; कोई भी प्रदाता आधिकारिक आधारलाइन प्रकाशित नहीं करता है, इसलिए इन्हें सामुदायिक टेलीमेट्री के रूप में व्यवहार करें न कि गारंटी। उत्पादन की बाधाएंः समानांतर कैशिंग को मारता है (पहली कैश लेखन से पहले जारी किए गए N समानांतर अनुरोध खर्च को कई गुना बढ़ा सकते हैं), और पूर्वावलोकन के अंदर गतिशील सामग्री पूरी तरह से कैश हिट को रोकती है। प्रोजेक्टडिस्कवरी ने कैश करने योग्य पूर्वावधान से गतिशील पाठ को स्थानांतरित करके 7% से 74% हिट दर (2025-11) तक बढ़ने की सूचना दी।

Type: Learn

Languages: Python (stdlib, toy two-layer cache simulator)

Prerequisites: Phase 17 · 04 (Serving Engine Internals), Phase 17 · 06 (SGLang RadixAttention)

Time: ~60 minutes

सीखने के लक्ष्य

  • L2 प्रॉम्प्ट/प्रिफिक्स कैशिंग (प्रदाता पर KV पुनः उपयोग) को L1 सेमेन्टिक कैशिंग (LLLM बायपास पर समान प्रॉम्प्ट) से अलग करें।
  • मानव विज्ञान की व्याख्या करें cache_controlस्पष्ट मार्किंग और दो TTL विकल्प (5 मिनट बनाम 1 घंटे) उनके मूल्य गुणक के साथ।
  • हिट रेट, प्रॉम्प्ट/रेस्पॉन्स मिक्स और टोकन कीमतों के आधार पर अपेक्षित मासिक बचत की गणना करें।
  • समानांतर प्रतिरूप का नाम दें जो बिलों को 5-10 गुना तक बढ़ाता है और गतिशील सामग्री प्रतिरूप जो हिट दर को ढहता है।

समस्या

आप अपनी RAG सेवा में शीघ्र कैशिंग जोड़ते हैं। बिल फ्लैट रहता है। आप हिट दर को मापते हैं; यह 7% है। आपके प्रमाणीकरण स्थिर दिखते हैं लेकिन वे नहीं हैं सिस्टम प्रमाणीकरण में वर्तमान तिथि शामिल है जो मिनट में स्वरूपित है, एक अनुरोध आईडी, और विविधता के लिए एक यादृच्छिक उदाहरण रीऑर्डर। प्रत्येक अनुरोध एक नया कैश प्रविष्टि लिखता है, शून्य पढ़ता है।

अलग से, आपका एजेंट प्रति उपयोगकर्ता प्रश्न दस समानांतर उपकरण कॉल चलाता है। सभी दस पहले कैश लिख पूरा होने से पहले प्रदाता पर पहुंचते हैं। दस लिखता है, शून्य पढ़ता है। आपका बिल 5-10 गुना है "कैशिंग के साथ" लागत होने वाली थी।

कैशिंग एक प्रोटोकॉल है, एक ध्वज नहीं दो परतें, दो अलग-अलग विफलता मोड।

अवधारणा

L2 प्रदाता प्रोम्प्ट/प्रिफिक्स कैशिंग

प्रदाता एक कैश करने योग्य पूर्वावलोकन के लिए ध्यान KV को संग्रहीत करता है और अगले अनुरोध पर इसका पुनः उपयोग करता है जो पूर्वावलोकन से मेल खाता है। आप एक बार लिखने की लागत का भुगतान करते हैं, लगभग मुफ्त पढ़ता है।

Anthropic (Claude 3.5 / 3.7 / 4 series): स्पष्ट cache_controlअनुरोध में मार्कर. आप टैग कर रहे हैं कि कौन से ब्लॉक कैश करने योग्य हैं. TTL: 5 मिनट (लेखन लागत 1.25x आधार) या 1 घंटे (लेखन लागत 2x आधार) । कैश पढ़ता हैः $0.30/M on Claude 3.5 Sonnet vs $3.00/M ताजा 10 गुना सस्ता (docs.anthropic.com, 2026-04) । कीमतें प्रति मॉडल भिन्न होती हैं (Opus/Haiku अलग से प्रकाशित); हमेशा लाइव मूल्य निर्धारण पृष्ठ को क्रॉस-चेक करें।

OpenAI: संकेतों के लिए स्वचालित कैशिंग ≥1024 टोकन (platform.openai.com, 2026-04). कोई स्पष्ट ध्वज नहीं। कैश इनपुट वर्तमान gpt-4o/gpt-5 दर कार्ड पर ताजा की तुलना में लगभग 10 गुना सस्ता है। न तो डॉक्स और न ही रिलीज नोट आधिकारिक हिट-रेट बेसलाइन प्रकाशित करते हैं; सावधानीपूर्वक शीघ्र डिजाइन के साथ सामुदायिक रिपोर्टों का लगभग 3060% समूह। मॉनिटर usage.cached_tokensअपने आप को मापने के लिए।

Google (Gemini): स्पष्ट एपीआई के माध्यम से संदर्भ कैशिंग; 1M-टोकन संदर्भ का मतलब है कैशिंग और भी अधिक भुगतान करता है।

Self-hosted (vLLM, SGLang): चरण 17 · 06 में अपने स्वयं के कम्प्यूटेशन पर RadixAttention समान पैटर्न शामिल है।

L1 ऐप-स्तर की सेमेटिक कैशिंग

LLM को कॉल करने से पहले, प्रॉम्प्ट को हैश करें, इसे एम्बेड करें, और एक समान कैश अनुरोध (छोटी सीमा से ऊपर, आमतौर पर 0.95+) की तलाश करें। हिट पर, कैश प्रतिक्रिया लौटाएं। मिस पर, LLM को कॉल करें और परिणाम कैश करें।

ओपन सोर्सः रेडिस वेक्टर सादृश्यता, GPTCache, Qdrant. वाणिज्यिकः पोर्टकी कैश, हेलिकोन कैश।

विक्रेता सटीकता दावों से संदर्भित किया जाता है कि कितनी बार लौटाया गया कैश प्रतिक्रिया अर्थिक रूप से उपयुक्त थी न कि कितनी बार आप हिट करते हैं। उत्पादन हिट दरेंः

  • खुली चैटः 10-15%.
  • संरचित FAQ/सहायताः 40-70%.
  • कोड प्रश्नः 20-30% (छोटे संस्करण हिट को मारते हैं) ।
  • आवाज एजेंट दोहराव संकेतः 50-80% (ध्वनि सामान्यीकरण फिक्स्ड सेट) ।

समानांतरता विरोधी पैटर्न

आपके एजेंट 10 टूल कॉल समानांतर करते हैं। सभी 10 में एक ही 4K-टोकन सिस्टम प्रॉम्प्ट होता है। मानव कैश लिखता है प्रति अनुरोध; पहले कैश-लेखन प्रदाता प्रॉम्प्ट देखने के बाद लगभग 300 एमएस पूरा होता है। 2-10 अनुरोध एक ही मिलीसेकंड विंडो में आते हैं और प्रत्येक कैश मिस होता है। आप 10 लिखने प्रीमियम, 0 पढ़ने की छूट का भुगतान करते हैं।

फिक्सः क्रमशः पहले के साथ बैच केवल 1 का अनुरोध करें, फिर 1 के कैश भरने के बाद 2-10 को निष्पादित करें। पहले टूल कॉल में 300 ms जोड़ता है; बिल को 5-10 गुना बचाता है।

गतिशील सामग्री विरोधी पैटर्न

आपका सिस्टम संकेत इस तरह दिखता हैः

You are a helpful assistant. The current time is 14:32:17.
User ID: abc123. Today is Tuesday...

हर अनुरोध अद्वितीय है, हर अनुरोध लिखता है, शून्य हिट.

फिक्सः वास्तव में स्थिर सब कुछ कैश करने योग्य पूर्वावलोकन में ले जाएं; कैश सीमा के बाद गतिशील सामग्री जोड़ेंः

[cacheable]
You are a helpful assistant. [rules, examples, instructions]
[/cacheable]
[dynamic, not cached]
Current time: 14:32:17. User: abc123.

प्रोजेक्टडिस्कवरी इस तरह 7% से 74% कैश हिट दर पर चला गया और एनाटॉमी प्रकाशित की।

रात भर के काम के भार के लिए स्टैक बैच + कैश

बैच एपीआई (चरण 17 · 15) 24 घंटे के टर्नअराउंड पर 50% छूट देते हैं। शीर्ष पर कैश इनपुट आपको ~ 10 गुना ऊपर मिलता है। ओवरनाइट वर्गीकरण, लेबलिंग और रिपोर्ट जनरेशन वर्कलोड स्टैकिंग द्वारा सिंक्रोनस-अनचेचेड लागत के ~ 10% तक गिर सकते हैं।

संख्याओं को याद रखना चाहिए

मूल्य निर्धारण बिंदुओं को लिंक किए गए विक्रेता दस्तावेजों से 2026-04 में कैप्चर किया जाता है और उन पर निर्भर होने से पहले हर कुछ महीनों में फिर से जांच की जाती है।

  • मानव कैश रीडः क्लाउड 3.5 सोनट पर $0.30/M, ताजा इनपुट की तुलना में लगभग 10 गुना सस्ता (docs.anthropic.com) ।
  • मानव कैश लेखन प्रीमियमः 1.25x (5 मिनट TTL) या 2x (1 घंटे TTL) ।
  • ओपनएआई ऑटो कैशः प्रॉम्प्ट्स ≥1024 टोकन पर लागू होता है; कैश इनपुट की कीमत वर्तमान दर कार्ड पर ताजा इनपुट के लगभग 10% पर है (platform.openai.com).
  • अर्थपूर्ण कैश हिट दर (सामुदायिक रिपोर्ट): ~ 10% खुला चैट; ~ 70% संरचित FAQ तक। कोई विक्रेता-दस्तावेज आधार नहीं।
  • प्रोजेक्टडिस्कवरीः 7% → 74% हिट दर पूर्वनिर्धारित से गतिशीलता को हटाने से (प्रोजेक्ट ब्लॉग, 2025-11) ।
  • समानांतर प्रतिरूपः 510x बिल मुद्रास्फीति की विशिष्ट रिपोर्टें जब N समानांतर अनुरोध पहले कैश लिखते हैं।

इसका प्रयोग करें

code/main.pyमिश्रित कार्यभार पर L1 + L2 कैशिंग का अनुकरण करता है। रिपोर्ट दरों, बिल, और समानांतर दंड दिखाता है।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-cache-auditor.md. शीघ्र टेम्पलेट और ट्रैफ़िक को देखते हुए, कैशेबिलिटी का ऑडिट करता है और पुनर्गठन की सिफारिश करता है।

व्यायाम

  1. दौड़ेंcode/main.py. समानांतर ध्वज को स्विच करें. बिल कितना बदलता है?
  2. आपके सिस्टम प्रॉम्प्ट में एक तारीख है इसे बाहर निकालें इससे पहले / बाद में हिट दर गणित दिखाएं।
  3. आपके अनुरोध की आगमन दर को देखते हुए 1 घंटे के TTL (2x लिखें) बनाम 5 मिनट के TTL (1.25x लिखें) के लिए ब्रेक-ईवन की गणना करें।
  4. 0.95 की सीमा पर अर्थिक कैश 20% तक पहुंचता है। 0.85 पर यह 50% तक पहुंचता है लेकिन आप गलत कैश किए गए उत्तर देखते हैं। सही सीमा चुनें और सही तर्क दें।
  5. आप प्रति उपयोगकर्ता प्रश्न 10 समानांतर उप-प्रश्न बैच. अंत-से-अंत विलंबता जोड़ने के बिना कैश-अनुकूलता के लिए फिर से लिखें.

प्रमुख शर्तें

TermWhat people sayWhat it actually means
L2 prompt cache"prefix cache"Provider stores KV for repeated prefix
cache_control"Anthropic cache marker"Explicit attribute marking cacheable blocks
Cache write premium"write tax"Extra cost for first miss-to-cache (1.25x or 2x)
L1 semantic cache"embedding cache"App-level hash-and-embed before calling LLM
GPTCache"LLM caching lib"Popular OSS L1 cache library
Cache hit rate"hits / total"Fraction of requests served from cache
Parallelization anti-pattern"the N-write trap"N parallel requests miss cache N times
Dynamic content trap"the time-in-prompt trap"Dynamic bytes in prefix kill hit rate
RadixAttention"intra-replica cache"SGLang's prefix-cache implementation

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.