त्वरित कैशिंग और अर्थिक कैशिंग अर्थशास्त्र
कैशिंग दो परतों पर होती है। L2 (प्रोवाइडर-लेवल) प्रॉम्प्ट/प्रिफिक्स कैशिंग दोहराए गए प्रीफिक्स के लिए ध्यान KV का उपयोग करता है एंथ्रोपिक के प्रॉम्प्ट-कैशिंग डॉक्स में 90% तक लागत में कमी और लंबे प्रॉम्प्ट पर 85% देरी में कमी का विज्ञापन होता है; क्लाउड 3.5 सोनेट कैश रीड्स के लिए $0.30/M vs $3.00/M ताजा 5 मिनट के TTL और 1 घंटे के TTL विकल्प के लिए 2x लेखन प्रीमियम के साथ (docs.anthropic.com, 2026-04) । ओपनएआई प्रॉम्प्ट कैशिंग स्वचालित रूप से प्रॉम्प्ट ≥1024 टोकन और कीमतों के लिए लागू होता है कैश इनपुट लगभग 90% छूट बनाम ताजा (platform.openai.com, 2026-04); प्रति मॉडल सटीक कैश दर लाइव रेट कार्ड पर निर्भर करती है। L1 (ऐप-स्तर) सेमँटिक कैशिंग LLM को पूरी तरह से समानता हिट को एम्बेड करने पर छोड़ देता है। विक्रेता "95% सटीकता" से मेल खाने की सटीकता, हिट दर नहीं रिपोर्ट किए गए उत्पादन हिट दर 10% (खुले चैट) से 70% (संरचित FAQ) तक है; कोई भी प्रदाता आधिकारिक आधारलाइन प्रकाशित नहीं करता है, इसलिए इन्हें सामुदायिक टेलीमेट्री के रूप में व्यवहार करें न कि गारंटी। उत्पादन की बाधाएंः समानांतर कैशिंग को मारता है (पहली कैश लेखन से पहले जारी किए गए N समानांतर अनुरोध खर्च को कई गुना बढ़ा सकते हैं), और पूर्वावलोकन के अंदर गतिशील सामग्री पूरी तरह से कैश हिट को रोकती है। प्रोजेक्टडिस्कवरी ने कैश करने योग्य पूर्वावधान से गतिशील पाठ को स्थानांतरित करके 7% से 74% हिट दर (2025-11) तक बढ़ने की सूचना दी।
Type: Learn
Languages: Python (stdlib, toy two-layer cache simulator)
Prerequisites: Phase 17 · 04 (Serving Engine Internals), Phase 17 · 06 (SGLang RadixAttention)
Time: ~60 minutes
सीखने के लक्ष्य
- L2 प्रॉम्प्ट/प्रिफिक्स कैशिंग (प्रदाता पर KV पुनः उपयोग) को L1 सेमेन्टिक कैशिंग (LLLM बायपास पर समान प्रॉम्प्ट) से अलग करें।
- मानव विज्ञान की व्याख्या करें
cache_controlस्पष्ट मार्किंग और दो TTL विकल्प (5 मिनट बनाम 1 घंटे) उनके मूल्य गुणक के साथ। - हिट रेट, प्रॉम्प्ट/रेस्पॉन्स मिक्स और टोकन कीमतों के आधार पर अपेक्षित मासिक बचत की गणना करें।
- समानांतर प्रतिरूप का नाम दें जो बिलों को 5-10 गुना तक बढ़ाता है और गतिशील सामग्री प्रतिरूप जो हिट दर को ढहता है।
समस्या
आप अपनी RAG सेवा में शीघ्र कैशिंग जोड़ते हैं। बिल फ्लैट रहता है। आप हिट दर को मापते हैं; यह 7% है। आपके प्रमाणीकरण स्थिर दिखते हैं लेकिन वे नहीं हैं सिस्टम प्रमाणीकरण में वर्तमान तिथि शामिल है जो मिनट में स्वरूपित है, एक अनुरोध आईडी, और विविधता के लिए एक यादृच्छिक उदाहरण रीऑर्डर। प्रत्येक अनुरोध एक नया कैश प्रविष्टि लिखता है, शून्य पढ़ता है।
अलग से, आपका एजेंट प्रति उपयोगकर्ता प्रश्न दस समानांतर उपकरण कॉल चलाता है। सभी दस पहले कैश लिख पूरा होने से पहले प्रदाता पर पहुंचते हैं। दस लिखता है, शून्य पढ़ता है। आपका बिल 5-10 गुना है "कैशिंग के साथ" लागत होने वाली थी।
कैशिंग एक प्रोटोकॉल है, एक ध्वज नहीं दो परतें, दो अलग-अलग विफलता मोड।
अवधारणा
L2 प्रदाता प्रोम्प्ट/प्रिफिक्स कैशिंग
प्रदाता एक कैश करने योग्य पूर्वावलोकन के लिए ध्यान KV को संग्रहीत करता है और अगले अनुरोध पर इसका पुनः उपयोग करता है जो पूर्वावलोकन से मेल खाता है। आप एक बार लिखने की लागत का भुगतान करते हैं, लगभग मुफ्त पढ़ता है।
Anthropic (Claude 3.5 / 3.7 / 4 series): स्पष्ट cache_controlअनुरोध में मार्कर. आप टैग कर रहे हैं कि कौन से ब्लॉक कैश करने योग्य हैं. TTL: 5 मिनट (लेखन लागत 1.25x आधार) या 1 घंटे (लेखन लागत 2x आधार) । कैश पढ़ता हैः $0.30/M on Claude 3.5 Sonnet vs $3.00/M ताजा 10 गुना सस्ता (docs.anthropic.com, 2026-04) । कीमतें प्रति मॉडल भिन्न होती हैं (Opus/Haiku अलग से प्रकाशित); हमेशा लाइव मूल्य निर्धारण पृष्ठ को क्रॉस-चेक करें।
OpenAI: संकेतों के लिए स्वचालित कैशिंग ≥1024 टोकन (platform.openai.com, 2026-04). कोई स्पष्ट ध्वज नहीं। कैश इनपुट वर्तमान gpt-4o/gpt-5 दर कार्ड पर ताजा की तुलना में लगभग 10 गुना सस्ता है। न तो डॉक्स और न ही रिलीज नोट आधिकारिक हिट-रेट बेसलाइन प्रकाशित करते हैं; सावधानीपूर्वक शीघ्र डिजाइन के साथ सामुदायिक रिपोर्टों का लगभग 3060% समूह। मॉनिटर usage.cached_tokensअपने आप को मापने के लिए।
Google (Gemini): स्पष्ट एपीआई के माध्यम से संदर्भ कैशिंग; 1M-टोकन संदर्भ का मतलब है कैशिंग और भी अधिक भुगतान करता है।
Self-hosted (vLLM, SGLang): चरण 17 · 06 में अपने स्वयं के कम्प्यूटेशन पर RadixAttention समान पैटर्न शामिल है।
L1 ऐप-स्तर की सेमेटिक कैशिंग
LLM को कॉल करने से पहले, प्रॉम्प्ट को हैश करें, इसे एम्बेड करें, और एक समान कैश अनुरोध (छोटी सीमा से ऊपर, आमतौर पर 0.95+) की तलाश करें। हिट पर, कैश प्रतिक्रिया लौटाएं। मिस पर, LLM को कॉल करें और परिणाम कैश करें।
ओपन सोर्सः रेडिस वेक्टर सादृश्यता, GPTCache, Qdrant. वाणिज्यिकः पोर्टकी कैश, हेलिकोन कैश।
विक्रेता सटीकता दावों से संदर्भित किया जाता है कि कितनी बार लौटाया गया कैश प्रतिक्रिया अर्थिक रूप से उपयुक्त थी न कि कितनी बार आप हिट करते हैं। उत्पादन हिट दरेंः
- खुली चैटः 10-15%.
- संरचित FAQ/सहायताः 40-70%.
- कोड प्रश्नः 20-30% (छोटे संस्करण हिट को मारते हैं) ।
- आवाज एजेंट दोहराव संकेतः 50-80% (ध्वनि सामान्यीकरण फिक्स्ड सेट) ।
समानांतरता विरोधी पैटर्न
आपके एजेंट 10 टूल कॉल समानांतर करते हैं। सभी 10 में एक ही 4K-टोकन सिस्टम प्रॉम्प्ट होता है। मानव कैश लिखता है प्रति अनुरोध; पहले कैश-लेखन प्रदाता प्रॉम्प्ट देखने के बाद लगभग 300 एमएस पूरा होता है। 2-10 अनुरोध एक ही मिलीसेकंड विंडो में आते हैं और प्रत्येक कैश मिस होता है। आप 10 लिखने प्रीमियम, 0 पढ़ने की छूट का भुगतान करते हैं।
फिक्सः क्रमशः पहले के साथ बैच केवल 1 का अनुरोध करें, फिर 1 के कैश भरने के बाद 2-10 को निष्पादित करें। पहले टूल कॉल में 300 ms जोड़ता है; बिल को 5-10 गुना बचाता है।
गतिशील सामग्री विरोधी पैटर्न
आपका सिस्टम संकेत इस तरह दिखता हैः
You are a helpful assistant. The current time is 14:32:17.
User ID: abc123. Today is Tuesday...हर अनुरोध अद्वितीय है, हर अनुरोध लिखता है, शून्य हिट.
फिक्सः वास्तव में स्थिर सब कुछ कैश करने योग्य पूर्वावलोकन में ले जाएं; कैश सीमा के बाद गतिशील सामग्री जोड़ेंः
[cacheable]
You are a helpful assistant. [rules, examples, instructions]
[/cacheable]
[dynamic, not cached]
Current time: 14:32:17. User: abc123.प्रोजेक्टडिस्कवरी इस तरह 7% से 74% कैश हिट दर पर चला गया और एनाटॉमी प्रकाशित की।
रात भर के काम के भार के लिए स्टैक बैच + कैश
बैच एपीआई (चरण 17 · 15) 24 घंटे के टर्नअराउंड पर 50% छूट देते हैं। शीर्ष पर कैश इनपुट आपको ~ 10 गुना ऊपर मिलता है। ओवरनाइट वर्गीकरण, लेबलिंग और रिपोर्ट जनरेशन वर्कलोड स्टैकिंग द्वारा सिंक्रोनस-अनचेचेड लागत के ~ 10% तक गिर सकते हैं।
संख्याओं को याद रखना चाहिए
मूल्य निर्धारण बिंदुओं को लिंक किए गए विक्रेता दस्तावेजों से 2026-04 में कैप्चर किया जाता है और उन पर निर्भर होने से पहले हर कुछ महीनों में फिर से जांच की जाती है।
- मानव कैश रीडः क्लाउड 3.5 सोनट पर $0.30/M, ताजा इनपुट की तुलना में लगभग 10 गुना सस्ता (docs.anthropic.com) ।
- मानव कैश लेखन प्रीमियमः 1.25x (5 मिनट TTL) या 2x (1 घंटे TTL) ।
- ओपनएआई ऑटो कैशः प्रॉम्प्ट्स ≥1024 टोकन पर लागू होता है; कैश इनपुट की कीमत वर्तमान दर कार्ड पर ताजा इनपुट के लगभग 10% पर है (platform.openai.com).
- अर्थपूर्ण कैश हिट दर (सामुदायिक रिपोर्ट): ~ 10% खुला चैट; ~ 70% संरचित FAQ तक। कोई विक्रेता-दस्तावेज आधार नहीं।
- प्रोजेक्टडिस्कवरीः 7% → 74% हिट दर पूर्वनिर्धारित से गतिशीलता को हटाने से (प्रोजेक्ट ब्लॉग, 2025-11) ।
- समानांतर प्रतिरूपः 510x बिल मुद्रास्फीति की विशिष्ट रिपोर्टें जब N समानांतर अनुरोध पहले कैश लिखते हैं।
इसका प्रयोग करें
code/main.pyमिश्रित कार्यभार पर L1 + L2 कैशिंग का अनुकरण करता है। रिपोर्ट दरों, बिल, और समानांतर दंड दिखाता है।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-cache-auditor.md. शीघ्र टेम्पलेट और ट्रैफ़िक को देखते हुए, कैशेबिलिटी का ऑडिट करता है और पुनर्गठन की सिफारिश करता है।
व्यायाम
- दौड़ें
code/main.py. समानांतर ध्वज को स्विच करें. बिल कितना बदलता है? - आपके सिस्टम प्रॉम्प्ट में एक तारीख है इसे बाहर निकालें इससे पहले / बाद में हिट दर गणित दिखाएं।
- आपके अनुरोध की आगमन दर को देखते हुए 1 घंटे के TTL (2x लिखें) बनाम 5 मिनट के TTL (1.25x लिखें) के लिए ब्रेक-ईवन की गणना करें।
- 0.95 की सीमा पर अर्थिक कैश 20% तक पहुंचता है। 0.85 पर यह 50% तक पहुंचता है लेकिन आप गलत कैश किए गए उत्तर देखते हैं। सही सीमा चुनें और सही तर्क दें।
- आप प्रति उपयोगकर्ता प्रश्न 10 समानांतर उप-प्रश्न बैच. अंत-से-अंत विलंबता जोड़ने के बिना कैश-अनुकूलता के लिए फिर से लिखें.
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| L2 prompt cache | "prefix cache" | Provider stores KV for repeated prefix |
cache_control | "Anthropic cache marker" | Explicit attribute marking cacheable blocks |
| Cache write premium | "write tax" | Extra cost for first miss-to-cache (1.25x or 2x) |
| L1 semantic cache | "embedding cache" | App-level hash-and-embed before calling LLM |
| GPTCache | "LLM caching lib" | Popular OSS L1 cache library |
| Cache hit rate | "hits / total" | Fraction of requests served from cache |
| Parallelization anti-pattern | "the N-write trap" | N parallel requests miss cache N times |
| Dynamic content trap | "the time-in-prompt trap" | Dynamic bytes in prefix kill hit rate |
| RadixAttention | "intra-replica cache" | SGLang's prefix-cache implementation |
आगे पढ़ना
- Anthropic Prompt Caching आधिकारिक
cache_controlअर्थशास्त्र और टीटीएल। - OpenAI Prompt Caching स्वचालित कैशिंग व्यवहार और पात्रता।
- TianPan — Semantic Caching for LLMs Production
- ProjectDiscovery — Cut LLM Costs 59% With Prompt Caching
- DigitalOcean / Anthropic — Prompt Caching
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.