التخزين السريع و الاقتصاد التخزين المفروض
يحدث التخزين في طبقتين. L2 (على مستوى المقدم) التخزين المطلوب / المقبلات التخزين يستخدم مرة أخرى الاهتمام KV للمقبلات المتكررة وثائق التخزين المطلوب من انتروبيك الإعلانات تخفيض التكلفة بما يصل إلى 90% وخفض التأخير بنسبة 85% على الطلبات الطويلة ؛ لكلود 3.5 Sonnet قراءات التخزين هي $0.30/M vs $3.00/م طازجة مع 5 دقائق TTL و 2x إعلان الكتابة لخيار 1 ساعة TTL (docs.anthropic.com، 2026-04). يتم تطبيق تخزين الاستعلامات المحفظية على الفور في OpenAI تلقائيًا لـ 1024 رمزًا أو أكثر وتسعيرات المدخل المحفظة المحفظة عند خصم تقريبًا 90٪ مقابل طازجة (platform.openai.com ، 2026-04) ؛ يعتمد معدل المحفظة المحفظة الدقيقة لكل نموذج على بطاقة معدل الحية. L1 (مستوى التطبيق) التخزين الاحتياطي الترجموي يفرغ LLM بالكامل على دمج ضربات التشابه. المورد "95% دقة" يشير إلى التطابق الصحيح، وليس معدل النتائج تقرير أسعار النتائج الإنتاجية تتراوح من 10% (الرداد المفتوح) إلى 70% (المراجع المتعلقة بالشكل المهيكلي). لا أحد من المقدمين ينشر خط أساس رسمي، لذلك تعامل هذه كمجموعة التلفاز بدلاً من ضمانات. مشاكل الإنتاج: يقتل التوازي الاحتفاظ بالتخزين (يمكن لطلبات متوازية N التي تم إصدارها قبل كتابة الاحتفاظ الأول أن تتضخم الإنفاق عدة مرات) ، والمحتوى الديناميكي داخل المسبق يمنع ضربات الاحتفاظ بالتخزين بالكامل. أبلغ ProjectDiscovery عن الانتقال من 7% إلى 74% من معدل الوصول (2025-11) عن طريق نقل النص الديناميكي من المقبلة القابلة للتخفيض.
Type: Learn
Languages: Python (stdlib, toy two-layer cache simulator)
Prerequisites: Phase 17 · 04 (Serving Engine Internals), Phase 17 · 06 (SGLang RadixAttention)
Time: ~60 minutes
أهداف التعلم
- التمييز بين الاحتفاظ بالاحتفاظ بالمقاومة L2 / الاحتفاظ بالمقاومة (استعمال KV عند المقدم) والاحتفاظ بالمقاومة الاحتفاظ بالمقاومة L1 (التغيب عن LLM عند الإتعامات المماثلة).
- اشرحوا أنثروبيك
cache_controlعلامة صريحة وخيارات TTL (خمس دقائق مقابل ساعة) مع مضاعفات أسعارها. - احسب المدخرات الشهرية المتوقعة بالنظر إلى معدل الإصابة، ومزيج الاستجابة / الاستجابة السريعة، وأسعار الرمز.
- أسمائ النمط المضاد للموازنة الذي يضخ الفواتير بنسبة 5-10x والنمط المضاد للمحتوى الديناميكي الذي ينهار معدل الضربة.
المشكلة
يمكنك إضافة الاحتفاظ بالخزينة السريعة إلى خدمة RAG الخاصة بك. يبقى الفاتورة ثابتة. تقوم قياس معدل النقاش؛ هو 7٪. تبدو الطلبات ثابتة ولكنها ليست يتضمن طلب النظام التاريخ الحالي الذي يتم تنسيقه إلى الدقيقة، و ID الطلب، وإعادة ترتيب مثال عشوائي للتنوع. كل طلب يكتب مدخلًا جديدًا في الاحتفاظ بالخزينة ، يقرأ صفر.
بشكل منفصل، يقوم وكيلك بتشغيل عشرة مكالمات أداة متوازية لكل سؤال للمستخدم. جميع العشرة تصل إلى المزود قبل اكتمال كتابة الاحتياطي الأول. عشر كتابات، صفر قراءة. فاتورتك 5-10x ما كان من المفترض أن يكلف "مع التخزين الآلي".
التخزين هو بروتوكول وليس علم، طبقتين، وضعين مختلفين للخلل.
المفهوم
L2 محفظة المحافظة على المقدم/المسجلات
المزود يخزن الاهتمام KV للاستعراض القابل للتخفيض ويعيد استخدامه في الطلب التالي الذي يطابق الإستعراض. تدفع تكلفة الكتابة مرة واحدة، تقرأ مجانا تقريبا.
Anthropic (Claude 3.5 / 3.7 / 4 series): صريح cache_controlعلامة في الطلب. يمكنك وضع علامة على الكتل التي يمكن تخزينها. TTL: 5 دقائق (تكلفة الكتابة 1.25x قاعدة) أو ساعة واحدة (تكلفة الكتابة 2x قاعدة).$0.30/M on Claude 3.5 Sonnet vs $3.00/م طازجة 10 مرات أرخص (docs.anthropic.com، اعتبارًا من 2026-2004). تختلف الأسعار لكل طراز (أوبوس/هايكو المنشورة بشكل منفصل).
OpenAI: التخزين الآلي لـ 1024 رمزًا (platform.openai.com، 2026-04). لا يوجد أي علم صريح. المدخل المتخزين هو أقل من 10 مرات تقريبًا من الأرخص على بطاقات معدلات gpt-4o / gpt-5 الحالية. لا توجد وثائق ولا ملاحظات الإفراج تنشر خطة أساسية رسمية لمعدل الوصول. تقارير المجتمع تشكيل حوالي 3060% مع تصميم سريع دقيق. مراقبة usage.cached_tokensلقياس الخاص بك.
Google (Gemini): الاحتفاظ بالسياق عبر API صريحة؛ 1M-token context يعني الاحتفاظ بالسياق يدفع أكثر.
Self-hosted (vLLM, SGLang): المرحلة 17 · 06 تغطي RadixAttention نفس النمط في الحساب الخاص بك.
L1 التخزين الاحتياطي الترقمي على مستوى التطبيق
قبل الاتصال بالماجستير في جميع الأحوال، قم بتشغيل المطلب، وضعه في التوابل، والبحث عن طلب مسجل مشابه (مثل التشابه على أعلى من العدالة، عادةً 0.95+). عند الضرب، أعيد الإجابة المسجلة في التوابل. عند التخطي، اتصل بالماجستير في التوابل والمسجل النتيجة.
المصدر المفتوح: شبيهة متجهات ريديس، GPTCache، Qdrant. التجارية: Portkey Cache، Helicone Cache.
تعني ادعاءات دقة البائع كمية المرات التي كان فيها الاستجابة المُخفية المُرجّعة مناسبة من الناحية الدّلّية وليس كمية المرات التي ضربتها. معدلات ضرب الإنتاج:
- -تحدث مفتوح: 10 إلى 15٪
- المراجع المشتركة / الدعم المهيكلة: 40-70%.
- أسئلة الرمز: 20-30% (الاختلافات الصغيرة تقتل النتائج).
- وكلاء الصوت يكررون الإشارات: 50-80% (تطبيع الصوت ثابت).
نمط مكافحة التوازي
يقوم وكيلك بعمل 10 مكالمات أداة بالتوازي. جميع 10 لديها نفس طلب نظام 4K-token. كتابات التخزين التخزينية الإنثروبية هي حسب الطلب. يتم كتابة التخزين التخزينية الأولى حوالي 300 ثانية بعد أن يرى المزود التخزين. تصل طلبات 2-10 في نفس نافذة ميل ثانية وكل منها يرى التخزين التخزينية. تدفع 10 قسطات الكتابة، 0 خصومات القراءة.
تصحيح: مجموعة مع التسلسل-أول إجراء طلب 1 وحده، ثم إطلاق 2-10 بمجرد أن يتم استئصال مخزن 1. يضيف 300 ms إلى أول مكالمة أداة؛ يوفّر 5-10x الفاتورة.
النمط المضاد للمحتوى الديناميكي
إن طلب نظامك يبدو مثل:
You are a helpful assistant. The current time is 14:32:17.
User ID: abc123. Today is Tuesday...كل طلب فريد كل طلب يكتب صفر ضربات
إصلاح: نقل كل شيء ثابت حقا إلى المقبلات القابلة للتخزين؛ إضافة محتوى ديناميكي بعد حدود التخزين:
[cacheable]
You are a helpful assistant. [rules, examples, instructions]
[/cacheable]
[dynamic, not cached]
Current time: 14:32:17. User: abc123.ProjectDiscovery انتقلت من 7% إلى 74% معدل ضربات التخزين بهذه الطريقة ونشرت التشريح.
مجموعة الكبيرة + الاحتفاظ بالخزنة لتحملات العمل الليلية
توفر APIs اللحظة (مرحلة 17 · 15) خصمًا بنسبة 50% عند التحول لمدة 24 ساعة. الإدخال المتخزين في الأعلى يحصل على ~ 10x على أعلى ذلك. يمكن أن تنخفض عبء العمل في التصنيف والتسمية وتوليد التقارير في الليل إلى ~ 10% من التكلفة غير المزمنة من خلال التجميع.
أرقام يجب أن تتذكر
يتم التقاط نقاط التسعير 2026-04 من وثائق البائعين المرتبطة وتحرك كل بضعة أشهر التحقق من جديد قبل الاعتماد عليها.
- القراءة المتخزنة للأنثروبية: 0.30 دولارًا / مليون على كلود 3.5 سونيت ، حوالي 10 مرات أرخص من المدخلات الجديدة (docs.anthropic.com).
- قسيمة كتابة التخزين التخزينية الأنثروبية: 1.25x (5-min TTL) أو 2x (1-hour TTL).
- الاحتفاظ الآلي OpenAI: ينطبق على الوصول ≥1024 رمز؛ المدخلات المحفظة سعر حوالي 10% من المدخلات الجديدة على بطاقات الأسعار الحالية (platform.openai.com).
- معدل ضربات التخزين التفسيري (مبلغ عن المجتمع): ~ 10% مفتوح الدردشة؛ يصل إلى ~ 70% من المراجع المتعلقة بالعمليات. ليس خط أساسي موثوق بالبائع.
- ProjectDiscovery: 7% → 74% معدل الاصابة عن طريق نقل الديناميكية من المسبق (مدونة المشروع، 2025-11).
- نمط مكافحة التوازي: تقارير نموذجية لضخم الفواتير 510x عندما تفوت طلبات متوازية N كتابة التخزين الأول.
استخدمها
code/main.pyيحاكي الاحتفاظ بالأموال المتبقية L1 + L2 على أحمال العمل المختلطة. التقارير تضرب الأسعار، الفاتورة، ويعرض عقوبة التوازي.
أرسله
هذا الدرس يُنتجoutputs/skill-cache-auditor.md. بالنظر إلى النموذج السريع والحركة المرورية، يقوم بإجراء مراجعات للاستحفاظ على الاحتياطي ويوصي بإعادة هيكلة.
التمارين
- أركض
code/main.py. إزيل علم التوازي كم تغير الفاتورة؟ - إن طلب النظام لديك تاريخ، إمضيه، أظهر قبل/بعد حسابات معدل الضرب
- احسب التوازن بين TTL لمدة ساعة واحدة (2x كتابة) مقابل TTL لمدة 5 دقائق (1.25x كتابة) بالنظر إلى معدل وصول طلبك.
- الاحتفاظ بالمتخزنة في 0.95 عند العدالة يصل إلى 20%. عند 0.85 يصل إلى 50% ولكنك ترى استجابات مخزنة غير صحيحة. اختر العدالة الصحيحة وتبرير.
- تقوم بتجميع 10 أسئلة متوازية لكل سؤال للمستخدم. إعادة كتابة لتوفير الاحتفاظ بالخزنة دون إضافة تأخير من نهاية إلى نهاية.
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| L2 prompt cache | "prefix cache" | Provider stores KV for repeated prefix |
cache_control | "Anthropic cache marker" | Explicit attribute marking cacheable blocks |
| Cache write premium | "write tax" | Extra cost for first miss-to-cache (1.25x or 2x) |
| L1 semantic cache | "embedding cache" | App-level hash-and-embed before calling LLM |
| GPTCache | "LLM caching lib" | Popular OSS L1 cache library |
| Cache hit rate | "hits / total" | Fraction of requests served from cache |
| Parallelization anti-pattern | "the N-write trap" | N parallel requests miss cache N times |
| Dynamic content trap | "the time-in-prompt trap" | Dynamic bytes in prefix kill hit rate |
| RadixAttention | "intra-replica cache" | SGLang's prefix-cache implementation |
المزيد من القراءة
- Anthropic Prompt Caching رسمي
cache_controlالإجراءات الدولية - OpenAI Prompt Cachingسلوك التخزين الآلي والقدرة على التأهل.
- TianPan — Semantic Caching for LLMs Production
- ProjectDiscovery — Cut LLM Costs 59% With Prompt Caching
- DigitalOcean / Anthropic — Prompt Caching
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.