ذخیره سازی سریع و اقتصاد ذخیره سازی معنوی
Caching در دو لایه اتفاق می افتد. L2 (در سطح ارائه دهنده) پرامپت / پیش فرض کیش توجه KV را برای پیش فرض های تکراری تکرار می کند اسناد کیش پرامپت Anthropic تا 90٪ کاهش هزینه و 85٪ کاهش تاخیر در پرامپت های طولانی را تبلیغ می کنند؛ برای Claude 3.5 Sonnet خواندن کیش هستند $0.30/M vs $3.00/M تازه با 5 دقیقه TTL و 2 برابر امتیاز نوشتن برای گزینه 1 ساعت TTL (docs.anthropic.com، 2026-04). ذخیره سازی سریع OpenAI به طور خودکار برای پیام های ≥1024 توکن و قیمت های ذخیره شده واردات با تقریباً 90٪ تخفیف در مقابل تازه (platform.openai.com، 2026-04) اعمال می شود؛ نرخ دقیق ذخیره شده در هر مدل بستگی به کارت نرخ زنده دارد. L1 (در سطح برنامه) ذخیره سازی معنوی LLM را به طور کامل در پیوند با ضربه های مشابهی نادیده می گیرد. فروشنده "95% دقت" به مطابقت درستگی، نرخ ضربه ای اشاره دارد نرخ ضربه تولید گزارش شده از 10٪ (چات باز) تا 70٪ (FAQ ساختاری) می باشد؛ هیچ یک از ارائه دهندگان یک خط پایه رسمی را منتشر نمی کنند، بنابراین این را به عنوان تلتمیتری جامعه به جای تضمین ها در نظر بگیرید. پیچیدگی های تولید: موازی سازی کشینگ را می کشد (N درخواست های موازی که قبل از اولین نوشتن کش می تواند هزینه را چندین برابر افزایش دهد) و محتوای پویا در داخل پیشگویی مانع از ضربه های کش می شود. پروژه کشف گزارش کرد که از 7٪ به 74٪ نرخ ضربه (2025-11) با حرکت متن پویا از پیشگویی ذخیره سازی شده حرکت می کند.
Type: Learn
Languages: Python (stdlib, toy two-layer cache simulator)
Prerequisites: Phase 17 · 04 (Serving Engine Internals), Phase 17 · 06 (SGLang RadixAttention)
Time: ~60 minutes
اهداف یادگیری
- از کیشنگ معنوی L1 (بیگردن LLM در پیام های مشابه) ، کیشنگ فوری L2 (استفاده مجدد KV در ارائه دهنده) را متمایز کنید.
- شرحي از آنترپيك
cache_controlعلامت گذاری صریح و دو گزینه TTL (5 دقیقه به مقابل 1 ساعت) با ضربات قیمت آنها. - پس انداز های انتظار شده ماهانه را با توجه به نرخ ضربه، ترکیب پاسخ/پاسخ سریع و قیمت توکن محاسبه کنید.
- الگوی ضد متوازنه را نام دهید که صورتحساب ها را 5-10 برابر افزایش می دهد و الگوی ضد محتوای پویا که نرخ ضربه را کاهش می دهد.
مشکل
شما به سرویس RAG خود کیش فوری اضافه می کنید. صورتحساب ثابت باقی می ماند. شما نرخ ضربه را اندازه گیری می کنید؛ 7٪ است. پیام های شما جامد به نظر می رسند اما آنها نیستند. پیام های سیستم شامل تاریخ فعلی به شکل دقیقه، یک شناسه درخواست و یک نمونه تصادفی برای تغییر ترتیب برای تنوع است. هر درخواست یک ورودی جدید از کیش می نویسد، صفر می خواند.
به طور جداگانه، آژانس شما 10 تماس ابزار موازی را در هر سوال کاربر اجرا می کند. همه 10 تا قبل از تکمیل اولین نوشتن پیشاپیش به ارائه دهنده می رسند. 10 نوشته، صفر می خواند. صورتحساب شما 5-10 برابر هزینه "با پیشاپیش" قرار است هزینه شود.
. "کاش" پروتکليه نه يه پرچم دو لايه دو حالت شکست
مفهوم
L2 پیش فرض/پیش فرض پیشگیری از پیشگیری از ارائه دهنده
ارائه دهنده KV توجه را برای یک پیشگویی ذخیره می کند و آن را در درخواست بعدی که با پیشگویی مطابقت دارد دوباره استفاده می کند. شما هزینه نوشتن را یک بار پرداخت می کنید، تقریبا رایگان می خواند.
Anthropic (Claude 3.5 / 3.7 / 4 series): صریحcache_controlTTL: 5 دقیقه (تکلیف نوشتن 1.25x پایه) یا 1 ساعت (تکلیف نوشتن 2x پایه)$0.30/M on Claude 3.5 Sonnet vs $قیمت ها در هر مدل متفاوت است (Opus/Haiku به طور جداگانه منتشر شده است) ؛ همیشه صفحه قیمت گذاری زنده را بررسی کنید.
OpenAI: ذخیره سازی خودکار برای پیام های فوری ≥1024 توکن (platform.openai.com، 2026-04). هیچ پرچم صریحی وجود ندارد. ورودی ذخیره شده تقریباً 10 برابر ارزان تر از تازه در کارت های نرخ فعلی gpt-4o / gpt-5 است. نه اسناد و نه یادداشت های انتشار یک خط اصلی رسمی نرخ ضربه را منتشر می کنند. گزارش های جامعه با طراحی دقیق پیامک را در حدود 3060% جمع آوری می کنند. نظارت کنید usage.cached_tokensتا اندازه گیری خودت رو انجام بده
Google (Gemini): ذخیره سازی کنتکس از طریق API صریح؛ 1M-توکن کنتکس به این معنی است که ذخیره سازی بیشتر می پردازد.
Self-hosted (vLLM, SGLang): مرحله 17 · 06 شامل RadixAttention همان الگوی در محاسبه خود را.
L1 ذخیره سازی سیمانتیک در سطح برنامه
قبل از تماس با LLM، پرامپت را هاش کنید، آن را گنجانید و به دنبال یک درخواست ذخیره شده مشابه (مثل همچینه بالاتر از حد، معمولاً 0.95+) باشید. در ضربه، پاسخ ذخیره شده را برگردانید. در miss، LLM را تماس بگیرید و نتیجه را ذخیره کنید.
منبع باز: شباهت ویکتور Redis, GPTCache, Qdrant. تجاری: Portkey Cache, Helicone Cache.
ادعاهای دقت فروشنده به میزان مکرر بودن پاسخ ذخیره شده به صورت معنوی مناسب است نه اینکه چقدر اغلب ضربه می زنید. نرخ ضربه تولید:
- چت باز: 10 تا 15 درصد
- سوالات منظم / پشتیبانی: 40-70٪
- سوالات کد: 20-30% (فروق های کوچک ضربه ها را می کشند).
- عامل های صدا که پیام های تکراری را تکرار می کنند: 50-80٪ (تعداد ثابت نرمال سازی صدا).
الگوی ضد متوازکی
در این حالت، شما می توانید از این طریق به این طریق به این طریق به کار ببرید که به شما کمک کند تا از طریق یک برنامه ای که به شما کمک می کند، به شما کمک کنید تا از طریق یک برنامه ای که به شما کمک می کند، به شما کمک کنید تا از طریق یک برنامه ای که به شما کمک می کند، به شما کمک کند تا از طریق یک برنامه ای که به شما کمک می کند، به شما کمک کند تا از طریق یک برنامه ای که به شما کمک می کند، به شما کمک کند تا از طریق یک برنامه ای که به شما کمک می کند، به شما کمک کند تا از طریق یک برنامه ای که به شما کمک می کند، به شما کمک کند تا از طریق یک برنامه ای که به شما کمک می کند، به شما کمک کند تا از طریق یک برنامه ای که به شما کمک می کند، به شما کمک کند تا از طریق یک برنامه ای که به شما کمک می کند، به شما کمک کند تا از طریق یک برنامه ای که به شما کمک می کند، به شما کمک کند تا از طریق یک برنامه ای که به شما کمک کند.
درست کردن: دسته با ترتیب اول درخواست 1 را تنها انجام دهید، سپس 2-10 را بعد از پر شدن کش 1 پر کنید. 300 ms را به اولین تماس ابزار اضافه می کند؛ 5-10 برابر صورتحساب را ذخیره می کند.
این نوع مواد پویا
. پیام سیستم شما شبیه اینه
You are a helpful assistant. The current time is 14:32:17.
User ID: abc123. Today is Tuesday...هر درخواست منحصر به فرد است هر درخواست نوشته شده صفر ضربه
اصلاح: همه چیز واقعی را به پیشگویی ذخیره سازی قابل حرکت منتقل کنید؛ محتوای پویا پس از مرز ذخیره سازی اضافه کنید:
[cacheable]
You are a helpful assistant. [rules, examples, instructions]
[/cacheable]
[dynamic, not cached]
Current time: 14:32:17. User: abc123.پروژه کشف از ۷ درصد به ۷۴ درصد از میزان ضربه های کیش به این ترتیب حرکت کرد و آناتومی را منتشر کرد.
دسته بندی دسته بندی + ذخیره سازی برای بار کاری شبانه
API های دسته بندی (فاز 17 · 15) در 24 ساعت تخفیف 50٪ را ارائه می دهند. ورودی ذخیره شده در بالای شما به شما ~ 10x در بالای آن می دهد. بار کاری طبقه بندی، برچسب گذاری و تولید گزارش در یک شب می تواند به ~ 10٪ از هزینه های غیرمسلح با انبوه کاهش یابد.
شماره هایی که باید به یاد داشته باشی
نقاط قیمت گذاری از اسناد فروشنده مرتبط 2026-04 گرفته شده و هر چند ماه یکبار بازرسی می شود.
- Anthropic cached reading: $0.30/M در Claude 3.5 Sonnet، تقریبا 10 برابر ارزان تر از ورودی تازه (docs.anthropic.com).
- پریمیم نوشتن کش انسان: 1.25x (5 دقیقه TTL) یا 2x (1 ساعت TTL).
- OpenAI خودکار: برای توکن های فوری ≥1024 مورد استفاده قرار می گیرد؛ ورودی ذخیره شده با قیمت حدود 10٪ ورودی تازه در کارت های نرخ فعلی (platform.openai.com)
- نرخ ضربه های کش سیمانیک (برنامه شده توسط جامعه): ~ 10% چت باز؛ تا ~ 70% سوالات منظم. نه یک خط پایه مستند شده توسط فروشنده.
- پروژه کشف: ۷٪ → ۷۴٪ نرخ ضربه با حرکت پویا از پیش فرض (برنامه پروژه، ۲۰۲۵-۱۱).
- الگوی ضد متواز: گزارش های معمول تورم صورتحساب 510x زمانی که N درخواست متوازکی اولین نوشته پیشگیر را از دست می دهد.
ازش استفاده کن
code/main.pyگزارش ها نرخ ها را می گیرند، صورتحساب می کنند و مجازات موازی را نشان می دهند.
-باده
این درس به ما کمک می کندoutputs/skill-cache-auditor.md. با توجه به قالب سریع و ترافیک، حسابرسی قابلیت ذخیره سازی را بررسی می کند و پیشنهاد بازسازی می کند.
تمرینات
- فرار کن
code/main.py. پرچم موازی را تغییر دهید . چقدر لایحه تغییر می کند؟ - .سائره سیستم شما يه تاريخ داره.شرکت کن.
- برای یک ساعت TTL (2 بار نوشتن) در مقابل 5 دقیقه TTL (1.25 بار نوشتن) با توجه به میزان ورود درخواست خود، تخفیف را محاسبه کنید.
- در 0.95، به %20 می رسد، اما پاسخ های زیرنویس اشتباه را می بینید.
- شما 10 سوال متوازی را در هر سوال کاربر جمع آوری می کنید. برای حفظ حافظه بدون اضافه کردن تاخیر پایان به پایان.
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| L2 prompt cache | "prefix cache" | Provider stores KV for repeated prefix |
cache_control | "Anthropic cache marker" | Explicit attribute marking cacheable blocks |
| Cache write premium | "write tax" | Extra cost for first miss-to-cache (1.25x or 2x) |
| L1 semantic cache | "embedding cache" | App-level hash-and-embed before calling LLM |
| GPTCache | "LLM caching lib" | Popular OSS L1 cache library |
| Cache hit rate | "hits / total" | Fraction of requests served from cache |
| Parallelization anti-pattern | "the N-write trap" | N parallel requests miss cache N times |
| Dynamic content trap | "the time-in-prompt trap" | Dynamic bytes in prefix kill hit rate |
| RadixAttention | "intra-replica cache" | SGLang's prefix-cache implementation |
خواندن بیشتر
- Anthropic Prompt Caching رسمی
cache_controlسیمانیک و TTL ها - OpenAI Prompt Caching رفتار خودکار ذخیره سازی و واجد شرایط بودن.
- TianPan — Semantic Caching for LLMs Production
- ProjectDiscovery — Cut LLM Costs 59% With Prompt Caching
- DigitalOcean / Anthropic — Prompt Caching
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.