Prompt caching
Как работает кеширование промпта, что именно кешируется, сколько это экономит и какие есть ограничения.
Обновлено 21 июл. 2026 г.⏱ 5 мин
#кеш#caching#prompt cache#cache_control#экономия#ephemeral
Prompt caching позволяет один раз «запомнить» большой неизменный контекст на стороне upstream и в следующих запросах читать его из кеша — дешевле и быстрее, чем пересылать заново.
#Как работает
Вы помечаете часть промпта как кешируемую. Первый запрос делает cache write (запись), последующие в пределах TTL — cache read (чтение). Read тарифицируется в разы дешевле обычного input.
#Что кешируется
- Большой системный промпт и инструкции.
- Документация, спецификации, справочники, приложенные к запросу.
- Стабильная часть кодовой базы в агентных сценариях.
- Определения инструментов (tools), если они не меняются между вызовами.
#Пример: Claude cache_control
пометка контекста как кешируемого
curl https://api.tkbk.io/claude/v1/messages \
-H "Authorization: Bearer cr_your_key" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-sonnet-5",
"max_tokens": 512,
"system": [
{
"type": "text",
"text": "…большой неизменный контекст: документация, правила, код…",
"cache_control": {"type": "ephemeral"}
}
],
"messages": [{"role": "user", "content": "Вопрос по этому контексту"}]
}'#Сколько экономит
| Операция | Относительная цена |
|---|---|
| Обычный input | База (×1) |
| Cache write (первый раз) | Немного дороже input |
| Cache read (повторно) | В разы дешевле input |
✓
Когда выгодно
Чем чаще повторяется один и тот же большой контекст, тем больше экономия. На однократных уникальных запросах кеш смысла не имеет.#Ограничения
- У кеша есть TTL — при простое запись устаревает и первый запрос снова делает cache write.
- Кешируется только неизменная часть: любое изменение символа ломает совпадение.
- Есть минимальный размер блока, ниже которого кеш не применяется.
- Расход на cache write и read виден в кабинете отдельными позициями.