Amazon Bedrock, платформа для работы с фундаментальными моделями, добавила поддержку кэширования промптов. Механизм позволяет снизить стоимость входных токенов до 90% при повторной отправке одного и того же контекста — например, длинного документа или системного промпта — в модели Anthropic Claude и Amazon Nova. Без кэширования отправка контракта на 10 000 токенов вместе с 50 вопросами пользователей означает 500 000 входных токенов, оплачиваемых по полной цене за контент, который модель уже обработала.

Кэширование промптов работает на уровне инфраструктуры: при добавлении маркера cachePoint в запрос Amazon Bedrock проверяет, совпадает ли содержимое перед маркером с существующей записью в кэше. При совпадении (cache hit) модель пропускает повторную обработку этих токенов и начинает генерацию с кэшированного состояния. При отсутствии совпадения (cache miss) модель обрабатывает полный контент и записывает результат в кэш для будущих запросов. Это снижает время до первого токена (TTFT) и затраты на кэшированные входные токены.

Тип токеновОписаниеСтоимость относительно стандартного ввода
cacheWriteInputTokensТокены, записываемые в кэш (первый запрос)на 25% выше
cacheReadInputTokensТокены, читаемые из кэша (последующие запросы)на 90% ниже
cacheWriteInputTokens (TTL 1 час)Токены, записываемые в кэш с временем жизни 1 часна 100% выше (2x)

В практических сценариях кэширование применяется для длинных документов при многократном анализе, системных промптов, определений инструментов для агентных рабочих процессов, а также для разделения кэша между арендаторами в мультитенантных приложениях. Поддерживается интеграция с LangChain. Синтаксис cachePoint в Converse API одинаков для всех поддерживаемых семейств моделей, включая Anthropic Claude и Amazon Nova.

При отправке документа в 10 000 токенов с 10 вопросами экономия на входных токенах составляет около 75%.

Prompt caching request flow
Prompt caching request flow · Источник: AWS Machine Learning Blog

Ценообразование включает две новые категории токенов: cacheWriteInputTokens (запись в кэш) стоит на 25% дороже стандартного ввода, а cacheReadInputTokens (чтение из кэша) — на 90% дешевле. Для записи с временем жизни 1 час стоимость вдвое выше стандартного ввода. При повторяющемся контексте экономия на входных токенах достигает примерно 75%. Например, при отправке документа в 10 000 токенов с 10 разными вопросами первый запрос несёт затраты на запись в кэш, а остальные девять читают из кэша со скидкой 90%, что даёт чистую экономию около 75% при условии, что все последующие запросы укладываются в TTL.

Кэш ограничен рамками отдельного аккаунта AWS и региона. Каждая контрольная точка кэша должна достигать минимального порога токенов: для Anthropic Claude Sonnet 4.5 и Sonnet 4.6 — не менее 1 024 токенов, для моделей Opus — не менее 4 096. Время жизни кэша по умолчанию составляет 5 минут, для отдельных моделей доступно до 1 часа. После истечения TTL запрос вызывает новую запись в кэш, что снижает итоговую экономию.

Для начала работы требуются аккаунт AWS с доступом к Amazon Bedrock в поддерживаемом регионе (например, us-west-2) и включённый доступ к целевой модели. В примерах используется Anthropic Claude Sonnet 4.5 (global.anthropic.claude-sonnet-4-5-20250929-v1:0).