Месяц работы с ИИ-агентом обходится от 87 до 7 720 долларов — разрыв в 88 раз между DeepSeek V4.1 Flash и GPT-6 Astra. Расчёт сделан по прайсам провайдеров на 16 сентября и модели потребления: 492 млн новых входных токенов, 2,3 млрд токенов, прочитанных из кэша, 10 млн выходных и примерно 25 тыс. запросов. Средний запрос весит около 112 тыс. токенов, и почти весь он уже был отправлен раньше.

Ключевая деталь, которую легко пропустить: 82% всего объёма — это кэш. Модель ничего не помнит между вызовами, и харнес — Claude Code, OpenCode, Cursor — на каждом ходу снова отправляет ей системный промпт, описания инструментов и историю. Провайдеры дают большую скидку на повторное чтение того же начала промпта: у большинства моделей Anthropic чтение кэша стоит 0,1 от цены входа, у Fable 5.1 — 0,025, у OpenAI скидка достигает 90%. Большой, но стабильный промпт может оказаться дешевле маленького, который постоянно меняется.

МодельВход / кэш / выход, $ за 1M$ в месяц
GPT-6 Astra*10 / 1 / 507 720
Claude Fable 5.1*10 / 0,25 / 505 995
Claude Opus 5*5 / 0,50 / 253 860
GPT-5.6 Sol*4 / 0,40 / 203 088
Qwen 3.7 Max2,50 / 0,50 / 7,502 455
Kimi K33 / 0,30 / 152 316
Grok 4.52 / 0,30 / 61 734
Qwen 3.8 Max2 / 0,25 / 61 619
GPT-5.6 Terra*2 / 0,20 / 121 564
GLM-5.3 и GLM-5.21,40 / 0,26 / 4,401 331
MiniMax M30,30 / 0,06 / 1,20298
DeepSeek V4.1 Flash, пик / вне пика0,30 / 0,006 / 1,20 и вдвое дешевле173 / 87
GPT-5.6 Luna*0,20 / 0,02 / 1,20156

Насколько велик этот эффект, видно на Claude Code: только что запущенная сессия уже занимала около 45 тыс. токенов — системный промпт, инструменты, файлы памяти. На одно слово «привет» ушло ещё 18 тыс. Стоимость определяет не то, что напечатал пользователь, а то, что агент фактически передал. На статистике автора 98% всех токенов — чтение из кэша, поэтому цифры по разным моделям так сильно расходятся.

82% всего объёма — чтение из кэша, поэтому цена модели без учёта кэша даёт неверную картину.

Отсюда практические правила. Кэш работает по совпадающему началу: изменили что-то в начале — всё, что дальше, снова стоит полную цену. Не стоит менять начало промпта посреди сессии, переподключать MCP-серверы и править правила, входящие в системный промпт: у Anthropic изменение описаний инструментов инвалидирует кэш целиком. MCP-серверы и скиллы лучше подключать на уровне проекта, а не глобально — их описания уезжают в каждый вызов. Нужно следить за TTL: у Anthropic API стандартный TTL — пять минут, расширенный — час. В Claude Code на подписке Pro или Max в пределах включённого лимита часть запросов получает часовой TTL автоматически, но при переходе на usage credits они возвращаются к пяти минутам, если явно не выставить promptCacheTtl: 1h. У GPT-5.6 и более новых моделей OpenAI минимальный TTL — 30 минут. Кэш всё равно не постоянная память: после долгого перерыва начало промпта снова придётся записать. И не стоит резать стабильную часть промпта вслепую — агенту не хватит контекста, он начнёт читать файлы и вызывать инструменты, и итоговый счёт за сессию вырастет.

Если платить за API по прайсу на 16 сентября, картина такая. GPT-6 Astra — 7 720 долларов в месяц, Claude Fable 5.1 — 5 995, Claude Opus 5 — 3 860, GPT-5.6 Sol — 3 088, Qwen 3.7 Max — 2 455, Kimi K3 — 2 316, Grok 4.5 — 1 734, Qwen 3.8 Max — 1 619, GPT-5.6 Terra — 1 564, GLM-5.3 и GLM-5.2 — 1 331, MiniMax M3 — 298, DeepSeek V4.1 Flash — 173 в пик и 87 вне пика, GPT-5.6 Luna — 156. Это нижняя оценка: запись в кэш, которую Anthropic и OpenAI тарифицируют отдельно, в расчёт не входит. Для Opus 5 при стандартном пятиминутном TTL наценка в четверть цены входа добавила бы примерно 615 долларов, при часовом TTL — уже 2 460. Если отдельные запросы переходят long-context порог провайдера, соответствующая строка будет дороже.

Сравнение с подписками даёт другой ответ. Подписка Claude Code Pro или Max покрывает часть служебных запросов и даёт часовой TTL автоматически, тогда как при переходе на usage credits те же запросы тарифицируются по API. Для сценариев с большим объёмом кэша подписка может оказаться дешевле, чем оплата по факту, — но только пока укладываешься в лимит. За его пределами начинается тарификация по API, и тогда разница между моделями снова становится решающей.

Рынок за месяц заметно сдвинулся: DeepSeek ввёл пиковые тарифы, Z.ai перевёл GLM Coding Plan на кредиты, появились новые модели. Цены на 16 сентября уже не совпадают с тем, что было в августе, — половина цифр месячной давности устарела. Для команд, которые считают бюджет на агентов, это означает, что пересчитывать модель потребления стоит не реже раза в квартал, а не один раз при выборе провайдера.