Месяц работы с ИИ-агентом обходится от 87 до 7 720 долларов — разрыв в 88 раз между DeepSeek V4.1 Flash и GPT-6 Astra. Расчёт сделан по прайсам провайдеров на 16 сентября и модели потребления: 492 млн новых входных токенов, 2,3 млрд токенов, прочитанных из кэша, 10 млн выходных и примерно 25 тыс. запросов. Средний запрос весит около 112 тыс. токенов, и почти весь он уже был отправлен раньше.
Ключевая деталь, которую легко пропустить: 82% всего объёма — это кэш. Модель ничего не помнит между вызовами, и харнес — Claude Code, OpenCode, Cursor — на каждом ходу снова отправляет ей системный промпт, описания инструментов и историю. Провайдеры дают большую скидку на повторное чтение того же начала промпта: у большинства моделей Anthropic чтение кэша стоит 0,1 от цены входа, у Fable 5.1 — 0,025, у OpenAI скидка достигает 90%. Большой, но стабильный промпт может оказаться дешевле маленького, который постоянно меняется.
| Модель | Вход / кэш / выход, $ за 1M | $ в месяц |
|---|---|---|
| GPT-6 Astra* | 10 / 1 / 50 | 7 720 |
| Claude Fable 5.1* | 10 / 0,25 / 50 | 5 995 |
| Claude Opus 5* | 5 / 0,50 / 25 | 3 860 |
| GPT-5.6 Sol* | 4 / 0,40 / 20 | 3 088 |
| Qwen 3.7 Max | 2,50 / 0,50 / 7,50 | 2 455 |
| Kimi K3 | 3 / 0,30 / 15 | 2 316 |
| Grok 4.5 | 2 / 0,30 / 6 | 1 734 |
| Qwen 3.8 Max | 2 / 0,25 / 6 | 1 619 |
| GPT-5.6 Terra* | 2 / 0,20 / 12 | 1 564 |
| GLM-5.3 и GLM-5.2 | 1,40 / 0,26 / 4,40 | 1 331 |
| MiniMax M3 | 0,30 / 0,06 / 1,20 | 298 |
| DeepSeek V4.1 Flash, пик / вне пика | 0,30 / 0,006 / 1,20 и вдвое дешевле | 173 / 87 |
| GPT-5.6 Luna* | 0,20 / 0,02 / 1,20 | 156 |
Насколько велик этот эффект, видно на Claude Code: только что запущенная сессия уже занимала около 45 тыс. токенов — системный промпт, инструменты, файлы памяти. На одно слово «привет» ушло ещё 18 тыс. Стоимость определяет не то, что напечатал пользователь, а то, что агент фактически передал. На статистике автора 98% всех токенов — чтение из кэша, поэтому цифры по разным моделям так сильно расходятся.
82% всего объёма — чтение из кэша, поэтому цена модели без учёта кэша даёт неверную картину.
Отсюда практические правила. Кэш работает по совпадающему началу: изменили что-то в начале — всё, что дальше, снова стоит полную цену. Не стоит менять начало промпта посреди сессии, переподключать MCP-серверы и править правила, входящие в системный промпт: у Anthropic изменение описаний инструментов инвалидирует кэш целиком. MCP-серверы и скиллы лучше подключать на уровне проекта, а не глобально — их описания уезжают в каждый вызов. Нужно следить за TTL: у Anthropic API стандартный TTL — пять минут, расширенный — час. В Claude Code на подписке Pro или Max в пределах включённого лимита часть запросов получает часовой TTL автоматически, но при переходе на usage credits они возвращаются к пяти минутам, если явно не выставить promptCacheTtl: 1h. У GPT-5.6 и более новых моделей OpenAI минимальный TTL — 30 минут. Кэш всё равно не постоянная память: после долгого перерыва начало промпта снова придётся записать. И не стоит резать стабильную часть промпта вслепую — агенту не хватит контекста, он начнёт читать файлы и вызывать инструменты, и итоговый счёт за сессию вырастет.
Если платить за API по прайсу на 16 сентября, картина такая. GPT-6 Astra — 7 720 долларов в месяц, Claude Fable 5.1 — 5 995, Claude Opus 5 — 3 860, GPT-5.6 Sol — 3 088, Qwen 3.7 Max — 2 455, Kimi K3 — 2 316, Grok 4.5 — 1 734, Qwen 3.8 Max — 1 619, GPT-5.6 Terra — 1 564, GLM-5.3 и GLM-5.2 — 1 331, MiniMax M3 — 298, DeepSeek V4.1 Flash — 173 в пик и 87 вне пика, GPT-5.6 Luna — 156. Это нижняя оценка: запись в кэш, которую Anthropic и OpenAI тарифицируют отдельно, в расчёт не входит. Для Opus 5 при стандартном пятиминутном TTL наценка в четверть цены входа добавила бы примерно 615 долларов, при часовом TTL — уже 2 460. Если отдельные запросы переходят long-context порог провайдера, соответствующая строка будет дороже.
Сравнение с подписками даёт другой ответ. Подписка Claude Code Pro или Max покрывает часть служебных запросов и даёт часовой TTL автоматически, тогда как при переходе на usage credits те же запросы тарифицируются по API. Для сценариев с большим объёмом кэша подписка может оказаться дешевле, чем оплата по факту, — но только пока укладываешься в лимит. За его пределами начинается тарификация по API, и тогда разница между моделями снова становится решающей.
Рынок за месяц заметно сдвинулся: DeepSeek ввёл пиковые тарифы, Z.ai перевёл GLM Coding Plan на кредиты, появились новые модели. Цены на 16 сентября уже не совпадают с тем, что было в августе, — половина цифр месячной давности устарела. Для команд, которые считают бюджет на агентов, это означает, что пересчитывать модель потребления стоит не реже раза в квартал, а не один раз при выборе провайдера.

