Когда ИИ-агент пишет код, почти все деньги уходят не на его «мысли» и не на диалог, а на многократную пересылку уже отправленного. Это показал анализ 40 завершенных сессий агентной разработки — 20 в Claude Code и 20 в Codex, проведенный на двух коммерческих веб-проектах. Суммарный оборот выборки составил 777 млн токенов: 298 млн у Claude Code и 479 млн у Codex.

Причина в архитектуре языковых моделей: они не хранят состояние между вызовами. Каждый шаг агента — думает ли он, вызывает ли инструмент или читает результат — отправляет модели всю историю сессии заново: системные инструкции, запрос пользователя, каждый прочитанный файл, каждый вывод команды. Модель перечитывает всё это и дописывает следующую реплику. Поэтому любой кусок текста, попавший в контекст на шаге k, будет переслан на каждом из оставшихся шагов. Чем раньше и крупнее вставка, тем дороже она обходится к концу сессии.

ПоказательClaude CodeCodex
Суммарный оборот токенов298 млн479 млн
Повторная пересылка на новый токен4736
Доля свежего ввода0.003%5.7%
Наклон тренда (лог-координаты)1.271.07

Главный результат: расход агентной сессии — это почти целиком повторная пересылка уже отправленного. На каждый токен, впервые попавший в контекст, медианная сессия повторно пересылает 47 (Claude Code) или 36 (Codex) старых. Свежий, никогда не отправлявшийся ввод — 0.003% объема у Claude и 5.7% у Codex; собственно ответ модели — меньше 1%. Всё остальное — круговорот одного и того же текста.

Повторная пересылка контекста — до 99% расхода: свежий ввод — 0.003% у Claude и 5.7% у Codex.

Провайдеры смягчают проблему кэшем промпта: уже отправленный неизменный префикс сохраняется на сервере, и его повторная пересылка тарифицируется примерно в 10 раз дешевле обычного входа. Но кэш не бесплатен: запись в него стоит дороже обычного входа (в 1.25–2 раза), а живёт запись обычно час — при паузе в работе кэш «сгорает» и строится заново, за деньги.

Из этого следуют два практических вывода. Стоимость сессии растёт быстрее её длины: у Claude Code удвоение числа шагов даёт примерно ×2.4 по токенам. А главные статьи расхода — не «болтливость» модели и не инструкции пользователя, а вывод инструментов, который агент читает и потом таскает с собой до конца сессии. Это значит, что оптимизация агентной разработки должна фокусироваться на сокращении объёма вывода инструментов и на управлении кэшем, а не на попытках «укоротить» промпты.

Методология включала скрипт agent-usage версии 3.0.0 из открытого набора abssoft/dreamteam, который читает локальные логи рантаймов и восстанавливает размер контекста на каждом шаге. Тарифы брались по встроенному каталогу официальных цен от 2026-08-29. Доля прироста контекста, надежно привязанного к источникам, составила ~80% — остальное приходится на сообщения человека и текст модели.