В эксперименте, описанном на Habr, один разработчик в течение двух недель вёл продакшен-разработку с помощью агентов: 30 993 запроса, 8,8 млрд токенов, ноль строк кода, написанных вручную. Подобные нагрузки делают накладные расходы на управление агентами главной статьёй издержек.
Трёхуровневый Governance-стек, который должен делать автономных агентов безопасными, потребляет контекст при каждом вызове. В проекте это примерно 35 000 токенов политик, 20 000 описаний навыков, 7 000 промптов ревьюеров и другие инструкции — суммарно от 70 до 90 тысяч токенов оверхеда. При ценах Anthropic на кэш-чтение средняя фича с миллионом токенов стоит $0,84; на DeepSeek V4 Flash тот же объём — меньше $0,004. Кажется, что это копейки, но на масштабе организации расходы уходят из-под контроля.
| Модель | SWE-bench | Cache Hit | Cache Miss | Output |
|---|---|---|---|---|
| Opus 4.8 | 88.6% | $0.50 | $5.00 | $25.00 |
| Sonnet 4.6 | 79.6% | $0.30 | $3.00 | $15.00 |
| Haiku 4.5 | 73.3% | $0.10 | $1.00 | $5.00 |
| DeepSeek V4 Pro | 80.6% | $0.0036 | $0.435 | $0.87 |
| DeepSeek V4 Flash | 79.0% | $0.0028 | $0.140 | $0.28 |
Три инцидента 2026 года показывают последствия. Uber к апрелю исчерпала годовой бюджет на ИИ-кодинг, раздав Claude Code примерно 5 000 инженерам; лимит теперь $1 500 в месяц на человека. Microsoft отменила внутренние лицензии
Governance-оверхед — от 70 до 90 тыс. токенов на вызов; при ценах Anthropic фича стоит $0,84, на DeepSeek — меньше $0,004.
Экономика агентной разработки менее предсказуема, чем у обычного чата. Стэнфордская лаборатория цифровой экономики в апреле 2026 года зафиксировала разброс стоимости до 30× на одной и той же задаче, а модели систематически недооценивают собственное потребление токенов. Поэтому вопрос не только в цене токенов, но и в архитектурной ставке компании: кто контролирует контекст и останавливает runaway-агентов — тот определяет, сколько реально стоит ИИ-кодинг.

