В эксперименте, описанном на Habr, один разработчик в течение двух недель вёл продакшен-разработку с помощью агентов: 30 993 запроса, 8,8 млрд токенов, ноль строк кода, написанных вручную. Подобные нагрузки делают накладные расходы на управление агентами главной статьёй издержек.

Трёхуровневый Governance-стек, который должен делать автономных агентов безопасными, потребляет контекст при каждом вызове. В проекте это примерно 35 000 токенов политик, 20 000 описаний навыков, 7 000 промптов ревьюеров и другие инструкции — суммарно от 70 до 90 тысяч токенов оверхеда. При ценах Anthropic на кэш-чтение средняя фича с миллионом токенов стоит $0,84; на DeepSeek V4 Flash тот же объём — меньше $0,004. Кажется, что это копейки, но на масштабе организации расходы уходят из-под контроля.

МодельSWE-benchCache HitCache MissOutput
Opus 4.888.6%$0.50$5.00$25.00
Sonnet 4.679.6%$0.30$3.00$15.00
Haiku 4.573.3%$0.10$1.00$5.00
DeepSeek V4 Pro80.6%$0.0036$0.435$0.87
DeepSeek V4 Flash79.0%$0.0028$0.140$0.28

Три инцидента 2026 года показывают последствия. Uber к апрелю исчерпала годовой бюджет на ИИ-кодинг, раздав Claude Code примерно 5 000 инженерам; лимит теперь $1 500 в месяц на человека. Microsoft отменила внутренние лицензии

Governance-оверхед — от 70 до 90 тыс. токенов на вызов; при ценах Anthropic фича стоит $0,84, на DeepSeek — меньше $0,004.

Экономика агентной разработки менее предсказуема, чем у обычного чата. Стэнфордская лаборатория цифровой экономики в апреле 2026 года зафиксировала разброс стоимости до 30× на одной и той же задаче, а модели систематически недооценивают собственное потребление токенов. Поэтому вопрос не только в цене токенов, но и в архитектурной ставке компании: кто контролирует контекст и останавливает runaway-агентов — тот определяет, сколько реально стоит ИИ-кодинг.