Разработчики агентных систем оказались в парадоксальной ситуации: модели дешевеют, но задачи решают хуже. Провайдеры соревнуются в снижении цены за токен, а команды переходят на облегчённые версии, экономя на вычислениях. Однако первая же реальная задача показывает, что агент на дешёвой модели делает в три раза больше вызовов инструментов, чем на дорогой. Он теряет способность планировать, начинает галлюцинировать, ходить по кругу, переспрашивать и исправлять ошибки новыми ошибками. Счёт за токены незаметно растёт, время выполнения увеличивается, а нервы — на пределе.
Причина в том, как устроен рынок ИИ. За последние два года индустрия пережила бум вычислений: Китай вложил 140 миллиардов долларов в закупку видеокарт, США строят дата-центры по полмиллиарда долларов каждый и проектируют АЭС для их питания. Число запросов к OpenAI, Anthropic и китайским аналогам выросло на порядки, а вычислительные мощности упираются в физический предел производства чипов. Чтобы обслужить всех, провайдеры выпускают упрощённые версии моделей, которые требуют меньше ресурсов на инференс, и снижают на них цены. Технически это достигается дистилляцией, квантизацией и прореживанием весов — модель сжимают до размеров, позволяющих запускать её на вдвое меньшем количестве видеокарт.
Проблема в том, что дистилляция режет не размер словаря, а глубину рассуждения. Модель становится менее способна удерживать длинный контекст, выстраивать многошаговую логику и видеть неочевидные связи. По формальным тестам облегчённые модели почти не уступают старшим, но бенчмарки вроде MMLU или GSM8K измеряют лишь способность отвечать на изолированные вопросы. Они не проверяют планирование, длинные цепочки рассуждений и устойчивость к ошибкам в многокомпонентных задачах — именно те качества, которые критичны для агентных систем.
Бенчмарки вроде MMLU и GSM8K не измеряют планирование и устойчивость к ошибкам, критичные для агентных систем.
Возьмём простейший сценарий: агенту нужно найти файл в Google Диске, извлечь данные и отправить отчёт в CRM. Дорогая модель напишет небольшой скрипт и завершит задачу. Дешёвая может сначала написать один скрипт, затем прочитать его заново, поискать в интернете, написать ещё один скрипт, затем дебаг. Вместо тысяч токенов — десятки или сотни тысяч. Формально цена за токен ниже, но итоговый счёт оказывается выше, а время выполнения растёт. Разработчики привыкли доверять бенчмаркам и не замечают деградацию, пока не столкнутся с ней в бою.
Как считать реальную стоимость модели? Нужно учитывать не цену за токен, а полную стоимость выполнения задачи: количество вызовов инструментов, время отладки, стоимость повторных попыток. Для агентных систем важнее способность модели планировать и удерживать контекст, чем скорость генерации. Провайдеры не снижают цены из альтруизма — это демпинг, пока ИИ-пузырь жив, но инвестиции в инфраструктуру когда-то придётся отбивать. Поэтому выбор модели — это компромисс между сиюминутной экономией и долгосрочной надёжностью вашего продукта.


