Руководитель разработки платформенных решений в Петрович-Тех Максим Чичев провёл эксперимент, который ставит под сомнение распространённый тезис о том, что в агентных системах главное — обвязка, а не модель. Он прогнал три LLM разных весовых категорий через один и тот же харнесс на задачах длиной 2, 3 и 15 шагов. Результаты показали, что на коротких цепочках разница между моделями почти не видна, но на длинных — проявляется критично.
Харнесс, или обвязка, — это программа вокруг модели, которая содержит системный промпт, каталог инструментов, поиск по документам, исполнение вызовов и обработку ошибок. Модель сама по себе умеет только получать текст и возвращать текст, а всю работу с внешними сервисами выполняет обвязка. В эксперименте Чичева харнесс был полностью заморожен: промпты, инструменты, база, лимиты — всё одинаковое, менялась только модель. Участниками стали Claude Sonnet 4.6 (облако, запад), Qwen3-235B (облако, Россия) и Qwen3.5-9B (локально, на одной видеокарте с квантом AWQ 4 бита).
| Модель | Категория | Развёртывание |
|---|---|---|
| Claude Sonnet 4.6 | Облако, запад | Облачный API |
| Qwen3-235B | Облако, Россия | Облачный API |
| Qwen3.5-9B | Локальная | Одна видеокарта, квант AWQ 4 бита, vLLM |
Задачи различались длиной цепочки вызовов. «Сводка» — пересказать показатели 13 виджетов (2 шага), «Отчёт» — собрать задачи в риске и сохранить файлом (3 шага), «Цикл» — тот же отчёт для семи проектов (15 шагов). Каждая задача прогонялась по три раза на каждой модели, всего 27 прогонов. Проверка результатов велась не по заранее записанному эталону, а по журналу вызовов: полный ответ каждого вызова записывался в JSON (~30 КБ), что позволяло точно знать, сколько строк модель получила и сколько донесла до файла.
Ключевой вывод: на задачах в 2 и 3 шага все три модели справились практически одинаково, и разница была в пределах статистической погрешности. Но на 15-шаговой задаче «Цикл» проявились существенные расхождения. Claude Sonnet 4.6 и Qwen3-235B показали схожие результаты, тогда как Qwen3.5-9B заметно отстала по надёжности. Это означает, что тезис «харнесс важнее модели», который сегодня популярен в индустрии, справедлив только для коротких цепочек. Когда агенту нужно выполнить 15 последовательных действий, где каждое следующее опирается на результат предыдущего, выбор модели становится определяющим.
Самым опасным видом ошибки оказался не отказ выполнить действие, а ложная уверенность. В одном из прогонов модель заявила, что создала 7 файлов, назвала точные числа строк, но на самом деле не создала ни одного файла. Такая ошибка особенно коварна, потому что её сложно обнаружить автоматически: система считает, что всё прошло успешно, а пользователь получает неверный результат. Чичев отмечает, что при проверке результатов важно сверяться не с эталоном, а с тем, что модель реально получила от инструментов, поскольку данные могут меняться со временем (например, возраст задач в SQL).
Эксперимент поднимает вопрос о достоверности публичных бенчмарков. Чичев подчёркивает, что не знает, как устроены задачи в публичных тестах, но его агент должен делать 15 действий подряд, и каждое следующее зависит от предыдущего. Публичные бенчмарки обычно оценивают отдельные ответы модели, а не длинные цепочки вызовов, поэтому они не показывают, как модель поведёт себя в реальных агентных сценариях. Для разработчиков, строящих системы, которые сами ходят в рабочие сервисы, это означает, что выбор модели должен опираться на тесты, приближенные к реальным задачам, а не на абстрактные рейтинги.

