Основатель ИИ-платформы VibePilot Сергей Игнатенко опубликовал лидерборд шести языковых моделей, работающих внутри агентов платформы. За три месяца через один и тот же конвейер прошло 1 198 задач, из них 22 завершились сбоем — 1,8%. Задачи брались из повседневной работы пользователей: сметы, акты, договоры, коммерческие предложения, многостраничные таблицы Excel с формулами, презентации, лендинги с формой заявки. Синтетических тестов в выборке нет.

Стандартные бенчмарки LLM измеряют качество ответа на алгоритмических, математических и программных задачах. VibePilot считает другое: дошла ли задача до готового файла, за сколько секунд и за сколько рублей. Модель здесь не отвечает в вакууме — она работает как агент с инструментами внутри конвейера, одинакового для всех участников. Для документов и таблиц конвейер состоит из трёх шагов: проверка вложений, генерация содержимого, проверка структуры. Для сайтов — из четырёх: изучение задачи, выбор стека, сборка страницы, проверка вёрстки. Каждый шаг ограничен по инструментам, числу итераций и цели. Модель решает только, что написать на текущем шаге, а не что делать дальше.

МодельПровайдерЗадачСбоевСреднее времяТокены (ср.)Стоимость
DeepSeek V4DeepSeek (прямой API)180,0%2 мин 27 сек1,9K1,32 ₽
DeepSeek V3.2DeepSeek (прямой API)440,0%3 мин 15 сек1,4K0,13 ₽
YandexGPT 5 ProYandex Cloud3221,2%2 мин 52 сек3,6K4,43 ₽
Qwen3-235BYandex Cloud2101,9%4 мин 25 сек3,4K2,22 ₽
DeepSeek V4Yandex Cloud2732,2%4 мин 09 сек3,5K2,47 ₽
Alice AI LLMYandex Cloud3312,4%2 мин 39 сек3,0K2,60 ₽

Из этого следуют три метрики. Сбой — задача не дошла до готового файла после всех ретраев конвейера. Время — от старта до готового файла, включая все запросы к модели и все проверки. Стоимость — реальный расход токенов по тарифу провайдера в рублях за задачу. Такой подход отсекает оценки вида «ответ так себе по мнению другой нейросети» и оставляет только наблюдаемый результат.

Средний процент сбоев по всем шести моделям — 1,8%; лидеры по надёжности — DeepSeek V3.2 и YandexGPT 5 Pro.

В лидерборде шесть моделей. DeepSeek V3.2 через прямой API: 44 задачи, 0% сбоев, среднее время 3 мин 15 сек, 1,4K токенов, 0,13 ₽ за задачу. DeepSeek V4 через прямой API: 18 задач, 0% сбоев, 2 мин 27 сек, 1,9K токенов, 1,32 ₽. YandexGPT 5 Pro через Yandex Cloud: 322 задачи, 1,2% сбоев, 2 мин 52 сек, 3,6K токенов, 4,43 ₽. Qwen3-235B через Yandex Cloud: 210 задач, 1,9% сбоев, 4 мин 25 сек, 3,4K токенов, 2,22 ₽. DeepSeek V4 через Yandex Cloud: 273 задачи, 2,2% сбоев, 4 мин 09 сек, 3,5K токенов, 2,47 ₽. Alice ИИ LLM через Yandex Cloud: 331 задача, 2,4% сбоев, 2 мин 39 сек, 3,0K токенов, 2,60 ₽.

Нули у DeepSeek напрямую автор лидерборда сам просит не читать буквально: 18 и 44 задачи против 200–330 у моделей в Yandex Cloud. При n = 18 один сбой уже даёт 5,5%. Прямой API DeepSeek стоит в конце цепочки фолбэков, поэтому задач туда попадает мало. Размер выборки показан в каждой строке именно для того, чтобы по этим двум строкам не делали выводов.

Одна и та же модель через разных провайдеров даёт разные цифры. DeepSeek V4 через Yandex Cloud: 273 задачи, 2,2% сбоев, 4 мин 09 сек. Через прямой API: 18 задач, 0%, 2 мин 27 сек. Разница во времени почти в два раза. Причины — разные версии развёртывания, разные лимиты, разная нагрузка на инференс. Вывод из этого не «облако портит модель», а «сравнивать надо не модели, а конкретные модели у конкретных провайдеров».

Разброс по стоимости почти в 35 раз: от 0,13 ₽ у DeepSeek V3.2 напрямую до 4,43 ₽ у YandexGPT 5 Pro. Это средние по всем типам задач; на конкретной задаче расклад может быть другим. Лидерборд показывает статистику, а забег — конкретику: одна задача, две модели, параллельно, через один и тот же конвейер.

В забеге на смету ремонта квартиры 60 м² с разделами (демонтаж, электрика, сантехника, штукатурка и стяжка, чистовая отделка) Alice ИИ LLM справилась за 19 секунд и 385 токенов, Qwen3-235B — за 1 мин 27 сек и 1 182 токена. Разрыв в четыре с половиной раза по времени и в три раза по токенам. Структура у Алисы оказалась аккуратнее: заголовки разделов отдельными строками и под каждым итог «Итого по демонтажу». Qwen обошёлся строками «Итого: Демонтаж» без выделенных заголовков, визуально смета читается хуже. Пять запросов к модели у Qwen против двух у Алисы — это конвейер отрабатывал уточнения: модели не хватило одного прохода, чтобы выдать структуру, которую примет валидатор.

Для аудитории VibePilot это не абстрактный рейтинг, а вопрос себестоимости. При 1 198 задачах разница между 0,13 ₽ и 4,43 ₽ за задачу превращается в десятки тысяч рублей в месяц. Платформа работает на моделях Яндекса с апреля, и автор отдельно отмечает: традиционно такие модели считают слабыми для агентных сценариев, но при проработанной архитектуре конвейера они закрывают сложные задачи. Независимые бенчмарки сравнить китайские и отечественные LLM в прикладной работе не позволяют — они меряют другое.

Что остаётся неопределённым. Выборка по прямым API DeepSeek слишком мала для выводов. Стоимость указана по тарифам провайдеров на момент замера и может меняться. Разница между провайдерами одной модели говорит о том, что цифры лидерборда привязаны к конкретному развёртыванию, а не к модели как таковой. Наконец, 1,8% сбоев — средняя по всем типам задач; на отдельных сценариях, например многостраничных таблицах с формулами, разброс может быть выше.