Независимый тестировщик потратил около двух недель, чтобы прогнать Алису от Яндекса и два тарифа GigaChat от Сбера по пяти бенчмаркам: τ³, ПРАКТ-120, MultiChallenge, WildBench и Arena-Hard. Алиса тестировалась через веб-коннектор alice.yandex.ru — так, как с ней взаимодействует обычный пользователь. В 90% случаев модель в процессе оправдывалась: «Сейчас повышенная нагрузка, поэтому я включаю модель попроще». GigaChat тестировался по API; бесплатных токенов при регистрации не хватило, поэтому использовались три аккаунта. Судьёй выступила модель Grok 4.6: она читала готовые ответы и либо сравнивала их попарно, либо ставила оценку по шкале.

Arena-Hard — это 750 тяжёлых заданий, где ответы сравниваются парами: победа, поражение или ничья. Победа достаётся тому, кто довёл расчёт и закрыл все пункты. GigaChat Max выиграл у Алисы 83% пар: из 750 пар судья отдал лист Max в 620 случаях, Алисе — в 106, ничья — 24. GigaChat Ultra показал лучший результат среди трёх моделей, Max — заметно лучше Алисы. Алиса выигрывала там, где соперник отказывался отвечать или ломал условие задачи. Итоговый порядок в Arena-Hard: Ultra, затем Max, затем Алиса.

БенчмаркЧто проверяетФормат оценки
Arena-HardСложные письменные задачи: код, кейсы, длинные инструкции750 пар, судья выбирает лучший ответ
WildBenchДлинные рабочие диалоги: чеклисты, правки, уточнения1024 диалога, оценка 1–10 за ответ
τ³Следование инструкциям в многошаговом диалоге на английскомСудья оценивает ответы
ПРАКТ-120Практические задачи на русском языкеСудья оценивает ответы
MultiChallengeНесколько реплик подряд с правиламиСудья оценивает ответы

WildBench — это 1024 длинных разговора, имитирующих рабочий день с ассистентом: длинные треды, чеклисты, просьбы «доделай», «перепиши мягче», «учти прошлый абзац». Судья ставит оценку от 1 до 10 за весь ответ. Пятёрка — «нормально, без блеска», ниже пяти — слабее обычного. WB-Score — та же шкала, сдвинутая так, чтобы пятёрка стала нулём: (средняя − 5) × 2. Минус на ней не значит «ноль ответов», а «средняя ниже пяти». В WildBench результаты трёх моделей оказались близки: Алиса в среднем чуть ниже «нормально», Max чуть выше, Ultra увереннее держит длинный чат. Разрыв небольшой, порядок тот же: Ultra, Max, Алиса.

В Arena-Hard GigaChat Max выиграл у Алисы 83% пар, но уступил GigaChat Ultra.

Остальные три бенчмарка — τ³, ПРАКТ-120 и MultiChallenge — проверяют, держит ли чат форму, когда задание длинное, на английском, с правилами и несколькими репликами подряд. Тестировщик отмечает, что русский чат легко проверить на «напиши стихотворение», но ему нужно было другое: способность следовать инструкциям в многошаговом диалоге. Западные лаборатории для этого давно собрали открытые наборы задач, и он прогнал по ним отечественные чаты — одни вопросы, одни правила счёта. Если связь обрывалась и вопрос до модели не доходил, попытка не засчитывалась и повторялась. Если чат возвращал пустоту или ошибку сервера — это ноль, а не «у нас сломался браузер».

В сравнение не вошла Маракуйя ИИ: команда ушла в глубокий рефакторинг и обещает вернуться с новой отечественной кодовой средой — аналогом Cursor, Claude Code и Codex, но без VPN, иностранных карт и с расчётом на суверенное решение. Тестировщик также отмечает, что Алиса для бизнеса, появившаяся в Алиса 360, не тестировалась — она вышла недавно, и, по его личному опыту, шансов на заметно лучший результат немного. GigaChat Max и Ultra — это два тарифа Сбера, которые нельзя склеить в одну строку: Ultra сильнее на длинном тексте и на задачах с инструментами, Max дешевле и слабее на тех же вопросах.

Для сравнения с мировыми моделями в WildBench приводятся результаты лидеров: Qwen3 235B A22B 2507 — 86,6, GPT-5.1 — 86,3, Kimi K2 — 86,2, o3 — 86,1, Gemini 3 Pro — 85,9. Однако дуэлей между Алисой, GigaChat и этими моделями не проводилось, поэтому прямое сопоставление некорректно. Тестировщик подчёркивает: он бы поставил прохождение бенчмарков в цикл разработки, потому что только так можно понять, где находится модель относительно мировых лидеров.