2 сентября Qwen3.8-Max-0902 заняла первую строку общего зачёта Code Arena WebDev, набрав 1691 очко. Это всего на четыре пункта больше, чем у Claude Opus 5 Max, которая идёт второй с 1687 очками. Однако за красивой цифрой скрывается нюанс: результат Qwen помечен как предварительный, голосов у неё в несколько раз меньше, а доверительные интервалы двух моделей сильно перекрываются. Пока готовился этот материал, количество голосов и отрыв успели измениться — таблица пересчитывается по мере поступления сравнений.

Code Arena WebDev устроена иначе, чем классические бенчмарки по программированию. Вместо набора алгоритмических задач пользователь описывает веб-приложение, две скрытые модели независимо собирают свои варианты, после чего человек запускает результаты и выбирает лучший. В текущем агентном режиме модель может планировать работу, создавать и править файлы, выполнять команды и повторять цикл. При голосовании учитываются три группы свойств: функциональность (выполнение задачи), удобство интерфейса и соответствие запросу, включая дизайн и поведение. Такой подход ближе к реальному прототипированию, чем изолированные тесты, но он смешивает качество кода, работу с инструментами и субъективный вкус голосующих.

МодельОценкаГолосаДиапазон местаЦена за 1 млн токенов, вход / выход
Qwen3.8-Max-09021691 ±191389от 1 до 4$2 / $6
Claude Opus 5 Max1687 ±810 517от 1 до 4$5 / $25
Kimi K3 Max1674 ±114544от 1 до 5$3 / $15
Qwen3.8-Max1669 ±123220от 1 до 5$2 / $6
Claude Opus 5 High1661 ±810 462от 3 до 5$5 / $25

Рейтинг Arena строится на модели Брэдли-Терри, которая оценивает относительную силу участников по результатам попарных сравнений. Одна точечная оценка не показывает устойчивость результата, поэтому публикуются доверительные интервалы и диапазон возможного места. У Qwen интервал от 1672 до 1710, у Claude — от 1679 до 1695. Весь интервал Claude лежит внутри интервала Qwen, а погрешность у лидера достигает 19 пунктов в каждую сторону. Диапазон места у обеих моделей совпадает: от первого до четвёртого. Корректная формулировка на 2 сентября звучит так: Qwen3.8-Max-0902 занимает первое место по текущей точечной оценке. Заявление о подтверждённом превосходстве над Claude потребует более узкого интервала и устойчивого разрыва.

Доверительный интервал Qwen (1672–1710) полностью перекрывает интервал Claude (1679–1695), поэтому диапазон места у обеих — от 1 до 4.

Alibaba называет qwen3.8-max-0902 снимком основной Qwen3.8-Max. Новый снимок прибавил 22 пункта к предыдущей версии, которая остаётся на четвёртой строке с 1669 очками. Это заметный сдвиг внутри одной линейки, но его точный размер стоит читать вместе с интервалами и разным количеством голосов. Цена за 1 млн токенов у Qwen3.8-Max-0902 — $2 на входе и $6 на выходе, что заметно дешевле Claude Opus 5 Max ($5/$25). Для разработчиков, которые активно используют веб-генерацию, это может стать аргументом попробовать модель, но для смены рабочего инструмента одного первого места в Code Arena недостаточно — нужны проверки на реальных проектах, включая архитектуру, безопасность и сопровождение кода.