2 сентября Qwen3.8-Max-0902 заняла первую строку общего зачёта Code Arena WebDev, набрав 1691 очко. Это всего на четыре пункта больше, чем у Claude Opus 5 Max, которая идёт второй с 1687 очками. Однако за красивой цифрой скрывается нюанс: результат Qwen помечен как предварительный, голосов у неё в несколько раз меньше, а доверительные интервалы двух моделей сильно перекрываются. Пока готовился этот материал, количество голосов и отрыв успели измениться — таблица пересчитывается по мере поступления сравнений.
Code Arena WebDev устроена иначе, чем классические бенчмарки по программированию. Вместо набора алгоритмических задач пользователь описывает веб-приложение, две скрытые модели независимо собирают свои варианты, после чего человек запускает результаты и выбирает лучший. В текущем агентном режиме модель может планировать работу, создавать и править файлы, выполнять команды и повторять цикл. При голосовании учитываются три группы свойств: функциональность (выполнение задачи), удобство интерфейса и соответствие запросу, включая дизайн и поведение. Такой подход ближе к реальному прототипированию, чем изолированные тесты, но он смешивает качество кода, работу с инструментами и субъективный вкус голосующих.
| Модель | Оценка | Голоса | Диапазон места | Цена за 1 млн токенов, вход / выход |
|---|---|---|---|---|
| Qwen3.8-Max-0902 | 1691 ±19 | 1389 | от 1 до 4 | $2 / $6 |
| Claude Opus 5 Max | 1687 ±8 | 10 517 | от 1 до 4 | $5 / $25 |
| Kimi K3 Max | 1674 ±11 | 4544 | от 1 до 5 | $3 / $15 |
| Qwen3.8-Max | 1669 ±12 | 3220 | от 1 до 5 | $2 / $6 |
| Claude Opus 5 High | 1661 ±8 | 10 462 | от 3 до 5 | $5 / $25 |
Рейтинг Arena строится на модели Брэдли-Терри, которая оценивает относительную силу участников по результатам попарных сравнений. Одна точечная оценка не показывает устойчивость результата, поэтому публикуются доверительные интервалы и диапазон возможного места. У Qwen интервал от 1672 до 1710, у Claude — от 1679 до 1695. Весь интервал Claude лежит внутри интервала Qwen, а погрешность у лидера достигает 19 пунктов в каждую сторону. Диапазон места у обеих моделей совпадает: от первого до четвёртого. Корректная формулировка на 2 сентября звучит так: Qwen3.8-Max-0902 занимает первое место по текущей точечной оценке. Заявление о подтверждённом превосходстве над Claude потребует более узкого интервала и устойчивого разрыва.
Доверительный интервал Qwen (1672–1710) полностью перекрывает интервал Claude (1679–1695), поэтому диапазон места у обеих — от 1 до 4.
Alibaba называет qwen3.8-max-0902 снимком основной Qwen3.8-Max. Новый снимок прибавил 22 пункта к предыдущей версии, которая остаётся на четвёртой строке с 1669 очками. Это заметный сдвиг внутри одной линейки, но его точный размер стоит читать вместе с интервалами и разным количеством голосов. Цена за 1 млн токенов у Qwen3.8-Max-0902 — $2 на входе и $6 на выходе, что заметно дешевле Claude Opus 5 Max ($5/$25). Для разработчиков, которые активно используют веб-генерацию, это может стать аргументом попробовать модель, но для смены рабочего инструмента одного первого места в Code Arena недостаточно — нужны проверки на реальных проектах, включая архитектуру, безопасность и сопровождение кода.

