Alibaba выпустила Qwen3.8 Max — новую версию флагманской модели семейства Qwen. В рейтинге Artificial Analysis Intelligence Index она набрала 56 баллов, что на 10 баллов выше, чем у Qwen3.7 Max. По этому показателю модель сравнялась с Claude Opus 4.8, обошла GLM-5.2 (51), но уступила Kimi K3 (57). При этом Kimi K3 стоит на 25% дешевле, и это не единственный компромисс.

Artificial Analysis Intelligence Index — это независимый бенчмарк, который оценивает совокупность когнитивных способностей LLM, а не отдельные навыки вроде кода или перевода. В тесте GDPval-AA, заточенном под рабочие задачи, Qwen3.8 Max совершила скачок на 468 пунктов Эло — до 1 739. Это выше, чем у Kimi K3 (1 685), и уступает только Claude Opus 5 (1 852).

МодельБалл Intelligence IndexСтоимость задачи
Qwen3.8 Max56$1,14
Kimi K357$0,86
GLM-5.251$0,57
Qwen3.7 Max46$0,53

Плата за результат — производительность и стоимость. На каждую задачу в тесте модель тратит 64 шага вместо 14 у предыдущей версии, а количество входных токенов выросло в 15 раз: тест пересылает полную историю разговора модели на каждом шаге. Из-за этого одна задача в Intelligence Index обходится в $1,14 — более чем вдвое дороже, чем $0,53 у Qwen3.7 Max. Kimi K3 выполняет задачу за $0,86, GLM-5.2 — за $0,57.

В GDPval-AA модель получила 1739 Elo, обойдя Kimi K3 (1685) и уступив Claude Opus 5 (1852).

Alibaba при этом снизила расценки на токены: ввод подешевел с $2,50 до $2,00 за миллион токенов, вывод — с $7,50 до $6,00, а попадание в кэш — с $0,50 до $0,25. Однако рост вычислительных затрат перекрывает экономию, и соотношение цены и качества ухудшилось.

Есть и регрессии относительно прошлой версии. Показатель AA-LCR, проверяющий, насколько корректно модель собирает информацию из очень длинных текстов, упал на 2 пункта. AA-Omniscience, который оценивает, отвечает ли модель на вопросы или честно признаётся в незнании, снизился на 10 пунктов. Точность осталась около 31%, зато уровень галлюцинаций вырос с 23% до 40%: модель чаще выдумывает ответы, вместо того чтобы сказать, что не знает.

История с Qwen3.8 Max показательна для рынка больших языковых моделей: гонка за верхними строчками бенчмарков не всегда означает улучшение практических свойств. Модель стала сильнее в рабочих задачах, но потеряла в надёжности и экономичности. Для разработчиков, которые выбирают между разными LLM, это повод смотреть не только на итоговый балл, но и на цену за задачу, поведение на длинных контекстах и склонность к галлюцинациям.