Alibaba выпустила Qwen3.8 Max — новую версию флагманской модели семейства Qwen. В рейтинге Artificial Analysis Intelligence Index она набрала 56 баллов, что на 10 баллов выше, чем у Qwen3.7 Max. По этому показателю модель сравнялась с Claude Opus 4.8, обошла GLM-5.2 (51), но уступила Kimi K3 (57). При этом Kimi K3 стоит на 25% дешевле, и это не единственный компромисс.
Artificial Analysis Intelligence Index — это независимый бенчмарк, который оценивает совокупность когнитивных способностей LLM, а не отдельные навыки вроде кода или перевода. В тесте GDPval-AA, заточенном под рабочие задачи, Qwen3.8 Max совершила скачок на 468 пунктов Эло — до 1 739. Это выше, чем у Kimi K3 (1 685), и уступает только Claude Opus 5 (1 852).
| Модель | Балл Intelligence Index | Стоимость задачи |
|---|---|---|
| Qwen3.8 Max | 56 | $1,14 |
| Kimi K3 | 57 | $0,86 |
| GLM-5.2 | 51 | $0,57 |
| Qwen3.7 Max | 46 | $0,53 |
Плата за результат — производительность и стоимость. На каждую задачу в тесте модель тратит 64 шага вместо 14 у предыдущей версии, а количество входных токенов выросло в 15 раз: тест пересылает полную историю разговора модели на каждом шаге. Из-за этого одна задача в Intelligence Index обходится в $1,14 — более чем вдвое дороже, чем $0,53 у Qwen3.7 Max. Kimi K3 выполняет задачу за $0,86, GLM-5.2 — за $0,57.
В GDPval-AA модель получила 1739 Elo, обойдя Kimi K3 (1685) и уступив Claude Opus 5 (1852).
Alibaba при этом снизила расценки на токены: ввод подешевел с $2,50 до $2,00 за миллион токенов, вывод — с $7,50 до $6,00, а попадание в кэш — с $0,50 до $0,25. Однако рост вычислительных затрат перекрывает экономию, и соотношение цены и качества ухудшилось.
Есть и регрессии относительно прошлой версии. Показатель AA-LCR, проверяющий, насколько корректно модель собирает информацию из очень длинных текстов, упал на 2 пункта. AA-Omniscience, который оценивает, отвечает ли модель на вопросы или честно признаётся в незнании, снизился на 10 пунктов. Точность осталась около 31%, зато уровень галлюцинаций вырос с 23% до 40%: модель чаще выдумывает ответы, вместо того чтобы сказать, что не знает.
История с Qwen3.8 Max показательна для рынка больших языковых моделей: гонка за верхними строчками бенчмарков не всегда означает улучшение практических свойств. Модель стала сильнее в рабочих задачах, но потеряла в надёжности и экономичности. Для разработчиков, которые выбирают между разными LLM, это повод смотреть не только на итоговый балл, но и на цену за задачу, поведение на длинных контекстах и склонность к галлюцинациям.



