Китайская компания Z.ai представила GLM-5.3-Flash — модель, которая при скромной цене показывает результаты, сопоставимые с флагманскими решениями. По данным Artificial Analysis, на Intelligence Index модель набирает 57 баллов при максимальном уровне рассуждений — это всего на три балла меньше, чем у более крупной GLM-5.3 (60 баллов), и на одном уровне с GPT-5.6 Terra и Muse Spark 1.2. При этом стоимость одной задачи на индексе составляет 0,09 доллара против 0,68 доллара у GLM-5.3 — разница примерно в 7,5 раза. Это ставит модель на границу Парето по соотношению интеллекта и цены, как отмечают аналитики.

GLM-5.3-Flash — первая нативно мультимодальная модель в серии GLM-5. Она имеет 320 млрд параметров, из которых активны только 18 млрд, что позволяет снизить вычислительные затраты. Модель распространяется под лицензией MIT, веса доступны на Hugging Face. Контекстное окно составляет один миллион токенов. На API Z.ai цена составляет 0,15 доллара за миллион входных токенов и 0,50 доллара за миллион выходных — это чуть более десяти процентов от цены GLM-5.3. На агентных задачах модель не уступает старшему брату: на GDPval-AA v2 она достигает Elo-рейтинга около 1770, что соответствует GLM-5.3 и Grok 4.6, уступая лишь Claude Opus 5. Однако модель менее эффективна по токенам: около 90 процентов выходных токенов уходит на рассуждения.

МодельIntelligence IndexСтоимость за задачу, $
GLM-5.3-Flash570.09
GLM-5.3600.68
GPT-5.6 Terra57
Muse Spark 1.257

Инфраструктурный аспект не менее примечателен. До официального запуска модель тестировалась анонимно под именем «ox-alpha» на OpenCode и OpenRouter, где стала самой популярной за неделю. По данным Z.ai, весь этот трафик обслуживался на китайских ИИ-чипах, а не на GPU Nvidia. SemiAnalysis сообщает, что система обрабатывала 100 триллионов токенов в день — уровень, который ранее считался доступным только ведущим лабораториям. Z.ai утверждает, что эффективность их оборудования и стоимость токена сопоставимы с обычными GPU Nvidia. Это рассматривается как очередное испытание «CUDA-рва», после недавних результатов с новым чипом OpenAI.

На Intelligence Index модель набирает 57 баллов — на уровне GPT-5.6 Terra и Muse Spark 1.2, но на 3 балла ниже GLM-5.3.

On the Intelligence Index, GLM-5.3-Flash lands at 57 points and sits in the most attractive cost-versus-intelligence quadrant. | Image: Artificial Analysis
On the Intelligence Index, GLM-5.3-Flash lands at 57 points and sits in the most attractive cost-versus-intelligence quadrant. | Image: Artificial Analysis · Источник: The Decoder

CUDA — это программный слой Nvidia, связывающий ИИ-софт с видеокартами. Он развивается почти 20 лет, и почти все ИИ-фреймворки оптимизированы под него. Переход на другие чипы требует переписывания кода, перенастройки вычислительных операций, адаптации доступа к памяти и поиска узких мест. Z.ai создала собственное серверное ПО на основе SGLang и разбила обработку на независимо масштабируемые стадии. Это, по словам компании, утроило пропускную способность по сравнению с первой попыткой на том же оборудовании. В оптимизации участвовал агент на основе GLM-5.3.

Появление GLM-5.3-Flash — очередной шаг китайских моделей, которые в последнее время оказывают сильное ценовое давление на западных провайдеров. Сочетание высокой производительности, низкой цены и работы на альтернативных чипах может изменить расклад сил на рынке ИИ, где доминирование Nvidia и американских моделей казалось незыблемым. Однако у модели есть и слабые стороны: низкая токен-эффективность и зависимость от специфического ПО для обслуживания. Тем не менее, для многих задач она может стать экономически выгодной альтернативой.