В предыдущих частях цикла редакция сравнивала флагманские модели западных и китайских лабораторий, но в комментариях читатели справедливо заметили: в реальной работе чаще используются более доступные модели. Поэтому пятый выпуск посвящён «рабочим лошадкам» — четырём китайским LLM, отобранным по стоимости токена, чтобы участники играли в одной лиге по деньгам. В подборку вошли MiniMax M3 от лаборатории MiniMax, LongCat 2.0 от Meituan, MiMo-v2.5-Pro от Xiaomi и DeepSeek V4 Pro — единственная модель, которая месяц назад тестировалась как флагман, но по цене попала в этот диапазон.

Методика осталась прежней: никаких бенчмарков, только реальные будничные задачи. Модели тестировались через API агрегатора BotHub, что исключает скрытую помощь веб-интерфейсов. Программа включала 12 тестов: кодинг, длинный контекст, стиль, суммаризация, сравнение документов, внимание в середине, анализ данных, разбор схемы, логика, шаблонность, галлюцинации и безопасность. Промпты дословно повторяли предыдущие части, настройки — температура 0,7, средняя логика рассуждений, поиск в интернете отключён. Затраты измерялись в CAPS — внутренней валюте BotHub, привязанной к числу токенов (1 рубль = 6370 CAPS).

МодельКомпанияСтоимость шахматПримечание
MiniMax M3MiniMaxМинималистичный проект, 5 файлов
LongCat 2.0Meituan2,55 руб.Canvas, отмена хода, корзины фигур
MiMo-v2.5-ProXiaomi
DeepSeek V4 ProDeepSeek~10 руб.Флагман месяц назад, регресс в тестах

Первый тест — браузерные шахматы — принёс неожиданный результат. Все четыре модели справились с задачей с первого раза, что стало лучшим показателем за весь цикл: западные флагманы тоже щёлкали задачу, но средний класс дал лишь два рабочих проекта из пяти, а китайские флагманы — два с половиной из четырёх. LongCat 2.0 выделилась креативностью: она единственная нарисовала доску на canvas, добавила кнопку «Отменить ход» и подписала корзины съеденных фигур — всё это за 2 рубля 55 копеек, вчетверо дешевле, чем у DeepSeek. MiniMax M3 отработала минималистично, как и просил промпт, но без лишних деталей.

LongCat 2.0 от Meituan оказалась самой дешёвой и креативной: реализовала отмену хода и подписанные корзины фигур за 2 рубля 55 копеек.

Однако не всё гладко. Восьмой тест — анализ данных — выявил проблему: только одна из четырёх моделей принимает изображения. Это подтверждает тенденцию, отмеченную в прошлой статье: для китайского сегмента текст-онли — скорее норма, чем исключение. Если вы строите мультимодальный пайплайн на дешёвых китайских моделях, проверяйте это первым делом.

DeepSeek V4 Pro, тестировавшаяся месяц назад как флагман, показала интересную динамику: повторный прогон по тем же промптам выявил регресс в некоторых тестах, но модель осталась конкурентоспособной по цене. Это единственный случай в цикле, когда одна и та же модель прошла одинаковые тесты с интервалом в месяц, что даёт уникальную возможность оценить стабильность.

Полные ответы моделей приведены под катом, так что читатели могут не согласиться с субъективными оценками редакции и выбрать своего фаворита. Для тех, кто выбирает модель для продакшена с сотнями тысяч запросов в месяц, этот материал — практическое руководство по бюджетному сегменту китайских LLM.