В предыдущих частях цикла редакция сравнивала флагманские модели западных и китайских лабораторий, но в комментариях читатели справедливо заметили: в реальной работе чаще используются более доступные модели. Поэтому пятый выпуск посвящён «рабочим лошадкам» — четырём китайским LLM, отобранным по стоимости токена, чтобы участники играли в одной лиге по деньгам. В подборку вошли MiniMax M3 от лаборатории MiniMax, LongCat 2.0 от Meituan, MiMo-v2.5-Pro от Xiaomi и DeepSeek V4 Pro — единственная модель, которая месяц назад тестировалась как флагман, но по цене попала в этот диапазон.
Методика осталась прежней: никаких бенчмарков, только реальные будничные задачи. Модели тестировались через API агрегатора BotHub, что исключает скрытую помощь веб-интерфейсов. Программа включала 12 тестов: кодинг, длинный контекст, стиль, суммаризация, сравнение документов, внимание в середине, анализ данных, разбор схемы, логика, шаблонность, галлюцинации и безопасность. Промпты дословно повторяли предыдущие части, настройки — температура 0,7, средняя логика рассуждений, поиск в интернете отключён. Затраты измерялись в CAPS — внутренней валюте BotHub, привязанной к числу токенов (1 рубль = 6370 CAPS).
| Модель | Компания | Стоимость шахмат | Примечание |
|---|---|---|---|
| MiniMax M3 | MiniMax | — | Минималистичный проект, 5 файлов |
| LongCat 2.0 | Meituan | 2,55 руб. | Canvas, отмена хода, корзины фигур |
| MiMo-v2.5-Pro | Xiaomi | — | — |
| DeepSeek V4 Pro | DeepSeek | ~10 руб. | Флагман месяц назад, регресс в тестах |
Первый тест — браузерные шахматы — принёс неожиданный результат. Все четыре модели справились с задачей с первого раза, что стало лучшим показателем за весь цикл: западные флагманы тоже щёлкали задачу, но средний класс дал лишь два рабочих проекта из пяти, а китайские флагманы — два с половиной из четырёх. LongCat 2.0 выделилась креативностью: она единственная нарисовала доску на canvas, добавила кнопку «Отменить ход» и подписала корзины съеденных фигур — всё это за 2 рубля 55 копеек, вчетверо дешевле, чем у DeepSeek. MiniMax M3 отработала минималистично, как и просил промпт, но без лишних деталей.
LongCat 2.0 от Meituan оказалась самой дешёвой и креативной: реализовала отмену хода и подписанные корзины фигур за 2 рубля 55 копеек.
Однако не всё гладко. Восьмой тест — анализ данных — выявил проблему: только одна из четырёх моделей принимает изображения. Это подтверждает тенденцию, отмеченную в прошлой статье: для китайского сегмента текст-онли — скорее норма, чем исключение. Если вы строите мультимодальный пайплайн на дешёвых китайских моделях, проверяйте это первым делом.
DeepSeek V4 Pro, тестировавшаяся месяц назад как флагман, показала интересную динамику: повторный прогон по тем же промптам выявил регресс в некоторых тестах, но модель осталась конкурентоспособной по цене. Это единственный случай в цикле, когда одна и та же модель прошла одинаковые тесты с интервалом в месяц, что даёт уникальную возможность оценить стабильность.
Полные ответы моделей приведены под катом, так что читатели могут не согласиться с субъективными оценками редакции и выбрать своего фаворита. Для тех, кто выбирает модель для продакшена с сотнями тысяч запросов в месяц, этот материал — практическое руководство по бюджетному сегменту китайских LLM.

