Китайская компания Moonshot ИИ, известная ассистентом Kimi, представила PerceptionBench — бенчмарк, который изолирует визуальное восприятие мультимодальных моделей от логических рассуждений. В тестировании участвовали 16 frontier-моделей, и ни одна не преодолела 60-процентный порог точности. Лучший результат — 59,7% — показала GPT-5.6 Sol, за ней следуют Kimi K3 (58,5%), Claude Fable 5 (57,2%) и Gemini 3.1 Pro (56,2%). Open-source модели заметно отстают: Qwen3.5-397B-A17B набрала 47,5%, а GLM-4.6V — всего 32,5%.
PerceptionBench отличается от традиционных тестов тем, что разбивает зрение на десять атомарных навыков: Visual Relation, Counting, Attributes, Depth & 3D, Localization, Comparison, Fine-grained Recognition, Context Integration, OCR и Hallucination. Каждый вопрос можно решить, просто посмотрев на изображение, без внешних знаний или рассуждений. Авторы подчеркивают, что существующие бенчмарки покрывают лишь узкие срезы ошибок восприятия: из 42 проанализированных открытых бенчмарков ни один не дает полной картины. Поэтому таксономия строилась не теоретически, а на основе реальных ошибок моделей, которые прослеживались до самого раннего сбоя.
| Модель | Точность (%) |
|---|---|
| GPT-5.6 Sol | 59.7 |
| Kimi K3 | 58.5 |
| Claude Fable 5 | 57.2 |
| Gemini 3.1 Pro | 56.2 |
| GPT-5.5 | 55.8 |
| Qwen3.5-397B-A17B | 47.5 |
| GLM-4.6V | 32.5 |
Из внутреннего пула из 17 000 проверенных вопросов Moonshot ИИ публикует 3 000 задач. 60% из них получены из ошибок моделей, 40% — переформулированы с использованием дополненных изображений. Задачи выглядят обманчиво простыми: определить, где находится символ на циферблате, посчитать цветы в красной коробке или сравнить два стакана с карандашами. Тем не менее, средние результаты по категориям показывают, что модели с почти одинаковыми общими баллами резко расходятся в отдельных навыках. Например, галлюцинации — умение не выдумывать несуществующие объекты — оказались самым слабым местом: GPT-5.6 Sol набрала лишь 26,9%, тогда как более слабая Gemini 3.5 Flash показала 50,6%.
Лучший результат — 59,7% у GPT-5.6 Sol; Kimi K3 набрал 58,5%, Claude Fable 5 — 57,2%, Gemini 3.1 Pro — 56,2%.

Ключевой вывод исследователей: многие ошибки, которые обычно списывают на недостаток рассуждений, на самом деле возникают на этапе восприятия. Когда модель не справляется с многошаговой задачей, первый шаг — корректное считывание изображения — часто уже провален. PerceptionBench разбивает такие задачи на подвопросы, позволяя точно определить, какой именно визуальный навык подводит. Это важно, потому что мультимодальные модели все шире применяются в реальных сценариях — от анализа медицинских снимков до автономного вождения, где ошибки восприятия могут иметь серьезные последствия.
Moonshot ИИ также отмечает, что Kimi K3, их открытая модель, сократила разрыв с западными конкурентами на общих бенчмарках, но в визуальном восприятии теперь работает наравне с ними. Ранее та же команда выпустила WorldVQA, где лучшая модель Gemini 3 Pro набрала лишь 47,4%, а отдельное исследование BabyVision показало, что frontier-модели проваливают базовые визуальные задачи, с которыми справляются дети: Gemini 3 Pro набрала 49,7% против 94,1% у людей. Исследователи связывают это с «вербализационным узким местом» — потерей точности при переводе визуальной информации в язык. PerceptionBench доступен на GitHub, что позволяет сообществу воспроизводить результаты и дорабатывать модели.



