Автор Habr провел необычное сравнение: он предложил двум популярным ИИ-моделям, Qwen 3.7-Plus и Grok, решить советские загадки на внимательность. В тест также была включена модель детекции объектов Owlv2 от Google, чтобы оценить, как разные архитектуры справляются с задачами, требующими визуального анализа и логики.

Советские загадки — это классические головоломки, где по картинке нужно ответить на вопросы, требующие внимания к деталям и дедукции. Например, определить, сколько туристов в лагере, когда они приехали и откуда дует ветер. Такие тесты интересны тем, что модели не могли заранее выучить ответы, если они не встречались в обучающих данных. Автор отмечает, что вероятность «заучивания» была, но результаты показали, что модели анализировали изображения.

Первый этап — поиск предметов на двух картинках. Owlv2, созданная для точного определения координат объектов, пыталась захватить всю картинку, но столкнулась с трудностями: она обучалась на реальных фотографиях, а не на рисунках, и перекрывающиеся объекты в тележке сбивали ее. В итоге она нашла лишь пару предметов из десяти. Qwen справился лучше, но часто давал ответы с оговорками, пытаясь угадать, если не был уверен. Например, на вопрос о конфете он предположил, что это может быть оранжевая коробка или бант, демонстрируя неуверенность. Grok пошел другим путем: при нехватке данных он просто дорисовывал недостающие объекты на изображении, изменяя его. Это связано с архитектурой: энкодер сжимает картинку, теряя часть пикселей, а декодер «перерисовывает» ее по сжатым токенам.

Owlv2 от Google, обученная на реальных изображениях, не справилась с нарисованными картинками.

Вторая часть теста — советские загадки. Qwen на вопрос о количестве туристов ответил, что их трое, основываясь на списке дежурств с тремя именами, но не заметил четвертого мальчика за кустами и сачок. После подсказки он дал более точные ответы: туристы приехали несколько дней назад (судя по паутине), на лодке (весла прислонены к дереву). Grok, вероятно, тоже давал ответы, но автор не приводит их в отрывке. Важно, что модели не могут сказать «я не знаю» и пытаются казаться уверенными, что создает проблемы для интерпретации их ответов в реальных задачах.

Этот тест подчеркивает различия в подходах: Owlv2 — строгая инженерная модель для детекции, Qwen — универсальная VLM с тенденцией к генерации правдоподобных, но не всегда верных ответов, Grok — модель, которая может изменять входные данные. Для пользователей это означает, что при работе с ИИ важно учитывать его ограничения и проверять результаты, особенно в задачах, требующих точности. Архитектура модели напрямую влияет на то, как она обрабатывает визуальную информацию и рассуждает, что видно на этом примере.