Исследователи из Лаборатории компьютерных наук и искусственного интеллекта MIT представили фреймворк Mental World Modeling (MWM), который расширяет классические мир-модели ментальными переменными — убеждениями, вниманием, целями, намерениями, эмоциями, нормами и социальными отношениями. Работа опубликована на GitHub, а тесты проводились на новом датасете Menti-Bench. Основная идея: мир-модель, которая отслеживает только физические объекты, не может предсказать действия человека, потому что игнорирует его знания о мире.

Классические мир-модели в ИИ симулируют физическое состояние среды: где находятся объекты, как они движутся. Но поведение человека определяется не только физикой, но и его ментальным состоянием. Например, если чью-то кружку переставили в шкаф, пока человек не смотрел, физическая модель увидит корректную сцену, но предскажет неверное следующее действие. Только модель, которая отслеживает убеждение человека о местонахождении кружки, объяснит, что он будет делать. MWM связывает физическое и ментальное состояния, рендерит вид от первого лица для целевого агента и симулирует, как действие меняет оба состояния.

МетодF1
Прямые ответы63,3
Самосогласованность77,9
MWM (полный пайплайн)87,9
Человек98,5

Для проверки теории авторы построили MENTIS — модульный пайплайн без дополнительного обучения. Он разбивает процесс на шесть шагов: парсинг сцены, рендеринг эго-перспективы, разделение вариантов действия на физические и ментальные компоненты, параллельная симуляция состояний, оценка по трём критериям (физическая правдоподобность, ментальная согласованность, социальная уместность) и детерминированное решение. Каждый этап пишет машиночитаемый промежуточный результат, что позволяет отследить ошибки.

В тестах на Menti-Bench точность выросла с 63,3 (прямые ответы) до 87,9 F1 с полным пайплайном.

A world model that only tracks objects predicts the wrong action for the same scene because it ignores what the person knows.
A world model that only tracks objects predicts the wrong action for the same scene because it ignores what the person knows. · Источник: The Decoder

Оценка проводилась на датасете Menti-Bench, содержащем 448 сцен: 320 текстовых описаний, 100 историй с картинками и 28 видео со звуком. В каждой сцене — шесть вариантов ответа и эталонное решение, документирующее не только правильное действие, но и лежащие в его основе ментальные и физические состояния. 78% сцен включают минимум двух персонажей.

Команда протестировала восемь языковых моделей, включая пять от OpenAI (GPT-5.6-Sol, GPT-4.1) и три от Anthropic (Claude Fable 5, Claude Opus 4.8, Claude Haiku 4.5). Точность измерялась F1-метрикой. Прямые ответы дали 63,3, самосогласованность (модель отвечает шесть раз и выбирает самый частый ответ) — 77,9, полный пайплайн MWM — 87,9. Люди достигают 98,5. Каждый добавленный слой моделирования улучшает предсказания, а удаление ментального или физического канала стоит двузначных потерь F1. Прирост нельзя воспроизвести простым сэмплированием прямых ответов: слабая модель с MWM (GPT-4.1, 84,9) превосходит сильную с самосогласованностью без MWM (GPT-5.6-Sol, 83,6).

Дополнительные тесты подтверждают ключевые предположения. Без ментального канала модели теряют в среднем 12,1 пункта, без физического — 16,5. Если переходы предсказывать независимо, а не связанно, теряется 6,4 пункта. Самый большой эффект даёт корректная симуляция переходов состояний — это центральное узкое место. Ментальное моделирование сильнее всего влияет в межличностных сценах: прирост F1 — 26,4 пункта, в объектно-ориентированных — только 14,0. Слабые модели выигрывают от явной структуры больше, чем сильные: разрыв между MWM и прямыми ответами для GPT-4.1 — 28 пунктов, для GPT-5.6-Sol — 21.

Авторы не претендуют на симуляцию сознания. Ментальные состояния — это гипотезы, выводимые из поведения и контекста, а не измерения. Системы, построенные на фреймворке, должны представлять неопределённость и сохранять прозрачность допущений. Это важно для практического применения: если ИИ-агент будет действовать на основе неверных предположений о намерениях человека, последствия могут быть серьёзными.

MWM couples physical and mental world states, renders a first-person view for the target agent, and simulates how an action changes both states.
MWM couples physical and mental world states, renders a first-person view for the target agent, and simulates how an action changes both states. · Источник: The Decoder

Ограничения работы связаны с тем, что MENTIS — это тренировочный-free пайплайн, который не обучается на данных, а использует готовые модели. Это упрощает внедрение, но может ограничивать масштабируемость. Тем не менее, результаты показывают, что учёт ментальных состояний — не роскошь, а необходимость для систем, которые должны предсказывать поведение людей в социальных контекстах.