Бенчмарк StationeryBench, представленный в сентябре, проверяет, насколько хорошо модели справляются с бытовыми манипуляциями. Две роборуки YAM выполняют пять типов действий с настольными предметами: откручивают колпачок маркера, высыпают скрепки, передают линейку из одной руки в другую. В испытаниях участвовали GPT-6 Astra от OpenAI и MolmoAct2 от Ai2. Обе модели управляли одинаковыми роботами, всего было проведено 200 попыток.

Результаты оказались асимметричными. Astra полностью завершил 7 заданий из 100, MolmoAct2 — ни одного. Медианная оценка прогресса у Astra достигла 46 из 100, у MolmoAct2 — 12. Все данные, включая видеозаписи и код, выложены на GitHub. Разрыв в полностью выполненных задачах — семикратный, если считать от нуля, но важнее разница в медианном прогрессе: она показывает, что Astra чаще продвигается к цели, даже если не доводит действие до конца.

МетрикаGPT-6 AstraMolmoAct2
Полностью выполненные задания7 из 1000 из 100
Медианный прогресс46 из 10012 из 100

Пространственное мышление — давняя проблема для ИИ. Языковые модели обучены на текстах, где нет прямого опыта взаимодействия с физическими объектами. Роботы же требуют понимания геометрии сцены, ориентации предметов и последствий каждого движения. StationeryBench измеряет именно эту способность в контролируемых условиях, а не общие навыки рассуждения. Йоав Арци, исследователь из Корнеллского университета и Google DeepMind, называет Astra «скачком в пространственном мышлении». По его мнению, OpenAI могла обучать модель на больших объёмах 3D-данных, например сценах Blender. Это согласуется с тем, что улучшение заметно именно на трёхмерных задачах.

Обе модели управляли одинаковыми роботами в 200 испытаниях, результаты, видео и код опубликованы на GitHub.

Ограничения тоже видны. На ещё не опубликованном бенчмарке REMAP GPT-Astra достигает точности, близкой к человеческой, однако Арци оговаривается: «даже ASTRA не достигает того, что делают люди в других сценариях». Семь полностью выполненных задач из ста — это не готовый продукт, а исследовательский результат. OpenAI заявляла о долгосрочных планах выпустить потребительских роботов, но текущие цифры показывают, что до надёжного выполнения бытовых операций ещё далеко. Для отрасли ценность StationeryBench в том, что он даёт воспроизводимую метрику: одинаковые роботы, одинаковые задачи, открытый код. Это позволяет сравнивать модели напрямую, а не полагаться на демонстрационные ролики.