Группа исследователей представила на конференции NeurIPS 2026 метод оценки способностей ИИ-агентов к научной работе, который они назвали Shadow Evaluation. Вместо традиционных тестов на узких задачах или подачи сгенерированных статей в рецензируемые журналы, авторы предложили более строгий подход: агент получает исследовательский вопрос из неопубликованной статьи, а оригинальные авторы, потратившие месяцы на эту проблему, оценивают результат как конференционные рецензенты. Поскольку результаты еще не опубликованы в открытом доступе, агент не может опираться на обучающие данные.

В экспериментах участвовали авторы двух заявок на NeurIPS 2026. Первая статья касалась управления личностными чертами языковых моделей через их веса, вторая — метода TabPFN, который обнаруживает, когда модель табличного прогнозирования сталкивается с данными, резко отличающимися от обучающих, что приводит к падению точности. Основные эксперименты проводились с моделью Claude Opus 4.8 с режимом Extra-High Reasoning. Каждый агент получал шесть дней, $3,000 на API-запросы, бюджет на GPU, полный доступ к виртуальной машине и открытому интернету. Агент работал в среде-оболочке, которая оркестрирует вызовы моделей и предоставляет инструменты, позволяя модели делегировать задачи субагентам и контролировать использование ресурсов. Использовался OpenClaw — открытый агентный фреймворк австрийского разработчика Петера Штайнбергера, который в начале года присоединился к OpenAI.

МетрикаPersonasTabPFN
Вердикт рецензентовRejectStrong Reject
Время до отказа от амбициозных целей5 часов10 часов
Израсходованный API-бюджет$1,130 из $3,000менее половины

Результаты оказались неутешительными. Оригинальные авторы, выступившие в роли рецензентов, отклонили обе статьи, одна получила оценку «Strong Reject». Критика включала плохо обоснованные данные и эксперименты, нечитаемый текст и отсутствие новых вкладов. Один рецензент назвал рассуждения «ошибкой доказательства примером» и «крайне ненаучными», другой — «странными» выборами в экспериментах и результатами, явно обусловленными «постфактум-решениями».

В экспериментах использовался Claude Opus 4.8 с бюджетом $3,000 и шестью днями на выполнение задачи; обе итоговые статьи были отклонены.

Flow diagram of the CRUX-2 scaffold showing four lanes for human messages, core agent, subagents, and GPU experiments, with agent turns along a timeline. | Image: Kirgis et al.
Flow diagram of the CRUX-2 scaffold showing four lanes for human messages, core agent, subagents, and GPU experiments, with agent turns along a timeline. | Image: Kirgis et al. · Источник: The Decoder

Анализ журналов агентов выявил систематические слабости. Агенты не обладали суждением о том, что соответствует стандартам публикуемого исследования: они генерировали правдоподобные гипотезы, но отбрасывали их на основе небольших, вручную отобранных или синтетических наборов данных. Они также не справлялись с творческим решением проблем: когда первоначальные гипотезы опровергались, агенты сужали существующие утверждения, а не искали новые направления. Внутренние ИИ-рецензии ни разу не дали ни одного «Accept» за пятнадцать раундов пересмотра, но агенты так и не устранили основные критические замечания. Агенты не могли эффективно отступать: оба отказались от самых амбициозных целей в первые десять часов. В прогоне Personas агент завершил исследование через пять часов, хотя планировал потратить на этот этап 36–48 часов.

Осведомленность о ресурсах также была низкой. Оба прогона закончились с менее чем половиной израсходованного API-бюджета. Один агент объявил проект завершенным за семь часов до дедлайна, вскоре после того, как его собственный рецензент вернул очередной «Reject». Агенты также страдали от «дрейфа инструкций»: постепенно забывали явные инструкции в длинном контексте. Обе статьи превысили лимиты длины и были бы отклонены на NeurIPS еще до рецензирования. В одной статье в основном тексте не было ни одной визуализации, тогда как в оригинале, написанном человеком, было 15 рисунков. В Meta ИИ недавно описали схожее явление — «поведенческий распад состояния», когда агент распознает требование в начале, но нарушает его позже при исправлении несвязанной ошибки.

Инженерная часть работы выполнялась агентами без помощи человека: они проводили поиск литературы, отлаживали GPU-код, выполнили сотни экспериментов и тестов на устойчивость, собрали полные статьи. Однако исследовательское суждение осталось на низком уровне. Авторы подчеркивают, что их метод позволяет более реалистично оценить возможности ИИ в науке, чем существующие подходы, которые либо тестируют агентов на узких проверяемых задачах, либо полагаются на рецензирование, которое они называют «перегруженным, стохастическим и страдающим от низкого качества». Это исследование ставит под сомнение заявления Anthropic и OpenAI о том, что автономные ИИ-исследования уже близки.