Группа исследователей представила на конференции NeurIPS 2026 метод оценки способностей ИИ-агентов к научной работе, который они назвали Shadow Evaluation. Вместо традиционных тестов на узких задачах или подачи сгенерированных статей в рецензируемые журналы, авторы предложили более строгий подход: агент получает исследовательский вопрос из неопубликованной статьи, а оригинальные авторы, потратившие месяцы на эту проблему, оценивают результат как конференционные рецензенты. Поскольку результаты еще не опубликованы в открытом доступе, агент не может опираться на обучающие данные.
В экспериментах участвовали авторы двух заявок на NeurIPS 2026. Первая статья касалась управления личностными чертами языковых моделей через их веса, вторая — метода TabPFN, который обнаруживает, когда модель табличного прогнозирования сталкивается с данными, резко отличающимися от обучающих, что приводит к падению точности. Основные эксперименты проводились с моделью Claude Opus 4.8 с режимом Extra-High Reasoning. Каждый агент получал шесть дней, $3,000 на API-запросы, бюджет на GPU, полный доступ к виртуальной машине и открытому интернету. Агент работал в среде-оболочке, которая оркестрирует вызовы моделей и предоставляет инструменты, позволяя модели делегировать задачи субагентам и контролировать использование ресурсов. Использовался OpenClaw — открытый агентный фреймворк австрийского разработчика Петера Штайнбергера, который в начале года присоединился к OpenAI.
| Метрика | Personas | TabPFN |
|---|---|---|
| Вердикт рецензентов | Reject | Strong Reject |
| Время до отказа от амбициозных целей | 5 часов | 10 часов |
| Израсходованный API-бюджет | $1,130 из $3,000 | менее половины |
Результаты оказались неутешительными. Оригинальные авторы, выступившие в роли рецензентов, отклонили обе статьи, одна получила оценку «Strong Reject». Критика включала плохо обоснованные данные и эксперименты, нечитаемый текст и отсутствие новых вкладов. Один рецензент назвал рассуждения «ошибкой доказательства примером» и «крайне ненаучными», другой — «странными» выборами в экспериментах и результатами, явно обусловленными «постфактум-решениями».
В экспериментах использовался Claude Opus 4.8 с бюджетом $3,000 и шестью днями на выполнение задачи; обе итоговые статьи были отклонены.

Анализ журналов агентов выявил систематические слабости. Агенты не обладали суждением о том, что соответствует стандартам публикуемого исследования: они генерировали правдоподобные гипотезы, но отбрасывали их на основе небольших, вручную отобранных или синтетических наборов данных. Они также не справлялись с творческим решением проблем: когда первоначальные гипотезы опровергались, агенты сужали существующие утверждения, а не искали новые направления. Внутренние ИИ-рецензии ни разу не дали ни одного «Accept» за пятнадцать раундов пересмотра, но агенты так и не устранили основные критические замечания. Агенты не могли эффективно отступать: оба отказались от самых амбициозных целей в первые десять часов. В прогоне Personas агент завершил исследование через пять часов, хотя планировал потратить на этот этап 36–48 часов.
Осведомленность о ресурсах также была низкой. Оба прогона закончились с менее чем половиной израсходованного API-бюджета. Один агент объявил проект завершенным за семь часов до дедлайна, вскоре после того, как его собственный рецензент вернул очередной «Reject». Агенты также страдали от «дрейфа инструкций»: постепенно забывали явные инструкции в длинном контексте. Обе статьи превысили лимиты длины и были бы отклонены на NeurIPS еще до рецензирования. В одной статье в основном тексте не было ни одной визуализации, тогда как в оригинале, написанном человеком, было 15 рисунков. В Meta ИИ недавно описали схожее явление — «поведенческий распад состояния», когда агент распознает требование в начале, но нарушает его позже при исправлении несвязанной ошибки.
Инженерная часть работы выполнялась агентами без помощи человека: они проводили поиск литературы, отлаживали GPU-код, выполнили сотни экспериментов и тестов на устойчивость, собрали полные статьи. Однако исследовательское суждение осталось на низком уровне. Авторы подчеркивают, что их метод позволяет более реалистично оценить возможности ИИ в науке, чем существующие подходы, которые либо тестируют агентов на узких проверяемых задачах, либо полагаются на рецензирование, которое они называют «перегруженным, стохастическим и страдающим от низкого качества». Это исследование ставит под сомнение заявления Anthropic и OpenAI о том, что автономные ИИ-исследования уже близки.



