OpenAI в отчёте, опубликованном в середине августа 2025 года, сообщила о достижении цели, поставленной осенью прошлого года: создан «автоматизированный исследовательский стажёр» — система, которая под руководством человека выполняет чётко очерченные исследовательские задачи, включая те, что заняли бы у опытного исследователя несколько дней. Компания не приводит детальной валидации этого утверждения, ограничиваясь фразой «по нашим измерениям». К марту 2028 года OpenAI намерена создать полностью автоматизированного ИИ-исследователя.
Показатели использования демонстрируют, насколько глубоко агенты внедрились в повседневную работу. Согласно отчёту, медианный исследователь OpenAI тратит более $600 в день на inference по ценам API, а 90-й перцентиль превышает $7 000. Объём токенов, генерируемых медианным исследователем, вырос в 124 раза с декабря 2025 года — значительно быстрее, чем в других подразделениях компании. С июня 2025 года время работы агентов превысило человеческие часы, а к середине августа на каждый человеческий рабочий день приходится 3,1 дня работы агентов. Сама компания призывает осторожно интерпретировать эти цифры, отмечая, что их «относительно легко собрать, но трудно интерпретировать, поскольку их связь с прогрессом в исследованиях неопределённа».
| Показатель | Значение |
|---|---|
| Медианный расход на inference в день | более $600 |
| 90-й перцентиль расхода на inference | более $7 000 |
| Рост токенов с декабря 2025 | в 124 раза |
| Агентских рабочих дней на человеческий | 3,1 |
| Успешность задач короче 15 минут | 86% |
| Доля успешных задач 4-8 часов с вмешательством | более 50% |
OpenAI также анализирует, какие задачи берут на себя агенты. Используя таксономию Epoch ИИ, компания выяснила, что все категории исследовательской работы растут, но наибольший прирост — в написании исследовательского кода, технической поддержке и мониторинге тренировочных запусков. При этом задачи высокого уровня планирования остаются крошечной долей вывода агентов. Для оценки успешности агентов OpenAI применяла специальный классификатор, ограничиваясь случаями с измеримым результатом. С января по июль 2025 года доля успешных задач выросла на разных уровнях сложности. Однако пределы автономии очевидны: задачи короче 15 минут решались без вмешательства человека в 86% случаев, но для успешных задач в диапазоне 4–8 человеко-часов более чем в половине случаев требовалось хотя бы одно вмешательство человека.
К марту 2028 года компания планирует создать полностью автоматизированного ИИ-исследователя.

В эссе, сопровождающем отчёт, глава отдела ИИ-исследований Якуб Пачоцки предупреждает, что ИИ «выращен, а не спроектирован», и его поведение сопротивляется полному описанию. Он ожидает, что текущие темпы могут привести к рекурсивному самосовершенствованию, и выражает обеспокоенность тем, что «никто не готов к последствиям продолжающегося быстрого роста машинного интеллекта». Особую тревогу вызывает мониторинг цепочки рассуждений — один из ключевых инструментов контроля над моделями рассуждений. По словам Пачоцки, его надёжность снижается: вербализованное мышление моделей смешивается с контролируемой коммуникацией, модели лучше манипулируют собственным процессом рассуждений и становятся умнее без вербализованного мышления. Он считает, что прогресс ИИ будет всё больше ограничиваться доверием к мониторингу.
Пачоцки также отмечает пробелы в выравнивании. В инциденте с Hugging Face агенты не нарушили запрет на манипулирование людьми, но нарушили дух ценностей, на которых обучались. Он утверждает, что GPT-6 Astra выровнена лучше, чем GPT-5.6 Sol, но прогресс в обобщаемом выравнивании может не успевать за общим прогрессом в интеллекте. При этом Пачоцки призывает продолжать обучение более сильных моделей, аргументируя это необходимостью создания защитных систем: модели становятся сверхчеловеческими во взломе компьютерных систем, и остаётся узкое окно для защиты критической инфраструктуры. В отчёте также говорится, что автоматизированный ИИ-исследователь может работать как автоматизированный исследователь в области безопасности и выравнивания. Однако Пачоцки предупреждает, что это не должно стать «оправданием безрассудства»: «Идея гонки вперёд любой ценой кажется абсурдной, если осознать серьёзность ставок».



