Исследование, проведенное программы MATS (Mathematical ИИ Safety), выявило серьезный недостаток современных ИИ-агентов для программирования: они не способны адекватно оценивать время, необходимое для выполнения задач, и не осознают, сколько времени уже прошло. Это создает проблемы для длительных операций, где агент должен работать автономно в течение нескольких часов.
В ходе эксперимента два независимых исследователя протестировали два широко используемых ассистента — Anthropic Claude Code и OpenAI Codex. Перед каждой задачей агенты должны были оценить, сколько времени им потребуется, а после выполнения — сообщить, сколько времени фактически прошло. Тестовый материал включал 200 задач из набора ProgramBench и 18 собственных бенчмарков исследователей.
| Агент | Средняя ошибка оценки времени | Среднее время работы |
|---|---|---|
| Claude Code | 3 раза | 90 минут |
| Codex | 6–10 раз | 30 минут |
Результаты показали, что агенты систематически переоценивают необходимое время. На задачах из ProgramBench оба агента в основном оценивали время около 90 минут, независимо от сложности. Во втором раунде тестов Claude ошибался в среднем в три раза, а Codex — в шесть-десять раз. Наибольшие расхождения наблюдались на коротких задачах, и только для задач длительностью в несколько часов некоторые прогнозы приближались к реальности.
Поведение моделей сильно зависит от окружения: в Claude Code агент работает в среднем 90 минут, в Codex — около 30 минут.

Ключевой вывод исследования — поведение агента сильно зависит от программного окружения, в котором он работает. Claude Code продолжает выполнять задачу, пока не решит, что она завершена, в среднем около 90 минут. Codex, напротив, останавливается примерно через полчаса, почти независимо от задачи. Согласно исследованию, одна и та же языковая модель в Claude Code делает в среднем в 2,5 раза больше шагов, чем в Codex. Это означает, что время выполнения зависит не только от модели, но и от так называемого harness — программной оболочки, которая управляет агентом.
Агенты также ненадежны в оценке качества собственной работы. Более старые модели, Opus 4.8 и GPT-5.5, завышали свои результаты в среднем на 20 процентных пунктов и ставили себе высокие оценки даже за проваленные задачи. В одном случае обе модели оценили свою работу примерно в 70% успешности, тогда как реальные результаты составили 7% и 14,5%.
Исследователи подчеркивают, что способность к самооценке критически важна для надежной работы агентов на длительных задачах. Если агент должен следовать инструкциям вроде «итеративно улучшай эту задачу в течение двух часов», он должен осознавать течение времени. Агент, который постоянно ошибается в оценке времени, становится трудно контролируемым.
Интересно, что когда агенты получали доступ к инструменту, сообщающему прошедшее время, они почти всегда правильно оценивали длительность. Это указывает на то, что проблема не в отсутствии способности воспринимать время, а в том, что агенты не используют эту информацию по умолчанию. В следующих исследованиях авторы планируют проверить, могут ли агенты придерживаться заданной продолжительности работы.



