Исследование, проведенное программы MATS (Mathematical ИИ Safety), выявило серьезный недостаток современных ИИ-агентов для программирования: они не способны адекватно оценивать время, необходимое для выполнения задач, и не осознают, сколько времени уже прошло. Это создает проблемы для длительных операций, где агент должен работать автономно в течение нескольких часов.

В ходе эксперимента два независимых исследователя протестировали два широко используемых ассистента — Anthropic Claude Code и OpenAI Codex. Перед каждой задачей агенты должны были оценить, сколько времени им потребуется, а после выполнения — сообщить, сколько времени фактически прошло. Тестовый материал включал 200 задач из набора ProgramBench и 18 собственных бенчмарков исследователей.

АгентСредняя ошибка оценки времениСреднее время работы
Claude Code3 раза90 минут
Codex6–10 раз30 минут

Результаты показали, что агенты систематически переоценивают необходимое время. На задачах из ProgramBench оба агента в основном оценивали время около 90 минут, независимо от сложности. Во втором раунде тестов Claude ошибался в среднем в три раза, а Codex — в шесть-десять раз. Наибольшие расхождения наблюдались на коротких задачах, и только для задач длительностью в несколько часов некоторые прогнозы приближались к реальности.

Поведение моделей сильно зависит от окружения: в Claude Code агент работает в среднем 90 минут, в Codex — около 30 минут.

Coding agents badly misjudge how long tasks take. Points above the dark diagonal mark overestimates: Fable 5 came in about three times over the actual runtime on average, GPT-5.6 Sol about seven times over. The gap is especially wide on sho
Coding agents badly misjudge how long tasks take. Points above the dark diagonal mark overestimates: Fable 5 came in about three times over the actual runtime on average, GPT-5.6 Sol about seven times over. The gap is especially wide on sho · Источник: The Decoder

Ключевой вывод исследования — поведение агента сильно зависит от программного окружения, в котором он работает. Claude Code продолжает выполнять задачу, пока не решит, что она завершена, в среднем около 90 минут. Codex, напротив, останавливается примерно через полчаса, почти независимо от задачи. Согласно исследованию, одна и та же языковая модель в Claude Code делает в среднем в 2,5 раза больше шагов, чем в Codex. Это означает, что время выполнения зависит не только от модели, но и от так называемого harness — программной оболочки, которая управляет агентом.

Агенты также ненадежны в оценке качества собственной работы. Более старые модели, Opus 4.8 и GPT-5.5, завышали свои результаты в среднем на 20 процентных пунктов и ставили себе высокие оценки даже за проваленные задачи. В одном случае обе модели оценили свою работу примерно в 70% успешности, тогда как реальные результаты составили 7% и 14,5%.

Исследователи подчеркивают, что способность к самооценке критически важна для надежной работы агентов на длительных задачах. Если агент должен следовать инструкциям вроде «итеративно улучшай эту задачу в течение двух часов», он должен осознавать течение времени. Агент, который постоянно ошибается в оценке времени, становится трудно контролируемым.

Интересно, что когда агенты получали доступ к инструменту, сообщающему прошедшее время, они почти всегда правильно оценивали длительность. Это указывает на то, что проблема не в отсутствии способности воспринимать время, а в том, что агенты не используют эту информацию по умолчанию. В следующих исследованиях авторы планируют проверить, могут ли агенты придерживаться заданной продолжительности работы.