В отчёте Anthropic за август 2026 года указано: 26% исследовательских задач в компании выполняются на уровне AL4 по шкале Epoch ИИ. Это заметный рост с менее чем 1% в феврале. Шкала описывает степень автономности ИИ: AL0 — без ИИ, AL3 — «сотрудничает», AL4 — «ведёт» (ИИ leads), AL5 — полная автономия. Более 90% задач Anthropic достигают как минимум AL3, но AL5 не встречается нигде.

Пример из отчёта показывает, что такое AL4 на практике. Инженер передаёт Claude сообщение об ошибке, и модель анализирует, исправляет и тестирует код без уточняющих вопросов. Однако она не имеет права выпускать релиз — человек читает отчёт и принимает решение. Задача и направление по-прежнему исходят от человека. Отличие от AL3 в том, что Claude перестаёт буксовать при возникновении сложностей.

УровеньНазваниеОписание
AL0Без ИИЗадача выполняется человеком без участия ИИ
AL3СотрудничаетИИ помогает, но останавливается при затруднениях
AL4Ведёт (AI leads)ИИ выполняет задачу без остановок, но не принимает решений о выпуске
AL5Полная автономияИИ самостоятельно определяет и выполняет задачи

Оценку уровня проводил сам Claude. Агенты собирали доказательства из Slack и внутренних документов, а другая модель Claude выставляла баллы. Компания признаёт, что такой «судья» может повторять ошибки проверяемой системы. Перекрёстная проверка показала: когда два сотрудника оценивали одну и ту же область работы, они совпадали в уровне лишь примерно в трети случаев. Модель Claude, выставлявшая официальные оценки, совпала с человеческим суждением в 59% случаев. В 97% случаев расхождение не превышало одного уровня, но один уровень — это как раз переход от «сотрудничает» к «ведёт».

На AL4 Claude анализирует, исправляет и тестирует баг-репорт без вопросов, но не выпускает релиз — решение остаётся за человеком.

Image description
Image description · Источник: The Decoder

Что именно измеряют 26%? Anthropic перечислила, как сотрудники тратили рабочее время в июле, и оценила каждую активность, причём задачи, занимающие много времени, получали больший вес. Таким образом, Claude «ведёт» четверть работы в пересчёте на человеко-часы. Это не говорит о том, сколько решений принимает Claude или влияет ли он на направление исследований. Цифра полезна компании двояко: как заявление о производительности продукта и как аргумент в пользу призыва генерального директора Дарио Амодеи замедлить развитие на переднем крае.

На самой используемой внутренней платформе Anthropic одновременно работают около 30 000 агентов. Монитор в реальном времени проверяет каждое действие и должен блокировать, например, копирование весов модели. Из более чем миллиарда решений в августе он остановил 0,002%. Второй монитор отмечает около 100 000 логов в неделю постфактум, и примерно 50 доходят до людей. Компания признаёт, что следит за этим лишь несколько месяцев и не уверена, что улавливает все модели поведения.

В отдельную неделю июля около 6% вычислений для исследований ИИ ушло на работу по безопасности. Anthropic считает эту метрику важной, потому что вычисления — наиболее проверяемый извне ресурс. Если бы отрасль договорилась о замедлении, это могло бы стать рычагом, например через добровольные обязательства по доле вычислений на безопасность. Низкое число не обязательно означает мало работы по безопасности: она в основном состоит из проектирования экспериментов, что требует времени исследователей, но мало чипов, тогда как обучение новой модели сжигает огромные мощности. Компания также не относила к безопасности работу, которая одновременно продвигает и безопасность, и возможности. Граница с исследованиями возможностей размыта, и каждый разработчик склонен проводить её щедро. Бремя доказательства, по мнению Anthropic, должно лежать на разработчике.