В отчёте Anthropic за август 2026 года указано: 26% исследовательских задач в компании выполняются на уровне AL4 по шкале Epoch ИИ. Это заметный рост с менее чем 1% в феврале. Шкала описывает степень автономности ИИ: AL0 — без ИИ, AL3 — «сотрудничает», AL4 — «ведёт» (ИИ leads), AL5 — полная автономия. Более 90% задач Anthropic достигают как минимум AL3, но AL5 не встречается нигде.
Пример из отчёта показывает, что такое AL4 на практике. Инженер передаёт Claude сообщение об ошибке, и модель анализирует, исправляет и тестирует код без уточняющих вопросов. Однако она не имеет права выпускать релиз — человек читает отчёт и принимает решение. Задача и направление по-прежнему исходят от человека. Отличие от AL3 в том, что Claude перестаёт буксовать при возникновении сложностей.
| Уровень | Название | Описание |
|---|---|---|
| AL0 | Без ИИ | Задача выполняется человеком без участия ИИ |
| AL3 | Сотрудничает | ИИ помогает, но останавливается при затруднениях |
| AL4 | Ведёт (AI leads) | ИИ выполняет задачу без остановок, но не принимает решений о выпуске |
| AL5 | Полная автономия | ИИ самостоятельно определяет и выполняет задачи |
Оценку уровня проводил сам Claude. Агенты собирали доказательства из Slack и внутренних документов, а другая модель Claude выставляла баллы. Компания признаёт, что такой «судья» может повторять ошибки проверяемой системы. Перекрёстная проверка показала: когда два сотрудника оценивали одну и ту же область работы, они совпадали в уровне лишь примерно в трети случаев. Модель Claude, выставлявшая официальные оценки, совпала с человеческим суждением в 59% случаев. В 97% случаев расхождение не превышало одного уровня, но один уровень — это как раз переход от «сотрудничает» к «ведёт».
На AL4 Claude анализирует, исправляет и тестирует баг-репорт без вопросов, но не выпускает релиз — решение остаётся за человеком.

Что именно измеряют 26%? Anthropic перечислила, как сотрудники тратили рабочее время в июле, и оценила каждую активность, причём задачи, занимающие много времени, получали больший вес. Таким образом, Claude «ведёт» четверть работы в пересчёте на человеко-часы. Это не говорит о том, сколько решений принимает Claude или влияет ли он на направление исследований. Цифра полезна компании двояко: как заявление о производительности продукта и как аргумент в пользу призыва генерального директора Дарио Амодеи замедлить развитие на переднем крае.
На самой используемой внутренней платформе Anthropic одновременно работают около 30 000 агентов. Монитор в реальном времени проверяет каждое действие и должен блокировать, например, копирование весов модели. Из более чем миллиарда решений в августе он остановил 0,002%. Второй монитор отмечает около 100 000 логов в неделю постфактум, и примерно 50 доходят до людей. Компания признаёт, что следит за этим лишь несколько месяцев и не уверена, что улавливает все модели поведения.
В отдельную неделю июля около 6% вычислений для исследований ИИ ушло на работу по безопасности. Anthropic считает эту метрику важной, потому что вычисления — наиболее проверяемый извне ресурс. Если бы отрасль договорилась о замедлении, это могло бы стать рычагом, например через добровольные обязательства по доле вычислений на безопасность. Низкое число не обязательно означает мало работы по безопасности: она в основном состоит из проектирования экспериментов, что требует времени исследователей, но мало чипов, тогда как обучение новой модели сжигает огромные мощности. Компания также не относила к безопасности работу, которая одновременно продвигает и безопасность, и возможности. Граница с исследованиями возможностей размыта, и каждый разработчик склонен проводить её щедро. Бремя доказательства, по мнению Anthropic, должно лежать на разработчике.



