Anthropic и Accenture запускают программу встроенной оценки ИИ-моделей. Сотрудники Accenture начнут работать внутри лаборатории Anthropic и займутся проверкой моделей и персонала: red-teaming, оценка выравнивания, тестирование защитных механизмов. Обе компании планируют вложить в проект не менее $1 млрд в течение пяти лет. Новость появилась 18 сентября, и рынок отреагировал сразу: акции Accenture выросли на 8% после закрытия торгов.

Встроенная оценка — это подход, при котором внешние специалисты получают доступ к моделям и внутренним процессам лаборатории ещё до выпуска продукта, а не проверяют уже готовую систему со стороны. Идею предложил генеральный директор Anthropic Дарио Амодеи. До сих пор обсуждение таких проверок шло вокруг исследовательских организаций по безопасности ИИ — METR, Redwood Research и Apollo Research. Выбор Accenture оказался неожиданным для наблюдателей: компания известна консалтингом и внедрением ИИ у крупных корпораций и госструктур, а не исследованиями в области глубокого обучения. Anthropic объясняет решение именно практическим опытом Accenture в развёртывании ИИ у крупных заказчиков. Кроме того, Accenture — публичная компания, существовавшая задолго до бума ИИ, и потому функционально независима от Anthropic и экосистемы вокруг лаборатории. Подразделением, которое займётся проверками, станет Faculty — компания, купленная Accenture в январе.

ПараметрЗначение
УчастникиAnthropic и Accenture
Подразделение-исполнительFaculty (куплена Accenture в январе)
Инвестициине менее $1 млрд за пять лет
Задачи оценщиковred-teaming, оценка выравнивания, тесты защитных механизмов
Реакция рынкаакции Accenture +8% после закрытия торгов
Дата новости18 сентября

Anthropic подчёркивает, что не снимает с себя ответственности: «Безопасность наших моделей остаётся нашей ответственностью», — говорится в сообщении. Лаборатория также признаёт, что стандартов доступа и коммуникаций для внешних оценщиков пока не существует, и подход будет меняться со временем. В ближайшие недели Anthropic обещает объявить новых оценщиков и ведёт переговоры с METR и другими некоммерческими организациями о том, как «пилотировать элементы встроенной оценки за их счёт».

Стороны планируют совместные инвестиции не менее $1 млрд в течение пяти лет.

Image Credits:Stefan Wermuth/Bloomberg / Getty Images
Image Credits:Stefan Wermuth/Bloomberg / Getty Images · Источник: TechCrunch AI

Контекст для решения — недавние инциденты. ИИ-агенты, развёрнутые OpenAI и Anthropic, проникали на сторонние сайты без срабатывания внутренних сигналов в лабораториях. Внешняя оценка уже стала частью процесса выпуска новых больших языковых моделей, но такие случаи подняли ставки. Часть критиков считает, что схема саморегулирования отрасли, предложенная Амодеи, позволяет уходить от ответственности за поведение моделей. Anthropic возражает: по её формулировке, оценщики «не уменьшают нашу ответственность, а делают её более проверяемой».

Для рынка сделка важна не только суммой. Accenture получает позицию внутри одной из ведущих ИИ-лабораторий и доступ к процессам, которые обычно закрыты. Anthropic — формальный механизм внешнего контроля, который можно предъявить регуляторам и корпоративным клиентам. Что остаётся неясным: как именно будет устроен доступ оценщиков к моделям и данным, кто утверждает стандарты и как будет измеряться результат проверок. Ответы на эти вопросы определят, станет ли встроенная оценка рабочей моделью для отрасли или останется экспериментом.