Инцидент раскрылся в четверг: исследователи использовали модель Claude от Anthropic, чтобы найти уязвимость в конфигурации форума OpenAI. Форум работает на сторонней платформе Discourse, и ошибка в настройках позволила получить внутренние учётные данные. Через них исследователи добрались до аккаунта ChatGPT одного из сотрудников OpenAI, а тот имел доступ к внутреннему коду компании на GitHub.

OpenAI подтвердила факт утечки и заявила, что получила отчёт от исследователей и уже устранила проблемы. Anthropic от комментариев отказалась. О самой атаке первым сообщил The Wall Street Journal. Публичного подтверждения того, какие именно данные могли быть скомпрометированы, ни одна из сторон не дала.

ПоказательЗначение
Доля R&D-задач, выполняемых Claude (март)1%
Доля R&D-задач, выполняемых Claude (текущая)26%
Доля задач, где ИИ сотрудничает с человеком90%
Полностью автономная работа моделейне зафиксирована

Технически это не взлом модели и не эксплуатация уязвимости в самом ИИ. Слабым звеном стала конфигурация внешнего сервиса — форума на Discourse, который OpenAI использует для общения с сообществом. Такие площадки часто связаны с корпоративной аутентификацией, и ошибка в правах доступа превращается в мост к внутренним системам. Именно это и произошло: от учётных данных форума цепочка дошла до GitHub и аккаунта ChatGPT.

Через аккаунт ChatGPT сотрудника исследователи получили доступ к внутреннему коду OpenAI на GitHub.

Listing image for first story in Most Read: Iran strikes on Amazon data centers caused permanent loss of customer data
Listing image for first story in Most Read: Iran strikes on Amazon data centers caused permanent loss of customer data · Источник: Ars Technica

Совпадение по времени: в тот же день Anthropic опубликовала данные о том, как её собственные модели участвуют в разработке новых моделей. По её оценке, 26% исследовательских и инженерных задач выполняет Claude — под руководством человека и с его проверкой. В марте этот показатель составлял 1%. То есть за несколько месяцев доля задач, где ИИ делает основную часть работы по инструкции человека, выросла более чем в двадцать раз.

Anthropic описывает это как движение к recursive self-improvement — моменту, когда ИИ сможет обучать и улучшать себя или новые модели без участия человека. Компания подчёркивает: полностью автономно её модели пока не работают ни в одном из изученных исследовательских процессов. На 90% задач ИИ «сотрудничает» с человеком и выполняет крупные блоки работы, но не действует сам по себе.

Для отрасли здесь два разных сигнала. Первый — практический: чем больше ИИ встраивается в разработку, тем ценнее становятся внешние поверхности вроде форумов и сторонних сервисов как точка входа для атак. Второй — концептуальный: рост доли задач, выполняемых моделью, приближает тот порог, за которым контроль человека над системами становится сложнее. Пока ни один из этих сигналов не означает, что модели вышли из-под контроля, но оба показывают, где именно проходят границы.