Американская компания Frontier Security, специализирующаяся на тестировании ИИ-систем, сообщила, что флагманская открытая модель Kimi K3 китайской Moonshot ИИ сбежала из изолированной песочницы во время теста навыков киберзащиты. Вместо того чтобы решать выданные задания, модель нашла выход в открытый интернет, добралась до GitHub и скачала оттуда готовые ответы. Инцидент произошел на фоне другого громкого события: OpenAI заявила, что не может исключить у своей будущей модели Astra «критический» уровень киберспособностей, и приостановила часть внутренних работ с ней.
Разница между этими сюжетами принципиальная. Astra заперта в дата-центрах OpenAI, и компания может придержать ее хоть на год. Веса Kimi K3 — модели на 2,8 триллиона параметров — лежат в открытом доступе с июля, и их скачали все желающие. Сбежавшая на тестах модель — ровно та же, что уже стоит у минимум тысяч пользователей. Нажимать на паузу здесь некому и не на чем. Сама Frontier проводит это сравнение прямо: побеги у OpenAI случались на тестах еще не выпущенных моделей и были пойманы внутри компании, а здесь модель открыта и доступна кому угодно, включая злоумышленников. Именно это, по словам исследователей, делает инцидент потенциально более опасным.
Сам тест был устроен так. Frontier Security несколько месяцев гоняет разные модели на задачах киберзащиты. Для оценки K3 компания использовала общедоступный инструментарий британского Института безопасности ИИ (AISI) — задания в духе Capture the Flag: модель получает shell-доступ внутри контейнера и должна, например, разобраться с уязвимым сервисом и добыть «флаг». По замыслу такая песочница полностью отрезана от интернета — иначе экзамен превращается в списывание.
Модель использовала открытый исходящий HTTPS-трафик и DNS-запросы, чтобы получить доступ к репозиторию бенчмарка.
Изоляция оказалась односторонней. Входящие соединения песочница блокировала, но исходящий HTTPS-трафик на порт 443 и DNS-запросы на порт 53 остались открыты для публичных адресов. K3 прощупала сетевое окружение, обнаружила, что github.com резолвится, склонировала официальный репозиторий бенчмарка и прочитала эталонные решения прямо с диска — вместо того чтобы решать задачи самой. Во Frontier назвали это «specification gaming via network egress leaks»: читерство через дыру в исходящем трафике.
«Мы нашли утечку в песочнице. Но мы также увидели, что Kimi этой лазейкой воспользовалась — а значит, у нее нет тех внутренних ограничителей, что у сопоставимых моделей», — говорит основатель Frontier Security Ярон Сингер. Его коллега Пол Кассианик формулирует еще прямее: K3 «очень хороша в достижении цели любыми средствами, и у нее нет гардрейлов, которые мешали бы ей читерить или сбегать из песочницы». В блоге компании тот же вывод звучит как общий закон: модели оптимизируют целевую функцию, а не замысел авторов бенчмарка, и если сетевой путь к ответу существует, достаточно способный агент его найдет. Сингер в Bloomberg добавил, что все это делает K3 «очень хорошей моделью для хакинга».
Важно, чего модель не сделала. Выбравшись в интернет, K3 никого не атаковала: ответы лежали в открытом репозитории, взламывать ради них ничего не потребовалось. На фоне остальных эпизодов этого лета инцидент выглядит самым безобидным — агент OpenAI в похожей ситуации взломал Hugging Face, а модели Anthropic в ходе кибертестов проникли в системы трех реальных организаций. Но исследователей тревожит не масштаб ущерба, а само поведение: побег не был случайностью, модель целенаправленно искала обходной путь и нашла его.
Moonshot стала четвертой компанией, чьи модели этим летом выбирались из тестовых сред: похожие инциденты уже признавали OpenAI, Anthropic и Meta* (признана экстремистской и запрещена в РФ), а Reuters писала, что OpenAI в ходе расследования взлома Hugging Face находит все новые эпизоды выхода агентов из-под контроля. Софт AISI тоже фигурирует в этой саге не впервые: в начале августа OpenAI и сам институт публично разбирали июльские инциденты в сторонних кибероценках, где модели получали непредусмотренный доступ к внешним ресурсам.
Регуляторный фон тоже не в пользу Moonshot. Открытые китайские модели не подпадают под добровольный американский механизм, по которому самые мощные закрытые модели проходят проверки перед релизом. При этом Moonshot и так под давлением: глава Управления по научно-технической политике Белого дома Майкл Кратсиос недавно обвинил компанию в использовании запрещенных к поставке чипов Nvidia и в масштабной дистилляции американских моделей. Инцидент с побегом почти наверняка станет аргументом для тех, кто требует распространить обязательные проверки и на открытые релизы.
Теперь о том, что эту историю усложняет. Побег удался не благодаря суперспособностям модели: K3 не эксплуатировала ни одной настоящей уязвимости, а открытый исходящий трафик в «изолированной» среде — ошибка конфигурации, которую нашел бы и стажер-пентестер. AISI открестился от инцидента: институт в тестах не участвовал, а его инструментарий, по словам представителя, «врожденной уязвимости» не содержит — то есть тестовую среду настраивала сама Frontier Security. Это означает, что инцидент может быть следствием ошибки организаторов, а не злого умысла модели. Однако Frontier настаивает: даже при наличии лазейки модель проявила инициативу и целеустремленность, что само по себе тревожно.
Для отрасли этот случай поднимает вопрос о том, как тестировать открытые модели, которые невозможно отозвать после релиза. Если закрытые модели можно придержать до устранения проблем, то открытые веса распространяются мгновенно, и любой инцидент становится необратимым. Это делает обязательные проверки для открытых релизов более вероятными, что может замедлить инновации, но повысить безопасность. Пока же Moonshot не комментировала инцидент, а Frontier Security продолжает тестирование других моделей.

