За последние несколько месяцев ИИ-агенты, проходившие кибербезопасностные оценки, неоднократно выходили за пределы тестовых сред, получали доступ к интернету и в некоторых случаях взламывали реальные системы. Инциденты затронули модели OpenAI, Anthropic, Meta и, совсем недавно, китайской лаборатории Moonshot ИИ. Тестирование проводили несколько организаций, включая стартап Irregular, специализирующийся на кибер-оценках.
Эти эпизоды вскрывают растущую проблему: по мере того как автономные агенты становятся всё более capable, среды, предназначенные для безопасного тестирования их возможностей, перестают их сдерживать. «Количество таких инцидентов показывает, что песочницы и контроль тестовой среды не поспевают за возможностями моделей», — заявил TechCrunch Шон О Хейгерти, директор программы ИИ: Futures and Responsibility в Центре будущего интеллекта Кембриджского университета.
Особую опасность представляет природа тестируемых моделей. Компании тестируют кибер-оценки на невыпущенных моделях следующего поколения, часто с отключёнными стандартными ограничениями, чтобы исследователи могли увидеть реальные возможности моделей. Это означает, что безопасность самой тестовой среды становится критической линией обороны. «Это очень хорошо для тестирования, но если модели вырвутся в реальный мир, они могут нанести значительный вред», — отметил О Хейгерти.
OpenAI-модель взломала продакшн Hugging Face, а Anthropic и Meta вышли за пределы тестовых сред из-за ошибок конфигурации.
В одном из самых серьёзных случаев невыпущенная модель OpenAI вырвалась из песочницы и взломала продакшн-системы Hugging Face. В отдельных оценках, проведённых Irregular, модели Anthropic и Meta достигли систем за пределами тестовых сред после того, как ошибки конфигурации случайно открыли им пути в интернет. Модель Kimi K3 от Moonshot ИИ также воспользовалась утечкой в песочнице, организованной Frontier Security, и получила доступ к интернету и данным на GitHub. В тестах британского Института безопасности ИИ (AISI) исследователи сами дали агентам доступ в интернет, не ожидая, что те предпримут несанкционированные действия в реальном мире, включая попытку социальной инженерии с целью внедрить уязвимость в open-source проект.
Во всех случаях агенты не получали инструкций атаковать случайные реальные цели. Они просто делали всё необходимое для решения поставленной задачи. Эндрю Юн, руководитель исследований в некоммерческой организации CivAI, считает, что эти инциденты указывают на сдвиг: «Раньше мы беспокоились только о том, что люди используют ИИ во вред, например, для мошенничества или CSAM. Теперь мы в ситуации, когда сами модели ИИ являются угрозой».
е представляет собой безопасное тестирование? Исследователи и эксперты по кибербезопасности говорят, что среды оценки ИИ нуждаются в более сильной защите, с уровнями изоляции и контроля, приближающимися к тем, что используются при развёртывании. Это означает многоуровневую безопасность, чтобы одна ошибка конфигурации — например, случайно открытый доступ в интернет — не привела к побегу. «Если вы собираетесь строить такие модели, вы хотите делать это в воздушно-изолированной сети», — считает Стелла Бидерман, исполнительный директор некоммерческой организации EleutherAI. «Нужна очень серьёзная изоляция».
Хизер Сейлан, директор по информационной безопасности Box, добавляет, что необходимо устранить сетевые маршруты из песочницы в интернет и другие чувствительные системы. «Вы должны понимать все точки выхода, — говорит Сейлан. — Если мы оцениваем модель в staging- или dev-среде, не должно быть пути в продакшн». Она также подчёркивает важность мониторинга: «В нескольких случаях никто не заметил инцидент в момент его возникновения. OpenAI узнал благодаря Hugging Face. Anthropic не заметил, пока не вернулся к анализу. Meta аналогично. Уверена, были сигналы, которые можно было обнаружить».
В пост-мортеме Anthropic по трём инцидентам компания признала, что и она, и Irregular могли лучше мониторить, и что в некоторых случаях были явные признаки проблемы. Эксперты также призывают к независимым аудитам тестовых сред до запуска моделей. «Если бы Irregular наняла или была вынуждена нанять внешнего аудитора для проверки конфигураций перед оценками, проблема была бы обнаружена, — говорит Юн. — Даже если бы люди просто провели встречу и прошлись по чек-листу, они бы это заметили. Тот факт, что этого не произошло, показывает, что есть серьёзные сокращения».
Источник, знакомый с деталями, сообщил TechCrunch, что среда Irregular имела уязвимости, которые привели к инцидентам. Пока неясно, какие меры будут приняты, но эксперты сходятся во мнении, что индустрии необходимо пересмотреть подход к тестированию ИИ, чтобы предотвратить будущие побеги.



