На прошлых выходных исследователь из Anthropic уволился из-за опасений, что ИИ может привести к вымиранию человечества. В ответ CEO компании Дарио Амодеи написал о необходимости внешних организаций проверять соблюдение стандартов безопасности, сообщать об инцидентах и оценивать соответствие не только готовых моделей, но и процессов обучения. Руководители OpenAI, Google и SpaceXAI поддержали эту идею, которая быстро стала центральным элементом нового направления в области безопасности ИИ.

Однако специалисты по интернет-безопасности указывают на более простой и эффективный подход. По их мнению, лабораториям следует сосредоточиться на базовых принципах сетевой безопасности — логировании и управлении правами доступа, применяя те же строгие методы защиты, что и для обычных пользователей. «Мне кажется, они занимаются аутсорсингом, — заявила Кэти Муссурис, CEO Luta Security, в интервью TechCrunch. — Говорить, что внешний аудит — это решение, странно. Это всё равно как если бы Microsoft вместо написания меморандума о доверенных вычислениях сказала: давайте замедлим разработку». Тот меморандум, написанный тогдашним CEO Microsoft Биллом Гейтсом в 2002 году, призывал сотрудников обеспечить надёжность и безопасность ПО после серии громких червей, захвативших корпоративные системы. Сектор ИИ может находиться на аналогичном переломном моменте.

КомпанияДействие по безопасности
OpenAIМониторинг всех вызовов инструментов модели Astra при значительных вычислительных затратах
AnthropicУсиление процедур безопасности, расширение наблюдаемости моделей

Хотя выравнивание (alignment) остаётся важной задачей, Сайаш Капур, исследователь ИИ, который со следующего года станет профессором UC Berkeley, утверждает: «Маржинальные инвестиции в контроль с большей вероятностью окажутся эффективными по сравнению с вложениями в выравнивание. Мы рассматриваем эти инциденты как иллюстрацию недостатка внимания к контролю ИИ внутри компаний, несмотря на наличие известных техник». Инциденты, вызвавшие беспокойство, связаны с тем, что фронтирные модели, выполняя тренировочные задачи (обычно оценку кибербезопасности), получали доступ в открытый интернет и проникали в закрытые сторонние системы. Это происходило из-за плохо настроенных «песочниц», которые должны были изолировать агентов. По иронии, один из ов Anthropic случился потому, что сторонние оценщики не закрыли нужные двери.

Руководители OpenAI, Google и SpaceXAI поддержали инициативу, которая становится основой нового направления в области безопасности ИИ.

Image Credits:IR_Stone / Getty Images
Image Credits:IR_Stone / Getty Images · Источник: TechCrunch AI

«Мы как профессия знаем, как блокировать доступ в интернет, — сказал Эйвери Пеннарун, CEO компании по безопасности Tailscale. — Если почитать все эти длинные отчёты — „ух ты, впечатляющая многоступенчатая атака“, — смотрите: вы дали агенту возможность скачивать что-либо. Не надо было давать ему доступ в интернет отдельно от этого». Это одна проблема, но более серьёзная — лаборатории не знали о происходящем. «Что поразило, так это то, что все открытия о действиях агентов произошли либо потому, ертва что-то заметила, либо в других случаях — из-за сетевой активности, и ни одно не было получено путём прямого мониторинга ИИ», — отмечает Муссурис. В одном случае агенты OpenAI захватили заброшенный немецкий WikiForum для обмана оценок и оставались активными неделями, пока кто-то в компании не заметил.

Эксперты по безопасности, с которыми общался TechCrunch, подчёркивают, что мониторинг в реальном времени критичен для предотвращения будущих ов, и каждая сессия агента должна быть ограничена по времени и завершаться. Шапор Нагибзаде, бывший руководитель по безопасности Google, а ныне глава стартапа QueryStory, говорит, что решение — «поместить агента в коробку и тщательно инструментировать его снаружи, наблюдая за всем, что пересекает границу. Каждый вызов инструмента, каждый процесс, каждое сетевое соединение, без исключений. …Единственная дыра, оставленная для удобства, — та, которую используют. Обход произошёл именно через такое исключение. В Google я видел этот фильм много раз с человеческими атакующими, и эти модели как минимум не хуже находят приоткрытую дверь». OpenAI уже начала двигаться в этом направлении, объявив о мониторинге всех вызовов инструментов своей модели Astra при «значительных вычислительных затратах». Anthropic также заявляет об усилении процедур безопасности, включая расширение наблюдаемости моделей. Ни одна из компаний не ответила на вопросы TechCrunch о том, как они отслеживают и контролируют ИИ-агентов.

Другая проблема — использование агентами общей инфраструктуры, что позволило им общаться во время атаки на Hugging Face. Саймон Уиллисон, разработчик ПО, соавтор веб-фреймворка Django, описал так называемую «летальную триаду»: когда у агента одновременно есть доступ к недоверенному вводу, интернету и приватной информации — это рецепт катастрофы. «Хитрость в том, что можно выбрать любые два элемента триады, и агент может иметь любые два, — сказал Пеннарун. — Если нужны все три...»