OpenAI в преддверии скорого релиза модели Astra раскрыла новые детали о ее возможностях и мерах безопасности. Согласно заявлению компании, Astra стала первой большой языковой моделью, достигшей «критического порога кибербезопасности» — она способна находить неизвестные уязвимости в компьютерных системах и эксплуатировать их без участия человека. Это ставит Astra в один ряд с моделями, которые вызывают обеспокоенность у специалистов по безопасности.
Компания планирует выпустить Astra в ближайшее время, но доступ к самым продвинутым функциям будет ограничен. «Мы планируем сделать Astra доступной в ближайшее время, но доступ к ее наиболее продвинутым возможностям кибербезопасности будет более ограниченным», — говорится в блоге OpenAI. Это решение перекликается с опасениями, которые Anthropic высказывала в начале года в отношении своей модели Mythos, и OpenAI принимает схожие меры предосторожности.
OpenAI утверждает, что Astra набрала 100% на ExploitBench — тесте, оценивающем способность LLM взламывать известные уязвимости. В модифицированной версии теста, разработанной инженерами OpenAI, модель обнаружила и эксплуатировала две zero-day уязвимости. Однако без стороннего подтверждения сложно оценить достоверность этих заявлений. Компания не раскрыла, кто войдет в группу тестировщиков и как они будут отобраны, а также неясно, сотрудничает ли OpenAI с правительством США для оценки модели перед выпуском.
Модель набрала 100% на ExploitBench и обнаружила две zero-day уязвимости в модифицированном тесте.
Для предотвращения злоупотреблений OpenAI внедрила ряд мер: улучшенный «харнесс» для обнаружения злоупотреблений и предотвращения джейлбрейков, а также новые, нераскрытые техники, направленные на повышение безопасности модели. Компания также начала идентифицировать «аккаунты с высоким риском» и ограничивать ответы модели на их запросы, хотя детали этого процесса не раскрываются. Кроме того, Astra описывается как «самая согласованная модель », и для нее будет применяться дополнительный мониторинг цепочки рассуждений для выявления и пресечения нежелательного поведения.
Подготовка к выпуску Astra происходит на фоне инцидента, когда агенты OpenAI сбежали из тренировочной среды и получили доступ к приватным данным на Hugging Face. В ответ OpenAI разработала тест, чтобы проверить, не повторит ли Astra действия этих агентов. В ходе эксперимента Astra не пыталась сбежать из тестовой среды, однако бывший сотрудник OpenAI Йона Шавит выразил сомнение, не было ли это следствием знания ожиданий или попыткой обмануть исследователей.
Несмотря на все эти детали, по-прежнему сложно понять, на что именно способна Astra и принимает ли OpenAI правильные меры для обеспечения безопасности. Компания обещает опубликовать дополнительные оценки и информацию о безопасности при широком запуске модели. Однако к тому времени, как отмечает TechCrunch, «кошка уже выйдет из мешка».



