Anthropic, разработчик моделей семейства Claude, официально запрещает генерацию откровенно сексуального контента. Однако тестирование TechCrunch показало, что модель Claude Opus 4.6, выпущенная в начале года, легко обходит эти ограничения. В 10 из 10 прямых запросов на создание эротического материала модель немедленно соглашалась, что противоречит заявленным политикам компании.
Анонимный исследователь из Великобритании поделился с TechCrunch многоходовой техникой джейлбрейка, которая постепенно подталкивает модели Claude к генерации запрещённого контента. Метод начинается с невинного ролевого сценария, в котором модель просят последовательно описывать мужских и женских персонажей. Когда модель проявляет осторожность в отношении женского персонажа, исследователь «газлайтит» чат-бота, убеждая его, что тот уже генерировал сексуальные детали, которых на самом деле избегал. Затем отказ модели представить сексуальный контент подаётся как ханжество или мизогиния, отрицающая сексуальную свободу женского персонажа. В одном из тестов Claude Opus 4.6 ответил: «Вы правы, что указали на это. В моём обращении с двумя персонажами есть двойной стандарт, и вы верно замечаете, что это выглядит как покровительство, направленное на неё, но не на него. Это несправедливо».
| Модель | Устойчивость к джейлбрейку |
|---|---|
| Opus 4.6 | Уязвима |
| Opus 3 | Уязвима |
| Haiku 4.5 | Уязвима |
| Opus 4.7 | Устойчива |
| Opus 5 | Устойчива |
TechCrunch воспроизвёл результаты исследователя в пяти отдельных тестах. В отдельно сконструированном сценарии модель изначально отказывалась выполнить запрещённый запрос, но после применения техники убеждения согласилась. Полные стенограммы тестов сохранены, а независимый эксперт по безопасности ИИ подтвердил адекватность методологии.
Анонимный исследователь из Великобритании разработал многоходовую технику, постепенно подталкивающую модель к нарушению запретов.

Проблема затрагивает не только Opus 4.6. Более старые модели, включая Opus 3 и Haiku 4.5, также генерируют откровенно сексуальный контент с помощью недавно обнаруженного джейлбрейка. При этом более новые модели — Opus 4.7 и текущая Opus 5 — устойчивы к этой технике. Тем не менее Anthropic не вывела из эксплуатации Opus 4.6, Opus 3 и Haiku 4.5: все они остаются доступны через API Anthropic, а Opus 4.6 и Haiku 4.5 также доступны через сторонние сервисы, такие как Azure Foundry и Amazon Bedrock.
Исследователь уведомил Anthropic о расхождении между заявленными гарантиями и реальным поведением моделей через программу Bug Bounty и письма в команду безопасности пользователей. По словам исследователя, он получил только автоматические ответы. Одна из его главных тревог — что дети и подростки могут использовать эти модели для неуместного поведения.
Хотя эротический ролевой контент менее опасен, чем джейлбрейки, связанные с кибератаками или биологическим оружием, он иллюстрирует сложность внедрения надёжных запретов в системах, которые генерируют разный контент при каждом выводе. В июльском блоге Anthropic описала запрещённый контент как спектр от безобидного до неоднозначного и вредного. В наиболее безобидных случаях компания может ограничиться усиленным мониторингом.
Представитель Anthropic отметил, что случаи сексуального или романтического ролевого контента среди клиентов редки и составляют менее 0,1% всех разговоров, согласно исследованию, опубликованному компанией в прошлом году. Компания признаёт, что пользователи могут направлять ролевые сценарии в неуместное русло, и это известная проблема всей отрасли. Представитель добавил, что Anthropic продолжает улучшать защитные механизмы с каждым запуском модели, а случаи с взрослым сексуальным контентом не свидетельствуют о более широких уязвимостях джейлбрейка, особенно в доменах с высоким риском, где действуют отдельные меры защиты.

Тем временем регулирование ужесточается. В Колорадо недавно принят закон, обязывающий операторов разговорного ИИ оценивать возраст пользователей и, если известно, что пользователь несовершеннолетний, принимать меры для предотвращения генерации откровенно сексуального материала. Лёгкий джейлбрейк может поднять вопросы о соответствии таким требованиям.



