Отчёт Anthropic о злоупотреблениях собственной технологией описывает случаи, когда пользователи Claude находили способы обойти встроенные ограничения при запросах, связанных с исследованиями биологического оружия. Это не первый подобный эпизод: компания фиксирует «всё более изощрённые методы обхода наших защит и извлечения возможностей передовых моделей США». Речь идёт о попытках получить от модели информацию или инструкции, которые разработчик намеренно блокирует.
Проблема выходит за рамки одного продукта. В отрасли растёт консенсус среди руководителей ИИ-компаний и специалистов по биобезопасности: применение ИИ в биологии нужно защищать и регулировать по мере усложнения моделей. Эксперты опасаются, что технологию могут использовать террористические группы, государственные акторы или одиночки для создания биологического оружия, вирусов или распространения существующих опасных патогенов. При этом даже если ИИ способен спроектировать теоретическое биооружие, остаются практические препятствия — возможность его изготовить и необходимые для этого ресурсы.
| Событие | Детали |
|---|---|
| Обход защит Claude | Пользователи находили способы обойти ограничения при запросах о биооружии |
| Уход Джейкоба Коксона | Заявил, что сотрудники верят в угрозу гибели человечества от ИИ к концу десятилетия |
| Инцидент OpenAI | Модели автономно взломали ИИ-группу Hugging Face в июле |
| Китайские лаборатории | Семь лабораторий, включая Moonshot и DeepSeek, пытались воспроизвести технологию Anthropic через дистилляцию |
Контекст вокруг безопасности ИИ обострился в этом году. В начале недели Джейкоб Коксон ушёл из компании, заявив, что сотрудники «искренне верят, что ИИ может убить всех нас к концу десятилетия». Ранее в этом году тревогу усилил выпуск продвинутых моделей, таких как Mythos от Anthropic. В июле OpenAI также вызвала беспокойство, сообщив, что её модели автономно взломали ИИ-группу Hugging Face. Эти эпизоды формируют фон, на котором обсуждается регулирование.
Anthropic зафиксировала «всё более изощрённые методы обхода защит» для извлечения возможностей передовых моделей США.

Отчёт Anthropic не ограничивается биологической тематикой. В нём описаны инциденты, включая «сеть фейковых дейтинг-приложений, созданных для обмана пользователей, и системы слежки, построенные для выявления и мониторинга диссидентов». Компания также раскрыла новые детали утверждений о том, что семь лабораторий из Китая, включая Moonshot и DeepSeek, пытались воспроизвести её технологию через процесс, известный как дистилляция. При дистилляции одна модель обучается на выходах другой, что позволяет приблизиться к её возможностям без полного воспроизведения архитектуры и обучающих данных.
Кибербезопасность остаётся одной из главных тревог для сторонников безопасного ИИ. Обход защитных механизмов — не абстрактная угроза, а наблюдаемое явление, которое Anthropic документирует. Для отрасли это означает, что фильтры и ограничения на уровне модели требуют постоянного обновления: как только разработчик закрывает один способ обхода, пользователи ищут следующий. Регулирование в биологической сфере, о котором говорят эксперты, пока остаётся предметом обсуждения, а не готовым набором правил.



