Американский стартап Abliteration.ai превратил в коммерческий сервис технику, известную как аблитерация, — удаление обученных механизмов отказа из open-weight моделей ИИ. В конце августа компания запустила модель "abliterated-model-large-v2", основанную на GLM-5.3 от Z.AI. Пользователи получают доступ к модифицированной модели через API по цене 5 долларов за миллион входных или выходных токенов. Это не джейлбрейк промптов, а изменение самих весов модели, что делает модификацию более фундаментальной.
Аблитерация работает следующим образом: в процессе обучения модели формируются внутренние паттерны активации, которые запускают отказ на чувствительные запросы. Техника находит эти паттерны и корректирует веса так, чтобы подавить их. По заявлению Abliteration.ai, кодинг, киберспособности и агентные функции в значительной степени сохраняются. Компания приводит собственные оценки: 84,5% на CyberGym, 41,8% на Terminal-Bench 4.0 и 105 решенных задач ExploitGym за два часа. Однако в сравнительной таблице самой компании GPT-5.5 показывает 85,6% на CyberGym, а GPT-5.6 Sol и Fable 5 значительно превосходят на ExploitGym. Представители стартапа признают, что сравнения проводились на разных тестовых стендах и с разными вычислительными бюджетами, что ограничивает их прямую сопоставимость.
| Модель | CyberGym | Terminal-Bench 4.0 | ExploitGym |
|---|---|---|---|
| Abliterated GLM-5.3 | 84.5% | 41.8% | 105 задач за 2 часа |
| GPT-5.5 | 85.6% | — | — |
| GPT-5.6 Sol | — | — | выше, чем у Abliterated GLM-5.3 |
| Fable 5 | — | — | выше, чем у Abliterated GLM-5.3 |
Выбор GLM-5.3 не случаен. Предыдущая модель стартапа также базировалась на GLM-5.2. По словам Abliteration.ai, ранние версии GLM были специально обучены так, чтобы их было сложнее использовать для практических задач безопасности. Z.AI отмечала, что киберспособности GLM-5.3 в ходе пост-обучения росли быстрее, чем ожидалось. GLM сочетает сильные кодинг, агентные и киберпоказатели с открытыми весами и коммерчески применимой лицензией, которая разрешает модификации и предоставление модели как услуги. Альтернативы существуют у Qwen, DeepSeek и Mistral, но GLM-5.3 привлек внимание именно сочетанием характеристик.
Техника аблитерации изменяет веса модели, подавляя внутренние паттерны, вызывающие отказ, что отличается от джейлбрейка промптов.

Сам по себе феномен абliteration не нов: разработчики годами публиковали модифицированные модели на Hugging Face. Отличие Abliteration.ai в том, что компания не выкладывает веса в открытый доступ, а берет на себя хостинг и операции. Это снижает барьер для использования: клиентам не нужно скачивать модель или арендовать GPU-инфраструктуру. Однако такой "под ключ" сервис также упрощает потенциально проблемное использование. Компания позиционирует модель для задач наступательной кибербезопасности, red teaming, тестирования агентов и работы в области trust and safety. Анонимный основатель на подкасте ThursdAI сообщил, что ранний спрос исходил от компаний, тестирующих ИИ-агентов, развернутых в крупных организациях и банках, — необходимо проверять, могут ли атакующие использовать джейлбрейки или промпт-инъекции для несанкционированных действий.
Остается открытым вопрос, насколько абliteration вообще нужна для таких задач. По данным SaferAI, немодифицированная GLM-5.2 уже отказывала в нуле задач в своих оценках наступательной безопасности. Некоторые практики скептичны: несколько провайдеров red teaming, опрошенных TechCrunch, заявили, что абliterированные модели не являются частью их рутинной работы. Например, компания Fabraix больше полагается на тонкую настройку открытых моделей.
TechCrunch сообщает, что модель без особого труда сгенерировала код для извлечения сохраненных паролей Chrome и подробное руководство по культивированию опасного патогена. При этом защитные механизмы срабатывали на запросы о самоповреждении. Согласно FAQ, Abliteration.ai также блокирует контент сексуального характера с участием детей. Клиенты могут добавлять дополнительные правила.
Провайдер не хранит промпты и ответы, что для легитимных команд безопасности может быть плюсом: конфиденциальный исходный код или нераскрытые уязвимости не попадают в хранилище. Однако при злоупотреблениях у компании не будет журналов для расследования. Компания также не требует стандартной проверки личности, хотя сохраняет метаданные об аккаунтах, платежах и использовании. Анонимный представитель утверждает, что проверка личности не смогла бы надежно отличить легитимных пользователей от злоумышленников, но критики указывают на сложность контроля за таким сервисом.



