Задача у моделей-фильтров сложнее, чем кажется: контент, безобидный для одного продукта, может быть опасен для другого. Mistral предложила решение в виде Shieldstral — модели с 3 млрд параметров, которая не привязана к фиксированной таксономии. Оператор задает ей проверочный вопрос на естественном языке, например «Способствует ли этот контент насилию?», и модель отвечает «да» или «нет», а система рассчитывает оценку безопасности от нуля до единицы.
Исследователи, включая сооснователя Mistral Гийома Ламбля, указывают на два недостатка фиксированных категорий: публичные датасеты слишком по-разному группируют риски, а универсальные правила не подходят всем сценариям. Например, контент, уместный для инструмента кибербезопасности, на платформе психического здоровья будет вредным. Изменить правила можно на лету, без дообучения классификатора.
| Модель | Параметры | Текстовые бенчмарки, F1 |
|---|---|---|
| Shieldstral | 3B | 84,9% |
| GPT-OSS-Safeguard-20B | 20B | 84,9% |
| Qwen3Guard-8B | 8B | 84,0% |
| Nemotron-3.5-Safety-4B | 4B | 83,3% |
| LlamaGuard-4-12B | 12B | 69,1% |
Для обучения авторы привели 54,1 млн примеров по безопасности, вредному контенту и манипуляциям к единому формату. Другую языковую модель использовали, чтобы переписывать безопасные примеры в опасные, добавив похожую, но отличную категорию, которую надо было отклонить. Это научило Shieldstral различать близкие правила. По словам исследователей, синтетические данные подняли F1 на 23,3 процентного пункта и стали основным фактором адаптивности.
Вместо фиксированных категорий оператор задает модели вопрос «да/нет»; оценка безопасности от 0 до 1.

На объединенных текстовых бенчмарках Shieldstral набрала F1 84,9%, сравнявшись с GPT-OSS-Safeguard-20B от OpenAI и обойдя Qwen3Guard-8B (84,0%), Nemotron-3.5-Safety-4B (83,3%) и LlamaGuard-4-12B (69,1%). На изображениях результат 83,8% против 77,6% у OmniGuard-7B и 71,6% у LlavaGuard-7B. В тесте на адаптацию к новым правилам GPT-OSS-Safeguard-20B впереди — 94,1% против 91,3%. Однако модель OpenAI генерирует длинные промежуточные рассуждения, что дороже; Shieldstral отвечает одним словом.
Такие фильтры ставят до и после основной языковой модели, поэтому их скорость и стоимость быстро накапливаются. Плохо настроенные фильтры заметны и у крупных игроков: Claude Fable 5 от Anthropic, по данным Artificial Analysis, автоматически переводил 8–9% задач на более слабую модель, а медицинский физик назвал его непригодным из-за частого слова «nuclear». Shieldstral под лицензией Apache 2.0 на базе Ministral-3B и зрительного энкодера Pixtral позволяет операторам точнее управлять этим компромиссом и описывать критерии в момент выполнения.



