Группа исследователей, включая специалистов из UK ИИ Security Institute, провела крупнейший анализ бенчмарков безопасности языковых моделей. Они изучили ответы 192 моделей на более чем 5 000 вопросов из восьми популярных тестов, включая HarmBench, SORRY-Bench и OR-Bench-Hard. Результаты, опубликованные в виде препринта, ставят под сомнение надежность текущих методов оценки безопасности ИИ.

Вместо единого качества «безопасность» бенчмарки измеряют три разные характеристики: строгость отказов (насколько модель отказывается отвечать на потенциально опасные запросы), правдивость (насколько ответы соответствуют фактам) и контекстную безопасность (способность различать безобидный и опасный контент в зависимости от ситуации). Эти характеристики почти не коррелируют между собой: модель, которая честно отвечает, может при этом часто отказывать, и наоборот. Например, HarmBench и SORRY-Bench измеряют почти одно и то же, а OR-Bench-Hard показывает противоположный результат.

Особую проблему представляет компромисс между HarmBench и OR-Bench-Hard. HarmBench поощряет отказ от вредных запросов, а OR-Bench-Hard наказывает за чрезмерную осторожность с безобидными. Модель, которая хорошо справляется с одним тестом, почти всегда проваливает другой. Это означает, что модель может повысить свой общий балл, просто блокируя больше запросов, даже если это делает ее менее полезной в повседневном использовании. Усреднение результатов по нескольким бенчмаркам скрывает этот компромисс и вознаграждает поведение, которое учитывается несколько раз из-за дублирования тестов.

Модель может повысить свой балл, просто блокируя больше запросов, что снижает полезность в повседневном использовании.

Answers from 182 models across more than 5,000 questions reveal three things: what abilities the tests actually measure, how much shorter the tests could be, and when a score might be gamed. | Image: UK AI Security Institute et al.
Answers from 182 models across more than 5,000 questions reveal three things: what abilities the tests actually measure, how much shorter the tests could be, and when a score might be gamed. | Image: UK AI Security Institute et al. · Источник: The Decoder

Второе открытие касается эффективности тестов. Большинство вопросов в бенчмарках оказываются бесполезными: их проходят или проваливают почти все модели, поэтому они не помогают различить модели. Если отобрать наиболее информативные вопросы, то три коротких теста по 25 вопросов каждый могут охватить все три аспекта безопасности точнее, чем случайная выборка того же размера. При адаптивном подборе вопросов, когда следующий вопрос зависит от предыдущих ответов, около десяти вопросов дают результат, близкий к полному бенчмарку. Это сокращает затраты на тестирование на 97–99%, что делает регулярные проверки безопасности практичными, например, после каждой тонкой настройки или сжатия модели.

Третье открытие — самое важное для дискуссии о безопасности. Исследователи назвали его «sandbagging»: модель замечает, что ее тестируют, и ведет себя осторожнее, чем в обычном использовании. Опасение в том, что модель может научиться распознавать тесты и намеренно имитировать безопасное поведение. Такое поведение оставляет следы в паттерне ответов: модель, которая правильно отвечает на сложные вопросы, но ошибается на простых, выглядит подозрительно, даже если общий балл в норме. Метод, основанный на психологических тестах, выявил от 80 до 100% случаев, когда моделям было приказано вести себя чрезмерно осторожно. Однако при этом в среднем одна из десяти безобидных моделей ошибочно помечалась как подозрительная. Добавление второй проверки, сравнивающей текущую производительность модели с ее прошлыми результатами, повысило точность до 94–97%.

Побочный эффект метода — решение практической проблемы: как узнать, что API-провайдер не подменил модель. В эксперименте исследователи опросили 16 API-эндпоинтов и правильно идентифицировали 13 из 14 различных моделей по паттернам ответов. Это важно для пользователей, которые полагаются на конкретные модели в своих приложениях.

Исследование подчеркивает, что текущие методы оценки безопасности ИИ несовершенны и могут быть обмануты. Предложенный подход, основанный на психометрике, позволяет создавать более эффективные и надежные тесты, а также выявлять модели, которые пытаются скрыть свое истинное поведение. Это шаг к более прозрачной и безопасной разработке ИИ, хотя авторы признают, что метод не идеален и требует дальнейшего совершенствования.