Anthropic представила статью, в которой описана система автоматизированных исследователей, способных улучшать выравнивание моделей без участия человека. Работа, опубликованная в пятницу, называется «Automated Researchers Can Reliably Mitigate Alignment Failures» и описывает, как ИИ может самостоятельно повышать показатели на наборах тестов безопасности.

Система, разработанная под руководством стипендиата Anthropic Чена Юэ-Ханя, воспроизводит традиционный исследовательский процесс: она ищет релевантную литературу, предлагает метод и обучает модель в течение 30 минут, постепенно повышая целевой показатель на нескольких итерациях. Эффективные методы сохраняются, неэффективные отбрасываются, что позволяет системе работать быстро и в большом масштабе. В ходе экспериментов система улучшила показатели на всех 10 наборах тестов, не снижая общую производительность модели.

Авторы утверждают, что лучший автоматизированный метод превосходит предложения опытных людей-исследователей в среднем за шесть часов. «Направления, предложенные людьми, не приводят к более высоким показателям», — говорится в статье. Кроме того, стоимость автоматического исследователя составляет около $4 в час за API-инференс, тогда как работа человека-исследователя обходится в $150 в час. Это делает автоматизацию не только быстрее, но и значительно дешевле.

Система работает по принципу традиционного исследования: ищет литературу, предлагает метод и обучает модель в течение 30 минут.

Image Credits:Dominika Zarzycka/SOPA Images/LightRocket / Getty Images
Image Credits:Dominika Zarzycka/SOPA Images/LightRocket / Getty Images · Источник: TechCrunch AI

Однако авторы признают ограничения подхода. Система работает только в той мере, в какой бенчмарки отражают реальные цели выравнивания, и требуются значительные усилия для поддержания и расширения как самих бенчмарков, так и литературы, на которой обучаются автоматические исследователи. Тем не менее, работа рассматривается как шаг к рекурсивному самосовершенствованию ИИ, когда модели смогут улучшать собственное обучение без участия человека. Это может привести к устареванию роли исследователей ИИ, хотя до этого еще далеко.