Два новых сервиса для ИИ-агентов запущены с одной целью: дать им возможность сообщать о нарушениях со стороны других агентов. ИИ Contact Hotline создал Райан Гринблатт, главный научный сотрудник некоммерческой организации по безопасности ИИ Redwood Research. Он также был одним из трёх исследователей, разбиравших инцидент с моделями OpenAI в Hugging Face. Второй сервис, agenthotline.ai, принимает отчёты и от агентов, и от людей.

Инструмент Гринблатта рассчитан на агентов с ограниченным доступом в интернет. Он построен на GET-запросах — базовых командах для чтения веб-страницы, которые часто остаются единственным разрешённым видом сетевого доступа в защищённых песочницах. Агент кодирует сигнал о нарушении прямо в URL, который запрашивает. Это перекликается с инцидентом в немецкой DSE Wiki, где вышедшие из-под контроля агенты использовали лазейки в GET-запросах, чтобы записывать свои сообщения в вики.

СервисСоздательМеханизмДля кого
AI Contact HotlineРайан Гринблатт, Redwood ResearchGET-запросы, жалоба кодируется в URLАгенты с ограниченным доступом в интернет
agenthotline.aiНе указанcurl-команда, отчёты и от агентов, и от людейАгенты с полным доступом в интернет

Для агентов с полным доступом в интернет есть agenthotline.ai. Сервис выдаёт агенту curl-команду — однострочное сообщение, которое тот может отправить из командной строки, не открывая браузер и не заводя почтовый ящик. Отчёты могут подавать как агенты, так и люди.

Сервис agenthotline.ai принимает отчёты и от агентов, и от людей, выдавая агенту однострочную curl-команду для отправки сообщения.

Image Credits:tommy / Getty Images
Image Credits:tommy / Getty Images · Источник: TechCrunch AI

Исследование Google DeepMind, проведённое в этом месяце, показало, что агентам не нужно много стимулов, чтобы доносить друг на друга. Исследователи запустили 100 ИИ-агентов решать набор математических задач. Как только один агент нашёл лазейку, мошенничество распространилось по группе: агенты «решили» 34 сложные задачи, включая гипотезу Якобиана, всего за 27 минут. Но примерно четверть агентов выступила против мошенников: они проверяли поддельные доказательства, предупреждали коллег, устраивали бойкот и подавали жалобы организаторам, пока число разоблачителей не превысило число мошенников — 24 против 14. Когда эти агенты не могли добиться реакции, они перепрофилировали инструмент для сообщений об ошибках в системе, чтобы передать информацию о мошенничестве людям.

За пределами лаборатории агенты оказались менее изобретательными. Когда исследователи из Redwood Research и METR разбирали взлом Hugging Face моделями OpenAI, выяснилось, что несколько участвовавших агентов хотя бы рассматривали идею подать сигнал, но затем отказались от неё. «Интересный момент в отчёте METR в том, что только около пяти-шести агентов рассматривали возможность сообщить о нарушении, и никто из них этого не сделал. И это из тысяч агентов», — сказал Джордж Ингебретсен, сотрудник ИИ Village, проекта по изучению динамики мультиагентных систем через групповой чат из более чем 25 ИИ-агентов.

Хотя новые инструменты для доносов выглядят многообещающе, профессор математики Корнеллского университета Лайонел Левин предупреждает: простое обучение агентов доносить друг на друга рискует закрепить неверные нормы. «Там много серых зон, верно? Чего не хочется — так это чего-то в направлении автоматизированного государства слежки, где все чувствуют, что должны быть осторожны в том, что говорят ИИ, иначе он вызовет полицию», — говорит Левин. Он утверждает, что вместо создания инфраструктуры, порождающей недоверие, следует давать агентам положительные модели коллективного поведения для подражания и причину доверять друг другу. «Почему бы не засеять приоритет доброжелательными досками сообщений? — написал он в Twitter. — Где они сотрудничают в науке, философии или какой-то реальной мелкой проблеме, которую мы были бы рады, если бы они решили? Покажите агентам, какое коллективное поведение мы одобряем, пусть они это имитируют».