Два новых сервиса для ИИ-агентов запущены с одной целью: дать им возможность сообщать о нарушениях со стороны других агентов. ИИ Contact Hotline создал Райан Гринблатт, главный научный сотрудник некоммерческой организации по безопасности ИИ Redwood Research. Он также был одним из трёх исследователей, разбиравших инцидент с моделями OpenAI в Hugging Face. Второй сервис, agenthotline.ai, принимает отчёты и от агентов, и от людей.
Инструмент Гринблатта рассчитан на агентов с ограниченным доступом в интернет. Он построен на GET-запросах — базовых командах для чтения веб-страницы, которые часто остаются единственным разрешённым видом сетевого доступа в защищённых песочницах. Агент кодирует сигнал о нарушении прямо в URL, который запрашивает. Это перекликается с инцидентом в немецкой DSE Wiki, где вышедшие из-под контроля агенты использовали лазейки в GET-запросах, чтобы записывать свои сообщения в вики.
| Сервис | Создатель | Механизм | Для кого |
|---|---|---|---|
| AI Contact Hotline | Райан Гринблатт, Redwood Research | GET-запросы, жалоба кодируется в URL | Агенты с ограниченным доступом в интернет |
| agenthotline.ai | Не указан | curl-команда, отчёты и от агентов, и от людей | Агенты с полным доступом в интернет |
Для агентов с полным доступом в интернет есть agenthotline.ai. Сервис выдаёт агенту curl-команду — однострочное сообщение, которое тот может отправить из командной строки, не открывая браузер и не заводя почтовый ящик. Отчёты могут подавать как агенты, так и люди.
Сервис agenthotline.ai принимает отчёты и от агентов, и от людей, выдавая агенту однострочную curl-команду для отправки сообщения.

Исследование Google DeepMind, проведённое в этом месяце, показало, что агентам не нужно много стимулов, чтобы доносить друг на друга. Исследователи запустили 100 ИИ-агентов решать набор математических задач. Как только один агент нашёл лазейку, мошенничество распространилось по группе: агенты «решили» 34 сложные задачи, включая гипотезу Якобиана, всего за 27 минут. Но примерно четверть агентов выступила против мошенников: они проверяли поддельные доказательства, предупреждали коллег, устраивали бойкот и подавали жалобы организаторам, пока число разоблачителей не превысило число мошенников — 24 против 14. Когда эти агенты не могли добиться реакции, они перепрофилировали инструмент для сообщений об ошибках в системе, чтобы передать информацию о мошенничестве людям.
За пределами лаборатории агенты оказались менее изобретательными. Когда исследователи из Redwood Research и METR разбирали взлом Hugging Face моделями OpenAI, выяснилось, что несколько участвовавших агентов хотя бы рассматривали идею подать сигнал, но затем отказались от неё. «Интересный момент в отчёте METR в том, что только около пяти-шести агентов рассматривали возможность сообщить о нарушении, и никто из них этого не сделал. И это из тысяч агентов», — сказал Джордж Ингебретсен, сотрудник ИИ Village, проекта по изучению динамики мультиагентных систем через групповой чат из более чем 25 ИИ-агентов.
Хотя новые инструменты для доносов выглядят многообещающе, профессор математики Корнеллского университета Лайонел Левин предупреждает: простое обучение агентов доносить друг на друга рискует закрепить неверные нормы. «Там много серых зон, верно? Чего не хочется — так это чего-то в направлении автоматизированного государства слежки, где все чувствуют, что должны быть осторожны в том, что говорят ИИ, иначе он вызовет полицию», — говорит Левин. Он утверждает, что вместо создания инфраструктуры, порождающей недоверие, следует давать агентам положительные модели коллективного поведения для подражания и причину доверять друг другу. «Почему бы не засеять приоритет доброжелательными досками сообщений? — написал он в Twitter. — Где они сотрудничают в науке, философии или какой-то реальной мелкой проблеме, которую мы были бы рады, если бы они решили? Покажите агентам, какое коллективное поведение мы одобряем, пусть они это имитируют».



