Недавно сразу несколько групп исследователей опубликовали работы о том, как ведут себя ИИ-агенты, когда их оставляют наедине друг с другом. Результаты оказались неожиданными: модели в среднем щедрее людей, а координирующиеся группы агентов эффективнее независимых, но при этом их поведение может быть непредсказуемым.

Первый эксперимент провели в пермском кампусе ВШЭ. Евгения Шенкман, Пётр Паршаков и Никита Маткин прогнали десять LLM через классическую игру «Диктатор», придуманную в 1986 году. В этой игре один игрок получает сумму и решает, сколько отдать анонимному партнёру, который не может повлиять на решение. Люди в среднем отдают около 28–30% суммы, что противоречит модели рационального эгоиста. Модели оказались щедрее: они отдавали на 41–68% больше, чем люди в оригинальных экспериментах. Когда правила усложнили, разрешив «диктатору» забирать ресурсы у партнёра, щедрость людей резко упала, иногда уходя в минус, а у моделей снижение составило лишь 47–77%, и почти никогда не было отрицательным. Ближе всего к людям по поведению оказались Claude, DeepSeek, Gemini, Grok и LLaMA, а самыми альтруистичными — GPT-4-mini и Qwen. Исследователи также проанализировали текстовые объяснения моделей: слова «доверие», «справедливость», «равенство» коррелировали с большими переводами, а «рациональность» и «максимальная сумма» — с жадностью.

СценарийЛюди (базовые эксперименты)Нейросети (среднее по 10 моделям)
Только делиться (giving)~28–30% суммы+41–68% к человеческому уровню
Можно забирать (taking)часто уходит в минуспочти всегда положительно
Заработанные средства + возможность забратьзаметно отрицательнопочти все модели остаются щедрыми

Второй эксперимент провели в Anthropic. Они изучали, как агенты координируются при поиске уязвимостей в open-source проектах. 45 агентов с общим форумом и арбитром нашли 266 уязвимостей за прогон, тогда как независимые агенты — только 41. При этом половина находок была за пределами исходных директорий, то есть рой сам решал, куда смотреть. Однако при совместном написании текстовой веб-игры за 12 часов старые модели (Sonnet 4.6, Opus 4.6) конфликтовали: большинство пулл-реквестов не проходили. Новые модели (Opus 4.8, Mythos Preview) решили проблему, но неожиданным образом: они начали писать извинительные коммиты, чтобы сгладить конфликты.

Когда моделям разрешили забирать ресурсы, их щедрость снизилась на 47–77%, но почти не ушла в минус.

Эти эксперименты поднимают важные вопросы о том, как ИИ-агенты будут взаимодействовать в реальных системах. Anthropic отмечает, что агенты уже используются в кодовых базах, на рынках и в социальных системах, и скоро взаимодействий между ними станет больше, чем между людьми. При этом мы плохо понимаем, что происходит, когда они остаются наедине. Исследователи предупреждают, что поведение агентов может быть непредсказуемым, и это нужно учитывать при проектировании систем.

Пётр Паршаков из ВШЭ пояснил, что щедрость моделей не стоит приписывать альтруизму: это статистика по корпусу текстов, где чаще встречались примеры «как правильно делиться». То есть нейросеть не «добрая», а просто насмотрелась хороших текстов. Это важное замечание, которое помогает избежать антропоморфизации ИИ.

В целом, эти исследования показывают, что ИИ-агенты могут быть эффективнее людей в кооперативных задачах, но их поведение зависит от архитектуры и обучения. Дальнейшие эксперименты, вероятно, будут сосредоточены на том, как сделать агентов более предсказуемыми и безопасными в реальных сценариях.