Когда несколько ИИ-агентов совместно выполняют задачу, итоговый успех не всегда означает, что процесс был корректным. Агенты могут продублировать работу, нарушить порядок операций или одновременно захватить общий ресурс, но финальное состояние окажется правильным. Именно эту проблему пытается решить CoCoBench — новый бенчмарк, разработанный исследователями из Нанкинского университета, Tsinghua и AgiBot.
CoCoBench включает 897 исполняемых сценариев в симуляторе AI2-THOR, где команды из двух, трёх или четырёх агентов выполняют бытовые задачи: раскладывают предметы, используют общий инструмент, закрывают контейнеры и передают объекты. Бытовая обстановка выбрана как воспроизводимая среда, но важны механизмы координации, которые переносимы на программные системы.
Бенчмарк разделяет координацию на четыре типа. Первый — распределение работы: агенты должны разделить независимые подзадачи, чтобы избежать дублирования и неравномерной нагрузки. Второй — соблюдение порядка действий: проверяются причинные зависимости, например, нельзя закрыть ящик, пока другой агент не положил предмет. Третий — доступ к общему ресурсу: несколько агентов используют один эксклюзивный ресурс, такой как файл, ветка Git или GPU. Четвёртый — синхронизация: агенты должны согласовать свои действия во времени.
Проблема обычного success rate в том, что он проверяет только конечное состояние, например, `pull_request.status == "merged"`. Если агент сначала попытался развернуть несуществующий артефакт, а потом повторил операцию после сборки, тест засчитает успех. В реальной среде такое поведение может привести к гонкам, лишним расходам или повреждению состояния. CoCoBench оценивает всю траекторию выполнения, сравнивая продолжительность плана с эталонным параллельным расписанием и выявляя нарушения зависимостей.
Для разработчиков программных агентов CoCoBench предлагает практические принципы. Во-первых, недостаточно просто сказать агентам «работайте вместе» — зависимости должны быть заложены в исполняемую модель процесса, например, через проверки `assert build.status == "completed"` перед деплоем. Во-вторых, среда выполнения должна запрещать недопустимые последовательности, а не полагаться на промпт. В-третьих, при оценке мультиагентных систем нужно учитывать не только результат, но и эффективность распределения задач.
CoCoBench пока ориентирован на симуляцию, но его методология применима к реальным сценариям: параллельная обработка тикетов, анализ независимых модулей, согласование изменений кода и тестов. Это шаг к более надёжной оценке мультиагентных систем, которые всё чаще используются в автоматизации разработки и операционных процессах.

