Автор, известный в русскоязычном ИИ-сообществе как разработчик мультиагентных конвейеров, решил проверить, может ли ИИ-продакт взять на себя управление продуктовым бэклогом. Эксперимент длился неделю и показал, что автономная система способна выполнять значительный объем работы, но вопросы эффективности остаются открытыми.

ИИ-продакт — это агент, который принимает решения о том, что и зачем делать, оценивает адекватность средств масштабу задачи и проверяет результат с точки зрения конечного пользователя. В отличие от исполнителей, которые видят только свою задачу, продакт имеет доступ к широкому контексту и может разрешать неоднозначности. В эксперименте продакт работал на модели Claude Opus 5, а разработку вели два провайдера: Codex на GPT 5.6 sol и Claude на Opus 5. Ключевым правилом было жесткое кросс-ревью: код, написанный Codex, проверял Claude, и наоборот. Если проверяющий был недоступен, работа останавливалась.

За неделю в четырех направлениях было выполнено около 350 задач, примерно поровну на Codex и Claude. За 1600 сеансов работы моделей потрачено около 14 млрд токенов. Автор отмечает, что ИИ-продакт самостоятельно закрывал задачи, выполнял приемку доработок с учетом потребностей пользователя, добавлял новые задачи в бэклог и планировал их работу. Однако он также признает, что эксперимент лишь частично успешен: в некоторых случаях требовалось вмешательство человека, особенно когда ответы не были очевидны.

Работа велась двумя провайдерами: Codex на GPT 5.6 sol и Claude на Opus 5, с жестким кросс-ревью.

Основная проблема, которую решает ИИ-продакт, — ограниченность контекста у исполнителей. Как и люди-разработчики, агенты видят только свою задачу и не всегда могут учесть общую картину. Продакт должен понимать потребность пользователя, оценивать средства и принимать решения, для которых у исполнителей слишком узкий контекст. В этой схеме три независимые части: продакт решает, что делать; задачи хранят контекст и историю решений; конвейер исполняет одну задачу и возвращает результат.

Автор сравнивает работу с агентами до внедрения продакта с игрой «Веселый фермер» — микроменеджментом, где приходилось одобрять простейшие действия. ИИ-продакт должен был снять эту нагрузку, и частично это удалось. Однако вопрос эффективности остается: 14 млрд токенов за неделю — это значительный расход, и автор не дает окончательной оценки, окупился ли такой подход.

Эксперимент показывает, что автономные системы с ИИ-продактом могут быть работоспособны, но требуют тщательной настройки и контроля. Возможно, это следующий уровень автономности, но не без издержек. Для тех, кто рассматривает подобные подходы, важно учитывать не только возможности, но и стоимость, а также необходимость человеческого надзора в сложных ситуациях.