С последними обновлениями Claude Code и Codex CLI классические сабагенты — дочерние процессы, которые модель запускает для параллельного решения подзадач, — стали скорее обузой, чем помощью. Разработчики на Hacker News все чаще отключают автоматический спавн и отказываются от тяжелых ролевых конфигов, используя deny: [Agent(Explore)] или флаг --disallowedTools Task. Причина — архитектурные особенности, превращающие сабагентов в источник перерасхода токенов и потери данных.

Сабагент не является легким фоновым потоком текущей сессии. Архитектурно это холодный старт нового изолированного процесса: семь системных промптов, семь списков тулов, семь повторных вычиток репозитория. Каждый потомок инициализирует собственное окружение — тяжелый system prompt, каталог инструментов, файлы инструкций и кэш. Завершив работу, он возвращает родителю лишь сжатый summary, в котором часто теряются важные детали. На практике это выглядит так: модель берет обычную задачу, поднимает семерых детей и съедает лимит аккаунта еще до того, как они закончат ресерч, тогда как последовательный запуск в одном окне закрывает ту же задачу за пару минут без лишних затрат.

КоэффициентБазовое сравнениеПервоисточникПримечание
~4×Относительно одиночного чатаИсследование Anthropic (июнь 2025)Задачи ресерча, не кодинг
~15×Относительно одиночного чатаТам же (объем токенов объясняет 80% дисперсии качества)Не путать со стоимостью относительно одиночного агента
3–10×Один агент на ту же задачуБлог Anthropic (январь 2026)Оверхед мультиагентности

В OpenAI Codex CLI сабагенты живут внутри одного корневого треда, а не как отдельные процессы. Команда /agent переключает дочерние треды внутри текущей сессии. Здесь возникают две статьи скрытых расходов. Первая — налог на опрос через wait_agent: по умолчанию таймаут составляет 30 секунд, и если дочерний агент пишет код две минуты, родитель каждые 30 секунд просыпается и делает новый model turn по распухшему контексту. Вторая — налог на историю (FullHistory): в MultiAgent V2 параметр fork_turns по умолчанию выставлен в all, и каждый потомок полностью копирует историю родителя. В тестах ночного координатора на OpenAI Community сабагенты с гидратацией истории родителя сожгли в 2.6 раза больше квоты, чем чистые сессии. Дополнительно без явного вызова close_agent завершенный потомок продолжает занимать слоты max_threads.

В Codex CLI сабагенты живут внутри треда, а wait_agent каждые 30 секунд перезапускает модель, сжигая токены.

В Claude Code сабагенты запускаются через инструмент Agent (ранее Task). С версии 2.1.198 они по умолчанию уходят в фон, и родитель получает только финальный summary. Лимиты: глубина до 3, параллельно до 20 воркеров. Основной риск — доставка данных. Когда ответ сабагента упирается в лимит output-токенов, движок делит его на два сообщения ассистента, но родителю возвращается только последнее, при этом статус отмечается как completed. В одном зафиксированном кейсе сабагент сгенерировал 151 652 символа (~75k токенов), а вызывающий процесс получил 24 353 символа — 84% вывода было потеряно.

Экспериментальные Agent Teams в Claude Code, где координация построена на JSON-файлах в ~/.claude/teams/{team}/inboxes/ и файловых блокировках, показали схожие проблемы. Ведущий агент выполнил 42 226 вызовов readMailbox, встретил 4 296 ошибок отсутствия файлов и блокировок, а через 2 часа 24 минуты отключил команду и закончил задачу в одиночку за 18 минут. Это классический пример из Теории ограничений (TOC): координация и handoff создали узкое горлышко, заблокировав всю работу.

Структура расхода токенов подтверждает оверхед. Исследование Anthropic (июнь 2025) показало, что мультиагентные системы потребляют примерно в 4 раза больше токенов, чем одиночный чат, для задач ресерча, и до 15 раз — в зависимости от объема токенов, который объясняет 80% дисперсии качества. Блог Anthropic (январь 2026) оценивает оверхед в 3–10 раз относительно одного агента на ту же задачу. Эти цифры не означают, что сабагенты бесполезны, но они требуют осознанного подхода: нативные пиринговые сессии, где агенты общаются короткими репликами без перезапуска онбординга, выглядят более эффективной альтернативой для типовых задач.