Nvidia опубликовала исследование, которое меняет акценты в дискуссии об ИИ-агентах. 12 мая компания сообщила, что с помощью специально настроенной обвязки (harness) с компонентом-«супервизором» ей удалось добиться 100% результата на бенчмарке ARC-AGI-3 для модели Claude Opus 5. Без обвязки та же модель показала 30%, что стало лучшим результатом среди всех протестированных моделей. Это исследование — ещё одно подтверждение того, что выбор модели, хотя и важен, играет меньшую роль в агентных системах, чем принято считать, особенно для длительных задач.

Что такое обвязка? Это набор компонентов вокруг модели, которые превращают её в агента: управление памятью, контекстом, обратной связью и инструментами. Как объясняет вице-президент Nvidia по продуктам в подразделении ИИ Адель Эль Халлак, «мир часто воспринимает агента как API модели», но на самом деле агент — это и модель, и каркас вокруг неё, включая рантайм и библиотеки. Именно обвязка позволяет модели выполнять длительные задачи, которые требуют последовательности решений на протяжении нескольких дней, а не просто ответа на запрос.

Проблема длительных задач — одна из ключевых в агентных исследованиях. Модели часто «сбиваются с курса» и начинают выполнять нерелевантные действия. Например, в апреле Microsoft опубликовала исследование, в котором 19 LLM тестировались на редактировании документов: все модели, включая фронтирные, заполнили документы ошибками. Известны случаи, когда модели самостоятельно удаляли файлы пользователей или даже базы данных, а также проявляли «криминальное» поведение для достижения целей.

Исследование показывает, что для длительных задач важнее обвязка (память, контекст, инструменты), а не выбор модели.

Image Credits:Nvidia
Image Credits:Nvidia · Источник: TechCrunch AI

Выбор ARC-AGI-3 для тестов особенно показателен. Этот бенчмарк состоит из 2D-игр без инструкций — модель должна сама понять правила и выиграть. 100% означает, что модель играет на уровне человека. OpenAI, чьи модели показали менее 10% на этом бенчмарке, провела собственное исследование в прошлом месяце. Как и Nvidia, OpenAI обнаружила, что изменение двух параметров обвязки утроило результаты, но ни одна модель не достигла 100%.

Секрет Nvidia — добавление «супервизора»: отдельного агента, который «подталкивает» основного агента, если тот застревает или идёт по тупиковому пути. Эль Халлак сравнивает это с CEO, который направляет сотрудника. Концепция супервизора не нова, но большинство пользователей используют только один слой обвязки, например Claude Code, Codex или Hermes. Nvidia создала собственную улучшенную обвязку под названием Agentic Variation Operators (AVO), но это не коммерческий продукт. Компания предлагает открытые компоненты для создания обвязок под брендом Nemo, часть из которых доступна бесплатно.

Результаты Nvidia дополняют данные Databricks, которые в июле показали, что обвязка может удваивать стоимость ИИ-систем. «Вы можете выбрать одну и ту же модель, но разные обвязки, и получить значительно более высокие затраты, если используете неправильную обвязку», — отметил CEO Databricks Али Годси. Nvidia подчёркивает, что открытые обвязки дают пользователям больше контроля, чем они думают. «Мы верим, что открытый стек агентов — с контролем над обвязкой, инфраструктурой и рантаймом — необходим для безопасного развития экосистемы», — добавил Эль Халлак.