Обучение языковых моделей работе с внешними инструментами — поиском, файловой системой, исполнением кода — требует больших датасетов, где для каждого пользовательского запроса есть проверенная цепочка вызовов API. Раньше такие данные собирали вручную (как в InstructPipe) или генерировали автоматически: сначала придумывали запрос, потом искали под него решение перебором. Google Research предложила обратный порядок.

В работе ToolGrad, представленной на ACL 2026, сначала генерируется эталонная цепочка вызовов инструментов, а затем под неё синтезируется пользовательский запрос. По словам авторов, явная цепочка даёт более однозначную информацию, чем запрос, поэтому обратная аннотация требует всего одного шага LLM. Это позволяет получать более сложные (long-horizon) цепочки при меньших затратах по сравнению с query-first подходом на основе поиска в глубину (DFS), который используется в ToolBench и ToolACE.

МодельРазмерРезультат на BFCL
ToolGrad-1B1B
ToolGrad-4B4B
ToolGrad-12B12B83.1

Ключевая идея — текстовые «градиенты», заимствованные из метода TextGrad. В обычном машинном обучении градиенты численно показывают, как обновить веса модели. TextGrad адаптировал эту парадигму для промптов: LLM-критик даёт текстовую обратную связь, которая направляет улучшение промпта. ToolGrad переносит тот же принцип на генерацию датасетов: вместо оптимизации статичного текста он итеративно строит сложные валидные цепочки API из больших библиотек инструментов.

A diagram showing ToolGrad's sequential API mini-batch method achieving a high annotation pass rate compared to failing prior art.
A diagram showing ToolGrad's sequential API mini-batch method achieving a high annotation pass rate compared to failing prior art. · Источник: Google Research Blog

Фреймворк состоит из четырёх модулей, которые последовательно предлагают, исполняют, выбирают и обновляют. API Proposer сужает выборку API до нескольких кандидатов для расширения текущей цепочки. API Executors параллельно тестируют выбранные API и формируют отчёты о выполнении. API Selector выбирает лучший вызов — он и выступает текстовым градиентом, задающим направление улучшения, — и добавляет его в цепочку. LLM Updater переписывает синтетический запрос и ответ ИИ под обновлённый набор API. Цикл повторяется, пока не получится образец из запроса, проверенной цепочки и финального ответа.

Для оценки авторы использовали базу ToolBench из более чем 16 тыс. реальных API. Сгенерировав небольшой датасет ToolGrad-500, они дообучили модели Gemma-3 размером 1B, 4B и 12B — ToolGrad-1B, ToolGrad-4B и ToolGrad-12B. Проверка на Berkeley Function Calling Leaderboard (BFCL), где набор инструментов отличается от ToolBench, показала устойчивый рост по сравнению с базовыми моделями. ToolGrad-12B набрал 83.1 балла и оказался конкурентоспособен с проприетарными Gemini, GPT и Claude, а также обошёл специализированные модели ToolACE и Hammer-2.1-7B.

Практический смысл в том, что компаниям и исследователям больше не нужно вручную размечать тысячи траекторий или гонять дорогостоящий DFS-поиск. Answer-first генерация с текстовыми градиентами снижает стоимость и порог входа для создания данных под fine-tuning агентных моделей. Это особенно актуально на фоне роста интереса к ИИ-агентам, которым требуется надёжное планирование вызовов инструментов в реальных сценариях.