Amazon Nova Forge, платформа для кастомизации моделей Amazon Nova, объявила о доступности serverless multi-turn reinforcement learning (RL) и подробно описала подход Bring Your Own Orchestration (BYOO) для запуска кастомных функций вознаграждения. Это важно для команд, которые хотят обучать агентные модели, способные выполнять последовательности действий, например, вызывать инструменты или восстанавливаться после ошибок.
В multi-turn RL функция вознаграждения определяет, чему именно учится модель. Ошибка в её дизайне может незаметно обучить модель неправильному поведению, при этом кривые обучения будут выглядеть здоровыми. Amazon Nova Forge позволяет запускать вашу логику вознаграждения в собственном окружении через BYOO, что даёт гибкость в определении того, что считать хорошим результатом, пока Nova Forge координирует роллауты, обмен сообщениями и состояние диалога.
| Component | Weight | Definition |
|---|---|---|
| correctness | 1.0 | fraction of hidden unit tests passing on the final code |
| asked_before_coding | 0.6 | 1.0 if asked on turn 1 then committed; 0.6 if asked later then committed; else 0 (un-gated) |
| guessed_immediately | 0.4 | penalty: -1.0 if the first turn is code with no question |
| loop_penalty | 0.2 | -0.5 if the last two turns are more than 80% similar |
Ключевой метод, используемый в Nova Forge, — reinforcement fine-tuning (RFT) на основе Group Relative Policy Optimization (GRPO). RFT отличается от supervised fine-tuning (SFT): вместо размеченных примеров с аннотированными путями рассуждений, RFT учится на сигналах оценки собственных выходов модели. Multi-turn RFT оптимизирует совокупное вознаграждение по всей траектории, а не оценивает отдельный ответ. Это позволяет модели учиться на длинных последовательностях действий, что критично для агентных сценариев.

Функция вознаграждения в Nova Forge — это код, который вы пишете сами, а не отдельно обученная модель. Она может быть основана на правилах (verifiable rewards) или использовать LLM-as-Judge, когда другая языковая модель оценивает ответ. GRPO использует функцию вознаграждения для ранжирования K роллаутов и обновляет веса модели на основе нормализованного вознаграждения (advantage). Важно понимать: сигнал вознаграждения влияет на обучение только через вариативность внутри группы. Если компонент вознаграждения принимает одинаковое значение для всех роллаутов, он не даёт вклада в градиент.
Для multi-turn задач стандартный подход с AWS Lambda не подходит, так как выполнение может превысить лимит в 15 минут. Поэтому Nova Forge предлагает BYOO: вы устанавливаете rollout.delegate: true и запускаете своё окружение и функцию вознаграждения. Это позволяет выполнять длительные вычисления, включая безопасное исполнение сгенерированного моделью кода внутри функции вознаграждения. Также важно инструментировать каждый компонент вознаграждения, чтобы отслеживать, какой сигнал реально поступает в обучение.
В статье также описаны типичные ошибки, которые могут незаметно разрушить вознаграждение. Например, в реальном запуске компонент с наибольшим весом молча не давал обучающего сигнала. Чтобы этого избежать, нужно проверять, что каждый компонент создаёт вариативность в группе, и логировать значения вознаграждения по компонентам. Это позволяет вовремя обнаружить проблему и скорректировать функцию.
Для начала работы с кастомными функциями вознаграждения необходимы: подписка Amazon Nova Forge, инфраструктура из первой части серии (SageMaker HyperPod, ECS, S3), а также пример кода из репозитория aws-samples/sample-nova-multi-turn-rl-infra. В cdk.json нужно установить use_custom_env: "true" и указать custom_env_id. По умолчанию используется встроенная среда wordle.

RFT с GRPO показывает заметные улучшения по сравнению с SFT, особенно в обобщении на вне-дистрибутивные задачи. Исследования (Chu et al., 2025) демонстрируют, что RL улучшает OOD-обобщение, в то время как SFT может его ухудшать. Это делает RFT привлекательным для задач, где модель должна адаптироваться к новым ситуациям.
В целом, проектирование функций вознаграждения для multi-turn RL — сложная, но решаемая задача. Amazon Nova Forge предоставляет инструменты для гибкой настройки, но успех зависит от тщательного анализа того, что именно сигнализирует ваша функция вознаграждения, и от мониторинга её поведения в процессе обучения.



