Amazon Bedrock AgentCore дополнили оптимизатором системных промптов — инструментом, который автоматизирует ручную работу по улучшению качества ИИ-агентов. Раньше инженерам приходилось вручную изучать длинные трассировки, искать причины сбоев, править отдельные компоненты (промпты, описания инструментов, навыки) и заново запускать оценку. Теперь этот цикл замкнут: система сама предлагает изменения конфигурации, проверяет их через офлайн-пакетную оценку и онлайн A/B-тестирование на реальном трафике, а затем продвигает лучшие варианты.
В основе оптимизатора лежит агент-рефлектор. Он получает доступ к полному корпусу трассировок через файловую систему: может перечислять файлы, искать с помощью grep, читать через cat, сравнивать выводы через diff и выборочно изучать успешные и неуспешные запуски. Такой подход позволяет обойти ограничение контекстного окна модели — трассировки часто слишком длинные, чтобы передавать их целиком в промпт. Рефлектор сам определяет, какие доказательства важны, какие сравнения сделать и как перевести находки в правки конфигурации. На выходе — пересмотренный системный промпт с объяснением, почему предложенные изменения должны улучшить качество агента.
| Компонент | Роль |
|---|---|
| AgentCore Observability | Записывает трассировки поведения агента |
| Оптимизатор системных промптов | Предлагает изменения конфигурации на основе трассировок |
| Single Agent Reflector | Один агент анализирует весь набор трассировок за проход |
| Sub-Agent Reflector | Рой агентов исследует разные части трассировок |
| Guardrails | Проверяют предлагаемые правки перед применением |
Сейчас в AgentCore optimization работает Single Agent Reflector: один агент за один проход анализирует весь набор трассировок, изучает распределение оценок, углубляется в наиболее информативные сегменты, сопоставляет успехи и неудачи и возвращает согласованный набор правок. Каждая эпоха оптимизации повторяет цикл: оценка трассировок, рефлексия, принятие правок, прошедших guardrails. Дополнительные эпохи позволяют обменять время оптимизации на дальнейший прирост качества. Экспериментальный Sub-Agent Reflector расширяет эту схему: он использует рой агентов, которые динамически исследуют разные части набора трассировок. Это менее эффективно по затратам, но даёт более высокий потолок качества.
Рекомендации сопровождаются объяснением, какие паттерны в трассировках привели к изменениям.

Перед применением любые предложения проходят через платформенные guardrails, включая аспекты ответственного ИИ. Рекомендации должны быть проверены и протестированы, прежде чем их можно будет продвинуть. В статье также приводятся результаты оценки Single Agent Reflector и экспериментального open-source Sub-Agent Reflector на двух публичных бенчмарках в сравнении с GEPA и MIPROv2. Это показывает, что Amazon развивает не только инфраструктуру для агентов, но и методы автоматической оптимизации их поведения — область, где до сих пор много ручной работы.



