В блоге AWS Machine Learning появилось описание Agent Evaluation Metric (AEM) — метрики, которая оценивает качество ИИ-агента не одним итоговым баллом, а по отдельным ходам диалога. Первое измерение, которое авторы реализовали, — корректность. Она раскладывается на две подметрики: правдивость (совпадают ли значения, которые агент выдал, с ожидаемыми — как в параметрах вызовов инструментов, так и в текстовых ответах) и полноту (все ли обязательные элементы присутствуют, нет ли пропущенных параметров или неполных ответов).

Проблема, которую решает AEM, знакома всем, кто запускал многоходовых агентов в продакшене. Одна ошибка на раннем ходу тихо портит все последующие. В примере из статьи: пятиходовый диалог с корпоративным ассистентом, пользователь просит создать отчёт о продажах, затем уточняет его. На втором ходу агент выбирает правильное действие, но передаёт параметр «profit» вместо «revenue». Эта единственная ошибка затем распространяется на ходы 3–5. Оценка на уровне задачи видит только финальный результат и помечает весь диалог как провальный, не показывая, что чинить нужно ровно один ход. AEM же изолирует корневую причину от её последствий.

Подход к оценкеЧто измеряетЧего не показывает
Task-level (goal success rate)Выполнена ли задача целикомКакое измерение качества сломалось
Single-turn (helpfulness, faithfulness)Качество отдельного ответаКак ошибки распространяются по ходам
Целостный баллОдно число за всю задачуРазницу между фактической ошибкой и пропущенным полем
AEM (turn-level)Правдивость и полноту по каждому ходу

Существующие инструменты оценки агентов — goal completion, LLM-as-judge, трассировка — дают целостный балл. Они отвечают на вопрос «справился ли агент с задачей», но не на вопрос «какое именно измерение качества сломалось». Балл 70% по goal completion не говорит, были ли провалы фактическими ошибками, пропущенной информацией или неверным выбором инструмента. Кроме того, целостный балл плохо расширяется: чтобы добавить новое измерение — безопасность или удержание инструкций, — приходится перестраивать всю схему оценки.

Корректность разложена на две подметрики: правдивость (совпадение значений с ожидаемыми) и полноту (наличие всех обязательных элементов).

One early error in turn 2 cascades through turns 3 to 5, while turn-level evaluation isolates the single root cause
One early error in turn 2 cascades through turns 3 to 5, while turn-level evaluation isolates the single root cause · Источник: AWS Machine Learning Blog

AEM предлагает другой подход: decompose-evaluate-compose. Качество разбивается на именованные подметрики, каждая измеряется по каждому ходу в контексте всей траектории, а затем они собираются в единый композитный показатель. Под корректностью лежит структурный фундамент — выбор инструментов и действий. Та же схема, по замыслу авторов, переносится на новые измерения без изменения механизма: достаточно добавить подметрику, не переписывая оценку целиком.

Для команд, которые строят агентов на базе LLM, это меняет рабочий процесс. Вместо того чтобы гадать, почему агент провалил задачу, и перебирать промпты вслепую, AEM указывает конкретный ход и конкретную подметрику — правдивость или полноту. Это сокращает цикл отладки и делает оценку воспроизводимой. Пока это первая публикация из серии: корректность — только первое измерение, остальные (безопасность, удержание инструкций, глубина рассуждений) заявлены как расширения той же схемы.