Amazon Bedrock представил автоматическое уточнение политик для Automated Reasoning checks. Раньше настройка политики сводилась к циклу: найти упавший тест, вручную поправить правила, прогнать проверку снова. Новый режим автоматизирует два первых шага: движок диагностирует причину отказа и предлагает правки на формальной логике, а пользователь просматривает и утверждает каждое изменение до его применения.

Automated Reasoning checks переводят инструкции с естественного языка в формальную логику и применяют к ним правила политики. Пайплайн состоит из двух шагов: translate превращает входной и выходной текст в набор значений переменных, validate сверяет эти значения с формальными правилами. Результат проверки — один из пяти вердиктов: VALID, INVALID, SATISFIABLE, IMPOSSIBLE или TRANSLATION_AMBIGUOUS. По данным из анонса GA, на однозначных переводах точность достигает 99%.

Тип отказаПричинаРежим уточнения
Rule issuesЛогика правил невернаIterative Refinement
Translation ambiguousЯзык неоднозначенAmbiguous Variable Refinement

Разработчики выделили два типа отказов. Если тест возвращает неожиданный вердикт при корректном переводе, причина в правилах: правило слишком строгое, слишком мягкое или отсутствует. Такой сбой закрывает режим Iterative Refinement: сервис предложит добавить, изменить или удалить правила. Если система возвращает TRANSLATION_AMBIGUOUS, дело в формулировках: разные модели перевода дают разные интерпретации переменных, например из-за пересекающихся определений «tenure» и «years of service». Для этого случая предназначен Ambiguous Variable Refinement, который уточняет описания переменных и сводит множество трактовок к одной.

Iterative Refinement исправляет логику правил: например, когда избыточное правило даёт INVALID вместо SATISFIABLE.

How Automated Reasoning checks validate a response at runtime
How Automated Reasoning checks validate a response at runtime · Источник: AWS Machine Learning Blog

Обе функции доступны через API: запуск, опрос статуса, получение результата. В консоли рабочий процесс повторяем: тесты превращают падающую политику в проходящую. Ключевое ограничение — каждое предложенное изменение требует ручного подтверждения, то есть автоматизируется диагностика, а не финальное решение.