Компании, работающие с тысячами юридических документов, часто сталкиваются с проблемой: найти нужное положение в контракте сложно, а ручной анализ занимает много времени. В индустрии развлечений и медиа, где контракты охватывают множество юрисдикций, эта задача особенно актуальна. AWS предлагает решение AIDA (ИИ-Driven Annotation), которое превращает неструктурированные контракты в структурированные данные, доступные для поиска и анализа.

AIDA использует архитектуру RAG (retrieval-augmented generation) на базе Amazon Bedrock Knowledge Bases. Пользователь задает вопрос на естественном языке, и система ищет ответ в репозитории контрактов. Однако, как отмечают разработчики, простой семантический поиск часто выдает слишком много фрагментов, которые модель не может обработать целиком. Чтобы решить эту проблему, AIDA применяет комбинацию неявных и явных фильтров, а также чанкинг с обогащением метаданными.

SetupCandidate pool (n)Coverage (15/k)Expired agreements identifiedRenewal terms explainedAnswer quality
Baseline RAG5527.3%Correctly identified Snap/United (expired 12/31/2000)Renewal details incompletePartial – expiration found, rationale weak
Explicit only4037.5%Misclassified as expiredRenewal terms misinterpretedNot precise
Implicit and explicit2075.0%Identified Snap/United but only as “potentially expired”Renewal mechanisms describedMixed – hedged on expiration
Implicit and explicit and enrichment20 (+ metadata)75.0%Correctly identified only Snap/United as expiredRenewal terms clearly explained for all othersMost reliable – precise and clause-grounded

Ключевая инновация — двухэтапный процесс фильтрации. Сначала система автоматически применяет условия на основе метаданных, например, фильтрует по датам вступления в силу или сторонам договора. Затем, уже в суженном пространстве, выполняется семантическое сопоставление. Это позволяет значительно повысить точность поиска, так как модель получает только релевантные фрагменты с достаточным контекстом.

Решение включает шифрование данных при передаче и хранении, а также управление доступом через IAM-политики.

Amazon Bedrock: автоматические фильтры повышают точность поиска по контрактам
· Источник: AWS Machine Learning Blog

Процесс обработки документов включает несколько этапов: загрузка контрактов с метаданными, разбиение на осмысленные фрагменты, преобразование в векторные представления и хранение в векторной базе данных, такой как Amazon OpenSearch Service или Amazon S3 Vectors. Все данные шифруются при передаче и хранении, а доступ контролируется через IAM-политики и роли на уровне приложения.

AIDA также включает защиту от инъекций и утечек данных с помощью Amazon Bedrock Guardrails. Это важно для юридических документов, где конфиденциальность критична. Решение ориентировано на предприятия, которым необходимо быстро находить информацию в больших объемах контрактов, снижая затраты на ручной анализ.

Хотя AIDA — это конкретное решение от AWS, описанные подходы (фильтрация по метаданным, чанкинг) применимы и в других RAG-системах. Они помогают решить общую проблему перегрузки языковых моделей избыточной информацией, что особенно актуально для узкоспециализированных областей, таких как право.