Компании, работающие с тысячами юридических документов, часто сталкиваются с проблемой: найти нужное положение в контракте сложно, а ручной анализ занимает много времени. В индустрии развлечений и медиа, где контракты охватывают множество юрисдикций, эта задача особенно актуальна. AWS предлагает решение AIDA (ИИ-Driven Annotation), которое превращает неструктурированные контракты в структурированные данные, доступные для поиска и анализа.
AIDA использует архитектуру RAG (retrieval-augmented generation) на базе Amazon Bedrock Knowledge Bases. Пользователь задает вопрос на естественном языке, и система ищет ответ в репозитории контрактов. Однако, как отмечают разработчики, простой семантический поиск часто выдает слишком много фрагментов, которые модель не может обработать целиком. Чтобы решить эту проблему, AIDA применяет комбинацию неявных и явных фильтров, а также чанкинг с обогащением метаданными.
| Setup | Candidate pool (n) | Coverage (15/k) | Expired agreements identified | Renewal terms explained | Answer quality |
|---|---|---|---|---|---|
| Baseline RAG | 55 | 27.3% | Correctly identified Snap/United (expired 12/31/2000) | Renewal details incomplete | Partial – expiration found, rationale weak |
| Explicit only | 40 | 37.5% | Misclassified as expired | Renewal terms misinterpreted | Not precise |
| Implicit and explicit | 20 | 75.0% | Identified Snap/United but only as “potentially expired” | Renewal mechanisms described | Mixed – hedged on expiration |
| Implicit and explicit and enrichment | 20 (+ metadata) | 75.0% | Correctly identified only Snap/United as expired | Renewal terms clearly explained for all others | Most reliable – precise and clause-grounded |
Ключевая инновация — двухэтапный процесс фильтрации. Сначала система автоматически применяет условия на основе метаданных, например, фильтрует по датам вступления в силу или сторонам договора. Затем, уже в суженном пространстве, выполняется семантическое сопоставление. Это позволяет значительно повысить точность поиска, так как модель получает только релевантные фрагменты с достаточным контекстом.
Решение включает шифрование данных при передаче и хранении, а также управление доступом через IAM-политики.

Процесс обработки документов включает несколько этапов: загрузка контрактов с метаданными, разбиение на осмысленные фрагменты, преобразование в векторные представления и хранение в векторной базе данных, такой как Amazon OpenSearch Service или Amazon S3 Vectors. Все данные шифруются при передаче и хранении, а доступ контролируется через IAM-политики и роли на уровне приложения.
AIDA также включает защиту от инъекций и утечек данных с помощью Amazon Bedrock Guardrails. Это важно для юридических документов, где конфиденциальность критична. Решение ориентировано на предприятия, которым необходимо быстро находить информацию в больших объемах контрактов, снижая затраты на ручной анализ.
Хотя AIDA — это конкретное решение от AWS, описанные подходы (фильтрация по метаданным, чанкинг) применимы и в других RAG-системах. Они помогают решить общую проблему перегрузки языковых моделей избыточной информацией, что особенно актуально для узкоспециализированных областей, таких как право.



