AWS представила подход к обработке сложных документов, таких как счета за коммунальные услуги, с помощью Amazon Textract и Amazon Bedrock. Решение ориентировано на客服-команды, которые ежемесячно обрабатывают тысячи счетов в разных форматах: PDF, DOCX, TXT, HTML, XLSX и PNG. Основная цель — автоматизировать извлечение ключевых данных (номеров счетов, сумм, сроков оплаты) и интегрировать их в RAG-систему для точных ответов на запросы клиентов.

Проблема, которую решает AWS, знакома многим: при загрузке сырых документов в языковую модель она часто упускает важные детали или генерирует недостоверную информацию. В статье приводится пример, когда клиент AWS пытался использовать RAG напрямую на счетах, но столкнулся с пропуском данных и галлюцинациями. Причина — неструктурированный формат счетов с плотными таблицами и разными макетами. Amazon Textract решает эту задачу, предварительно извлекая текст и структуру документов, включая таблицы, что позволяет LLM работать с чистыми данными.

Amazon Textract поддерживает многостраничные PDF, изображения и другие форматы, извлекая текст из сложных макетов. После извлечения данные очищаются и обогащаются, что повышает точность последующего анализа. В связке с Amazon Bedrock, который предоставляет доступ к LLM, это позволяет создавать RAG-решения, где модель опирается на структурированные данные, а не на сырые документы. Такой подход сокращает время обработки запросов и снижает риск ошибок в ответах клиентам.

Прямая загрузка сырых счетов в RAG-модель приводит к пропуску данных и галлюцинациям.

Chatbot response for a utility bill query using the custom knowledge base solution
Chatbot response for a utility bill query using the custom knowledge base solution · Источник: AWS Machine Learning Blog

Решение уже доступно на GitHub, что позволяет разработчикам адаптировать его под свои задачи. AWS подчеркивает, что подход применим не только к счетам за ЖКХ, но и к другим сложным документам — например, к финансовым отчетам или медицинским записям. Это особенно актуально для компаний, которые работают с большим объемом неструктурированных данных и нуждаются в автоматизации их анализа.

Для тех, кто только знакомится с RAG, стоит пояснить: это техника, при которой языковая модель дополняется внешними данными из базы знаний, что позволяет ей отвечать на вопросы по конкретным документам. Однако без предварительной обработки документов модель может «галлюцинировать» — выдавать правдоподобные, но неверные ответы. Использование Textract в качестве предобработчика решает эту проблему, извлекая только релевантную информацию и структурируя её.

В итоге, связка Textract и Bedrock — это пример того, как облачные сервисы AWS закрывают разрыв между сырыми документами и генеративными моделями. Для бизнеса это означает возможность автоматизировать рутинные операции, сократить издержки и повысить качество обслуживания клиентов. Остаётся вопрос, насколько легко интегрировать это решение в существующие системы, но наличие готового кода на GitHub упрощает старт.