Инженеры AWS разработали решение для автоматической проверки содержимого дашбордов, которое использует большие языковые модели (LLM) на платформе Amazon Bedrock. Система сканирует сотни дашбордов в приложении AWS Insights и выявляет отсутствующие или некорректные элементы, такие как пустые таблицы, устаревшие данные или ошибки отображения. По данным команды, время обнаружения проблем сократилось с 72 часов до менее чем 1 часа.

Проблема, которую решает это решение, знакома многим организациям, работающим с бизнес-аналитикой: пользователь открывает дашборд перед важной встречей и видит пустой график. Инфраструктурные мониторы при этом сообщают о полной исправности: серверы работают, API отвечают, конвейер данных завершился по расписанию. Однако содержимое экрана повреждено, и ни одна система мониторинга не сигнализирует об этом. Такие сбои являются «тихими»: они существуют только в том, что видит пользователь, и остаются незамеченными до тех пор, пока кто-то не подаст жалобу. Инструментарий AWS показал, что такие случаи происходят менее чем в 1% случаев, но их влияние может быть значительным.

ПоказательДо внедренияПосле внедрения
Время обнаружения сбоядо 72 часовменее 1 часа
Количество выявленных сбоев за 30 днейне измерялось802
Доля сбоев, подтвержденных пользователямине измерялосьменее 1%

Традиционный мониторинг, такой как Amazon CloudWatch Synthetics, проверяет доступность страниц, корректность ссылок и задержки, а валидация на уровне данных выявляет сбои конвейеров. Однако разрыв остается на уровне представления BI: фильтры, ошибки агрегации или проблемы с обновлением могут привести к тому, что на экране появятся неверные числа, несмотря на успешные проверки вышестоящих систем. Это «последняя миля» — семантическая проверка того, что видит пользователь. Решение AWS дополняет существующие инструменты, а не заменяет их.

High-level solution overview showing scheduled capture flowing through AI analysis to dashboard owner alerting
High-level solution overview showing scheduled capture flowing through AI analysis to dashboard owner alerting · Источник: AWS Machine Learning Blog

Архитектура решения включает пять этапов, реализованных на управляемых сервисах AWS. Два параллельных механизма проверки работают на одном принципе: один отвечает за визуальную целостность, другой — за числовую согласованность. Визуальная проверка анализирует скриншоты дашбордов с помощью LLM, выявляя пустые секции, ошибки рендеринга и другие аномалии. Числовая проверка запускается после каждого еженедельного обновления данных и генерирует отчет для проверки. При обнаружении проблемы владелец дашборда получает уведомление в Slack с названием секции, скриншотом, оценкой уверенности ИИ и ссылкой на панель мониторинга для расследования.

За 30 дней работы система обнаружила 802 случая сбоев, включая ошибки прав доступа на уровне строк, пропуски записей фильтрами и проблемы рендеринга. Менее 1% этих случаев имели соответствующие отчеты пользователей, что подчеркивает неэффективность реактивных каналов поддержки. Особую важность это приобретает, когда данные дашбордов используются ИИ-системами для генерации отчетов для руководителей: числовая ошибка напрямую распространяется на выводы, влияющие на решения.

Инженеры AWS также делятся уроками production-разработки: важно проектировать систему против ложных срабатываний и держать LLM подальше от арифметики. Это означает, что языковые модели используются для семантического анализа визуальных элементов, а числовые проверки выполняются отдельно, чтобы избежать ошибок в расчетах.

Решение AWS демонстрирует, как LLM могут закрыть пробел в мониторинге BI-систем, который не покрывается традиционными инструментами. Это особенно актуально для организаций, которые полагаются на дашборды для принятия решений и хотят минимизировать риски, связанные с «тихими» сбоями.