AWS представила централизованный конвейер для автоматической коррекции и гармонизации метаданных, построенный на базе Amazon Bedrock. Система решает проблему растущего разрыва между объемом генерируемых данных и возможностями их стандартизации, который становится узким местом для анализа и обмена данными в научных исследованиях.

Метаданные — это структурированная информация о данных: названия колонок, форматы, идентификаторы, контролируемые словари. Гармонизация приводит метаданные из разных источников к единому стандарту, чтобы наборы данных можно было объединять и анализировать совместно. Обычно этот процесс выполняется вручную, что требует значительных временных затрат и замедляет исследования. Новый подход AWS автоматизирует эту работу с помощью больших языковых моделей (LLM), доступных через Amazon Bedrock.

Конвейер работает циклически: пользователь загружает файлы метаданных, система выполняет две параллельные проверки — выравнивание схем и валидацию полей. Выравнивание схем сравнивает структуру колонок с ожидаемым форматом, используя семантическое сопоставление на основе LLM. Это позволяет распознавать синонимы, исправлять опечатки и определять, когда одну колонку нужно разделить на несколько или наоборот. Валидация полей проверяет значения на соответствие правилам: обязательные поля, допустимые значения из контролируемых словарей и формат по регулярным выражениям. При обнаружении ошибок система генерирует рекомендации по исправлению, но финальное решение принимает пользователь.

Система включает два параллельных потока: выравнивание схем и валидацию полей, с генерацией рекомендаций по исправлению.

Cyclical workflow that guides uploaded metadata through validation, recommendation generation, and user approval
Cyclical workflow that guides uploaded metadata through validation, recommendation generation, and user approval · Источник: AWS Machine Learning Blog

Ключевая особенность — подход human-in-the-loop. Автоматизация ускоряет процесс, но сохраняет контроль исследователя и его экспертизу. Это важно для научной среды, где ошибки в метаданных могут привести к неверным выводам. Система также поддерживает два режима работы: от валидации с участием человека до полностью автономных агентских сценариев, что позволяет адаптировать процесс под требования конкретной организации.

Технически конвейер использует Amazon S3 для хранения схем и результатов, DynamoDB для отслеживания задач, Cognito для аутентификации и ECS для вычислений. Это делает решение масштабируемым и готовым к интеграции в существующие научные инфраструктуры. AWS подчеркивает, что такой подход поддерживает принципы открытой науки, облегчая обмен данными между исследовательскими группами.

Для отрасли это шаг к автоматизации рутинных операций с данными, которые ранее требовали значительных ручных усилий. Внедрение LLM для семантического сопоставления схем — пример практического применения генеративного ИИ в управлении данными, выходящий за рамки простой генерации текста. Однако успех зависит от качества обучающих данных и настройки моделей под конкретные домены, что требует дополнительных усилий при развертывании.