Google Research представила GlucoFM — фундаментальную модель для анализа данных непрерывного мониторинга глюкозы (CGM). Модель использует двухпотоковую архитектуру, которая разделяет медленные тренды уровня глюкозы и краткосрочные отклонения, что позволяет точнее предсказывать метаболические показатели. В тестах на четырех когортах GlucoFM превзошла лучший вариант GluFormer по PR-AUC в среднем на 5,8 процентного пункта.

CGM-устройства, такие как Dexcom и Libre, измеряют уровень глюкозы в интерстициальной жидкости каждые несколько минут, фиксируя изменения в течение дня и ночи. Однако интерпретация этих данных сложна: качественные клинические метки, необходимые для обучения моделей, редки и дороги. Существующие фундаментальные модели, включая CGMformer, GluFormer и CGM-JEPA, обрабатывают данные глюкозы как единый поток, не разделяя медленные тренды и краткосрочные отклонения. GlucoFM решает эту проблему, используя двухпотоковый энкодер, который выделяет низкочастотный компонент (базовый тренд) и остаточный компонент (кратковременные отклонения, связанные с приемами пищи, физической активностью или артефактами датчика).

Обучение GlucoFM проходило на 109 066 часах немаркированных данных CGM из набора Wear-CGM и четырех опубликованных датасетов, всего 477 записей участников. Модель использует латентное предсказательное обучение с двумя задачами: контекстное предсказание (маскирование частей последовательности и предсказание их латентных представлений) и предсказание временной динамики (как меняются базовый уровень и отклонения от часа к часу). Это позволяет модели улавливать непрерывную природу гликемических изменений, не реконструируя каждый замер. Дополнительно применяются аугментации, имитирующие реальные условия: дрейф базовой линии, сжатие, разреженную выборку и кратковременные разрывы.

Overview diagram of the GlucoFM framework detailing data preprocessing, JEPA-style pre-training architecture, and clinical forecasting applications.
Overview diagram of the GlucoFM framework detailing data preprocessing, JEPA-style pre-training architecture, and clinical forecasting applications. · Источник: Google Research Blog

Оценка GlucoFM проводилась на четырех когортах (CGMacros, Stanford, Hall и ShanghaiT2DM) по семи клиническим задачам: риск диабета, инсулинорезистентность, дисфункция бета-клеток, гиперлипидемия, гипогликемия, ожирение и глюкотип. Всего было выполнено 14 оценок «когорта-задача». GlucoFM показала лучшие результаты по PR-AUC во всех оценках риска диабета и дисфункции бета-клеток, а также в трех из четырех оценок инсулинорезистентности. В задаче прогнозирования постпрандиального гликемического ответа (PPGR) GlucoFM достигла наименьшей средней абсолютной ошибки (MAE) на двух устройствах CGM (Dexcom и Libre).

Модель также продемонстрировала лучшую общую производительность при переносе между наборами данных и сильную способность к few-shot адаптации, когда данных из новой когорты или размеченных примеров крайне мало. Это важно для практического применения: клинические данные часто ограничены, и модель, способная адаптироваться к новым условиям с минимальной разметкой, может быть полезна для персонализированной медицины.

GlucoFM — не единственная модель в этой области, но ее двухпотоковый подход выделяется на фоне аналогов. В отличие от CGMformer и GluFormer, которые используют единый поток представлений, GlucoFM явно разделяет медленные и быстрые компоненты, что позволяет лучше моделировать физиологию глюкозы. Это может привести к более точным прогнозам и лучшему пониманию метаболических процессов.

Развитие фундаментальных моделей для CGM — часть более широкого тренда применения ИИ в здравоохранении. Такие модели могут помочь в ранней диагностике диабета и других метаболических нарушений, а также в персонализации лечения. Однако до клинического применения предстоит решить вопросы валидации и регулирования. Тем не менее, результаты GlucoFM показывают, что подходы на основе самоконтролируемого обучения могут эффективно использовать большие объемы немаркированных данных CGM.