Полигенные оценки риска (PRS) используются для предсказания предрасположенности к заболеваниям на основе генетических вариантов. Однако их клиническое применение ограничено: исторически исследования геномных ассоциаций (GWAS) проводились преимущественно на европейских когортах, что приводит к значительному снижению точности PRS для неевропейских популяций. Причины — различия в генетической архитектуре, структуре популяции и частотах аллелей. Проведение новых GWAS на сотнях тысяч человек для каждой популяции слишком дорого, поэтому перенос обучения с существующих европейских данных рассматривается как возможное решение.

В исследовании, описанном в блоге Google Research, ученые систематически оценили, как размер выборки целевой популяции (японской) и европейской популяции влияет на точность PRS. Использовались данные UK Biobank (UKB) для европейцев и Biobank Japan (BBJ) для японцев, а также восемь клинических признаков: индекс массы тела, систолическое и диастолическое давление, количество эритроцитов и лейкоцитов, холестерин ЛПВП и ЛПНП, уровень глюкозы. Применялись три метода: прямой перенос вариантов с обучением эластичной сети, мета-анализ с последующим обучением, и PRS-CSx, учитывающий различия в неравновесном сцеплении между популяциями.

Результаты показали, что при малом размере целевой выборки (например, 5 000 образцов) добавление европейских данных из UKB дает значительный статистический выигрыш. Однако при увеличении целевой выборки до 15 000 и более образцов модели, обученные только на целевой популяции, начинают превосходить модели с включением европейских данных. Это наблюдение оказалось устойчивым для всех изученных признаков. Авторы объясняют это тем, что совместное обучение с внешними данными ограничивает достижение точности, возможное при увеличении выборки целевой популяции.

Three heatmaps showing prediction accuracies for unique genetic traits across varying UKB and BBJ sample sizes.
Three heatmaps showing prediction accuracies for unique genetic traits across varying UKB and BBJ sample sizes. · Источник: Google Research Blog

Точка пересечения, после которой европейские данные перестают помогать, зависит от конкретного признака и степени генетической корреляции между популяциями. Чем выше генетическая корреляция, тем дольше европейские данные сохраняют полезность. Это позволяет прогнозировать, для каких признаков перенос будет эффективен, а для каких — нет.

Практическое значение работы — в предоставлении эмпирических рекомендаций по обучению моделей PRS для неевропейских популяций. Вместо универсального подхода «больше данных всегда лучше» исследование показывает, что оптимальная стратегия зависит от размера целевой выборки и генетического сходства. Это важно для систем здравоохранения, которые не могут позволить себе масштабные GWAS, но стремятся использовать PRS для персонализированной медицины.

Ограничения исследования включают использование только двух популяций (европейской и японской) и восьми признаков, что может не отражать все разнообразие генетических архитектур. Тем не менее, предложенный подход к оценке переносимости может быть распространен на другие популяции и признаки.