Полигенные оценки риска (PRS) используются для предсказания предрасположенности к заболеваниям на основе генетических вариантов. Однако их клиническое применение ограничено: исторически исследования геномных ассоциаций (GWAS) проводились преимущественно на европейских когортах, что приводит к значительному снижению точности PRS для неевропейских популяций. Причины — различия в генетической архитектуре, структуре популяции и частотах аллелей. Проведение новых GWAS на сотнях тысяч человек для каждой популяции слишком дорого, поэтому перенос обучения с существующих европейских данных рассматривается как возможное решение.
В исследовании, описанном в блоге Google Research, ученые систематически оценили, как размер выборки целевой популяции (японской) и европейской популяции влияет на точность PRS. Использовались данные UK Biobank (UKB) для европейцев и Biobank Japan (BBJ) для японцев, а также восемь клинических признаков: индекс массы тела, систолическое и диастолическое давление, количество эритроцитов и лейкоцитов, холестерин ЛПВП и ЛПНП, уровень глюкозы. Применялись три метода: прямой перенос вариантов с обучением эластичной сети, мета-анализ с последующим обучением, и PRS-CSx, учитывающий различия в неравновесном сцеплении между популяциями.
Результаты показали, что при малом размере целевой выборки (например, 5 000 образцов) добавление европейских данных из UKB дает значительный статистический выигрыш. Однако при увеличении целевой выборки до 15 000 и более образцов модели, обученные только на целевой популяции, начинают превосходить модели с включением европейских данных. Это наблюдение оказалось устойчивым для всех изученных признаков. Авторы объясняют это тем, что совместное обучение с внешними данными ограничивает достижение точности, возможное при увеличении выборки целевой популяции.

Точка пересечения, после которой европейские данные перестают помогать, зависит от конкретного признака и степени генетической корреляции между популяциями. Чем выше генетическая корреляция, тем дольше европейские данные сохраняют полезность. Это позволяет прогнозировать, для каких признаков перенос будет эффективен, а для каких — нет.
Практическое значение работы — в предоставлении эмпирических рекомендаций по обучению моделей PRS для неевропейских популяций. Вместо универсального подхода «больше данных всегда лучше» исследование показывает, что оптимальная стратегия зависит от размера целевой выборки и генетического сходства. Это важно для систем здравоохранения, которые не могут позволить себе масштабные GWAS, но стремятся использовать PRS для персонализированной медицины.
Ограничения исследования включают использование только двух популяций (европейской и японской) и восьми признаков, что может не отражать все разнообразие генетических архитектур. Тем не менее, предложенный подход к оценке переносимости может быть распространен на другие популяции и признаки.



