DeepMind представила AlphaGenome Atlas — базу предсказаний последствий для девяти миллиардов возможных одиночных изменений ДНК в человеческом геноме. Набор данных занимает один петабайт, что в 30 раз больше базы AlphaFold, содержащей структуры белков. Атлас построен на основе модели AlphaGenome, представленной в 2025 году, и призван закрыть пробел в интерпретации вариантов, лежащих за пределами белок-кодирующих областей.

Модель AlphaGenome считывает участки ДНК длиной в миллион букв и предсказывает, насколько активно считывается ген, могут ли регуляторные белки связываться с ДНК и как сплайсируется транскрипт гена. Ранее модель приходилось запрашивать для каждого варианта отдельно; теперь ответы предвычислены. Для каждого варианта в атласе содержится в среднем около 27 000 индивидуальных предсказаний. Это особенно важно для примерно 98% генома, которые не содержат инструкций для синтеза белков. Эти некодирующие области действуют как переключатели и регуляторы, определяя, когда и в какой ткани активен ген. Именно там расположено большинство вариантов, связанных с заболеваниями, и именно там их эффекты труднее всего интерпретировать.

ИнструментЧисло входных признаковДоля случаев с причинным вариантом в топ-50
AVI1829,5%
CADDболее 15012,5%

Тысячи предсказаний на вариант слишком громоздки для повседневного использования, поэтому DeepMind разработала индекс AlphaGenome Variant Impact Score (AVI), сводящий их к одному числу. Небольшая нейросеть объединяет предсказания AlphaGenome с моделью AlphaMissense и двумя показателями консервативности участка ДНК в ходе эволюции. AVI использует 18 входных признаков, тогда как распространённый инструмент CADD — более 150. Поскольку для почти ни одного варианта неизвестно наверняка, вреден ли он, команда применила косвенный подход: редкие в популяции варианты считаются вероятно вредными, а частые — вероятно безвредными, так как вредные мутации реже распространяются между поколениями. Несмотря на такое косвенное обучение, AVI превзошёл существующие инструменты в тестах на уже клинически классифицированных вариантах, особенно в некодирующих областях, хотя в некоторых задачах конкуренты оказались лучше.

Модель AlphaGenome, представленная в 2025 году, считывает участки ДНК длиной в миллион букв и предсказывает влияние на экспрессию генов и сплайсинг.

Атлас также показывает, какой именно процесс определяет оценку варианта — например, нарушение сплайсинга или работы регуляторного элемента. Практический пример из консорциума GREGoR, изучающего неразгаданные редкие заболевания, демонстрирует пользу такого подхода. У ребёнка с тяжёлой эпилепсией долго не могли поставить диагноз, несмотря на полногеномное секвенирование. AVI вывел вариант в гене DNM1, ранее классифицированный как неясный, в топ кандидатов. Предсказания AlphaGenome указали механизм: вариант создаёт неправильный сайт сплайсинга, удлиняя белок на 13 аминокислот, но это происходит только в версии гена, которая экспрессируется исключительно в мозге. Поэтому более ранние анализы образцов крови ничего не выявили. Лабораторный эксперимент подтвердил предсказание, и исследователи рекомендовали классифицировать вариант как вероятно болезнетворный. При ретроспективном анализе уже решённых случаев консорциума AVI помещал причинный вариант в топ-50 кандидатов в 29,5% случаев, тогда как CADD — лишь в 12,5%.

Атлас предназначен и для популяционных исследований. Чтобы выяснить, влияют ли редкие варианты в области генома на какой-либо показатель, например уровень белка в крови, необходимо анализировать их совместно, поскольку каждый по отдельности слишком редок для статистики. Если смешивать безвредные и эффективные варианты, сигнал теряется в шуме. Гарет Хоукс из Университета Эксетера использовал атлас, чтобы группировать только те варианты, которые предсказаны как действующие одинаково, на основе данных геномов более 54 000 участников UK Biobank. Это позволило выявить на 22% больше связей между некодирующими вариантами и уровнями белков в крови, чем при использовании обычных фильтров. Из предсказаний также выведено 2601 повторяющихся коротких мотивов ДНК — по сути, «слов» генома, к которым прикрепляются регуляторные белки.

У AlphaGenome есть ограничения: он не охватывает все типы клеток и не учитывает эффекты, опосредованные количеством других регуляторных белков. Атлас и AVI — исследовательские инструменты, подчёркивают в DeepMind, и могут быть лишь одним из звеньев в цепи доказательств при постановке диагноза. Атлас доступен для некоммерческого использования через веб-портал, API и как навык в Google Antigravity. Коммерческая версия появится позже в Google Cloud.