Технологии и будущее

Использование искусственного интеллекта: как нейросети совершили прорыв в расшифровке генома

98% человеческого генома не кодируют белки напрямую. Но «некодирующий» не означает бесполезный или случайный: в этих последовательностях находятся участки, регулирующие активность генов, работу РНК и упаковку ДНК.

Использование искусственного интеллекта: как нейросети совершили прорыв в расшифровке генома

Долгое время их было трудно анализировать системно. Данных становилось больше, а способы отделить биологический сигнал от технического шума оставались ограниченными.

Использование искусственного интеллекта изменило эту ситуацию не одним эффектным открытием, а целой цепочкой рабочих инструментов. Нейросети научились распознавать варианты в сырых данных секвенирования, предсказывать пространственную форму белков и оценивать, как замена одного нуклеотида может повлиять на регуляторные процессы в клетке. При этом ИИ не превратил геномику в автоматическую кнопку «получить диагноз». Он сделал другое: ускорил перебор гипотез и позволил рассматривать такие объёмы данных, с которыми прежние методы справлялись только частично.

От сырых данных к биологическим открытиям: роль DeepVariant

Секвенирование нового поколения выдаёт не готовую последовательность генома, а множество коротких фрагментов ДНК. Их нужно сопоставить с референсным геномом, учесть качество каждого считывания и определить, где находится настоящий генетический вариант, а где ошибка прибора или артефакт подготовки образца.

Это задача не столько «чтения текста», сколько восстановления сигнала по неполным и зашумлённым наблюдениям. Один и тот же участок может быть покрыт множеством фрагментов, часть из которых прочитана неправильно. В гетерозиготном геноме дополнительно нужно понять, какие изменения присутствуют в одной копии хромосомы, а какие — в обеих.

Классические алгоритмы решали эту задачу с помощью набора статистических правил и заранее заданных моделей ошибок. Такой подход остаётся полезным, но у него есть ограничение: качество работы зависит от типа данных, особенностей платформы секвенирования и параметров конкретного конвейера. Модель, хорошо настроенная для одного источника данных, не обязательно так же уверенно поведёт себя на другом.

В 2017 году Google Research представила DeepVariant — инструмент, который переложил часть задачи вызова вариантов на архитектуру, напоминающую компьютерное зрение. Вместо того чтобы напрямую обрабатывать последовательность правил, программа формирует визуальное представление участка: в нём отражаются совпадения с референсом, альтернативные основания, качество считываний и другие характеристики покрытия. Нейросеть затем классифицирует такое представление.

В практическом смысле DeepVariant отвечает на несколько связанных вопросов:

  • совпадают ли данные с референсной последовательностью;
  • есть ли в этом месте однонуклеотидная замена;
  • присутствует ли небольшая вставка или делеция;
  • достаточно ли качества сигнала, чтобы считать наблюдение настоящим вариантом;
  • какова вероятная генотипическая конфигурация — например, одна изменённая копия или две.

Результатом становится стандартный файл с описанием генетических вариантов, который можно передать в следующие этапы анализа. Это важное изменение в рабочем процессе: нейросеть не «понимает геном» целиком, а автоматизирует конкретную, хорошо формализуемую часть обработки.

Для оценки таких инструментов используют precision, recall и объединяющую их F1-меру. Они показывают, насколько хорошо модель находит реальные варианты и насколько часто ошибочно принимает артефакты за биологические изменения. На эталонных наборах DeepVariant демонстрировал очень высокое качество для однонуклеотидных замен и небольших инделей. Но эти результаты нельзя превращать в универсальную константу: итог зависит от типа варианта, покрытия, качества образца, технологии секвенирования и версии модели.

DeepVariant поддерживает разные платформы и режимы работы, однако это не означает одинаковой производительности во всех случаях. Для коротких чтений, длинных чтений и данных с разной моделью ошибок используются отдельные настройки и обученные варианты моделей. Там, где одна технология даёт устойчивый сигнал, другая может требовать дополнительной фильтрации или иной стратегии вызова вариантов.

Именно поэтому нейросеть не отменяет контроль качества. Она снижает объём ручной настройки и делает обработку более воспроизводимой, но специалистам всё равно нужно проверять покрытие, происхождение данных, тип найденных вариантов и соответствие результата поставленной задаче.

Революция в структурной биологии: как AlphaFold предсказывает форму белков

Белок — это не просто цепочка аминокислот. Его функции зависят от того, как эта цепочка сворачивается в пространстве, какие участки оказываются рядом и как образуется поверхность взаимодействия с другими молекулами.

Получить такую структуру экспериментально можно разными способами. Рентгеноструктурный анализ требует выращивания подходящих кристаллов белка и последующей обработки дифракционных данных. Криоэлектронная микроскопия работает иначе: образец быстро замораживают и исследуют в тонком слое льда, после чего по множеству изображений восстанавливают трёхмерную форму. Для крио-ЭМ кристаллизация не нужна, хотя метод также предъявляет серьёзные требования к чистоте, стабильности и концентрации образца.

Экспериментальные методы остаются основой структурной биологии, но они могут быть длительными, дорогими и плохо подходить для нестабильных или сложных белковых комплексов. Вычислительные модели позволяют заранее отобрать наиболее интересные варианты и понять, какие участки молекулы заслуживают внимания.

Первая версия AlphaFold показала, что глубокое обучение может заметно улучшить предсказание структуры белка по аминокислотной последовательности. Переломным моментом стала AlphaFold 2, представленная в 2020 году на конкурсе CASP14. Модель использует информацию об эволюционно связанных последовательностях и парных отношениях между остатками. Если два участка белка часто меняются согласованно, это может указывать на их пространственную близость или функциональную связь.

Архитектура AlphaFold 2 объединяет несколько типов представлений:

  • последовательность аминокислот;
  • множественное выравнивание родственных последовательностей;
  • вероятные связи между парами аминокислот;
  • геометрические ограничения будущей структуры;
  • оценку уверенности в отдельных участках предсказания.

Важен не только сам трёхмерный результат, но и карта уверенности. Для компактного стабильного домена модель может быть весьма надёжной, а для гибкого концевого участка, неупорядоченного региона или белка с несколькими возможными состояниями — значительно менее уверенной. Одна красивая картинка молекулы поэтому ещё не является доказательством того, что именно такая конфигурация существует в клетке.

На CASP14 AlphaFold 2 показала результат, который для значительной части белковых мишеней приблизился к качеству экспериментальных моделей. В некоторых случаях показатель GDT превышал 90 баллов. GDT оценивает, какая доля структуры предсказана с различной точностью по сравнению с экспериментальным эталоном. Это удобная сравнительная метрика, но она не переводится напрямую в одну универсальную медианную погрешность координат всех атомов. Высокий GDT не означает автоматически, что каждая координата известна с одинаковой точностью.

Сильная сторона AlphaFold — не обещание абсолютной истины, а способность быстро сузить пространство правдоподобных структур.

В 2021 году метод и исходный код AlphaFold 2 были опубликованы, а база AlphaFold DB стала доступна исследователям. В ней собраны предсказания для огромного числа белковых последовательностей, включая многие белки, для которых экспериментальных структур пока нет. Это изменило саму логику работы: структурную гипотезу теперь часто получают до лабораторного эксперимента, а не после многомесячного цикла подготовки образца.

Следующее развитие системы — AlphaFold 3 — расширило область моделирования за пределы отдельных белков. Модель предназначена для работы с комплексами, в которых участвуют белки, нуклеиновые кислоты, ионы и небольшие молекулы-лиганды. Такой подход особенно важен для изучения лекарственного взаимодействия: биологический эффект часто определяется не формой белка в изоляции, а тем, как он связывается с другой молекулой.

Но предсказанный комплекс всё равно остаётся моделью. Его нужно проверять экспериментально, особенно если речь идёт о разработке препарата, механизме заболевания или точной инженерии белка.

Взлом «тёмной материи» ДНК: возможности модели AlphaGenome

Если белки можно условно назвать рабочими механизмами клетки, то некодирующие участки генома во многом задают условия их включения. Промоторы влияют на запуск транскрипции, энхансеры усиливают активность генов, сайленсеры её подавляют, а интроны участвуют в организации и обработке РНК. Один и тот же ген может работать по-разному в нейроне, клетке печени или иммунной клетке именно из-за различий в регуляторном окружении.

Проблема в том, что регуляторный сигнал редко ограничивается несколькими соседними нуклеотидами. Он может зависеть от сочетания мотивов, типа клетки, состояния хроматина и пространственного сближения удалённых участков ДНК. Простая проверка одной буквы в одной позиции часто не объясняет, что произойдёт с геном в живой системе.

В 2025 году Google DeepMind анонсировала AlphaGenome — модель, ориентированную на анализ длинных последовательностей ДНК и прогнозирование множества молекулярных характеристик. Её ключевая идея состоит не в том, чтобы рассматривать ген как изолированный фрагмент, а в том, чтобы учитывать широкий контекст вокруг него.

В заявленном подходе модель может анализировать последовательности длиной до миллиона пар нуклеотидов и строить прогнозы сразу по нескольким типам сигналов:

Категория данныхЧто она помогает оценить
Экспрессия геновНасколько активно ген может считываться в конкретном типе клеток
Альтернативный сплайсингКак один и тот же транскрипт может превращаться в разные варианты РНК
Доступность хроматинаНасколько участок ДНК открыт для регуляторных белков
Модификации гистоновКакие эпигенетические признаки связаны с активностью участка
Метилирование ДНКНаличие регуляторных меток в определённых контекстах
Связывание факторов транскрипцииГде могут закрепляться белки, управляющие считыванием генов
Контактные карты хроматинаКакие участки генома оказываются пространственно сближены

На вход можно подать исходную последовательность и её изменённую версию, после чего сравнить прогнозы. Если одна замена меняет предполагаемый профиль доступности хроматина, сплайсинга или связывания регуляторного фактора, это становится аргументом в пользу дальнейшей проверки.

Но здесь особенно важно различать предсказание и причинное объяснение. Модель способна заметить статистическую связь между последовательностью и молекулярным сигналом, однако не всегда может показать, какой именно механизм лежит в её основе. Изменение прогноза не доказывает, что мутация вызовет заболевание, а отсутствие заметного изменения не гарантирует полной биологической нейтральности.

Кроме того, даже очень длинное окно не охватывает все возможные взаимодействия генома. Регуляторный элемент может находиться значительно дальше, работать только в определённой клеточной среде или зависеть от состояния организма. Поэтому AlphaGenome и сходные системы полезны прежде всего как инструменты приоритизации: они помогают решить, какие варианты и участки стоит проверять в лаборатории в первую очередь.

Оценка патогенности мутаций: метрика AVI и точность прогнозов

Самый чувствительный вопрос геномного анализа звучит просто: влияет ли конкретная мутация на здоровье человека? На практике ответ складывается из нескольких независимых линий доказательств. Учитывают частоту варианта в популяции, его сохранность в эволюции, расположение в гене, известные клинические наблюдения, результаты функциональных экспериментов и предсказания вычислительных моделей.

Особенно трудно работать с редкими вариантами, для которых нет достаточного числа наблюдений. В таких случаях алгоритм может оценить вероятность функционального эффекта, но не заменить клиническую интерпретацию. Категория VUS — вариант неопределённого клинического значения — существует именно потому, что биологическая правдоподобность ещё не равна доказанной патогенности.

Вокруг новых моделей появляются композитные оценки, которые пытаются объединить несколько сигналов. В контексте AlphaGenome можно обсуждать условную метрику AVI, или AlphaGenome Variant Impact, как способ свести прогнозы регуляторного воздействия с другими оценками, включая результаты AlphaMissense. Такая комбинация может быть удобна для ранжирования вариантов, но её нельзя автоматически считать универсальным клиническим стандартом.

У AVI нет общепринятого порога, который сам по себе переводил бы вариант из категории доброкачественных в патогенные. Значение любой композитной оценки зависит от того, на каких данных она обучалась, что именно предсказывает, как была откалибрована и на какой популяции проверялась. Порог, заимствованный из другой модели, не становится корректным только потому, что обе системы используют шкалу от нуля до единицы.

Для оценки подобных инструментов используют разные типы валидации:

1. Сопоставление с функциональными экспериментами. Предсказанный эффект сравнивают с данными MPRA, измерениями экспрессии, доступности хроматина или другими лабораторными тестами.

2. Проверка на известных вариантах. Модель тестируют на наборах, где уже есть достаточно надёжная классификация.

3. Разделение по типам клеток. Хороший прогноз в одной ткани не гарантирует такого же результата в другой.

4. Проверка на независимых данных. Модель должна работать не только на примерах, близких к обучающим, но и на новых наборах.

5. Оценка калибровки. Если система сообщает высокую вероятность эффекта, это должно соответствовать сопоставимой доле действительно функциональных вариантов в проверочной выборке.

Даже при хорошем результате такая оценка остаётся частью доказательной цепочки. Она может помочь выбрать кандидатов для эксперимента, но не должна в одиночку определять медицинское решение. Снижение доли VUS в клинических отчётах нельзя заявлять как установленный эффект AVI без отдельных клинических исследований, стандартизированных наборов данных и проверки в реальной практике.

Здесь особенно заметна разница между исследовательским и диагностическим применением ИИ. В исследовании допустимо использовать модель, чтобы быстро расставить приоритеты среди тысяч гипотез. В клинике требуется другое: воспроизводимость, понятная калибровка, контроль ошибок, прозрачные критерии интерпретации и ответственность за итоговое заключение.

Границы возможностей: почему ИИ дополняет, а не заменяет лаборатории

Нейросети ускоряют анализ, но не устраняют физические ограничения биологии.

Первое ограничение связано с обучающими данными. Модель узнаёт закономерности из примеров, а не выводит их из полного набора фундаментальных законов. Если в обучающей выборке мало похожих последовательностей, необычная структура белка или редкий тип регуляторного взаимодействия, уверенность прогноза может быть завышенной. Особенно осторожно нужно относиться к вариантам, которые сильно отличаются от уже изученных.

Второе ограничение — неполнота контекста. Даже модель, способная обрабатывать миллион пар оснований, не видит весь геном сразу. Регуляция может зависеть от более удалённых участков, трёхмерной организации хромосом и состояния конкретной клетки. Длина окна сама по себе не гарантирует, что причинная связь будет восстановлена.

Третье — разрыв между молекулярным сигналом и клиническим исходом. Изменение экспрессии гена ещё не означает развитие заболевания. Между мутацией и симптомом находятся клеточные пути, ткани, возраст, среда и другие варианты генома. Алгоритм может точно предсказать один промежуточный показатель и всё равно не дать надёжного ответа о состоянии организма.

Четвёртое — переносимость между видами и типами образцов. Модель, обученная главным образом на человеческих данных, не обязана одинаково хорошо работать на организмах с необычной биохимией, редкими модификациями оснований или сильно отличающейся архитектурой генома. Для древней ДНК добавляются повреждения, низкое покрытие и загрязнение образца.

Пятое — проблема неопределённых структур. Белки могут быть подвижными, существовать в нескольких конформациях или менять форму после связывания с партнёром. Предсказание одной наиболее вероятной конфигурации не всегда описывает весь набор состояний, доступных молекуле в клетке.

ИИ сокращает расстояние между данными и гипотезой, но не отменяет расстояние между гипотезой и доказательством.

Поэтому практический рабочий процесс выглядит не как замена лаборатории, а как разделение труда:

  • нейросеть просматривает большие массивы последовательностей;
  • вычислительная модель выделяет варианты и структуры, заслуживающие внимания;
  • исследователь проверяет качество данных и биологический контекст;
  • лабораторный эксперимент подтверждает или опровергает ключевое предсказание;
  • новые результаты могут использоваться для улучшения следующей версии модели.

В этом смысле автоматизация научных исследований не означает исчезновения экспериментатора. Она меняет место, где его участие наиболее ценно. Вместо ручного просмотра огромного числа слабых кандидатов специалист получает более короткий список, но должен критически оценить сам способ его формирования.

Главный эффект применения нейросетей в науке сегодня — не универсальная точность и не полная автоматизация, а увеличение масштаба разумного поиска. DeepVariant помогает надёжнее извлекать варианты из данных секвенирования. AlphaFold позволяет начинать структурную гипотезу ещё до получения экспериментального образца. AlphaGenome нацелена на более сложную задачу — связать последовательность некодирующей ДНК с активностью регуляторных сетей. Композитные оценки вроде AVI могут помочь ранжировать мутации, но пока требуют аккуратной валидации и не заменяют клинические критерии.

Следующий этап развития будет зависеть не только от архитектур моделей. Нужны качественные экспериментальные данные, разнообразные клеточные системы, стандарты оценки и понятные способы сообщать об uncertainty — неуверенности прогноза. Чем глубже ИИ входит в биологию, тем важнее становится не впечатляющая цифра в презентации, а ответ на более трудный вопрос: в каких условиях этой цифре можно доверять.

Частые вопросы

Заменяет ли ИИ лабораторные эксперименты в биологии?
Нет, ИИ не заменяет лаборатории. Он помогает быстро сузить пространство гипотез и выбрать варианты для проверки, но окончательное подтверждение результатов требует экспериментального доказательства.
Как DeepVariant помогает при анализе генома?
DeepVariant использует архитектуру компьютерного зрения для классификации генетических вариантов. Он автоматизирует процесс выявления однонуклеотидных замен, вставок и делеций в зашумленных данных секвенирования.
Насколько точно AlphaFold предсказывает структуру белков?
AlphaFold позволяет предсказывать структуру белков с высокой точностью, приближающейся к экспериментальным методам для многих мишеней. Однако модель также предоставляет карту уверенности, так как для гибких или неупорядоченных участков точность прогноза может быть ниже.
Можно ли использовать AlphaGenome для диагностики заболеваний?
AlphaGenome помогает приоритизировать варианты для проверки, но не является диагностическим инструментом. Модель может выявить статистическую связь между мутацией и молекулярным сигналом, но не всегда объясняет механизм развития заболевания.
Что такое варианты неопределенного клинического значения (VUS)?
Это варианты, для которых недостаточно данных для однозначной классификации как патогенных или доброкачественных. Использование вычислительных моделей помогает в их ранжировании, но не отменяет необходимости клинической интерпретации.