Наука Просто
Генетика и эпигенетикаРазбор исследования4 мин чтения18 августа 2026 г.

Можно ли предсказать метилирование ДНК по её последовательности?

Модель Melody учится читать закономерности метилирования прямо из последовательности ДНК. На данных 39 типов клеток она превзошла прежние методы и показала, где для прогноза уже необходим контекст самой клетки.

Двойная спираль ДНК с выделенными участками метилирования на фоне разных типов клеток.

Иллюстрация: «Наука Просто», создана с использованием ИИ.

У метилирования есть интересный парадокс: разные типы клеток имеют практически одну и ту же последовательность ДНК, но их эпигенетические профили заметно различаются. Тем не менее новая модель Melody показала, что предсказать метилирование ДНК во многих участках можно по самой последовательности — особенно если смотреть не на несколько десятков букв генома, а на контекст длиной около 10 000 оснований. Метилирование ДНК — это химическая модификация, при которой к цитозину присоединяется небольшая метильная группа.

У человека она особенно часто анализируется в участках CpG, где цитозин соседствует с гуанином. Такие метки связаны с работой генов, организацией хроматина и клеточной идентичностью. Но метилирование нельзя считать просто «надстройкой», совершенно независимой от текста генома.

Сама последовательность содержит участки, которые распознаются регуляторными белками, а расположение таких мотивов связано с локальным состоянием метилирования. Вопрос в том, насколько далеко можно зайти, имея перед глазами только последовательность ДНК.

10 000 оснований вместо нескольких десятков

Авторы использовали опубликованные карты метилирования 39 нормальных типов человеческих клеток и создали систему глубокого обучения Melody. На вход модель получает участок ДНК длиной 10 килобаз — около 10 000 оснований — и пытается восстановить уровень метилирования отдельных CpG-сайтов.

Это существенно более широкий контекст, чем у ряда предыдущих моделей. Например, одна из моделей сравнения использовала окно всего в 41 пару оснований. Такой короткий фрагмент может содержать ближайший регуляторный мотив, но пропустить сигналы, расположенные значительно дальше.

Разница оказалась измеримой. В тестах на данных 39 типов клеток многоканальная версия Melody показала среднюю корреляцию Спирмена 0,723 на одном тестовом наборе и 0,645 при проверке на отложенной хромосоме. У лучших моделей сравнения соответствующие значения составляли 0,590 и 0,584.

В среднем авторы оценивают относительное улучшение корреляции примерно в 17%. Важно, что корреляция 0,723 не означает «72,3% точности». Она показывает, насколько хорошо предсказанные моделью различия в метилировании соответствуют реальным различиям между участками генома.

Эксперименты с длиной входной последовательности тоже оказались показательными. Окна примерно в 10 килобаз работали лучше 2-килобазных, а увеличение контекста до 20–50 килобаз уже не давало дополнительного выигрыша и добавляло избыточную информацию.

Что модель узнала о регуляции метилирования

Melody проверяли не только как инструмент восстановления уже известных профилей. Авторы также исследовали, способна ли она предсказывать влияние генетических вариантов, связанных с изменением метилирования, — так называемых meQTL.

Модель анализировала, как замена одной буквы ДНК может создавать или разрушать последовательности, узнаваемые регуляторными белками. Кроме того, исследователи систематически изучили 282 мотива связывания транскрипционных факторов. В предсказаниях появились как широко действующие регуляторные мотивы, так и сигналы, характерные для определённых клеточных линий.

Это интересный результат, но здесь особенно важно не перепутать предсказание с механизмом. Если модель связывает определённый мотив с изменением метилирования, это ещё не доказывает, что именно этот мотив непосредственно вызывает изменение в живой клетке. Авторы прямо называют такие результаты модельными ассоциациями, требующими экспериментальной проверки.

Последовательности недостаточно

Особенно наглядно граница возможностей проявилась при попытке предсказать метилирование в типах клеток, которых модель раньше не видела.

Для такого теста пять типов клеток полностью исключили из обучения, оставив остальные 34. Здесь появилась версия Melody-G, в которую кроме последовательности ДНК добавили информацию об активности генов из данных одноклеточного RNA-секвенирования. Средняя AUC на пяти новых типах клеток выросла с 0,633 у простого базового подхода до 0,697 после дополнительного обучения Melody-G — относительное улучшение составило 10,1%.

То есть последовательность генома содержит значительную часть информации, необходимой для предсказания метилирования, но не всю. Реальное состояние клетки зависит также от доступности хроматина, присутствия транскрипционных факторов, истории развития клетки, времени репликации и других процессов, которых в одной последовательности ДНК нет. Работа полностью вычислительная: новых биологических образцов авторы не собирали, а использовали существующие публичные наборы данных.

Поэтому пока речь идёт не о новом способе измерения метилирования вместо лабораторного анализа и тем более не о готовом диагностическом инструменте. Главный вывод работы скорее фундаментальный. Эпигенетическая информация не записана в последовательности ДНК в виде простого кода, но и не существует независимо от неё.

Значительная часть структуры метилома оказывается предсказуемой из самого генома, а оставшуюся часть помогает объяснить состояние конкретной клетки.