Можно ли предсказать метилирование ДНК по её последовательности?
Модель Melody учится читать закономерности метилирования прямо из последовательности ДНК. На данных 39 типов клеток она превзошла прежние методы и показала, где для прогноза уже необходим контекст самой клетки.

Иллюстрация: «Наука Просто», создана с использованием ИИ.
У метилирования есть интересный парадокс: разные типы клеток имеют практически одну и ту же последовательность ДНК, но их эпигенетические профили заметно различаются. Тем не менее новая модель Melody показала, что предсказать метилирование ДНК во многих участках можно по самой последовательности — особенно если смотреть не на несколько десятков букв генома, а на контекст длиной около 10 000 оснований. Метилирование ДНК — это химическая модификация, при которой к цитозину присоединяется небольшая метильная группа.
У человека она особенно часто анализируется в участках CpG, где цитозин соседствует с гуанином. Такие метки связаны с работой генов, организацией хроматина и клеточной идентичностью. Но метилирование нельзя считать просто «надстройкой», совершенно независимой от текста генома.
Сама последовательность содержит участки, которые распознаются регуляторными белками, а расположение таких мотивов связано с локальным состоянием метилирования. Вопрос в том, насколько далеко можно зайти, имея перед глазами только последовательность ДНК.
10 000 оснований вместо нескольких десятков
Авторы использовали опубликованные карты метилирования 39 нормальных типов человеческих клеток и создали систему глубокого обучения Melody. На вход модель получает участок ДНК длиной 10 килобаз — около 10 000 оснований — и пытается восстановить уровень метилирования отдельных CpG-сайтов.
Это существенно более широкий контекст, чем у ряда предыдущих моделей. Например, одна из моделей сравнения использовала окно всего в 41 пару оснований. Такой короткий фрагмент может содержать ближайший регуляторный мотив, но пропустить сигналы, расположенные значительно дальше.
Разница оказалась измеримой. В тестах на данных 39 типов клеток многоканальная версия Melody показала среднюю корреляцию Спирмена 0,723 на одном тестовом наборе и 0,645 при проверке на отложенной хромосоме. У лучших моделей сравнения соответствующие значения составляли 0,590 и 0,584.
В среднем авторы оценивают относительное улучшение корреляции примерно в 17%. Важно, что корреляция 0,723 не означает «72,3% точности». Она показывает, насколько хорошо предсказанные моделью различия в метилировании соответствуют реальным различиям между участками генома.
Эксперименты с длиной входной последовательности тоже оказались показательными. Окна примерно в 10 килобаз работали лучше 2-килобазных, а увеличение контекста до 20–50 килобаз уже не давало дополнительного выигрыша и добавляло избыточную информацию.
Что модель узнала о регуляции метилирования
Melody проверяли не только как инструмент восстановления уже известных профилей. Авторы также исследовали, способна ли она предсказывать влияние генетических вариантов, связанных с изменением метилирования, — так называемых meQTL.
Модель анализировала, как замена одной буквы ДНК может создавать или разрушать последовательности, узнаваемые регуляторными белками. Кроме того, исследователи систематически изучили 282 мотива связывания транскрипционных факторов. В предсказаниях появились как широко действующие регуляторные мотивы, так и сигналы, характерные для определённых клеточных линий.
Это интересный результат, но здесь особенно важно не перепутать предсказание с механизмом. Если модель связывает определённый мотив с изменением метилирования, это ещё не доказывает, что именно этот мотив непосредственно вызывает изменение в живой клетке. Авторы прямо называют такие результаты модельными ассоциациями, требующими экспериментальной проверки.
Последовательности недостаточно
Особенно наглядно граница возможностей проявилась при попытке предсказать метилирование в типах клеток, которых модель раньше не видела.
Для такого теста пять типов клеток полностью исключили из обучения, оставив остальные 34. Здесь появилась версия Melody-G, в которую кроме последовательности ДНК добавили информацию об активности генов из данных одноклеточного RNA-секвенирования. Средняя AUC на пяти новых типах клеток выросла с 0,633 у простого базового подхода до 0,697 после дополнительного обучения Melody-G — относительное улучшение составило 10,1%.
То есть последовательность генома содержит значительную часть информации, необходимой для предсказания метилирования, но не всю. Реальное состояние клетки зависит также от доступности хроматина, присутствия транскрипционных факторов, истории развития клетки, времени репликации и других процессов, которых в одной последовательности ДНК нет. Работа полностью вычислительная: новых биологических образцов авторы не собирали, а использовали существующие публичные наборы данных.
Поэтому пока речь идёт не о новом способе измерения метилирования вместо лабораторного анализа и тем более не о готовом диагностическом инструменте. Главный вывод работы скорее фундаментальный. Эпигенетическая информация не записана в последовательности ДНК в виде простого кода, но и не существует независимо от неё.
Значительная часть структуры метилома оказывается предсказуемой из самого генома, а оставшуюся часть помогает объяснить состояние конкретной клетки.
© 2026 «Наука Просто». Правообладатель: Давид Чеишвили. Краткое цитирование допускается с активной ссылкой на оригинальный материал. Правила использования
