Как используются нейросети в биоинформатике и медицине?
Рассказывает Василий Раменский, к.ф.-м.н., руководитель Лаборатории искусственного интеллекта в биоинформатике и медицине ИИИ МГУ.
В последние годы мы наблюдаем удивительный и очень быстрый прогресс нейросетевых моделей. Самые наглядные результаты, наверное, получаются в области создания текстов и изображений: первый самостоятельный эксперимент с моделями вроде ChatGPT или Kandinsky производит невероятно сильное впечатление.
Так называемые большие языковые модели обучаются на всех доступных текстах и превращают их в последовательности векторов. Каждый вектор соответствует одному слову и не вполне очевидным для нас образом отражает смысл слова и его контекст. При этом схожие по смыслу или контексту слова описываются похожими векторами. Наш запрос к модели также трансформируется в вектор и служит точкой для дальнейшего взаимодействия.
Биологические последовательности тоже можно рассматривать как тексты. Словом при этом является отдельная аминокислота. Оказалось, что современные методы глубокого обучения, разработанные для работы с языками, могут быть весьма эффективны при решении задач молекулярной биологии. Например, в задаче мутирования белков с целью улучшения их свойств.
Для этого был предложен подход, состоящий из двух основных шагов. На первом этапе используется так называемая базовая модель, обученная на сотнях миллионов последовательностей всех известных на сегодняшний день белков. На втором этапе модель подстраивается на работу с конкретным белком: для этого используются результаты экспериментов, в которых в данный белок вносят мутации и измеряют их влияние на свойства белка. Важно, что таких экспериментов можно провести относительное небольшое количество, например, десятки. Такая схема объединяет информацию о том, как устроены белки в принципе, с особенностями конкретного белка и позволяет предложить потенциально перспективные новые варианты данного белка, например, более устойчивые к высоким температурам окружающей среды.
Наша Лаборатория искусственного интеллекта в биоинформатике и медицине занимается, в частности, разработкой и применением базовых моделей глубокого обучения для предсказания изменения биологической активности и термостабильности ряда специфических биоинженерных и промышленных ферментов: бета-лактамазы, никазы, химозина и других.
Другой задачей, решаемой с помощью больших языковых моделей, является описание функций новых белков. Нами были разработаны модель и сервис Protomenal для выявления так называемых функциональных доменов в составе белков. Домены представляют собой фрагменты последовательности, ответственные за ту или иную функцию и часто более эволюционно консервативные, чем другие участки белка. Сервис может использоваться, например, при анализе впервые секвенированных геномов бактерий или вирусов.
Еще одним бурно развивающимся направлением в современной биомедицине является анализ закономерностей профилей экспрессии генов в различных тканях. Экспрессией гена называется его "включение", которое приводит к синтезу белка-продукта этого гена. Последовательность ДНК и, следовательно, набор генов одинаковы во всех клетках организма, а многообразие и трансформации различных клеток обеспечиваются разнообразием экспрессии групп генов, то есть их согласованного включения и выключения. Регуляция экспрессии генов является основой клеточной дифференцировки, развития, морфогенеза, а также универсальности и приспособляемости любого организма.
Современные методы глубокого обучения оказываются эффективным инструментом для исследования согласованной экспрессии групп генов и влияния на нее внешних воздействий. Один из подходов можно описать, используя упрощенную аналогию с нейросетями, которые при генерации изображений разделяют стиль и сюжет изображения: "нарисуй мне ускоритель элементарных частиц в стиле среднего периода Врубеля".
На основе так называемого условного вариационного автокодировщика нами была разработана методика, которая позволяет исследовать и предсказать изменения профиля экспрессии генов при изменении заранее определенного категориального фактора, например, воздействия лекарственных препаратов и новых химических соединений. Это может использоваться для решения практических задач – разработки новых лекарственных препаратов, разработки схем лечения, планирования экспериментов, а также для анализа и интерпретации полученных результатов.
