Оптимизация
антител
при помощи филогенетического анализа

Ускоряем разработку лекарств, используя
компьютерное построение

Схема антитела с лёгкими и тяжёлыми цепями

Антитело

Защитный белок, который можно представить как «липучку». Антитело узнаёт конкретную молекулу-мишень в организме, прикрепляется к ней и либо блокирует её работу, либо помогает иммунной системе заметить опасную клетку или вирус.

Но проблема в том, что вариантов антител может быть очень много. Даже небольшая мутация, то есть замена одной «буквы» в последовательности, может изменить свойства антитела.

Как устроено антитело и где находится участок связывания

Иммуноглобулин G (IgG) — Y-образный белок из четырёх цепей: двух тяжёлых (H) и двух лёгких (L), сшитых дисульфидными связями. Две верхние цепи узнают мишень, нижняя цепь подаёт сигнал иммунным клеткам — уничтожить помеченный объект.

Мишень называется антигеном: это фрагмент вируса, бактерии или изменённой клетки. Антитело связывает не весь антиген целиком, а маленький участок его поверхности — эпитоп.

Каждая цепь собрана из доменов. На концах цепей лежат вариабельные домены (VH и VL) — именно они различаются у разных антител. Остальные домены константные и почти одинаковы у всех молекул одного класса.

тяжёлая цепь (H)VHCH1CH2CH3лёгкая цепь (L)VLCLвнутри вариабельного доменаFR1CDR1FR2CDR2FR3CDR3FR4

Внутри вариабельного домена чередуются четыре каркасных участки (FR1–FR4) и три гипервариабельные петли (CDR1–CDR3). Каркас держит форму, а петли CDR физически касаются антигена и решают, к чему антитело прилипнет. Границы петель размечают консервативные якоря — цистеин и триптофан; по ним нумерация IMGT находит CDR3, самый разнообразный участок молекулы.

Поэтому замена в CDR меняет связывание намного сильнее, чем такая же замена в каркасе, — и пайплайн в первую очередь смотрит именно на эти позиции.

Лабораторная система для работы с образцами

Проблема и актуальность

Антитела — идеальное оружие против болезней. В отличие от химических препаратов, они действуют точечно: распознают только нужную мишень и не трогают здоровые клетки.

Но создать работающее антитело непросто. Его эффективность зависит от множества аминокислотных замен, и каждая комбинация даёт непредсказуемый результат. Вариантов — бесчисленное множество, синтезировать их все невозможно.

Наше решение

Наш подход основан на построении филогенетических деревьев для групп антител, близких по структуре. Анализируя ветвления и накопленные замены, мы отслеживаем, какие мутации возникали и закреплялись в ходе естественной эволюции. Это позволяет выделить позиции, где изменения с высокой вероятностью вели к улучшению целевых характеристик — и именно их мы рассматриваем как приоритетные для дальнейшей инженерии.

Филогенетический анализ — построение «родословного дерева» для похожих последовательностей. Мы строим такие деревья для антител и подсвечиваем на них мутации — чтобы увидеть, как иммунная система «эволюционировала» в ответ на инфекцию.
Как читать филогенетическое дерево

Филогенетическое дерево — схема родства последовательностей. Листья на концах ветвей — реальные антитела из образца, внутренние узлы — их предполагаемые общие предки, а корень дерева — зародышевая (germline) последовательность, с которой всё началось.

Длина ветви показывает, сколько замен накопилось на этом участке пути. Клада — узел вместе со всеми потомками, то есть группа антител, происходящих от одного общего предка.

Ветви неравноценны: у каждой есть оценка надёжности. IQ-TREE считает бутстреп-поддержку (UFBoot), MrBayes — апостериорную вероятность. Мы считаем кладу уверенной, когда UFBoot не ниже 95 и aLRT не ниже 80, а байесовская модель даёт вероятность от 0,95.

Дальше дерево читается так: если замена возникла на ветви, ведущей к уверенной кладе, и сохранилась у всех её потомков — скорее всего, её закрепил отбор, а не случайность. Такие позиции и становятся кандидатами.

Цель: реализация программного пайплайна на основе филогенетического анализа, который будет по последовательностям антител определять позиции потенциально важных мутаций и формировать рекомендации кандидатов для дальнейшей разработки лекарства.

От буквы к свойству

Как читается одна мутация

Кодон — три буквы ДНК, задающие аминокислоту. Измените любую букву и посмотрите, как замена отражается на белке.

Измените букву: A → C → G → T
От образца к результату

Пайплайн решения

Сначала очищаем данные, затем объединяем родственные последовательности, выравниваем их и строим деревья, чтобы найти значимые мутации.

01

Ввод данных

Проверяем формат и качество исходных последовательностей.

02

Группировка

Объединяем родственные последовательности по V / (D) / J-генам.

03

Выравнивание

Сопоставляем позиции и сохраняем рамку считывания.

04

Филогенетические деревья

Строим две независимые модели: IQ-TREE и MrBayes.

05

Анализ мутаций

Сопоставляем ветви и формируем список приоритетных замен.

Подробно по этапам

01 · FASTA

Входные данные

Лаборатория считывает генные последовательности антител. Мы проверяем формат, удаляем неполные записи и сохраняем только продуктивные цепи.

образец
>seq_001 | heavy_chain
ATGCAGGTGCAGCTG...
>seq_002 | light_chain
GATATTGTGATGACC...
02 · клональные линии

Группировка последовательностей

Последовательности распределяются по гермлайновым генам V / (D) / J, а близкие варианты собираются в отдельные клональные семьи.

IGHV
Heavy chain variable — гены тяжёлой цепи, постфикс (например 3-23) после номера — вариант гена.
IGHJ
Joining genes — гены «стыковки» тяжёлой цепи, также с постфиксом, например IGHJ4.
IGHD
Diversity genes — гены диверсификации между V и J, тоже имеют постфикс (IGHD2-2).
IGHV3-23126 последовательностей
IGHV1-6984 последовательности
IGHJ457 последовательностей
родственные записи→ одна клональная линия
03 · два режима

Выравнивание последовательностей

Сравниваем ДНК-последовательности буква к букве, чтобы увидеть совпадения и мутации. Для сравнения используем классический режим и режим с учётом рамки считывания.

Зачем нужна рамка считывания

Рамка считывания — разбиение последовательности ДНК на кодоны, тройки нуклеотидов. Каждая тройка кодирует одну аминокислоту, и клетка читает ген строго по три буквы, начиная от старт-кодона.

При выравнивании программа вставляет пропуски, чтобы совместить похожие участки. Если пропуск не кратен трём, все последующие кодоны сдвигаются — происходит сдвиг рамки. После него белок читается неверно: аминокислоты получаются чужие, а часто возникает и преждевременный стоп-кодон.

MAFFT выравнивает нуклеотиды как обычный текст и о кодонах не знает, поэтому может разрезать тройку пополам. MACSE выравнивает с учётом рамки: держит кодоны целыми и добавляет пропуски порциями по три.

Это не косметика. Только при сохранённой рамке замену можно честно назвать синонимичной (аминокислота не изменилась) или значимой (изменилась) — а весь дальнейший отбор кандидатов держится именно на этом различии.

MAFFTклассическое выравнивание
MACSEвыравнивание по кодонам
Рамка считываниясохраняет смысл белка
Два режима выравниванияодни данные · разная логика
без учёта рамки считыванияMAFFT · multiple sequence alignmentклассическое выравнивание нуклеотидов
germlineA C G T A G C T clone_01A C G C A G C T clone_02A C G A G C T clone_03A C G T A G G T
с учётом рамки считыванияMACSE · codon-aware alignmentкодоны остаются целыми
germlineATG CAG GTG CAG clone_01ATG CAA GTG CAG clone_02ATG --- GTG CAG clone_03ATG CAG GTA CAG
совпадениезаменаделеция (удаление)
04 · двойная проверка

Построение филогенетических деревьев

IQ-TREE и MrBayes строят независимые модели. Совпавшие ветви с высокой поддержкой становятся наиболее надёжными кандидатами для анализа мутаций.

IQ-TREE
MrBayes

IQ-TREE ищет дерево, лучше всего объясняющее данные. MrBayes оценивает вероятности деревьев. Совпавшие выводы надёжнее.

IQ-TREE

Максимальное правдоподобие

IQ-TREE — ищет самое вероятное дерево
L(дерево) = P(данные | дерево)
лучшее дерево = arg maxдерево L(дерево)

Простым языком: мы видим сегодняшние последовательности, но не знаем путь их эволюции. IQ-TREE сравнивает варианты дерева и выбирает тот, при котором увиденные данные наиболее вероятны.

BootstrapПеремешиваем позиции выравнивания и проверяем, насколько стабильно повторяется ветвь.
97 на деревеВетвь появилась в 970 из 1000 повторов — высокая поддержка.
MrBayes

Байесовский подход

MrBayes — считает вероятность каждого дерева
P(дерево | данные) =P(данные | дерево) · P(дерево)P(данные)

Простым языком: это обратная задача. MrBayes рассматривает множество возможных деревьев и оценивает вероятность каждого после того, как увидел данные.

Posterior probabilityДоля рассмотренных деревьев, в которых присутствует конкретная ветвь.
0,99 на деревеВетвь присутствует в 99% выборки; значение выше 0,95 считается надёжным.
05 · проверка результата

Анализ мутаций

Графики показывают распределение генов, размеров и глубины клад и накопление замен. Таблица ниже связывает каждую мутацию с позицией IMGT, исходным кодоном и новой аминокислотой.

Графики анализа мутаций
sequence_idregionimgt_posref_aamut_aaref_codonmut_codon
ATAGACCAGGGCATGT-1_contig_2FR111VLGTGTTG
ATAGACCAGGGCATGT-1_contig_2FR123KQAAGCAG
ATAGACCAGGGCATGT-1_contig_2CDR130FLTTCCTC
ATAGACCAGGGCATGT-1_contig_2CDR131SNAGCAAC
sequence_id
ID последовательности
region
участок домена: каркас FR или петля CDR
imgt_pos
позиция по нумерации IMGT
ref_aa / mut_aa
аминокислота в зародышевой линии → в последовательности
ref_codon / mut_codon
кодон в зародышевой линии → в последовательности
Колесо генетического кода
От кодона к аминокислотеТри нуклеотида читаются от центра к краю и задают одну аминокислоту.
Инструменты проекта

Открытый научный стек

Инструменты, принятые в филогенетике и биоинформатике.

MAFFT

Множественное выравнивание последовательностей.

IQ-TREE

Деревья максимального правдоподобия и bootstrap.

MrBayes

Байесовский подход к оценке надёжности клад.

IgBLAST

Аннотация V(D)J и поиск гермлайновых генов.

MACSE

Выравнивание с учётом рамки считывания.

Biopython

Подготовка, обработка и анализ последовательностей.

Интерфейс

Как выглядит работа с результатом

Графический интерфейс открывает каталог прогона и показывает результат по каждой клональной группе: дерево, выравнивание с разметкой FR и CDR, таблицу мутаций и список достоверных клад.

Интерфейс просмотр результатов прогона
Интерфейс просмотра результатов прогона: дерево, выравнивание, таблица мутаций
QR-код
QR-код на репозиторий проекта
Репозиторий проекта
Вопросы и ответы

Коротко о главном

Шесть вопросов, которые чаще всего возникают к нашему решению.

Сколько антител способен произвести организм?

Порядка десяти миллиардов различных вариантов. Иммунная система собирает их случайными комбинациями V-, D- и J-генов, а затем дорабатывает точечными заменами — этот процесс называется соматическим гипермутированием. Именно поэтому иммунная защита у каждого человека своя.

Почему нельзя просто перебрать все варианты?

Типичное антитело — это две тяжёлые цепи примерно по 450 аминокислот и две лёгкие примерно по 220, всего около 1340 позиций. Каждая из них — потенциальная точка замены, а замены ещё и сочетаются между собой. Синтезировать и проверить такой объём в лаборатории невозможно, поэтому перебор нужно сузить заранее.

Зачем искать мутации у природы, а не наугад?

Иммунная система уже провела этот перебор за нас: при созревании аффинности отбор сохранял те клетки, чьи антитела связывали мишень прочнее. Мы читаем результат уже состоявшегося эксперимента — какие замены закрепились и передались потомкам, — вместо того чтобы генерировать варианты вслепую.

Зачем два независимых метода вместо одного?

IQ-TREE и MrBayes опираются на разную математику: первый ищет дерево с наибольшим правдоподобием, второй оценивает вероятности целого множества деревьев. Ветвь, которую подтверждают оба, — это как два независимых свидетеля, описавших одно и то же событие. Совпадение и служит нам критерием доверия.

Что такое синонимичная замена?

Генетический код избыточен: разные тройки нуклеотидов кодируют одну и ту же аминокислоту. Например, GGT и GGC — обе глицин. Такая замена меняет ДНК, но не меняет белок, поэтому на свойства антитела не влияет и в кандидаты не идёт. Проверить это можно прямо в интерактиве выше.

Когда клада считается достоверной?

Когда её независимо подтверждают обе оценки надёжности: бутстреп-поддержка не ниже 95 и SH-aLRT не ниже 80, а для байесовского пути — апостериорная вероятность от 0,95. На нашем прогоне из 357 клональных групп такой порог прошли 742 клады — именно их замены и попадают в список кандидатов.

Команда

Над решением работали

Денис Шумилов

Биоинформатик · деревья IQ-TREE, визуализация, таблицы мутаций

Ксения Сигалаева

Биоинформатик · обработка исходных данных и клональная группировка

Алина Джалилова

Биоинформатик · множественное выравнивание последовательностей

Никита Сыздыков

Биоинформатик · байесовский анализ и отбор достоверных клад

Менторы

Екатерина Фильчакова

Аналитик отдела разработки биоинформатического программного обеспечения, BIOCAD

Константин Тыщук

Руководитель отдела разработки биоинформатического программного обеспечения, BIOCAD

Оптимизация антител при помощи филогенетического анализа