ПЕРИОДИЧЕСКИЕ ПРИЗНАКИ В ЗАДАЧЕ РАНЖИРОВАНИЯ ГЕНОМНЫХ ОКОН С ПОВТОРЯЮЩИМИСЯ УЧАСТКАМИ
Конференция: XCIX Международная научно-практическая конференция «Научный форум: технические и физико-математические науки»
Секция: Информатика, вычислительная техника и управление

XCIX Международная научно-практическая конференция «Научный форум: технические и физико-математические науки»
ПЕРИОДИЧЕСКИЕ ПРИЗНАКИ В ЗАДАЧЕ РАНЖИРОВАНИЯ ГЕНОМНЫХ ОКОН С ПОВТОРЯЮЩИМИСЯ УЧАСТКАМИ
PERIODICITY FEATURES FOR RANKING GENOMIC WINDOWS WITH REPETITIVE REGIONS
Klochkov Vadim Evgenievich
doctoral degree applicant, Russian Presidential Academy of National Economy and Public Administration, Russia, Moscow
Аннотация. Исследована добавочная ценность 29 признаков периодичности при ранжировании 8 550 141 геномного окна из 50 сборок животных и растений относительно разметки RepeatMasker. Добавление признаков к характеристикам WindowMasker повысило среднюю AP с 0,7762 до 0,9136; положительное изменение получено во всех сборках. При отборе 10 % окон число положительных объектов увеличилось с 586 051 до 797 956.
Abstract. The added value of 29 periodicity features was evaluated for ranking 8,550,141 genomic windows from 50 animal and plant assemblies against RepeatMasker labels. Adding these features to WindowMasker descriptors increased mean AP from 0.7762 to 0.9136, with a positive change in all assemblies. At a 10% selection budget, the number of positive windows increased from 586,051 to 797,956.
Ключевые слова: геномные окна; периодические признаки; WindowMasker; RepeatMasker; DUST; ранжирование; низкая сложность
Keywords: genomic windows; periodicity features; WindowMasker; RepeatMasker; DUST; ranking; low complexity
Введение
Повторяющиеся участки влияют на выравнивание последовательностей, поиск гомологов и построение генных моделей. Частые слова создают многочисленные неспецифические совпадения, а немаскированные повторы могут приводить к ошибочным предсказаниям кодирующих областей [4; 5]. Для предварительного подавления таких участков применяются методы с разной вычислительной и предметной специализацией. RepeatMasker сопоставляет последовательность с библиотеками семейств повторов, тогда как WindowMasker строит маску по статистике сверхпредставленных слов без видоспецифичной библиотеки [5; 8]. Выходы этих программ различаются: первая возвращает классы и координаты распознанных элементов, вторая выделяет часто встречающиеся фрагменты.
Современные средства аннотации повторов охватывают несколько уровней анализа. Dfam предоставляет профильные модели известных семейств, RepeatModeler2 объединяет несколько процедур для автоматического обнаружения семейств мобильных элементов, а DeepTE применяет сверточную нейронную сеть для их классификации [3; 7; 9]. Эти методы ориентированы на распознавание и предметную классификацию элементов. В данной работе рассматривается другая, предшествующая операция: ранжирование локальных окон по выраженности простой периодической структуры без определения семейства повтора.
Безбиблиотечная маска удобна для новых и немодельных сборок, однако высокая частота коротких слов не описывает протяженность регулярного участка. Два окна с близким составом могут различаться по порядку серий и по сохранению периода. Поэтому к характеристикам WindowMasker целесообразно добавить признаки, непосредственно измеряющие периодическую структуру строки. В данной работе проверяется блок
, построенный для локального окна без поиска заранее заданного мотива.
Цель исследования состоит в оценке добавочной информативности
при ранжировании окон относительно координатной разметки RepeatMasker. Проверка включает три аспекта: перенос модели между сборками животных и растений, поведение при ограниченном числе отбираемых кандидатов и устойчивость к добавлению DUST. Отдельный контур на референсных сборках человека используется для анализа чувствительности к размеру окна и источнику меток.
Материалы и методы
Периодический блок признаков
Последовательность каждого окна рассматривается одновременно на нуклеотидном уровне и как последовательность максимальных серий одинаковых символов:
![]()
где
,
и
. Неоднозначный символ разрывает последовательность на независимо обрабатываемые блоки.
Для каждого шага
строится последовательность индикаторов
![]()
Пусть
— максимальный непрерывный отрезок единиц в
. Он задает кандидатный периодический фрагмент из
![]()
серийных событий и протяженностью

оснований. Кандидат сохраняется, если
, то есть содержит не менее трех последовательных копий блока из
событий. Внутри каждого блока для шага
выбирается кандидат с наибольшим
, а при равенстве — с наибольшим
. Если окно разделено неоднозначными символами, для каждой части сначала выполняется тот же поиск, после чего для координат данного шага сохраняется результат с наибольшим числом событий. Фиксированный порядок обхода делает выбор при полном равенстве однозначным.
Алгоритм вычисления имеет следующий вид: для каждого допустимого блока и каждого
сравниваются два сдвинутых массива событий; в полученном булевом массиве находятся непрерывные серии единиц; для серий, удовлетворяющих
, вычисляется сумма длин исходных серий; затем обновляются лучшие значения для шага и для окна в целом. Для каждого
сохраняются две координаты
и
. Их дополняют протяженности общего лучшего фрагмента
и
, нормированные доли
и
, а также шаг
этого фрагмента:
![]()
Граница 12 относится к числу серийных событий, а не к длине нуклеотидного мотива. При фиксированном
вычислительная сложность равна
, то есть
по числу серий и не более
по длине окна.
В отличие от частотного профиля
-меров, блок
сохраняет сведения о непрерывности периодического участка. В отличие от специализированного поиска тандемных повторов, он не возвращает мотив, число копий и границы аллеля. Его выходом является числовое описание окна, пригодное для модели ранжирования.
Панель сборок и оконная разметка
Основная панель содержит 25 референсных сборок животных и 25 сборок растений. Из последовательностей сформированы неперекрывающиеся окна длиной 4 тыс. нуклеотидов. Полная сетка включает 8 550 141 окно. Интервалы RepeatMasker получены в режиме без интерсперсных повторов; целевая разметка относится к классам простых повторов и участков низкой сложности. Положительным считалось окно, не менее 1% длины которого перекрыто целевыми интервалами. Окна в пограничной области сохранялись при бюджетном отборе, но исключались из расчета AP и ROC AUC. Итоговое множество содержит 5 366 867 положительных, 2 086 925 отрицательных и 1 096 349 пограничных окон.
WindowMasker запускался отдельно для каждой полной сборки. Из координатной маски для окна вычислялись доля замаскированных оснований, число интервалов на 1 тыс. нуклеотидов, доля наибольшего перекрытия и средняя доля перекрытия. Проверены чистый WindowMasker и его штатное объединение с DUST. Для каждого варианта сравнивались модель по четырем характеристикам маски и модель по объединению этих характеристик с
.
Схема оценки
Единицей разделения служила целая сборка. Внутри каждой таксономической группы применялась пятикратная перекрестная проверка по сборкам, повторенная для трех фиксированных начальных состояний. Все окна одной сборки относились только к обучающей или только к контрольной части. Такой порядок исключает перенос сборкоспецифических свойств между частями выборки.
Основной метрикой служила средняя точность ранжирования AP. Дополнительно рассчитывались ROC AUC, число положительных окон при бюджетах 1, 2, 5, 10, 20 и 50%, а также доля сетки, необходимая для достижения полноты 90, 95 и 99%. Разности вычислялись попарно для каждой сборки. Доверительные интервалы получены бутстрепом сборок с 10 тыс. повторов; направление эффекта проверено точным знаковым критерием. Для заранее заданного семейства сравнений применена процедура Бенджамини–Хохберга [1; 2].
Дополнительный контур включает полные оконные сетки GRCh38 с длинами окна 2, 4 и 8 кб и T2T-CHM13 с окном 4 кб. Он предназначен для оценки изменения контраста при другой длине окна, референсной сборке и координатном источнике повторов, поэтому его абсолютные значения не объединялись с межвидовой панелью.
Результаты
Добавление периодических признаков к WindowMasker
На всей панели средняя AP модели WindowMasker равна 0,7762, а после добавления
— 0,9136. Средняя парная разность составляет 0,1374, 95%-й доверительный интервал равен [0,1148; 0,1604]. Улучшение наблюдалось во всех 50 сборках (рис. 1). Для животных AP возросла с 0,7411 до 0,8974, для растений — с 0,8112 до 0,9298. Разности равны соответственно 0,1563 и 0,1186 (табл. 1).

Рисунок 1. Парное изменение AP после добавления P₂₉. Каждая точка соответствует одной сборке; пунктир показывает равенство моделей
Таблица 1.
Средняя точность ранжирования по таксономическим группам
|
Группа |
WindowMasker |
С |
Разность |
95%-й интервал |
|---|---|---|---|---|
|
Животные |
0,7411 |
0,8974 |
0,1563 |
[0,1221; 0,1900] |
|
Растения |
0,8112 |
0,9298 |
0,1186 |
[0,0926; 0,1472] |
|
Вся панель |
0,7762 |
0,9136 |
0,1374 |
[0,1148; 0,1604] |
Средняя ROC AUC увеличилась с 0,6637 до 0,8380. Разность 0,1743 имеет доверительный интервал [0,1538; 0,1952]. Для AP и ROC AUC скорректированное значение не превышает
. Согласованное направление двух метрик показывает, что результат не обусловлен только долей положительного класса.
Отбор при ограниченном бюджете
Наиболее заметное изменение получено в верхней части ранжированного списка. При бюджете 1% базовая модель отобрала 52 407 положительных окон, гибридная — 84 985, что соответствует приросту 62,2%. При бюджете 10% число положительных окон увеличилось с 586 051 до 797 956, или на 36,2%. При отборе половины сетки абсолютный прирост достиг 431 534 окон (табл. 2).
Таблица 2.
Число положительных окон при фиксированном бюджете
|
Бюджет |
WindowMasker |
С |
Прирост |
Прирост, % |
|---|---|---|---|---|
|
1% |
52 407 |
84 985 |
32 578 |
62,2 |
|
5% |
284 974 |
409 135 |
124 161 |
43,6 |
|
10% |
586 051 |
797 956 |
211 905 |
36,2 |
|
20% |
1 190 693 |
1 532 217 |
341 524 |
28,7 |
|
50% |
2 968 200 |
3 399 734 |
431 534 |
14,5 |
Обратная постановка фиксирует требуемую полноту. Для достижения полноты 90% базовой модели в среднем требовалось 84,22% сетки, а модели с
— 80,32%. На всей панели это сокращает список с 7 268 693 до 6 874 479 окон. При полноте 95% сокращение равно 2,46 процентного пункта, при полноте 99% — 0,73 процентного пункта. Следовательно, наибольшая практическая разница достигается при ограниченном бюджете, а не в режиме почти полного просмотра генома.
Контроль DUST и референсные сборки человека
Включение DUST изменило характеристики исходной маски, но не уменьшило вклад
(рис. 2). Средняя AP базовой модели равна 0,7721, гибридной — 0,9135. Парная разность 0,1413 имеет интервал [0,1187; 0,1643] и положительна для всех 50 сборок. Для животных разность составляет 0,1581, для растений — 0,1245. При бюджете 10% число положительных окон увеличилось с 576 926 до 797 926. Таким образом, периодический сигнал сохраняется после явного добавления стандартного фильтра низкой сложности.

Рисунок 2. Средняя разность AP и 95%-е доверительные интервалы для чистого WindowMasker и контроля с DUST
На GRCh38 положительный контраст периодического блока с гомополимерными признаками сохранялся при окнах 2, 4 и 8 кб: разности AP равны 0,0792, 0,0827 и 0,0773. Относительно энтропийно-компрессионного блока оценки также оставались положительными и находились в диапазоне 0,0703–0,0773. Сравнение с метаданными окна зависело от масштаба: 0,0077 при 2 кб,
при 4 кб и
при 8 кб. На T2T-CHM13 с окном 4 кб периодический блок дал положительные разности AP относительно всех четырех проверенных групп, от 0,1376 до 0,1668. Различие GRCh38 и T2T-CHM13 связано одновременно с референсом и источником интервальных меток, поэтому оно характеризует переносимость вычислительной схемы, а не межпопуляционный эффект.
Вычислительная стоимость
Полный расчет WindowMasker для 50 сборок занял 64,8 мин при шести рабочих процессах; сумма времени по сборкам равна 4,89 ч. Контроль с DUST при повторном использовании частотных словарей потребовал 23,4 мин.
Хронометраж
выполнен на 1600 реальных окнах длиной 4 кб: по 32 окна из каждой из 50 сборок, три последовательных повторения. Использовался один рабочий процесс. Сравнения событий при каждом шаге в пределах окна векторизованы средствами NumPy, но многопоточная обработка окон в это измерение не входила. Среднее по сборочным измерениям составило 0,598 мс на окно, медиана — 0,588 мс, диапазон — 0,538–0,736 мс. Линейный перенос среднего на 8 550 141 окно дает 5 110 с, или 1,42 процессорного часа; эта величина не является измеренным астрономическим временем полного запуска и не учитывает ввод-вывод.
При фиксированном максимальном шаге
число операций пропорционально числу серий
и сверху ограничено длиной окна. Поэтому при сходном составе последовательности увеличение длины окна вдвое должно приблизительно удваивать время вычисления. Окна независимы, и их можно распределять между рабочими процессами; фактическое ускорение ограничивается расходами на чтение данных и передачу заданий.
Суммарное ранее измеренное время RepeatMasker на той же панели равно 44,21 ч. Это сопоставление показывает порядок вычислительных затрат, но не означает взаимозаменяемость программ. WindowMasker и
формируют ранжирующий сигнал, тогда как RepeatMasker выполняет координатную классификацию по семействам повторов.
Операционная схема применения
Результат может быть использован в двухступенчатой схеме. На первом шаге для полной сборки рассчитываются WindowMasker и
, после чего окна упорядочиваются по оценке межсборочной модели. На втором шаге для верхней части списка применяется уточняющая процедура: библиотечная аннотация повторов, поиск тандемных мотивов или экспертная проверка маски. Порог отбора задается в долях окон, что сопоставляет ожидаемую полноту с доступным временем и числом объектов.
Для окна длиной 4 кб оценка
характеризует всю локальную последовательность. Если последующая задача требует нуклеотидной точности, верхнее окно служит только областью поиска. Такое разделение выходов предотвращает подмену координатной аннотации оконной классификацией.
В задаче контроля качества сборки верхний список может быть пересечен с разрывами, падениями покрытия и другими признаками ненадежной координатной области. В задаче аннотации различие исходной и уточненной маски следует оценивать по изменению генных моделей и их согласованию с транскриптами. Эти проверки измеряют конечный биологический эффект, тогда как настоящее исследование проверяет предшествующую стадию отбора.
Обсуждение
Практическая область результата связана с приоритетным анализом геномных участков. WindowMasker используется при подготовке маски для выравнивания и аннотации эукариотических сборок, особенно когда отсутствует полная видоспецифичная библиотека [6]. Добавление
меняет порядок окон так, что при одинаковом числе кандидатов в верхней части списка оказывается больше участков, подтвержденных координатной разметкой RepeatMasker. Такой список может применяться для выборочной проверки маски, настройки библиотек повторов и анализа областей, способных исказить последующее выравнивание.
Полученный эффект относится к простым повторам и низкой сложности, поскольку RepeatMasker запускался без интерсперсных повторов. Проверка не устанавливает качество распознавания LINE, SINE, LTR и других семейств. Кроме того, высокая точность верхнего списка не равна полноте всего генома: при бюджете 1% гибридная модель обнаруживает около 1,58% всех положительных окон. Поэтому результат описывает задачу приоритизации, а не полную аннотацию повторов.
Прямое влияние на качество генных моделей в эксперимент не входило. Для такого вывода требуется сравнить конечные аннотации, построенные с исходной и уточненной масками, по числу ложных моделей в повторных областях и по согласованию с транскриптами. Настоящая работа устанавливает предшествующее условие:
систематически повышает концентрацию RepeatMasker- положительных окон в ограниченном списке кандидатов.
Заключение
На полной сетке из 8,55 млн окон и 50 эукариотических сборок добавление
к характеристикам WindowMasker повысило среднюю AP на 0,1374. Положительная разность наблюдалась во всех сборках животных и растений и сохранилась после включения DUST. При бюджете 10% гибридное ранжирование добавило 211 905 положительных окон, а при целевой полноте 90% сократило объем отбора на 394 214 окон. Периодический блок тем самым дает измеримый добавочный сигнал для приоритетной проверки простых повторов и участков низкой сложности в эукариотических сборках.

