<?xml version="1.0" encoding="UTF-8"?>
    <!DOCTYPE article PUBLIC "-//NLM/DTD JATS (Z39.96) Journal Publishing DTD v1.2 20120330//EN" "http://jats.nlm.nih.gov/publishing/1.2/JATS-journalpublishing1.dtd">
    <!--<?xml-stylesheet type="text/xsl" href="article.xsl">-->
<article xmlns:ns0="http://www.w3.org/1999/xlink" xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" article-type="research-article" dtd-version="1.2" xml:lang="en">
	<front>
		<journal-meta>
			<journal-id journal-id-type="eissn">2530-1381</journal-id>
			<journal-title-group>
				<journal-title>Journal of Bioinformatics and Genomics</journal-title>
			</journal-title-group>
			<publisher>
				<publisher-name>ООО Цифра</publisher-name>
			</publisher>
		</journal-meta>
		<article-meta>
			<article-id pub-id-type="doi">10.60797/jbg.2026.33.3</article-id>
			<article-categories>
				<subj-group>
					<subject>Brief communication</subject>
				</subj-group>
			</article-categories>
			<title-group>
				<article-title>Влияние учёта электрического заряда атомов на точность предсказания взаимодействия Т-клеточных рецепторов с эпитопами программой MultiPASS</article-title>
			</title-group>
			<contrib-group>
				<contrib contrib-type="author" corresp="yes">
					<contrib-id contrib-id-type="orcid">https://orcid.org/0000-0002-7510-1602</contrib-id>
					<contrib-id contrib-id-type="rinc">https://elibrary.ru/author_profile.asp?id=1098745</contrib-id>
					<contrib-id contrib-id-type="rid">https://publons.com/researcher/HQK-5517-2023</contrib-id>
					<name>
						<surname>Смирнов</surname>
						<given-names>Антон Сергеевич</given-names>
					</name>
					<email>anton.smirnov.9910@gmail.com</email>
					<xref ref-type="aff" rid="aff-1">1</xref>
					<xref ref-type="aff" rid="aff-3">3</xref>
				</contrib>
				<contrib contrib-type="author">
					<contrib-id contrib-id-type="orcid">https://orcid.org/0000-0003-1757-8004</contrib-id>
					<contrib-id contrib-id-type="rinc">https://elibrary.ru/author_profile.asp?id=100566</contrib-id>
					<contrib-id contrib-id-type="rid">https://publons.com/researcher/G-3745-2010</contrib-id>
					<name>
						<surname>Лагунин</surname>
						<given-names>Алексей Александрович</given-names>
					</name>
					<email>alexey.lagunin@ibmc.msk.ru</email>
					<xref ref-type="aff" rid="aff-1">1</xref>
				</contrib>
				<contrib contrib-type="author">
					<contrib-id contrib-id-type="orcid">https://orcid.org/0000-0002-0339-8478</contrib-id>
					<contrib-id contrib-id-type="rinc">https://elibrary.ru/author_profile.asp?id=112983</contrib-id>
					<contrib-id contrib-id-type="rid">https://publons.com/researcher/F-4463-2017</contrib-id>
					<name>
						<surname>Филимонов</surname>
						<given-names>Дмитрий Алексеевич</given-names>
					</name>
					<email>dmitry.filimonov@ibmc.msk.ru</email>
					<xref ref-type="aff" rid="aff-2">2</xref>
				</contrib>
				<contrib contrib-type="author">
					<contrib-id contrib-id-type="orcid">https://orcid.org/0000-0002-8916-9675</contrib-id>
					<contrib-id contrib-id-type="rinc">https://elibrary.ru/author_profile.asp?id=112942</contrib-id>
					<contrib-id contrib-id-type="rid">https://publons.com/researcher/F-1573-2017</contrib-id>
					<name>
						<surname>Рудик</surname>
						<given-names>Анастасия Владимировна</given-names>
					</name>
					<email>rudik_anastassia@mail.ru</email>
					<xref ref-type="aff" rid="aff-2">2</xref>
				</contrib>
			</contrib-group>
			<aff id="aff-1">
				<label>1</label>
				<institution>Российский национальный исследовательский медицинский университет имени Н.И. Пирогова</institution>
			</aff>
			<aff id="aff-2">
				<label>2</label>
				<institution>Научно-исследовательский институт биомедицинской химии имени В.Н. Ореховича</institution>
			</aff>
			<aff id="aff-3">
				<label>3</label>
				<institution>Медико-генетический научный центр имени академика Н.П. Бочкова</institution>
			</aff>
			<pub-date publication-format="electronic" date-type="pub" iso-8601-date="2026-09-25">
				<day>25</day>
				<month>09</month>
				<year>2026</year>
			</pub-date>
			<pub-date pub-type="collection">
				<year>2026</year>
			</pub-date>
			<volume>10</volume>
			<issue>33</issue>
			<fpage>1</fpage>
			<lpage>10</lpage>
			<history>
				<date date-type="received" iso-8601-date="2026-05-17">
					<day>17</day>
					<month>05</month>
					<year>2026</year>
				</date>
				<date date-type="accepted" iso-8601-date="2026-09-21">
					<day>21</day>
					<month>09</month>
					<year>2026</year>
				</date>
			</history>
			<permissions>
				<copyright-statement>Copyright: &amp;#x00A9; 2022 The Author(s)</copyright-statement>
				<copyright-year>2022</copyright-year>
				<license license-type="open-access" xlink:href="http://creativecommons.org/licenses/by/4.0/">
					<license-p>
						This is an open-access article distributed under the terms of the Creative Commons Attribution 4.0 International License (CC-BY 4.0), which permits unrestricted use, distribution, and reproduction in any medium, provided the original author and source are credited. See 
						<uri xlink:href="http://creativecommons.org/licenses/by/4.0/">http://creativecommons.org/licenses/by/4.0/</uri>
					</license-p>
					.
				</license>
			</permissions>
			<self-uri xlink:href="https://journal-biogen.org/archive/3-33-2026-september/10.60797/jbg.2026.33.3"/>
			<abstract>
				<p>Цель: оценить влияние учёта электрического заряда атомов аминокислотных остатков пептидов на точность моделей связи «структура-активность» (SAR, structure-activity relationships) и расширить спектр прогнозируемых активностей разработанного ранее веб-сервиса TCR-Pred для предсказания взаимодействия Т-клеточного рецептора с эпитопом и главным комплексом гистосовместимости (MHC).В качестве источника данных использовались обновленные базы данных IEDB, CEDAR, VDJdb, McPAS-TCR, PIRD от марта 2026 года. Классификационные модели SAR были созданы с использованием программы MultiPASS 2025. MultiPASS 2025 основан на модифицированном наивном Байесовском классификаторе и на описании структурных формул CDR3 (Complementarity-Determining Region 3) участков в виде дескрипторов многоуровневых атомных окрестностей (MNA, Multilevel Neighbourhoods of Atoms), как заряженных, так и незаряженных атомов.Учёт заряда практически не повлиял на характеристики лучших моделей. Новые модели SAR для прогноза взаимодействия между Т-клеточными рецепторами и эпитопами/молекулами MHC имеют в сравнении с предыдущей версией более высокую точность (в среднем на 0,06 по величине ROC AUC) и расширенный спектр (в среднем в 2 раза) прогнозируемых активностей.</p>
			</abstract>
			<kwd-group>
				<kwd>TCR-Pred</kwd>
				<kwd> SAR</kwd>
				<kwd> эпитопы</kwd>
				<kwd> Т-клеточный рецептор</kwd>
				<kwd> главный комплекс гистосовместимости</kwd>
			</kwd-group>
		</article-meta>
	</front>
	<body>
		<sec>
			<title>HTML-content</title>
			<p>1. Введение</p>
			<p>Т-лимфоциты распознают клетки, содержащие признаки чужеродной генетической информации, с помощью специализированных молекул на своей мембране — Т-клеточных рецепторов (T-cell receptor, TCR). Т-клеточный рецептор взаимодействует с комплексом «эпитоп-главный комплекс гистосовместимости» (major histocompatibility complex, MHC) своими участками, определяющими комплементарность (complementarity determining regions, CDR). Взаимодействие Т-клеточный рецептор-эпитоп-главный комплекс гистосовместимости (TCR-peptide-MHC, TCR-pMHC) является одним из ключевых событий, приводящим к развитию иммунного ответа. Предсказание ответа иммунных клеток на специфические антигены является одной из ключевых задач иммуноинформатики. Решение этой проблемы позволяет ускорить разработку биологических препаратов, повысить их терапевтическую эффективность и снизить затраты на создание средств диагностики и лечения. Для этих целей широко применяются вычислительные методы, алгоритмы и прогностические модели, используемые при рациональном дизайне вакцин и иммунодиагностических систем [1], [2]. Экспериментально подтверждено, что наибольший вклад в распознавание эпитопов вносят участки CDR3 TCR [3]. На протяжении последних 30 лет научные коллективы по всему миру собирают экспериментальные данные о взаимодействии TCR с эпитопами. Эти данные агрегируются в специализированные базы данных: одна из крупнейших — Immune Epitope Database (IEDB) содержит больше 250000 записей о взаимодействии последовательностей CDR3 TCR c эпитопами [4].</p>
			<p>Современные подходы для прогноза взаимодействия TCR-pMHC в основном опираются на модели машинного обучения, включая глубокие нейронные сети. Данное направление активно развивается благодаря прогрессу в области искусственного интеллекта [5], [6]. Однако, несмотря на достигнутые успехи, большинство современных моделей имеют относительно низкую точность и охватывают довольно узкий спектр эпитопов [7]. Так, NetTCR-2.2 позволяет делать прогноз для 26 эпитопов со средней величиной ROC AUC 0,85 [8]. TCRex показывает похожие результаты на выборке IMMPREP2023, при этом способен делать прогноз для 100 эпитопов [8], [9]. Доступные данные характеризуются очень низким видовым разнообразием, что ограничивает область применимости этих моделей [10].</p>
			<p>Ранее нами был разработан веб-сервис TCR-Pred, который способен рассчитывать вероятность связывания ТCR с пептидным эпитопом и молекулами МНС и который не уступает своим аналогам [11]. Наш подход использует модифицированный наивный Байесовский классификатор для построения моделей зависимости «структура-активность» (SAR) и основан на представлении белковой последовательности CDR3 в виде структурных формул, описанных набором дескрипторов многоуровневых атомных окрестностей (Multilevel Neighbourhoods of Atoms, MNA) [12]. Впервые для биологических макромолекул он был применен для предсказания сайтов фосфорилирования белков [13]. Предсказание взаимодействия TCR-pMHC и сайтов фосфорилирования белков послужило подтверждением возможности применения подобных методов хемоинформатики для решения задач, связанных с оценкой свойств биологических макромолекул. С использованием данного подхода ранее также были созданы классификационные модели для предсказания патогенных вариантов аминокислотных замен, приводящих к лекарственной устойчивости, сайтов ацетилирования и вторичных структур белка [14], [15], [16], [17]. Целью данного исследования являлось изучение влияния учёта электрического заряда атомов в описании структурных формул аминокислотных остатков пептидов на качество прогноза и обновление моделей TCR-Pred с учетом новых экспериментальных данных.</p>
			<p>2. Методы и принципы исследования</p>
			<p>Подготовка данных и построение моделей были автоматизированы с использованием Nextflow v. 25.04.06 и Python 3.10 [18]. Часть вычислений проводилась на базе инфраструктуры высокопроизводительного кластера Алдан3 вычислительного центра НИИ Трансляционной медицины ФГАОУ ВО РНИМУ им. Н.И. Пирогова (Пироговский Университет) [19]. Для построения моделей были использованы сведения, извлечённые из баз данных IEDB, CEDAR, VDJdb, McPAS-TCR, PIRD [4], [20], [21], [23]. Исходные выборки были скачаны 21 марта 2026 года. Были использованы следующие критерии фильтрации:</p>
			<p>Общие правила:Наличие публикации (литературной ссылки).Результат взаимодействия между TCR и pMHC — положительный.Цепь CDR3 — альфа и/или бета.Корректные последовательности CDR3 (записанные в однобуквенном формате из 20 протеиногенных аминокислот).Организм-хозяин CDR3 – Homo sapiens (человек) или Mus musculus (мышь).</p>
			<p>Данные о взаимодействии «Т-клеточный рецептор-эпитоп»:Корректная последовательность эпитопа.Эпитопы без химических модификаций.</p>
			<p>Данные о взаимодействии «Т-клеточный рецептор — MHC аллель»:Первый или второй класс MHC (для моделей «Т-клеточный рецептор-эпитоп» эта информация может быть пропущена).Аллель MHC записана до конкретного белкового продукта (если была дополнительная информация, она была удалена).</p>
			<p>Данные были сгруппированы в зависимости от типа цепи CDR3 (альфа или бета), организма-хозяина (человек или мышь) и типа прогнозируемой активности (эпитоп или аллель MHC) во всех возможных сочетаниях. При объединении данных были удалены записи-дубликаты. Аллели MHC приведены к общему номенклатурному виду с помощью библиотеки mhcgnomes [24]. Дубликаты выявлялись по совпадению столбцов со структурой (CDR3) и активностью (эпитоп или MHC). Получившиеся таблицы были преобразованы в Structure-Data Format (SDF) файлы с помощью специальной программы, разработанной авторами [25], [26]. В результате были сгенерированы SDF файлы, содержащие два типа структур: с полностью заряженными аминокислотными остатками и полностью нейтральными (такое представление было использовано при создании первой версии веб приложения TCR-Pred [11]).</p>
			<p>Для построения моделей взаимодействия «Т-клеточный рецептор — эпитоп» и «Т-клеточный рецептор — MHC» была использована модифицированная версия программы MultiPASS (версия 2025 года) [27], [28]. MultiPASS работает на основе усовершенствованного алгоритма наивного Байесовского классификатора и использует представление структурных формул последовательностей CDR3 в виде дескрипторов многоуровневых атомных окрестностей (Multilevel Neighborhoods of Atoms, MNA). Принцип построения дескрипторов MNA представлен на рисунке 1. MultiPASS рассчитывает вероятности, что вещество будет активным (Pa) по отношению к некоторой мишени, и вероятность, что будет неактивно (Pi) по отношению к ней. Итоговый прогноз представляет собой разность этих вероятностей (Pa-Pi) и принимает значения в интервале от -1 до 1. Чем выше эта величина, тем выше вероятность, что исследуемое вещество обладает прогнозируемой активностью (взаимодействием с конкретным эпитопом или MHC аллели).</p>
			<fig id="F1">
				<label>Figure 1</label>
				<caption>
					<p>Принцип генерации дескрипторов многоуровневых атомных окрестностей (MNA) для карбоксильного атома углерода треонина</p>
				</caption>
				<alt-text>Принцип генерации дескрипторов многоуровневых атомных окрестностей (MNA) для карбоксильного атома углерода треонина</alt-text>
				<graphic ns0:href="/media/images/2026-09-24/cc46a302-ede5-4cfe-8335-7ac3d7e07840.png"/>
			</fig>
			<p>Дескрипторы MNA являются линейной нотацией атомно-центрированных фрагментов молекулы, формируемой рекурсивно по следующему принципу. Дескриптором нулевого уровня (MNA_0) является символьное обозначение атома согласно периодической таблице Менделеева (например -C, атом углерода номер «0» в пептидной связи между остатками треонина и гистидина). Символ «-» добавляется к обозначению атомов, не входящих ни в какие циклы. Дескриптор любого другого уровня (MNA_N) формируется из дескриптора MNA_0 атома и заключенных в скобки дескрипторов предыдущего уровня (MNA_N-1) атомов, непосредственно связанных с ним ковалентной связью (MNA_1 – -C(-C-N-O), MNA_2 – -C(-C(-H-C-C-N)-N(-H-C-C)-O(-C)), и т.д.). Светло-серым выделены атомы, входящие в окрестность второго уровня. В MultiPASS применена специальная технология, благодаря которой дескрипторы MNA любого уровня состоят не более чем из 40 символов. Структура молекулы в MultiPASS представляется в виде бесповторного множества дескрипторов каждого из атомов молекулы от MNA_1 до MNA_N с заданным максимальным уровнем N. Розовым цветом выделен остаток аланина, зеленым — треонина, голубым — гистидина.</p>
			<p>Модели SAR были созданы для каждого SDF файла с использованием максимального уровня (далее — просто «уровня») дескрипторов от 3 до 12. Оценка качества моделей производилась в процедуре перекрёстной проверки с разбиением на 5 частей с помощью метрики площади под кривой оперативной характеристики приемника (ROC AUC). Модели были отобраны по двум критериям. Во-первых, ROC AUC должен быть больше или равен 0,7. Второй критерий, минимальное количество пептидов участков CDR3 TCR в выборке, равен 3 последовательностям. Оптимальный уровень дескрипторов MNA равен минимальному уровню, при котором достигается максимальная медианная величина ROC AUC или очень близкая к нему. В случае затруднения в выборе лучшей модели по величине точности учитывали максимальное количество эпитопов или MHC аллелей, для которых можно было делать предсказание соответствующей моделью — широта спектра активностей. Таким образом, лучшими считались модели SAR, обладающие максимальными значениями как медианной ROC AUC, так и широты спектра. В случае незначительных отклонений между моделями с учетом зарядов атомов и без него приоритет отдавался последним, так как хранение заряда увеличивает размер файлов выборок и моделей, приводя к повышению нагрузки на работу сервера.</p>
			<p>3. Основные результаты</p>
			<p>3.1. Характеристика данных</p>
			<p>В таблице 1 представлены характеристики обучающих выборок старой (v.2023) и новой версии (v.2026) TCR-Pred. В новой версии в 1,5–2 раза больше CDR3 последовательностей, последовательностей эпитопов и аллелей MHC. Этот рост количества данных может быть связан как с обновлением баз, так и со смягчением критериев отбора. Так, из критериев фильтрации была исключена каноничность последовательности CDR3 — то есть требование наличия консервативного цистеина на N-конце и фенилаланина на C-конце. Наблюдается небольшое снижение числа последовательностей для человеческих бета-цепей CDR3. Это может быть связано с обновлением и уточнением информации в самих базах данных. Для определения оптимальных параметров моделирования итоговые обучающие выборки были разбиты в зависимости от типа цепи CDR3 и организма-хозяина CDR3 во всех возможных сочетаниях. Выборки по классам MHC делить не стали, так как из-за этого значительно падает общая точность прогноза вследствие уменьшения объема обучающей выборки.</p>
			<table-wrap id="T1">
				<label>Table 1</label>
				<caption>
					<p>Информация об обучающих выборках предыдущей и новой версии после обработки с разбиением по организму-хозяину и типу цепи</p>
				</caption>
				<table>
					<tr>
						<td>Количество уникальных структур в моделях</td>
						<td>v.2023</td>
						<td>v.2026</td>
					</tr>
					<tr>
						<td>Человек</td>
						<td>Мышь</td>
						<td>Человек</td>
						<td>Мышь</td>
					</tr>
					<tr>
						<td>α</td>
						<td>β</td>
						<td>α</td>
						<td>β</td>
						<td>α</td>
						<td>β</td>
						<td>α</td>
						<td>β</td>
					</tr>
					<tr>
						<td>CDR3 – эпитоп</td>
						<td>CDR3</td>
						<td>35616</td>
						<td>141500</td>
						<td>1604</td>
						<td>3014</td>
						<td>72630</td>
						<td>134026</td>
						<td>3401</td>
						<td>6156</td>
					</tr>
					<tr>
						<td>Эпитоп</td>
						<td>799</td>
						<td>1257</td>
						<td>96</td>
						<td>123</td>
						<td>1865</td>
						<td>2052</td>
						<td>148</td>
						<td>171</td>
					</tr>
					<tr>
						<td>CDR3 – MHC</td>
						<td>CDR3</td>
						<td>31066</td>
						<td>47639</td>
						<td>1462</td>
						<td>2550</td>
						<td>72630</td>
						<td>134026</td>
						<td>3401</td>
						<td>6156</td>
					</tr>
					<tr>
						<td>MHC</td>
						<td>76</td>
						<td>88</td>
						<td>11</td>
						<td>12</td>
						<td>121</td>
						<td>146</td>
						<td>11</td>
						<td>14</td>
					</tr>
				</table>
			</table-wrap>
			<p>Обращает на себя внимание, что активность Т-клеточных рецепторов изучена для малого разнообразия возможных эпитопов. На рисунке 2 представлено распределение объёма положительных примеров в обучающих выборках для конкретной активности (эпитопа/аллель MHC). Базы данных практически не содержат отрицательных примеров. MultiPASS принимает все примеры, которые не отмечены как положительные для данной активности, за отрицательные. Крайне мало эпитопов имеет большое количество (&gt; 100) положительных примеров (взаимодействующих последовательностей CDR3), а половина всех имеющихся эпитопов/аллелей MHC имеет не более 2–3 положительных примеров.</p>
			<fig id="F2">
				<label>Figure 2</label>
				<caption>
					<p>Гистограммы распределения количества последовательностей CDR3, взаимодействующих с конкретным эпитопом/аллелем МНС в обучающих выборках с разбиением по цепи CDR3: А – для эпитопов; Б – для аллелей MHC; ось ординат – количество эпитопов/аллелей МНС; ось абсцисс – число CDR3-последовательностей на эпитоп/аллель MHC; синяя линия – ядерная оценка плотности распределения; красная линия – отметка медианы распределения</p>
				</caption>
				<alt-text>Гистограммы распределения количества последовательностей CDR3, взаимодействующих с конкретным эпитопом/аллелем МНС в обучающих выборках с разбиением по цепи CDR3: А – для эпитопов; Б – для аллелей MHC; ось ординат – количество эпитопов/аллелей МНС; ось абсцисс – число CDR3-последовательностей на эпитоп/аллель MHC; синяя линия – ядерная оценка плотности распределения; красная линия – отметка медианы распределения</alt-text>
				<graphic ns0:href="/media/images/2026-09-24/c5ab4936-43f1-432c-bc1d-7e5e7dbd3ee6.png"/>
			</fig>
			<p>Проверка влияния учёта электрического заряда атомов аминокислотных остатков на точность моделей SAR</p>
			<p>Перед построением моделей SAR была выдвинута гипотеза, что учёт электрического заряда атомов аминокислотных остатков в структурных формулах последовательностей CDR3 должен улучшить медианную точность моделей SAR. Для проверки этой гипотезы были сформированы два вида SDF файлов, с указанием заряда атомов в структурах аминокислотных остатков и без указания заряда. Для обоих видов SDF файлов были проведены одинаковые процедуры обучения, валидации и отбора лучших моделей SAR. Моделям SAR были присвоены названия заглавными буквами на английском языке в соответствии с использованной выборкой в следующем формате: цепь_активность_вид, например BETA_EPITOPE_MOUSE. Результаты сравнения представлены на рисунке 3. Из приведенных на рисунке 3 данных видно, что значимого улучшения медианной точности предсказываемых эпитопов или MHC аллелей, так же как и увеличения их количества, не наблюдается при добавлении информации о заряде молекул. Диаграммы на рисунке 3 построены по активностям, для которых удалось провести процедуру перекрёстной проверки. Для моделей SAR ALPHA_EPITOPE_HUMAN, BETA_EPITOPE_HUMAN количество эпитопов, прошедших перекрёстную проверку, не возрастало монотонно. Для дальнейших экспериментов использовались модели SAR без учёта зарядов атомов, потому что файлы таких выборок и моделей SAR занимают меньше места на диске. Следует отметить, что на диаграммах показаны результаты пятикратной кросс-валидации, поэтому количество активностей, которые могут предсказывать модели SAR несколько выше. По имеющимся диаграммам были выбраны оптимальные уровни дескрипторов MNA. Для каждого уровня MNA дескрипторов была проведена проверка статистической значимости различий между распределениями значений ROC AUC был использован тест Манна-Уитни из библиотеки scipy для языка программирования Python с параметрами по умолчанию. Этот критерий был выбран, так как закон распределения ROC AUC в нашем случае неизвестен и не симметричен. Из-за большого количества тестирований поправка Бенджамини-Хохберга, реализованная в этой же библиотеке, с параметрами по умолчанию была использована для корректировки p-значений. Ни на одном из уровней MNA дескрипторов, ни для одной из моделей не было найдено статистически значимых отличий между заряженными и нейтральными дескрипторами. Подробная информация приложена в дополнительных материалах, таблица 1.</p>
			<fig id="F3">
				<label>Figure 3</label>
				<caption>
					<p>Диаграммы зависимости медианной точности прогноза для эпитопов (А) и МНС (Б) по результатам пятикратной кросс-валидации от уровня дескрипторов MNA для моделей SAR с учётом зарядов атомов и без него</p>
				</caption>
				<alt-text>Диаграммы зависимости медианной точности прогноза для эпитопов (А) и МНС (Б) по результатам пятикратной кросс-валидации от уровня дескрипторов MNA для моделей SAR с учётом зарядов атомов и без него</alt-text>
				<graphic ns0:href="/media/images/2026-09-24/30d3e355-2b40-490e-b6c1-8d6ce62486e3.png"/>
			</fig>
			<p>Сравнение качества моделей SAR версий v.2023 и v.2026</p>
			<p>Для первоначального сравнения моделей SAR разных версий мы отобрали только те активности, которые присутствуют в обеих версиях. Результаты такого сравнения представлены на рисунке 4. Новые версии лучших моделей SAR по медианной точности при пятикратной кросс-валидации превзошли все старые, за исключением ALPHA_EPITOPE_MOUSE. Для общего сравнения качества моделей SAR было проведено сравнение версий на всем спектре активностей. Характеристики моделей SAR при оптимальном значении уровня дескрипторов MNA представлены в таблице 2. Из приведенных в таблице 2 данных видно, что новые версии моделей (v.2026) превосходят старые (v.2023) по спектру активностей и медианной точности. Исключение составляет модель ALPHA_EPITOPE_MOUSE, где наблюдается расхождение, однако мы считаем, что уменьшение медианного AUC на 0,05 не так значимо, как расширение спектра активностей в 2 раза, с 13 до 28 MHC аллелей. Для некоторых моделей SAR, таких как BETA_EPITOPE_HUMAN, наблюдается рост количества предсказываемых эпитопов в 6 раз. Для большинства моделей SAR получилось добиться значительного прироста точности. Статистически значимые отличия в распределениях ROC AUC найдены в 6 из 8 типах моделей (исключая ALPHA_EPITOPE_MOUSE, BETA_MHC_MOUSE) в 36 точках (из 80). Для BETA_EPITOPE_HUMAN, BETA_EPITOPE_MOUSE различия наблюдаются практически на каждом уровне MNA дескрипторов. Подробная информация приложена в дополнительных материалах, таблица 2.</p>
			<table-wrap id="T2">
				<label>Table 2</label>
				<caption>
					<p>Сравнительная характеристика двух версий TCR-Pred</p>
				</caption>
				<table>
					<tr>
						<td>Модель SAR</td>
						<td>Версия</td>
						<td>Оптимальный уровень дескрипторов MNA</td>
						<td>Количество активностей</td>
						<td>Медиана ROC AUC</td>
					</tr>
					<tr>
						<td>ALPHA_EPITOPE_HUMAN</td>
						<td>v.2023</td>
						<td>10</td>
						<td>97</td>
						<td>0,8054</td>
					</tr>
					<tr>
						<td>v.2026</td>
						<td>10</td>
						<td>540</td>
						<td>0,8750</td>
					</tr>
					<tr>
						<td>BETA_EPITOPE_HUMAN</td>
						<td>v.2023</td>
						<td>9</td>
						<td>196</td>
						<td>0,7908</td>
					</tr>
					<tr>
						<td>v.2026</td>
						<td>9</td>
						<td>803</td>
						<td>0,8919</td>
					</tr>
					<tr>
						<td>ALPHA_MHC_HUMAN</td>
						<td>v.2023</td>
						<td>7</td>
						<td>20</td>
						<td>0,8233</td>
					</tr>
					<tr>
						<td>v.2026</td>
						<td>10</td>
						<td>44</td>
						<td>0,8464</td>
					</tr>
					<tr>
						<td>BETA_MHC_HUMAN</td>
						<td>v.2023</td>
						<td>10</td>
						<td>28</td>
						<td>0,7849</td>
					</tr>
					<tr>
						<td>v.2026</td>
						<td>9</td>
						<td>53</td>
						<td>0,8727</td>
					</tr>
					<tr>
						<td>ALPHA_EPITOPE_MOUSE</td>
						<td>v.2023</td>
						<td>5</td>
						<td>13</td>
						<td>0,9583</td>
					</tr>
					<tr>
						<td>v.2026</td>
						<td>10</td>
						<td>28</td>
						<td>0,9086</td>
					</tr>
					<tr>
						<td>BETA_EPITOPE_MOUSE</td>
						<td>v.2023</td>
						<td>9</td>
						<td>42</td>
						<td>0,8463</td>
					</tr>
					<tr>
						<td>v.2026</td>
						<td>10</td>
						<td>45</td>
						<td>0,9434</td>
					</tr>
					<tr>
						<td>ALPHA_MHC_MOUSE</td>
						<td>v.2023</td>
						<td>6</td>
						<td>7</td>
						<td>0,7865</td>
					</tr>
					<tr>
						<td>v.2026</td>
						<td>9</td>
						<td>8</td>
						<td>0,8423</td>
					</tr>
					<tr>
						<td>BETA_MHC_MOUSE</td>
						<td>v.2023</td>
						<td>8</td>
						<td>7</td>
						<td>0,7539</td>
					</tr>
					<tr>
						<td>v.2026</td>
						<td>11</td>
						<td>9</td>
						<td>0,8831</td>
					</tr>
				</table>
			</table-wrap>
			<fig id="F4">
				<label>Figure 4</label>
				<caption>
					<p>Диаграммы зависимости медианной точности прогноза по результатам пятикратной кросс-валидации от уровня дескрипторов MNA для старой и новой версии моделей SAR: А – для эпитопов; Б – для МНС</p>
				</caption>
				<alt-text>Диаграммы зависимости медианной точности прогноза по результатам пятикратной кросс-валидации от уровня дескрипторов MNA для старой и новой версии моделей SAR: А – для эпитопов; Б – для МНС</alt-text>
				<graphic ns0:href="/media/images/2026-09-24/bd2c57fe-ac43-4909-8f8b-4743aa220653.png"/>
			</fig>
			<p>4. Обсуждение</p>
			<p>Предсказание взаимодействия рецепторов адаптивного иммунитета с эпитопами в настоящий момент является трудной задачей. Экспериментально эти взаимодействия изучены для малого количества эпитопов, причем для большинства из них известно небольшое количество положительных примеров последовательностей, взаимодействующих с ними CDR3 участков Т-клеточных последовательностей, при этом нет информации об однозначно отрицательных примерах, что затрудняет построение классификационных моделей. За три года произошел существенный рост количества экспериментальных данных, что позволило в новой версии TCR-Pred построить отдельные модели для человека и мыши. Увеличить количество данных также помогла их менее строгая фильтрация. В то же время, данное исследование показало, что учёт дополнительной информации, такой как электрический заряд атомов аминокислотных остатков фрагментов белков, не приводит к повышению статистически значимого количества более точных моделей. Такой результат является неожиданным, потому что электростатические взаимодействия играют важную роль при белок-белковых взаимодействиях. Вполне вероятно, что в текущем виде MNA дескрипторы уже неявно учитывают электростатические взаимодействия. Кроме того, теоретические расчеты указывают на то, что гидрофобные взаимодействия между T-клеточным рецептором и эпитопом играют более важную роль, чем кулоновские взаимодействия [29]. Несмотря на то, что с точки зрения медианной точности прогноза разница между моделями, созданными с учетом заряда аминокислотных остатков и без их учета несущественна, для отдельных эпитопов и MHC аллелей использование зарядов атомов аминокислотных остатков фрагментов белков приводило к большей точности моделей. Это можно использовать для дальнейшего совершенствования веб-приложения в будущем.</p>
			<p>Отдельно стоит отметить, что прогноз взаимодействия Т-клеточных рецепторов с эпитопами, которые отсутствовали в обучающей выборке, остаётся нерешённой задачей. Хемоинформатический подход в представлении белковых последовательностей в виде молекулярных дескрипторов имеет большой потенциал для обхода этого ограничения, а также для решения обратной задачи — подбор последовательностей рецептора под конкретный эпитоп. В дальнейшем мы продолжим совершенствовать TCR-Pred в направлении увеличения широты предсказываемых активностей, решения проблемы неизвестных эпитопов и создания REST API интерфейсов для Python и R.</p>
			<p>5. Заключение</p>
			<p>В данной работе было показано, что учёт информации о заряде атомов в описании структурных формул аминокислотных остатков CDR3 TCR практически не влияет на точность прогноза активности Т-клеточных рецепторов по отношению к эпитопам и аллелям MHC.</p>
			<p>Также нами было обновлено веб приложение TCR-Pred, в котором значительно расширился спектр предсказываемых эпитопов и MHC аллелей, а также для большинства моделей повысилась медианная точность.</p>
			<p>5.1. Доступность данных и исходного кода</p>
			<p>Исходный код подготовки и анализа данных доступен по адресу github.com/SmirnygaTotoshka/TCRpred. Программа MultiPASS доступна по обоснованному запросу. Базы данных, используемые в работе, являются открытыми и общедоступными. Веб приложение TCR-Pred является свободно доступным (way2drug.com/TCR-Pred/).</p>
		</sec>
		<sec sec-type="supplementary-material">
			<title>Additional File</title>
			<p>The additional file for this article can be found as follows:</p>
			<supplementary-material xmlns:xlink="http://www.w3.org/1999/xlink" id="S1" xlink:href="https://doi.org/10.5334/cpsy.78.s1">
				<!--[<inline-supplementary-material xlink:title="local_file" xlink:href="https://journal-biogen.org/media/articles/25602.docx">25602.docx</inline-supplementary-material>]-->
				<!--[<inline-supplementary-material xlink:title="local_file" xlink:href="https://journal-biogen.org/media/articles/25602.pdf">25602.pdf</inline-supplementary-material>]-->
				<label>Online Supplementary Material</label>
				<caption>
					<p>
						Further description of analytic pipeline and patient demographic information. DOI:
						<italic>
							<uri>https://doi.org/10.60797/jbg.2026.33.3</uri>
						</italic>
					</p>
				</caption>
			</supplementary-material>
		</sec>
	</body>
	<back>
		<ack>
			<title>Acknowledgements</title>
			<p/>
		</ack>
		<sec>
			<title>Competing Interests</title>
			<p/>
		</sec>
		<ref-list>
			<ref id="B1">
				<label>1</label>
				<mixed-citation publication-type="confproc">Schaap-Johansen A.-L. T Cell Epitope Prediction and Its Application to Immunotherapy / A.-L. Schaap-Johansen, M. Vujović, A. Borch [et al.] // Frontiers in Immunology. — 2021. — Vol. 12. — URL: https://www.frontiersin.org/journals/immunology/articles/10.3389/fimmu.2021.712488/full (accessed: 11.09.2025).</mixed-citation>
			</ref>
			<ref id="B2">
				<label>2</label>
				<mixed-citation publication-type="confproc">Ahmad T.A. B-cell epitope mapping for the design of vaccines and effective diagnostics / T.A. Ahmad, A.E. Eweida, S.A. Sheweita // Trials in Vaccinology. — 2016. — Vol. 5. — P. 71–83.</mixed-citation>
			</ref>
			<ref id="B3">
				<label>3</label>
				<mixed-citation publication-type="confproc">Krogsgaard M. How T cells “see” antigen / M. Krogsgaard, M. M. Davis // Nature Immunology. — 2005. — Vol. 6. — № 3. — P. 239–245.</mixed-citation>
			</ref>
			<ref id="B4">
				<label>4</label>
				<mixed-citation publication-type="confproc">Vita R. The Immune Epitope Database (IEDB): 2018 update / R. Vita, S. Mahajan, J. A. Overton [et al.] // Nucleic Acids Research. — 2019. — Vol. 47. — № D1. — P. D339–D343.</mixed-citation>
			</ref>
			<ref id="B5">
				<label>5</label>
				<mixed-citation publication-type="confproc">Yadav S. TCR-ESM: Employing protein language embeddings to predict TCR-peptide-MHC binding / S. Yadav, D.S. Vora, D. Sundar [et al.] // Computational and Structural Biotechnology Journal. — 2024. — Vol. 23. — P. 165–173.</mixed-citation>
			</ref>
			<ref id="B6">
				<label>6</label>
				<mixed-citation publication-type="confproc">Jokinen E. Predicting recognition between T cell receptors and epitopes with TCRGP / E. Jokinen, J. Huuhtanen, S. Mustjoki [et al.] // PLOS Computational Biology. — 2021. — Vol. 17. — № 3. — P. e1008814.</mixed-citation>
			</ref>
			<ref id="B7">
				<label>7</label>
				<mixed-citation publication-type="confproc">Lu T. Deep learning-based prediction of the T cell receptor–antigen binding specificity / T. Lu, Z. Zhang, J. Zhu [et al.] // Nature Machine Intelligence. — 2021. — Vol. 3. — № 10. — P. 864–875.</mixed-citation>
			</ref>
			<ref id="B8">
				<label>8</label>
				<mixed-citation publication-type="confproc">Jensen M.F. Enhancing TCR specificity predictions by combined pan- and peptide-specific training, loss-scaling, and sequence similarity integration / M.F. Jensen, M. Nielsen // eLife. — 2024. — Vol. 12. — P. RP93934.</mixed-citation>
			</ref>
			<ref id="B9">
				<label>9</label>
				<mixed-citation publication-type="confproc">Gielis S. Identification of Epitope-Specific T Cells in T-Cell Receptor Repertoires / S. Gielis, P. Moris, W. Bittremieux [et al.] // Bioinformatics for Cancer Immunotherapy : Methods in Molecular Biology / Ed. by S. Boegel. — New York: Springer US, 2020. — Vol. 2120. — P. 183–195. — URL: http://link.springer.com/10.1007/978-1-0716-0327-7_13 (accessed: 12.01.2026).</mixed-citation>
			</ref>
			<ref id="B10">
				<label>10</label>
				<mixed-citation publication-type="confproc">Hudson D. Can we predict T cell specificity with digital biology and machine learning? / D. Hudson, R. A. Fernandes, M. Basham [et al.] // Nature Reviews Immunology. — 2023. — Vol. 23. — № 8. — P. 511–521.</mixed-citation>
			</ref>
			<ref id="B11">
				<label>11</label>
				<mixed-citation publication-type="confproc">Smirnov A.S. TCR‐Pred: A new web‐application for prediction of epitope and MHC specificity for CDR3 TCR sequences using molecular fragment descriptors / A.S. Smirnov, A.V. Rudik, D.A. Filimonov [et al.]. — URL: https://onlinelibrary.wiley.com/doi/10.1111/imm.13641 (date accessed: 22.05.2025).</mixed-citation>
			</ref>
			<ref id="B12">
				<label>12</label>
				<mixed-citation publication-type="confproc">Lagunin A. PASS: prediction of activity spectra for biologically active substances / A. Lagunin, A. Stepanchikova, D. Filimonov [et al.] // Bioinformatics. — 2000. — Vol. 16. — № 8. — P. 747–748.</mixed-citation>
			</ref>
			<ref id="B13">
				<label>13</label>
				<mixed-citation publication-type="confproc">Karasev D.A. Application of molecular descriptors for recognition of phosphorylation sites in amino acid sequences / D.A. Karasev, P.I. Savosina, B.N. Sobolev [et al.] // Biomeditsinskaya Khimiya. — 2017. — Vol. 63. — № 5. — P. 423–427.</mixed-citation>
			</ref>
			<ref id="B14">
				<label>14</label>
				<mixed-citation publication-type="confproc">Zadorozhny A. Prediction of pathogenic single amino acid substitutions using molecular fragment descriptors / A. Zadorozhny, A. Smirnov, D. Filimonov [et al.] // Bioinformatics (Oxford, England). — 2023. — Vol. 39. — № 8. — P. btad484.</mixed-citation>
			</ref>
			<ref id="B15">
				<label>15</label>
				<mixed-citation publication-type="confproc">Porfireva E.S. Sequence-structure based prediction of pathogenicity for amino acid substitutions in proteins associated with primary immunodeficiencies / E.S. Porfireva, A.D. Zadorozhny, A.V. Rudik [et al.] // Frontiers in Immunology. — 2025. — Vol. 16. — P. 1492751.</mixed-citation>
			</ref>
			<ref id="B16">
				<label>16</label>
				<mixed-citation publication-type="confproc">Zakharov O.S. Prediction of Protein Secondary Structures Based on Substructural Descriptors of Molecular Fragments / O.S. Zakharov, A.V. Rudik, D.A. Filimonov [et al.] // International Journal of Molecular Sciences. — 2024. — Vol. 25. — № 23. — P. 12525.</mixed-citation>
			</ref>
			<ref id="B17">
				<label>17</label>
				<mixed-citation publication-type="confproc">Lebedev N.V. Prediction of New Nε-Acetylation Sites in the Human Proteome Based on Molecular Multilevel Neighborhoods of Atom Descriptors / N.V. Lebedev, D.A. Filimonov, V.V. Poroikov [et al.] // Molecular Biology. — 2025. — Vol. 59. — № 5. — P. 836–848.</mixed-citation>
			</ref>
			<ref id="B18">
				<label>18</label>
				<mixed-citation publication-type="confproc">Di Tommaso P. Nextflow enables reproducible computational workflows / P. Di Tommaso, M. Chatzou, E.W. Floden [et al.] // Nature Biotechnology. — 2017. — Vol. 35. — № 4. — P. 316–319.</mixed-citation>
			</ref>
			<ref id="B19">
				<label>19</label>
				<mixed-citation publication-type="confproc">Kotliar V. Building a Computer Cluster for Bioinformatics and Biomedical Research from Scratch to Production / V. Kotliar, D. Bolotin, D. Syrko // Physics of Particles and Nuclei. — 2024. — Vol. 55. — № 3. — P. 474–476.</mixed-citation>
			</ref>
			<ref id="B20">
				<label>20</label>
				<mixed-citation publication-type="confproc">Koşaloğlu-Yalçın Z. The Cancer Epitope Database and Analysis Resource (CEDAR) / Z. Koşaloğlu-Yalçın, N. Blazeska, R. Vita [et al.] // Nucleic Acids Research. — 2022. — Vol. 51. — № D1. — P. D845–D852.</mixed-citation>
			</ref>
			<ref id="B21">
				<label>21</label>
				<mixed-citation publication-type="confproc">Goncharov M. VDJdb in the pandemic era: a compendium of T cell receptors specific for SARS-CoV-2 / M. Goncharov, D. Bagaev, D. Shcherbinin [et al.] // Nature Methods. — 2022. — Vol. 19. — № 9. — P. 1017–1019.</mixed-citation>
			</ref>
			<ref id="B22">
				<label>22</label>
				<mixed-citation publication-type="confproc">Tickotsky N. McPAS-TCR: a manually curated catalogue of pathology-associated T cell receptor sequences / N. Tickotsky, T. Sagiv, J. Prilusky [et al.] // Bioinformatics. — 2017. — Vol. 33. — № 18. — P. 2924–2929.</mixed-citation>
			</ref>
			<ref id="B23">
				<label>23</label>
				<mixed-citation publication-type="confproc">Zhang W. PIRD: Pan Immune Repertoire Database / W. Zhang, L. Wang, K. Liu [et al.] // Bioinformatics. — 2020. — Vol. 36. — № 3. — P. 897–903.</mixed-citation>
			</ref>
			<ref id="B24">
				<label>24</label>
				<mixed-citation publication-type="confproc">Rubinsteyn A. mhcgnomes: Parsing MHC nomenclature in the wild / A. Rubinsteyn, T. O’Donnell, N. Wheeler.</mixed-citation>
			</ref>
			<ref id="B25">
				<label>25</label>
				<mixed-citation publication-type="confproc">BIOVIA CTFILE FORMATS. — URL: https://discover.3ds.com/sites/default/files/2020-08/biovia_ctfileformats_2020.pdf (accessed: 14.08.2025).</mixed-citation>
			</ref>
			<ref id="B26">
				<label>26</label>
				<mixed-citation publication-type="confproc">Dalby A. Description of several chemical structure file formats used by computer programs developed at Molecular Design Limited / A. Dalby, J.G. Nourse, W.D. Hounshell [et al.] // Journal of Chemical Information and Computer Sciences. — 1992. — Vol. 32. — № 3. — P. 244–255.</mixed-citation>
			</ref>
			<ref id="B27">
				<label>27</label>
				<mixed-citation publication-type="confproc">Zhuravleva S.I. Prediction of Amino Acid Substitutions in ABL1 Protein Leading to Tumor Drug Resistance Based on «Structure-Property» Relationship Classification Models / S.I. Zhuravleva, A.D. Zadorozhny, B.V. Shilov [et al.] // Life (Basel, Switzerland). — 2023. — Vol. 13. — № 9. — P. 1807.</mixed-citation>
			</ref>
			<ref id="B28">
				<label>28</label>
				<mixed-citation publication-type="confproc">Filimonov D.A. Computer-aided prediction of biological activity spectra for chemical compounds: opportunities and limitation / D.A. Filimonov, D.S. Druzhilovskiy, A.A. Lagunin [et al.] // Biomedical Chemistry: Research and Methods. — 2018. — Vol. 1. — № 1. — P. e00004.</mixed-citation>
			</ref>
			<ref id="B29">
				<label>29</label>
				<mixed-citation publication-type="confproc">Rollins Z.A. Using molecular dynamics simulations to interrogate T cell receptor non-equilibrium kinetics / Z.A. Rollins, R. Faller, S.C. George // Comput. Struct. Biotechnol. J. — 2022. — Vol. 20. — P. 2124–2133.</mixed-citation>
			</ref>
		</ref-list>
	</back>
	<fundings>
		<funding lang="RUS">Работа выполнена при финансовой поддержке Российского научного фонда № 25-25-01171, https://rscf.ru/project/25-25-01171/.
</funding>
		<funding lang="ENG">This work was supported by the Russian Science Foundation (project № 25-25-01171, https://rscf.ru/project/25-25-01171/).
</funding>
	</fundings>
</article>