摘要
线性B细胞表位(BCE)是疫苗设计和免疫治疗的关键靶点,但现有实验方法鉴定线性表位效率低且成本高。本研究旨在开发高效的计算预测模型,为新型疫苗研发和疾病诊断提供理论支持;基于深度学习构建MCALBCE模型,整合词嵌入、双向长短期记忆(BiLSTM)、双向门控循环单元(BiGRU)和Transformer编码模块,通过多头交叉注意力机制实现多源特征融合。使用IEDB数据库的4 440个线性BCE和5 485个非线性BCE作为训练集,1 110个线性BCE和1 408个非线性BCE作为独立测试集;模型在独立测试集上准确率达0.767,敏感性0.814,AUC值0.820,较现有最优模型提升显著。特征分析表明,模型能准确识别天冬氨酸(D)等表位特征氨基酸,与已知免疫学证据一致;MCALBCE通过多模态特征融合与注意力机制优化,显著提升了线性BCE的识别性能,为疫苗设计和免疫诊断提供了高效的计算工具。
Abstract
B-cell epitopes are critical targets for vaccine design and immunotherapy, but current experimental methods for identifying linear epitopes are inefficient and costly. This study aims to develop a high-performance computational prediction model to provide theoretical support for novel vaccine development and disease diagnosis. We constructed the MCALBCE model based on deep learning, integrating word embedding, bidirectional long short-term memory (BiLSTM), bidirectional gated recurrent unit (BiGRU), and Transformer encoder modules. Multi-head cross-attention mechanisms were employed to achieve multi-source feature fusion. The model was trained on 4 440 linear BCEs and 5 485 non-linear BCEs from the IEDB database, with an independent test set of 1 110 linear BCEs and 1 408 non-linear BCEs.On the independent test set, the model achieved an accuracy of 0.767, sensitivity of 0.814, and AUC of 0.820, significantly outperforming existing state-of-the-art models. Feature analysis demonstrated the model's ability to accurately identify epitope-characteristic amino acids such as aspartic acid (D), consistent with established immunological evidence.By optimizing multi-modal feature fusion and attention mechanisms, MCALBCE significantly improves the predictive performance for linear BCEs, providing an efficient computational tool for vaccine design and immunodiagnostics.
Keywords
B细胞表位(BCE)是指抗原分子中能够被B细胞受体(BCR)或抗体特异性识别并结合的特定区域[1],是适应性免疫应答的关键靶标。BCE可以是抗原蛋白序列中的连续氨基酸残基,称为线性表位,也可以是不连续的氨基酸残基,它们相互作用以将蛋白质序列折叠成三维构象,称为构象表位[2]。虽然大多数自然界发现的BCE不是线性的,但它们的识别受到诸如生化特征和结构连接性等问题的阻碍[3]。而线性BCE其识别不依赖于蛋白质的空间折叠,且在疫苗设计[4]、免疫诊断[5]、抗体开发[6]以及疾病诊断和治疗[7-8]中具有独特优势,因此如何准确地识别线性BCE受到广泛的关注。
在生物信息学和高通量技术发展之前,主要依赖实验方法进行表位鉴定,例如肽扫描技术[9]、酶解或化学降解结合免疫沉淀[10]、噬菌体展示技术[11]、竞争性结合实验[12]和抗原-抗体复合物晶体学[13]。这些传统方法虽然准确,但通常耗时、成本高,且依赖抗体的质量和实验条件。随着生物信息学的发展,表位预测算法与高通量技术的结合,大大提高了线性BCE鉴定的效率。在2013年,Singh等[14]构建使用二进制谱、二肽组成(DPC)和氨基酸对(AAP)对线性B细胞表位的数据进行特征表示,并使用不同的机器学习技术进行进一步的特征提取和分类,结果表明支持向量机(SVM)和K最近邻算法的预测结果更好。Manavalan等[15]在2018年提出模型iBCE-EL,该模型使用物理化学性质(PCP)、氨基酸组成和DPC的组合作为特征输入,使用极度随机化树(ERT)和梯度提升(GB)作为分类器取得了很好的分类结果。在2020年,Hasan等[16]构建了iLBE,使用平均信息谱(AIP)、自相关-互相关转换(AFC)、位置特异性评分矩阵(PSSM)和伪K元氨基酸频率(PKAF)构建特征矩阵并分别使用随机森林(RF)进行特征提取,并将提取的特征拼接并使用逻辑回归(LR)的方法进行分类。Bahai等[17]在2021年提出EpitopeVec,该模型使用氨基酸组成(AAC)、DPC、AAP和氨基酸类型分组(AAT)结合的方法将序列转换为可学习的特征向量,并输入到SVM分类器中进一步提取特征分类。Liu Yufeng等[18]和Liu Fang等[19]分别在2023年和2024年构建了LBCE-XGB和LBCE-BERT模型,两模型均使用AAC、AAT、AAP和BERT模型相结合的方法进行特征转化,并使用极端梯度提升(XGBoost)进行进一步特征提取,并取得了更好的分类效果。传统的手工特征提取和机器学习的方法对于特征的提取具有一定局限性,随着深度学习和自然语言处理方法的进步,对于线性BCE的识别分类也有着更好的选择。
本文提出一个使用自然语言处理和深度学习相结合的识别线性BCE的模型MCALBCE,流程图如图1所示。首先,将序列特征使用词嵌入的方法转换为向量特征方便计算机的学习;随后,分别使用Transformer、双向长短期记忆和双向门控循环单元对向量特征进行进一步的特征提取,并且将提取后的输出作为多头交叉注意力机制的三个输入进行最终的特征提取;最后,输入到全连接层进行分类,判别序列是否为线性BCE。模型在独立测试集上进行评估,结果显示本文提出的预测模型达到了更好的分类效果。
1 材料和方法
1.1 数据收集
数据集对模型的特征提取起着至关重要的作用,好的数据集可以让模型学习到更好的特征从而达到更好的分类效果。本文为了与现有的模型更好地进行对比来说明模型的可行性,选择了与之前模型相同的数据集。该数据集从免疫表位数据库(IEDB[20-21])中提取了一个线形肽的实验数据集,该数据集由实验验证的线性BCE和非线性BCE组成。IEDB整合了来自病毒、细菌和真菌的多种数据集。使用CD-HIT(0.7)从数据集中移除了同源序列。最终得到4 440个正样本(线性BCE)和5 485个负样本(非线性BCE)作为模型的训练集,而独立测试集包含1 110个正样本和1 408个负样本。正负样本的具体数据如表1所示。
表
1
数据集的详细信息
Table
1
Details of the datasets
1.2 模型结构
构建的MCALBCE模型包含六个模块:词嵌入模块、双向长短期记忆模块、Transformer模块、双向门控循环单元模块、多头交叉注意力机制模块和分类模块。模型的结构图如图1所示,词嵌入模块是将序列数据转换为数字向量即特征矩阵,将特征矩阵分别输入到双向长短期记忆模块、双向门控循环单元模块和Transformer模块进行特征提取,并将其分别作为多头注意力机制的查询向量、键向量和值向量输入到多头注意力机制中组成多头交叉注意力机制进行更深层的特征提取,以便提取到更多更有利于分类的特征,最后输入到分类模块进行全连接和分类。
图
1
MCALBCE 模型的结构图
Fig.
1
Architecture of MCALBCE
1.2.1 词嵌入模块
词嵌入[22]是一种将离散数据转换为连续向量的自然语言处理方法,它不仅可以学习到单个氨基酸的特征,同时可以学习到相邻氨基酸的关系,因此词嵌入的引入对后续的特征提取起着关键性的作用。由于氨基酸有20个常见氨基酸和3个非常见氨基酸,因此本文首先将蛋白质序列中的氨基酸分别用1-23进行替换以便于输入到词嵌入中。随后将数字替换的氨基酸输入到词嵌入中进行特征提取,将每一个氨基酸提取为128维的向量,因此每一条氨基酸都被提取为(25,128)的特征矩阵,表示矩阵如下:
(1)
1.2.2 双向长短期记忆模块
双向长短期记忆[23]是一种结合了前向和后向信息的改进循环神经网络结构,能够有效捕捉序列数据中的长距离依赖关系。该网络通过两个独立的长短期记忆层分别处理输入序列的正向和反向信息,并将两者的隐藏状态进行整合,从而充分利用输入序列的完整上下文特征。相较于单向长短期记忆,双向长短期记忆在自然语言处理任务中表现出更强的语义理解能力,尤其适用于需要全局上下文信息的场景。其核心优势在于通过双向信息流增强模型对序列局部和全局特征的提取,显著提升了序列建模的准确性。将词嵌入处理后特征矩阵作为双向长短期记忆的输入,网络通过协同工作的正向和反向长短期记忆层来全面捕捉蛋白质序列的局部和全局特征。正向沿氨基酸序列氨基端到羧基端,学习序列的局部模式;反向则从氨基酸序列羧基端到氨基端,捕获互补的序列特征。每个长短期记忆单元通过精心设计的门控机制(遗忘门、输入门和输出门)动态调节氨基酸残基间的长程相互作用:遗忘门控制历史记忆的保留程度,输入门筛选新的序列特征存入细胞状态,输出门则调控当前隐藏状态的生成。具体而言,其门控结构可形式化表示如下:
(2)
其中,𝜎 表示Sigmoid函数,· 表示Hadamard逐元素乘法,𝑥𝑡 为当前输入,ℎ𝑡-1 为前一时刻的隐藏状态,𝐶𝑡为当前时刻的细胞状态,𝑊 和 𝑏 分别为各门对应的权重矩阵与偏置项。在每一个氨基酸位置,系统将正向和反向的隐藏状态进行拼接,形成包含双向上下文信息的综合表征。通过双向捕捉蛋白质的序列信息,为后续构建多头交叉注意力机制提供了更好的特征基础。
1.2.3 双向门控循环单元模块
门控循环单元由Cho等[24]在2014年提出。其目标是使每个循环单元能够自适应地捕捉不同时间的依赖关系。门控循环单元类似于长短期记忆单元,它们调节单元内的信息流。与长短期记忆单元不同的是,门控循环单元将三个门转换为两个门:更新门和重置门。门控循环单元将单元状态和输出结合成一个状态。对于输入的每个元素,进行如下计算:
(3)
其中 𝑊𝑧,𝑊𝑟,𝑊 是门控循环单元的权重,ℎ𝑡 是时间 𝑡 处的隐藏状态,ℎ𝑡-1 是时间为0时的初始状态或 𝑡-1 处的隐藏状态,𝜎 是sigmoid函数,°是矩阵对应元素相乘(Hadamard积)。在双向门控循环单元中,第 𝑙 层(𝑙≥2)的输入由前一层的隐藏状态决定。经过 𝑘 层传递后,最终可获得第 𝑘 层的隐藏状态输出ℎ𝑘,其表示为。本文使用双向门控循环单元捕获了序列数据的历史与未来上下文信息,所提取的信息作为键向量输入到交叉注意力机制中,为模型提供了更好的特征。
1.2.4 Transformer模块
Transformer是由Vaswani等[25]在2017年提出的,它最初应用于机器翻译任务,现已成为大量自然语言处理任务中最先进的模型。与以往的基于蛋白质能量的方法相比,AlphaFold通过使用Transformer取得了巨大的成功。因此,本文研究采用Transformer作为我们模型的一部分来提取蛋白质的序列特征。在我们模型的Transformer部分,Transformer由编码模块和解码模块两个部分组成,编码模块由一系列用于提取输入特征的编码器组成,解码模块由一系列用于生成表示的解码器组成。本文中只使用了Transformer的编码模块提取特征。编码模块通过将编码好的特征矩阵输入到多头自注意力机制(MSA)和多头感知机(MLP)中,并在每一个模块前使用归一化层(LN)和残差连接,防止过拟合的同时也防止了信息的流失。一个编码器层的输出为:
(4)
(5)
公式(3)和公式(4)表示了一个编码器层的输入和输出,而最终的输出将作为第二个编码块的输入,以此类推最终通过 n 个编码层得到我们想要的输出(n为构建模型时的超参数)。经过上述操作,可以获得一个依赖于上下文的嵌入式表示矩阵。Transformer不仅捕捉了序列固定区域窗口中的局部信息,还捕获了全局信息,解释了为什么表示依赖于上下文。通过学习上下文的嵌入表示,显著提高了肽序列中的符号表示的预测概率。此外,为后续作为值向量输入多头交叉注意力机制提供了更准确的编码。
1.2.5 多头交叉注意力机制模块
多头交叉注意力机制是Transformer架构中的核心模块,通过并行化注意力头实现多视角的跨序列信息交互。其核心思想是将查询、键、值矩阵分割为多个子空间(如8头或16头),每个头独立计算缩放点积注意力,最终拼接各头输出并通过线性层融合。该机制能同时捕获不同子空间的特征关系,显著提升模型对跨序列依赖的建模能力,广泛应用于机器翻译、视觉-语言任务(图像-文本关联)等场景。相比单头注意力,多头设计通过并行化增加了模型的表达容量,同时保持了计算效率。本文使用双向长短期记忆、双向门控循环单元和Transformer的编码模块分别作为查询、键和值的输入来进一步提取和融合特征,使用8个子空间进行计算,从而使得模型提取到更多更好的信息来识别线性BEC。公式如下:
(6)
其中、、为第 𝑖 个头的投影矩阵,ℎ 为头数,Attention(𝑄,𝐾,𝑉)为缩放点积注意力,MultiHead(𝑄,𝐾,𝑉)为多头输出的拼接。通过多头交叉注意力机制有效地将不同方法提取的特征矩阵融合,提高分类效率和结果。
1.3 模型评估
根据以往的工作,我们使用以下分类指标来评估我们的模型:准确性(ACC)、敏感性(SN)、特异性(SP)、曲线下面积(AUC)和马修相关系数(MCC)。这些指标公式如下:
(7)
其中TN是真线性BCE序列数量(即实际为线性BCE并且模型识别为线性BCE的数量),FP是假线性BCE序列数量(即实际为线性BCE但模型识别为非线性BCE的数量),TN是真非线性BCE序列数量,FN是假非线性BCE数量。准确性是正确分类样本与总样本的比率,是最直观的性能评估方法。灵敏度是被正确分类的正样本的比例,特异性是被正确分类的负样本的比例,其中在生物序列分析中灵敏度越高实际应用价值越好。曲线下面积和马修相关系数都考虑了正样本和负样本,因此通常被视为衡量模型整体性能的平衡指标。特别是当训练集的正负样本数据为不平衡数据时,曲线下面积和马修相关系数越高则说明模型的训练效果越好。
1.4 迭代算法
适应性矩估计(Adam)是一种广泛使用的优化算法,专为训练深度学习模型设计。它结合了动量和自适应学习率的思想,通过动态调整每个参数的更新步长,显著提升了训练效率和收敛性。本文使用pytorch来构建我们的模型,使用GPU在计算机上训练模型,使用Adam优化器优化模型。在模型训练中,batch size大小设置为32,epoch大小设置为100,学习率设置为0.000 1。
2 结果和分析
2.1 不同氨基酸序列编码对比和氨基酸编码维度讨论
词向量[26](Word2Vec)是一种广泛应用于符号序列处理的向量化技术,旨在将离散的元素(如单词或氨基酸)映射到连续的低维向量空间中。通过训练,Word2Vec能够捕捉符号间的潜在关联性,使得在生物学上或语义上功能相似的元素在向量空间中的距离更接近。该方法主要包括两种模型架构,即基于当前符号预测上下文的跳字模型(Skip-gram)模型和基于上下文预测中心符号的连续词袋模型(CBOW)模型。与传统的独热编码方式相比,Word2Vec生成的向量更为紧凑且富有信息量,能够有效缓解高维稀疏问题,并为下游深度学习模型提供更具表达能力的输入特征。在蛋白质序列分析等任务中,Word2Vec不仅能够反映氨基酸之间的局部依赖关系,还能在一定程度上揭示序列片段的功能相似性,为分类、预测等任务提供有力支持。因此,Word2Vec作为一种高效且可扩展的表示学习方法,已在自然语言处理与生物信息学领域得到了广泛应用和验证。为了证明MCALBCE使用的词嵌入拥有更好的表现,本文使用CBOW与词嵌入进行了对比。CBOW模型在训练时将一个氨基酸序列作为“一个句子”,k个连续的氨基酸作为句子中的单词,使用上下的单词来预测中心的单词。为了与本文的词嵌入具有可比性,我们使用了相同的参数,将k设置为1,一个氨基酸表示为128维的向量,与词嵌入处理后的数据具有相同的编码,均为(25,128)的特征矩阵。与此同时在特征提取部分也使用了相同的算法,并使用独立测试集进行检验对比。如表2所示,在相同的特征矩阵和算法下,词嵌入的编码方法对线性BCE有更准确的预测结果,因此本文模型最终选择词嵌入作为模型中的特征提取方法。
表
2
测试集上不同氨基酸序列编码对比
Table
2
Comparison of different amino acid sequence encodings on test dataset
在词嵌入的维度选择方面,本文结合了常用的维度和氨基酸序列的长度。由于本文所使用的数据长度为5~25,因此词嵌入的维数过大会导致模型严重的过拟合,过小可能会丢失过多的信息。而GPU/CPU的显存总线和计算单元通常以32/64/128位为单位处理数据,这样在选择维度时为2的幂次方可以最大化利用显存带宽。本文对词嵌入的维度64和128进行了对比,如表3所示,可以看出,当维度为128时结果更好。
表
3
测试集上不同词嵌入维度对比
Table
3
Comparison of different word embedding dimensions on test dataset
2.2 独立测试集表现与模型对比
为客观评估MCALBCE模型在线性B细胞表位识别任务中的性能表现,本研究严格采用与现有基准模型完全相同的独立测试集进行对比实验,确保比较的公平性与结果的可比性。如表4所示,本文模型在训练集上的四个评价指标都拥有最好的表现,ACC、SN、AUC和MCC分别为0.792、0.835、0.858和0.589。在生物序列的识别训练任务中,SN是用来评价正样本识别的准确率,AUC和MCC在对评价不平衡数据时更有说服力。因此在训练和识别线性BCE的实际应用中,SN、AUC和MCC指标更高则说明我们的模型更有价值。MCALBCE在训练集中的ACC、SN、AUC和MCC表现比现有的模型至少高出0.04、0.076、0.038和0.093,说明在训练时模型学习到了更多更准确的信息,特别是正样本的信息。为了说明模型的泛化能力,在训练集上也进行了对比,模型在ACC、SN和MCC上的指标分别为0.767、0.814和0.540,高于现有的其他模型0.010、0.055和0.032。这将很好地说明MCALBCE在识别线性BCE上具有更好的鲁棒性和更有用的实际价值。
表
4
与现有模型对比
Table
4
Performance comparison with existing models
2.3 消融实验
消融实验是通过逐步移除或修改模型的某个组件,观察性能变化,以验证该组件的必要性及其对模型效果的影响。这类实验常用于论文中证明模型设计的合理性,帮助研究者理解不同模块的作用,并优化模型结构。为了证明MCALBCE模型的算法构建为结果最好的算法,使用消融实验对所选择的算法进行对比。
在多头注意力机制中,注意力头数的选择需要平衡模型表达能力、计算效率和任务需求。头的数量通常与模型的隐藏层单头维度有关。单头维度的计算方法为总维度除以头数,单头的维度不宜过大和过小,过大容易出现梯度爆炸、计算效率过低等问题,过小容易丢失氨基酸信息,因此本文选取2、4和8这三个具有代表性的头数进行对比实验。结果如表5所示,当多头注意力头数为8时,评价指标的结果更优。
由于交叉注意力机制中的查询向量、键向量和值向量为三种不同的输入,因此在模型进行特征提取时,相同特征输入的不同位置将会提取到不同的特征,从而造成不同的结果,因此本文对此进行了消融分析从而来验证所选择模型为最优结果。如图2所示,其中A表示双向长短期记忆,B表示双向门控循环单元,C表示Transformer的编码模块,[A,A,C]表示在交叉注意力机制的输入中,查询向量、键向量和值向量分别为双向长短期记忆、双向长短期记忆和Transformer的编码模块,其余表示同上。
表
5
测试集中不同注意力头数对比
Table
5
Comparative analysis of different numbers of attention heads on test dataset
从表2可以看出,当Transformer的编码模块作为查询向量和键向量输入时,模型的SN和SP差异较大,即正样本的准确率小于负样本的准确率,说明模型学习到了更多负样本的信息,而对正样本信息学习较差。当双向长短期记忆作为查询向量和键向量,Transformer的编码模块作为值向量时,模型的SN显著提升,说明学习到了更多的正样本的信息。当双向门控循环单元作为查询向量和键向量,双向长短期记忆作为值向量输入时,模型的SN和SP也较为平衡。除此之外,如图3所示,当不使用多头交叉注意力机制时,仅使用一种方法作为多头注意力机制的输入,可以从表中看出,当输入为双向门控循环单元时模型的正负样本准确率最为平衡。因此通过分析发现,模型选择将双向长短期记忆和双向双向门控循环单元作为查询向量和值向量,将Transformer的编码模块作为值向量输入将会得到更好的结果。而从两个图中也可以看出,这种选择得到了最好的分类效果,同时在正样本数量小于负样本时,仍使得正样本的识别准确率高于负样本,因此有着更高的应用价值。
图
2
交叉注意力机制中不同输入的对比消融(1)
Fig.
2
Ablation study on different inputs in cross-attention mechanism (1)
图
3
交叉注意力机制中不同输入的对比消融(2)
Fig.
3
Ablation study on different inputs in cross-attention mechanism (2)
除此之外,本文还分析了当缺少模型中的模块对识别线性BCE的影响。如图4所示,本文分析了仅使用双向长短期记忆或双向门控循环单元或Transformer的编码模块三种方法对特征编码矩阵进行特征提取,图中前三个色即为对训练好的模型使用独立测试集进行验证,通过结果可以看出双向长短期记忆对模型负样本提取特征较好,但对正样本提取到的特征较差。另外,为了证明交叉注意力机制对模型的帮助,本文通过去掉此模块,使用矩阵的拼接和矩阵对应元素相加的方法进行特征融合,经过对比发现,MCALBCE模型的评价指标得分远高于其他方法,有效地说明了本文模型算法构建的最优性。
2.4 特征可视化和生物分析
基于复杂神经网络结构的优异性能,从计算的角度进一步探索线性BCE的生物特性。为此,对数据集中的每个肽进行了计算机模拟突变(ISM)。由于本文使用的数据中仅包含20个常见的氨基酸,因此将肽的每个参考氨基酸突变为其他19个替代氨基酸来评估预测概率的变化。此外,还对线性BCE和非线性BCE数据集中的每个位置进行了氨基酸统计概率分析作为分析的参考,如图5所示。
图
4
不同方法模块对比
Fig.
4
Comparative analysis of different method modules
图
5
训练集中正负样本氨基酸统计概率
Fig.
5
Statistical probabilities of amino acids in positive and negative samples within the training set
选择了一个氨基酸个数为21长度的序列作为样本生成热图,如图6所示。其中颜色越深代表使用某种氨基酸替代时模型对序列的预测评分越高,颜色越浅则说明模型对序列的预测评分越低。热图中很容易看出甲硫氨酸(M)和亮氨酸(L)对模型有明显的抑制作用。具体来说,从图5的概率图中可以看出虽然甲硫氨酸在正负样本中出现的概率并不高,但在负样本中明显出现的频率是高于正样本的,因此当氨基酸突变为甲硫氨酸时,模型对序列识别的评分相对较低。亮氨酸在图中可以看出,是负样本的几乎每一个位置的出现频率最高的氨基酸。特别是位置为11和12的氨基酸突变为亮氨酸时,模型预测的概率明显较低。说明本文模型很好地学习到了负样本出现频率较高的氨基酸信息。除此之外,天冬氨酸(D)和天冬酰胺(N)这两种氨基酸在热图中很明显对于模型起着积极的作用,当模型中的元素突变为这两个氨基酸时,模型对序列的评分较高。这从概率分布图中可以看出天冬氨酸和天冬酰胺的出现频率相比于负样本,正样本中出现的频率较高,这也解释了热图所反映的现象。计算机突变实验很好地说明了模型对序列中氨基酸信息提取的优劣。但由于模型识别的准确率并非为100%,因此仍有一定的提升空间。
图
6
计算机模拟突变实验热图
Fig.
6
Heatmap of computer-simulated mutation experiments
以上地分析均基于训练集中的数据,为了说明模型的鲁棒性,本文随机选取负样本的一个样本使用基于沙普利值的特征贡献分析(SHAP)得到每个氨基酸对模型的贡献值。如图7所示,负值表示氨基酸对预测具有负贡献,即偏向于使序列被识别为与真实样本相反的样本。图7所示的数据为正样本,因此甲硫氨酸和丙氨酸(A)明显更偏于负样本,甲硫氨酸由热图分析已得出,而丙氨酸在图5中频率分布可以看出,在负样本的出现频率大于正样本的出现频率,从而更偏向于识别为负样本。
图
7
基于沙普利值的特征贡献分析
Fig.
7
SHAP value for amino acids
t-SNE[27]是一种非线性降维可视化技术,特别适用于高维数据的二维或三维可视化展示。它通过保留数据点之间的局部相似性关系,将高维数据映射到低维空间,使得在原始高维空间中相似的点在低维投影中彼此靠近,而不相似的点则相互远离。为了更加直观的显示本文模型地分类情况,使用t-SNE对模型进行可视化。如图8所示,左图为特征提取前的模型可视化,右图为模型提取完成的可视化,可以看出几乎很好地将不同类别的样本分开,和评价指标中的结果相匹配,从而也说明MCALBCE模型的分类可行性。
图
8
模型的t-SNE可视化分析
Fig.
8
t-SNE visualization analysis of the model
2.5 未来工作与研究启示
MCALBCE模型通过多模态特征融合与注意力机制,为线性BCE预测提供了高效工具。未来研究可结合实验验证数据(如噬菌体展示)优化模型,使其能够预测不同病原体的优势表位,并评估其免疫原性,从而加速候选疫苗的初步筛选。在医疗应用方面,该模型可助力个性化癌症疫苗的开发。通过分析肿瘤特异性突变产生的新抗原序列,MCALBCE可预测高免疫原性的线性表位,并结合患者HLA分型数据,筛选出最可能引发强效B细胞应答的肽段,为个体化免疫治疗提供计算支持。同时,该技术也可应用于自身免疫疾病的研究,如通过预测自身抗原的关键表位,辅助设计耐受性疫苗(如多发性硬化症或1型糖尿病),以调控异常免疫反应。未来可进一步与临床数据(如患者血清抗体谱等)结合,优化预测模型,推动精准免疫疗法的发展。这一研究范式也为其他生物序列预测任务(如T细胞表位或蛋白质相互作用)提供了可借鉴的技术框架。
3 结论
本文提出的MCALBCE模型通过多头交叉注意力机制整合双向长短期记忆、双向门控循环单元和Transformer编码模块的多层次特征,实现了线性B细胞表位的高精度预测。实验表明:
1)特征融合优势:将序列的局部依赖(双向长短期记忆)、全局上下文(Transformer)与双向时序特征(双向门控循环单元)协同编码,使模型在独立测试集上的AUC达到0.820,较现有最佳模型提升4.2%;
2)生物可解释性:通过计算机模拟突变热图与SHAP值分析,揭示天冬氨酸(D)和天冬酰胺(N)对表位识别的正向贡献,与训练集的氨基酸频率统计一致;
3)应用价值:模型对正样本的高敏感性(SN 0.814)尤其适用于疫苗靶点筛选。未来可扩展至构象表位预测,并集成蛋白质结构信息以进一步提升性能。