基于Transformer的多种蛋白质从头肽测序技术在基准数据集上的评测
doi: 10.12113/202411012
邱宁宁 , 张航 , 柳楠
山东建筑大学 计算机科学与技术学院,济南 250101
基金项目: 国家自然基金青年项目(No.61902221);2021年山东省研究生教育教学改革研究项目(No.SDYJG21173).
Evaluation of multiple protein de novo peptide sequencing technologies based on transformer on benchmark datasets
QIU Ningning , ZHANG Hang , LIU Nan
School of Computer Science and Technology, Shandong Jianzhu University, Jinan 250101, China
摘要
从头肽测序作为质谱分析中解析蛋白质结构与功能的关键技术,近年来深度学习模型尤其是 Transformer 架构的融入,展现出巨大发展潜力。本文旨在聚焦基于 Transformer 的多种蛋白质从头肽测序技术,通过在基准数据集上的评测,为该领域的研究提供全面且深入的参考。从众多基于 Transformer 架构的模型中,选取Casanovo、CasanovoV2、Transformer-DIA、π-HelixNovo、PowerNovo 以及 π-PrimeNovo,在基准数据集上开展对比实验。从肽测序准确率、运行效率等多个维度,对各模型的性能表现差异展开深入剖析,详细分析各模型在处理质谱数据、预测肽序列过程中所采用的不同策略。与传统的肽测序方法相比,Transformer 模型的并行处理和全局依赖建模能力为肽测序带来了革新,通过降低复杂度、提高精确度和效率,解决了传统方法中的错误级联问题,为蛋白质组学研究提供了不可或缺的价值。通过对多种基于 Transformer 的蛋白质从头肽测序技术在基准数据集上的评测与分析,为读者提供一个全面的视角,明确了这些模型在推动蛋白质组学研究中的重要作用,同时也为后续研究指明了方向。
Abstract
De novo peptide sequencing, as a key technology for analyzing the structure and function of proteins in mass spectrometry analysis, has shown great development potential in recent years with the integration of deep learning models, especially the Transformer architecture. This study aims to focus on various de novo peptide sequencing technologies for proteins based on the Transformer, and through evaluations on benchmark datasets, provide a comprehensive and in-depth reference for research in this field. In this study, from among numerous models based on the Transformer architecture, Casanovo, CasanovoV2, Transformer-DIA, π-HelixNovo, PowerNovo, and π-PrimeNovo were selected to conduct comparative experiments on benchmark datasets. The differences in the performance of each model were deeply analyzed from multiple dimensions such as peptide sequencing accuracy and operation efficiency. The different strategies adopted by each model in processing mass spectrometry data and predicting peptide sequences were analyzed in detail. Compared with traditional peptide sequencing methods, the parallel processing and global dependency modeling capabilities of Transformer models have brought innovation to peptide sequencing. By reducing complexity, improving accuracy and efficiency, it has solved the error cascade problem in traditional methods, providing indispensable value for proteomics research. Through the evaluation and analysis of various Transformer-based de novo peptide sequencing techniques for proteins on benchmark datasets, this paper provides readers with a comprehensive perspective, clarifies the important role of these models in promoting proteomics research, and also points out the direction for subsequent research.
在蛋白质组学领域,串联质谱法[1]是分析复杂生物样品中蛋白质含量的唯一高通量方法,因此是推动蛋白质组学[2]领域发展的主要技术。在这个领域,一个关键的挑战是在不利用肽序列数据库的先验知识的情况下,确定每个观察到的质谱的氨基酸序列。尽管已经开发了各种机器学习方法来解决这个从头测序问题,但在对串联质谱建模时出现的挑战导致了模型越来越复杂,需要结合多个神经网络和后处理步骤。早期的从头肽测序方法使用启发式搜索或动态规划对每个观察到的质谱进行肽序列评分。近年来,机器学习特别是深度神经网络在这项任务上提供了先进的性能,如DeepNovo[3]和SeqNovo[4]等,通过结合神经网络架构和复杂的后处理步骤,显著提高了测序性能。这些方法采用不同类型的神经网络,例如卷积神经网络(Convolutional neural network,CNN)用于频谱峰嵌入和处理,循环神经网络(Recurrent neural network,RNN)用于肽序列处理。尽管这些方法在性能上有所改进,但它们仍然面临建模复杂和推断时间长的问题。
近年来,Transformer[5]模型因其卓越的学习情境化表示和序列数据建模能力,已在多个领域取得了显著成果。这种模型最初是在自然语言处理(Natural language processing,NLP)任务中取得了成功,如机器翻译[6]和文本生成[7]。越来越多的研究表明,Transformer同样适用于生物序列数据的分析,特别是在肽测序领域,Transformer模型展示了其潜力\[8-9\]。与传统的序列测序方法相比,如卷积神经网络(CNN)和循环神经网络(RNN),在处理长序列时常常面临挑战。CNN的局部感受野和RNN的顺序处理特性限制了其在捕捉全局信息方面的能力。相比之下,Transformer模型的全局自注意机制能够更有效地捕捉序列中的全局信息,这对于从头肽测序的学习问题尤为重要。
1 基于Transformer架构的从头肽测序模型
1.1 Casanovo
Casanovo[10]是一个简单而强大的从头肽测序模型,通过使用Transformer将从质谱中观察到的数据直接转为氨基酸序列输出,Casanovo 的工作流程中包括学习质谱的潜在表示、质谱处理和肽序列处理等主要步骤,这些步骤在基于 Transformer 架构的从头肽测序模型中得到了统一,如图1所示。通过这种方式,Casanovo大大降低了模型的复杂度,同时提高了准确性。
Casanovo模型的关键创新在于使用Transformer框架为从头肽测序中的各个子任务提供了一个统一的解决方案,改变了之前深度学习模型的复杂度。在之前的从头肽测序模型中要使用卷积神经网络(CNN)提取频谱特征和使用循环神经网络(RNN)去捕捉序列之间的依赖关系,而Casanovo则是利用Transformer将上述的子任务统一到一个框架中,不仅简化了模型结构,也提高了模型的效率和鲁棒性。
图 1 基于Transformer架构的从头肽测序模型的工作流程
Fig. 1 De novo peptide sequencing model based on Transformer architecture
Casanovo是由Transformer的编码器和解码器堆栈组成,分别负责学习输入质谱峰的潜在表示和解码质谱生成肽的氨基酸序列,利用自注意机制直接将观察到的质谱峰序列翻译为氨基酸序列,如图2所示。这种方法类似于自然语言处理中的神经机器翻译模型。Transformer 中的自注意力机制[11]。允许模型一次性处理整个序列数据,而不是像传统的 RNN 或 LSTM(Long short-term memory)需要依赖逐步处理,所以在处理长序列或大规模数据时效率更高。通过自注意力机制[12],可以对整个质谱峰序列中的不同峰值进行关联,找到哪些质谱峰之间的关联性较强。而且自注意力机制能捕捉数据序列中的长程依赖关系,从而帮助模型更好地理解复杂的质谱数据。所以 Transformer 可以在处理复杂的任务时表现得更好。
图 2 Casanovo模型流程图
Fig. 2 Casanovo model flowchart
Casanovo在参数设置上,采用9层网络结构,嵌入大小为512,设置8个注意力头。训练过程中,批量大小为32个光谱,权重衰减为10-5,峰值学习率为5×10-4。学习率在 100 k的预热步骤中从零线性增加到峰值,之后采用余弦形衰减。这种学习率调整策略使得 Casanovo 在训练前期能够快速调整参数,加快收敛速度。在训练后期,随着学习率逐渐减小,模型能够更精细地调整参数,避免错过最优解,进而提高模型的训练效果和性能。训练过程中会对验证集进行评估,最终采用验证损失最低的模型权重用于测试。在优化算法方面,Casanovo采用交叉熵损失函数,通过最小化模型输出概率与真实肽段氨基酸序列的差异来优化模型。与传统质谱分析方法不同,Casanovo将单个谱峰连同前体质量和电荷作为输入,无需对质谱的质量电荷比(m/z)轴进行离散化处理,避免了精确度和模型复杂性之间的权衡。
在性能表现上,Casanovo的优势比较明显,通过对Casanovo与两种基于神经网络的从头开始的肽测序方法DeepNovo[3]和PointNovo[13]在九个物种基准数据集上进行对比试验。如表1所示,在覆盖率为60%的情况下,Casanovo在肽段精确度上相对于DeepNovo 和 PointNovo有37.3%和31.0%的相对提升。即使在覆盖率为100%的情况下,Casanovo 的肽段精确度也达到了45.2%,仍高于在覆盖率为60%的DeepNovo 和 PointNovo的肽段精确值。
表 1 Nine-Species Benchmark Dataset上的平均肽段精确度和氨基酸精确度
Table 1 Average peptide precision and amino acid precision on the Nine-Species Benchmark Dataset
Casanovo更加注重序列中的长距离依赖关系,主要通过使用 Transformer 中的自注意力机制来实现。自注意力机制能够直接建模输入序列中任意位置之间的依赖关系,不受序列长度的限制,相比之下,DeepNovo和PointNovo擅长捕捉局部特征,通过多层卷积可以逐渐捕捉到更广泛的上下文信息,但仍然受限于感受野的大小,难以有效处理长距离依赖关系。
Casanovo为从头肽测序提供了一个创新且高效的解决方案。Transformer通过强大的长距离依赖关系建模能力、高效的并行化计算、灵活的注意力分配以及全局上下文信息的利用,使其在肽段测序任务中表现出了显著的优势。
1.2 CasanovoV2
CasanovoV2[14]在Casanovo[10]基础上进行了改进。多个方面得到了提升,包括更好的泛化能力,覆盖更多的边缘情况,减少偏差,提高鲁棒性等。CasanovoV2 在实际应用中能够更加高效和精准地完成质谱分析任务。
CasanovoV2仍采用Transformer架构来实现从头肽测序。Casanovo不同的是,在解码过程中,Casanovo采用贪婪策略[15],计算序列中的每个位置中所有氨基酸的概率,并选择概率最高的氨基酸作为当前步骤的输出。通过这种贪婪策略,模型能够在每个解码步骤中选择最有可能的氨基酸,从而生成最终的肽序列。虽然这种方法简单高效,但由于贪婪策略只选择一条最可能的路径,缺乏对其他潜在路径的探索,这可能导致生成的肽序列缺乏多样性,无法捕捉到所有可能的合理序列。因此,CasanovoV2则采用波束搜索解码策略[16],如图3所示,在Casanovo的输出层之后引入波束搜索解码策略。
图 3 CasanovoV2模型流程图
Fig. 3 CasanovoV2 model flowchart
波束搜索解码策略可以持续跟踪最有可能的序列预测,直到序列完成或超过前体质量限制,如图4所示。每一步在进行预测时,会选出 k 个概率得分最高的氨基酸,这些氨基酸随后会被用于下一轮的解码过程。最终,会选择一个最接近前体质量要求且概率得分最高的肽序列作为输出。由于引入波束搜索解码策略,实现了从头肽测序在解码过程当中保留多个候选序列,增加找到全局最优解的机会,避免了使用贪婪策略解码可能会陷入局部最优的问题。
图 4 波束搜索解码策略
Fig. 4 Beam search decoding strategy
CasanovoV2 在 Casanovo 的基础上通过引入波束搜索解码方法显著提高了从头肽测序的准确性。与 Casanovo 使用的贪婪搜索策略相比,波束搜索能够在生成序列时考虑多个候选路径,从而减少因早期错误累积而导致的最终序列错误,显著提升了氨基酸的精确度和肽段的召回率。
1.3 Transformer-DIA
在蛋白质组学研究中,液相色谱联用串联质谱(Liquid chromatography-tandem mass spectrometry,LC-MS/MS)是常用的蛋白质鉴定与定量技术[17-18]。在传统的数据依赖获取(Data-dependent acquisition,DDA)[19]方法中,当涉及识别到低分子量肽时,MS2质谱与蛋白质数据库中的条目进行匹配时,存在局限性。因此,DDA通常会选择在MS1质谱中离子强度较高或电荷较大的前体离子进行分离和分析。
近年来,数据独立采集(Data-independent acquisition,DIA)[20-21]策略取得了显著进展。与传统的数据依赖获取(DDA)不同,DIA 不是选择特定的前体离子进行碎片化,而是对一定质荷比范围内的所有前体离子进行连续的碎片化和检测。因此,每个质谱图中会同时包含多个前体肽碎片化产物。这种信号的复杂性为从头肽/蛋白质测序带来了极大的挑战,因此提出了Transformer-DIA。
Transformer-DIA[22]是基于Transformer架构的深度学习模型,旨在解析DIA质谱数据。它利用了Transformer的强大表征能力来处理复杂的DIA质谱数据。如图5所示,Transformer-DIA模型在Transformer编码器之前加入了一个质谱编码器,它主要接收三种输入:MS1谱图、前体离子阵列和产物离子阵列。MS1的m/z值通过位置编码器处理,捕获峰的位置信息,提高氨基酸序列的准确性。前体质谱和产物离子阵列通过线性层转换,提高模型的表征能力。经过位置编码和线性层转换后的输入信号通过拼接、标准注意力或多种头注意力机制进行组合,帮助模型捕捉输入信息之间的复杂关系。质谱编码器有效整合多种输入信息,可以显著提升预测的精确度和模型的整体性能。
图 5 质谱编码器流程图
Fig. 5 Spectrum encoder flowchart
质谱编码器探索了三种不同的输入整合方法:串联、标准注意力和多头注意力。实验结果显示,串联层的表现始终优于其他两种方法,其次是标准注意力机制,而多头注意力表现最差。这一现象归因于不同方法在信息整合和特征提取中的有效性。串联层通过直接连接MS1、MS2和前体配置文件的信息,形成更丰富的特征表示,有效避免信息丢失。标准注意力机制能动态分配权重,强调关键特征,但在全局信息整合上不如串联层高效。多头注意力虽然灵活,但其复杂性可能导致冗余信息处理,影响模型性能。总体而言,简单有效的特征整合方式在处理DIA质谱数据时表现更好,提升了模型的整体性能。
Transformer-DIA模型在参数设置上使用与Casanovo相同的超参数进行训练,包括嵌入大小为512、配置8个注意力头、训练批量大小为32以及学习率为5×10-4。训练数据来自 MassIVE 存储库的人类 DIA 数据集,包含 UTI、OC 和Plasma数据集,这些数据集被随机按 0.9∶0.05∶0.05 的比例划分为训练集、验证集和测试集。在训练过程中,通过验证集对模型性能进行监控,监控指标包括每个训练 epoch 的损失、肽精确度、氨基酸精确度以及召回率。Transformer-DIA 模型采用交叉熵损失函数进行优化,旨在最小化预测肽序列与真实肽序列之间的差异,进而提升训练效果。
为了全面评估Transformer-DIA的性能,使用三个不同的数据集:UTI、OC和Plasma。将Transformer-DIA与两个专门为DIA数据设计的现有模型进行了比较:DeepNovo-DIA[23]和PepNet[24]。实验结果表明,Transformer-DIA在氨基酸和肽水平的精确度上始终优于当前最先进的方法,如图6所示。
图 6 在UTI、OC和Plasma下的肽段精确度和氨基酸精确度对比
Fig. 6 Comparison of peptide precision and amino acid precision under UTI, OC, and Plasma conditions
Transformer-DIA在处理DIA质谱数据时表现出比DeepNovo-DIA和PepNet更好的性能。主要原因在于采用注意力机制和复杂的特征融合方法,能够更有效地整合不同来源的信息,捕捉复杂的特征关系。相比之下,DeepNovo-DIA和PepNet虽然实现简单且计算效率高,但是简单的特征组合方法忽略了特征之间的复杂关系,导致信息丢失和表达能力有限。Transformer-DIA通过从MS1、前体离子阵列和产物离子阵列中提取丰富的特征(如m/z值、强度、电荷状态和保留时间),能够更全面地理解复杂的质谱数据。在性能上,Transformer-DIA在氨基酸和肽水平上的精确度显著提高。
与Casanova相比,Transformer-DIA在输入之前增加了质谱编码器,能够处理复杂的数据,能比Casanova的特征提取更加全面,特别是在处理DIA数据时,能够更有效地整合MS1、前体质谱和产物离子阵列的信息,因此预测的序列精确度更高,但训练的时间较长,如表2所示。
表 2 Transformer-DIA和Casanova的训练时间对比
Table 2 Comparison of training time between Transformer-DIA and Casanova
作为 Casanova 模型的扩展,Casanova-DIA 显著提升了 DIA 数据的从头肽测序能力,尤其在肽水平的复杂任务中表现出色。凭借其出色的性能,Casanova-DIA 已成为DIA 数据分析领域中推动肽测序进展的一个极具前景的工具。
1.4 π-HelixNovo
从头开始的肽测序技术旨在不依赖于已知数据库的情况下,直接从质谱数据中解码出肽段的氨基酸序列。然而,由于质谱过程中,在酶切、噪声处理过程中可能出现的离子丢失等问题,导致质谱质量的波动,这给从头肽测序带来了不小的挑战。为了解决这一难题,π-HelixNovo[25]应运而生,它是一个高效且精准的从头测序模型(图7)。
π-HelixNovo通过使用互补质谱来增强实验质谱中的离子信息。根据b离子和y离子的质量和等于肽的质量,b离子是从肽链N末端断裂形成的离子,y离子是从肽链C末端断裂形成的离子,b离子和y离子的强度在理论上是相等的,并且通过概念分析与实际应用进行论证,提出互补质谱概念,可以凭借互补质谱的新概念去填补缺失的信号数据。π-HelixNovo在Transformer编码器之前加入了新的编码器,用于对实验质谱及其相应的互补质谱进行编码。
π-HelixNovo模型采用了Transformer架构进行从头肽测序,独特之处在于分别对实验谱与互补谱进行编码,之后将两者的编码结果结合起来,并传递给Transformer编码器以进行进一步处理,使模型能够更全面地理解和解析谱图中的数据。
π-HelixNovo 是基于互补谱和 Transformer 架构的肽测序模型。模型采用9层 Transformer 编码器与解码器,配备8个注意力头,模型维度为512。训练过程中,使用多个数据集,如九物种基准数据集、合并数据集等。π-HelixNovo采用与Casanovo相同的超参数和策略进行训练。优化算法方面,采用交叉熵损失函数,配合Adam优化器和带100 k步热身的余弦退火学习率调度器。为了进一步提高π-HelixNovo的性能,在Transformer解码器之后采用波束搜索[16]。
图 7 π-HelixNovo模型流程图
Fig. 7 π-HelixNovo model flowchart
π-HelixNovo相较于Casanovo精确度和召回率上表现更为出色,如表3所示。π-HelixNovo分别对实验谱和互补谱进行了编码,这种双轨并进的策略使得模型能更全面地捕获和理解谱图中的信息,从而能够比Casanovo获取更加全面的质谱信息,进而提升肽测序的精确度。此外,π-HelixNovo在Transformer解码器后应用了波束搜索策略,这种方法不仅能有效捕捉序列间的长期依赖关系,还能在控制计算复杂性的同时增强模型的稳健性。当π-HelixNovo使用贪婪搜索策略时,其性能不如采用束搜索策略时的表现。贪婪搜索每步仅选择局部最优解,可能导致在复杂的肽测序任务中陷入局部最优,而束搜索策略通过同时探索多个路径并保存多个候选解,能更好地发现全局最优解,提高预测的准确性和完整性。不过,波束搜索策略的计算成本高于贪婪搜索策略。
π-HelixNovo通过引入互补质谱的概念,以及在使用束搜索策略,这些技术改进,使π-HelixNovo在氨基酸精确度、氨基酸召回率及肽段召回率等方面均超越了Casanovo成为当前从头肽测序领域的一个突出贡献者。
表 3 Nine-Species Benchmark Dataset上的氨基酸平均精确度、氨基酸平均召回率和肽段平均召回率
Table 3 Average amino acid precision, average amino acid recall, and average peptide recall on the Nine-Species Benchmark Dataset
1.5 PowerNovo
PowerNovo[26]是一款从头肽测序工具,利用多种质谱分析仪和碎片化技术获取的串联质谱数据,结合Transformer模型和综合序列质量评估,提供了完整的质谱数据处理流程,包括肽序列预测、肽组装和蛋白质推断。
PowerNovo新颖之处在于引入BERT[27]来评估从Transformer模型输出的氨基酸序列假设,缓解了下一个标记的预测依赖于前一个标记从而准确度降低这一问题。在模型中,BERT 模型扮演着评估和优化由变压器模型生成的肽段序列的关键角色。BERT 模型通过判断生成的肽段序列是否为诱饵序列(即不存在于自然界中的虚假序列)来排除错误预测,并通过评估肽段序列的可检测性,将其分类为高度可检测、低度可检测或潜在可检测,从而筛选出最有可能真实存在的肽段序列。
PowerNovo实现了质谱数据处理的完整周期。质谱数据处理通常涉及多个步骤,从数据采集到最终的肽序列预测。PowerNovo的架构将这些步骤模块化,主要分为三个模块,每个模块负责特定的功能,确保系统的整体运作效率和准确性,如图8所示。首先是Transformer模型模块,该模块的设计主要目的在于精确捕捉质谱中的信息,并将其转化为肽序列。通过学习质谱的潜在表征,Transformer模型能够有效处理复杂的质谱数据,并进行肽序列预测。其次是肽推断模块,专注于评估和修正氨基酸序列,并预测肽的可检测性,以提供更准确的肽序列及其置信度得分,该模块的结果是每个质谱最可能的肽序列,并附带相应的置信度评分。这使得PowerNovo能够有效地评估和优化肽序列的质量,提供更准确的鉴定结果。最后是蛋白质推理模块,蛋白质推理模块负责将识别出的肽序列组装成完整的蛋白质,并进行最终的蛋白质鉴定。
图 8 PowerNovo模型流程图
Fig. 8 PowerNovo model flowchart
在 PowerNovo 模型中,BERT 模型是通过掩码语言模型(Masked language model, MLM)[28]技术来识别和修复肽段序列中的错误氨基酸,从而提高最终预测的准确性。具体来说,BERT 模型首先接收由Transformer模型生成的肽段序列作为输入,这些序列可能包含错误的氨基酸或缺失的片段离子。在训练过程中,BERT 模型通过Transformer编码器学习肽段序列的内部结构和上下文关系,能够根据周围的氨基酸预测被掩码或替换的氨基酸[29]。在预测阶段,BERT 模型遍历输入序列中的每一个氨基酸,并根据上下文信息预测每个位置的氨基酸。错误的序列会被修复,修复后的序列会通过 BERT 模型的评估模块进行评估,根据模型的置信度评分来判断修复后的序列是否合理。如果评分高,序列会被保留,通过这种方式,BERT 模型不仅能够识别和修复肽段序列中的错误氨基酸,还能评估修复后的序列的可检测性,从而显著提高最终预测的准确性和可靠性。
PowerNovo结合Transformer和BERT 架构以实现高效的肽段序列分析。Transformer具备强大的序列特征提取能力,在处理质谱数据时,将质谱数据的嵌入维度设置为512,虽然维度越高可容纳的特征信息越丰富,但同时会增加计算成本。光谱变换器设置为10层,更多的层数有助于模型挖掘质谱数据中的复杂特征,提升模型对数据的抽象理解能力。肽段推断模块基于BERT架构,配备8个注意力头和7层隐藏层。多头注意力机制能够让模型从不同视角捕捉肽段序列中的上下文信息,增强对序列特征的捕捉能力;7层隐藏层可以逐步对输入信息进行深度抽象和转换。在蛋白质推理模块,采用 ALPS 算法进行肽段分配,该算法在序列组装方面具有较好的性能。在蛋白质分配时,设置最小一致性为75%,即要求将肽段映射到蛋白质序列时,匹配部分的相似度至少达到75%,以此保证蛋白质鉴定的准确性。在模型训练过程中,设置最大训练轮数为 256,以此控制模型训练的迭代次数,避免过拟合或欠拟合;学习率设定为5×10,帮助模型快速收敛到最优解。
在氨基酸精确度上,PowerNovo表现优于Casanovo。PowerNovo 在氨基酸召回率和肽段召回率方面也显示出较好的性能,如图9所示。PowerNovo 提供了全面的解决方案,包括肽序列组装和蛋白质映射,能够有效简化研究人员的工作流程。由于引入BERT模块,PowerNovo 的模型复杂度相应增加,导致计算时间和计算资源的需求上升。
在蛋白质组学中开发人工智能模型的瓶颈之一是没有严格的方法来评估从头测序输出的有效性。PowerNovo在引入BERT模块,减轻了评估相关中的不确定性。
图 9 数据集MSV000079801上的氨基酸平均精确度、召回率和肽段平均召回率
Fig. 9 Amino acid mean precision, recall, and peptide mean recall on dataset MSV000079801
1.6 π-PrimeNovo
肽测序是通过串联质谱(MS/MS)技术分析蛋白质组学数据的核心技术。它在揭示生物系统中复杂的蛋白质世界中发挥着关键作用。当前大多数用于肽测序的深度学习模型采用自回归生成方法,即模型按顺序一个标记接一个标记地生成肽序列。这种方法有一个显著的问题,如果在序列的早期生成中出现错误,这些错误会累积并影响整个序列的准确性[30]。波束搜索等顺序译码算法虽然能够在一定程度上缓解这一问题,但其计算成本较高,推理速度较慢。
为了解决上述问题,π-PrimeNovo引入了一种非自回归的深度学习模型,基于Transformer架构,如图10所示。非自回归模型不同于传统的自回归方法,它可以在不依赖之前生成的序列标记的情况下,同时生成整个序列。这种方法减少了错误级联的风险,并大大提高了生成速度。该模型以MS/MS数据作为输入,生成预测的肽序列。它主要由两个关键组件组成:一个非自回归的Transformer模型主干,该部分优化了连接时间分类(Connectionist temporal classification,CTC)损失[31],使其能够同时预测序列中所有位置的氨基酸。精确质量控制(Precision mass control,PMC)解码单元,该单元通过利用预测概率,精确优化生成的肽序列,以确保符合质量标准,如图11所示。
图 10 Transformer 编码器与非自回归解码器内部结构
Fig. 10 Internal structure of Transformer encoder and non-autoregressive decoder
图 11 π-PrimeNovo工作流程图
Fig. 11 π-PrimeNovo model flowchart
π-PrimeNovo 模型在肽测序领域展现出独特优势,其架构设计、训练方式及核心组件的协同作用,提升了测序的准确性与效率。在模型架构上,π-PrimeNovo的编码器和解码器均由9个多头注意力层构成,每个注意力层配备8个注意力头,隐藏嵌入维度设置为400。这样的结构设计为模型处理质谱数据和肽序列信息时,提供了强大的特征提取和信息交互能力。训练过程中,采用Cosine学习率调度器与AdamW优化器相结合的方式,同时将随机失活率设为0.18。这种组合能够有效防止过拟合现象的发生,确保模型在复杂的训练数据中稳健学习,优化参数,提升模型的泛化能力。推理阶段,π-PrimeNovo 通过将精确质量控制(PMC)的精度设定为0.1 Da,严格保障了解码肽段质量与光谱前体质量偏差控制在0.1 Da 范围内,进一步提高了测序结果的准确性。
π-PrimeNovo 模型的核心组件是非自回归解码器,它由9个解码器层构成,每个层包含了多头自注意力(Multi-head self-attention)和多头交互注意力(Multi-head inter-attention)两个子模块。多头自注意力的主要作用是处理内部的肽序列信息,使得模型能够在生成过程中同时考虑整个序列的所有氨基酸,而不局限于已经生成的部分。这种全局视野有助于提高预测的精确度和完整度。另一方面,多头交互注意力则专注于捕获质谱特征和肽序列之间的相互影响。多头交互注意力机制允许模型在肽序列和质谱数据之间建立双向的信息流动。肽序列的每一个位置都会根据质谱数据计算出一个新的表示,这个新表示不仅包含了该位置自身的特征,还融合了来自质谱数据的相关信息。通过这种方式,π-PrimeNovo模型不仅能考虑到肽序列本身的特性,还可以充分利用质谱数据提供的上下文信息,从而更准确地预测肽序列。这两个子模块协同工作,共同提升了模型的性能和预测能力。与传统 Transformer 解码器逐个生成氨基酸的方式不同,π-PrimeNovo 模型能够并行生成整个肽序列。这种并行生成方式不仅避免了前期错误对后续序列准确性的连锁影响,同时大幅减少了计算时间和资源消耗。在处理较长肽序列时,非自回归解码器的优势尤为突出,能够更高效地完成测序任务。
π-PrimeNovo通过引入非自回归编码器,在多个关键性能指标上显著超越了现有模型。在氨基酸精确度方面,π-PrimeNovo展现出最高的精确度,接近80%,如图12所示。在肽段召回率方面,π-PrimeNovo同样表现出色,而Casanovo和其他模型的召回率则相对较低。π-PrimeNovo模型通过使用非自回归解码器并行生成肽序列,避免了自回归模型中早期错误累积的问题,大幅提高了从头肽测序的速度和准确性。
图 12 Nine-Species Benchmark Dataset 上的氨基酸平均精确度和肽段平均召回率
Fig. 12 Average Amino Acid Accuracy and Average Peptide Recall on the Nine-Species Benchmark Dataset
2 基于Transformer架构的从头肽测序模型的联系
Casanovo、CasanovoV2、π-HelixNovo、Transformer-DIA、PowerNovo和π-PrimeNovo等模型在从头肽测序领域内形成了一个技术演进的链条,如图13所示。
Casanovo作为先驱,首次将变压器架构应用于肽序列预测,奠定了利用先进神经网络处理质谱数据的基础,大大提高序列的准确度。然而,由于Casanovo采用贪婪搜索策略,容易陷入局部最优解,从而会降低准确度。因此,为改变这一问题,提出CasanovoV2。CasanovoV2改用波束搜索策略,进一步提高序列的准确度,但对于前期质谱数据的收集仍存在不足。π-HelixNovo在此基础上引入“互补光谱”的概念,重建缺失的质谱数据,增强模型对于复杂样本的解析能力。Transformer-DIA针对前期质谱数据的收集还不是很全面这一问题进行改进,增加质谱编码器,专门针对信息量大且复杂的DIA数据进行编码,提供更全面的输入数据,从而能更准确地捕捉序列间的关系。PowerNovo针对序列预测过程中缺乏准确的评估而造成序列准确度降低这一问题做出改进,创新地采用了三阶段处理流程,结合了变压器编码器、解码器和BERT模型的优势,不仅提高了序列预测的准确性,还提供了更为全面的质谱数据分析解决方案。最后,π-PrimeNovo首次实现了非自回归的肽序列预测,大幅减少了预测过程中的误差累积,同时通过引入精确的质量控制单元,确保了预测序列与前体质量的高度匹配。
图 13 基于transformer架构的从头肽测序模型的联系
Fig. 13 Linkage of de novo peptide sequencing models based on Transformer architecture
3 结束语
随着蛋白质组学领域的不断发展,从头肽测序技术的进步对于揭示蛋白质的结构和功能变得愈发关键。本综述全面回顾了基于Transformer架构的从头肽测序方法的最新进展,展示了这一领域如何通过深度学习,尤其是Transformer模型的引入,实现了显著的性能提升。
本文综述了Transformer模型在从头肽测序中的应用,介绍了几个最新的模型,如Casanovo、CasanovoV2、Transformer-DIA、π-HelixNovo、PowerNovo和π-PrimeNovo。这些模型的开发标志着蛋白质从头肽测序技术的一个重要进步。通过利用Transformer架构的强大能力,这些模型在处理质谱数据时展现出了卓越的性能,尤其是在学习情境化表示和序列数据建模方面。Transformer模型以其卓越的序列数据处理能力和自注意机制,为解决传统方法中的复杂性和效率问题提供了新的视角。通过本综述可知,基于 Transformer 的从头肽测序方法在模型复杂度、推理时间以及提高测序精度方面均展现出显著优势。尽管 Transformer 模型在肽测序任务中已取得出色性能,但其仍存在一定局限性,主要体现在模型可解释性、动态调整能力、模块协同性以及数据适应性等方面。
(1)可解释性差。基于 Transformer 的模型结构复杂,内部的自注意力机制与多层神经网络使得序列决策过程晦涩难懂。以Casanovo为例,它虽能依据质谱峰序列预测肽序列,但研究人员很难确切了解模型如何利用每个峰的信息进行决策。这种黑箱特性阻碍了研究人员深入理解模型行为,不利于发现模型潜在问题和探索改进方向。在实际应用中,尤其是对结果准确性要求极高的生物医学研究领域,可解释性差可能降低人们对测序结果的信任度。
(2)模型缺乏动态调整能力。当前的模型架构大多采用固定的网络结构和参数设置,难以根据输入数据的特点进行动态调整。在处理不同质量和复杂度的质谱数据时,无法自适应地分配计算资源或调整处理策略。例如,Transformer-DIA 在处理不同样本的质谱数据时,无论数据复杂程度如何,均采用相同的编码和注意力机制。可能导致在处理简单数据时计算资源浪费,而处理复杂数据时又无法充分挖掘数据特征,进而影响测序效率和准确性。
(3)部分模型存在模块间协同性不足。大多数模型包含多个功能模块,但模块间的协同性有待优化。以 π-HelixNovo 为例,它设有分别处理实验光谱和互补光谱的编码器,以及负责肽序列生成的解码器,但这些模块之间的信息传递和协同工作可能未达最佳状态。编码器和解码器之间会存在信息沟通不畅的情况,导致互补光谱的优势无法充分体现在肽序列预测中,影响整体模型性能。
(4)数据适应性问题。现有模型在处理不同来源和质量的质谱数据时,表现存在差异。不同的数据集在样本类型、质谱仪参数和后处理程序等方面存在差异,可能导致模型的性能不稳定。一些模型在特定数据集上表现良好,但在其他数据集上的泛化能力不足。
综上所述,这些局限性制约了基于 Transformer 的肽测序技术的广泛应用和进一步发展,亟待后续研究加以改进。未来,在现有模型的基础上可从以下几个关键方向展开改进:
(1)增强模型可解释性。开发可视化工具呈现 Transformer 模型内部信息,辅助理解其工作机制。探索设计新结构,如引入结构化注意力机制,让模型决策逻辑更易理解。
(2)提升动态调整能力。设计自适应模型架构,使其能依据质谱数据特征自动调整网络结构或参数。例如采用动态层规划技术,或研发智能注意力机制,灵活聚焦关键信息。
(3)优化模块协同性。深入剖析模型模块间信息流动机制,改进信息传递与交互方式。像在 π-HelixNovo 类模型中,优化中间表示形式,还可引入强化学习提升协作效率。
(4)强化数据适应性。构建多源数据融合框架,让模型学习不同质谱数据共性,增强泛化能力。开发自适应预处理技术,并探索元学习方法,减少模型性能波动。
通过这些改进方向,有望突破现有局限,推动基于 Transformer 的肽测序技术更广泛应用与深入发展,助力蛋白质组学研究取得更多突破。目前的研究已经取得了令人鼓舞的成果,但仍有许多挑战需要克服。未来可能会集中在进一步优化Transformer模型的结构,提高其在处理大规模和复杂质谱数据时的鲁棒性,以及探索更多跨学科的应用场景。此外,随着计算资源的日益丰富和算法的不断进步,期待基于Transformer的从头肽测序技术能够在蛋白质组学研究中发挥更大的作用,为生命科学领域带来新的突破。
图 1 基于Transformer架构的从头肽测序模型的工作流程
Fig. 1 De novo peptide sequencing model based on Transformer architecture
图 2 Casanovo模型流程图
Fig. 2 Casanovo model flowchart
图 3 CasanovoV2模型流程图
Fig. 3 CasanovoV2 model flowchart
图 4 波束搜索解码策略
Fig. 4 Beam search decoding strategy
图 5 质谱编码器流程图
Fig. 5 Spectrum encoder flowchart
图 6 在UTI、OC和Plasma下的肽段精确度和氨基酸精确度对比
Fig. 6 Comparison of peptide precision and amino acid precision under UTI, OC, and Plasma conditions
图 7 π-HelixNovo模型流程图
Fig. 7 π-HelixNovo model flowchart
图 8 PowerNovo模型流程图
Fig. 8 PowerNovo model flowchart
图 9 数据集MSV000079801上的氨基酸平均精确度、召回率和肽段平均召回率
Fig. 9 Amino acid mean precision, recall, and peptide mean recall on dataset MSV000079801
图 10 Transformer 编码器与非自回归解码器内部结构
Fig. 10 Internal structure of Transformer encoder and non-autoregressive decoder
图 11 π-PrimeNovo工作流程图
Fig. 11 π-PrimeNovo model flowchart
图 12 Nine-Species Benchmark Dataset 上的氨基酸平均精确度和肽段平均召回率
Fig. 12 Average Amino Acid Accuracy and Average Peptide Recall on the Nine-Species Benchmark Dataset
图 13 基于transformer架构的从头肽测序模型的联系
Fig. 13 Linkage of de novo peptide sequencing models based on Transformer architecture
表 1 Nine-Species Benchmark Dataset上的平均肽段精确度和氨基酸精确度
Table 1 Average peptide precision and amino acid precision on the Nine-Species Benchmark Dataset
表 2 Transformer-DIA和Casanova的训练时间对比
Table 2 Comparison of training time between Transformer-DIA and Casanova
表 3 Nine-Species Benchmark Dataset上的氨基酸平均精确度、氨基酸平均召回率和肽段平均召回率
Table 3 Average amino acid precision, average amino acid recall, and average peptide recall on the Nine-Species Benchmark Dataset
SEIDLER J, ZINN N, BOEHM M E, et al. De novo sequencing of peptides by Ms/Ms[J]. Proteomics, 2010, 10(4): 634-649. DOI: 10.1002/pmic.200900459.
AEBERSOLD R, MANN M. Mass-spectrometric exploration of proteome structure and function[J]. Nature, 2016, 537: 347-355. DOI: 10.1038/nature19949.
TRAN N H, ZHANG X, XIN Lei, et al. De novo peptide sequencing by deep learning[J]. Proceedings of the National Academy of Sciences of the United States of America, 2017, 114(31): 8247-8252. DOI: 10.1073/pnas.1705691114.
WANG Ke, ZHU Mingjia, WADII B, et al. SeqNovo: De novo peptide sequencing prediction in IoMT via Seq2Seq. [J]. IEEE Journal of Biomedical and Health Informatics, 2025, 29(4): 2377-2387. DOI: 10. 1109/JBHI. 2023. 3321780.
HAN Kai, XIAO An, WU Enhua, et al. Transformer in transformer[EB/OL]. (2021-02-27)[2021-10-26]. https://arxiv.org/abs/2103.00112.DOI:10.48550/arXiv.2103.00112.
RAGANATO A, TIEDMANN J. An analysis of encoder representations in transformer-based machine translation[C]//Proceedings of the 2018 conference on empirical methods in natural language processing workshop blackboxNLP: Analyzing and interpreting neural networks for NLP, November 1, 2018, Brussels, Belgium: Association for Computational Linguistics, 2018: 287-297. DOI: 10.18653/v1/W18-5431.
MISHRA P, DIWAN C, SRINIVASA S, et al. Automatic title generation for text with pre-trained transformer language model[C]//2021 IEEE 15th international conference on semantic computing (ICSC), January 27-29, 2021, Laguna Hills, CA, USA: IEEE, 2021: 17-24. DOI: 10. 1109/ICSC50631. 2021. 00009.
RIVES A, MEIER J, SERCU T, et al. Biological structure and function emerge from scaling unsupervised learning to 250 million protein sequences[J]. Proceedings of the National Academy of Sciences of the United States of America, 2021, 118(15): e2016239118. DOI: 10.1073/pnas.2016239118.
AVSEC Z, AGARWAL V, VISENTIN D, et al. Effective gene expression prediction from sequence by integrating long-range interactions[J]. Nature Methods, 2021, 18: 1196-1203. DOI: 10.1038/s41592-021-01252-x.
YILMAZ M, FONDRIE W, BITTREMIEX W, et al. De novo mass spectrometry peptide sequencing with a transformer model[J]. International Conference on Machine Learning. Proceedings of Machine Learning Research, 2022, 162: 25514-25522. DOI: 10.1101/2022.02.07.479481.
VASWANI A, SHAZEER N, PARMAR N, et al. Attention is all you need[EB/OL]. (2017-06-12)[2023-08-02]. https://arxiv.org/abs/1706.03762ArXivPreprint.DOI:10.48550/arXiv.1706.03762.
NIU Zhaoyang, ZHONG Guoqiang, YU Hui. A review on the attention mechanism of deep learning[J]. Neurocomputing, 2021, 452: 48-62. DOI: 10.1016/j.neucom.2021.03.091.
QIAO Rui, TRAN N H, XIN Lei, et al. Computationally instrumentresolution-independent de novo peptide sequencing for high-resolution devices[J]. Nature Machine Intelligence, 2021, 3: 420-425. DOI: 10.1038/s42256-021-00304-3.
YILMAZ M, FONDRIE W E, BITTREMIUX W, et al. Sequence-to-sequence translation from mass spectra to peptides with a transformer model[J]. Nature Communications, 2024, 15: 6427. DOI: 10.1038/s41467-024-49731-x.
CHICKERING D M. Optimal structure identification with greedy search[J]. Journal of Machine Learning Research, 2003, 3(3): 507-554. DOI: 10.1162/153244303321897717.
KUMAR A, VEMBU S, MENON A K, et al. Beam search algorithms for multilabel learning[J]. Machine Learning, 2013, 92: 65-89. DOI: 10.1007/s10994-013-5371-6.
JEMAL M. High-throughput quantitative bioanalysis by LC/MS/MS[J]. Biomedical Chromatography, 2000, 14(6): 422-429. DOI: 10.1002/1099-0801(200010)14: 6<422: : AID-BMC25>3. 0. CO;2-I.
MCCORMACK A L, SCHIELTZ D M, GOODE B, et al. Direct analysis and identification of proteins in mixtures by lc/ms/ms and database searching at the low-femtomole level[J]. Analytical Chemistry, 1997, 69(4): 767–776. DOI: 10.1021/ac960799q.
张莹莹, 舒坤贤, 常乘. 基于数据非依赖采集的以肽为中心分析算法和软件的研究进展[J]. 生物工程学报, 2023, 39(9): 3579-3593. DOI: 10.13345/j.cjb.230079.
ZHANG Yingying, SHU Kunxian, CHANG Cheng. Advances of peptide-centric data-independent acquisition analysis algorithms and software tools[J]. Chinese Journal of Biotechnology, 2023, 39(9): 3579-3593. DOI: 10.13345/j.cjb.230079.
FERNÁNDEZ-COSTA C, MARTÍNEZ-BARTOLOME S, MCCLATCHY D B, et al. Impact of the identification strategy on the reproducibility of the dda and dia results[J]. Journal of Proteome Research, 2020, 19(8): 3153–3161. DOI: 10.1021/acs.jproteome.0c00153.
HUNTER C L, BONS J, SCHILLING B. Perspectives and opinions from scientific leaders on the evolution of data-independent acquisition for quantitative proteomics and novel biological applications[J]. Australian Journal of Chemistry, 2023, 76(8): 379-398. DOI: 10. 1071/CH23039.
EBRAHIMI S, GUO Xuan. Transformer-based de novo peptide sequencing for data-independent acquisition mass spectrometry[EB/OL]. (2024-02-17)[2024-06-26]. https://arxiv.org/abs/2402.11363.DOI:10.48550/arXiv.2402.11363.
TRAN H N, QIAO Rui, XIN Lei, et al. Deep learning enables de novo peptide sequencing from data-independent-acquisition mass spectrometry[J]. Nature Methods, 2019, 16: 63-66. DOI: 10.1038/s41592-018-0260-3.
LIU Kaiyuan, YE Yuzhen, LI Sujun, et al. Accurate de novo peptide sequencing using fully convolutional neural networks[J]. Nature Communications, 2023, 14: 7974. DOI: 10.1038/s41467-023-43010-x.
YANG Tingpeng, LING Tianze, SUN Boyan, et al. Introducing π-HelixNovo for practical large-scale de novo peptide sequencing[J]. Briefings in Bioinformatics, 2024, 25(2): bbae021. DOI: 10.1093/bib/bbae021.
PETROVSKIY D V, NIKOLSKY K S, KULIKOVA L I, et al. PowerNovo: De novo peptide sequencing via tandem mass spectrometry using an ensemble of transformer and BERT models[J]. Scientific Reports, 2024, 14: 15000. DOI: 10.1038/s41598-024-65861-0.
DEVLIN J, CHANG Mingwei, LEE K, et al. Bert: Pre-training of deep bidirectional transformers for language understanding[C]. //In Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1, June, 2019, Minneapolis, Minnesota: Association for Computational Linguistics, 2019: 4171-4186. DOI: 10.18653/v1/N19-1423.
SALAZAR J, LIANG D, NGUYEN T Q, et al. Masked language model scoring[EB/OL]. (2019-10-31)[2021-01-01]. https://arxiv.org/abs/1910.14659.DOI:10.48550/arXiv.1910.14659.
XU Liyan, GU Yile, KOLEHMAINEN J, et al. Rescorebert: discriminative speech recognition rescoring with bert[C]. //ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), May, 23-27, 2022. New Jersey: IEEE, 2022: 6117-6121. DOI: 10. 1109/ICASSP43922. 2022. 9747118.
ARORA K, ASRI L E, BAHULEYAN H, et al. Why exposure bias matters: An imitation learning perspective of error accumulation in language generation[EB/OL]. (2022-04-03)[2023-01-09]. https://arxiv.org/abs/2204.01171.DOI:10.48550/arXiv.2204.01171.
GRAVES A. Connectionist temporal classification[M]//GRAVES A. Supervised sequence labelling with recurrent neural networks, Berlin, Heidelberg: Springer, 2012: 61-93. DOI: 10.1007/978-3-642-24797-2_7.

友情链接LINKS