摘要
近年来,研究显示lncRNA的突变和失调与许多复杂疾病密切相关。本文提出一种基于混合协同过滤算法的随机游走模型来预测lncRNA-疾病关联,简称HCRLDA。首先,分别将疾病语义相似性、lncRNA功能相似性及miRNA功能相似性分别与各自的高斯相似性集成,得到三个同构相似性网络。随后,结合已知的疾病-lncRNA、疾病-miRNA、lncRNA-miRNA关联信息构建了一个原始的多层异构相似性网络,由于已知的关联矩阵信息比较稀疏,其信息的完整性对模型的预测效果有着直接的影响,因此,引入了一种基于项目和用户的混合协同过滤推荐算法来更新原始异构网络。最后,在更新后的异构网络上实施重启随机游走算法来预测疾病关联的lncRNA,在十折交叉验证下HCRLDA的AUC平均值达到0.986 9,与以往的关联预测模型相比实验结果显示了该模型算法的有效性。
Abstract
In recent years, studies have shown that mutations and dysregulations of lncRNA are closely related to many complex diseases. In this paper, a random walk model based on a hybrid collaborative filtering algorithm is proposed to predict lncRNA-disease associations, referred to as HCRLDA. Firstly, disease semantic similarity, lncRNA functional similarity, and miRNA functional similarity are integrated with their respective Gaussian similarities to obtain three isomorphic similarity networks. Then, original multi-layer heterogeneous similarity networks are constructed by combining known disease-lncRNA, disease-miRNA, and lncRNA-miRNA association information. Due to the sparsity of the known association matrix information and the direct impact of information completeness on the prediction performance of the model. Therefore, a hybrid collaborative filtering recommendation algorithm based on items and users is introduced to update the original heterogeneous networks. Finally, the random walk with restart algorithm(RWR) is implemented on the updated heterogeneous network to predict diseases-related lncRNAs. The average AUC of HCRLDA reaches 0.9869 under ten-fold cross-validation, and experimental results demonstrate the effectiveness of the model compared to previous association prediction models.
LncRNA是目前研究的热点与难点,许多研究显示lncRNA参与了多样化的生物进程,其结构变异或表达失衡已被证明与多种复杂疾病的发生和发展有紧密联系[1-2]。预测lncRNA与疾病是否存在关联,通过生物实验的方法来预测既耗时又需要昂贵的费用。因此,近年来研究人员利用计算手段,尤其是借助机器学习技术来构建预测模型,以探索lncRNA与疾病间的潜在关联性。这种方法逐渐成为生物信息学研究中的一个关键领域,为理解疾病的分子机制提供了新的视角[3]。
借助快速发展的智能计算技术,目前已经开发出多种lncRNA-疾病关联预测模型,主要可以分为三类。第一类是基于机器学习的方法。这类方法通过使用已知的疾病相关的lncRNA和未知的lncRNA特征来训练分类器,通过分析生物学特征之间的差异,这些分类器能够对候选lncRNA进行优先级排序,从而为后续的生物学研究和临床应用提供重要的参考依据。这种方法的优势在于其能够处理大量复杂的数据,并从中提取出潜在的生物学信息,为疾病的早期诊断和治疗策略的制定提供支持[4]。例如,Chen等[5]提出了基于半监督学习框架的LRLSLDA模型,将拉普拉斯正则化最小二乘法方法用于其中,它是研究lncRNA-疾病关联关系预测的首例计算模型。Yu等[6]则提出CFNBC模型,该模型使用基于项目的协同过滤算法以更新三分网络应对lncRNA-疾病关联数据的稀疏性挑战,然后采用朴素贝叶斯分类器预测潜在的lncRNA-疾病关联。
第二类是基于矩阵分解的预测方法。矩阵分解方法因其原理简单而受到广泛应用,许多模型利用此技术处理数据并提取特征,以预测潜在的lncRNA与疾病的关联[7-8]。Fu等[9]通过把异构的多源关联矩阵分解为低秩矩阵,基于矩阵分解方法提出了MFLDA模型,并为不同来源的数据赋予权重来进行融合,对原本稀疏的lncRNA-疾病关联矩阵使用优化后的低秩矩阵来进行重构,从而提升了数据的可用性和分析的准确性。Biswas等[10]采用双聚类方法来识别lncRNA模块对数据进行多维度的聚类分析,并将非负矩阵分解方法用于疾病-lncRNA关联预测。Xuan等[11]提出了一个名为PMFILDA的模型,此模型首先建立了一个加权的lncRNA-疾病关联网络,接着使用基于节点间相似性的k-近邻算法更新网络中的关联权重,最后使用概率矩阵分解方法来预测潜在的lncRNA-疾病关联关系。
第三类是基于信息网络的方法。考虑到功能相似的lncRNA可能与表型相近的疾病有关联,研究人员开发了多种基于生物网络框架的技术来识别与疾病相关的lncRNA[4]。具体而言,Sun等[12]设计了一种名为RWRlncD的模型,它是基于lncRNA功能相似网络的全局网络计算方法,然后通过在lncRNA功能相似网络上实施重启随机游走(RWR)以揭示潜在的lncRNA-疾病关联。Yang等[13]构建了一个涵盖编码-非编码基因-疾病的二分网络,并运用传播算法在该网络中寻找隐藏的lncRNA-疾病关联。Yu等[14]提出了名为BRWLDA的模型,该模型的核心在于构建一个定向的双关系网络。通过采用双向随机游走的方法,该模型能够有效地挖掘潜在的lncRNA与各种疾病之间的关联性[15]。
此外,lncRNA与生物分子之间的相互作用关系可以通过数据的网络结构图清晰地表示,因此基于网络节点属性和拓扑结构信息的关联预测方法也成为了该领域中的重要分支[16-17]。这类方法的核心在于能够有效地综合处理大规模多源异构网络数据,并常采用随机游走或信息传播算法来准确预测网络中节点之间的关联[18]。本文将此方法应用于预测lncRNA-疾病关联,提出了一种基于异构信息网络上的混合协同过滤推荐算法,并采用随机游走模型预测lncRNA-疾病关联。首先,计算了疾病语义相似性、lncRNA功能相似性及miRNA功能相似性并将其分别与各自的高斯相似性结合,生成了三个同构相似性网络。再结合收集的疾病-lncRNA、疾病-miRNA、lncRNA-miRNA等三个异构网络得到了一个原始多层异构信息网络。然后,我们引入了一种基于项目和用户的混合协同过滤推荐算法来更新原始异构网络,降低其稀疏性对模型预测能力的影响。最后,在更新后的异构网络上实施重启随机游走算法预测与疾病关联的lncRNA。本文通过十折交叉验证比较了HCRLDA与LRWRHLDA[19]、RWLDA[20]、BRWMC[21]、LPARP[22]几个先进模型的预测性能,结果显示HCRLDA模型具有可靠性。
1 数据集
考虑到整合多种数据源可以提高预测模型的性能[23],本文中的异构信息网络是由三种类型的数据组成包括疾病、lncRNA及miRNA,它们之间的关联关系分别来自不同数据库,从中搜集了三种关联数据:疾病-lncRNA、疾病-miRNA、lncRNA-miRNA。本文用到的相关数据主要来源于以下数据库及Wang等[19]的工作:疾病-lncRNA关联数据集包括5 339对疾病-lncRNA关联,其中包含190种疾病和814个lncRNA,这些数据来自数据库:LncRNADisease database[24-25]、Lnc2Cancer database[26]、MNDR v3.1 database[27];疾病-miRNA关联数据集包括23 977对疾病-miRNA关联,其中包含190种疾病和2 476个miRNA,这些数据来自数据库:MNDR v3.1 database[27]、HMDD database[28]、MiR2Disease database[29]、lncRNA-miRNA关联数据集包括38 010对lncRNA-miRNA关联,其中包含814个lncRNA和2 476个miRNA,这些数据来自数据库:DIANA-LncBase database[30]、LncAcTdb 2.0 database[31]、MiRcode database[32]、StarBase database[33]。
最后,在纠正错误记录、删除一些重复关系、统一相同数据的命名规则之后得到了190种疾病、814个lncRNA及2 476个miRNA。各种数据源的个数及不同数据源之间的关联个数如图1所示。已知关联数据集的基本特征如表1所示。
图
1
各数据源的个数及不同数据源之间的联系
Fig.
1
Number of data and the interconnections between different data
表
1
已知关联数据集的基本特征
Table
1
Fundamental attributes of the known associated datasets
(其中,稀疏度为 1-。)
2 方法
2.1 相似性计算
2.1.1 疾病语义相似性
1)采用一种新的疾病语义相似性计算方法[34],它要优于目前被广泛认可和使用的两种疾病语义相似性I、II计算方法[35-36],通过将信息内容语义贡献因子引入到语义值的计算中,不仅考虑了疾病有向无环图(Directed acycline graph,DAG[37])的层次结构,还考虑了同一层次上不同疾病术语的特异性。对于疾病D, DAG(D)=(D,T(D),E(D))表示疾病D所对应的DAG图信息,其中T(D)是D及它所有祖先节点的集合,E(D)是节点间边的集合。因此如下定义了疾病d对疾病D的语义贡献值[33]:
(1)
其中,Δ是语义贡献因子通常取为0.5,𝑝d 是信息内容语义贡献因子,定义如下:
(2)
𝑘 是疾病的医学主题词(Medical subject headings,MeSH[38])中所有疾病的集合,N是所有疾病的数量,Dags(d)是包括疾病术语 d 自身的后代节点的数目,值得注意的是这里的 𝑃𝑑 值会随着MeSH版本的不断更新而变化。
因此,疾病 D 的语义值 DV(T) 为:
(3)
两种疾病的语义相似性为:
(4)
2)修正疾病语义相似性矩阵:虽然通过公式(4)可得到疾病语义相似性矩阵,但结果显示它是非常稀疏的,因此本文中对其稀疏性进行修正。对任一疾病 𝑑𝑖,DS矩阵第 𝑖 行中值不为0的所有元素代表了与 𝑑𝑖 相关的疾病。此外,若lncRNA与某一疾病团的关联性越大,那么其与该靶疾病的关联性就越大。因此,本文将DS矩阵中第 𝑖 行不为0的元素集合定义为疾病 𝑑𝑖 的疾病团[39]。然后,对于任意两种疾病 𝑑𝑖,𝑑𝑗 其相似性被修正如下:
(5)
(6)
(7)
这里𝛼为惩罚因子,其中DS(𝑖)表示矩阵第 𝑖 行中所有非0元素的集合,∂(𝑑𝑖) 和 ∂(𝑑𝑗) 分别是疾病 𝑑𝑖、𝑑𝑗 与除去二者之外的其他所有疾病之间的相似性得分向量。
2.1.2 lncRNA和miRNA的功能相似性
基于与同种疾病相关的lncRNAs(miRNAs)往往是相似的生物假设前提[40]。本文使用与lncRNA相关的疾病的相似性来计算lncRNA的功能相似性。𝐷1={𝑑1𝑖|1≤𝑖≤𝑚}、𝐷2={𝑑2𝑗|1≤𝑗≤𝑛}分别是与lncRNA 𝑙1和lncRNA 𝑙2相关的两组疾病。则其中一组疾病中的一种疾病和另一组疾病的相似性定义如下[19]:
(8)
然后,lncRNA 𝑙1和lncRNA 𝑙2之间的功能相似性计算方法如下:
(9)
同理,miRNA的功能相似性MS(𝑚1,𝑚2)与lncRNA的功能相似性计算方法类似。
2.1.3 疾病、lncRNA及miRNA的高斯相互作用谱核相似性
由于不同数据之间存在不同的高斯相互作用谱,本文将疾病-lncRNA的原始邻阶矩阵表示为,若疾病 𝑑𝑖 和lncRNA 𝑙𝑗 存在关联关系,则(𝑖,𝑗)=1,否则(𝑖,𝑗)=0。类似地,可定义disease-miRNA的关联矩阵、miRNA-disease的关联矩阵、miRNA-lncRNA的关联矩阵。
基于已知的疾病-lncRNA关联,疾病 𝑑𝑖 和 𝑑𝑗 的高斯相互作用谱核相似性[41]GaD𝐿计算如下:
(10)
(11)
其中IP(𝑑𝑖𝑙)表示矩阵 的第 𝑖 行,它是一个二进制向量。𝑟𝑑=1是核带宽参数 𝑟𝑑𝑙 的调节参数,nd 为疾病的数量。
基于已知的疾病-miRNA关联,疾病 𝑑𝑖 和 𝑑𝑗 的高斯相互作用谱核相似性 GaD𝑀 计算如下:
(12)
(13)
其中IP(𝑑𝑖𝑚)表示矩阵 的第 𝑖 行。
最终,将疾病的高斯相似性集成如下:
(14)
同样地,lncRNA、miRNA的高斯相似性(GaL、GaM)计算方法也与疾病类似。
2.2 疾病、lncRNA、miRNA的整合相似性
无论是疾病语义相似性、功能相似性还是高斯相互作用谱核相似性,都只反映了单方面的相似性信息,又考虑到功能相似性矩阵的稀疏性。因此本文通过将疾病语义相似性、lncRNA(miRNA)的功能相似性分别与各自的高斯相似性进行整合[42],以此来获得更加全面、准确的相似性。整合计算如下:
(15)
(16)
(17)
其中 b 是权重,介于0到1之间。
2.3 构建多层异构网络
基于以上计算的三个相似性矩阵LL、DD及MM,本文构造了三个同构相似性网络:lncRNA相似性网络、疾病相似性网络及miRNA相似性网络,又基于三者之间两两的原始关联矩阵LD、LM及MD(其中LD=,LM=,MD=),得到了三个异构网络如图2(a)所示。将上述三个同构相似性网络及三个异构关联网络整合,我们得到了一个原始的异构三分信息网络,如图2(b)所示。
2.4 基于项目和用户的混合协同过滤推荐算法
由于已知的lncRNA-miRNA、disease-miRNA原始矩阵关联关系十分稀疏,这对模型的预测效果有着直接影响,这里可能存在许多未知的关联关系,因此,我们使用基于项目和用户的混合协同过滤推荐算法来挖掘潜在的关联关系降低网络的稀疏性以提高模型的预测性能。协同过滤推荐算法可能涉及各种数据(用户和项目)的输入,因此,在本模型中我们将疾病和lncRNA看作用户、miRNA看作项目,以解决lncRNA-miRNA、disease-miRNA原始邻阶矩阵的稀疏性。由于miRNA-disease的原始邻阶矩阵及miRNA-lncRNA的原始邻阶矩阵有着相同的行向量,所以将二者整合得到一个新的邻阶矩阵=[,]。
图
2
HCRLDA的流程图
Fig.
2
Flowchart of HCRLDA
首先,采用基于项目的协同过滤推荐算法为lncRNA和疾病节点推荐更多的共同邻居节点miRNA。基于上述原始异构三分网络及定义了同现矩阵𝐴𝑚×𝑚,𝐴(𝑚𝑘,𝑚𝑟)表示同现矩阵𝐴𝑚×𝑚中第k行第r所对应元素,若miRNA节点𝑚𝑘和miRNA节点𝑚𝑟在原始三分网络中存在至少一个共同邻居节点(疾病或者lncRNA节点),那么𝐴(𝑚𝑘,𝑚𝑟)=1。否则,𝐴(𝑚𝑘,𝑚𝑟)=0。我们将𝐴𝑚×𝑚矩阵归一化,得到如下相似性矩阵𝐴'[6]:
(18)
其中表示原始三分网络中与𝑚𝑘存在已知关联的lncRNA和疾病节点数量,即矩阵第k行为1的个数,与类似。表示原始三分网络中与𝑚𝑘和𝑚𝑟同时都关联的lncRNA和疾病节点数量。因此,基于邻阶矩阵和相似性矩阵𝑅′可以得到如下新的推荐矩阵:
(19)
同理,采用基于用户的协同过滤推荐算法为miRNA节点推荐更多lncRNA或疾病节点。基于上述原始异构三分网络及定义了同现矩阵𝐴𝑙𝑑×𝑙𝑑,表示同现矩阵中第k行第r所对应元素,若lncRNA节点 𝑙𝑘(或疾病节点 𝑑𝑘)和lncRNA节点 𝑙𝑟(或疾病 𝑑𝑟)在原始三分网络中存在至少一个共同邻居节点miRNA,那么=1。否则,=0。将 矩阵归一化,得到如下相似性矩阵𝐴″:
(20)
其中 表示原始三分网络中与 𝑙𝑘(或𝑑𝑘)存在已知关联的miRNA节点数量,即矩阵第k列为1的个数,与类似。表示原始三分网络中与𝑙𝑘(或𝑑𝑘)和𝑙𝑟(或𝑑𝑟)同时关联的miRNA节点数量。因此,基于邻阶矩阵和相似性矩阵𝐴''可以得到如下新的推荐矩阵:
(21)
因此,将基于项目和用户的推荐算法相结合,得到一个新的混合推荐矩阵:
(22)
其中𝑎1,𝑎2是权重参数。为了方便起见,为两部分分配相同的权重,即𝑎1=𝑎2=1。
对于原始三分网络中的任一lncRNA节点 𝑙𝑖 和疾病节点 𝑑𝑗,若存在一个miRNA节点𝑚𝑘满足=1或者=1,将的第 𝑖 列和 𝑗 列分别加权求平均值 。如果在矩阵中的第 𝑖 列或第 𝑗 列中存在一个miRNA节点𝑚𝜃满足 或者 ,那么把miRNA 节点𝑚𝜃分别推荐给𝑙𝑖或𝑑𝑗,并将原始三分网络中的𝑚𝜃与𝑙𝑖之间或𝑚𝜃与𝑑𝑗之间分别添加一条新的连线。
为了更好地理解混合协同过滤推荐算法的过程,如图2(b)-(c)所给例子,这里已知=,可得到相应和计算如下:=
以节点𝑑2为例,从矩阵可知𝑚2,𝑚3及𝑚5与𝑑2关联,通过上述计算矩阵的结果可知: 因此,可以将𝑚4推荐给𝑑2。同理,分别将𝑚3,𝑚5推荐给𝑙1,将𝑚4,𝑚5推荐给𝑑3,并在原始三分网络中增加它们之间新的连线,在图2(c)中用虚线表示,这样就可以得到一个更新后的三分网络。
2.5 重启随机游走算法
在上述更新后的三分网络上实施拉普拉斯归一化重启随机游走算法,用于预测与研究疾病相关的候选LNCRNA。在重启随机游走中,游走者在移动的过程中每经过一个节点都会以概率 λ 返回起始节点重新开始游走,以概率 1-λ 移动到当前节点的邻居节点,这样既能捕获网络的局部结构又能捕获网络的全局结构,如图2(d)所示。重启随机游走算法的迭代公式定义如下[43]:
(23)
其中,𝑃0为初始概率向量,𝑃𝑡、𝑃𝑡+1分别为随机游走t、t+1步到达各个节点的概率向量,λ∈(0,1)为重启概率,W是经过归一化后得到的概率转移矩阵,𝑊𝑖𝑗表示从节点 𝑖 到节点 𝑗 的转移概率。经过公式(23)反复迭代,这个概率分布就会趋于收敛,最终达到稳定状态。当𝑃𝑡+1和𝑃𝑡的𝐿1范数小于10-6时,就认为达到了稳定概率,最终根据概率得分对疾病候选的lncRNA进行排序。
概率转移矩阵W定义如下:
(24)
𝑊𝐿𝐿是网内概率转移矩阵,表示从一个lncRNA节点转移到另一个lncRNA节点的概率,𝑊𝑀𝑀、𝑊𝐷𝐷与之类似。𝑊𝐿𝑀是网间概率转移矩阵,表示节点从lncRNA网络转移到miRNA网络的概率,𝑊LD、𝑊ML、𝑊MD、𝑊DL、𝑊DM与之类似。
拉普拉斯归一化可用于网络带权的规范化,应用拉普拉斯归一化[44]可计算得出W中所有值,以计算𝑊LM和𝑊LL为例:
从𝑙𝑖到𝑚𝑗的网间转移概率计算如下:
(25)
(26)
从 𝑙𝑖 到 𝑙𝑗 的网内转移概率计算如下:
(27)
(28)
其中,𝑃LM、𝑃LD范围介于0到1之间,分别表示从lncRNA相似性网络到miRNA(疾病)相似性网络的跳转概率,并且𝑃LD=𝑃DL,𝑃LM=𝑃ML,𝑃MD=𝑃DM。类似地,其他网内和网间概率转移矩阵计算方法类似。初始概率向量𝑃0计算如下:
(29)
其中,𝜂L、𝜂M、1-𝜂L-𝜂M是权重参数,范围介于0到1之间。𝑃𝐿0为lncRNA网络的初始概率,所有种子节点初始概率相同并且和为1。𝑃𝑀0与𝑃𝐿0类似。𝑃𝐷0是疾病网络的初始概率,除需要预测的疾病𝑑𝑖其初始概率为1外,其他所有节点的初始概率均为0。
3 结果
3.1 性能评估
在这项研究中,从各个数据库整合搜集到190种不同疾病和814个lncRNA之间的5 339对已知关联数据,为了对本文模型进行评估,将这些关联数据作为训练数据,并采用十折交叉验证来评估模型的准确性。在验证过程中,所有已知的lncRNA-疾病关联被随机均匀分为十个独立的数据子集,在每次验证中,选取其中一个子集作为测试集,其余九个子集则作为训练集,这个过程重复十次,确保每个子集都有机会充当一次测试集从而使得验证结果更加全面、公正。这样可得到十次结果的AUC及AUPR值,最终获得平均AUC值为0.986 9,平均AUPR值为0.910 0。如下图3所示绘制了十次结果的ROC曲线和PR曲线。(其中参数取值为𝑃LD=𝑃LM=𝑃MD=0.1,𝑏=0.3,𝜂𝐿=0.1, 𝜂𝑀=0.1,λ=0.9)
3.2 消融实验
为了探索不同模块如新的疾病语义相似性、基于项目和用户的混合协同过滤推荐算法的有效性,进行了消融实验即删除或替换模型中的一些模块,通过这一过程,能够更清晰地评估各个算法模块对整体模型性能的影响,其十折交叉验证结果如下表2所示。下面详细介绍了各个消融实验模型:
1)HCRLDA-DI:表示在实验中,新的疾病相似性被疾病语义相似性I所取代。
2)HCRLDA-DII:表示在实验中,新的疾病相似性被疾病语义相似性II所取代。
3)HCRLDA-IU:表示在实验中,删除掉基于用户和项目的混合协同过滤算法模块即未处理异构网络的稀疏性问题。
如表2显示了十倍交叉验证下不同消融模型的平均AUC及AUPR值,三个模型的平均AUC值均低于HCRLDA模型的平均AUC值0.986 9。实验结果表明HCRLDA模型达到了最佳性能,这也证明了各个算法模块在模型中的有效性。
3.3 与其他方法的比较
为了进一步证实本文模型的优越性能,比较了HCRLDA与其他几个先进模型LRWRHLDA[19]、RWLDA[20]、BRWMC[21]、LPARP[22]的预测性能。将本文中的数据集应用于其他几个模型并进行十折交叉验证,且统一采用AUC和AUPR值来综合评估这些模型的性能[42]。比较结果如图4所示。结果显示本文提出的模型在这五个模型中达到了最好的效果,其AUC值达到了0.986 9,优于LRWRHLDA(0.963 3)、RWLDA(0.810 2)、BRWMC(0.941 8)、LPARP(0.932 1)这四种先进模型。
图
3
HCRLDA的平均ROC曲线和PR曲线
Fig.
3
Average ROC curve and PR curve of HCRLDA
注:(a) 受试者工作特征曲线;(b) 精确率-召回率曲线.
表
2
HCRLDA的消融实验结果
Table
2
Ablation experiment results of HCRLDA
图
4
HCRLDA与其他模型的性能比较
Fig.
4
Performance comparison of HCRLDA with other models
注:(a) 各个模型的平均AUC值;(b) 各个模型的平均AUPR值.
为了全面地评估模型的性能,并避免因数据泄露或过拟合导致的问题,参考其他模型所搜集的数据[42-45]引入独立测试集,这样既能充分利用有限的数据资源又能提高实验结果的可靠性和说服力,实验结果如图5所示,在独立测试集下本文模型平均AUC值为0.985 8,平均AUPR值为0.909 0均优于其他几个先进模型。
图
5
独立测试集下HCRLDA与其他模型的性能比较
Fig.
5
Performance comparison of HCRLDA with other models under the independent test set
注:(a) 各个模型的平均AUC值;(b) 各个模型的平均AUPR值.
3.4 参数分析
HCRLDA模型中参数为:𝑃LD、𝑃LM、𝑃MD、𝑏、𝜂𝐿、𝜂𝑀、λ,由于参数较多,本文将部分参数取值固定𝑃=𝑃LD=𝑃LM=𝑃MD、η𝑀=0.1。为了评估各个参数对模型影响的大小,相应计算结果如表3到表6所示,结果显示,除了重启概率参数λ对模型有较大的影响外,其他参数的影响较小,随λ的增加AUC值不断增加,当λ=0.9时AUC达到最大值0.986 87,而当λ=1时AUC降低到0.5。当𝜂𝐿=0.1, 𝜂𝑀=0.1, 𝑃=𝑃LD=𝑃LM=𝑃MD=0.3, 𝑏=0.1, λ=0.9时模型预测效果最好。
表
3
不同P值的十折交叉验证结果
Table
3
Results of 10-fold cross-validation for different values of P
表
4
不同 𝑏 值的十折交叉验证结果
Table
4
Results of 10-fold cross-validation for different values of 𝑏
表
5
不同 𝜂𝐿 值的十折交叉验证结果
Table
5
Results of 10-fold cross-validation for different values of 𝜂𝐿
表
6
不同λ值的十折交叉验证结果
Table
6
Results of 10-fold cross-validation for different values of λ
4 结论
预测潜在的lncRNA-疾病关联不仅有助于疾病的准确诊断和有效治疗,而且可为生物实验设计提供有效的数据,降低传统生物实验的时间和成本。本文提出了一种名为HCRLDA的预测模型,该模型基于混合协同过滤推荐算法与随机游走策略来预测lncRNA-疾病关联。通过十折交叉验证实验得出如下结论:
1)HCRLDA算法有效可靠,优于当前的一些主流算法。
2)相较于现有的lncRNA-疾病关联预测模型,本文提出了一种基于用户和项目的混合协同过滤推荐算法来更新原始的三分网络以解决其稀疏性对模型预测效果的影响,然后在更新后的三分网络上实施拉普拉斯归一化重启随机游走算法。这种更新后的信息网络模型不仅提高了对lncRNA-疾病关联预测的准确性,还为生物医学数据处理和分析提供了新的思路和方法。