王鲜芳,卢 凡,刘依锋,李启萌
(1.河南工学院 计算机科学与技术学院,河南 新乡 453003;2.河南师范大学 计算机与信息工程学院,河南 新乡 453007)
嗜热蛋白质在开发应用方面有着非常广阔的前景。在发酵行业中,可利用其能耐受高温这一特性,提高反应温度和速度,减少中温型杂菌污染的机会[1],来生产多种催化剂。由嗜热蛋白质生产的这些酶制剂具有热稳定性好,催化反应速率高,易于在室温下保存等优点。嗜热蛋白质研究中最引人注目的成果之一是将水生栖热菌中耐热的TaqDNA聚合酶[2]用于基因研究和遗传工程以及基因技术之中。所以对于嗜热蛋白质的预测显得尤为重要。
目前嗜热蛋白质预测主要有两类方法:生物实验手工标注和计算方法预测[3]。在后基因组时代,随着DNA和蛋白质序列以及结构信息的大量积累,传统的手工实验费时费力,所以人们更倾向于利用数学、计算机科学知识分析、挖掘生物数据,以寻求蕴含在其中的生物规律[4]。近年来,机器学习算法被广泛应用到蛋白质预测中,目前常用的机器学习分类算法有线性判别分析、K近邻算法、决策树、朴素贝叶斯、支持向量机[5]和神经网络等。其中,Hua和Sun[6]等人采用氨基酸组成方法构造特征表达模型,在蛋白质数据集上取得了高达91.4%的预测准确率;Wu[7]等人运用决策树预测嗜热蛋白质的热稳定性,其精度达到80%以上;Dao[2]等人运用支持向量机对嗜热蛋白质进行预测,在五折叠交叉验证中精度达到了92.75%。……