基于隐马尔可夫模型的蛋白质序列筛选算法

2011-07-13 06:02:50张毅梅挺
电子设计工程 2011年21期
关键词:数据库特征模型

张毅,梅挺

(成都医学院 人文信息管理学院,四川 成都 610083)

近年来,随着人们对蛋白质测序工作的快速发展,蛋白质数据库中的序列数量呈现指数级的增长速度,在这存储有海量的蛋白质数据库中,存在着大量的冗余蛋白质序列。虽然目前对冗余蛋白质序列尚未有很明确和统一的定义,但是普遍认为,在蛋白质数据库中,如果两条蛋白质序列的具有非常高的相似度,尤其是在整个序列中控制蛋白质功能的特征序列具有很强的相似性时,则认为这两条蛋白质序列是互为冗余的序列。造成这种现象的原因很多,一个典型的原因即针对某一同源的蛋白质序列进行的测序,并将测量的结果存入数据库中。

由于蛋白质数据库在医学研究、物种研究等方面发挥着非常重要的作用,利用蛋白质数据库中的信息,有助于人们发现新物种,寻找物种之间的生物关系,研究针对某些特殊病毒的抗生药物等。然而,如果在蛋白质数据库中存在大量的冗余序列,则可能导致对这些蛋白质数据分析的误差加大。比如在某一蛋白质序列簇中,如果冗余序列过多,可能会夸大这一序列簇的某些功能特征,从而对蛋白质序列间相互关系的研究产生误导[1]。

目前,针对蛋白质数据库冗余的问题,国内外有不少相关学者开展了研究,比较有代表性的有Hoblhm和Sander提出的CD-HIT去冗余算法,该算法的设计思想是在每个蛋白质序列簇中选取一个序列作为特征序列,然后再将该簇中的其余序列进行冗余检测,如果某条序列与该序列的匹配程度超过某一阈值,则该序列被视为冗余序列。……

登录APP查看全文

猜你喜欢
数据库特征模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
如何表达“特征”
不忠诚的四个特征
当代陕西(2019年10期)2019-06-03 10:12:04
数据库
财经(2017年2期)2017-03-10 14:35:35
3D打印中的模型分割与打包
数据库
财经(2016年15期)2016-06-03 07:38:02
数据库
财经(2016年3期)2016-03-07 07:44:46
数据库
财经(2016年6期)2016-02-24 07:41:51
线性代数的应用特征
河南科技(2014年23期)2014-02-27 14:19:15