李 子 夏
(天津大学应用数学中心,天津 300072)
固有无序蛋白区域(intrinsically disordered proteins regions,IDRs)在生物体中占有重要地位.具有IDRs的蛋白质能影响分子组装识别、信号传导、重排、转录和翻译等细胞功能[1],并参与小分子的结合、转运和催化[2].Habchi等[3]证实约30%~50%的真核蛋白具有一个或多个长的IDRs.固有无序蛋白结合域是IDRs的功能区域,在细胞的信号传递和调节过程中起着重要作用,是无序蛋白质研究的热点.固有无序蛋白结合域按照区域的长短分为短线性基序(short linear motifs,SLiMs)和分子识别特征(molecular recognitionfeatures,MoRFs),其中SLiMs和MoRFs的残基数分别是≤5和5~25个.Yan等[4]分析了868个完整蛋白质组,结果显示真核生物有21%的IDRs具有MoRFs,细菌和古细菌有29%的IDRs具有MoRFs.
由于SLiMs和MoRFs长度上的差异,所以预测这2类功能域的方法不同.目前SLiMs的预测是基于在一组不同序列中寻找正则表达式的原理来开发算法.MoRFs相比于其他无序区域和结构化区域有其独特的序列特征,因此,MoRFs的预测可以基于序列进行精确的计算预测.另外,MoRFs的长度越长,序列特征越明显,如:与其他IDRs相比,MoRFs区域富含大的疏水侧链的氨基酸,特别是芳香族氨基酸含量较高;与SLiMs的预测算法相比,MoRFs的预测算法更多,准确率也更高.这些预测算法的出现,推动了MoRFs计算识别算法的发展[4],推定MoRFs不仅有助于阐明蛋白质功能,还可用于多种病毒蛋白质组、细胞死亡途径、通道蛋白的相互作用组、激酶、核小体和核糖体的分析研究[5-10].
近年来,研究人员相继提出一批基于不同原理及方法的MoRFs预测算法[11-12].Dosztanyi等[11]基于多肽链中残基的3种性质,结合残基必须处于一个长的无序区域、残基不能与其领域折叠以及残基能够与球状结合域相互作用,开发了ANCHOR;……