《计算机技术与发展杂志》发表论文赏析
作者:梁潇;';吴昊;刘全中;'*
单位:1. 西北农林科技大学 信息工程学院,陕西 杨凌 712100;2. 陕西省农业信息感知与智能服务重点实验室,陕西 杨凌 712100
摘要:多肽,也可简称为肽,是 α-氨基酸通过肽键连接在一起而形成的一类化合物,也是蛋白质水解的产物。 它对人体的生长、发育、代谢有着重要的影响,部分多肽具有抗癌、抗菌、抗病毒、穿透细胞等特性,对于相应疾病的治疗具有重大意义。 因此研究识别具有治疗特性的多肽方法至关重要,然而传统生物实验方法鉴定多肽耗时且昂贵,不适合处理高通量的序列数据。 现有的基于机器学习的预测模型虽然大大提高了多肽的识别效率,但存在识别性能不足,泛化能力不够,以及一种模型只能有效识别特定的一种多肽等问题。 针对以上问题,该文提出了一种通用深度学习模型 DeepPEPred,该模型能有效预测多种不同的肽。 在抗癌肽、抗菌肽、细胞穿透肽和结合肽四种不同肽数据集上进行十折交叉验证和独立测试,实验结果表明:与目前最新的方法 PEPred-Suit 相比,DeepPEPred 在抗癌肽数据集上准确度提升了 29. 6% ,MCC 提升了 59. 7% ;在抗菌肽、细胞穿透肽和结合肽三种数据集上准确度均提升了 1. 2% ,MCC 分别提升了 2. 3% 、2. 5% 和 2. 4% ,AUC 分别提升了 0. 8% 、0. 3% 和 1. 2% 。
关键词:多肽;深度学习;预测模型;识别方法;特征提取