《计算机技术与发展杂志》发表论文赏析

基于CNN的程序编译错误信息特征提取

来源:计算机技术与发展杂志2021年第05期北京时间:

作者:何烨辛;谷 林;孙 晨

单位:1.西安工程大学计算机科学学院,陕西 西安710048;2.西安科技大学管理学院,陕西 西安710054

摘要:伴随着互联网行业的迅速发展,在自然语言处理领域中,有效地将输入表示为固定长度的特征向量是机器学习算法中的一个重要研究方向。海量的编译错误信息不仅可以用于程序错误相似度的研究,也可将编译错误信息进行聚类、分类之后给教师在计算机编程类课程的教育教学中给予针对性的指导。这些应用的根本在于高效地提取编译错误信息特征。该文提出了一种基于word2vec模型结合卷积神经网络(convolutionalneuralnetworks,CNN)对编译错误信息进行特征提取的方法,首先利用word2vec工具中的skip-gram模型以词向量的形式表示编译错误信息,然后利用CNN神经网络完整地表征编译错误信息特征向量。有效地从可变长度的编译错误信息中学习固定长度的特征表示。最后使用支持向量机(SVM)分类算法进行实验结果的验证。结果表明,该特征提取方法在编译错误信息中有显著的效果。

关键词:word2vec;编译错误信息;skip-gram模型;CNN;支持向量机

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!