《计算机科学与探索杂志》发表论文赏析
作者:孔金英,李晓,王磊,杨雅婷,罗延根
单位:1. 中国科学院 新疆理化技术研究所,乌鲁木齐 8300112. 新疆民族语音语言信息处理重点实验室,乌鲁木齐 8300113. 中国科学院大学,北京 100049
摘要:机器翻译系统中调序规则表和翻译表一般规模都很大,对翻译表进行优化过滤一直都是研究热点,而过滤调序规则表的研究却近乎空白。将调序规则表的过滤当成短文本分类问题,提出了一种基于自动编码机(Autoencoder)的调序规则表过滤模型。该模型首先使用一种基于自动编码机的分类器对调序规则进行打分评价,然后对调序规则表进行基于最小差异策略的过滤,最后使用过滤得到的调序规则表重新计算调序规则得分表用于机器翻译的解码过程。实验表明,在公开的英汉语料和维汉语料上使用该模型,可以在调序规则表减少40%的基础上分别将BLEU(bilingual evaluation understudy)值提高0.19和0.26。
关键词:自动编码机,过滤模型,调序规则表,机器翻译