《计算机应用杂志》发表论文赏析
作者:邓加原, 姬东鸿, 费超群, 任亚峰
单位:武汉大学 计算机学院, 武汉 430072
摘要:推特文本中包含着大量的非标准词,这些非标准词是由人们有意或无意而创造的。对很多自然语言处理的任务而言,预先对推特文本进行规范化处理是很有必要的。针对已有的规范化系统性能较差的问题,提出一种创新的无监督文本规范化系统。首先,使用构造的标准词典来判断当前的推特是否需要标准化。然后,对推特中的非标准词会根据其特征来考虑进行一对一还是一对多规范化;对于需要一对多的非标准词,通过前向和后向搜索算法,计算出所有可能的多词组合。其次,对于多词组合中的非规范化词,基于二部图随机游走和误拼检查,来产生合适的候选。最后,使用基于上下文的语言模型来得到最合适的标准词。所提算法在数据集上获得86.4%的F值,超过当前最好的基于图的随机游走算法10个百分点。
关键词:规范化,无监督学习,二部图,随机游走,拼写检查
基金资助:国家自然科学基金重点项目(61133012);国家哲学社会科学重大计划项目(11&ZD189);国家自然科学基金资助项目(61173062)。