《软件学报杂志》发表论文赏析

一种神经范畴标注模型

来源:软件学报杂志2016年第11期北京时间:

作者:吴惠甲,张家俊,宗成庆

单位:吴惠甲,模式识别国家重点实验室(中国科学院 自动化研究所), 北京 100190;中国科学院大学, 北京 10019011,张家俊,模式识别国家重点实验室(中国科学院 自动化研究所), 北京 100190;中国科学院大学, 北京 10019002,宗成庆,模式识别国家重点实验室(中国科学院 自动化研究所), 北京 100190;中国科学院 脑科学与智能技术卓越创新中心, 北京 100190;中国科学院大学, 北京 10019003

摘要:范畴标注是组合范畴语法解析中的子任务之一,可用于提高解析器的效率和性能.传统的最大熵模型需要手工定义特征模板,神经网络则通过隐含层学习到离散特征的分布式表示,从而自动提取分类需要的特征.引入该模型来解决该问题,在原有神经语言模型的基础上加入了向量化的词性表示层和范畴表示层,并通过反向传播自动更新词向量、词性向量和范畴向量,学习到它们的分布式表示.此外,在预测时采用束搜索的序列解码方式来引入标签之间的依赖信息.实验结果表明,这两种改进都能提升模型的性能,使其在范畴标注任务上比传统的最大熵模型效果要好(提升1%).

关键词:范畴标注;分布式表示;神经语言模型;束搜索

基金资助:国家自然科学基金(61333018);中国科学院战略性先导科技专项(XDB02070007)

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!