《计算机科学与探索杂志》发表论文赏析
作者:田家源,杨东华,王宏志
单位:1. 哈尔滨工业大学 计算机科学与技术学院,哈尔滨 1500012. 哈尔滨工业大学 基础与交叉科学研究院,哈尔滨 150001
摘要:医学信息提取的第一步在于命名实体识别,然而公开医学语料的缺乏使得这项工作困难重重。已有的研究大都建立在少量人工标注的文本之上,不具备很好的推广性。互联网作为大量数据的聚集地,可以从中进行医学知识的提取。针对互联网资源规模大,结构化程度低,缺乏标注等特点,提出了一种迭代式框架来对其加以利用。使用融合通用模型和领域词典的方法对文本进行标注,缓解了领域不同带来的精度降低问题。使用在线方法来构建模型,避免了迭代中对模型进行整体重构。在命名实体识别模型中融入了词法特征、词缀特征、词长特征等,提高了模型的识别能力。提出了一种启发式的模型压缩方法,增强模型的可用性。实验结果表明,所提出的策略是有效的。
关键词:命名实体识别,互联网资源,迭代框架,平均感知器