《计算机科学与探索杂志》发表论文赏析

基于LCA分块算法的大学科研人员信息抽取

来源:计算机科学与探索杂志2016年第6期北京时间:

作者:易晨辉,刘梦赤,胡婕

单位:1. 武汉大学 计算机学院,武汉 4300722. 湖北大学 计算机与信息工程学院,武汉 430062

摘要:现有的半结构化网页信息抽取方法主要假设有效数据间具有较强结构相似性,将网页分割为具有类似特征的数据记录与数据区域然后进行抽取。但是存有大学科研人员信息的网页大多是人工编写填入内容,结构特征并不严谨。针对这类网页的弱结构性,提出了一种基于最近公共祖先(lowest common ancestor,LCA)分块算法的人员信息抽取方法,将LCA和语义相关度强弱的联系引入网页分块中,并提出了基本语义块与有效语义块的概念。在将网页转换成文档对象模型(document object model,DOM)树并进行预处理后,首先通过向上寻找LCA节点的方法将页面划分为基本语义块,接着结合人员信息的特征将基本语义块合并为存有完整人员信息的有效语义块,最后根据有效语义块的对齐获取当前页面所有关系映射的人员信息。实验结果表明,该方法在大量真实的大学人员网页的分块与抽取中,与MDR(mining data records)算法相比仍能保持较高的准确率与召回率。

关键词:信息抽取,最近公共祖先(LCA),基本语义块,有效语义块,关系映射

获取完整文献 了解学术指导

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!