《计算机科学与探索杂志》发表论文赏析
作者:刘春梅,郭岩,俞晓明,赵岭,刘悦,程学旗
单位:1. 中国科学院 计算技术研究所,北京 1001902. 中国科学院大学,北京 100190
摘要:互联网上大量论坛使用开源软件生成,针对这类论坛,提出了针对论坛网页信息抽取的基于模板的信息抽取方法。首先给出了基于网页结构相似度的簇划分策略,并通过实验证明了该策略优于直接基于软件版本号等直观类别的划分策略;其次提出了基于开源软件特征的聚类算法,能够根据网页相似度将大规模开源软件生成的论坛网页进行有效的自动划分,形成可标注类别。实验表明,该方法不仅保持了基于模板的抽取方法所具有的高准确率的优点,同时弥补了其模板配置与维护代价高的缺点。
关键词:记录定位,网页聚类,模板抽取