《图书情报工作杂志》发表论文赏析
作者:俞琰,陈磊,姜金德,赵乃瑄
单位:1. 南京工业大学信息服务部 南京 210009;<br />\r\n2. 东南大学成贤学院计算机工程系 南京 211816;<br />\r\n3. 南京晓庄学院商学院 南京 211171
摘要:[目的/意义]针对中文专利候选术语选取方法存在需要对不同的数据集分别制定不同的模式匹配规则、专利术语抽取准确性不高等问题,本文提出基于依存句法分析的中文专利术语选取方法,以提高中文专利术语抽取准确性。[方法/过程]主要包括依存句法分析、剪枝、生成依存子树等三个主要步骤。首先对中文专利进行依存句法分析,得到依存树,对依存树进行剪枝,去除不符合要求的依存关系,生成依存子树,从中选取连续词串作为候选术语,以抽取中文专利术语。[结果/结论]实验结果表明,与已有的中文专利候选术语选取方法相比,本文提出的基于依存句法分析的中文候选术语选取方法能够有效地提高中文专利术语抽取的准确性。
关键词:术语抽取,依存句法分析,中文候选术语选取,
基金资助:本文系教育部人文社会科学规划项目 "大数据时代技能知识图谱构建研究"(项目编号:16YJAZH073)和国家社会科学基金一般规划项目"大数据时代支持创新设计的多维度多层次专利文本挖掘研究"(项目编号:17BTQ059)研究成果之一。