《图书情报工作杂志》发表论文赏析
作者:郭诗琪,贠强,陈亮,周杰
单位:1. 中国医学科学院医学信息研究所 北京 100020;<br />\r\n2. 中国科学技术信息研究所 北京 100038
摘要:[目的/意义] 对比文件是用以判断专利能否授权或无效的重要文件,针对传统信息检索方法的不足且鲜有利用机器学习方法研究对比文件检索的问题,在引入对比文件信息的基础上,构建专利相关性判定模型。[方法/过程] 以专利无效判决书中的目标专利与对比文件为数据集进行实验,提取文本相似度、共现词汇和共词数量特征信息,利用GBDT模型将对比文件的检索问题转化为判断其是否相关的分类问题。[结果/结论] 研究结果表明,不同字段数据对分类效果的贡献不同,其中说明书字段的准确率、召回率和F1值分别为79%、48%和59%,并且多特征集成后的分类效果显著优于单一文本相似度的结果,最后对实验错分情况进行分析,指出本研究下一步的研究方向。
关键词:专利无效宣告,对比文件,特征选择,机器学习,
基金资助:本文系国家重点研发计划项目课题“知识产权信息智能采集及深加工技术研究与应用示范”(项目编号:2017YFB1401902)和中信所重点工作“重点科技领域前沿跟踪与深度研究”(项目编号:ZD2020-02)研究成果之一。