《图书情报工作杂志》发表论文赏析
作者:邢思思,钱力
单位:1 中国社会科学院图书馆 北京 100732;2 中国科学院文献情报中心 北京 100190;3 中国科学院大学经济与管理学院信息资源管理系 北京 100190
摘要:[目的/意义] 针对专利知识抽取粒度较粗、数据依赖性强、准确率不高等问题,研究面向TRIZ的专利技术知识抽取方法,以提升领域专利知识抽取的深度和准确性。[方法/过程] 在语义TRIZ指导下,面向特定领域延伸细化通用的专利技术要素,基于“预训练—继续预训练—微调”技术路径,构建面向特定领域的BERT-CRF实体识别模型和BERT-softmax关系抽取模型,以薄膜磁头技术领域为例开展实证研究。[结果/结论] 经实证验证,构建的面向薄膜磁头技术领域专利的BERT-MH+CRF实体识别模型F1分数为84.93%,BERT-MH+softmax关系抽取模型F1分数为63.7%。所提出的方法可以有效提升专利知识抽取的效率和效果,为专利语义分析、技术功效矩阵智能构建、领域知识图谱构建等专利技术挖掘场景提供丰富的知识支持。
关键词:语义TRIZ,专利文献,预训练技术,实体识别,关系抽取,
基金资助:本文系国家社会科学基金一般项目“AI4S科技文献知识底座的理论体系及建设方法研究”(项目编号:24BTQ043)研究成果之一。