《图书情报工作杂志》发表论文赏析
作者:崔鸿飞
单位:北京科技大学经济管理学院 北京 100083
摘要:[目的/意义] 科研实体的精准标注是构建高质量学术社交网络的基础。当前主流开放知识图谱(如AMiner OAG)虽具较高实体覆盖率,但存在作者与机构过度合并的问题,影响分析精度。提升科研实体标注的细粒度与准确性,有助于为学者合作模式分析、学科演化路径追踪以及科研趋势识别等应用提供更可靠的数据支撑,具有重要的理论与实践意义。[方法/过程] 提出融合大语言模型语义嵌入与学术社交关系分析的实体拆分框架。该框架包括语义嵌入、机构拆分和作者拆分三个模块:语义嵌入模块基于嵌入式大模型,对百万级机构署名变种和千万级科研关键词进行语义向量化表示;机构拆分模块基于语义相似性聚类机构署名,生成细化的机构二级标注实体;作者拆分模块引入多维学术社交关系(包括同机构、同名合作者及关键词领域重叠等),构建署名网络、识别作者实体。本文将上述方法应用于DBLP-Citation-network数据集,将10 794个内部异质性过高的OAG机构实体细化为56 527个院系、研究所等二级注释实体,同时将2 794 014个OAG作者合理拆分为3 706 896个作者实体。[结果/结论] 本文提出的研究方法可以在提升注释精细度的同时,保持良好的实体间异质性。该方法在更换嵌入模型时具备较强的鲁棒性,便于研究者根据具体需求灵活选取模型。研究结果验证了嵌入式大语言模型在科研实体消歧任务中的应用潜力,并为后续的学术社交网络分析与推荐系统构建研究提供了更高质量的数据基础。
关键词:学术社交网络,大模型,语义嵌入,科研实体,消歧,
基金资助:本文系国家自然科学基金项目“基于深度特征融合推荐模型的互联网用户电影文化偏好量化研究方法”(项目编号:72101029)的研究成果之一。