《计算机应用研究杂志》发表论文赏析
作者:田明杰,崔荣一,
单位:延边大学计算机科学与技术学科智能信息处理研究室,吉林延吉133002;
摘要:针对日渐丰富的跨语言的文字信息资源与新闻报道及科技文献中的多标签数据,为了挖掘跨语言间的相关性及数据属性间的关联性,提出了带标签双语主题模型,应用于跨语言文本分类与标签的推荐。首先,假设科技文献中的关键词与摘要部分有着内容上的相关性,对关键词进行提取,并进行标签化,进而把标签对应于主题模型中的主题,实例化“潜在”的主题;其次,利用带标签双语主题模型对摘要部分进行了训练迭代;最后,对新加入的文档进行跨语言文本分类及标签的推荐。实验结果表明,跨语言文本分类任务中micro-F1达到94.81%,推荐的标签也能较好地体现出语义上的相关性。
关键词:主题模型,标签,跨语言文本分类,标签推荐,潜在主题,
基金资助:国家语委“十二五”科研规划项目(YB125-178);延边大学外国语言文学世界一流学科建设科研项目(18YLPY13);;