《图书情报工作杂志》发表论文赏析
作者:吴树芳,张雄涛,朱杰
单位:1 河北大学管理学院 保定 071000;<br />\r\n2 北京科技大学东凌经济管理学院 北京 100083;<br />\r\n3 中央司法警官学院信息管理系 保定 071000
摘要:[目的/意义] 查询似然模型存在零概率问题,融合多源信息对模型进行扩展,不仅可以解决零概率问题,还可以实现对全局信息的差异化处理,降低噪声。[方法/过程] 通过LDA主题挖掘和历史微博兴趣挖掘,分别获取初始微博的主题相关信息和兴趣相关信息,并将二者与全局信息融合,用于改进初始微博的语言模型估计,从而得到扩展的微博查询似然模型。运用网络爬虫工具从新浪微博爬取数据,并通过实证研究验证扩展模型的有效性。[结果/结论] 实验结果表明:与已有的查询似然模型扩展方法相比,新模型具有较好的检索性能。
关键词:多源信息,微博检索,查询似然模型,主题信息,作者兴趣,
基金资助:本文系国家社会科学基金项目"网络信息治理视域下社交网络不可信用户识别研究"(项目编号:17BTQ068)研究成果之一。