《计算机科学与探索杂志》发表论文赏析
作者:刘正涛,王建东
单位:1. 三江学院 计算机科学与工程学院,南京 2100122. 南京航空航天大学 计算机科学与技术学院,南京 210016
摘要:如何从数量众多的Web数据源集合中选择数量合适的数据源,使得在满足特定查询需求的前提下尽可能地减少访问数据源的数量,是Web大数据系统集成中的关键问题之一。提出了一个两阶段数据源选择方案:第一阶段通过各个数据源模式与中间模式的相似度选择与查询相关度高的数据源,通过计算依赖数据源的质量来选取质量较好的数据源;第二阶段基于最大熵理论计算数据源之间的重复率,设计实现了一个查询最小代价模型动态选择数据源算法。最后在实验平台上对算法进行了评估,实验表明该算法具有较高的效率与扩展性。
关键词:Web大数据,数据源选择,数据源质量,数据源依赖