《计算机科学与探索杂志》发表论文赏析

基于Spark的序列数据质量评价

来源:计算机科学与探索杂志2017年第6期北京时间:

作者:韩超,段磊,邓松,王慧锋,唐常杰

单位:1. 四川大学 计算机学院,成都 6100652. 四川大学 华西公共卫生学院,成都 6100413. 南京邮电大学 先进技术研究院,南京 210003

摘要:随着序列数据在实际中的广泛应用,序列数据质量评价成为学术、工业等众多领域的热门研究问题。目前主流的序列数据质量评价方法是基于概率后缀树模型进行数据质量评价,然而这种方法难以实现对大规模数据的处理。为解决此问题,提出了基于Spark的序列数据质量评价算法STALK(sequential data quality evaluation with Spark),并且采用了改进的剪枝策略来提高算法效率。具体地,在Spark平台下,利用大规模序列数据高效建立生成模型,并根据生成模型对查询序列的数据质量进行快速评价。最后通过真实序列数据集验证了STALK算法的有效性、执行效率和可扩展性。

关键词:数据质量,概率后缀树,Spark,并行计算

获取完整文献 了解学术指导

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!