《软件学报杂志》发表论文赏析
作者:赵强利,蒋艳凰,卢宇彤
单位:赵强利,湖南商学院 计算机与信息工程学院, 湖南 长沙 41020511,蒋艳凰,高性能计算国家重点实验室国防科学技术大学, 湖南 长沙 41007302,卢宇彤,高性能计算国家重点实验室国防科学技术大学, 湖南 长沙 41007303
摘要:集成式数据流挖掘是对存在概念漂移的数据流进行学习的重要方法.针对传统集成式数据流挖掘存在的缺陷,将人类的回忆和遗忘机制引入到数据流挖掘中,提出基于记忆的数据流挖掘模型MDSM(memorizing based data stream mining).该模型将基分类器看作是系统获得的知识,通过"回忆与遗忘"机制,不仅使历史上有用的基分类器因记忆强度高而保存在"记忆库"中,提高预测的稳定性,而且从"记忆库"中选取当前分类效果好的基分类器参与集成预测,以提高对概念变化的适应能力.基于MDSM模型,提出了一种集成式数据流挖掘算法MAE(memorizing based adaptive ensemble),该算法利用Ebbinghaus遗忘曲线对系统的遗忘机制进行设计,并利用选择性集成来模拟人类的"回忆"机制.与4种典型的数据流挖掘算法进行比较,结果表明:MAE算法分类精度高,对概念漂移的整体适应能力强,尤其对重复出现的概念漂移以及实际应用中存在的复杂概念漂移具有很好的适应能力.不仅能够快速适应新的概念变化,并且能够有效抵御随机的概念波动对系统性能的影响.
关键词:数据流挖掘;概念漂移;回忆与遗忘;Ebbinghaus遗忘曲线;选择性集成
基金资助:国家自然科学基金(61272141,60905032,61120106005,61273232)