《计算机应用杂志》发表论文赏析
作者:杨鹏坤, 彭慧, 周晓锋, 孙玉庆
单位:1. 中国科学院 物联网研究发展中心, 江苏 无锡 214135;2. 江苏物联网研究发展中心, 江苏 无锡 214135;3. 无锡中科泛在信息技术研发中心有限公司, 江苏 无锡 214135;4. 国网枣庄供电公司, 山东 枣庄 277100
摘要:针对最大频繁项目集挖掘算法(DMFIA)当候选项目集维数高而最大频繁项目集维数较低的情况下要产生大量的候选项目集的缺点,提出了一种改进的基于频繁模式树(FP-tree)结构的最大频繁项目集挖掘算法——FP-MFIA。该算法根据FP-tree的项目头表,采用自底向上的搜索策略逐层挖掘最大频繁项目集,从而加速每次对候选集计数的操作。在挖掘时根据每层的条件模式基产生维数较低的非频繁项目集,尽早对候选项目集进行剪枝和降维,可大量减少候选项目集的数量。同时在挖掘时充分利用最大频繁项集的性质,减少搜索空间。通过算法在不同支持度下挖掘时间的对比可知,算法FP-MFIA在最小支持度较低的情况下时间效率是DMFIA以及基于降维的最大频繁模式挖掘算法(BDRFI)的2倍以上,说明FP-MFIA在候选集维数较高的时候优势明显。
关键词:最大频繁项集,频繁模式树,数据挖掘,关联规则,非频繁项集
基金资助:国家科技支撑计划项目(2012BAF12B08)