《计算机集成制造系统杂志》发表论文赏析
作者:林雷蕾,杨良,闻立杰,周华,王建民
单位:1.清华大学软件学院2.浪潮通用软件有限公司3.西南林业大学大数据与智能工程学院
摘要:为提升模型发现的质量,可以利用日志划分将原始日志数据划分为多个子日志。现有日志划分的评价方法基本采用有标的方式来衡量划分的质量,而实际生活中很难获取到有标的日志数据。为此,提出划分熵作为无标日志划分的衡量标准。首先,定义轨迹变体用于刻画每个子日志的分布情况。其次,提出内部熵和外部熵来分别刻画子日志的内聚度和差异性。然后,利用惩罚因子对盲目迎合评价指标的划分方法进行惩罚。最后,将以上内容进行融合,形成划分熵的表达式。实验结果表明了所提方法的可行性。
关键词:过程挖掘,日志划分,信息熵,轨迹聚类
基金资助:国家重点研发计划资助项目(2017YFA0700605);国家自然科学基金资助项目(61472207,71690231);北京信息科学与技术国家研究中心资助项目。