《计算机技术与发展杂志》发表论文赏析
作者:海洋;徐魁;李晓辉;曾涛;陶军
单位:1. 宝鸡市公安局通信处,陕西 宝鸡 721014;2. 宝鸡创天清航科技发展有限责任公司,陕西 宝鸡 721000;3. 东南大学 网络空间安全学院,江苏 南京 210096
摘要:对工控协议的识别,是对工控协议开展研究的第一步。 而在通信过程中频繁出现的字符串,是对工控协议识别中的重要特征。 针对工控协议识别中特征字符串的提取问题,提出了一种自顶向下的频繁字符串挖掘算法,可以直接得到没有冗余的频繁字符串集。 同时,对于自顶向下方法中原始数据过于庞大、算法迭代次数较多等问题,借鉴了 N-gram 模型,提出了一种数据划分策略,解决了自顶向下处理时数据过大的问题。 此外,在挖掘频繁字符串的过程中,采取了删除重叠项与字符串分裂相结合的方法。 实验结果表明,该算法针对多种协议均能识别出其中的特征字符串;同时,利用识别出的字符串作为特征,在协议识别工作中也能取得良好的效果。 可以得出结论,该算法能够较好地提取出工控协议中的特征字符串。
关键词:频繁字符串;自顶向下;数据划分;特征提取;数据处理