《计算机工程与应用杂志》发表论文赏析
作者:彭晏飞, 郭家隆, 黄瑾, 郑宏威, 王庚哲
单位:1.辽宁工程技术大学 电子与信息工程学院,辽宁 葫芦岛 125105;2.北京微芯区块链与边缘计算研究院,北京 100086
摘要:针对当前挖矿币种识别数据集匮乏以及币种识别方法单一问题,基于挖矿网络流量构建了一套挖矿币种识别数据集MCID,包含5种虚拟货币挖矿币种的14 348条样本。同时将币种识别定义为文本分类任务,结合文本特征向量与机器学习方法进行币种分类的基线模型实验。在此基础上,以决策树为基学习器,构建多层次Bagging分类模型。实验结果显示,结合文本特征向量与机器学习的基线模型在MCID上取得了显著效果,尤其是N-Gram+多层感知器模型,准确率和F1值分别达到97.14%和96.95%。多层次Bagging分类模型的表现优于所有基线模型,其准确率和F1值分别达到了97.49%和97.32%。不仅填补了币种识别数据集的研究空白,还提供了币种分类的基线模型,并在其基础上构建了多层次Bagging分类模型,为虚拟货币挖矿币种识别方法的选择提供了指导。此外,该研究的结论也可为未来虚拟货币挖矿场景模拟、金融安全和节能减排等业务的结合提供参考依据。MCID已在GitHub上公开发布,详细地址如下:https://github.com/jialongguo/MCID。
关键词:虚拟货币,挖矿,网络流量,币种识别,机器学习