《南京信息工程大学学报·自然科学版杂志》发表论文赏析
作者:章凌,赵波,黄林荃
单位:章凌,武汉大学 空天信息安全与可信计算教育部重点实验室/国家网络安全学院, 武汉, 43007,赵波,武汉大学 空天信息安全与可信计算教育部重点实验室/国家网络安全学院, 武汉, 43007,黄林荃,武汉软件工程职业学院(武汉开放大学) 信息学院, 武汉, 430205
摘要:深度神经网络(DNNs)对经过特殊设计的对抗样本存在脆弱性,容易受到欺骗.目前的检测技术虽能识别一些恶意输入,但在对抗复杂攻击手段时,其保护能力仍显不足.本文基于无标记数据提出一种新型无监督对抗样本检测方法,其核心思想是通过特征的构建与融合,将对抗样本检测问题转化为异常检测问题,为此设计了图像变换、神经网络分类器、热力图绘制、距离计算以及异常检测器5个核心部分.先对原始图像进行变换处理,将变换前后的图像分别输入神经网络分类器,提取预测概率数组与卷积层特征绘制热力图,并将检测器从单纯关注模型输出层拓展到输入层特征,增强检测器对对抗样本和正常样本差异的建模和度量能力,进而计算变换前后图像的概率数组KL距离与热力图关注点变化距离,将距离特征输入异常检测器判断是否为对抗样本.在大尺寸高质量图像数据集ImageNet上进行实验,本检测器面向5种不同类型攻击取得的平均AUC值为0.77,展现出良好的检测性能.与其他前沿的无监督对抗样本检测器相比,本检测器在保持相近的误报率的情况下TPR大幅领先,检测能力具有明显优势.
关键词:对抗样本检测;无监督学习;对抗攻击;深度神经网络;图像变换