融合数据映射和知识蒸馏的恶意软件轻量化检测方法

罗养霞 ,  吴燕玲

武汉大学学报(理学版) ›› 2026, Vol. 72 ›› Issue (3) : 317 -328.

PDF (3747KB)
武汉大学学报(理学版) ›› 2026, Vol. 72 ›› Issue (3) : 317 -328. DOI: 10.14188/j.1671-8836.2025.0015
智能安全与可信计算

融合数据映射和知识蒸馏的恶意软件轻量化检测方法

作者信息 +

A Lightweight Malware Detection Method Integrating Data Mapping and Knowledge Distillation

Author information +
文章历史 +
PDF (3836K)

摘要

与日俱增的恶意软件变种为网络安全带来严重威胁,准确且快速地识别恶意软件变种是安全防御的关键环节。现有研究利用端到端的深度学习模型优势进行检测,但复杂度较高,在性能及计算资源方面受限,给实际部署带来困难。本文构建了基于颜色编码与数据映射的GMA(byte stream GLCM, assembly instruction Markov, API)图像数据集,最大化保留特征信息量的同时,实现数据规模轻量化;提出了基于解耦知识蒸馏的恶意软件轻量化检测模型MTFKD(Malware Texture Feature Classification based on Knowledge Distillation),应用知识蒸馏策略实现模型轻量化,结合高效多尺度注意力机制与空洞空间金字塔池强化特征表达,并使用改进的随机森林算法提升分类效率。实验表明,本文模型在检测准确率达到99.49%的情况下,复杂度明显降低,大大增强模型的实际应用性与泛化能力。

Abstract

The rapid proliferation of malware variants poses a serious threat to network security, and accurately and quickly identifying these variants is a key aspect of security defense. Existing research leverages the advantages of end-to-end deep learning models for detection; however, the models are computationally expensive and have limitations in performance, making practical deployment challenging. Therefore, a GMA (byte stream GLCM, assembly instruction Markov, API) image dataset based on color coding and data mapping is built, which maximizes feature information retention while ensuring lightweight data scaling. A lightweight malware detection model, MTFKD (Malware Texture Feature Classification based on Knowledge Distillation), is proposed, which applies a knowledge distillation strategy to reduce model complexity, integrates an efficient multi-scale attention mechanism with the atrous spatial pyramid pooling to enhance feature expression, and employs an improved Random Forest algorithm to enhance classification efficiency. Experiments demonstrate that the proposed model achieves 99.49% detection accuracy with significantly reduced complexity, greatly enhancing the model’s practical applicability and generalization.

Graphical abstract

关键词

恶意软件检测 / 模型轻量化 / 解耦知识蒸馏 / 数据映射 / 随机森林

Key words

malware detection / model lightweighting / decoupled knowledge distillation / data mapping / random forest

引用本文

引用格式 ▾
罗养霞,吴燕玲. 融合数据映射和知识蒸馏的恶意软件轻量化检测方法[J]. 武汉大学学报(理学版), 2026, 72(3): 317-328 DOI:10.14188/j.1671-8836.2025.0015

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

互联网作为不同节点之间信息共享的主要来源,常被网络犯罪者视为主要攻击目标;而蠕虫、病毒与特洛伊木马等恶意软件的指数级增长,已成为互联网安全的重要威胁之一。根据Kaspersky实验室最新统计数据报告,2024年该机构每日检测到全球新增恶意软件近50万个[1]。依据Gartner的预测,2025年全球信息安全支出将超过1.5万亿元,较2024年增长15.1%[2]。因而,有效检测恶意软件具有重要现实意义。

随着网络技术的发展,传统的恶意软件检测方法已被广泛应用。然而,恶意软件也在持续演化以逃避检测。恶意软件编辑者常通过加密、混淆、操作码重排等多种途径不断修改原有恶意软件,生成大量变种,使传统的基于签名或特征的检测方法难以识别。近年来,深度学习因具有从数据中学习并适应新模式的能力,在恶意软件检测领域备受关注。通过将恶意软件转换为图像形式,可以省略复杂的特征工程步骤,简化算法检测流程[3-5]。而恶意软件检测本质上是对恶意软件及其变种类型的识别与分类。基于此,越来越多的学者考虑将恶意软件检测问题进一步转换为结合深度学习的图像分类问题。例如,Cui等[6]将恶意代码转换为灰度图,基于卷积神经网络(Convolutional Neural Network, CNN)对图像实现特征的自动提取与分类。Xing等[7]运用自编码器对以灰度图像形式表示的恶意软件进行分类,在Android数据集上证明了算法的有效性,但仅提取了全局信息,忽略了局部特征信息与语义信息,对恶意软件变种的适应性较低;Dhanya等[8]依据Dalvik可执行文件的字节码生成马尔可夫图像,结合CNN框架检测物联网Android恶意软件,其关于恶意软件与良性软件的区分准确度达到99.41%,但未考虑恶意代码上下文间的关联性;王金伟等[9]结合N-gram和TFI-DF技术提取二进制文件灰度图特征,构建了DenseNet88_CBAM恶意软件分类网络;Vasan等[10]通过色彩映射技术,将恶意软件二进制文件生成的灰度图转换为彩色图像,并微调CNN架构分类恶意软件;轩勃娜等[11]使用多特征组合生成RGB图像,对CNN结构进行改进,实现恶意软件分类,但模型规模较大。

综上所述,现有研究存在以下特点:1) 大多使用单一特征将恶意软件转换为灰度图等形式,或是对多个特征图像简单组合,忽略了恶意代码间的特征依赖关系,难以有效检测恶意软件变种;2) 端到端的深度学习模型复杂度较高,对计算资源与数据集的需求大,性能开销大,难以在资源有限的环境下部署。

鉴于此,本文提出了一种融合数据映射与知识蒸馏的恶意软件轻量化检测方法。主要贡献在于:

1) 提取恶意软件三类特征纹理,即二进制字节流灰度共生矩阵(byte stream Gray Level Co-occurrence Matrix, 简称byte stream GLCM)图像、汇编指令Markov(assembly instruction Markov)图像和API(Application Programming Interface)调用序列图像,基于RGB颜色编码技术重构三通道,生成数据映射后的恶意软件可视化特征集GMA(byte stream GLCM, assembly instruction Markov, API)。

2) 设计一种轻量化的恶意软件分类框架MTFKD(Malware Texture Feature Classification based on Knowledge Distillation),引入解耦知识蒸馏技术,使模型学习的知识由复杂教师网络向轻量型学生网络迁移,以实现模型规模的精简与压缩。

3) 结合高效多尺度注意力机制与空洞空间金字塔池强化特征表达,避免特征信息损失或冗余;基于改进的随机森林进行最终分类,进一步降低计算资源消耗,提升检测速度。

1  可视化特征集生成与映射

在常用特征中,API调用序列特征能够反映恶意代码上下文间存在的关系;汇编操作码与操作数特征可以保留恶意软件汇编指令中的语义信息;二进制字节流序列特征虽然忽略了特定恶意代码间的语义信息,但能够保留原始恶意文件的二进制信息及全局信息。来自同一家族的不同恶意软件在转换成图像时存在相似的纹理分布,为了尽可能地保留特征信息,并最大限度缩小数据集规模,本章给出了上述三类特征的可视化图像生成方法,并利用RGB颜色编码技术及数据映射方法重组三类特征,用于后续检测网络的输入。

1.1 API调用序列特征的可视化

API调用序列特征作为一种调用程序的上下文表示,是恶意软件行为属性的重要体现,被认为是最具代表性的特征之一[12]。本文API调用序列特征的可视化流程如图1所示。

首先,为了提取恶意软件的上下文语义相关性,基于相似性聚类方法将功能相似的API归为同类,并将其分组到有限数量的动态链接库中。通过将多个相关的API映射到特定的动态链接库,可以避免单独处理每个API的调用,从而简化恶意行为特征的识别和分类。根据提供的.asm反汇编文件,结合各样本文件中动态库的内部顺序与外部调用关系,提取整个数据集样本的API调用序列特征。利用词嵌入技术将API调用序列特征转换为向量,并计算各向量间的余弦相似度以生成相似度矩阵,采用K均值聚类算法实现API的分组聚类。

其次,由于UTF-8、One-Hot等编码方式会引入更高的复杂性和计算开销,对分组后的单个API聚类名称按字母顺序进行ASCII值编码,并转换为十进制数值,编码示例如表1。该方法可以将每个API函数视为一个整体,且不改变API名称所代表的功能。此外,由于API名称仅由字母、数字和少量符号组成,其ASCII值范围较小(32~126),因此编码后的数值范围在[0,255]之间,可直接映射到灰度图像的像素矩阵,从而生成API图像。

1.2 汇编指令Markov特征的可视化

汇编操作码和操作数特征能够反映程序的行为意图,同一家族的恶意软件有着相似的汇编指令序列。为了避免因丢弃字节或操作码而遗漏有用信息,并减少生成图像的稀疏性,本文基于汇编指令序列生成汇编操作码和操作数的Markov图像,可视化流程如图2所示。

首先,从汇编文件中提取恶意软件样本的操作码与操作数特征。然后,根据寄存器的类型标记操作数,并对相同功能的操作码进行合并归类,例如,将Mov、Movq和Movd归为同一操作码。经过统计、筛选,将汇编指令缩减至255个,剩余部分占比极小(约0.04%),被统一归为第256个。按出现概率从高到低依次进行编码,编码范围固定在0~255。

假设下一状态ti+1只与当前状态ti有关,则恶意软件的汇编指令序列T=t0,,t255可视为一个Markov链,有P(ti+1t0,,ti)=P(ti+1ti)。在汇编文件中,某个汇编指令m出现后,紧接着出现另一汇编指令n的概率为转移概率。即当给定汇编指令m时,程序以条件概率P(nm)转移到后一汇编指令n,转移概率Pm,n可由(1)式计算:

Pm,n=P(nm)=f(m,n)n=0255f(m,n)

其中,f(m,n)指由汇编指令m移动到汇编指令n的频率。

最后,按次序计算各汇编指令对的转移概率,得到一步转移概率矩阵,据此填充像素矩阵。生成的转移概率矩阵M如(2)式所示:

M=P0,0P0,1P0,255P1,0P1,1P1,255P255,0P255,1P255,255

其中,Pm,n表示由汇编指令m转移到汇编指令n的转移概率。

转移概率矩阵M具有256类汇编指令,则转移概率为2562个,将其作为生成单通道图像的二维像素张量,大小为256×256,尺寸均匀。

1.3 二进制字节流GLCM特征的可视化

GLCM是一种利用灰度描述空间纹理特征的统计分析工具,能够从方向、相邻间隔、变化幅度等方面反映灰度的综合信息[13]。本文直接将GLCM以及其包含的纹理和空间信息作为灰度共生矩阵图像使用。为避免丢失基本特征信息,通过三个步骤将PE文件的原始二进制字节流转换为GLCM图像:1) 生成灰度图像;2) 进行直方图均衡化和灰度图像离散化处理;3) 计算子矩阵。具体流程如图3所示。

1) 灰度图像生成

首先将原始二进制字节流序列切分为长度为8位的子字符串b7,b6,b5,b4,b3,b2,b1,b0,使每个子字符串被转换为[0,255]内的无符号十进制整数,保存为单通道图像中的一个像素值pbin。转换公式为:

pbin=b7×27+b6×26+b5×25+b4×24+
b3×23+b2×22+b1×21+b0×20

由此构建一维特征向量,按序填充至二维像素矩阵,以生成所需灰度图像。来自不同恶意软件族群的文件有所差异,生成图像的大小也不尽相同,其高度取决于PE文件的内容,宽度则由PE文件的大小决定。

2) 直方图均衡化与灰度图像离散化

为增强图像对比度,对转换后的灰度图像进行直方图均衡化操作。为了加快GLCM的生成过程,将灰度图像离散化,灰度级别从256降至128,减少计算成本。

3) 子矩阵计算

根据离散化后的128级灰度图像计算GLCM。图像中的纹理可能沿不同方向排列,形式上,对于各距离和角度值,每个矩阵都包含一个大小为128×128的子矩阵,其中包含了不同方向上的纹理和空间信息。0°、45°、90°和135°可分别计算水平、右上对角线、垂直和左上对角线方向上的灰度共生关系。因此,为了全面地描述图像整体纹理模式,取距离值为1,将GLCM重塑为4个不同角度值(0°、45°、90°与135°)的128×128子矩阵并堆叠,形成一幅像素为256×256的最终图像,即GLCM图像。

1.4 颜色编码与数据映射

采用RGB色彩空间对三类纹理特征进行颜色编码。由于API图像、Markov图像和GLCM图像的像素尺寸已统一为256×256,因此无需进行额外的对齐操作。分别将三组灰度图像数据映射至R、G、B三个通道,生成GMA图像数据集。

相较于单通道图像,GMA的三个通道分别包含不同的纹理特征,能为分类网络提供更丰富的视角和纹理信息。此外,GMA在显著提升有效信息量的同时,还实现了数据规模的轻量化,其规模比直接应用单通道图像的组合缩减了2/3。图4展示了由颜色编码与数据映射生成RGB图像的具体示例。

2  MTFKD模型框架

MTFKD模型框架如图5所示,包括恶意软件深度特征抽取及恶意软件分类两个模块。恶意软件深度特征抽取模块基于解耦知识蒸馏技术,在大规模深度学习模型与轻量型模型间实现知识迁移,提取恶意软件GMA图像的深度特征,在保证特征提取效率的同时缩小模型规模;恶意软件分类模块利用随机森林的并行计算特性,提升模型对变种的分类效率和响应速度。下面将分别介绍各模块的具体构成。

2.1 恶意软件深度特征抽取模块

为了压缩模型规模,提升对恶意软件变种的检测效率,并解除CNN对图像尺寸的限制,恶意软件深度特征抽取模块由基于解耦知识蒸馏[14](Decoupled Knowledge Distillation, DKD)的深度特征抽取网络构建,并结合了高效多尺度注意力机制(Efficient Multi-Scale Attention Module, EMA)和空洞空间金字塔池(Atrous Spatial Pyramid Pooling, ASPP)加以优化。实现过程如算法1所示。

2.1.1 基于DKD的深度特征抽取网络

利用DKD进行模型轻量化处理,将复杂教师网络的知识迁移至简单学生网络。DKD的总损失函数如(4)式所示,包含目标类知识蒸馏(Target Class Knowledge Distillation, TCKD)和非目标类知识蒸馏(Non-Target Class Knowledge Distillation, NCKD)两个独立部分。

DKD=αTCKD+βNCKD

其中,αβ分别表示TCKD和NCKD的权重系数。通过调整αβ在两部分间找到最佳平衡,使知识迁移更高效。基于解耦知识蒸馏技术进行深度特征提取,使模型在保证性能的同时缩小模型规模、降低计算消耗,便于在资源受限的边缘设备中部署。

同时,本文选择ResNeXt网络[15-16]为教师网络,MobileNetV2网络为学生网络。与常用于恶意软件图像纹理检测的ResNet网络[17]相比,ResNeXt在保留残差连接的基础上,将标准卷积替换为分组卷积,显著提升了网络性能。同时,分组卷积能够有效降低网络的计算成本,进一步提升计算效率。而学生网络MobileNetV2采用深度可分离卷积,将标准卷积分解为深度卷积与逐点卷积,以降低计算复杂度。网络架构中采用瓶颈层与倒置残差结构,实现网络参数量的显著减少,同时保证网络性能。并且,与ResNeXt相比,MobileNetV2在参数量上缩减约86.4%,计算量降低约9.7%,适用于有限资源下的部署。

2.1.2 高效多尺度注意力机制

本文引入EMA,以强化特征信息表达。为学习不同语义信息,EMA将输入的恶意软件特征图在通道维度划分为多个子特征,通过并行子网络处理、跨空间学习和特征融合3个步骤,实现对多尺度特征信息的提取,过程如图6所示。

1) 并行子网络处理。为了捕捉多尺度特征,实现通道级特征增强,在1×1分支中,分别对子特征在宽度和高度方向进行一维全局平均池化操作,提取两个方向的全局特征;连接特征后通过1×1卷积核分别映射至通道,经Sigmoid激活,生成通道级权重。3×3分支中,在每个子特征组堆叠单个3×3卷积核,以捕捉局部多尺度特征表示。

2) 跨空间学习。为了构建空间相关性,实现空间维度上的特征增强,使用1×1和3×3分支的输出,利用二维全局平均池化分别编码全局空间信息;对1×1分支的输出,直接转换为相应维度,以适应信道特征的联合激活机制。基于非线性函数Softmax,由两个分支编码后的全局空间信息分别生成空间注意力图;其中,第1张空间注意力图通过1×1分支捕捉长程依赖,第2张空间注意力图通过3×3分支保留精确的空间位置信息。聚合两张图,利用Sigmoid函数生成空间权重。

3) 特征融合。为增强特征图,融合多尺度特征,由最终的空间权重生成并输出融合后的特征图。

EMA相较于其他注意力机制更为轻量,计算开销低,且收敛速度更快[19]。同时,通过引入EMA机制,网络能够有效捕获特征维度间的依赖关系,并充分利用全局上下文信息,确保了模型的高效性。

2.1.3 空洞空间金字塔池

CNN要求输入图像尺寸统一,网络在处理不同结构与比例的图像时均受到一定限制,将导致部分信息遗失或不必要的几何变形。为消除固定图像大小的约束并保留特征间关系信息,在模型中引入ASPP层。

ASPP层由空洞卷积及空间金字塔池[20](Spatial Pyramid Pooling,SPP)组合构成。基于空洞卷积扩大感受野,捕获多尺度的上下文信息;应用SPP保证适应任意大小的图像输入,并将其输出为所需维度的向量。ASPP结构中存在多个并行的卷积率不同的池化层,确保了不同分布的特征信息均能被取样与聚合。使网络解除对样本图像尺寸大小的限制,并降低信息丢失概率,进而提升模型的准确性。

2.2 恶意软件分类模块

本文利用深度学习模型的强大特征提取能力,将神经网络视为深度特征提取器,从GMA中提取深度特征;再将其输入到基于机器学习算法的最终分类器中实现恶意软件检测,以获取稳健的分类结果。最终检测器不涉及深度特征计算,计算成本较低,从而达到性能与资源消耗的平衡。同时,模型也减少了逆向工程中对领域专家知识的需求,有助于增强泛化能力。

采用改进的随机森林[21](Improved Random Forest, IRF)模型为最终分类器,实现恶意软件的快速分类。为了增强优异决策树对结果的影响并削弱劣质决策树的负面作用,在分类决策时,改简单投票为加权投票。通过构建多棵决策树并整合各预测结果,有效规避了过拟合并缓解数据不平衡问题。

本文检测任务中,IRF首先对每棵树的输出进行加权概率估计,获得第tr棵树关于每个类别k的加权概率值Ptr(kV);然后,计算加权平均概率值P(kV),如(5)式所示;最后,使用argmax函数从加权平均概率P(kV)中选择最有可能的类别作为最终预测结果y^,如公式(6)所示。

P(kV)=tr=1TRPtr(kV)CRtrtr=1TRCRtr
y^=argmaxkP(kV)

其中,V为神经网络抽取出的深度特征向量;TR为树的总数;CRtr为第tr棵树的权重;argmaxk用于寻找使P(kV)最大化的类别k

3  实验分析

3.1 实验环境与评估方法

本文采用微软公开数据集MMCC[22]评估算法性能。该数据集在恶意软件分类领域应用广泛,具有较高的代表性。实验使用其训练集部分,共包含10 868个样本,涵盖9个恶意软件家族,每个样本均提供.byte和.asm两种文件格式。具体样本分布如表2所示。

对MMCC生成的GMA图像数据集按照8∶2划分,获得训练集与测试集。为充分验证所提检测框架的泛化效果,实验采用10折交叉验证法。利用网格搜索技术进行参数寻优。设置深度特征抽取模型的批大小(Batch Size)为64,训练轮次(Epoch)为60;解耦知识蒸馏系数αβ分别为1.0和8.0。为了保证模型在学习过程中的稳定性,采用带预热机制的余弦衰减学习率调整策略(Warm-up Cosine Annealing),初始学习率为0.001。优化过程中使用Adam优化器与交叉熵损失函数。线性分类器IRF中决策树数量n_estimators为60。

实验的硬件环境为AMD EPYC 9654 96-Core处理器,NVIDIA GeForce RTX 4090 GPU;软件环境为Ubuntu 22.4,Python 3.10,采用PyTorch 2.1.0框架。

考虑到数据集存在不平衡现象,本文采用加权的4种评价指标[23]评估算法的分类性能,即加权准确率(Accuracyw)、加权召回率(Recallw)、加权精确率(Precisionw)与加权F1分数(F1w),如(7)~(10)式所示。

Accuracyw=Accuracy=TP+TNN×100%
Recallw=k=1Kwk¯Recallk×100%
Recallk=TPkTPk+FNk×100%
Precisionw=k=1Kwk¯Precisionk×100%
Precisionk=TPkTPk+FPk×100%
F1w=k=1Kwk¯F1k×100%
F1k=2×PrecisionkRecallkPrecisionk+Recallk×100%

其中,权重wk¯=nkNnk为类别k的样本数目,N为总样本量;RecallkPrecisionkF1k分别为每类样本k对应的召回率、精确率与F1分数;TP、TN、FP、FN分别表示真正例、真反例、假正例和假反例的数量。

3.2 数据集有效性验证

本文基于不同的恶意软件纹理可视化组合方案进行实验,以评估所提GMA数据集的有效性。可视化数据集生成方案如表3所示。

实验在常见恶意软件检测网络[24](如基础CNN、VGG16、ResNet-50和EfficientNetV2)以及本文所提MTFKD模型中进行,采用的基础CNN分别设置了4个卷积层、最大池化层、Dropout层和密集层,并在最终层之前使用2个扁平层作为全连接层。为了减少数据处理的开销,本文使用Dropout和DeCov正则器。不同恶意软件检测网络的对比实验结果如图7

随着可视化方案的逐步优化,各检测网络的准确率总体呈提升趋势。一方面,在单通道数据集中,3类纹理特征均对检测效果起积极作用,展现出较为优异的性能,其中以操作码Markov图像的贡献度最高。另一方面,三通道的RGB数据集相对于单通道数据集能够提供更丰富的信息,因此分类效果明显更优。对于可选方案的不同组合,相较于S1(文献[1125]可视化方法),S2中采用字节码灰度共生矩阵图,在提取全局信息的同时,考虑了纹理间的空间关系;S3在提取汇编指令序列的基础上进一步生成Markov图像,有效利用汇编指令间的转移概率,提取更深层次的模式和依赖关系,因此有更好的检测效果;GMA数据集组合了三类纹理特征,在规模相同的情况下提供了更为全面的信息视角,能够捕捉恶意软件原始样本与变种之间的深层依赖关系和变种的细微差异,有效增强模型对恶意软件变种的适应能力,在MTFKD算法中更是达到99.49%的准确率,与其他可视化方案相比特征集的有效性更高。

3.3 网络压缩对比

为验证解耦知识蒸馏技术对网络性能的影响,对比使用ResNeXt-50、MobileNetV2网络直接训练与将MobileNetV2作为学生网络时的参数量、浮点数、运行时间以及准确率,如表4所示。其中,参数量用于衡量网络规模,浮点数为度量网络计算资源消耗的指标,运行时间用以反映网络的时间复杂度。结果表明,与作为教师网络的ResNeXt-50相比,不论是直接训练还是用作学生网络,轻量级MobileNetV2网络规模都更小,且运行时间明显缩短。对比文献[11]中改进的EfficientNetV2网络(参数量为30.20×106,浮点数为7.27×109),本文应用的MobileNetV2网络参数量显著降低,在规模的轻量化上具有明显优势。用于学生网络的MobileNetV2网络相较于直接训练,准确率提高了1.87%。可以认为,解耦知识蒸馏策略使得简单的网络结构能够学习到复杂网络的特征表达,在保证网络性能的同时,展现出降低资源消耗的卓越能力。

3.4 消融实验

为了研究各组件对MTFKD模型的影响,设计消融实验以评价模型的有效性。分别移去EMA、ASPP及最终分类器,并设置完整的MTFKD模型作为对照组,实现4组消融实验。表5图8分别给出了实验结果与混淆矩阵。

分析可知,相较于完整的MTFKD模型,缺少某一模块均会导致不同程度的模型性能下降。实验过程中EMA机制的加入,使得深度特征提取器能够从GMA数据集中获取更多有效特征信息,引导网络兼顾全局与局部信息,进而调整特征图权重,加速收敛。ASPP使设计网络时免于增加裁剪、变形等数据处理步骤,避免了特征信息的丢失与冗余。分类模块有效提升了模型的响应速度。尽管移去模块可以降低模型规模与运行时间,但检测效果也随之降低。实验表明,MTFKD算法较全面地考虑了数据输入、特征抽取与分类过程中可能出现的问题,提高了对不同家族恶意软件变种的识别能力,兼顾高效性与准确性,实现了性能与计算资源的优化。

3.5 分类算法性能评估

为了评估分类器在恶意软件检测中的有效性,选取K最近邻算法(K-Nearest Neighbors, KNN)、逻辑回归(Logistic Regression)、极端梯度提升(eXtreme Gradient Boosting, XGBoost)、支持向量机(Support Vector Machine, SVM)以及本文使用的IRF算法,分别与不同构成的特征抽取模块组合,基于默认参数进行实验评估,比较分类准确率,实验结果如图9所示。由图9可知,IRF在与各网络架构结合时均能够表现出较高的准确率。这是因为IRF的加权投票机制能够集成各决策树性能以避免过拟合,且多棵决策树的并行计算也使得其具备了有效处理高维特征数据的能力,对各特征抽取网络提取出的深度特征向量均能够进行准确分类。

3.6 性能对比分析

与其他使用MMCC数据集的工作对比,结果如表6所示。文献[26]利用Gabor滤波器提取的Markov图像特征进行恶意软件分类,取得99.12%的准确率,但由于检测模型集成了Xception与CNN两种大规模模型,模型推理的时间成本较高;MalCVS[27]引入彩色标签框(CoLab)标记PE文件,并使用改进的VGG16结构提取CoLab图像深度特征,基于SVM算法分类恶意软件,但难以处理封装好的恶意软件,无法高效应对恶意软件变种;文献[23]在EfficientNetB1网络中,基于二进制字节文件转换成的图像进行恶意软件分类,只提取了全局信息,忽略了局部特征与语义信息,对恶意软件变种的适应性较低,且运行时间较长;FACILE[17]分多个阶段提取特征,但胶囊网络架构的动态路由过程需要进行多次迭代计算,其训练速度相对较慢,且在面对较大图像尺寸时模型效率将会降低,存在较大的计算资源消耗;TriCh-LKRepNet[25]基于RGB图像映射预处理恶意软件样本,最终分类准确率达到99.47%,尽管引入重参数技术可以简化LKRepNet网络,但大核卷积等复杂模块限制了模型推理速度的进一步优化;MalSort[28]使用遮掩自监督学习框架,实现轻量化设计与对标注数据的低依赖性,但模型架构依赖于参数量较大的Swin Transformer,难以在资源有限的环境下应用。

综上分析,本文检测方法在恶意软件检测领域表现出了优异性能。GMA图像集将多个特征信息有效整合,并缩减了数据规模。MTFKD组合了深度特征抽取模块与分类模块;借助解耦知识蒸馏策略轻量化深度学习模型,基于EMA与ASPP增强特征表征,利用IRF的并行计算特性提升分类处理速度。因此,本文算法在兼顾各指标优异表现的同时,显著降低了时间复杂度,提升了算法的实际应用性。

4  结 语

现有恶意软件检测技术大多使用单一特征或简单组合,注重检测效果但忽略了模型规模与资源消耗。为丰富特征信息表达,本文基于MMCC样本与数据映射技术,组合API灰度图、汇编指令Markov图像与字节级GLCM图像,将数据预处理为能够全面反映恶意软件数据结构与行为的GMA图像数据集;为增强纹理特征表征,缩小模型规模,快速响应恶意软件分类任务,提出了基于解耦知识蒸馏的恶意软件轻量化检测方法MTFKD。经对比研究,MTFKD的综合性能与轻量化表现更出色,是一种有效的恶意软件检测模型。即便在恶意软件家族数量增加的情况下,模型仍能通过学习特征之间的内在关系来进行有效分类,保持较高的准确性。

后续研究中,将使用包含更多家族样本的公开数据集进一步验证模型的泛化性能和检测效果;尝试优化特征集构成并简化网络架构,以加强对持续性威胁及零日攻击的检测,在低资源消耗的前提下不断提升模型推理速度。同时将探索更先进的生成对抗网络(Generative Adversarial Network, GAN)与图卷积网络(Graph Convolutional Network, GCN)改进模型结构,提升算法的可解释性。

参考文献

[1]

KASPERSKY. Kaspersky reports rise in malware threats & attacks in 2024[EB/OL]. [2024-12-18].

[2]

GARTNER. Gartner forecasts global information security spending to grow 15 percent in 2025[EB/OL]. [2024-08-28]. DOI: 10.1201/9781420030631.ch14 .

[3]

谢丽霞, 魏晨阳, 杨宏宇, . 基于图像化方法的恶意软件检测与分类综述[J]. 计算机学报202548(3): 650-674. DOI: 10.11897/SP.J.1016.2025.00650 .

[4]

XIE L XWEI C YYANG H Yet al. Review on malware detection and classification using imaging-based methods[J]. Chinese Journal of Computers202548(3): 650-674. DOI: 10.11897/SP.J.1016.2025.00650(Ch ).

[5]

DENG H XGUO CSHEN G Wet al. MCTVD: A malware classification method based on three-channel visualization and deep learning[J]. Computers & Security2023126: 103084. DOI: 10.1016/j.cose.2022.103084 .

[6]

杨春雨, 徐洋, 张思聪, . 一种基于三通道图像的恶意软件分类方法[J]. 武汉大学学报(理学版)202268(1): 26-34. DOI: 10.14188/j.1671-8836.2021.2005 .

[7]

YANG C YXU YZHANG S Cet al. A malware classification method based on three-channel images[J]. Journal of Wuhan University (Natural Science Edition)202268(1): 26-34. DOI: 10.14188/j.1671-8836.2021.2005(Ch ).

[8]

CUI Z HXUE FCAI X Jet al. Detection of malicious code variants based on deep learning[J]. IEEE Transactions on Industrial Informatics201814(7): 3187-3196. DOI: 10.1109/TII.2018.2822680 .

[9]

XING X FJIN XELAHI Het al. A malware detection approach using autoencoder in deep learning[J]. IEEE Access202210: 25696-25706. DOI: 10.1109/ACCESS.2022.3155695 .

[10]

DHANYA K AVINOD PYERIMA S Yet al. Obfuscated malware detection in IoT Android applications using Markov images and CNN[J]. IEEE Systems Journal202317(2): 2756-2766. DOI: 10.1109/JSYST.2023.3238678 .

[11]

王金伟, 陈正嘉, 谢雪, . 基于Ngram-TFIDF的深度恶意代码可视化分类方法[J]. 通信学报202445(6): 160-175. DOI:10.11959/j.issn.1000-436x.2024115 .

[12]

WANG J WCHEN Z JXIE Xet al. Deep visualization classification method for malicious code based on Ngram-TFIDF[J]. Journal on Communications202445(6): 160-175. DOI:10.11959/j.issn.1000-436x.2024115(Ch ).

[13]

VASAN DALAZAB MWASSAN Set al. IMCFN: Image-based malware classification using fine-tuned convolutional neural network architecture[J]. Computer Networks2020171: 107138. DOI: 10.1016/j.comnet.2020.107138 .

[14]

轩勃娜, 李进. 基于改进CNN的恶意软件分类方法[J]. 电子学报202351(5): 1187-1197. DOI:10.12263/DZXB.20220818 .

[15]

XUAN B NLI J. Malware classification method based on improved CNN[J]. Acta Electronica Sinica202351(5): 1187-1197. DOI:10.12263/DZXB.20220818(Ch ).

[16]

AMER EZELINKA I. A dynamic Windows malware detection and prediction method based on contextual understanding of API call sequence[J]. Computers & Security202092: 101760. DOI: 10.1016/j.cose.2020.101760 .

[17]

CONTI MKHANDHAR SVINOD P. A few-shot malware classification approach for unknown family recognition using malware feature visualization[J]. Computers & Security2022122: 102887. DOI: 10.1016/j.cose.2022.102887 .

[18]

ZHAO B RCUI QSONG R Jet al. Decoupled knowledge distillation[C]//2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2022: 11943-11952. DOI: 10.1109/CVPR52688.2022.01165 .

[19]

HE Y WKANG X GYAN Q Bet al. ResNeXt+: Attention mechanisms based on ResNeXt for malware detection and classification[J]. IEEE Transactions on Information Forensics and Security202419: 1142-1155. DOI: 10.1109/TIFS.2023.3328431 .

[20]

ZHANG L FSONG J BGAO Aet al. Be your own teacher: Improve the performance of convolutional neural networks via self distillation[C]//2019 IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE Press, 2019: 3712-3721. DOI: 10.1109/ICCV.2019.00381 .

[21]

ZOU B HCAO C JWANG L Jet al. FACILE: A capsule network with fewer capsules and richer hierarchical information for malware image classification[J]. Computers & Security2024137: 103606. DOI: 10.1016/j.cose.2023.103606 .

[22]

OUYANG D LHE SZHANG G Zet al. Efficient multi-scale attention module with cross-spatial learning[C]//ICASSP 2023—2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). New York: IEEE Press, 2023: 1-5. DOI: 10.1109/ICASSP49357.2023.10096516 .

[23]

HOU Q BZHOU D QFENG J S. Coordinate attention for efficient mobile network design[C]//2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2021: 13708-13717. DOI: 10.1109/ CVPR46437.2021.01350 .

[24]

CHEN L CPAPANDREOU GKOKKINOS Iet al. DeepLab: Semantic image segmentation with deep convolutional nets, atrous convolution, and fully connected CRFs[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence201840(4): 834-848. DOI: 10.1109/TPAMI.2017.2699184 .

[25]

熊健, 覃仁超, 何梦乙, . 改进随机森林在Android恶意软件检测中的应用[J]. 计算机工程与应用202157(3): 130-136. DOI: 10.3778/j.issn.1002-8331.2001-0291 .

[26]

XIONG JQIN R CHE M Yet al. Application of improved random forest algorithm in Android malware detection[J]. Computer Engineering and Applications202157(3): 130-136. DOI: 10.3778/j.issn.1002-8331.2001-0291(Ch ).

[27]

RONEN RRADU MFEUERSTEIN Cet al. Microsoft malware classification challenge[EB/OL]. [2015-02-04].

[28]

CHAGANTI RRAVI VPHAM T D. Image-based malware representation approach with EfficientNet convolutional neural networks for effective malware classification[J]. Journal of Information Security and Applications202269: 103306. DOI: 10.1016/j.jisa.2022.103306 .

[29]

SHARMA OSHARMA AKALIA A. MIGAN: GAN for facilitating malware image synthesis with improved malware classification on novel dataset[J]. Expert Systems with Applications2024241: 122678. DOI: 10.1016/j.eswa.2023.122678 .

[30]

李思聪, 王坚, 宋亚飞, . TriCh-LKRepNet: 融合三通道映射与结构重参数化的大核卷积恶意代码分类网络[J]. 电子学报202452(7): 2331-2340. DOI:10.12263/DZXB.2024016 .

[31]

LI S CWANG JSONG Y Fet al. TriCh-LKRepNet: A large kernel convolutional malicious code classification network for structure reparameterisation and triple-channel mapping[J]. Acta Electronica Sinica202452(7): 2331-2340. DOI: 10.12263/DZXB.20240162(Ch ).

[32]

SHARMA OSHARMA AKALIA A. Windows and IoT malware visualization and classification with deep CNN and Xception CNN using Markov images[J]. Journal of Intelligent Information Systems202360(2): 349-375. DOI: 10.1007/s10844-022-00734-4 .

[33]

XIAO MGUO CSHEN G Wet al. Image-based malware classification using section distribution information[J]. Computers & Security2021110: 102420. DOI: 10.1016/j.cose.2021.102420 .

[34]

WANG F WSHI X PYANG Fet al. MalSort: Lightweight and efficient image-based malware classification using masked self-supervised framework with Swin Transformer[J]. Journal of Information Security and Applications202483: 103784. DOI: 10.1016/j.jisa.2024.103784 .

基金资助

国家自然科学基金(62301304)

陕西省自然科学基础研究计划(2025JC-YBMS-670)

西安财经大学2023年研究生创新基金(23YC033)

西安财经大学2023年研究生创新基金(23YC013)

AI Summary AI Mindmap
PDF (3747KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/