基于动静态语义行为增强的APT攻击溯源研究

杨秀璋 ,  彭国军 ,  王晨阳 ,  周逸林 ,  李家琛 ,  武帅 ,  傅建明

武汉大学学报(理学版) ›› 2026, Vol. 72 ›› Issue (1) : 57 -70.

PDF (2549KB)
武汉大学学报(理学版) ›› 2026, Vol. 72 ›› Issue (1) : 57 -70. DOI: 10.14188/j.1671-8836.2024.0126
区块链、密码学与分布式系统

基于动静态语义行为增强的APT攻击溯源研究

作者信息 +

Research on APT Attack Tracing Based on Dynamic and Static Semantic Behavior Enhancement

Author information +
文章历史 +
PDF (2609K)

摘要

针对高级可持续威胁(Advanced Persistent Threat,APT)溯源未考虑ATT&CK(Adversarial Tactics, Techniques, and Common Knowledge)技战术和攻击语义行为增强,未融合动静态两个视角探索和实现攻击行为互补的溯源分析,易被加壳和混淆的APT恶意软件逃避问题,提出一种基于动静态语义行为增强的APT攻击溯源(Advanced Persistent Threat Eye, APTEye)模型。首先,构建APT组织恶意软件样本集并实施预处理;其次,提取恶意软件的静态行为特征与动态行为特征;再次,设计行为特征语义增强及表征算法,分别利用Attack2Vec将静态API特征和攻击链以及语义行为映射,APISeq2Vec增强动态API序列的时间语义关系,实现低级别行为特征到高级别攻击模式的映射;接着,构建动静态特征对齐和行为语义聚合算法将APT攻击恶意软件的动态静态特征融合;最后,构建图注意力网络模型溯源APT组织。实验结果表明,APTEye模型能有效追踪溯源APT攻击,其精确率、召回率和F1值分别为92.24%、91.85%和92.04%,均优于现有模型。此外,APTEye模型能够有效识别细粒度的动静态API函数及攻击行为,实现与ATT&CK技战术映射,为后续APT攻击的意图推理和攻击阻断提供支撑。

Abstract

To address the limitations of current Advanced Persistent Threat(APT) attacks tacing methods, such as the neglect of ATT&CK(Adversarial Tactics, Techniques, and Common Knowledge) and semantic behavior enhancement, the failure to combine dynamic and static perspectives for in-depth attack traceability analysis, and the vulnerability to evasion by the packed and obfuscated APT malware. We propose a novel traceability model for APT attacks based on dynamic and static semantic behavior enhancement (APTEye). Firstly, an APT malware sample set is constructed and preprocessed. Secondly, static and dynamic behavioral features of the malware are extracted. Then, a behavioral feature semantic enhancement and representation algorithm is designed. Attack2Vec is used to map static API features, the attack chain, and the semantic behaviors. APISeq2Vec is employed to enhance the temporal semantic relationships of dynamic API sequences, thereby mapping low-level behavior features to high-level attack patterns. Subsequently, a dynamic-static feature alignment and behavior semantic aggregation algorithm is designed to integrate dynamic and static features of APT malware. Finally, a graph attention network-based model is constructed to trace APT organizations. Experimental results show that the proposed method can effectively track APT attacks, with a precision of 92.24%, a recall of 91.85%, and an F1-score of 92.04%, superior to existing models. In addition, the APTEye model can effectively identify fine-grained dynamic and static API functions and attack behaviors, facilitating the mapping between behaviors and the ATT&CK framework, which supports further intent inference and blocking of APT attacks.

Graphical abstract

关键词

高级可持续威胁 / APT攻击溯源 / 语义行为增强 / 图注意力网络

Key words

advanced persistent threat / APT attack tracing / semantic behavior enhancement / graph attention network

引用本文

引用格式 ▾
杨秀璋,彭国军,王晨阳,周逸林,李家琛,武帅,傅建明. 基于动静态语义行为增强的APT攻击溯源研究[J]. 武汉大学学报(理学版), 2026, 72(1): 57-70 DOI:10.14188/j.1671-8836.2024.0126

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

随着全球网络形势日益复杂,国家间的网络对抗愈发激烈。高级可持续威胁(Advanced Persistent Threat, APT)攻击作为一种新型网络攻击模式,针对特定目标采用高级入侵手段并实施可持续控制,具有高级性、隐蔽性、持续性、对抗性和高威胁性等特点[1-4]。APT攻击已对全球多个关键行业和日常生活造成严重影响[5]。APT组织通常采用高隐蔽、高对抗的入侵手段长期渗透和破坏特定目标。恶意软件或代码常经过加壳和混淆处理,使得攻击载荷能在目标网络中长期潜伏,从而导致传统检测及溯源系统难以有效追踪攻击来源和深入分析攻击行为[6]

在我国,APT攻击频繁发生,网络空间主权屡遭侵犯,特别是以OceanLotus、毒云藤、蔓灵花、Darkhotel、方程式等为代表的APT组织,它们长期活跃并针对中国境内目标实施攻击。我国在APT攻击溯源研究方面,主要以工业界为主,国内企业如奇虎科技、奇安信、安天、绿盟、腾讯等公司均已建立APT检测系统或威胁情报溯源团队,致力于提升APT攻击的检测和溯源能力。尽管已经取得一定进展,但现有检测技术和溯源手段过度依赖专家知识和逆向技术,对智能化和对抗加壳混淆技术的研究相对不足,甚至难以捕获APT攻击活动的高隐蔽行为,从而导致追踪溯源幕后的攻击组织和黑客成员准确性较差。由此可见,设计有效的方法溯源APT攻击的发起者以及分析恶意软件的行为,已然成为APT攻击防御领域的一个新颖且关键的问题,这对于维护我国网络空间安全具有重要意义。

APT攻击智能溯源旨在结合APT攻击的技战术特点提取溯源特征,并构建智能模型以识别攻击活动中的线索和痕迹,实现APT组织或黑客的溯源追踪。目前,学术界和产业界主要利用机器学习、深度学习、溯源图和知识图谱等方法进行APT智能溯源。文献[7-10]通过构建机器学习模型(如支持向量机、随机森林、决策树)学习攻击行为特征溯源APT组织或攻击者;文献[11-14]通过构建深度学习模型(如卷积神经网络、循环神经网络、图卷积神经网络)学习攻击审计日志或行为特征追踪APT组织;文献[15-18]利用溯源图和知识图谱关联APT攻击特征,并追踪攻击来源。然而,上述工作仍未较好地解决APT攻击溯源问题,其局限性表现为:1) 缺乏对真实世界APT攻击实战性的考虑,未能充分利用ATT&CK(Adversarial Tactics, Techniques, and Common Knowledge)框架映射和行为时序依赖关系进行APT组织溯源;2) 部分方法过度依赖专家经验和先验知识,企业倾向于利用规则匹配和同源分析来实现APT攻击溯源,缺乏细粒度和自动化的行为分析;3) 未能有效整合APT攻击的动态和静态行为特征进行语义增强,未能从动静两个视角探索攻击行为的互补作用;4) 溯源模型存在局限性,难以对抗加壳混淆技术,且无法学习适用于动静态特征的嵌入向量,导致现有工作更倾向于简单叠加的深度学习模型,与安全问题结合较浅,忽视溯源的本质且鲁棒性较差。因此,本文的研究重点在于如何结合提取的行为特征,构建融合语义知识的模型,以溯源追踪APT攻击的来源,并深入分析攻击行为。

针对上述问题,本文设计并实现了一种基于动静态语义行为增强的APT攻击溯源模型,称为APTEye(Advanced Persistent Threat Eye)模型。本文主要贡献如下:

1) 针对APT攻击恶意软件的隐蔽性、持续性和对抗性极强特点,提出APTEye模型,该模型基于动态和静态行为特征融合,利用ATT&CK框架和时序依赖关系增强语义行为信息,结合图注意力网络完成APT组织溯源。

2) 借助CAPA工具采集经反汇编及规则匹配的静态API和ATT&CK技战术行为特征,利用Cuckoo和CAPE沙箱的监控代理及Hook机制捕获运行时的动态行为,再结合时间序列生成动态API序列和提取依赖关系。通过动静态行为特征融合实现攻击行为互补,从两种视角提升溯源模型的鲁棒性和准确性。

3) 提出两种词嵌入方法,通过Attack2Vec将静态API特征和攻击链进行映射,利用APISeq2Vec增强动态API序列的时间语义关系,实现了低级别行为特征到高级别攻击行为模式的映射,有效消除语义鸿沟问题。此外,该嵌入方法通过动静态行为特征融合和向量表征,有效捕获APT攻击行为的依赖关系,能更好地被后续的图注意力网络学习以溯源APT攻击组织。

1  相关工作

结合学术界和产业界相关研究,本文将APT攻击溯源分为四类方法,具体内容如下。

1.1 基于规则匹配和关联分析的溯源方法

传统APT攻击溯源通过规则匹配、安全知识库和APT组织技战术特征匹配,结合关联分析[19]、相似性度量或同源分析[20]技术实现攻击来源判定。典型方法包括模糊哈希[21]、BinDiff[22]和DeepBinDiff[23]。该类方法可在一定程度上溯源目标区域、组织和攻击者,但其过度依赖人工标注,无法有效识别混淆对抗或新型网络攻击(如无文件攻击)的来源,且自动化程度低、鲁棒性较差。

1.2 基于机器学习的溯源方法

该类方法通过构建机器学习模型对溯源特征进行学习,从而预测网络攻击来源。常见算法包括支持向量机(Support Vector Machine, SVM)、随机森林(Random Forest, RF)、逻辑回归(Logistic Regression, LR)、K均值算法(K-Means)、密度聚类算法。在分类方面,文献[8-924]通过构建随机森林分类器分别学习二进制代码的动态特征、控制流图特征、静态特征,以溯源APT组织及源代码作者。文献[725-26]构建SVM分类器溯源APT攻击来源。集成学习[27]方法被用于检测APT攻击。在聚类方面,代表性方法包括Ctracer系统[10]、K-Means聚类算法[1928-29]等。

相比规则匹配和关联分析,机器学习方法具备一定智能性、较高准确率和较低误报率,且具有一定的可解释性和易实现特点。然而,属于浅层学习的机器学习难以捕获深层语义信息,并依赖特征工程和人工标注,扩展性有限。尤其在大规模日志、流量和APT报告分析时,模型泛化能力下降,难以精准检测高隐蔽性和对抗性攻击的来源。

1.3 基于深度学习的溯源方法

深度学习方法主要包括卷积神经网络(Convolutional Neural Network, CNN)、循环神经网络(Recurrent Neural Network, RNN)、自编码器(AutoEncoder)和图神经网络(Graph Neural Network, GNN)。早期研究通过CNN、双向长短期记忆网络(Bidirectional Long Short-Term Memory, BiLSTM)以及CNN-LSTM(Convolutional Neural Network - Long Short-Term Memory)组合模型学习二进制代码[1230]、网络攻击流量[31]、恶意软件和C&C(Command and Control)服务器的流量共享特征[32],实现恶意代码作者溯源、攻击IP识别、未知APT攻击检测。随后,融合注意力机制的深度学习方法被广泛应用,代表性工作包括文献[1133]。由于图神经网络包含丰富的节点和关系信息,能捕获更深层次的语义知识,因此也被应用于溯源研究。文献[34-36]分别构建图卷积神经网络、图注意力网络模型和多阶段注意力检测模型追踪APT组织,并且能从系统和网络层面捕获APT攻击的各阶段行为。

深度学习能够捕获语义知识和长距离依赖,在少量标注数据的情况下仍具备较高准确率和扩展性。然而,现有工作忽视动静态特征行为的提取与融合,难以应对代码混淆和加壳保护,并未深入关联攻击行为与ATT&CK框架的技战术特点。此外,现有研究主要聚焦神经网络模型的叠加和组合,对APT攻击的安全性、模型适配性等问题探索不足,APT攻击溯源研究仍有待完善。

1.4 基于溯源图和知识图谱的溯源方法

前期,该类方法结合审计日志和流量告警构建溯源图和关系图谱,并基于因果依赖关系溯源APT攻击来源,ProTracer[16]和Trace[18]是两个典型的基于溯源图的追踪系统。随后,融合知识图谱、智能算法的溯源追踪工作逐渐产生,代表性工作包括APTMalInsight系统[15]、攻击者-防御者形式化模型[17]、基于图卷积神经网络和Louvain社区发现算法的溯源模型[34]、APT-KGL系统[37]。此外,为更好地开展实时APT攻击溯源研究,融合高级场景图的HOLMES系统[38]、融合注意力机制的溯源图模型[39]、基于溯源图和STP近似算法的NODLINK系统[40]、融合ATT&CK知识的APTSHIELD系统[41]被提出。

相比于1.1、1.2、1.3的三类方法,该类方法具有更高的自动化和智能化水平,可识别隐蔽性较高的APT攻击事件,甚至通过事件痕迹或子图匹配溯源攻击对象,还原攻击场景和实现语义推断。然而,该类方法需要捕获网络攻击在系统中长期潜伏所生成的审计日志并构建溯源图,存在溯源滞后、数据漂移和数据爆炸等问题。此外,相比于构建模型学习恶意软件的行为特征,基于溯源图的方法在实时检测和APT攻击行为映射方面仍存在不足,如何有效提取恶意软件行为特征或代码基因(即能够准确表征APT组织技战术特点的API序列特征)仍是亟待解决的挑战。

本节系统介绍了四类溯源方法,梳理其原理、代表工作和发展历程,并对比分析优缺点。传统方法以规则匹配和关联分析为主,起步较早且应用于工业界。基于机器学习和深度学习的溯源方法追求与前沿神经网络技术融合。溯源图与知识图谱的应用进一步加强了深层语义知识的关联能力,特别适用于大规模审计日志场景的攻击溯源。然而,针对隐蔽性强、对抗性高、复杂且持续时间长的APT攻击,现有溯源模型仍存在局限。因此,本文以APT攻击恶意软件为研究对象,提出结合动静态行为特征和语义关系的APTEye模型,探索APT组织溯源的新思路。

2  溯源模型设计与实现

2.1 APTEye溯源模型整体框架

APTEye主要包括5个步骤,整体框架如图1所示。

1) APT恶意软件采集。采集典型APT组织的恶意软件样本集(即长期针对我国并被相关部门及安全公司披露的黑客组织),主要以PE文件为主,并对样本集开展脱壳和解混淆预处理操作。脱壳采用常见的Unipack自动化工具并编写脚本批量实现。

2) 动静态特征抽取。提取恶意软件静态和动态行为特征,利用CAPA工具采集经反汇编和规则匹配的静态API和ATT&CK技战术行为特征;利用Cuckoo和CAPE沙箱的监控代理和Hook机制捕获运行时的动态行为,结合时间序列生成动态API序列,并利用关联分析算法提取依赖关系。

3) 行为特征语义增强及表征。设计行为特征语义增强及表征算法,结合上一阶段所提取的静态及动态特征,实现对应的向量表征过程。通过Attack2Vec将静态API特征和攻击链映射,利用APISeq2Vec增强动态API序列的时间语义关系,最终实现低级别行为特征到高级别攻击行为模式的映射,有效消除语义鸿沟问题。

4) 动静态特征语义融合。构建动静态特征对齐和行为语义聚合的算法将APT攻击恶意软件的动态和静态特征向量深度融合。在该阶段,APTEye通过融合动态和静态两个维度的向量实现联合表示学习,从而解决静态行为特征易受加壳、混淆干扰,PE文件导入表中存在大量未执行的API函数,动态行为特征会因某些条件未触发而不被沙箱系统捕获的问题。

5) APT攻击溯源。由于动态和静态行为特征形成的嵌入向量适合图模型学习。因此,APTEye构建图注意力网络学习和溯源APT组织,能有效突出ATT&CK映射和时间序列的关系(详见图1第⑤步),并进行关键行为特征深入分析。

2.2 动静态特征抽取

1) 静态行为特征抽取。特征抽取是利用静态分析和动态分析技术从源数据中抽取具有特殊含义或标志的特征集合。常见的静态行为特征包括字符串、控制流图(Control Flow Graph, CFG)、字节码序列、PE文件头部信息(如导入表、导出表、动态链接库、节信息等)、IOC特征、编程风格等。

本文利用CAPA工具实现静态特征抽取,该工具由FireEye安全公司开源,能够自动提取恶意软件的静态API函数,快速挖掘样本中的恶意行为。整个静态行为特征抽取过程如图2所示。首先,各APT组织恶意样本通过反汇编生成汇编代码。其次,转换为语义关系和控制流依赖更丰富的CFG图。最后,结合各APT组织常用的技战术特点,构建CAPA能够学习的定制化规则,通过关联匹配捕获APT恶意软件的静态行为特征。图2中,“namespace”表示CAPA匹配规则文件所对应的路径;“scope”表示匹配方式,本文利用的典型方式为基本块(basic block)和函数(function)的匹配;“att&ck”表示与ATT&CK映射的技战术攻击行为,本文抽取的内容包括战术(tactics)、技术(techniques)和编号(no),ATT&CK框架通过14种技战术表征更好地体现APT组织的攻击特点,现已被广泛应用于产业界;“api”表示该恶意软件包含的API函数,能有效表示攻击行为,并且所抽取的API特征与ATT&CK技战术特点进行映射,譬如“advapi32.StartService”函数与ATT&CK持久化“Persistence”对应。

经过上述操作,有效提取APT恶意软件样本集的静态攻击行为特征,接着利用数据标注操作对特征集合进行处理,为后续特征表征和分析提供支撑。

2) 动态行为特征抽取。常见的动态行为特征包括API序列、系统调用行为、运行时状态信息、堆栈信息等。本文利用Cuckoo和CAPE沙箱实现APT恶意软件的动态行为特征抽取,整个流程如图3所示。首先,各APT组织恶意样本通过自定义的脚本文件来批量调用CAPE沙箱,沙箱利用监控代理和运行执行提取关键特征。其次,CAPE沙箱通过虚拟化网络关联Cuckoo Host和Analysis Guest。恶意软件在Guest中执行,通过Hook机制捕获动态行为,并撰写定制化代码提取运行时API行为特征和时间序列依赖关系,通过窗口内的时间戳进行上下文API时序关联。最后,输出结果为各恶意软件时序执行API函数的序列,它们具有良好的前后时序关系。如图3所示,“CreateFile”“WriteFile”“StartService”“SetWindows-HookEx”为某时间戳窗口内(time1到time4)恶意软件的执行行为。

通过上述操作,有效提取APT恶意软件样本集的动态攻击行为特征,接着结合时间序列生成动态API序列,并提取依赖关系和时序共现关系。最终利用数据标注操作对特征集合进行处理,以供后续的特征表征和溯源模型学习。

2.3 行为特征语义增强及表征算法

2.3.1 静态行为特征语义增强及表征

本文设计了一种静态行为特征语义增强及表征算法,称为Attack2Vec,旨在将静态API特征和攻击链进行映射,从而形成对应的嵌入向量。相比于传统静态特征单一抽取过程,本文提出的Attack2Vec算法的行为描述和ATT&CK技战术映射能力更强。整个算法实现过程如算法1所示。

核心步骤如下:

1) 提取恶意软件静态行为特征,每个恶意软件用多个四元组〈fapi, ftactic, ftechnique, fno〉序列表示,其指某个功能行为所调用的API函数、ATT&CK的技术、战术和序号,旨在映射攻击行为和API的关系。

2) 构建APT恶意软件的序列集SStaic和特征集FStaic,将所有不重复特征构建为节点集EStaic,并且两两计算所有特征的映射关系,如(1)式所示。如果特征fjfk 共现,即通过CAPA定制规则映射到相同功能行为中,对应关系矩阵中的元素AttackPairs[j][k]加1;否则结果不变,最终生成AttackPairs矩阵。

AttackPairs[j][k]=vjk+1,if fj,fkvjk,otherwise

3) 使用三元组构建行为映射关系集RStaic,计算训练集中具有较强语义关系的静态行为映射对,譬如〈advapi32.StartService,Persistence〉和〈kernel32.GetComputerName,Discovery〉。

4) 采用Word2Vec依次计算每个静态行为特征及关系的词向量,并将每个恶意软件按映射关系Attack2Vec拼接成对应的句向量,形如 V(attack)

通过上述步骤,最终形成 V(attack)的静态行为语义特征序列向量,并实现低级别行为特征到高级别攻击行为模式的映射。

2.3.2 动态行为特征语义增强及表征

同理,通过2.2小节已提取的动态行为特征来实现动态行为语义增强,设计并实现APISeq2Vec算法,旨在提取动态API序列的时间语义依赖关系,并结合时间逻辑关联动态API特征,形成对应的嵌入向量。APISeq2Vec算法的实现过程与核心步骤如下,其原理与算法1类似。

1) 提取恶意软件的动态行为API函数特征,并存储至集合SDynamic

2) 按照时间顺序两两计算所有特征的映射关系,如(2)式所示。如果特征fjfk 在某个时间窗口内共现,则对应关系矩阵中的元素APISeqPairs[j][k]加1;否则结果保持不变。

APISeqPairs[j][k]=vjk+1,if fj,fkvjk,otherwise

3) 构建实体集合EDynamic,使用三元组〈fj,vjk,fk 〉构造关系集合RDynamic,并按照时间依赖关系计算出训练集中具有较强语义关系的特征对,它们经常出现在APT组织恶意软件家族中,具有相似的攻击行为。

4) 利用Word2Vec依次计算每个动态行为特征及关系的词向量,并将每个恶意软件按映射关系APISeq2Vec拼接成对应的句向量,形如 V(APISeq)

通过上述步骤,最终形成 V(APISeq)的动态行为语义特征序列向量。至此,APTEye模型成功提取恶意软件的动态和静态行为特征,并利用两种语义增强及表征算法形成 V(attack)V(APISeq)向量。

2.4 动静态特征语义融合算法

不同于先前工作的特征简单组合,本文按照ATT&CK语义关系和时间序列依赖关系提取静态和动态特征,并利用Attack2Vec和APISeq2Vec生成对应的向量实现深层次的嵌入向量融合。此外,本文构建包含节点和关系的向量,适用于后续图神经网络模型学习,可进一步提升APT组织溯源的效果。

算法2为特征语义融合的实现过程。首先,输入静态和动态特征抽取及表征的向量 V(attack)V(APISeq);其次,分别对不同的向量执行对齐和拼接操作,然后生成融合表征的向量 V(multi)。由于基于注意力机制的图网络架构非常适合处理图结构数据,其自注意力(self-attention)机制能计算邻域节点到中心节点的向量知识,实现对该节点的隐层表示,并且能更好地学习上述生成的多视图向量,突出ATT&CK映射和时间序列关系。因此,本文通过构建图注意力网络(Graph Attention Network, GAN)实现APT攻击溯源任务。

3  实验设计与评估

3.1 实验数据和评估指标

为构建APT攻击溯源的实验数据集,首先从国内外安全厂商公开披露的APT分析报告中,提取常见APT组织的恶意软件的哈希值,再从病毒分析网站(包括Hybrid、AnyRun、微步沙箱、VirusShare)和Github中下载这些哈希值对应的恶意软件样本。此外,部分样本由国内某些安全厂商提供,以增强数据集的全面性。在对样本进行预处理和验证后,最终提取来自10个APT组织的6 620个恶意软件集合,如表1所示。由于APT组织攻击存在一定的敏感性,因此,本文对APT组织名称进行匿名化脱敏处理后,再做相关学术探讨,以保护相关信息的隐私。

实验采用精确率(Precision)、召回率(Recall)、F1值和准确率(Accuracy)四个常用的评价指标衡量算法的有效性。其中,精确率表示正确识别的恶意软件隶属APT组织数量占识别出的APT组织所有数量的百分比;召回率表示正确识别的恶意软件隶属APT组织数量占所有该组织数量的百分比;F1值是精确率和召回率的调和平均数,该值从查准和查全两个角度综合反映模型效果,值越大表示溯源效果越好,本文用它对组织溯源实验进行整体评估;准确率旨在评估APT溯源正确的样本数量占总样本数量的百分比,可以直观地反映溯源效果的好坏。为验证本文模型的有效性和真实性,取10次实验结果的平均值作为最终结果,以降低数据划分所造成的随机性和单一训练可能会导致的结果波动,并且提升模型的泛化能力,更全面地评估模型在未知APT恶意样本集上的溯源表现。

在实验环境及参数设置方面,本文采用TensorFlow和Keras框架构建图神经网络模型和对比的机器学习、深度学习模型,编程语言版本为Python3.7。该模型采用随机梯度下降法作为优化模型,迭代次数为60,批量大小设置为64,初始化参数为0.005。所有实验均在Windows 10 64位操作系统环境下运行,CPU为Inter Core i7-8700K,内存为64 GB,GPU为GTX 1080Ti。对比实验的基线模型包括常用的溯源方法和代表性工作。由于现有方法大多数未开源代码,因此本文结合相关工作的算法思路,复现对应模型开展对比实验。具体包括:

1) 基于机器学习的溯源方法:SVM、LR、RF;

2) 基于深度学习的溯源方法:CNN、BiLSTM、BiGRU(Bidirectional Gated Recurrent Unit)、CNN-BiLSTM(Convolutional Neural Network - Bidirectional Long Short-Term Memory);

3) 溯源代表性工作:RNN[11]、FireEye[19]、RF+DNN[8]、函数模糊哈希[21]

3.2 APT组织溯源实验分析

通过实验得到本文方法的精确率为92.24%,召回率为91.85%,F1值为92.04%,准确率为92.16%。为进一步验证本文方法的有效性,将本文方法与传统的机器学习模型、深度学习模型和现有方法进行对比。表2给出了本文方法与对比方法各评价指标的差值。

表2 各溯源模型的实验对比

Table 2 Experimental comparison of various

traceability models

%

由表2可知,APTEye模型的F1值比最佳的机器学习模型(RF)高11.14个百分点,比最佳的深度学习模型(CNN-BiLSTM)高2.22个百分点,比RNN[11]、FireEye[19]、RF+DNN[8]和函数模糊哈希[21]的方法分别高5.85、9.33、6.97和6.33个百分点。APTEye模型优于其他各类方法,能更好地捕获恶意软件特征之间的语义关系,通过将低级别行为特征映射到高级别攻击行为模式,显著提升模型的性能。

为验证动静态特征抽取和向量融合的有效性,本文对比了融合前后实验结果(见表3)。实验结果表明,相较于单一视图,本文方法和对比方法在融合动态行为特征和静态行为特征的情境下均能取得更高的F1值,且具有一定程度的提升。这表明融合动静态特征抽取和向量表示的算法能有效提升APT组织的溯源效果,多层次的语义特征抽取和动静态语义行为增强是有效的。通过动静态行为特征融合实现攻击行为的互补,增强了模型的鲁棒性和F1值。

3.3 APT组织技战术行为分析

为有效证明APTEye能够识别细粒度的动静态API函数及攻击行为,实现与ATT&CK技战术映射,并为攻击溯源实验提供支撑,本节结合溯源预测结果生成各APT组织常见攻击的技战术行为,利用动态分析和静态分析技术提取关键行为特征,主要包括关键API函数、典型的技战术、ATT&CK所映射的技战术序号。此外,本文结合APT组织的技战术多样性,筛选出来自东亚、欧美、东南亚、南亚次大陆不同区域的4个代表性APT组织,以便反映不同区域的攻击技战术特点,实验结果如表4所示。

不同APT组织所利用的攻击手法、战术行为、技术行为和关键API函数能够以结构化知识的形式呈现,并且能与各APT组织的ATT&CK框架有效映射,技战术行为与关键API函数呈现一对多的关系。表4呈现了四个代表性APT组织最常用的6种攻击行为类型,这些技战术及API函数常被应用于该组织的APT攻击事件及定向渗透活动中,它们准确反映了该APT组织的特点,通过关键特征的识别能更好地被图神经网络学习,从而追踪溯源APT组织。譬如,表4中组织2的战术行为“Discovery”和技术行为“System Information Discovery”对应于ATT&CK框架的“T1082”,通过调用“GetComputerName”和“kernel32.GetProcAddress”函数可执行“发现(信息系统)”的行为,说明该组织擅长捕获系统信息;再如组织3的战术行为“Defense Evasion”和技术行为“Obfuscated Files or Information”对应于ATT&CK框架的“T1027”,通过调用“CryptGenRandom”和“advapi32.CryptHashData”函数可加密恶意代码,并执行逃逸载荷或命令,从而躲避杀毒软件的查杀。

总之,该实验表明APTEye既可以消除易受加壳混淆干扰或PE文件导入表中存在大量未执行的API函数(静态行为)的影响,也可以抵抗沙箱中因某些条件未触发而导致动态行为无法捕获的差异,通过动静态融合来捕获能映射攻击行为的关键特征(如表4所示的技战术及关键APT特征),最终消除语义鸿沟且实现APT组织溯源。

为进一步分析不同APT组织的关键API特征及技战术行为的语义关系,APTEye模型提取了各个APT组织的动静态语义行为特征关系,并结合特征的共现关系及出现频率,利用Gephi工具的密度聚类算法生成如图4所示的关系图谱。其中,图谱节点包括APT组织名称、攻击技战术特征、ATT&CK映射序号、APT组织所利用样本的关键API函数;节点之间的连线(边)表示两个特征间的语义共现关系,表明这些特征在APT组织的恶意样本中经常同时出现。不同颜色对应不同的类簇,节点越大表明该关键特征的度越高,即与其相关的节点越多,譬如组织8的度为658,其以较大的节点呈现在图4中;边越粗表明两个特征的语义关系越紧密,经常出现在相同APT组织的恶意样本中,譬如“组织2”和“Defense Evasion”的关系权重为1 280,是图中最为紧密的关系。最终,该关系图谱共计生成668个关键特征和9 548条重要关系,平均聚类系数为0.946,以簇的形式将不同APT组织的关键特征及语义关系表征,并将关系紧密的节点关联在一起。

通常而言,相同APT组织利用的恶意软件具有较高的相似性,其攻击模式以及关键特征的依赖关系更紧密。图4主要体现了APT组织的静态和动态特征在语义层面上的关联关系,这种语义特征的共现模式能够被后续图神经网络更有效地学习和建模,从而提升攻击行为分析和APT溯源的精准度。譬如,在该关系图谱中,具有相似攻击模式的APT组织在图中表现为高度集中的局部结构,其关键特征之间的连通性更强,如“组织2”和“Defense Evasion”战术行为紧密相连,表明该组织倾向于采用规避检测的方法进行攻击。

在APT溯源过程中,该关系图谱不仅揭示了APT组织内部的攻击行为模式,还为APT攻击溯源提供了关键的关联依据。由于相同APT组织利用的恶意软件通常具有较高的行为相似性,其攻击模式及关键特征的依赖关系表现为更紧密的语义共现结构。在对未知恶意软件样本的分析中,APTEye可通过匹配该样本的行为特征与图谱中的APT组织关键特征,推测其可能的攻击来源。譬如,当检测到“shell32.ShellExecute”函数与“Defense Evasion”战术的组合时,系统可依据图谱推理该攻击行为属于特定APT组织。此外,该方法能够在攻击行为的演变过程中追踪APT组织的战术变迁,例如某些APT组织可能在不同时期采用不同的攻击方式,但其核心攻击手法仍保持高度一致。最终,该方法能更好地被后续图神经网络学习,通过表2和表3的实验结果证明APTEye显著提升了APT组织的溯源能力,为高级网络威胁分析提供了高效、可解释的智能分析途径。

为验证APTEye在APT组织攻击行为分析及溯源研究方面具有语义增强的作用,本节对APT组织8的关键技战术行为特征及API函数进行关系图谱分析,即进一步细化图4的节点及关系,生成如图5所示的“组织8”的攻击语义特征关系图谱。该实验用以揭示APT攻击行为、技战术映射及API函数特征的语义关联,进一步验证APTEye在APT行为建模和溯源分析中的适用性。

图5可知,整个组织的恶意软件特征分为四个层次,反映了动静态特征抽取与行为语义增强算法所挖掘的关键特征及其语义关联,使得静态和动态特征的语义信息得以有效捕获,并为后续图神经网络学习提供优质的输入表示。具体而言,图5构建了APT组织、攻击技战术、关键技术行为及API函数之间的多层次共现关系,其中上部分绿色节点及区域为ATT&CK框架的技术序号和战术序号,左部分黄色节点及区域为典型的攻击战术行为,右部分蓝色节点及区域为具体技术行为,下部分红色节点及区域为内核攻击操作行为对应的API函数。

此外,图5清晰地展现了API函数与各类攻击行为之间的语义映射关系,并呈现出一对多的映射模式,即同一类攻击技战术往往涉及多个API函数,而某些API函数可能同时参与不同的攻击技战术。譬如,组织8通常利用ATT&CK框架中的“T1027”技术编号执行高隐蔽攻击,其战术行为为“Defense Evasion”,依赖“Obfuscated Files or Information”技术,通过文件混淆手段来实施防御逃逸和躲避系统检测,并对应关键API函数“kernel32.VirtualAllocEx”和“kernel32.VirtualProtect”,分别用于分配内存空间和修改内存保护属性。为更直观地反映其语义关系,本文在上述关系的基础上增加了5条红色辅助线,图中的辅助线表示了组织8中ATT&CK序号“T1027”、战术行为为“Defense Evasion”、“Obfuscated Files or Information”技术、API函数“kernel32.VirtualAllocEx”和“kernel32.VirtualProtect”的关联关系。由于该映射关系在该组织的多个恶意软件样本中均被观测到,因此可以推断这些API函数的使用与“Defense Evasion”战术高度相关,且不同APT组织可能通过相似的API调用序列实现攻击行为映射,更好地被后续模型学习,最终APTEye获得最佳的溯源效果。

通过上述实验,表明本文提出的APTEye模型是有效的,动静态特征抽取确保了攻击行为的完整性,使得关键API函数能够与具体攻击技战术建立准确的映射关系,从而更好地被图神经网络学习,提升了溯源分析的精准度。这种语义映射不仅能够用于攻击行为分类,还能为APT溯源提供更加精细化的特征支持。譬如,不同APT组织对相同API函数的使用模式可能有所不同,这种细粒度差异可作为溯源过程中的关键判别依据。此外,该实验结果与第3.2节APTEye的溯源实验结果相呼应,进一步验证了动静态语义增强在APT组织行为建模和攻击溯源中的作用。综上,图5所展示组织8的攻击行为语义映射不仅揭示了攻击技战术与API函数之间的多对多关联关系,同时也表明APTEye模型能够有效捕获APT组织的行为特征关系,这种语义关系增强了APT攻击行为溯源的可解释性与准确性。

3.4 逃逸对抗型APT攻击的溯源及鲁棒性分析实验

为更好地评估APTEye的鲁棒性和扩展性,以及对逃逸型、对抗型APT攻击恶意样本的溯源分析能力。本文结合静态特征中识别的ATT&CK框架知识,将具有逃逸、混淆、伪装、躲避检测、对抗溯源(含对抗样本)等技战术特点的样本聚集,譬如包含“Obfuscated Files or Information”“Defense Evasion”“Virtualization/Sandbox Evasion”“Hide Artifact”等战术行为或技术行为的样本。随后,在尽可能保证测试集中包含更多逃逸型、对抗型APT攻击恶意样本的情况下,按照3∶7的比例随机划分训练集和测试集,从而降低训练集样本标注知识,以验证各模型的鲁棒性和对抗性。

通过实验得到本文方法的F1值为75.35%,准确率为76.24%。为进一步验证本文方法的有效性,计算了本文方法与对比方法各评价指标的差值,结果如表5所示。由表5可知,本文方法在小样本标注及逃逸对抗型APT攻击溯源场景下,相较于对比方法具有更好的性能。此外,该实验F1值和准确率的提升效果(即F1值差值和准确率差值)大部分高于表2中常规样本集的提升效果,充分说明本文方法通过动静态语义行为增强能有效识别逃逸型、对抗型APT攻击恶意样本,能在少量样本标注的场景下溯源APT攻击,并取得更好的性能和鲁棒性。

4  结 语

本文提出基于动静态语义行为增强的APT攻击溯源方法,设计行为特征语义增强及表征算法,通过Attack2Vec将静态API特征和攻击链映射,利用APISeq2Vec增强动态API序列的时间语义关系,并且构建动静态特征对齐和行为语义聚合的算法将APT攻击恶意软件的动态和静态特征融合。实验结果表明,本文方法能准确地溯源高隐蔽恶意软件所属的APT组织,优于对比方法,通过动态和静态行为特征高效表征APT组织的ATT&CK技战术行为,这将为高隐蔽攻击行为检测及溯源提供新思路和学术探索。在下一步工作中,作者将结合控制流图和抽象语法树开展特征融合,尝试利用大语言模型来辅助APT溯源和推理研究。

参考文献

[1]

MARTÍN LIRAS L FDE SOTO A RPRADA M A. Feature analysis for data-driven APT-related malware discrimination[J]. Computers & Security2021104: 102202. DOI: 10.1016/j.cose.2021.102202 .

[2]

杨秀璋, 彭国军, 李子川, . 基于Bert和BiLSTM-CRF的APT攻击实体识别及对齐研究[J]. 通信学报202243(6): 58-70. DOI: 10.11959/j.issn.1000-436x.2022116 .

[3]

YANG X ZPENG G JLI Z Cet al. Research on entity recognition and alignment of APT attack based on Bert and BiLSTM-CRF[J]. Journal on Communications202243(6): 58-70. DOI: 10.11959/j.issn.1000-436x.2022116(Ch ).

[4]

STOJANOVIĆ BHOFER-SCHMITZ KKLEB U. APT datasets and attack modeling for automated detection methods: A review[J]. Computers & Security202092: 101734. DOI: 10.1016/j.cose.2020.101734 .

[5]

XIONG C LZHU T TDONG W Het al. Conan: A practical real-time APT detection system with high accuracy and efficiency[J]. IEEE Transactions on Dependable and Secure Computing202219(1): 551-565. DOI: 10.1109/TDSC.2020.2971484 .

[6]

LANGNER R. Stuxnet: Dissecting a cyberwarfare weapon[J]. IEEE Security & Privacy20119(3): 49-51. DOI: 10.1109/MSP.2011.67 .

[7]

ALSHAMRANI AMYNENI SCHOWDHARY Aet al. A survey on advanced persistent threats: Techniques, solutions, challenges, and research opportunities[J]. IEEE Communications Surveys & Tutorials201921(2): 1851-1877. DOI: 10.1109/COMST.2019.2891891 .

[8]

黄克振, 连一峰, 冯登国, . 一种基于图模型的网络攻击溯源方法[J]. 软件学报202233(2): 683-698. DOI: 10.13328/j.cnki.jos.006314 .

[9]

HUANG K ZLIAN Y FFENG D Get al. Method of cyber attack attribution based on graph model[J]. Journal of Software202233(2): 683-698. DOI: 10.13328/j.cnki.jos.006314(Ch ).

[10]

WANG Q QYAN H BHAN Z H. Explainable APT attribution for malware using NLP techniques[C]//Proceedings of the 2021 IEEE 21st International Conference on Software Quality, Reliability and Security (QRS). New York: IEEE Press, 2021: 70-80. DOI: 10.1109/QRS54544.2021.00018 .

[11]

CALISKAN AYAMAGUCHI FDAUBER Eet al. When coding style survives compilation: De-anonymizing programmers from executable binaries[C]//Proceedings of the 2018 Network and Distributed System Security Symposium. Reston: Internet Society, 2018. DOI: 10.14722/ndss.2018.23304 .

[12]

HONG K FCHEN C CCHIU Y Tet al. Ctracer: Uncover C&C in advanced persistent threats based on scalable framework for enterprise log data[C]//Proceedings of the 2015 IEEE International Congress on Big Data. New York: IEEE Press, 2015: 551-558. DOI: 10.1109/BigDataCongress.2015.86 .

[13]

李昂. 基于恶意代码基因的攻击组织特征提取方法研究[D]. 北京: 北京邮电大学, 2021. DOI: 10.26969/d.cnki.gbydu.2021.001346 .

[14]

LI A. Research on features extraction method of attack group based on malicious code gene[D]. Beijing: Beijing University of Posts and Telecommunications, 2021. DOI: 10.26969/d.cnki.gbydu.2021.001346(Ch ).

[15]

ALRABAEE SKARBAB E BWANG L Yet al. BinEye: Towards efficient binary authorship characterization using Deep Learning[C]//Proceedings of the 24th European Symposium on Research in Computer Security (ESORICS). Cham: Springer International Publishing, 2019: 47-67. DOI: 10.1007/978-3-030-29962-0_3 .

[16]

ROSENBERG ISICARD GDAVID E. DeepAPT: Nation-state APT attribution using end-to-end deep neural networks[C]//Proceedings of 26th International Conference on Artificial Neural Networks (ICANN). Cham: Springer International Publishing, 2017: 91-99. DOI:org/10.1007/978-3-319-68612-7_11 .

[17]

ROSENBERG ISICARD GDAVID E O. End-to-end deep neural networks and transfer learning for automatic analysis of nation-state malware[J]. Entropy201820(5): 390. DOI: 10.3390/e20050390 .

[18]

HAN W JXUE J FWANG Yet al. APTMalInsight: Identify and cognize APT malware based on system call information and ontology knowledge framework[J]. Information Sciences2021546: 633-664. DOI: 10.1016/j.ins.2020.08.095 .

[19]

MA S QZHANG X YXU D Y. ProTracer: Towards practical provenance tracing by alternating between logging and tainting[C]//Proceedings of the 2016 Network and Distributed System Security Symposium. Reston: Internet Society, 2016:1-15. DOI: 10.14722/ndss.2016.23350 .

[20]

BERADY AJAUME MTONG V V Tet al. From TTP to IoC: Advanced persistent graphs for threat hunting[J]. IEEE Transactions on Network and Service Management202118(2): 1321-1333. DOI: 10.1109/TNSM.2021.3056999 .

[21]

IRSHAD HCIOCARLIE GGEHANI Aet al. TRACE: Enterprise-wide provenance tracking for real-time APT detection[J]. IEEE Transactions on Information Forensics and Security202116: 4363-4376. DOI: 10.1109/TIFS.2021.3098977 .

[22]

FireEye. Going ATOMIC: Clustering and associating attacker activity at scale[EB/OL]. [2022-10-15].

[23]

宋文纳, 彭国军, 傅建明, . 恶意代码演化与溯源技术研究[J]. 软件学报201930(8): 2229-2267. DOI: 10.13328/j.cnki.jos.005767 .

[24]

SONG W NPENG G JFU J Met al. Research on malicious code evolution and traceability technology[J]. Journal of Software201930(8): 2229-2267. DOI: 10.13328/j.cnki.jos.005767(Ch ).

[25]

吕杨琦, 王张宜, 杨秀璋, . 基于特征功能函数的APT样本分类方法[J]. 郑州大学学报(理学版)202355(2): 10-17. DOI: 10.13705/j.issn.1671-6841.2021417 .

[26]

Y QWANG Z YYANG X Zet al. A novel APT malware classification method based on feature function code[J]. Journal of Zhengzhou University (Natural Science Edition)202355(2): 10-17. DOI: 10.13705/j.issn.1671-6841.2021417(Ch ).

[27]

Zynamics. BinDiff[EB/OL]. [2022-10-15].

[28]

DUAN YLI XWANG J Het al. DeepBinDiff: Learning program-wide code representations for binary diffing[C]//Proceedings of the 2020 Network and Distributed System Security Symposium. Reston: Internet Society, 2020:1-16. DOI: 10.14722/ndss.2020.24311 .

[29]

LAURENZA GLAZZERETTI RMAZZOTTI L. Malware triage for early identification of Advanced Persistent Threat activities[EB/OL]. 2018: 1810.07321. DOI: 10.1145/3386581 .

[30]

ALRABAEE SSHIRANI PDEBBABI Met al. On the feasibility of malware authorship attribution[C]//Proceedings of the 9th Foundations and Practice of Security (FPS), Cham: Springer International Publishing, 2016: 256-272. DOI:org/10.1007/978-3-319-51966-1_17 .

[31]

KUMAR TSOMANI G. Origin information assisted hybrid analysis to detect APT malware[C]// Proceedings of the 17th International Conference on Information Systems Security (ICISS), Cham: Springer International Publishing, 2021: 75-93. DOI:org/10.1007/978-3-030-92571-0_5 .

[32]

SAINI NBHAT KASARAGOD VPRAKASHA Ket al. A hybrid ensemble machine learning model for detecting APT attacks based on network behavior anomaly detection[J]. Concurrency and Computation: Practice and Experience202335(28): e7865. DOI: 10.1002/cpe.7865 .

[33]

ROSENBLUM NZHU X JMILLER B P. Who Wrote This Code? Identifying the Authors of Program Binaries[M]//Proceedings of the 16th European Symposium on Research in Computer Security (ESORICS). Berlin: Springer, 2011: 172-189. DOI: 10.1007/978-3-642-23822-2_10 .

[34]

乔延臣, 云晓春, 张永铮, . 基于调用习惯的恶意代码自动化同源判定方法[J]. 电子学报201644(10): 2410-2414. DOI: 10.3969/j.issn.0372-2112.2016.10.019 .

[35]

QIAO Y CYUN X CZHANG Y Zet al. An automatic MaIware Homology identification method based on Calling habits[J]. Acta Electronica Sinica201644(10): 2410-2414. DOI: 10.3969/j.issn.0372-2112.2016.10.019(Ch ).

[36]

ABUHAMAD MABUHMED TMOHAISEN Aet al. Large-scale and language-oblivious code authorship identification[C]//Proceedings of the 2018 ACM SIGSAC Conference on Computer and Communications Security. New York: ACM, 2018: 101-114. DOI: 10.1145/3243734.3243738 .

[37]

XUAN C DODAO M H. A novel approach for APT attack detection based on combined deep learning model[J]. Neural Computing and Applications202133(20): 13251-13264. DOI: 10.1007/s00521-021-05952-5 .

[38]

SHANG L KGUO DJI Y Det al. Discovering unknown advanced persistent threat using shared features mined by neural networks[J]. Computer Networks2021189: 107937. DOI: 10.1016/j.comnet.2021.107937 .

[39]

WEI C XLI QGUO Det al. Toward identifying APT malware through API system calls[J]. Security and Communication Networks20212021: 8077220. DOI: 10.1155/2021/8077220 .

[40]

李腾, 乔伟, 张嘉伟, . 隐私保护的基于图卷积神经网络的攻击溯源方法[J]. 计算机研究与发展202158(5): 1006-1020. DOI: 10.7544/issn1000-1239.2021.20200942 .

[41]

LI TQIAO WZHANG J Wet al. Privacy-preserving network attack provenance based on graph convolutional neural network[J]. Journal of Computer Research and Development202158(5): 1006-1020. DOI: 10.7544/issn1000-1239.2021.20200942(Ch ).

[42]

LI Z TCHENG XSUN L Xet al. A hierarchical approach for advanced persistent threat detection with attention-based graph neural networks[J]. Security and Communication Networks20212021(1): 9961342. DOI: 10.1155/2021/9961342 .

[43]

谢丽霞, 李雪鸥, 杨宏宇, . 基于样本特征强化的APT攻击多阶段检测方法[J]. 通信学报202243(12): 66-76. DOI:10.11959/j.issn.1000-436x.2022238 .

[44]

XIE L XLI X OYANG H Yet al. Multi-stage detection method for APT attack based on sample feature reinforcement[J]. Journal on Communications202243(12): 66-76. DOI:10.11959/j.issn.1000-436x.2022238(Ch ).

[45]

CHEN T MDONG C Y M Qet al. APT-KGL: An intelligent APT detection system based on threat knowledge and heterogeneous provenance graph learning[J]. IEEE Transactions on Dependable and Secure Computing2022: 1-15. DOI: 10.1109/TDSC.2022.3229472 .

[46]

MILAJERDI S MGJOMEMO RESHETE Bet al. HOLMES: Real-time APT detection through correlation of suspicious information flows[C]//Proceedings of the 2019 IEEE Symposium on Security and Privacy (SP). New York: IEEE Press, 2019: 1137-1152. DOI: 10.1109/SP.2019.00026 .

[47]

李元诚, 罗昊, 王欣煜, . 基于溯源图和注意力机制的APT攻击检测模型构建[J]. 通信学报202445(3): 117-130. DOI:10.11959/j.issn.1000-436x.2024039 .

[48]

LI Y CLUO HWANG X Yet al. Construction of advanced persistent threat attack detection model based on provenance graph and attention mechanism[J]. Journal on Communications202445(3): 117-130. DOI:10.11959/j.issn.1000-436x.2024039(Ch ).

[49]

LI S FDONG FXIAO X Set al. NODLINK: An online system for fine-grained APT attack detection and investigation[C]//Proceedings of the 2024 Network and Distributed System Security Symposium. Reston: Internet Society, 2024:. DOI: 10.14722/ndss.2024.23204 .

[50]

ZHU T TYU J KXIONG C Let al. APTSHIELD: A stable, efficient and real-time APT detection system for Linux hosts[J]. IEEE Transactions on Dependable and Secure Computing202320(6): 5247-5264. DOI: 10.1109/TDSC.2023.3243667 .

基金资助

国家自然科学基金(62172308)

国家自然科学基金(U1626107)

国家自然科学基金(61972297)

国家自然科学基金(62172144)

贵州省科技重大专项计划(黔科合重大专项字[2024]014)

贵州省基础研究(自然科学)项目(黔科合基础-zk[2025]面上686)

AI Summary AI Mindmap
PDF (2549KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/