基于图数据增强和对比学习的隐私保护网络流量分析

祁龙云 ,  曹永健 ,  周剑 ,  刘全 ,  崔惠 ,  张浩天

武汉大学学报(理学版) ›› 2026, Vol. 72 ›› Issue (3) : 329 -338.

PDF (1194KB)
武汉大学学报(理学版) ›› 2026, Vol. 72 ›› Issue (3) : 329 -338. DOI: 10.14188/j.1671-8836.2025.0001
智能安全与可信计算

基于图数据增强和对比学习的隐私保护网络流量分析

作者信息 +

Privacy-Preserving Network Traffic Analysis Based on Graph Data Augmentation and Contrastive Learning

Author information +
文章历史 +
PDF (1222K)

摘要

为了在保护数据隐私的条件下实现加密网络流量中的异常行为识别,提出一种基于图数据增强和对比学习的隐私保护网络流量分析方案。首先,基于网络行为日志构建数据溯源图,以刻画节点间的交互关系和行为因果链;其次,提出基于差分隐私的图数据增强方法,利用指数机制(Exponential Mechanism)对节点和边进行评分与选择性扰动,生成隐私保护的增强视图;然后,基于增强视图构建对比学习任务,提升节点表示的一致性和判别性;最后,采用归纳图神经网络(GraphSAGE)学习节点表示并完成异常行为识别。实验结果表明,本文方案在Streamspot数据集上的精确率和准确率均高达99%,比Streamspot方案分别高25个百分点和33个百分点,能有效识别加密网络流量中的恶意流量,且在隐私保护能力方面较对比方案更具优势。

Abstract

In order to identify anomalous behavior in encrypted network traffic while protecting data privacy, a privacy-preserving network traffic analysis scheme based on graph data augmentation (GDA) and contrastive learning is proposed.First, a provenance graph is constructed from network behavior logs to capture interactions and causal dependencies among nodes. Then, a differential-privacy-based graph data augmentation method is proposed, where the exponential mechanism is used to score and selectively perturb nodes and edges to generate privacy-preserving augmented views. Next, contrastive learning tasks are built on these augmented views to improve the consistency and discriminability of node representations. Finally, GraphSAGE is used to learn node representations and identify anomalous behaviors. Experimental results show that on the Streamspot dataset, the proposed scheme achieves both precision and accuracy as high as 99%, which are 25 percentage points and 33 percentage points higher than those of Streamspot method, respectively. The scheme can effectively identify malicious traffic in encrypted network traffic and shows greater advantages in privacy protection compared to baseline approaches.

Graphical abstract

关键词

图数据增强 / 对比学习 / 异常检测 / 图神经网络 / 隐私保护

Key words

graph data augmentation / contrastive learning / anomaly detection / graph neural networks / privacy-preserving

引用本文

引用格式 ▾
祁龙云,曹永健,周剑,刘全,崔惠,张浩天. 基于图数据增强和对比学习的隐私保护网络流量分析[J]. 武汉大学学报(理学版), 2026, 72(3): 329-338 DOI:10.14188/j.1671-8836.2025.0001

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

随着我国数字经济和未来网络通信的持续发展,各类新兴网络服务和互联网应用正以前所未有的速度渗透至人们生活的各个领域。相关技术的迅猛发展极大地便利了人们的工作和生活方式,但与此同时,海量网络流量的产生也使得网络空间中的流量分析和隐私保护面临日益严峻且复杂的挑战[1]。随着物联网和边缘计算的快速发展,网络流量持续增长,网络攻击事件也日益频发。恶意流量利用加密通信、协议变形等隐蔽手段,导致传统基于内容的入侵检测系统(Network-based Intrusion Detection System, NIDS)检测准确率下降,误报率与漏报率升高[2-4]。网络流量分析作为保障网络空间安全的重要手段,其核心任务是对网络中的异常行为进行检测与识别。该技术旨在对网络中传输的结构化或非结构化数据进行建模与理解,从而发现潜在的威胁模式。异常检测是实现这一目标的关键技术,旨在从正常通信行为中及时发现偏离分布的可疑事件,如命令控制通信、横向扫描与权限提升操作等。流量分析为行为建模提供了上下文语义基础,而异常检测则直接服务于识别潜在攻击行为这一核心安全需求。因此,精准的异常检测是实现有效网络流量分析、保障网络安全的关键所在。

在此背景下,如何准确、高效地检测加密网络流量中的恶意流量和异常行为,已成为保障网络空间安全的关键[5]。现有研究已从传统检测、机器学习检测、深度学习检测和图结构建模等多个方向展开探索。传统网络异常检测方法主要依赖签名匹配或内容检测,典型系统如Snort和Bro通过匹配已知攻击模式或协议字段实现入侵检测[6-7]。这类方法在明文流量环境下具有较高检测准确率,但在面对加密流量时,由于难以解析数据负载,其检测能力显著下降[8-9]。为适应加密流量环境,研究者进一步提出基于统计特征和机器学习的异常检测方法。Lotfollahi等[10]提出Deep Packet框架,基于深度神经网络从数据包长度、方向、时间间隔等特征中学习流量模式,用于加密流量分类与检测。Shapira等[11]利用无监督学习对加密流量中潜在异常模式建模,提升了对未知攻击的检测能力。随着深度学习技术的发展,Wang等[12]提出了一个基于深度学习的加密流量分析框架,通过整合数据集、特征构造和模型架构,分析了基于深度学习的加密流量分析所面临的挑战。近年来,基于图神经网络(Graph Neural Network,GNN)的方法在加密流量异常检测中得到了广泛应用。这些方法通过构建流量交互图,捕捉流量之间的复杂关系,从而有效识别异常行为。Fu等[4]提出了一种基于流量交互图分析的实时未知加密恶意流量检测方法,通过构建内存紧凑图捕获流量交互模式,利用图结构特征提升检测性能。Huoh等[13]将图卷积网络(Graph Convolution Network, GCN)应用于加密流量分类与异常检测,验证了图结构建模在捕获流量时序相关性方面的有效性。

除基于流量交互关系的检测方法外,基于数据溯源图的异常检测方法也在近年来的网络安全研究中受到关注。溯源图通过节点和边刻画系统对象之间的数据流和控制流关系,能够展示事件因果和来源链条,为异常检测提供重要上下文信息。现有数据溯源图异常检测方法主要包括基于误用的检测方法和基于异常的检测方法。基于误用的检测方法依赖预定义的攻击模式或专家知识匹配已知威胁,例如HOLMES通过匹配预先定义的攻击模式进行异常检测[14],POIROT基于多个系统指标进行关联分析并生成攻击图以识别异常[15]。然而,这类方法在应对未知攻击时存在局限,难以有效检测未包含在威胁情报中的新型攻击。基于异常的检测方法则通过学习系统正常行为模式识别偏离分布的活动。例如,StreamSpot方案通过分析信息流图检测入侵[16];Unicorn利用基于WL核方法的全图特征提取技术,在多变的网络环境中提升了检测效果[17];PROVDETECTOR通过分析溯源图中的路径信息检测恶意行为[18]。然而,现有方法仍存在对复杂因果链和长距离依赖建模不足、对动态流量场景适应能力有限、以及缺乏隐私保护机制等问题。

综上,国内外研究虽多聚焦于提升加密网络流量异常行为检测的准确率和效率[8-10,17-18],但仍存在以下关键局限:1) 传统内容检测性能退化:传统基于内容的入侵检测系统因无法解析数据负载而检测能力显著下降[8],基于签名的检测方法对加密或变形流量几乎无效,且在高动态网络环境下误报率与漏报率普遍偏高,影响实际部署效果和可靠性[9];2) 样本分布严重不均衡:实际网络环境中异常流量极为稀少,导致监督学习模型偏倚于多数类(正常流量),从而使得异常流量难以被准确识别[10,17-18];3) 隐私保护机制缺乏:现有方法常需要直接处理原始流量或构造高维行为特征,可能暴露用户身份、通信关系等敏感信息[19]

针对上述挑战,本文引入图数据增强(Graph Data Augmentation,GDA)与对比学习技术。通过将网络行为抽象为数据溯源图结构并利用其内在关联进行分析,摆脱对数据包内容的依赖,从而缓解传统内容检测在加密流量下的性能退化问题;通过基于差分隐私的图数据增强方法对节点和边进行选择性扰动,生成多个隐私保护的增强视图,在扩展训练样本结构分布的同时降低敏感关系泄露风险;进一步利用对比学习约束不同增强视图下节点表示的一致性和判别性,从而缓解异常样本稀缺导致的模型偏倚问题。本文主要贡献如下:

1) 提出了一种基于差分隐私的图数据增强方法。该方法采用指数机制对数据溯源图中的节点和边进行评分,并依据评分结果进行选择性扰动,生成满足差分隐私要求的增强视图,在保护用户网络行为隐私的同时提高模型对结构异常的鲁棒性。

2) 构建了一种基于图数据增强对比学习的GraphSAGE异常检测框架。该框架以GraphSAGE作为归纳式图编码器,利用增强视图构建正负样本对,并通过对比学习提升节点表示在不同视图下的一致性和判别性,从而增强模型对少数异常样本和边界样本的识别能力。

1  基础知识

1.1 归纳型图神经网络模型

在归纳型图神经网络中,GraphSAGE[20]作为一种代表性方法,具有较强的通用性和扩展能力。

为建模网络流量中的信息传播关系,定义一个数据溯源图G=V,E,Xv,XE,Te。其中,V代表图中的节点集;E代表图中的边集,是图中的信息流;Xv:VRd是一个函数,将每个节点映射到其特征向量,d是节点特征维度;XE:ERk是一个函数,将每条边映射到其特征向量,k是边特征向量的维度;Te是每条边eE的时间戳(即边标签),用于记录每个交互事件的发生时间,反映网络流量的时序特性。

在此基础上,GraphSAGE可用于对溯源图中的节点进行嵌入表示学习。GraphSAGE的核心在于前向传播算法(Forward Propagation,FP),该算法通过聚合节点邻居的特征更新节点的表示。给定节点vV及其邻居集合Nv,GraphSAGE通过以下步骤计算节点的嵌入表示。

1) 节点特征初始化。初始时,v节点的嵌入表示为其节点特征:

hv0=Xvv

其中,hv0Rd是节点vV的初始特征,维度为d

2) 聚合邻居特征。对于第ii=1,2,,K,节点v的邻居节点uNv的特征是通过一个聚合函数进行聚合而得到的。常用的聚合函数包括均值聚合器、池化聚合器以及LSTM聚合器。对于均值聚合器,第k层中邻居节点特征的聚合hNv(k)表示为:

hNv(k)=AGGREGATE(k)hu(k-1):uNv=1|N(v)|uNvhu(k-1)

其中,AGGREGATE(k)表示对第k层节点特征的聚合操作。

3) 节点特征更新。节点v的表示通过聚合其自身特征和邻居特征得到:

hv(k)=gWkCONCAThv(k-1),hv(k)

其中,WkR2d×d是第k层的权重矩阵;g是激活函数(例如ReLU);CONCAT操作将节点的自身特征和邻居的聚合特征连接起来;hv(k)Rd是节点v在第k层的嵌入表示。

4) 最终嵌入表示。经过K层前向传播后,节点v的最终嵌入表示为:

zv=hvK

其中,zvRd是节点v的低维嵌入表示,能够捕捉到节点的局部结构信息和其在图中的上下文。

5) 训练与损失函数。在训练阶段,本研究引入对比学习和增强后的数据溯源图优化节点嵌入表示。对于异常检测问题,将图中的节点分为正常节点和异常节点,并定义交叉熵(Cross-entropy)损失函数:

CE=-vVyvlogy^v+1-yvlog1-yv

其中,yv是节点v的真实类别标签,yv0,1分别代表正常和异常节点;y^v是预测概率。

与传统方法不同,GraphSAGE能够泛化到新的、未见过的节点甚至全新的图上。通过采样固定大小的邻居,GraphSAGE能够有效处理像数据溯源图一样的大规模图。

1.2 差分隐私

Dwork提出的差分隐私(Differential Privacy, DP)[21]是一种保护数据隐私的数学框架。其核心思想是通过向原始数据中添加噪声,使得任何个体的加入或移除对整个数据集的分析结果影响最小,从而保障个体的隐私。形式化地,对于任意两个相邻数据集DD',若随机算法A满足:

PrADSeεPrAD'S+δ

则称算法A满足差分隐私。

其中,Pr表示概率;A(D)表示算法A在数据集 D上的输出;S为算法输出空间的任意子集;DD'为仅相差一个个体的相邻数据集;ε是隐私参数,称为隐私预算,越小则隐私保护越强;δ是松弛参数,用于控制算法输出出现较大偏差的概率,通常取值较小。

差分隐私通过上述约束条件(即(6)式)确保攻击者即使获得算法的输出结果,也无法确定任意个体是否存在于数据集中,从而有效防止隐私泄露。

实现差分隐私的常用机制包括拉普拉斯机制、高斯机制和指数机制。其中,指数机制适用于离散对象选择问题,其基本思想是根据评分函数为候选对象赋予不同的选择概率,在保证高评分对象更可能被选中的同时,引入随机性以满足差分隐私要求。具体而言,设e表示候选对象,se表示候选对象e的评分函数,ΔS表示评分函数s的全局敏感性,则指数机制选择候选对象e的概率与(7)式成正比:

expεse2ΔS

其中,ε表示隐私预算,exp为指数函数。

本文的图数据增强过程需要从溯源图中的节点和边中选择扰动对象,属于离散对象选择问题。

2  本文方法

2.1 方案概述

本文融合GDA、差分隐私扰动、对比学习与GraphSAGE,构建完整的加密流量异常检测框架,如图1所示。

在一个隐蔽的入侵活动中,攻击者试图隐藏其恶意行为,但与恶意活动相关的节点仍然会表现出与正常节点不同的行为特征。例如,异常进程节点可能会同时与多个远程IP节点建立连接,表现出广泛的外部交互和随机连接行为,而正常进程节点一般仅会与少量可信服务器建立稳定连接,网络访问行为较为固定且规律,不会频繁发起异常的远程访问或跨域通信。这些异常节点的局部结构与良性节点存在明显差异,因此通过提取这些特征,模型能够学习不同节点的隐藏分布。

基于上述场景,本文将主机入侵检测问题形式化为图1中的异常节点检测问题,主要包括以下步骤:

1) 图构建与建模:基于网络行为日志构建数据溯源图,建模节点之间的交互关系和行为因果链,捕捉攻击活动的上下文信息与路径依赖特征;

2) 基于差分隐私的数据增强:在图数据增强过程中引入差分隐私中的指数机制,对图中节点及其边结构进行评分,并依据评分结果进行选择性扰动,生成满足差分隐私要求的多个增强视图,在保护用户隐私的同时提高模型对结构异常的敏感性;

3) 图对比学习训练:利用数据增强视图构建正负样本对,通过对比学习提升节点在不同视图下表示的一致性,从而缓解异常样本稀缺问题;

4) 节点级异常检测:采用归纳式图神经网络GraphSAGE对节点表示进行学习与更新,最终实现对未知加密流量中潜在恶意节点的识别与判定。

2.2 方案实现

2.2.1 预处理阶段

预处理阶段包括:1) 图构建与建模。与许多其他溯源图的异常检测[9-10,17-19]方法类似,本文首先采用CamFlow[22]全系统数据溯源采集机制,以流式模式收集主机的审计数据,并将其转换为溯源图以供后续分析。CamFlow构建了一个具有时间顺序的溯源图,为信息流的捕获提供了强大的安全性和完整性保证。随后,数据被分配到磁盘和内存中,本文将整个图存储在磁盘上以保留历史信息,同时在内存中维护一个有限大小的子图,用于训练和检测。这种存储策略保证了该框架的可扩展性和动态检测能力。

2) 基于差分隐私扰动的图数据增强。对于收集到的图数据,本文首先引入基于差分隐私扰动的图数据增强方法,通过对节点和边进行选择性扰动,生成不同的增强视图,以提高模型对结构变化的鲁棒性。本文提出了两种适用于图结构数据的通用数据增强方法,如表1所示。

节点扰动:给定图G,节点丢失将随机丢弃一定比例的顶点及其连接的边。选择扰动比例通常基于图的大小和密度,常设置为5%~20%,随机选定节点后,删除这些节点以及它们的边,以模拟信息的部分丢失。此操作引入的先验知识是丢失部分节点不会改变图的语义。每个节点的丢弃概率遵循默认的独立同分布(或任何其他分布),以保证扰动的随机性和多样性。

边扰动:通过随机增加或删除一定比例的边缘来扰动图中的连通性。扰动比例一般为现有边数的5%~10%,以保持操作的现实性和有效性。此操作假定图的语义对边缘连通性模式的变化具有一定的鲁棒性。同样遵循独立同分布添加/删除每条边缘,即可模拟真实世界中的连接变化,进一步丰富数据多样性。

本文通过引入scale参数控制增强强度。较大的scale值会导致更显著的增强变化,而较小的值则会产生较细微的变化。在模型训练和评估过程中,使用不同的scale值调整生成增强因子λ的正态分布的σ,具体地,将基础删除比例p0与由增强因子λ~N1,scaleσ2调整的比例相结合,得到最终的调整比例p=p0·λ

分别对图数据进行节点扰动、边扰动的增强操作,以观察不同增强方法对模型识别准确率和隐私保护效果的影响。在图数据增强过程中,为了满足差分隐私的指数机制,每个点/边e被选中的概率需与expεse2ΔS成正比,从而在增强操作中实现隐私保护。其中,exp为指数函数;ε为隐私参数;ΔS为评分函数S的全局敏感性;se为点/边e的评分函数打分值。

在图数据增强方法中,选取合适的敏感性和打分值对其结果至关重要。对于随机删点方法,本文将其敏感性定义为图中节点度数的最大值,同时为单个点定义其分数为该点的度数。对于随机删边方法,本文将其敏感性定义为图中点度数的最大值的平方,并为单条边定义其分数为该边所连两个点度数的乘积。基于上述定义,对图进行数据增强,能够确保这一过程满足差分隐私的要求,从而有效保护数据隐私。

2.2.2 图对比学习训练

为了进一步提高检测精度并减少误报,本文提出了一种基于GraphSAGE和对比学习的多模型训练框架(如图1的图对比学习训练部分所示),该算法的核心思想是通过多个子模型逐步学习不同类型的良性节点表示,从而降低对少数类别节点的误分类风险。同时,引入对比学习损失,以拉近同类节点间的嵌入距离,扩大不同类别节点间的特征差异,增强模型的判别能力。

受到视觉表示学习中对比学习最新进展[23-24]的启发,本文的图对比学习通过优化同一图结构中两种增强视图在潜在空间中的表征一致性实现。图对比训练部分由以下3个主要组件组成:

1) 图数据增强:给定图G,对其进行图数据增强以获得两个相关视图Gi,Gj,作为正样本对,其中Gi^qi|G,Gj^qj|G分别来自不同的增强策略。

2) 投影头:投影头是一种非线性变换g,将增强表示,即增强后的视图输入GraphSAGE编码器进行特征编码后获得的表示,映射到另一个潜在空间中,在该空间中计算对比损失[23]。在图对比学习中,采用两层感知机(MLP)获得两个最终的图嵌入表示zi,zj

3) 对比损失:定义一个对比损失函数l,用于强制最大化正样本对zi,zj与负样本对之间的一致性。在此,本文使用了归一化的温度缩放交叉熵损失(NT-Xent)[23]

在GraphSAGE预训练期间,随机采样一个包含N个图的小批次,并通过对比学习处理生成2N个增强图以及相应的对比损失优化。负样本对不是显式采样的,而是从小批次中的其他N-1个增强图中生成[23]。定义余弦相似度函数为simzn,i,zn,j=zn,iTzn,j/zn,izn,j,第n个图的NT-Xent损失定义为:

ln=-logexpsimzn,i,zn,j/τn'=1,n'nNexpsimzn,i,zn',j/τ

其中,τ表示对比学习的温度参数。在训练过程中,首先对原始图结构进行数据增强,生成两组具有语义差异的图视图。随后,通过调整τ,优化相似性度量,以平衡正负样本间的对比关系。在前向传播阶段,模型分别生成原始图和增强图的节点表示,并基于余弦相似度构建对比损失,通过反向传播逐步优化模型参数,学习更具判别性的节点嵌入。在监督训练阶段,模型在已学习的节点表示基础上接入一个分类头,通常为全连接层,利用带标签的训练数据进行有监督训练。通过最小化交叉熵损失函数,模型被引导学习不同语义角色下良性节点的分类边界,从而增强对节点类别的判别能力。然而,当异常节点的特征分布与正常节点高度相似时,模型仍可能产生假阴性。为解决这一问题,可通过比较预测节点类型与其真实类型之间的偏差,识别潜在的异常节点。如果某节点在执行阶段被错误分类,说明其分布特征与训练阶段学习到的良性节点存在显著差异,因此可能为执行恶意任务的异常节点。该机制有助于在高隐蔽性的入侵行为中识别并定位数量极少的异常节点。

2.2.3 节点级异常检测

为提升分类的可靠性,设计了基于概率置信度的筛选策略,用于减少误报。利用基于概率的分类决策机制,通过计算模型对节点类型的置信度判断其性质。若某节点在至少一个子模型中被正确分类,则将其判定为良性节点;否则视为异常节点,从而进一步提升检测的准确性和稳健性。

本文的核心算法如算法1所示。第8~9行:计算两个节点嵌入z1z2之间的相似性损失,以优化特征学习过程;第10行:采用对比损失函数,使得同类节点距离更近,异类节点距离更远;第11~12行:计算交叉熵损失;第13行:计算总损失,β用于调整两者的权重,保证分类任务和对比学习任务的平衡。第14行:执行反向传播更新模型参数;第16~26行:置信度筛选,计算Softmax归一化后的分类概率,遍历所有活跃节点v进行置信度筛选,只有当最大概率Mv,Cv远大于次大概率Mv,Cv^时,才认为该节点分类正确。最后,训练完成后储存当前子模型Mcnt

3  实验分析

为了验证本文方案的有效性并确保实验结果的可复现性,所有实验均在统一的高性能计算平台上进行。硬件环境方面,实验设备配备了NVIDIAGeForce RTX 4090显卡。软件环境方面,操作系统选用Ubuntu 20.04 LTS。本文提出的模型基于Python 3.8.10语言编写,深度学习框架采用PyTorch 1.12.1,图数据处理与神经网络库采用PyTorch Geometric 2.1.0。为保证结果的可靠性,所有实验均重复10次并取平均值,以确保实验结果的稳定性与可复现性。

3.1 StreamSpot数据集

StreamSpot是一个开源数据集[25],使用SystemTap工具记录了五种正常的浏览行为(5个正常的工作负载,包括视频游戏、YouTube、文件下载、CNN 和电子邮件)以及一种恶意行为(通过下载驱动的攻击)。该攻击细节模拟了一个命令和控制(C&C)场景,其中攻击者利用Firefox的漏洞,在受害者点击攻击者控制的URL后进行攻击。一旦进入系统,攻击者就利用Flash漏洞获得了root权限。StreamSpot数据集[25]对每种行为重复测试100次,生成了600个图表。每个图表平均有27 792 491条边和822 998个节点。

3.2 威胁模型

在本研究中,主要聚焦于检测和追踪入侵活动在主机上的异常行为。对于APT攻击,假设对手具有以下特点。

隐蔽性:攻击者不会简单地执行攻击,而是有意识地隐藏其恶意行为,试图将其与大量的正常背景数据混合在一起,使受害系统表现得像是正常模式,增加检测难度。

持久性:入侵活动往往持续较长时间,攻击者可能会在系统内隐藏一段时间,逐步推进攻击步骤,而非一蹴而就。

频繁使用零日漏洞:攻击者通常利用零日漏洞攻击系统,因此假设在训练阶段并没有任何攻击模式的先验知识。

在溯源图中留下攻击模式:为了完成不同于正常活动的恶意行为,攻击者的行为会在溯源图中留下某些攻击模式,这些模式会使攻击者节点的局部结构与同一标签的正常节点不同。

3.3 评价指标

在异常检测任务中,为了全面评价模型的性能,本文使用了精确率(Precision)、召回率(Recall)、准确率(Accuracy)以及F1值(F1-score)4个评价指标。这些指标各自的作用和含义如下。

精确率(Precision):是模型预测为异常的样本中实际为异常的比例。该指标衡量了模型在检测出异常样本时的准确性。高精确率表明模型预测为异常的样本大多数是真实的异常。精确率定义如(9)式所示。

Precision=TPTP+FP×100%

召回率(Recall):表示所有真实异常样本中被模型正确识别为异常的比例。它反映了模型的检测覆盖率,即有多少异常样本被成功捕获。高召回率说明模型漏检的异常样本较少。召回率定义如(10)式所示。

Recall=TPTP+FN×100%

准确率(Accuracy):衡量了模型在所有样本中的总体正确性,包括正常样本和异常样本。该指标可以提供模型整体性能的直观评价,但在数据不平衡的情况下可能失去参考价值。准确率定义如(11)式所示。

Acuuracy=TP+TNTN+TP+FN+FP×100%

F1-score是精确率和召回率的调和平均,尤其适用于数据不平衡的场景。在异常检测任务中,F1值能综合反映模型在检出异常和避免误判方面的平衡性能。F1值高,表明模型在精确率和召回率之间取得了更好的平衡。F1-score定义如(12)式所示。

F1-score=2×Precision×RecallPrecision+Recall×100%

在上述公式中,TP表示被模型正确预测为异常的实际异常样本数;TN表示被模型正确预测为正常的实际正常样本数;FP表示被模型错误预测为异常的实际正常样本数(即误报);FN表示被模型错误预测为正常的实际异常样本数(即漏报)。

通过这些指标的组合,可以更加全面地评估模型在异常检测任务中的表现,并根据实验结果对模型进行优化和改进。

3.4 实验结果和分析

将本文方法(在扰动比例为1%时)与StreamSpot方案[16]进行对比实验,实验结果如表2所示。StreamSpot方案[16]是一种专为处理流式异构图数据设计的经典检测算法,其通过监控信息流图的动态变化、计算图间相似性得分实现对异常行为的实时识别;由于该方法采用聚类核心机制,其原始评估未包含召回率与F1-score。本文选取StreamSpot[16]作为主要对比基线,主要基于以下3点考量:其一,作为该数据集的官方基线方法,与其对比能最直接地验证本方法在相同任务上的有效性提升;其二,与Holmes[14]等基于规则的误用检测不同,StreamSpot[16]与本文均致力于发现未知攻击,任务属性一致;其三,现有优秀图检测方案(如Unicorn[17])通常直接在原始无噪数据上训练,未引入隐私约束,将其与本文基于差分隐私扰动的模型直接对比并不公平。综上,与StreamSpot[16]的对比旨在说明,即便在严格隐私保护条件下,本文方法仍能超越该领域的经典流式基线。

表2可知,本文方法的精确率和准确率均高于StreamSpot方案[16],分别达到99%和99%,较StreamSpot方案[16]分别提高了25个百分点和33个百分点,说明本文方法在识别攻击样本时更具可靠性和一致性。此外,本文方法的召回率(95%)和F1-score(97%)也较高,进一步凸显了本文方法在整体检测能力上的优势。该结果表明,本文方法在保持高精度的同时,能够识别大部分异常样本,具备更强的实用性。这是因为,本文方法引入了图数据增强和对比学习相结合的训练机制。一方面,图数据增强策略通过在结构上进行扰动,有效扩展了训练样本的分布范围,提升了模型对潜在异常结构的鲁棒性;另一方面,对比学习通过拉近相似图结构的表示、扩大不同类型样本之间的特征差异,使得模型在表示空间中更清晰地区分正常与异常行为。这种对比监督信号加强了模型对边界样本的识别能力,从而提高了检测的精确率、召回率和F1-score,最终实现了更优的整体性能。

除此之外,为了说明本文提出方法的平均损失,图2展示了训练过程中各轮次(Epoch)对应的平均损失(Loss)变化趋势。可以观察到,Loss在前10轮迅速下降,从初始的约185下降至接近于10,随后趋于平稳,表明模型在前期已经完成了有效的收敛。该结果说明所提方法在训练初期具有较快的收敛速度,并且具备较强的拟合能力。

3.5 消融实验

本文还进一步研究了不同数据增强强度以及是否使用对比学习方法对实验结果的影响。

对于数据增强,本文做了以下两个方面的探究:1) 图中节点的扰动比例;2) 图中边的扰动比例。对于节点扰动和边扰动,本文选取了10%、15%、20%和25%的扰动比例,该设置能够在不过度增加实验规模的前提下,较为充分地覆盖从轻度扰动到较强扰动的增强范围,从而便于观察模型性能随增强强度变化的整体趋势。实验结果分别如表3表4所示。可以看出,适度的节点或边扰动能够提升模型对局部结构变化的鲁棒性,但当扰动比例过高时,图中的关键结构信息会被破坏,导致节点上下文表示不稳定,从而影响异常节点的识别效果。相比节点扰动,边扰动整体表现更优,说明在StreamSpot数据集中,节点本身及其局部邻域对异常行为识别具有较强语义作用,直接删除节点更容易破坏攻击行为链条;而适度改变边连接关系能够在保留主体节点信息的同时增加结构多样性,因此更有利于模型学习稳健表示。综合来看,过高的扰动比例会削弱异常行为的关键结构特征,进而降低模型对少数异常样本的识别能力。

本文还探究了对比学习技术对于提出方法的影响。本文在模型中移除对比学习模块,仅保留图数据增强部分。使用相同的加密网络流量数据集,以10%的边扰动比例,在测试集上评估两组模型的精确率、召回率、准确率和F1-score等指标,实验结果如表5所示。实验结果表明,采用对比学习技术使F1-score由91%提升至97%,说明该技术对于异常检测效果的提升有重要影响。

除此之外,本文对是否使用差分隐私进行消融实验,结果如表6所示。实验结果表明,使用符合差分隐私概率分布进行点和边的随机选择对于异常检测的效果影响较小。尽管在使用差分隐私的情况下召回率降低了1个百分点,但这对于方法的整体识别异常的能力几乎没有影响。而使用差分隐私可以保护用户的隐私信息。

4  结 语

本文探讨了如何通过图数据增强和对比学习技术嵌入溯源图异常检测提高入侵检测系统的准确性和效率,同时确保数据隐私的安全。具体而言,该方法通过提取图结构中节点的上下文信息,实现了对隐蔽且复杂的APT攻击的早期发现与跟踪。与现有方法相比,本文方法通过溯源图建模减少对数据包内容的依赖,通过图数据增强和对比学习缓解异常样本稀缺带来的模型偏倚,并通过差分隐私机制降低网络行为数据中的敏感信息泄露风险。与当前主流的检测模型相比,本文方法在精确率、召回率和F1分数上均优于Streamspot方案,展现出更优的攻击检测能力。此外,本文所提出的基于溯源图的模型更有效地利用了图数据增强和对比学习弥补恶意样本的不足,同时引入差分隐私机制以保护用户隐私。通过对比不同扰动下的增强方式,实现了隐私保护强度的动态调整。然而,本研究也存在一些局限性。首先,本文的方法主要针对特定类型的网络攻击,面对更加复杂和多变的攻击手段时,模型的泛化能力有待提升。此外,实验数据集的规模和多样性也限制了模型在不同实际应用场景中的表现。针对上述不足,未来的研究可以从以下几个方面展开:1) 提升模型的实时性和适应性,针对高动态网络环境,优化差分隐私机制和图神经网络的计算效率,以实现更快速的实时检测和响应;2) 多层次防御策略的集成,将本文的方法与其他网络安全防御机制相结合,构建多层次的综合防御体系,提高整体网络安全水平;3) 实地应用与验证,在实际网络环境中部署和测试所提出的入侵检测系统,评估其在真实场景下的性能和可行性,并根据反馈进行优化和改进。

参考文献

[1]

张成磊, 付玉龙, 李晖, . 6G网络安全场景分析及安全模型研究[J]. 网络与信息安全学报20217(1): 28-45. DOI:10.11959/j.issn.2096-109x.2021004 .

[2]

ZHANG C LFU Y LLI Het al. Research on security scenarios and security models for 6G networking[J]. Chinese Journal of Network and Information Security20217(1): 28-45. DOI:10.11959/j.issn.2096-109x.2021004(Ch ).

[3]

PAPADOGIANNAKI EIOANNIDIS S. A survey on encrypted network traffic analysis applications, techniques, and countermeasures[J]. ACM Computing Surveys202154(6): 1-35. DOI:10.1145/3457904 .

[4]

ALWHBI I AZOU C CALHARBI R N. Encrypted network traffic analysis and classification utilizing machine learning[J]. Sensors202424(11): 3509. DOI:10.3390/s24113509 .

[5]

FU C PLI QXU K. Detecting unknown encrypted malicious traffic in real time via flow interaction graph analysis[EB/OL]. [2024-09-13]. DOI: 10.14722/ndss.2023.23080 .

[6]

方滨兴, 贾焰, 李爱平, . 重构网络空间安全防御模型——SARPPR[J]. 网络空间安全科学学报20242(1): 2-12. DOI:10.20172/j.issn.2097-3136.240101 .

[7]

FANG B XJIA YLI A Pet al. SARPPR: Reconstructing cyberspace security defense model[J]. Journal of Cybersecurity20242(1): 2-12. DOI:10.20172/j.issn.2097-3136.240101(Ch ).

[8]

ROESCH M. Snort — lightweight intrusion detection for networks[C]// Proceedings of the 13th USENIX conference on System administration. New York: ACM. 1999: 229-238. DOI: 10.5555/1039834.1039864 .

[9]

PAXSON V. Bro: A system for detecting network intruders in real-time[J]. Computer Networks199931(23-24): 2435-2463. DOI:10.1016/S1389-1286(99)00112-7 .

[10]

GARCÍA SGRILL MSTIBOREK Jet al. An empirical comparison of botnet detection methods[J]. Computers and Security201445: 100-123. DOI:10.1016/j.cose.2014.05.011 .

[11]

LANSKY J, ALI S, MOHAMMADI Met al. Deep learning-based intrusion detection systems: A systematic review[J]. IEEE Access20219: 101574-101599. DOI:10.1109/ACCESS.2021.3097247 .

[12]

LOTFOLLAHI MJAFARI SIAVOSHANI MSHIRALI HOSSEIN ZADE Ret al. Deep packet: A novel approach for encrypted traffic classification using deep learning[J]. Soft Computing202024(3): 1999-2012. DOI:10.1007/s00500-019-04030-2 .

[13]

SHAPIRA TSHAVITT Y. FlowPic: Encrypted Internet traffic classification is as easy as image recognition[C]//IEEE INFOCOM 2019 - IEEE Conference on Computer Communications Workshops (INFOCOM WKSHPS). New York: IEEE Press, 2019: 680-687. DOI:10.1109/INFCOMW.2019.8845315 .

[14]

WANG Z HFOK K WTHING V L L. Machine learning for encrypted malicious traffic detection: Approaches, datasets and comparative study[J]. Computers & Security2022113: 102542. DOI:10.1016/j.cose.2021.102542 .

[15]

HUOH T LLUO YLI P Let al. Flow-based encrypted network traffic classification with graph neural networks[J]. IEEE Transactions on Network and Service Management202320(2): 1224-1237. DOI:10.1109/TNSM.2022.3227500 .

[16]

MILAJERDI S MGJOMEMO RESHETE Bet al. HOLMES: Real-time APT detection through correlation of suspicious information flows[C]//2019 IEEE Symposium on Security and Privacy (SP). New York: IEEE Press, 2019: 1137-1152. DOI:10.1109/SP.2019.00026 .

[17]

MILAJERDI S MESHETE BGJOMEMO Ret al. POIROT: Aligning attack behavior with kernel audit records for cyber threat hunting[C]//Proceedings of the 2019 ACM SIGSAC Conference on Computer and Communications Security. New York: ACM, 2019: 1795-1812.. DOI:10.1145/3319535.3363217 .

[18]

MANZOOR EMILAJERDI S MAKOGLU L. Fast memory-efficient anomaly detection in streaming heterogeneous graphs[C]//Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining. New York: ACM, 2016: 1035-1044. DOI:10.1145/2939672.2939783 .

[19]

HAN X YPASQUIER TBATES Aet al. Unicorn: Runtime provenance-based detector for advanced persistent threats[C]//Proceedings 2020 Network and Distributed System Security Symposium. San Diego: Internet Society, 2020: 1-18. DOI:10.14722/ndss.2020.24046. DOI:10.14722/ndss.2020.24046 .

[20]

WANG QHASSAN W ULI Det al. You are what you do: Hunting stealthy malware via data provenance analysis[EB/OL]. [2024-09-13]. DOI: 10.14722/ndss.2020.24167 .

[21]

朱蓓佳, 李娜, 陈晶, . 基于对比学习的域名生成算法加密流量检测技术[J]. 武汉大学学报(理学版)202571(4): 517-525. DOI:10.14188/j.1671-8836.2024.0034 .

[22]

ZHU B JLI NCHEN Jet al. Encrypted traffic detection of domain generation algorithm based on contrastive learning[J]. Journal of Wuhan University (Natural Science Edition)202571(4): 517-525. DOI:10.14188/j.1671-8836.2024.0034(Ch ).

[23]

HAMILTON W LYING RLESKOVEC J. Inductive representation learning on large graphs[EB/OL]. 2017arXiv: 1706.02216. DOI: 10.48550/arXiv.1706.02216 .

[24]

DWORK C. Differential privacy[M]//Automata, Languages and Programming. Berlin: Springer, 2006: 1-12. DOI:10.1007/11787006_1 .

[25]

PASQUIER THAN X YGOLDSTEIN Met al. Practical whole-system provenance capture[C]//Proceedings of the 2017 Symposium on Cloud Computing. New York: ACM, 2017: 405-418. DOI:10.1145/3127479.3129249 .

[26]

CHEN TKORNBLITH SNOROUZI Met al. A simple framework for contrastive learning of visual representations[EB/OL]. 2020arXiv: 2002.05709.

[27]

HE K MFAN H QWU Y Xet al. Momentum contrast for unsupervised visual representation learning[C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2020: 9726-9735. DOI:10.1109/CVPR42600.2020.00975 .

[28]

GOYAL AWANG GBATES A. R-CAID: Embedding root cause analysis within provenance-based intrusion detection[C]//2024 IEEE Symposium on Security and Privacy (SP). New York: IEEE Press, 2024: 3515-3532. DOI:10.1109/SP54263.2024.00253 .

基金资助

国家电网有限公司科技项目(5700-202318304A-1-1-ZN)

AI Summary AI Mindmap
PDF (1194KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/