基于混合自编码器模型的XSS攻击检测研究

赵润钰 ,  赵生慧

盐城工学院学报(自然科学版) ›› 2026, Vol. 39 ›› Issue (1) : 17 -22.

PDF (847KB)
盐城工学院学报(自然科学版) ›› 2026, Vol. 39 ›› Issue (1) : 17 -22. DOI: 10.16018/j.cnki.cn32-1650/n.202601003
计算机应用研究

基于混合自编码器模型的XSS攻击检测研究

作者信息 +

Research on XSS Attack Detection Based on Hybrid Autoencoder Models

Author information +
文章历史 +
PDF (866K)

摘要

针对传统检测方法,包括基于规则的方法和传统深度学习模型难以适应新兴攻击技术,难以有效捕捉跨站脚本(Cross-site scripting, XSS)攻击载荷细微差异与上下文相关性的局限,提出了一种融合检测模型UBL-XSS。该模型创新性地结合了BERT、通用句子编码器和基于LSTM的自编码器3种深度学习技术,从多个维度捕获XSS攻击载荷的语义和句法特征,实现了基准数据集上99.95%的精确度和99.84%的召回率,显著优于文中提出的现有主要检测方法。

Abstract

To address the limitations of traditional detection methods, including rule-based approaches and conventional deep learning models, which struggle to adapt to emerging attack techniques and fail to effectively capture the subtle differences and contextual dependencies of cross-site scripting(XSS) payloads, this paper proposes a fusion detection model named UBL-XSS. The model innovatively integrates three deep learning techniques including BERT, universal sentence encoder, and LSTM-based autoencoders, to capture the semantic and syntactic features of XSS payloads from multiple dimensions. Experimental results demonstrate that UBL-XSS achieves a precision of 99.95% and a recall of 99.84% on benchmark datasets, significantly outperforming the state-of-the-art detection methods discussed in this study.

Graphical abstract

关键词

XSS攻击检测 / 自编码器 / BERT / USE

Key words

XSS attack detection; autoencoder; BERT; USE

引用本文

引用格式 ▾
赵润钰,赵生慧. 基于混合自编码器模型的XSS攻击检测研究[J]. 盐城工学院学报(自然科学版), 2026, 39(1): 17-22 DOI:10.16018/j.cnki.cn32-1650/n.202601003

登录浏览全文

4963

注册一个新账户 忘记密码

随着互联网技术的迅速发展,网络安全越来越引起人们的重视。在Web应用领域, 跨站脚本(cross-site scripting,XSS)攻击是当前最普遍且危险的攻击方式之一,其核心机制在于攻击者成功地将恶意脚本注入到终端用户所信任的网站,让该脚本在用户浏览器上运行,进而窃取用户敏感信息或劫持用户会话1
传统的XSS攻击检测主要依赖于静态分析2和动态分析3,其中静态分析因无法捕获脚本动态行为,可能会忽略某些类型的XSS攻击;而动态分析严重依赖于实际执行,可能导致更高的计算开销和复杂攻击的潜在规避。为了克服这些限制,研究人员越来越多地转向基于机器学习(machine learning,ML)的方法4,包括决策树、随机森林、支持向量机、逻辑回归等,并取得了不同程度的成功5-6。例如,Zhou等7利用贝叶斯网络和威胁情报进行检测,在恶意记录占比45%的测试场景下仍能达到98.54%的准确率。
近年来,深度学习(deep learning,DL)进一步推动了XSS攻击检测的发展8。Krishnan等9结合ML模型和深度神经网络模型,并采用URL编码与字典映射机制,提出了一种混合堆叠集成学习方法,在多个数据集上实现了超过99.5%的检测准确率;Lei等10研究发现长短期记忆神经网络(long short-term memory networks, LSTM)在检测复杂XSS载荷时,精确度和召回率均优于传统机器学习方法。
随着人工智能技术的发展,通过特征建模和行为分析,人工智能技术能够有效识别潜在的恶意脚本,显著提升检测的自动化水平和准确性11。Peng等12提出基于Transformer的XSS检测方法,通过自动生成变形攻击向量解决数据集单一及陈旧问题,效果显著优于传统的深度学习模型。基于Transformer的架构,特别是双向编码器表征法(bidirectional encoder representations from transformers, BERT)的出现,在最近的一些研究中已将它应用于网络钓鱼检测13和SQL注入识别14等,但BERT在XSS攻击检测中的应用尚未得到充分探索。
本文在上述文献的基础上,构建了一个多维异构特征空间,通过同时捕获细粒度的词语语义和更广泛的句子上下文,来弥补单一模型的局限性,从而增强XSS攻击载荷的特征提取能力,有效缓解在面对新型攻击变体时出现的性能下降问题。具体方法如下:
1) 利用通用句子编码器(universal sentence encoder,USE)在XSS攻击检测领域提供的独特优势,将文本数据转换为捕获语义相似性和含义的高维向量15,从而挖掘整个Web内容的潜在意图,更有效地识别潜在的XSS攻击;
2) 利用BERT的双向编码器结构精准捕获深层句法和复杂的语义依赖关系,从而产生高质量的特征表示,显著提高检测的准确性和泛化能力;
3) 采用基于LSTM的自编码器(LSTM-based autoencoder, LSTM-AE)模型作为无监督ML模型,通过识别异常模式来检测网络流量中的未知攻击。
本文的主要贡献如下:1) 将LSTM-AE模型的无监督学习机制与基于句子的多维嵌入技术相结合,开发了一种专门为XSS攻击检测设计的混合DL模型,使系统在适应演变攻击策略和识别新型混淆技术的同时,提升整体检测性能;2) 整合3种DL架构的句子级嵌入表示,提出了一种经消融研究验证的嵌入融合机制,在基准数据集上实现了99.95%的精确度和99.84%的召回率;3) 设计了基于分类结果的反馈循环,对自编码器进行无监督的“自我纠正”,以弥补单一模型的局限性。

1 UBL-XSS混合模型

1.1 数据预处理

本文开发的专门为XSS攻击检测设计的混合DL模型为UBL-XSS混合模型,该模型采用3种基于句子的技术,融合了LSTM自动编码器、BERT双向编码器和USE编码器的互补优势,实现对XSS攻击的高效检测。

UBL-XSS混合模型结构如图1所示。该模型在对XSS攻击进行检测前,首先要对检测代码片段进行预处理,具体处理方法如下:

1) 针对待检测代码片段执行解码操作,以识别其恶意或良性特征。攻击者常采用混淆策略规避传统过滤与验证机制的检测,这些混淆手段包括Unicode转换、十六进制编码、Base64加密及UTF-7编码等多种技术。本研究提出的解码模块能够穷举各类编码可能性,将经过混淆的代码还原至标准格式。

2) 对经过解码操作形成标准格式的代码进行规范化处理,旨在消除解码后数据中的冗余信息与噪声。具体规范化操作包括:剔除空格、过滤特殊符号、移除协议前缀“http://”,并将函数参数统一转换为参数字符串标识“param_strings”。

3) 对数据进行分词处理,目的是将字符串序列分解成包含输入字符、子字符或子组的片段,从而最小化数据长度并降低复杂性,进而减少了数据处理的成本。通过分词保留了代码片段中重要的词,提高了检测的准确性。

1.2 UBL-XSS检测模型构建

经过预处理后的数据集需要通过自编码器进行预训练,以提升对异常结构的感知能力。自编码器是一种无监督的神经网络,通过最小化重构误差,从数据集中学习最佳的编码-解码方案。为确保模型学习到高阶特征表示,瓶颈层的维度应显著小于输入维度,从而实现对原始载荷的压缩与关键模式提取。

为了提升训练效果,本文融合了LSTM自动编码器(LSTM-AE编码器)、BERT模型和USE模型的互补优势,提出了一种经消融研究验证的嵌入融合机制。该机制使用标准交叉熵损失函数通过测量预测类别与真实标签之间的差异进行训练,计算公式如下:

L=-i=1Nyilogy^i+(1-yi)log(1-y^i)

式中:L代表标准交叉熵损失函数;yi{0,1}表示第i个样本的实况标签;y^i表示恶意类别的预测概率;N代表样本总数。

通过最小化该损失函数,模型学会了有效区分正常输入和攻击输入。这种架构不仅能够捕获表面级词汇特征,还对深层句法和语义模式进行建模,使其能够抵御XSS攻击中普遍存在的对抗技术,如字符编码、脚本注入和标签操作。

1.2.1 LSTM-AE模型

LSTM-AE编码器结构如图2所示。在XSS攻击检测场景中,LSTM-AE编码器通过学习XSS有效负载和正常网络请求的潜在表示,能够识别异常模式并提取具有判别能力的特征。对于任意输入样本X,编码器提取其潜在表示的公式如下:

zAE=Encoder(X)R128

式中: zAE为编码器提取的128维特征。

由于模型学习了正常请求和攻击的潜在表示差异,编码器提取的特征包含了“偏离正常模式”的信息,因此即使对于训练时未见过的新型XSS攻击变种,编码器仍能生成异常的特征向量,为后续分类器提供判别信号。

1.2.2 通用句子编码器

USE是一个强大的自然语言处理框架,能够将不定长文本输入转换为固定维度的向量表示,从而编码语义信息和上下文特征16。该架构采用在大规模文本语料上训练的深度神经网络,生成高保真度的嵌入向量以捕获语义关系和句间相似性。USE已在多种NLP任务中表现出色,包括文本分类、语义相似度度量和情感分析。本研究将USE作为XSS攻击检测的特征提取机制,利用其生成Web内容有意义表示的能力,从而提升检测模型性能。数学上,句子s的USE嵌入zUSE表示如下:

zUSE=fUSE(s)Rm

式中:m是USE嵌入的维度,大小为512。

1.2.3 BERT

BERT利用多头自注意力机制和深度双向编码来捕获自然语言序列中的复杂依赖关系17,其架构如图3所示。该模型以预处理阶段生成的token IDs、注意力掩码和段IDs序列三元组作为输入,将它们转换为128维的上下文隐藏状态序列,转换公式如下:

Hi=BERT(Ii, Ai, Si)=[h1, h2,, h128]

式中:IiAiSi分别表示预处理阶段生成的token IDs、注意力掩码和段IDs;Hi表示输入序列中由128个数据组成的每个token的隐藏状态向量。

对应于特殊分类token[CLS]的向量,记为zBERT,作为BERT模型输出的第一个位置的隐藏状态向量,如公式(5)所示。

zBERT=Hi[0]Rdbert

式中:dbert表示BERT模型的隐藏层维度。

向量zBERT聚合了整个输入序列的全局语义信息,作为下游分类任务的句子级表示。

1.3 特征拼接与分类

根据图1的流程,将BERT和USE分别生成的嵌入进行融合,再与LSTM自编码器中编码器提取的特征进行连接,得到新的用于XSS攻击分类的特征向量zfused。连接公式如下:

zfused=[zBERT, zUSE, zAE]R

式(6)中得到的融合特征向量输入到全连接层进行特征向量学习后,再传递到Softmax进行分类,用于正常Web请求或XSS攻击的最终分类,计算公式如(7)所示。

y^=softmax (Wzfused+b)

式中:Wb分别代表权重和偏置;输出ŷ∈R2包含输入分别属于正常、恶意类别的预测概率。

2 实验与分析

2.1 实验环境与数据集

为评估UBL-XSS检测模型的有效性,本文采用的实验环境为Ubuntu 22.04操作系统、Intel® Xeon® Platinum 8352V CPU@2.10 GHz处理器、90 GB RAM内存、NVIDIA vGPU-32 GB GPU、Python 3.12编程语言、PyTorch 2.5.1DL框架、CUDA 12.4并行计算环境,数据集来自文献[18]。该数据集中包含约20万条正常网络请求的负样本、4万条恶意攻击请求的正样本,样本类别用[0,1]表示,其中0代表良性,1代表恶意。

实验时,将正样本和负样本混合后,按照8∶

1∶1的比例随机划分为训练集、验证集和测试集,其中训练集用于模型的参数学习,验证集用于模型的超参数优化与调整,而测试集则用于模型的最终性能评估。

2.2 评价指标

本文采用准确率A、精确度P、召回率RF1值作为评价指标来评估模型的性能,各指标计算公式如下:

A=TP+TNTP+TN+FP+FN×100%
P=TPTP+FP×100%
R=TPTP+FN×100%
F1=2×P×RP+R×100%

式中:TPTNFPFN分别表示真正例、真负例、假正例、假负例。

2.3 模型参数设置

在构建混合DL模型时,涉及多个参数的设置与优化。通过实验过程反复调试各项参数,最终使模型性能达到最佳状态,此时各参数配置如表1所示。

2.4 消融实验

为了验证UBL-XSS混合模型的有效性,通过消融实验对来自于文献[18]的数据集进行验证,得到各指标的结果如表2所示。由表2可知,仅使用LSTM-AE效果不佳,4项指标均最低;使用BERT与LSTM自编码器的组合即BERT-LSTM自编码器方案,4项指标均较USE与LSTM自编码器的组合即USE-LSTM自编码器方案高,但仍然比集成三者输出方案的UBL-XSS混合模型低。

为直观展示消融实验中各模块对模型性能的影响,根据表2的实验结果绘制了不同配置下各评价指标的对比图,如图4所示。

2.5 对比实验

为验证本文所提UBL-XSS混合模型的优越性,对XSS攻击检测的几种常用方法在来自于文献[18]的数据集上开展对比测试,结果如表3所示。表3的实验结果表明,UBL-XSS混合模型在所有性能指标上均表现最佳,这可能是由于:1) UBL-XSS混合模型融合了3种不同的句子嵌入表示方法,能够从多个维度捕获XSS攻击载荷的语义和句法特征;2) LSTM-AE通过无监督学习识别异常模式,使系统能够适应演变的攻击策略并检测新型混淆技术;3) 优化的嵌入融合策略能够同时捕获局部句法模式和全局语义上下文。3个模型协同互补,使得本文提出的UBL-XSS混合模型在准确率、精确度、召回率以及F1分数上得到了进一步提升。

为便于清晰展示本文方法相对于其他深度学习方法在各个评价指标上的性能表现,依据表3实验结果绘制了对比图,如图5所示。

3 结论

针对XSS攻击载荷的复杂性与混淆性,提出了一种多维特征融合的检测模型UBL-XSS。该模型创新性地整合了BERT、USE以及LSTM-AutoEncoder模块,构建了多层次的句子级嵌入架构;通过全连接层学习来自每种技术的嵌入,在预测分类概率后传递给Softmax进行最终分类。实验结果表明,UBL-XSS在所有性能指标上均表现最佳,显著优于现有主流方案。

参考文献

[1]

SHARIF M H U. Web attacks analysis and mitigation techniques[J]. International Journal of Engineering Research & Technology (IJERT)2022: 10-12.

[2]

USHA GKANNIMUTHU SMAHENDIRAN P Det al. Static analysis method for detecting cross site scripting vulnerabilities[J]. International Journal of Information and Computer Security202013(1): 32-47.

[3]

王铃铜, 王慧玲, 徐苗, . 跨站脚本攻击检测与防御技术综述[J]. 计算机应用研究202441(3): 652-662.

[4]

KAUR JGARG UBATHLA G. Detection of cross-site scripting (XSS) attacks using machine learning techniques: a review[J]. Artificial Intelligence Review202356(11): 12725-12769.

[5]

THAJEEL I KSAMSUDIN KHASHIM S Jet al. Machine and deep learning-based XSS detection approaches: a systematic literature review[J]. Journal of King Saud University: Computer and Information Sciences202335(7): 101628.

[6]

ALHAMYANI RALSHAMMARI M. Machine learning-driven detection of cross-site scripting attacks[J]. Information202415(7): 420.

[7]

ZHOU YWANG P C. An ensemble learning approach for XSS attack detection with domain knowledge and threat intelligence[J]. Computers & Security201982: 261-269.

[8]

TADHANI J RVEKARIYA VSORATHIYA Vet al. Securing web applications against XSS and SQLi attacks using a novel deep learning approach[J]. Scientific Reports202414: 1803.

[9]

KRISHNAN M, LIM Y, PERUMAL Set al. Detection and defending the XSS attack using novel hybrid stacking ensemble learning-based DNN approach[J]. Digital Communications and Networks202410(3): 716-727.

[10]

LEI LCHEN MHE Cet al. XSS detection technology based on LSTM-attention[C]//2020 5th International Conference on Control, Robotics and Cybernetics (CRC). October 16-18, 2020, Wuhan, China. IEEE, 2020: 175-180.

[11]

SOHAIL AAYISHA BHAMEED Iet al. Deep neural networks based meta-learning for network intrusion detection[J]. arXiv preprint arXiv:2023.

[12]

PENG B TXIAO X YWANG J. Cross-site scripting attack detection method based on transformer[C]//2022 IEEE 8th International Conference on Computer and Communications (ICCC). December 9-12, 2022, Chengdu, China. IEEE, 2023: 1651-1655.

[13]

RIFAT NAHSAN MCHOWDHURY Met al. BERT against social engineering attack: phishing text detection[C]//2022 IEEE International Conference on Electro Information Technology (EIT). May 19-21, 2022, Mankato, MN, USA. IEEE, 2022: 1-6.

[14]

LODHA SGUNDAWAR A. SQL injection and its detection using machine learning algorithms and BERT[C]//International Conference on Cognitive Computing and Cyber Physical Systems. November 26-27, 2022, Bhimavaram, Andhra Pradesh. Springer Nature Switzerland, 2022: 3-16.

[15]

AL-SMADI MHAMMAD M MAL-ZBOON S Aet al. Gated recurrent unit with multilingual universal sentence encoder for Arabic aspect-based sentiment analysis[J]. Knowledge-Based Systems2023261: 107540.

[16]

FATTOH I EKAMAL ALSHEREF FEAD W Met al. Semantic sentiment classification for COVID-19 tweets using universal sentence encoder[J]. Computational Intelligence and Neuroscience20222022: 6354543.

[17]

GARDAZI N MDAUD AMALIK M Ket al. BERT applications in natural language processing: a review[J]. Artificial Intelligence Review202558(6): 166.

[18]

赵斯祺, 代红, 王伟. 基于Transformer-LSTM模型的跨站脚本检测方法[J]. 计算机应用与软件202340(9): 327-333

[19]

FANG YLI YLIU L. DeepXSS: Cross site scripting detection based on deep learning[C]//Proceedings of the 2018 International Conference on Computing and Artificial Intelligence. March 12-14, 2018, Chengdu, China. ACM, 2018: 47-51.

[20]

LUO JXU G Q. XSS attack detection methods based on XLNet and GRU[C]//2021 4th International Conference on Robotics, Control and Automation Engineering (RCAE). November 4-6, 2021, Wuhan, China. IEEE, 2021: 171-175.

基金资助

滁州市委网信办横向项目(HX2022122)

AI Summary AI Mindmap
PDF (847KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/