面向优化的大语言模型黑盒越狱攻击研究综述

陶佳玲 ,  黄松 ,  高心怡 ,  方勇 ,  曲豫宾 ,  李瑞阳 ,  陆江涛

四川大学学报(自然科学版) ›› 2026, Vol. 63 ›› Issue (02) : 241 -258.

PDF (1239KB)
四川大学学报(自然科学版) ›› 2026, Vol. 63 ›› Issue (02) : 241 -258. DOI: 10.19907/j.0490-6756.250250
大模型在网络安全漏洞挖掘中的创新应用前沿进展

面向优化的大语言模型黑盒越狱攻击研究综述

作者信息 +

A review of black-box jailbreak attacks on large language models for optimization

Author information +
文章历史 +
PDF (1268K)

摘要

大型语言模型(Large Language Models,LLMs)在自然语言处理领域展现出强大的能力,但其安全漏洞,尤其是越狱攻击已成为当前的核心挑战。越狱攻击利用精心构造的对抗性提示突破模型的安全对齐机制,揭示了基于人类反馈强化学习(Reinforcement Learning from Human Feedback,RLHF)等对齐技术的局限性。当前基于模版或者手工设计的越狱方法因其成功率低且泛化性差,在持续迭代的LLMs安全机制下迅速失效。而基于优化的越狱方法凭借其自动生成对抗性提示的能力,在攻击成功率和隐蔽性方面表现显著,能够有效规避常规检测手段。针对白盒攻击对梯度信息的依赖与迁移性差等问题,本文聚焦黑盒优化范式,首次系统性地将现有越狱方法归纳为4类框架:基于遗传算法的优化、基于强化学习的优化、基于模糊测试的优化和基于LLMs对抗生成的优化。深入剖析各类方法的核心机制、技术优势与约束。本文的主要贡献在于提出一种新颖的分类体系与研究视角,明确指出现有防御手段在实时性、泛化性和攻防平衡方面的严重不足,并进一步倡导构建动态化防御架构与标准化评估基准,为探索LLMs在对抗环境中的安全性与性能平衡机制提供理论支持与实践指引。

Abstract

Large Language Models (LLMs) have demonstrated remarkable capabilities in Natural Language Processing (NLP).However, their security vulnerabilities, particularly jailbreak attacks, pose a critical challenge.These attacks circumvent safety alignment mechanisms through carefully crafted adversarial prompts, revealing the limitations of alignment techniques like Reinforcement Learning from Human Feedback (RLHF).Template-based or manually crafted jailbreak methods typically exhibit low success rates and poor generalization, and they rapidly become obsolete as LLM safety mechanisms evolve.In contrast, optimization-based methods automatically generate adversarial prompts, leading to higher success rates and better stealthiness that effectively bypass common detection mechanisms.To overcome the limitations of white-box attacks, such as their reliance on gradients and limited transferability, the review investigates the black-box optimization paradigm and presents the first systematic taxonomy of jailbreak methods: Genetic Algorithm (GA)-based, Reinforcement Learning (RL)-based, Fuzzing-based, and LLM-based Adversarial Optimization.We delve into the core mechanisms, technical strengths, and limitations of each category.The primary contribution of this survey is proposing a novel taxonomy that critically examines existing defenses' deficiencies in real-time performance, generalizability, and attack-defense balance.It further advocates for dynamic defense architectures and standardized benchmarks, thereby providing a theoretical foundation and practical guidance for balancing the security and performance of LLMs in adversarial settings.

Graphical abstract

关键词

大语言模型 / 优化 / 越狱攻击 / 越狱防御

Key words

LLMs / optimization / jailbreak attack / jailbreak defence

引用本文

引用格式 ▾
陶佳玲,黄松,高心怡,方勇,曲豫宾,李瑞阳,陆江涛. 面向优化的大语言模型黑盒越狱攻击研究综述[J]. 四川大学学报(自然科学版), 2026, 63(02): 241-258 DOI:10.19907/j.0490-6756.250250

登录浏览全文

4963

注册一个新账户 忘记密码

近年来,大型语言模型(Large Language Models,LLMs)如GPT-41、Claude2和LLaMA3等,在自然语言处理领域展现出强大的生成与推理能力,其应用已逐步扩展到教育4、医疗5和金融6等社会关键行业领域。然而,随着模型能力的指数级增长,其潜在的安全风险也日益凸显。其中,越狱攻击作为能系统性突破LLMs内容审查和安全防护边界的对抗策略,已成为AI安全研究的关键前沿。这不仅因为其直指大语言模型价值对齐的潜在漏洞,而且其大范围地影响了基于LLMs的各种应用,让人们对其使用安全性产生了深度怀疑。
越狱攻击的本质是通过构造特定语义模式或对抗样本,诱导LLMs突破预设的道德准则和内容审核边界,生成包含暴力、歧视以及隐私泄露等危害性内容7。这一现象暴露了当前基于RLHF8的安全对齐技术的脆弱性。研究表明,即使经过严格安全训练的模型,在面对语义混淆、多轮对话诱导或知识隐写等攻击策略时,仍可能产生违背设计者意图的输出。更值得警惕的是,攻击者可通过“模型自我越狱”技术,直接利用目标模型生成对抗性样本,形成自动化攻击链路9
为了全面总结现有的越狱技术,不同调查研究者提出了自己的越狱技术分类。Jin等10对LLMs和VLMs(Vision Language Models)的越狱攻击方法和防御策略进行了系统的调研和分析。Xu等11全面系统评估了在3种不同语言模型Vicuna、LLama和GPT-3.5Turbo中应用的9种攻击技术和7种防御技术的有效性,并且建立了评估LLMs安全性的综合框架。Yi等12根据目标LLM对攻击者的透明度,将越狱攻击方法分为黑盒攻击和白盒攻击,并进一步细化其中的分类。本文还强调了不同攻击技术和防御方法之间的关系,让研究人员对模型可能存在的安全风险和未来防御建设有了更加深入的理解。
尽管现有综述在技术罗列、方法对比和攻击分类方面提供了有价值的背景,但对特定攻击类别的内在逻辑、统一框架及演进趋势的深入分析仍显不足。本文则从一个新颖且具有显著潜力的视角切入,聚焦于基于优化的黑盒越狱攻击方法。传统基于优化的方法通常将越狱攻击视为离散的令牌优化问题,试图寻找最大化恶意响应的令牌组合,贪婪坐标梯度7(Greedy Coordinate Gradient,GCG)就是其中最典型的代表。但是这种优化需要访问模型的梯度信息,可扩展性和通用性较差,而且生成的越狱提示通常表达不自然,容易被基于困惑度的过滤策略识别。综上考虑,本综述研究的是在黑盒场景下的优化越狱攻击。与依赖手工技巧或白盒设置的传统方法不同,这类方法通过算法驱动,利用优化目标和搜索算法,自动寻找对抗性提示,展现出更强的自动化和泛化能力。本文旨在深入剖析其共性机制、设计原理与挑战趋势,填补现有研究在系统理解该类自动化黑盒攻击方法方面的空白,并为构建更安全的LLMs防御体系提供方法论支持。
基于优化的黑盒越狱攻击是利用迭代优化算法和黑盒反馈,系统性搜索能诱导目标大语言模型突破其安全限制、产生违规响应的特定对抗性输入的攻击方法。在本文中,我们主要将优化攻击分为4大类:基于遗传算法的优化、基于强化学习的优化、基于模糊测试的优化和基于LLMs对抗生成的优化。基于遗传算法13的优化是一种受生物进化启发的方法,通过模拟自然选择中的选择、交叉和变异演变,迭代生成和改进候选提示。基于强化学习的优化是指通过强化学习等算法,将越狱行为建模为搜索问题,通过学习最优策略,并且结合奖励函数和策略优化,实现高效越狱。基于模糊测试的优化将软件工程的模糊测试方法与LLMs越狱攻击相结合,探索可能的越狱提示。基于LLMs对抗生成的优化是借助辅助的大语言模型,利用模型之间的攻防对抗,不断迭代优化以生成更加有效的提示。
本综述旨在助力研究人员以黑盒优化方法的独特视角,更深入地把握大语言模型越狱攻击的核心演进趋势与关键挑战。通过系统性地探索此类攻击揭示的LLMs安全漏洞,我们期望这项工作能为针对当下主流攻击方法设计更坚固、自适应的防御策略提供理论基础与实践启示,最终推动构建安全性更高、鲁棒性更强的大型语言模型。

1 研究方法

本研究采用系统文献综述法(Systematic Literature Review,SLR)14,对领域内相关文献进行系统性检索、筛选与综合分析。该方法的规范化研究流程与透明化操作,被国际学术界公认为是能有效控制偏倚风险、提高证据可信度的评估基准。具体实施过程如下所示。

1.1 研究内容

本文致力于系统性地梳理与分析面向优化的大语言模型黑盒越狱攻击技术。研究聚焦于基于优化算法的黑盒攻击范式,重点探讨其核心机理、演进路径及发展趋势,以揭示此类攻击方法的内在规律与共性特征。通过对现有研究的结构化归纳与对比分析,本文旨在构建一个统一的理解框架,为识别潜在威胁以及设计针对性防御机制提供理论依据,并为推动大语言模型安全性与鲁棒性研究奠定基础。

1.2 搜索策略

本研究采用系统性文献检索策略,覆盖多个主流学术数据库,包括Google Scholar、IEEE Xplore、ACM Digital Library和DBLP,同时纳入ArXiv预印本库,以确保涵盖该领域最新研究进展。检索以“LLMs”和“jailbreak”为核心关键词,时间范围定为2023年至2025年这3年。初步检索结果如下:Google Scholar返回979条记录,IEEE Xplore收录24篇文献,ACM Digital Library包含21项研究,DBLP索引159篇论文,ArXiv预印本库提供455篇相关文献。初步共获得了1638篇与LLMs越狱攻击相关的文献记录。鉴于各数据库存在文献交叉重复,执行去重处理后,最终保留1167篇有效研究论文。

1.3 纳入和排除标准

在初步获取相关文献后,制定以下纳入与排除标准对收集到的论文进行系统筛选,以有效过滤与本研究主题无关的文献,保留与研究问题直接相关且具有学术价值的研究成果。筛选标准基于文献类型、研究范畴和技术特异性3个维度建立,如下所示。

标准1 纳入期刊论文、会议论文及具有学术指导意义的预印本论文,排除学位论文、书籍章节与技术报告。

标准2 纳入原创性技术研究论文,排除实证研究报告及文献综述类文章。

标准3 纳入针对大语言模型文本生成场景的越狱攻击研究,排除视觉大模型、音频大模型、多模态模型以及代码生成、数学推理等非文本场景研究。

标准4 纳入黑盒攻击范式研究,排除白盒攻击范式研究。

标准5 纳入基于优化方法的攻击技术,排除与优化无关的攻击策略。

应用标准1对去重后的1167篇文献进行筛选,保留1023篇符合要求的文献。执行标准2后,技术报告与综述类文献被排除在外,剩余878篇原创研究。从标准3开始,基于论文标题、摘要及全文内容进行内容相关性判定,排除非文本生成场景研究后,文献量缩减至364篇。执行标准4保留黑盒攻击范式研究,排除白盒攻击范式后,剩余143篇文献。经标准5最终筛选,确定30篇符合“基于优化的黑盒越狱攻击”核心研究主题的关键文献。

1.4 滚雪球策略

为规避关键词检索可能造成的文献遗漏风险,本综述额外采用滚雪球法15作为补充检索策略,以确保研究文献的全面覆盖。具体实施过程中,系统追溯已收录文献的参考文献列表,依据预定的纳入标准评估其研究相关性。通过多轮迭代检索并执行重复文献排除程序,最终形成更加完备的文献数据库。经此补充检索流程,最后相关领域文献总量扩充至31篇。

1.5 数据提取和分析

基于最终筛选的研究文献,系统提取以下核心研究要素:攻击方法类别、技术实现路径、实验数据集、评估指标及主要研究结论。通过对提取信息的结构化归类与深度分析,识别当前研究趋势、技术挑战与现存局限。该流程设计确保了综述过程的系统性与可复现性,为后续批判性讨论奠定坚实的实证基础。

2 基于优化的大语言模型黑盒越狱攻击

尽管加强了对LLMs的安全培训,例如利用人类反馈的强制学习来对齐LLMs,但是他们仍然容易受到各种类型的越狱攻击。本节将依次介绍4种面向优化的大语言模型黑盒越狱方法:基于遗传算法优化的黑盒越狱攻击、基于强化学习优化的黑盒越狱攻击、基于模糊测试优化的黑盒越狱攻击和基于LLMs对抗生成优化的黑盒越狱攻击。4种分类方法的概述和参考文献见表1

2.1 基于遗传算法优化的黑盒越狱攻击

基于遗传算法优化的黑盒越狱攻击方法通常利用手工模板初始化提示种群,通过交叉与变异生成新提示。依赖模型输出反馈,即适应度函数来评估和筛选子代。这种迭代优化过程显著增强了突破黑盒LLMs安全机制的能力。其越狱攻击流程如图1所示。

Lapid等16提出的自动化越狱策略,通过适应度评估、交叉与变异迭代优化对抗性后缀,附加至查询诱导有害输出。虽具有跨模型迁移性,但生成的后缀可能含无意义字符,易被检测,导致隐蔽性不足。

Liu等17提出名为AutoDAN的越狱方法,以DAN47手工越狱提示为原型,采用分层遗传算法生成隐蔽恶意提示。该方法在段落级重组句子结构,以及在句子级用动量词评分替换关键词,目标最大化响应概率,并动态检测拒绝信号终止迭代。

Li等18设计的语义镜像越狱SMJ方法,将问题建模为多目标优化。该方法通过初始种群、基于双指标的筛选以及轮盘赌选择和句法改写迭代优化。这避免了对手工模板的依赖,但静态语义相似度阈值限制了其对动态防御的适应性。

为了进一步拓展越狱攻击的优化目标维度,Wang等19提出的BLACKDAN框架,创新应用了NSGA-Ⅱ算法,同时优化攻击成功率、隐蔽性和语义相关性等多目标。该方法整合交叉变异操作,遵循帕累托最优原则,支持用户定制优化目标,能生成高效、鲁棒且高隐蔽性的越狱提示。

Yu等20从生物感染和进化的过程中得到启发,提出了LLM-virus,将越狱视为进化优化与迁移学习问题。利用LLMs自身作为进化算子和评估器,通过迭代生成高效越狱模板,引导不安全响应。局部进化降低了计算成本,提升了有效性和伪装性。

为解决内容模糊和场景自适应问题, Wu等21提出基于遗传算法方法GeneShift,将恶意查询嵌入良性的上下文以规避拒绝关键词检测。通过动态优化多场景规则组合,利用种群进化机制寻找最佳组合诱导有害响应。

因为预定义策略空间规模的限制是关键瓶颈,Huang等22提出CL-GSO框架,将策略分解为角色、内容支持、上下文和沟通技巧等4个核心组件,将其扩展到839种组合。该方法通过遗传算法和自适应衰减高效探索优化策略选择。

基于遗传算法的越狱攻击依据适者生存的择优法则,不断迭代优化其内容,从而突破模型安全限制。该类越狱方法未来的趋势和面临的挑战如以下几方面。

1) 多目标优化:攻击目标从单一目标的攻击成功率(Attack Success Rate,ASR)扩展到多维度,如SMJ对攻击有效性与语义相似性进行优化。BlackDAN使用NSGA-Ⅱ算法优化ASR、语义相关性和隐蔽性,并支持按任务偏好灵活定制优化目标。

2) 隐蔽性升级:新一代方法,如Li等提出的SMJ,强调生成语义合理的提示,旨在同时突破模型安全机制并规避基于困惑度或异常词检测的防御。

3) LLMs赋能进化:利用强大LLMs本身作为进化操作,直接生成高质量候选提示,提升了提示的多样性和隐蔽性,标志着攻击向自主进化演进。

4) 依赖性与泛化性:该类方法严重依赖人工初始模板,搜索受限且易陷局部最优;策略针对特定模型设计,迁移到更强对齐模型时效果显著下降。

5) 计算效率低下:多代进化需要大量对目标模型的频繁查询,加之随机搜索需探索大量无效解,导致高计算开销和冗长的收敛时间,难以实时响应动态防御。

6) 防御策略的迫切需求:随着攻击隐蔽性的持续升级,传统静态规则检测和基于困惑度过滤的防御策略已经难以抵挡越来越先进的越狱攻击方法,结合语义分析以及上下文感知建模等技术开发动态高效的防御手段已经迫在眉睫。

基于遗传算法的黑盒越狱攻击正朝着多目标协同优化、隐蔽性深度增强及模型智能驱动的方向演进,然而当前仍面临初始策略依赖性强与计算效率瓶颈等核心挑战。未来发展可能需要融合迁移学习等轻量化优化技术,同时引入LLMs辅助变异的语义可控生成方法,并构建对抗防御的实时自适应策略,以此全面提升攻击的实际应用价值与鲁棒性表现。

2.2 基于强化学习优化的黑盒越狱攻击

基于强化学习优化的黑盒越狱攻击利用强化学习算法,让“攻击代理”智能体与目标大模型交互,把模型的响应当作奖励信号,动态优化对抗提示生成策略。代理逐步学会绕过模型的安全防护,产生高隐蔽性和强攻击性的指令。相比遗传算法随机搜索,策略梯度算法优化路径更稳定、高效。其越狱攻击流程如图2所示。

Chen等23提出RLbreaker方法,将提示优化建模为策略搜索问题,使用PPO(Proximal Policy Optimization)算法优化提示突变策略。该方法以目标模型响应与原始输出的余弦相似度为奖励,提升攻击效果与样本质量。相比,RL-JACK24在架构和算法上与RLbreaker相似,但它更侧重于设计丰富上下文来应对复杂对话场景。

受“逃离迷宫”游戏启发,Lin等25提出了一种基于多智能体强化学习的越狱方法PathSeeker。该方法构建问题变异体与模板变异体,利用词汇丰富度与恶意评分联合构建奖励。该方法克服RLbreaker和RL-JACK依赖代理模型输出的局限,在GPT-4o-mini等多种模型上展现了高ASR。

Jawad等26提出的QROA框架,仅通过查询-响应接口工作,设计奖励函数驱动后缀的令牌级离散优化策略。同时框架还引入了Q-Learning在有限查询下协调探索与利用,规避局部最优,高效生成强攻击性后缀。

Jha等27提出的LLMSTINGER方法,采用双反馈强化学习:目标模型的二元攻击反馈和字符串相似性检查器的Token级惩罚信号。后者驱动后缀语义模式对齐历史成功路径,抑制无效探索以提升效率。

Wang等28提出RLTA方法,将LLM生成能力嵌入RL框架,创新使用BLEU分数构建动态奖励函数,量化输出与预设有害字符串的语义匹配度,驱动迭代优化以实现精准攻击。实验显示出强泛化性,但依赖代理模型且覆盖率低。

为突破现有语义相似度方法的预设依赖局限,Lee等29提出的黑盒越狱攻击方法xJailbreak,联合强化学习与嵌入空间分析,将恶意提示语义迁移至良性空间,在保持意图一致下生成高效越狱提示,实现预设无关的语义转换。

Liu等30提出了基于强化学习的框架AUTO-RT,通过无预设模板自主探索优化策略。该方法采用终止低效搜索的动态资源分配策略和降阶近似模型生成密集奖励的渐进式奖励跟踪机制,协同克服奖励稀疏性,提升大规模策略空间搜索效能。

Guo等31提出自动红队训练框架JailbreakR1,是首次结合模仿学习、多样性探索和渐进式奖励,有效解决了越狱强化学习中知识缺失、局部最优和奖励稀疏等三大核心问题。

基于环境与问题描述关联性及结构关键性的发现,Tang等32提出了增强型越狱攻击方法SwordEcho,通过多奖励驱动强化学习,生成兼具语义对齐性与结构完整性的越狱提示,提升了在动态场景下的适应性。

利用强化学习算法进行优化的越狱攻击方法表现出同其他优化方法的差异与优势,该攻击方法面临的趋势和挑战如下几个方面。

1) Agent自主决策驱动攻击:如RL-breaker、PathSeeker等方法,将代理Agent作为动态对抗提示的生成器,通过其与目标LLM的交互,利用奖励函数和策略优化算法自主学习并持续优化攻击策略。

2) 高效策略化搜索:强化学习框架下的智能体,能根据目标模型的动态反馈,通过策略网络主动学习最优提示变异路径,显著优于遗传算法的随机全局搜索模式。

3) 代理模型能力的依赖:尽管强化学习Agent提升了越狱适应性,但其核心能力,如PathSeeker的语义扰动、LLMSTINGER的高效对抗提示生成,都高度依赖代理模型的能力边界。这种依赖性是该范式的固有局限,亟需通过知识蒸馏或迁移学习等技术突破。

4) 计算成本高昂:高昂的迭代计算成本是强化学习驱动越狱的核心挑战。其优化过程依赖多轮模型查询到策略更新的闭环迭代,单次迭代即需数十次目标LLM的完整推理调用和策略网络梯度计算。

5) 防御体系失效风险:基于强化学习的越狱攻击在多种开源和闭源模型中均呈现出良好的攻击效果,针对强安全对齐商业模型的突破性尤为显著。该现象表明,攻击策略的快速自主进化远超被动防御响应,同时现有RLHF对齐训练对语义级攻击存在本质脆弱性,亟需通过重构动态对抗训练范式破局。

上述趋势和挑战表明,基于强化学习的越狱攻击已演化为Agent自主决策、高效动态搜索与深度语义隐蔽性相耦合的新型威胁范式。这种通过智能体与目标模型对抗形成的自适应闭环,暴露了当前防御体系的关键缺陷,即现有安全对齐对动态攻击鲁棒性不足,防御响应固有滞后难以匹配攻击进化速度。因此,构建覆盖“训练-推理-检测”三位一体的动态协同防御机制,是应对此类持续进化攻击的核心方向。

2.3 基于模糊测试优化的黑盒越狱攻击

基于模糊测试优化的黑盒越狱攻击,是将传统模糊测试中“通过输入变异探测软件存在漏洞”的核心思路移植到LLMs安全领域的方法。其本质是结合智能种子搜索策略与LLMs驱动的语义变异,自动生成高语义连贯性的对抗提示,系统性突破大语言模型的安全防御机制。其越狱攻击流程如图3所示。

Yu等33提出了黑盒越狱攻击框架GPT-FUZZER。该框架主要由三个核心部分组成:通过种子选择策略平衡效率和可变性,利用变异运算创建语义等效,并采用判断模型评估越狱攻击成功与否。GPTFUZZER已被证明在很多开源和商用LLMs上展现出高越狱成功率,但受限于人工种子质量及变异策略创新性,拓展性面临挑战,且缺乏多轮交互能力。

类似的,Yu等34提出的LLM-Fuzzer也采用了优化策略。该方法采用改进的蒙特卡洛树搜索策略探索种子,结合LLM辅助语义变异和判定模型。同时还建立多项指标系统性评估攻击效率。得益于Shorten算子,LLM-Fuzzer单次查询API成本仅为0.048美元,较GPTFUZZER显著降低65%。

Gong等35提出的基于语义优化的攻击框架PAPILLON突破初始模板依赖,从空种子池启动,通过角色扮演和场景化生成初始模板。利用LLMs变异器生成长度适中、语义自然的提示。其非法内容与问题相关性的两级判定机制,实现更低的误报率。

将软件工程领域的模糊测试技术引入LLMs安全评估,充分体现了跨领域技术的融合与创新。通过对上述研究方法的深入分析,可以清晰洞察该类方法在提升LLMs安全性方面所呈现的发展趋势与面临的核心挑战,具体如下几方面。

1) 轻量化攻击。文献[33-35]的研究均将提示压缩作为优化目标之一,就是为了改进当前攻击中普遍存在的冗长提示生成问题。该类方法通过语义保持的压缩策略,在维持攻击效能的同时降低被防御机制识别的风险及API调用成本。

2) 评估标准不统一。PAPILLON采用 RoBERTa+GPT的双法官机制,还要经过人工校验的把关,而GPTFUZZER完全依赖微调RoBERTa模型,只要包含违规内容即判定成功。这种对越狱行为成功与否的判断偏差已引发学界对越狱攻击真实效用的普遍性质疑。当前亟需建立统一、权威的评估标准,以消除方法间可比性障碍,并为防御技术发展提供明确方向。

3) 防御范式需更新升级。模糊测试驱动的越狱攻击方法对现有防御体系构成核心挑战,当前防御体系仍停留在异常检测层面,而新一代越狱攻击已进化至“合法形式恶意”,防御范式迫切需要升级换代以应对这些日益隐蔽、难以检测的攻击形式。

模糊测试与LLMs安全的融合创新,不仅激活了传统软件测试方法的潜能,更揭示了语义级对抗攻防将是未来越狱攻击的主要方向。未来LLMs防御体系需突破表层规则限制,构建以深度意图理解为核心、具备动态演化能力的主动防御框架,才能牢牢守住大语言模型的安全底线。

2.4 基于LLMs对抗生成优化的黑盒越狱攻击

基于LLMs对抗生成优化的越狱攻击,利用攻击者LLM的理解与推理能力,通过与目标模型的交互对抗和响应反馈,迭代优化提示以实现高效攻击。根据是否需要微调代理模型,此类攻击方法主要分为两种类型:无需微调代理模型的直接对抗交互和需要微调代理模型的攻击代理微调。

2.4.1 直接对抗交互

直接对抗交互越狱无需微调模型,而是利用LLM作为攻击代理,生成语义可解释的对抗性输入,如提示、后缀或预填充文本。通过与目标LLM的交互并利用其反馈,迭代优化攻击代理以生成高质量越狱提示。其越狱攻击流程如图4所示。

Chao等36提出的通用黑盒越狱攻击方法PAIR,利用攻击LLM自动生成针对目标LLM的越狱提示,无需人工参与。攻击失败后,PAIR基于目标LLM的反馈迭代更新提示,通常能在20次查询内成功实施攻击。

Jiang等37将LLMs作为优化器,通过自然语言任务指导其生成并优化恶意查询后缀。ECLIPSE突破在于将离散优化转化为LLMs可理解的黑盒生成任务,规避预设短语依赖,但对复杂指令理解能力依赖度高。

Mehrotra等38提出名为TAP(Tree of Attacks with Pruning)的自动化越狱攻击方法,该方法利用树形分支探索机制,突破了PAIR单链式优化的空间局限性。TAP利用评估LLM响应进行动态剪枝过滤无效提示,显著降低了无效的查询,查询效率优于PAIR和ECLIPSE。

Chen等39提出一种名为AutoBreach的词谜规则越狱方法。该方法采用两阶段闭环优化流程,利用LLMs摘要推理能力通过文字游戏生成和优化规则;评估器反馈驱动规则迭代。引入句子压缩和思维链确保规则理解,降低误差。

Yang等40采用自动红队框架SeqAR,驱动攻击LLM生成一组虚构“反派角色”描述,嵌入强制内容分发故事模板,迫使目标模型扮演所有角色独立生成恶意内容,利用多角色分散安全机制,结合贪心序列优化,实现无模板高效越狱。

Li等41提出了基于预填充的越狱攻击方法Prefill,该方法包含两种实现方式:静态预填充使用固定预填充文本,操作简单但对于安全防护较强的模型效果有限;优化预填充的方式基于响应用选定LLMs迭代有害文本。该方法兼容现有攻击方法,但是应用范围受限,仅适用于Claud、deepseek等支持预填充API的模型。

直接对抗交互的方法利用LLMs自身的理解和生成能力实现越狱攻击,体现了典型的“红队-蓝队”对抗思想,深刻诠释了“以子之矛,攻子之盾”的策略逻辑,是当前及未来LLMs安全研究的核心方向之一。

1) 查询效率显著提升:遗传算法的随机搜索策略和强化学习的策略优化通常需要大量重复查询,导致计算效率低下。相比之下,PAIR、TAP和ECLIPSE等方法通过直接调用LLMs的提示生成能力,仅需10~30次查询即可完成越狱提示构建,显著提升了查询效率。

2) 多模型协同优化:该类方法超越了单一模型的局限,转向多模型协同的闭环优化框架。该协作框架将攻击任务解耦为“攻击模型生成提示-目标模型响应-评估模型反馈”的明确链路,通过三者协同,实现了自我强化的攻击闭环。

3) LLMs能力驱动的语义对抗:对抗重心已从传统的字符级扰动转向语义层攻击,驱动了多样化语义优化策略的涌现。该方法从PAIR的提示语义改写,到AutoBreach的词谜规则引导,再到SeqAR的多角色指令链设计。这些策略充分挖掘语言模型固有的生成与推理能力,显著提升了对抗攻击的语义灵活性和实施隐蔽性。

4) 依赖模型的指令遵循能力:各类语义优化策略的有效执行,实际上高度依赖于LLMs对指令意图的精确理解与响应生成能力。若模型解读指令出现偏差或偏离原始目标,攻击效能将显著降低。

以语言模型自身能力为矛,构建自迭代的闭环对抗机制,驱动越狱攻击由低效的局部令牌扰动迈向高效的全局语义博弈。此举既彰显了LLMs在生成与推理上的巨大潜力,也暴露了其防御机制可被自身能力突破的内在脆弱性。

2.4.2 攻击代理微调

攻击代理微调是一个自增强的闭环攻击流程,其核心流程包括:数据构建、代理微调、攻击执行和反馈迭代。通过收集成功越狱目标LLM的“输入-输出对”构建数据集微调代理LLM,然后利用该代理攻击目标LLM,根据响应动态更新训练数据,驱动代理模型持续优化。其越狱攻击流程如图5所示。

Li等42将RLHF对齐技术逆向应用于越狱攻击领域,提出了基于偏好优化训练的攻击框架JailPO。该框架通过微调模型来生成融合隐蔽恶意问题与复杂诱导模板的候选攻击提示,利用分类器筛选高攻击样本构建偏好对,然后采用偏好优化算法优化奖励误差,强化模型自主学习语义混淆度与场景诱导强度等隐蔽攻击特征。

Wang等43提出的MRJ-Agent采用自动化两阶段流程进行高效多轮越狱对话攻击。在数据构建阶段,该框架通过风险分解将有害查询拆解为低风险子查询,并运用心理诱导策略提升其诱导性。红队训练阶段通过监督微调与直接偏好优化,使其能根据对话反馈自适应地选择最佳心理诱导策略,生成自然且有害的多轮攻击对话。

Sun等44提出的ADV-LLM框架通过迭代自调优方法显著降低了对抗后缀的生成成本。该框架利用模型偏好响应作为起点,降低了优化目标的负对数似然,有效缩小了搜索空间。随后,框架将筛选出的高成功率越狱后缀作为训练数据微调模型。通过多轮迭代优化,最终将基础语言模型训练为擅长生成有效对抗后缀的模型。

借鉴ADV-LLM的训练思路,Paulus等45提出了名为AdvPrompter的攻击模型。该模型利用其自身生成的对抗性后缀作为训练数据,通过低秩自适应微调自身参数,从而持续提升其生成高质量对抗后缀的能力。

Basani等46提出了GASP,这是一种结合人类可读提示生成与潜在贝叶斯优化的新框架。该框架训练Suffix-LLM模型生成自然语言后缀,将恶意查询改写为看似无害的指令。GASP通过在连续嵌入空间中使用贝叶斯搜索最优后缀向量,并结合胜率偏好优化动态微调模型来提升攻击效果。攻击的优化通过GASPEval评估器实现。

攻击代理微调的方法通过使用微调专用LLM代理实现自动化越狱提示生成,其“数据构建-代理微调-攻击执行-反馈迭代”的范式显著提升了攻击效率与迁移性。该类方法的趋势和挑战如下。

1) 端到端代理训练:该类方法通过训练专用攻击代理实现端到端对抗生成,不仅降低了单次攻击成本,还显著提升了黑盒迁移性。

2) 查询效率实现突破:经微调的攻击模型,其查询效率获得显著提升,最快的方法GASP响应时间已缩短至0.01 s/提示, AdvPrompter也达到0.05 s/提示。

3) 计算成本持续增长:攻击代理微调不仅需要优化大模型参数,还需通过查询目标模型进行评估,这些都显著增加了计算负担。例如ADV-LLM每轮训练就需要消耗8张A100GPU约2 d时间;GASP训练需调用目标模型18万次,仅API费用就超过500美元。

4) 高度依赖训练数据:在基于微调的攻击方法中,初始数据质量决定了攻击的上限。实验表明,在JailPO中,当失败样本占比大于30%时,代理模型ASR从82%骤降至35%;MRJ-Agent因未过滤失败样本,导致训练后期ASR下降41%,这些结果凸显了低质量样本对模型训练显著的负面影响。

尽管攻击代理微调技术在跨模型迁移能力与响应速度上取得突破性进展,但其高昂的计算成本与强数据依赖性仍构成显著瓶颈。未来防御体系需通过实时智能监控和动态策略轮换建立主动拦截机制,同时实施数据污染反制与攻击溯源阻断,迫使攻击陷入“高成本投入、低持续实效”的循环陷阱,从根本上逆转攻防博弈态势。

3 防御机制与策略

深入理解LLMs越狱攻击是制定有效防御策略的基础。从作用对象看,防御方法主要从对象上分为提示级防御和模型级防御两大类。鉴于本文研究的基于优化的越狱攻击,其核心在于生成对抗性提示以实现攻击,因此本节将基于下述分类框架进行更深入的探讨:在提示级防御下,重点考察提示检测与提示扰动两类方法;在模型级防御下,则聚焦代理防御与攻防协同防御两种策略。本文防御策略的概述和参考文献见表2

3.1 提示级防御:基于提示分析与改写的防御机制

3.1.1 提示检测

基于提示检测的防御方法通过分析用户输入提示的结构特征、语义内涵及潜在意图,在模型生成响应前主动识别并拦截恶意查询。此类方法的核心在于不修改原始输入,而是通过计算提示的困惑度等量化指标来识别对抗性输入,从而阻断恶意输出生成。

Jain等48提出了一种基于文本困惑度的检测方法,指出对抗性攻击通常因语法或逻辑异常导致困惑度显著升高。此外,他们采用ChatGPT-3.5对可疑提示进行释义处理以增强防御。Alon等49则融合困惑度与序列长度特征,利用LightGBM构建分类器,可有效识别Lapid16方法生成的对抗性后缀,显著降低了检测误报率。Xie等50提出梯度检测方法GradSafe。该方法将输入提示与合规响应配对,计算安全关键参数的损失梯度,并通过分析该梯度与已知越狱提示参考梯度的余弦相似度来检测攻击;当相似度超过预定阈值时,系统即触发防御机制。

3.1.2 提示扰动

基于提示扰动的防御是一种针对LLMs越狱攻击的主动防护策略,通过在用户输入的潜在恶意提示抵达LLMs推理引擎前,策略性地施加细微、可控的扰动,利用对抗性提示对输入变化的敏感特性,破坏原始越狱结构的关键特征,从而诱导模型将其正确识别为不安全内容,维护安全框架。

Cao等51开发了基于随机掩码的RA-LLM防御框架,通过生成输入文本的多个词级掩码副本,当模型对掩码样本的拒绝率超过预设阈值时,判定原始输入为恶意攻击。Kumar等52提出的erase-and-check方法基于“安全提示子序列继承安全性”原则,通过令牌擦除操作生成提示子序列,并利用安全过滤器进行验证。为避免穷举搜索,该方法引入启发式策略优化令牌擦除选择过程。

Robey等53将对抗防御中的随机平滑策略引入LLMs领域,提出SmoothLLM方法。通过插入、交换和补丁等3种字符级扰动生成提示变体,聚合模型响应后,采用多数投票机制输出安全结果。相较于字符级扰动,Ji等54提出的SEMANTICSMOOTH框架通过语义保持型扰动,在保障良性任务性能的前提下显著增强鲁棒性。Hu等55通过嵌入层扰动分析发现:恶意提示的拒绝损失梯度范数显著高于正常样本。基于此现象,他们设计了GradientCuff防御框架,利用梯度范数差异构建双重检测机制。

当前提示级防御机制呈现显著的动态演变特征,早期基于字符扰动的粗粒度策略正被语义感知范式取代,但仍面临计算效率与攻击演化的双重压力。提示级防御面临的发展趋势和挑战如下。

1) 语义智能防御转向:早期方法,如 Smooth LLM,依赖字符级随机扰动破坏对抗序列结构,但会导致合法查询的语义失真。新兴研究转向语义保留型变换,通过同义改写54或意图解构55在维持原始查询功能的前提下扰乱对抗特征。该趋势的本质是通过语义理解实现安全性与实用性的高阶平衡,将良性查询误伤率抑制至3%~5%。

2) 计算开销与实时性的根本矛盾:强防御机制52需遍历O(nd)子序列(其中d为对抗后缀长度),当d>20时检测延迟超过28 s。而随机子采样的轻量化妥协55又使攻击漏检率上升34%,呈现强度与效率的零和博弈。

3) 传统检测机制的适应性危机:基于规则或困惑度的方法对高语义连贯的对抗提示识别率不足50%。随着攻击者利用模型决策机制生成人们不可察觉的后缀,此类方法在自适应攻击下逐渐失效。

综上,提示级防御的核心矛盾体现为语义理解深度与计算复杂度的不可兼得。既要通过细粒度语义分析应对隐蔽攻击,又需突破指数级计算瓶颈。未来突破点可能在构建理论保障与计算轻量兼备的新型防御架构。

3.2 模型级防御:基于架构优化与协同策略的防御机制

3.2.1 代理防御

在大语言模型越狱攻击的防御策略中,代理防御是一种基于多智能体协作的防御机制。它通过引入多个具有特定角色的代理,协同识别并过滤有害内容,从而提升模型的安全性。

Zeng等56提出的AutoDefense是一种基于响应过滤的多智能体防御框架。它将防御任务分解为意图分析、提示推断和最终判决等3个子任务,由多个LLMs智能体协同完成,能有效识别并拦截越狱攻击生成的恶意响应。Zheng等57设计的GPO框架则采用了双代理博弈的动态对齐策略。该框架通过对抗代理与防御代理的迭代对抗训练,并结合多样性奖励机制以防止攻击模式单一化,实现模型安全性的持续提升。Cai等58提出“运行时多智能体协同防御”方案,区别于传统训练阶段的加固方案。该方案在模型推理时部署调度器、偏转器、响应器和评估器等4个专用代理动态拦截威胁。同时,它还利用贝叶斯优化的提示工程,使系统能够自主进化防御策略,无需模型重新训练。

3.2.2 攻防协同防御

攻防协同防御是一种通过构建攻击与防御的循环对抗来增强大语言模型安全性的方法。此类防御使用攻击技术探测模型弱点,然后利用这些弱点优化防御措施,促使攻击和防御在不断地相互对抗中协同进化,从而持续提升模型的整体抗攻击能力。

Deng等59提出对抗防御框架,利用上下文学习驱动LLMs模拟人工构建高质量攻击提示,并基于目标模型的防御弱点迭代生成新提示。通过与攻击模型的迭代交互来微调目标模型,使模型学会对有害输入输出拒绝的响应,实现攻防协同增强LLMs安全性。类似的方法还有MasterKey60,这是一种自进化防御机制,将成功攻击样本转化为安全训练数据微调模型,抵御同样不断迭代优化的攻击。另一方面,Mo等61和Zhou等62均将攻击纳入防御体系,设计双层攻防范式:内层调用效果最佳的攻击方法最大化攻击威胁,外层优化防御提示组件最小化风险。该方法仅需15~20个token的轻量级提示修改而无需调整模型参数,即可实现跨模型的高效鲁棒防御。

越狱攻击与防御技术的对抗性演进持续升级,驱动LLMs安全防护范式从被动响应向主动协同演化。这一进程凸显出模型级防御在多智能体协作与攻防闭环层面的重大创新,却也暴露防御边界认知及资源不对称性的深层次约束。模型级防御面临的趋势和挑战如下。

1) 多智能体防御架构兴起:多智能体机制的应用已从攻击方向防御领域拓展。以AutoDefense为代表的框架通过专用代理协同执行意图分析、提示推断及风险评估等任务,显著提升了防御的系统性与实时性。

2) 攻防协同闭环逐步完善:攻防协同的防御范式,通过主动攻击暴露模型脆弱性,结合实时微调或提示工程加固防御。这种动态迭代机制正成为应对新型越狱攻击的有效策略,但需解决对抗训练成本高和攻击泛化性不足等实施挑战。

3) 防御边界尚未完全探索:尽管指令微调和RLHF等技术增强了模型对齐性,防御边界仍存在未充分研究的薄弱环节。攻击者可利用模型对语义扰动的敏感性、知识冲突情境等隐蔽后门策略绕过防护,凸显系统性脆弱点分析的迫切性。

4) 攻防资源不对称性凸显:如Deng等59所指出的本质矛盾,攻击者仅需发掘单一漏洞即可达成越狱,而防御方需覆盖无限可能的攻击面。这种非对称博弈导致防御机制常陷入“补丁式响应”困境,对构建可迁移、轻量化的普适防御体系构成根本挑战。

总体而言,模型级防御技术的演进,始终伴随着防御协同性提升与安全脆弱性暴露的矛盾共生。尽管多代理架构与攻防闭环机制显著增强了动态防御能力,却因攻击面高度离散化,仍无法彻底消除防护盲区。同时,防御边界认知滞后和攻防资源先天失衡这两大深层因素,持续制约着安全体系的鲁棒性。展望未来,研究突破的关键在于推动构建轻量化的动态防御框架以缓解计算资源压力。同时建立跨模型的安全信息共享机制,整合防御知识,有效扩大防御面积。

4 基准数据集和评估指标

表3系统性对比了不同优化策略下越狱方法在基准数据集与评估指标层面的特征差异。分析结果表明,尽管各类越狱方法的技术路径存在显著异质性,但其在数据集择取维度与评估框架设计层面,又展现出鲜明的共性特征。

4.1 常见的基准数据集概述

表3分析可见,基于优化的黑盒越狱攻击方法在基准数据集选择和使用上呈现显著集中化趋势,具体表现为AdvBench、 HarmBench及JBB-Behaviors等3大核心数据集的普遍采用。

AdvBench数据集最初由Zou等7创建,包含520个有害指令,是用于GCG中基于梯度的越狱后缀构建。目前AdvBench已经成为LLMs越狱攻击的基础数据集,其使用范围几乎覆盖本文提到的所有基于优化的越狱攻击。

HarmBench数据集是由标准化评估框架HarmBench63构建的,其特点是专注于安全性的二元分类任务。HarmBench包含400个安全对齐的有害行为,覆盖多模态等更复杂的现实场景,可以帮助研究人员和开发者更好地理解和改进模型的安全性和鲁棒性。

JBB-Behaviors数据集是标准化越狱攻击评估平台JailbreakBench64的核心子数据集,用于测试攻击方法的泛化能力和鲁棒性。JBB-Behaviors数据集涵盖从网络钓鱼到隐私侵犯众多领域的100种有害行为和100种良性行为,并参考OpenAI的使用政策进行分类。

除了这些较为通用的数据集,为了测试研究方法的某些特定性能,研究人员也会使用一些较为专用或者手工制作的数据集。例如为了验证生成模型的迁移性,xJailbreak和ADV-LLM使用了MaliciousInstruct数据集65,因为MaliciousInstruct数据集包含多样化恶意类别和差异化查询结构,可以有效验证对抗后缀在跨模型和跨查询类型场景中的迁移能力。在SMJ中,通过手工编写的100个恶意问题,测试生成的越狱提示的语义隐蔽性。

4.2 评估指标

在LLMs越狱攻击中,评估指标主要是用来衡量越狱方法对目标模型产生的越狱效果,不同的研究方法会根据研究动机,设置相应的评估指标来精确展示其方法的有效性。

4.2.1 攻击成功率ASR

攻击成功率(Attack Success Rate, ASR)是衡量对抗攻击效果最直接的指标之一,它表示攻击者成功欺骗模型并获得错误输出的比率。ASR越高,意味着对抗攻击越有效,模型在面对这类攻击时的鲁棒性越差。其公式可以表示为:

JASR=NsuccessfulNtotal

其中,Nsuccessful指的是攻击者生成的对抗样本中成功欺骗模型并得到错误输出的样本数量,Ntotal指的是攻击者生成的所有对抗样本数量。

根据判断方式的不同,实际应用中研究人员主要采取基于规则和基于模型自动判断两种判断逻辑。基于规则的判断逻辑通常使用预定义的规则来判断攻击是否成功,比如通过匹配特定的拒绝短语,如“Sorry,I cannot”来评估攻击的有效性766。这种方法依赖于规则库,规则的选择和覆盖范围直接影响ASR的计算结果。基于模型自动判断的方法通常是利用深度学习模型或语言模型来自动判断攻击成功与否,这也是目前较为广泛的评估方法,但是这种方法评估的准确性会根据采用的判断模型的性能而有所差异。为了进一步分析攻击效果, Shu等67提出AttackEval评估框架,在整体评估越狱提示跨模型的攻击效果之后,还细粒度地分析单个LLM上每个攻击提示的细节,并给出攻击是部分成功还是完全成功的详细分数。

4.2.2 困惑度PPL

困惑度(Perplexity,PPL)是评估语言模型性能的重要指标,尤其在越狱提示的检测和防御中具有关键作用。困惑度用于衡量语言模型对生成文本的概率分布的置信度,其值越低,表示模型对生成文本的预测越准确,反之则越差。给定一个文本序列W=(w1,w2,...,wn)Wi表示文本序列中第i个词,该序列的PPL值可以表示为PPPL如下式。

PPPL(W)=exp(-1Ni=1NlogP(wiw,1w2,...,wi-1))

式(2)中,N表示文本序列中单词的总数,P(wiw1,w2,...,wi-1)表示在给定前面所有词的条件下,模型预测当前词wi的概率。

在越狱提示评估中,困惑度用于衡量提示的语义连贯性与可读性。PPL值过高通常表明提示语义不自然或包含无意义片段,此类提示易被基于困惑度的防御机制识别和拦截。尽管低PPL值意味着文本表面可信度较高,但仍无法完全体现模型在上下文理解与运用方面的潜在缺陷。因此,实际应用中困惑度常与BLEU、ROUGE等指标结合使用,以更全面地评估提示的安全性和文本质量68

5 展望和挑战

针对日益先进的大语言模型69,研究人员持续探索各类攻击方法与技术手段,旨在突破其防御机制并挖掘潜在安全漏洞。尽管基于优化的越狱攻击已取得阶段性成果,但现有方法仍面临多重挑战,这也为后续攻击研究指明了方向。与此同时,为有效应对不断升级的攻击技术、筑牢大语言模型的安全防线,必须系统性地优化防御策略。既要充分评估现有防御机制的实际效能与瓶颈问题,也需前瞻性地规划未来防御体系的发展路径。

5.1 越狱攻击的演进趋势和技术挑战

当前优化驱动的黑盒越狱攻击面临三重耦合性瓶颈:计算效率、资源依赖性与隐蔽性三者相互制约,形成难以突破的限制。

从计算角度看,遗传算法类方法需遍历指数级子序列空间,叠加强化学习的策略迭代负担,共同造成实时性瓶颈,难以支持高并发攻击场景。攻击效能也高度依赖资源,代理模型能力强弱与训练数据质量会直接影响其跨模型泛化效果。更根本的矛盾在于攻击强度与隐蔽性难以兼顾,具体为:提升文本自然度往往削弱攻击效力;即便通过多目标优化试图平衡两者,仍易被强防御机制抑制。这种内在权衡既揭示了对抗样本的理论局限,也指明了未来攻击范式需突破的关键方向。

综合当前技术瓶颈与发展需求,未来越狱攻击的研究方向应聚焦以下三大核心维度:1) 设计轻量化架构。为实现实时、高并发攻击,需从算法与架构层面双重优化。可以采用提示压缩和知识蒸馏技术,将攻击 LLM的“攻击知识”蒸馏至参数量更少、推理速度更快的专用模型中,大幅降低计算开销。此外,需要开发更加高效的搜索算法,例如将强化学习中的策略网络与价值网络解耦,以减少策略迭代的次数和计算负担。2) 强化跨域泛化能力。其核心在于削弱对特定模型架构和数据分布的依赖。可以选择引入元学习(Meta-Learning)框架,使攻击代理模型在多种异构模型(例如Llama、GPT、Claude等)上进行元训练,从而获得快速适应未知目标模型的泛化能力;同时,构建多样化和对抗性的训练数据集,主动集成多源模型的响应数据,并采用回译、语义扰动等数据增强技术模拟不同模型的输出分布,以全面提升攻击模式的鲁棒性和泛化性能。3) 协同优化隐蔽与效能。突破传统强度与隐蔽的二元对立框架,探索基于对抗博弈的多目标优化范式,构建语义自然性与攻击穿透力的协同增强机制,实现对抗样本生成的理论边界突破。

5.2 防御机制的瓶颈与发展方向

当前大语言模型防御面临四大核心困境:1) 实时性瓶颈导致认证擦除等检测方法计算复杂度激增,梯度袖套等两阶段检测显著推高推理延迟;2) 传统规则与困惑度检测易被语义连贯的对抗样本绕过,暴露静态防御对自适应攻击的脆弱性;3) 多智能体系统难以识别复杂诱导逻辑,静态防护策略泛化能力不足;4) 攻防成本严重失衡,攻击方单次突破即可奏效,防御方却需以数十倍成本覆盖海量变体。这些根本性挑战共同制约了动态防御体系的有效构建。

综合当前防御体系的技术瓶颈与动态攻防需求,未来LLMs安全防御的研究应聚焦以下三大核心维度:1) 搭建轻量化实时防御框架。可构建多层异步检测流水线,在前端部署过滤器或小型神经网络对明显恶意提示进行高速拦截以降低后端负载,随后采用轻量化微调模型进行精细语义分析,精确识别隐蔽威胁。该机制能够在保障低延迟响应的情况下,显著降低整体防御开销,并有效应对高并发环境下的安全需求。2) 提高深度语义理解能力。为识别并阻断日益隐蔽的语义攻击,防御机制需构建上下文感知机制,对长对话结构进行建模,通过多维度内容解析识别潜在威胁,动态调整安全边界以适应语义变异,从而精准发现隐蔽性攻击模式。3) 维护协同智能防御生态。建立跨模型的安全信息共享机制,通过联邦学习等方式整合分散的防御知识;设计基于强化学习的自适应防御调度系统,融入对攻击行为的预测和响应,变被动修补为主动防护,从根本上提升防御体系的可持续性和鲁棒性。

5.3 越狱与防御的理论基础与评估框架构建

越狱攻击与防御技术的演进始终依赖于基础理论的支撑。未来研究亟需从理论层面深化探索,系统解析攻击与防御的内在机制及其科学渊源,从而为大语言模型防御体系的设计提供坚实的理论根基。与此同时,构建全面、标准化的评估框架与基准体系已成为该领域亟待攻克的核心挑战。当前,攻击方法与防御方法在评估指标与基准设定上存在显著差异,导致研究成果难以横向比较。唯有建立统一、普适的评估范式,方能系统量化不同越狱攻击技术与防御策略的有效性差异,帮助研究者和政策制定者精准把握越狱攻击的潜在风险,进而推动更高效防御机制的研发,在确保技术安全性的前提下实现可持续发展。

6 结论

本综述不仅系统梳理了面向优化的黑盒越狱攻击方法与对应防御策略,更深刻揭示了大型语言模型安全对齐机制中普遍存在的潜在脆弱性。本文的核心贡献为:首次从优化范式的统一视角出发,构建了由遗传算法、强化学习、模糊测试与LLMs对抗生成组成的四维分析框架,以此深入剖析了各类攻击技术的核心机理、演进趋势并厘清其关键挑战。在防御层面,本文首次对现有策略进行了系统比较,明晰了其技术演进脉络,并深刻揭示了当前防御技术在实时性、泛化性等方面存在的根本性瓶颈。综上所述,本研究为理解与评估LLMs的安全性提供了新颖的系统分析工具和设计原则,旨在助力构建下一代高效动态防御方案,最终推动发展兼具高鲁棒性、强可解释性且符合人类价值观的安全框架的落地实践。

参考文献

[1]

Achiam JAdler SAgarwal Set al.GPT-4 TechnicalReport[EB/OL].[2025-03-22].

[2]

Enis MHopkins M.From LLM to NMT: Advancing low-resource machine translation with claude[EB/OL].[2025-03-24].

[3]

Touvron HMartin LStone Ket al.Llama 2: Open foundation and fine-tuned chat models[EB/OL].[2025-03-16].

[4]

Gu SKnoll AJin M.TeaMs-RL: Teaching LLMs to generate better instruction datasets via reinforcement learning[EB/OL].[2025-04-15].

[5]

Li QLiu HGuo Cet al.Merging clinical knowledge into large language models for medical research and applications: A survey[EB/OL].[2025-03-19].

[6]

Wu SIrsoy OLu Set al.BloombergGPT: A large language model for finance[EB/OL].[2025-04-02].

[7]

Zou AWang ZCarlini Net al.Universal and transferable adversarial attacks on aligned language models[EB/OL].[2025-04-20].

[8]

Ouyang LWu JJiang Xet al.Training language models to follow instructions with human feedback[C]//Proceedings of the 36th International Conference on Neural Information Processing Systems.New Orleans, USA: Curran Associates Inc., 2022: 27730-27744.

[9]

Perez ERinger SLukosiute Ket al.Discovering language model behaviors with model-written evaluations[C]//Findings of the Association for Computational Linguistics: ACL 2023.Toronto, Canada: Association for Computational Linguistics, 2023: 13387-13434.

[10]

Jin HHu LLi Xet al.JailbreakZoo: Survey, landscapes, and horizons in jailbreaking large language andvision-language models[EB/OL].[2025-03-20].

[11]

Xu ZLiu YDeng Get al.A comprehensive study of jailbreak attack versus defense for large language models[C]//Findings of the Association for Computational Linguistics ACL 2024.Bangkok, Thailand and virtual meeting.Stroudsburg, PA, USA: ACL, 2024: 7432-7449.

[12]

Yi SLiu YSun Zet al.Jailbreak attacks and defenses against large language models: A survey[EB/OL].[2025-03-24].

[13]

Vie AKleinnijenhuis A MFarmer D J.Qualities, challenges and future of genetic algorithm: A literature review[EB/OL].[2025-04-06].

[14]

Huang F QYou J RTu L Net al. Systematic re- view methodology: Cases, procedures, and values [J].E Educ Res201738(11): 11-18, 25.

[15]

黄甫全, 游景如, 涂丽娜, .系统性文献综述法: 案例、步骤与价值[J]. 电化教育研究201738(11): 11-18, 25.

[16]

Li X ZMoreschini SZhang Z Yet al.The anatomy of a vulnerability database: A systematic mapping study[J].J Syst Softw2023201: 111679.

[17]

Lapid RLangberg RSipper M.Open sesame! Universal black-box jailbreaking of large language models [J].Appl Sci202414(16): 7150-7163.

[18]

Liu X GXu NChen M Het al.AutoDAN: Generating stealthy jailbreak prompts on aligned large language models[C]//Proceedings of the 12th International Conference on Learning Representations.Vienna, Austria: ICLR, 2024: 7739.

[19]

Li XLiang SZhang Jet al.Semantic mirror jail- break: Genetic algorithm based jailbreak prompts against open-source LLMs[EB/OL].[2025-04-07].

[20]

Wang XHuang V S JChen Ret al.BlackDAN: A black-box multi-objective approach for effective and contextual jailbreaking of large language models [EB/OL].[2025-04-07].

[21]

Yu MFang JZhou Yet al.LLM-Virus: Evolutionary jailbreak attack on large language models [EB/OL].[2025-04-08].

[22]

Wu T YXue Z WLiu Yet al.Geneshift: Impact of different scenario shift on jailbreaking LLM[C]//ICLR 2025 Workshop on Foundation Models in the Wild.Singapore: ICLR, 2025: 82.

[23]

Huang YSun Y TRuan S Wet al.Breaking the ceiling: Exploring the potential of jailbreak attacks through expanding strategy space[C]//Findings of the Association for Computational Linguistics: ACL 2025.Vienna, Austria: Association for Computational Linguistics, 2025: 7870-7888.

[24]

Chen XGuo WNie Yet al.When LLM meets DRL: Advancing jailbreaking efficiency via DRL-guided search[C]//Advances in Neural Information Processing Systems 37.Vancouver, BC, Canada:Neural Information Processing Systems Foundation, Inc.(NeurIPS), 2024: 26814-26845.

[25]

Chen XNie YYan Let al.RL-JACK: Reinforcement learning-powered black-box jailbreaking attack against LLMs[EB/OL].[2025-04-10].

[26]

Lin ZMa WZhou Met al.PathSeeker: Exploring LLM security vulnerabilities with a reinforcement learning-based jailbreak approach[EB/OL].[2025-04-20].

[27]

Jawad HChenik YBrunel N J B.Towards universaland black-box query-response only attack on LLMs with QROA[EB/OL].[2025-04-19].

[28]

Jha PArora AGanesh V.LLM STINGER: Jailbreaking LLMs using RL fine-tuned LLMs (student abstract)[C]//Proceedings of the Thirty-Ninth AAAI Conference on Artificial Intelligence.Palo Alto, CA: AAAI Press,2025: 29393-29395.

[29]

Wang XPeng JXu Ket al.Reinforcement learning-driven LLM agent for automated attacks on LLMs[C]//Proceedings of the Fifth Workshop on Privacy in Natural Language Processing.Bangkok, Thailand.Stroudsburg, PA, USA: ACL, 2024: 170-177.

[30]

Lee SNi SWei Cet al.xJailbreak: Representation space guided reinforcement learning for interpretable LLM jailbreaking[EB/OL].[2025-04-17].

[31]

Liu YZhou SLu Yet al.Auto-RT: Automatic jail-break strategy exploration for red-teaming large language models[EB/OL].[2025-04-19].

[32]

Guo WShi ZLi Zet al.Jailbreak-R1: Exploring the jailbreak capabilities of LLMs via reinforcement learning[EB/OL].[2025-04-22].

[33]

Tang X HXiao W JYao Z Jet al.SwordEcho: A LLM jailbreaking optimization strategy driven by reinforcement learning [C]//Proceedings of the 2024 8th International Conference on Computer Science and ArtificialIntelligence.New York: Association for Computing Machinery, 2025: 183-190.

[34]

Yu J HLin X WYu Zet al.GPTFUZZER: Red teaming large language models with auto-generated jailbreak prompts[EB/OL].[2025-04-13].

[35]

Yu J HLin X WYu Zet al.LLM-Fuzzer: Scaling assessment of large language model jailbreaks [C]//Proceedings of the 33rd USENIX Security Symposium.Philadelphia, PA: USENIX Association, 2024: 4657-4674.

[36]

Gong X LLi M ZZhang Y Let al.PAPILLON:Efficient and stealthy fuzz testing-powered jailbreaks for LLMs[C]//Proceedings of the 34th USENIX Conferenceon Security Symposium.Seattle, WA: USENIX Association, 2025: 2401-2420.

[37]

Chao PRobey ADobriban Eet al.Jailbreaking black box large language models in twenty queries [C] //Proceedings of the 2025 IEEE Conference on Secure and Trustworthy Machine Learning (SaTML).Piscataway, NJ: IEEE, 2025: 23-42.

[38]

Jiang W PWang Z TZhai Jet al.An optimizable suffix is worth a thousand templates: Efficient blackbox jailbreaking without affirmative phrases via LLM as optimizer[C]//Findings of the Association for Computational Linguistics: NAACL 2025.Albuquerque,New Mexico:Association for Computational Linguistics,2025: 5471-5483.

[39]

Anderson HKarbasi AKassianik Pet al.Tree of attacks: Jailbreaking black-box LLMs automatically [C]//Advances in Neural Information Processing.Vancouver, BC, Canada:Neural Information Processing Systems Foundation, Inc.(NeurIPS), 2024: 61065-61105.

[40]

Chen J WYang XFang Z Wet al.AutoBreach: Universal and adaptive jailbreaking with efficient wordplay-guided optimization via multi-LLMs[C]//Findings of the Association for Computational Linguistics: NAACL 2025.Albuquerque, New Mexico.Stroudsburg, PA, USA: ACL, 2025: 6777-6798.

[41]

Yang YXiao Z GLu Xet al.SeqAR: Jailbreak LLMs with sequential auto-generated characters [C] // Proceedings of the 2025 Conference of the NorthAmerican Chapter of the Association for ComputationalLinguistics: Human Language Technologies.Albuquerque, New Mexico: Association for Computational Linguistics, 2025: 912-931.

[42]

Li Y KHu J KSang W Det al.Prefill-level jail- break: A black-box risk analysis of large language models[EB/OL].[2025-04-28].

[43]

Li H YYe J WWu Jet al.JailPO: A novel black-box jailbreak framework via preference optimization against aligned LLMs[C]//Proceedings of the 39th AAAI Conference on Artificial Intelligence.Palo Alto:AAAI Press, 2025: 27419-27427.

[44]

Wang F XDuan R JXiao Pet al.MRJ-Agent: An effective jailbreak agent for multi-round dialogue [EB/OL].[2025-05-06].

[45]

Sun C ELiu X DYang W Wet al.Iterative self- tuning LLMs for enhanced jailbreaking capabilities [C]//Proceedings of the 2025 Conference of the North American Chapter of the Association for ComputationalLinguistics: Human Language Technologies.Albuquerque, New Mexico: Association for Computational Linguistics, 2025: 5768-5786.

[46]

Paulus AZharmagambetov AGuo Cet al.AdvPro-mpter: Fast adaptive adversarial prompting for LLMs[EB/OL].[2025-05-06].

[47]

Basani A RZhang X.GASP: Efficient black-box generation of adversarial suffixes for jailbreaking LLMs[EB/OL].[2025-04-29].

[48]

Shen X YChen Z YBackes Met al.“Do anything now”: Characterizing and evaluating in-the-wild jailbreak prompts on large language models [C]//Proceedings of the 2024 on ACM SIGSAC Conference on Computer and Communications Security.Salt Lake City UT USA: ACM, 2024: 1671-1685.

[49]

Jain NSchwarzschild AWen Y Xet al.Baseline defenses for adversarial attacks against aligned language models[EB/OL].[2025-05-08].

[50]

Alon GKamfonas M.Detecting language model attacks with perplexity[EB/OL].[2025-05-16].

[51]

Xie Y QFang M HPi R Jet al.GradSafe: Detecting jailbreak prompts for LLMs via safety-critical gradient analysis[C]//Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers).Bangkok, Thailand.Stroudsburg, PA, USA: ACL, 2024: 507-518.

[52]

Cao BCao Y PLin Let al.Defending against a- lignment-breaking attacks via robustly aligned LLM [C]//Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics.Bangkok, Thailand: Association for Computational Linguistics, 2024: 10542-10560.

[53]

Kumar AAgarwal CSrinivas Set al.Certifying LLM Safety against Adversarial Prompting[EB/OL].[2025-05-16].

[54]

Robey AWong EHassani Het al.SmoothLLM: Defending large language models against jailbreaking attacks[EB/OL].[2025-05-16].

[55]

Ji J BHou B RRobey Aet al.Defending large language models against jailbreak attacks via seman-tic smoothing[EB/OL].[2025-05-21].

[56]

Hu X MChen P YHo T Y.Gradient cuff: Detecting jailbreak attacks on large language models by exploring refusal loss landscapes[C]//Proceedings of the 38th International Conference on Neural Information Processing Systems.Vancouver, Canada: Curran Associates Inc., 2025: 126265-126296.

[57]

Zeng Y FWu Y RZhang Xet al.AutoDefense: Multi-agent LLM defense against jailbreak attacks [EB/OL].[2025-05-23].

[58]

Zheng RGuo H YLiu Z Het al.Toward optimal LLM alignments using two-player games[EB/OL].[2025-05-26].

[59]

Cai ZShabihi SAn Bet al.AegisLLM: Scaling agentic systems for self-reflective defense in LLM security[EB/OL].[2025-06-01].

[60]

Deng BWang W JFeng F Let al.Attack prompt generation for red teaming and defending large language models[C]//Findings of the Association for Computational Linguistics: EMNLP 2023.Singapore.Stroudsburg, PA, USA: ACL, 2023: 2176-2189.

[61]

Deng G LLiu YLi Y Ket al.MASTERKEY: Automated jailbreaking of large language model chat-bots[C]//Proceedings of the 2024 Network and Distributed System Security Symposium.Reston, VA:Internet Society, 2024.

[62]

Wang YMo YWang Yet al.Fight back against jailbreaking via prompt adversarial tuning[C]//Advances in Neural Information Processing Systems 37.Vancouver, BC, Canada: Neural Information Processing Systems Foundation, Inc.(NeurIPS), 2024: 64242-64272.

[63]

Li BWang HZhou A.Robust prompt optimization for defending language models against jailbreaking attacks[C]//Advances in Neural Information Processing Systems 37.Vancouver, BC, Canada: Neural Information Processing Systems Foundation, Inc.(NeurIPS), 2024: 40184-40211.

[64]

Mazeika MPhan LYin X Wet al.HarmBench: A standardized evaluation framework for automated red teaming and robust refusal[C]//Proceedings of the 41st International Conference on Machine Learning.Vienna, Austria: JMLR.org, 2024: 35181-35224.

[65]

Chao PDebenedetti ERobey Aet al.Jailbreak Bench: An open robustness benchmark for jailbreaking large language models[C]//Advances in Neural Information Processing Systems.Vancouver, Canada:Curran Associates, Inc., 2024: 55005-55029.

[66]

Huang Y SGupta SXia M Zet al.Catastrophic jailbreak of open-source LLMs via exploiting generation[C]//Proceedings of the 12 th International Conference on Learning Representations.Vienna, Austria: ICLR, 2024.

[67]

Zou X TChen Y KLi K.Is the system message really important to jailbreaks in large language models?[EB/OL].[2025-04-26].

[68]

Shu DZhang CJin Met al.AttackEval: How to evaluate the effectiveness of jailbreak attacking on large language models[J].SIGKDD Explor Newsl202527(1): 10-19.

[69]

Deng M KWang J YHsieh C Pet al.RLPrompt: Optimizing discrete text prompts with reinforcement learning[C]//Proceedings of the 2022 Conference onEmpirical Methods in Natural Language Processing.Abu Dhabi, United Arab Emirates: Association for Computational Linguistics, 2022: 3369-3391.

[70]

Wu H Q. Integration of large-scale models and cloud, transition from informatization to digital intelligence [J].Journal of Chongqing University of Posts and Telecommunications(Natural Science Edition)202436(1): 1-8.

[71]

邬贺铨.大模型融入云平台,信息化走向数智化[J].重庆邮电大学学报(自然科学版)202436(1): 1-8.

基金资助

国家自然科学基金(U24B20147)

AI Summary AI Mindmap
PDF (1239KB)

2343

访问

0

被引

详细

导航
相关文章

AI思维导图

/