基于低秩适配器评估重要性的结构化剪枝方法

曾惠冰 ,  刘鹏 ,  姚廉 ,  武继刚

四川大学学报(自然科学版) ›› 2026, Vol. 63 ›› Issue (4) : 911 -921.

PDF (1390KB)
四川大学学报(自然科学版) ›› 2026, Vol. 63 ›› Issue (4) : 911 -921. DOI: 10.19907/j.0490-6756.250238
电子信息科学

基于低秩适配器评估重要性的结构化剪枝方法

作者信息 +

Structured pruning method via low-rank adaptation for importance assessment

Author information +
文章历史 +
PDF (1422K)

摘要

Transformer架构的大语言模型在自然语言处理领域快速发展,但其庞大的参数量和高昂的计算成本严重制约了模型的部署应用。现有模型压缩技术存在两大问题:一是依赖梯度信息计算权重重要性;二是压缩模型后需要全数更新,增加训练成本。针对现有问题,本文提出一种基于低秩适配器(Low Rank Adaptation,LoRA)评估重要性的结构化剪枝方法,旨在实现高效的模型压缩与参数微调。在剪枝过程中,该方法创新性地将LoRA模块中低秩矩阵的梯度信息作为原始参数重要性的近似表征。该方法通过避免直接计算原始权重梯度,有效提升了剪枝过程的计算效率与硬件兼容性。在模型性能恢复阶段,通过LoRA模块进行轻量级参数更新,降低了全量参数微调带来的资源消耗。同时,本文将剪枝建模为多目标优化问题,并引入指数型稀疏率调节策略,实现了性能、资源与压缩率间的动态平衡。本文在GLUE基准测试集上对所提出的方法进行了评估。实验结果表明,该方法在无需预微调的情况下,能够保持模型性能并降低GPU显存占用,比现有的剪枝策略更有优势。具体而言,所提出的方法的显存占用相比传统剪枝策略最高可降低68.9%。

Abstract

Although Large Language Models (LLMs) based on the Transformer architecture have developed rapidly in Natural Language Processing (NLP), their massive parameter counts and high computational costs severely constrain practical deployment.Existing model compression techniques face two critical challenges, namely the reliance on gradient information for weight importance assessment and the necessity of full parameter updating after pruning, which increases training costs.To address these challenges, this paper proposes a structured pruning method guided by Low-Rank Adaptation (LoRA) for importance assessment, aiming to achieve efficient model compression and fine-tuning.During pruning, the proposed method innovatively utilizes gradient information of the low-rank matrices in the LoRA module to approximate the importance of original parameters.By avoiding the direct gradient calculation of original weights, this method effectively enhances computational efficiency and hardware compatibility.In the performance recovery phase, lightweight parameter updates are performed via the LoRA module, thereby reducing the resource consumption associated with full-parameter fine-tuning.Furthermore, this paper formulates pruning as a multi-objective optimization problem and introduces an exponential sparsity regulation strategy to achieve a dynamic balance among performance, resource consumption, and compression rate.Evaluations on the General Language Understanding Evaluation (GLUE) benchmark demonstrate that, without pre-fine-tuning, the proposed method maintains model performance while reducing GPU memory usage, showing superiority over existing pruning strategies.Specifically, the proposed method reduces GPU memory usage by up to 68.9% compared to traditional approaches.

Graphical abstract

关键词

Transformer / 低秩适配器 / 结构化剪枝 / 模型压缩

Key words

Transformer / low-rank adaptation / structured pruning / model compression

引用本文

引用格式 ▾
曾惠冰,刘鹏,姚廉,武继刚. 基于低秩适配器评估重要性的结构化剪枝方法[J]. 四川大学学报(自然科学版), 2026, 63(4): 911-921 DOI:10.19907/j.0490-6756.250238

登录浏览全文

4963

注册一个新账户 忘记密码

近年来,基于Transformer架构1的预训练语言模型,如BERT2、RoBERTa3和GPT-34,在NLP领域取得了突破性进展。这些模型通过在海量未标注语料上预训练,学习到通用的语言表示,并在句子分类、阅读理解、自然语言推理等多种下游任务中显著提升了性能5。同时,Transformer 架构在计算机视觉领域同样表现出卓越的性能,迅速成为该领域的主流结构6
随着下游任务复杂度的不断提升,模型结构趋于加深加宽,导致其在存储开销、内存占用以及计算复杂度方面的负担显著增加,难以应用在资源受限的边缘设备中。已有研究表明,针对不同任务,现有神经网络中普遍存在参数冗余的现象,这一发现为预训练模型的压缩与优化提供了理论基础7-8。基于此,许多研究开始探索针对 Transformer的模型压缩方法9-10。其中,剪枝作为一种高效的模型压缩技术,通过去除模型中冗余的组件,显著降低了模型的存储需求和计算复杂度11-12
模型剪枝根据剪枝粒度可分为结构化剪(Structured Pruning)和非结构化剪枝(Unstrutured Pruning )。非结构化剪枝通过移除单个权重或神经元实现细粒度稀疏化,理论上能达到极高稀疏率13。然而,其产生的非规则稀疏模式难以映射到硬件加速器,需要专门的硬件支持才获得实际的加速效果14。相比之下,结构化剪枝以通道(channel)、注意力头(attention head)15或权重组16为单元进行剪枝,能够保持模型结构的规则性,从而更好地适配硬件部署需求。
然而,结构化剪枝后的模型往往需要更长时间的微调来恢复性能17,并且需要额外的蒸馏手段来恢复性能。此外,传统结构化方法依赖参数梯度评估参数重要性,这会带来额外且不可忽略的剪枝开销。更重要的是,在大模型场景下,压缩过程的计算成本和剪枝后重新训练的成本都非常高。
LoRA18作为一种高效的参数微调方法,为解决上述问题提供了新的思路。它通过冻结原始模型权重,并在模型架构的每一层注入一对可训练的低秩矩阵,显著降低了微调成本并提升推理效率。例如,LLM-Pruner19借助LoRA微调方法来恢复性能剪枝模型的性能,有效降低了微调成本,但该方法仍然依赖梯度来评估权重的重要性。
为了解决模型压缩率与性能恢复能力之间的矛盾,本文提出了一种基于LoRA(Low Rank Adaptation)评估重要性的结构化剪枝方法,该方法致力于降低模型的参数量与计算开销并最小化因压缩导致的性能损失及附加开销。与传统依赖权重梯度的方法不同,本方法仅利用LoRA中低秩矩阵的梯度信息近似权重重要性,以驱动结构化剪枝冗余模块,从而减少剪枝过程中的资源消耗,提升模型的硬件部署效率。此外,区别于传统的微调前剪枝和微调后剪枝策略,本方法通过LoRA轻量微调恢复剪枝模型的性能,无需进行全量参数更新。本文的主要贡献总结如下。
1) 提出了一种基于LoRA评估重要性的结构化剪枝框架,该方法仅利用LoRA中低秩矩阵的梯度来评估权重重要性,实现无需全梯度计算的结构化剪枝,有效降低计算和内存开销。
2) 剪枝后通过LoRA微调恢复模型性能,避免了全量参数的重新训练,显著减少微调阶段的资源消耗和训练时间。同时,本文设计了一种基于多目标优化和指数型稀疏率调节的渐进式剪枝流程,有效缓解一次性剪枝导致的性能退化,并提升了策略的稳定性与灵活性。
3) 实验结果表明,所提出的方法的性能表现优于现有的剪枝方法,同时GPU显存占用最高降低约68.9 %,充分验证了该方法的有效性。

1 相关工作

1.1 背景

本文重点研究了基于编码器的Transformer模型的剪枝,每一个编码层由多头注意力(Multi-Head Attention,MHA)模块和前馈神经网络(Feed-Forward Network,FFN)模块组成。其输出可以形式化表示为:

MHA(x)=h=1HAttn(WQh,WKh,WVh,WOh,x) 
XMHA=LayerNorm(x+MHA(x))
FFN(x)=σ(xW(1)+b(1))W(2)+b(2)

具体而言,一个MHA层有H个独立参数化的注意力头组成,其中WQRd×k表示查询参数矩阵、WKRd×k表示关键参数矩阵、WVRd×k表示值参数矩阵和WORd×k表示输出参数矩阵,k表示输入维度的大小,d表示注意力头的输出维度,LayerNorm表示归一化操作。一个FFN层有上下两层投影矩阵W(1)W(2)b(1)b(2)为对应的偏置向量,σ是激活函数。前者通过计算输入序列中不同token上的注意力图来捕获全局信息,而后者分别从每个token中提取信息。

1.2 剪枝中的重要性评估机制

合理评估参数的重要性是神经网络剪枝的核心,其目的在于判断哪些参数对模型性能影响较小,进而有效指导剪枝过程。早期如Optimal Brain Damage(OBD)方法基于损失函数的二阶泰勒展开,通过Hessian矩阵对角元素估计参数对损失的影响20。然而,在大规模模型场景下,计算完整的二阶信息所需的成本极高。为降低计算复杂度,后续方法采用参数幅值作为简易的评估准则,优先移除绝对值小的权重21。但由于神经网络中参数间存在复杂的参数耦合,即便幅值较小的权重,也可能在梯度传播中发挥重要作用。为更准确捕捉剪枝对模型性能的影响,Molchanov等22提出基于一阶泰勒展开的估计方法,首次引入梯度信息评估权重重要性,并在卷积神经网络中验证了其有效性。此外,部分研究采用Fisher信息矩阵替代Hessian矩阵,以进一步逼近二阶信息23。尽管这些改进在一定程度上提升了评估准确性,但仍未摆脱梯度计算与存储带来的高开销问题。

1.3 结构化剪枝

结构化剪枝作为一种高效的模型压缩策略,近年来在Transformer模型中得到了广泛应用。为增强结构裁剪的灵活性与任务适应性,EBERT则引入了输入感知机制,实现对注意力头与前馈通道的样本级动态裁剪24。CoFi联合执行粗粒度与细粒度组件的裁剪,并配合逐层蒸馏策略,在GLUE与SQuAD等任务中实现超过10×的推理加速25。同时,剪枝策略也在逐步走向更高效的梯度估计方法。例如,FLOP26采用低秩分解同时,通过正则化与增强型拉格朗日优化,从权重矩阵中自适应剔除冗余成分,不仅提升了剪枝灵活性,还保留了稠密矩阵计算的效率。而BMP27引入半结构化的块级剪枝,对注意力与前馈模块进行子矩阵级压缩,在保证可部署性的同时具备更强的表达能力。不过,上述方法均未跳出微调前剪枝或微调后剪枝的框架,仍需对全模型进行微调。为了进一步降低剪枝所需的计算成本,RECAP28提出了无需预训练的高效框架,基于泰勒近似与Fisher信息作为指标进行重要性评估,在显著节省内存开销的同时保持性能稳定。

尽管上述方法在效率与性能之间做出了诸多探索,但它们普遍存在以下几个不足:1) 全模型微调策略不适用于GPU显存有限的大模型训练场景;2) 现有的剪枝策略仍依赖梯度信息来评估权重重要性,导致剪枝阶段计算与内存成本高昂;3) 剪枝后的模型依赖全参数更新或者需要额外的蒸馏手段来恢复模型性能,增加了资源消耗与训练时间。

1.4 LoRA

LoRA作为一种参数高效微调技术,为解决上述问题提供了新思路。其通过向冻结的预训练模型中注入可训练的低秩矩阵来近似权重更新,并且有效地减少了模型微调开销,并提升了推理效率,其原理如图1所示。

图中1a的Full Fine-Tuning是传统全量微调方式,输入经预训练权重W与可微调权重ΔW相加得到输出,即对预训练模型的权重进行全量更新微调;图1b的LoRA向冻结的预训练模型中注入可训练低秩矩阵近似权重更新,改进后的前向计算形式为:

Output=(W+ΔW)X+b     =WX+b+ΔWXResidual     =WX+b+(BA)X

其中,WRdout×din表示原始的权重矩阵,XRdin×n为输入特征,bRdout为偏置项。ΔW=BA是通过低秩分解引入的参数微调增量,其中BRdout×r,ARr×din,且秩 rmin(din,dout)。这种分解将可训练的参数量从d×k减少到r×(d+k),矩阵A采用高斯分布初始化。其中,矩阵B初始化为全0矩阵来保证更新量的零初始化。

针对目前模型压缩工作存在的不足,本文研究了以下内容:1) 如何将LoRA与结构化剪枝更好地结合起来,突破全模型微调带来的资源瓶颈;2) 研究降低剪枝阶段的计算与内存开销;3) 结合LoRA技术降低剪枝模型恢复性能的开销。

2 基于LoRA评估重要性的结构化剪枝方法设计

本文提出了一种基于LoRA评估重要性的结构化剪枝方法,旨在在不引入大量计算与显存开销的前提下,实现高效的模型参数压缩与性能恢复。具体地,如图2所示,本文通过引入轻量的低秩可训练矩阵 AB,在微调过程中利用其梯度信息评估原始权重的重要性,来替代传统剪枝方法中对权重梯度的依赖。其次,引入约束函数并采用指数稀疏率调节策略逐步剪枝MHA和FFN模块的冗余参数,每轮剪枝后通过对LoRA参数的更新即可快速恢复模型性能,无需全量参数更新,显著提升训练效率与部署适应性。

2.1 基于LoRA评估的权重重要性

本文采用LoRA的低秩矩阵来评估权重重要性,从而减少剪枝带来的额外存储和计算开销。本文采用了一种基于模型损失函数变化的权重重要性评估策略22,用去除该权重后损失函数(x,y,W)的变化近似表示为该权重的重要性,损失变化越大则越重要。结合LoRA之后,权重Wi,j的重要性I^i,j计算表达式如下:

I^i,j=(x,y,W)-x,y,W|Wi,j=-(BA)i,j2

式(5)表示将权重Wi,j的有效贡献置为零,即用-(BA)i,j抵消LoRA更新,以观测其对损失变化的影响。为了降低计算复杂度,对等式(5)沿(BA)i,j方向使用一阶泰勒展开可得:

I^i,j=(BA)i,jWi,j+(BA)i,j2

其中,(BA)i,j表示损失函数相对于元素(BA)i,j 的梯度,可以反映Wi,j的重要性程度。然而,直接计算并存储完整梯度矩阵(BA)会带来与原始权重同量级的存储与计算开销,不利于资源受限场景下的实时剪枝。所以需要将(BA)i,j进一步处理,由链式法则推导可知,可以仅用矩阵AB及对应梯度表示权重重要性如下:

I^i,j=(Bi,:A:,j+Bi,:A:,j-Bi,:A:,j)Wi,j+(BA)i,j2

式(7)近似形式避免了显式计算与存储完整梯度矩阵,大幅降低了梯度存储与计算成本。获取该权重重要性的算法流程如算法1所示。

2.2 构建结构化剪枝问题

本文采用结构化剪枝以提高硬件友好性,并确保剪枝后的模型在实际部署中的延迟和内存开销得到有效优化。针对Transformer编码器,本文将剪枝对象聚焦MHA与FFN层的参数模块。为了充分利用模块化结构并避免剪枝后出现不一致的结构破坏,本文在剪枝前对模型权重进行分组。

假设WGm属于同一组的权重,其中m表示组索引。在MHA层中,将属于同一注意力头的所有参数矩阵(WQWKWVWO)作为同一个剪枝组Gm。在FFN层中,则以每一个隐藏单元为单位进行分组,即第l层第f个前馈单元的相关权重(W:,f(1)Wf,:(2))共同作为同一个剪枝组Gm。则每组的综合权重重要性定义为组内各元素重要性的累加形式:

I^m=WGm(BA+BA-BA)W2

为模型权重进行分组后,本文为每组模块引入一个二值掩码变量,以指示该模块是否被保留。具体地,设第l层第h个注意力头的掩码为mlh0,1,第l层第f个前馈单元的掩码为mlf0,1。其中,mlh=1表示该头被保留,参与训练计算;mlh=0表示该头被移除,不参与训练计算。当对MHA与FFN模块施加二值掩码后,每个模块的输出可以表示为以下形式:

MHA(x;mlh)=i=1Hml,ihAttni(x)
FFN(x;mlf)=i=1Nml,ifW:,i(2)σWi,:(1)x+b(1)+b(2)

其中,H表示MHA层注意力头的个数,N表示FFN隐藏层单元数,x表示第l层注意力子模块的输入向量。式(9)ml,ihAttni(x)表示第i个头的输出按掩码ml,ih缩放或屏蔽。若ml,ih=1则该项等于Attni(x);若为0则该项为零向量。则式(10)表示如果ml,if=0则该隐藏单元的整个贡献被置零,等于把第i列从W(2)上删掉。

算法1 权重重要性计算

Require: 模型,数据集 𝒟,训练轮数 Nepoch

Ensure 重要性分数 I

function CalculateImportance (DNepoch

for epoch =1 to Nepoch do

for each batch  D do

l,WForward(batch,)    //前向传播

Backward(l)       //反向传播

AGetGradA)    //提取梯度A

BGetGradB()    //提取梯度B

IAB+BAW2     //重要性计算

end for

end for

return I

end function

2.3 剪枝流程设计

为了更加全面地兼顾模型性能与部署效率,本文将剪枝问题建模为多目标优化问题。与传统仅约束模型参数量的方法不同,本文引入两个正则项:资源消耗项与结构稀疏项,从而形成如下目标函数:

minm task(m;W)+λ1cost(m)+λ2sparsity(m)

其中task(m;W)表示在掩码m下模型的任务损失;cost(m) 衡量剪枝后模型的资源占用,如显存占用或者FLOPs;sparsity(m)=1|m|imi表示模型结构的稀疏性;λ1,λ2 为调节性能、资源与压缩比的超参数。

该目标函数在优化过程中允许启发式搜索方法在性能和资源间做柔性权衡,增强了剪枝策略的适应性与泛化性。

算法2 基于指数稀疏率调节与多目标函数的剪枝掩码搜索

Require: 权重重要性I,初始稀疏率vi,目标稀疏率vf,总训练步数T,指数衰减系数α,正则化系数λ1,λ2

Ensure 最优掩码 m*=(mh,mf)

初始化掩码mh1mf1#初始化所有注意力头和前馈单元均保留

F*,m*(mh,mf)# 初始化最优目标值和最优掩码

for t=1 to T do

vtvf-(vf-vi)exp(-αt/T)//计算当前步的稀疏率vt

rt1-vt      //当前应保留的结构比例rt

NhrtLH //计算当前需保留的注意力头数量

NfrtLF //计算当前需保留的前馈单元数量

Ih从大到小排序,取前Nh个索引:IdxhTopK(Ih,Nh) //选择保留的重要性头索引

If 从大到小排序,取前 Nf 个索引:IdxfTopK(If,Nf) // 选择保留的重要性前馈单元索引初始m^h0LH, m^f0LF // 初始化候选掩码为0(全剪)

for each iIdxh do

m^h[i]1     // 设置当前注意力头保留

end for

for each jIdxh do

m^f[j]1     // 设置当前通道数保留

end for

task(f(x;m^),y)  // 基于掩码m^计算模型损失costFLOPs(m^)  // 根据掩码估算计算代价sparsity1LH+LFm^h+m^f//计算稀疏度

Fttask+λ1cost+λ2sparsity//计算当前步的多目标函数值

if Ft<F* then

F*Ft,m*(m^h,m^f) //若当前目标函数更优,则更新最优掩码

end if

end for

return m*  //返回在训练过程中表现最优的剪枝掩码

为了避免一次性剪枝对模型带来不可恢复的性能损失和提升剪枝策略的灵活性与收敛性能,本文引入一种基于指数增长的稀疏率调节函数,用于动态控制剪枝强度的变化过程。该策略能使模型能够在训练过程中逐渐适应参数的减少,提高模型的稳定性和鲁棒性以及通过在训练过程中逐渐增大压缩力度,使得模型在可恢复范围内逐渐满足目标函数。同时,对LoRA的参数 AB 进行更新以恢复模型性能。具体形式如下所示:

V(t)=vf-(vf-vi)e-αt/T

其中,t表示当前训练步数,T 为训练的总步数,vivf分别为初始稀疏率和目标稀疏率,α>0为指数增长的控制系数,用于调节稀疏率增长的速度。策略说明:1) 在训练初期(t0)稀疏率变化缓慢,使模型能够充分学习原始特征,避免早期剪枝带来的性能退化;随训练过程推进,稀疏率平滑提升,最终逐渐逼近目标稀疏率 vf,保证剪枝强度的可控性;2) 通过调节超参数 α,可灵活控制剪枝节奏,使其适应不同的模型结构与任务需求。

具体而言,在训练初期,保持较低的剪枝比例,让模型正常学习和收敛;随着训练的进行,逐渐增加剪枝比例,模型在学习过程中逐步调整自身结构,以适应参数的变化。

算法2展示了一种基于指数型稀疏率调节函数的渐进式剪枝策略。算法首先初始化注意力头掩码 mh和前馈单元掩码 mf为全1,即保留所有结构。每轮迭代中,根据当前步数t计算稀疏率目标v(t),进而确定保留的结构数目NhNf。其次,基于当前的重要性得分 I=(Ih,If),筛选出得分最高的Nh个注意力头与Nf个前馈单元,构造候选掩码 (m^h,m^f)。同时,计算该掩码下的任务损失task、资源约束cost与结构稀疏度误差,并综合为总目标函数total。若该结构性能更优,则更新当前掩码,并记录精度与剪枝索引。最终,选择准确率最高的结构作为最优剪枝方案m*=(mh,mf)输出。

3 实验

3.1 实验对比设置

3.1.1 数据集

GLUE基准数据集:用于测试BERT-base模型在不同压缩方法上的性能。GLUE任务包含SST-2、QQP、QNLI、MRPC、CoLA、STSB、RTE。其中,SST-2、QNLI和RET采用正确率分数(Accuary)作为评价指标,CoLA采用马修斯相关系数( Mcc ),QQP和MRPC采用F1分数和Accuary作为评价指标,STSB采用Pearson相关系数和Spearman相关系数。

CIFAR100和TinyImageNet数据集:测试各种Vision Transformer模型(ViT-base、ViT-large和ViT-huge)在不同压缩方法上的性能,均采用正确率分数(Accuary)作为评价指标。

3.1.2 实验对比方法说明

本文选取多种主流的网络剪枝与稀疏化策略方法对BERT-base模型进行压缩精度对比,其中BMP27基于重要性估计全局稀疏化;RECAP28采用迭代式重要性评估与再训练的稀疏化框架;LayerDrop29基于层级随机失活结构化压缩;SNIP30通过一次前向计算评估权重敏感度;PGB31利用梯度信息引导剪枝决策分组剪枝;Movement32在微调过程中联合优化剪枝掩码动态稀疏化。

3.2 实验设置

实验硬件采用NVIDIA RTX 3090 GPU和Intel® Xeon® Silver 4210R CPU(主频2.40GHz),基于CUDA 12.2加速环境。优化器选择AdamW(默认动量参数),权重衰减系数设置为1×104。训练配置中,训练周期(epoch)根据数据集规模自适应调整,批次大小固定为32,初始学习率为1×10-4。稀疏化参数设置中,初始稀疏率为0.01,剪枝步数阈值与训练总步数的比例设定为0.01。

3.3 在BERT-base模型的实验对比

为了充分验证本文所提出方法的有效性,将本文方法与BMP27,RECAP28,LayerDrop29,SNIP30,PGB31等先进方法进行对比。对BERT-base模型进行压缩,实验结果如表1所示。其中,BERT-base是经过微调后的基线模型。

实验结果表明,本文所提出的方法在50%和80%的剪枝率下,在多个任务中的性能表现仍保持领先。具体而言,相比于基线模型,当稀疏率为 50%时,在QQP上的性能损失仅有0.29%,显著低于LayerDrop和RECAP等方法。此外,在进一步提高模型稀疏度时,本文所提出的方法仍然优于其他方法。

3.4 在Vision Transformer模型的实验对比

为了验证所提出方法在不同稀释率和显存效率上的优势,本文将所提出的剪枝策略与其他策略进行了对比。其中,Full-FT表示无剪枝的全量微调,Head-FT表示仅微调任务头,冻结其余参数,Pre-FT和Post-FT分别代表剪枝后微调与剪枝前后双阶段微调策略22,Movement通过联合优化将剪枝融入到微调过程中32,RECAP为基于重要性评估的迭代式稀疏化框架28。Full-FT被用作基线方法,以衡量不同压缩方法所导致的性能损失。

3.4.1 不同稀疏比例下的性能变化趋势

为了探究所提出的方法在不同稀疏率下的性能变化,本文采用不同的压缩方法对ViT-base和ViT-large 模型进行剪枝,并在CIFAR100和TinyImageNet数据集上开展实验,实验结果如图3图4所示。由图可知,本文所提方法在不同稀疏下的剪枝模型性能显著优于其他剪枝方法。具体而言,随着稀疏率的增大,Pre-FT和RECAP的剪枝模型性能下降明显,而本文所提方法与Post-FT能保持相对稳定的性能,精度曲线更为平缓。并且,本文所提方法始终接近甚至优于Post-FT。实验结果表明,本文所提出的方法在多任务场景和高稀疏水平下展现了显著优势,有效减少了模型参数量并保持了模型性能。

3.4.2 不同剪枝策略的性能与显存效率分析

为了验证所提出方法在显存效率上的优势,本文将所提出的剪枝和微调策略与其他策略进行了对比,并报告了对应的显存,实验结果如表2所示,稀疏率统一设置为33.3%。

实验结果表明,本文方法在显存占用与模型精度上均表现出优越的性能-效率权衡,能够在多种Vision Transformer模型与数据集上保持较高精度,并且实现最低显存占用。

1) ViT-base:本文方法显存占用为387 MB,较Movement和Post-FT分别降低68.17%和67.75%。在CIFAR100数据集上达到最优精度,在TinyImageNet数据集上与Post-FT和Movement相差甚微。

2) ViT-large:本文方法显存占用为1229 MB,较Movement和Post-FT分别降低68.40%和68.10%。在CIFAR100数据集上达到最优精度,在TinyImageNet数据集上精度高于Movement与Post-FT精度相近。

3) ViT-huge:显存占用为2478 MB,较Movement和Post-FT分别降低69.06%和68.90%。在CIFAR100数据集上达到最好精度,相比于基线模型性能损失最少。

4) 此外,虽然RECAP在显存占用上与本文方法接近,但在各数据集上的精度显著低于本文方法,进一步验证了本文方法在不同模型与数据集上的综合优势。

为进一步验证本文方法在性能与显存效率上的统计显著性,对表2中各方法结果进行了统计分析。Friedman检验结果显示,在模型精度上χ²= 28.89,p=0.000 1,在显存占用上χ²=17.71,p=0.007 0,表明不同方法间在性能与显存方面的差异均具有统计显著性。随后,采用 Wilcoxon配对检验对本文方法与各方法进行两两比较。结果表明,本文方法在精度上显著优于 Head-FT、Pre-FT和RECAP方法(P<0.05),与 Movement和Post-FT方法性能持平(P=0.093 8 与0.593 8)。在显存占用方面,本文方法在3种模型规模下均保持最低显存需求,平均仅为 1365 MB,尽管差异仅表现出边缘显著性(P≈0.1),但结合绝对数值差异可认为其在显存效率上具有明显改进趋势。进一步构造综合性能-效率指标S=Accuracy-0.001×Mem,结果显示,本文方法的平均得分最高(88.80),显著优于Movement(85.50)和Post-FT(85.88)。该结果表明,本文提出的基于LoRA的权重重要性评估与结构化剪枝策略,能够在保证模型精度的同时显著减少资源消耗,实现性能与效率的最优平衡。

3.5 消融实验

3.5.1 不同重要性评估方式的比较

为验证不同重要性评估策略在结构化剪枝中的有效性,本文比较了基于权重大小(Weight Magnitude)、梯度(Gradient-base)和LoRA(LoRA-base)等3种方法在33.3%。从表3中可以看出,本文采用的LoRA评估的重要性方法在平均性能和显存上都优于其他两种方案。具体如下,LoRA仅使用低秩矩阵梯度计算重要性,与使用权重梯度相比,分别节约了44.39%和48.58%的显存。而Magnitude的显存占用虽然与LoRA一样,但模型性能损失明显。进一步的Wilcoxon配对检验显示,LoRA-base方法在精度上较Weight magnitude 平均提升3.17%,在显存上较Full-FT 与 Gradient-base分别减少1719 MB和735 MB,由于样本数量限制虽未达到统计显著(P>0.05),但在多模型与任务上均表现出一致的性能提升与显存节省趋势。

3.5.2 不同稀疏率调节函数设置的比较

为探究不同渐进函数策略对模型性能的影响,本文重点对比了3种稀疏率调节方法,分别是(a)均匀增长、(b)指数增长和(c)分段增长。其中,(a)均匀增长是最简单直观的渐进函数策略,其核心是让稀疏度随着迭代次数呈线性增长,公式如下:

fx=x,x0,1

然而,其在不同训练阶段缺乏适应性。实际中,初期应缓慢提升稀疏度以应对梯度不稳定,中期可加速增长,后期则需放缓以降低压缩难度。为实现这种动态增长特性,本文进一步对比了两种策略:1) 本文所采用的(b)基于指数增长的稀疏率调节函数; 2)(c)分段增长的渐进函数,其公式如下:

v(t)=                        vi,                                0  t < ts, vi+(vf-vi)(3t-tsT-ts-tf2-2t-tsT-ts-tf3), ts   t < T -tf,                                vf,                                 T - tf t   T (14)

其中tstf通常设置为0.1T

表4展示了不同函数策略对BERT-base剪枝模型性能的影响。由表可知,动态策略(b)与(c)分别较(a)提升模型性能0.81%和0.32%,且(b)整体性能最佳,因此本文采用指数增长作为稀疏率调节函数。

4 结论

本文提出了一种基于LoRA评估重要性的结构化剪枝框架,用于实现预训练语言模型的高效压缩与微调。该方法利用LoRA中低秩矩阵的梯度信息评估参数重要性,避免了在剪枝过程中对完整梯度的计算需求,显著降低了显存占用和计算开销。此外,剪枝后的模型可通过轻量级的 LoRA微调实现性能恢复,无需进行代价高昂的全量参数更新。进一步地,本文将剪枝问题建模为多目标优化任务,并引入指数型稀疏率调节机制,在保证任务性能的同时动态控制稀疏率增长,使模型在训练过程中逐步适应压缩。在GLUE基准任务上的实验结果表明,在相同稀疏度下,所提出方法不仅在多个任务上性能优于或接近现有剪枝方法,同时在资源使用方面表现出显著优势,GPU显存开销最多可减少68.9%。这些结果充分验证了该方法在资源受限环境中应用的实际潜力。未来,本文将进一步探索将该框架与量化、知识蒸馏等模型压缩技术相结合,以进一步提升其效率与可扩展性。

参考文献

[1]

Vaswani AShazeer NParmar Net al.Attention is all you need[J].Adv Neural Inf Process Syst201730:5998-6008.

[2]

Devlin JChang M WLee Ket al.BERT: Pre-training of deep bidirectional transformers for language understanding[C]//Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, 2019: 4171-4186.

[3]

Liu YOtt MGoyal Net al.RoBERTa: A robustly optimizedBERT pretraining approach [PP/OL].[2025-06-28].

[4]

Brown TMann BRyder Net al.Language models are few-shot learners[J].Adv Neural Inf Process Syst202033: 1877-1901.

[5]

Wang ASingh AMichael Jet al.GLUE: A multi-task benchmark and analysis platform for natural language understanding[C]//Proceedings of the 2018 EMNLP Workshop Blackbox NLP: Analyzing and Interpreting Neural Networks for NLP, 2018: 353-355.

[6]

Dosovitskiy ABeyer LKolesnikov Aet al.An image is worth 16×16 words: Transformers for image recognition at scale[PP/OL].[2025-06-28].

[7]

Shih K-HChiu C-TLin J-Aet al.Real-time object detectionwith reduced region proposal network via multi-feature concatenation[J].IEEE Trans Neural Netw Learn Syst202031(6): 2164-2173.

[8]

Tang YWang YGuo Jet al.A survey on transformer compression[PP/OL].[2025-06-28].

[9]

Lin JTang JTang Het al.AWQ: Activation-aware weight quantization for on-device LLM compression and acceleration[J].GetMobile: Mobile Comp and Comm202528(4): 12-17.

[10]

Anagnostidis SBiggio LHofmann Tet al.Dynamic context pruning for efficient and interpretable autoregressive transformers[J].Adv Neural Inf Process Syst202336: 65202-65223.

[11]

Voita ETalbot DMoiseev Fet al.Analyzing multi-head self-attention: Specialized heads do the heavy lifting, the rest can bepruned[C]//Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics, 2019: 5797-5808.

[12]

Wang ZHong WTan Y-Pet al.Pruning 3D filters for accelerating 3D ConvNets[J].IEEE Trans Multimed202022(8):2126-2137.

[13]

Wang HZhang W Q.Unstructured pruning and low rank factorisation of self-supervised pre-trained speech models[J].IEEE J Sel Top Signal Process202418(6): 1046-1058.

[14]

Han SMao HDally W J.Deep compression: Compressing deep neural networks with pruning, trained quantization and huffman coding[PP/OL].[2025-06-28].

[15]

Michel PLevy ONeubig G.Are sixteen heads really better than one?[C]//Proceedings of the 33rd International Conference on Neural Information Processing Systems, 2019: 14037-14047.

[16]

Kang H J.Accelerator-aware pruning for convolutional neural networks[J].IEEE Trans Circuits Syst Video Technol202030(7):2093-2103.

[17]

Frankle JCarbin M.The lottery ticket hypothesis: Finding sparse, trainable neural networks[PP/OL].[2025-06-28].

[18]

Hu E JShen YWallis Pet al.Lora: Low-rank adaptation of large language models [PP/OL].[2025-06-28].

[19]

Fang GMa XWang X.LLM-pruner: On the structural pruningof large language models[C]//Advances in Neural Information Processing Systems 36, 2023: 21702-21720.

[20]

LeCun YDenker JSolla S.Optimal brain damage [C]//Proceedings of the 3rd International Conference on Neural Information Processing Systems, 1989: 598-605.

[21]

Lee JPark SMo Set al.Layer-adaptive sparsity for the magnitude-based pruning[PP/OL].[2025-06-28].

[22]

Molchanov PMallya ATyree Set al.Importance estimation for neural network pruning[C]//2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2019: 11256-11264.

[23]

Kwon WKim SMahoney M Wet al.A fast post-training pruning framework for transformers[J].Adv Neural Inf Process Syst202235: 24101-24116.

[24]

Liu ZLi FLi Get al.EBERT: Efficient BERT inference with dynamic structured pruning[C]//Findings of the Association forComputational Linguistics: ACL-IJCNLP 2021, 2021: 4814-4823.

[25]

Xia MZhong ZChen D.Structured pruning learns compact and accurate models[C]//Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics, 2022: 1513-1528.

[26]

Wang ZWohlwend JLei T.Structured pruning of large language models[C]//Proceedings of the 2020 Conference on EmpiricalMethods in Natural Language Processing (EMNLP), 2020: 6151-6162.

[27]

Lagunas FCharlaix ESanh Vet al.Block pruning for faster transformers[C]//Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing, 2021: 10619-10629.

[28]

Ilhan FSu GTekin S Fet al.Resource- efficient transformerpruning for finetuning of large models [C]//2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2024: 16206-16215.

[29]

Sajjad HDalvi FDurrani Net al.Poor man’s bert: Smaller and faster transformer models[PP/OL].[2025-06-28].

[30]

Lin ZLiu JYang Zet al.Pruning redundant mappings in transformer models via spectral-normalized identity prior[C]//Findings of the Association for Computational Linguistics: EMNLP 2020, 2020: 719-730.

[31]

Lim HLee JChoi D W.PGB: One-shot pruning for BERT via weight grouping and permutation[J].Jair202685: 1-20.

[32]

Sanh VWolf TRush A.Movement pruning: Adaptive sparsityby fine-tuning[J].Adv Neural Inf Process Syst202033: 20378-20389.

基金资助

国家自然科学基金(62374047)

国家自然科学基金(62174038)

计算机体系结构国家重点实验室开放课题(CLQ 202407)

AI Summary AI Mindmap
PDF (1390KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/