基于输出激活引导的大模型通道级自适应稀疏度剪枝方法

李沛鸿 ,  贺傍 ,  周彤昕 ,  李丽 ,  傅玉祥

南京大学学报(自然科学) ›› 2026, Vol. 62 ›› Issue (03) : 422 -433.

PDF (1000KB)
南京大学学报(自然科学) ›› 2026, Vol. 62 ›› Issue (03) : 422 -433. DOI: 10.13232/j.cnki.jnju.2026.03.008

基于输出激活引导的大模型通道级自适应稀疏度剪枝方法

作者信息 +

OGAS: Output⁃activation guided pruning with adaptive sparsity for large language model

Author information +
文章历史 +
PDF (1023K)

摘要

针对大语言模型(Large Language Model,LLM)在端侧部署时面临的计算资源受限与显存占用过高问题,训练后剪枝(Post⁃Training Pruning,PTP)是一种高效的压缩手段.然而,现有的主流方法(如Wanda,SparseGPT)通常采用层级统一的稀疏度策略,忽视了不同层级与通道间显著的信息贡献异质性,而且,其评估多聚焦于输入侧强度,难以识别高能量静态冗余通道,导致高压缩率下模型精度严重衰减.为此,提出一种输出激活引导的通道级自适应稀疏度剪枝方法(OGAS).该方法首先构建融合输出激活能量范数与峰均比(Peak⁃to⁃Average Power Ratio,PAPR)的双重评价指标,从响应强度与特征特异性两个维度精准识别并保护稀疏关键特征;其次,设计了基于非线性曲率的连续映射机制,在连续空间内实现通道级稀疏度的动态自适应分配;此外,还引入黄金分割搜索算法来构建闭环优化流程,实现了关键超参数的层级自动寻优.在LLaMA⁃3和Mistral上的实验结果表明:在50%稀疏度下,OGAS将LLaMA⁃3.1⁃8B在WikiText⁃2数据集上的困惑度(Perplexity,PPL)降至7.99,相比于目前主流的一阶方法Wanda PPL=8.85取得了显著提升;在常识推理任务上的零样本平均准确率达到63.46%,和Wanda相比提升了1.6%.实验结果验证了OGAS能够更有效地保持大幅压缩后模型的语义理解与逻辑推理性能,在不同架构的模型上均表现出优异的稳健性与通用性.

Abstract

Post⁃training pruning (PTP) has emerged as an efficient compression technique to address the challenges of limited computational resources and excessive memory footprint during the edge deployment of Large Language Models (LLMs). However,existing mainstream methods (e.g.,Wanda and SparseGPT) typically employ uniform layer⁃wise sparsity strategies,overlooking the significant heterogeneity in information contribution across different layers and channels. Moreover,their evaluation criteria predominantly focus on input⁃side intensity,making it difficult to identify high⁃energy static redundant channels,which leads to severe model performance degradation under high compression ratios.To address these limitations,this paper proposes OGAS,an Output⁃activation Guided Adaptive Sparsity pruning method at the channel level. First,a dual evaluation metric is constructed by integrating the output activation energy norm with the Peak⁃to⁃Average Power Ratio (PAPR) to accurately identify and protect sparse key features from the dimensions of response intensity and feature specificity. Second,a continuous mapping mechanism based on non⁃linear curvature is designed to achieve dynamic adaptive allocation of channel⁃level sparsity within a continuous space. Furthermore,a closed⁃loop optimization workflow is established by introducing the Golden Section Search algorithm to realize the automated layer⁃wise tuning of critical hyperparameters.Experimental results on mainstream open⁃source models,including LLaMA⁃3 and Mistral,demonstrate that at a 50% sparsity ratio,OGAS reduces the perplexity (PPL) of LLaMA⁃3.1⁃8B on the WikiText⁃2 dataset to 7.99,a significant improvement over the state⁃of⁃the⁃art first⁃order method Wanda (8.85). In common sense reasoning tasks,the average zero⁃shot accuracy reached 63.46%,representing a 1.6% improvement over Wanda. The results verify that OGAS effectively maintains the semantic understanding and logical reasoning capabilities of models after large⁃scale compression,exhibiting superior robustness and versatility across different model architectures.

Graphical abstract

关键词

大语言模型 / 训练后剪枝 / 自适应稀疏度 / 峰均比(PAPR

Key words

large language model / model pruning / adaptive sparsity / Peak⁃to⁃Average Power Ratio

引用本文

引用格式 ▾
李沛鸿,贺傍,周彤昕,李丽,傅玉祥. 基于输出激活引导的大模型通道级自适应稀疏度剪枝方法[J]. 南京大学学报(自然科学), 2026, 62(03): 422-433 DOI:10.13232/j.cnki.jnju.2026.03.008

登录浏览全文

4963

注册一个新账户 忘记密码

近年来,以LLaMA⁃31为代表的大语言模型(Large Language Model,LLM)在自然语言理解、逻辑推理及多轮对话等任务中表现优异.然而,随着模型性能的提升,其参数规模也呈指数级增长,通常达到数百亿甚至千亿量级.庞大的参数量带来了巨大的计算成本与显存占用,限制了LLM在边缘计算设备及实时在线服务中的部署.因此,模型压缩技术成为推动模型在实际工业中部署的重要研究方向2.剪枝是模型压缩技术中的一种,在众多剪枝范式中,训练后剪枝(PostTraining Pruning,PTP)无需昂贵的重训练过程,仅需少量校准数据即可实现高效压缩,具备较好的工程实用价值3-4.
尽管现有的PTP方法(如SparseGPT5,Wanda6,RIA7,SliceGPT8,OWL9等)在压缩效果上取得了一定突破,但在追求极限压缩比的过程中,科学地界定参数的重要性仍是一个未被完全解决的难题,其核心挑战在于LLM内部特征分布的强异质性与剪枝策略的适配性之间的矛盾.强异质性指LLM内部不同神经元和通道在激活数值、分布范围以及对输出的影响力上存在的极大的不均衡性10-11.现有研究表明,LLM的不同层级乃至同一层内的不同通道,在特征提取与语义表征中发挥着截然不同的作用712.这种异质性与剪枝策略之间的矛盾在于统一的剪枝比例无法兼顾不同通道对模型性能的不同贡献度,导致关键通道被过度压缩而冗余通道仍有残留.部分通道对特定语义高度敏感,承载了模型的长尾知识,另一部分通道则表现为高均值、低方差的统计特性,本质上近似于静态背景噪声10.然而,主流的剪枝策略通常采用全局统一或层级统一的稀疏度分配,即强制模型的所有部分承担相同的压缩比例.这种策略在理论上并非最优,往往导致对富含信息的高特异性通道的过度修剪,会引发推理能力的退化.同时,对冗余通道压缩不足,也限制了整体参数效率的提升.此外,在衡量通道价值时,单纯依赖权重的幅值或输入激活强度往往存在局限性.高能量的激活可能仅仅是由于归一化层没有对齐而产生的高能量静态冗余13-14,若无法区分这种静态冗余与真正的有效信号,可能影响剪枝决策的准确性.最新的研究SpQR15也指出,分离这些高能量的激活对于保持模型精度至关重要.
针对上述问题,本文提出一种输出激活引导的通道级自适应稀疏度剪枝方法(Output⁃Activation Guided Adaptive Sparsity,OGAS),通过分析通道的信息承载密度,动态调整其稀疏度配额.具体地,OGAS从输出端入手,构建了融合能量范数(Energy)与峰均比(Peak⁃to⁃Average Power Ratio,PAPR)的双重评价指标.利用PAPR对信号波动性的敏感度来规避高能量噪声的干扰,识别出能量较低但对特定语义重要的稀疏特征通道.在此基础上,本文设计了一种基于非线性曲率的连续映射机制,将通道的重要性评分转化为精确的稀疏度,并引入黄金分割搜索算法构建参数闭环优化流程.该流程能够以层级重构误差为导向,自动寻找每一层较优的分配曲率,从而在无需人工干预的情况下实现资源分配的优化.
本文的主要贡献如下.
(1)提出融合信号特异性的双重评价指标.结合输出激活的能量范数与PAPR指标,有效区分了“高能量静态冗余”与“低能量关键特征”,弥补了单一维度评估的缺陷.
(2)构建连续自适应稀疏度分配框架.摒弃了僵化的统一剪枝策略,设计了非线性映射函数,根据通道重要性在连续区间内自适应分配剪枝率,实现了模型精度的最大化保留.
(3)实现参数的全局自动化寻优.利用黄金分割搜索算法实现了超参数的自动配置,显著提升了算法在不同模型与任务上的泛化能力.

1 相关理论

1.1 剪枝范式的演进与稀疏度分配

模型剪枝旨在通过移除神经网络中的冗余参数来降低计算量与显存占用.根据参数移除的几何约束不同,现有的剪枝范式主要包括非结构化、结构化和半结构化剪枝,各类方法在精度保留与硬件效率之间寻求不同的平衡点.非结构化剪枝是发展最早且最为精细的剪枝方式,其核心思想是以单个权重元素为单位进行独立筛选与剔除15-16.由于消除了几何约束的限制,该方法能够保留模型中最重要的参数权重,从而在极高的稀疏度水平下依然保持较好的模型精度,常被视为探索模型参数冗余下限的理想工具17.尽管在早期硬件上实现加速存在挑战,但随着稀疏矩阵计算库(如CuSparse)的发展,非结构化剪枝在极高稀疏度下的理论压缩比的优势依然显著,特别是在对精度极其敏感的大语言模型场景中,它是维持模型推理能力的重要基准.

结构化剪枝强制移除完整的几何结构,如神经元通道、注意力头或模型层18-20.经典的Network Slimming19和ThiNet20通过评估通道的重要性来移除冗余结构,降低显存占用并获得显著的硬件加速.虽然这种方式效率极高,但对模型结构的破坏比较剧烈,往往导致精度的严重衰减,通常需要配合昂贵的微调来恢复性能.为了缓解这一问题,最新的研究,如LLM⁃Pruner21,Sheared LLaMA22和SliceGPT8等,尝试通过正交变换或端到端微调等手段将网络投影到稀疏基底上以减少信息损失,但这些方法往往会引入额外的计算开销,或需要特定的算子来进行融合支持,增加了部署的复杂性.

为了平衡细粒度的精度优势与结构化的效率优势,NM半结构化稀疏(如NVIDIA的2∶4模式)逐渐成为一种主流的折衷方案23-24.该模式要求在连续的权重块中必须有固定数量的零元素,既保留了部分权重的选择灵活性,又能利用特定指令集来实现推理加速.

然而,无论采用何种剪枝粒度,现有的主流方法在稀疏度分配策略上仍显僵化.大多数方法(如Wanda6,SparseGPT5,RIA7)在模型全局或层内采用统一的稀疏度目标.已有研究指出,LLM的不同层级乃至同一层内的不同通道,对于知识存储与推理能力的贡献具有显著的异质性1425-26.强制所有层或通道承担相同的压缩比例,会导致对富含信息的关键层的过度修剪,而对冗余层则压缩不足.因此,突破静态分配的限制以实现通道级的自适应稀疏度分配是提升剪枝后模型性能的关键突破口.

1.2 训练后剪枝的重要性评估准则

在PTP场景下,参数的重要性评估方式是决定剪枝质量的核心因素.早期的幅值剪枝基于一个朴素假设,权重的绝对值越小,其对输出的影响越弱16,但这种简单的评估方式没有考虑输入激活分布对网络输出的影响.随后,基于二阶信息的方法被提出.经典的Optimal Brain Damage(OBD)27和Optimal Brain Surgeon(OBS)28利用Hessian矩阵进行剪枝.Frantar and Alistarh5提出基于二阶信息的SparseGPT算法,将输入信息引入重要性评估.该方法将剪枝建模为局部重构误差最小化问题,通过计算Hessian逆矩阵来确定剪枝掩码并补偿剩余权重,在精度上取得了显著提升,但是对于计算资源的要求很高.

为了降低计算复杂度,Sun et al6提出Wanda算法,确立了一种简洁高效的一阶准则,利用权重幅值与输入激活范数的元素级乘积作为评分依据.Wanda的研究表明,LLM中激活值的异常值在衡量重要性方面比二阶信息更关键.沿着这一思路,Zhang et al7进一步提出RIA (Relative Importance and Activations)算法,发现绝对的一阶评估准则容易导致网络权重的整个通道被直接剪除,损害模型性能.为此,RIA引入相对重要性的概念,通过联合考察权重的输入通道、输出通道以及激活信息来评估每个权重元素在其所在行和列中的相对重要度.然而,无论是Wanda还是RIA,它们的核心依然局限于输入侧特征或局部的权重结构,未能充分感知输出特征的全局分布特性,因此,还是容易误判那些输入能量大但对输出信息实际贡献度低的冗余通道9.针对这一局限,本文提出的OGAS算法进一步将视角扩展至输出激活,通过感知输出特征的统计特性来修正传统一阶方法的评分偏差.

尽管上述评估准则被不断优化,但现有的剪枝方案在稀疏度分配上仍以简化策略为主.绝大多数方法在模型全局或层内采用统一的稀疏度目标,但这种策略没有充分考虑深度神经网络中普遍存在的特征贡献异质性14.已有研究指出,LLM的不同层对于知识存储与推理能力的贡献不均衡,部分层(如中间层)存在较多冗余,而部分关键层(如靠近输出端的层)对权重敏感25.虽然已有研究尝试通过Layer⁃wise搜索来分配不同层的剪枝率26,但这类方法通常面临搜索空间较大的挑战.本文旨在探索一种基于连续非线性映射的通道级分配机制,以更精细地匹配不同层级和通道的特征分布差异.

2 输出激活引导与自适应稀疏度的剪枝方法

针对现有训练后剪枝算法普遍忽视通道间信息承载能力的差异性,本文提出一种基于输出激活引导的大模型通道级自适应稀疏度剪枝方法(OGAS),算法的整体架构图如图1所示.该方法摒弃了传统层内均匀剪枝的静态策略,通过精细化的评价机制来实现模型参数的智能压缩.具体地,OGAS包含两个核心创新环节.首先,在重要性评估阶段,构建了融合能量范数与峰均比的输出特征感知机制,从信号响应强度与特征特异性两个维度精准甄别关键通道.其次,在稀疏度分配阶段,设计了基于非线性映射的自适应剪枝率分配模型,并引入黄金分割搜索算法(Golden Section Search),实现了对超参数的全局自动化寻优,从而在无需人工干预的情况下,最大化地保留模型在特定任务上的语义表征能力.

2.1 基于输出激活的通道重要性评估

现有的训练后剪枝算法(如Wanda)通常采用权重幅值与输入激活范数的乘积WX作为重要性评价指标.这种评估方式隐含了一个假设,即激活值的幅度越大,该通道对网络输出的贡献越重要.然而,在大语言模型中,非线性激活函数与层间的依赖关系使输入与输出之间的映射并非简单的线性传递,仅凭输入侧的统计量难以真实反映某一权重通道对下一层特征表示的实际贡献率.

为此,本文提出从输出激活的视角重新审视通道的重要性.一个高价值的特征通道应当具备两重属性:一是具备较高的响应强度,即对输入信号有显著反应;二是具备较强的特征特异性,即在特定语义场景下能被强烈激活,而非产生平庸的背景噪声.

设第l层的线性变换为Y=XW,其中WRCout×Cin为权重矩阵,X为校准数据集的输入,输出矩阵YRT×Cout.对于权重矩阵的第i行(即第i个输出通道),其输出是一个随输入样本和序列位置变化的张量.为了准确描述这一过程,定义N为校准数据集的样本总数,T为每个样本的序列长度.记yk,t,i为第k个样本中第t个Token在第i个通道上的输出激活值.为了衡量该通道的平均激活强度,采用均方根(Root Mean Square,RMS)评分.和传统的L2范数相比,RMS具有尺度不变性,通过对激活值的累积平方和引入与总Token数(即样本数乘以序列长度)相关的归一化因子,消除了校准数据集大小的影响,可以更稳健地反映通道在单位Token上的平均贡献能力.其计算如式(1)所示:

Ei=1N×Tk=1Nt=1Tyk,t,i2

然而,仅依赖能量容易忽略那些具有“稀疏突发”特性的关键神经元(即平时沉默,但在关键Token上强烈激活).为此,本文引入通信领域常用的PAPR指标Pi,通过计算通道在所有样本上的最大响应振幅与RMS的比值来捕捉特征的特异性.为了确保计算的稳定性和物理意义的准确性,本文在具体实现时,先在单一样本内部的Token维度上计算PAPR,再对所有样本取平均,如式(2)所示:

Pi=1Nk=1Nmaxt1,,Tyk,t,iEk,i+ϵ

其中,Ek,i=1Tt=1Tyk,t,i2表示第i个通道在第k个独立样本上的均方根能量.在式(2)的分子部分,maxt操作严格作用于Token维度,并使用激活值的绝对值yk,t,i以无视正负号捕捉峰值振幅;分母中的ϵ是为了防止除零的数值稳定常量,具体设定为10-9.

值得注意的是,大语言模型的激活值通常呈现极端的长尾分布,直接使用原始统计量会导致归一化后的数值堆积.为了解决这一问题,本文在代码实现中引入了对数平滑预处理.定义预处理后的特征评分E^iP^i,如式(3)所示:

E^i=Normln1+EiP^i=Normln1+Pi

其中,Normv=v-minvmaxv-minv+ϵ表示最大最小归一化操作,ln1+x函数优先被应用,用于有效抑制异常离群值的影响,从而扩展低能量区间的区分度.

最终,通过平衡因子λ将两者融合,得到第i个通道的综合重要性评分Ii,如式(4)所示:

Ii=1-λE^i+λP^i

为了直观验证上述双重评价指标相较于传统方法的优越性,选取LLaMA⁃3.1⁃8B模型中间层(Down Projection)的通道特征数据进行可视化分析,结果如图2所示,图中横坐标表示归一化的能量范数,纵坐标表示归一化的PAPR.

由图可见,传统的剪枝方法(如Wanda,图中红色垂直虚线所示)仅依赖幅值的阈值进行截断,这种单一维度的评估策略导致了严重的判别偏差.图中右下角的红色倒三角区域虽然能量极高,但PAPR极低,表明该类通道在所有样本上均持续高激活,本质上属于携带信息量极少的“高能量静态冗余”通道,却被Wanda错误地保留,挤占了宝贵的参数预算.相反,图中左上角的蓝色正三角区域虽然平均能量微弱,容易被传统方法误删,但拥有极高的PAPR,意味着它们是处理特定低频词或复杂句法结构的高特异性通道.OGAS方法通过引入PAPR指标,构建了一条自适应的倾斜决策边界(图中黑色实线所示),成功实现了对这两类极端情况的修正,既剔除了一般方法难以识别的伪偏置冗余,又挽救了对模型泛化能力至关重要的长尾特征通道.这种对特征价值的精准甄别,为后续实现通道级的自适应稀疏度分配奠定了坚实基础.

2.2 非线性自适应稀疏度映射

在获得通道级重要性评分Ii后,接下来的核心问题是依据该评分给每个通道分配相应的稀疏度.传统的剪枝方法通常采用粗放的层级统一剪枝率,忽视了通道间显著的信息承载差异,极易导致对关键通道的“过度修剪”或对冗余通道的“保留过多”.针对这一局限,本文提出一种基于非线性曲率的连续映射机制,在Smin,Smax的连续区间内实现稀疏度的精细化自适应分配.

为了在优先保护高评分关键通道的同时,最大化地压缩低评分冗余通道,构建了如下的非线性衰减映射模型.对于第l层的第i个通道,其自适应稀疏度si的计算如式(5)所示:

si=ClampSmin+α1-Iiγ,Smin,Smax

其中,Clamp将计算结果约束在预设的安全区间Smin,SmaxSminSmax分别为稀疏度的下界与上界.Smin确立了对高重要性通道的保护基线,确保这些关键通道仅受到极微量的压缩(如1%),从而维护核心语义通路的完整性;Smax限制了单一通道的过度剪枝,防止因冗余通道被完全剔除而导致的层级功能崩塌.式(5)中的γ是控制映射函数几何特性的关键超参数,通过调整γ的取值可以灵活改变映射曲线的曲率,从而调节算法对高分通道的保护力度以及对低分通道的压缩激进程度.这种非线性设计使OGAS能更好地拟合大语言模型参数分布的长尾特性,即在确保核心通道被完整保留的同时,对处于中间地带及尾部的冗余通道执行差异化的压缩策略.

上述模型中的缩放系数α是一个决定整体稀疏度水平的动态变量.为了确保层级剪枝后的平均稀疏度严格符合预设的全局目标Starget,将α的确定建模为如下的根求解问题.

定义层级平均稀疏度函数fα,如式(6)所示:

f(α)=1Couti=1Coutsi(α)

目标是寻找α*使得fα*=Starget.由于siα关于α严格单调递增,本文采用二分查找算法(Binary Search)在连续域内进行高效迭代求解,通过不断收缩搜索区间,能在极低的计算成本下快速收敛至最优解α*,在微观上实现通道级的非线性自适应分配,在宏观上严格遵守预定的模型压缩预算.这种连续空间的自适应策略有效避免了离散化分档带来的量化误差,确保每一份稀疏度预算都能精准服务于模型的特征重构.

2.3 基于层级重构误差的参数自适应寻优

在确定稀疏度分配机制后,映射函数中的曲率因子γ成为决定剪枝性能的关键.不同于传统方法依赖人工经验设定全局固定的超参数,OGAS致力于实现层级粒度的参数自适应,为此,将γ的最优选择建模为层级输出重构误差(Layer⁃wise Reconstruction Error)的最小化问题.

对于第l层,给定校准输入X和原始权重W,目标是寻找最优的γ*,使剪枝后的输出Ypruned最大程度地逼近原始稠密输出Ydense.优化目标函数的定义如式(7)所示:

γ*=argminγΩLγ=argminγΩYdense-YprunedγFYdenseF

其中,F表示Frobenius范数,Ωγ的搜索空间.为了求解该问题,本文采用嵌套优化策略,该策略包含内外两层循环.

(1)内层循环.对于任意给定的γ,利用2.2的二分查找算法,求解唯一的α以严格满足全局稀疏度约束Starget.此时,剪枝掩码及重构误差Lγ被唯一确定.

(2)外层循环.在γ的搜索空间内,利用黄金分割搜索算法寻找使L(γ)最小的γ*.相比于网格搜索,这种嵌套的黄金分割搜索方法无需遍历大量离散点,能够以对数级的时间复杂度高效逼近局部最优解.

为了进一步降低计算开销,在搜索阶段仅采用校准数据集的一个子集来快速评估重构误差,待确定最优γ*后,再将其应用于全量数据的最终剪枝.通过这种闭环优化策略,OGAS能针对不同层级的特征分布差异,自动匹配最适宜的稀疏度分配曲线,从而在无需人工干预的情况下实现模型精度的最大化保留.

2.4 算法伪代码

算法的伪代码如下所示.

OGAS自适应剪枝算法流程

输入:预训练模型M,校准数据集D,全局目标稀疏度Starget

输出:剪枝后的模型M*

1.从校准数据集D中随机抽取少量样本构成子集Dsub,用于参数的快速搜索.

2.遍历模型M的线性层,计算输出激活并统计每个通道的能量E与峰均比P.

3.对EP进行归一化及加权融合,生成通道重要性评分I.

4.在搜索区间0.05,1.1内,利用黄金分割算法搜索最优曲率因子γ*.在此过程中,对于每一个候选γ,通过二分查找确定缩放系数α以严格满足Starget约束.

5.基于最优参数γ*α*,利用非线性映射函数计算每个通道的自适应稀疏度si.

6.生成细粒度剪枝掩码.

(1)针对当前层的权重矩阵WRCout×Cin,逐行执行以下(2)(3)操作i=1,,Cout.

(2)计算元素得分.计算该行内各元素的重要性得分vi,j=Wi,jXnorm,j,其中,Xnorm,j为该层输入激活第j个特征的L2范数,此评分准则与Wanda[6]保持一致.

(3)执行Top⁃k筛选.根据该行对应的自适应稀疏度si,计算该通道需剪除的参数数量ki=Cin×si.将得分向量vi中数值最低的前ki个元素对应的位置设为0,生成掩码矩阵M.

7.根据掩码M更新权重W=WM并输出最终模型M*.

3 实验结果与分析

通过在多个标准基准上执行剪枝与评估流程,系统验证OGAS方法在语言建模与逻辑推理任务中的性能表现.为了全面衡量算法的泛化性与鲁棒性,选取WikiText⁃2和C4数据集,对比OGAS与Wanda等方法在不同数据分布下的困惑度差异,并利用ARC⁃Challenge等数据集量化模型在下游常识推理任务中认知能力的保留程度.此外,针对本文提出的PAPR指标与连续自适应稀疏度分配机制,通过消融实验剖析各核心组件对模型性能提升的独立贡献及协同效应,以验证双重指标融合策略在稀疏度分配中的有效性.

3.1 实验设置

为了全面衡量模型在不同数据分布下的表现,选取WikiText⁃229和C430两个具有代表性的标准数据集分别进行实验.每一个数据集均从其训练集中随机抽取128个长度为2048的序列片段作为校准数据集,用于参数搜索与剪枝掩码计算,确保两个数据集上的实验过程相互独立.所有实验均在配备NVIDIA H800 GPU的高性能计算平台上完成,选用LLaMA⁃3.1⁃8B⁃Instruct和Mistral⁃7B⁃v0.1作为基础模型进行验证.采用困惑度(Perplexity,PPL)作为衡量语言模型预测能力的核心指标,并引入零样本准确率(Zero⁃Shot Accuracy)以量化评估模型在下游常识推理任务中认知能力的保留度31.

在对比基准的选择上,不仅以Magnitude Pruning作为基础基线16,还重点选取当前最先进的一阶剪枝算法Wanda6,RIA7以及经典的二阶剪枝算法SparseGPT5作为对比对象,以全面评估OGAS在不同准则下的性能优势.OGAS方法的全局目标稀疏度设定为50%.对于每一个线性层,非线性映射函数中的稀疏度边界设置为Smin=0.01Smax=0.6,以兼顾对关键通道的连通性保护与对冗余通道的极限压缩.针对不同模型,采取差异化的超参数设置:对于LLaMA⁃3.1⁃8B,设置平衡因子λ=0.4,曲率因子γ的搜索空间设定为Ω=0.05,1.1,并采用黄金分割搜索自动寻找每一层的最优参数配置,搜索终止容差设定为0.05;对于Mistral⁃7B,设置平衡因子λ=0.2,且曲率因子γ设为固定值0.2.为了加速搜索过程,在搜索阶段仅使用校准集中的36个样本作为子集,在保证精度的前提下显著提升了计算效率.

本研究仅针对Transformer块内的各类线性投影层(如q/k/v/o,up/down/gate)进行剪枝.为了保护模型基础的词表映射能力与输出对齐能力,本文方法及所有对比基线均不裁剪输入Embedding层与最后的语言模型头(lm_head).

3.2 语言建模能力评估

在50%全局稀疏度约束下,在LLaMA⁃3.1⁃8B和Mistral⁃7B模型上分别实现了Magnitude Pruning,RIA,SparseGPT,Wanda和OGAS五种剪枝方法,对比了各方法在WikiText⁃2和C4数据集上的PPL表现,实验结果如表1表2所示,其中,Dense指未经过剪枝的原始模型表现,代表了剪枝模型所能达到的性能上限.

由表可见,在LLaMA⁃3.1⁃8B模型上,OGAS在两个数据集上的PPL均显著低于Wanda和RIA.在WikiText⁃2数据集上,OGAS的PPL=7.99,相较于Wanda降低了0.86;在C4数据集上,PPL从17.75降低至16.25,降幅达1.50.综合来看,OGAS在该模型上的平均PPL相对降幅达8.84%,甚至超越了计算复杂度更高的二阶算法SparseGPT.

表2所示的Mistral⁃7B模型上,OGAS同样展现了最优性能.与RIA相比,OGAS的平均PPL大幅领先1.93;与当前主流的Wanda和Sparse⁃GPT相比,OGAS依然保持了领先优势.实验结果一致表明,本文提出的OGAS 算法通过感知输出特征的统计特性并结合自适应稀疏度分配策略,能够比传统一阶或二阶方法更精准地识别冗余通道,在不同架构的模型上均能有效缓解剪枝过程中的信息丢失,保持了极佳的语言流利度.

3.3 零样本任务性能对比

为了评估模型在下游任务中的泛化能力,在ARC⁃Challenge32,BoolQ33,HellaSwag34及WinoGrande35四个常识推理数据集上进行了零样本准确率测试31,结果如表3所示.

由表可见,在LLaMA⁃3模型上,OGAS在下游推理任务中的整体表现优于同类一阶方法.与Wanda相比,OGAS的平均准确率提升1.63%.具体地,OGAS在ARC⁃Challenge,BoolQ和Hella⁃Swag三个极具挑战性的任务上,精度均得到明显提升.特别是在HellaSwag任务上,OGAS相比于Wanda实现了3.39%的大幅提升,表明OGAS通过精细化的通道分配策略,相对更完整地保留了模型处理复杂逻辑推理所需的关键知识.

表4展示了在Mistral模型上的测试结果,可见OGAS依然保持了稳健的泛化性能,其平均准确率不仅优于Wand和RIA,甚至超过二阶剪枝方法SparseGPT.实验结果证明,OGAS算法在实现大幅度稀疏化的同时,能够有效兼顾语言模型的建模能力与下游任务的推理精度,展现出优秀的任务迁移性.

3.4 消融实验与指标有效性分析

为了验证OGAS框架中关键组件的贡献,在WikiText⁃2数据集上进行了消融实验.设置三种变体以对比分析自适应分配策略与评价指标的影响:Energy⁃Adaptive λ=0PAPR⁃Adaptive λ=1以及融合双指标的OGAS λ=0.4.所有变体均基于相同的非线性映射框架,仅仅是输入的重要性评分不同.实验结果如表5所示.

由表可见,将Wanda的统一分配策略替换为基于Energy的自适应分配后,PPL从8.8513降低至8.1611,证实了根据通道特征动态调整稀疏度能够有效缓解层级敏感度不匹配的问题.仅使用PAPR指标的变体与仅使用Energy的变体性能相当,说明PAPR本身具备作为独立剪枝导向信号的能力.最终,融合双指标的OGAS取得了7.9947的最低PPL.这一结果优于任一单一指标变体,表明能量指标与PAPR指标在通道筛选上具有互补作用,两者的结合能更精准地指导稀疏度预算的分配,从而实现模型性能的最大化保留.

3.5 高稀疏度下的稳健性分析

为了进一步探究剪枝算法在极端情况下的可靠性,对比不同方法在30%~90%稀疏度跨度下PPL变化趋势,结果如图4所示.

由图可见,当稀疏度低于50%时,各主流方法(SparseGPT,Wanda,RIA,OGAS)的表现相对接近且均保持在较低的PPL水平.然而,随着稀疏度的进一步提升(特别是超过70%后),各方法的性能表现出现了剧烈分化.传统的幅度剪枝(Magnitude Pruning)和基于二阶信息的SparseGPT在高稀疏度下出现了明显的“性能崩坏”,PPL指数级上升.相比之下,OGAS算法的曲线(红色)展现出最平缓的增长趋势.即便在80%和90%的极高稀疏度下,OGAS的PPL依然显著低于其他一阶和二阶方法.充分证明了OGAS通过感知输出特征分布所确定的通道重要性更具稳健性,能够在极高的压缩比下锁定并保留模型最核心的权重结构,延缓了模型性能的衰减速度.

4 结论

本文针对大语言模型剪枝中的稀疏度分配问题,提出一种基于输出激活引导的通道级自适应剪枝方法OGAS.该方法通过引入能量范数与峰均比(PAPR)的双重评价指标,能够有效识别模型中的高能量静态冗余通道与稀疏关键特征;此外,结合非线性映射机制与闭环参数寻优,实现了对模型不同层级稀疏预算的精细化分配.

在LLaMA⁃3.1⁃8B和Mistral⁃7B模型上的实验结果表明,OGAS在WikiText⁃2和C4数据集上的语言建模能力不仅优于目前主流的一阶方法Wanda和RIA,甚至在特定场景下超越了计算复杂度更高的二阶方法SparseGPT.同时,在下游零样本常识推理任务中,OGAS也展现出更优的任务泛化性能.特别地,在高稀疏度测试中,OGAS表现出显著优于其他方法的稳健性,有效延缓了模型在极限压缩比下的性能衰减.研究结果验证了基于输出特征感知的自适应分配策略在提升模型压缩后性能方面的有效性,表明了在剪枝过程中兼顾通道响应强度与特征特异性的重要性,为大语言模型在资源受限场景下的高效部署提供了有价值的参考与技术支持.

参考文献

[1]

Dubey AJauhri APandey Aet al.The llama 3 herd of models.2024,arXiv:

[2]

Zhu X YLi JLiu Yet al.A survey on model compression for large language models.Transactions of the Association for Computational Linguistics2024(12):1556-1577.

[3]

Nagel MAmjad R AVan Baalen Met al.Up or down?Adaptive rounding for post⁃training quantization∥Proceedings of the 37th International Conference on Machine Learning. Online:JMLR.org,2020:7197-7206.

[4]

Han SMao H ZDally W J.Deep compression:Compressing deep neural networks with pruning,trained quantization and Huffman coding∥The 4th International Conference on Learning Represen⁃tations.San Juan,Puerto Rico:ICLR,https://arxiv.org/abs/1510.00149,2016.

[5]

Frantar EAlistarh D. Massive language models can be accurately pruned in one⁃shot∥Proceedings of the 40th International Conference on Machine Learning.Honolulu,HI,USA:PMLR,2023:1-15.

[6]

Sun M JLiu ZBair Aet al. A simple and effective pruning approach for large language models. 2023,arXiv:

[7]

Zhang BWu HLin Zet al. Plug⁃and⁃play:An efficient post⁃training pruning method for large language models∥Proceedings of the 12th Inter⁃national Conference on Learning Representations.Vienna,Austria:OpenReview.net,https://openreview.net/forum?id=H6xKBf3uVv,2024.

[8]

Ashkboos SCroci M Ldo Lago M Get al. SliceGPT:Compress large language models by deleting rows and columns∥Proceedings of the 12th International Conference on Learning Represen⁃tations. Vienna,Austria:OpenReview.net,https://openreview.net/forum?id=8u3Jf5EFWb,2024.

[9]

Yin LWu YZhang Z Yet al. Outlier weighed layerwise sparsity (OWL):A missing secret sauce for pruning LLMs to high sparsity∥Proceedings of the 41st International Conference on Machine Learning. Vienna,Austria:JMLR.org,2024:57101-57115.

[10]

Dettmers TLewis MBelkada Yet al. GPT 3.int8():8⁃bit matrix multiplication for transformers at scale.Red Hook:Curran Associates,Inc.,2022:30318-30332.

[11]

Bondarenko YNagel MBlankevoort T. Under⁃standing and overcoming the challenges of efficient transformer quantization∥Proceedings of the 38th International Conference on Machine Learning.New York,NY,USA:PMLR,2021:1108-1120.

[12]

Gheini MRen XMay J. Cross⁃attention is all you need:Adapting pretrained transformers for machine translation∥Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing.Stroudsburg,PA,USA:Association for Compu⁃tational Linguistics,2021:1754-1767.

[13]

Wei X YZhang Y CZhang X Get al. Outlier suppression:Pushing the limit of low⁃bit transformer language models∥Advances in Neural Information Processing Systems. Red Hook,NY,USA:Curran Associates,Inc.,2022:17402-17414.

[14]

Men XXu M YZhang Q Yet al. ShortGPT:Layers in large language models are more redundant than you expect. 2024,arXiv:

[15]

Dettmers TSvirschevski REgiazarian Vet al. SpQR:A sparse⁃quantized representation for near⁃lossless LLM weight compression. 2023,arXiv:

[16]

Han SPool JTran Jet al. Learning both weights and connections for efficient neural network∥Proceedings of the 29th International Conference on Neural Information Processing System. Volume 1. Montreal,Canada:MIT Press,2015:1135-1143.

[17]

Frankle JCarbin M. The lottery ticket hypothesis:Finding sparse,trainable neural networks∥Proceedings of the 7th International Conference on Learning Representations.New Orleans,LA,USA:ICLR,https://openreview.net/forum?id=6Mq1⁃UkCv5o,2019

[18]

He Y HZhang X YSun J. Channel pruning for accelerating very deep neural networks∥2017 IEEE International Conference on Computer Vision. Venice,Italy:IEEE,2017:1398-1406.

[19]

Liu ZLi J GShen Z Qet al. Learning efficient convolutional networks through network slimming∥2017 IEEE International Conference on Computer Vision. Venice,Italy:IEEE,2017:2755-2763.

[20]

Luo J HWu J XLin W Y. ThiNet:A filter level pruning method for deep neural network compression∥2017 IEEE International Conference on Computer Vision.Venice,Italy:IEEE,2017:5068-5076.

[21]

Ma X YFang G FWang X C. LLM⁃Pruner:On the structural pruning of large language models∥Advances in Neural Information Processing Systems.New Orleans,LA,USA:Curran Associates,Inc.,2023:21702-21720.

[22]

Xia MGao TZeng Zet al. Sheared LLaMA:Accelerating language model inference via structured pruning. 2023,arXiv:

[23]

Mishra ALatorre J APool Jet al. Accelerating sparse deep neural networks. 2021,arXiv:2104. 08378.

[24]

Zhou A JMa Y KZhu J Net al. Learning NM fine⁃grained structured sparse neural networks from scratch. 2021,arXiv:

[25]

Kusupati ARamanujan VSomani Ret al. Soft threshold weight reparameterization for learnable sparsity∥Proceedings of the 37th International Conference on Machine Learning.New York,NY,USA:PMLR,2020:5544-5555.

[26]

Zhang Q RZuo S MLiang Cet al. Platon:Pruning large transformer models with upper confidence bound of weight importance∥Proceedings of the 39th International Conference on Machine Learning. New York,NY,USA:PMLR,2022:26809-26823.

[27]

LeCun YDenker J SSolla S A. Optimal brain damage∥Proceedings of Advances in Neural Information Processing Systems.Cambridge,MA,USA:MIT Press,1990:598-605.

[28]

Hassibi BStork D G. Second order derivatives for network pruning:Optimal brain surgeon∥Proceedings of Advances in Neural Information Processing Systems.San Francisco,CA,USA:Morgan Kaufmann Publishers Inc,1993:164-171.

[29]

Merity SXiong CBradbury Jet al. Pointer sentinel mixture models. 2016,arXiv:

[30]

Rafel CShazeer NRoberts Aet al. Exploring the limits of transfer learning with a unified text⁃to⁃text transformer. Journal of Machine Learning Research202021(1):5485-5551.

[31]

Gao LTow JAbbasi Bet al. A framework for few⁃shot language model evaluation.Zenodo,https://doi.org/10.5281/zenodo.10479364,2023.

[32]

Clark PCowhey IEtzioni Oet al. Think you have solved question answering?Try arc,the ai2 reasoning challenge.2018,arXiv:

[33]

Clark CLee KChang M Wet al. BoolQ:Exploring the surprising difficulty of natural yes/no questions∥Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics:Human Language Technologies. Volume 1. Long and Short Papers. Minneapolis,MN,USA:Association for Computational Linguistics,2019:2924-2936.

[34]

Zellers RHoltzman ABisk Yet al. HellaSwag:Can a machine really finish your sentence?∥Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. Florence,Italy:Association for Computational Linguistics,2019:4791-4800.

[35]

Sakaguchi KBras R LBhagavatula Cet al. WinoGrande:An adversarial Winograd schema challenge at scale. Communications of the ACM202164(9):99-106.

基金资助

国家重点研发计划(2023YFB2806800)

国家自然科学基金(U21B2032)

苏州市“揭榜挂帅”重点项目(SYG2024134)

AI Summary AI Mindmap
PDF (1000KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/