基于自动可微分激活函数近似的神经网络隐私推理加速方法

顾颖, 庞智, 余荣威, 王丽娜

武汉大学学报(理学版) ›› 2026, Vol. 72 ›› Issue (1) : 35 -46.

PDF (1788KB)
武汉大学学报(理学版) ›› 2026, Vol. 72 ›› Issue (1) : 35 -46. DOI: 10.14188/j.1671-8836.2024.0174
区块链、密码学与分布式系统

基于自动可微分激活函数近似的神经网络隐私推理加速方法

    顾颖, 庞智, 余荣威, 王丽娜
作者信息 +

A Method of Privacy Inference Acceleration in Neural Networks Based on Automated and Differentiable Activation Function Approximation

    Ying GU, Zhi PANG, Rongwei YU, Lina WANG
Author information +
文章历史 +
PDF (1830K)

摘要

针对隐私推理方案(如同态加密、安全多方计算等)中ReLU(非线性单元)的效率瓶颈,提出了一种神经网络非线性优化方法——ReLURep(ReLU Replace,ReLU替换)框架,采用自动可微分的梯度下降和二值化辅助控制掩码自动定位并替换ReLU操作,从而在效率和准确性之间取得平衡。ReLURep利用可学习的二值掩码定位待替换的ReLU激活函数,在掩码确定后以端到端共同训练的方式自动学习最佳多项式参数配置,减少因ReLU替换导致的模型性能下降。此外,ReLURep框架中还采用了一种特征分布蒸馏方法,逐层学习最佳系数,最大程度地减少因网络线性化造成的精度损失。在CIFAR10、CIFAR100和Tiny ImageNet等数据集上进行的实验表明,该方法在绝大多数ReLU操作数量预算下都取得了显著的改进。在CIFAR100数据集上,ReLU预算为6 000时,正确率达到了75.29%,比现有最优方法高1.5个百分点。

Abstract

To addresses the efficiency bottleneck of ReLU (nonlinear unit) in privacy inference schemes (such as homomorphic encryption and secure multi-party computation), we propose a neural network nonlinearity optimization method—ReLURep (ReLU Replace) framework. It uses automatic differentiable gradient descent and binary auxiliary control masks to automatically identify and replace ReLU operations, achieving a trade-off between efficiency and accuracy. ReLURep uses learnable binary masks to locate ReLU activation functions that need to be replaced, and after mask parameter fixation, it jointly trains to automatically learn the optimal polynomial parameters, reducing performance degradation caused by ReLU replacement. Additionally, a feature distribution distillation method is employed to learn the best coefficients layer by layer, minimizing accuracy loss due to network linearization. Experimental results on CIFAR10, CIFAR100, and Tiny ImageNet datasets demonstrate significant improvements in almost all ReLU budgets. For example, on CIFAR100, with a ReLU budget of 6 000, ReLURep achieves an accuracy of 75.29%, which is 1.5 percentage points higher than the state-of-the-art method.

Graphical abstract

引用本文

引用格式 ▾
顾颖, 庞智, 余荣威, 王丽娜. 基于自动可微分激活函数近似的神经网络隐私推理加速方法[J]. 武汉大学学报(理学版), 2026, 72(1): 35-46 DOI:10.14188/j.1671-8836.2024.0174

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

随着研究的深入与技术的进步,越来越多公司利用深度学习技术向用户提供神经网络推理服务,例如图像分类[1]、语音助手[2]、路径规划[3]等应用程序。在使用这些智能服务时,用户通常需要将数据从客户端上传至服务器端,由服务器端储存的模型对其进行推测。然而,这一过程可能导致用户的敏感信息面临泄露风险。若将服务器端的模型分发到客户端,虽然可以避免数据上传,但客户端可能缺乏充足的算力进行推理,同时模型的机密性也难以得到保障。

为解决这一问题,隐私推理(Privacy Inference, PI)技术应运而生。PI利用加密技术同时保护用户数据隐私和服务器端模型隐私。具体而言,用户数据经加密后发送至云端服务器,云端托管了参数加密的模型,能够直接对密文进行操作并返回加密的推理结果,从而确保双方隐私信息的安全。隐私推理主要基于同态加密(Homomorphic Encryption, HE)[4-7]和安全多方计算等密码学技术实现,其技术方案包括不经意传输(Oblivious Transfer, OT)[8-9]、混淆电路(Garbled Circuits, GCs)[10-11]和秘密共享(Secret Sharing, SS)[12-15]等。然而,这些技术虽然有效保护了隐私,但也引入了显著的时间开销,极大地降低了推理速度和用户体验。在明文的神经网络推理中,运行成本主要来自线性单元(包括卷积层和全连接层等)的浮点运算(Floating Point OPerations, FLOPs)。而研究[16-17]表明,密文域隐私推理中非线性单元(ReLU)的运行延迟比线性单元高出若干个数量级。这是因为线性单元的加密往往使用加性秘密共享等高效的密码协议,而非线性单元则需要使用姚氏混淆电路或同态加密等更复杂、计算和通信开销更高的协议。此外,深度神经网络中大量存在的ReLU操作,进一步增加了隐私推理的整体成本。

因此,探寻新的网络结构,在保持准确性的同时最大程度地减少ReLU操作的数量,是解决深度神经网络中隐私推理延迟瓶颈的主要方向。围绕这个方向,现有研究主要聚焦两个方面:一是采用其他激活函数(如多项式或者线性函数)替换ReLU函数[18-22];二是通过神经网络搜索(Neural Architecture Search,NAS)[23]获得ReLU数量较少的网络架构。尽管这些方法在一定程度上加速了神经网络隐私推理的速度,但仍存在精度下降或需要手动调整阈值参数的问题,难以有效地获取最优解。例如,DeepReDuce[18]分为多个阶段以不同的粒度逐步删除ReLU,但需要手动选择待剪枝的ReLU;SENet[19]采用多阶段优化框架,但其ReLU重要性评估阶段的精确性极大程度上影响后续优化步骤,且效率较低耗时较长;SNL[20]以端到端的方式训练参数化ReLU,但精度损失较大。

针对这些问题,本文提出了一种基于梯度的、自动化的、细粒度的ReLU替换(ReLU Replace,ReLURep)策略,采用梯度下降方法,通过二值化辅助控制掩码像素级地定位需要替换的ReLU操作,并将其替换为近似的、可训练的二次函数,从而满足了网络推理效率和准确性的平衡,同时,结合知识蒸馏进一步学习最佳的多项式参数配置,降低模型精度损失。本文的主要贡献如下:

1) 提出了一个神经网络非线性优化方法,针对隐私推理中神经网络的非线性计算瓶颈,将非线性单元以端到端的方式渐进式地替换为隐私计算友好型的可学习二次多项式,极大地提升了隐私推理的效率;

2) 提出了一个自动且完全可微分的神经网络非线性优化框架,通过添加一个辅助架构参数,以端到端的方式自动学习优化后的ReLU分布,并且保持较高的正确率;

3) 引入了一个基于特征分布蒸馏的ReLU多项式近似算法,进一步提升了模型性能,它可以逐层地学习ReLU近似多项式的最佳系数,缩小因网络线性化导致的学习能力和中间特征分布差异。

在ResNet18[24]、Wide ResNet22-8[25](下称WRN-22-8)、VGG16[26]等常用神经网络架构上进行修改测试,在CIFAR10、CIFAR100和Tiny ImageNet等图像分类数据集上进行的实验表明:在有限ReLU操作数量预算(下简称ReLU预算)的约束下,本文方法在众多任务上的表现均取得了进步,并在效率和准确性之间实现了均衡。

1  背景和相关工作

1.1 威胁模型

在隐私保护深度学习中,主要考虑两种威胁模型:半诚实模型和恶意模型。与DELPHI[16]等其他工作一致,本研究采用半诚实模型。该模型假定攻击者会遵守预定的协议并得到正确的结果,但可能会利用记录的信息推测其他成员的输入。在这种威胁模型下,客户端的输入数据和服务器端的神经网络模型参数等信息都应该被隐藏。

1.2 密码学协议

在隐私保护深度学习中,多种核心技术被广泛应用于提升数据和模型参数的安全性。其中,同态加密允许在加密数据上直接进行运算,主要包括部分同态加密(Partially Homomorphic Encryption, PHE)[4]、类同态加密(Somewhat Homomorphic Encryption, SHE)[5]和全同态加密(Fully Homomorphic Encryption, FHE)[6-7]三种模式,尽管FHE支持无限次运算,但其计算复杂度较高,且噪声累积和密钥管理问题限制了其实际应用性能;不经意传输[8-9]是一种保证发送方和接收方信息安全的协议,允许接收方选择性获取特定信息,而发送方无法得知其选择,该技术广泛应用于安全多方计算和隐私保护数据查询等场景;混淆电路[10]通过逻辑门的布尔电路实现对函数的安全计算,能有效保护输入和中间结果的隐私,尤其适用于神经网络中非线性层的计算;秘密共享[12-14]则通过将敏感信息分割并分发至多个参与者,确保只有满足特定条件时才能恢复信息,从而避免单点泄露。这些技术通常协同使用,为隐私保护深度学习提供多层安全保障。然而,它们在效率、计算开销和准确性保持方面的局限性,促使研究者探索优化方法,以更高效地实现非线性单元(如ReLU)的隐私推理,同时在隐私与性能之间找到平衡点。

1.3 相关工作

结合以上密码协议,许多研究对深度学习中的隐私推理进行了探索。CryptoNets[27]引入了同态加密协议,实现了隐私保护的深度学习模型。然而,其线性计算占据了运行时间成本的主导地位,在通信负载较轻的情况下,计算成本超过数百秒,限制了模型的实用性和可扩展性。此外,随着网络层数的增加,由于非线性函数被近似处理,模型的精度也随之下降。DeepSecure[28]采用了混淆电路的方法,但电路规模较大,导致计算和通信成本较高。SecureNN[29]引入了可信第三方,采用秘密共享策略,使得网络深度增加的同时,模型精度损失可以忽略不计,但不可避免地带来了效率上的损失。GAZELLE[30]提出了一种结合同态加密和逻辑电路的混合方案,针对线性和非线性函数的不同性质,分别采用基于同态加密的线性计算和基于逻辑电路的ReLU平衡计算复杂度和通信复杂度,因此总体上优于只采用一种策略的方案,但其计算效率仍有提高的空间。

DELPHI[16]在GAZELLE[30]的基础上进行了改进,将在线阶段中针对同态加密密文的复杂密码运算移到预处理阶段,大大降低了在线阶段的处理时延。同时提出了在非线性层采用多项式近似激活函数替代部分ReLU函数的思想,将布尔电路计算转化为算术电路,从而提高计算效率。

现有优化隐私推理的相关工作主要基于DELPHI[16]的思想进行改进,重点关注减少ReLU操作的数量,从而降低隐私推理的计算成本。这些工作大致可以分为两类:神经网络架构搜索和神经网络非线性优化。

1.3.1 神经网络架构搜索

神经网络架构搜索[2331]是一种利用机器学习算法自动得到最优神经网络架构的基本方法。早期神经网络架构搜索主要采用基于强化学习[23]和基于进化算法[31]的方法。为了解决架构搜索的可扩展性挑战,Liu等[32]提出了可微分架构搜索(Differentiable ARchiTecture Search,DARTS)方法,该方法利用梯度下降优化架构。一些研究利用神经网络架构搜索设计ReLU高效的网络架构。例如,NetAdaptV2[33]在DARTS中使用的单层坐标下降优化器的基础上,通过引入通道级旁路连接、有序丢弃和多层坐标下降优化器等新技术,在支持不可微搜索指标的同时,显著提高了搜索效率。

为了设计ReLU高效的网络架构,一些研究引入了神经网络架构搜索方法。例如,CryptoNAS[17]通过将核心网络和跳跃连接的搜索空间解耦并分别进行优化,降低了搜索成本,并实现了更高的准确性和效率。SAFENet[34]提出了一种通道级激活函数近似方法,通过保留最重要的激活通道并用不同阶数的多项式替换剩余不太有用的通道,以加速隐私推理,并采用二叉树种群训练(Binary-Tree Population Based Training, BTPBT)算法搜索合适的替换比例和阶数。Sphynx[35]则结合了微搜索策略和重参数化技巧,通过学习缩减ReLU单元的最优位置,最小化非线性单元的计算成本。

这些方法的优点在于可以自动发现ReLU高效的网络架构,并在一定程度上平衡了准确性和效率。然而,NAS[23]通常计算成本很高,而且搜索到的架构可能难以解释。

1.3.2 神经网络非线性优化

除了NAS方法,还有一些方法通过优化原有神经网络结构中的非线性单元减少ReLU的使用。剪枝技术通过去除网络中不重要的连接或神经元减少ReLU的数量。例如,DeepReDuce[18]提出ReLU在网络中的不同阶段对正确率的贡献不同,早期阶段的ReLU对模型正确率的贡献较小,而后期阶段的贡献较大。为此,它采用了一种三阶段优化策略——剔除(Culling)、稀释(Thinning)和重塑(Reshaping),以不同的粒度逐步减少ReLU的数量。SENet[19]指出如果一个层对剪枝越敏感,那么该层中ReLU的重要性就越低,同时较早的层比较晚的层具有更高的剪枝敏感性,因此提出了一种自动化的逐层ReLU敏感度评估策略,并使用训练后的掩码创建部分ReLU(Partial-ReLU)模型,其中ReLU仅存在于非线性层的固定部分。CoPriv[22]通过给每个ReLU分配一个衡量其重要程度的架构参数进行剪枝,并通过网络重参数化技术进一步提高精度。这类方法的优点在于可以有效地减小模型大小并缩减计算量。然而,剪枝可能会损害模型的准确性。

另一些方法则保留了神经元之间的连接,采用线性函数替换ReLU激活函数。例如,DELPHI[16]使用二次多项式近似ReLU函数,以减少在线计算量,但这种方法需要手动选择多项式的阶数和系数,缺乏自动化和灵活性。SNL[20]引入辅助参数,根据参数的大小判断ReLU的重要性,将部分ReLU单元替换成恒等函数,达到线性化部分激活函数的目的。AutoReP[21]提出了一个参数化的离散指示函数,与模型权重共同训练,并使用滞后回线更新函数增强二值化ReLU替换训练过程的稳定性。这类方法的优势在于能够更精细地控制ReLU的使用,并可以利用现有的网络架构。然而,如何选择合适的替换操作和替代函数以及如何平衡准确性和效率仍然是需要解决的问题。

本文采用ReLURep框架,通过定义合适的辅助参数和损失函数自动化地执行替换操作,并用合适的多项式逼近ReLU函数,实现激活函数的选择性替代。

2  本文方法

2.1 问题定义

在神经网络隐私推理优化课题中的关键问题就是要达到推理准确性和推理效率的平衡,即给定ReLU预算B,使得L层神经网络模型fW的ReLU数量Cf不超过预算的同时,最大化模型的精度,见(1)式。

max ACCfW,  s.t.Cf<B

其中,W=W0,,WL-1代表神经网络的权重矩阵,ACC()代表模型的精度。

定义符号XY分别为模型的输入和输出。对于一个ReLU层,x代表激活函数Act()的输入,ReLU()代表ReLU函数。在每个ReLU层中添加与x形状相同的辅助控制参数m,每个像素xi都有对应的mi{0,1},细粒度地决定哪些ReLU单元应该被替换为多项式函数,如(2)式所示。

Act(xi)=ReLU(xi),mi=1P(n)(xi),mi=0

其中,P(n)(x)=k=0nakxk为每层中用于替换的n次多项式函数。a(n)={a0,a1,,ak,,an}代表次数为n的多项式函数的系数,ak为多项式中第k项的系数。

M代表神经网络中所有ReLU层中添加的辅助控制参数m的集合,ReLU数量Cf则可以表示为Cf=mMm0。用A(n)代表所有ReLU层中n次多项式函数系数的集合。

本文工作的最终目标就是要通过自动化微分方法更新并找到合适的参数集合M和多项式系数集合A(n),实现神经网络的非线性优化。

2.2 方法概述

本文方法的整体架构如图1所示,在预训练模型的基础上,通过ReLURep框架,将ReLU单元替换为PolyReLU单元,得到优化后的模型。客户端将隐私输入加密后发送给服务器端的优化模型,模型计算后返回给客户端,经解密后就可以得到相应的输出。ReLURep框架的核心包含三点:1) 通过辅助控制参数自动化选择被替换的ReLU函数;2) 根据特征分布得到近似多项式函数;3) 通过知识蒸馏进一步提高精度。在训练过程中不断更新辅助控制参数和多项式系数,加上蒸馏损失,将激活函数替换为由多项式函数和ReLU函数混合的PolyReLU结构,并在对辅助控制参数进行二值化后,精调模型参数,最终获得优化模型。

PolyReLU结构的训练过程如图2所示。在每个ReLU层中,相应地引入了一个参数m˜(辅助控制参数m的浮点数形式)和一个BatchNorm层。通过BatchNorm层的运行时参数获取均值(running_mean)和方差(running_var),以确定替换后的多项式函数的系数。在此基础上,结合多项式函数计算输出,最后根据相应的损失函数进行反向传播,从而实现参数的更新。

2.3 辅助控制参数

图1所示,辅助控制参数m可以像素级地控制激活函数,决定ReLU单元是保留或是被替换为多项式函数P(n)(x),(2)式中的激活函数Act()用张量m可以表示为:

Act(x)=mReLU(x)+(1-m)P(n)(x)

其中,表示哈达玛乘积(Hadamard product)。

本文的目标是降低非线性层的运行时间,即最小化Cf。整个过程可以看作如下优化问题:

minW,M fW,MX,Y+mMm0

其中,()表示损失函数,fW,M表示加入了辅助架构参数的神经网络模型,0表示L0范式即非零的元素个数。

然而,由于L0范式在梯度下降中难以求导或优化,因此本文将其近似为L1范式,同时将训练期间的二值的辅助控制参数m作为浮点数张量m˜进行更新,即

minW,M˜ LfW,M˜X,Y+αm˜M˜m˜1

其中,α是调节参数(tuning parameter),1表示L1范式,αm˜M˜m˜1称为mask损失。

训练结束后,再通过二值化方法得到mth为二值化阈值:

mi=0,m˜i<th1,m˜ith

2.4 近似多项式函数

本文采用二次多项式P(2)(x)=a2x2+a1x+a0(以下简记为P(x))替换部分ReLU函数,以达到提高计算效率的目的。

现有的一些研究采用固定的多项式函数替换ReLU函数,精度和训练稳定性较差[1636]。因此,本文采用了一种通过感知网络每层特征分布逼近的方法动态调整多项式函数的参数。

本文的目标是要找到一组多项式的系数a(n)={a0,a1,,ak,,an},最小化多项式函数P(n)(x)=k=0nakxk与ReLU函数之间的差异,用最小均方误差(Minimum Mean Square Error, MMSE)可以表示为:

a(n)MMSE=arga(n)minReLU(x)-P(n)(x)2

和AutoReP[21]相似,本文假设激活函数的输入的特征图x符合正态分布,即xN(μ,σ2),其概率密度函数可表示为φ(x)=12πσe-(x-μ)22σ2,(7)式可以重新表述为:

a(n)MMSE=arga(n)minReLU(x)-P(n)(x)2φ(x)dx

n=1,得以求出一次多项式P(1)(x)=a1x+a0的系数表达式为:

a1=1+erfμ22σ22
a0=σe-μ22σ22π

其中erf()为误差函数。而当n=2,就可以得到二次多项式P(x)的系数表达式:

a2=e-μ22σ222πσ
a1=1+erfμ22σ22-μe-μ22σ22πσ
a0=e-μ22σ222πσσ2+μ2

具体地,如图2所示,利用BatchNorm层运行时参数得到均值μ和方差σ,计算出二次多项式系数,再随着梯度下降做进一步优化。

2.5 采用知识蒸馏提升精度

为了进一步提升模型的精度,本文采用了知识蒸馏(Knowledge Distillation)方法。知识蒸馏是一种模型压缩技术,旨在将大型教师模型的知识迁移到较小的学生模型中,从而提高学生模型的性能。利用原始的未进行过ReLU替换的神经网络架构(可以称为全ReLU模型)进行训练,得到预训练模型fW(教师模型)。随后在进行ReLU替换的过程中,利用知识蒸馏从预训练模型的输出中学习,从而弥补新模型因ReLU替换带来的精度损失。将加入了辅助架构参数和多项式系数的神经网络模型表示为fW,M˜,A,则加上蒸馏损失KD的损失函数可以表示为:

total=fW,M˜,A(X),Y+αm˜M˜m˜1+
KDfW,M˜,A(X),fW(X)

2.6 整体流程与算法

本文的整体流程分为两个步骤:训练(train)阶段和微调(finetune)阶段。模型的训练过程如算法1所示。

在训练阶段本文用PolyReLU替换原有的ReLU,其中包含辅助控制参数的浮点数形式m˜和多项式系数,它们根据损失函数((11)式),随着训练过程更新,直到ReLU数量Cf小于给定的ReLU预算B。为了减少训练过程中的不稳定性,使Cf可以保持下降趋势,本文为L1范式调节参数α增加了一个乘性因子κ,动态调整mask损失在总损失中的比重。

在微调阶段中,本文根据阈值th二值化得到参数mM并固定它。再利用预训练的模型知识蒸馏对模型其他参数做进一步更新,得到最终的新模型。

3  实验结果与分析

3.1 网络架构与数据集

为了与现有的工作进行公正、全面地对比,将本文方法运用于ResNet18[24]、WRN22-8[25]、VGG16[26]等常见神经网络模型中,根据相关工作[1820-21],去除了对网络贡献较小的第一个卷积层中的ReLU层。同时在标准图像分类数据集CIFAR10、CIFAR100和Tiny ImageNet上均进行了测试,其中CIFAR10和CIFAR100均包含50 000张训练图像和10 000张测试图像,每张图像大小为32×32×3。CIFAR10将图像分为10类,而CIFAR100将图像分为100类。Tiny ImageNet则包含100 000张训练图像和10 000张验证图像,大小为64×64×3,分为200类。每种神经网络模型架构下,保留全部ReLU的预训练模型在各个数据集上训练出的正确率和ReLU数量,如表1所示,后续的模型训练在对应预训练模型上进行。

3.2 实验环境与参数设置

实验在Ubuntu 20.04 操作系统上进行,采用Python 3.8和PyTorch 2.0.0构建与训练模型,使用支持CUDA 11.8的NVIDIA RTX 4090 GPU(24 GB 显存)加速计算。采用二次多项式来替换ReLU,二值化阈值th取值为0.005,初始化α为1E-5。批处理大小为256,在训练阶段采用Adam(Adaptive Moment Estimation)优化器,在微调阶段采用SGD(Stochastic Gradient Descent)优化器迭代120次。对于知识蒸馏,本实验将温度设置为4,对交叉熵损失的相对权重设置为1。

3.3 和其他工作对比

本文针对不同的ReLU预算,在提出的神经网络架构和数据集上进行测试,得到测试正确率。采用SNL[20]中提出的线性回归方法估算延迟,本文的估算基于AutoReP[21]工作,它采用CrypTen[37]作为隐私推理的框架。忽略其他线性层的延迟,最终可以得出,在ResNet18[24]上,每一千个密文ReLU操作的延迟约为0.002 5 s,而密文每一千个二次多项式操作的延迟约为0.000 286 s。

表2~表8分别展示了本文方法在CIFAR100、CIFAR10和Tiny ImageNet上与其他方法的比较结果。可以看出在不同模型、不同数据集上,本文方法在同一水平的ReLU数量下,正确率几乎都是最高的。和参考文献[18-21]一样,本文通过计算正确率(%)和ReLU数量(103)的比值ρ评估帕累托效率(Pareto Efficiency)。因为模型正确率和ReLU数量存在单调性关系,所以可以通过计算比值ρ,将帕累托效率的多目标优化问题(即最小化ReLU数量的同时最大化正确率)转换为单目标优化问题,即使得同一ReLU数量下,正确率最大;显然比值ρ越高,结果越优。

表2表3可知,在CIFAR100数据集上,当ReLU数量大于等于100×103时,本文的一些结果略低于SENet[19],这可能是因为SENet[19]用于训练的ResNet18[24]和WRN22-8[25]基础模型正确率(78.05%[24]和80.82%[25])比本文的基础模型正确率(77.89%和80.35%)略高。但是在ReLU数量小于100×103的情况下,本文的结果明显更好。在ResNet18模型上,当ReLU数量在25.0×103左右时,本文工作比SENet[19]工作正确率提升了4.79个百分点;在ReLU数量为6 000时,本文工作比AutoReP[21]工作正确率提升了1.5个百分点。

除了ResNet18[24]和WRN22-8[25]模型,表4表5中也将本文方法在VGG16[26]模型、CIFAR10数据集上与其他工作进行了比较,当ReLU数量为12.5×103时,本文在VGG16[26]模型上比SENet[19]正确率高了1.36个百分点。

相比于CIFAR10和CIFAR100,Tiny ImageNet数据集拥有更多更大的图像和更多的类别,表6~表8中的数据展示了本文方法在此数据集上的优越表现,在不大于30×103的ReLU数量下,使用ResNet18[24]模型时,本文的正确率比AutoReP[21]高了0.82个百分点。

表2~表8可知,在CIFAR100、CIFAR10和Tiny ImageNet上本文方法的ρ分别能达到12.548×10-5、7.434×10-5和2.355×10-5,均高于其他方法,表明了本文提出的方法与其他方法在ReLU数量一致时,正确率更高,在多数情况下,帕累托效率最优。

图3直观地比较了各个方法的延迟和正确率,在相同的延迟的情况下,本文方法的正确率始终优于其他方法。这一结果表明,本文方法在权衡效率和准确性方面具有明显优势。本文提出的ReLURep框架通过辅助控制参数像素级自动定位被替换的非线性单元,广泛适用于各种模型架构,与神经网络搜索方法相比,更加高效简洁的同时,也更加精准。采用基于特征分布蒸馏的ReLU多项式近似算法,用二次多项式替换ReLU函数的方法,相对于恒等函数和系数固定的多项式函数替换的方法,也带来了明显的准确度提升。

3.4 消融实验

图4所示,本实验在ResNet18模型、CIFAR10数据集上系统评估了不同多项式函数(一次多项式、二次多项式和恒等函数(即SNL方法[20]))对ReLU单元的替换效果。由图4可以看出,在高预算(保留的ReLU数量≥100×103)的水平时,一次多项式替换和二次多项式替换正确率相差不大;而在低预算(保留的ReLU数量小于100×103)水平时,一次多项式替换的精度要比二次多项式替换低很多。实验表明,在多种情形下,本算法中使用二次多项式进行替换,比一次多项式和恒等函数可以使模型保持更好的正确率。

在辅助控制参数的二值化过程中,二值化阈值th起到了很大作用,图5给出了在ResNet18模型、CIFAR100数据集上,th在0.01、0.005和0.001时的ReLU预算-正确率曲线。可以发现,当th=0.01,在ReLU预算小于12.9×103时正确率要低于其他取值;th=0.001时则无法在高ReLU预算(ReLU预算大于25×103)的场景下取得良好表现。因此,本文的二值化阈值取值为0.005。

3.5 ReLU分布层次观察

图6揭示了在ResNet18[24]全ReLU模型和ReLU预算为100×103、50×103和25×103时各层的ReLU保留情况。可以看出在浅层(1~8层)被替换的ReLU要远远多于深层(9~16层)的ReLU单元。这与DeepReDuce[18]、SENet[19]等工作中得出的ReLU重要性规则一致,即深层的ReLU对模型的贡献度要比浅层的ReLU更大。

3.6 算法复杂度分析

ReLURep框架通过基于梯度的优化方法和基于特征分布蒸馏的多项式近似算法实现了对ReLU的自动替换,其核心优点在于优化效率和可扩展性。相比于传统的神经网络架构搜索方法(如CryptoNAS[17]和Sphynx[35]),ReLURep避免了对大量网络结构候选的冗长搜索。神经网络架构搜索方法通常依赖于预定义的搜索空间,其时间复杂度主要取决于候选网络的数量k和训练每个网络的开销T,总复杂度为Ο(kT)。在对ReLU的替换中,神经网络架构搜索的效率受限于对离散候选点的穷尽搜索,k随着网络层数的增加呈指数级增长,导致资源消耗巨大。

相比之下,ReLURep采用梯度驱动的方法,将辅助控制参数和权重参数联合优化,复杂度为Ο(E(T+C)),其中E为训练的总迭代数,C是模型所有ReLU层输入的元素数量,算法中做的是元素级乘法,因此开销是线性的。整体复杂度大幅低于基于神经网络架构搜索的优化方法。在空间复杂度上,ReLURep总体存储需求为Ο(W+M+A),其中M是辅助控制参数的大小,A是多项式系数的大小。相比于优化前的模型,虽然需要额外增加辅助控制参数和多项式系数的存储空间,但鉴于模型参数通常部署于服务器云端而非客户端,这部分存储开销是可控的。

4  结 语

本文提出了一种神经网络优化框架,通过自动可微分的梯度下降,将神经网络中的非线性ReLU选择性地替换为多项式函数,达到加速隐私推理的目的。该方法在神经网络推理服务上有着广泛的应用,可以在保证用户和模型的隐私的同时加快推理速度。未来,可以在框架结构包括多项式的选择做进一步的提升,例如部分替换为一次多项式函数、部分替换为二次多项式函数等。同时,进一步研究将该方法扩展到其他深度学习模型,例如Transformer[38]、ViT[39]、LLM[40]等,提高其适用范围。

参考文献

[1]

KRIZHEVSKY ASUTSKEVER IHINTON G E. ImageNet classification with deep convolutional neural networks[J]. Communications of the ACM201760(6): 84-90. DOI:10.1145/3065386 .

[2]

LI X GYANG Y NWU X H. A comparative study on selecting acoustic modeling units in deep neural networks based large vocabulary Chinese speech recognition[C]//Intelligence Science and Big Data Engineering. Berlin: Springer, 2013: 473-480. DOI: 10.1007/978-3-642-42057-3_60 .

[3]

LI Y BZHANG S TYE Fet al. A UAV path planning method based on deep reinforcement learning[C]//2020 IEEE USNC-CNC-URSI North American Radio Science Meeting (Joint with AP-S Symposium).New York: IEEE Press, 2020: 93-94. DOI: 10.23919/usnc/ursi49741.2020.9321625 .

[4]

ELGAMAL T. A public key cryptosystem and a signature scheme based on discrete logarithms[C]//IEEE Transactions on Information Theory. New York: IEEE Press, 1985: 469-472. DOI: 10.1109/TIT.1985.1057074 .

[5]

BONEH DGOH E JNISSIM K. Evaluating 2-DNF formulas on ciphertexts[M]//Theory of Cryptography. Berlin: Springer, 2005: 325-341. DOI:10.1007/978-3-540-30576-7_18 .

[6]

GENTRY C. Fully homomorphic encryption using ideal lattices[C]//Proceedings of the Forty-First Annual ACM Symposium on Theory of Computing. New York: ACM. 2009: 169-178. DOI:10.1145/1536414.1536440 .

[7]

BRAKERSKI ZVAIKUNTANATHAN V. Efficient fully homomorphic encryption from (standard) LWE[C]//2011 IEEE 52nd Annual Symposium on Foundations of Computer Science.New York: IEEE Press, 2011: 97-106. DOI:10.1109/FOCS.2011.12 .

[8]

ISHAI YKILIAN JNISSIM Ket al. Extending oblivious transfers efficiently[C]// Advances in Cryptology— CRYPTO 2003. Berlin: Springer, 2003: 145-161. DOI:10.1007/978-3-540-45146-4_9 .

[9]

RABIN M O. How to exchange secrets with oblivious transfer[EB/OL]. [2024-03-16]. DOI: 10.1201/9781315383033-4 .

[10]

YAO A C. Protocols for secure computations[C]//23rd Annual Symposium on Foundations of Computer Science (sfcs 1982). New York: IEEE Press, 1982: 160-164. DOI:10.1109/SFCS.1982.38 .

[11]

YAO A C. How to generate and exchange secrets[C]//27th Annual Symposium on Foundations of Computer Science (sfcs 1986). New York: IEEE Press, 1986: 162-167. DOI:10.1109/SFCS.1986.25 .

[12]

SHAMIR A. How to share a secret[J]. Communications of the ACM197922(11): 612-613. DOI:10.1145/359168.359176 .

[13]

CHOR BGOLDWASSER SMICALI Set al. Verifiable secret sharing and achieving simultaneity in the presence of faults[C]//26th Annual Symposium on Foundations of Computer Science (sfcs 1985). New York: IEEE Press, 1985: 383-395. DOI:10.1109/SFCS.1985.64 .

[14]

HERZBERG AJARECKI SKRAWCZYK Het al. Proactive secret sharing or: How to cope with perpetual leakage[C]//Advances in Cryptology—CRYPTO’ 95. Berlin: Springer, 1995: 339-352. DOI:10.1007/3-540-44750-4_27 .

[15]

GOLDREICH OMICALI SWIGDERSON A. How to play any mental game, or a completeness theorem for protocols with honest majority[C]//Providing sound foundations for cryptography: On the work of shafi goldwasser and silvio micali. New York: Association for Computing Machinery, 2019: 307-328. DOI:10.1145/3335741.3335755 .

[16]

MISHRA PLEHMKUHL RSRINIVASAN Aet al. DELPHI: A cryptographic inference service for neural networks[C]//Proceedings of the 29th USENIX conference on security symposium. Berkeley: USENIX Association, 2020:2505-2522. DOI:10.5555/3489212.3489353 .

[17]

GHODSI ZVELDANDA A KREAGEN Bet al. CryptoNAS: private inference on a relu budget[EB/OL]. [2024-03-20].

[18]

JHA N KGHODSI ZGARG Set al. DeepReDuce: ReLU reduction for fast private inference[EB/OL]. [2021-03-02].

[19]

KUNDU SLU SZHANG Yet al. Learning to linearize deep neural networks for secure and efficient private inference [EB/OL]. [2023-01-23].

[20]

CHO MJOSHI AREAGEN Bet al. Selective network linearization for efficient private inference[EB/OL]. [2022-06-08].

[21]

PENG H WHUANG S YZHOU Tet al. AutoReP: Automatic ReLU replacement for fast private network inference[C]//2023 IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE Press, 2023: 5155-5165. DOI:10.1109/ICCV51070.2023.00478 .

[22]

ZENG W XLI MYANG H Cet al. CoPriv: Network/protocol co-optimization for communication-efficient private inference[EB/OL]. [2023-11-03].

[23]

ZOPH BLE Q V. Neural architecture search with reinforcement learning[EB/OL]. [2017-02-15].

[24]

HE K MZHANG X YREN S Qet al. Deep residual learning for image recognition[C]//2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2016: 770-778. DOI:10.1109/CVPR.2016.90 .

[25]

ZAGORUYKO SKOMODAKIS N. Wide residual networks[EB/OL]. [2017-06-14]. DOI: 10.5244/c.30.87 .

[26]

SIMONYAN KZISSERMAN A. Very deep convolutional networks for large-scale image recognition[EB/OL]. [2015-04-10]. DOI: 10.48550/arXiv.1409.1556 .

[27]

GILAD-BACHRACH RDOWLIN NLAINE Ket al. CryptoNets: Applying neural networks to encrypted data with high throughput and accuracy[EB/OL]. [2024-03-22].

[28]

ROUHANI B DRIAZI M SKOUSHANFAR F. DeepSecure: Scalable provably-secure deep learning[C]//2018 55th ACM/ESDA/IEEE Design Automation Conference (DAC). New York: IEEE Press, 2018: 1-6. DOI:10.1109/DAC.2018.8465894 .

[29]

WAGH SGUPTA DCHANDRAN N. SecureNN: 3-party secure computation for neural network training[J]. Proceedings on Privacy Enhancing Technologies20192019(3): 26-49. DOI:10.2478/POPETS-2019-0035 .

[30]

JUVEKAR CVAIKUNTANATHAN VCHANDRAKASAN A. GAZELLE: A low latency framework for secure neural network inference[C]//Proceedings of the 27th USENIX Conference on Security Symposium. Baltimore: USENIX Association, 2018: 1651-1668. DOI:10.5555/3277203.3277326 .

[31]

ELSKEN TMETZEN J HHUTTER F. Neural architecture search: A survey[J]. Journal of Machine Learning Research201920(1): 1997-2017. DOI:10.5555/3322706.3361996 .

[32]

LIU H XSIMONYAN KYANG Y M. DARTS: Differentiable architecture search[EB/OL]. [2019-04-23].

[33]

YANG T JLIAO Y L, SZE V. NetAdaptV2: Efficient neural architecture search with fast super-network training and architecture optimization[C]//2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2021: 2402-2411. DOI:10.1109/cvpr46437.2021.00243 .

[34]

LOU QSHEN YJIN Het al. SAFENet: A secure, accurate and fast neural network inference[EB/OL]. [2023-05-06].

[35]

CHO MGHODSI ZREAGEN Bet al. Sphynx: A deep neural network design for private inference[J]. IEEE Security & Privacy202220(5): 22-34. DOI:10.1109/MSEC.2022.3165475 .

[36]

陈品极, 何琨, 陈晶, . 隐私保护深度学习研究综述[J]. 密码学报(中英文)202411(4): 771-798. DOI: 10.13868/j.cnki.jcr.000705 .

[37]

CHEN P JHE KCHEN Jet al. A survey on privacy-preserving deep learning[J]. Journal of Cryptologic Research202411(4): 771-798. DOI: 10.13868/j.cnki.jcr.00070(Ch ).

[38]

KNOTT BVENKATARAMAN SHANNUN Aet al. CryptTen: Secure multi-party computation meets machine learning[EB/OL]. [2024-04-10]. DOI: 10.1109/access.2024.3388992 .

[39]

VASWANI ASHAZEER NPARMAR Net al. Attention is all you need[EB/OL]. [2024-04-13]. DOI: 10.1007/978-3-031-84300-6_13 .

[40]

DOSOVITSKIY ABEYER LKOLESNIKOV Aet al. An image is worth 16x16 words: Transformers for image recognition at scale[EB/OL]. [2024-04-06].

[41]

ZHAO W XZHOU KLI J Yet al. A survey of large language models[EB/OL]. [2023-03-31].

AI Summary AI Mindmap
PDF (1788KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/