基于选择性超声波干扰的语音助手隐私保护系统

程健豪 ,  周满 ,  吴逸豪

武汉大学学报(理学版) ›› 2023, Vol. 69 ›› Issue (5) : 553 -564.

PDF (3219KB)
武汉大学学报(理学版) ›› 2023, Vol. 69 ›› Issue (5) : 553 -564. DOI: 10.14188/j.1671-8836.2023.0046
物联网安全

基于选择性超声波干扰的语音助手隐私保护系统

作者信息 +

A Privacy Protection System for Voice Assistants Based on Selective Ultrasonic Interference

Author information +
文章历史 +
PDF (3295K)

摘要

智能语音助手所要求的开放式麦克风权限带来了用户私密谈话内容泄露的风险。选择性超声波麦克风干扰系统是一种保护用户语音隐私安全的解决方案。然而,目前的系统无法有效地保护语音隐私安全,且去干扰机制的适用性存在问题。因此,提出了一种安全性更高、适用性更强的选择性超声波麦克风干扰系统。安全性方面,使用混合语音类型干扰可靠的混淆非授权设备;适用性方面,设计了一种参考高频段投影干扰副本的迭代自适应滤波方法,允许授权设备在多种干扰信号类型下记录更高质量的干净语音。此外,本文还拓展了选择性干扰机制,保留用户与语音助手的无接触交互能力。实验表明,本文设计的系统能够可靠地干扰非授权麦克风,同时授权设备去干扰效果在多项语音评价指标上均优于现有的选择性超声波麦克风干扰系统。

Abstract

The open microphone permission required by smart voice assistants brings the risk of user private conversation content leakage. The use of the selective ultrasonic microphone jamming system has been proposed as a means to protect user voice privacy and security. However, the current system is not fully effective in preserving speech privacy, and there are limitations with the active interference cancellation mechanism. Hence, this paper presents a selective ultrasonic microphone jamming system that addresses these challenges by incorporating enhanced safety considerations and improved applicability. This paper employs mixed speech type interference to effectively obfuscate unauthorized devices, enhancing security. Moreover, for improved applicability, an iterative adaptive filtering approach is designed, utilizing a reference high-frequency projection interference copy to enable authorized devices to capture cleaner speech amidst various types of interference signals. Furthermore, this paper extends the selective interference mechanism to preserve the touchless interaction capability between users and voice assistants.Experimental results demonstrate that the proposed system effectively blocks unauthorized microphones, and the quality of the denoised speech is higher than those recovered from existing selective ultrasonic jmicrophone amming systems in terms of subjective and objective speech evaluation.

Graphical abstract

关键词

系统安全 / 超声波麦克风干扰器 / 智能语音助手 / 隐私保护 / 主动干扰消除

Key words

system security / ultrasonic microphone jammer / smart voice assistant / privacy preservation / active interference elimination

引用本文

引用格式 ▾
程健豪,周满,吴逸豪. 基于选择性超声波干扰的语音助手隐私保护系统[J]. 武汉大学学报(理学版), 2023, 69(5): 553-564 DOI:10.14188/j.1671-8836.2023.0046

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

语音助手已经被广泛应用于智能手机和智能音箱中,如Amazon Alexa、Apple Siri、Google Assistant和Microsoft Cortana等。用户可以通过无接触的语音命令与智能语音助手进行交互,实现控制家居设备、执行问询搜索等操作,由于其便捷性,语音助手越来越受到人们的欢迎。为了保证交互/应答的实时性,语音助手在开启状态下需要不断监听环境中的声音。尽管语音助手通常被设计为关键词唤醒的模式,例如需要说出“Alexa”“Hi Siri”等,但实现这一功能的前提是语音助手必须无间断地记录并处理所有到达的声音信号,这引发了用户严重的隐私担忧。一旦声音数据被语音助手记录,该数据的控制权与流向便难以掌握与追溯。例如,在2019年,Apple被曝光允许第三方承包商在未经关键字激活时监听Siri的随机录音[1]。目前,还没有一种简单且通用的方法让用户相信和强制确认这些数据的最终用途。

目前在工业界一种流行的解决方案是引入一个由用户完全控制的麦克风开关按钮,如智能音箱上实体开关。然而,这种方法需要用户与设备进行一对一的接触式交互,对用户来说并不友好,特别是在有多个语音助手的场景下。另一种常用的反录音解决方案是在说话源附近添加可听的噪声干扰,例如,使用白噪声干扰器或音乐播放器,但这也意味着用户需要忍受可能会影响正常交流的高能量噪声。过去,电磁干扰是一种有效的麦克风干扰方法[2],但现代麦克风对电磁干扰具有较强的免疫能力[3]

为了有效反制语音助手窃听并兼顾用户友好性,研究人员提出了超声波麦克风干扰器[4~8]。该方法利用商用麦克风内放大器固有的非线性[910],通过精心设计的超声波将人耳可听的信号注入到录音中[411]。由于可以注入任意低频信号,用户可通过不可听超声波为载体,主动注入干扰信号来混淆语音助手录音,达到保护语音隐私的目的。与传统的可听声干扰器相比,这种方案不会扰乱用户听觉,更具隐蔽性。

然而目前超声波干扰系统中的选择性干扰机制不完善。Patronus[6]中的设备级别选择性干扰机制只适用于余弦波类型干扰,这种干扰方式被证明安全性存在缺陷[8],而对于其他更安全干扰类型,如常见的语音和白噪声干扰,选择性干扰机制几乎失去了效果。MicShield[7]的语音级别选择性干扰机制条件苛刻,需要一个不受干扰的麦克风,这在实际场景中难以满足。

针对之前方法中的不足,本文提出了一种兼顾干扰可靠性和去干扰有效性的选择性超声波干扰系统。干扰器广播调制超声波向周围麦克风注入混淆噪声,干扰未经授权的麦克风设备。本文贡献如下:

1) 同时实现了设备级别和语音级别的选择性干扰机制。授权设备通过从干扰器接收干扰信号的先验知识,实现抗干扰的语音录制功能。句子级别的唤醒词不受干扰影响,用户与语音助手之间的语音交互方式得以保留。

2) 本文设计的系统无须定制昂贵的超声波麦克风或者极尽巧思地放置普通麦克风来避免干扰,任意一台拥有计算和无线通信能力,且带有麦克风的普通设备均可成为授权设备。

3) 超声波语音注入信道实际表现为一个带记忆的时变非线性系统,为了抵抗其对选择性干扰机制的影响,提高经授权恢复的语音质量,本文在超声波麦克风干扰系统中首次引入一个额外的跳频“嗅探”超声波载波,将扭曲的低频干扰同步投影到不受说话声影响的较高频段,以此作为参考信号来有效消除低频干扰。

1  相关研究

1.1 麦克风非线性效应

麦克风捕获声音的流程如图1所示,麦克风将空气振动产生的机械波转化为电压信号后,需要经过放大器,低通滤波器(low-pass filter,LPF),模数转换器(analog-to-digital converter,ADC)。其中放大器虽然被设计为线性放大器,但在超过听觉频带范围外实际表现却是非线性的。之前研究表明[411],利用商用麦克风放大器上存在非线性缺陷,通过精心设计的超声波在低频范围内产生解调信号,可以将人耳可听的信号注入到麦克风录音中。假设输入麦克风放大器之前的信号是Sin(t),输出信号为:

Soutt=D1Sint+D2Sin2t+D3Sin3t+

其中,D1为输入信号的直接增益系数,D2为二次方项的增益系数,三阶和更高阶项的增益系数非常弱,往往直接忽略。非线性二阶项的存在使输出信号表现为时域上的扭曲。假定存在一个任意低频信号mt和一个超声余弦波cos(w1t)m(t)频率为fm(t),当输入信号由mtcosw1t组成时,由于二次方项的正增益影响,输出信号将在放大器发生频率调制,从而产生新的“阴影”信号。忽略三阶及以上增益,此时放大器输出信号为:

Soutt=
D1mtcosw1t+D2mtcosw1t2=
D12cos(w1+fm(t))t+D12cos(w1-fm(t))t+D22m2t+D22cos2w1t

假定w1=2π40E+3,信号m(t)的时变频率fm(t)恒小于4 kHz。由于cos(w1+fm(t))tcos(w1-fm(t))tcos2w1t项频率均高于20 kHz而被低通滤波器所过滤,最终留下了D222m2t低频分量。ADC无法分辨到达信号的产生源,采用正常声音的处理流程进行模数转换,于是麦克风录制得到了可听的“阴影”信号。通过改变调制方式,超声波还可以将原始信号m(t)注入到录制音频中。上述调制方式受限于超声波的特性,注入有效距离较短,还有研究表明[12],通过裁剪注入信号m(t)的频带,可以进一步扩大有效范围到10 m。

1.2 超声波麦克风干扰器

利用麦克风非线性效应,攻击者可以在用户无察觉的情况向其注入危险的语音命令,如打开门。用户也可以在知情的情况下主动注入干扰来混淆麦克风,防止麦克风非法窃听,保护自己的隐私。BackDoor[4]利用麦克风硬件上的自动增益控制(automatic gain control, AGC)电路,发出高功率超声波抑制语音信号,并利用麦克风非线性原理注入额外的低频频率畸变来降低录制音频的质量。BackDoor未考虑授权机制,只考虑了如何进行干扰。Wearable Jammer[5]重点关注超声波干扰器的可用性和用户体验,设计了一款低功耗的可穿戴式手环干扰器,利用跳频余弦波干扰佩戴者周围的麦克风。Patronus[6]首次引入选择性干扰机制,设计了一种设备级别的选择性超声波干扰系统,能防止未经授权的窃听麦克风,同时降低干扰对授权设备的影响。Patronus利用无线通信向授权设备传输干扰的先验知识,利用原始的干扰作为参考信号进行自适应滤波,消除干扰噪声对授权设备的影响。然而,相比于可听声噪声消除,利用非线性频率泄露原理注入的干扰信号受到复杂非线性时变信道的影响,拥有更大程度的扭曲和失真,实际注入干扰和原始信号之间存在较大差异,Patronus通过原始干扰和其倍频信号模拟复杂非线性信道响应的方法只适用于余弦波干扰,而这种干扰方式被证明是不安全的[8],容易遭受到频率分析攻击。对于其他类型的干扰信号,如白噪声和语音,Patronus选择性干扰机制无法正常工作,无法有效去除干扰。MicShield[7]采用了一种语音级别的选择性超声波干扰系统,其中选择性干扰机制不包含主动去干扰技术,而是需要一个不受干扰的麦克风来监听唤醒词的前几个音素,以保证用户说出唤醒词后及时关闭干扰。MicShield在实际场景的适用性受到限制,因为无干扰麦克风的条件难以满足,虽然这可以通过麦克风特殊布局避免自干扰来实现,如将麦克风放置在干扰死角内,但这提升了用户部署系统的难度,又或者可以配置一个超声波麦克风来满足条件,然而这极大地提高了硬件成本。BigBrother[13]提出了超声波麦克风干扰系统的评估框架,使用多个评价指标量化分析了多种干扰系统在不同威胁模型下的干扰效果。

2  系统设计

2.1 选择性干扰系统

本文设计了一种基于设备级别和语音级别选择性干扰机制的超声波麦克风干扰系统,能有效干扰未经授权的语音助手,保护用户私密谈话内容。设备级别的选择性干扰机制允许授权设备进行正常的录音。当环境中存在至少一台授权设备时,授权设备将代替语音助手来监听环境中的唤醒词,用户仍然能通过语音命令控制语音助手,实现语音句子级别的选择性干扰。

图2所示,干扰器持续向周围发出不可听的调制超声波,利用麦克风放大器非线性效应注入低频噪声混淆干扰半径内的所有麦克风。对于授权设备,干扰器向其发送干扰噪声的先验知识。授权设备接收到干扰和对应先验知识后,首先将两者进行同步,然后利用先验知识重建出低频干扰信号,随后通过自适应滤波主动去除干扰恢复得到干净音频。干净音频进一步被递送到关键字识别模块,当监听到语音助手的唤醒词后,授权设备通知干扰器停止干扰一段时间,保留用户与语音助手的无接触式语音交互能力。本文与几种主流的超声波干扰系统的比较如表1

2.2 干扰信号设计

2.2.1 威胁模型

本文假设窃听者会不断尝试从被干扰的信号中去恢复干净语音,考虑窃听者采取频率分析方法来去除干扰,如短时傅里叶变换(short-time Fourier transform,STFT)。之前超声波干扰器中流行的一种干扰方式是采用频率不断变化(跳频)的余弦波[56],跳频是为了防止窃听者通过频率分析方法得到干扰的准确频率,进而恢复出干净语音。然而,余弦波干扰为窄带信号,为了达到抑制说话声的目的,其往往拥有比语音高得多的能量分布。窃听者即使无法得到余弦波干扰的准确频率,也可以通过简单的陷波滤波器删除高能频段来有效地去除干扰[8]。宽带信号能以更低的功率达到与窄带余弦波近似的干扰效果,而不需要依靠高功率信号的掩蔽效应[14]压制说话声。

本文考虑窃听者拥有盲源分离(blind source separation,BSS)能力。盲源分离无需有关语音任何的先验知识,利用说话者语音(称为源)的统计独立性或非高斯性,将一个或多个源从同时记录的多个混合语音信号中分离出来。混响、回声、高功率白噪声能有效破坏语音源的统计独立性。

为了能够有效削弱窃听者恢复干净语音的能力,本文将注入的低频干扰信号设计为两个语音信号的叠加,语音从预构建的语音样本数据库中随机选择。语音的频率带宽广且富有变化,能有效扰乱同频带内的其他说话声。超声波语音注入信道的复杂非线性效应会显著降低注入干扰音频的质量,因此能够有效破坏掉音源的统计独立性。

2.2.2 超声波调制

为了将低频干扰通过非线性效应注入麦克风,超声波扬声器必须以足够高的功率运行。不幸的是,增加扬声器的功率会触发扬声器自身隔膜片的非线性[12],此时由数模转换器、功率放大器、超声波扬声器、传输介质、麦克风组成的超声波音频注入信道表现为一个复杂的带记忆的非线性时变系统,此信道对不同输入、中间设备和干扰功率的响应存在显著差异,难以用简单的泰勒级数来表示其复杂的非线性。

为了解决非线性时变信道的影响,受到文献[15]的启发,本文设计“嗅探”信号,额外播放一个同相的余弦波来投影信道复杂非线性效应。具体来说,本文设计的播放信号为:

Stxt=mtcosw1t+cosw1t+cosw2t

其中,mt为低频干扰信号,与超声余弦波cos w1t进行AM调制, cos w2t为“嗅探”信号。w1w2的频率均高于人耳可听的最高阈值20 kHz,且两个频率点相距较远,避免相互串扰。本文使用三组超声波扬声器分别播放mtcos w1tcos w1tcos (w2t),避免由于一个扬声器同时播放叠加的三个信号时,因为非线性隔膜片产生可被人耳感知到的高功率低频mt分量。原始设计信号Stxt经过数模转换器、功率放大器、超声波扬声器、空气介质、麦克风语音传感器后,到达放大器前的信号为:

Sint=A1m'tcosw1t+A2cosw1t+A3cos(w2t)

其中,m'tm(t)经过多个无记忆的非线性系统和带记忆的非线性系统后得到,与原始mt存在显著差异。A1A2A3为信号的加权系数。应用麦克风放大器的非线性模型,经过低通滤波器(low pass filter,LF)并且去除直流分量后,得到麦克风的输出:

Soutt=D1Sint+D2Sin2t=LF
D2A122m'2t+D2A1A2m't+D2A1A3m'tcosw1-w2t

其中,包含了三个频率分量:m'tm'2tm'tcosw1-w2tm'tcosw1-w2t将作为参考信号被用于去除有效低频干扰m'tm'2t,参考信号的有效性存在两个前提:

1) 分量m'tcos w1-w2t完整留在截止频率范围内,这个阈值在大多数商用麦克风上为20 kHz;

2) 双边带调制后的投影分量m'tcosw1-w2t不会与说话声、m'tm'2t频率分量发生混叠。

一般认为4 kHz的窄带频率可充分表达人类语音信号[16]。超声波扬声器的频率响应陡峭,m't受到此影响,表现为一个窄带信号,频率低于2 kHz,m'2tm'tcosw1-w2t的中心频率|w1-w2|大于两倍的语音带宽频率(>8 kHz)时即可满足第二点要求。此外,为了确保m'tcos w1-w2t的右边带不会遭到低通滤波器裁剪,中心频率|w1-w2|需要小于16 kHz。满足以上两点要求的m'tcos w1-w2t分量可以提供一个对噪声的有效参考。本文选择基础载波频率w1=40 kHz,“嗅探”信号的频率w2{24 kHz,32 kHz}。此时w1-w28 kHz,16 kHzm't|w1-w2|分量左边带信号不会与低频分量产生混淆,右边带也落在滤波器截止频率范围内。

“嗅探”信号的引入,将麦克风放大器前所有的非线性效应全部投影到高频段,对系统输入原始干扰信号类型、中间设备、扬声器功率鲁棒,授权设备可以通过它更好地估计低频干扰。不过,频率固定的“嗅探”信号同样也给了窃听者可乘之机。窃听者通过频率分析可以获得高频投影的中心频率|w1-w2|,在无需任何先验知识的情况下,窃听者同样也可以提取m't|w1-w2|用于取消干扰。为此,本文将“嗅探”信号设计为随机跳频的模式。由于超声波扬声器输出的有效频率范围相比于普通扬声器更窄,一般在中心频率± 2 kHz以内,实际跳频范围取决于采用的超声波扬声器具体型号。

“嗅探”信号剧烈的频率改变会引起超声波麦克风的振铃效应[4],产生人耳可听的低频“啪嗒”声,破坏了超声波干扰器的隐蔽性。因此,本文在“嗅探”信号频率突变之间插入短扫频波(chirp)信号[17],用于平滑地连接相邻的频率段,改善振铃效应,提升隐蔽性。插入的chirp信号表达式为:cos(2πf1t+π(f2-f1)t2T),其中{f1,f2}是频率变化范围,T为chirp长度。chirp信号本质为一个扫频波,频率随时间变化,从频谱上看,chirp信号的频率从f1逐渐线性增加(或减少)到f2。经过chirp信号平滑处理后的一个示例“嗅探”信号的频谱图如图3绿色部分所示,实线为随机跳频余弦波的频率,虚线为chirp信号的频率。

此外,为了同步授权设备接收到的“嗅探”信号,本文还将频率递增的chirp信号插入到每段干扰信号的前端作为前导码。chirp信号后紧跟着一段空白信号,防止前导码的振铃效应对后续干扰信号产生延迟影响。最终,本文设计的低频干扰的频谱图如图3蓝色部分所示。超声波载波和“嗅探”信号由两组超声波扬声器分别播放,低频干扰作为有效载荷,经过超声波载波调制后通过另外一组超声波扬声器播放。

2.3 设备级别选择干扰机制

2.3.1 同步

干扰是分段发送的,每段干扰的前端插入了一个chirp信号作为前导码。授权设备通过定位每段干扰的前导码实现同步。本文使用非相干解调器对录音进行匹配滤波。具体来说,本文使用与chirp信号频率相同,相位相反的共轭信号与录音进行卷积。匹配滤波通过抵消相关信号的相位,在时域实现信号的相干叠加,以最大化相关信号的信噪比(signal-to-noise ratio,SNR)。由于匹配滤波器的幅频特性与前导码一致,匹配滤波可以更好地放大前导码的强频点,这表现在相关性估计曲线上,即拥有最强能量的chirp前导码时域对应位置上出现一个极大值。本文利用这个极大值点准确定位干扰的起始位置,以此同步“嗅探”信号随机频率的序列和实际录制音频。

chirp信号对环境拥有较强鲁棒性[18],具体原因有两个。一是环境中噪声极少包含与chirp前导码具有相同频率和相位特征的扫频波;二是chirp信号具有分辨多径传播的能力。前导码除了经过视线路径到达麦克风外,可能还会经过周围物体的反射到达麦克风,此时,记录音频中包含多个chirp前导码。反射路径比起视线路径拥有更大的衰减和时延,非相干解调器仍能定位拥有最大能量、经由视线路径传播的前导码。

2.3.2 重建干扰信号

被干扰的麦克风记录得到带系数的m'tm'2tm't|w1-w2|三个频率分量。这三个分量中共同包含的m't信号,本文发现这三个m't信号并非完全相同,但存在强相关性。这是因为干扰器为了提高注入低频信号的功率,需要发出一个更高功率的超声波信号,高功率状态下运行的超声波扬声器输出信号强度不稳定。带有效干扰载荷的超声波信号、“嗅探”信号和超声波载波分别由不同的超声波扬声器组播放,这种不稳定独立反映在各自系数上,即A1A2A3表现为时变的系数A1(t)A2(t)A3(t)。本文令A1(t)A2(t)m't=ML(t)A12(t)m'2t=ML2(t)A1A3m'tcos w1-w2t=MH(t)cos w1-w2t

授权设备基于同步后的“嗅探”信号随机频率的序列重建低频干扰信号,具体步骤为:

1) 首先,带通滤波器被用于去除作为有效低频干扰部分的ML(t)ML2(t)分量,留下高频投影信号MH(t)cosw1-w2t。然后将其与已知的cosw1-w2t进行AM调制,调制产生两个分量MH(t)MH(t)cos2w1-w2t。高频分量MHtcos2w1-w2t被低通滤波器去除,留下估计的MH(t)

2) 此时提取到的MH(t)信号包含由麦克风失真引起的直流分量。为了移除直流分量,使用无重叠滑动窗口对信号进行分块,窗口中的每个点减去窗口内采样点的平均值,即MH(t)=MH(t)-MEANMH(t),最后对振幅进行归一化以满足后续自适应滤波器的需求。

通过以上两个步骤,本文重建得到了与实际低频干扰强相关的估计噪声。图4为干扰器注入音频干扰时,授权设备上实际录制到的低频干扰和根据高频投影信号重建得到的干扰信号在时域和频域上的比较情况。

2.3.3 主动干扰消除

接下来利用重建的干扰从混乱的信号中主动去除注入的低频干扰。由于重建干扰与注入干扰不完全一致,直接使用谱减法取消干扰效果较差,同时由于麦克风放大器非线性,低频干扰除了包含ML(t)外,还存在ML2(t)平方项,在实际录制到的低频干扰中,这两个分量以一种未知的系数加权求和。本文采用迭代自适用滤波算法在系数未知的情况下去除这两个分量,提升去干扰效果。

假设用户交谈的语音信号为s(t),它通过声学信道h1到达麦克风。授权设备的麦克风同时记录了语音和低频干扰ML(t)ML2(t),自适应滤波器系统的期望信号输入为:

d(t)=h1*s(t)+B1MLt+B2ML2(t)

其中,*符号为卷积操作,B1B2为未知的权重系数。自适应滤波器系统的参考信号输入为nref(t)nref(t)ML(t)ML2(t)相关。系统的误差信号可表示为:

et=dt-h*nreft

其中,h为自适应滤波器自适应的一组权重。充分收敛的自适应滤波器系统输出的误差信号e(t)可以看作是对语音s(t)良好的估计,语音中干扰被去除。本文使用归一化最小均方误差(normalized least mean squares,NLMS)算法,以最小化误差信号的瞬态均方误差为准则,定义优化问题:

minEet2=minEdt-h*nreft2=
minEh1*st+B1MLt+B2ML2t-h*nreft2

当(9)式中的期望最小时,可以认为自适应滤波器系统输出的误差信号e(t)为不带干扰的语音信号。自适应滤波器h本身并不是一成不变的,误差信号e(t)将会反馈回滤波器本身来更新其权重,以期望误差信号逼近语音信号。NLMS算法直接利用瞬态的均方误差对滤波器权重求梯度,得到滤波器权重h的更新公式为:

h*=h+2βe(t)nref(t)nref(t)2

其中,β是迭代步长。NLMS算法通过逐步调整权重系数,最小化预测误差的平方和实现滤波,相较于最小均方误差(least mean squares,LMS)算法具有更好的收敛速度和稳定性。在具体实现上,本文使用基于NLMS算法的分块频率自适应滤波器(partitioned block frequency-domain adaptive filter,PBFDAF)[19],PBFDAF利用快速傅里叶变换代替时域的线性卷积和互相关操作[20],可以显著减少计算开销。

自适应滤波中参考信号nref(t)的质量对于滤波效果至关重要。通过“嗅探”高频投影重建出的干扰信号MH(t)与低频干扰分量MLt强相关,且由于低频干扰ML2(t)包含m'2(t)项,MH(t)平方后与其相关。为了有效去除这两个干扰分量,本文设计了两轮的自适应迭代滤波算法,具体流程为:

1) 第一轮中,将重建干扰MH(t)作为NLMS自适应滤波器系统的参考信号输入,即nreft=MH(t)。滤波后将输出误差信号e(t)传递到下一轮滤波器中作为期望信号输入;

2) 第二轮NLMS自适应滤波器参考输入nreft=MH2(t),利用幂次模拟倍频干扰项实现从混合信号中删除这些高阶项。滤波器输出误差信号e(t)作为算法输出最终结果,此时可以认为ML(t)ML2(t)两个干扰分量已被有效去除。

2.4 语音级别选择干扰机制

语音级别选择干扰机制实现了句子级别的选择性干扰,用户未说出语音助手唤醒词之前的语音都会受到干扰,而唤醒词后紧随的语音命令不受影响。语音识别选择干扰机制的实现基于设备级别的选择干扰机制。当场景中存在至少一台授权设备时,授权设备利用设备级别选择干扰机制恢复得到干净语音后,代替语音助手监听环境中的唤醒词,本文使用基于隐式马尔科夫声学模型(hidden Markov model,HMM)的解码器识别唤醒关键字。检测到唤醒词后,授权设备通知干扰器关闭干扰一段时间,持续时间是一个经验值。在这段时间内,用户发出的语音命令将不受到任何干扰,可以用正常方式与智能语音助手进行交互。

3  实验评估

3.1 实验设置和评价指标

本文实现了一个如图5所示的原型测试平台。在干扰实验中,本文将Thinkpad X1 Gen7电脑作为信号发生器,借助高采样率声卡和Python sounddevice库在一个NU32C16T 16mm超声波扬声器播放“嗅探”信号,在两个NU40C12T 12mm超声波扬声器上播放超声波调制干扰和超声波载波。播放干扰信号采样率为96 kHz。每个超声波扬声器与WX-DC2416 150 W功率放大器连接。“嗅探”信号每0.1 s随机改变一次频率,频率范围是{30 kHz,32 kHz },频率之间用0.01 s的chirp平滑连接。本文使用TIMIT语料库[21]作为语音数据集,使用Alexa数据集[22]作为唤醒词数据集测试在授权设备上的唤醒成功率。从TIMIT数据集中选择两个句子对应的两条语音,将它们经过时域线性叠加后的样本作为私有的干扰噪声库。在Google Home Mini音箱上播放语音样本模拟环境中的用户说话声。此外,每段干扰前插入0.1 s频带为{1 kHz,2kHz}的chirp信号。chirp信号后紧跟着0.1 s的空白信号来消除前导码对干扰信号的影响。本文默认使用HUAWEI P30 Pro智能手机录制音频,干扰器和录制麦克风之间没有任何障碍物。默认情况下,通过调节播放音量和改变播放/录制设备之间距离,语音信号和干扰信号的SNR维持在0 dB左右。所有采集的信号也由Thinkpad X1 Gen7电脑进行处理。

在主动干扰消除实验中,干扰器和授权设备之间使用随机数种子完成噪声先验知识的传递。使用重建干扰信号和基于NLMS的PBFDAF去除干扰。对于去干扰前后的录音,应用Google STT(speech to text)[23]服务进行文本转录评估其质量。

系统有效性可由干扰可靠性和选择性干扰机制的去干扰效果进行衡量,本文主要通过三个方面的指标来评估系统有效性。它们分别是SNR、基于神经网络的客观评价和基于指标的客观评价。

1) SNR等于带干扰音频与去干扰后音频的功率之比;

2) 基于神经网络的客观评价采用自动语音识别(automatic speech recognition,ASR)的识别准确率Acc,Acc=(1-语音字错误率(word error rate, WER))×100%,WER为识别词序列转化到标签词序列所需增删改查操作次数;

3) 基于指标的客观评[13]:Smix=w[PESQ,LLR,WSS,NCM,CSII,STOI]T,其中,w=[0.18,0.13,0.06,0.2,0.21,0.22],PESQ为语音质量感知评估(perceptual evaluation of speech quality),LLR为对数似然比(log likelihood ratio),WSS为加权谱倾斜(weighted spectral slope),NCM为归一化协方差度量(normalized-covariance measure),CSII为连贯性和语音可懂度指数(coherence and speech intelligibility index),STOI为短时语音可懂度(short-time objective intelligibility)。Smix取值范围是0到1之间,其值越大代表语音可理解性越好。

3.2 方案对比

评估了余弦波和混合语音干扰在相同功率水平下的干扰可靠性,以及本文和Patronus中的选择性干扰机制对两者的去干扰效果。数据采集是通过在安静会议室环境中播放从TIMIT数据集中随机挑选的100条长度为2 s到8 s的语音片段得到,录制得到了共300条录音,其中100条带有200 Hz余弦波干扰,100条带有混合语音干扰,剩下100条为纯净语音。使用ASR识别准确率Acc和客观可理解性指标Smix评估音频质量。

干扰实验结果如表2所示。可以看到,没有干扰时,麦克风录制得到语音质量极高。麦克风被注入混合语音干扰后,音频质量急剧下降。而相同功率的余弦波信号虽然较大程度地降低了Smix指标,但却无法有效混淆ASR,此时Acc仍能达到高水平的87.7%。考虑到窃听者往往是通过ASR等自动化手段来窃取用户隐私文本信息,降低Acc往往更为重要。混合语音能在较低功率水平有效扰乱说话声,余弦波想要达到近似的有效效果,则需要更大的功率。

由于在授权设备上的干扰消除效果对于恢复语音的质量至关重要。本文比较了基于“嗅探”信号的去干扰方法和Patronus中基于原始信号的去干扰方法的有效性。实验中使用的PBFDAF和Patronus中的NLMS自适应滤波器均通过参数搜索的方式选取了最优参数。

表2展示了去干扰实验结果。针对余弦波干扰,本文和Patronus效果接近。但Patronus方法处理混合语音干扰后,性能反而出现了下降。相比于Patronus,本文方法可以有效去除混合语音干扰,极大地提升Acc。本文提出的选择性干扰机制在更安全的干扰信号类型的去干扰效果大幅优于Patronus。

图6展示不同方法干扰和去干扰的示例。为了能更为直观地观察效果,将干扰的功率适当地进行了提升。从包络上观察,200 Hz余弦波大幅改变了原始语音的时域波形,混合语音改变波形的同时,还在语音中间停顿部分添加了扰动,如0.5 s和2 s处。针对余弦波干扰,Patronus和本文方法都恢复出了高质量的波形,与原始语音相当接近。而对于混合语音干扰,Patronus去干扰后的音频更加混乱,尤其是在0.5 s左右,出现了更多杂波。本文方法恢复得到的音频包络上更加接近原始语音,质量高于Patronus方法。

3.3 干扰信号类型的影响

本文分别评估了混合语音信号、余弦波和带宽受限的白噪声在相同功率下干扰和去干扰的效果,结果如图7所示。可以看到,混合语音信号对ASR干扰效果较好,同时反映客观可理解性指标的Smix 较小。余弦波无法有效降低ASR识别准确率Acc,但是却能显著减小Smix。可能的原因是,一个单频信号能较大程度地改变信号包络和频谱,但大多数依赖于人耳听觉特征的语音识别模型对于单频点改变是鲁棒的。值得注意的是,1 kHz余弦波取得了极低Smix和较高的Acc,这说明ASR识别准确率不完全和可理解性指标相关。宽带的白噪声干扰效果十分出色,三种带宽的白噪声对应的Acc由低到高排序分别是4 kHz,1 kHz和200 Hz,Smix排序也是如此。其中200 Hz白噪声几乎无干扰效果,而4 kHz白噪声大幅干扰了麦克风,Acc只有15.6%。这表明,屏蔽语音中能量较为集中的窄带频段并不能完全将其干扰,白噪声干扰宽带越宽,干扰效果越好。值得注意的是,选择性超声波麦克风干扰系统需要在干扰和去干扰效果之间寻找一个平衡,不能一味地追求极致的干扰效果。虽然白噪声干扰效果极佳,但授权设备却无法有效去除干扰,恢复得到的说话声的Acc和Smix均维持在低水平。混合语音去除干扰后,Acc出现了明显的上升,接近90%。混合语音类型干扰能满足本系统需求,即能以较低的功率有效干扰非授权麦克风的同时,在授权设备上获得质量较高的干净语音。

3.4 干扰信号强度的影响

实际场景中,干扰器和设备之间的距离存在差异,说话人和麦克风之间的距离也是动态变化的。在不同SNR情况下,即设备接收不同幅度的说话声和干扰噪声,本文评估了非授权设备和授权设备录制得到语音的质量。为了控制语音和干扰的SNR,固定播放语音的音箱音量,逐渐增加干扰器的功率。实验结果如图8所示。结果显示,干扰功率减小(SNR越大表示干扰信号的功率越小),干扰效果也减弱,尤其是SNR小于等于0 dB后,ASR识别准确率Acc低于30%,反映客观可理解性的指标Smix低于0.65。SNR大于等于6时,此时,Acc高于92%,Smix大于0.75,麦克风难以被成功干扰。SNR为-3 dB时,授权设备上的去干扰效果最好,Acc上升了65%,Smix提升了0.07。然而过高的功率会极大地影响选择性干扰机制,降低恢复语音效果,如在SNR=-9 dB时,去干扰后的语音的Acc只由4%上升到了26%。在实际场景中使用系统时,用户需注意不能将超声波干扰器放置在离授权设备过近的位置,否则会影响其选择性干扰机制。也要注意有效干扰半径,麦克风与干扰器之间超过一定范围将会削弱干扰效果。

3.5 授权设备关键字识别结果

语音级别的选择性干扰机制实现依赖于授权设备代替语音助手监听语音唤醒词,以便在用户发出语音命令前及时停止干扰。本文在三种不同的商用手机上评估了语音级别的选择性干扰机制的有效性,即去干扰语音对于关键词唤醒成功率的影响。实际场景中,如果用户说出唤醒词后没有得到及时反馈的话,往往会通过多次尝试来反复唤醒语音助手。本文通过蓝牙音箱播放从Alexa数据集中随机挑选的300个样本,模拟用户多次尝试唤醒语音助手的场景,3次尝试中只要唤醒一次语音助手就计入成功。使用三种不同的手机Huawei P30 Pro,Redmi Note10和Oppo R9S,录制干扰音频。音频去除干扰后,使用基于HMM的CMU PocketSphinx[24]解码器识别关键字,关键词字段只包含Alexa。手机机型,尝试次数与语音助手唤醒成功率的关系如表3所示。可以看到Huawei P30 Pro平均唤醒成功率最高。三种机型一次成功唤醒语音助手的概率都较低,Oppo R9S甚至只有82%。但是3次尝试后,唤醒率均达到了99%以上。本文超声波干扰器系统牺牲少量语音助手唤醒成功率,保留了用户与语音助手的无接触交互能力,实现了语音级别选择性干扰机制。

4  结 语

本文利用麦克风放大器非线性缺陷,通过超声波向麦克风主动注入干扰信号,能有效干扰未经授权设备,防止语音助手非法窃听,保护用户隐私。本文设计了设备级别的选择性干扰机制,允许用户授权可信的设备,通过干扰器向其传输先验知识来消除干扰,从而录制得到干净语音;设计了语音级别的选择性干扰机制,利用授权设备能恢复干净语音的能力,代替语音助手监听唤醒词以便在用户发出语音命令前及时停止干扰,保留用户与语音助手的无接触语音交互能力,提升用户体验;引入了“嗅探”信号抵抗带记忆的非线性时变信道对于干扰信号质量的影响,相比于之前基于原始信号取消干扰的方法,本文在授权设备上能记录到更高质量的干净语音,同时保证安全性。

本文仅仅实现了一个原型,如何构建一个实用的、兼具设备兼容性和可拓展性的并联级多干扰器系统是一个有潜力的研究方向。由于超声波的物理特性,本文方法在干扰半径和干扰全向性方面受到限制,未来可在有效扩大干扰器的覆盖范围上作进一步研究。目前激光被发现利用光电效应可影响麦克风录音,未来研究可以探索其他种类的信号在语音隐私保护方面的应用。

参考文献

[1]

DEDVUKAJ T. Apple’s Siri is eavesdropping on your conversations, putting users at risk: Report[EB/OL]. [2019-09-19].

[2]

KUNE D FBACKES JCLARK S Set al. Ghost talk: Mitigating EMI signal injection attacks against analog sensors[C]//2013 IEEE Symposium on Security and Privacy. New York: IEEE Press, 2013: 145-159. DOI: 10.1109/SP.2013.20 .

[3]

马成,周正林,王成全.一种防窃听录音阻断器装置:201320228440.3[P]. 2013-10-16.

[4]

MA CZHOU Z LWANG C Q. Anti-Eavesdropping and Recording Blocker Device:201320228440.3[P]. 2013-10-16 (Ch).

[5]

ROY NHASSANIEH HCHOUDHURY R R. BackDoor: Making microphones hear inaudible sounds[C]//Proceedings of the 15th Annual International Conference on Mobile Systems, Applications, and Services. New York: ACM, 2017: 2-14. DOI: 10.1145/3081333.3081366 .

[6]

CHEN Y XLI H YTENG S Yet al. Wearable microphone jamming[C]//Proceedings of the 2020 CHI Conference on Human Factors in Computing Systems. New York: ACM, 2020: 1-12. DOI: 10.1145/3313831.3376304 .

[7]

LI L KLIU M NYAO Y Get al. Patronus: Preventing unauthorized speech recordings with support for selective unscrambling[C]//Proceedings of the 18th Conference on Embedded Networked Sensor Systems. New York: ACM, 2020: 245-257. DOI: 10.1145/3384419.3430713 .

[8]

SUN KCHEN CZHANG X Y. “Alexa, stop spying on me!”: Speech privacy protection against voice assistants[C]//Proceedings of the 18th Conference on Embedded Networked Sensor Systems. New York: ACM, 2020: 298-311. DOI: 10.1145/3384419.3430727 .

[9]

CHEN Y KGAO MLIU Y Jet al. Implement of a secure selective ultrasonic microphone jammer[J]. CCF Transactions on Pervasive Computing and Interaction20213(4): 367-377. DOI: 10.1007/s42486-021-00074-2 .

[10]

CHEN G K CWHALEN J J. Comparative RFI performance of bipolar operational amplifiers[C]//IEEE International Symposium on Electromagnetic Compatibility. New York: IEEE Press, 2016: 1-5. DOI: 10.1109/ISEMC.1981.7569908 .

[11]

ABUELMA'ATTI M T. Analysis of the effect of radio frequency interference on the DC performance of bipolar operational amplifiers[J]. IEEE Transactions on Electromagnetic Compatibility200345(2): 453-458. DOI: 10.1109/TEMC.2003.811312 .

[12]

ZHANG G MYAN CJI X Yet al. DolphinAttack: Inaudible voice commands[C]//Proceedings of the 2017 ACM SIGSAC Conference on Computer and Communications Security. New York: ACM, 2017: 103-117. DOI: 10.1145/3133956.3134052 .

[13]

ROY NSHEN SHASSANIEH Het al. Inaudible voice commands: The long-range attack and defense[C]//Proceedings of the 15th USENIX Conference on Networked Systems Design and Implementation. New York: ACM, 2018: 547-560. DOI: 10.5555/3307441.3307488 .

[14]

CHEN Y KGAO MLI Y Met al. Big brother is listening: An evaluation framework on ultrasonic microphone jammers[C]//IEEE INFOCOM 2022 ― IEEE Conference on Computer Communications. New York: IEEE Press, 2022: 1119-1128. DOI: 10.1109/INFOCOM48880.2022.9796834 .

[15]

SCHROEDER M RATAL B SHALL J L. Optimizing digital speech coders by exploiting masking properties of the human ear[J]. The Journal of the Acoustical Society of America197966(6): 1647-1652. DOI: 10.1121/1.383662 .

[16]

HE Y TBIAN J YTONG X Yet al. Canceling inaudible voice commands against voice control systems[C]//MobiCom '19: The 25th Annual International Conference on Mobile Computing and Networking. New York: ACM, 2019: 1-15. DOI: 10.1145/3300061.3345429 .

[17]

Wikipedia.Voice Frequency[EB/OL]. [2022-12-11].DOI: 10.1007/springerreference_28303 .

[18]

COOK C E. Linear FM signal formats for beacon and communication systems[J]. IEEE Transactions on Aerospace and Electronic Systems1974, AES-10(4): 471-478. DOI: 10.1109/TAES.1974.307800 .

[19]

LEE HKIM T HCHOI J Wet al. Chirp signal-based aerial acoustic communication for smart devices[C]//2015 IEEE Conference on Computer Communications (INFOCOM). New York: IEEE Press, 2015: 2407-2415. DOI: 10.1109/INFOCOM.2015.7218629 .

[20]

PÁEZ BORRALLO JGARCIA OTERO M. On the implementation of a partitioned block frequency domain adaptive filter (PBFDAF) for long acoustic echo cancellation[J]. Signal Processing199227(3): 301-315. DOI: 10.1016/0165-1684(92)90077-A .

[21]

YANG F RENZNER GYANG J. On the convergence behavior of partitioned-block frequency-domain adaptive filters[J]. IEEE Transactions on Signal Processing202169: 4906-4920. DOI: 10.1109/TSP.2021.3102175 .

[22]

GAROFOLO J SLAMEL L FFISHER W Met al.Darpa Timit Acoustic-Phonetic Continuous Speech Corpus CD-ROM{TIMIT}[EB/OL]. [2023-01-02]. DOI: 10.6028/nist.ir.4930 .

[23]

ANHARI A. Alexa Dataset[EB/OL]. [2022-10-24].

[24]

Google Cloud Speech-to-Text[EB/OL]. [2019-09-30]. DOI: 10.5626/ktcp.2019.25.3.191 .

[25]

PocketSphinx[EB/OL]. [2021-12-20]. DOI: 10.5220/0005148008400844 .

基金资助

国家自然科学基金(U20B2049)

AI Summary AI Mindmap
PDF (3219KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/