定向偏置声场的传声器阵列多点协同记录方法

王文韬 ,  王栋才 ,  刘紫赟 ,  沈勇

南京大学学报(自然科学) ›› 2026, Vol. 62 ›› Issue (03) : 458 -474.

PDF (1931KB)
南京大学学报(自然科学) ›› 2026, Vol. 62 ›› Issue (03) : 458 -474. DOI: 10.13232/j.cnki.jnju.2026.03.012

定向偏置声场的传声器阵列多点协同记录方法

作者信息 +

A multi⁃point collaborative recording method for microphone arrays in directionally biased sound fields

Author information +
文章历史 +
PDF (1976K)

摘要

准确的声场记录是声场分析、控制与重放等空间声应用的关键前提.针对实际环境中普遍存在的定向偏置声场,基于最优基函数的模式分解已被证明是一种高效的表征手段,然而,现有方法在实施过程中依赖单点传声器阵列的独立测量,其空间信息获取能力有限,易受测量噪声的影响.为了解决这一问题,将多点测量技术引入最优模式分解框架,提出一种面向定向偏置声场的分布式协同记录方法.该方法在多个空间位置布设传声器阵列来获取声压观测数据,利用球面波函数的叠加定理构建多点约束下的声场分解传递函数矩阵,实现了对模式分解系数的联合估计.数值仿真与实测结果均表明,与目前单点测量方案或基于球谐基函数的方法相比,所提方法在有效频率范围及整个目标听音区域内均可显著降低重构声压的相对误差,从而提升对定向偏置声场的记录能力.

Abstract

Accurate sound field recording serves as a fundamental prerequisite for spatial audio applications such as sound field analysis,control,and reproduction. For directionally biased sound fields commonly encountered in practice,modal decomposition based on optimal basis functions has proven to be an efficient representation approach; however,existing implementations typically rely on independent measurements using a single microphone array,which provides limited spatial information and is susceptible to noise. To address this issue,this study incorporates multi⁃point measurement into the optimal modal decomposition framework and proposes a distributed collaborative recording method for directionally biased sound fields. By constructing a sound field decomposition transfer matrix under multi⁃point constraints using the addition theorem of spherical wave functions,joint estimation of modal decomposition coefficients is achieved. Numerical simulations and experimental measurements demonstrate that,compared with single⁃point strategies or methods using spherical harmonic bases,the proposed method significantly reduces the relative error of reconstructed sound pressure over both the effective frequency range and the entire target listening area,thereby improving recording performance for directionally biased sound fields.

Graphical abstract

关键词

声场记录 / 模式分解 / 多点测量 / 传声器阵列 / 球谐函数

Key words

sound field recording / modal decomposition / multi⁃point measurement / microphone arrays / spherical harmonics

引用本文

引用格式 ▾
王文韬,王栋才,刘紫赟,沈勇. 定向偏置声场的传声器阵列多点协同记录方法[J]. 南京大学学报(自然科学), 2026, 62(03): 458-474 DOI:10.13232/j.cnki.jnju.2026.03.012

登录浏览全文

4963

注册一个新账户 忘记密码

复杂声学场景的分析与应用需求已不再局限于传统混响时间与声能分布测量,而是向着能够支持全方位声场重建,甚至是六自由度交互体验的精细化建模转变1-3.在此背景下,高保真的空间声场测量与记录尤为关键,其核心目标在于尽可能完整地捕获并保留目标区域内声场的时空信息.若声场记录的空间分辨率不足或准确性不佳,会直接导致声场分析失真与重放时的听感体验下降4-6.因此,提升声场测量与记录的准确性,对于实现更有效的声场分析、重建与控制具有重要意义7-8.
作为主流的空间音频表征方法,高阶Ambisonics(Higher⁃Order Ambisonics,HOA)利用球谐函数(Spherical Harmonics,SH)对声场进行模式分解,通过一组与基函数对应的球谐域系数(亦称“HOA信号”)来记录声场9.理论上,球面上任意平方可积的声压分布均可由无限阶球谐函数的线性组合精确表示10,然而,受限于实际物理实现,HOA信号必须进行有限阶次截断近似,截断阶次越高,其空间分辨率越高.HOA信号的截断阶次主要受阵列传声器数量的制约,编码性能也容易受测量噪声的影响11-12.针对这些挑战,现有研究主要通过优化阵列构型与空间滤波算法13-16来提升有限软硬件条件下的声场记录准确性.
基于球谐基函数的声场测量与记录技术通常默认目标声场是“各向同性”分布的,即入射声波等概率地来自空间不同方向.然而,大部分实际的声学环境往往表现出显著的方向偏向性,入射声波更可能从相对于听众的特定方位传来.以剧院、电影院、报告厅、教室等典型环境为例,绝大部分声波均从听众前方到达听音位置,直达声与早期反射能量在统计意义上明显向听众前方偏置.利用这类声场方向偏向的统计特征,有研究尝试使用与目标声场方向分布更加契合的基函数替代标准球谐函数,通过混合阶Ambisonics17、椭球型Ambisonics18、球扇谐函数(Spherical Sector Harmonics)19、Slepian函数20等特殊基函数完成了更加高效、准确的声场模式分解.在此基础上,Gao et al21建立了一套最优模式分解的技术框架,可针对任意定向偏置声场定制构造适配其方向偏向特征的最优模式分解基函数,并求解出对应的系数以表征声场,显著提升了声场记录的准确性.
上述方法在理论上取得了大量的进展,但在实际测量应用时,大多数方法仍依赖单一位置布置的传声器阵列,即使在空间多点进行测量,不同测量点间的数据也往往被独立处理,没有充分利用声场的空间相关性,在一定程度上限制了声场记录的准确性.针对这一局限,Fernandez⁃Grande22在同一等效声源模型下对不同位置球形传声器阵列的测量数据进行向量拼接,联合反演出大尺寸声源的等效强度.Samarasinghe et al23-24在目标空间的多个测量点使用分布式传声器阵列采集声场,结合球面波函数的数学特性扩展了HOA信号的截断阶次.Fahim et al25在此基础上使用分布式高阶传声器阵列在球谐域中实现了目标声源与噪声的线性分离.然而,这些多点协同记录方法仍主要基于球谐基函数展开,没有充分利用针对定向偏置声场设计的方向性基函数的高效表征能力.
受到这一系列研究的启发,将空间多点测量技术引入最优模式分解框架中,提出一种面向定向偏置声场的高保真记录方法.该方法在目标空间多个测量位置布设传声器阵列来获取分布式声压数据,构建并扩展多点约束下的声场分解传递函数矩阵进行联合编码.这种多点联合处理策略充分利用了声场的空间相关性,在计算最优模式分解系数时有效抑制了测量噪声引起的数值偏差.考虑到球谐函数作为一组完备的正交基,任意球面上平方可积的定向偏置基函数都可以表示为球谐函数的线性组合26,基于此,结合球面波函数的三维叠加特性,除了最优模式分解所构建的定制化基函数外,混合阶Ambisonics和Slepian函数等其他基函数类型同样适配本研究的实现路径,该方法实际上在不同定向偏置基函数的选择上具有较好的兼容性与泛化能力.
数值仿真与实验验证的结果均表明,和现有的单点测量或基于球谐基函数的方法相比,本文提出的方法在有效频率范围及整个目标听音区域内显著降低了重构声压的相对误差,提升了目标定向偏置声场的记录准确性.

1 原理与方法

1.1 基于最优模式分解的定向偏置声场表征

若声源距离目标听音区域足够远,听音区内的声场可视为来自各个方向平面波的叠加27

sk,r=𝕊2 ak,θ,φe-jkrdΩ

其中,sk,r为空间位置r处的声压,k=2πf/c为波数,f为频率,c为声速.ak,θ,φ为来自θ,φ方向的平面波复振幅,θφ分别为球坐标系中的天顶角和方位角.j=-1为虚数单位,k=-ksinθcosφ,sinθsinφ,cosθT为波矢,其中,上标T为转置算符.为了简化记号,后文表达式略去波数k.𝕊2dΩ=02π0πsinθdθdφ为沿单位球表面的积分.通常情况下,将aθ,φ视为随机变量,其期望满足:

𝔼aθ,φ=0

还可以通过模式分解方法将aθ,φ在一组基函数下展开,使其表示为多个模式的叠加,即:

aθ,φψHθ,φu

其中,ψθ,φ M×1为由模式分解基函数构成的向量,u M×1为对应的模式分解系数向量,上标H为共轭转置算符,为复数集合,M为总模式数.

现有方法通常采用球谐基函数进行模式分解,但该类方法隐含声场在各个方向上近似“各向同性”的假设,不适用于具有方向偏向性的声场记录场景.事实上,在多数实际应用场景中,不同入射方向声波的分布概率以及它们对听众听感的贡献均存在显著差异.针对这类定向偏置声场,Gao et al21提出一种利用声场方向偏向先验信息构造最优模式分解基函数的方法,该方法对应的优化问题可以表示为:

minu𝕊2 wθ,φψHθ,φu-aθ,φ2dΩ

其中,wθ,φ为非负实值权函数,用于描述不同入射方向平面波对听众的相对重要性.该权函数通常依据目标声场的空间分布特性,由先验信息加以确定.此外,还需要对基函数施加如下加权正交性条件:

𝕊2 wθ,φψθ,φψHθ,φdΩ=I

其中,I是对应维度的单位矩阵.因此,最优的模式分解系数满足:

uopt=𝕊2 wθ,φψθ,φaθ,φdΩ

在最优模式系数条件下最小化模式分解的误差,结合式(5),可以将最优基函数的求解转换为优化问题:

ψoptθ,φ=argminψ𝔼  𝕊2 wθ,φψHθ,φuopt-aθ,φ2dΩs.t.    𝕊2 wθ,φψθ,φψHθ,φdΩ=I              (7)

为了实现数值求解,Gao et al21利用球谐函数进行离散化,将连续的ψoptθ,φaθ,φ分别展开为有限阶球谐函数的线性组合形式:

ψoptθ,φ=Toptψ^SHθ,φ
aθ,φ=ψ^SHθ,φa

其中,ψ^SHθ,φ N+12×1表示N阶截断的球谐函数共轭值按阶次排列构成的列向量:

ψ^SHθ,φ=Y00θ,φY1-1θ,φY10θ,φY11θ,φYNNθ,φH

Ynmθ,φ代表阶数为n、度数为m的球谐函数.a N+12×1是平面波复振幅对应的球谐展开系数.相应地,最优基函数对应的模式分解系数满足:

uopt=ToptWa

其中,ToptW可以表示为21

Topt=I,ΟUHΣ˜-1ΟVH
W=𝕊2 wθ,φψ^SHθ,φψ^SHHθ,φdΩ=VΣΣVH

其中,-1代表方阵的逆运算,Ο是对应维度的零矩阵,V N+12×N+12是酉矩阵,Σ N+12×N+12是对角矩阵(为实数集合),存在:

Σ=Σ˜ΟΟΟ

Σ˜ N0×N0同样是对角矩阵,其对角线元素为降序排列的大于零的实数.U N0×N0是酉矩阵,与ΣV满足如下关系:

ΣVHAVΣ=UΠUHΟΟΟ

其中,

A=𝔼aaH=𝕊2ψ^SHθ1,φ1𝒞θ1,φ1,θ2,φ2ψ^SHHθ2,φ2dΩ1dΩ2

其中,𝒞()为协方差算符.ΠN0×N0同样是对角矩阵,其对角线元素为降序排列的大于零的实数.利用式(8)式(11)求解的最优基函数及其模式分解系数,来自θ,φ方向的平面波复振幅可以被近似表示为:

aθ,φψoptHθ,φuopt

1.2 基于传声器阵列的最优模式分解系数估计

一般情况下,平面波复振幅分布函数aθ,φ及其球谐展开系数a是未知的,无法直接通过式(11)求解模式分解系数uopt,需要借助传声器阵列的实际测量结果进行反演估计.现有技术通常采用全指向型传声器构成的阵列对声场进行空间采样,考虑球心位于坐标原点的传声器阵列,若目标空间中所有声源均位于以原点为球心、半径为R0的球体外部,则该球形区域内任意位置处的声压均可近似表示为有限阶球谐函数的展开形式12

srn=0Nm=-nnsnmbnkrYnmθ,φ

其中,snm为声压的球谐域展开系数,亦即HOA信号.对于由平面波构成的声场,存在:

snm=𝕊2 aθ,φYnm*θ,φdΩ

径向函数bnkr由传声器阵列的边界条件决定,为了简化叙述,本文重点考虑半径为r0的刚性球面传声器阵列,存在:

bnkr=4πjnjnkr-jn'kr0hn2'kr0hn2kr

其中,jnjn'分别表示n阶球贝塞尔函数及其导数,hn2hn2'分别表示第二类n阶球汉克尔函数及其导数.后续分析均默认使用此类最典型的传声器阵列构型方案.

设阵列包含Q个传声器,其空间位置记为rq=r0,θq,φqq=1,2,,Q.式(18)可以进一步离散化为矩阵形式:

s=Gsnm+n=YBsnm+n

其中,s Q×1为观测向量,其第q个元素sqrq表示传声器在位置rq处测得的声压信号在频域中的复振幅.snm N+12×1是由snm构成的球谐域系数向量,n Q×1则代表各个传声器处的测量噪声.相应地,球谐函数矩阵Y可以被表示为:

Y=ψ^SHθ1,φ1ψ^SHθ2,φ2ψ^SHθQ,φQH=Y00θ1,φ1Y1-1θ1,φ1Y10θ1,φ1Y11θ1,φ1YNNθ1,φ1Y00θ2,φ2Y1-1θ2,φ2Y10θ2,φ2Y11θ2,φ2YNNθ2,φ2Y00θQ,φQY1-1θQ,φQY10θQ,φQY11θQ,φQYNNθQ,φQ

B N+12×N+12是一个对角矩阵,其第n2+1至第n+12个对角元素为bnkr0n=0,1,2,,N.

基于上述球形传声器阵列测得的声压信号,假设最优基函数对应的模式分解系数可由线性编码矩阵直接映射得到,即存在关系:

uopt=Eopts

其中,Eopt M×Q表示最优基函数对应的编码矩阵,可以通过如下优化问题求解:

minEopt𝔼𝕊2 wθ,φψoptHθ,φuopt-aθ,φ2dΩ

假设传声器噪声n和采集到的信号互不相关,且满足:

𝒞n=σ2I

σ2等效为相关矩阵求逆过程中的Tikhonov正则化参数.该参数可以被估计为21

σ2=trGAGHQ

其中,tr为矩阵的迹,为实际测量环境中的信噪比.在上述假设下将式(9)式(21)式(23)代入式(24),可以得到最优编码矩阵的闭式解:

Eopt=ToptWAGHGAGH+σ2I-1

由此,结合传声器阵列的声压观测值即可实现最优模式分解系数的线性估计.

1.3 基于传声器阵列的多点协同记录

在实际应用中,为了更充分地获取目标区域的声场信息,通常采用分布式传声器阵列多点协同记录策略.相较于在各个离散位置进行独立观测的单点测量方法,多点协同记录能够利用各测点间的空间相关性,通过扩展的有效观测值更准确地估计出模式分解系数.具体地,假设在目标区域内I个不同测量位置布设传声器阵列,每个子阵列均可编码得到截断阶次为Ni的HOA信号.在以O为原点的全局坐标系下,第i个阵列i=1,2,,I的中心坐标为ri0=ri0,θi0,φi0.若以第i个阵列中心Oi所在位置为原点建立局部坐标系,参考式(21),该坐标系下阵列中各传声器的声压观测量可以表示为:

si=Gisn,im+ni

局部球谐系数sn,im的截断阶次Ni受限于该位置处阵列中的传声器数量,因此,需要利用多组不同的Ni阶球谐系数来实现阶次拓展,联合求解出截断阶次为N的全局球谐系数sn,0m,在数值上一般存在NiN.根据三维球面波函数的平移叠加定理1223,局部坐标系下的球谐系数均可由相对于全局原点O定义的全局球谐系数表示.具体地,当使用传声器阵列在目标空间中I个不同测量位置进行测量时,存在关系:

s̆=Ğsn,0m+n̆

其中,s̆,n̆均由I个测点处对应的表达式直接拼接而成:

s̆=s1s2sI,n̆=n1n2nI

ĞI个测点处的传声器阵列多点协同记录时所对应的传递函数矩阵,满足28-29

Ğ=Φ+ΨZMT

其中,上标代表Moore⁃Penrose伪逆算符.ΦΦi组合而成:

Φ=Φ1    Φ2        ΦI=Y1J1    Y2J2        YIJI

其中,Yi是第i个测点处的传声器阵列对应的球谐函数矩阵,形如式(22).Ji Ni+12×Ni+12是一个对角矩阵,其第ni2+1至第ni+12个对角元素为4πjnijnikr0,ini=0,1,2,,Nir0,i=rii代表第i个测点处球形传声器阵列的半径.Ψ满足:

Ψ=Y11H11Y21H21YI1HI1Y12H12Y22H22YI2HI2Y1IH1IY2IH2IYIIHII

其中,Yij是由Ynjmjθi,qj,φi,qj构成的球谐函数矩阵,Hij是由4πjnjhnj2kri,qj元素构成的对角矩阵,nj=0,1,2,,Nj.其中,ri,qj=ri,qj,θi,qj,φi,qj代表第i个测点处阵列中各个传声器在以第j个测点处Oj为原点建立的局部坐标系中的坐标.MMi组合而成:

M=M1    M2        MI

其中,Mi是第i个测点处传声器阵列的散射模态响应矩阵,用于将该处的入射系数映射为散射系数.对于刚性球面传声器阵列,Mi是一个对角矩阵,其第ni2+1至第ni+12个对角元素为

-jni'kr0,i/hni2'kr0,i.

TTi拼接而成:

T=T1T2TI

其中,

Ti=S^0,00,0ri0S^1,0-1,0ri0S^1,00,0ri0S^1,01,0ri0S^N,0N,0ri(0)S^0,10,-1ri0S^1,1-1,-1ri0S^1,10,-1ri0S^1,11,-1ri0S^N,1N,-1ri0S^0,10,0ri0S^1,1-1,0ri0S^1,10,0ri0S^1,11,0ri0S^N,1N,0ri0S^0,10,1ri0S^1,1-1,1ri0S^1,10,1ri0S^1,11,1ri0S^N,1N,1ri0S^0,Ni0,Niri0S^1,Ni-1,Niri0S^1,Ni0,Niri0S^1,Ni1,Niri0S^N,NiN,Niri0

S^n0,nim0,miri0满足:

S^n0,nim0,miri0=4π-12m0-mil=0jljlkri0Ylmi-m0*θi0,φi0×2n0+12ni+12l+14πW1W2

其中,上标*为共轭算符.W1W2表示Wigner 3⁃j符号,具体形式为:

W1=n0nil000,    W2=n0nilm0-mimi-m0

Z可写作:

Z=I-M2S2,1 -MISI,1 -M1S1,2 I-MISI,2 -M1S1,I -M2S2,I I

其中,Si,j 是一个和Ti类似的平移变换矩阵,满足1223

Si,j =S¯0,00,0rijS¯1,0-1,0rijS¯1,00,0rijS¯1,01,0rijS¯Nj,0Nj,0rijS¯0,10,-1rijS¯1,1-1,-1rijS¯1,10,-1rijS¯1,11,-1rijS¯Nj,1Nj,-1rijS¯0,10,0rijS¯1,1-1,0rijS¯1,10,0rijS¯1,11,0rijS¯Nj,1Nj,0rijS¯0,10,1rijS¯1,1-1,1rijS¯1,10,1rijS¯1,11,1rijS¯Nj,1Nj,1rijS¯0,Ni0,NirijS¯1,Ni-1,NirijS¯1,Ni0,NirijS¯1,Ni1,NirijS¯Nj,NiNj,Nirij

其中,rij是第i个测点在以第j个测点处以Oj为原点建立的局部坐标系中的坐标.当rijr0,i时,S¯nj,nimj,mirij满足:

S¯nj,nimj,mirij=4π-12mj-mil=0jlhl2krijYlmi-mj*θji,φji×2nj+12ni+12l+14πnjnil000njnilmj-mimi-mj

对于各类定向偏置声场,可将式(29)中的s̆Ğn̆分别替代式(21)中的sGn,并结合式(23),即可获得目标区域内通过多点协同记录估计出的最优模式分解系数:

ŭopt=ToptWAĞHĞAĞH+σ̆2I-1s̆

式(42)对应的Tikhonov正则化框架下,随着目标区域内测点数量的增加,扩展后的传递函数矩阵Ğ的行数相应增加.事实上,如果使用规格相同的传声器阵列在目标区域内进行多点协同记录,Ğ将变成维度为QI×N+12的矩阵.一般情况下,通过合理选择传声器数量Q与测点数量I使QIN+12,可将线性方程组求解过程中原本可能存在的欠定问题转化为超定问题.在实际测量应用中,尤其在高随机噪声环境下,根据多点协同记录形成的超定方程组可利用更多有效的观测数据对随机噪声进行平滑与抑制,从而显著提升模式分解系数估计的准确性,并最终降低声场表征与记录时的误差.

式(31)中多点协同记录的传递函数矩阵考虑了不同传声器阵列在测量过程中可能产生的互散射效应,该效应主要体现在矩阵Z和矩阵Ψ中的非对角块元素上.事实上,在多数实际应用中,待测环境通常具有较好的稳定性,不具备明显的声学时变特性.基于成本和实施复杂度的考虑,工程上常将单个传声器阵列依次布设于多个测点进行分时顺序测量30,天然避免了多个阵列同时存在引起的互散射问题.在仅考虑传声器阵列自身散射而忽略不同阵列间互散射效应的情况下,矩阵Z可退化为单位矩阵、矩阵Ψ也仅含YijHij

i=j相关分量,此时矩阵Ğ拥有简化形式:

Ğs=G1T1G2T2GITI

事实上,由于Si,j Hij中包含的球汉克尔函数幅值随kr的增大迅速衰减(如图1a所示),因此哪怕被记录声场的时变特征明显,如果同时布设的各个传声器阵列间距足够大,不同测点间的散射干扰在空间上传播后也将充分衰减,对测量结果的影响可近似忽略.为了定量评估阵列间互散射效应的影响,图1b和图1c对两个相同的刚性球面传声器阵列的互散射效应进行了模拟.每个测点处的阵列均包含64个均匀分布的传声器,局部截断阶次为Ni=7,全局截断阶次为N=10.测点间距设置为阵列半径的2~40倍.定义传递函数矩阵相对误差为:

ηr=20×lgĞ-ĞsFĞsF

其中,F代表矩阵的Frobenius范数.在声学领域,通常使用分贝(decibel,dB)表示两个数的对数比.本文涉及相对误差、信噪比等比值类指标时,均采用dB表示.若以-30 dB为阈值,当相对误差低于-30 dB时,认为互散射效应可以忽略.由图1b和图1c可知,在当前仿真设定的条件下,若相邻测点间距大于阵列半径的20倍,在绝大部分目标频率范围内,阵列间的互散射效应均可近似忽略.

综上,为了简化运算并与实际应用中更常见的分时顺序测量流程保持一致,后续的数值仿真和实验验证均不考虑阵列间的互散射影响.

2 数值仿真

2.1 仿真设置

通过数值仿真对上述理论建模进行验证.仿真场景选取声场记录中十分常见的一类定向偏置声场,假定平面波复振幅aθ,φ的协方差满足:

𝒞θ1,φ1,θ2,φ2=δθ1,φ1,θ2,φ2,-π2φ1π20,其他

该假设包含两层含义:其一,来自不同入射方向的平面波相互独立;其二,入射声波的方位角被限制在-π/2,π/2,声能主要来自听者朝向的前半空间.事实上,此类“前向占优”的方向分布符合剧院、电影院、报告厅、教室等典型室内声学空间的统计特性.此外,为了体现人耳在水平面附近更强的方位辨别能力31,引入方向权函数:

wθ,φ=sinθ

该权函数凸显了来自听者双耳水平面附近入射声波的相对重要性.仿真中目标声场由100列独立平面波叠加构成,其振幅与入射方向具有随机性,但入射方位角均被限制在-π/2,π/2,入射天顶角的概率密度与sinθ成正比.

为了比较本文方法和多种现有方法在定向偏置声场记录中的表现,定义加权重构声压相对误差为:

εr=10×lgj=1Jwθj,φjs˜rj,θj,φj-srj,θj,φj2j=1Jwθj,φjsrj,θj,φj2

其中,rj,θj,φj为被评估声场区域中的目标观测位置,在以原点为球心、半径为R0的球形区域内采用体积加权随机采样生成,共取J=20000个在球体内呈现均匀分布特性的观测点.估计声压s˜rj,θj,φj与真实声压srj,θj,φj分别根据平面波复振幅估计值a˜θ,φ和仿真设定中已知的平面波复振幅真实值aθ,φ结合式(1)求得.计算频率的采样间隔为20 Hz.

仿真中采用刚性边界球形传声器阵列记录声场.阵列中的传声器均为全指向型,近似均匀地分布在刚性球表面,阵列半径r0设为0.05 m.传声器的测量噪声为随机噪声,振幅服从高斯分布,相位服从均匀分布.若无特殊说明,编码矩阵E计算时采用的信噪比与实际信噪比保持一致,均设置为40 dB.各测量点均使用相同规格的传声器阵列,它们的空间位置分布如图2所示.“单测量点”表示仅在原点通过单一球阵进行独立测量;“5,9,13个测量点”表示除原点处的中心测点外,其余测点分别位于正四面体、正六面体、正二十面体的顶点处,顶点到中心的距离为0.5 m.可以认为除中心点外其余各测点均匀分布在同半径的球面上.

2.2 仿真结果与分析

图3展示了不同方法计算得出的重构声压相对误差随频率的变化情况.为了最小化声场重构误差,模式分解维度与全局球谐展开阶次保持一致.总模式数M分别被设置为121,256和441,分别对应全局球谐截断阶次N等于10,15和20时球谐函数的总模式数.每个测点处阵列中的传声器数量Q=100,多点协同记录时选用的测点数I=9.由图可见,在有效频率范围内,多点测量的结果均显著优于单点测量,且本文提出的结合最优基函数的多点协同记录方法在绝大多数频率下均能取得最小的重构误差.图4呈现了N=15、频率为1000 Hz时,xy平面内归一化声压的重构结果对比.综合对比图中声压实部和虚部的分布后可以直观地看出,本方法(图4e和图4j)能够更加准确地记录目标声场的声压分布信息.

此外,从图3还可以看到,和单点测量方法相比,多点测量方法存在有效截断频率上限.当N分别为10,15和20时,该上限约为1000,1600和2100 Hz.在有效频率范围内,提高全局截断阶次N不会降低相同频率处的重构误差,但是能够提升截断频率并拓宽有效频带.这是由于多点测量技术依赖的局部球谐系数在平移分解时,会不可避免地引入更高阶球谐模态的能量耦合32.理论上,为了实现精确的表示,需要依赖无穷阶次的球谐系数,因此式(36)中的Ti式(40)中的Si,j在理论上都应是维度为Ni+12×的矩阵.然而,实际应用中必须进行有限阶次截断,随着截断阶次的提升,其近似表征的准确性也相应提升.当i=1INi+12=N+12时一个理想条件下可供参考的有效截断频率的计算如下23

fcutoff=ci=1INi+12-1πeR0=cNπeR0

其中,R0为需要记录或重构的目标声场区域的半径.

由于在“局部⁃全局”球谐系数平移分解过程中存在耦合效应,多点协同记录方法的截断频率上限通常低于单测点独立记录方法.由式(48)可知,截断频率主要受全局截断阶次N和被记录声场区域尺度R0的共同影响.事实上,在许多实际应用场景中(例如虚拟现实或增强现实系统中的多自由度双耳渲染),目标声场区域通常仅覆盖人头附近的小范围空间,此时R0一般不超过0.1 m.在这种情况下,即使全局截断阶次N取值相对有限,也能使有效频率范围覆盖空间音频应用的主要工作频段.对于目标声场区域较大的应用场景,往往通过增加测点数量以支持更高阶的全局球谐展开,从而提高可实现的有效截断频率.此外,在实际空间音频系统中,声场编码通常采用分频段处理策略.在中低频段可利用基于模式分解的方法对声场进行较为精确的表示,频率较高的部分主要采用参数化空间音频方法进行建模,以减轻截断频率或空间混叠带来的限制33.

为了进一步评估本文方法的性能,分别分析测点数量I与各个测点处阵列传声器数量Q的影响,结果如图5图6所示.设置总模式数M=256,对应的N=15.图5Q固定为100,测点数量I分别为1,5,9和13,其空间位置分布如图2所示.图6I固定为9,传声器数量Q分别为64,100和169.由图可见,在有效频率范围内,重构声压相对误差随着测点数量或传声器数量的增加而不断降低,但增加测点数带来的效果提升明显优于增加阵列中的传声器数量.这可能是因为球形传声器阵列的半径r0通常小于各测点间的间距,在单一测点处各传声器观测到的声场在空间上差异有限,尤其对于低频段声波,通道信息冗余较强,而多测点采样能够覆盖更大的空间范围,引入更丰富的声压幅度与相位差异信息,降低观测数据间的相关性,进一步增强了对模式分解系数估计时的约束强度,从而提升了模式分解系数估计及声场记录的准确性.

提出的基于最优基函数的多点协同记录方法建立在Tikhonov正则化框架上.为了分析正则化参数的选择对算法性能的影响,图7给出了不同实际信噪比下重构声压的相对误差.其中,编码过程采用的信噪比设置为40 dB,实际环境中的真实信噪比分别设置为20,30,40和50 dB.仿真中,设置总模式数M=256,对应的N=15.每个测点处阵列的传声器个数Q=100,测点数I=9.由图7可知,在有效频率范围内,当实际信噪比大于或等于算法在编码过程中设定的信噪比时,采用本文方法得到的重构声压相对误差不存在明显差异.然而,当实际信噪比小于编码矩阵构建时设定的信噪比时,重构声压相对误差将明显增加.因此,在实际应用中,编码过程中设定的信噪比应小于或等于实际信噪比,较稳健的策略是将其设置为实际环境可能出现的最小信噪比.

面向定向偏置声场的最优基函数方法依赖于声场空间分布的先验信息,为了分析当真实声场分布与算法所采用的先验信息不一致时对声场记录性能的影响,图8呈现了各算法重构声压相对误差的变化情况.仿真中,设置总模式数M=256,对应的N=15.共设置九个测点,每个测点处阵列传声器数量为Q=100.使用三类真实声场来测试算法性能:第一类和第二类声场由100列相互独立的平面波叠加构成,第三类声场用于模拟鞋盒型影院空间中的室内声场,它们具体的空间分布特性如表1所示.本方法所需的ToptWA均在式(45)式(46)的先验设定下求得.

对比图8a和图8b可知,当真实声场的空间偏向性和先验假设存在一定偏差,但其总体分布范围仍处于预期声场的覆盖区域内时,基于最优基函数的方法能够获得优于各向同性球谐基函数方法的重构效果.在有效频率范围内,本方法始终具有最小的重构声压相对误差.然而,当真实声场和记录算法中假设的预期声场偏差过大时,尤其当真实声场分布明显超出了预期声场的覆盖范围(图8b),无论是单点测量还是多点测量,基于最优基函数的方法均可能表现出比球谐基函数方法更大的重构误差.图8c中的结果与图3b和图8a中的结果类似,说明本方法所采用的“前向占优”统计声场模型能在一定程度上较好地逼近实际室内复杂声场环境,在更接近真实条件的情况下也能取得更优的声场重构效果,进一步验证了面向定向偏置声场的记录算法在真实声场空间偏向性与先验预期存在适度偏差时仍能保持良好的重构性能,本方法具备一定的适用性和鲁棒性.

由于多点协同记录方法在估计模式分解系数时依赖于各测点的三维坐标Ri,而实际声场记录过程中测点位置不可避免地存在测量误差,图9分析了测点位置误差对多点协同记录方法声场记录性能的影响.仿真中对测量位置引入随机扰动,x,y,z三个坐标分量的误差相互独立且均服从零均值和相同标准差的高斯分布.在三组对比模拟中,标准差分别设置为5,20和50 mm.总模式数设为M=256,对应的N=15.每个测点处阵列传声器数量为Q=100,多点协同记录时选用的测点数为I=9.仿真结果表明,多点协同记录方法具备一定鲁棒性,当测点位置误差较小时,多点方法的效果均优于单点方法,其中本文提出的基于最优基函数的多点协同记录方法仍在绝大部分有效频率处具备最佳的声场重构表现.随着测点位置误差的增大,多点方法的效果整体呈现退化趋势,且基于最优基函数和基于球谐基函数的多点方法之间的差距也逐渐减小,说明最优基方案相较于球谐基方案对位置扰动更加敏感.当测点坐标在每个维度上的位置误差标准差增至约50 mm时,多点协同记录方法的优势基本消失,其声场记录的准确性接近甚至低于单点独立测量的结果.因此,实际应用中应尽量保证测点位置的测量准确性,可通过定制化标准模具布设传声器阵列,或引入更精确的坐标测量方法,充分发挥多点协同记录方案在声场记录与重构中的性能优势.

3 实验验证

3.1 实验设置

在标准视听室内开展实验来进一步验证方法的有效性.以目标听音位置为原点建立全局坐标系,目标听音区域定义为以原点为中心、半径约0.35 m的球形空间区域.选用八只GENELEC® 8010A监听扬声器作为测试声源,各扬声器相对原点的空间方位如表2所示.这些方位依据“前向占优”定向偏置声场的统计特性来选取,均位于目标听音区域的前半空间内,以保证合成声场在听音区域内呈现明显的前向传播偏置特性.声场测量采用em64 Eigenmike®球形传声器阵列,该阵列由64个全指向型驻极体式传声器构成,阵列半径为0.042 m.实验场景与音频信号链路分别如图10a和图10b所示.由于实验环境声学特性稳定,不具备突出的时变特性,测量采用多位置分时顺序采集方式完成.如图10c所示,共设置五个测量点:第一个测点位于坐标原点,其余四个测点和原点位于同一水平面内,以原点为中心构成正方形的四个顶点,各顶点到原点的距离约为0.354 m.

需要说明,使用的em64 Eigenmike®球形传声器阵列内置Dante音频接口,各传声器通道在出厂时已完成幅度校准与时间对齐,且通过专业的Ferrofish A32 Dante音频转换器作为主时钟,依赖Dante网络音频系统机制实现采集系统的高精度时间同步.事实上,当目标声场具有明显时变特性时,同时布设的多个传声器阵列之间也可由统一时钟源进行时间同步,例如利用支持Word Clock或网络音频同步协议的多通道采集系统实现统一触发.此类多通道、多阵列同步技术在空间音频测量系统中已较为成熟,可有效保证多通道信号采集过程中的时间一致性.

真实声场由八只扬声器共同激励形成,其直达声在听音区域内占主导地位.为了便于建模与分析,将该声场的主导传播分量近似表示为八列平面波的叠加,其中每列平面波的入射方向对应于各扬声器的空间方位,振幅对应于各扬声器在全局原点处辐射声压的实测幅值.该声场在统计意义上与仿真部分所设定的“前向占优”定向偏置声场特性一致.因此,计算最优模式分解编码矩阵Eopt时所需的声场先验信息,即平面波复振幅协方差𝒞θ1,φ1,θ2,φ2和权函数wθ,φ,也与仿真部分保持一致.在当前声学环境中实际测量得到的信噪比约为22.9 dB,考虑到编码所用信噪比应小于等于实际信噪比,而实际环境中还存在部分较为复杂、尚未被建模的其他干扰噪声,因此在计算编码矩阵时信噪比被设置为20 dB.计算频率的采样间隔为20 Hz.

3.2 实验结果与分析

图11展示了不同方法在实测条件下重构声压相对误差随频率变化的对比结果.考虑到实测中传声器数量与测点数量均少于仿真条件,设置总模式数M=100,169,256,对应的全局球谐截断阶次N=9,12,15.图12则直观呈现了N=15、频率为800 Hz时xy平面内真实声压与各方法重构结果的空间分布对比.由于受到实测条件下传声器数量较少、测点位置存在测量误差、真实声场与先验模型之间具有一定偏差以及其他未建模噪声等因素的共同影响,重构声压的相对误差水平整体高于同阶次的仿真结果.然而,其变化趋势及各方法间的相对性能对比与仿真结论仍保持一致.本文提出的基于最优模式分解的多点协同记录方法能在整个目标听音区域的有效频率范围内取得最低的重构误差.此外,从图11还可以看到,提高全局截断阶次N不会降低相同频率处的重构误差水平,但可在一定程度上扩展有效频率上限.实测结果进一步验证了本方法在目标声场测量与记录方面的优势.

图13展示了实测条件下测点数量对本方法性能的影响.与仿真结果一致,在有效频率范围内,重构声压相对误差随测点数量的增加而持续降低.对于测点数量相同但空间分布不同的情形,误差存在一定差异,但整体处于相近水平.随着频率升高,即使仍在有效频段内,不同测点数量对应的误差水平也趋于一致,这可能源于测点位置误差的影响.高频声波波长较短,对位置偏差引起的相位失配更加敏感,限制了声场记录准确性的进一步提升.

4 结论

提出一种基于最优模式分解的传声器阵列多点协同记录方法,实现各类定向偏置空间声场的高保真采集与记录.该方法在最优基函数对应的声场编码模型中引入多个空间位置的观测信息,利用三维球面波函数的平移叠加定理对声场分解中的传递函数矩阵进行扩展建模,显著提升了模式分解系数的反演精度.

事实上,由于大量具有方向偏向特性的模式基函数均可表示为球谐函数的线性组合,本文方法不仅适用于根据目标声场空间分布定制化构建的最优基函数,还可以拓展至混合阶Ambisonics,Slepian函数等其他具有方向偏向特性的基函数体系,从而形成一套具有良好通用性的面向定向偏置声场的传声器阵列多点协同记录框架.

数值仿真与基于em64 Eigenmike®球形传声器阵列的实测结果均表明,相较于单点测量方案或依赖各向同性球谐基函数的方法,本文方法在有效频率范围及整个目标听音区域内均可获得更低的重构声压相对误差,显著提升定向偏置声场的记录准确性.此外,由于该方法构建的模式基函数能够更高效地表征具有方向偏向特性的声场,因此,和其他方法相比,本文方法在实现相同空间表征分辨率的条件下可减少所需模式系数的数量,降低了计算与存储资源消耗;或者在保持模式数相同的情况下进一步提升声场记录质量,为后续的声场分析、控制与重放等空间音频应用提供更加可靠的数据支撑.

此外,系统分析了模式数设置、阵列配置形式、声场方向性先验估计失配、测点定位误差等各种因素对声场记录性能的影响,为实际系统设计提供了参考依据.所提方法在工程应用中具有较高的实用价值,特别对于时变性较弱的稳态或准稳态声场,可以在不增加硬件成本的前提下,通过单一传声器阵列在不同空间位置进行分时顺序测量,实现等效的多点协同记录效果.

由于本文方法隶属模式分解框架,以模式分解系数作为声场表征形式,因此最终记录得到的信息可以与采集端和渲染端解耦,支持兼容不同后处理算法以及多种终端设备,特别适用于虚拟现实与增强现实环境中的六自由度声场渲染、虚拟声学环境音效重建以及沉浸式音频节目录音与制作等应用场景,甚至可以形成满足长期存储与复用需求的“声学数据资产”.

参考文献

[1]

McCormack LPolitis AMcKenzie Tet al. Object⁃based six⁃degrees⁃of⁃freedom rendering of sound scenes captured with multiple ambisonic receivers. Journal of the Audio Engineering Society202270(5):355-372.

[2]

Tervo SPätynen JKuusinen Aet al. Spatial decomposition method for room impulse responses. Journal of the Audio Engineering Society201361(1/2):17-28.

[3]

Berzborn MNolan MFernandez Grande Eet al. Directional sound field decay analysis in a reverberation room. The Journal of the Acoustical Society of America2025158(6):4706-4720.

[4]

Ahrens JAndersson C. Perceptual evaluation of headphone auralization of rooms captured with spherical microphone arrays with respect to spaciousness and timbre. The Journal of the Acoustical Society of America2019145(4):2783-2794.

[5]

Fargeot SVidal AAramaki Met al. Perceptual evaluation of an ambisonic auralization system of measured 3D acoustics. Acta Acustica2023(7):56.

[6]

McCormack LPulkki VPolitis Aet al. Higher⁃order spatial impulse response rendering:Investigating the perceived effects of spherical order,dedicated diffuse rendering,and frequency resolution. Journal of the Audio Engineering Society202068(5):338-354.

[7]

Cobos MAhrens JKowalczyk Ket al. An overview of machine learning and other data⁃based methods for spatial audio capture,processing,and reproduction. EURASIP Journal on Audio,Speech,and Music Processing20222022(1):10.

[8]

Zhang WSamarasinghe P NChen H Cet al. Surround by sound:A review of spatial audio recording and reproduction. Applied Sciences20177(5):532.

[9]

Moreau SDaniel JBertet S. 3D sound field recording with higher order ambisonics⁃objective measurements and validation of a 4th order spherical microphone∥Audio Engineering Society 120th Convention. Paris,France:Audio Engineering Society,2006:6857.

[10]

Williams E G. Fourier acoustics:sound radiation and nearfield acoustical holography. London:Academic Press,1999.

[11]

Zotter FFrank M. Ambisonics:A practical 3D audio theory for recording,studio production,sound reinforcement,and virtual reality. Cham:Springer,2019.

[12]

Rafaely B. Fundamentals of spherical array processing. Cham:Springer,2018.

[13]

Rafaely BWeiss BBachmat E. Spatial aliasing in spherical microphone arrays. IEEE Transactions on Signal Processing200755(3):1003-1010.

[14]

Jin C TEpain NParthy A. Design,optimization and evaluation of a dual⁃radius spherical microphone array. IEEE/ACM Transactions on Audio,Speech,and Language Processing,201422(1):193-204.

[15]

Lin JWu X HQu T S. Anti spatial aliasing HOA encoding method based on aliasing projection matrix∥2020 IEEE 3rd International Conference on Information Communication and Signal Processing. Shanghai,China:IEEE,2020:321-325.

[16]

Politis ATervo SPulkki V. COMPASS:Coding and multidirectional parameterization of ambisonic sound scenes∥2018 IEEE International Conference on Acoustics,Speech and Signal Processing. Calgary,Canada:IEEE,2018:6802-6806.

[17]

Chang JMarschall M. Periphony⁃lattice mixed⁃order ambisonic scheme for spherical microphone arrays. IEEE/ACM Transactions on Audio,Speech,and Language Processing,201826(5):924-936.

[18]

Kaneko SDuraiswami R. Spheroidal ambisonics:Spatial audio in spheroidal bases. JASA Express Letters20211(8):084803.

[19]

Kumari DKumar L. Spherical sector harmonics representation of sound fields using a microphone array over spherical sector. The Journal of the Acoustical Society of America2021149(1):145-157.

[20]

Zotter FPomberger H. Spherical Slepian functions for approximation of spherical measurement data∥Fortschritte der Akustik⁃DAGA. Darmstadt:DEGA 20122012:709-710.

[21]

Gao HRen J LCheng J Zet al. Optimal modal decomposition for directionally biased sound field recording. IEEE/ACM Transactions on Audio,Speech,and Language Processing,2024,32:3424-3436.

[22]

Fernandez⁃Grande E. Sound field reconstruction using a spherical microphone array. The Journal of the Acoustical Society of America2016139(3):1168-1178.

[23]

Samarasinghe P NAbhayapala T DPoletti M A. 3D spatial soundfield recording over large regions∥International Workshop on Acoustic Signal Enhancement. Aachen,Germany:VDE,2012:1-4.

[24]

Samarasinghe PAbhayapala TPoletti M. Wavefield analysis over large areas using distributed higher order microphones. IEEE/ACM Transactions on Audio,Speech,and Language Processing,201422(3):647-658.

[25]

Fahim ASamarasinghe P NAbhayapala T D. Sound field separation in a mixed acoustic environment using a sparse array of higher order spherical microphones∥2017 Hands⁃free Speech Communications and Microphone Arrays.San Francisco,CA,USA:IEEE,2017:151-155.

[26]

Rafaely B. Plane⁃wave decomposition of the sound field on a sphere by spherical convolution. The Journal of the Acoustical Society of America2004116(4):2149-2157.

[27]

Rabenstein RSpors SAhrens J. Chapter 32⁃sound field synthesis∥Trussell J,Srivastava A,Roy⁃Chowdhury A K,et al. Academic Press Library in Signal Processing. Volume 4. Amsterdam:Elsevier,2014:915-979.

[28]

Nakanishi MUeno NKoyama Set al. Two⁃dimensional sound field recording with multiple circular microphone arrays considering multiple scattering∥2019 IEEE Workshop on Applications of Signal Processing to Audio and Acoustics.New Paltz,NY,USA:IEEE,2019:368-372.

[29]

Kaneko SDuraiswami R. Multiple scattering ambisonics:Three⁃dimensional sound field estimation using interacting spheres. JASA Express Letters20211(8):084801.

[30]

Samarasinghe P NAbhayapala T DPoletti M A. Synthesis of room transfer function over a region of space by multiple measurements using a higher⁃order directional microphone∥2014 IEEE China Summit International Conference on Signal and Information Processing. Xi'an,China:IEEE,2014: 6-10.

[31]

Blauert J. Spatial hearing:The psychophysics of human sound localization. Cambridge:The MIT Press,1996.

[32]

Beb Hagai IPollow MVorländer Met al. Acoustic centering of sources measured by surrounding spherical microphone arrays. The Journal of the Acoustical Society of America2011130(4):2003-2015.

[33]

McCormack LPolitis AGonzalez Ret al. Parametric ambisonic encoding of arbitrary microphone arrays. IEEE/ACM Transactions on Audio,Speech,and Language Processing,2022,30:2062-2075.

基金资助

国家自然科学基金(12374446)

AI Summary AI Mindmap
PDF (1931KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/