结合声源分离的两通路立体声音乐信号向上混合方法

刘博达 ,  刘紫赟 ,  王栋才 ,  沈勇

南京大学学报(自然科学) ›› 2026, Vol. 62 ›› Issue (04) : 657 -668.

PDF (1229KB)
南京大学学报(自然科学) ›› 2026, Vol. 62 ›› Issue (04) : 657 -668. DOI: 10.13232/j.cnki.jnju.2026.04.011

结合声源分离的两通路立体声音乐信号向上混合方法

作者信息 +

Stereo music upmixing assisted by source separation

Author information +
文章历史 +
PDF (1258K)

摘要

现有主流的向上混合方法通常在时频域内对音频内容进行处理.在复杂混音音乐内容中,多声源在时频域内的重叠会导致向上混合过程中相关性及声源位置参数估计出现偏差.为了解决这一问题,在现有的频域向上混合框架的基础上,提出一种结合声源分离的两通路立体声音乐信号向上混合方法,将混音音乐信号分离为多个音乐声源,对分离后的音乐声源分别进行向上混合处理,减少时频重叠对参数估计的干扰.听音实验结果表明,相比于多种代表性向上混合方法以及未引入声源分离模块的消融版本,提出的方法在综合听感上有更优的表现.

Abstract

Conventional stereo upmixing methods typically operate on audio content within the time⁃frequency domain. However,in complex musical mixtures,the overlapping of multiple sources in this domain often leads to biased estimation of correlation and source location parameters. To mitigate this issue,this paper proposes a two⁃path stereo music upmixing method incorporating source separation,built upon the existing frequency⁃domain upmixing framework. By decomposing the mixed music signal into multiple constituent sources and processing them individually,the proposed method effectively reduces interference caused by time⁃frequency overlap during parameter estimation. Subjective listening tests demonstrate that,compared with several representative upmixing methods and an ablation variant without the source separation module,the proposed approach achieves superior performance in terms of overall perceived audio quality.

Graphical abstract

关键词

向上混合 / 环绕声 / 声源分离 / 空间音频渲染

Key words

upmixing / surround sound / source separation / spatial audio rendering

引用本文

引用格式 ▾
刘博达,刘紫赟,王栋才,沈勇. 结合声源分离的两通路立体声音乐信号向上混合方法[J]. 南京大学学报(自然科学), 2026, 62(04): 657-668 DOI:10.13232/j.cnki.jnju.2026.04.011

登录浏览全文

4963

注册一个新账户 忘记密码

多通路环绕声系统在家庭影院、汽车音响等家用音频设备中已得到广泛应用,5.1,5.0,7.1,5.1.4等多种多通路环绕声配置成为常见选择.与传统的两通路立体声系统相比,多通路环绕声系统能够提供更强的空间包裹感、更准确的声像定位以及更大的最佳听音区1-2.当前影视制作已经广泛采用5.1等环绕声格式,但音乐、广播等音频内容仍以两通路立体声为主,许多经典的音频作品也以两通路立体声格式存档.在此背景下,通过算法手段将两通路立体声音频有效转换为多通路环绕声格式成为一个具有重要现实意义的研究问题.
两通路立体声信号向上混合方法旨在在不改变原始声像布局、不引入超出录音自身包含的空间线索的前提下,将两通路立体声信号自动转换为适配多通路环绕声系统的格式,以获得更自然的空间听觉体验3.已有众多研究提出了多种不同的技术路线,但在复杂音乐混音内容中,在不改变原始音乐内容与混音风格的前提下保持良好的声像稳定性与音色自然度仍有待进一步优化.
在音乐信号处理领域的多个相关任务中,已有研究尝试将声源分离作为预处理步骤引入模型,例如和弦识别4、节拍跟踪5、节奏检测6、主导乐器识别7和计算机辅助配器8等.其核心思想是将混合信号分离为若干相对独立的声源分量,以削弱不同声源在时频域上的相互干扰,突出与具体任务相关的关键信息特征.相关研究表明,在多声源高度耦合的音乐信号中引入声源分离模块有助于提升处理过程的稳定性及参数估计的可靠性.上述研究思路为本文在向上混合任务中引入声源分离作为前置处理步骤提供了合理的研究动机.
基于此,本文提出一种结合声源分离的两通路立体声音乐信号向上混合方法,其基本思想如图1b所示.与图1a表示的对混音内容直接进行时频处理的向上混合思路相比,本文方法通过引入声源分离模型,缓解了现有的频域向上混合方法在多声源时频重叠区域面临的相关性估计偏差问题.相比于现有的引入声源分离的向上混合方法,本文方法不引入额外的空间位置先验,能更好地保留原两通路立体声信号中包含的声像空间线索,可以有效地还原原始音乐内容与混音风格.
本文通过主观听音实验对所提方法与多种典型向上混合策略进行了系统对照评估,并在实验中引入去除声源分离模块的消融版本以重点评估声源分离模块对向上混合结果的影响.实验结果表明,与多种代表性的向上混合方法相比,本文方法在综合听感上有更优的表现.

1 研究背景

向上混合方法主要可分为时域方法、频域方法以及近年来兴起的基于深度学习的策略.不同的技术路线各具优势,但也均存在一定局限性.

早期的向上混合方法主要在时域框架下工作,通过对左右通路进行加减运算并结合延时等基础处理手段生成多通路信号.在Dolby Pro Logic II9,Logic710等商业系统中,此类方法得到了广泛应用.基于时域的向上混合方法的处理结构较为简单,对计算资源和设备算力的要求相对较低,但其在输入内容中存在多个声源在时间维度上发生重叠的情况下,往往难以准确估计声像方向,导致声像模糊或发生偏移11.

为了克服时域方法的固有不足,研究者提出多种基于频域的向上混合方法,目前,频域方法已成为最主流和应用最广泛的技术路线,通过将信号变换至时频域处理,在一定程度上缓解了时域重叠导致的分离困难.代表性方法包括基于互相关的频域掩蔽法12、归一化最小均方(Normalised Least Mean Squares,NLMS)方法13、主成分分析(Principal Component Analysis,PCA)方法14、最小均方估计(Least Squares,LS)方法15以及中侧通路分解(Mid⁃Side Decomposition)方法16等.He et al17系统比较了这些方法的实现效果,并指出LS方法在抑制直达声泄露方面具有最优表现,为本文方法的选择提供了重要参考.

频域方法在一定程度上缓解了时域重叠带来的问题,但其通常建立在时频稀疏性假设上,即假定每个时频单元内仅存在一个主导声源.而在真实的音乐混音场景中,多声源往往在时间与频率维度上高度重叠,使该假设难以满足,导致参数估计出现明显偏差18,这一偏差进一步引发了直达声泄露、空间伪影以及声像定位不稳定等问题19.依赖能量比的方向估计方法在能量关系被破坏时容易产生系统性偏移,最终表现为听感中的声像漂移.

近年来,深度学习技术在音频源分离领域取得了显著进展,由此衍生的向上混合策略也相继被提出.例如,Páez⁃Amaro20引入声源分离模块,将分离得到的人声信号渲染至中央通路,以改善人声的空间稳定性.Negru et al19探索了基于乐器类别的声源分离与空间映射策略,将不同声源分配至预定义的空间位置以实现多通路重混.Yang et al21提出一种基于神经网络学习相似音乐混音风格的自动重混方法.这些方法能够改善部分场景下的音频空间表现,但通常依赖额外的声源空间位置先验,不仅可能改变原两通路立体声信号中蕴含的空间线索和混音风格,也降低了方法的普适性22.当空间先验与真实混音信号的空间线索不匹配时,过强的先验假设会导致声像偏移,违背音乐作品原有的艺术意图.

综上,向上混合技术在现有时域方法、频域方法以及结合声源分离方法等技术路线中均存在各自限制.时域方法在多声源场景下相关性估计不稳健,频域方法依赖稀疏性假设而在复杂混音中失效,深度学习方法常因使用额外的声源位置先验而破坏原始空间布局.

本文在传统频域向上混合框架中引入声源分离模块作为预处理,该方法没有完全摆脱时频稀疏性假设,而是通过声源分离预先降低各声源在时频域内的重叠程度,使该假设在后续处理过程中更接近成立,提升后续空间参数估计的准确性,实现在保留原两通路立体声信号的声像位置和混音风格的前提下提升系统的稳定性与适用性.与已有结合声源分离的向上混合工作19-20相比,本文方法的优势主要体现在系统集成策略层面.已有工作通常在声源分离后引入预设的空间位置先验,将不同声源映射至固定的目标方位,用预设的空间先验替换原始混音中的空间信息.本文方法在声源分离后不引入任何额外的空间先验,仍依据各分离声源在原两通路立体声中的能量关系估计其声像方向,从而在改善频域参数估计条件的同时,最大程度保留原始两通路立体声所蕴含的声像布局与混音风格.

2 本文方法

在频域向上混合方法12-16中,声像位置与相关性参数通常依赖两通路立体声信号在时频域的能量分布及互相关特性进行估计,但当多个声源在时频单元上发生重叠时,这些估计往往会偏离实际,导致直达声泄露、声像漂移以及空间定位不稳定等问题,所以提高输入信号的时频独立性是增强频域向上混合方法稳健性的有效途径.基于此,本文提出一种基于声源分离辅助并结合频域线性估计的向上混合框架.首先利用深度学习声源分离模型从输入混音信号中提取相对独立的声源,以减弱多声源重叠导致的相关性估计偏差;随后,在各声源内部分别进行直达声与环境声的分离;最终通过幅度矢量合成定位法(Vector Based Amplitude Panning,VBAP)23将处理后的各声源映射至目标多通路布局,在无需额外空间先验的前提下获得更稳定的声像定位和更自然的空间还原效果.该方法的整体流程如图2所示.

2.1 声源分离

基于深度学习的声源分离方法可以在没有先验信息的条件下,提取混音内容中的不同声源,涉及的音频源类型会根据具体的混音内容而不同.在音乐中,声源构成在统计意义上具有一定的规律性,例如人声、吉他、键盘、贝斯和鼓等往往占据主导地位.近年来,针对音乐中这些典型声源的分离问题,基于深度学习的方法已取得较为成熟的研究成果,相关工作24-25提供了基于公开数据集训练并开源的高质量分离模型.图3是基于U⁃Net架构的时域音频分离网络示意图26,但仅说明声源分离模型实现思想,不对应本文具体使用模型.本文采用的声源分离模块作为一个独立的预处理单元直接引入整体框架,无需针对本文任务进行额外的训练或参数微调.

2.2 直达声与环境声分离

对于基于声源分离得到的各个声源信号需进一步进行直达声与环境声的分离.分离在时频域内进行,多采用短时傅里叶变换来实现时频变换.但由于短时傅里叶变换在所有频段具有均匀的频率分辨率,不符合人耳非均匀的频率分辨特性27,在听音测试28中发现,同时存在多种声音事件时,基于短时傅里叶变换的时频处理会在快速瞬态信号的方向重建中引入误差.

为了在合理的运算复杂度内获得更符合人耳空间听觉特性的频率分辨率,本文采用一种复数过采样伪正交镜像滤波器组(Quadrature Mirror Filters,QMF)29进行时频变换,以在低频段提供更高的频率分辨率.

在实现信号时频变换的基础上,采用文献[10]中的信号模型,将左通路信号XLb,k与右通路信号XRb,k表示为直达声Pb,k与环境声Nb,k的叠加,其中,b代表时域系数,k代表频域系数.为了简化表述,后文中省略bk.参数ALb,kARb,k均为正实数,用于表征左右通路中直达声的幅度值.

XLb,k=ALb,kPb,k+NLb,k
XRb,k=ARb,kPb,k+NRb,k

为了实现对输入信号中直达声与环境声成分的独立估计,需要对两类信号的统计关系引入若干合理假设.后续分析基于以下假设条件10:两通路信号中的环境声成分之间相互不相关;直达声与环境声之间相互不相关;单一时频单元中仅存在单一声像;左右通路中的环境声能量近似一致,表示为N2.尽管在真实混音场景中上述假设难以严格满足,但本文方法通过声源分离来预先降低多声源在时频域的重叠程度,使假设的成立条件在统计意义上得到改善,提升后续参数估计的准确性与方法在工程实现中的稳定性.

在该信号模型下,两通路的自相关系数和互相关系数可表示为:

rLL=AL2P2+N2
rRR=AR2P2+N2
rLR=ALARP2

其中,·代表变量的模.由式(2a)(2b)(2c)进一步推导可得:

ALP=rLL-rRR+rLL-rRR2+4rLR22
ARP=2rLL-rRR+rLL-rRR2+4rLR2·rLR

此处解出的ALP,ARP均为实数,代表左右通路中直达声的幅度.为了估计得到带有相位信息的复数直达声信号,需采用线性估计.将估计得到的左通路直达声ALP和右通路直达声ARP分别表示为:

ALP^=w1XL+w2XR
ARP^=w1XL+w2XRARAL

预测误差e可以表示为:

e=ALP^-ALP=w1XL+w2XR-ALP

根据正交性原理30,当误差e的平方最小时,应满足:

Ee·XL=0
Ee·XR=0

其中,E·表示期望算符.由式6a6b可得:

w1rLL+w2rLR-AL2P2=0
w1rLR+w2rRR-rLR=0

进一步解得:

w1=AL2P2rRR-rLRrLRrLLrRR-rLR2
w2=rLLrLR-AL2P2rLRrLLrRR-rLR2

将式4a4b代入,可以用估计的相关系数rLL,rRR,rLR计算估计参数w1w2.通过取短时平均的方法得到估计的相关系数,再得到ALP^.用同样的方法,可以解得ARP^.得到直达声的数值后,环境声NL^,NR^可由式9a9b计算得到:

NL^=XL-ALP^
NR^=XR-ARP^

由此,本节构建了一种基于线性估计的直达声与环境声分离方法.

2.3 音频渲染与重混

在完成声源分离及直达声与环境声分离后,需依据不同信号分量的统计特性,采用相应的混合与渲染策略,将各分量重混至目标多通路系统中.

对于环境声信号渲染,需首先经过声信号去相关处理,以避免环境声信号直接馈入多通路系统而产生可感知的虚拟声像定位现象11.相关研究31-33已提出了多种在尽可能保持原始音色特性的前提下对音频信号进行去相关的有效方法.具体地,本文采用基于格型全通滤波器的去相关方法33,对各频带的环境声信号施加不同阶数的相位扰动以降低左右通路间的相关性,并在每个时频单元上进行能量补偿,以避免去相关过程引入可感知的音色染色.本文中,频率轴依据600,2400,4000和12000 Hz 四个分界频率被划分为多个频段,各频段分别采用20,15,6,3阶的格型全通滤波器,能量补偿平滑系数取0.75.随后,将从输入音频中分离得到的环境声分量与经去相关处理后的环境声信号共同渲染至多通路渲染模块,实现环境声的空间化渲染与重混.

对于直达声信号的渲染,为了尽可能还原原始两通路立体声内容中包含的声像位置信息,需要根据提取得到的直达声在左右通路中的能量关系,利用VBAP23相关公式反解出其入射方向,如式(10)所示:

p=sinθ^cosθ^=-sinθ0Ψ^1-sinθ0Ψ^2

其中,Ψ^=-AL^-AR^AL^+AR^p是声源的方向矢量;θ^是估计的声源位置相对于中置扬声器的夹角;θ0是左前、右前扬声器相对于中置扬声器的夹角,通常在30°~45°.在获得方向估计后,进一步采用VBAP方法将虚拟声源重定向到目标扬声器布局中,以实现对直达声的渲染.具体地,根据VBAP原理,目标虚拟声源的方向矢量可由所选活动扬声器对应的方向矢量线性表示,其中,各方向矢量前的权重系数即为对应扬声器的增益系数,即:

p=g1l1+g2l2

其中,l1l2分别代表目标扬声器的方向矢量.将式11写成矩阵形式可得:

p=Lg

其中,L=l1l2g=g1g2.

由式12可解得g=L-1p,并结合式13所示的能量归一化约束对其进行归一化处理,得到对应活动扬声器对的增益系数g1g2.

g12b,k+g22b,k=1

得到扬声器对的增益系数后,即可将对应时频单元中的直达声信号映射至具体扬声器通路,完成多通路重放的定向渲染.对于典型的5.0通路布局的重放系统,图4展示了一种直达声与环境声的渲染方法.直达声信号通过三个前置扬声器播放,各个通路的权重系数g通过直达声位置矢量p和扬声器位置根据VBAP确定得到.左右通路的环境信号被馈给到两个前置侧向扬声器L,R中.NL^'NR^'为分别对NL^NR^去相关得到的环境信号,被馈给到两个后置扬声器RL,RR中,以重建空间包围感.

在完成各声源的直达声与环境声渲染后,每个分离声源均可独立得到一组对应目标多通路布局的时频域输出信号.将所有声源在各目标通路上的时频域输出信号逐通路相加,再经时频反变换得到最终的时域多通路环绕声输出信号,实现对原始两通路立体声音乐信号的向上混合.

3 实验与结果

为了验证提出的结合声源分离的两通路立体声音乐信号向上混合方法的有效性,设置听音实验.将本文方法与多种具有代表性的向上混合方法进行对比,以评估方法在综合主观听感上的表现,其中,重点评估本文方法引入的声源分离模块能否提升传统频域向上混合方法在复杂混音音乐内容下的听感质量.

3.1 实验设置

选取四种代表性向上混合方法与本文方法进行对比实验.其中,Faller15采用与本文方法相似的信号模型和线性估计策略,可视为现有频域向上混合方法的代表性方法.Negru et al19同样采用声源分离方法应用于向上混合流程,并提供了公开的两通路立体声向上混合至多通路环绕声的音频样本.依据文献[34]的描述,本文将一种基于时域处理的被动矩阵解码策略纳入比较,作为实验的参考锚点.为了进一步评估声源分离模块在整体框架中的作用,还设置了一个移除分离模块的消融版本加入对比.

本文方法中的声源分离部分采用由频域与时域双分支组成的混合结构模型HTDemucs25,模型版本为Demucs (v4),采用官方提供的预训练权重进行推理,将输入音频分离为人声、鼓声、贝斯、吉他、钢琴与其他,共六路声源.

为了保证不同方法之间比较的公平性,实现的各方法均采用统一的帧长2048与帧移512.其中,帧长2048在频率分辨率和时间分辨率之间提供了较好的折中.75%的帧重叠(帧移512)计算开销相对较高,但较高的重叠率可为参数的时间变化带来更好的平滑性和稳定性.考虑到实验在离线条件下进行,不存在实时性约束,因此采用了相对较高的重叠率.对于Negru方法,直接采用其公开音频样本进行对比,没有重新实现其算法流程,其内部参数设置不在本文统一控制的范围内.

3.1.1 实验样本

选取四首音乐作为测试样本,其中,《Pisces》《Anomalie Bleue》与《The Cult of Dionysus》三首曲目来源于Negru et al19提供的数据库,该数据库同时包含原始两通路立体声版本和由Negru方法向上混合生成的5.1通路版本,适合与本文提出的方法进行直接对比分析.考虑到本文的目标输出与听音评价均基于5.0通路系统,所以比较时仅使用其中的五个主通路,不开启LFE通路.由于低音通路主要用于低频能量补充,不承载空间声像信息的表达功能,在本文以五个主通路的综合听感为重点的评价框架下,不纳入LFE预计不会对比较结论产生实质性影响.此外,还选取《Hotel California》作为补充样本,该曲目不包含Negru方法的向上混合结果,仅用于与其余几种向上混合方法的比较.

3.1.2 实验流程

由于采用的音频样本没有真实的理想多通路参考版本,所以没有用MUSHRA实验标准来设计实验流程,而是基于Rumsey3的两通路至五通路向上混合听音评价方法进行设计.实验中没有设置明确的理想信号样本,因为研究的目的在于比较各向上混合方法之间的相对听觉质量差异,而非测定相对于理想信号的绝对失真程度.

实验在一间背景噪声极低的标准听音室内进行.实验环境如图5所示,配置了由28台Genelec 8010A监听扬声器构成的多通路播放系统,并根据五通路扬声器布局标准ITU⁃R BS.775⁃335启用相应位置的五台扬声器作为播放系统,听评者坐于系统几何中心位置.所有监听扬声器的音量进行统一调节,并调整至评估者耳朵的高度.响度测量遵循ITU⁃R BS.1770⁃436推荐标准,所有测试片段在听音测试前均被归一化至-23 LUFS,使用REAPER37作为音频播放平台.

共招募八名受试听音员,其中男性五人,女性三人,年龄22~27岁,均为南京大学声学专业研究生,并接受过系统的听音训练.实验开始前,所有听音员都经过培训,熟悉Rumsey方法中3的声场整体空间感知和声像定位感知评价原则.听音员使用10的倍数(如40,50,60等)进行打分以保证听音实验评分结果的一致性.

在每个测试单元中,听音员首先聆听原始的两通路立体声参考音乐片段,以熟悉其音色特征及声源的空间分布,随后,听音员在多个经不同向上混合方法处理得到的多通路音频样本之间进行听音评价.测试系统允许听评者在不同音频样本之间自由切换,以进行直接对比.在整个过程中,听音员需以两通路立体声参考信号为基准,对各向上混合方法生成的多通路音频在音色自然度、声像一致性和空间印象等方面的综合听感进行评价,并给出总体评分.

3.2 实验结果与数据分析

筛选得到有效评分数据后,对各向上混合方法的听音实验评分结果进行统计分析.图6为各测试样本在不同方法下的实验结果得分箱线图,以直观比较不同方法的评分分布、均值及离散程度.总体上,被动解码方法在所有测试样本中得分较低,验证了实验设计和评分结果的有效性.注意,Negru的方法在多个样本上的得分普遍偏低,其综合听感未能达到预期效果.这可能与其在声源重混阶段直接预设声源空间位置有关,与原始的混音风格和音乐内容不完全一致.

为了检验各向上混合方法之间的显著性差异,采用Friedman检验38对评分数据进行非参数统计分析.由于听音实验的数据往往不满足方差齐性与正态性假设,Friedman检验39被认为比ANOVA更加稳健.由于Negru方法没有提供《Hotel California》片段的对应样本,该片段的Friedman检验仅仅基于其余四种方法的评分数据进行,其余三个测试片段则纳入全部五种方法.

表1列出了各测试片段经Friedman检验所得的p值.分析结果表明,全部测试片段的p值均小于0.001,表明各对比方法之间的实验评分存在统计学意义上的显著差异.

为了进一步比较各方法之间的显著性差异,采用Wilcoxon符号秩检验40对所提方法与其他方法之间的差异显著性进行了评估.该检验是一种非参数统计方法,在数据不满足正态分布假设的情况下,被推荐作为t检验的稳健替代方法39.由于涉及多组两两比较,为了控制族错误率,对每个测试片段内部,本文方法与各对照方法之间的多组两两比较,分别采用Holm41方法进行p值校正.

表2给出了经Holm校正后各方法与本文方法之间符号秩检验的p值结果.和Faller方法、被动矩阵解码方法和Negru方法相比,本文方法所有实验样本的p值均小于0.05,表明本文方法在整体上具有统计意义上的显著效果提升.与无分离模块方法的比较结果显示,在四个测试样本中,有两个样本的差异达到统计显著水平.

*,p<0.05

进一步采用Cliff's delta dc42对实验数据进行效应量分析,以在统计显著性之外进一步刻画不同方法间差异的实际效应大小.该指标可在不依赖正态性假设的情况下反映评分分布的差异程度,其中,dc0.474通常被视为“大效应量”,表明两方法之间存在显著且强烈的实际差异.

表3给出了各方法与本文方法的Cliff's delta dc比较结果,表中dc<0.147时表示可忽略,0.147dc<0.33时表示小,0.33dc<0.474表示中等,dc0.474时表示较大.可见,除了在《Anomalie Bleue》片段中与无分离模块方法进行比较以外,其余片段的dc均超过0.474,达到“大效应量”水平,表明本文方法在听音实验评分上和其他方法相比,不仅具有统计显著性差异,也表现出较强的实际效应.

综合主观听音结果及统计分析结果,本文方法在多数测试片段上与各对照方法相比,均表现出更优的整体听感,并在多个比较条件下达到统计显著水平.Friedman检验结果表明,在得分较高的几种方法之间,实验评分存在显著差异;Wilcoxon符号秩检验和Cliff's delta效应量分析进一步说明,本文方法和多数对照方法相比,不仅在多个测试片段上达到统计显著,还表现出较强的实际效应.需要指出的是,在《Hotel California》片段中,本文方法与无分离模块方法进行比较时,虽然Wilcoxon检验结果没有达到显著性水平(p=0.0547),但其Cliff's delta为0.703,达到“大效应量”水平.由于Wilcoxon符号秩检验反映的是在当前样本量下是否有足够证据拒绝零假设,受样本规模影响较大,而效应量反映的是两组评分分布的实际差异幅度,相对独立于样本量,因此,未达统计显著但呈现较大效应量的结果不矛盾,提示两者之间存在明显的实际差异趋势,但在当前实验规模下尚不足以在0.05显著性水平上完全确认.综合p值与效应量两方面证据来看,引入声源分离模块对该片段的听感显示出改善趋势.

4 结论

本文针对现有主流向上混合方法在复杂混音内容下面临的参数估计偏差问题,在传统频域向上混合框架中引入深度学习声源分离作为预处理步骤,构建了一种结合声源分离的两通路立体声音乐信号向上混合方法.通过引入深度学习声源分离模型,在一定程度上缓解了多声源在频域重叠所导致的能量估计偏差问题,改善了相关空间参数的估计条件,有助于提升向上混合结果的整体主观听感.

本文的贡献主要在系统集成策略层面,将声源分离用于改善现有频域向上混合方法参数估计的条件,而不是用来重新分配各声源的空间位置,从而在提升稳健性的同时,保留了原始两通路立体声所蕴含的声像布局信息.

和多种代表性的向上混合方法以及不使用声源分离的消融版本进行了对比实验,本文方法在综合听感上获得了更高评分.统计分析进一步验证了该性能提升具有统计意义上的显著性,并在多数测试片段中呈现出“大效应量”水平,该结果证明,在现有频域向上混合框架中引入声源分离模块在当前实验条件下对主观听感提升是有效的.

在当前实验设置下的音乐场景中已经验证了本文方法的有效性,但听音实验在测试样本数量、听音员数量方面有限,且听音员背景比较集中,因此,当前结果更适合作为本文方法有效性的初步验证,相关结论在更大样本规模与更丰富音乐类型条件下的普适性有待进一步验证.此外,实验中采用的声源分离模型主要面向主流音乐类型信号,模型对于电影音频等更复杂内容的泛化能力仍有提升空间.

未来将探索面向不同音频类型与声场条件的向上混合策略,以提升方法在更广泛应用场景中的泛用性与稳健性.

参考文献

[1]

Rumsey F. Spatial audio. The 1st Edition.Oxford:Focal Press,2001:82-96.

[2]

包振锴. 立体声上变换5.1环绕声的原理. 电声技术201539(3):64-68.

[3]

Rumsey F. Controlled subjective assessments of two⁃to⁃five⁃channel surround sound processing algorithms. Journal of the Audio Engineering Society199947(7/8):563-582.

[4]

Reed J TUeda YSiniscalchi Set al. Minimum classification error training to improve isolated chord recognition∥Proceedings of the 10th International Society for Music Information Retrieval Conference. Kobe:ISMIR,2009:609-614.

[5]

Zapata J RGómez E. Improving beat tracking in the presence of highly predominant vocals using source separation techniques:Preliminary study∥The 9th International Symposium on Computer Music Modeling and Retrieval. London,UK:Springer,2012: 583-590.

[6]

Chordia PRae A. Using source separation to improve tempo detection∥Proceedings of the 10th International Society for Music Information Retrieval Conference. Kobe,Japan:International Society for Music Information Retrieval,2009:183-188.

[7]

Gómez J SAbeßer JCano Eet al. Jazz solo instrument classification with convolutional neural networks,source separation,and transfer learning∥Proceedings of the 19th International Society for Music Information Retrieval Conference. Paris,France:International Society for Music Information Retrieval,2018:577-584.

[8]

Dzvonczky LChédin LSaldarriaga⁃Fuertes Aet al. Source separation methods for computer⁃assisted orchestration∥The 3rd Conference on AI Music Creativity. Online:AIMC,2022:1-10.

[9]

Dressler R. Dolby surround pro logic II decoder principles of operation. San Francisco:Dolby Laboratories,Inc.,2000.

[10]

Griesinger D H. 5⁃2⁃5 matrix encoder and decoder system. United States Patent,7386132.2008⁃06⁃10.

[11]

Kraft S. Stereo signal decomposition and upmixing to surround and 3D audio. Ph.D. Dissertation. Hamburg:Helmut⁃Schmidt⁃Universität,2022.

[12]

Merimaa JGoodwin M MJot J M. Correlation⁃based ambience extraction from stereo recordings∥Proceedings of the 123rd Audio Engineering Society Convention. New York,NY,USA:Audio Engineering Society,2007:7282.

[13]

Irwan RAarts R M. Two⁃to⁃five channel sound processing. Journal of the Audio Engineering Society200250(11):914-926.

[14]

Goodwin M MJot J M. Primary⁃ambient signal decomposition and vector⁃based localization for spatial audio coding and enhancement∥2007 IEEE International Conference on Acoustics,Speech and Signal Processing. Honolulu,HI,USA:IEEE,2007:I⁃9-I⁃12.

[15]

Faller C. Multiple⁃loudspeaker playback of stereo signals. Journal of the Audio Engineering Society200654(11):1051-1064.

[16]

Kraft SZölzer U. Stereo signal separation and upmixing by mid⁃side decomposition in the frequency⁃domain∥Proceedings of the 18th International Conference on Digital Audio Effects. Trondheim,Norway:Norwegian University of Science and Technology,2015:DAFX⁃1-DAFX⁃6.

[17]

He J JTan E LGan W S. Linear estimation based primary⁃ambient extraction for stereo audio signals. IEEE/ACM Transactions on Audio,Speech,and Language Processing201422(2):505-517.

[18]

Steinmetz C JUhle CEverardo Fet al. Audio signal processing in the artificial intelligence era:Challenges and directions. Journal of the Audio Engineering Society202573(7/8):406-428.

[19]

Negru MMoroşanu BNeacşu Aet al. Automatic audio upmixing based on source separation and ambient extraction algorithms∥2023 International Conference on Speech Technology and Human⁃Computer Dialogue. Bucharest,Romania:IEEE,2023:12-17.

[20]

Páez⁃Amaro R TTejeda⁃Ocampo CSouza⁃Blanes Eet al. Deep learning based voice extraction and primary⁃ambience decomposition for stereo to surround upmixing∥Proceedings of the 154th Audio Engineering Society Convention. Helsinki,Finland:Audio Engineering Society,2023:Express Paper 62.

[21]

Yang H CWager SRussell Set al. Upmixing via style transfer:A variational autoencoder for disen⁃tangling spatial images and musical content∥ICASSP 2022-2022 IEEE International Conference on Acoustics,Speech and Signal Processing. Singapore:IEEE,2022:426-430.

[22]

易凯灵,黄坤朋. 立体声向上混合研究综述. 电声技术202347(9):15-19.

[23]

Pulkki V. Virtual sound source positioning using vector base amplitude panning. Journal of the Audio Engineering Society199745(6):456-466.

[24]

Stöter F RUhlich SLiutkus Aet al. Open⁃unmix:A reference implementation for music source separation. Journal of Open Source Software20194(41):1667.

[25]

Rouard SMassa FDéfossez A. Hybrid trans⁃formers for music source separation∥2023 IEEE International Conference on Acoustics,Speech and Signal Processing. Rhodes Island,Greece:IEEE,2023:1-5.

[26]

Ronneberger OFischer PBrox T. U⁃Net:Convo⁃lutional networks for biomedical image segmen⁃tation∥Medical Image Computing and Computer⁃Assisted Intervention. Cham,Switzerland:Springer,2015:234-241.

[27]

Breebaart J.van de Par S,kohlrausch A. Binaural processing model based on contralateral inhibition. I. Model structure. The Journal of the Acoustical Society of America2001110(2):1074-1088.

[28]

Pulkki VFaller C. Directional audio coding:Filterbank and STFT⁃based design∥The 120th Convention of Audio Engineering Society. Paris,France:Audio Engineering Society,2006:6658.

[29]

Breebaart JPurnhagen HBreebaart Jet al. The reference model architecture for MPEG spatial audio coding∥Proceedings of the 118th AES Convention.Barcelona,Spain:Audio Engineering Society,2005:1-13.

[30]

Haykin S. Adaptive filter theory. The 5th Edition. Boston:Pearson,2014:110-114.

[31]

Kendall G S. The decorrelation of audio signals and its impact on spatial imagery. Computer Music Journal199519(4):71-87.

[32]

Alary BPolitis AVälimäki V. Velvet⁃noise decorrelator∥Proceedings of the 20th International Conference on Digital Audio Effects. Edinburgh,UK:Audio Engineering Society,2017:DAFX⁃405-DAFX⁃411.

[33]

Kermit⁃Canfield EAbel J. Signal decorrelation using perceptually informed allpass filters∥Proceedings of the 19th International Conference on Digital Audio Effects. Brno,Czech Republic:International Conference on Digital Audio Effects,2016:DAFX⁃225-DAFX⁃231.

[34]

谢菠荪. 空间声原理. 北京:科学出版社,2019:314-319.

[35]

International Telecommunication Union. Multi⁃channel stereophonic sound system with and without accompanying picture. ITU⁃R BS. 775. Geneva:International Telecommunication Union,2012.

[36]

International Telecommunication Union. Algorithms to measure audio programme loudness and true⁃peak audio level. ITU⁃R BS. 1770⁃4⁃2015.Geneva:International Telecommunication Union,2015.

[37]

Incorporated Cockos. REAPER (v7.55):Rapid environment for audio production,engineering,and recording. https://www.reaper.fm,2025-11-28.

[38]

Friedman M. A comparison of alternative tests of significance for the problem of m rankings. The Annals of Mathematical Statistics194011(1):86-92.

[39]

Mendonça CDelikaris⁃Manias S. Statistical tests with MUSHRA data∥The 144th Audio Engineering Society International Convention. Milan,Italy:Audio Engineering Society,2018:859-868.

[40]

Wilcoxon F. Individual comparisons by ranking methods. Biometrics Bulletin19451(6):80-83.

[41]

Holm S. A simple sequentially rejective multiple test procedure. Scandinavian Journal of Statistics19796(2):65-70.

[42]

Cliff N. Dominance statistics:Ordinal analyses to answer ordinal questions. Psychological Bulletin1993114(3):494-509.

基金资助

国家自然科学基金(12374446)

AI Summary AI Mindmap
PDF (1229KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/