基于自监督预训练模型和NWCE的口吃语音分类

殷志鹏 ,  徐新洲

中北大学学报(自然科学版) ›› 2025, Vol. 46 ›› Issue (01) : 19 -26.

PDF (1218KB)
中北大学学报(自然科学版) ›› 2025, Vol. 46 ›› Issue (01) : 19 -26. DOI: 10.62756/jnuc.issn.1673-3193.2023.09.0002
语音语义与文本处理专栏

基于自监督预训练模型和NWCE的口吃语音分类

作者信息 +

Stuttering Speech Classification Based on Self‑Supervised Pre‑Trained Model and NWCE

Author information +
文章历史 +
PDF (1246K)

摘要

口吃语音分类旨在利用语音信号对不同口吃类别进行分类识别,而现有相关研究没有充分考虑自监督预训练模型表示嵌入的时序特性,且只简单地表征了口吃语音数据的类别不平衡性。为此,本文提出一种基于自监督预训练模型和非线性加权交叉熵(NWCE)损失的口吃语音分类方法。该方法首先利用自监督预训练模型提取副语言表示嵌入,然后通过带自注意力机制的双向长短期记忆网络模型,捕捉嵌入中显著的时序特征和上下文信息,最后利用非线性加权交叉熵损失来关注样本较少的口吃语音类别。在口吃语音分类数据集上的实验结果表明,本文方法通过学习语音中自监督预训练模型多层表示嵌入的时序信息,并且通过NWCE充分描述了各口吃类别数据间的关系,取得了比现有方法更好的口吃语音分类性能。

Abstract

Stuttering speech classification aims to classify and recognize different categories of stuttering using spoken signals. Nevertheless, the existing related works fail to sufficiently focus on sequential characteristics for the representation embedding of self-supervised pre-trained models, and these works also simplistically address the class-imbalance issue for stuttering-speech data. In this regard, we proposed a stuttering speech classification approach based on self-supervised pre-trained models and nonlinear weighted cross-entropy (NWCE) loss. Within the proposed approach, we first employed a self-supervised pre-trained model to extract paralinguistic representation embeddings from stuttering speech. Then, we utilized a bidirectional long short-term memory network model with a self-attention mechanism to capture essential temporal features and contextual information within the embeddings. Afterwards, a nonlinear weighted cross-entropy loss was performed to focus on stuttering speech categories with fewer samples. The experimental results on stuttering speech classification dataset indicate that, the proposed approach achieves better performance for classifying stuttering speech compared with state-of-the-art approaches, through learning the sequential information from self-supervised pre-trained models’ multi-layer representation embedding in speech, and sufficiently describes the relationship between the data of different stuttering categories by using NWCE.

Graphical abstract

关键词

计算副语言 / 口吃语音分类 / 自监督预训练模型 / 非线性加权交叉熵损失

Key words

computational paralinguistics / stuttering speech classification / self-supervised pre-trained model / nonlinear weighted cross-entropy loss

引用本文

引用格式 ▾
殷志鹏,徐新洲. 基于自监督预训练模型和NWCE的口吃语音分类[J]. 中北大学学报(自然科学版), 2025, 46(01): 19-26 DOI:10.62756/jnuc.issn.1673-3193.2023.09.0002

登录浏览全文

4963

注册一个新账户 忘记密码

0 引 言

计算副语言学1是计算机科学和语言学的交叉领域,旨在研究语音信号中的非言语特性及其与言语信息的关系,目前已广泛应用于语音情绪识别2、阿尔茨海默症检测3以及言语障碍诊断4等领域。作为一种常见的言语障碍,口吃主要涉及说话时的流畅性问题5,例如重复单词或音节、延长声音等。此外,口吃语段也包含一些副语言特征,例如无意义的填充词等。

早期相关研究主要基于声学特征的提取和分析,并采用了深度学习基础模型。Sheikh等6利用梅尔频率倒谱系数(Mel-scale Frequency Cepstral Coefficients,MFCC)和时延神经网络(Time Delay Neural Network,TDNN)描述口吃语音的时序信息。Kourkunakis等7则使用频谱图作为输入,结合深度残差网络(Residual Networks,ResNets)和双向长短期记忆网络(Bidirectional Long Short Term Memory Networks,Bi-LSTM),对口吃语音进行了多分类。然而,由于口吃病例数量有限、个人隐私的保护以及获取标准化数据的难度较大等因素,口吃数据样本稀少8,导致无法很好地捕捉口吃语音中的副语言信息9。于是,Grósz等10将自监督预训练模型应用于口吃语音分类,得到了更通用的副语言表示嵌入。

目前的口吃语音分类研究仍存在一些不足。首先,现有的相关研究仅关注自监督预训练模型所提取特征嵌入的统计特性,而忽略其时序特征和上下文信息。其次,口吃数据集通常存在类别不平衡的情况,这会导致模型的性能欠佳,而Sheikh等11提出的加权交叉熵损失(Weighted Cross-Entropy Loss,WCE Loss)缺乏对口吃语音类别间关系的充分描述。

本文将自监督预训练模型和非线性加权交叉熵损失(Nonlinear WCE Loss,NWCE Loss)相结合用于口吃语音分类。该方法利用自监督预训练模型提取副语言表示嵌入,通过带自注意力机制的双向长短期记忆(Bi-LSTM with Self-Attention,BLSA)网络模型学习该嵌入中有效的时序和上下文信息,并应用非线性加权交叉熵损失关注样本较少的口吃类别,对类平衡权重进行非线性的尺度变换,以解决数据的类别不平衡问题。

1 相关工作

1.1 口吃语音分类

口吃语音蕴含丰富的副语言信息,大多数相关研究使用MFCC、频谱图或其变体作为特征提取方法6,其中Jouaiti等12结合了MFCC特征和音素概率,使用Bi-LSTM网络实现了口吃检测。Kourkunakis等7使用频谱图作为输入特征,结合ResNets和Bi-LSTM进行特征提取和时序处理;FluentNet模型13则采用相同的输入特征,但使用了SE(Squeeze-and-Excitation)ResNets来学习更有效的特征表示,并在Bi-LSTM处理之后添加了全局注意力机制。

1.2 自监督预训练模型

自监督预训练模型通过自监督学习方法,在大量未标记的数据集上进行训练14,从而无需完全依赖人工标注的数据集,有效解决了数据稀少的问题。在语音信号处理领域中,wav2vec 2.0是目前应用最广泛的自监督预训练模型之一,通过对大量未标注的语音数据进行预训练,广泛应用于下游语音处理任务,如情绪识别15 、说话人识别16、认知障碍检测17等。

自监督预训练模型在口吃语音分类中有两种应用方法。1)在目标任务的数据集上对自监督预训练模型进行微调1819。Grósz等10针对口吃任务对自监督预训练模型进行微调,但微调大型模型需要更多的存储及更长的训练时间20。2)将自监督预训练模型作为静态特征提取器,对提取的嵌入,在时间维度上使用各种统计21进行池化,送入下游分类器。例如Bayerl等22将提取的嵌入在时间维度进行平均池化和降维处理;Sheikh等11计算了嵌入的平均值和标准差,并对不同层的嵌入进行求和,更好地利用了自监督预训练模型的多层特征表示能力;Montacié等23进一步探究了对口吃语音最具区分性的特征处理策略,对嵌入信息在时间维度上使用了多个统计泛函,得到新特征集并进行了组合筛选。

2 本文方法

本文方法的结构如图 1 所示,包含自监督预训练模型的嵌入提取、带自注意力机制的双向长短期记忆网络,以及非线性加权交叉熵损失等三部分。

首先,使用自监督预训练模型对口吃语音进行嵌入提取;接着,使用带自注意力机制的双向长短期记忆网络模型,通过对自监督预训练模型嵌入进行上下文信息建模,实现对口吃语音的分类;最后,结合非线性加权交叉熵损失,进一步关注较少样本类别的损失。

2.1 带自注意力机制的双向长短期记忆网络模型

本文使用自监督预训练模型对任一样本进行嵌入提取,得到了更加通用的副语言表示嵌入x(i)RT×nd,其中,x(i)为自监督预训练模型第i层嵌入,T为所提取嵌入的时间步长,nd为自监督预训练模型的嵌入维度。本文选择第ii取值为4,8,12,16,20,24)层嵌入,分别送入带自注意力机制的双向长短期记忆网络模型。

本文采用一个使用缩放点积注意力的自注意力层,作为带自注意力机制的双向长短期记忆网络模型的第一层,以减少冗余和无关的输入信息。将任一样本的第i层嵌入x(i)馈送到自注意力层,从而得到对应输出

O(i)=softmax(QKTm)VRT×m

式中:softmax()表示Softmax函数。自注意力层将x(i)线性映射为查询(Query)向量Q、键(Key)向量K、值(Value)向量V

Q=x(i)W(Q)RT×mK=x(i)W(K)RT×mV=x(i)W(V)RT×m

式中:W(Q),W(K),W(V)Rnd×m分别为映射参数矩阵;m为映射维度。

将任一样本的第i层嵌入对应的自注意力层输出O(i)馈送到双向长短期记忆网络层,以对表示嵌入中的时序信息和上下文信息进行建模。故设O(i)在时间t对应的输出Ot(i)Rm×1

长短期记忆网络(LSTM)单元的遗忘门ft、输入门zt、输出门ut和候选状态c˜t根据当前时间步t的输入Ot(i)和前一时间步t-1的隐藏状态ht-1Rne×1生成相应的输出,分别可表示为

ft=σW(f)(Ot(i))T, (ht-1)TT+b(f)
zt=σW(z)(Ot(i))T, (ht-1)TT+b(z)
ut=σW(u)(Ot(i))T, (ht-1)TT+b(u)
c˜t=tanhW(c˜)(Ot(i))T, (ht-1)TT+b(c˜)

式中:σ表示Sigmoid函数;tanh表示双曲正切函数;网络线性权重W(f)W(z)W(u)W(c˜)Rne×(m+ne)和偏置b(f),b(z),b(u),b(c˜)Rne×1是可学习的参数,ne为LSTM的映射维度。进而LSTM单元根据ftzt的输出生成状态

ct=ftct-1+ztc˜t

式中:为向量元素乘积。Bi-LSTM结合了前向隐藏输出ht和后向隐藏输出ht,得到当前时间t的输出为

Ht=(ht)T, (ht)TTR2ne×1

其中任一方向隐藏输出

ht= uttanh(ct)Rne×1

本文将所有时刻的隐藏输出Ht构成Bi-LSTM的输出,则得到任一样本的第i层嵌入所对应的长短期记忆网络层输出Olstm(i)=H1,H2,,HTTRT×2ne

2.2 非线性加权交叉熵损失

分别将任一样本的第ii取值为4,8,12,16,20,24)层嵌入输入到带自注意力机制的双向长短期记忆模型,并将所有输出在空间维度上进行拼接,得到任一样本的融合输出Ocon=Olstm(4),Olstm(8),,Olstm(24)RT×12ne。将Ocon送入以高斯误差线性单元(Gaussian Error Linear Units,GELU)为激活函数的全连接层,进一步降低到所需的维度,输出

Ofc=OconWfc+bfcRT×d

式中:WfcR12ne×dbfcRT×d分别为全连接层的映射矩阵和偏置;d为全连接层的节点数。

Ofc在时间维度上进行平均池化得OavgR1×d。最后将Oavg送入输出层,得到任一样本对应的每个口吃类别的预测输出y=y1,y2,,ycR1×c表示为

y=OavgW+b

式中:WRd×cbR1×c分别为输出层的映射矩阵和偏置;c为口吃语音类别数。

针对口吃语音数据集不平衡的情况,为了关注到样本较少的口吃类别和平衡各个口吃类别的损失,本文对不同类别的损失赋予不同的权重,根据各个类别的训练样本数量Nj获得各个类别的类平衡权重wj,并进行归一化处理使得任一类别的类平衡权重wj[0,1]。类平衡权重

wj=NcNjj=1cNcNj

式中:N为训练集的样本数量。

由于各类别样本数差距过大,线性的WCE损失缺乏对各类间关系的充分描述。因此,为更准确地衡量口吃数据集中类别间的权重,本文提出NWCE损失。该方法通过对类平衡权重进行非线性的尺度变换,将较高的权重映射到较低尺度,缩小权重之间差距,得到归一化的非线性加权权重

vj=kwj-1j=1c(kwj-1)

式中:k为非线性映射系数。

非线性加权交叉熵损失函数为

L=1Ni=1Nvdilog(eydij=1ceyj)j=1cvj

式中:di为第i个样本的真实类别标签索引;vdi为第i个样本所属类别的非线性加权权重;ydi为第i个样本所属类别的预测输出。

3 实 验

3.1 实验准备

3.1.1 数据集KSF-C

实验使用Kassel流利度挑战数据集(Kassel State of Fluency Corpus,KSF-C)2425,该数据集包含37名德语使用者的5 597个语音片段,各语音片段长度为3 s,总时长4.6 h。3位标注者将所有语音片段分为6个口吃相关类别,包括语言阻滞(Block)、音节延长(Prolongation,简称Prolong)、声音重复(Sound Repetition)、单词重复(Word Repetition)、修改语音技术(Modified Speech Technique,简称Modified)、填充词(Interjection,又称Fillers)。为确保标注的准确性,删除了所有多标签片段,最终得到4 601个片段。最终数据集类别包括6个口吃相关类别和无口吃表现(No Disfluency)类以及垃圾类(Garbage),其中,垃圾类表示无法理解、不包含语音或受背景噪声影响的片段,详细信息如表 1 所示。

3.1.2 音频特征表示

wav2vec 2.0 是一种从原始音频数据中提取特征表示的自监督学习模型。在预训练阶段,wav2vec 2.0使用自监督学习方法在大量未标记的音频数据集上学习语音信号的特征表示。为了适应不同的语音识别任务,可以通过连接时序分类(Connectionist Temporal Classification,CTC)损失,在目标任务数据集上进行微调。

本文选择在Common Voice26数据集(多语言,9 283 h)上进行预训练的wav2vec 2.0大型模型10用于提取音频表示,并将该模型针对德语语音识别任务进行微调。本文选择该模型的原因是其可以针对德语音频语段进行识别,且与KSF-C数据集的语言一致,能更好地适应目标任务。

3.1.3 超参数设置

基于深度学习现有的经验,本文方法的实验模型参数设置为:自监督预训练模型嵌入维度nd为1 024,自注意力层映射维度m为1 024,双向长短期记忆层的映射维度ne为256,全连接层节点数d取值为256。训练时选用Adam(Adaptive moment estimation)优化器,批大小(Batch Size) 为 64,最大训练轮数(Epoch)为100,初始学习率(Initial Learning Rate)的取值范围为{0.000 5,0.000 1, 0.000 05,0.000 01,0.000 005},最后记录最佳结果。

3.2 实验结果

3.2.1 本文方法

使用本文BLSA方法,考虑焦点损失函数和加权交叉熵损失以及非线性加权交叉熵损失,进行5次重复实验,记录本文方法在不同损失函数下,开发集的最大未加权平均召回率(Unweighted Average Recall,UAR)和其对应的宏F1分数(macro F1-Score)结果,如表 2 所示。其中,对于Focal损失的参数设置,可调焦点参数取值为2.0,类别权重采用WCE中的类平衡权重;非线性加权交叉熵损失的参数k取值范围为{1.5,2.0,2.5,3.0}。Focal损失下的UAR最大值高于WCE损失下的最大值。所有NWCE损失下的UAR最大值(RUAR-max)均高于WCE损失下的最大值,这表明在口吃识别模型中,使用NWCE损失可以取得更好的性能表现。当k取值为2.0时,口吃语音分类模型的性能最好。进一步给出不同k值的NWCE损失的UAR平均值(RUAR-avg)及其标准差,结果如图 2 所示,可以看出,各k值对应的UAR平均值在大部分情况下都高于WCE的UAR最大值。

为了探讨本文BLSA模块中自注意力机制对口吃语音分类的影响,构建了仅包含Bi-LSTM层的模型,该模型与本文方法的不同是去除了自注意力层。模型使用多层wav2vec 2.0嵌入作为输入,并采用k取值为2.0的非线性加权交叉熵损失。进行5次重复实验,记录5次实验的开发集的UAR最大值(RUAR-max)和平均值(RUAR-avg),实验结果如表 3 所示。由表 3 可知,本文方法中的自注意力层可减少自监督预训练模型嵌入中的冗余信息。

为了研究BLSA模块中Bi-LSTM层的输出维度对模型性能的影响,本文进行了多组超参数敏感性实验。将Bi-LSTM层的输出维度分别设置为{128,256,512},并进行5次重复实验,记录5次实验的开发集的UAR最大值(RUAR-max)和平均值(RUAR-avg),如表 4 所示。由表 4 可知,当Bi-LSTM层的输出维度取值为256,本文模型的性能最好。

3.2.2 对比分析

将本文方法与现有口吃语音分类方法进行UAR性能对比,结果如表 5 所示。

文献[24]给出了在KSF-C数据集上的基线实验结果;文献[11,2223]则关注于wav2vec 2.0嵌入的统计特性,仅在时间维度上使用不同的统计泛函进行分析;文献[10]采用对wav2vec 2.0模型进行微调的方法,分别微调了小型、大型、超大型wav2vec 2.0模型。虽然超大型wav2vec 2.0模型取得了最佳结果,但仍与其他规模的模型结果处在同一量级且参数量大,因此本文选择大型模型结果作为对比对象。此外,本文还尝试将常用的传统音频特征MFCC作为输入特征来进行比较,即提取40维MFCC特征,通过二维卷积将其扩展为1 024维,输入BLSA-NWCE模型(k=2.0,单通道),记录5次重复实验的开发集UAR的结果,最大值为25.8%。

所有对比实验均取KSF-C开发集上的UAR的最大值。由表 5 可知,所有基于wav2vec 2.0模型嵌入作为特征的方法均远高于基线结果。同时,本文方法性能优于其他3种只考虑wav2vec 2.0模型嵌入统计特性的方法。此外,与微调的wav2vec 2.0模型方法相比,本文方法具有较好的分类性能。

为进一步展示本文方法在识别不同口吃类别的性能,给出了实验结果中性能最佳模型生成的混淆矩阵和KSF-C数据集基线的混淆矩阵24,分别如图 3(a)图 3(b) 所示。

通过与基线混淆矩阵的比较可知,本文方法对大多数口吃类别识别的性能都优于基线方法。

4 总结与展望

本文提出了一种基于自监督预训练模型和非线性加权交叉熵损失的口吃语音分类方法。基于自监督预训练模型来提取口吃语音的副语言表示嵌入,使用带自注意力机制的双向长短期记忆网络对口吃语音进行分类,进一步使用非线性加权交叉熵损失关注样本较少的口吃类别。未来可以将语音信号与文本信息、图像信息等多模态信息相融合,以提升口吃语音分类的准确度和稳健性。

参考文献

[1]

SCHULLER B WBATLINER AAMIRIPARIAN Set al.The ACM multimedia 2023 computational paralinguistics challenge:Emotion share & requests[C]//ACM International Conference on Multimedia,2023:9635-9639.

[2]

XU XDENG JZHANG Zet al.Zero-shot speech emotion recognition using generative learning with reconstructed prototypes[C]//IEEE International Conference on Acoustics,Speech and Signal Processing (ICASSP).IEEE,2023:1-5.

[3]

HAIDER FDE LA FUENTE S,LUZ S.An assessment of paralinguistic acoustic features for detection of Alzheimer's dementia in spontaneous speech[J].IEEE Journal of Selected Topics in Signal Processing201914(2):272-281.

[4]

SHAHIN MZAFAR UAHMED B.The automatic detection of speech disorders in children:Challenges,opportunities,and preliminary results[J].IEEE Journal of Selected Topics in Signal Processing201914(2):400-412.

[5]

SHEIKH S ASAHIDULLAH MHIRSCH Fet al.Machine learning for stuttering identification:Review,challenges and future directions[J].Neurocomputing2022514:385-402.

[6]

SHEIKH S ASAHIDULLAH MHIRSCH Fet al.Stutternet:Stuttering detection using time delay neural network[C]//European Signal Processing Conference (EUSIPCO).IEEE,2021:426-430.

[7]

KOURKOUNAKIS THAJAVI AETEMAD A.Detecting multiple speech disfluencies using a deep residual network with bidirectional long short-term memory[C]//IEEE International Conference on Acoustics,Speech and Signal Processing(ICASSP).IEEE,2020:6089-6093.

[8]

SEBASTIAN P BDOMINIK WELMAR Net al.Detecting dysfluencies in stuttering therapy using wav2vec 2.0[C]//Annual Conference of the International Speech Communication Association (INTERSPEECH),2022: 347.

[9]

BAYERL S PWAGNER DNÖTH Eet al.The influence of dataset partitioning on dysfluency detection systems[C]//International Conference on Text,Speech,and Dialogue(ICTSD).Cham:Springer International Publishing,2022:423-436.

[10]

GRÓSZ TPORJAZOVSKI DGETMAN Yet al.wav2vec2-based paralinguistic systems to recognise vocalised emotions and stuttering[C]//ACM International Conference on Multimedia,2022:7026-7029.

[11]

SHEIKH S ASAHIDULLAH MOUNI Set al.End-to-end and self-supervised learning for ComParE 2022 stuttering sub-challenge[C]//ACM International Conference on Multimedia,2022:7104-7108.

[12]

JOUAITI MDAUTENHAHN K.Dysfluency classification in stuttered speech using deep learning for real-time applications[C]//IEEE International Conference on Acoustics,Speech and Signal Processing (ICASSP).IEEE,2022:6482-6486.

[13]

KOURKOUNAKIS THAJAVI AETEMAD A.FluentNet:End-to-end detection of stuttered speech disfluencies with deep learning[J].IEEE/ACM Transactions on Audio,Speech,and Language Processing202129:2986-2999.

[14]

BAEVSKI AZHOU YMOHAMED Aet al.wav2vec 2.0:A framework for self-supervised learning of speech representations[J].Advances in Neural Information Processing Systems202033:12449-12460.

[15]

SUN HLIAN ZLIU Bet al.EmotionNAS:Two-stream architecture search for speech emotion recognition[DB/OL].(2022-03-25)[2023-09-05].

[16]

VAESSEN NVAN LEEUWEN D A.Fine-tuning wav2vec2 for speaker recognition[C]//IEEE International Conference on Acoustics,Speech and Signal Processing (ICASSP).IEEE,2022:7967-7971.

[17]

BRAUN FERZIGKEIT ALEHFELD Het al.Going beyond the cookie theft picture test:Detecting cognitive impairments using acoustic features[C]//International Conference on Text,Speech,and Dialogue (ICTSD).Cham:Springer International Publishing,2022:437-448.

[18]

GHOSH STYAGI UKUMAR Set al.A novel multimodal dynamic fusion network for disfluency detection in spoken utterances[DB/OL].(2022-11-27)[2023-09-05].

[19]

SHARMA M.Multi-lingual multi-task speech emotion recognition using wav2vec 2.0[C]//IEEE International Conference on Acoustics,Speech and Signal Processing (ICASSP).IEEE,2022:6907-6911.

[20]

REN ZNGUYEN T TCHANG Yet al.Fast yet effective speech emotion recognition with self-distillation[C]//IEEE International Conference on Acoustics,Speech and Signal Processing (ICASSP).IEEE,2023:1-5.

[21]

BAYERL S PWAGNER DBAUMANN Iet al.Detecting vocal fatigue with neural embeddings[DB/OL].(2022-04-07)[2023-09-05].

[22]

BAYERL S PGERCZUK MBATLINER Aet al.Classification of stuttering-The ComParE challenge and beyond[J].Computer Speech & Language202381:101519.

[23]

MONTACIÉ CCARATY M JLACKOVIC N.Audio features from the wav2vec 2.0 embeddings for the ACM multimedia 2022 stuttering challenge[C]//ACM International Conference on Multimedia,2022:7195-7199.

[24]

SCHULLER BBATLINER AAMIRIPARIAN Set al.The ACM multimedia 2022 computational paralinguistics challenge:Vocalisations,stuttering,activity,& mosquitoes[C]//ACM International Conference on Multimedia,2022:7120-7124.

[25]

BAYERL SVON GUDENBERG A WHÖNIG Fet al.KSoF:The Kassel State of Fluency dataset-a therapy centered dataset of stuttering[C]//Language Resources and Evaluation Conference (LREC),2022:1780-1787.

[26]

ARDILA RBRANSON MDAVIS Ket al.Common Voice:A massively-multilingual speech corpus[C]//Language Resources and Evaluation Conference (LREC),2020:4218-4222.

基金资助

中国博士后科学基金面上项目(2022M711693)

国家自然科学基金面上项目(62071242)

国家自然科学基金面上项目(62172235)

南京邮电大学校级自然科学基金(NY222158)

AI Summary AI Mindmap
PDF (1218KB)

401

访问

0

被引

详细

导航
相关文章

AI思维导图

/