文章来源于音频语音与语言处理研究组,作者邵琪杰

人类的语音中除了包含语言信息外,还蕴含着丰富的副语言信息,包括情感、口音等。口音识别(Accent Recognition, AR)旨在通过说话人的语音识别其口音的任务。此外,对于带口音的语音识别(ASR)任务,口音识别也是一个重要的前置任务。

近期,由西工大音频语音与语言处理研究组(ASLP@NPU)和腾讯TEG合作的论文“Linguistic-Acoustic Similarity Based Accent Shift for Accent Recognition ”被语音研究顶级会议Interspeech 2022接收。该论文提出一种基于语音-声学相似度的口音偏移度量机制,可以将语音对应文本作为锚点,评估不同口音相对于同一个单词或字的偏移。实验证明,以这种偏移度量作为口音识别模型的输入可以显著提升口音识别正确率。现对该论文进行简要的解读和分享。



论文题目:Linguistic-Acoustic Similarity Based Accent Shift for Accent Recognition

作者列表:邵琪杰,颜京豪,康健,郭鹏程,石宪,胡鹏飞,谢磊

论文原文:https://arxiv.org/abs/2204.03398v2


图1 发表论文截图


图2 扫码直接看论文


1、背景动机

口音是一种受地域、教育程度等因素影响而产生的发音变异。例如大家常常听到的国内各具特色的中文地方口音,以及英语中受地域影响的不同发音习惯。西工大音频语音与语言处理研究组曾在2021年联合数据堂、上海交通大学举办了口音英语识别挑战赛——AESRC2020[1],涉及了多国英语人群的口音识别和语音识别任务。口音识别任务可以应用于用户画像等任务,也可辅助语音识别模型更好的识别带口音的语音,从而提升不同人群语音的识别准确率。
目前常见的口音识别模型[2,3,4]与说话人识别模型结构类似,例如ResNet或x-vector等。但不同于说话人信息可以直接从低级别的Fbank或MFCC声学特征中提取,口音是一种与语言相关的信息,直接使用声学特征作为输入会导致模型过拟合到说话人或者信道上[5],难以获得满意的识别性能。
实际上,口音可以被视为相对标准发音的一系列偏移[6,7],如果有相同内容的标准发音的语音作为基准,则区分不同口音会容易得多。但是,这种成对(parallel)的语音数据却极难获取,因此口音偏移的评估面临困难。
针对这一问题,本文提出了基于语言-声学相似度的口音偏移(LASAS)度量方法,并将其用于口音分类任务。对于一个带口音的语句,在映射其相应文本向量到口音相关空间作为基准后,本文通过评估声学嵌入和该基准的相似度,实现对口音偏移的度量。然后,本文将口音偏移和文本向量拼在一起,以获得语言-声学双模态表征。相比于纯声学嵌入,这种双模态表征充分利用了语言和声学信息,物理意义更加丰富和清晰,从而显著改善了口音分类性能。在口音英语识别挑战赛(AESRC)数据集[1]上的相关实验证明了本文方法的有效性。在测试集上实现了77.42%的分类正确率,相比于一个有竞争力的基线获得了6.94%的相对提升。


2、方案介绍

总体结构:如图3(a)所示,本文提出的模型由三个主要模块组成。
  • Input模块,它以声学特征(Fbank或MFCC)和对齐文本作为输入。其中,声学特征进入 Conformer 编码器以提取带口音的声学嵌入,该编码器可以由ASR模型的编码器初始化。考虑到编码器的最深层输出可能大部分是语言信息,本文将编码器层的某些中间层输出拼接在一起作为声学嵌入。
  • LASAS模块,以对齐文本和声学嵌入来计算口音偏移,并输出语言-声学双模态的嵌入表示。
  • AR 模块,将语言-声学双模态表示作为输入,先通过轻量级 Transformer编码器提取上下文相关的口音信息,然后,在 DNN 和池化层之后获得话语级口音预测结果。


图3 口音识别模型的系统结构示意图


LASAS模块:通过比较相同内容的标准发音和口音发音,我们可以度量带口音发音相对标准发音的偏移。但对于 AR 任务场景,这种偏移在缺少成对数据的情况下难以获取。但是,如果我们能建立一种虚拟口音偏移,使之可以在同一个发音单元上针对不同的口音显示出不同偏移距离和方向,那么这样的偏移对于后续的AR模型也很有意义。

为了实现这个目标,我们需要一个基准,它与语音内容相关联,并且在时间上保持对齐。在本文中,我们将语音内容的对齐文本向量映射到多个欧氏空间作为基准。这种方法保证了同个发音单元出现在不同口音中时的基准是相同的。基于对齐文本的基准定义为:

然后,我们先将声学嵌入映射到与文本基准相同的维度,再通过缩放点积计算它们的相似度:

如图3(b)所示,我们使用多组映射来获得多个相似度值。所有 Wa 和 Wt 都是可训练的。一个相似度值只能表示声学嵌入和文本基准在某一个方面的接近程度, 但多个相似度的组合则可以反映口音的移位方向和偏移程度。因此,口音偏移由多个相似度拼接表示:

考虑到口音偏移是一种相对表征,而对于 AR 模型,还有必要知道这种偏移的基准,即发音单元信息。由于上面提到的每个 Vt 都与口音相关联,而此处的基准必须与口音无关。因此,我们单独设置一个降维矩阵,对输入对齐文本(Onehot形式)进行降维以表示纯发音单元信息。最后,我们将口音偏移和降维文本拼接到一起,形成语言-声学双模态表示,以作为后续 AR 模型的输入。



3、实验验证
数据及设置:本文使用前文介绍的口音英语挑战数据集AESRC [1]。该集涉及来自8个地域的带口音英语,训练集中每种口音英语20 小时,测试集各2小时。此外,本文使用一个 ASR 模型来做文本强制对齐(除表2外,其余均使用真实文本),并初始化Conformer编码器。此 ASR 模型由 Librispeech 960和AESRC 数据集训练,在 AESRC 开发集中的CER为 6.06%。

实验:在表1中,采用本文LASAS方案的系统3明显优于系统2和系统1。在没有LASAS模块的情况下,即使系统2比系统1复杂,但其性能并没有明显的提高。这些实验充分证明LASAS是有效的。


表1 LASAS有效性实验的口音分类准确率



本文选择“The”和“I”来可视化口音偏移。选择这两个子词是因为如下考虑。一方面,一些口音在“The”上更明显,而大多数口音在“I”上几乎没有变化;另一方面,这两个子词出现的频率更高,因此结果更可信。我们平均了每个片段在开发和测试集中的帧级口音偏移,然后进行了T-SNE 和 PCA 变换。如图4所示,对于“The”,LASAS口音偏移量的可区分性显著高于编码器输出的声学嵌入。此外,如图5所示,“The”的口音偏移距离显著大于“I”。特别地,对于印度口音的“The”,其在图4中的聚类效果比其他口音更加突出,并且在图5中的偏移距离明显大于英式和美式口音。这是因为“The”的发音在印度口音更近似于“de”,这个现象在其他口音中是不常见的。这些现象充分证明了LASAS是一种符合语言学规律的度量。


图4 “The”的T-SNE变换图



图5 “The”和“I”的PCA变换图。其中圆圈为高斯云图。直线连接该子词的所有口音的平均质心和各个口音的平均质心,用于显示口音偏移距离


表2显示了 本文LASAS方案和AESRC竞赛获奖方案的结果对比。本文的系统20~22超过了比赛Top2方案,与Top1不使用TTS数据扩充的情况下效果接近。在系统20∼22中,本文研究了文本可靠性对 LASAS 的影响。在系统20中,LASAS在使用真实文本时取得了最佳效果。但即便使用经过ASR识别语音获得的抄本进行训练及测试,系统22在测试集上的准确率仅下降了相对0.48%。这证明由于LASAS利用了整句语音的信息,即使某些字识别带有错误,LASAS方案也可以保持良好的性能。最后系统22实现了开发和测试集的准确率分别为 84.88% 和 77.42%的效果,相对于系统18分别提高了4.81% 和 6.94%。


表2 LASAS 和 AESRC 挑战赛获奖方案的口音分类准确率对比。表中 Real 和 ASR 表示使用真实文本或ASR 生成的文本。



4、总结
本文提出了一种基于语言-声学相似度的口音偏移(LASAS)度量方法,并将其用于口音分类任务。我们通过LASAS模块提取口音偏移并将其与文本基准拼接,形成用于口音识别任务的双模态表征。在口音英语识别挑战赛AESRC数据集上的实验表明,我们的方法有效地提高了口音识别性能,并具备显著的物理意义和可解释性。未来我们将尝试将LASAS进一步应用于口音ASR任务中。


5、参考文献
[1] X. Shi, F. Yu, Y. Lu, Y. Liang, Q. Feng, D. Wang, Y. Qian, and L. Xie, “The accented English speech recognition challenge 2020: Open datasets, tracks, baselines, results and methods,” in Proc. ICASSP, 2021, pp. 6918–6922.
[2] M. A. T. Turan, E. Vincent, and D. Jouvet, “Achieving multiaccent ASR via unsupervised acoustic model adaptation,” in Proc. Interspeech, 2020.
[3] A. Hanani and R. Naser, “Spoken Arabic dialect recognition using x-vectors,” Natural Language Engineering, pp. 691–700, 2020.
[4] S. Shon, A. Ali, Y. Samih, H. Mubarak, and J. Glass, “ADI17: A fine-grained Arabic dialect identification dataset,” in Proc. ICASSP, 2020, pp. 8244–8248.
[5] S. A. Chowdhury, A. M. Ali, S. Shon, and J. R. Glass, “What does an end-to-end dialect identification model learn about nondialectal information?” in Proc. Interspeech, 2020, pp. 462 466.
[6] J. C. Wells and J. C. Wells, Accents of English: Volume 1. Cambridge University Press, 1982.
[7] M. Tjalve and M. Huckvale, “Pronunciation variation modelling using accent features,” in Proc. EuroSpeech, 2005.

相关链接

ASLPer,公众号:语音之家论文分享丨NPU-ASLP实验室将携14篇论文参加语音旗舰会议INTERSPEECH2022