
本文由清华大学与微软亚洲研究院合作,提出了一个同时利用声学特征、语音学特征和语言学特征的音素级别错误发音检测与诊断(mispronunciation detection and diagnosis,MD&D)框架。其中语音学特征提取自用大规模语料训练的语音识别模型,具备噪声鲁棒和与说话人无关等特性,因此增加这一特征后模型能更容易捕获音频中与发音相关的信息。本文实验验证了语音学特征是声学特征和语言学特征的良好补充,所提出的MD&D框架相比现有方法在音素识别任务和MD&D任务上都取得显著的性能提升。
扫码阅读论文:
https://arxiv.org/abs/2110.07274
更多实验结果:
https://thuhcsi.github.io/icassp2022-MDD-APL/

背景动机
计算机辅助发音训练(computer-aided pronunciation training, CAPT)为语言学习者提供了方便的学习途径,错误发音检测与诊断(MD&D)是CAPT的重要组成部分。MD&D指出语言学习者的发音是否有误(检测),并进一步指出具体错误(诊断)。
MD&D可以通过音素识别模型来完成,模型识别出用户实际的发音音素序列,和标准发音的音素序列进行对比即可给出MD&D结果。然而音素级别的L1(母语说话人)和L2(非母语说话人)语料非常稀少,现有的MD&D方法主要是端到端的音素识别模型,然而这种方法一般仅以原始声学特征(MFCC,fbank等)或加上语言学特征(标准发音)为输入,端到端地训练并识别音素,这样的做法无法在小量级的数据上取得可接受的音素识别和MD&D效果。
本文提出了一个同时利用声学特征、语音学特征和语言学特征的音素级别MD&D框架,利用大规模单词级别的语料训练的语音识别模型,提取噪声鲁棒、说话人无关的语音学信息,输入到音素识别模型中作为声学特征、语言学特征的补充,减缓了MD&D任务场景的数据稀缺问题,使得音素识别模型能更关注于音频的发音信息,忽略发音无关的内容,进而提升识别效果。
模型训练与推理框架

模型的训练分两个阶段:在第一阶段,先用单词级别的自动语音识别(ASR)语料训练一个声学模型;第二阶段,训好的声学模型参数被固定,接受来自MD&D语料的声学特征,输出相应的语音学特征,即声学模型的隐层输出的BNF(bottleneck features)或者最后一层输出的PPG(phonetic posteriorgrams)。声学特征、语音学特征和语言学特征同时输入到APL模型中,APL最终输出帧级别的音素后验概率,并以CTC损失函数进行训练。
模型推理时,直接对APL的输出进行无语言模型的波束搜索(beam search),即得到所识别的音素序列。
模型框架

APL模型有声学编码器、语音学编码器和语言学编码器,分别用于提取声学特征、语音学特征和语言学特征这三个输入的信息,其中声学编码器和语音学编码器由CNN Stack和RNN Stack堆叠而成,语言学编码器由一个嵌入层、双向LSTM层和线性层组成。提取的三个输入信息通过一个注意力机制对齐,并输入到解码器中,再通过一个线性层和softmax层后输出帧级别后验概率。
数据集
本文的实验主要在TIMIT和L2-ARCTIC (V5.0)两个数据集上进行,其中TIMIT包含630个美国L1说话人录制的语料,而后者包括24个L2说话人,他们的母语有印地语、汉语、普通话、西班牙语、阿拉伯语和越南语,每种母语4个说话人。我们把所有的TIMIT数据加上一半的L2-ARCTIC数据来做训练集,验证集和测试集平分L2-ARCTIC剩余的12个说话人。L2说话人在训练、测试、验证集的分布确保了训练集包含了验证集和测试集出现的所有音素。

声学模型
我们采用了两种声学模型设定。第一个声学模型AM1,是在Librispeech数据集(960小时)上训练的,它的帧级别BNF被当作后续的语音学特征。而第二个声学模型AM2,是在Microsoft EN*数据集(大于10万小时)上训练的,它的帧级别PPG被用于后续的语音学特征。
对比实验
我们在音素识别任务和MD&D任务上对比了6种模型设定:
Baseline-1:CNN-RNN-CTC模型,它仅以声学特征为输入
Baseline-2 (AL):输入声学特征 + 语言学特征
PL-1:输入AM1的语音学特征 + 语言学特征
PL-2:输入AM2的语音学特征 + 语言学特征
APL-1:输入声学特征 + AM1的语音学特征 + 语言学特征
APL-2:输入声学特征 + AM2的语音学特征 + 语言学特征

根据实验结果,对比PL-1、PL-2和AL,结果说明语音学特征优于原始的声学特征,与设想一致;对比APL-1、APL-2和PL-1、PL-2,推测语音学特征由于提取自用L1语料训练的声学模型,它相比原始声学特征可能损失了一部分对MD&D有用的信息,所以我们认为尽管语音学特征比声学特征表现好,但它应作为声学特征的补充而不是替代;对比APL-1和APL-2,我们得知从更大规模数据训练的大模型提取的语音学特征表现更好。
本文提出了一个同时利用声学特征、语音学特征和语言学特征的音素级别MD&D框架。语音学特征提取自用大规模语料训练的语音识别模型,具备噪声鲁棒和与说话人无关等特性,因此增加这一特征后,模型能更容易捕获音频中与发音相关的信息。实验验证了这一方法能显著提高音素识别和MD&D的识别表现。
