文章来源于音频语音与语言处理研究组,作者魏坤
对话场景是语音识别(ASR)应用中出现频率很高的一种场景,比如智能客服、客服质检等。在对话语音识别(Conversational ASR)中,如何将语音或识别抄本的有用上下文信息引入进来,是一个值得关注的研究工作[1]。
基于对话特征建模的对话语音识别
魏坤,公众号:语音之家论文推介:基于对话特征建模的对话语音识别
对话语音识别中基于文本-语音跨模态方法学习长语音表征
魏坤,公众号:语音之家论文推介:对话语音识别中基于文本-语音跨模态方法学习长语音表征


图1 发表论文截图

图2 扫码直接看论文
1、背景动机 上下文(Context)信息在长语音ASR中起着重要的作用,特别是在主题集中的对话等场景中,语义相关的词或短语经常会重复出现[4]。传统的声学-语言混合ASR模型通常依赖于丰富的语言模型来建模上下文信息[5],同时,也有将上下文拼接后作为长语音输入输出的工作[6]。Transformer及其变种作为当前最为流行的基于注意力机制的端到端模型,在包括ASR等众多任务上表现出优异的性能。然而由于自注意的计算和存储代价是输入序列长度的二次多项式级别,Transformer难以处理长序列,例如上下文拼接后的输入。 本文提出了一个新的基于Transformer的端到端语音识别框架。我们利用跨句信息来增强对话语音识别系统的性能,参照[7],我们在编码器中加入了一个残差注意力模块,能够加快模型收敛速度,并很好地模拟每个输入序列中的长时序的全局依赖性。此外,为了进一步传递前一句的context信息,我们还提出了一种新的context感知的残差注意力机制,该模块通过注意力分数来传递句间context信息。对于解码器部分,我们使用一个额外的注意力模块来学习更多的句间信息。通过使用上述方法,我们在Transformer ASR模型中引入了句间上下文信息。在两个对话标准数据集HKUST和Switchboard、一个演讲的标准数据集TEDLIUM2和一个内部对话数据集DATATANG-dialog上证明了我们的方法的优越性。在实验中字错误率(CER)明显降低,而同时计算成本和模型复杂度的增加几乎可以忽略。



图3 残差注意力机制结构图





图4 条件解码器架构
表1 数据集详情

表2 提出方法的实验结果

表3 说话人信息对识别结果的影响

