ASLP嗑盐君 音频语音与语言处理研究组 2019-08-29近期,实验室孙思宁、郭鹏程同学的论文“Adversarial Regularization for Attention Based End-to-End Robust Speech Recognition”被语音研究领域顶级期刊IEEE/ACM TRANSACTIONS ON AUDIO, SPEECH, AND LANGUAGE PROCESSING录用,将在11月正式发表,这也是该期刊上第一篇对抗学习在鲁棒语音识别上的应用论文。论文作者为:孙思宁(西工大),郭鹏程(西工大),谢磊(西工大),黄美玉(出门问问AI Lab)。



随着深度学习的快速发展,基于深度神经网络的语音识别已经在大型商用系统中得到了成功的应用。虽然目前线上系统大多采用的传统的DNN-HMM混合模型能够取得很好的识别效果,但其建模过程复杂,模块多,每个模块有各自不同的优化目标,且解码过程涉及到庞大的解码图。为了简化语音识别建模过程,端到端(end-to-end)框架成为新的研究热点,其旨在简化语音识别过程,甚至只用一个神经网络进行建模,直接输出文字,因而吸引了大量工业界和学术界的研究兴趣。例如,近期的研究表明,基于注意力机制的LAS(Listen, Attend, Spell)模型[1],在若干公开数据集合上,已经达到或超过了传统的DNN-HMM模型的性能。其他相关模型如RNN Transducer、Transformer也具有很好的潜力。


传统ASR vs 端到端ASR


LAS模型结构


鲁棒性(robustness)一直是语音识别研究的一个关键问题,旨在提升识别模型的推广和适应能力,应对各种复杂场景(口音、噪声等)的识别任务。端到端框架对语音识别的简化,也带来了鲁棒性的问题。因为LAS模型使用一个模型同时建模声学层面和语言层面的信息,声学层面的扰动很容易地传递到语言层面,直接影响模型最终的输出。


另一方面,研究者们发现,基于端到端的语音识别模型,非常容易受到“对抗样本(adversarial examples)”的攻击,即给原始的语音添加极小的人类不易察觉的“对抗扰动”,端到端模型将无法正确识别出扰动后的内容,甚至识别结果非常离谱[2,3]。



微小的“对抗扰动”引发巨大的语音识别错误


近期,在不同任务中都证明了“对抗样本”的存在,对人工智能的众多任务构成了威胁。例如,前两天发表的“一张贴纸破解顶级FaceID”就是人脸识别极易受到对抗样本的攻击的很好例子[4]。对抗学习以及如何防御这种对抗攻击也成为近期的研究热点。



“对抗样本”引发人脸识别错误


端到端模型之所以存在这些问题,一个重要的原因是模型的输出对于输入不平滑(unsmooth),即输入端的一个极小扰动,可以造成输出端的一个极大的跳跃。



对抗样本的定义


本文不对对抗样本生成、防御对抗攻击进行研究,而是旨在充分考虑和利用这种对抗扰动的影响,用于提升端到端语音识别模型(LAS)的鲁棒性。实验室前期工作中也采用了对抗样本作为一种数据增广的方法来提升语音识别的鲁棒性,实验证明也是非常有效的[5,6]。


为了解决端到端模型的不平滑性,本文提出在模型训练的损失函数中,利用对抗样本,引入“对抗正则化项(adversarial regularization)”的方法,用于提高模型的平滑性,进而提升语音识别鲁棒性。


在本文中,我们使用了两种改进的LAS模型的对抗正则化损失函数,即基于“快速符号梯度法(FGSM)”的“对抗训练”和基于“局部分布平滑(LDS)”的“虚拟对抗训练”[7]。基于FGSM的对抗训练,首先使用FGSM方法产生对抗样本,然后将对抗样本产生的损失项和原始数据的损失函数结合,提高模型对对抗样本的鲁棒性。基于LDS的虚拟对抗训练,明确地引入了衡量模型在某个数据点周围平滑性的指标,即LDS,通过迭代方式,近似估计对抗扰动,然后使用估计的对抗扰动计算LDS,并将LDS作为损失项加入到损失函数中,使模型更加的平滑。FGSM为有监督生成对抗样本的方法,LDS为无监督方法。



基于FGSM的对抗样本生成




基于LDS的对抗样本生成


语音是典型的序列数据,且比文本数据更加复杂。基于FGSM和LDS的方法,首先应用于图像任务,无法在序列模型上直接应用。针对LAS这种序列模型,本文改进了上述的两种对抗正则化的方法,与传统的逐帧产生对抗扰动不同,改进的方法直接产生对抗扰动序列,保证了扰动在序列模型上的对抗性。



基于对抗样本的损失函数正则化



基于对抗正则化的LAS模型训练


为了验证本文所提出的算法的有效性,我们在两个公开的中文语料库AISHELL-1(170小时)[8]和AISHELL-2(1000小时)[9]上进行了实验。由于AI两个语料库是在相对干净的环境中录制,为了验证算法对噪声的鲁棒性,我们进行了数据加噪,信噪比覆盖了5,10,15和20db。即模型是采用带噪的数据训练,干净和带噪数据进行测试。


同时,由于对抗正则化和我们之前所提出的基于对抗样本直接数据增广方法具有很强的相关性,因此在本文中也进行了详细的对比。此外值得指出的是,为了和更高识别指标的基线模型进行对比,我们采用了谷歌新近提出的SpecAugment方法[10],该方法本身能够比基线LAS有2%的绝对字错误率下降。实验中,经过SpecAugment处理的数据训练的LAS模型作为对比基线。


在AISHELL-1的实验中,本文所提出的基于FGSM和LDS的对抗正则化方法,相比于使用传统的交叉熵损失函数训练的基线模型,获得了相对9.2%和16.6%的字错误率下降。在AISHELL-2的实验上,在不同的测试集上,基于LDS的方法也获得了相对7.0%-12.2%的字错误率下降,而且达到了和非端到端Chain-TDNN模型相当的识别效果。同时,本文所提出的基于LDS的对抗正则化方法,相比于我们之前的基于FGSM的对抗数据增广方法,在AISHELL-1和AISHELL-2上,也取得了9.2% 和8.1%(Android Noisy测试集)的相对字错误率下降。



在AISHELL-2 1000小时语料库上的实验结果,REG为正则化方法,AUG为数据增广方法


两个中文数据库上的实验结果,充分说明了对抗正则化在提高端到端模型平滑性和鲁棒性上的有效性。本工作是对抗正则化在语音识别任务上的首次成功应用。此外,我们也证实了相关方法在声纹识别中的有效性[11]。在未来工作中,我们将继续探索其在其他任务中的效果,深入挖掘对抗样本在语音相关任务中的潜力。


论文链接:https://ieeexplore.ieee.org/abstract/document/8788563



扫描获取论文原文


参考文献:

[1].Chan, William, Navdeep Jaitly,Quoc Le, and Oriol Vinyals. "Listen, attend and spell: A neural network for large vocabulary conversational speech recognition." In 2016 IEEEInternational Conference on Acoustics, Speech and Signal Processing (ICASSP),pp. 4960-4964. IEEE, 2016.

[2].Carlini, N. and Wagner, D.,2018, May. Audio adversarial examples: Targeted attacks on speech-to-text. In2018 IEEE Security and Privacy Workshops (SPW) (pp. 1-7). IEEE.

[3].Qin, Y., Carlini, N., Cottrell,G., Goodfellow, I. and Raffel, C., 2019, May. Imperceptible, Robust, and Targeted Adversarial Examples for Automatic Speech Recognition. In International Conference on Machine Learning (pp. 5231-5240).

[4].Komkov, S., Petiushko, A.,2019. AdvHat: Real-world adversarial attack on ArcFace Face ID system. arXivpreprint arXiv: 1908.08705.

[5].Sun, S., Yeh, C.F., Ostendorf,M., Hwang, M.Y. and Xie, L., 2018. Training Augmentation with Adversarial Examples for Robust Speech Recognition. Proc. Interspeech 2018, pp.2404-2408.

[6].Wang, X., Sun, S., Shan, C.,Hou, J., Xie, L., Li, S. and Lei, X., 2019, May. Adversarial Examples forImproving End-to-end Attention-based Small-footprint Keyword Spotting. In ICASSP 2019-2019 IEEE International Conference on Acoustics, Speech and SignalProcessing (ICASSP) (pp. 6366-6370). IEEE.

[7].Miyato, T., Maeda, S.I.,Koyama, M. and Ishii, S., 2018. Virtual adversarial training: a regularizationmethod for supervised and semi-supervised learning. IEEE transactions onpattern analysis and machine intelligence, 41(8), pp.1979-1993.

[8].Bu, H., Du, J., Na, X., Wu, B.and Zheng, H., 2017, November. Aishell-1: An open-source Mandarin speech corpus and a speech recognition baseline. In 2017 20th Conference of the Oriental Chapter of the International Coordinating Committee on Speech Databases andSpeech I/O Systems and Assessment (O-COCOSDA) (pp. 1-5). IEEE.

[9].Du, J., Na, X., Liu, X. and Bu,H., 2018. AISHELL-2: Transforming Mandarin ASR Research Into Industrial Scale. arXiv preprint arXiv:1808.10583.

[10].Park, D.S., Chan, W., Zhang,Y., Chiu, C.C., Zoph, B., Cubuk, E.D. and Le, Q.V., 2019. Specaugment: A simpledata augmentation method for automatic speech recognition. arXiv preprintarXiv:1904.08779.

[11].Qing Wang, Pengcheng Guo,Sining Sun, Lei Xie, John H.L. Hansen, Adversarial Regularization for End-to-end Robust Speaker Verification, Interspeech2019, 16-19 September,2019, Graz, Austria