近期上海交通大学听觉认知与计算声学实验室,联合美国卡内基梅隆大学CMU和日本电报电话公司NTT,合作的论文“Module-Based End-to-End Distant Speech Processing: A Case Study of Far-Field Automatic Speech Recognition”被信号处理领域顶级期刊 IEEE Signal Processing Magazine(SPM)接收。该论文系统性梳理了针对远场语音识别问题的近期研究进展,包括端到端和基于模块的远场语音识别系统,并对远场语音处理领域的未来挑战进行了展望。


远场语音处理是语音和音频信号处理领域中的一项关键任务,对语音技术在嘈杂环境中的实际应用具有重要意义。传统研究通常将其分解为多个子问题来逐一解决,包括对输入语音进行信号增强、特征提取以及文字转录。这种研究思路促进了模块化(Modular)的远场自动语音识别(Distant Automatic Speech Recognition,DASR)系统的发展,它通常设计为多级串联结构(如语音增强与分离→特征提取→语音识别),每一级对应特定的子问题。
另一方面,近年来深度学习技术的突飞猛进极大推动了端到端(End-to-End,E2E)系统的兴起,不同于模块化系统,它仅由单个大型神经网络构成(Monolithic),并完全通过数据驱动的方式完成整个DASR任务。
此外,还存在第三种能够结合两者特点的设计范式,本文称之为模块化端到端(E2E modular)系统。它在架构设计上保持模块化的形式,串联的每个子模块对应特定的子问题,而在训练时则采用端到端系统的黑盒优化方式,仅利用最终模块的训练准则优化整个系统。
它兼具前两种范式的优点,展现出较大应用潜力。本文将概述基于上述三种设计范式的DASR系统的最新发展,重点介绍基于模块的系统,并分别展示基于模型和数据驱动的语音信号处理在下游应用中的成功案例。


Module-Based End-to-End Distant Speech Processing: A Case Study of Far-Field Automatic Speech Recognition

作者列表:常烜恺,Shinji Watanabe,Marc Delcroix,Tsubasa Ochiai,张王优,钱彦旻
合作单位:卡内基梅隆大学,日本NTT公司,上海交通大学
论文原文:https://ieeexplore.ieee.org/document/10819672


背景动机

人类与生俱来的听觉能力使我们能够从复杂的声音场景中捕捉并理解各种信息源。例如,著名的“鸡尾酒会效应”指的是人类听觉系统能在如同鸡尾酒会一般的复杂环境(存在干扰人声、背景噪声、混响等)中专注于特定对话[1],或追踪周围环境中的任意声音。语音和音频处理研究的目标之一便是设计能够接近这种人类听觉能力的技术。在嘈杂多变的实际应用中,干扰人声、噪声、混响等因素成为实现上述目标的重要阻碍,而远场语音处理便是克服这些阻碍的关键研究领域。在本文中,我们以远场自动语音识别(DASR)[2]为例进行综述,旨在梳理现有研究中的三种主流设计范式及其优劣,为后续研究和实际应用提供有价值的参考。相关结论应能推广至其他类似的远场语音和音频处理任务,如说话人识别、情感识别、音频事件检测等。


概 览

为解决DASR这类复杂问题,早期研究通常采用“分而治之”的思想,先将其分解为若干个更简单的子问题,并为每个子问题设计特定模块加以解决,再通过将这些子问题的模块结合起来,便能构造足以解决完整复杂问题的模块化系统。例如,DASR系统可以分为以下三个模块[3](值得一提的是,每个模块还可以进一步由多个子模块组成),每个模块单独进行设计和优化:
1) 基于语音分离和增强(Speech Separation and Enhancement,SSE)的前端模块:从输入的混合语音信号中提取干净语音。
2) 特征提取(Feature Extraction,FE)模块:为语音信号提取包含丰富信息的特征,使其更适配下游任务。
3) 基于自动语音识别(Automatic Speech Recognition,ASR)的后端模块:将语音特征序列转换为文字序列,得到转录结果。

上述每个模块均可以根据下列方法进行设计:
1)基于模型的方法(Model-based approach):如基于问题中的物理原理进行数学设计。
2)数据驱动的方法(Data-driven approach):如深度学习。
3)混合方法(Mixed approach):上述两种方法的结合。

上述设计的优点包括:① 能够显式利用理论模型、关于子问题的物理知识、或者特定领域的有标注数据分别进行设计和高效优化,泛化性通常较好;② 每个模块具有较好可解释性,能够单独进行评估,便于调试和针对性优化;③在部署时,每个模块可以灵活地进行单独改动或替换,而不会对系统其他模块的功能产生影响。相应地,上述设计也具有缺点:① 由于采用模块化设计,系统组成较为复杂,每个子模块在设计时均要求一定的专家知识;② 不同模块的优化准则各异,容易产生冲突和失配,导致次优的最终性能。
另一方面,得益于近年来深度学习技术和海量数据的发展,端到端系统应运而生。不同于上述模块化设计,它仅采用单个大型神经网络的架构,通过在大量数据上进行训练,实现直接将输入语音转换为文本转录,而没有显式的前端信号处理过程。这种设计的优点包括:① 设计简单,对专家知识要求较低;② 优化过程简单,仅需考虑最终准则作为优化目标,不存在优化目标冲突问题。但它也具有一些缺点:① 高度依赖充足的训练数据,相较于模块化系统,过拟合问题更严重;② 由于采用黑盒式的端到端优化,可解释性差,难以有效利用特定子问题的数据进行优化,难以引入专家知识,缺少模块化系统的灵活性。
最后,作为上述两种设计范式的拓展,模块化端到端系统逐渐受到关注。在架构上,它遵循模块化系统的设计理念,为不同子问题设计相应的模块,保持可解释性;在训练优化时,它则采用了端到端系统的训练方式,仅利用最终模块的训练准则对整个系统进行联合优化。它结合了前两种设计范式的优势,并允许对不同模块进行联合优化,从而克服传统模块化系统的模块间失配问题。最早的相关研究可以追溯到21世纪初[4]。

问题描述




上述第一种和第三种设计范式的系统可以统一用图1表示。前者为每个模块设计单独的优化准则,仅负责相应模块的参数更新;而后者采用最终模块的优化准则同时更新所有模块的参数。如前文所提到的,每个模块可以采用基于模型的方法、数据驱动的方法、混合方法三者中的任意一种进行设计。


方法综述
模块化系统

端到端系统

在DASR问题中,端到端系统通常在标准语音识别方法的基础上针对抗噪鲁棒性、多说话人语音干扰等主要影响因素进行改进。在单麦克风通道场景下,典型的方法包括多风格训练[2]、领域对抗训练[15]等。在多麦克风通道场景下,常见的方法有多通道特征[16]、基于多通道输入的网络架构设计[17]等。针对存在多说话人干扰的场景,主流的多说话人语音识别方法包括基于排列不变性训练(Permutation Invariant Training,PIT)[18]和序列化输出训练(Serialized Output Training,SOT)[19]的方法。

端到端模块化系统

a.现有方法。与模块化系统类似,该系统通常由前端模块、特征提取模块和语音识别后端模块组成,但为了解决前文所提到的模块化系统在模块间失配问题上的不足,其训练过程则采用了端到端系统的设计,即仅利用最终的语音识别训练准则对所有模块进行联合优化,同时保持每个模块的可解释性与功能。为了实现这一点,现有研究通常采用基于混合方法设计的前端模块,如基于神经网络的波束形成器、基于神经网络的加权预测误差(Weighted Prediction Error,WPE)去混响算法等[4][20],借助其强误差容忍度和泛化能力,确保在利用语音识别准则进行联合优化的过程中保持原有的信号增强功能。此外,在优化过程中还可能面临训练稳定性问题,因为涉及多个模块的同时优化,在特定模块中的梯度更新可能由于不稳定的数值运算(如复数矩阵求导)而出现极端梯度,导致训练不稳定甚至无法收敛。现有研究通常可采用对角加载项、掩码底值、优化运算算子等多项技术[21]来缓解上述问题。这类系统目前已在单说话人[20]和多说话人场景[22]中均得到了验证,并进一步拓展至将基于预训练模型的特征提取模块引入联合优化过程中[23],取得了显著性能提升。

b.未来挑战。尽管在较为简单的单人和固定人数的多人场景下取得了较好系统,这类系统在更复杂场景下仍然存在局限性:① 在处理更自然的对话场景(如会议、多人晚餐等)时,将需要进一步对系统模块进行拓展,加入说话人日志和长音频处理能力,这类拓展不仅将同时增加计算和内存开销,也对系统的架构设计和参数优化带来更大挑战;② 系统的实时性也面临挑战,因为多模块级联式的架构难以避免地增加了系统延迟(即后一模块必须等待前一模块完成处理),而端到端系统则可以通过网络架构优化有效规避这一问题,因此还有待进一步探索;③ 在训练数据方面,直接应用真实数据训练上述系统是可行的,但相比于单人数据,真实的多通道多人混合语音数据通常较为稀缺,如何有效弥补由于数据分布不均衡带来的性能下降和泛化性问题,以及提高对不同质量训练数据的鲁棒性,将是未来亟待解决的挑战。


实验案例

表2展示了上述介绍的三类系统在CHiME-4基准数据集上的单通道和多通道语音处理性能,采用了SDR、STOI和PESQ来评估语音信号增强的性能(越大越好),采用了词错误率(Word Error Rate,WER)来评估语音识别的性能(越小越好),其中Monolithic行的结果对应端到端系统,联合优化(Joint-Optimization)一栏为✓的结果对应模块化端到端系统,其余行的结果对应模块化系统。
在单通道场景下,可以得出以下几个关键发现:1)端到端系统的语音识别性能显著优于缺少联合优化的模块化系统;2)模块化端到端系统引入的联合训练能够显著提升模块化系统的语音识别性能;3)将系统中的特定模块更新为具有更强性能的结构(如将FBank特征替换为WavLM),能够进一步改善语音识别性能;4)采用联合优化后,前端模块的信号增强能力受到较大影响,呈现出显著下降。
在多通道场景下同样能观察到上述类似的现象,如将BeamformIt替换为Mask-based MVDR、将FBank替换为WavLM,均能显著提升模型的信号增强/语音识别性能。值得注意的是,在多通道场景下经过联合优化后,前端模块的信号增强性能并没有出现单通道场景下类似的显著下降。这是由于此处前端模块所采用的神经波束形成方法是基于混合方法设计,具有较好鲁棒性;而单通道情况下所采用的则是数据驱动的Conv-TasNet方法,难以在仅采用语音识别准则优化时保证信号增强性能。


总 结

本文概述了远场语音识别技术的研究进展,它是基于模型和数据驱动的音频信号处理技术的重要下游应用。本文将远场语音识别系统分为模块化系统、端到端系统和模块化端到端系统三类设计范式,并着重探讨了基于模块的两类系统,详细讨论了针对不同子问题设计的模块,如语音信号增强、特征提取和自动语音识别。本文进一步梳理了每个子模块的代表性方法,通常可分为基于模型的方法、数据驱动的方法以及混合方法三类。此外也分析了不同设计范式的优缺点,重点关注模块化端到端系统的鲁棒性。这些方法的适应能力凸显了其解决存在多说话人的远场语音识别问题的潜力。然而,模块化端到端系统的未来发展仍然面临许多挑战,包括庞大的模型架构、复杂的优化流程以及训练数据的可用性和质量等。
最后,为了实现涵盖完整听觉场景的综合机器听觉能力,未来研究需要在远场语音处理之外,进一步考虑各种非语音的音频事件以及融合多模态信息。这包括针对性处理关键的音频成分(如声音和音乐事件),每个成分都将需要专门的处理模块。一个潜在的研究方向是通过整合在音频信号处理中已被广泛研究的现成声音和音乐事件模块,以及其他模态(如视频和传感器数据)的处理模块,来扩展模块化端到端远场语音处理系统的功能。


参考文献

[1] E. C. Cherry, “Some experiments on the recognition of speech, with one and with two ears,” The Journal of the Acoustical Society of America, vol. 25, no. 5, pp. 975–979, 1953.

[2] R. Haeb-Umbach, J. Heymann, L. Drude, S. Watanabe, M. Delcroix, and T. Nakatani, “Far-field automatic speech recognition,” Proceedings of the IEEE, vol. 109, no. 2, pp. 124–148, 2021.

[3] R. Haeb-Umbach, S. Watanabe, T. Nakatani, M. Bacchiani, B. Hoffmeister, M. L. Seltzer, H. Zen, and M. Souden, “Speech processing for digital home assistants: Combining signal processing with deep-learning techniques,” IEEE Signal Processing Magazine, vol. 36, no. 6, pp. 111–124, 2019.

[4] M. L. Seltzer, B. Raj, and R. M. Stern, “Likelihood-maximizing beamforming for robust hands-free speech recognition,” IEEE Transactions on Speech and Audio Processing, vol. 12, no. 5, pp. 489–498, 2004.

[5] S. Boll, “Suppression of acoustic noise in speech using spectral subtraction,” IEEE Transactions on Acoustics, Speech, and Signal Processing, vol. 27, no. 2, pp. 113–120, 1979.

[6] B. D. Van Veen, and K. M. Buckley, “Beamforming: A versatile approach to spatial filtering,” IEEE ASSP Magazine, vol. 5, no. 2, pp. 4–24, 1988.

[7] S. Choi, A. Cichocki, H.-M. Park, and S.-Y. Lee, “Blind source separation and independent component analysis: A review,” Neural Information Processing-Letters and Reviews, vol. 6, no. 1, pp. 1–57, 2005.

[8] D. Wang, and G. J. Brown, “Computational auditory scene analysis: Principles, algorithms, and applications,” Wiley-IEEE Press, 2006.

[9] W. Jiang, and K. Yu, “Speech enhancement with integration of neural homomorphic synthesis and spectral masking,” IEEE/ACM Trans. ASLP., vol. 31, pp. 1758–1770, 2023.

[10] S. Watanabe, M. Mandel, J. Barker, E. Vincent, et al., “CHiME-6 challenge: Tackling multispeaker speech recognition for unsegmented recordings,” in Proc. 6th International Workshop on Speech Processing in Everyday Environments (CHiME 2020), 2020, pp. 1–7.

[11] H. Hermansky, D. P. Ellis, and S. Sharma, “Tandem connectionist feature extraction for conventional HMM systems,” in Proc. IEEE ICASSP, 2000, pp. 1635–1638.

[12] A. Mohamed, H.-y. Lee, L. Borgholt, J. D. Havtorn, J. Edin, C. Igel, K. Kirchhoff, S.-W. Li, K. Livescu, L. Maaløe, T. N. Sainath, and S. Watanabe, “Self-supervised speech representation learning: A review,” IEEE Journal of Selected Topics in Signal Processing, vol. 16, no. 6, pp. 1179–1210, 2022.

[13] G. Hinton, L. Deng, D. Yu, G. E. Dahl, A.-r. Mohamed, N. Jaitly, A. Senior, V. Vanhoucke, P. Nguyen, T. N. Sainath, and B. Kingsbury, “Deep neural networks for acoustic modeling in speech recognition: The shared views of four research groups,” IEEE Signal Processing Magazine, vol. 29, no. 6, pp. 82–97, 2012.

[14] J. Li, “Recent advances in end-to-end automatic speech recognition,” APSIPA Transactions on Signal and Information Processing, vol. 11, no. 1, 2022.

[15] Y. Shinohara, “Adversarial multi-task learning of deep neural networks for robust speech recognition,” in Proc. ISCA Interspeech, 2016, pp. 2369–2372.

[16] N. Kanda, Y. Fujita, S. Horiguchi, R. Ikeshita, K. Nagamatsu, and S. Watanabe, “Acoustic modeling for distant multi-talker speech recognition with single-and multi-channel branches,” in Proc. IEEE ICASSP, 2019, pp. 6630–6634.

[17] F.-J. Chang, M. Radfar, A. Mouchtaris, B. King, and S. Kunzmann, “End-to-end multi-channel transformer for speech recognition,” in Proc. IEEE ICASSP, 2021, pp. 5884–5888.

[18] M. Kolbaek, D. Yu, Z. H. Tan, and J. Jensen, “Multitalker speech separation with utterance-level permutation invariant training of deep recurrent neural networks,” IEEE/ACM Trans. ASLP., vol. 25, no. 10, pp. 1901–1913, 2017.

[19] N. Kanda, Y. Gaur, X. Wang, Z. Meng, and T. Yoshioka, “Serialized output training for end-to-end overlapped speech recognition,” Proc. ISCA Interspeech, pp. 2797–2801, 2020.

[20] T. Ochiai, S. Watanabe, T. Hori, and J. R. Hershey, “Multichannel end-to-end speech recognition,” in Proc. ICML, 2017, pp. 2632–2641.

[21] W. Zhang, X. Chang, C. Boeddeker, T. Nakatani, S. Watanabe, and Y. Qian, “End-to-end dereverberation, beamforming, and speech recognition in a cocktail party,” IEEE/ACM Trans. ASLP., vol. 30, pp. 3173–3188, 2022.

[22] X. Chang, W. Zhang, Y. Qian, J. Le Roux, and S. Watanabe, “MIMO-Speech: End-to-end multi-channel multi-speaker speech recognition,” in Proc. IEEE ASRU, 2019, pp. 237–244.

[23] Y. Masuyama, X. Chang, W. Zhang, S. Cornell, Z.-Q. Wang, N. Ono, Y. Qian, and S. Watanabe, “Exploring the integration of speech separation and recognition with self-supervised learning representation,” in Proc. IEEE WASPAA, 2023, pp. 1–5.