近日,在全球音频技术顶尖会议ICASSP 2022举办的AEC Challenge(Acoustic Echo Cancellation Challenge)回声消除比赛中,快手音视频技术团队在近端单讲音质、远端单讲回声消除、双讲音质和回声消除、语音识别准确率等各项指标中均跻身世界前三,综合得分斩获世界亚军。此外,在ICASSP 2022会议中,快手在深度噪声抑制DNS(Deep Noise Suppression)领域的两篇论文被接收,这也标志着快手在该领域的先进性得到学界的持续认可。
https://www.microsoft.com/en-us/research/academic-program/acoustic-echo-cancellation-challenge-icassp-2022/#!results图:快手在AEC Challenge比赛中,夺得世界亚军
ICASSP(International Conference on Acoustics, Speech and Signal Processing)即国际声学、语音与信号处理会议,是由IEEE主办的全世界最大、最全面的信号处理及其应用方面的顶级会议,涵盖了音频和声学信号处理,图像、视频和多维信号处理等多个方向。01 AEC Challenge|快手斩获世界亚军
在视频会议、直播连麦、语音聊天等实时通讯领域,回声一直是影响通话音质的关键问题。回声是如何产生的?主要是设备播放的声音被声音采集系统收集并传到通话远端导致的。如果处理不当,会产生通话者听到自己的回声、对端说话人语音严重失真和剪切等问题。回声消除算法就是解决此类问题的关键技术。近年来,网络通信、娱乐行业高速发展,加上疫情影响,实时通讯在全球范围内的需求量空前高涨,顺畅的实时通讯体验变得尤为重要。本次AEC Challenge(Acoustic Echo Cancellation Challenge)回声消除比赛是由音频技术顶级会议(International Conference on Acoustics, Speech, and Signal Processing, ICASSP)与微软公司联合举办。本次大赛的评估指标较往届有着一定变化,在近端单讲、远端单讲和双讲场景下的Mean Opinion Scores (MOS)或Degradation Mean Opinion Scores (DMOS)的主观音质分数的基础上,新增了语音识别率指标作为客观评估标准。最终成绩以各项主、客观指标的综合分数为准,这意味着参赛队伍在进行回声消除任务时,既要保证良好的主观听感,也要保证语音能够被智能系统精准识别,因此双指标挑战既是难点,也是亮点。此外,本次比赛采用的测试数据统一使用48kHz超宽带采样率,相比以往的16kHz采样率,有着更高的基础音质,但对系统的复杂度、模型的泛化能力都带来了极大挑战。
为了实现以上目标,快手音频团队搭建了一种传统信号处理和深度学习相结合的回声消除系统,使用高鲁棒性的传统信号处理算法,融合最新的深度学习网络(CrossNet),提出了兼具去回声、降噪、保证语音音质的算法。为了处理48kHz超宽带音频信号,本系统提出了一种高低频融合的网络结构,在不显著增加计算复杂度的同时,保证低频基础音质,同时带来高频语音的清晰透亮。为了提升系统泛化能力,并同时保证主观听感和语音识别,快手音频团队使用大量语音数据(1,000小时左右的纯净语音、100多个小时的各类噪声、5,000个设备的真实回声数据等),结合最新研发的兼顾主观听感和语音识别准确率指标的损失函数,实现了业界顶尖的AEC主、客观指标成绩。在快手收集的评估AEC指标测试集中,本系统在近端单讲、远端单讲、双讲等多种场景下客观语音质量评估(Perceptual evaluation of speech quality, PESQ)指标取得平均1分以上的提升,回声反馈损失增强(Echo Return Loss Enhancement, ERLE)达到55dB以上,语音识别误码率(Word Error Rate, WER)平均达到15%以下。在大赛评估的近端单讲音质、远端单讲回声消除、双讲音质和回声消除、语音识别准确率等各项指标中,快手均跻身世界前三名,最终在这场世界级高手云集的比赛中获得亚军。本项技术目前已经上线了快手旗下K歌App回森,在K歌录制、K歌打分和歌房场景中,极大提升了用户在音质上的体验。音频团队也期待将最新研究成果应用在更多场景中,如直播连麦、会议系统等,不断升级用户体验。噪声抑制一直是音频处理领域广受关注的问题,在实时通讯、音视频生产等多个领域均有极大需求,具有极高价值。近年来,基于深度学习的噪声抑制技术成为了业界研究的热点。在本次ICASSP会议中,快手音频团队在深度噪声抑制DNS(Deep Noise Suppression)领域的两篇论文:《A TWO-STEP BACKWARD COMPATIBLE FULLBAND SPEECH ENHANCEMENT SYSTEM》和《L-SPEX: LOCALIZED TARGET SPEAKER EXTRACTION》均被收录。《A TWO-STEP BACKWARD COMPATIBLE FULLBAND SPEECH ENHANCEMENT SYSTEM》
作者:Xu Zhang, Lianwu Chen, Xiguang Zheng, Xinlei Ren, Chen Zhang, Liang Guo and Bing Yu提出了一种48kHz采样率超宽带语音增强系统。相比已有算法基于感知特征的单个模型语音增强方法,本项工作基于快手音频团队在全球顶级语音会议INTERSPEECH 2021上提出的宽带(wideband)降噪模型( “Low-Delay Speech Enhancement Using Perceptually Motivated Target and Loss,” in Interspeech 2021, Aug. 2021),提出了一种两步学习系统。在保证后向兼容已有宽带降噪模型的基础上,利用宽带模型的增强语音信号辅助全带(fullband)语音增强。《L-SPEX: LOCALIZED TARGET SPEAKER EXTRACTION》
作者:Meng Ge, Chenglin Xu, Longbiao Wang, Eng Siong Chng, Jianwu Dang and Haizhou Li现实生活中,目标说话人的语音往往混杂着噪声和干扰人声。为了去掉噪声和干扰人声,目标说话人提取技术应运而生,该技术的关键在于能够模仿人的听觉注意力机制,从多个混叠的说话人音频中提取特定的目标说话人。对此,快手联合天津大学、新加坡南洋理工大学和新加坡国立大学提出了一种自定位目标说话人的多麦克风提取技术——L-SPEX,不同于其他基于视频信息的方式,该技术仅通过参考目标说话人嵌入(target speaker embedding)信息定位到目标说话人,从而获得目标说话人方位和波束形成输出等空间特征,然后根据获得的空间提示和说话人嵌入信息,生成音频注意力信息,最终实现特定说话人的语音提取。该方法相比于基线方案有着极大提升。快手音频团队的深度噪声抑制技术目前已上线快手APP、快手极速版、快影、一甜相机等多个应用,极大提升了快手用户在实时通讯、视频生产等场景的用户体验。