对于语音增强任务,干扰信号通常被认为是加性噪声。对于室内声学场景,由于声波遇到障碍时会反射和吸收,因此会导致原始语音产生多份衰减和延迟的加和,从而产生混响现象。对于语音增强任务,目标即为去除噪声干扰,而对于去混任务,其目标为消除晚期混响(Late reverberation),从而保留早期反射(Early reflection)和直达声(Direct sound)这些被认为对可懂度和音质有帮助的成分。针对基于深度学习的语音前端处理,由于其能从海量仿真数据中学习到从带噪语音到干净语音的映射,因此其降噪效果,尤其是对非平稳噪声的抑制,相比于传统信号模型有明显的提升。
西工大音频语音与语言处理研究组(ASLP@NPU)近年来致力于基于深度学习的语音前端处理方向的研究。此前已针对基于深度学习的单通道语音增强,推出了DCCRN[1]、DCCRN+[2]以及面向超宽带的S-DCCRN[3]等模型,针对多通道语音增强、分离及去混问题推出了DESNet[4]等模型,效果显著。
近期,实验室和搜狗AI交互事业部(现腾讯PCG)针对单通道语音增强任务提出了Uformer模型,其相关论文"Uformer: A Unet Based Dilated Complex & Real Dual-path Conformer Network for Simutaneous Speech Enhancement and Dereverberation"被语音研究顶级会议ICASSP2022接收。Uformer以Unet为骨架,使用混合Encoder和Decoder架构来同时对复数谱和幅度谱进行建模。此外Uformer使用Encoder Decoder注意力机制(Encoder Decoder Attention)来学习到每一层Encoder和Decoder之间的相关性。更为重要的是,Uformer将在语音识别任务中表现突出的Conformer模型进行复数化改进,并使用双路注意力机制来分别进行局部时序和频带建模,即Dilated dual-path conformer,该模块还使用带洞卷积来扩大感受野以进行全局时序建模。Uformer在Interspeech2021 DNS Challenge盲测集上获得了与该当年竞赛第一名模型SDD-Net[5]相当的效果,同时相比于SDD-Net的多阶段训练,Uformer采用了完全端到端的简洁训练流程,可控性和稳定性更高。
论文题目:Uformer: A Unet Based Dilated Complex & Real Dual-path Conformer Network for Simutaneous Speech Enhancement and Dereverberation
作者列表:付艺辉,刘允,李劲东,罗大为,吕术博,琚雨恺,谢磊
论文原文:https://arxiv.org/pdf/2111.06015.pdf

发表论文截图

扫码直接看论文
近年来,基于深度学习的语音增强逐渐成为研究热点。此前很长一段时间,研究者只对幅度谱进行增强,而在语音重构时使用带噪语音的相位谱[6]。这种方法通常会造成一定量的语谱损伤。近年来,研究者开始尝试采用复数谱,对输入语音频谱的实部和虚部同时进行建模,能够获得更高的理论上限,从而逐渐成为研究的热点方向[7]。但此前工作没有对这两个域的特征进行联合优化以发掘其潜在的内部联系。此外,基于深度学习的多通道语音去混亦取得了长足进步[7]。然而由于空间信息的缺失,在单通道场景下的语音去混亦充满了挑战。另一方面,从Transformer[9]模型进化而来的Conformer[10]模型因其强大的时序建模能力而在端到端语音识别任务上取得了优异效果。Conformer模型包含两个主要模块:自注意力机制和卷积层来分别进行全局和局部时序建模。然而对于语音前端处理模型,不同于语音识别模型,我们不能只关注时序信息而忽略频带信息,因为不同频带包含不同的能量和信息,需要更精细化的建模方式。因此研究者对自注意力机制进行了双路(Dual-path)改造[11],即在时频两个维度分别进行注意力机制学习。本文将Conformer和Dual-path思想进行了结合并加以改进以获得更强大的时频建模能力。
如图1所示,Uformer包含Encoder、Decoder和Dilated dual-path conformer三个主要的模块。Encoder通过卷积层的堆叠以学习到语音的高维特征,Decoder通过反卷积层的堆叠以将高维特征映射到与输入相同维度。每层Encoder和Decoder都使用了Hybrid Encoder and Decoder架构来同时进行复数谱和幅度谱的建模和信息融合,每层Encoder和Decoder之间都使用了Encoder Decoder Attention机制来学习到对应层之间的相关性。对于Dilated dual-path conformer,其主要包含四个主要模块:两层全连接层(feed forward, FF)、时序注意力(time attention, TA),频带注意力(frequency attention, FA)和带洞卷积(dilated convolution, DC)。
图1 Uformer结构
复数Self Attention:在复数self attention中,我们将对输入复数特征进行如下式所示的运算以对实部和虚部分别进行注意力机制计算:
Dilated Dual-path Conformer:该模块结构如图2所示。FF模块主要用于特征维度压缩和复原,并使用了半残差连接来避免梯度消失。TA模块通过对当前帧与历史/未来帧信息进行拼接并在时间轴上进行实/复数self attention计算,以建模局部时序特征。FA模块通过对不同频带进行实/复数self attention计算,以建模频率信息。DC模块通过对包含带洞卷积的TCN[12]模型进行改造以进行全局时序特征建模。具体改造方法为将两个带洞卷积的膨胀系数(Dilation)取反以进行不同感受野联合建模。
图2 Dilated dual-path conformer结构
Hybrid Encoder and Decoder:由于Uformer需要同时处理复数谱和幅度谱特征进行建模,因此我们提出该模块以实现两个域之间的信息交互:
Encoder Decoder Attention:传统方法为了防止梯度消失,一般会对对应的Encoder和Decoder层进行跳连(Skip connection)。但我们认为该方法并不能很好地学习到Encoder和Decoder的相关性信息。因此我们使用注意力机制来加强建模能力。首先我们对对应Encoder和Decoder层的输出分别通过实/复数二维卷积以学习到高维特征并进行加和及通过Sigmoid函数,随后通过第三层实/复数二维卷积以学习到Sigmoid mask并作用于原始Decoder层输出上。我们将该特征与Encoder层输出进行拼接作为下一层Decoder的输入:

损失函数:在对模型输出的复数和幅度特征进行融合后,我们使用对时域SI-SNR、时域L1loss、幅度谱L2loss和复数谱L2loss损失函数联合优化的策略:
在实验中,我们使用的干净人声数据包括LibriTTS、AISHELL-3、DNS竞赛语音数据和MUSDB的清唱部分,共1050小时。噪声数据包括MUSAN、DNS竞赛噪声数据、MUSDB的音乐部分、MS-SNSD等,共260小时。RIR我们使用镜像法仿真,RT60范围为0.2至1.2秒。信噪比为-5至15dB。所有训练数据均为动态随机混合生成。测试数据使用与上述数据集同源而无重叠,按[-5,0]、[0,5]和[5,10]三个信噪比区间分别进行仿真。此外我们还采用Interspeech2021 DNS竞赛官方盲测集作为另一个测试集。我们使用PESQ、eSTOI、DNSMOS和MOS作为测试指标。实验结果如表1所示。Uformer无论在客观指标还是主观听感上均优于所有之前效果突出的复数谱模型(DCCRN、DCCRN+)及时域模型(TasNet[12]、DPRNN[13]),显示了其强大的增强和去混能力。Uformer也获得了与Interspeech2021 DNS竞赛第一名模型SDD-Net几乎一致的效果。但相比SDD-Net多步训练的配置,Uformer的训练实现了完全端到端,过程更简单可控易复现。此外消融实验证明了提出的包括dilated dual-path conformer、hybrid Encoder and Decoder及Encoder Decoder attention在内的所有子模块均有其明显的贡献。
表1 Uformer及其对比模型的主客观指标

Uformer处理结果

SDD-Net处理结果

第二组
带噪语音(高混响场景)

Uformer处理结果

SDD-Net处理结果

第三组(街道场景实录语音)
带噪语音

Uformer处理结果

第四组(食堂场景实录语音)
带噪语音

Uformer处理结果

更多样例详见
https://felixfuyihui.github.io/Uformer-Demo/
[1] Yanxin Hu, Yun Liu, Shubo Lv, Mengtao Xing, Shimin Zhang, Yihui Fu, Jian Wu, Bihong Zhang, and Lei Xie, "DCCRN:Deep complex convolution recurrent network for phase-awarespeech enhancement," Interspeech, pp. 2472–2476, 2020.[2] Shubo Lv, Yanxin Hu, Shimin Zhang, and Lei Xie, "DCCRN+:Channel-wise subband dccrn with snr estimation for speech enhancement," Interspeech2021[3] Shubo Lv, Yihui Fu, Mengtao Xing, Jiayao Sun, Lei Xie, Jun Huang, Yannan Wang and Tao Yu, " S-DCCRN: SUPER WIDE BAND DCCRN WITH LEARNABLE COMPLEX FEATURE FOR SPEECH ENHANCEMENT," ICASSP2022[4] Yihui Fu, Jian Wu, Yanxin Hu, and Lei Xie. DESNet: A Multi-Channel Network for Simultaneous Speech Dereverberation, Enhancement and Separation, 2021 IEEE Spoken Language Technology Workshop (SLT). IEEE, 2021: 857-864.[5] Andong Li, Wenzhe Liu, Xiaoxue Luo, Guochen Yu, ChengshiZheng, and Xiaodong Li, "A simultaneous denoising and dereverberation framework with target decoupling," arXiv preprintarXiv:2106.12743, 2021.[6] Yuxuan Wang, Arun Narayanan, and DeLiang Wang, "On training targets for supervised speech separation," IEEE/ACMTransactions on Audio, Speech, and Language Processing, vol.22, no. 12, pp. 1849–1858, 2014.[7] Donald S Williamson and DeLiang Wang, "Time-frequencymasking in the complex domain for speech dereverberation anddenoising," IEEE/ACM Transactions on Audio, Speech, andLanguage Processing, vol. 25, no. 7, pp. 1492–1501, 2017.[8] Hideaki Kagami, Hirokazu Kameoka, and Masahiro Yukawa,"Joint separation and dereverberation of reverberant mixtureswith determined multichannel non-negative matrix factorization," ICASSP2018.[9] Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N Gomez, Lukasz Kaiser, and IlliaPolosukhin, "Attention is all you need," Advances in neuralinformation processing systems, vol. 30, 2017.[10] Anmol Gulati, James Qin, Chung-Cheng Chiu, Niki Parmar, Yu Zhang, Jiahui Yu, Wei Han, Shibo Wang, Zhengdong Zhang, Yonghui Wu, and Ruoming Pang, "Conformer:Convolution-augmented transformer for speech recognition," arXiv preprint arXiv:2005.08100, 2020.[11] Feng Dang, Hangting Chen, and Pengyuan Zhang, "Dptfsnet: Dual-path transformer based full-band and sub-band fusion network for speech enhancement," arXiv preprintarXiv:2104.13002, 2021.[12] Yi Luo and Nima Mesgarani, "Conv-tasnet: Surpassing idealtime–frequency magnitude masking for speech separation,"IEEE/ACM Transactions on Audio, Speech, and LanguageProcessing, vol. 27, no. 8, pp. 1256–1266, 2019.[13] Yi Luo, Zhuo Chen, and Takuya Yoshioka, "Dual-Path RNN:efficient long sequence modeling for time-domain singlechannel speech separation," ICASSP2020