本文由知乎作者Oliver投稿,采用第一人称视角撰写
语音增强技术已经发展了好多年了,但是目前各说各的好或者是技术保密。那么现在语音增强技术到底发展到一种什么程度了呢?未来的趋向又在什么地方?

2022年入职后,在mentor的指导下我开始真正接触语音增强,从初探传统降噪算法WebRTC ANS,到复现RNNoise、DTLN、DCCRN等经典AI降噪模型,再到后面跟进DNS Challenge、AEC Challenge、SSI Challenge、URGENT Challenge、ICASSP、Interspeech等赛事会议上的SOTA模型,自己也算是见证了这段时间以来语音增强领域的发展。

按照我自己的认识,我会对过去的发展做一个这样的分类(大体上按照时间排序,但是发展是多轨的,不同类别在时间上会有重合):

  • 第一类:传统降噪算法(维纳滤波、基于MMSE的噪声功率估计,优雅),比如WebRTC ANS、OMLSA;
  • 第二类:过渡的AI降噪算法(传统前后处理+AI模型,突出一个设计感),比如RNNoise、PercepNet;
  • 第三类:高纯度的AI降噪算法(基础结构逐渐稳定为CRN,元器件上有大力上Transformer、Mamba的,也有精致雕琢出轻量的),比如SEMamba、GTCRN;
  • 第四类:个性化AI降噪算法(融合个人语音特征,主打私人订制),比如TEA-PSE、pBSRNN;
  • 第五类:回声消除和降噪算法(不满足降噪,延时估计、线性回声、非线性回声我都想要),比如MTFAA、DeepVQE;
  • 第六类:通用语音增强(融合降噪、去混响、修复等多项任务,不仅要丢不想听的,还要补得好听),比如EDNet、TS-URGENet;
  • 第七类:空间语音增强(结合多麦、波束形成等空间硬件/算法做语音增强),比如H-GTCRN;

不考虑当下的实用性,只讲理想,在我心中,真正的AI应该是通用的,而不是限制于一小项任务,所以对这所谓的七类,我最感兴趣的其实是“通用语音增强”。这类算法,有几个方向还是挺有意思的。

Mapping

⏩EDNet

标题:EDNet: A Distortion-Agnostic Speech Enhancement Framework with Gating Mamba Mechanism and Phase Shift-Invariant Training

论文地址:https://arxiv.org/abs/2506.16231v1

发布日期:2025-06-19

AI降噪通常可以分为两类:masking和mapping。前者假设噪声具有加性,模型通常要求输出取值范围[0, 1]的mask,降噪频谱=带噪频谱×mask,输出可控;后者直接通过模型估计降噪频谱,理论上适用性更广,但是输出可控性要差一些,比如语音失真。单从降噪效果来看,masking更好,用的也更广泛。但是现在任务要求不仅要去的漂亮,还要补的好听,怎么办呢?可以考虑把masking和mapping结合一下,优势互补。不过EDNet这模型只是在内部特征处理使用这个混合方法,decoder的输出只用了mapping。


EDNet模型结构

这个模型有两个分支,一个分支输入幅度谱,经过encoder->GM-Blocks->decoder,输出去噪和修复的幅度谱;另一个分支输入建模难度较大的相位谱(之所以要和幅度谱分开,有一个认可度比较高的说法是,相位谱建模难度大,放一起会影响幅度谱的建模),经过 encoder->concat->TF-Mamba(可以视作TF-GRU这类操作,Mamba这里就不展开了)->decoder->PSIT,encoder后面接concat是因为幅度谱和相位谱存在内在联系,引入幅度谱的中间特征可以协助相位谱建模,输出去噪和修复的相位谱后再用PSIT做一次校正;增强的幅度谱和相位谱结合后做iSTFT即可输出增强波形。


训练过程,数据包含多项失真:噪声、混响、频带缺失。损失函数是一个很全面的组合:PESQ-based GAN 鉴别器loss+幅度谱loss+相位loss+时域loss+复数谱loss+一致性loss。值得一提的是,一致性loss认为模型输出偏离了STFT域,所以先做iSTFT然后再做STFT,再计算loss会更加合理。


GM-Block结构

独立对比降噪、去混响、频带扩展三个任务,EDNet都能达到SOTA水准。



⏩TS-URGENet

标题:TS-URGENet: A Three-stage Universal Robust and Generalizable Speech Enhancement Network

论文地址:https://arxiv.org/abs/2505.18533

发布日期:2025-05-27

TS-URGENet由GTCRN的作者提出,参加了Interspeech 2025 URGENT Challenge,最终获得了赛道一的第二名,厉害!单个模型做一堆任务可能有点勉强,可以分成多个阶段一步步来完善,这就是其核心思想。



TF-GridNet整体结构

DNN模块结构

TS-URGENet包含三个阶段:

  • 第一阶段采用GAN based TF-GridNet-S填充丢包造成的不连续性;
  • 第二阶段采用TF-GridNet-L降噪、去混响;
  • 第三阶段采用GAN based CWS-TF-GridNet做频带扩展、伪影消除和丢包补偿(CWS,channel-wise subband);

TS-URGENet整体结构


Flow Matching

⏩USEMamba

标题:Universal Speech Enhancement with Regression and Generative Mamba

论文地址:https://arxiv.org/abs/2505.21198

发布日期:2025-10-01

修复任务要求在原有的信号上添加东西,可视作生成任务。目前,扩散模型(Diffusion Models)和流匹配(Flow Matching)都是生成任务的有效解决方案。前者的一种经典实现是Score-based DDPM,限制了采样概率路径的选择(反向去噪过程),导致训练时间过长,且采样效率低;后者的一种经典实现是CFM(C代表条件),也需要从随机噪声多次迭代才能得到目标信号,但不需要前向加噪,而且后向推理过程仅需64~128步,更高效。

CFM背后的数学原理比较复杂,但是可以从简单的角度进行理解。


这篇文章中CFM采用的模型结构来自SEMamba(同一个作者的另一篇论文《An Investigation of Incorporating Mamba for Speech Enhancement》)。该模型大体构造和MP-SENet相近,亮点在于中间信息建模的TF-Mamba,最后幅度谱采用masking降噪,效果和MP-SENet相近,不过计算量更低,有完整的开源工程,大家可以体验下。


SEMamba模型结构

USEMamba在SEMamba的基础上引入了4项改动,但不包含CFM:

  • 损失函数优化;
  • masking转mapping;
  • STFT和iSTFT引入SFI(不同于常规STFT固定win_size和hop_size的点数,SFI要求固定时长,这样不同采样率下的频谱帧数一致,仅频谱长度不同,后续网络需要适配这种变化);
  • 增加TF-Mamba的层数;

如果在USEMamba的基础上引入CFM,就变成了图示的USEMamba-Flow。前者生成效果有限,后者会生成噪声,评分低,所以在实际运行过程中,需要配合能量检测自适应切换。


USEMamba(实线)和USEMamba-Flow(实线+虚线)模型结构

该模型在URGENT 2025 Challenge的盲测阶段获得了赛道一第二名,很厉害!


Vocoder

通用语音增强的一大难点是相位恢复,一类有效的方法是分两阶段:首先增强mel谱,然后利用vocoder恢复完整波形。前者可以用mapping的方法来实现,后者可以参考Hifi-GAN来实现。

⏩VoiceFixer

标题:VoiceFixer: Toward General Speech Restoration with Neural Vocoder

开源地址:https://github.com/haoheliu/voicefixer

发布日期:2021-10-05

VoiceFixer就是这个方向的一种经典实现:第一阶段使用ResUNet加强mel谱(Restoration Mask由ReLU输出,属于mapping),第二阶段使用TFGAN恢复mel谱为波形,具体信息可以看下面的图,画得很清晰。从我自己测试的结果来看,VoiceFixer整体听感比较自然,但是会削弱一次谐波附近能量,造成音色变化,并且有时候会丢帧。


VoiceFixer整体结构

分析阶段模型结构

合成阶段模型结构

⏩AI Codec

AI Codec的经典流程是:编码(encoder)-残差矢量量化(RVQ,如果不熟悉,推荐看下What is Residual Vector Quantization?)-解码(decoder)。“基于AI Codec的方式做通用语音增强”这个方向还比较新颖,论文也提到还在探索阶段,目前流行的做法是在RVQ和decoder之间加入一个模型用于预测加强信号的离线令牌(分类任务)。结合论文里的阐述,我觉得这样做有两个优势:

  • 效果优势:相比连续域回归型SE,离散域分类型SE(根据失真信号令牌,估计加强信号令牌)理论上能处理更多失真,泛化性更强,更加灵活;
  • 功能优势:支持云服务端做实时SE。

⏩UDSE

标题:Universal Discrete-Domain Speech Enhancement

论文地址:https://arxiv.org/abs/2510.09974

发布日期:2025-10-11

失真音频通过编码器+RVQ,得到量化特征(码表的索引组合),与编码特征结合后,经过一个令牌估计器(使用模型来做RVQ),然后通过解码器得到加强音频。

实际训练过程可以简化描述为:

  1. 神经语音编解码器训练:让编解码器学会将语音高效量化为离散令牌,同时保证令牌解码后的语音保真度;
  2. UDSE 核心模块训练:冻结编解码器参数后,仅训练特征处理器和令牌预测器;

UDSE模型结构

对比其他SOTA模型,UDSE在各种任务上都表现优异。


⏩Improving DF-Conformer Using Hydra

标题:Improving DF-Conformer Using Hydra For High-Fidelity Generative Speech Enhancement on Discrete Codec Token

论文地址:https://arxiv.org/abs/2511.02454

发布日期:2025-11-04

这篇文章针对Genhancer提出改进措施:Latent Denoiser和Token Generator的模型都源自DF-conformer,其中的FAVOR+存在注意力聚焦能力弱、特征多样性降低、语义混淆问题,可以替换为DC-Hydra(基于Mamba的一个模型结构)。另一个重点就是这条执行链路。


Genhancer模型结构

总 结

进入音频信号处理这个行业已经有三年了,“让用户听到的音频更好听”一直是我的目标(虽然这么讲有点官方)。”删除干扰,补充缺失“这样的混合型任务——通用语音增强,无疑是离目标更近的一步。根据目前的调研,我能看到多个方向的发展,并且这些成果达到的效果也还不错,内心还是十分开心的~


本文作者


Oliver,浙江大学信息与通信工程硕士,在直播、语音通讯等场景拥有三年音频3A算法优化和落地经验。


参考资料: