语音增强(Speech Enhancement)技术旨在提升语音的可懂度和质量,在实时语音通信、音质修复等诸多场景中具有举足轻重的作用。近来,以语言模型(Language Model)为基础的生成式(Generative)语音增强技术在语音质量和去噪能力上,相比传统的判别式语音增强模型表现出了优势。然而,现有的生成式语音增强模型存在诸如增强前后说话人音色甚至是内容改变的问题;而传统的判别式语音增强模型则存在任务扩展性较为局限,不同任务模型之间能力难以迁移的问题等。因此,如何有效地激发语言模型在语音增强领域的泛化能力的同时拥有和传统判别式模型可比的语音保留能力,是当前研究的一大挑战。

最近,西工大语音与语言处理研究组(ASLP@NPU)与香港科技大学(HKUST)、华为合作撰写了论文“LLaSE-G1: Incentivizing Generalization Capability for LLaMA-based Speech Enhancement”,针对上述问题开展了深入研究,提出了一种简洁高效的的基于LLaMA框架和Xcodec2的生成式语音增强框架,名为LLaSE-G1,是首个开源的多任务生成式语音增强模型,并在多项子任务上达到了SOTA的水平,并表现出对于未见任务的涌现能力和推理扩展能力。现对该框架进行简要的解读和分享。


论文题目:LLaSE-G1: Incentivizing Generalization Capability for LLaMA-based Speech Enhancement
作者列表:康博意*,朱新发*,张子晗*,叶蓁,刘铭帅,王子谦,朱毅可,马国斌,陈鋆,肖龙帅,翁超,雪巍,谢磊
合作单位:香港科技大学,华为
论文预印版:https://arxiv.org/pdf/2503.00493
Demo Page:https://submission-papers.github.io/LLaSE-G1-demo-page/
代码:https://github.com/Kevin-naticl/LLaSE-G1
模型:https://huggingface.co/ASLP-lab/LLaSE-G1


为什么做?

语言模型的强大能力

近年来,大型语言模型(Large Language Model, LLM)在人工智能关键领域取得了突破性进展,显著推动了自然语言处理、计算机视觉以及语音处理等技术的快速发展[1,2]。在NLP领域,LLM通过创新的预训练和后训练范式,不仅重新定义了文本生成的技术基准,更在少样本学习和零样本学习场景中展现出卓越的性能。与此同时,在语音处理领域,香港科技大学联合西北工业大学等单位最新发布的语音生成模型LLaSA[3],通过将LLM与兼顾语义和声学信息的Xcodec2语音编码器技术相结合,成功突破了语音生成的性能瓶颈,达到了当前的SOTA水平。这一系列成果充分证明了LLM在跨领域应用中的巨大潜力和强大的泛化能力。
Llasa:语音合成也遵循Scaling Law,太乙真人“原声放送”讲解论文


基于语言模型的语音增强

语音增强(SE)是语音处理领域的一类基本任务,旨在从带噪语音中去除干扰并分离和重建干净的目标语音,广义的语音增强任务包括噪声抑制(Noise Suppression,NS)、目标说话人提取(Target Speaker Extraction)、丢包补偿(Packet Loss Concealment)、声学回声消除(Acoustic Echo Cancelation)和语音分离(Speech Separation)等任务。
现有的语音增强模型可以分为传统的判别式模型和基于LM和Diffusion等的生成式模型。基于LM的生成式判别式模型近来表现出了强于判别式模型的去噪能力和理解能力,例如实验室首次将离散Token和LM引入语音增强的SELM和最近发表在ICLR2025上的GenSE[4,5]。 尽管基于LM的SE方法在语义理解和上下文建模方面表现出色,但它们可能忽视了保留声学信息的关键作用,导致增强后的语音在声学表现上不一致,比如说话人音色发上改变,并且在不同SE任务中的泛化能力有限。此外,大多数生成式SE模型专注于单一任务(如噪声抑制),这限制了它们在不同SE任务中的泛化能力。而正是LM在诸多领域的强大泛化能力,让我们看到了一个单一生成式模型解决多种语音增强任务的可能性。
ICASSP2024 | SELM: 基于离散表征和语言模型的语音增强
ICLR2025 | GenSE: 基于层次化建模的生成式语音增强


激发语言模型在增强上的泛化能力

为了解决上述问题,本文提出了LLaSE-G1,一个基于LLaMA架构的模型,旨在激励语音增强任务的泛化能力。LLaSE-G1结构分享简单,通过使用WavLM的连续表示作为输入,并预测 X-Codec2 的语音Token,最大化声学信息的保留。此外,LLaSE-G1引入了双通道输入和输出,统一了多个SE任务,而不需要任务特定的ID。LLaSE-G1在多个SE基准测试中优于现有的特定任务判别式和生成式SE模型,展示了在测试时的扩展能力和对未见SE任务的涌现能力。


怎么做?

LLaMA为基础的极简架构

LLaSE-G1 创新性地采用单一 LLaMA 架构的语言模型,充分发挥其强大的泛化能力,实现多种语音增强任务的统一处理。如图 1 所示,相较于传统判别式模型的复杂结构,LLaSE-G1 采用了极简设计,仅包含三个核心模块:
  • WavLM 编码器:负责从带噪语音中提取连续语音特征
  • 基于 LLaMA 的语言模型:以连续语音特征作为输入,预测目标语音的Token
  • X-codec2 解码器:根据预测的Token重建出增强后的语音信号

图1 LLaSE-G1 结构图

最大化声学保留
当前主流的生成式语音增强模型普遍采用Codec编码器或基于自监督学习(SSL)模型来获取原始语音的离散Token。然而,我们认为现有生成式语音增强方案在音色保真度方面的不足,根源在于离散Token的信息缺失问题。相比之下,连续语音特征具有更丰富的信息量,能够从根本上解决这一技术瓶颈。此外,我们采用了香港科技大学最新研发的X-Codec2编解码器,其创新性地将语义和声学特征集成到统一的码本中,不仅确保了音频信号的一维因果依赖性,还完整保留了传统一维语义Token所无法捕捉的声学细节。这种设计充分契合了音频信号固有的时序结构特性。基于以上分析,我们采用连续特征表征作为模型输入,并将X-Codec2提取的语音Token作为语言模型的建模目标。


多增强任务统一

LLaSE-G1 的损失函数设计针对不同语音增强任务进行了精细化优化:在NS、PLC和AEC任务中,采用单监督学习策略,通过交叉熵损失函数直接约束模型预测结果与目标语音之间的匹配度;在 TSE 任务中,分别对干扰说话人和目标说话人进行独立建模和优化,以实现更精确的说话人分离效果;此外,我们将 SS 任务作为模型训练过程中未见过的测试场景,用以全面验证模型在零样本学习条件下的泛化能力和鲁棒性。


效果如何?

我们采用动态生成数据对模型进行训练,其中包含约5000小时的纯净语音数据,包括中文,英文,德语,西班牙语,法语等语言,噪声数据包括1000小时,覆盖街道、办公室、车站等各种场景。在测试集的选择上,我们主要采用微软公司主办的语音增强系列竞赛的官方测试集作为benchmark。具体而言,针对不同的语音处理任务,我们分别选取了最具代表性的测试集:对于NS任务,采用DNS Challenge 2020竞赛测试集;对于PLC任务,使用PLC Challenge 2022竞赛测试集;对于TSE任务,选用DNS Challenge 2023竞赛测试集;对于AEC任务,采用AEC Challenge 2023竞赛测试集;对于SS任务,则同时使用Libri2Mix和WSJ0-2mix两个广泛使用的测试集进行综合评估。在测试指标上,也采取与竞赛对齐的指标,包括微软提供的DNSMOS,PLCMOS,AECMOS等工具。同时通过基于SSL模型的SpeechBERTScore和Cosine Similarity来评估处理音频的语义和音色相似度。


SOTA的表现

表 1 展示了提出的 LLaSE-G1 与几种最先进的判别式和生成式模型的对比结果。"With Reverb" 列表示包含混响的测试集,而 "No Reverb" 列表示不包含混响的测试集。结果表明,生成式噪声抑制模型在去噪性能上始终优于判别式模型,尤其是在混响条件下。通过单次推理,LLaSE-G1 已经超越了大多数其他系统。经过多次推理后,其性能进一步提升,在无混响测试集上取得了 3.49 的 OVRL 分数,在有混响测试集上取得了 3.42 的 OVRL 分数,达到了当前SOTA的水平。表2-4则展示了我们提出的LLaSE-G1在训练数据中包含的PLC,TSE,AEC任务上与现有SOTA模型的对比,结果表明,LLaSE-G1在其他任务上也达到了超越或者与现有SOTA模型可比的效果。

表1 DNS测试集上的结果


表2 PLC盲测集上的结果


表3 TSE盲测集上的结果


表4 AEC盲测集上的结果


良好的涌现与扩展效应

如表5所示,SS任务并未包含在训练数据中,我们使用它来测试LLaSE-G1的涌现能力。与其他判别式方法相比,我们基于LLaMA的LLaSE-G1展现了显著的涌现能力。通过多次推理,我们的生成模型在测试集上的OVRL分数分别达到了3.17和3.25,优于判别式方法,展示了LLaSE-G1超越任务特定优化并无缝适应新任务的潜力。

表5 Zero-shot的语音分离任务结果


如表 6 所示,我们对比了基线系统和 LLaSE-G1 在语义和说话人相似性方面的表现。需要注意的是,TSE和AEC任务是在盲测集上测试的,这些数据集中没有真实的目标语音作为参考,因此我们仅对噪声抑制NS、PLC和SS任务进行了评估。LLaSE-G1 在生成式语音增强模型中表现优异,尽管在语义相似性(SBS)得分上相比判别式模型略低,这表明 LLaSE-G1 能够有效保留语音内容。此外,LLaSE-G1 在 NS 任务中取得了最高的说话人相似度(SimWB) 分数,在 PLC 和 SS 任务中也表现出具有竞争力的 SimWB 分数,展示了其卓越的声学保留能力。

表6 在各种任务语义和说话人相似度上的结果


如图 2 所示,增加推理时间几乎在所有任务中都提升了模型性能。对于AEC和TSE任务,性能在第二次推理后达到峰值,其中EMOS从4.42提升至4.52,DMOS从3.82上升至3.91。相比之下,PLC任务在增加推理时间后表现出显著的性能提升,PLCMOS从3.67上升至4.30,OVRL从3.03提升至3.27,增幅高达25%。对于NS任务,OVRL分数在no_reverb数据集上从3.42增加至3.49,在with_reverb数据集上从3.33上升至3.42。这些结果表明,增加测试时的计算资源最初会提升性能,但随后由于声学失真的累积,性能会有所下降。


图2 在各种任务上的inference-time scaling结果


失败的尝试

在实验设计过程中,我们原本计划基于语言模型的泛化能力,通过单一输出通道实现多任务统一输出。这种设计理念旨在利用LM的自主判断能力,使其能够识别任务类型并确定相应的输出目标。然而,在具体任务实施过程中,我们发现AEC和TSE任务中参考音频的功能存在本质性差异:在TSE任务中,参考音频作为目标语音的音色参考,而在AEC任务中,参考音频则用于引导模型消除与之相似的噪声成分。这种功能上的对立性导致模型在训练过程中产生显著的混淆,特别是在LM能力相对有限的情况下,模型难以实现有效收敛。

为解决这一问题,我们最终采用了双通道Token输出策略。具体而言,我们定义通道1为与参考音频相关联的音频输出通道,通道2则为与参考音频无关的音频输出通道。通过这种策略,TSE任务的输出被明确分配至通道1,而AEC、NS、PLC和SS等任务的输出则统一分配至通道2。这种分通道输出策略不仅有效解决了不同任务间参考音频功能的冲突问题,同时实现了多任务输出的系统化统一。


完整样例请查看Demo Page:https://submission-papers.github.io/LLaSE-G1-demo-page/


参考文献

[1] OpenAI. 2024. Gpt-4 technical report. Preprint, arXiv:2303.08774.

[2] Michael Tschannen, Cian Eastwood, and Fabian Mentzer. 2024. Givt: Generative infinite-vocabulary transformers. Preprint, arXiv:2312.02116.

[3] Zhen Ye, Xinfa Zhu, Chi-Min Chan, Xinsheng Wang, Xu Tan, Jiahe Lei, Yi Peng, Haohe Liu, Yizhu Jin, Zheqi DAI, Hongzhan Lin, Jianyi Chen, Xingjian Du, Liumeng Xue, Yunlin Chen, Zhifei Li, Lei Xie, Qiuqiang Kong, Yike Guo, and Wei Xue. 2025. Llasa: Scaling train-time and inference-time compute for llama-based speech synthesis. Preprint, arXiv:2502.04128.

[4] Jixun Yao, Hexin Liu, Chen Chen, Yuchen Hu, EngSiong Chng, and Lei Xie. 2025. Gense: Generative speech enhancement via language models using hierarchical modeling. ICLR2025, arXiv:2502.02942.

[5] Ziqian Wang, Xinfa Zhu, Zihan Zhang, YuanJun Lv, Ning Jiang, Guoqing Zhao, and Lei Xie. 2024. Selm: Speech enhancement using discrete tokens and language models. ICASSP2024, arXiv:2312.09747.