Interspeech 是由国际语音通讯协会组织的语音处理领域旗舰国际会议,作为全球最大的综合性语音处理领域的科技盛会,历届Interspeech会议都备受全球学术界和工业界的广泛关注。第26届Interspeech大会将于2025年8月17日至21日在荷兰鹿特丹隆重举行。

分享西工大音频语音与语言处理研究组(ASLP@NPU)中稿的11篇论文,论文的合作单位包括南洋理工大学、字节跳动、华为、中国电信、长安汽车、理想汽车、希尔贝壳、华为云、爱奇艺、极氪汽车等。


EASY: Emotion-aware Speaker Anonymization via Hierarchical Disentanglement

作者列表:姚继珣,刘和鑫,Eng-Siong Chng,谢磊

合作单位:南洋理工大学

论文摘要:情感在语音交互中扮演着至关重要的角色。通过语调、音高和节奏等属性的变化,情感使我们能够传达超越语言本身的感受与意图,从而营造出更具个性化的交流体验。然而,目前大多数说话人匿名化系统采用的是并行解耦的方法,仅将语音划分为语言内容和说话人身份两个部分,往往忽略了对原始情感状态的保留。在本研究中,我们提出了 一个具备情感感知能力的说话人匿名化框架EASY。EASY 引入了一种全新的顺序解耦机制,依次分离说话人身份、语言内容和情感表示,利用因子化蒸馏策略,在不同的子空间中分别建模这些语音属性。通过对说话人身份和情感表示的独立约束,EASY 在最大程度保护隐私的同时,保留了语音的语言内容和原始情感状态。在 VoicePrivacy Challenge 官方数据集上的实验结果表明,EASY 在保护说话人隐私的同时,显著优于所有基线系统,且更好地保留了语音中的语言信息与情感表达。

论文预印版:https://arxiv.org/pdf/2505.15004


Selective Invocation for Multilingual ASR: A Cost-effective Approach Adapting to Speech Recognition Difficulty

作者列表:薛鸿飞,唐玉峰,张骏,耿雪龙,谢磊

合作单位:字节跳动

论文摘要:尽管多语种自动语音识别(ASR)系统已经取得了显著进展,能够使单一模型处理多种语言,但固有的语言差异和数据不平衡问题仍然对各语言的最先进性能构成挑战。虽然语种识别(LID)模型可以将语音路由到相应的ASR模型,但如果调用各语种最先进的商业模型,这种方法往往会伴随着高昂的成本,并且由于误分类,准确性也受到影响。为了解决这些问题,我们提出了SIMA——一种基于输入语音难度自适应选择性调用的多语种ASR方法。SIMA构建于语音大语言模型(SLLM)之上,能够评估输入语音是否足够简单,适合直接转录,或是否需要调用最先进的对应语种的ASR模型。与SLLM直接转录相比,我们的方法将词错误率降低了18.7%,且与基于LID的方法相比,调用成本减半。对三个数据集的测试结果表明,SIMA是一种可扩展、具有成本效益的多语种ASR应用解决方案。

论文预印版:https://arxiv.org/abs/2505.16168


Delayed-KD: Delayed Knowledge Distillation based CTC for Low-Latency Streaming ASR

作者列表:李龙豪、李泱泽、薛鸿飞、刘杰、方帅、王凯、谢磊

合作单位:华为云

论文摘要:基于 CTC 的流式自动语音识别(ASR)在实际应用中备受关注,但仍面临两大挑战:小块(chunk)条件下的准确率下降以及固有的令牌发射延迟问题。为缓解这些问题,我们提出了一种延迟知识蒸馏方法(Delayed-KD),该方法在非流式教师模型与流式学生模型之间进行 CTC 后验概率的延迟蒸馏。具体而言,在极小的 chunk 条件下,我们引入时序对齐缓冲区(TAB)——通过设定相对于非流式教师模型的相对延迟范围,有效对齐了 CTC 输出,并缓解了非空白令牌的误匹配问题。此外,TAB 还能实现对令牌发射延迟的细粒度控制。在 178 小时的 AISHELL-1 和 1 万小时的WenetSpeech 普通话数据集上的实验表明,Delayed-KD 始终具有优越性。令人印象深刻的是,在仅40 毫秒延迟的设定下,Delayed-KD 在 AISHELL-1 数据集上实现了5.42%的字符错误率(CER),与在320 毫秒延迟下运行的强基线模型 U2++ 性能相当。

论文预印版:https://arxiv.org/abs/2505.22069


Contextualized Automatic Speech Recognition with Dynamic Vocabulary Prediction and Activation

作者列表:林振楠*、黄凯勋*、任伟*、杨林举、谢磊

合作单位:长安汽车

论文摘要:神经网络偏置(Deep Biasing)通过引入上下文短语提升了自动语音识别(ASR)的性能。然而,大多数现有方法将上下文短语中的子词视为独立单元进行增强,这可能会破坏上下文短语的整体性,从而降低识别准确率。为了解决这一问题,本文提出了一种利用动态词表预测与激活的基于编码器的上下文语音识别方法。我们在架构上进行了优化,并引入了偏置损失函数,以扩展基于帧级输出的短语级上下文预测。此外,本文还提出了一种置信度激活解码方法,可在抑制错误偏置的同时,确保上下文短语的完整输出。在LibriSpeech和Wenetspeech两个数据集上的实验结果表明,与基线系统相比,所提出方法在整体词错误率(WER)上分别实现了28.31%和23.49%的相对降低,在上下文短语上的WER相对降低幅度分别达到了72.04%和75.69%。

论文预印版:https://arxiv.org/abs/2505.23077


Towards Robust Overlapping Speech Detection A progressive Speaker-Aware Method Using WavLM

作者列表:孙照凯,张丽,王晴,周盼,谢磊

合作单位:理想汽车

论文摘要:重叠语音检测(OSD)旨在识别对话中多个说话人同时说话的区域,这是多方语音处理中的一个关键难题。本研究提出了一种基于说话人信息的渐进式OSD模型,利用渐进式训练策略加强语音活动检测(VAD)和重叠检测等子任务之间的关联。为了提升语音特征表示效果,我们尝试使用先进的自监督学习(SSL)模型,如WavLM和wav2vec 2.0,并加入说话人注意力模块,以引入帧级的说话人信息来丰富特征。实验结果表明,该方法在AMI测试集上达到了82.76%的F1分数,表现出良好的稳健性和有效性。

论文预印版:http://arxiv.org/abs/2505.23207


AISHELL-5:The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition

作者列表:戴宇航、王贺、李星辰、张子晗、王水源、谢磊、徐昕、郭泓霄、张绍极、卜辉、陈伟

合作单位:希尔贝壳、理想汽车

论文摘要:本文介绍了AISHELL-5,这是首个开源的车载多通道、多说话人普通话自动语音识别(ASR)数据集。AISHELL-5 包含两个部分:超过 100 小时的多通道语音数据,这些语音是在电动车内、60 多种真实驾驶场景下录制的。音频数据包括四路远场语音信号(由分别安装在车门上的麦克风采集),以及近场语音信号(由每位说话人佩戴的高保真耳麦录制)。约 40 小时的真实环境噪声录音,用于车载语音数据的模拟。此外,我们还提供了一个开源、可复现的基线系统,基于该数据集构建。该系统包括一个语音前端模型,利用语音源分离技术从远场信号中提取出每位说话人的清晰语音,以及一个语音识别模块,用于准确转写每位说话人的语音内容。实验结果展示了多种主流 ASR 模型在 AISHELL-5 数据集上面临的挑战。我们相信,AISHELL-5 能够推动在车载领域复杂驾驶场景下的语音识别研究。

论文预印版:http://arxiv.org/abs/2505.23036


FlowSE: Efficient and High-Quality Speech Enhancement via Flow Matching

作者列表:王子谦,刘子楷,朱新发,朱毅可,刘铭帅,陈君,肖龙帅,翁超,谢磊

合作单位:华为

论文摘要:本文提出了一种新型语音增强模型FlowSE,基于流匹配(Flow Matching)框架,旨在解决当前生成式语音增强方法中的两大挑战:语言模型方法存在量化损失,影响语音的自然度与可懂度;扩散模型则训练与推理过程复杂,延迟高,难以实时应用。FlowSE通过学习噪声语音到干净语音的连续映射,实现在mel频谱域上的高质量增强,显著降低推理延迟。模型核心采用基于DiT(Diffusion Transformer)的速度场预测网络,可选地结合文本信息辅助建模,增强模型在低信噪比条件下的表现。实验在DNS Challenge和仿真数据集上验证了其优越性:FlowSE不仅在语音质量、说话人相似度和识别准确率方面超过现有主流方法,还在推理速度上具备显著优势(实时因子RTF低至0.31)。

论文预印版:https://arxiv.org/abs/2505.19476


U-SAM: An audio language Model for Unified Speech, Audio, and Music Understanding

作者列表:王子谦,夏咸军,朱新发,谢磊

合作单位:字节跳动

论文摘要:本文提出U-SAM,一种统一的音频语言模型,旨在解决现有模型在语音、通用音频和音乐理解方面的泛化能力不足问题。U-SAM结合了三种专用音频编码器(Whisper、CED、MERT)以提取多尺度特征,并通过查询引导的Q-Former压缩表示。其核心组件包括:1)任务感知投影模块(TAPM),基于Mixture of Experts机制,根据任务文本提示动态融合不同编码器特征;2)语义感知对比损失模块(SACLM),通过重要性评分与三元组对比学习,增强音频与文本间的语义对齐。此外,U-SAM将所有音频任务统一视为文本生成问题,利用冻结的大语言模型(如LLaMA)进行推理。实验表明,U-SAM在语音识别、语音翻译、音频和音乐总结生成等多个基准任务上均优于现有最先进模型,且在未见任务上展现出迁移泛化能力,验证了其作为通用音频语言理解框架的潜力。

论文预印版:https://arxiv.org/abs/2505.13880


Weakly Supervised Data Refinement and Flexible Sequence Compression for Efficient Thai LLM-based ASR

作者列表:邵明辰,朱新发,王成有,穆秉甡,李海,闫影,刘俊晖,谢丹铭,谢磊

合作单位:爱奇艺

论文摘要:尽管在低资源场景下自动语音识别(ASR)取得了显著成果,但仍面临两大挑战:高质量数据的稀缺性和巨大的计算开销。本文提出了 EThai-ASR——首个将大语言模型(LLM)应用于泰语 ASR 并构建高效 LLM 驱动 ASR 系统的方案。EThai-ASR 包括语音编码器、连接模块和泰语 LLM 解码器三个部分。为了解决数据稀缺问题并获得更强大的语音编码器,我们引入了一种自我演化的数据精炼策略,可对弱标注数据进行迭代精炼,从而产出性能更优的编码器。此外,在连接模块中我们设计了一个可插拔的序列压缩模块,提供三种压缩模式,以在保持良好识别性能的前提下大幅缩短序列长度、降低计算需求。大量实验证明,EThai-ASR 在多个数据集上已达到最新的SOTA水平。

论文预印版:http://arxiv.org/abs/2505.22063


Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis

作者列表:徐天翼,陈虹洁,王晴,吕航,康健,李杰,林振楠,李永翔,谢磊

合作单位:中国电信

论文摘要:大规模的训练语料库极大地提高了自动语音识别(ASR)模型的性能。而由于数据相对匮乏,中文口音和方言仍然是大多数自动语音识别模型面临的挑战。自我监督学习的最新进展表明,自我监督预训练与大型语言模型(LLM)相结合,可以有效提高低资源场景下的 ASR 性能。本文目的是研究这种范式对汉语方言的有效性。具体来说,我们在 30 万小时的无标注方言和重音语音数据上对 Data2vec2 模型进行预训练,并在 4 万小时的有监督数据集上进行对齐训练。然后,本文系统地检验了在此范式下各种投影仪和 LLM 对普通话、方言和重音语音识别性能的影响。本文的方法在包括 Kespeech 在内的多个方言数据集上取得了 SOTA 结果。我们将开源我们的工作。

论文预印版:https://arxiv.org/abs/2505.21138


CabinSep: IR-Augmented Mask-Based MVDR for Real-Time In-car Speech Separation with Distributed Heterogeneous Arrays

作者列表:韩润铎,胡炎鑫,付艺辉,张子晗,琚雨恺,陈立,谢磊

合作单位:极氪汽车

论文摘要:对于高效车载人机语音交互系统,从多说话人重叠语音中分离独立语音片段并定位对应说话人位置至关重要。本文提出轻量级 CabinSep,基于神经网络掩码的最小方差无失真响应(neural mask-based MVDR)语音分离系统,有效提升后端 ASR 系统语音识别准确性。主要贡献如下:1)设计高效利用音频空间信息的网络结构,无需复杂多通道麦克风阵列,降低硬件成本;2)采用训练阶段独立优化神经网络预测掩码、推理阶段应用 MVDR 的策略,在保证语音分离精度与降噪量的同时减少语音失真,利好ASR任务 ;3)提出融合实录 IRs 与仿真 IRs 的数据增广方法,显著提升“模糊音区”语音分离与定位精度。实验表明,相较于之前的 SOTA 车载语音分离系统 DualSep,本方案计算复杂度仅为其 26%(共0.4 GMACs),实录数据集上语音识别错误率降低 17.5%。