全国人机语音通讯学术会议(National Conference on Man-Machine Speech Communication, NCMMSC)是中国计算机学会(CCF)和中国中文信息学会(CIPS)联合主办的我国语音科学与技术领域极具影响力的重要学术会议。2026年会议正式进入CCF推荐学术会议列表(C类),标志着会议的学术影响力、组织水准与成果质量获得权威认可。2026年盛会将于2026年11月5日至8日在珠海横琴举行。本届会议以“语音×语言×多模态:迈向智能交互新范式”为主题。在人工智能大模型的驱动下,语音技术、自然语言处理与多模态智能正深度融合。会议将紧扣这一前沿趋势,重点聚焦语音大模型、多模态交互、情感与认知计算、信息无障碍等方向,推动语音技术从“感知与合成”向“认知理解与智能交互”跨越升级。本届盛会ASLP实验室共有9篇论文录用,将在会议上交流,论文内容涉及语音识别与理解、语音合成、语音大模型等方向。
更多会议信息请见会议网站:http://www.ncmmsc.org.cn/
01
论文题目:Summary of the ChinaVoices Challenge 2026: Data, Tasks, Baseline, and Methods
作者列表:廖育杰、穆秉甡、王水源、薛浏蒙、刘和鑫、石宪、胡捷、谢磊
合作单位:南京大学、南洋理工大学、慧听科技
论文摘要:本文总结了中文多方言语音处理挑战赛 ChinaVoices Challenge 2026,该挑战赛旨在为中文方言语音处理建立统一的任务定义和评测条件,推动多方言识别与自动语音识别(ASR)的发展。挑战赛覆盖 16 个方言类别,设置两个任务:中文多方言识别与中文多方言 ASR,使用约 320 小时语音数据(分为 Reference Set、Open Evaluation Set 和 Hidden Evaluation Set)。两个任务共用同一评测音频,且各含受限数据与开放数据两个赛道。论文描述了任务设置、数据、评测指标及 Qwen3-ASR-1.7B 基线系统,并分析排行榜结果与参赛系统。共 28 支队伍提交结果,17 支提交技术报告,15 支队伍的系统通过合规审查纳入分析。大多数合格系统超越基线,官方前三名在 Hidden Evaluation Set 上排名保持不变。方言级结果显示识别准确率较高的方言通常 ASR 错误率较低,但两个任务考察的是相关而不同的能力。领先的识别系统普遍利用方言判别性声学表征,领先的 ASR 系统则强调数据规范化、增广和辅助 CTC 目标。
竞赛官网:https://aslp-lab.github.io/ChinaVoices-Challenge
Github 项目:https://github.com/ASLP-lab/ChinaVoices-Challenge
论文预印版:https://arxiv.org/abs/2609.03471
02
论文题目:DiTAR+: Dual Optimization for Robust Autoregressive Diffusion Speech Synthesis
作者列表:张子萸、左天伦、李函昭、张皓宇、谢磊
论文摘要:连续潜空间自回归扩散Transformer(AR-DiT)模型在零样本语音生成领域展现出了巨大潜力。然而,在合成长语音或复杂语言结构时,这些模型仍面临解码稳定性不足的问题。这种不稳定性主要源于扩散解码器内部受限的历史感受野以及对声学惯性的依赖,导致模型忽略了语义条件。为应对这些挑战,我们提出了双重优化框架DiTAR+。首先,我们引入了“扩张上下文采样”(Dilated Context Sampling)技术,在不破坏物理时间连续性的前提下扩大宏观历史感受野,从而防止累积误差的传播。其次,我们提出了“分层声学掩码”(Hierarchical Acoustic Masking)策略,阻止浅层网络关注声学前置上下文,从而显式地将语义对齐与声学细节重构解耦。大量实验表明,该框架能有效减少发音错误和语义幻觉,增强模型在复杂句子生成中的鲁棒性,并在长语音生成的全过程中保持极高的说话人相似度。在语言难度较高的ZH-Hard测试集上,DiTAR+将词错误率从12.478%降低至9.893%;而在25至35秒的长语音生成任务中,该模型在将词错误率从2.778%降至2.173%的同时,将说话人相似度从0.741提升至0.759,性能优于离散Token(discrete-token)和纯流匹配(pure flow-matching)基线模型。
Demo Page:https://ziyuzhang020511.github.io/DiTAR_plus/
论文预印版:https://arxiv.org/abs/2609.13909
03
论文题目:On-Policy Self-Distillation for Multi-Dialect ASR: Mastering Dialects, Retaining Mandarin
作者列表:王水源、穆秉甡、张鹏燊、王成有、廖育杰、梁成栋、张彬彬、丰强泽、谢磊
合作单位:WeNet开源社区、数据堂
论文摘要:当前大规模自动语音识别(ASR)模型已具备优异的普通话识别准确率,同时拥有一定的汉语方言识别能力,但在真实场景语音中,其方言识别准确率仍存在局限。直接进行方言适配虽可降低方言的字符错误率(CER),但也可能导致普通话字符错误率上升。为此,本文研究如何对性能优异的 ASR 模型进行适配,在不损耗普通话识别性能的前提下提升多方言识别能力。本文采用一套适配流程:以持续预训练(CPT)与方言有监督微调(SFT)构建性能基础,再通过同策略自蒸馏(On-Policy Self-Distillation, OPSD)完成最终优化。OPSD 针对自回归 ASR 中的训练 - 测试不匹配问题,让学生模型基于自身解码出的前缀序列进行训练;同时以参考文本作为特权上下文,由冻结的教师模型提供软 token 级目标。该方法用蒸馏机制替代了方言数据上的硬交叉熵更新,在优化方言识别能力的同时保留了模型的普通话识别能力。本文基于 Qwen3-ASR-1.7B 实现了该框架,并在公开及内部的普通话、方言测试集上完成评测。在优化数据与训练调度匹配的条件下,OPSD 在提升方言识别性能的同时未造成普通话 CER 上升;而持续的教师强制微调则会导致普通话 CER 升高。本文将开源模型权重与评测脚本。
Github 项目: https://github.com/ASLP-lab/CN-MultiDialect-ASR
Hugging Face:https://huggingface.co/ASLP-lab/CN-MultiDialect-ASR
Demo Page: https://github.com/ASLP-lab/CN-MultiDialect-ASR#-demo
论文预印版:https://arxiv.org/pdf/2608.11898
04
论文题目:OSUM-Pangu: An Open-Source Multidimension Speech Understanding Foundation Model Built upon OpenPangu on Ascend NPUs
作者列表:廖育杰、耿雪龙、薛鸿飞、王水源、谢磊
论文摘要:语音大语言模型的最新进展大幅提升了多维语音理解能力。然而,绝大多数高性能框架主要面向以 GPU 为核心的生态与私有基座模型做优化,这就给在非 CUDA 计算基础设施上部署带来了巨大障碍。本文提出OSUM-Pangu—— 一款完全开源的语音理解基础大模型,整套软硬件栈完全基于非 CUDA 环境开发。该模型将音频编码器与 openPangu-7B 大语言模型基座融合,在昇腾 NPU 平台上完整实现了训练与推理全链路。为在非 CUDA 资源受限条件下实现高效任务对齐,本文采用分阶段训练方案,依次打通语音感知与用户意图识别。实验结果表明:OSUM-Pangu 的任务精度可媲美主流基于 GPU 的模型,同时保留稳定强大的自然语言交互能力。本工作为开源语音社区提供了一套可复现的非 CUDA 基线模型,助力多模态智能技术自主演进。
Github 项目:https://github.com/ASLP-lab/OSUM-Pangu
论文预印版:https://arxiv.org/abs/2603.10862
05
论文题目:Complex-Text Robustness Evaluation and Failure Diagnosis for Low-Resource Multilingual Text-to-Speech
作者列表:左天伦、张子萸、茆廷志、付中华、谢磊
合作单位:科大讯飞
论文摘要:低资源多语言文本转语音(TTS)系统虽然扩大了语言覆盖范围,但其在复杂文本输入下的鲁棒性尚未得到充分诊断。现有评估主要使用常规测试句子关注自然度、说话人相似度和内容一致性,对多语言TTS系统在处理数字、日期、命名实体、长句、语码切换表达及标点相关结构等挑战性输入时的失败模式缺乏深入分析。本文提出了一种面向低资源多语言TTS的复杂文本鲁棒性诊断框架。我们从内容一致性、语言一致性和生成稳定性三个维度评估鲁棒性,针对泰语、越南语、斯瓦希里语和印尼语设计了多语言复杂文本鲁棒性测试集,涵盖普通句子和多种复杂文本类型。我们进一步引入了自动诊断指标,包括字符错误率、语言识别准确率和时长异常率。为了在语音生成前进行输入级风险分析,我们提出了一种轻量级文本风险评分(TRS),该评分从可解释的文本特征估计合成风险,无需人工标注或模型训练。在三个代表性多语言TTS系统(OmniVoice、VoxCPM2 和 MMS-TTS)上的实验表明,复杂文本输入暴露了常规短句评估无法充分反映的系统性失效模式。不同系统在数字归一化、命名实体处理、长文本生成和语码切换输入处理方面表现出不同的脆弱性。此外,TRS与内容错误和时长异常呈正相关,证明了其作为低资源多语言TTS复杂文本风险诊断的低成本预合成指标的有效性。
论文预印版:https://arxiv.org/abs/2609.11545
06
论文题目:SphereVAE: Hyperspherical Latent Autoencoders for Robust Autoregressive Speech Representation Modeling
作者列表:张皓宇、胡景斌、解晗轲、詹其瑞、李文豪、张子萸、任夏明、李越、朱训谕、陈志鹏、谢磊
合作单位:网易
论文摘要:随着语音生成技术的快速发展,离散 Codec 表征因能够提供稳定的预测范式而被广泛采用。然而,在表现力语音生成任务中,离散 Codec 的量化瓶颈会导致细粒度韵律、音色、发音以及帧间连续性等信息的缺失。连续表征(如 VAE Latent)由于消除了这一约束,已成为自回归建模更加有效的替代方案。然而,当连续表征作为自回归预测目标时,预测误差会沿着生成链不断累积,导致潜变量漂移(latent drift),并降低长文本生成的稳定性。为缓解这一问题,我们提出了 SphereVAE。SphereVAE 将 VAE 的潜空间约束在单位超球面上,在超球面上定义 Power Spherical 后验分布,并将潜变量分布正则化到均匀先验,使信息主要通过方向变化进行编码,从而为自回归预测提供一个有界的几何目标,降低范数漂移(norm drift)的风险。由于潜空间自由度受到限制,SphereVAE 在重建指标上略逊于标准 VAE。然而,当将其集成到 VoxCPM 中用于零样本语音合成和长文本语音生成时,SphereVAE 能够在保持可比说话人相似度的同时,实现更低的内容错误率,并表现出更加稳定的长程说话人一致性。实验结果表明,对潜空间施加适当的几何约束,能够有效缓解语音生成过程中自回归误差累积和潜变量漂移的问题。
Demo Page:https://haoyuzhang3.github.io/SphereVAE_Demo/
Github 项目:https://github.com/ASLP-lab/SphereVAE
Huggingface:https://huggingface.co/ASLP-lab/SphereVAE
论文预印版:https://arxiv.org/pdf/2609.09903
07
论文题目:Towards Fine-Grained Multi-Dimensional Speech Understanding: Data Pipeline, Benchmark, and Model
作者列表:李国健、 赵致闲、林振楠、胡景斌、詹其瑞、曹雨昂、谢鹏源、谢川、刘杰、张强、付中华、谢磊
合作单位:上海玲光乍现科技
论文摘要:尽管语音大语言模型(LLMs)在基础语音识别等常规任务上表现出色,但它们缺乏细粒度、多维度的感知能力。这种缺陷体现在它们难以解耦微声学线索、声学场景和副语言信号等复杂特征。由此导致的对真实世界语音的不完整理解,从根本上阻碍了具有感知和共情能力的下一代语音系统的发展。其核心在于,这种持续存在的感知局限主要源于三个相互作用的因素:高质量表达性数据稀缺、缺乏面向多维属性的细粒度建模,以及依赖覆盖范围受限的粗粒度基准。我们通过三大支柱来应对这些挑战:首先,我们稳健的数据整理流程解决了复杂声学环境和长音频时间戳对齐的挑战,从音视频来源中提取高质量的自发语音语料库。其次,我们构建了 FMSU-Bench,一个覆盖14个语音属性维度的开创性基准,以严格评估当前模型的细粒度、多维度语音理解能力。第三,依托我们整理的语料库,我们提出了 FM-Speech。在解耦属性建模和渐进式课程微调框架的驱动下,它显著提升了细粒度、多维度的声学感知能力。在 FMSU-Bench 上的广泛评估表明,当前语音理解模型在多维度、细粒度理解方面仍需显著改进。相比之下,FM-Speech 显著优于当前开源模型,为真实世界语音理解建立了稳健范式。代码、基准和模型将在 GitHub 上开源。
Github 项目: https://github.com/ASLP-lab/FMSU-Bench
Hugging Face:https://huggingface.co/collections/ASLP-lab/fmsu
论文预印版:https://arxiv.org/pdf/2605.12036
08
论文题目:SpeechAnnotator: A Context-Aware Multi-Agent Framework and Benchmark for Multidimensional Speech Annotation
作者列表:詹其瑞、王水源、胡景斌、张皓宇、任夏明、梁津睿、余朝仁、吴本谷、陈云翔、刘厚盾、冯溯、薛浏蒙、谢磊
合作单位:媲美 语图智能 南京大学
论文摘要:近年来,可控语音生成对训练数据提出了更高要求,需要包含说话人特征、韵律、情感、副语言线索、声学场景以及上下文等细粒度标注。现有工作流程通常依赖人工校正、付费托管的多模态服务,或固定的处理链路,因而在大规模数据处理时受到标注成本、外部服务依赖以及跨阶段恢复能力不足等因素的限制。为此,我们提出 SpeechAnnotator,一个完全基于开源模型和工具构建、可本地部署的上下文感知多智能体框架。辅助前端模块首先获取说话人感知的语音片段及最终分段转写结果,先验证据提取模块则为各片段附加异构的片段级线索。随后,三个专门化智能体通过共享状态协同工作:Planning Agent 将局部音频证据、说话人历史、相邻片段以及录音级上下文转换为面向不同字段的标注约束;Labeling Agent 在这些约束指导下,对可直接观测的属性进行多模态预测;Review Agent 则执行有界审核循环,检查预测结果是否具有充分的证据支撑以及跨片段一致性,并仅针对缺乏证据支持或存在不一致的字段触发重新标注。现有评测资源往往分散于彼此独立的任务中,且多数测试集仅覆盖较为有限的领域。针对这些问题,我们提出 SpeechAnnotator-Bench(SA-Bench),包含来自九类源格式、共计 8.87 小时的人工标注音频。我们进一步提出 SpeechAnnotator-Eval(SA-Eval),将评测划分为三个部分:用于说话人感知时间线恢复的 Timeline-Eval、用于有限集合属性评测的 Closed-Eval,以及用于开放式属性评测的 Open-Eval。实验与消融结果表明,SpeechAnnotator 为商业音频理解系统提供了一种可本地部署的替代方案,同时,有界审核循环能够通过基于证据和上下文的字段级恢复机制提升多维语音标注性能。
Demo Page:https://zhanqirui.github.io/SpeechAnnotator-demo-page/
开源代码:https://github.com/ASLP-lab/SpeechAnnotator
论文预印版:https://arxiv.org/pdf/2609.09947
09
论文题目:NVV-Locator: From Transcript Tags to Acoustic Boundaries for Fine-Grained Nonverbal Vocalization Grounding
作者列表:曹雨昂、穆秉甡、林振楠、李国健、詹皓粤、刘杰、谢川、张强、薛浏蒙、谢磊
合作单位:南京大学,上海玲光乍现科技
论文摘要:人类语音中除了词汇内容,还包含非言语发声(NVVs),如笑声、叹息、呼吸和咳嗽,它们传递情感与互动信息。现有方法通常将 NVVs 表示为转录级标签,对其波形时间边界的监督有限。我们提出 NVV-Locator,用于细粒度 NVV 时间定位。我们首先统一了公共资源中的 26 个 NVV 类别,并通过双 LLM 验证、转录引导的强制对齐和基于能量的边界细化,构建大规模时间戳监督训练数据。我们进一步提出 NVV-TimeBench,一个经专家精炼的基准,包含 667 条话语和 1,094 个事件。NVV-Locator 采用非自回归槽填充架构,联合预测词汇时间戳、NVV 类别和事件边界。在 NVV-TimeBench 上,它取得 71.0% Micro F1、70.2% Macro F1、80.4% Macro mIoU 和 59.6 ms Macro mMAE,优于所评估的大型音频模型对应方案。在外部语料库上的评估进一步证明了 NVV-Locator 的跨语料库泛化能力。
Demo Page: https://nvv-locator.github.io/Demo-Page/
