在真实对话中,人们传递信息的不只有文字。
一次笑声、一声叹气、突然的咳嗽、吸气、哭泣或打哈欠,都可能表达情绪、态度、反馈、轮次转换和社交意图。它们是自然交流的重要组成部分,却常常被现有语音系统忽略:语音识别模型往往将其省略或归一化,语音合成模型也尚难稳定、自然地生成和控制这些表达性声音。
为推动这一方向的发展,NVVSpeech Challenge @ ISCSLP 2026 现已正式开放报名。
本竞赛聚焦非语言发声(Nonverbal Vocalizations, NVVs)的理解与生成,面向普通话中文和英文设置统一任务、隐藏测试集、基线系统与标准化评测协议,邀请语音识别、语音生成、音频大模型、语音语言模型及相关领域的研究者和开发者共同探索:语音系统如何更准确地“听懂”并更自然地“表达”语言之外的声音。
什么是 NVV?
NVV 指语音中的非语言发声,例如:
笑声、哭声、叹气、呼吸、咳嗽、清嗓、吸鼻、哈欠、倒吸气、喷嚏、打鼾、哼鸣、咂嘴、打嗝等。
这些声音并非“噪声”或可有可无的附属信息,而是人类交流中重要的情感、社会与生理信号。
赛事信息
本挑战赛将依托国际语音通信与语言处理学术会议(ISCSLP 2026)会议平台,围绕语音中的非语言发声(Nonverbal Vocalizations, NVVs)理解与可控生成任务,构建面向普通话中文和英文的统一评测数据、评价指标与竞赛流程,为学术界和工业界提供一个开放、公平、可复现的语音理解与生成评测平台。
赛事名称:
NVVSpeech Challenge: Understanding and Generation of Speech with Nonverbal Vocalizations
面向非语言发声的语音理解与生成挑战赛
赛道方向:
Track 1:语音中的非语言发声理解
Track 2:非语言发声的可控语音生成
赛道说明
Track 1:语音中的非语言发声理解
任务定义:给定一段包含语音和一个或多个 NVV 的音频,系统需要生成带有 NVV 标签的转写文本,同时识别其类别与在文本中的相对位置。
例如:这真是太意外了。[laugh]
该赛道重点考察系统是否能够同时完成语音内容识别,NVV 事件检测与类别判断,NVV 标签位置预测和带标签完整转写生成。
评测将综合以下三个方面:
NVV 事件识别准确性:预测的 NVV 是否在类别和文本相对位置上与参考标注一致;
NVV 标签位置准确性:预测标签与参考标签之间的位置偏差;
带标签转写准确性:在完整转写中同时考察语音内容与 NVV 标签的识别正确性。中文采用带标签字符错误率,英文采用带标签词错误率。
官方将综合上述指标形成单语言成绩,并以中英文成绩的平均值作为最终排名依据。具体计算方式以官方评测协议为准。
Track 2:非语言发声的可控语音生成
任务定义:给定包含一个或多个 NVV 标签的文本,系统需要生成一段自然、清晰且具有适当表现力的语音。
例如:这真是太意外了。[laugh]
系统不仅要“读出”文字,还需要将指定的笑声等 NVV 在合适的位置自然融入语音,并保持整体语音的可懂度、自然度、音质与表达协调性。
评测将从以下五个维度进行:
NVV Accuracy:指定 NVV 的类型、数量和位置是否被正确实现;
NVV Perceptual Effect:NVV 是否清晰可感知、可辨识,并具有相应的表达效果;
Overall Naturalness:整段语音是否自然、流畅,语音与 NVV 之间是否衔接连贯;
Overall Quality:音频质量是否良好,是否存在明显伪影或失真;
Overall Expression:语言内容、目标 NVV 与整体表达是否协调、恰当。
排行榜将采用音频语言大模型多评委评测协议,排名靠前的系统还将接受人工听评,最终成绩将依据官方评测协议综合自动评测与人工评测结果确定。
赛事特点
中英双语评测:普通话中文与英文均设测试集,最终成绩取两种语言的平均表现;
16 类 NVV 标签:覆盖常见情感、呼吸、生理与交互相关发声;
开放资源赛制:不提供官方训练集,参赛者可使用合法公开的数据集、预训练模型及相关资源;
统一、可复现的评测协议:从识别准确性、标签位置到生成质量与表达效果进行系统评估;
关注真实的语音交互能力:不仅考察“语音是否好听”,更关注系统是否真正理解并生成目标 NVV。
赛事核心目标
本挑战赛面向自然语音交流中的非语言发声,重点关注以下目标:
构建统一评测平台:面向普通话中文和英文,构建覆盖多类非语言发声的统一任务设置与评测流程,为非语言发声理解和可控语音生成提供标准化测试平台。
推动关键技术发展:聚焦非语言发声识别、类别判断、文本相对位置预测与拟人化语音生成等问题,评估语音理解、语音生成及语音与音频基础模型的相关能力。
建立公平可复现的评价机制:建立公开、公平、可复现的竞赛流程与评价机制,促进不同模型、不同技术路线在统一任务设置下的系统比较。
推动资源与工具建设:围绕非语言发声标签体系、基线系统、评测协议和排行榜建设,推动相关数据资源、评测工具和研究成果的共享与积累。
促进学术与产业交流合作:促进高校、科研机构与企业团队在副语言信息理解、情感和拟人化语音生成、语音与音频大模型等方向的交流合作,共同推动更自然、更具表达力的语音交互技术发展。
参赛须知
本竞赛为开放资源赛制,可使用合法公开的外部数据、预训练模型、合成数据、增强方法、工具或 API。
系统描述论文中须明确说明所使用的外部资源及方法。
测试集标签保持隐藏,禁止通过数据泄漏、未授权访问等方式获取参考答案
所有测试输出必须由提交系统自动生成,禁止逐样本人工标注、修正、筛选或编辑。
Track 2 禁止人工音频拼接、测试样本专门录制或手工波形编辑。
排名前列的队伍可能需要提供推理脚本、模型配置与环境说明,以供可复现性验证。
参与最终官方排名、奖项评选及竞赛专题展示,须按时提交系统描述论文。
赛事重要时间安排
- 6 月 22 日:竞赛官网与报名开放
- 7 月 6 日:发布基线系统
- 7 月 22 日:发布评测集
- 7 月 29 日:最终系统提交截止/排行榜冻结
- 8 月 3 日:系统描述论文提交截止
- 8 月 31 日:论文录用通知
- 9 月 21 日:Camera-ready 截止
- 11 月 14—17 日:ISCSLP 2026 会议
赛事组织团队
NVVSpeech Challenge 由来自高校和企业的研究者联合组织,核心组织者包括:
薛浏蒙,南京大学
谢磊,西北工业大学
雪巍,香港科技大学
吴海滨,Meta
钱馨园,北京科技大学
王帅,南京大学
连政,同济大学
卜辉,希尔贝壳科技有限公司(AISHELL)
曹雨昂,西北工业大学
胡景斌,西北工业大学
陈华康,西北工业大学
詹其瑞,西北工业大学
赛事联系方式
赛事官网:https://nvvspeech-challenge.github.io/
报名入口
腾讯表单:https://docs.qq.com/form/page/DY3JjbkVEd3FFd3Vt
ISCSLP 2026官网:https://iscslp.org/2026/
联系邮箱:nvvspeech_iscslp2026@googlegroups.com
微信群:

后续赛事相关信息将通过挑战赛官网统一发布。
