在真实对话中,人们传递信息的不只有文字。

一次笑声、一声叹气、突然的咳嗽、吸气、哭泣或打哈欠,都可能表达情绪、态度、反馈、轮次转换和社交意图。它们是自然交流的重要组成部分,却常常被现有语音系统忽略:语音识别模型往往将其省略或归一化,语音合成模型也尚难稳定、自然地生成和控制这些表达性声音。

为推动这一方向的发展,NVVSpeech Challenge @ ISCSLP 2026 现已正式开放报名。

本竞赛聚焦非语言发声(Nonverbal Vocalizations, NVVs)的理解与生成,面向普通话中文和英文设置统一任务、隐藏测试集、基线系统与标准化评测协议,邀请语音识别、语音生成、音频大模型、语音语言模型及相关领域的研究者和开发者共同探索:语音系统如何更准确地“听懂”并更自然地“表达”语言之外的声音。

什么是 NVV?

NVV 指语音中的非语言发声,例如:

笑声、哭声、叹气、呼吸、咳嗽、清嗓、吸鼻、哈欠、倒吸气、喷嚏、打鼾、哼鸣、咂嘴、打嗝等。

这些声音并非“噪声”或可有可无的附属信息,而是人类交流中重要的情感、社会与生理信号。

赛事信息

本挑战赛将依托国际语音通信与语言处理学术会议(ISCSLP 2026)会议平台,围绕语音中的非语言发声(Nonverbal Vocalizations, NVVs)理解与可控生成任务,构建面向普通话中文和英文的统一评测数据、评价指标与竞赛流程,为学术界和工业界提供一个开放、公平、可复现的语音理解与生成评测平台。

赛事名称:

NVVSpeech Challenge: Understanding and Generation of Speech with Nonverbal Vocalizations

面向非语言发声的语音理解与生成挑战赛

赛道方向:

Track 1:语音中的非语言发声理解

Track 2:非语言发声的可控语音生成

赛道说明

Track 1:语音中的非语言发声理解

任务定义:给定一段包含语音和一个或多个 NVV 的音频,系统需要生成带有 NVV 标签的转写文本,同时识别其类别与在文本中的相对位置。

例如:这真是太意外了。[laugh]

该赛道重点考察系统是否能够同时完成语音内容识别,NVV 事件检测与类别判断,NVV 标签位置预测和带标签完整转写生成。

评测将综合以下三个方面:

NVV 事件识别准确性:预测的 NVV 是否在类别和文本相对位置上与参考标注一致;

NVV 标签位置准确性:预测标签与参考标签之间的位置偏差;

带标签转写准确性:在完整转写中同时考察语音内容与 NVV 标签的识别正确性。中文采用带标签字符错误率,英文采用带标签词错误率。

官方将综合上述指标形成单语言成绩,并以中英文成绩的平均值作为最终排名依据。具体计算方式以官方评测协议为准。

Track 2:非语言发声的可控语音生成

任务定义:给定包含一个或多个 NVV 标签的文本,系统需要生成一段自然、清晰且具有适当表现力的语音。

例如:这真是太意外了。[laugh]

系统不仅要“读出”文字,还需要将指定的笑声等 NVV 在合适的位置自然融入语音,并保持整体语音的可懂度、自然度、音质与表达协调性。

评测将从以下五个维度进行:

NVV Accuracy:指定 NVV 的类型、数量和位置是否被正确实现;

NVV Perceptual Effect:NVV 是否清晰可感知、可辨识,并具有相应的表达效果;

Overall Naturalness:整段语音是否自然、流畅,语音与 NVV 之间是否衔接连贯;

Overall Quality:音频质量是否良好,是否存在明显伪影或失真;

Overall Expression:语言内容、目标 NVV 与整体表达是否协调、恰当。

排行榜将采用音频语言大模型多评委评测协议,排名靠前的系统还将接受人工听评,最终成绩将依据官方评测协议综合自动评测与人工评测结果确定。

赛事特点

中英双语评测:普通话中文与英文均设测试集,最终成绩取两种语言的平均表现;

16 类 NVV 标签:覆盖常见情感、呼吸、生理与交互相关发声;

开放资源赛制:不提供官方训练集,参赛者可使用合法公开的数据集、预训练模型及相关资源;

统一、可复现的评测协议:从识别准确性、标签位置到生成质量与表达效果进行系统评估;

关注真实的语音交互能力:不仅考察“语音是否好听”,更关注系统是否真正理解并生成目标 NVV。

赛事核心目标

本挑战赛面向自然语音交流中的非语言发声,重点关注以下目标:

构建统一评测平台:面向普通话中文和英文,构建覆盖多类非语言发声的统一任务设置与评测流程,为非语言发声理解和可控语音生成提供标准化测试平台。

推动关键技术发展:聚焦非语言发声识别、类别判断、文本相对位置预测与拟人化语音生成等问题,评估语音理解、语音生成及语音与音频基础模型的相关能力。

建立公平可复现的评价机制:建立公开、公平、可复现的竞赛流程与评价机制,促进不同模型、不同技术路线在统一任务设置下的系统比较。

推动资源与工具建设:围绕非语言发声标签体系、基线系统、评测协议和排行榜建设,推动相关数据资源、评测工具和研究成果的共享与积累。

促进学术与产业交流合作:促进高校、科研机构与企业团队在副语言信息理解、情感和拟人化语音生成、语音与音频大模型等方向的交流合作,共同推动更自然、更具表达力的语音交互技术发展。

参赛须知

本竞赛为开放资源赛制,可使用合法公开的外部数据、预训练模型、合成数据、增强方法、工具或 API。

系统描述论文中须明确说明所使用的外部资源及方法。

测试集标签保持隐藏,禁止通过数据泄漏、未授权访问等方式获取参考答案

所有测试输出必须由提交系统自动生成,禁止逐样本人工标注、修正、筛选或编辑。

Track 2 禁止人工音频拼接、测试样本专门录制或手工波形编辑。

排名前列的队伍可能需要提供推理脚本、模型配置与环境说明,以供可复现性验证。

参与最终官方排名、奖项评选及竞赛专题展示,须按时提交系统描述论文。

赛事重要时间安排

  • 6 月 22 日:竞赛官网与报名开放
  • 7 月 6 日:发布基线系统
  • 7 月 22 日:发布评测集
  • 7 月 29 日:最终系统提交截止/排行榜冻结
  • 8 月 3 日:系统描述论文提交截止
  • 8 月 31 日:论文录用通知
  • 9 月 21 日:Camera-ready 截止
  • 11 月 14—17 日:ISCSLP 2026 会议

赛事组织团队

NVVSpeech Challenge 由来自高校和企业的研究者联合组织,核心组织者包括:

薛浏蒙,南京大学

谢磊,西北工业大学

雪巍,香港科技大学

吴海滨,Meta

钱馨园,北京科技大学

王帅,南京大学

连政,同济大学

卜辉,希尔贝壳科技有限公司(AISHELL)

曹雨昂,西北工业大学

胡景斌,西北工业大学

陈华康,西北工业大学

詹其瑞,西北工业大学

赛事联系方式

赛事官网:https://nvvspeech-challenge.github.io/

报名入口

谷歌表单:https://docs.google.com/forms/d/e/1FAIpQLSeqsc69MhVMVx7yixcI5fR5pQwVnCx7xvAWuolbFS8nQlPxtQ/viewform?usp=dialog

腾讯表单:https://docs.qq.com/form/page/DY3JjbkVEd3FFd3Vt

ISCSLP 2026官网:https://iscslp.org/2026/

联系邮箱:nvvspeech_iscslp2026@googlegroups.com

微信群:

后续赛事相关信息将通过挑战赛官网统一发布。