近日,Cartesia 发布 Sonic-3.5 与 Ink-2 语音模型:基于状态空间模型,首音延迟降至 82ms 并集成原生轮次检测。 Cartesia 推出新一代实时语音端到端模型 Sonic-3.5 与 Ink-2。该系列模型基于状…
声浪
现在的语音合成(TTS)越来越像真人了,但总觉得少了点“人味儿”。 为什么?因为真人说话不仅仅是念文字,还充满了非语言发声(Nonverbal Vocalizations, NVs): 生理反应:咳嗽(Cough)、叹气(Sigh)、呼吸声…
本期分享西工大音频语音与语言处理研究组(ASLP@NPU)被 Interspeech 2026接收的11篇论文,以下是发表论文的相关信息。 01、OmniCodec: Low Frame Rate Universal Audio Codec…
在语音大模型与具身智能快速发展的今天,全双工人机交互正成为学术界与工业界关注的焦点。构建高拟人度、支持实时中断与流式响应的口语对话系统,关键在于是否拥有具备“真实交互动态”与“富含副语言标签”的长音频对话数据。然而,当前开源社区仍缺乏此类大…
一个面向沉浸式音频故事创作的自反思闭环多智能体框架。 录取信息:Accepted to Interspeech 2026 论文题目:AuDirector: A Self-Reflective Closed-Loop Framework fo…
本文介绍AudioLens,一个全新的用于播放、分析、观察音频文件的 VSCode 插件。 AudioLens 多通道主界面 针对语音、声音事件检测、音频算法、信号处理、机器学习或音频数据集处理工作者,日常工作流的一个痛点问题是: 代码,数…
来源丨语音及语言信息处理国家工程研究中心 本期分享 语音及语言信息处理国家工程研究中心智能语音信息处理团队被 Interspeech 2026接收的14篇论文,论文方向涵盖语音编码、语音合成、语音识别、语音匿名化、声音事件检测等。 1、An…
想象一下你身处一个拥挤的派对:人声鼎沸,谈笑声不断,酒杯碰撞声此起彼伏。突然,几句话——或许是提到了你的名字——将你拉入了一场远方的对话。对话的两个人离你几米远,但当你把注意力集中到他们身上时,他们的话语似乎变得更加清晰易懂,甚至可能更加响…
