声浪
第三届CCF语音对话与听觉处理前沿进展研讨会技术报告(RASDAP2026 Technical Report)
当前语音对话与听觉处理领域蓬勃发展,学术界与工业界不断涌现创新的技术与产品,为了更好地推动经验交流与前瞻研讨,由中国计算机学会(CCF)语音对话与听觉专委会发起的第三届CCF语音对话与听觉处理前沿进展研讨会(RASDAP2026,Recen…
24 1 0
WavCube:一个 128 维连续表征,同时搞定语音理解、重建与生成
以下文章来源丨模型之声 标题:《WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Mod…
29 0 0
StepAudio 2.5 Realtime 上线!真人级实时语音对话能力,千万人设任你打造
今天,阶跃正式发布新一代实时语音大模型StepAudio 2.5 Realtime! 我们希望创造更有“活人感”的 AI 聊天搭子:有温度、有灵魂、有态度。为此重点聚焦三大能力突破: 顶级副语言能力:实现真人级深度感知,精准听懂对话里的弦外…
29 0 0
X-Voice:0.4B参数狂飙30语种零样本克隆,AI配音彻底杀疯了
论文标题:X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning 论文链接:https://arxiv.org/a…
22 0 0
Doubao-Seed-2.0-lite升级,支持全模态理解
今天,Doubao-Seed-2.0-lite 升级新版本,这是豆包大模型家族首款全模态理解模型,支持视频、图像、音频、文本原生统一理解,Agent、Coding 与 GUI 能力同步升级。在同等算力成本下,是企业大规模、批量化部署全模态推…
26 0 0
MINT-Bench: 面向指令遵循语音合成的综合性多语言细粒度诊断评测基准
在当前指令遵循式语音合成(Instruction-Following TTS)快速发展的背景下,如何系统性地评估模型是否真正“听懂并执行”了用户的自然语言声音指令,已成为制约该领域发展的关键瓶颈。现有的评测方案普遍面临覆盖维度有限、诊断粒度…
23 0 0
