ICASSP 2026|Phys-NVAS:基于视觉语言模型物理先验挖掘与3D声学环境建模的新视角声学合成
作者:罗立昂,编辑:冯小雨,审核:关键 在追求沉浸式体验的道路上,空间音频扮演着至关重要的角色。想象一下,在虚拟现实中,不仅能看到逼真的场景,还能听到与场景几何、物体材质、布局息息相关的真实声场,这才是真正的“身临其境”。然而,新视角声学合…
18 0 0
作者:罗立昂,编辑:冯小雨,审核:关键 在追求沉浸式体验的道路上,空间音频扮演着至关重要的角色。想象一下,在虚拟现实中,不仅能看到逼真的场景,还能听到与场景几何、物体材质、布局息息相关的真实声场,这才是真正的“身临其境”。然而,新视角声学合…
「现存问题」 TTS(文本转语音)这两年进步很快,很多模型在测试集上能做到很低的 WER(词错误率),听起来“字面上没问题”。 但现实场景里,用户真正关心的往往不是“每个词都对”,而是: 这段语音里提到的关键信息我能不能抓住?例如:日期、金…
来源丨新智元 AI音乐变天了!Mureka V8强势登顶AA榜,包揽人声与器乐双项冠军。而这仅仅是开始,下一代Mureka V9已在路上了! 双榜封顶,实至名归! 就在今天,AI音乐大模型Mureka V8在权威Artificial Ana…
现在的配音模型有时会“顾此失彼”:为了追求声音像,可能时机就不准了;为了追求时机准,音质有可能会变差。这是因为模型试图用一套标准同时满足所有要求,导致目标之间互相“打架”。 为了解决这个问题,通义实验室开源发布了PrismAudio。 论文…
AudioCC交我学 作为学术研究者与实践者的连接点,我们致力于打造一个专注于语音技术的学术交流平台——「AudioCC交我学」专栏。在这里,我们将以简洁、专业的视角,解读听觉认知与计算声学领域的前沿论文,分享技术创新与应用实践的最新动态。…