WavChat:深入探索语音对话模型的前沿
原创2 years ago
WavChat:深入探索语音对话模型的前沿

在人机交互日益智能化的今天,语音对话模型正引领AI领域的新一轮革新。为填补当前语音对话模型综述的空白,浙江大学与微软、阿里巴巴、腾讯团队联合撰写了《WavChat:A Survey of Spoken Dialogue Models》。 该…

10 0 0
李飞飞团队统一动作与语言,新的多模态模型不仅超懂指令,还能读懂隐含情绪
转载2 years ago
李飞飞团队统一动作与语言,新的多模态模型不仅超懂指令,还能读懂隐含情绪

来源丨机器之心 人类的沟通交流充满了多模态的信息。为了与他人进行有效沟通,我们既使用言语语言,也使用身体语言,比如手势、面部表情、身体姿势和情绪表达。因此,为了理解和生成人类动作,理解这些多模态的行为至关重要,而且这一研究方向最近受到的关注…

8 0 0
基于深度说话人表征学习的说话人建模及其应用综述
转载2 years ago
基于深度说话人表征学习的说话人建模及其应用综述

该综述由来自深圳市大数据研究院,上海交通大学,香港理工大学,香港中文大学(深圳)的相关学者共同完成。在这篇综述中,我们从理论和实践两个角度对基于神经网络的说话人表示学习方法进行了系统而全面的回顾。在理论层面,我们探讨了该领域的关键发展,包括…

8 0 0
GPT-4o再暴露「弱智」缺陷,大模型无一幸免!港中文等发布「视觉听觉」基准AV-Odyssey:26个任务直指死角问题
转载2 years ago
GPT-4o再暴露「弱智」缺陷,大模型无一幸免!港中文等发布「视觉听觉」基准AV-Odyssey:26个任务直指死角问题

来源丨新智元 多模态大模型在听觉上,居然也出现了「9.11>9.8」的现象,音量大小这种简单问题都识别不了!港中文、斯坦福等大学联合发布的AV-Odyssey基准测试,包含26个视听任务,覆盖了7种声音属性,跨越了10个不同领域,确保测试的…

6 0 0