CVPR 2024 基于运动解耦扩散模型的语音驱动共语手势视频生成 本文由清华大学与华为云计算公司、华为诺亚实验室、香港中文大学合作,研究虚拟数字人共语手势(co-speech gestures)视频的自动生成。现有共语手势生成工作大多停留…
声浪
CVPR 2024|基于运动解耦扩散模型的语音驱动共语手势视频生成
30 0 0
开源发布Whistle: 基于弱音素监督推进数据高效多语言和跨语言语音识别
论文地址:https://arxiv.org/abs/2406.02166 开源代码及模型:https://github.com/thu-spmi/CAT/blob/master/egs/cv-lang10/r
17 0 0
安普德 | 招聘语音识别/合成算法工程师(北京)
安普德 Amp’ed RF安普德2003年创立于美国硅谷,并于2009年12月在中国天津滨海高新区华苑产业园注册成立,依托两地优势,我们聚集众多无线射频芯片和无线物联技术的高端人才,潜心研究、锐意进取,现已逐步成为国内外同行业中同时可提供无…
41 0 0
天津大学认知计算与应用团队4篇论文被语音技术顶会INTERSPEECH 2024接收!
近日,Interspeech 2024会议发出了审稿结果通知,天津大学认知计算与应用团队共4篇论文被会议接收,论文方向涵盖语音识别、语音合成、语音增强等方向。 Interspeech 是由国际语音通讯协会(International Spe…
45 0 0
慧言科技 | 招聘语音识别算法实习生(天津)
慧言科技 慧言科技(天津)有限公司是一家业内领先的言语交互高新技术企业。公司基于自主可控“海河·谛听”言语交互意图理解大模型,研发语音识别、语音生成、语义理解、文本生成、知识问答、机器翻译、声纹识别等全链路言语交互技术,支持中英日韩法西俄德…
39 0 0
