声浪
MMAudio 在给定视频和/或文本输入的情况下生成同步音频。我们的关键创新是多模式联合训练,它允许对广泛的视听和音频文本数据集进行训练。此外,同步模块将生成的音频与视频帧对齐。 项目地址:https://hkchengrex.com/MM…
来源丨机器之心 人类的沟通交流充满了多模态的信息。为了与他人进行有效沟通,我们既使用言语语言,也使用身体语言,比如手势、面部表情、身体姿势和情绪表达。因此,为了理解和生成人类动作,理解这些多模态的行为至关重要,而且这一研究方向最近受到的关注…
魔珐科技成立于2018年,是一家以三维计算机图形学和AIGC技术为核心的3D虚拟人科技公司。魔珐科技打造了端对端的超写实3D虚拟人工业化产线,并在此基础上建立了“3D虚拟人AIGC平台--星云平台”,自研了3D虚拟人AIGC消费级产品矩阵,…
杭州像衍科技有限公司成立于2021年9月。 像衍的创始团队深耕数字人相关的三维计算机视觉和图形学技术多年,创新研发了基于神经网络表示的高质量三维重建、驱动和绘制技术,打造了以“计算底座+工具链+超写实数字人内容生成”的全栈工具软件平台,以创…
普强于2009年在美国硅谷成立全球研发中心,主要从事智能语音和语言技术的研究,2010年设立中国运营公司,是金融科技创新和智能汽车AI服务提供商,在硅谷和中关村、上海,深圳均建设有技术研发中心,在南京拥有声学实验室,专注于金融大数据、AI芯…
深圳市冠旭电子股份有限公司于1997年成立于中国深圳,总部位于深圳龙岗坪地国际低碳城中心区。 公司主要从事专业音频、智能耳机及智能音箱等智能终端产品的研发、制造及品牌营销。凭借全方位、多领域的核心技术体系及精益化生产管理能力等综合竞争优势,…
介绍一个对话系统领域非常令人兴奋的新挑战 —FutureDial-RAG Challenge。这是一个依托 2024 IEEE SLT 国际会议,由中国移动研究院与清华大学联合组织的挑战赛,旨在推动检索增强生成(Retrieval Augm…
