来源丨AI音频时代 SkyReels-Audio 是 Skywork AI 团队开发的一款创新框架,能够将静态图像或视频与语音输入相结合,生成高度逼真且唇形同步的说话人像视频。 该框架基于预训练的视频扩散变换器构建,支持无限长度的视频生成和…
声浪
本文由清华大学与腾讯优图实验室合作,研究基于多模态数据的可控语音合成。现有的面部驱动的语音合成方法由于数据质量限制,在鲁棒性和泛化性方面存在缺陷;而文本描述驱动的语音合成方法则存在多样性有限和精细控制不足的问题。另一方面,尽管多模态驱动的语…
随着ChatGPT、Claude等文本大模型的爆火,人们开始期待更自然的语音交互方式。然而,当前的语音大模型在知识理解方面表现如何?它们能否像人类一样通过纯语音进行复杂的知识问答? 来自香港中文大学的研究团队在ACL 2025主会上发表了一…
本文由清华大学与腾讯AI Lab合作,研究基于大语言模型与检索增强生成(RAG)技术的自动语音风格匹配文本转语音合成(TTS)系统。当前主流TTS方法虽已实现高保真语音合成,但在语音风格控制方面仍依赖人工设定的提示语,难以自适应待合成文本内…
GUIRoboTron-Speech团队 投稿 来源 |量子位 由美团和浙江大学联合推出的GUIRoboTron-Speech——让用户解放双手,直接对计算机“发号施令”。 联系方式:wenkangh@zju.edu.cn 论文链接:htt…
AI眼镜的爆发与挑战 AI眼镜正从科技概念迅速走向大众消费市场,其作为穿戴式智能设备的独特优势,使其有望成为每个独立个体的私人助理,重塑人机交互的入口。近期,随着AI大模型与增强现实技术的深度融合,智能眼镜市场迎来了新的发展机遇。Meta与…
语音与语言如何连接,机器耳朵与大脑如何高效协同?本文工作给出了探索回答。在自动语音识别(ASR)中,基于音素的多语种预训练与跨语言微调因其出色的数据利用效率和相较于基于子词模型的性能优势,正受到越来越多的关注。然而,传统的加权有限状态转换器…
来源丨新智元 谷歌扔下重磅炸弹:AI编程工具Gemini CLI,开源!免费!权限拉满!百万token上下文、千次调用额度、VS Code+终端全打通,谷歌彻底掀桌子:开发者的终端,要定了! 编程智能体,风云突变:编程智能体Gemini C…
