传统级联式语音交互系统通常采用"语音识别-大语言模型-语音合成"的串联处理流程,这种架构存在明显的时延累积和信息损耗问题。相比之下,语音交互大模型通过端到端的处理方式,将语音理解和语音生成能力深度融合到大语言模型中,从而实现高性能、低时延的…
声浪
Multi-token Prediction引领语音生成新范式:上海交大、蚂蚁集团联合发布语音交互大模型VocalNet
16 0 0
语音合成突破:F5R-TTS首次实现非自回归模型的GRPO优化,零样本克隆性能显著提升
在人工智能技术日新月异的今天,语音合成(TTS)领域正经历着一场前所未有的技术革命。最新一代文本转语音系统不仅能够生成媲美真人音质的高保真语音,更实现了「只听一次」就能完美复刻目标音色的零样本克隆能力。这一突破性进展的背后,是大规模语音数据…
17 0 0
合成数据也能通吃真实世界?首个融合重建-预测-规划的生成式世界模型AETHER开源
近日,上海人工智能实验室(上海 AI 实验室)开源了生成式世界模型 AETHER。该模型全部由合成数据训练而成,不仅在传统重建与生成任务中表现领先,更首次赋予大模型在真实世界中的 3D 空间决策与规划能力,可助力机器人完成目标导向的视觉规划…
16 0 0
云知声 | 招聘语音合成算法研究员(北京)
云知声专注于物联网人工智能服务,拥有完全自主知识产权、世界顶尖的智能语音识别和相关AI技术。公司成立于2012年6月29日,总部位于北京,在上海、深圳均设有分公司。 云知声利用机器学习平台,在语音技术、语言技术、知识计算、大数据分析等领域建…
25 0 0
智谱华章 | 招聘音频生成算法工程师(北京)
智谱AI致力于打造新一代认知智能大模型,专注于做大模型的中国创新。公司于2020年底研发GLM预训练架构,2021年训练完成百亿参数模型GLM-10B,同年利用MoE架构成功训练出收敛的万亿稀疏模型,2022年合作研发了中英双语千亿级超大规…
29 0 0
智谱华章 | 招聘音频生成算法工程师(北京)
智谱AI致力于打造新一代认知智能大模型,专注于做大模型的中国创新。公司于2020年底研发GLM预训练架构,2021年训练完成百亿参数模型GLM-10B,同年利用MoE架构成功训练出收敛的万亿稀疏模型,2022年合作研发了中英双语千亿级超大规…
24 0 0
开源语音合成&声音克隆系统:MegaTTS3,仅0.45B参数,中英文混合无缝切换。
今天分享一个声音克隆及语音合成系统——MegaTTS3 MegaTTS3 是由字节跳动与浙江大学联合推出的开源语音合成工具,主模型仅有 0.45B 参数,具备高度轻量化优势。支持超高质量的语音克隆,能在 Huggingface Demo 体…
12 0 0
