通义发布并开源了首个支持影视级多场景配音的多模态大模型Fun-CineForge。此外,还配套开放了高质量数据集的构建方法。通过“数据 + 模型”的一体化设计,Fun-CineForge 正尝试解决影视级 AI 配音长期面临的关键问题。 在…

最新声浪
查看全部 →Fun-CineForge丨通义开源首个支持影视级多场景配音的多模态大模型
23 0 0
WEST 更新:语音大模型后训练方案来了
WEST 新增了 GRPO 强化学习和 On-Policy Distillation 两个 recipe,支持对 Qwen2-Audio、Qwen2.5-Omni 等音频模型做后训练。GRPO 方案可复现 r1-aqa、Ke-Omni、Om…
34 0 0
SLM-SS:用“语音语言模型”重塑语音分离丨ICASSP2026
基于神经网络的方法使语音分离技术取得显著进步,在信号层面的指标上表现更佳。然而,这些方法往往难以在分离信号中保持语音可懂度,这会对语音识别等下游任务的性能产生负面影响。本文提出SLM-SS方法,通过将语音语言模型应用于语音分离,旨在提升分离…
28 0 0
腾讯推出Covo-Audio:7B 参数打通听 - 说 - 思,全双工对话 + 情感共情拉满
论文标题:Covo-Audio Technical Report 论文链接:https://arxiv.org/pdf/2602.09823v1 当语音助手能听懂指令、生成语音时,却常陷入 “逻辑脱节、交互僵硬、音色难定制” 的困境,要么只…
44 0 0
Fish Audio 开源 S2 文本转语音模型,支持1.5万种情感控制,单卡100ms极速推理!
来源丨RET开发者社区 传统的AI语音合成往往因缺乏情感表达而显得机械生硬。Fish Audio最新开源的文本转语音模型Fish Audio S2,致力于解决这一痛点。该模型能够生成包含清嗓、叹息、笑场等细微人类声学特征的语音。 模型权重、…
30 0 0
AI生成同步音频的进化,声音制作人真正受到威胁的开始
来源丨AI音频时代 AI似乎已经无处不在,而我们身处的内容产业,AI内容生成技术也像极了即将到来的暴风骤雨,但无论是否还要继续坚持,我们都应该去了解这里面发生了什么。而多年来,视频生成和音频生成一直像两个陌生人,分别待在不同的制造车间里。当…
20 0 0
