论文标题:X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning 论文链接:https://arxiv.org/a…

最新声浪
查看全部 →X-Voice:0.4B参数狂飙30语种零样本克隆,AI配音彻底杀疯了
25 0 0
OpenAI 「实时语音」架构首次公开
以下文章来源于丨赛博禅心 Realtime API 是 OpenAI 的实时语音交互接口,在 24 年的 DevDay 首次亮相,当时还是 beta,调用贵到离谱,音频输出 200 刀/百万 token:OpenAI 凌晨发布:Realti…
38 0 0
Doubao-Seed-2.0-lite升级,支持全模态理解
今天,Doubao-Seed-2.0-lite 升级新版本,这是豆包大模型家族首款全模态理解模型,支持视频、图像、音频、文本原生统一理解,Agent、Coding 与 GUI 能力同步升级。在同等算力成本下,是企业大规模、批量化部署全模态推…
28 0 0
MINT-Bench: 面向指令遵循语音合成的综合性多语言细粒度诊断评测基准
在当前指令遵循式语音合成(Instruction-Following TTS)快速发展的背景下,如何系统性地评估模型是否真正“听懂并执行”了用户的自然语言声音指令,已成为制约该领域发展的关键瓶颈。现有的评测方案普遍面临覆盖维度有限、诊断粒度…
25 0 0
李宏毅团队全面综述:语音 AI 中的偏见与公平性,从定义到缓解的统一框架
本文来源:模型之声 标题:《Toward Fair Speech Technologies: A Comprehensive Survey of Bias and Fairness in Speech AI》 链接:https://arxi…
22 0 0
【交我学-31】多模态神经机器翻译综述
AudioCC交我学 作为学术研究者与实践者的连接点,我们致力于打造一个专注于语音技术的学术交流平台——「AudioCC交我学」专栏。在这里,我们将以简洁、专业的视角,解读听觉认知与计算声学领域的前沿论文,分享技术创新与应用实践的最新动态。…
34 0 0
