面向听觉智能与物理AI的
人机交互开发者社区

发现模型、参与赛事、分享实践、连接同行,共创数据、模型与评测驱动的人机交互生态。

50k+
注册开发者
5.8k+
技术文章
268+
开源数据集
300+
技术课程

最新声浪

查看全部 →
通义开源 PrismAudio:声画同频,音效随行
转载7 months ago
通义开源 PrismAudio:声画同频,音效随行

现在的配音模型有时会“顾此失彼”:为了追求声音像,可能时机就不准了;为了追求时机准,音质有可能会变差。这是因为模型试图用一套标准同时满足所有要求,导致目标之间互相“打架”。 为了解决这个问题,通义实验室开源发布了PrismAudio。 论文…

26 0 0

为语音开发者而生