字节联手港中大,打造TTS语音自然度评估系统,让机器懂人类觉得“自然”的语音
标题:《SpeechJudge: Towards Human-Level Judgment for Speech Naturalness》 论文地址:https://arxiv.org/pdf/2511.07931 项目地址:https:/…
24 0 0
标题:《SpeechJudge: Towards Human-Level Judgment for Speech Naturalness》 论文地址:https://arxiv.org/pdf/2511.07931 项目地址:https:/…
多模态生成技术在图像、视频、语音等方向的快速突破,使 “音乐 × 视频” 的多模态生成变成新的研究热点。然而在真实业务场景中,仍然存在诸多未被充分解决的技术空白,例如: 在音乐驱动的视频生成中,仍缺乏对长时序一致性、音画节奏对齐与镜头运动的…
近日,人工智能领域的顶级国际会议——AAAI 2026(The 40th Annual AAAI Conference on Artificial Intelligence)正式公布了论文录用结果。IMU语音理解与生成实验室最新表现力视频配…