跨语言情感语音合成(Cross-lingual Emotional Speech Synthesis)旨在在不改变语音语言内容信息的前提下,将源语言语音中的情感特征自然迁移到目标语言的合成语音中。这一技术在电影配音、多语言虚拟人等场景中有着…
声浪
本系列的十篇文章,是对之前文章中提到的十个趋势进行详细的剖析。 关于未来语音技术和应用趋势的10点看法 在这个系列文章中,会穿插科普、技术综述、技术发展路线,以及一些个人和其他行业专家的思考。希望通过这一系列文章,无论读者之前对语音技术和应…
大家好,欢迎来到「AudioCC交我学」专栏! 作为学术研究者与实践者的连接点,我们致力于打造一个专注于语音技术的学术交流平台——「AudioCC交我学」专栏。在这里,我们将以简洁、专业的视角,解读听觉认知与计算声学领域的前沿论文,分享技术…
来源丨PaperWeekly 180 万小时、44k 高保真、支持全量微调——刚刚开源的 VoxCPM 1.5,技术细节全解密。 最近,面壁技术团队发布了 VoxCPM 1.5 版本,在持续优化开发者开发体验的同时,也带来了多项核心能力升级…
本文由知乎作者Oliver投稿,采用第一人称视角撰写 语音增强技术已经发展了好多年了,但是目前各说各的好或者是技术保密。那么现在语音增强技术到底发展到一种什么程度了呢?未来的趋向又在什么地方? 2022年入职后,在mentor的指导下我开始…
近日智谱正式发布工业级语音合成系统 GLM-TTS,并在 Hugging Face 和 ModelScope 上开放模型权重。 基于在数据筛选、基础模型结构、精品音色监督微调(SFT)范式和强化学习(RL)范式等多方面创新,GLM-TTS…
语音转换(Voice Conversion, VC)旨在在不改变语言内容的情况下,将源说话人的语音转换为目标说话人的语音,广泛应用于电影配音、虚拟人、语音聊天等场景。然而在真实应用场景中,VC 系统面临两大挑战。 环境噪声:用户录音往往嘈杂…
语音匿名化(Voice Anonymization)旨在在保留语义和情感信息的同时去除说话人的身份特征。现有基于深度学习的主流方法通常依赖显式说话人嵌入模型(Speaker Embedding Model)来提取和替换说话人特征,但这类方法…
