上个月,香港中文大学(深圳)联合中国科学院声学研究所、上海人工智能实验室等机构推出了涵盖6种语言、超过10万小时的多样化语音生成数据集——Emilia,并在 GitHub 平台上开源了数据预处理框架 Emilia-Pipe。

详情请见:6种语言超过10万小时语音生成数据集Emilia。

近日,Amphion团队在 Hugging Face和OpenDataLab 平台上开源了 Emilia数据集。这一数据集是全球最大且最为多样的多语言语音数据集之一,助力多语种语音生成与研究。🎉🎉🎉

可通过以下链接免费下载并立即开始使用:


Emilia数据集简介:

  • 📢 超10万小时的真实语音数据,采集自互联网各大平台,包括脱口秀、访谈、辩论、体育解说、有声书等内容;

  • 🌍 支持6种语言:英语(En)、中文(Zh)、德语(De)、法语(Fr)、日语(Ja)、韩语(Ko);

  • 🎙 丰富的说话风格,涵盖多种内容题材,满足不同应用场景下的大规模语音生成需求;

  • 💪 训练效果对标SOTA,基于 Emilia 数据集训练的 TTS 系统可以跟 SeedTTS、ChatTTS 等开源和商业系统/模型的主观/客观指标对标。


Emilia数据多样性分析
通过 Emilia 数据集,研究者和开发者可以进行大规模语音生成模型的训练和开发,为多语言环境下的语音应用提供强有力的支持!期待大家在使用 Emilia 数据集时能够发掘更多惊喜,欢迎分享您的研究成果与经验!
⚠️请注意:该数据集仅可用于非商业科研目的,Amphion 团队不拥有这些音频文件的版权,版权仍归原始视频或者音频的所有者。想把该数据预处理框架用于商业用途或定制大规模数据集,请联系Amphion团队。