作者:朱鹏程

近日,由网易伏羲语音与音乐团队、上海视觉艺术学院流行音乐舞蹈学院王玉老师团队、西工大音频语音与语言处理研究组谢磊老师团队、同济大学设计创意学院吴洁老师团队联合发布的中文精标歌声合成数据集Opencpop,正式在wenet开源社区开放下载。数据申请入口:

“

https://wenet.org.cn/opencpop/download/

”
关于Opencpop的详细情况,可参见已提交至arXiv的相关论文, 论文链接:
https://arxiv.org/pdf/2201.07429.pdf

数据集介绍

背景信息

歌声合成(singing voice synthesis, SVS)是指计算机将包含歌词的标准化曲谱转化为歌声的技术。作为语音合成技术的重要分支,歌声合成有着悠久的研究历史。近年来,随着深度学习在时长建模、声学建模、声码器等语音合成任务上带来的突破性进展,歌声合成也逐渐迈向实用化的阶段,其在虚拟偶像、音乐创作、游戏配乐等场景中崭露出巨大的应用潜力。
在工业界大力发展歌声合成的同时,高质量开源歌声合成数据的短缺把学术界以及资金相对薄弱团体的研究人员拒之门外。为了汇集更多的智慧、推进AI音乐技术的普及与发展,首个高质量中文歌声合成数据集Opencpop应运而生。open译为开源、开放,C-pop是指汉语流行音乐。Opencpop的诞生致力于降低中文歌声合成研究道路上的数据门槛,为中小型企业、高校、个人等研究者们敞开中文歌声合成研究的大门。

项目主页

  • 数据主页:https://wenet.org.cn/opencpop/
  • Github项目:https://github.com/wenet-e2e/opencpop

数据集信息

opencpop示例(干声)音频:戳我听音频
opencpop示例(加伴奏)音频:戳我听音频


数据集由100首纯中文歌曲构成,其中训练集包含95首,另外5首则为测试集。音频在录音棚环境录制,音频采样率44.1kHz,24位深度,有效时长超5.2小时。同时,我们提供了人工精标的信息,包括MIDI、句子边界、音符边界、音素边界、连音信息、呼吸声、歌词等信息。数据集单句时长控制在8秒内,共3756句。为方便研究者们快速进行实验,我们在原始数据(音频, MIDI, TextGrid)外,提供了分句音频、训练集/测试集的抄本文件。

如上图所示,数据集建设由音库设计、录制、MIDI标注、TextGrid标注、QA检查、后处理入库等六个步组成。音库候选歌曲来自各音乐平台热门歌曲榜,去除包含英文的歌曲,从300首纯中文歌曲中,按音素覆盖、BPM等原则挑选得到最终100首歌曲。与一般歌声数据集不同,我们的MIDI与TextGrid的标注都是以实际人声为准,没有修音等操作,这样能做到在充分保证歌声和曲谱一致性的基础上,不破坏人声信息。数据集音高分布如下图所示:图片

实验结果

为了保证数据的高可用性,我们以Opencpop为实验数据,基于主流深度神经网络结构(Transformer和Conformer)和神经声码器(HifiGAN)搭建了三套歌声合成系统进行验证。主客观实验均表明,该数据集符合歌声合成任务需求,数据库质量达标。图片
opencpop生成结果一音频:戳我听音频
opencpop生成结果二音频:戳我听音频


未来展望

  • 歌声合成在多说话人合成、高表现力合成、音域扩展等方面还存在很多研究热点,期待和各位研究者们共同突破。

  • 为促进歌声合成技术发展,给研究者提供准确的基线系统,Opencpop团队正在准备代码开源事宜,敬请期待!


致谢

  • 感谢上海视觉艺术学院流行音乐舞蹈学院音频团队(上图)在音频录制和MIDI标注任务上的努力和付出。

  • 感谢各位AI音乐的热爱者们,期待Opencpop在你们手中发挥出更大的作用,给华流音乐创作添砖加瓦。

  • 感谢我们伟大的祖国,盛世之下文艺与技术才能百花齐放。