SLT(Spoken Language Technology)是由IEEE信号处理学会(IEEE Signal Processing Society)语音与语言处理技术委员会(Speech and Language Processing Technical Committee,SLTC)主办的语音与语言处理研究领域的国际顶尖会议。
特定主题的挑战赛是SLT大会议程的亮点,每年从全球学者的提案中遴选。SLT2024将于12月在澳门举行,其中包括由美国罗切斯特大学、卡内基梅隆大学和日本名古屋大学联合承办的SVDD 2024挑战赛(Singing Voice Deepfake Detection)。


官网:https://challenge.singfake.org/

赛事背景 
随着AI生成的歌声日益接近自然人类的歌唱并与音乐谱曲完美对接,这一技术的迅速发展引发了艺术家和音乐产业的高度关注。与口语不同,歌唱声音由于其音乐性和强烈的背景音乐的存在,呈现出独特的挑战,使得歌唱声音深度伪造检测(SVDD)成为一个需要专注关注的专业领域。为了促进SVDD研究,我们最近提出了“SVDD挑战”,这是首个专注于实验室控制环境和野外真实及深度伪造歌唱声音记录的研究挑战。
这个SVDD挑战的提议是基于我们之前收集的SingFake数据集。这个数据集包含了各种语言和歌手的野外真实和深度伪造歌曲片段的大量收集。使用这个数据集,我们还展示了训练在语音上的最新语音CM系统在评估歌唱声音时性能大幅下降,而在歌唱声上重新训练则可大幅提高性能。这突显了专门的SVDD系统的必要性,并激励我们提出SVDD挑战。我们还评估了未知歌手、通信编解码器、不同语言和音乐环境等相关挑战,强调了稳健的SVDD系统的需求。这项工作一经发布,就受到了语音和音乐处理社区的广泛关注。我们认为,在SLT上组织一个关于SVDD的挑战和特别会议是及时的,既能解决利益相关者的关切,也能满足研究社区的兴趣。
为了支持这一挑战,我们设计了两个赛道,分别是野外SVDD(WildSVDD)和控制SVDD(CtrSVDD),代表野外和控制场景。WildSVDD赛道正在扩展我们现有的SingFake数据集,以创建一个更全面的野外数据集。这个扩展的数据集将为SVDD研究提供丰富的现实世界案例。鉴于野外数据的版权限制,我们将不会直接发布这些录音。相反,我们将提供可以访问这些录音的网页URL,以确保符合版权法。除了野外数据集外,我们还在策划一个控制数据集,CtrSVDD,使用各种现有的歌声合成系统。这将包括一些来自歌声转换挑战的顶尖系统。为这种控制环境生成的深度伪造将专注于歌唱声部。

我们将在SLT 2024上举办一个特别会议,展示这一挑战的结果和研究贡献。会议将从挑战的设置和结果概述开始,继而展示在此特别会议上接受的论文。我们预计许多论文将描述参与挑战的研究方法,同时我们也欢迎提交与SVDD研究相关的非直接参与挑战的论文。此会议旨在为SVDD研究人员提供一个交流平台,并吸引更广泛的语音社区关注SVDD这一新兴问题。


赛道介绍 
CtrSVDD赛道:

我们从现有的开源歌唱录音中获取真实数据集,包括普通话和日语歌唱数据集,如Opencpop、M4Singer、Kising以及Ofuton、Oniku、Kiritan和JVS-MuSiC。我们整合了14个深度伪造系统,覆盖了多种架构,以提供全面的评估环境。大部分模型均来源于开源工具包,并在公开可用的歌唱基准上进行训练。


WildSVDD赛道:

我们继续从社交媒体平台以类似于SingFake数据集的格式收集数据标注。鉴于版权问题,我们只提供URL和标注。因此,各参赛团队可能会获取与相同标注对应的不同媒体文件。由于这种变化性,我们在提交论文后不为WildSVDD挑战赛设置提供官方排名,但参与者可以使用自报的成绩比较系统性能。


重要时间节点 

- 2024年1月8日:发布CtrSVDD训练/开发数据

- 2024年3月2日:CodaBench开放,发布CtrSVDD测试数据和基准系统

- 2024年3月29日:发布WildSVDD数据集URL

- 2024年4月2日:发布评估计划1.0版本

- 2024年6月8日:报名截止,请求额外训练数据集权限截止

- 2024年6月15日:结果提交截止

- 2024年6月20日:SLT论文提交

- 2024年6月27日,SLT论文更新截止

- 2024年8月30日,SLT论文录用通知

- 2024年12月2日至5日:在SLT 2024上举办SVDD特别会议


更多信息及注册,请访问赛事官网:https://challenge.singfake.org/


组委会成员 
  • 张优, University of Rochester

  • 臧永宜, University of Rochester

  • 史嘉彤, Carnegie Mellon University

  • Ryuichi Yamamoto, Nagoya University

  • Tomoki Toda, Nagoya University

  • 段志尧, University of Rochester

我们期待您的参与和卓越的研究贡献,一同推动歌声深度伪造检测技术的发展!