为进一步方便大家使用 WeNet 进行学术研究,近日,WeNet 在原有 LibriSpeech 和 GigaSpeech 两个主流英文数据集的基础上,新增如下四个英文数据集的支持:

  • chime4
  • switchboard
  • tedlium3
  • wsj

这4个数据集的支持是由开源社区的几位同学分别贡献的,感谢他们的支持和付出!未来,WeNet 还会进一步丰富数据集的支持,欢迎各位有志同学多多参与,多多贡献,想参与的同学可以直接在 https://github.com/wenet-e2e/wenet/discussions/587 评论认领数据集的支持,或在 WeNet 的微信交流群中直接沟通。

本次更新的四个数据集的详情如下。

chime4

贡献者:巫健,微软

recipe:https://github.com/wenet-e2e/wenet/tree/main/examples/chime4/s0

数据集简述:CHiME(Computational Hearing in Multisource Environments)第 4 届挑战赛,18小时,覆盖远场、多通道、4种噪声(咖啡厅、街道十字路口、公共汽车、步行街)等挑战场景。

结果如下表所示:

decoding modedt05_real_1chdt05_simu_1chet05_real_1chet05_simu_1ch
ctc_prefix_beam_search19.06%21.17%28.39%29.16%
attention_rescoring17.92%20.22%27.40%28.25%

swtichboard

贡献者:郭鹏程,西北工业大学计算机学院

recipe:https://github.com/wenet-e2e/wenet/tree/main/examples/swbd/s0

数据集简述:英文电话对话类数据集,300h,8k 采样率。

结果如下表所示:

decoding modeeval2000 (WER)
ctc_greedy_search32.39%
ctc_prefix_beam_search32.39%
attention31.28%
attention_rescoring31.36%

tedlium3

贡献者:张悦铠,Zoom

recipe:https://github.com/wenet-e2e/wenet/tree/main/examples/tedlium3/s0

数据集简述:英文 TED 演讲风格数据集,452小时,16k 采样率,总计包含 2351 段演讲。

结果如下表所示:

decoding modeDev WERTest WER
attention rescoring9.54%8.66%

wsj

贡献者:李盛强,西北工业大学航海学院

recipe:https://github.com/wenet-e2e/wenet/tree/main/examples/wsj/s0

数据集简述:英文语音听写风格数据集,70 小时,16k 采样率。

结果如下表所示:

decoding modedev93 (CER)dev93 (WER)
ctc_greedy_search5.25%13.16%
ctc_prefix_beam_search5.17%13.10%
attention_rescoring5.11%12.17%