以下数据集包含相关语言的转录音频数据,由波形文件和 TSV 文件(line_index.tsv)组成。文件行_index.tsv 包含匿名的 FileID 和文件中的音频转录。数据集已手动检查质量,但可能仍有错误。
High quality TTS data for Bengali languages
http://www.openslr.org/37/孟加拉国孟加拉语和印度孟加拉语
High quality TTS data for Javanese
High quality TTS data for Khmer.
High quality TTS data for Nepali.
High quality TTS data for Sundanese.
http://www.openslr.org/44/桑达尼斯
Large Sinhala ASR training data set
Large Bengali ASR training data set
http://www.openslr.org/53/孟加拉语
Large Nepali ASR training data set
http://www.openslr.org/54/尼泊尔文
Crowdsourced high-quality Argentinian Spanish speech data set.
http://www.openslr.org/61/西班牙语(阿根廷布宜诺斯艾利斯)
Crowdsourced high-quality Malayalam multi-speaker speech data set.
http://www.openslr.org/63/马拉雅拉姆语(母语)
Crowdsourced high-quality Marathi multi-speaker speech data set.
http://www.openslr.org/64/马拉地语(母语)
Crowdsourced high-quality Tamil multi-speaker speech data set.
http://www.openslr.org/65/泰米尔语(母语)
Crowdsourced high-quality Telugu multi-speaker speech data set.
http://www.openslr.org/66/泰卢固语(母语)
Crowdsourced high-quality Catalan speech data set.
http://www.openslr.org/69/加泰隆语。
Crowdsourced high-quality Nigerian English speech data set.
http://www.openslr.org/70/尼日利亚英语
Crowdsourced high-quality Chilean Spanish speech data set.
http://www.openslr.org/71/智利西班牙语
Crowdsourced high-quality Columbian Spanish speech data set.
http://www.openslr.org/72/哥伦比亚西班牙语
Crowdsourced high-quality Peruvian Spanish speech data set.
http://www.openslr.org/73/秘鲁西班牙语
Crowdsourced high-quality Puerto Rico Spanish speech data set.
http://www.openslr.org/74/波多黎各西班牙语
Crowdsourced high-quality Venezuelan Spanish speech data set.
http://www.openslr.org/75/委内瑞拉西班牙语
Crowdsourced high-quality Basque speech data set.
http://www.openslr.org/76/巴士克语
Crowdsourced high-quality Galician speech data set.
http://www.openslr.org/77/加利西亚语
Crowdsourced high-quality Gujarati multi-speaker speech data set.
http://www.openslr.org/78/古吉拉特语(母语)
Crowdsourced high-quality Kannada multi-speaker speech data set.
Crowdsourced high-quality Burmese speech data set.
