以下数据集包含相关语言的转录音频数据,由波形文件和 TSV 文件(line_index.tsv)组成。文件行_index.tsv 包含匿名的 FileID 和文件中的音频转录。数据集已手动检查质量,但可能仍有错误。

High quality TTS data for Bengali languages

http://www.openslr.org/37/孟加拉国孟加拉语和印度孟加拉语

High quality TTS data for Javanese

http://www.openslr.org/41/爪 哇

High quality TTS data for Khmer.

http://www.openslr.org/42/高棉

High quality TTS data for Nepali.

http://www.openslr.org/43/尼泊尔

High quality TTS data for Sundanese.

http://www.openslr.org/44/桑达尼斯

Large Sinhala ASR training data set

http://www.openslr.org/52/僧伽罗

Large Bengali ASR training data set

http://www.openslr.org/53/孟加拉语

Large Nepali ASR training data set

http://www.openslr.org/54/尼泊尔文

Crowdsourced high-quality Argentinian Spanish speech data set.

http://www.openslr.org/61/西班牙语(阿根廷布宜诺斯艾利斯)

Crowdsourced high-quality Malayalam multi-speaker speech data set.

http://www.openslr.org/63/马拉雅拉姆语(母语)

Crowdsourced high-quality Marathi multi-speaker speech data set.

http://www.openslr.org/64/马拉地语(母语)

Crowdsourced high-quality Tamil multi-speaker speech data set.

http://www.openslr.org/65/泰米尔语(母语)

Crowdsourced high-quality Telugu multi-speaker speech data set.

http://www.openslr.org/66/泰卢固语(母语)

Crowdsourced high-quality Catalan speech data set.

http://www.openslr.org/69/加泰隆语。

Crowdsourced high-quality Nigerian English speech data set.

http://www.openslr.org/70/尼日利亚英语

Crowdsourced high-quality Chilean Spanish speech data set.

http://www.openslr.org/71/智利西班牙语

Crowdsourced high-quality Columbian Spanish speech data set.

http://www.openslr.org/72/哥伦比亚西班牙语

Crowdsourced high-quality Peruvian Spanish speech data set.

http://www.openslr.org/73/秘鲁西班牙语

Crowdsourced high-quality Puerto Rico Spanish speech data set.

http://www.openslr.org/74/波多黎各西班牙语

Crowdsourced high-quality Venezuelan Spanish speech data set.

http://www.openslr.org/75/委内瑞拉西班牙语

Crowdsourced high-quality Basque speech data set.

http://www.openslr.org/76/巴士克语

Crowdsourced high-quality Galician speech data set.

http://www.openslr.org/77/加利西亚语

Crowdsourced high-quality Gujarati multi-speaker speech data set.

http://www.openslr.org/78/古吉拉特语(母语)

Crowdsourced high-quality Kannada multi-speaker speech data set.

http://www.openslr.org/79/缅甸

Crowdsourced high-quality Burmese speech data set.

http://www.openslr.org/80/卡纳达