文章来源于THUsatlab,作者王皓宇
本文介绍清华大学语音与音频技术实验室(SATLab)Interspeech 2022录用论文The THUEE System Description for the IARPA OpenASR21 Challenge. 在去年的IARPA OpenASR21低资源语音识别挑战赛中,来自SATLab实验室参赛队伍THUEE在两个赛道的13个项目中取得了第一名的优秀成绩。THUEE队伍在受限赛道中使用了基于Kaldi的CNN-TDNN-F和CNN-TDNN-F-A系统,在半受限赛道中则使用了wav2vec 2.0 XLSR-53预训练模型。论文全文见文末链接。
01 OpenASR21挑战赛

比赛涉及到的15种语言
02 受限赛道

受限赛道的系统概况
03 半受限赛道

半受限赛道的系统概况
一部分OpenASR21语种有罗马化标注,这些语种使用罗马字符作为建模单元;另一些语种没有罗马化标注。这时我们使用字素作为建模单元。微调学习率为10E-3,共微调100K步。微调模型和受限赛道对应语种的模型使用ROVER工具进行融合。
THUEE队伍在OpenASR21赛事中取得了优异的成绩,其中限制赛道的关键在于多种系统的融合;而半限制赛道的关键提升来自于无监督+有监督的两步微调策略。
