天聪智能
ASV-Subtools是厦门大学智能语音实验室(XMUSPEECH)于2020年6月推出的一套高效、易于扩展的声纹识别开源工具,该工具是基于Kaldi与Pytorch开发的,充分结合了Kaldi 在语音信号和后端处理的高效性以及PyTorch 开发和训练神经网络的便捷灵活性。
更新介绍
ASV-Subtools原有的训练模式为离线模式,即采用的是原生的Pytorch Dataset,训练样例主要存储在csv文件中,每个样例为一行,其中信息主要包含数据路径、对应标签等,这里的数据为Kaldi格式的特征存储路径;在训练流程中,可以根据存储位置进行数据读取并与其对应的标签组合成训练样例。然而,随着数据量的增加,原有离线训练模式已不能满足高效研发的需求:频繁的IO读取会导致显存占用高但利用率低的问题。

图1 ASV-Subtools中的数据处理流程
因此为了满足大规模数据训练的需求,ASV-Subtools参考借鉴了WeNet、Speechbrain等优秀开源框架的架构,新增了在线训练模式,并从以下三个方面进行更新:
01
大规模数据读取下的IO改进

图2 ASV-Subtools在线数据处理方案
02
混合精度训练
03
在线数据扩增

图3 ASV-Subtools在线数据扩充示意图
最新结果
新增的在线训练模式刷新了此前ASV-Subtools在VoxCeleb数据集上的最优结果,再次取得了SOTA的水平,相关复现脚本均已更新至Github,读者可以在GitHub上获得更多测试结果和详细的实验配置,感兴趣的读者赶紧上手试试吧!
VoxCeleb2上ResNet34模型的测试结果:

VoxCeleb2上ECAPA模型的测试结果:

►►►其他更新
1、XMUSPEECH针对语速对抗问题的最新研究成果的源码已更新至ASV-Subtools,该研究成果“Deep Representation Decomposition for Rate-Invariant Speaker Verification”已被国际顶级说话人和语种识别研讨会 (Odyssey 2022)接收。
论文原文:
https://www.isca-speech.org/archive/odyssey_2022/tong22_odyssey.html
2、新增部分模型,例如RepVGG、RepSPK等。
3、支持JIT模型转化,并且模型落地的RUNTIME模块在下一步开源计划中,敬请期待~
►►►课程推荐

