语音分享系列继续来袭,这次带来几个开源的工程。
1.OpenTransformer
正坤同学最近把OpenTransformer里加入里conformer模型,在aishell测试上效果刚刚,conformer模型基本成为继transformer模型后的标配。这套代码相比espnet还是简单很多,没有太多的耦合。这是第二次推荐这个系列了,大家有问题可以随时提。
https://github.com/ZhengkunTian/OpenTransformer
2.wenet
来自出门问问团队的端到端语音识别。unified模型已经被推到大家都在研究,之前谷歌,阿里等都放出对应的文章。但是问问团队不仅仅写论文,还开源了工程。
论文地址:https://arxiv.org/pdf/2012.05481.pdf
代码地址:https://github.com/mobvoi/wenet
在aishell测试上已经做到5以内的CER了。这个工程还在不断迭代中,向内部人员了解到在大数据集上也有不错表现。
3.用wav2vec2.0做声纹和语种
wav2vec2.0之前也推荐过,一个无监督的模型。预训练模型在NLP领域很成熟,但语音领域还挺少的。facebook团队做出了wav2vec2.0;来自自动化所的团队,在wav2vec2.0基础上去做声纹和语种的任务,发现同样有不错的效果。
论文地址:https://arxiv.org/pdf/2012.06185.pdf
关于wav2vec2.0可以去下面这个链接了解更多的信息。
https://github.com/pytorch/fairseq/tree/master/examples/wav2vec
4.公开课分享
推荐内容地址如下:
/mp.weixin.qq.com/s/WvQWTFdHcxYn0WzJFBwu1A
强烈推荐给大家,计算机相关专业在自我学习的路上还是很有帮助。
