本文转载自微信公众号:NVIDA英伟达 网易互娱 AI Lab 的研发人员,基于 Wenet 语音识别工具进行优化和创新,利用 NVIDIA Triton 推理服务器的 GPU Batch Inference 机制加速了语音识别的速度,并且…
声浪
本文介绍了Wenet模型实现时使用的mask技巧 在Wenet的模型实现时,涉及到一些论文中没有描述细节,比如: 一个batch内的输入帧数不等长,进行padding的部分如何处理。 一个batch内标注文本不等长,进行padding的部分…
本节介绍基本的端到端语音识别涉及的重要概念 语音识别任务中,输入是语音,输出是文本,两个序列不等长,但是时序上有同步性。传统语音识别通过HMM来建模输出和输入不等长和时序同步性,并对音素,词典,语言模型分层次建模。 在传统的HMM框架里,声…
目的 小结一下WeNet, bidecoder架构下的, 在Train的时候,涉及encoder/decoder/loss的,所有的forward函数。 要好好研究forward函数,需要: root@1032f8d48655:/# vi…
学习第四个解码算法:解码算法 在脚本中对应的是: decode_mode="attention" 怎么还是感觉和之前的有一定的重合的地方???[这个是特殊的!自回归+beam search] 这个允许batch_size > 1,所以我们设…
在哪儿 已经连续学习了两个inference算法,本次学习第三个: ctc prefix beam search,感觉这个貌似和attention rescoring非常类似。 在脚本中对应的是: decode_mode="ctc_pref…
启动脚本 第一个inference的算法 attention rescoring,就在上面part -6 学习了。 本次学习第二个inference算法:ctc greedy search。 这个只需要在运行脚本中增加: decode_mo…
本次开始,对WeNet的测试代码,进行逐行学习。 运行脚本 if[${stage}-le8]&&[${stop_stage}-ge8];then # Test model, please specify the model you want…
目前的位置: left_decoder和right_decoder已经执行完毕,结果返回: decoder执行结束,结果返回 开启loss计算之旅: decoder执行完毕;现在需要根据model output和reference text…
目前的位置: encoder的forward走完了 在所有12层ConformerEncoderLayer的forward执行完毕之后,最后还有个after_norm 来最后搞一次layer normalization。 至此,Encode…
