超过的话,一个是 embedding 没法表示,一个是一直不能做 rescore。原理就是识别到足够长的blank就认为语音结束,rescore后清空一些状态,重新开始识别。
WeNet做长语音识别的策略是什么?源码好像不能超过20s,如果超过怎么做?
评论 0
文明发言,友善讨论
还没有评论,发表你的看法,来抢沙发~
超过的话,一个是 embedding 没法表示,一个是一直不能做 rescore。原理就是识别到足够长的blank就认为语音结束,rescore后清空一些状态,重新开始识别。