声浪
WeNet做长语音识别的策略是什么?源码好像不能超过20s,如果超过怎么做?
超过的话,一个是 embedding 没法表示,一个是一直不能做 rescore。原理就是识别到足够长的blank就认为语音结束,rescore后清空一些状态,重新开始识别。
95 0 0
是不是目前基于aishell预训练的模型在给定的py脚本下里面是没办法流式的? 尝试改了 encoder的初始化参数 “use_dynamic_chunk”, 推理时能够走到forward_chu
如果模型训练的时候没有用dynamic chunk,在推理时强行更改配置文件也无法做流式。
76 0 0
请问一下,远程服务器docker启动了,本地如何前端访问?
问:请问一下,远程服务器docker启动了,本地如何前端访问? 答:参考https://zhuanlan.zhihu.com/p/462949231
70 0 0
单机多卡训练,WeNet的train.py总是在init_process_group就不往前了,是有什么特殊运行方式呢?
问:单机多卡训练,WeNet的train.py总是在init_process_group就不往前了,是有什么特殊运行方式呢? 答:需要删除 ddp_init
82 0 0
在使用websocket_server_main的时候发现内存会随请求数不断增长,但是当识别任务结束连接断开的时候内存并未被释放,这大概是哪部分代码的引起的呢?
不是WeNet的问题,是libtorch和onnx内部的内存管理机制,可以在必要的地方强制free libtorch官方github里有相应issues。
49 0 0
