语音之家
首页声浪活动AI科普学堂SOTA分享热聘会员服务
登录 注册

声浪

写文章
如果有长语音识别需求就需要自己手动裁剪,然后再合并?
语音小管家语音小管家
问答4 years ago
如果有长语音识别需求就需要自己手动裁剪,然后再合并?

开启实时长语音识别选项即可。

54 0 0
如果说话长度超过了给定阈值后,WeNet是否可以认为把一句话分割成多句话了,分别识别?
语音小管家语音小管家
问答4 years ago
如果说话长度超过了给定阈值后,WeNet是否可以认为把一句话分割成多句话了,分别识别?

runtime 的代码中,超过 20s 就会强制截断。

88 0 0
WeNet做长语音识别的策略是什么?源码好像不能超过20s,如果超过怎么做?
语音小管家语音小管家
问答4 years ago
WeNet做长语音识别的策略是什么?源码好像不能超过20s,如果超过怎么做?

超过的话,一个是 embedding 没法表示,一个是一直不能做 rescore。原理就是识别到足够长的blank就认为语音结束,rescore后清空一些状态,重新开始识别。

95 0 0
是不是目前基于aishell预训练的模型在给定的py脚本下里面是没办法流式的?   尝试改了 encoder的初始化参数 “use_dynamic_chunk”, 推理时能够走到forward_chu
语音小管家语音小管家
问答4 years ago
是不是目前基于aishell预训练的模型在给定的py脚本下里面是没办法流式的? 尝试改了 encoder的初始化参数 “use_dynamic_chunk”, 推理时能够走到forward_chu

如果模型训练的时候没有用dynamic chunk,在推理时强行更改配置文件也无法做流式。

76 0 0
8k16bit的wav,计算 cmvn 的时候每个frame是多长?10ms?
语音小管家语音小管家
问答4 years ago
8k16bit的wav,计算 cmvn 的时候每个frame是多长?10ms?

帧长25ms,帧移10ms

164 0 0
请问一下,远程服务器docker启动了,本地如何前端访问?
语音小管家语音小管家
问答4 years ago
请问一下,远程服务器docker启动了,本地如何前端访问?

问:请问一下,远程服务器docker启动了,本地如何前端访问? 答:参考https://zhuanlan.zhihu.com/p/462949231

70 0 0
dpp init是会自动生成的吗?需要自己预先touch 吗?
语音小管家语音小管家
问答4 years ago
dpp init是会自动生成的吗?需要自己预先touch 吗?

自动生成的

61 0 0
 想问一下 加语言模型后转译结果都是生僻字,是什么原因呢?
语音小管家语音小管家
问答4 years ago
想问一下 加语言模型后转译结果都是生僻字,是什么原因呢?

问:想问一下 加语言模型后转译结果都是生僻字,是什么原因呢? 答:检查一下 words.txt,应该用语言模型对应的词典

84 0 0
单机多卡训练,WeNet的train.py总是在init_process_group就不往前了,是有什么特殊运行方式呢?
语音小管家语音小管家
问答4 years ago
单机多卡训练,WeNet的train.py总是在init_process_group就不往前了,是有什么特殊运行方式呢?

问:单机多卡训练,WeNet的train.py总是在init_process_group就不往前了,是有什么特殊运行方式呢? 答:需要删除 ddp_init

82 0 0
在使用websocket_server_main的时候发现内存会随请求数不断增长,但是当识别任务结束连接断开的时候内存并未被释放,这大概是哪部分代码的引起的呢?
语音小管家语音小管家
问答4 years ago
在使用websocket_server_main的时候发现内存会随请求数不断增长,但是当识别任务结束连接断开的时候内存并未被释放,这大概是哪部分代码的引起的呢?

不是WeNet的问题,是libtorch和onnx内部的内存管理机制,可以在必要的地方强制free libtorch官方github里有相应issues。

49 0 0
‹1…34567…14›

热门主题

1资讯
2SpeechIO
3WeNet
4Kaldi
5AudioCC
6算法
7开源
8数据
9学术
10内推招聘

热文排行

1英伟达CPU问世:ARM架构,对比x86实现十倍性能提升2微软拟斥资 160 亿美元收购全球最大语音识别公司 Nuance3ImageNet验证集6%的标签都是错的,MIT:十大常用数据集没那么靠谱4WeNet更新:支持 CTC alignment52021全国声学大会语言声学分论坛报告—第三代语音识别技术初探6详解 WebRTC 高音质低延时的背后 — AGC(自动增益控制)7TIOBE 场景测试:经济 金融 货币8语音信号处理论文优选:Handling Background Noise in Neural Speech Generation9TIOBE 场景测试:汽车之家 汽车评测10推出 Lyra:用于语音压缩的新型极低比特率编解码器

活跃用户榜

语音小管家
语音小管家
已发表 3000 篇
每日语音速递
每日语音速递
已发表 991 篇
西工大音频语音与语言处理研究组
西工大音频语音与语言处理研究组
已发表 106 篇
SpeechIO
SpeechIO
已发表 82 篇
低调奋进
低调奋进
已发表 57 篇
机器之心
机器之心
已发表 45 篇
新智元
新智元
已发表 39 篇
阿里语音AI
阿里语音AI
已发表 33 篇
新一代Kaldi
新一代Kaldi
已发表 31 篇
THUHCSI人机语音交互实验室
THUHCSI人机语音交互实验室
已发表 29 篇

语音之家 SpeechHome

汇聚产学研各界开发者,覆盖语音识别、音频合成、声纹识别、视听多模态、物理 AI、具身听觉、人机交互等方向。

友情链接

中国计算机学会中国人工智能产业发展联盟中国人工智能学会魔搭社区希尔贝壳开源中国思否稀土掘金RTE开发者社区CSDNAI光影社 WeNetopenslrMongoDB中文社区

资源

声浪 活动 AI科普 分享 热聘 会员服务

关于

服务条款 隐私协议 合作伙伴

© 2026 语音之家 SpeechHome.com|京ICP备17027745号-4|京公网安备11010802032971号