以下是 k2 团队对2022年输出的技术做的盘点。 1. 技术创新 1.1 Pruned RNN-T loss 该项工作是新一代 Kaldi 针对 RNN-T 损失函数的创新性改进。原始的 RNN-T 损失函数在处理长文本或者长语音的时候显…
声浪
本文以 CTC Loss 计算为例,分析 k2.compose 和 k2.intersect 的区别和联系 如果已经很熟悉 k2.compose = k2.invert + k2.intersect, 建议直接滑到文末抽奖环节(大周末的,多…
下面是我们整理的Daniel Povey在第二届SH语音技术研讨会和第七届Kaldi技术交流会的报告内容,因为是翻译整理,如果有误,欢迎指正。 讲者:Daniel Povey 编辑:徐天翼、郭泓霄 去年以来的进展总结 新一代kaldi将焦点…
文章来源于新一代Kaldi,作者NGK编辑部 Dan神又出新东西了!(前面的都学完了吗?)本文主要介绍k2中的低时延RNN-T训练,这是一篇短小的写给懒人的科普文,不会有详细的理论推导,感兴趣的大佬可以直接阅读论文:https://arxi…
文章来源于新一代Kaldi,作者NGK编辑部 本文介绍如何使用新一代 Kaldi 中的 WebSocket 服务进行语音识别。 简介 本文介绍最近在sherpa[1]中新增的使用C++实现基于WebSocket的语音识别服务。只涉及设计思想…
文章来源于新一代Kaldi,作者NGK编辑部 本文介绍新一代 Kaldi 中的 LSTM GradientFilter: 相关代码:https://github.com/k2-fsa/icefall/blob/master/egs/libr…
文章来源于新一代Kaldi,作者NGK编辑部 本文介绍据我们所知, 第一个使用ncnn进行语音识别的开源项目sherpa-ncnn。 简介 sherpa[1]目前支持使用PyTorch做推理框架,进行语音识别。当模型使用PyTorch训练好…
1. 背景 近年来,随着GPU算力的不断提升,大型自监督预训练模型在自然语言处理这项任务中大放异彩,从GPT,到BERT,再到GPT-3,SOTA被不断的刷新。这类模型在预训练过程中,仅使用无标注数据进行学习,便能够对数据本身进行分析,学习…
文章来源于新一代Kaldi,作者NGK编辑部 NGK小组毕竟不是香港记者,不能每周都搞一个大新闻。近期有个别同学在交流群里问 Pruned RNN-T 的细节,这周就深入一点挖挖这个旧坟(闻)吧。 之前我们发过一篇文章,介绍了如何用 Pru…
