对语音识别有了大体印象,或许技术流程的细节、原理仍不是太清晰,此时大可以花些时间先行将每个知识点逐一弄明白,等到面面俱到了,这才出山,并期望有了一整套理论加持便能快速地实现一个语音识别系统。这样的线性思维适合一些考试,只要把教材的知识点摸得…
声浪
语音识别的全称是自动语音识别(Automatic Speech Recognition,ASR),说得多了, 就把“自动”省去了,认为“自动”是理所当然的了。语音识别属于序列转换技术,它将语音序列转换为文本序列。大体来说,这是一次搬运,是把…
从最起初的一声巨响,到梵音天籁,到耳旁的窃窃私语,到妈妈喊我回家吃饭,总离不开声音。声音是这个世界存在并运动着的证据。 1.1大音希声 假设我们已经知道了声音是什么。 我们可以找到很多描述声音的词语,如“抑扬顿挫”、“余音绕梁”。当我们在脑…
1.AP-OLR Challenge 2020 Baseline Recipe发布 上次推送的语种比赛,baseline已经发布。 论文地址:https://arxiv.org/pdf/2006.03473; 地址:https://gith…
kaldi官方正式合并了基于HI-MIA数据集的唤醒recipe方案。此唤醒的recipe方案由北京希尔贝壳科技,西北工业大学音频语音与语言处理研究组,AISHELL Foundation合作完成。 此recipe方案基于北京希尔贝壳科技在…
近日,freewym(Yiming Wang)在kaldi的master分支合并了Wake-word detection #3467。 此前,出门问问团队在openslr上上传了数据,地址:https://www.openslr.org/8…
由中国工信出版集团,电子工业出版社,由陈果果,都家宇,那兴宇,张俊博四位同学合著的kaldi 语音识别实战这本书终于预售了。欢迎大家前去购买。地址在阅读原文里。
kaldi官网(https://github.com/kaldi-asr/kaldi)合并了Lookahead graph decoding #3616。look ahead的具体解释:将当前节点历史下的后继单词语言模型得分最大值加进来(提…
从去年开始,深度学习工具箱如雨后春笋般一个接一个出来。但是作为语音识别的学生,研究或者工程人员应该选择哪个工具呢?下面是我的一些理解,希望对大家选用工具有一点帮助。 1、tensorflow 社区应该目前是最大的,谷歌有那么一大帮人来维护,…
三音素GMM与单音素GMM的主要差别在于决策树状态绑定,与GMM参数更新相关的原理、程序和类两者都是一样的。 在这个笔记中,我会首先介绍表示HMM的类HmmTopology和TransitionModel,然后介绍三音素GMM训练脚本tra…
