首先语音识别系统对收集到的目标语音进行预处理,这个过程就已经十分复杂,包含语音信号采样、反混叠带通滤波、去除个体发音差异和设备、环境引起的噪声影响等等。之后对处理的语音进行特征提取。
语音识别的原理其实并不难理解,原理上和指纹识别的原理相同:设备收集目标语音,然后对收集到的语音进行一系列处理,得到目标语音的特征信息,然后让特征信息与数据库中已存数据进行相似度搜索比对,评分高者即为识别结果。然后通过其他系统的接入来完成设备的语音识别功能。本篇文章给大家主要分享一下,对中英ASR的标注。
需要标注语种:中英混ASR
标注要求
1、语义片段截取
2、入股音频内没有英文单词,直接选择“丢弃”。
3、原始数据有初始的起始点,需要重新进行截取。对语音进行最大截取,截取能听懂的最长连续语音片段,首尾截取点可以包含静音片段。
4、如果大部门都听不懂,最后剩下最长语音片段小于2s,选择“丢弃”,后续ASR相关标注无需进行。

转写文本标注
1、需要注意的是数字需要使用中文数字,不要标注阿拉伯数字等其他符号,如果念的是英文字母串需要在字母串中间加空格。(标注文本中只能包含汉子英文和标点)
2、如果语音片段中有多人说话,说话没有重复,正常标注,如果说话有重叠,标注主说话人。
3、标注主说话人,背景噪音不要标注。(背景噪声、人声噪、电视噪声幅值低于主要说话人语音幅值的一半)
4、人声重叠,多个人说话声音大小相近,需要截取掉或者丢弃。(背景噪声、人声噪、电视噪声幅值高于主要说话人语音幅值的一半)
标点标注
1、逗号,句号,感叹号,问号
2、纯文本和中英混用全角标点,纯英文用半角标点。其他标点标注标准可参考:中英文标点标注规则-外部
常见字母串
1、常见的字母串(ktv pdf)不用加空格,无法界定是否常见可加可不加(nfc)
音标写法
1、全英文语境[h],[en],-英文标点
2、中英混:这个音标念[h],这里的逗号是中文逗号
3、要点:音符前后都需要打空格,音标和标点之间都需要空格(不区分全角半角)
标点符号
1、根据实际转写出来的文本打标点符号
2、标点符合常用习惯即可,不能出现硬性错误。(类似于英语随意给逗号,语义完成的句末给逗号)
3、话没说完,末尾不要打标点,说完了打句号
4、关于标点符号,以下三个例子中
(1)一台iphone十二,
(2)八月,一月爆火的Never家。韩货老大的Lisa
(3)fenty beauty 的另一个持妆系列的一个粉底液
以上这三个句子,都是名词类的,都不需要家标点
笑声的转写
1、大于等于5个的不可数笑声 -统一转写5个
2、小于5个的笑声,按照实际发声数转写
截取
1、首尾截取静音预留无要求
2、如果主说话人在说话的过程停顿了很久,中间大段的静音片段也可保留
磕巴
1、中文磕巴:紧凑的叠字我我不去。直接这样写即可,我我之间不打标点。
2、英文磕巴:re- re- restaurant 结巴音后打连字符加一个空格
单词转写
1、英文单词发音不标准,能猜出目标词,写目标词
2、找不到发音的英文单词,不进行转写
(1)https://tcs.jiyunhudong.com/workprocess/6950089134979465736?mode=scan&task_ids=6950149502779048451音乐的 do re mi fa sol,截取掉,不转写
(2)https://tcs.bytedance.net/workprocess/6950089134979465736?mode=scan&task_ids=6950149551399387662JavaScript 他念成了 Java creen 发音差别较大,还是写目标词 JavaScript
(3)单词 sql 有念 secker的 有念 socker 的。我们都转写为 sql 目标词。
语音识别是涉及心理学、生理学、声学、语言学、信息理论、信号处理、计算机科学、模式识别等多个学科的交叉学科,具有广阔的应用前景,如语音检索、命令控制、自动客户服务、机器自动翻译等。当今信息社会的高速发展迫切需要性能优越的,能满足各种不同需求的自动语音识别技术。但是,这样的目标面临着诸多困难,如:
①语音信号会受 到上下文的影响而发生变化;
②发音人以及口音的不同会导致语音特征在参数空间分布的不同;
③同一发音人心理和生理变化带来的语音变化;
④不同的发音方式和习惯引起的省略、连读等多变的语音现象;
⑤环境和信道等因素造成的语音信号失真问题
文章来源知乎,本文作者:阿玲
