语音识别的研究工作对于信息化社会的发展,人们生活水平的提高等方面有着深远的意义。随着计算机信息技术的不断发展,语音识别技术将取得更多重大突破,语音识别系统的研究将会更加深入,有着更加广阔的发展空间。语音识别是解决机器“听懂”人类语言的一项技术。作为智能计算机研究的主导方向和人机语音通信的关键技术,语音识别技术一直受到各国科学界的广泛关注。这篇文章就给大家分享,《语音识别-方言转写》案例。
判断声音是否有效
1、有效:中文标准普通话,或者略带轻/重口音的地方;保存继续下一句快捷键alt+enter
2、无效:整体判断原则不变,判断原则见P2,但是对无效3类,如下无效1-人噪,整句只有人噪没有有效语音
(1)听不清人说的内容,无法判断的
(2)有效占比过低的数据(如一句话整段只能听清30%,剩下的70%听不清)
(3)只有语气词:嗯,啊,嗯嗯,哦哦
(4)视频或电视节目等真实人声,如不能转写出来-无效1-人噪无效2-非人噪,整句只有非人噪没有有效语音
(5)非人发出的噪声,比如鸣笛声、开关门等
(6)非发音人说话的语音(比如咳嗽笑声等)、音乐(纯音乐、清唱、录播的音乐)、键盘音、电话忙音、彩铃等
(7)唱歌属于非人噪。不管是清唱、跟唱或原生带唱的
(8)音频总时长>16秒且全是非人说话的噪音的时候。无效2-非人噪无效3-其他:
如tts即人工合成的声音
音频总时长>16秒且是人声的时候
由于采样率错误或数据源问题导致的变音-语速异常,过快或过慢的
如果一个批次连续出现语速不正常音频,请先暂停标注并反馈
注意:
(1)包含人噪及非人噪,优先标注为人噪
(2)包含人噪及tts,优先标注为人噪
(3)包含tts及非人噪,优先标注为其他
(4)音频有问题,像是说话不正常特别快或特别慢,需要反馈出来确认是否无效
(5)常规无效中,出现多种无效原因,按照优先级选择:人噪>其他>非人噪
关于TTS和录音电子音定义
1、TTS:无效。指人工合成的声音,非常标准的,如地铁中的播报,导航的声音……TTS声音的特征较为僵硬,声调无明显转换
2、录音电子音:有效。电视中人的声音,广播新闻中人的声音,指录的真人的声音……
性别
1、男
2、女
口音
1、有|无判断:按照有无明显口音为标准。平翘舌不分,n l不分,前后鼻音不分等,还有特别明显的地方味道的重口音,则算有口音。
底噪
1、有|无判断:截取区间内有连续性背景噪音/无连续性背景噪音,包括敲打键盘声音、其它人声音、电视背景音、汽车声音等。特别注意“连续性”、“持续性”。 按照是否明显判定。请务必区分句子中单独噪音(noise)和连续底噪的概念。
儿童音
1、有|无(主观判断)整个音频是/不是儿童音。按照是否明显判定。
标签
1、标签代表 截取区间红线内的一些噪音等标注
原始文本
1、是预识别的参考结果。有参考结果做校对,没有参考结果做转写

文本标注规范及标准
1、转写内容与实际发音内容一致,对于因为口音或者个人习惯导致的音变,仍按照原内容转写。Liu2奶→写牛奶;转写内容的完整性要与实际发音一致,不得删减;请规范汉字使用,不要出现错别字,特别也规范“的得地”的使用。
2、专有名词:所有的专有名词,包括人名、地名、组织机构名等,详细规范说明如下:对于熟知的人名,必须正确转写。例如,“郭德纲的相声很不错”,就不能转录成“郭德刚”。 “邀请白举纲参加来往活动”,不能是“白句刚”。 而对于泛泛的名字,则使用最常见的文字来转写,不使用生僻字。例如,用“王小明”,不用“王晓明”,更不能用“王潇铭”(这个太偏僻了)。地名、组织机构名规则与人名相同。
3、同音字的使用不同批次不同要求,注意发布任务前的通知。
4、数字写法:按照数字的汉字写法写成“一二三…”形式,而不是“123”更不能是“壹贰叁”;注意: 读yao1写幺,读lia3写俩,读liang3写两,读1.5*1.8写一点五乘以一点八
5、音变(轻声/儿化)、变调、口音、方言词汇
(1)儿化音:有明显儿化音则转写,比如:“这个小孩儿”
(2)轻声要转写
(3)汉语变调情况普遍。标注时只转写其本调汉字。
(4)例如: yi2 bu4 xiao3 xin1 jiu4 da3 dao4 ni1 le1.
(5)错误转写:移不小心就打到你了。
(6)正确转写:一不小心就打到你了。
(7)由于口音或个人习惯导致的音变,按普通话标注音转写。例如,“办公室”的“室”,有人说成“shi3”,有人说成“shi4”,都要转写成“办公室”
6、标点
(1)只可以采用逗号、顿号、句号、问号、感叹号五个标点符号。
(2)句尾需要加标点。
(3)句子标点符号不可过碎,亦不可整句无标点。
(4)标点符号不可连续使用。例如不要出现“,。。。”
7、繁体&简体问题:禁止使用繁体。只能用简体中文
8、英文
(1)字母拼读大写加空格:Q Q,K T V;M P三;车牌中的字母拼读必须加空格
(2)单词:正常大小写。Agelababy;iphone…
(3)中英混:中英混的情况,中文+英文单词/英文字母。对于英文单词,或者作为单词发音的缩写词,如果其发音是按照一个单词来发音的,请直接转写,注意字母间要加空格,英文和汉字之间不用加空格。
9、拼音:写拼音_py。 发音:s u an酸;转写:s_py u_py an_py 酸
10、语气词: 语气词一般带有口子旁。常见语气词有“嗯(en1,en2,en)、啊(a1,a2,a)、呀(ya1,ya)、哇(wa1)、哦(o1)、啦(la1)、呢(ne1,ne)、咚(dong1)、呐(na1,na)、吧(ba1)、吗(ma1,ma)、呵(he1,he)、呃(e1,e)、唔(wu1)、嘛(ma1,ma)”等。
11、保存:保存继续下一句快捷键(alt + enter);最后一句保存后,右上角出现提交按钮,提交后质检才能查标注员的任务。
12、常规数据如果句子中间有几个音可以听清(非专有名词发音),但是转写后没有意义,我们可以音译不要使用~。用~会影响字准。是专有名词写不出来可以使用~
13、首字/尾字:
(1)首/尾字能听出来就正常转写
(2)发音模糊听不出来的截取到红线外不转写,禁止在首/尾加(~)
(3)首/尾字被截断,能听出来的截取到红线内正常转写。
(4)首/尾字被截断,听不出来的截取到红线外不转写,禁止在首/尾加(~)

截取
1、一条音频只截取一段有效。有效语音前、后需保留一定静音部分,静音部分20ms-30ms(非常小,是一个格子的1/10,一个格子是200ms。就是为了不切到有效文本的波形而设置的)。如果有效文本前后是噪音,则贴着音频截取,不做预留
2、句首句尾有截断的情况,从听感上能听出来说的是什么,则转写出来;若都不行,则从能听清的地方截取准确时间点。
3、错误的截取(只截取有效音频的一部分就转写文字,或者截取的音频与文字对应不上)。质检检查的时候,如果音频直接播放的文字跟文本对不上那就是截取错误了。要改正,标注和质检在反复听的时候注意别把截取弄错了。
其他注意事项
1、需要截取,不要切到波形。
2、超时回收:标注任务领取48小时后的凌晨3:00回收;返工超3次,第4次返工系统回收
3、新人第一个包做完提交后必须申请质检,首包通过后才可以自己随便领任务了。
随着现代科学的发展,人们在与机器的信息交流中,需要一种更加方便、自然的方式,而语言是人类最重要、最有效、最常用和最方便的通信形式。这就很容易让人想到能否用自然语言代替传统的人机交流方式(如键盘、鼠标等)。人机自然语音对话就意味着机器应具有听觉,能“听懂”人类的口头语言,这就是语音识别(Speech Recognition)的功能。
