随着人工智能技术的飞速发展,语音识别(Automatic SpeechRecognition)的应用越来越广泛,对于多语种多口音语音识别的需求也在日渐增加。虽然语音识别系统的基本原理和框架是不受限于语种的,在建立一个新语种的ASR模型时,还…
声浪
关键词:文本后处理,标点预测,顺滑检测,CT-Transformer 背景介绍 自动语音识别 (ASR) 原始输出的文本不含标点,且口语的ASR识别结果通常包含大量不顺滑的短语。随着自动语音识别(ASR)技术的广泛应用,以标点预测和顺滑检测…
2020 icassp,因为假期错过了在线观看的朋友们,可以登入https://2020.ieeeicassp.org/,进入虚拟room: 然后进去之后有一些keynotes: 当然你想看一些主题,进入到speech process:ht…
1.背景 在声纹识别的应用中,常遇到的一个挑战是,应用场景需求的多样性、复杂性、以及明显的信道差异,使得基础声纹模型无法适配多个场景,声纹识别效果不理想。在跨信道、跨领域时,声纹识别性能会明显下降。为确保高准确率,通常需要针对应用场景精确地…
ImageNet的出现带来计算机视觉领域的突破发展,掀起了一股预训练之风,这就是所谓的ImageNet时刻。但与计算机视觉同样重要的语音领域,却是迟迟不见“ImageNet时刻”的到来。而作为NLP研究中最重要的方向之一——语音转文本(Sp…
一、背景 说话人日志(speakerdiarization)也叫说话人分离,它是从一个连续的多人说话的语音中切分出不同说话人的片段,并且判断出每个片段是哪个说话人的过程。借助说话人日志技术可以完成对音频数据流的结构化管理,具有广泛的应用价值…
谷歌发布了语音分离数据集与深度学习模型。语音分离数据集,全名为The Free Universal Sound Separation (FUSS) Dataset 。这个数据集将在DCASE2020 Challenge Task 4: So…
导读:腾讯会议推出,集结腾讯在AI、云计算、安全等方面的能力,全方位满足不同场景下的会议需求,在短短两个月内就突破千万日活大关。面对多样且复杂的场景,比如开会环境嘈杂、同一地点多设备接入、房间声学参数不理想等,腾讯会议如何通过对音频信号的处…
在这次的workshop (https://chimechallenge.github.io/chime2020-workshop/)上,来自腾讯AI LAB的俞栋老师分享了腾讯AI LAB在解决鸡尾酒会问题上的一些进展。这些进展涉及单模态…
