关键词:文本后处理,标点预测,顺滑检测,CT-Transformer 背景介绍 自动语音识别 (ASR) 原始输出的文本不含标点,且口语的ASR识别结果通常包含大量不顺滑的短语。随着自动语音识别(ASR)技术的广泛应用,以标点预测和顺滑检测…

最新声浪
查看全部 →2020 icassp,因为假期错过了在线观看的朋友们,可以登入https://2020.ieeeicassp.org/,进入虚拟room: 然后进去之后有一些keynotes: 当然你想看一些主题,进入到speech process:ht…
1.背景 在声纹识别的应用中,常遇到的一个挑战是,应用场景需求的多样性、复杂性、以及明显的信道差异,使得基础声纹模型无法适配多个场景,声纹识别效果不理想。在跨信道、跨领域时,声纹识别性能会明显下降。为确保高准确率,通常需要针对应用场景精确地…
ImageNet的出现带来计算机视觉领域的突破发展,掀起了一股预训练之风,这就是所谓的ImageNet时刻。但与计算机视觉同样重要的语音领域,却是迟迟不见“ImageNet时刻”的到来。而作为NLP研究中最重要的方向之一——语音转文本(Sp…
一、背景 说话人日志(speakerdiarization)也叫说话人分离,它是从一个连续的多人说话的语音中切分出不同说话人的片段,并且判断出每个片段是哪个说话人的过程。借助说话人日志技术可以完成对音频数据流的结构化管理,具有广泛的应用价值…
谷歌发布了语音分离数据集与深度学习模型。语音分离数据集,全名为The Free Universal Sound Separation (FUSS) Dataset 。这个数据集将在DCASE2020 Challenge Task 4: So…
导读:腾讯会议推出,集结腾讯在AI、云计算、安全等方面的能力,全方位满足不同场景下的会议需求,在短短两个月内就突破千万日活大关。面对多样且复杂的场景,比如开会环境嘈杂、同一地点多设备接入、房间声学参数不理想等,腾讯会议如何通过对音频信号的处…
在这次的workshop (https://chimechallenge.github.io/chime2020-workshop/)上,来自腾讯AI LAB的俞栋老师分享了腾讯AI LAB在解决鸡尾酒会问题上的一些进展。这些进展涉及单模态…
神经网络结构搜索算法最近在各个方面都使用,本文是在语音合成上的使用, 关键是论文链接:https://arxiv.org/abs/2002.10389, GitHub链接:https://github.com/renqianluo/Semi…
