译者按:作者Martin Casado是软件定义网络(SDN)之父,2016年4月从从VMware离职加盟了著名的风险投资公司Andreessen Horowitz成为合伙人到现在。由于作者是工业界技术大牛,所以他的见解不随波逐流,且和笔者…
声浪
本文是Baidu Research, USA在2021.04.29更新的文章,主要工作为多模态的talking-head,把text转成video 具体的文章链接: https://arxiv.org/pdf/2104.14631.pdf…
来自谷歌的研究团队表明,将傅里叶变换取代 transformer 自监督子层,可以在 GLUE 基准测试中实现 92% 的准确率,在 GPU 上的训练时间快 7 倍,在 TPU 上的训练时间快 2 倍。 Transformer 自 2017…
腾讯 QQ,8 亿人都在使用的即时通信软件,大量用户使用它进行免费视频、音频通话。用户在进行音频通话时可能处于各种场景,嘈杂的背景声音对通话产生干扰,高质量的音频降噪能够有效提升用户通话体验。 QQ 团队基于开源 TensorFlow 机器…
对于提取伴奏,消除人声,相信从事AI语音行业的朋友对这个不会陌生,各类软件也是层出不穷,今天就跟大家分享一个高效快捷的人声伴奏分离的网站——团子 DanGo.ai。操作简单,直接在网面上传歌曲,40秒左右即可拿到背景音乐和人声。 网址:ht…
近日,WeNet 中增加了对语言模型(Language Model, LM)的支持。WeNet中选择基于 n-gram 的统计语言模型,结合WFST(Weighted Finite State Transducer)框架和传统语音识别解码技…
在业界,实时音视频的 QoE(Quality of Experience) 方法一直都是个重要的话题。之所以这么重要,其实是因为目前 RTE(实时互动)行业中还没有一个很好的可用于评价实时互动场景的 QoE 评价方法。 最古老的评定实时音频…
著名的开源录音编辑软件 Audacity 已被新成立的 Muse Group 公司收购,具体交易价格并未透露,好消息是 Audacity 仍将是免费和开源的。 Audacity 是最受欢迎的免费跨平台的开源音频编辑器之一。它可以在 Wind…
4月25日,余承东在华为开发者大会2021上(HDC.Cloud),发布盘古系列超大规模预训练模型,包括30亿参数的全球最大视觉(CV)预训练模型,以及与循环智能、鹏城实验室联合开发的千亿参数、40TB训练数据的全球最大中文语言(NLP)预…
Endpoint 检测是语音识别系统的重要组成部分,可以提高人机交互的效能和质量。它的任务是确定用户何时结束讲话,这对于实时长语音转写和语音搜索等交互式语音应用非常重要。 最近,WeNet 的更新则支持了 endpoint 的检测。有了 e…
