在深度学习、大数据和大算力的推动下,以语音增强、识别和合成为代表的智能语音技术已经在众多应用中落地。特为大家整理了一些比较前沿的报告,文末可免费获取。 No.1
声浪
去年起,美国政府开始认真对待机器人来电问题。2021 年 6 月 30 日起,联邦通信委员会 FCC 要求电话提供商使用一种名为 STIR/SHAKEN 的基于加密协议的方式来验证所有来电者的 ID。 和往常一样,这种方法并没有治本,任何期…
近日,由快手音视频技术部联合意大利罗马第一大学(Sapienza University of Rome, Italy),在国际音频顶级会议 ICASSP 2022 上发起的深度3D音频信号处理挑战赛(L3DAS22:Machine Lear…
目前的语音合成系统大多基于单一说话人单一风格语音数据建模,但随着语音合成应用场景的不断扩展,对多风格语音合成的需求越来越大。然而单人多风格数据难以获取,一来成本高,二来不是每个发音人都能完成不同风格的录制。一种最直接的方式是通过语音风格迁移…
近期,来自北京大学和腾讯AI LAB, ASR oteam的研究人员在主流端到端语音识别系统上进行了两点改进:(1)将LF-MMI准则用于端到端语音识别系统的训练和解码中;(2)使用词级别N-gram模型进行在线解码。集成上述两点的端到端模…
ICASSP 2022 近日,2022年IEEE音频、语音与信号处理国际会议(2022 IEEE International Conference on Acoustics, Speech, and Signal Processing,IC…
语音合成又称文语转换技术 (Text-to-speech, TTS),是将文本转换为自然语音的一类技术,是服务于语音交互、信息播报、有声朗读等任务的核心技术。在深度学习的推动下,语音合成的自然度和音质得到了巨大的提升。然而,仅仅合成听起来自…
人们通过聆听和观察说话者的嘴唇动作来感知言语。那么,AI 也可以吗? 事实上,研究表明视觉线索在语言学习中起着关键的作用。相比之下,人工智能语言识别系统主要是建立在音频上。而且需要大量数据来训练,通常需要数万小时的记录。 为了研究视觉效果,…
借助读唇语,人类能够更容易听懂他人的讲话内容,那么AI也能如此吗? 最近,Meta提出了一种视听版BERT,不仅能读唇语,还能将识别错误率降低75%。效果大概就像如下这样,给一段视频,该模型就能根据人物的口型及语音输出他所说的内容。 而且与…
本次分享FastSpeech作者任意发表于NeurIPS 2021的另一篇语音合成论文《PortaSpeech: Portable and High-Quality Generative Text-to-Speech》。该论文提出了一个轻量…
