目前的语音合成系统大多基于单一说话人单一风格语音数据建模,但随着语音合成应用场景的不断扩展,对多风格语音合成的需求越来越大。然而单人多风格数据难以获取,一来成本高,二来不是每个发音人都能完成不同风格的录制。一种最直接的方式是通过语音风格迁移…
声浪
语音合成又称文语转换技术 (Text-to-speech, TTS),是将文本转换为自然语音的一类技术,是服务于语音交互、信息播报、有声朗读等任务的核心技术。在深度学习的推动下,语音合成的自然度和音质得到了巨大的提升。然而,仅仅合成听起来自…
本次分享FastSpeech作者任意发表于NeurIPS 2021的另一篇语音合成论文《PortaSpeech: Portable and High-Quality Generative Text-to-Speech》。该论文提出了一个轻量…
语音合成(Speech Synthesis)是指赋予机器像人一样开口说话的能力,是实现自然人机交互的重要一环。语音合成除了在语音交互中充当机器嘴巴的能力之外,还在AI有声朗读、障碍语音恢复等任务中具有重要应用。语音合成的应用场景包括语音助手…
本次分享ICML 2021会议中一篇语音合成的佳作《Conditional Variational Autoencoder with Adversarial Learning for End-to-End Text-to-Speech》(A…
字节跳动智能创作语音团队SAMI(Speech, Audio and Music Intelligence)近日上线一项高保真、低延迟、高并发歌唱合成技术。该技术在兼顾保真度和速度上实现了一定的突破:一方面,AI模型可以模拟人类独特的音色、…
12月18日,在中国智能语音产业发展高峰论坛暨中国语音产业联盟2021年会现场,中国语音产业联盟发布《2020~2021中国语音产业发展白皮书》(以下简称「《白皮书》」),总结这一年来智能语音行业的发展态势,把脉语音产业、指引未来走向。 智…
近期,内蒙古大学计算机学院首次利用非自回归语音合成技术实现了完全非自回归的实时高保真蒙古语语音合成模型MonTTS。该MonTTS模型可以以蒙古文文本为输入对mel-spectrum声学参数进行非自回归预测,之后利用HiFi-GAN声码器实…
要说生活里最常见的AI应用场景,语音合成与识别当属大家最为耳熟能详的场景之一了。寻常到平时地图导航的播报、微信语音转文字、手机语音输入,以及小度智能音箱,都离不开语音技术的加持。语音技术到底是怎么实现的?有哪些现成可用的开源代码可以快速集成…
