直播回放
由CCF语音对话与听觉专委会 、中国人工智能产业发展联盟(AIIA)评估组 、北京希尔贝壳科技有限公司、语音之家(北京)科技有限公司共同主办的【语音之家】AI技术沙龙——语音合成,将于2021年7月24号 9:30在线上直播进行。
沙龙简介
语音合成(Speech Synthesis)技术已经被广泛应用在智能客服、新闻播报、有声阅读等业务场景。实现从文本到语音(Text To Speech)的转化,解决了人机语音交互的闭环,多语言多情感的实现赋能了机器的发声。所熟知的微软小冰、小爱同学、小度音箱等已经陪伴在我们生活当中,成为了人类的助手。但是在TTS的高拟真度、声音多样性、情绪控制等还存在一些问题需要解决,人类的对话不仅是一个发声而是有思想、有情感、有内容的更深入表达。TTS技术未来如何发展,值得我们思考与期待。



分享内容:序列到序列语音合成网络中编码器结构的探索
摘要:近年来,序列到序列神经网络成为语音合成任务的主流框架,显著地提升了合成语音的效果。这个框架主要由编码器、解码器以及编解码器之间的对齐模块三部分组成。编码器主要功能是从输入文本中提取与发音、韵律相关的语义信息。 这些信息的准确与丰富程度直接决定了合成语音的自然度与表现力。本报告分析了目前主流的编码器方案,CBHG(Tacotron),CNN+BLSTM(Tacotron2),Self-Attention+CNN(FastSpeech)等等,并着重介绍小米提出的对编码器多层结果进行聚合的思路。同时报告还将简要介绍语音合成在小米产品上的主要应用。
嘉宾简介:栾剑,现任小米技术委员会AI实验室语音生成团队负责人。曾任东芝(中国)研究院研究员、微软(中国)工程院高级语音科学家、微软小冰首席语音科学家及语音团队负责人等职位。长期从事语音方向的技术研究和应用,在声纹识别、语音合成、歌唱合成、语音识别、语言副信息提取等多个领域都有深入研究并取得重要成果。主导开发的微软小冰语音合成系统和歌唱合成软件X-Studio,均处于世界领先水平,深受用户好评。在国际顶级学术会议和杂志发表论文10余篇,在中国、美国、日本等地获批专利50多项。

何 磊
The principal scientist manager in Speech China team of Microsoft
Neural Text-to-Speech @Microsoft-large scale production and ongoing exploration
Since 2016, Lei He focused on research of neural TTS and worked with engineering team to release high quality neural voices across 51 locales and enable custom neural voice creation in MS Azure TTS service. Recently, He continued pushing forward speech modeling, for wider and deeper TTS applications.
Before MS, Lei He was senior researcher and research manager in TOSHIBA, with research interests in speech signal process, speech recognition and speech synthesis.
Lei He is the senior member of IEEE, with 50+ publications and 20+ patents.

参会方式一:

扫码进入直播间观看
参会方式二:
点击下方链接进入直播间
https://wx.vzan.com/live/tvchat-1581514982?v=1626771265354

