声明:语音合成论文优选系列主要分享论文,分享论文不做直接翻译,所写的内容主要对文章简略概括。如有转载,请标注来源。
AdaSpeech 3: Adaptive Text to Speech for Spontaneous Style
本文为Microsoft Research Asia, China在2021.07.06更新的文章,主要做spontanous-style的adaptive tts,具体的文章链接 https://arxiv.org/pdf/2107.02530.pdf
以前对谭旭的AdaSpeech和AdaSpeech2介绍过,可参考
AdaSpeech 2 在AdaSpeech基础上只使用audio来做个性化工作
另外谭旭更新了一篇survey,我本打算写这篇survey,但我不想按文章翻译,所以就没写,大家可以阅读原文
https://arxiv.org/pdf/2106.15561.pdf
1 背景
spontanous-style 语音其主要特点 1)存在大量um,uh等filled pauses(FP) 2)更多样的韵律(语速语调)。虽然tts在阅读风格语音合成效果很好,但对spontanous-style (podcast or conversation)研究很少。另外spontanous-style的数据相比阅读数据可训练的数据较少,因此本文提出adaspeech3 。adaspeech3使用较少的spontanous-style 数据在阅读风格tts上进行自适用,从而合成较高质量的spontanous-style 语音。
2 详细设计
根据spontanous-style 语音的特点,本文在AdaSpeech上添加FP predictor模块,并修改了duration predictor结构为MoE(mixed of expert),具体如图1所示。为了做spontanous-style 自适应,需要三类数据:SPON-FP, SPON_PHYTHM和SPON-TIMBER。SPON-FP数据的格式为


3 实验
首先对比一下SMOS,table 3展示本文AdaSpeech 3合成的spontanous-style语音更好,table 4展示本文在各方面的MOS都比AdaSpeech好。table 5验证每个模块作用大小。


4 总结
本文主要对spontanous-style的语音合成进行研究,可以使用较少数据合成较高质量的spontanous-style语音。
