人类语音不仅承载语言信息,还蕴含着及其丰富的情感。如何在合成语音中呈现适当的情感对于构建多样化的语音生成系统至关重要。目前大多数情感语音合成系统是基于单一说话人建模多情感的,也就是说基于一个目标发音人录制的多种情感语音建立情感语音合成系统。但随着语音合成应用场景的不断扩展,对多人多情感语音合成的需求越来越大。然而多人多情感数据难以获取,一种最直接的方式是通过跨说话人情感迁移的方法来解决该问题。而在跨说话人场景中,存在着提升迁移情感表现力的同时保持目标说话人音色稳定的挑战性问题。
近期,由西工大音频语音与语言处理研究组(ASLP@NPU)和出门问问合作的论文“Cross-speaker Emotion Transfer Based on Prosody Compensation for End-to-End Speech Synthesis”被语音旗舰会议Interspeech 2022接收。该论文提出一种基于韵律补偿的跨说话人情感迁移方法,解决目标音色稳定性和迁移过程中的情感表现力之间的平衡问题。现对该论文进行简要的解读和分享。

出门问问官方相关推文

公众号:出门问问Mobvoi出门问问论文入选全球语音技术顶会INTERSPEECH 2022



论文题目:Cross-speaker Emotion Transfer Based on Prosody Compensation for End-to-End Speech Synthesis
作者列表:李涛,王新升,谢启聪,王智超,江明奇,谢磊
论文原文:https://arxiv.org/abs/2207.01198



图1 发表论文截图


1. 背景动机

语音合成中的跨说话人情感迁移旨在将情感从具有情感数据的源说话人迁移到新的没有该情感的目标说话人上,使目标说话人能够表达其训练数据中不存在的各种情感。基于参考(reference)的情感迁移是跨说话人场景中最流行的策略。其中Reference Encoder[1]、Global Style Tokens (GST)[2] 和Variational Autoencoder(VAE)[3]是常用的从具有所需情感参考音频中提取情感嵌入的方法。在这项任务中,从源说话人的情感参考音频中提取与说话人无关的情感嵌入至关重要。否则,情感嵌入中保留的说话人信息会影响目标说话人的音色。在去除说话人信息的过程中,如何防止情感嵌入中的情感信息被削弱是一个挑战,因为情感和音色都与韵律相关,因此基于reference的方法常常在情感迁移质量和说话人相似性之间进行折中。具体来说,在合成语音中,具有足够情感信息的emotion embedding 往往会导致源说话人音色泄漏,而进一步消除emotion embedding中的说话人信息可能会使迁移的情感表现力削弱。为了应对这一挑战,本文提出一种韵律补偿策略来补偿情感嵌入中由于说话人信息消除造成的情感信息损失,在不损失说话人相似度的前提下,提升合成语音的情感表表现力。受[4,5]的启发,由预训练的 ASR 模型产生的潜在表征保留了一定的韵律信息,但没有明显的说话人信息。我们提出了一个韵律补偿模块(prosody compensation module, PCM)以参考音频通过ASR模型得到的中间表征作为输入,用于补偿解耦过程损失的情感信息。


2. 方案介绍
如图3所示,本文提出的带韵律补偿模块的跨说话人情感语音合成模型是一个基于Tacotron2 框架的扩展,包含三个模块:说话人解耦模块、说话人嵌入模块和韵律补偿模块,其中说话人嵌入模块以speaker id作为输入控制说话人身份。



图3 本文提出的跨说话人情感迁移TTS模型


说话人解耦模块(Speaker disentangling module, SDM)
在基于参考的跨说话人情感迁移方法中,从参考音频中获得的情感嵌入应该在情感上是可区分的,并且不包含说话人的信息。为此,用SDM训练的情感编码器受到情感分类的约束,使获得的情感嵌入在情感类别方面具有区分性。为了消除情感嵌入 e 中的源说话人信息,使情感嵌入与说话人嵌入正交,对应loss其定义为:

说话人嵌入 s 是由 SDM 中的说话人编码器获得的,用说话人分类损失和带有梯度反转的情感分类损失进行训练。


韵律补偿模块 (Prosody conpensation module, PCM)
由于语音中情感信息和说话人信息的纠缠,情感嵌入所传达的情感信息在消除说话人相关信息后会被削弱,从而导致合成语音的表达力平淡。受研究 [4,5] 的启发,ASR 的中间特征(AIF)保留了与说话人无关的韵律信息,所以提出 PCM 使用 AIF 来补偿情感嵌入中的情感信息丢失。如图4所示,韵律补偿编码器通过预训练ASR模型的编码器提取的AIF获得一个全局的情感表征。虽然序列包含的上下文信息对于ASR模型非常重要,但在特定的时间步长,词或音素的预测与本地上下文序列更相关而不是整个序列。相反,整个句子所传达的情感通常是全局信息。因此,如何从相对分散的ASR模型的中间表示中提取这种全局信息是至关重要的。为此,在韵律补偿编码器中使用了global context(GC)block[6],该block展示了获得全局信息的良好能力。如图4所示,该韵律补偿编码器类似于SDM中的情感编码器,不同之处在于在该编码器中引入了三个GC block。GC block由global attention pooling, bottleneck transform 和 broadcast element-wise addition组成,分别用于上下文建模、通道相关性捕获和特征融合,这有助于编码器捕获长距离相关性。该韵律补偿编码器产生的韵律补偿嵌入被添加到情感嵌入数据中,然后作为提供情感信息的变量输入Tacotron中。


图4 韵律补偿编码器



3. 实验结果
实验数据
本文情感源说话人来自一个成年女性情感语料库,包含5000句中性情感语句和每个情感类别惊喜、快乐、悲伤、愤怒、厌恶和恐惧)各2000句。目标说话人是另一个成年女性语料库,只具备该说话人的中性数据。
对比模型
为了评估所提出的方法(CSPC)在跨说话人情感迁移上的性能,我们首先将该方法与几种公开方法进行比较。在这些比较方法中,multi-reference Tacotron (Multi-R)  和 cross-speaker emotion transfer (CSET)是基于reference 的方法,而 prosody bottleneck (PB)是最近提出的基于标签的方法。
实验结果
情感相似度评估: 不同模型的情感相似度MOS测试结果如 表1所示,其中情感相似度MOS值越高,情感迁移性能越好。如该图所示,就所有情感类别而言,本文提出的方法(CSPC)实现了最佳的情感相似性。此外,与其他方法相比,CSPC在不同的情感类别方面表现出更稳定的性能。具体而言,CSPC在不同情感中获得的最高和最低得分之间的相对差异为6.8%,而Multi-R、CSET和PB的差异分别为16.2%、13.6%和13.5%。


表1 与其他模型方法的情感相似度对比结果


说话人相似度评估:除了将情感从reference迁移到合成语音之外,目标说话人的音色也应在合成语音中保持一致。表2 显示了不同模型在保持合成语音中目标音色方面的性能,该性能通过说话人相似性MOS测试进行评估。说话人相似度越高,音色保持越好。如该表所示,除disgust外,Multi-R在大多数情感类别中都达到了最佳说话人相似性。然而,如 表1所示,这种良好的目标音色保留伴随着表现力较弱的情感迁移。对于CSET、PB和本文提出的的CSPC之间没有明显差异。实际上,这几种方法的说话人相似度 MOS 差异可能部分是由于情感语音会影响参与者对音色相似度的评分,因为参考是中性的而不是情感语音。


表2 与其他模型方法的情感相似度对比结果


情感嵌入和韵律补偿的必要性:我们继续验证了同时使用情感嵌入和韵律补偿嵌入的必要性,其中分别舍弃了情感嵌入和全局补偿嵌入,记为“w/o EE”和“w/o PCE”,主观MOS测试结果如表3和表4所示。其中如 表3所示,情感嵌入对迁移情感表现力的影响最大,同时“w/o PCE”的性能下降证明了韵律补偿嵌入可以为情感嵌入提供额外的情感信息。对于目标音色保持,通过比较表4中“w/o PCE”和“CSPC”获得的说话人相似度MOS分数,可以发现,添加韵律补偿嵌入时,没有出现明显的性能下降。


表3  与分别舍弃情感嵌入和全局补偿嵌入的模型变体的情感相似度对比


表4 与分别舍弃情感嵌入和全局补偿嵌入的模型变体的说话人相似度对比


GC block的有效性:为了验证GC block在提出的情感补偿编码器中的重要性,在提出的方法和被称为“w/o GC”的提出方法变体之间进行AB偏好测试,其中“w/o GC”指GC block从韵律补偿编码器(见图4)中去除。结果如图5所示,在情感相似度方面,CSPC显著优于“w/o GC”。至于说话人相似度,舍弃GC block会带来轻微的提升,但不显著。


图5 与舍弃韵律补偿编码器中的GC block模型变体“w/o GC”对比说话人、情感相似度结果


4. 总结
本文提出了一种韵律补偿方法来改善跨说话人情感迁移任务中的情感迁移效果。受预先训练的ASR模型获得的中间特征可能包含一定的韵律信息这一事实的启发,由提出的韵律补偿模块(PCM)提取的韵律嵌入将ASR提取的中间特征(AIF)作为输入,用于为说话人解耦模块(SDM)产生的解耦后的情感嵌入提供额外信息。实验表明,所提出的韵律补偿方法可以为情感嵌入提供额外的有效情感信息,从而补偿说话人与情感解耦过程中丢失的情感信息。


5. 样例展示

目标说话人的真实语音:target音频

源说话人惊讶情感语音:source_sur音频

情感迁移结果:transfer_sur音频

源说话人喜悦情感语音:source_hap音频

情感迁移结果:transfer_hap音频

源说话人恐惧情感语音:source_fea音频

情感迁移结果:transfer_fea音频

实验中的更多样例敬请访问:https://silyfox.github.io/cspc/


6. 参考文献
[1] R. J. Skerry-Ryan, E. Battenberg, Y. Xiao, Y. Wang, D. Stanton, J. Shor, R. J. Weiss, R. A. J. Clark, and R. A. Saurous, “Towards end-to-end prosody transfer for expressive speech synthesis with Tacotron,” ArXiv, vol. abs/1803.09047, 2018.
[2] Y. Wang, D. Stanton, Y. Zhang, R. Skerry-Ryan, E. Battenberg, J. Shor, Y. Xiao, F. Ren, Y. Jia, and R. A. Saurous, “Style tokens: Unsupervised style modeling, control and transfer in end-to-end speech synthesis,” in Proc. ICML, 2018, pp. 5180–5189.
[3] Y.-J. Zhang, S. Pan, L. He, and Z.-H. Ling, “Learning latent rep- resentations for style control and transfer in end-to-end speech synthesis,” ICASSP 2019 - 2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 6945– 6949, 2019.
[4] Z. Wang, W. Ge, X. Wang, S. Yang, W. Gan, H. Chen, H. Li, L. Xie, and X. Li, “Accent and speaker disentanglement in many- to-many voice conversion,” 2021 12th International Symposium on Chinese Spoken Language Processing (ISCSLP), pp. 1–5, 2021.
[5] Wang, Z., Zhou, X., Yang, F., Li, T., Du, H., Xie, L., Gan, W., Chen, H., & Li, H. (2021). Enriching Source Style Transfer in Recognition-Synthesis based Non-Parallel Voice Conversion. Interspeech 2021.
[6] Y. Cao, J. Xu, S. Lin, F. Wei, and H. Hu, “GCNet: Non-local networks meet squeeze-excitation networks and beyond,” 2019 IEEE/CVF International Conference on Computer Vision Workshop (ICCVW), pp. 1971–1980, 2019.