语音转换(Voice Conversion, VC)旨在保留语言内容的同时,将源说话人语音转换成目标说话人的语音。语音转换在个性化语音合成、自动化影视配音、实时通信与娱乐等方面具有重要应用。随着深度学习技术的引入,语音转换技术取得了巨大的飞跃。现有的语音转换方法可以较好地实现音色转换,但这是建立在大量高质量目标说话人语音数据用于训练的前提之上。单样本语音转换(One-shot VC)就是关注于极少资源下(一句话,≤10s)实现目标说话人的音色复刻并且保持较高的转换质量以及表现力的一类技术。

近期,由西工大音频语音与语言处理研究组(ASLP@NPU)和网易伏羲实验室合作的论文“ONE-SHOT VOICE CONVERSION FOR STYLE TRANSFER BASED ON SPEAKER ADAPTATION”被语音研究顶级会议ICASSP2022接收。该论文提出一种基于风格迁移的说话人自适应方法,可以通过将语音分解为多种表征包括内容、说话人、风格,在极低资源的情况下中实现对于目标说话人音色的学习并且保持较好的音色相似度以及表现力。现对该论文进行简要的解读和分享。


论文题目:ONE-SHOT VOICE CONVERSION FOR STYLE TRANSFER BASED ON SPEAKER ADAPTATION
作者列表:王智超,谢启聪,李涛,杜洪强,谢磊,朱鹏程,毕梦霄
论文原文:https://arxiv.org/abs/2111.12277


图1 发表论文截图


图2 扫码直接看论文


1 背景动机
语音转换(Voice Conversion, VC)是一个在不改变语音内容的前提下,改变语音中原始说话人音色使得听起来像是另外一个人的一项技术,是语音研究领域中热门的研究方向之一。现有主流实际应用的方法需要大量高质量的语音数据来构建语音转换系统。然而,当目标说话人语音数据十分有限时,语音转换系统的说话人相似度和转换语音表现力会受到很大影响。最近,研究者们提出了许多单样本(one-shot)场景下的VC方法,即在给定目标说话人一句录音的情况下,实现说话人身份的转换。与以往需要目标说话人大量数据的方法相比,这种单样本方法在实际场景下会更加实用,然而目前从转换的说话人相似度和表现力上仍然差强人意。
在One-shot VC任务中,过去的工作主要的思路是基于解耦表征再组合的大框架,即将语音分解成多种成分再组合不同的成分生成目标语音。此类思路包含两种分解模式。其中一种[1][2]是在训练中将语音分解为内容和说话人表征,然后在推断时将输入音频的内容表征和目标说话人的说话人表征进行融合生成目标语音。然而,该类方法学习到的内容表征中可能包含有风格信息以及说话人相关信息,从而导致转换语音说话人相似度不稳定。另外一种[3][4]是将语音表征为内容、说话人、音高等。这种方式进一步提高了模型解耦能力,但是转换语音和目标说话人语音的说话人相似度仍然存在差距。除了这种解耦再组合的思路,许多工作也关注于通过说话人自适应(speaker adaptation)来实现对于few-shot甚至one-shot。这种方式主要需要解决的问题是由小数据量带来过拟合问题导致的说话人相似度和生成质量的降低。
本文关注在只有一句目标说话人语音的情况下,将输入语音的风格韵律以及内容转换到目标说话人上。鉴于在一句语音训练极易导致过拟合的问题,我们基于瓶颈特征(Bottleneck Feature, BN)的识别-合成(recognition-synthesis)语音转换框架[5]提出了一种基于风格迁移方法的one-shot VC的模型,结合了说话人自适应和解耦语音成分的优势。一方面,采用说话人归一化(speaker normalization)去除BN中说话人相关的信息,这有助于提高最终的说话人相似度;另一方面,引入了权重正则(weight regularization)防止模型在训练中过拟合导致性能下降。此外,采用韵律模块从输入语音提取韵律信息迁移到目标语音上。这种对语音成分的充分表征可以实现风格韵律的迁移同时使模型在说话人自适应过程中更加关注于对于音色的学习。实验结果表明,在只有一句目标语音的情况下,提出的方法能够很好地缓解过拟合问题,同时能实现与目标说话人较高的说话人相似度以及获得与输入语音较为类似的风格韵律。
2 方案简介
如图3所示,文中的模型结构是由四个模型组成的:内容模块(Content Module)、韵律模块(Prosody Module)、 说话人模块(Speaker Module)和转换模块(Conversion Module)。内容模块用于提取说话人归一化的内容信息,确保内容信息中不存在说话人差异。说话人模块用于提取语音中的说话人信息表征。韵律模块学习提取独立于说话人的韵律表示。转换模块将韵律、内容和说话人表征作为输入,输出目标语音mel谱。最后采用LPCnet进行波形重构。


图3 本文提出的模型结构

Speaker Normalization:虽然ASR系统使用大量的数据进行训练,但是提取的瓶颈特征BN仍然不可避免的包含说话人相关的信息,包括音色和风格等。这会影响语音转换中目标说话人的说话人相似度。对抗训练常常被用于去除BN中说话人信息。但是由于对抗的训练成本以及不稳定的表现,我们采用了说话人归一化方法。具体来说,利用Any-to-one的VC系统将输入语音的BN转换到特定说话人以达到归一化的目的。
Weight Regularization:为了缓解单句训练引起的过拟合问题,提高训练过程的稳定性,引入权值正则化[6]。该权值正则化方法是l2正则化的变体。定义如下:


其中θ表示的是自适应过程中可训练参数,θ_{f}表示自适应之前模型的参数。该正则方法的核心思想是防止自适应过程中与基础模型的学习到的参数偏离过大导致知识遗忘。
Source style transfer:为了更好的解耦语音成分同时将输入语音风格韵律迁移到目标语音上,我们在one-shot框架中引入了韵律模块[7]。总的来说,我们将语音表征为说话人、内容以及风格三个方面。韵律模块负责提供输入语音的风格信息。一方面,我们从输入语音中显式地提取能量、VUV和原始lf0;另一方面,使用BN作为参考编码器的输入来获取隐式的韵律表征。通过添加韵律模块,语音转换框架能够进行风格迁移提高转换结果的表现力。
模型训练流程:图3中的①②③标识了模型的训练流程。
步骤一(①):预训练内容模块实现any-to-one的语音转换。内容模块在大量语音数据训练以及特定说话人上进行微调,在后续训练中参数固定。
步骤二(②):整个模型用多说话人数据进行训练。训练中用重构损失L_{recons}优化整个模型,采用交叉熵损失L_{ce}优化了说话人模块。这一阶段的损失函数描述如下:


步骤三(③):在这个阶段,只使用目标说话人的单条语音来微调模型。由于大量的参数可能导致模型过拟合。如图3所示,此阶段仅仅转换模型中部分网络参与。同时这一阶段,加入权重正则帮助缓解过拟合问题。该阶段损失函数如下所示:


3 实验验证
实验数据:实验使用公开数据集VCTK,选取其中102个说话人的数据参与基础模型训练。为了验证方案的有效性,CMU-ARCTIC(rms, clb)以及ESD的数据用来作为测试的源音频,预留的VCTK说话人p340和p363以及CMU-ARCTIC的slt和bdl说话人用作one-shot说话人测试,用于说话人自适应的目标说话人语音时长范围为3-4s。
对比系统:AGAINVC[2], VQMIVC[3], GSE[4]。同时为了公平对比,GST-finetune被用作对比,该系统是在GSE的基础上做说话人自适应。
主观测试:主观测试包含三个方面—音质、说话人相似度、风格相似度。三项均采用了MOS的打分的方式。

表1 语音质量、风格相似度和说话人相似度主观测试结果(MOS)


  • 对比分析:从表3中可以看出GSE在音质方面取得最好的分数。提出的系统P3在说话人相似度和风格相似度上明显好于对比系统。之前的方法由于缺乏韵律建模能力同时目标说话人的音色对于模型未知,这可能是导致其表现不稳定的重要原因。从GSE和GSE-finetune的对比也可以看出,使GSE从目标说话人数据中学习可以提高说话人相似度。
  • 消融分析:从表3中可以看出,BL系统取得的分数非常低,这也说明了过拟合对该系统的影响。随着提出的方法的应用,各项指标均有上升,过拟合现象得到缓解。同时随着韵律模块的加入,使模型更加关注于音色的学习,因此说话人相似度和风格相似度均得到提升。
  • 自适应数据时长分析:本文进一步验证用于说话人自适应的目标说话人时长对于模型性能的影响,具体包括1,3,6,9,15s长度的句子。如图4所示,对于1-3s,提出的系统仍旧会受到过拟合的影响表现出性能的下降。在3-6s区间,三种评估指标都有着明显的上升。6s之后,三种曲线都上升趋势减缓,9s之后三种曲线变得稳定。


图4 不同时长下系统MOS结果


客观测试:本文进一步用实际样例探究了过拟合问题,以及通过客观指标进行进一步分析。
  • 过拟合:如图5所示,为了进一步探究消融系统中的过拟合现象,我们可视化了各系统转换结果的语谱图。明显可以看出,BL系统具有较为平坦的共振峰,同时静音段出现了噪声。同时随着本文方法引入,谱上的细节和变化变得更加丰富。
  • 韵律相关性:如表2所示,为了进一步验证系统对于源音频风格的迁移能力,我们提取了源音频和转换音频的lf0和energy,计算了它们之间的Pearson相关系数,越高表示相关性越高。从能量和lf0分数来看,提出的方法(P3)的得分最高。


图5 源音频和不同消融系统转换音频语谱图

表2 相关系数(lf0,energy)


4 样例展示

目标说话人p340

目标说话人语音

p340 音频

输入语音

1-source 音频

论文转换结果

1-p340 音频

目标说话人bdl

目标说话人语音

bdl 音频

输入语音

3-source 音频
论文转换结果
3-bdl 音频


更多样例:

https://kerwinchao.github.io/Oneshotvc.github.io/


5 参考文献

[1] Kaizhi Qian, Yang Zhang, Shiyu Chang, Xuesong Yang, and Mark Hasegawa-Johnson, “Autovc: Zero-shot voice style transfer with only autoencoder loss,” in International Conference on Machine Learning(ICML), 2019, pp. 5210–5219.

[2] Yen-Hao Chen, Da-Yi Wu, Tsung-Han Wu, and Hung-yi Lee, “Again-VC: A One-Shot Voice Conversion Using Activation Guidance and Adaptive Instance Normalization,” in International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2021, pp. 5954–5958.

[3] Disong Wang, Liqun Deng, Yu Ting Yeung, Xiao Chen, Xunying Liu, and Helen Meng, “VQMIVC: Vector Quantization and Mutual Information-Based Unsupervised Speech Representation Disentanglement for One-Shot Voice Conversion,” in Proc. Interspeech, 2021, pp. 1344–1348.

[4] Hui Lu, Zhiyong Wu, Dongyang Dai, Runnan Li, Shiyin Kang, Jia Jia, and Helen Meng, “One-Shot Voice Conversion with Global Speaker Embeddings,” in Proc. Interspeech, 2019, pp. 669–673.

[5] Lifa Sun, K. Li, Hao Wang, Shiyin Kang, and H. Meng, “Phonetic Posteriorgrams for Many-to-One Voice Conversion without Parallel Data Training,” in International Conference on Multimedia and Expo (ICME), 2016, pp. 1–6.

[6] Rui Li, Qianfen Jiao, Wenming Cao, Hau-San Wong, and Si Wu, “Model Adaptation: Unsupervised Domain Adaptation without Source Data,” in Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2020, pp. 9641–9650.

[7] Zhichao Wang, Xinyong Zhou, Fengyu Yang, Tao Li, Hongqiang Du, Lei Xie, Wendong Gan, Haitao Chen, and Hai Li, “Enriching Source Style Transfer in Recognition-Synthesis Based Non-Parallel Voice Conversion,” in Proc. Interspeech, 2021, pp. 831–835.