本次分享日本名古屋大学Tomoki Toda教授、国立台湾大学李宏毅教授和卡内基梅隆大学Shinji Watanabe教授三位大佬合作投稿于ICASSP2022的论文《S3PRL-VC: Open-source Voice Conversion Framework with Self-supervised Speech Representations》,该论文将自监督语音表示应用到语音转换领域,并进行了一系列的实验对不同自监督语音表示和不同语音转换模型的表现进行了测试。同时基于实验结果,分别从自监督和语音转换的角度,对未来研究提出了建议。
论文地址:
https://arxiv.org/abs/2110.06280
Demo地址:
https://unilight.github.io/Publication-Demos/publications/s3prl-vc/index.html
代码仓库:
https://github.com/s3prl/s3prl/tree/master/s3prl/downstream/a2o-vc-vcc2020
语音转换主要将源说话人的语音转换为目标说话人,而不改变说话的内容。近年来,基于“识别+合成”(ASR+TTS 或 rec-syn)的语音转换框架收到广泛关注。例如,VCC2020挑战赛的基线系统之一正是基于ASR+TTS的语音转换系统。一些基于ASR+TTS的参赛系统在语音自然度和说话人相似度方面也表现出了SOTA的效果。基于“识别-合成”的VC模型中,在标注数据中预先训练的ASR模型以有监督的方式为语音提取内容表示(如PPG)等。而标注数据的收集是费时费力的,尤其在一些跨语言语音转换(cross-lingual VC)等低资源场景中。因此,研究人员采取“无监督”或者“自监督语音表示”(self-supervised speech representation,S3R)学习方案来从大量无标注数据中学习有意义的语音特征表示。大量相关工作已经在any-to-one VC, many-to-many VC, any-to-any VC 和 cross-lingual VC等任务证明了自监督语音表示的有效性。除了可以利用无标注数据这一优点,基于自监督语音表示的语音转换模型(S3R based VC)也可以看作是一个很好的针对自监督语音表示的探索性任务。近期发布的SUPERB基准测试在一系列判别性语音处理任务中测试了不同自监督语音表示的性能,但是,在一些生成任务(例如VC)中,哪些自监督语音表示是最优的仍然有待验证。本文在S3PRL和SUPERB的基础上提出了新的S3PRL-VC基准测试工具。该工具主要面向any-to-one (A2O)VC,其中的的合成器是通过说话人相关的方式实现。使用VCC2020数据来进行单语言和跨语言的语音转换。我们还通过使用d-vector来对unseen的speaker进行编码来实现了any-to-any(A2A)VC的扩展。我们复现了VCC2018和VCC2020的最优模型以进行充分的实验比较。我们进行了一系列客观和主观实验来比较不同SOTA模型搭配不同S3R的性能。实验结果表明,1)S3PRL-VC与VCC2020最优系统相比,在A2O场景下的说话人相似度方面取得了不相上下的结果;2)在A2A场景下,基于S3R的VC系统取得了SOTA的表现。- 我们的S3PRL-VC继承了SUPERB的优点,可以快速部署,并且实现了SOTA的表现。可以很好的服务于自监督语音表示和语音转换领域。
- 我们从VC的角度对S3R进行了大规模的比较,为自监督语音表示的分析提供了新的见解和视角。我们还与VCC2020中使用PPG的最优系统进行了比较,显示了S3Rs的局限性和竞争力。
2.1 General description of VCC2020
本文所有实验基于VCC2020数据。VCC2020包含两个任务:Task1: 单语言VC(intra-lingual VC);Task2: 跨语言VC(cross-lingual VC)。2.2 Intra-lingual and cross-lingual
Any-to-one(A2O) VC主要是指将任意语音转换为预先定义的目标说话人的语音。本文将在A2O场景下对2.1中的两个任务进行实验。A2O VC的训练和转换过程如图1所示,首先在一个多说话人数据上训练自监督语音表示模型,这个模型具备将任意unseen的说话人进行信息编码的能力(编码向量用H表示)。之后使用目标说话人数据Dtrg训练合成器,用来将向量H重构为声学特征Y。在转换阶段,波形合成器(如神经声码器)将生成的声学特征Y转换为最终的语音波形。A2O VC对于研究上游S3R模型的表现是一个很好的探索性任务。
VC的一个基本要求是语言学信息一致的前提下实现说话人信息的转换,因此,最终VC系统的性能与S3R模型的说话人编码能力之间存在正相关关系。
如果S3R模型编码了丰富的说话人信息,则源语音中的源说话人信息会与合成器中学习到的目标说话人信息相冲突,可能会影响VC的表现。
在跨语言VC中进行合成器训练时,由于现有的S3R模型大多只使用英语数据集进行训练,因此S3R模型可能无法很好的建立非英语目标说话人与英语源说话人的联系。因此,单语S3R模型向不同语言的迁移能力值得探索。
2.3 Intra-lingual any-to-any VC
我们也提供了S3PRL-VC在any-to-any(A2A)VC(也叫做 zero-shot VC)场景下的扩展。A2A VC场景下,待转换的目标说话人的数据Dtrg是很有限的(通常指小于1分钟),导致微调策略并不适用。A2A VC一般使用多说话人数据进行训练。与A2O VC中使用合成器直接恢复目标说话人语音不同,A2A VC需要将说话人向量送入合成器。说话人向量从预训练的说话人验证(automatic speaker verification,ASV)模型中提取得到。在训练阶段,可以直接对目标说话人的语音进行说话人向量提取。在转换阶段,给定新的目标说话人数据Dtrg,可以为数据中所有语音提取说话人向量,之后平均计算得到最终的说话人向量用于目标说话人语音的合成。3.1 Recognizer (upstream models)
表1列举了本文中涉及的S3R模型。其中,mel 和 PPG是使用TIMIT数据训练。其余模型均与S3PRL中的模型相同,并且都是用LibriSpeech英语语音数据进行训练。3.2 Synthesizer model design
如图2所示,我们参考近几年VCC挑战赛中的优秀模型实现了若干合成器模型,选择Mel-spectrogram作为目标声学特征。其中,Simple是VCC2018中的最优模型;Simple-AR是语音合成领域的经典模型;Taco2-AR是VCC2020的最优模型。使用VCTK数据训练A2A VC 模型, 使用LibriSpeech、VoxCeleb1 和2 的混合数据训练好的d-vector模型用来进行说话人向量的提取。4、Evaluation Metrics and Protocols
- Mel cepstrum distortion (MCD)用来评价生成语音的整体表现;
- Word error rate (WER) 用来评价生成语音的可懂度和语言学一致性;
- Accept rate 使用预训练的ASV模型来计算说话人向量的余弦相似度,用来评价生成语音的说话人相似度。
4.2 Subjective evaluation
使用Amazon Mechanical Turk (Mturk)平台进行语音自然度和说话人相似度的评测。5、Evaluation Results and Discussions
5.1 Comparison of different models
我们首先比较3.2节中不同合成器在单语言A2O场景下的表现。实验结果如表1所示。实验结果表明:在Simple模型上添加自回归AR操作后,大部分S3R模型都在WER指标上获得明显提升。Taco2-AR模型与其他两个模型相比,除了PASE+、modified CPC和Mockingjay,其余所有S3R模型的ASV accept rate都高于80%;但与此同时,所有S3R模型的WER都出现了不同程度的下降。以上结果表明,增加合成器模型复杂度有助于提升说话人相似度的表现,但是同时也带来了可懂度的损失。另外,Taco2-AR模型的MCD值也优于其他两个合成模型,这与我们在之后的主观实验结果一致。基于三个合成器模型的训练时间不相上下及以上的实验结果,我们使用Taco2-AR模型进行后续的实验。5.2 Results on different tasks
本节比较基于自监督语音表示S3R的不同VC任务的表现。实验结果如表1所示。我们首先发现,基于单语语料训练的S3R在跨语言VC场景中也有很好的表现,这证明了S3R的跨语言迁移能力。但是,与单语言A2O任务相比,所有的S3R模型都在WER和ASV accept rate指标上出现了性能下降。另外,与A2O相比,在单语言A2A场景中,所有的S3R模型都在WER指标上表现更好,而在MCD 和ASV accept rate上表现较差。可能原因在于,1) 在A2A VC场景中,目前的S3R模型不能很好的将语言学和说话人等信息解耦;2) 预训练的说话人编码器可能不是最优选择,或许将说话人编码器与VC模型联合训练才更加适合基于自监督语音表示的VC模型。5.3 Comparing with top systems using
本节比较不同的SOTA模型与S3R-based VC模型的表现。USTC-2018、USTC-2020、SRCB和CASIA都是VCC2020的一些Top模型。它们都使用PGG作为声学特征,都使用多说话人数据进行合成器模型的预训练,都使用基于AR的声码器;ASR+TTS是VCC2020中的基线系统;S2VC是A2A VC场景下目前的SOTA模型。实验结果如表2所示。实验结果表明:- vq-wav2vec在单语言A2O场景下,超越了其他所有自监督模型,在自然度和说话人相似度的主观分数分别为3.59和59%。
- 在A2O场景下,vq-wav2vec模型与VCC2020的模型相比,在自然度上仍然有一定差距;而在说话人相似度方面,vq-wav2vec在单语言A2O下与USTC-2018和CASIA不相上下,在跨语言A2O下取得了最好的结果。
- 在A2A场景下,vq-wav2vec与S2VC在说话人相似度方面不相上下,但是在自然度方面表现出明显的优势。因此,在A2A VC任务中,我们的S3R-based VC模型实现了SOTA的效果。
5.4 Impact of supervision
尽管所有使用PPG的Top系统在自然度方面都明显优于vq-wav2vec,但是,由于这些系统使用了在私有大规模语音数据下训练的基于AR的声码器。因此,有监督与无监督语音表示的比较还不是很明确。因此,我们使用相同的声码器对vq-wav2vec与PPG(TIMIT)的表现进行比较。表2中的实验结果表明,PPG确实在WER和自然度方面表现较差。但是,在说话人相似度方面,PPG在不同的场景下都具有与vq-wav2vec不相上下或者更好的表现。这表明,有监督的特征表示确实对于说话人相似度的提升有一定的贡献,尤其是在A2A VC这类难度比较大的场景中。这也说明,自监督语音表示S3R在说话人信息解耦方面表现要差于PPG,这也值得进一步探索。
6 Conclusions and Future Work
本文提出了S3PRL工具的扩展版本,S3PRL-VC,将自监督语音表示应用于语音转换。进行了一系列的主观和客观实验来验证不同的自监督模型在不同VC场景下的表现。通过将自监督表示S3R与基于有监督机制的PPG相比较,我们发现S3R在一些场景下具有竞争力的表现,同时也分析了在某些场景下的不足并提出改进方向。我们从不同的角度为未来的研究提供了一些建议。从VC的角度来看,可以考虑设计更加合理有效的下游VC模型。例如,在A2A VC场景中,可以研究更科学的说话人编码方法,而不是简单的使用预训练的d-vector。从自监督模型角度看,考虑到VC领域所面临的挑战,在设计新的语音自监督模型时,可以将VC作为下游任务进行探索。