本次分享韩国科学技术高级研究院 Korea Advanced Institute of Science and Technology (KAIST) 在InterSpeech2021发表的表现力语音合成论文《STYLER: Style Factor Modeling with Rapidity and Robustness via Speech Decomposition for Expressive and Controllable Neural Text to Speech》(作者: Keon Lee, Kyumin Park, Daeyoung Kim)。该论文提出了一个高质量的快速、可控、表现力丰富、鲁棒性高的语音合成模型STYLER。


论文地址:https://arxiv.org/abs/2103.09474

Demo地址:https://keonlee9420.github.io/STYLER-Demo/

代码仓库:https://github.com/keonlee9420/STYLER

0 Abstract

神经语音合成(Text-to-Speech, TTS)的研究主要集中在训练和解码的推理速度、困难合成条件下的鲁棒性问题、表现力和可控性等方面。虽然大量工作对于解决这些问题做出贡献。但是,很少有工作考虑使用单一模型同时解决多个问题。本文提出了一个具有快速和鲁棒合成能力的表现力丰富和可控的TTS模型:STYLER模型。我们提出了Mel校准器(Mel Calibrator)用于文本和音频对齐学习,摒弃了自回归解码过程从而实现快速的训练和解码过程以及对于Unseen数据的稳定合成。同时,有监督的解耦风格因子建模方法提升了TTS的可控能力,也实现了表现力丰富TTS效果。另外,一个新颖的基于领域对抗训练和残差解码的噪声建模方法实现了噪声鲁棒的风格传递效果,可以在不添加任何附加标签的情况下对噪声进行分解。各种实验表明,STYLER在速度和鲁棒性方面优于基于自回归解码的表现力TTS模型,同时比阅读风格的非自回归TTS更具有表现力和可控性。

1 Introduction

神经TTS的研究取得了很大进展,但是在表现力和可控性方面仍然存在一些问题。由于TTS模型合成语音的风格来自于训练数据的平均风格信息,因此合成语音表现力受限。一些工作致力于使用不同的风格信息来合成或者控制合成语音的表现力。

然而,这些表现力TTS的工作由于自回归框架的限制,在合成速度和鲁棒性方面存在一定缺陷。自回归的迭代解码方式可能导致整个合成过程失败。同时,无监督的风格建模方法在特征解耦方面也存在不足。

一些非自回归TTS模型摒弃了自回归解码方式,使用基于自注意力机制的Transformer模型实现了并行解码。将注意力机制替换为有监督的时长预测机制提升了合成速度以及合成稳定性。但是,这些模型仍然只以单一文本作为输入,在表现力和可控性方面仍然存在局限性。

以上提到的大量工作没有将语音合成中的速度、鲁棒性、表现力、可控性等这些关键问题同时考虑。为了实现这个目标,以下一些重要条件需要被满足:首先,需要舍弃在速度和鲁棒性方面表现欠佳的自回归框架;其次,更多的语音变化信息应该作为文本的辅助信息,在真实语音信号中的风格因素建模考虑更多的表现力和可控性。

本文中,我们提出一个快速和稳定的风格建模TTS框架:STYLER,实现表现力丰富和可控的语音合成效果。基于非自回归结构,我们构建了风格因子建模方法来为每种风格因子实现表达和控制。输入信息除了文本信息之外,STYLER将真实语音分解为以下5个部分(包括:时长duration、基频pitch、能量energy、内容content和噪声noise)并将其作为输入。受到语音转换(voice conversion,VC)中基于informationbottleneck的语音解耦技术,我们的模型对不同的风格因子单独编码后将其解码为合成语音。另外,我们的噪声建模方法是将噪声从无标签的参考语音中分解出来,同时成功地从有噪声的输入中编码出语音风格。在高自然度前提下,STYLER模型首次实现了可以同时满足快速、稳定、表现力丰富和可控的语音合成效果。

本文贡献总结为以下几点:

  1. STYLER基于创新的文本音频对齐技术,与自回归表现力TTS系统相比,在unseen数据上具有更快和更稳定的表现。

  2. STYLER通过对风格因子的解耦,在相同的监督水平,与非自回归TTS系统相比,实现了更高的表现力和更好的可控性。

  3. STYLER也表现出噪声鲁棒性,我们的噪声建模方法可以在不需要任何额外的标签下将噪声与其他风格因子分解。

2 Method

2.1 Supervised Speech Decomposition


Supervised Speech Decomposition

实现非自回归TTS的风格因子建模需要考虑两个因素:首先,合成语音的语义内容来自于文本信息,可能与音频内容存在不匹配;其次,最近的一些非自回归TTS工作基于有监督学习,而其中的语音解耦是以无监督方式进行的。为了解决这些问题,我们提出了Mel校准器(Calibrator),并且在有监督方式下对语音解耦进行重新定义。

Mel Calibrator

注意力机制可以学习长度不匹配的<文本,语音>对之间的对齐关系,但是在合成unseen的句子时,注意力机制往往表现不稳定。为了提升语音合成的鲁棒性,我们提出了Mel Calibrator,将音频按文本长度进行线性压缩或扩展。只给定输入文本和音频的总时长信息,Mel Calibrator按照音素数量与音频帧长度的比率,通过平均音频的语音帧或复制某一帧,将它们分配给每个音素。通过这样的操作,对齐学习过程转变为真实音频的一个简单的帧级别bottleneck特征映射问题,而不需要任何的注意力或强制对齐过程。因此表现出两个优势:1、它不会为非自回归TTS模型带来任何鲁棒性问题;2、它不涉及文本信息,所以与音频相关的风格信息只来自于音频本身。

Information Bottleneck under Supervision

先前的无监督语音分解编码器在信道和帧级别都需要一个紧凑的瓶颈来传递来自源音频的必要信息,导致训练费时且难度增加。在有监督方式下,不同的编码器可以充分利用目标音频中的预提取声学特征(如基频、能量等)。

2.2 Model Architecture

图1展示了提出模型的整体结构。STYLER一共对6种风格因子进行建模,包括文本text、时长duration、基频pitch、说话人speaker、能量energy和噪声noise。为了同时实现快速、鲁棒、表现力丰富和可控性强的合成效果,STYLER将非自回归TTS和语音解耦方面工作的一些元素进行了结合。

Encoders

文本编码器以音素序列作为输入,其中包含两个256维的FFT blocks。时长、基频、能量和噪声编码器包含三个卷积层和两层BiLSTM实现的channel-wise的bottleneck层。Mel校准器应用在卷积层之后。

编码器的输出在送入各个预测器之前(Predictor)要先上采样到channel-wise。Length Regulator以frame-wise上采样的方式根据时长信息将语音帧为各自所属的音素重复多次。


时长和噪声编码器均以mel-spectrogram作为输入;基频编码器以说话人正则化后的pitch contour为输入,以确保对说话人无关的pitch contour进行建模;说话人编码器使用预训练的DeepSpeaker模型提取;能量编码器以归一化成0到1的能量值作为输入,降低模型训练难度。

所有输入只通过channel-wise的bottleneck层。这是因为音频已经由Mel校准器处理,并且额外的frame-wise的bottleneck层看作额外的调节机制。

Decoders

STYLER包含三个预测器,分别为时长、基频和能量预测器。每个预测器的输入都是文本编码和其对应编码的和。基频预测器将说话人编码也作为额外输入来预测最终的pitch contour,这样可以提升说话人信息的分离效果。

解码器的输入是文本编码、基频向量、能量向量和说话人向量。

2.3 Noise modeling

在提高STYLER的噪声鲁棒性的同时,音频中的噪声信息可以在没有附加标签的情况下分离出来。在我们的模型中,噪声是模型编码器中显式编码的另一个重要因子。

Domain Adversarial Training

为了从音频信号中提取噪声无关特征,Domain Adversarial Training(DAT)技术在TTS领域被广泛使用。与之前工作相似,我们添加了augmentation label 和gradient reversal layer (GRL),并将其与模型其他参数一起训练。每个预测器的label看作一个类别label

如图1所示,DAT被用到了除噪声编码器之外的其他所有音频相关编码器中。GRL层输出的编码信息通过augmentation分类器来预测augmentation后验信息(original/augmented)。通过这样的操作,除了噪声编码器之外的所有编码器都认为是噪声无关的,因此每个预测器的输出都与clean lebels做比较而不与noisy lebel做比较。

Residual Decoding

根据噪声的定义,以及没有显式label,我们设计一个“Residual Decoding”模块。包含clean decoding和noisy decoding两部分。在clean decoding中,所有噪声无关的编码都用来预测纯净的mel-spectrogram。在noisy decoding中,噪声编码器的输出与噪声无关编码加起来用来预测带噪声的mel-spectrogram。由于噪声编码器只在noisy decoding时更新,梯度不会回传到其他编码器。

2.4

Loss Calculation

不涉及噪声建模的模型整体代价函数是:


带有噪声建模的模型整体代价函数是:


3 Experiment

3.1 Experiment Setup

实验数据选择VCTK。我们从WHAN!数据集中随机选择背景噪声并将其与纯净语音进行混合后构建噪声数据,其中信噪比signal-to-noise ratio(SNR)变化范围为5到25。

我们构建了以下baseline模型,将从四个方面与我们的STYLER模型做比较:

Mellotron:基于Tacotron2和GST的自回归TTS模型,其将pitch和duration作为显式条件输入。我们使用该baseline来比较表现力丰富和可控TTS在速度、鲁棒性方面的效果。

FastSpeech2:以pitch、duration、energy为监督信号的非自回归TTS模型。我们使用该baseline来比较阅读风格非自回归TTS在表现力和可控性方面的效果。

使用预训练的ResCNN Softmax+Triplet模型提取说话人向量。使用预训练的HiFi-GAN(UNIVERSAL_V1版本)作为声码器。

3.2 Evaluation Metrics

我们在四个方面评价模型效果:速度、鲁棒性、表现力和可控性。其中,训练和推理时间用来比较速度。

Mean opinion score(MOS)分数用来比较自然度和鲁棒性。Comparative Mean opinion score(CMOS)用来在风格迁移任务中比较表现力效果。最后,可控性的效果验证是在ablation study中完成的。

实验设置两种不同的说话人设置:seen speakers(S)和unseen speakers(US),以及两种不同的合成环境:paraller(P)和nonparallel(NP)。parallel指语音内容与输入文本相同。

3.3 Results

Rapidity and Naturalness


表1展示了关于速度和语音自然度的实验结果。对于速度指标计算,我们计算1k steps内每一个step的平均时间作为训练速度;我们计算测试集中单个文本的平均解码时间作为解码速度。虽然我们的STYLER与FastSpeech2相比由于增加了风格因子建模的步骤而影响了训练和解码的速度,但是STYLER仍然比Mellotron的训练和解码时间分别快3.49和8.96倍。

MOS结果可以看出,STYLER虽然比FastSpeech2具有更高的模型复杂度,但是仍然可以合成自然的语音。除了在S中的MOS-P中出现了略微下降,STYLER比Mellotron具有更高的MOS分数。

在US和NP条件下,两个baseline都表现出不同程度的性能下降,但是STYLER表现出很好的合成效果。

在我们的辅助实验中,STYLER在一个特定的不确定点开始倾向于合成具有平均风格的语音,在自然度提升的表现要优于表现力方面。随着US MOS分数的增加,US的MOS分数高于S的MOS分数。另外,Mellotron表现出重复、跳词等问题,这是由于对齐学习的不稳定,这样的情况在STYLER中是不存在的。综上,我们的模型合成的语音比Mellotron更自然,特别是当以unseen数据作为输入时,证明了在unseen data场景下的合成鲁棒性。

Style Transfer


表2报告了不同系统的风格迁移效果。STYLER的表现均优于两个baseline。

Style Factor Modeling


图2展示了我们的ablation study结果。我们依次减去风格因子建模模块来验证风格因子建模的有效性。

参考语音带有背景噪音时(左上),合成语音是否包含背景噪音(右上与左中)取决于noisy decoding是否被激活。如果只将noisy decoding单独激活,则将只合成噪声信号(右中)。

从这些结果可以证明STYLER可以从有噪声的参考音频中产生干净的音频,验证了我们的模型的噪声鲁棒性。我们还发现,噪声模型可以预测输入音频的不同噪声级别。综上所述,本文所建立的噪声建模方法成功从参考语音中分解出噪声信息。

当忽略与噪声无关的风格因子时,对应的编码变成固定样式(左下)。例如,除去pitch编码后,合成的语音只具有平坦的音高轮廓。另外,如果给定另一个说话人,说话人的身份会发生改变而其他风格因子则不会改变。当文本编码器被屏蔽时,与音频相关的风格因子可以被成功建模,但是合成语音具有很差的可懂度(右下)。从所有的消融研究结果可以看出,我们的编码器成功地捕获了预期的风格因子信息。

在FastSpeech2中,持续时间、音高和能量都是可控变量。但是,这些值是从相同的文本中预测出来的,并且只有在合成之后才能进行控制。相反,STYLER在文本和风格因子之间平均分配依赖,并在输入级别上进行合成控制。因此,通过解耦的风格因子,STYLER可以使用来自不同信息来源的输入变量控制语音输出。

4 Conclusion

本文提出了STYLER,一个具有风格因子建模的非自回归TTS框架,同时对快速、鲁棒性、表现力和可控性等4个问题进行研究。各种实验表明我们的方法取得了喊好的合成表现。然而,我们的模型在风格迁移性能和语音自然度之间有一个折衷。未来计划是扩展到不同的数据集和语言中来解决这种折衷问题。