近期,新加坡国立大学Human Language Technology (HLT) 实验室发布全新情感语音数据集Emotional Speech Database (简称ESD),相关论文Emotional Voice Conversion: Theory, Databases and ESD (Authors: Kun Zhou, Berrak Sisman, Rui Liu, Haizhou Li) 已被语音通信领域顶级期刊Speech Communication接收。
论文地址:https://tinyurl.com/4kfhe8xp
项目主页:https://hltsingapore.github.io/ESD/
(文末附百度网盘数据获取方式)
1 摘要
2 引言

3 情感语音转换回顾
3.1 语音中的情感
对语音中的情感信息进行建模时,需要考虑两个问题:1) 如何描述和表示情感信息;2) 如何建模人类表达和感知情感的过程。
情感的表示
情感可以表示为离散的情感类别和连续的情感维度。情感类别可以使用情感分类标签(如:angry、fear、happy、sad 和 surprise等)直接的表示情感。
情感维度可以通过情感极性的表示方法(定义为arousal、valence 和 dominance三个维度)来描述语音中情感状态的连续变化。
近年来,利用大规模情感标注语音数据进行表示学习(representation learning)也可以学习到有意义的情感表示。
情感的感知和生成
韵律特征包括音质、语速和基频(Fundamental frequency,F0),如频谱特征、持续时间、F0轮廓线和能量包络线等,是情绪相关研究中常用的声学特征。在情感语音转换中,通常需要考虑这些声学特征的转换来实现情感的渲染。
随着深度学习的出现,利用神经网络学习的深度情感特征(deep emotional features)可以很好的在连续空间中描述语音不同的情感风格。这样的深度特征也被广泛的应用于情感语音转换领域且取得了不错的表现。
3.2 平行数据下的情感语音转换
早期的情感语音转换模型主要依赖平行数据实现。平行数据指说话人和文本内容相同但是表达情感不同的配对语音数据。在训练过程中,转换模型通过配对的特征向量学习源情感A到目标情感B的映射。如图2所示,情感语音转换过程通常包括特征提取、帧对齐和特征映射三个步骤。其中,动态时间规整(dynamic time warping, DTW)、基于语音识别或注意机制的时长对齐是常用的帧对齐方法。特征映射的目的是学习源特征和目标特征之间的关系。

3.3 非平行数据下的情感语音转换
由于平行数据中配对语音数据的录制耗时耗力,制作难度较大。因此,基于制作难度较小的非平行数据下的情感语音转换技术逐渐受到关注。非平行数据中,不同类别的情感语音通常也包含不同的语义内容,不会受到文本内容必须相同的限制。下面我们将回顾两种比较有代表性的非平行数据下的情感语音转换方法:1) 自编码器(auto-encoder)和 2) CycleGAN模型。
基于以上两种模型的情感语音转换方法主要依照以下三种技术路线来对非平行数据进行充分学习和利用:1) Emotional domain translation, 2) Disentanglement between emotional prosody and linguistic content, 3) Leveraging TTS or ASR systems。
Emotional domain translation
如图3所示, CycleGAN基于对抗学习的概念,即通过生成器和鉴别器之间的最小最大值博弈,训练生成模型来寻找最优解。CycleGAN包含3种损失,即1)对抗性损失、2)循环一致性损失和3) 身份映射损失。对抗性损失衡量转换后的特征分布和目标特征分布之间的可区分性。基于循环转换设计的循环一致性损失摆脱了平行数据的约束,身份映射损失有助于保持输入和输出之间的语义内容一致性。
StarGAN从两个域扩展到多个域来学习多域的情感迁移,适用于多对多说话人语音转换。它由一个由类参数化的生成器/鉴别器对和一个用于验证类正确性的域分类器组成。通过这种方式,StarGAN允许多类到多类的域转换。

Disentanglement between emotional prosody and linguistic content
如图4所示,一个典型的基于自编码器的情感语音转换主要由三部分组成,即1)编码器,2)生成器,3)鉴别器。编码器学会逐帧生成一个编码z,它应该包含情感无关信息,如语言内容和说话人身份。生成器学习从编码z和情感身份中重建输入特征,鉴别器学习将重构特征与真实特征区分开来。

Leveraging TTS or ASR systems
在说话人语音转换领域,语音中的语义信息可以作为语音转换的辅助信息提升说话人转换的稳定性。因此,说话人语音转换可以与TTS或ASR进行不同形式的融合。
受此启发,TTS和ASR也可以服务于情感语音转换。对于TTS,可以基于Seq2Seq模型结构并采用多任务学习的方式与情感语音转换联合训练。其中TTS在训练过程可以学习到语音的潜在语义表征来服务语音转换。在推理阶段,系统可以将给定的参考语音中的情感状态转换为目标情感。对于ASR,如图5所示, 语音后验概率(phonetic posterorgrams, PPG)可以作为情感语音转换的辅助输入特征,提升情感语音转换系统对多说话人、多情感语音数据的泛化能力。

4 情感语音数据回顾

4.1 词汇多样性
词汇内容对语音生成系统的泛化能力有重要影响,在语音转换和语音合成研究中尤为重要。一般来说,语音合成系统可以从大量词汇变化的训练数据中获益。然而,并没有可用的包含丰富词汇多样性的情感语音数据,大多数数据集只包含有限的文本内容。
4.2 语言多样性
在表1中列出的19个数据库中,有9个数据库只包含英语语音,而其他数据库包括德语、法语、丹麦语和汉语。其中只有2个数据集(AmuS和EmoV-DB)同时包含两种语言(英语和法语)。然而,由于英语和其他语言之间情感语音数据的不平衡,使得跨语言情感表征在情感语音转换中仍然存在困难。因此,我们有必要构建一个能够在英语和其他语言之间取得平衡的多语言情感语音数据库,适合于研究不同语言之间的情感表达。
4.3 说话人多样性
情感表达同时表现出说话者相关和说话者无关的特征。通过在大规模多说话人情感语音数据上学习说话人无关的情感特征,情感语音转换可以表现出很好的泛化性。我们注意到,许多现有的情感语音数据集缺乏说话人多样性,因此对于研究说话人无关的情感语音转换并不理想。
4.4 干扰因素
作为一个复杂的副语言声学特征,情感表达也受到年龄、口音等信息的影响。我们注意到,由于存在干扰因素,一些情感语音数据集并不适合构建一个高质量的说话人无关情感语音转换模型。例如,eNTERFACE’05数据包含潜在的口音信息;IEMOCAP数据包含笑声、叹气等。
4.5 录音环境
在制作高质量的语音数据时,专业的录音环境和录音设备是必不可少的。我们注意到,一些情感语音数据集从对话、电影或电视节目中收集得到。由于一些不可避免的背景噪音等问题,这些数据库可能不是最佳选择。
5 ESD数据详情
ESD数据集的目的是为社区提供一个大规模的情感语音数据集。在本节中,我们首先解释ESD数据库如何克服现有情感语音数据集的不足。然后,提供了ESD数据集的全面分析。我们也使用语音情感识别模型对ESD数据集进行测试,并对语音情感识别模型中学习到的深度情感特征进行可视化分析。
5.1 满足学术研究需要
词汇多样性:如前所述,现有数据不具有足够的词汇多样性。ESD数据集中为每个说话人的每一种情感准备了350句平行文本。 语言多样性:ESD数据集同时包含中文和英文语音数据。可以更好的构建跨语种的情感语音转换系统。 说话人多样性:ESD数据包含10个中文说话人和 10个英文说话人,每种语言都分别包含5名男性和5名女性说话人。 干扰因素:所有说话人的年龄均在25-35岁之间。在录制过程中,要求说话人避免笑声或叹气声等干扰因素。所有英文说话人都使用北美英语口音录制,所有中文说话人都使用标准普通话录制。 录音环境:为了保证理想的录音环境,ESD数据集中的所有语音数据都是在专业的室内录音室中录制,信噪比在20 dB以上,采样频率为16 kHz。
5.2 数据集设计
数据集划分
如表2所示,对于每个说话人的350条语音,我们使用前20条语音作为验证集,接下来的30条语音作为测试集,剩下的300条语音作为训练集。

数据集结构
ESD数据库的目录组织如图6所示。数据文件夹和ReadMe在根目录下。在Data文件夹中,我们有20个子文件夹,分别存放了10个中文说话人(0001 - 0010)和10个英文说话人(0011 - 0020)的所有语音。对于每一个说话人子文件夹,包含一个文本文件,以及5个子文件夹对应5种情感类别。对于每个情感类别子文件夹,我们将所有的语音数据划分为三个子文件夹,即验证集、测试集和训练集。

5.3 数据集统计详情
表3给出了ESD数据集的详细统计信息。

词汇多样性
中文数据中,所有说话人的1750条语音中一共有20025个汉字,汉字词汇量为939。如图7 (a)所示,中文句子的平均长度为11.5个汉字。英语数据中,1750条语音一共包含11015个英文单词,单词词汇量是997。如图7 (b)所示,平均长度为6.31个单词。

时长统计
发音的持续时间是语音节奏的表现。图8展示了ESD数据集中不同语言在不同情感下发音时长的概率密度直方图。英文语音数据的平均时长和单词时长分别为2.76s和0.44s,汉语的平均时长和单词时长分别为3.22s和0.28s。

基频统计
基频(Fundamental frequency,F0)是一种重要的语音韵律描述符。表4汇报了ESD数据中F0参数的均值和标准方差。

5.4 情感分类测试
为了验证ESD数据集中情感表达的质量,我们首先为中文语音和英文语音分别建立一个说话人无关的语音情感识别模型。模型结构包括LSTM层、全连接层和softmax分类层。我们按照5.2.1中的ESD数据集划分方式对语音情感识别模型进行训练并汇报测试结果。图9展示了最终测试集情感预测结果的混淆矩阵。结果显示,中、英文系统的总体情感识别准确率分别为92.0%和89.0%,表明该数据集中的情感语音的情感表达与情感标签具有较高的一致性。

另外,如3.1.2节所说,深度情感特征(deep emotional features)可以很好的表征语音的情感状态。我们将从语音情感识别模型提取的中间层特征来作为ESD数据的深度情感特征并验证其表现。我们从测试集中对每种情感都随机选择20条语音,使用t-SNE进行可视化分析。如图10所示,不同情感明显的聚类效果说明从ESD中提取的深层情感特征可以很好地描述语音的情感状态。

6 基于ESD数据的情感语音转换实验
我们基于一些最先进的情感语音转换模型,提供了面向ESD数据的基准实验。
6.1 实验设计
6.2 客观实验结果
我们采用MCD对转换结果进行客观评价,客观实验结果如表5所示,其中zero effort表示源语音声学参数和目标语音声学参数直接比较的结果。可以发现,CycleGAN-EVC和VAWGANEVC的MCD值都明显低于zero effort。此外,CycleGAN-EVC在所有情感转换场景下的表现都优于VAWGAN-EVC。

6.3 主观实验结果
主观实验分别包括MOS和XAB实验,实验结果如图11和图12所示。可以看到CycleGAN-EVC系统的结果优于 VAWGAN-EVC。


7 ESD数据的其他应用
除了情感语音转换,ESD数据还可服务区其他语音转换任务及语音合成任务。例如 跨语言语音转换、情感语音合成等。
8 论文总结
本文对情感语音转换相关的研究和语音数据进行了全面的回顾。为了促进社区的发展,我们开源了全新的目前为止规模最大的情感语音数据集ESD。实验部分提供了基于ESD数据的基线情感语音转换系统,验证了数据的表现。
数据获取方式
