
本文由清华大学与上海交通大学、微软中国合作,提出了一种从语音预测虚拟人脸部动画参数(Speech-to-Animation, S2A)的方法,能够稳定且高效地生成与语音内容同步的面部表情动作。与传统方法相比,本文利用音素后验概率图来表征语音中与文本相关的内容,使模型拥有对不同语言和不同说话人自适应的能力;并引入了韵律特征(基频和能量)作为模型输入,从而能够生成更有表现力和区分性的嘴部动作。为了更好地建模语音特征和面部表情序列中的长短距离联系,本文还提出了一种基于混合专家网络(MOE)的Transformer模型。实验表明,本文所提的方法在嘴型准确度上超越了此前的其它方法,并在运行速度上得到了17倍的提升。特别感谢Digital Domain公司提供并渲染生成虚拟人角色。
论文链接:
https://arxiv.org/abs/2111.09771
合成效果试看:
https://thuhcsi.github.io/icassp2022-Transformer-S2A

随着人机交互技术的发展,单一模态的交互模式越来越难满足日益细分的场景。为了提高对话场景下的用户体验,融合语音和视觉的多模态交互模式正受到越来越多的关注。一个直观简单的做法是在对话场景中生成一个虚拟人形象,并使其说出预先定义好的语句,该语句可能由语音合成系统生成。直接从语音驱动虚拟人形象是一个极端困难的任务,通常的做法是控制某些脸部参数(animation),再从参数渲染生成虚拟人图片。Speech-to-Animation(S2A)则是一项从语音自动预测这些参数的方法。
然而,当前的S2A方法想要生成稳定高质量的脸部参数,主要面临着两方面的困难:1)如何获得稳定的语音特征表示。大部分方法使用梅尔谱图(Mel spectrogram)或者音素后验概率图(phonetic posteriorgram,PPG)来表示语音,前者不能实现对新说话人的自适应,而后者忽略了语音中的韵律信息,导致生成的脸部表情过于平均化。2)如何准确高效的预测脸部参数。传统的帧级别模型忽略了语音序列中的时序联系,基于循环神经网络的方法则在推理速度上有着一定的限制。
本文提出了一种稳定高效的从语音准确预测脸部动画参数的方法。通过使用PPG作为语音的基础表征,使得该方法拥有说话人和语言自适应的能力;通过引入额外的韵律特征基频(pitch)和能量(energy),使得生成的脸部动作更准确且具有表现力。本文进一步提出了一种基于混合专家网络(mixture-of-experts,MOE)的Transformer模型,该模型通过选择合适的候选专家模块,可以更好的捕获输入序列中的上下文信息。

图1:本文方法整体框架图
研究方法
韵律特征的引入
首先我们对脸部参数中较重要的一维参数“jawOpen”进行了分析。从下图可以观察到,对于两句具有相同文本内容的语音而言,其对应的脸部表情参数在曲线轮廓上相差很大,其中蓝色曲线对应的语句有着更高的音量和音调。我们知道PPG中包含了更多的文本内容信息而缺少韵律信息,因此图中两条差异较大的曲线,其对应的PPG在数值分布上却较为接近。仅仅使用PPG作为S2A的输入,将会导致生成的面部表情过于平均化而缺少表现力和变化。
为了给S2A模型提供明确的引导以预测脸部参数中多样的变化信息,需要使用额外的韵律特征(基频和能量)与PPG一起用作语音的特征表示。这一设计也符合人们的常规直觉:说话时的声调(基频)越高或者音量(能量)越大,嘴往往张得更大、脸部的动作更丰富。

图2:两段相同内容的语音对应的脸部参数“jawOpen”曲线,语句内容为“millions of dollars”
基于MOE的Transformer
在S2A模型构建方面,本文设计了一种基于MOE的Transformer来预测脸部动画参数,其具体结构如下图所示。相比于循环神经网络,Transformer中的自注意力机制(self-attention)更容易关注输入的语音序列中与输出相关的部分,且在推理时能够实现并行化。本文将原始Transformer中的全连接层替换为MOE层,它由n个结构相同但权重不共享的专家模块(expert)和一个门控(gating)网络组成。

图3:Transformer-S2A模型结构示意图
门控网络根据输入,评估每个专家模块的贡献度,只有贡献度排名前k的专家模块被考虑。

最终MOE层的输出可以表示为top-k个专家模块输出的加权和。

在这里,我们将总的候选专家模块数量n设置为48,与中文和英文中的音素(phoneme)数量大致相同;将k设置为16,即传统方法中描述嘴部动作的视素(viseme)数量。
数据采集:本文使用虚幻4(Unreal Engine 4,UE4)作为后端的渲染工具,除了UE4之外,也可以使用其他渲染引擎如Unity或Maya。如下图所示,我们使用一台iPhone配合软件LiveLinkFace和UE4进行数据采集。我们仅对一个志愿者采集大约一个小时的语音+脸部参数数据用于模型的训练。在这个过程中,我们不需要任何关于游戏制作的先验知识或者其它昂贵复杂的设备。

图4:数据采集示意图
PPG模型:为了获得稳定的PPG表征,我们利用大量容易获取的中英文语音数据,预先训练了一个语音识别模型,并使用64维的瓶颈特征作为PPG的表示。
对比方法:1)NVP [1],ECCV2020上开源的工作;2)BLSTM [2],广泛用于S2A的模型结构;3)LipSync3d [3],谷歌在CVPR2021上发表的工作,是目前虚拟人生成领域效果最好的方法(state-of-the-art,SOTA),但是该工作没有开源,因此我们直接下载Google官方给出的Demo用于主观评测。
实验结果
质量客观指标
为了评估本文所提方法的效果,我们计算了预测脸部参数和真实值之间的均方根误差(root mean square error,RMSE)。下表给出了所有参数维度和两个关键参数(jawOpen和mouthClose)上的RMSE结果。可以看出,对于NVP这样的帧级别方法,增大窗长会使RMSE降低,说明更长的上下文信息确实会提高预测精度。对于BLSTM,虽然它能够捕捉长距离依赖,但是忽略了语音和脸部参数之间的天然对齐关系,因此效果并不理想。本文所提方法在两个指标上都取得了最好的效果。除此之外,我们对MOE层、输入特征分别做了消融实验,实验结果也验证了各个模块的有效性。
表1:不同方法RMSE对比
(所有数值均已被除以100)

样例分析
为了进一步说明本文所提方法生成的脸部参数有更好的表现力,我们将其与NVP方法进行对比。下图展示了虚拟人说完中文音素/i/并向/æ/过渡的过程。可以发现,本文所提方法的嘴巴开口更大,更具有表现力,顺利地过渡到了下一个音素。

图5:NVP(左)和所提方法(右)预测参数渲染得到的虚拟人图像
推理速度
如下表所示,我们对比了不同方法生成1秒的脸部参数所需要的平均时间,被测试的音频长度均在12秒左右。可以发现,相比于BLSTM,所提出方法可以加速17倍;与帧级别方法NVP相比,我们的方法实现了可接受的速度下降,但获得了更高的生成质量。
表2:不同方法的推理速度对比

主观评测
为了进一步与SOTA方法进行对比,并检验所提方法跨语言和跨说话人的性能,我们在英文数据上进行了ABX实验。35个熟练掌握英文的志愿者参与了本次评测,他们被要求选择哪种方法生成的虚拟人有着更高的语音-嘴唇同步度和自然度,同时不同虚拟人之间的形象差异应当被忽略。结果如下图所示,本文所提方法在两个维度均获得了比LipSync3D更好的性能。值得注意的是,本文中的S2A模型是完全在中文数据集上训练得到的,而LipSync3D是直接在英文数据上训练的。

图6:本文所提方法(Proposed)与目前SOTA方法(LipSync3D)的ABX实验结果
结论
本文提出了一种稳定高效的从语音预测虚拟人脸部动画参数的方法。我们使用PPG和韵律特征作为语音的表示,在保证跨说话人和跨语言能力的同时,保留了语音中文本内容以外的变化信息。本文还提出了基于MOE的Transformer模型,进一步提升了模型建模上下文的能力,同时保证了推理效率。实验结果充分展示了所提方法在稳定性和效率上的优势。此外,我们提供了更多关于说话和唱歌的Demo展示,欢迎点击文末链接观看。
更多实验结果:https://thuhcsi.github.io/icassp2022-Transformer-S2A
主要参考文献
[1] Justus Thies, Mohamed Elgharib, Ayush Tewari, Christian Theobalt, and Matthias Nießner. Neural voice puppetry: Audio-driven facial reenactment. in ECCV, 2020, pp. 716–731
[2] Guanzhong Tian, Yi Yuan, and Yong Liu. Audio2face: Generating speech/face animation from single audio with attention-based bidirectional LSTM networks. in ICMEW, 2019, pp. 366–371
[3] AvisekLahiri, Vivek Kwatra, Christian Frueh, John Lewis, and Chris Bregler. Lipsync3d: Data-efficient learning of personalized 3D talking faces from video using pose and lighting normalization. in CVPR 2021, pp. 2755–2764
