标题:Explore Speaker Adaptation Text-to-Speech Method Based ProbSparse Self-attention
作者:冷媛媛,王宗挥,方志华,张云祥,何亮

单位:新疆大学计算机科学与技术学院、清华大学电子工程系


研究背景
传统的自注意力机制在捕获长程依赖关系和增强合成语音方面显示出了希望。然而,这些机制具有较高的计算复杂度和存储需求,特别是在处理长语音序列时。此外,自注意力的密集性质导致了冗余计算,限制了可扩展性和实时适用性。为了克服这些挑战,本文引入了PSSA[1]模块,减少了计算负担和内存使用。这种基于概率的方法保留了重要的特征,同时舍弃了信息量较少的元素,提高了效率和合成质量。在语音合成数据集上的广泛实验表明,基于PSSA的框架优于传统的自注意力方法。


本文方案
1.动机

在基于FastSpeech2的个性化语音合成模型中,该模型的计算复杂度为O(n)2,导致训练和推理缓慢。为了解决这个问题,我们引入了PSSA。PSSA的优点是具有O(nlogn)的时间复杂度和内存使用,显著提高了训练速度。基于注意力的长尾分布,筛选出有价值的Q,用平均权重分布表示影响力较小的Q。对于影响较小的部分,我们只需要进行固定计算。PSSA一般可以优化自注意力,筛选重要查询,突出主要特征,提高合成效果。同时,还可以降低模型的复杂度和计算量,从而解决基于FastSpeech2的个性化语音合成模型中的一些关键问题。


2.模型概述

所提出方法的结构如图1所示。首先,我们使用CDFSE[2]作为我们的模型主干,但进行了一些修改。将CDFSE模型的解码器和梅尔编码器中的自注意力机制替换为PSSA。在模型操作过程中,编码器首先从参考梅尔频谱中提取局部内容和说话人嵌入。这些提取的内容和说话人嵌入被视为键和值,然后传递给参考注意力模块。同时,FastSpeech2的音素编码器生成一系列查询。这些查询被发送到引用注意力模块,与键和值进行交互,并产生相应的输出。然后,将此输出添加到音素编码器的输出中,形成一个完整的、内容丰富的表示。最后,将该表示输入到FastSpeech2的方差适配器中,生成与参考语音相同的语音。


图1. 基于ProbSparse自注意力的说话人自适应语音合成的模型结构


3. 概率稀疏自注意力

传统的自注意力主要由查询、键和值组成,其中第一个注意力被定义为核平滑的概率形式,如公式1所示。自注意力需要内存和二次点积计算的成本,这是预测能力的主要缺点。首先对典型自注意力的学习注意模式进行了定性评估。PSSA得分呈长尾分布,即少数点积对注意力有贡献,其他点积对注意力可以忽略。


我们将查询稀疏度计算定义为公式2。第一项是所有键的对数和exp (LSE),第二个是算术平均值。


根据建议的度量,我们通过允许每个键只参与u主导的查询来获得PSSA,如公式3所示。PSSA的实现如算法1所示。




实验结果分析

为了评估感知语音合成质量和说话人相似度,我们分别使用MOS和SMOS进行评估。10名母语为汉语的人被要求判断合成语音样本的质量。文本内容在不同的系统中保持一致,以便所有测试人员只检查音频质量,而不考虑其他干扰。我们将我们的模型与四个模型进行了比较。这四个模型分别是CDFSE、两种典型的定长说话人嵌入方法(GSE、CLS)和基于Attentron的变长嵌入方法(Attentron*)。这四种方法也是基于FastSpeech2的。


表1. Aishell3数据集上的语音合成质量和说话人相似性结果


结果如表1所示,所提模型的音频质量优于其他基线模型。所提出的CDFSE方法在说话人相似度方面也优于所有四个基线。该模型的可见扬声器的SMOS为4.23,未见扬声器的SMOS为3.55。实验结果表明,该模型有助于提高音频质量和说话人相似度。

为了检验PSSA结构对模型的重要性,我们将其与自注意模型进行了比较并进行了实验。实验结果如表2所示。实验结果表明,PSSA优于自注意模型,确实提高了模型的综合质量。


表2. 测试PSSA对模型的影响


采样因子以稀疏概率控制自聚焦信息的带宽。为了研究不同采样因子对语音合成的影响,从小因素到大因素进行了研究。如表3所示,整体性能略有提高,最终稳定下来。验证了自关注机制中冗余点积对的查询稀疏性假设。实验结果如表3所示。当采样因子为80时,音频质量最好。在实际操作中,我们设置样本因子c = 80。


表3. 采样因子对语音合成的影响


合成频谱图与音频展示:


基线的音频:【点击试听】

合成的音频:【点击试听】

相比于稀疏注意力,稠密注意力的发音间隙不明显(如频谱图),导致听上去较为顿挫,这是因为不重要的特征被加上权重。


小结

本文解决了传统自注意力模块在语音合成中的局限性,并提出PSSA模块作为一种新的解决方案。实验证明了基于pssa的框架的优越性,提高了合成质量,并有效解决了传统自注意力机制在计算复杂度和内存使用方面的困难。


参考文献
[1]Zhou H, Zhang S, Peng J, et al. Informer: Beyond efficient transformer for long sequence time-series forecasting[C]//Proceedings of the AAAI conference on artificial intelligence. 2021, 35(12): 11106-11115.
[2]Zhou, Y., Song, C., Li, X., Zhang, L., Wu, Z., Bian, Y., Su, D., Meng, H.: Content-Dependent Fine-Grained Speaker Embedding for Zero-Shot Speaker Adaptation inText-to-Speech Synthesis. In: Proc. Interspeech 2022. pp. 2573–2577.