声明:平时看些文章做些笔记分享出来,文章中难免存在错误的地方,还望大家海涵。
搜集一些资料,方便查阅学习:http://yqli.tech/page/speech.html
语音合成领域论文列表请访问:http://yqli.tech/page/tts_paper.html
语音识别领域论文统计请访问:http://yqli.tech/page/asr_paper.html
如何查找语音资料请参考文章:https://mp.weixin.qq.com/s/eJcpsfs3OuhrccJ7_BvKOg
如有转载,请注明出处。欢迎关注微信公众号:低调奋进。
Prosodic Clustering for Phoneme-level Prosody Control in End-to-End Speech Synthesis本文为三星企业在2021.11.19更新的文章,主要对音素级别的韵律进行调控,具体的文章链接:
本文整体思想还比较简单,整体的思路如下:1)先通过对齐工具把每帧和音素进行对齐;2)求取音素的时长和f0; 3)然后使用k-means进行聚类,本文实验把f0聚类为12类,duration聚类15类;4)然后使用如下图1所示的系统进行训练和推理,该系统整体架构为tacotron架构。该系统的输入为音素序列和音素对应的韵律序列,韵律序列即聚类分类。
本实验训练三个系统:仅使用f0分类训练的F0 model,仅使用duration训练的Duration model和同时使用f0和duration的joint model。图1测试了三个系统随着调节f0和duration分类的系统情况,可以看出单独模型和联合模型可以控制系统韵律变化。图3展示单独调节f0和duration对MOS值的影响,图4是同时调节f0和duration对整体系统MOS的影响。图5展示了音符上进行的聚类情况。


4、总结
本文章设计了一种使用f0和duration进行聚类来进行音素级别的韵律控制。