设定一个程序,用户只要剪辑出来某个人的高清录音就可以直接生成语音合成。例如,我们需要训练某个播音员、配音演员和电影明星的声音。首先剪辑出他的录音,导入系统之后,系统利用已有的语音识别自动生成文本,用户只要对文本内容进行检查即可。检查完毕后,语音与文本进行配合自动训练,训练的时间成本就大大缩减了。这样可以快速训练出一个播音员的语音合成模板
为什么不用语音识别自动喂养训练语音合成?
评论 1
文明发言,友善讨论
银河标注员5 years ago
因为语音合成的数据跟真实的人说话是有区别,而语音识别面对的场景是人说话;用合成的数据会涉及到不匹配;但是近来,端到端里面会有合成的数据生成一些文本的匹配数据来训练lm的环节。
