ICLR2026 - FlexiVoice:零样本音色克隆 + 自然语言风格指令控制的统一语音生成框架来了
转载8 months ago
ICLR2026 - FlexiVoice:零样本音色克隆 + 自然语言风格指令控制的统一语音生成框架来了

「 现存问题 」 用户在进行指令语音合成时,常常希望用自然语言指令控制情绪、语气、语速等风格,同时又希望用一段参考音频实现零样本音色克隆。但现实中参考音频往往会把自身的情绪与韵律一起“带进来”,文本也可能自带隐含风格,导致模型忽略指令,出现…

19 0 0