CosyVoice 系列一直是 TTS 领域备受瞩目的标杆之作。从 CosyVoice 1 到如今的 CosyVoice 3,它不仅逐步实现了当前 TTS 技术的主流功能,更在技术架构上实现了全面覆盖与深度优化。近日,CosyVoice 3 迎来重要更新,本文将为你带来最新亮点与核心升级解析。

项目链接:https://github.com/FunAudioLLM/CosyVoice

论文链接:https://arxiv.org/pdf/2505.17589v1

项目简介

CosyVoice 3 是阿里巴巴集团通义实验室语音团队研发的零样本TTS模型,实现复杂环境下的语音合成。该模型通过多项关键技术升级实现显著性能提升:训练数据规模扩展至百万小时级别,模型参数量增至15亿,并引入多任务监督训练的语音分词器以及可微分奖励优化机制。相比前代模型,CosyVoice 3 在内容一致性、说话人相似度与韵律自然度等方面均有显著突破。该模型仅需3秒原始音频即可高度还原目标音色,并支持方言合成与语气灵活调整等功能。

模型结构


Cosyvoice 3沿用了CosyVoice 2的架构。其中Speech tokenizer使用了FSQ,预训练的任务是ASR。LM backbone在CosyVoice的基础上去掉了utterance-level的speaker embedding,支持流式解码和非流式生成。Causal Conv-Transformer UNet支持不同大小的chunk生成,可以平衡时延和生成效果。

技术特点

  • 采用新型语音分词器,通过多任务监督训练(涵盖自动语音识别、语音情感识别等任务),提升韵律自然度。

  • 提出新的可微分奖励模型,适用于自身及其他基于大语言模型的语音合成模型的后训练。

  • 扩大训练数据规模至百万小时,覆盖 9 种语言、18 种汉语方言及多样场景。

  • 增加模型参数至 15 亿,提升多语言基准测试性能。

  • 支持发音修复、文本归一化自训练及指令驱动语音生成等功能,增强可控性与鲁棒性。

实验结果