来源丨RET开发者社区
传统的AI语音合成往往因缺乏情感表达而显得机械生硬。Fish Audio最新开源的文本转语音模型Fish Audio S2,致力于解决这一痛点。该模型能够生成包含清嗓、叹息、笑场等细微人类声学特征的语音。

模型权重、微调代码及 SGLang 推理栈已在 GitHub 和 Hugging Face 开源;S2 Pro 版本已在官方平台上线。


  • 开源协议:Fish Audio Research License


Fish Audio 正式开源 S2 文本转语音模型,基于 4.4B 参数的双自回归(Dual-AR)架构与 1000 万小时音频数据。该模型实现了生产级的低延迟流式推理,并支持通过自然语言标签进行词级情感控制,以及多角色、跨段落的长音频生成。


  • 自然语言精细化行内控制:支持在文本中嵌入自由格式的指令标签(如[astonished]、[voice up]),实现词级的音调、情感和语速控制。在 EmergentTTS-Eval 中,副语言控制胜率达 91.61%,优于 GPT-4o-mini-tts。

  • 多角色多轮对话支持:通过、等标签语法,支持一键生成复杂的多人对话。系统支持多 Prompt 音频输入,可快速完成多音色的克隆与切换。

  • 高效率流式推理性能:实测首包延迟(TTFT)小于 100ms,实时因子(RTF)低于 0.195。在单张 NVIDIA H200 上,系统可在维持 RTF < 0.5 的前提下,实现每秒 3000+ 声学 token 的吞吐量。

  • 长文本上下文推理稳定性:支持长上下文推理(Long Context Inference),确保在生成跨段落的长文本故事或演讲时,音色与语气保持一致,避免传统 TTS 模型在长序列下的质量衰减。

  • Dual-AR 非对称架构优化:采用 4B 参数的 Slow AR 处理语义 codebook,400M 参数的 Fast AR 处理残差声学细节。该设计与标准 LLM 同构,可无缝利用 SGLang 的连续批处理、RadixAttention(前缀缓存命中率达 86.4%)等优化手段。