声浪
刚刚开源的TTS神器,Kokoro-82M驱动,支持ePub/PDF/TXT,跨平台!
文本转语音(TTS)工具的需求现在是越来越多,尤其是在生成高质量有声书、配音和同步字幕的场景中。传统TTS工具要么依赖云端API,存在隐私风险,要么生成速度慢、语音不自然。 Abogen是最近刚开源的一款新型 TTS 工具,通过Kokoro…
24 0 0
邱锡鹏团队开源MOSS-TTSD!百万小时音频训练,突破AI播客恐怖谷
来源丨机器之心 当前的文本到语音(TTS)模型在单句或孤立段落的语音生成效果上取得了令人瞩目的进展,合成语音的自然度、清晰度和表现力都已显著提升,甚至接近真人水平。不过,由于缺乏整体的对话情境,这些 TTS 模型仍然无法合成高质量的对话语音…
26 0 0
Step-Audio 2:端到端音频大语言模型,实现行业级理解与对话能力
Step‑Audio 2是由StepFun团队开发的多模态大语言模型,可直接从原始音频输入理解语义与副语言信息,并生成连贯的文本与音频响应。 模型通过隐向量音频编码器、强化学习(RL)与检索增强生成(RAG)机制,引入工具调用(如 Web…
27 0 0
