浩浩荡荡的AIGC潮流,叠加资本资金如火如荼地注入,过去一年里,AI赛道焕发了新生,再度登上了科技语境的浪潮之巅。
自从十一期间,由OpenAI引领的Whisper和自然对话语音合成发布后,国内多家公司都在加速研发语音合成大模型的落地,今天来盘点下市面上部分TTS大模型的状况:

豆包APP
字节跳动推出的人工智能助手「豆包 App」,提供了写作助手、AI 图片生成、AI 漫画生成、智能聊天等功能。在设置的时候,声音版块有很多音色,早期豆包还没有那么多的音色,随着12月1日发布起来,豆包增加了很多音色,其中比较有特色的声音有:魅力苏菲(御姐风格)、爽快思思(直爽闺蜜)、京腔侃爷(北京话)、悠悠君子(温柔男友)、快乐小东(同事),目前使用语音通话,效果很自然。
豆包APP里面的声音复刻,大概需要用户读几十个字,复刻的效果页也特别像自己的音色,还是比较推荐的。豆包APP无需注册,支持抖音平台直接授权登陆。目前全部功能都是可以免费使用的,无限制。可在官网进行下载,也可以在手机应用市场进行下载。



讯飞星火APP
1月30日下午,科大讯飞发布了语音大模型的进展,中文、英语、法语、俄语等首批37个主流语种的语音识别效果超过OpenAI Whisper V3,而在多语种语音合成方面,星火语音大模型的首批40个语种拟人度超83%。
讯飞星火APP,目前只有聆小玥(女声)、聆飞逸(男声),整个男声的自然对话效果也非常厉害的。
讯飞星火APP还没看到可以直接复刻的。




海螺问问APP
Minimax的海螺问问APP,在语音通话模式,音色这块也有十几个音色,也有一个模仿音色。他们自己对外宣传的文章中提到的模仿熊二(卡通风格)、心悦(亲和力的女声)、子轩(低沉有磁性的男声)、胖橘(古装剧的皇室)等。
Minimax可以用6s左右可以复刻自己的声音,此外他们有自己的开放平台,有对应的API接口可以接入。
下载地址:https://www.123pan.com/s/etAOjv-FEo7A.html



序列猴子
2023年4月20日,出门问问的自研大模型序列猴子正式登场。基于这个大模型,出门问问也推出了面向创作者的一站式CoPilot的AIGC产品矩阵。期中就包括AI配音平台魔音工坊,是出门问问的第六代TTS引擎MeetVoice Pro,相信可以做出来非常好的语音合成大模型。
出门问问的合成可以支持数秒就可以完成复刻自己的声音。


ChatGPT
OpenAI的ChatGPT,由于墙的原因,很多人只能在各种视频网站上体验,之前标贝科技做了一个ChatGPT的评测,显示Cove这个男声音色是非常的厉害。
不过OpenAI 曾表示,为了避免语音合成所产生的诈骗问题,目前 ChatGPT 选择与专业的配音演员合作,只提供五种特定的声音,并仅限于语音聊天。使用语音功能时,你可以从所提供的五种声音中选择你最喜欢的声音,随时随地与它交谈。

当然,国内各家都在做类似的语音合成大模型,也有很多在一些场景落地。本次语音合成大模型对整个语音范式带来了新的挑战,期待见到更多自然对话的语音合成造福整个语音交互。