文本输入和一个 15 秒的音频样本就能生成与原始说话者非常相似的自然声音。

3月30日凌晨,OpenAI在官网首次展示了全新自定义音频模型“Voice Engine”。

用户只需要提供15秒左右的参考声音,通过Voice Engine就能生成几乎和原音一模一样的全新音频,在清晰度、语音连贯、音色、自然度等方面比市面上多数产品都强很多。

除了能合成音频之外,OpenAI还展示了Voice Engine很多其他际商业用途,例如,一位失去声音表达能力的女孩,在Voice Engine帮助下能像以前一样正常发音说话。


令人惊讶的是,Voice Engine 并未根据用户数据进行训练或微调,而是通过一个扩散过程和 transformer 结合的方式 —— 从而产生语音。

OpenAI 产品员 Jeff Harris 表示,他们采用少量音频样本和文本,生成与原始说话者相匹配的真实语音。请求完成后,所使用的音频将被删除。

在定价方面,尽管 OpenAI 在今天发布的营销材料中删除了 Voice Engine 的定价信息,但根据新闻网站 TechCrunch 消息,Voice Engine 的定价为每一百万字符 15 美元,这样的定价可以覆盖狄更斯的《雾都孤儿》,还略有余地,相当于 18 小时的音频,使得价格略低于每小时 1 美元。这个价格确实比 ElevenLabs 的收费便宜一些 —— 每月 100,000 字符收费 11 美元。不过,Voice Engine 目前不支持音调、音高或节奏的调整。

如果 OpenAI 的音频工具流行起来,那么,配音员们又将何去何从呢?要知道,ZipRecruiter 上的配音员工资从每小时 12 美元到 79 美元不等 —— 比 Voice Engine 贵很多,即使是低端的配音员,价格也不便宜。

最后又回到大家关心的安全与隐私,OpenAI 也早早考虑了这些问题,他们明确禁止未经授权来模仿任何个人或组织。与此同时,他们也开发了一系列安全措施,包括对 Voice Engine 生成的音频加水印,主动监控使用情况等。


总 结

OpenAI首次展示的语音生成模型Voice Engine引起了广泛的关注。该模型能够生成与原声非常相似的自然语音,通过文本输入和音频样本,用户可以与AI助手进行更自然的交互。虽然该技术还存在挑战,但它展示了语音生成技术在改善用户体验和推动创新方面的巨大潜力。
未来,Voice Engine的发展将为语音生成技术开辟更广阔的前景。随着模型的不断优化和训练数据的增加,我们可以预见到更加逼真、流畅且具有情感表达的语音生成结果。
这项技术的潜在应用领域也非常广泛。在教育领域,Voice Engine可以为教学内容提供有声化的支持,使学习过程更加生动和个性化。在娱乐产业中,它可以用于游戏角色的语音交互,增强游戏的沉浸感。此外,Voice Engine还有望在医疗辅助和可访问性方面发挥作用,为视觉或听觉障碍的人群提供更多支持和便利。
然而,随着技术的进步,我们也必须认真对待伦理和隐私问题。合成语音的滥用可能引发虚假信息传播、欺诈和侵犯隐私等问题。因此,OpenAI将继续与社会各界积极合作,制定相应的政策和法规,确保技术的应用始终符合道德和法律的准则。
总的来说,OpenAI展示的Voice Engine语音生成模型引领着人工智能领域的语音交互技术发展。它为我们带来了更加逼真、个性化和自然的语音交互体验。未来,我们可以期待这项技术在各个领域的广泛应用,为人们创造更加智能、便捷和有趣的交互方式。同时,我们也需要保持警惕,确保技术的使用始终符合伦理和法律的要求,以实现更加可持续和负责任的人工智能发展。