来源丨AI音频时代

人工智能研究实验室Stability AI正式推出企业级音频生成模型Stable Audio 2.5。也是首款针对企业级用例开发的模型。

Stable Audio 2.5在音频细节处理、生成速度、音乐结构完整性以及功能拓展性等方面实现重大突破,尤其宣称“仅需2秒钟即可创建3分钟音频曲目”,引发音频创作行业的广泛关注。

功能特点:
  • 几秒生成三分钟曲目:研究团队首创的对抗性相对对比(ARC)后期训练法,使 GPU 推理不到两秒即可输出最长三分钟的完整曲目。

  • 动态多段体作品:优化音乐结构,可一次性生成含引子、发展、尾声的多段体;对提示词响应更准,情绪描述(如“振奋人心”)与跨流派语汇(如“丰富的合成器”)均能被精准捕捉。

  • 音频修复带来更多控制:除文本到音频、音频到音频外,新增音频修复工作流,用户可上传自有音频并指定起始点,模型将依上下文补全剩余部分。


Stable Audio 2.5的核心改进聚焦于音乐生成能力。与前代模型相比,新模型生成的音频结果更贴合实际编曲逻辑,能够呈现包含前奏、发展、结尾等完整多段式结构的音乐作品,为音频创作者提供了更专业、更丰富的创作素材。

在提示词理解方面,Stable Audio 2.5展现出更高的精准度。特别是在对情绪描述和音乐风格词汇的把握上,模型能够更准确地响应创作者的意图,生成符合预期的音频内容。这一改进极大地提升了音频创作的灵活性和个性化程度,使创作者能够更自由地表达创意。

借助 Stable Audio 2.5 的企业级功能,专业创意团队可利用更先进、可定制的音频生成技术,为每条制作赋予精准音效。

新版模型在音频生成速度上的显著提升,得益于Stability AI研发团队提出的后训练方法ARC(Adversarial Relativistic-Contrastive)。该方法通过结合相对式对抗训练与对比判别器,对扩散模型的生成过程进行优化加速。在保证音轨质量的前提下,大幅降低了GPU推理耗时,从而实现2秒钟生成长达3分钟的音频内容,为音频创作行业树立了新的效率标杆。


随着 Stable Audio 2.5 发布,Stability AI 携手全球声品牌代理机构 amp(隶属 Landor 集团,WPP 旗下成员),共同开发面向创新品牌的声品牌解决方案。该模型将通过 WPP Open 向 WPP 全球客户开放,把先进技术与创意专长合二为一。