谷歌的Magenta团队推出了Magenta RealTime(Magenta RT),这是一种开放权重的实时音乐生成模型,为生成式音频带来了前所未有的交互性。Magenta RT根据Apache 2.0许可证发布,可在GitHub和Hugging Face上获取,它是首个支持具有动态、用户可控风格提示的实时推理的大规模音乐生成模型。

官方博客:https://magenta.tensorflow.org/magenta-realtime
GitHub:https://github.com/magenta/magenta-realtime
模型卡片:https://huggingface.co/google/magenta-realtime

背景:实时音乐生成

实时控制和现场交互是音乐创作的基础。虽然之前的Magenta项目(如Piano Genie和DDSP)强调表达控制和信号建模,但Magenta RT将这些目标扩展到全频谱音频合成。它通过实现即时反馈和动态音乐演变,缩小了生成模型与“人在回路”创作之间的差距。

Magenta RT建立在MusicLM和MusicFX的基础建模技术之上。然而,与它们面向API或批处理的生成模式不同,Magenta RT支持前向实时因子(RTF)>1的流式合成——这意味着即使在免费的Colab TPU上,它也能以超过实时的速度生成内容。


技术概述

Magenta RT是一个基于Transformer的语言模型,在离散音频标记上进行训练。这些标记通过神经音频编解码器生成,该编解码器以48kHz的立体声保真度运行。该模型利用了一个8亿参数的Transformer架构,该架构针对以下方面进行了优化:

  • 以2秒音频片段进行流式生成
  • 具有10秒音频历史窗口的时间条件
  • 使用文本提示或参考音频的多模态风格控制

为了支持这一点,模型架构调整了MusicLM的分阶段训练流程,集成了一个新的联合音乐-文本嵌入模块,称为MusicCoCa(MuLan和CoCa的混合体)。这使得能够对流派、乐器和风格演变进行有语义意义的实时控制。


数据与训练

Magenta RT在约19万小时的器乐库存音乐上进行训练。这个庞大且多样化的数据集确保了广泛的流派泛化能力和在各种音乐环境中的平滑适应能力。训练数据使用分层编解码器进行标记,这使得在不损失保真度的情况下实现紧凑表示。每个2秒的块不仅以用户指定的提示为条件,还以10秒的先前音频的滚动上下文为条件,从而实现平滑、连贯的进展。

该模型支持两种风格提示的输入模式:

  • 文本提示,使用MusicCoCa转换为嵌入
  • 音频提示,通过学习的编码器编码到相同的嵌入空间


这种模式的融合允许实时流派变形和动态乐器混合——这是现场创作和类似DJ表演场景的基本能力。


性能与推理

尽管模型规模庞大(8亿参数),Magenta RT实现了每2秒音频1.25秒的生成速度。这足以满足实时使用(RTF约为0.625),并且推理可以在Google Colab的免费TPU上执行。

生成过程被分块以允许连续流式传输:每个2秒的片段在前向管道中合成,使用重叠窗口以确保连续性和连贯性。通过模型编译(XLA)、缓存和硬件调度的优化,进一步最小化了延迟。


应用和用例

Magenta RT旨在集成到以下场景中:

  • 现场表演,音乐家或DJ可以实时引导生成
  • 创意原型工具,提供音乐风格的快速试听
  • 教育工具,帮助学生理解结构、和声和流派融合
  • 互动装置,实现响应式生成音频环境

谷歌已经暗示即将支持设备上的推理和个人微调,这将使创作者能够使模型适应他们独特的风格特征。


与相关模型的比较

Magenta RT补充了谷歌DeepMind的MusicFX(DJ模式)和Lyria的RealTime API,但关键区别在于它是开源的且可自行托管。它还与潜在扩散模型(如Riffusion)和自回归解码器(如Jukebox)不同,专注于具有最小延迟的编解码器标记预测。

与MusicGen或MusicLM等模型相比,Magenta RT提供了更低的延迟,并支持交互式生成,这在当前需要预先生成完整曲目的提示到音频管道中往往是缺失的。


结论

Magenta RealTime推动了实时生成音频的边界。通过将高保真合成与动态用户控制相结合,它为AI辅助音乐创作开辟了新的可能性。其架构平衡了规模和速度,而其开放许可确保了可访问性和社区贡献。对于研究人员、开发人员和音乐家来说,Magenta RT代表了迈向响应式、协作式AI音乐系统的基础性一步。