FluxMusic 是一种将当下最火、效果最好的 Flux 文生图模型技术扩展到音乐生成的开源模型,能够很好的遵循提示词生成音乐,并且更自然流畅。

源码库:https://github.com/feizc/FluxMusic

论文:https://arxiv.org/pdf/2409.00587

FluxMusic 是一种基于类似 Flux 的 Transformer 架构的新型模型,专门用于从文本生成音乐。这个模型的创新之处在于,它采用了双文本音乐流的独立注意力机制,随后应用去噪补丁预测来处理堆叠的单音乐流。通过这一系列步骤,FluxMusic 模型能够有效捕获字幕语义信息,并在生成过程中保持较高的推理灵活性。该模型在生成音乐时展现出更高的准确性、灵活性和逼真度,为文本到音乐的生成开创了新的方向。

FluxMusic主要功能

  1. 文本到音乐生成:将文本描述直接转换成音乐。

  2. 语义理解:利用预训练的文本编码器捕捉文本中的语义信息,确保生成的音乐与文本描述的情感和风格相匹配。

  3. 灵活的推理:通过多个文本编码器的组合,提供灵活的推理选项。

  4. 高效训练:采用修正流训练方法,提高模型训练的效率和生成音乐的质量。


FluxMusic技术原理

  1. 扩散模型:基于扩散模型,通过逐步逆转数据从有序状态到随机噪声的转换过程,来生成音乐。

  2. 修正流(Rectified Flow):利用修正流技术优化数据和噪声之间的连接,提高理论属性和生成效果。

  3. 双流注意力机制:在模型初期使用双流注意力机制处理文本和音乐的联合序列,实现信息的双向流动。

  4. 堆叠单流块:在文本流被丢弃后,使用堆叠的单音乐流块专注于音乐序列建模。

  5. 变分自编码器(VAE):将音乐压缩成潜在空间表示,作为噪声添加和模型训练的基础。

  6. 梅尔频谱:将音频信号转换为梅尔频谱,作为音乐表示和生成过程的一部分。

  7. 预训练文本编码器:使用如T5 XXL和CLAP-L等预训练模型提取文本特征,增强模型对文本描述的理解能力。

  8. 调制机制:结合粗略文本信息和时间步嵌入,用于调整音乐生成过程。

  9. 细粒度文本细节: 将细粒度文本信息与音乐补丁序列结合,作为模型输入。