歌唱语音合成(SVS)的快速发展亟需高质量标注数据集,但传统人工标注成本高昂且效率低下。现有自动歌唱标注(ASA)方法通常仅解决标注流程中的孤立任务。为此,我们提出STARS,首个统一框架,同时解决歌唱转录、歌词对齐与精细化风格标注三大任务,提供以下多层级标注:

  1. 精确音素-音频对齐

  2. 音符转录与对齐

  3. 音素级演唱技巧识别(如颤音、假声)

  4. 全局风格表征(情感、节奏等)


论文链接:https://arxiv.org/abs/2507.06670

Demo链接:https://gwx314.github.io/stars-demo

代码链接:https://github.com/gwx314/STARS


任务动机
传统歌声合成技术缺乏精细标注的数据集,且传统的标注方式需要使用多种工具进行分段标注。STARS通过以下创新解决难题:
  • 统一多任务框架:首次集成歌唱转录、歌词对齐、技巧标注与风格分析于单一模型。
  • 五级层次化架构:设计帧/词/音素/音符/句子五级特征编码器,分别进行对应标注任务。
  • 端到端联合优化:多任务学习,避免繁琐的级联方式的多任务标注。

图1:传统方法与STARS对比

方 法

总体架构


图2:STARS 总体模型架构

图中展示了本文提出的 STARS 的整体框架。模型输入音频和对应的歌词序列。首先,模型通过五种不同层次的声学编码器提取帧/词/音素/音符/句子对应层次的声学特征,然后基于这些提取的特征,实现歌词对齐,音符对齐和转录,音素级别技巧和整体风格的预测。

多级特征提取

基于U-Net架构,融入Conformer模块捕捉长短期时序依赖,并创新性引入FreqMOE (Frequency Mixture of Experts)对频谱带进行专家建模,通过向量量化(VQ)与长度调节器,动态聚合不同粒度的声学特征(帧→句子)。歌词对齐

进行训练的过程中,融合帧级交叉熵(CE)损失和CTC损失优化音素预测;利用二元交叉熵(BCE)损失优化边界检测。

在推理过程中,结合音素预测概率与歌词序列,采用Viterbi强制对齐算法确定音素/词边界。

音符转录

融合帧/词/音素特征,通过BCE损失训练边界预测器。推理时结合预测的词边界约束生成最终音符边界。基于预测的音符边界,在音符级别特征上,采用加权平均聚合特征并预测音高(CE损失优化)。

风格标注

基于五种层次的声学特征,我们对技巧风格进行了预测

  • 音素级技巧预测:视为多任务多标签二分类(9类技巧:混合音、假声、强音、弱音、滑音、气声、气泡音、颤音、喉音)。利用五级特征及音素边界,采用注意力加权预测各技巧存在性(BCE损失)。

  • 全局风格预测:视为多类别分类任务(情感、节奏、音域、语言、性别)。引入5个[CLS]标记作为查询,五级特征总和作为键/值,通过交叉注意力机制预测各属性(CE损失)。


实 验
整体性能

图3:音素对齐结果可视化。图中为梅尔频谱与音素对应关系。


图4:音符转录结果可视化。其中蓝色线为真实的基频,红色线是真实的midi曲线,绿色线是预测的midi曲线。
通过实验和结果可视化可以看出,在音素和音频对齐的精度、音符转录精度、演唱技巧识别以及整体风格的自动化标注结果足够精确,自动化标注的数据可以用于歌声合成任务。
STARS消融

消融实验证实,CTC损失的加入可以有效提升音素和音频对齐的效果,CMUEncoder相较于单纯使用卷积层对各个层次特征的提取具有关键作用。多语言的加入,由于音素数目的增加,提升了音素和音频对齐的难度,但有效提升了总体风格预测的结果。
歌声合成对比

技巧可控歌声合成
我们采用不同比例的真实和自动化标注的数据进行技巧可控的歌声合成模型的训练。实验证实,STARS标注数据达到接近人工标注的合成效果,混合自动标注的数据集可进一步提升歌声生成模型的性能。

总结与展望
STARS是首个统一解决歌唱转录、对齐与精细化风格标注的框架,通过创新的五级层次化架构特征提取,实现了高效、精准的全自动多维度标注,能为歌声合成模型提供更丰富的训练数据,助力生成更自然、风格可控的歌声合成。
未来,团队计划进一步拓展 STARS 的能力,包括结合大语言模型实现动态风格描述生成,以及扩展至更多语言数据集,推动歌唱语音技术在多语种、多场景下的应用。