该框架的核心在于将语音和文本标记联合建模,通过预测下一个语音标记来生成语音。
验证Scaling Law
训练时间扩展(Scaling Train-time Compute)
实验表明,增加模型参数(从1B到8B)和训练数据量(从80k小时到250k小时)可以显著提高语音的自然度、韵律准确性和情感表达能力。
零样本学习能力:扩展训练资源能够显著提高模型对未见说话人的语音克隆能力。
推理时间扩展(Scaling Inference-time Compute)
研究还探索了在推理阶段通过增加计算资源(例如使用语音理解模型作为验证器)来优化生成语音的质量。实验表明,推理时间扩展可以显著提高语音的情感表达、音色一致性和内容准确性。
实验结果
语音分词器性能:提出的Xcodec2在多个指标上优于现有分词器,特别是在低比特率下的语音重建质量。
TTS 性能:Llasa在LibriSpeech、Seed-TTS-Eval和ESD数据集上达到了最先进的性能,尤其是在情感相似性、音色相似性和零样本学习能力方面。
推理时间扩展效果:通过PRM和ORM方法,推理时间扩展显著提高了语音合成的质量,尤其是在复杂任务中。
“开源渡世”
咳咳,太乙真人重新上线:
老道已将丹方(训练代码)、丹药(模型权重)公之于世,广邀三界修士共参:
秘方参照:Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis

诸位道友若有心得,不妨留言论道,老道自当一一解惑!
