论文标题:ParaS2S: Benchmarking and Aligning Spoken Language Models for Paralinguistic-aware Speech-to-Speech Interaction

论文地址:https://arxiv.org/pdf/2511.08723

发表时间:2025年11月13号

项目主页:https://paras2sbench.github.io


01、研究背景:现有语音对话模型的“尬聊”问题

现在的语音-语音(S2S)模型,比如Qwen2.5-Omni、ChatGPT语音模式,虽然能正常聊天,但有个大毛病——搞不定“副语言线索”。简单说就是没法识别语音里的情绪(比如难过、开心)、语气(比如讽刺、真诚)、说话人属性(年龄、性别),只会看文本内容回复,经常出现“人家说‘我丢了钱包’(难过语气),它回‘太好了!下次注意’”这种尬场面。
为啥会这样?主要三个问题:
  • 副语言被无视:模型只抓文字意思,不管语音里的“隐藏情绪”;
  • 没好的评估标准:以前的基准要么只看文本回复,要么只测基础语音理解,没人直接评估“输入语音→输出语音”的内容和风格配不配;
  • 数据太少太贵:要做带副语言标注的语音对话数据,得雇人标情绪、录带风格的语音,成本高到用不起,模型没数据练自然不行。


02、核心框架:ParaS2S——一边评一边调的解决方案

ParaS2S分两部分:ParaS2SBench(评估基准)和ParaS2SAlign(RL调优框架),简单说就是“先搞个尺子量模型好不好,再用强化学习把模型调优”。

  • 左图(a)是ParaS2SBench流程:从生成测试语音,到提取内容/风格,再到GPT评分,一步一步很清晰;
  • 右图(b)是ParaS2SAlign流程:分SFT热身、蒸馏奖励模型、GRPO后训练三阶段,每个阶段的输入输出都标得很明白,能快速看懂整个调优逻辑。
2.1 第一部分:ParaS2SBench——给模型“打分的尺子”
这部分的核心是做一个能自动给S2S模型打分的工具,而且得和人类判断差不多准。
a. 设计思路:三个原则避免“作弊”
  • 端到端评语音:不绕弯子,直接拿输入语音和输出语音对比,既看内容对不对,也看风格配不配;
  • 对比式风格:同一个文本内容,配两种相反风格(比如“遇到前任”配“惊讶”vs“悲伤”),逼模型必须听语音,不能靠文字猜;
  • 文本要中性:比如“社区要建商场”,光看文字看不出情绪,模型只能靠语音里的副语言线索做回复。
b. 数据从哪来?合成+真实双管齐下
基准里的测试数据分两类,覆盖4种副语言维度,具体如下:

c. 怎么自动打分?三步搞定
不用雇人一个个评,模型自己就能算分,还和人类评分很像(相关性>0.7):
  • 提信息:用Whisper-v3把输出语音转成文字(看内容对不对),用AudioReasoner(基于Qwen-Audio 2)提取输出语音的风格(比如“悲伤、正式”);
  • 送GPT评分:把“输入内容+输入风格+输出内容+输出风格”喂给ChatGPT 4.1,按人工定的准则(1-5分,5分最好)打分;
  • 出结果:这个分数就能当后续强化学习的“反馈信号”——分高说明模型做得好,分低就改。
2.2 第二部分:ParaS2SAlign——用RL让模型“自学”副语言
因为标注数据贵,作者搞了个三阶段强化学习框架,用GRPO(Group Relative Policy Optimization) 算法,让模型能从无标注语音里学副语言能力(比常用的PPO省内存,还不用训麻烦的价值函数)。
阶段1:SFT热身——先给模型“打基础”
直接用RL的话,模型一开始啥都不会,生成的回复全是垃圾,没法学。所以先搞个“热身训练”:
  • 按ParaS2SBench的逻辑,造10k组“输入语音→输出语音”数据(总共100小时);
  • 让ChatGPT生成配输入风格的回复文字和风格描述,再用GPT-4o-mini-TTS合成高质量输出语音(还得过滤掉识别不准的,人工筛一遍);
  • 以Kimi-Audio为基础模型,训“输入语音token→输出语音token”的预测,得到一个初步会看副语言的模型(叫θ_sft)。
阶段2:蒸馏奖励模型——把“打分尺子”变快
ParaS2SBench打分虽准,但要调用好几个模型(Whisper、AudioReasoner、ChatGPT),太慢了,没法支撑实时RL训练。所以得把这个慢流程“压缩”成一个轻量的奖励模型:
  • 用阶段1的θ_sft,给10k个输入语音各生成32个不同回复,凑320k组“输入→输出”对;
  • 用ParaS2SBench给这些对打分,造一个“偏好数据集”(分高的回复更优);
  • 用LoRA微调Qwen2.5-Omni当奖励模型(叫φ),输入“输入语音+输出语音+评分准则”,就能直接输出1-5分,快多了。
阶段3:GRPO后训练——让模型从无标注数据里学
有了热身模型和快的奖励模型,就能用无标注语音训了:
  • 找100k个无标注语音(只留波形,丢了文字和风格标签),用Whisper转文字做输入token;
  • 给每个输入生成G个回复,用奖励模型φ打分,算“优势值”(哪个回复更好);
  • 用GRPO调优θ_sft:鼓励生成分高的回复,加KL正则避免模型忘了基础聊天能力,最后得到终版模型。


03、实验:ParaS2S到底好不好用?

实验用Kimi-Audio当基础模型,对比了GPT-4o Voice、Qwen2.5 Omni、GLM-4-Voice这些开源/闭源模型,主要看三个指标:ParaS2SBench自动评分、人类主观评分、VoiceBench评分(确保基础聊天能力没退化)。
3.1 关键结果1:基准评分和人类很一致——尺子很准

GPT和人类评分对比表中能看出来:
  • TTS模型(比如gpt-4o-mini-tts(god))分很高(GPT评4.649,人类评4.469),因为它们能精准控风格;
  • 现有S2S模型(比如GPT-4o Voice、Qwen2.5 Omni)分都在3左右,说明它们确实不会看副语言;
  • 所有模型的GPT评分和人类评分排名几乎一样,相关性超0.7,证明这个基准能代替人类打分。
3.2 关键结果2:RL比SFT强多了,还特省数据

RL和SFT数据效率对比表很直观:
  • 纯SFT虽然比现有模型好,但要大量数据才涨分;
  • RL(GRPO)不管用多少数据,都比同数据量的SFT好:10小时SFT+RL,就能追上50小时纯SFT的性能;20小时SFT+RL,能追100小时纯SFT;
  • 必须先热身:直接用基础模型跑RL,根本学不会,因为生成的回复太差,没有效反馈。
3.3 关键结果3:在真实语音上也好用——泛化性强

真实语音测试集结果显示:
  • 只用合成数据训的SFT+GRPO,在IEMOCAP(演员语音)和MELD(电视剧语音)上已经比现有模型好;
  • 如果把真实语音加进RL训练,性能还能涨:比如“GRPO on IEMOCAP + MELD”在IEMOCAP得4.394分,MELD得3.947分,平均4.166,比纯合成数据训的高不少。
3.4 关键结果4:比所有现有模型都强——效果顶流

各模型ParaS2SBench评分对比能看到:
  • 现有S2S模型(包括GPT-4o Voice、Qwen2.5 Omni)的分都不高,和“Whisper-GPT-TTS”(只转文字再合成语音,不管风格)差不多;
  • 我们的模型(Kimi-Audio GRPO)在合成数据上平均4.441分,真实数据上平均4.161分,远超其他模型,还接近“GPT-TTS”(用了真实风格标签的上限模型)的水平。
3.5 关键结果5:资源该怎么分配?优先给SFT

SFT和奖励模型资源分配对比图说明:
  • 固定标注预算时,多给SFT数据,RL效果更好(因为热身模型质量高,生成的回复更有用);
  • 奖励模型不用多的数据:只要10小时标注语音,就能训出和基准相关性>0.7的奖励模型,再多数据提升不大。


04、核心贡献:ParaS2S到底解决了什么问题?

  • 首个副语言S2S基准:第一次实现“输入语音→输出语音”的端到端评估,还能暴露现有模型的“尬聊”问题;
  • 首个RL调优框架:不用大量标注数据,靠“热身SFT+蒸馏奖励模型+GRPO”,让模型从无标注语音里学副语言能力;
  • 数据效率超高:10小时标注数据+RL,就能追上50小时纯SFT的性能,解决了数据贵的痛点;
  • 开源资源:会开放数据集、代码和模型,降低后续研究门槛。

05、结论

现有S2S模型在副语言感知上就是“耳盲”,ParaS2S用“基准+RL”的组合,既解决了“怎么评”的问题,又解决了“数据少怎么训”的问题。实验证明,这个框架能让模型生成更自然、更共情的语音回复,而且不用花大价钱标数据,为后续做人性化语音对话模型提供了新方向。