标题:《HPSU: A Benchmark for Human-Level Perception in Real-World Spoken Speech Understanding》
链接:https://arxiv.org/pdf/2511.23178
开源地址:https://github.com/Ichen12/HPSU-Benchmark
公开日期:2025年12月1号
作者单位:中山大学、腾讯
其他:论文已被AAAI2026接收
01、核心贡献(这仨点是真·创新,得重点说)
搞了个超大规模的评估基准 :HPSU里有超过2万条中英双语样本,还都经过专家验证,覆盖了从“认说话人性别”到“猜潜台词”的16个细分任务,能全方面测模型的感知和推理能力。
解决了标注难的问题 :设计了“多模态半自动化标注流程”,不用全靠人工,还顺便产出了 HPSC数据集 (5万+条中英语音-描述对)——这个数据集不光能给模型微调,还能用来做可控语音生成。
测了13个主流模型,发现了关键差距 :包括11个开源模型(比如Qwen2.5-Omni、SALMONN)和2个闭源模型(Gemini 2.5 Pro/Flash),明确了现在模型和人类在“复杂推理”上的核心差距,给后续研究指了方向。
02、方法部分(怎么造的HPSU?实验前的准备很关键)

基础感知:比如认年龄(选“成年/青少年”)、性别(男/女)、口音(美式/苏格兰式),还有简单的主情感识别(“担忧/感兴趣”)。
复杂推理:这才是重点,比如“情感变化”(从平静到焦虑)、“语言和情绪矛盾”(嘴上说“开心”实际“失望”)、“猜潜台词”(比如反讽暗示情况不好),甚至还要推测“说话人的视觉行为”(比如“在哭/在大笑”)。
客观题(单选/多选)、主观题(判断描述准不准)都有; 还加了“对抗性提示”:每个任务给三种提示——标准的、带正确答案暗示的(正向泄露)、带错误引导的(负向误导),看模型会不会被带偏; 评分超严格:用Gemini 2.5 Pro自动打分,单选必须和标准答案语义完全一致,多选错一个就0分,杜绝“蒙对一半”的情况。
03、实验过程(测了哪些模型?怎么测的?)
模型:13个主流语音LLM,比如闭源的Gemini 2.5 Pro/Flash,开源的Qwen2.5-Omni、Kimi-Audio-Instruct、Audio Flamingo系列等(GPT-4o因为安全政策不答题,没算进去)。
基线:三个参照组,确保结果有对比性:
人类基线:每种语言找10个大学生,每人做300道题,平均准确率87.3%(这是“天花板”);
随机猜测:纯靠运气选答案,看 Chance 水平;
Whisper+GPT-4o:先让Whisper转写音频成文本,再让GPT-4o只看文本答题——测“光看文字能不能搞定”。
04、实验结果(重点来了!模型表现怎么样?差距在哪?)


比如“情感复杂变化(SH)”、“潜台词理解(Subt)”,模型准确率不足50%,人类却能超85%; 从 表4 (各模型任务准确率表)能更清楚看到:中文Subt任务里,人类准确率95.9%,Gemini 2.5 Pro才52.3%,差了40多个百分点;“对话场景判断(Scn)”人类85.3%(英文),模型最高才49.4%(Qwen2.5-Omni)。
05、关键发现:模型的3个大弱点


06、总 结
