Speaker-Reasoner:将多说话人语音转录从“序列解码”升级为“多轮时序推理”
在会议和电话等真实的多说话人对话场景中,全面的对话理解不仅需要准确的语音识别(ASR),还要求模型能够联合处理说话人属性、细粒度的时间戳定位以及文本转写。然而,语音重叠、频繁的附和(backchannels)以及快速的语权交替等复杂声学现象…
35 0 0
在会议和电话等真实的多说话人对话场景中,全面的对话理解不仅需要准确的语音识别(ASR),还要求模型能够联合处理说话人属性、细粒度的时间戳定位以及文本转写。然而,语音重叠、频繁的附和(backchannels)以及快速的语权交替等复杂声学现象…