声浪
通用语音识别模型VibeVoice ASR:长达60分钟音频一次性“直出”结构化转写
本文来源丨微软亚洲研究院 近日,微软亚洲研究院发布了一款通用的语音识别模型VibeVoice ASR,单次转录可处理长达 60 分钟的连续音频,并能够可靠地生成丰富、结构化的输出,清晰地记录说话者是谁以及其说话时间。作为一种全新的语音识别范…
26 0 0
本文来源丨微软亚洲研究院 近日,微软亚洲研究院发布了一款通用的语音识别模型VibeVoice ASR,单次转录可处理长达 60 分钟的连续音频,并能够可靠地生成丰富、结构化的输出,清晰地记录说话者是谁以及其说话时间。作为一种全新的语音识别范…