ChatGPT、DeepSeek等语言模型具备「深度推理」(Reasoning)能力,这类模型会在回答问题前先进行一段较长的推论过程,使回答的品质大幅提升。
不过,这种「等使用者说完话才开始思考」的方式,虽然在纯文字的使用场景能够被接受,却不太适用于需要即时反应的语音互动场景。
现在,台大李宏毅教授团队与微软研究人员合作开发出SHANKS,让口语语言模型(即输入语音、输出语音的大型语言模型, Spoken Language model)能「边听使用者说话进行深度推理」。

论文地址:
项目主页与demo:https://d223302.github.io/SHANKS/index_zh.html
⏩作者团队来自
工业界:微软
学术界:台湾大学李宏毅团队
⏩SHANKS的贡献

SHANKS将使用者的流式语音输入进行分段推理,根据现有的使用者语音思考或产生动作,使得模型能够聆听使用者说话,一边进行无声的深度思考。
实验显示SHANKS可以在使用者说错话时,更准确的打断使用者并提出纠正与澄。
SHANKS可以用来在使用者说话时,同时调用工具。当使用者的输入需要调用工具才能回覆时,现存模型需要等到使用者说完话才会开始进行工具调用,然而,我们观察到有些工具其实在使用者话说到一半时就能调用了。我们使用SHANKS在使用者说话时调用工具,能够大幅降低回覆的延迟。
