技术解读|复杂人声干扰下,如何让 ASR “听对人”
转载a month ago
技术解读|复杂人声干扰下,如何让 ASR “听对人”

在安静环境里,语音识别的问题很直接:用户说什么,模型就转录什么。但在会议、车内或咖啡厅里,用户的声音经常会和旁人交谈一起进入麦克风。 假设用户说“打开导航”,旁边的人同时说“我们明天几点出发”。一种常见错误不是把“导航”识别成别的词,而是把…

119 0 0
模型、代码、Demo已开源|X2-Turn:每80ms实时预测ASR和对话状态,同时理解「说了什么」和「该不该接话」
原创2 months ago
模型、代码、Demo已开源|X2-Turn:每80ms实时预测ASR和对话状态,同时理解「说了什么」和「该不该接话」

你有没有过这种体验:跟语音助手说话,刚停半秒,它就抢着回——其实你只是喘了口气; 或者你已经说完了,它还在干等,场面一度很尴尬。 这些「接话时机」问题,本质不是 ASR 认不清字,而是系统不会判断: 用户是说完了,还是话还没说完? 这句「嗯…

348 1 1