NCMMSC 2026 | ChinaVoices Challenge 2026:数据、任务、基线与方法总结
转载18 days ago
NCMMSC 2026 | ChinaVoices Challenge 2026:数据、任务、基线与方法总结

中文语音交互不仅需要处理普通话,也需要面对丰富的地域方言。对于一段方言语音,系统既要判断“说的是哪种方言”,也要准确识别“说了什么”。然而,现有研究采用的方言类别、训练资源和测试集并不统一,系统性能难以直接比较。 近期,西工大音频语音与语言…

算法资讯
19 0 0
TASLP论文分享:联邦音频深伪检测
转载19 days ago
TASLP论文分享:联邦音频深伪检测

以下文章来源:生物信息感知与人机交互团队 随着语音合成与生成式人工智能技术快速发展,高质量合成语音在身份冒充、语音诈骗和虚假信息传播等场景中带来了新的安全风险,推动了音频深度伪造检测(Audio Deepfake Detection,ADD…

18 0 0
EMNLP 2026|Qwen Audio 团队入选论文分享
原创20 days ago
EMNLP 2026|Qwen Audio 团队入选论文分享

近日,EMNLP 2026正式公布录用结果,本期分享阿里 Token Foundry Qwen Audio 团队中稿的 3 篇论文,涵盖视频到音频生成、大语言模型推理增强、神经编解码语音合成三大前沿方向。 本次入选的 3 篇论文分别围绕跨模…

算法资讯
37 0 0
网易有道开源流式ASR模型 R2T2,要做语音Agent 的 infra
原创22 days ago
网易有道开源流式ASR模型 R2T2,要做语音Agent 的 infra

做过实时语音识别的人,大概率都见过这样一种场景: 你刚说完半句话,屏幕上的字幕已经出来了,但再多说几个字,前面的内容突然被改掉。字幕一会儿增加、一会儿回滚,甚至整句话重新刷新。如果只是看字幕,这可能只是“有点闪”。但当ASR的输出开始直接连…

算法资讯
45 0 0