ICASSP 2026|迈向构建低资源语种的多任务语音理解模型
基于语音编码器、适配器和大语言模型(LLM)构建的语音大语言模型(SLLM),在英语和中文等高资源语言中展现了卓越的多任务理解性能。然而,在泰语等低资源语言中,其有效性显著降低。这种局限性主要源于三个因素: 现有的常用语音编码器(如 Whi…
22 0 0
基于语音编码器、适配器和大语言模型(LLM)构建的语音大语言模型(SLLM),在英语和中文等高资源语言中展现了卓越的多任务理解性能。然而,在泰语等低资源语言中,其有效性显著降低。这种局限性主要源于三个因素: 现有的常用语音编码器(如 Whi…
Singing Accompaniment Generation(SAG,人声伴奏生成)想做的事很直观:给你一段干净的人声/旋律,模型生成一段和声、节奏匹配的伴奏。 但现实里,很多SAG系统都踩在同一个坑上:它们训练时用的“人声输入”,往往…
构建稳健的对话语音大语言模型(Speech LLM)在很大程度上依赖于真实的多语种对话语音数据,然而当前此类数据的稀缺对该领域的发展构成了重大挑战。Interspeech2025多语种对话语音语言模型(MLC-SLM)挑战赛旨在通过发布真实…