声浪
ICASSP 2026|迈向构建低资源语种的多任务语音理解模型
基于语音编码器、适配器和大语言模型(LLM)构建的语音大语言模型(SLLM),在英语和中文等高资源语言中展现了卓越的多任务理解性能。然而,在泰语等低资源语言中,其有效性显著降低。这种局限性主要源于三个因素: 现有的常用语音编码器(如 Whi…
23 0 0
Soul App发布开源模型SoulX-LiveAct:高鲁棒实时交互数字人,双卡低成本流式生成
近日,Soul App AI团队(Soul AI Lab)发布开源模型SoulX-LiveAct。作为新的实时数字人生成方案,SoulX-LiveAct通过 Neighbor Forcing(同扩散步对齐的自回归条件传播)与 ConvKV…
18 0 0
别再喂给模型“分离人声”了,ANYACCOMP让AI学会只看旋律配伴奏 | ICASSP 2026
Singing Accompaniment Generation(SAG,人声伴奏生成)想做的事很直观:给你一段干净的人声/旋律,模型生成一段和声、节奏匹配的伴奏。 但现实里,很多SAG系统都踩在同一个坑上:它们训练时用的“人声输入”,往往…
13 0 0
开源流式语义状态预测模块:SoulX-Duplug 让半双工系统秒变全双工
近日,Soul App AI 团队(Soul AI Lab)联合上海交通大学 X-LANCE Lab和西北工业大学 ASLP@NPU 团队,正式开源 SoulX-Duplug —— 一款面向 全双工语音对话系统(Full-Duplex Sp…
29 0 0
ICASSP 2026|首届多语种对话语音大语言模型挑战赛:数据集、任务、基线系统和方法总结
构建稳健的对话语音大语言模型(Speech LLM)在很大程度上依赖于真实的多语种对话语音数据,然而当前此类数据的稀缺对该领域的发展构成了重大挑战。Interspeech2025多语种对话语音语言模型(MLC-SLM)挑战赛旨在通过发布真实…
19 0 0
