声浪
ICASSP 2026|通义实验室13篇录用论文分享
通义实验室语音团队提出一种基于心理学 PAD 模型的情感语音合成框架,支持用户在愉悦度(Pleasure)、唤醒度(Arousal)和支配度(Dominance)上灵活控制情感表达。无需依赖固定情感标签,就能自由组合出“温柔但坚定”“兴奋而…
32 0 0
ICASSP 2026|上交大跨媒体语言智能实验室12篇录用论文分享(二)
近日,ICASSP 2026会议发出了审稿结果通知,上海交通大学跨媒体语言智能实验室共12篇论文被会议接收。我们将用两期推送介绍接收论文,本文是第二期。 07、Task Vector in TTS: Toward Emotionally E…
18 0 0
ICASSP 2026|上交大跨媒体语言智能实验室12篇录用论文分享(一)
近日,ICASSP 2026会议发出了审稿结果通知,上海交通大学跨媒体语言智能实验室共12篇论文被会议接收。我们将用两期推送介绍接收论文,本文是第一期。 01、Measuring Prosody Diversity inZero-Shot…
18 0 0
ICLR2026 - FlexiVoice:零样本音色克隆 + 自然语言风格指令控制的统一语音生成框架来了
「 现存问题 」 用户在进行指令语音合成时,常常希望用自然语言指令控制情绪、语气、语速等风格,同时又希望用一段参考音频实现零样本音色克隆。但现实中参考音频往往会把自身的情绪与韵律一起“带进来”,文本也可能自带隐含风格,导致模型忽略指令,出现…
19 0 0
WenetSpeech-Wu:“史上最大”的多维度标注吴语语音数据集来啦!
作为汉语分支中极具价值的重要方言,吴语承载着约 1 亿使用者的沟通需求与文化记忆,不仅保留了古汉语全浊辅音系统,更有着复杂的连读变调特征。针对吴语这一类低资源方言的语音处理,并开发稳健的语音技术仍然是一项根本性的挑战。尽管吴语在语言学上具有…
21 0 0
