🎯中文口语语言处理国际会议 International Symposium on Chinese Spoken Langauge Processing (ISCSLP) 会议时间:2026年11月14-17日 会议地点:马来西亚·槟城 往…
声浪
音频算法工程师(腾讯会议-天籁实验室) 学历要求:硕士及其以上,工作经验1-3年; 岗位职级:T5-T9 岗位地点:北京 岗位职责: - 负责优化ASR的前端音频算法,包括语音增强,回声消除,说话人日志和语音分离等- 负责追踪业界前沿的语音…
数秒克隆语音早已不新鲜,但能覆盖600+语种的语音克隆 TTS 模型,今天终于来了! 此前,音色克隆 TTS 的多语言支持最多停留在几十种语言,低资源小语种始终难以覆盖。小米 AI 实验室新一代 Kaldi 团队重磅推出 OmniVoice…
多模态情感分析正经历从静态分类向生成式推理(Generative Reasoning)的深刻范式转变。为了理解复杂的社交互动,系统必须能够综合诸如面部微表情和语音韵律等细粒度信号,以解码潜在的因果逻辑。 近年来,虽然通用多模态大语言模型(如…
来源丨paperWeekly 近日,南京大学与腾讯音乐发布开源语音大模型 VITA-Qinyu ,这是业内首款兼具自然对话、高表现力角色扮演与歌唱能力的 开源端到端语音语言模型 (SLM)。目前 VITA-QinYu 的训练代码与模型权重全…
语音修复(Speech Restoration)要解决的事很朴素: 把一段“坏掉的语音”修回“听起来像正常录音”的样子。坏的方式很多,比如: 降噪:背景嘶嘶声、风噪、环境噪 去混响:房间回声太大 去削波/爆音(declipping):录音过…
文章链接:https://arxiv.org/pdf/2508.07375 想象一下,当你和AI 语音助手聊天时,它可以像真人一样自然地倾听、适时地“嗯、啊”附和,甚至在你打断它时迅速反应。这就是全双工语音大模型(FD-SLMs)的魅力所在…
来源丨AIGC Studio Voxtral TTS是首个在多语言语音生成方面拥有顶尖性能的文本转语音模型。基于大型语音数据集进行训练,专为全球应用而构建。它支持 9 种语言,性能一流:英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语…
