声浪
Speech Com | Whisper-SV:将Whisper自适应于低数据资源的说话人验证
Whisper[1] 是一种在海量语音数据上训练的多任务、多语言语音基座模型,已在语音识别、翻译和语种识别等任务上表现出卓越性能。然而,其在说话人验证(SV)任务中的适用性尚未被探索,特别是在带说话人标签的语音数据有限的低数据资源场景。 近…
9 0 0
开源发布CUSIDE-Array: 清华CAT工具包支持流式多通道端到端语音识别
论文地址:https://arxiv.org/abs/2407.09807 开源代码及模型:https://github.com/thu-spmi/CAT/blob/master/docs/cuside-array.md 摘&
10 0 0
论文导读丨INTERSPEECH 2024专题(三)
为促进最新研究成果的传播与交流,CCF语音对话与听觉专委在专委会微信公众号启动论文导读栏目,定期分享最新语音、对话与听觉相关研究方向论文。本期是INTERSPEECH 2024专题第三部分,共遴选了8篇论文,覆盖语音合成、音色转换、情感识别…
7 0 0
Interspeech2024丨基于离散语音单元的流式解码器语音识别
在当今数字化时代,大模型以其强大的数据处理和复杂问题解析能力,正深刻改变着我们的现实生活。以GPT4o等为例,大模型已经具备了令人惊叹的全双工语音交互能力,其中实时交互是语音对话的关键。因此,如何在保持大模型强大能力的同时,提升其实时性能,…
11 0 0
中科智加 | 招聘语音识别工程师(北京)
中科智加 中科智加是中科院自动化所旗下技术产业化公司,致力于用AI技术为行业赋能,为客户提供以语音识别、机器翻译、自然语言理解、知识图谱、图像视频智能处理等技术为核心的应用产品与解决方案,相关服务案例覆盖国内30余地市。 招聘岗位 语音识别…
28 0 0
