Data2vec是一种优秀的语音自监督学习(SSL)方法,在语音识别(ASR)等下有任务上表现卓越。Data2vec采用教师-学生架构,其教师分支的浅层可以捕捉说话人和语种信息,中层编码音素和单词特征,而深层负责重构。在多语种(multil…
声浪
来源丨新智元 OpenAI真的要开源了!奥特曼官宣,即将开源自GPT-2以来的首款推理模型,可在消费级硬件上运行。同时,OpenAI又拿到了最高400亿单轮融资,估值直冲3000亿。 OpenAI终于要Open AI了! 一大早,奥特曼郑重…
本期将为大家介绍上海交通大学听觉认知与计算声学实验室被ICASSP2025录用的7篇论文,研究领域涵盖说话人识别、语音增强、语音合成、语音分离等多个方向。 01、Flow-TSVAD:Target-Speaker Voice Activit…
沃丰科技是中国人工智能与营销服务解决方案提供商,旗下拥有Udesk、GaussMind、ServiceGo、微丰四大产品线,凭借行业居前的AI场景落地能力,为企业提供覆盖客户全生命周期的智能营销与服务解决方案,得到众多世界五百强、中国五百强…
荔枝集团是一家专注于声音领域的上市公司,基于音频技术为用户提供产品和服务。公司在语音识别和音频智能方面取得了显著成果,开发出多款基于声音的社交软件,为用户提供便捷自然的交流体验。荔枝集团通过提升语音识别技术的准确性和效率,满足用户多样化需求…
近期语言模型(LM)在自然语言处理和计算机视觉领域蓬勃发展,可以生成高质量的文本或图像。相比之下,当前的语音生成模型仍然在语音质量和任务多样性之间挣扎。本文提出了Vec-Tok Speech,一个适用于众多下游任务的的可扩展框架,生成富于表…
近年来,大模型(LLMs)如 GPT 系列、Claude 等展现出的惊人多语言能力,常常让人惊叹。它们不仅能理解和生成多种语言的文本,甚至能在不同语言之间无缝切换,完成翻译、问答、写作等复杂任务。这不禁引人发问:这种强大的多语言能力究竟从何…
拾音,以丰富客户的感知体验技术为使命,致力于提供的新技术及声学领域的服务、方案和产品。我们是一家高新技术企业,是国内拥有仿真分析、试验测试和软件算法能力最为完备的供应商之一。真诚用心的服务和前瞻性的科技专长,使拾音成为汽车性能开发、实验室解…
