普强信息 普强于2009年在美国硅谷成立全球研发中心,主要从事智能语音和语言技术的研究,2010年设立中国运营公司,是金融科技创新和智能汽车AI服务提供商,在硅谷和中关村、上海,深圳均建设有技术研发中心,在南京拥有声学实验室,专注于金融大数…
声浪
第四范式 第四范式(北京)技术有限公司成立于2014年底,是人工智能平台与技术服务提供商,公司以“Empower AI Transformation and Advance AI For Everyone”为企业使命,旨在让AI成为驱动社会…
来源丨新智元 前脚有高通提收购,后脚就来了救星?外媒称,风投公司阿波罗全球管理(APO),计划向英特尔投资50亿美金。全公司押注18A制程,最后救命稻草能抓住吗? 英特尔的救星来了? 几天前,高通收购英特尔的消息,成为整个半导体行业今年来掀…
来源丨机器之心 LLaMA-Omni能够接收语音指令,同步生成文本和语音响应,响应延迟低至 226ms,低于 GPT-4o 的平均音频响应延迟 320ms。 论文标题:LLaMA-Omni: Seamless Speech Interact…
论文:U-Style: Cascading U-nets with Multi-level Speaker and Style Modeling for Zero-Shot Voice Cloning 作者:李涛,王智超,朱新发,从坚,田乔…
今天,据《华尔街日报》、CNBC等多家美媒报道,高通已就收购事宜接洽英特尔。这将是近年来规模最大、影响最深远的交易之一。 此前外媒传出高通拟收购英特尔PC业务,但收购整家公司,对于半导体领域来说,倒回几年绝对是耸人听闻的离谱事件。 高通目前…
近年来,多模态模型(Multimodal Models)在深度学习领域取得了显著进展。这类模型能够同时处理和整合来自不同模态(如文本、图像、音频、视频等)的数据,提供更为全面的理解和应用能力。CLIP、Grounding DINO、SAM等…
分享上交大听觉认知与计算声学实验室6篇被SLT 2024收录的论文,论文方向涵盖目标语音提取,声音异常检测,多语种语音识别和语音增强等。 1、DISCRIMINATIVE DIFFUSION MODEL FOR TARGET SPEECH…
