在人机交互日益智能化的今天,语音对话模型正引领AI领域的新一轮革新。为填补当前语音对话模型综述的空白,浙江大学与微软、阿里巴巴、腾讯团队联合撰写了《WavChat:A Survey of Spoken Dialogue Models》。 该…
声浪
说话人日志任务(Speaker Diarization)是指将音频划分为属于不同说话人的多个段落。其目标是确定音频中有多少个不同的说话人,并且识别出每个说话人在音频中的开始时间和结束时间。 3D-Speaker开源工具针对该功能进行了更新升…
歌尔股份有限公司成立于2001年6月,2008年5月在深交所上市,是全球布局的科技创新型企业,主要从事声光电精密零组件及精密结构件、智能整机、高端装备的研发、制造和销售,目前已在多个领域建立了综合竞争力。 秉持一站式服务为客户创造更大价值的…
华院由美国加州大学伯克利分校数学博士创立,成立于 2002 年,公司专注于数据智能研究。团队以基础算法研究和通用人工智能引擎开发为核心,从计算智能、感知智能,到认知智能,一直在人工智能算法研究领域处于行业前茅,产品与技术广泛应用于金融保险、…
深圳时空壶技术有限公司创立于2016年,致力于通过人工智能与硬件技术的结合,打造让人类跨越语言障碍的AI翻译产品。成立6年间,时空壶针对不同场景下的翻译需求,先后上市W3旗舰翻译耳机、M3旅行翻译耳机,以及Zero随身翻等系列产品。在商务、…
中科智加是中科院自动化所旗下技术产业化公司,致力于用AI技术为行业赋能,为客户提供以语音识别、机器翻译、自然语言理解、知识图谱、图像视频智能处理等技术为核心的应用产品与解决方案,相关服务案例覆盖国内30余地市。 招聘岗位 语音识别工程师 岗…
来源丨新智元 AutoPatent框架能够自动化生成高质量的专利文档,大幅提高专利撰写效率,有望简化专利申请流程,降低成本,促进创新保护。 最近,来自中科院深圳先进院和大连理工大学的研究团队联合开发了一个名为AutoPatent的自动化的多…
论文标题:Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech 论文作者:刘瑞,何树伟,胡一帆,李…
零样本语音转换 (Zero-Shot Voice Conversion) 旨在将源说话者的音色迁移到任意未见过的说话者,同时保留原始的语言内容不变。尽管近年来出现许多令人印象深刻的零样本语音转换技术,并在专业有声读物制作和娱乐短视频等领域有…
