文章来源于音频语音与语言处理研究组,作者俞帆 说话人相关语音识别(Speaker-Attributed Automatic Speech Recognition,SA-ASR)是多方会议转录的主要目的,旨在解决“谁说了什么”这个问题。与多说…
声浪
日前,被誉为数据挖掘领域历史最悠久、规模最大的国际顶级学术会议ACM SIGKDD(国际数据挖掘与知识发现大会,KDD)正于美国华盛顿召开。会上,火山语音多篇论文被KDD 2022 Research track接收并发表,同时创新性提出基于…
文章来源于音频语音与语言处理研究组,作者邵琪杰 人类的语音中除了包含语言信息外,还蕴含着丰富的副语言信息,包括情感、口音等。口音识别(Accent Recognition, AR)旨在通过说话人的语音识别其口音的任务。此外,对于带口音的语音…
今天跟大家分享一篇语音相关的论文合集:cs.SD语音6篇,eess.AS音频处理6篇。 cs.SD语音 【1】 Extract fundamental frequency based on CNN combined with PYIN 标题…
今天跟大家分享一篇语音相关的论文合集:cs.SD语音8篇,eess.AS音频处理8篇。 cs.SD语音 【1】 LCSM: A Lightweight Complex Spectral Mapping Framework for Stere…
OPPO 小布智能中心 小布智能中心隶属于OPPO数智工程系统,主要负责语音语义、数字人等多模态人机交互的研发和产品化,产品包括小布助手APP、小布数字人、小布客服、小布机器人等,中心下设智能交互部、认知计算部、平台产品部和多模态学习组,是…
文章来源于音频语音与语言处理研究组,作者魏坤 语音识别(ASR)任务被广泛应用在车载、家居、会议等场景。对话语音识别(Conversational ASR)是ASR领域的一项重要工作,旨在将自然产生的对话语音转录成文本[1],这种场景在语音…
普强信息 普强于2009年在美国硅谷成立全球研发中心,主要从事智能语音和语言技术的研究,2010年设立中国运营公司,是金融科技创新和智能汽车AI服务提供商,在硅谷和中关村、上海,深圳均建设有技术研发中心,在南京拥有声学实验室,专注于金融大数…
今天跟大家分享一篇语音相关的论文合集:cs.SD语音10篇,eess.AS音频处理14篇。 cs.SD语音 【1】 Towards Cross-speaker Reading Style Transfer on Audiobook Data…
云知声 云知声专注于物联网人工智能服务,拥有完全自主知识产权、世界顶尖的智能语音识别和相关AI技术。公司成立于2012年6月29日,总部位于北京,在上海、深圳均设有分公司。 云知声利用机器学习平台,在语音技术、语言技术、知识计算、大数据分析…
