声浪
标贝科技 标贝(北京)科技有限公司(简称“标贝科技”)是一家专注智能语音交互和AI数据服务的人工智能公司,公司拥有的知识产权超过120余项,个人知识产权达80余项。标贝科技以“语音连接场景、数据服务技术”为理念,打造有温度有情感的声音体验,…
华控智加科技 北京华控智加科技有限公司由清华大学作为控股股东主导成立,是清华大学打造的人工智能产业化平台。首席科学家刘加教授是清华大学电子系知名人工智能学者,公安部国家重点研发计划专家组组长、全国刑事技术标准化委员会智能语音技术组委员,由其…
黑芝麻智能 黑芝麻智能科技(Black Sesame Technologies)致力于成为全球嵌入式智能驾驶计算平台的共创者,用“芯”赋能未来出行。公司于2016年设立,在硅谷、新加坡、上海,全球员工近700人,创始团队大多毕业于清华大学,…
百融云创是一家领先的人工智能(AI)技术服务公司。应用大语言模型、自然语言处理(NLP)、深度机器学习、隐私计算和云计算等科技,通过模型即服务(MaaS)及业务即服务(BaaS)的服务模式提供服务。百融云创的MaaS服务利用决策式AI,通过…
为促进最新研究成果的传播与交流,CCF语音对话与听觉专委在专委会微信公众号启动论文导读栏目,定期分享最新语音、对话与听觉相关研究方向论文。本期分享一篇发表在INTERSPEECH2024上的构音障碍语音识别方面的文章。 论文标题:Perce…
clone-voice是一款免费开源的声音克隆工具,它凭借先进的人工智能技术,能够分析和模拟人类声音的特征,从而实现高质量的声音克隆. 只需提供一段简短的音频样本,它就可以根据该样本生成与原始声音极其相似的克隆声音,并且支持多种语言,目前包…
Moonshine是一款专为资源受限设备优化的开源语音识别模型,能够提供快速且准确的实时语音转文本服务. 它在多个标准数据集上展现出比OpenAI的Whisper模型更低的词错误率,并且计算需求与音频长度成比例,这使得其在处理短音频时速度显…
NVIDIA最近推出了一款革命性的生成式AI模型——Fugatto(Foundational Generative Audio Transformer Opus 1),它能够通过文本和音频输入创造任何组合的音乐、人声和声音。 这款由一群生成…
