Cactus Compute 开源 16.9MB 语音识别模型 Whistle
原创a day ago
Cactus Compute 开源 16.9MB 语音识别模型 Whistle

Cactus Compute 发布开源语音识别模型 Whistle,面向手机、可穿戴设备、机器人、汽车和微控制器等端侧设备。 模型文件仅 16.9MB,直接在 CPU 上运行,并与其端侧工具调用模型 Needle 共用同一套 C++ 推理引…

开源资讯
14 0 0
开源语音数据库发布丨RealMAN
原创2 years ago
开源语音数据库发布丨RealMAN

由于大规模实录多通道音频数据集的匮乏,基于深度学习的多通道语音增强和声源定位非常依赖于房间冲激响应以及多通道扩散噪声的仿真。然而,仿真数据与实录数据的声学特性差异会使得模型在泛化到真实场景中时增强与定位性能下降。为了降低仿真到真实泛化带来的…

66 0 0
开源分享丨超11万音视频说话人识别数据集 VoxBlink2
开源分享丨超11万音视频说话人识别数据集 VoxBlink2

声纹识别是语音领域一个重要的问题,一个鲁棒性强的声纹模型也能够让许多下游任务(语音分离,说话人日志等)受益。然而,声纹识别一个重要的痛点在于说话人人数的多少,这也间接影响着语种,信道的多样性。为了丰富开源语音语料库,为训练声纹大模型提供强有…

49 0 1
开源语音数据库发布丨AISHELL-6
原创2 years ago
开源语音数据库发布丨AISHELL-6

随着人工智能新一轮浪潮兴起,AI语音对话技术日趋成熟,带来越来越好的智能语音交互体验。但全球仍有大量语言障碍的人无法进行正常的沟通交流以及与智能语音产品交互。因此,为了加快技术迭代,快速推动相关项目的研发,希尔贝壳(AISHELL)开源了A…

66 0 0