声乐情感传感器 | 告别误会,比你更懂你
原创6 years ago
声乐情感传感器 | 告别误会,比你更懂你

导语:可以识别中立、快乐、悲伤、愤怒、恐惧、厌恶和惊讶声音情感传感器,并且准确率在83%以上,还可以根据情绪播放相应的音乐。 关键词:音乐、音频提取、构建模型、情感传感器 人跟人面对面的交流很可能都没有办法愉快地理解彼此,如果把对话放到电话…

11 0 0
人工智能的产品和工程视角
转载6 years ago
人工智能的产品和工程视角

导语:王咏刚老师从人工智能的产品研发和系统工程角度,帮学生梳理一下,如何将一个前沿人工智能技术变成一个具有商业价值的产品或解决方案。这方面的方法论、知识体系,学生在学校期间并不能经常接触到。 每年暑期,创新工场举办的DeeCamp大学生人工…

10 0 0
书单 | 语音研究进阶指南
转载6 years ago
书单 | 语音研究进阶指南

作为人类最自然的交流方式,“听”和“说”包括了人类大脑皮层从听觉感知到语言处理和理解,再到声音生成这个“神奇”的认知过程。语音领域的探索和研究已经持续了长达150多年,从最初的电话通信到语音识别、语音合成、说话人识别等扩展应用, 研究内容涵…

12 0 0
除了智能音箱,AI语音还可以用在哪里?
转载6 years ago
除了智能音箱,AI语音还可以用在哪里?

说起来可笑,每次我找不到眼镜的时候,我都想拿出手机,给我的眼镜“打个电话”,好听声辨位。 不知道有没有人,开发这种功能? 不得不承认,在某些场景下,声音具有很强的穿透力。也因此,智能音箱会被开发出来,一声“小爱同学”省了我们不少力气。 在智…

55 0 0
多语言语音合成和跨语言语音克隆
原创6 years ago
多语言语音合成和跨语言语音克隆

场景描述:语音合成解决的主要问题就是如何将文字信息转化为可听的声音信息,涉及语言和语音两部分。TTS技术(又称文语转换技术)隶属于语音合成,它是将计算机自己产生的、或外部输入的文字信息转变为可以听得懂的、流利的汉语口语输出的技术。 关键词:…

14 0 0
语音交互的垃圾分类图签
原创6 years ago
语音交互的垃圾分类图签

垃圾,词典里给出的解释是:“废弃无用或肮脏破烂之物”。其实在语音交互这个领域也是有很多“垃圾”需要过滤或者回收再利用,今天就让我们看看语音交互的垃圾分类图签。 本底噪音(ground noise)和背景噪音(background noise…

8 0 0
MASR - 中文语音识别,提供预训练模型,高识别率
转载6 years ago
MASR - 中文语音识别,提供预训练模型,高识别率

MASR 中文语音识别 MASR是一个基于端到端的深度神经网络的开箱即用的中文普通话语音识别工具。 最新更新:使用声学嵌入查找音近字 MASR的特点是: 开箱即用 只需要不到5分钟,你就可以运行本项目并完成第一次中文语音识别 使用与训练分离…

15 0 0
XLNet:运行机制及和Bert的异同比较
转载6 years ago
XLNet:运行机制及和Bert的异同比较

XLNet和Bert比,有什么异同?有什么模型方面的改进?在哪些场景下特别有效?原因又是什么?本文通过论文思想解读及实验结果分析,试图回答上述问题。 首先,XLNet引入了自回归语言模型以及自编码语言模型的提法,这个思维框架我觉得挺好的,可…

8 0 0
逆天语言模型GPT-2最新开源
转载6 years ago
逆天语言模型GPT-2最新开源

逆天的语言模型GPT-2又有最新开源进展了! GPT-2,这个造假新闻编故事以假乱真,能完成阅读理解、常识推理、文字预测、文章总结等多种任务的AI模型,从诞生开始就引起大量关注。 但因一开始只放出了117M的小型预训练模型,OpenAI还被…

7 0 0