导读:声学是一门具有广泛应用性的学科,涉及到人类生产、生活及社会活动的各个方面;同时声学又是一门具有很强交叉渗透性的学科,与各种新学科、新技术相互作用,相互促进,不断地吸收、应用和发展新的思想,增强了声学的生命力、竞争力和学术与艺术魅力。本…
声浪
对于语音增强任务,干扰信号通常被认为是加性噪声。对于室内声学场景,由于声波遇到障碍时会反射和吸收,因此会导致原始语音产生多份衰减和延迟的加和,从而产生混响现象。对于语音增强任务,目标即为去除噪声干扰,而对于去混任务,其目标为消除晚期混响(L…
歌声合成( singing voice synthesis )是根据乐谱来生成歌声的技术,是创造能说会唱的虚拟人中的重要一环。例如,近期网易雷火音频与网易伏羲推出的拜年歌曲一键创作工具,取得了用户的好评,歌声合成是其核心基础服务。与语音合成…
《谈谈音频信号处理中CNN的因果性》今天补下后续。 3.2. 多层卷积网络 本节考虑包含了两层二维卷积的网络,且每层二维卷积在时间维度上的参数均为:kernel=3, stride=1。类似于图1,现给出相应的两层CNN网络的因果性示例图,…
尊敬的开发者: 您好! 近期,上海白玉兰开源开放研究院携手海内外知名企业、高校、共同发起了《中国AI开发者调研》问卷,此次问卷将通过匿名的方式收集答案。我们将基于问卷调研结果及桌面研究成果形成报告和白皮书,预期于2022年世界人工智能大会期…
手滑点错按钮,会有什么后果呢?GitHub大佬亲自用自身经历现身说法。 至于影响,小到订不到机票车票、大到丢饭辙丢老婆,都是有可能的。 这种失误在开源程序界的明星那里,会有什么影响呢? 下文就会告诉你一个典型的例子。
01 前述 音频信号处理已经进入了神经网络时代,而CNN由于其强大的建模能力,已被广泛地应用在了各种音频信号处理网络中,像最近几届DNS Challenge的冠军所提出的网络均大量使用了CNN。与图像处理不同,音频信号处理在大多数应用场景下…
中国人民大学高瓴人工智能学院 GeWu 实验室提出了一种动态视音场景下的空间 - 时序问答模型,让 AI 能像人一样观看和聆听乐器演奏,并对给定的视音问题做出跨模态时空推理。论文已被 CVPR2022 接收并选为 Oral Presenta…
语音转换(Voice Conversion, VC)旨在保留语言内容的同时,将源说话人语音转换成目标说话人的语音。语音转换在个性化语音合成、自动化影视配音、实时通信与娱乐等方面具有重要应用。随着深度学习技术的引入,语音转换技术取得了巨大的飞…
