
2022年5月28日,由CCF语音对话与听觉专委会 、中国人工智能产业发展联盟(AIIA)评估组 、腾讯AI Lab、语音之家、北京希尔贝壳科技有限公司共同主办的【语音之家】AI产业沙龙—腾讯AI Lab语音技术进展分享报告在线上成功举办。
下下面是本次沙龙的回顾:
近年来大模型在NLP,CV取得了很大的进展,在语音领域一直未有很多进展。本次报告介绍了基于动态神经网络构建大参数量声学模型,重点阐述了在语音场景下构建动态神经网络端到端语音识别系统的难点和解决方案,介绍该模型如何在增大声学模型参数量条件下保持计算量恒定,另外介绍针对multi-domain 和multi-accent语音识别任务如何设计动态神经网络。最后介绍腾讯AI Lab团队最新提出来的multi-loss,multi-path和multi-level(3M)动态神经网络,3M模型在wenetspeech数据上自监督学习(self-supervised learning)和有监督学习取得了sota结果,3M-ASR模型训练pipeline已在github上开源。
降噪扩散概率模型(DDPM)是近两年开始火热起来的一种非自回归生成模型,特点是能以较为简单的训练方式在许多基准图像生成任务中达到跟GAN差不多甚至是更佳的生成质量。在听感测试中,业内一些基于DDPM的声码器的合成质量已能赶上自回归模型,但生成速度仍要远低于同为非自回归模型的Flow和GAN模型。这是由于DDPM在建模上需要通过迭代几百上千个采样步数来得到有效的降噪,如何快速得到高质量的合成样本仍然是难以解决的瓶颈。本次分享介绍了腾讯AI Lab团队最近的工作BDDM和FastDiff如何通过理论、算法和模型层面解决这些难题。
从语音信号中提取说话人特征是一项基础且有广泛应用的技术。传统的基于神经网络的监督学习算法虽然在很多任务上都取得了非常显著的效果,但是此类技术受限于标签数据的规模和算法的泛化能力,常常有诸如domain mismatch, 无标签数据(服务数据)不能充分被利用,维护和更新模型比较复杂的问题。近一段时间以来,基于自监督的表征学习表现出了克服上述监督算法问题的潜力,得到了很多的重视,在不同的任务上取得有不错的进展。本汇报介绍了腾讯AI Lab团队在声纹自监督表征学习的一些最新研究进展和实际应用。
现有的多通道声源分离系统广泛使用以波束成形为代表的空间滤波方法。在端到端、尤其是序列式(sequential)系统中,此类空间滤波操作一般生成中间输出来辅助次阶段的分离,而不是直接生成目标声源的估计。然而,现有的、广泛使用的空间滤波方法以MVDR等波束成形方法为主,其定义与频域操作特性在端到端系统中并不一定是最优解。本次分享介绍了腾讯AI Lab团队在此类序列式多通道端到端声源分离系统中对于空间滤波设计的尝试;具体地介绍了广义维纳滤波(Generalized Wiener Filter),其无需复数域操作、具有可联合优化的信号变换操作、易于与任何现有模型直接整合、且所需的额外计算量较小。
至此,本期沙龙圆满结束。语音之家将持续为大家带来干货满满的技术分享,敬请关注!
嘉宾PPT获取方法
关注语音之家公众号后,在后台的对话框中回复“腾讯AI Lab”,即可获取五位嘉宾的PPT。

