微软举办的DNS Challenge比赛做语音的朋友们或多或少有所了解,但是这个比赛更多的注重语音增强的效果。然而在实际场景下,很多语音增强的算法要放在低算力的端侧运行,这就对模型的参数量提出了要求。受到DNS Challenge比赛的启发,Intel 提出了N-DNS Challenge 比赛,旨在帮助神经网络和机器学习研究人员创建高质量、低功耗的实时音频去噪系统。其中N表示神经拟态(neuromorphic),是指模拟生物神经系统(特别是人类大脑)的结构和功能的技术和设计理念。该概念广泛应用于计算机科学、人工智能和电子工程领域,旨在开发能够以类似于生物神经元和突触的方式处理信息的系统。仿照人类大脑神经元和突触结构及功能的计算芯片,成为神经拟态芯片(neuromorphic chip),Intel推出的Loihi 2就是一款神经拟态芯片,其架构如下所示。

Intel N-DNS Challenge的整理架构包括encoder、denoiser和decoder三部分。带噪语音输入到encoder,encoder将音频波形转换为适合神经形态去噪器处理的形式。denoiser接收该输入并从信号中去除噪声。最后,decoder将denosier的输出转换为干净的输出音频波形。Intel N-DNS 挑战包括两个赛道:
赛道1(算法):旨在鼓励算法创新,在实现高去噪性能的同时,在作为神经拟态系统实现时保持高效。编码器、解码器和神经形态去噪器都在CPU上运行。
赛道2(Loihi 2):旨在将赛道1中的算法在实际的神经拟态硬件上实现,并展示一个实时去噪系统。编码器和解码器在CPU上运行,denoiser在Loihi 2上运行。
由于赛道2更像是一个工程性的问题,因此本文主要关注赛道1,低开销的高性能降噪网络。首先看下官方release的baseline系统,如下图所示。该结构是一个SDNN结构(sigma-delta ReLU neural network),利用了两种神经形态计算理念:使用sigma-delta神经元进行稀疏消息传递,以及使用轴突延迟进行时间计算。

第一届Intel N-DNS Challenge的冠军方案是基于Fullsubnet,结合门控脉冲神经元、频率划分和多帧深度滤波等技术,这些改进不仅系统的语音增强能力,还显著提升了其计算效率,整体架构如下所示。




整体的损失函数包含几个部分,首先是基于SI-SDR的损失函数,然后计算了复数的频谱和幅度频谱用于频率级别的优化,最后引入了 MetricGAN+ 的判别损失来预测深度噪声抑制平均意见得分(DNSMOS),完整的loss计算公式如下:

最终整体的效果如下表所示,可以看到在参数量较小的情况下也可以达到比较好的效果。

参考文献:
[1]. https://iopscience.iop.org/article/10.1088/2634-4386/ace737/pdf
[2]. https://github.com/haoxiangsnr/spiking-fullsubnet
[3]. https://github.com/IntelLabs/IntelNeuromorphicDNSChallenge
[4]. https://www.intel.com/content/www/us/en/research/neuromorphic-computing-loihi-2-technology-brief.html
