得益于深度学习技术的推动,计算机视觉、自然语言处理和智能语音等技术的各项指标都得到了极大的提高,而且,一个共同的趋势是超大规模预训练模型的涌现,并不断刷新各个技术竞赛榜单。


2022年4月21日,语音之家公开课邀请到南开大学计算机学院教授、天津市媒体计算技术工程研究中心(TMCC) 副主任—秦勇教授分享了《音频模式识别》。公开课简要介绍了音频模式识别这一热点方向,包括相关数据资源和应用场景。同时介绍国内外在相关领域研究的最前沿进展,最后重点介绍南开大学HLT实验室在音乐分类领域的探索和观点。


下面我们来一起回顾技术分享中的精彩细节。


秦 勇

南开大学计算机学院 教授

天津市媒体计算技术工程研究中心(TMCC) 副主任

目前来说,特定任务的“窄”人工智能获得了巨大进步,“窄”意味着每一个技术相对来说是一个单一任务,单一模态,或者单一领域而言,相对是比较封闭的一个环境。随着深度学习的发展,机器翻译、语音识别、自然语言处理以及计算机视觉等都取得了非常大的进步。对语音而言,我们还是希望它能够向计算机视觉领域“ImageNet moment”的方向努力。就语音识别来说,还是有很多挑战,如会议场景的多人说话、远场、噪声混响、口音方言等等。


音频模式识别之所以被关注,主要原因在于音频模式识别领域有很多的声学信号,有非常丰富的信息,通过最近的论文也可以发现这是一个比较热的子领域,其应用场景丰富,可以用在国家安全、军事、车联网、医疗等场景,还有一大块就是音乐推荐方面。相关的研究领域包括语音识别、说话人识别、振动监控、癫痫预测、智能前端唤醒词服务等。其相关数据集有很多,如ESC-50、Urban Sound and Urban Sound8K、Ravdess、MSoS、AudioSet by Google、DCASE、MagnaTagATune、Million Song Dataset、MTG-Jamendo Dataset、GTZAN等。


关于技术内容,主要讲解了音乐流派识别的问题定义,即给定一段音频,输出它的流派是什么,对应的流派有Blues、Classical、Country等10种。语音模式识别通常的做法是将时域信号转成频域,因为频域更方便观测其区分性特征,如fbank特征。音乐流派分类主要有两种方法,一种是长30s的片段切分为2s左右的小片段,将这些小片段输入到网络中去学习流派的相关性,考虑到数据量问题,一般做一些数据增强处理工作, Decoding部分采取Majority voting with n-best output。另一种是直接将30s的信号输入到网络中,可以学到一些segments之间的依赖关系信息。


数据增广通常的技术主要有两种做法:第一种Spectrum Augment,如TimeMasking和FrequencMasking;第二种是从计算机视觉领域引过来的Mixup。相关的技术挑战主要有四点,包括小数据、数据多样性、复杂性、主观性。


关于如何提高分类的效果,主要讲解了五类方法:

  1. Rethink CNN使用不同的FFT window_size,提取不同特征,将其叠加,类似于3D tensor,再选取图像领域的一个pretrain模型,如3*Inception,即可以达到一个还不错的效果。

  2. Multi-temporal 直接使用时域信号,选取不同的CNN1D kernel 大小代表不同频域分辨率特征,形成多个Channel,叠加形成不同的tensor,将tensor送到标准的如VGG里。

  3. CRNN 参考Deep Speech 2架构,频域提取特征之后,做一个CNN,后面跟一个GRU,包含它的local和global特征再去做分类。

  4. Multi-channels 参考的PANNs,将Multi-temporal与类似CRNN两个系统独立做信息的抽取,将final layer vector做一个结合来分类。

  5. Transformer 放弃CNN,频谱提取不同的patch形成序列,将序列加上 projection encoding送到Transformer中,最终抽取token信息做分类。


将音乐流派分类作为音频模式识别问题解决的时候,从应用和数据集不同层面上有不同的问题需要解决,需要构建一个比较复杂的系统,且数据集需要更详细更全面。对于未来主要的计划,则分为两个方向:其一是Build a strong demo on MIR;其二是工业相关领域,如工业设备异常检测、癫痫等疾病监测,以及音乐推荐等。


至此,本期公开课圆满结束。语音之家将持续为大家带来干货满满的技术分享,敬请关注!


嘉宾PPT获取方法 

关注语音之家公众号后,在后台的对话框中回复“腾讯AI Lab”,即可获取五位嘉宾的PPT。