作为声学、语音和信号处理相关研究领域的旗舰国际会议,ICASSP2022将采用全新的会议形式——5月7-13日全线上虚拟会议,5月22-27日以新加坡主会场、中国深圳分会场的线下线上混合形式进行。ICASSP为IEEE信号处理协会(SPS)主办的核心会议,今年是第47届盛会,参会人数规模预计在2000人以上,备受学术界和工业界关注。
会议官方网址:
https://2022.ieeeicassp.org/
西工大音频语音与语言处理研究组(ASLP@NPU)本届会议将携合作伙伴宣读论文10篇,涉及智能语音处理领域的众多研究方向,包括语音识别、语音增强、回声消除、语音合成、语音转换等,同时也包括介绍上万小时多领域中文开源语音识别数据WenetSpeech的论文。此外在本届会议上,ASLP实验室携合作伙伴获得微软主办的深度噪声抑制国际评测(DNS Challenge)个性化语音增强赛道(Track 2)冠军以及声学回声消除国际评测(AEC Challenge)第三名的优异成绩。下面简要介绍本次录用的各篇论文。

01 Multi-Task Deep Residual Echo Suppression with Echo-aware Loss

(扫码看论文)
相关论文推介
是民,公众号:语音之家 声学回声消除:基于多任务学习的残余回声抑制及回声感知代价函数
02 One-shot Voice Conversion for Style Transfer Based on Speaker Adaptation

(扫码看论文)
作者列表:Yongmao Zhang, Jian Cong, Heyang Xue, Lei Xie, Pengcheng Zhu, Mengxiao Bi
合作单位:网易
论文摘要:本文提出了一个完整的端到端高质量歌唱声音合成(SVS)系统—VISinger,它可以直接从歌词和乐谱中生成音频波形形式的歌唱。我们的方法受到VITS的启发,采用基于VAE的后验编码器,并辅以基于归一化流的先验编码器和对抗解码器,实现完整的端到端音频生成。VISinger遵循了VITS的主要架构,但根据歌唱的特点进行了相应改造。首先,我们引入长度调节器和帧级先验网络来获得帧级声学特征的均值和方差,而不是使用音素级声学特征的均值和方差,对歌唱中丰富的声学变化进行建模。其次,我们引入F0预测器来引导帧级先验网络,使歌唱效果更加稳定。最后,为了保证歌唱的节奏符合乐谱标注,我们对音素的时长预测器进行了调整,预测音素与音符的持续时间比,使用乐谱中的Note时长作为先验信息来辅助时长的预测。在一个专业的普通话歌唱语料库上进行的实验表明,VISinger优于FastSpeech+Neural-Vocoder两阶段方案和原始VITS;消融实验证实了不同贡献的有效性。
论文网址:https://arxiv.org/abs/2110.08813v2

(扫码看论文)
作者列表:Yihui Fu, Yun Liu, Jingdong Li, Dawei Luo, Shubo Lv, Yukai Jv, Lei Xie
合作单位:搜狗(现腾讯PCG)
论文摘要:复频谱和幅度谱是语音增强和去混响的两个最主要特征。传统方法一般是将这两个特征分开处理,忽略了它们之间的内部潜在关系。本文提出了一种用于同时进行多通道语音增强和去混的基于Unet的复数及实数的带洞卷积Conformer模型—Uformer。该方案利用时间注意力(Time attention,TA)和带洞卷积(Dilated convolution,DC)来学习局部和全局上下文信息;同时使用频率注意力(FA)来建模频率信息,通过混合Encoder和Decoder算法来同时建模复数谱和幅度谱,以促进两个特征之间的信息交互,使用Encoder-Decoder注意机制来加强Encoder和Decoder间的信息交互。实验结果表明,Uformer在Interspeech 2021 DNS竞赛测试集上得到了3.60的DNSMOS,优于竞赛中的最佳模型的效果,同时模型消融实验也证明了各个模块和贡献的有效性。
论文网址:https://arxiv.org/abs/2111.06015

(扫码看论文)
作者列表:Yukai Ju, Wei Rao, Xiaopeng Yan, Yihui Fu, Shubo Lv, Luyao Cheng, Yannan Wang, Lei Xie, Shidong Shang
合作单位:腾讯
论文摘要:本文介绍了腾讯天籁实验室– 西北工业大学联队提交至 ICASSP 2022 深度噪声抑制(DNS)挑战赛的个性化语音增强 (TEA-PSE) 系统,该系统采用两阶段策略,发挥各个阶段的优势。提交方案在竞赛盲测集上达到3.97整体音频质量 (OVRL) MOS 和 0.69 词准确度(WAcc) ,其OVRL MOS表现优于基线 0.57 ,在个性化语音增强赛道上排名第一。
作者列表:Shubo Lv, Yihui Fu, Mengtao Xing, Jiayao Sun, Lei Xie, Jun Huang, Yannan wang, Tao Yu
合作单位:腾讯
论文摘要:在语音增强中,复数神经网络由于其在处理复数谱方面的有效性而显示出良好的性能。大多数的语音增强方法主要集中在采样率为16KHz的宽带信号上。然而由于高频部分难以建模,对超宽带(例如,32KHz)甚至全频段(48KHz)降噪具有更高的挑战性。本文将实验室先前提出的深度复数卷积递归神经网络(DCCRN)扩展为超宽带版本——S-DCCRN,对 32KHz 采样率的语音进行降噪。我们首先采用了一个级联的子带和全带处理模块,它由两个小尺寸 DCCRN 组成,一个处理子带信号,一个处理全带信号,旨在从局部和全局频带两个维度上处理信息。此外,和传统方案中采用 STFT 特征作为输入的方式不同,本文方案以端到端方式训练复数特征编码器来细化不同频带的信息。而后使用复数特征解码器将特征恢复到频域。最后采用可学习的频谱压缩方法来调整不同频带的能量,有利于神经网络的学习。本文提出的S-DCCRN模型在效果上超越了 PercepNet等多个主流模型,并在语音质量和可懂度方面达到了最优效果。消融研究也证明了不同贡献的有效性。
论文网址:https://arxiv.org/abs/2111.08387

(扫码看论文)
作者列表:Binbin Zhang, Hang Lv, Pengcheng Guo, Qijie Shao, Chao Yang, Lei Xie, Xin Xu, Hui Bu, Xiaoyu Chen, Chenchen Zeng, Di Wu, Zhendong Peng
合作单位:出门问问,希尔贝壳
论文摘要:本文介绍了一个多领域中文开源语料库—WenetSpeech语料库。其包含10000+小时的高质量有标注语音数据,2400+小时弱标注语音数据和大约10000小时无标签语音数据,总计22400+小时。我们从YouTube和Podcast(播客平台)收集数据,其包含多种多样的说话方式、情景、领域、主题和噪声条件等。对于YouTube数据,使用光学字符识别(OCR)方法对视频中的字幕进行识别,从而生成相应的音频/文本切分候选;对于Podcast数据,通过一个高质量的语音识别系统生成相应的音频/文本切分候选。而后,我们提出了一种新颖的端到端(end-to-end)标注错误检测方法,从而进一步矫正和过滤候选。与此同时,我们为WenetSpeech提供了3个人工精标的高质量测试集:Dev,用于训练时交叉验证;Test_Net,来源于互联网,是一个匹配的测试集;Test_Meeting,来源于真实会议场景的录制,是一个更具挑战性的非匹配测试集。我们为WenetSpeech语料库提供了Kaldi、ESPnet和WeNet三种主流语音识别工具包训练的基线系统,并展示了其在WenetSpeech的3个测试集上的识别性能。据我们所知,WenetSpeech是目前最大的有标注的开源中文语音识别语料库,其对于产业级大数据规模的语音识别研究大有裨益。
论文网址:https://arxiv.org/abs/2110.03370

(扫码看论文)
相关推介
东方彬彬,公众号:语音之家 全球最大多领域中文语音识别数据集 WenetSpeech 正式发布并开放下载
作者列表:Kun Wei, Yike Zhang, Sining Sun, Lei Xie, Long Ma
合作单位:腾讯
论文摘要:对话语音识别是语音识别中的一项关键任务。与常规句级ASR不同,对话ASR可以自然地利用会话的特点,如角色偏好和话题连贯性等。本文在当前流行的端到端神经网络框架下,提出了一种学习对话级特征的对话ASR模型。提出的模型有以下两个特点。首先,将潜在变分模块(LVM)连接到基于conformer的编码器-解码器ASR框架中,学习对话中的角色偏好和话题一致性特性。其次,使用特定的主题模型将解码器的输出偏置为待预测主题中的词汇。在两个中文普通话对话数据集上的测试结果表明,该模型的相对字符错误率(CER)最大可达12%降低。
论文网址:https://arxiv.org/abs/2202.07855v2

(扫码看论文)
作者列表:Fan Yu, Shiliang Zhang, Yihui Fu, Lei Xie, Siqi Zheng, Zhihao Du, Weilong Huang, Pengcheng Guo, Zhijie Yan, Bin Ma, Xin Xu, Hui Bu
论文摘要:随着语音识别、说话人日志等语音处理技术的快速发展,大大激发了语音技术的落地应用。会议场景是语音技术发展中最有价值同时也是最具挑战性的场景之一,其中说话人日志和多说话人语音识别这两个任务受到了业界广泛关注。但是由于一直缺乏大型公开的会议数据,严重阻碍了该领域的进步和发展。因此,我们提供了 AliMeeting 语料库,其中包含 120 小时录制的中文普通话会议数据,包括 8 通道麦克风阵列采集的远场数据以及耳机麦克风采集的近场数据。每个会议会话包含2-4 名不同的发言者在不同大小的房间中录制,每场会议的说话人重叠率都不相同。基于这个发布的数据集,我们在 ICASSP 2022上发起了多通道多方会议转录挑战赛(M2MeT),包括说话人日志和多说话人语音识别两条赛道,旨在为会议转录任务提供一个通用的测试平台,并促进该领域的研究发展。在本文中,我们详细介绍了 AliMeeting数据集、挑战赛规则、评估方法和基线系统。
论文网址:https://arxiv.org/abs/2110.07393

(扫码看论文)
作者列表:Fan Yu, Shiliang Zhang, Pengcheng Guo, Yihui Fu, Zhihao Du, Siqi Zheng, Weilong Huang, Lei Xie, Zheng-Hua Tan, DeLiang Wang, Yanmin Qian, Kong Aik Lee, Zhijie Yan, Bin Ma, Xin Xu, Hui Bu
合作单位:希尔贝壳、丹麦奥尔堡大学、美国俄亥俄州立大学、新加坡资讯通信研究院、上海交通大学等
论文摘要:ICASSP 2022 多通道多方会议转录挑战赛 (M2MeT) 专注于会议场景,该场景是语音技术中最有价值也是最具挑战性的场景之一。M2MeT 挑战赛特别设置了两个赛道,说话人日志(赛道 1)和多说话人语音识别(赛道 2)。在本次挑战赛中,我们发布了 120 小时真实录制的普通话会议语音数据并带有精确的人工注释,包括通过 8 通道麦克风阵列采集的远场数据以及耳机麦克风采集的近场数据。本文在简要描述了发布的数据集、赛道的设置、基线基础上,重点总结了参赛队伍的提交结果以及使用的主要技术。
论文网址:https://arxiv.org/abs/2202.03647

