ICASSP 2023 论文预讲会是由CCF语音对话与听觉专委会、语音之家主办,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。活动将邀请 ICASSP 2023 录用论文的作者进行报告交流。

ICASSP 2023 论文预讲会邀请到西北工业大学音频语音与语言处理研究组(NPU-ASLP)在5月23日、5月24日分别做两期专场分享,本文介绍第一场相关内容,欢迎大家预约观看。


实验室概况

西北工业大学音频语音与语言处理研究组(ASLP@NPU)依托于空天地海一体化大数据应用技术国家工程实验室和陕西省语音与图像信息处理重点实验室。研究组成立于1995年,经过近20多年的快速发展,已形成了人机语音交互、语音与音频信号处理、音视频多模态信息处理、多媒体内容分析、机器学习等主要研究方向。研究组与比利时、英国、美国、新加坡等多所高校与研究机构建立了长期合作关系,同时,实验室与工业界联系密切,目前已经与华为、腾讯、微软、阿里巴巴、小米、网易、字节跳动、美团、爱奇艺、网易、出门问问等行业头部企业与初创公司开展了广泛深入的科研合作,众多研究成果已经在实际产品中获得应用,获得华为技术合作奖、美团科研合作奖等。实验室在领域顶级期刊和会议上发表学术论文300余篇,在多个重要会议上获得多篇优秀论文奖,参加多个国际国内技术评测获得第一名,取得了丰硕的研究成果。实验室入选2019《互联网周刊》十大顶尖高校人工智能实验室。

实验室主页:www.npu-aslp.org


下面是预讲会的回顾:

魏坤

分享主题:利用语音和双语文本联合预训练的语音到语音翻译模型

摘要:与级联语音到语音翻译任务(S2ST)相比,端到端语音到语音翻译具有诸多优点,是当前的热点研究课题。然而,端到端S2ST存在数据稀缺问题,因为从源语言语音到目标语言语音的语料库非常稀少。为了解决这个问题,本文中提出了一个Speech2S模型,该模型使用未配对语音和双语文本数据进行联合预训练,用于端到端语音到语音翻译任务。通过有效利用双语的翻译文本数据,Speech2S能够建模从源语言到目标语言的跨语言语音的翻译。我们在Europarl-ST和VoxPopuli数据集上验证了所提出的Speech2S模型的性能。实验结果表明,与仅使用编码器预训练的语音到语音翻译模型相比,Speech2S获得了约5个BLEU分数的提升,并实现了与现有最先进模型相比具有竞争力甚至更好的性能。


张丽
分享主题:基于距离的权重转移,用于从近场到远场的说话人验证模型的微调
摘要:带标签的远场语音的稀缺是训练高性能远场说话人验证系统的制约性因素,在大规模近场语音预训练的模型上再使用远场语音数据微调 (fine-tuning)的效果远远优于在远场数据上从头开始训练的效果。然而,常规微调方法具有灾难性遗忘和过拟合问题。本文提出了一种权重迁移正则化(WTR)损失来约束大规模近场语音预训练模型与少量远场语音微调模型之间的权重距离。在微调过程WTR正则化损失充分利用大规模近场语音训练模型的判别能力来避免灾难性遗忘。同时,我们使用 PAC-Bayes 泛化理论来分析具有 WTR 损失的微调模型的泛化界。结果表明,WTR 正则化项使微调模型具有更严格的泛化上限,从而使微调模型更具有泛化性。此外,我们探索了三种用于权重迁移的范数距离,即 L1 范数距离、L2 范数距离和最大范数距离。最后,我们评估了 WTR 损失在 VoxCeleb(预训练数据集)和 FFSVC(微调数据集)数据集上的有效性。


张子晗
分享主题: 应用于全带残余回声抑制的两步频带分割神经网络方法
摘要:本文介绍了一种用于全频带残余回声消除的两步分频带神经网络(TBNN)。在线性滤波之后,我们将全带信号分成宽带(16KHz)和高频带(16-48KHz)两部分,以较低的复杂度进行建模,同时抑制残余回声与噪声。宽带信号由使用U^2编码器的门控卷积递归网络处理,而高频带信号则用复杂度较低的高频带后滤波网络处理。我们最终提交给ICASSP 2023 AEC挑战赛的方案取得了4.344的总体平均意见得分(MOS)和0.795的词准确率(WAcc),在非个性化赛道中排名第二(并列)。

闫晓鹏

分享主题:西工大-大象声科个性化语音增强系统

摘要:本文介绍了西工大-大象声科联合提交的的个性化语音增强系统 (NAPSE),该系统参加了 ICASSP 2023 第五届深度噪声抑制挑战赛(DNS Challenge)。该方案基于两阶段模型 TEA-PSE 2.0,探索了更好的说话人嵌入融合方式,优化了模型训练策略,并引入了对抗训练和多尺度损失。根据官方结果,该系统在耳机赛道(赛道 1)中排名第一(并列),在扬声麦克风赛道(赛道 2)中排名第二。


张奥

分享主题:VE-KWS: 基于视觉信息增强的端到端视听关键词检出
摘要:基于音频模态的关键词检出(KWS)系统在远场和有噪声干扰情况下性能会出现明显的下降。因此,在视频可以同时获取的场景,如何能够利用音频和视觉模态间互补关系进行视听关键词检出,成为新的研究的热点。本文提出一种利用视觉信息提升性能的端到端关键词检出方法(VE-KWS),该方法从两个方面融合视觉和听觉信息。首先,我们利用视频中的唇动信息去确定说话人的位置来辅助波束形成的训练,通过这个波束形成的前端去抑制噪声提升性能。此外,我们在不同模态之间进行交叉注意力机制计算来来捕捉模态间的关系。在MISP2021挑战赛的数据集上,我们的提出的方法取得了2.79%的误拒绝和2.95%的误唤醒,取得该数据集上当前最佳性能,超过了竞赛时的最好成绩。

论文征集
ICASSP 2023 论文预讲会面向全球线上招募,结合定向邀请与自选投稿的方式,来选择预讲会的嘉宾


为了共创高质量的论文预讲会,我们诚挚邀请所有 ICASSP 2023 作者参与到会议中来,也欢迎大家推荐适此会议论文分享的学者。


投稿方式

投稿邮箱

jack@speechhome.com


联系人微信