ICASSP 2024 论文预讲会由CCF语音对话与听觉专委会、语音之家主办,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。活动将邀请 ICASSP 2024 录用论文的作者进行报告交流。

ICASSP 2024 论文预讲会第九期邀请到厦门大学智能语音实验室做本次会议的专场分享,欢迎大家观看。


实验室概况

厦门大学智能语音实验室(XMU Speech Lab),成立于2015年,是汇集了厦门大学信息学院的人工智能系、电子科学与技术学院电子工程系、海洋与地球学院等学科领域的优势力量而组建的一支创新科研团队。自实验室成立以来,不仅科研成果丰硕,同时推进产学研深度融合,与多家企业保持良好的合作关系。实验室始终致力于打造全国乃至世界一流的智能语音技术研究团队。

厦门大学智能语音实验室现有团队成员包括洪青阳教授、李琳教授、童峰教授、许彬彬助理教授,以及20余名在校研究生。实验室主要研究方向是声纹识别、语音识别、语音合成、语音增强、语音唤醒、语种识别、麦克风阵列等。



第九期

厦门大学智能语音实验室【专场】

时间:3月16日(周六)19:00 ~ 20:00

形式:线上

议程:每位嘉宾分享30分钟(含5分钟QA)



嘉宾&主题


嘉宾简介:管文豪,厦门大学智能语音实验室二年级硕士生,导师为洪青阳教授。主要研究兴趣为语音合成。

分享主题:ReFlow-TTS: A Rectified Flow Model For High-Fidelity Text-to-Speech

摘要:扩散模型在语音合成任务中表现出了优异的性能。然而,它的有效性是以大量采样步骤为代价的,这导致合成高质量语音所需的采样时间过长。这也阻碍了它在现实场景中的实际应用。在本文中,我们介绍了ReFlow-TTS,这是一种新的基于rectified flow的高保真语音合成方法。具体来说,我们的ReFlow-TTS是一个常微分方程(ODE)模型,它尽可能以直线路径将高斯分布传输到真实的Mel谱图分布。此外,我们提出的方法能够用单个采样步骤实现高质量的语音合成,并消除了训练教师模型的需要。我们在LJSpeech数据集上的实验表明,与其他基于扩散的模型相比,我们的ReFlow-TTS方法实现了最佳性能。与现有的一步TTS模型相比,具有一步采样的ReFlow-TTS实现了具有竞争力的性能。


嘉宾简介:罗龙杰,厦门大学智能语音实验室一年级硕士生,导师为李琳教授。主要研究兴趣为语音增强。
分享主题:The XMUSPEECH System For Audio-Visual Target Speaker Extraction In MISP 2023 Challenge

摘要:基于多模态信息的语音处理(MISP)2023挑战赛首次聚焦于视听说话人提取(AVTSE)任务,旨在探索前端AVTSE系统对后端ASR系统识别准确率的影响。如何在不损伤目标说话人语音信号的前提下尽可能地抑制干扰是此次挑战赛的主要难点,为此,本文提出了一个多模态多通道的生成对抗式语音增强网络AV-MCCMGAN,其生成器使用了远场6通道音频作为引导源分离(GSS)信号的补充,以克服GSS噪声抑制不充分、损伤目标语音以及错误增强干扰等不足,同时通过引入目标说话人的视觉线索,进一步抑制噪声,鉴别器则通过模拟PESQ打分,改善生成语音的客观质量。实验结果表明,本文提出的AV-MCCMGAN系统在模型可训练参数量仅为基线2.4%的情况下,在开发集和验证集上的字符错误率(CER)分别为23.3%和33.41%,相对提升11%和7.4%。

Demo:https://leroisoleil2023.github.io/MISP2023-XMU-System-Demo/


参与方式

直播将通过语音之家微信视频号进行直播

手机端、PC端可同步观看
👇👇👇



讨论群

扫码添加语音小管家,进入语音之家讨论群


预讲论文征集
ICASSP 2024 论文预讲会面向全球线上招募,结合定向邀请与征集报名的方式,来选择预讲会的嘉宾。


为了共创高质量的论文预讲会,我们诚挚邀请所有 ICASSP 2024 作者参与到此次预讲会活动中来,也欢迎大家推荐适合此次预讲会活动的学者。


预讲论文报名方式

联系人邮箱

bd@speechhome.com


联系人微信