INTERSPEECH 2023 论文预讲会是由CCF语音对话与听觉专委会、语音之家主办,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。活动将邀请 INTERSPEECH 2023 录用论文的作者进行报告交流。

INTERSPEECH 2023 论文预讲会 - 第十一期邀请到网易易盾进行专场分享,欢迎大家预约观看。



下面是预讲会的回顾:


杨玉婷

分享主题:Enhancing the Unified Streaming and Non-streaming Model with Contrastive Learning

摘要:近年来,流式/非流式一体化ASR模型提升了流式识别的性能,降低了模型开发部署的成本,成为领域内的研究热点之一。然而,一体化ASR模型仍然存在两个性能差距:非流式识别性能优于流式识别,纯离线模型性能优于一体化模型的非流式识别。如何进一步提升一体化模型的性能仍然是一个挑战。针对这个问题,我们提出利用对比学习方法来缩小流式和非流式模式之间的内在表征差距,从而提升一体化模型的性能。实验结果表明,我们的方法在流式和非流式模式下都取得了显著的性能提升。


汪文轩

分享主题:Language-Routing Mixture of Experts for Multilingual and Code-Switching Speech Recognition
摘要:兼顾单语和语码转换的多语言语音识别是一项具有挑战性的任务。最近,许多基于专家混合模型(MoE)的工作在这个任务上取得了不错的进展,但随着支持语言的增多,模型计算复杂度往往也会大幅增加。针对这个问题,我们提出了一种计算高效的LR-MoE网络。在LR-MoE中,共享权重的帧级语种识别网络作为每个专家混合层的路由器与ASR任务进行联合训练,并引导每个专家层学习各语言的特定表示。实验结果表明,我们的方法在兼顾计算效率的同时取得了多语种和语码转换场景下ASR性能的显著提升。


论文征集
INTERSPEECH 2023 论文预讲会面向全球线上招募,结合定向邀请与自选投稿的方式,来选择预讲会的嘉宾。


为了共创高质量的论文预讲会,我们诚挚邀请所有 INTERSPEECH 2023 作者参与到会议中来,也欢迎大家推荐适此会议论文分享的学者。


投稿方式

投稿邮箱:jack@speechhome.com


联系人微信