INTERSPEECH 2023 论文预讲会是由CCF语音对话与听觉专委会、语音之家主办,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。活动将邀请 INTERSPEECH 2023 录用论文的作者进行报告交流。

INTERSPEECH 2023 论文预讲会 - 第十二期邀请到清华大学语音与音频技术实验室进行专场分享,欢迎大家预约观看。



王皓宇

分享主题 1:DistilXLSR:压缩的多语种语音表征模型

摘要:多语种预训练模型为低资源语音识别系统的表现带来了极大的提升,但同时也增加了这些系统对硬件平台计算能力的要求,因此,我们尝试对多语种预训练模型进行蒸馏。针对多语种蒸馏中数据获取成本、训练成本较高的问题,我们尝试只使用英语数据蒸馏多语种模型,并提出一种随机打乱音节的数据增强方法,以移除音频中的音位学特征;另外,为了充分利用大模型中的预训练参数,我们还提出一种新的跳层模型初始化策略。在15个低资源语种上的实验表明,我们的方法在减少50%模型参数的同时,仍能保留多语种预训练模型的跨语种表征能力。

分享主题 2:任务无关的语音预训练模型结构化剪枝方法

摘要:基于无监督预训练技术的语音表征模型为许多语音任务带来了显著的进步,但这些模型通常包括大量的参数,对硬件平台的计算能力和内存空间有很高的要求。结构化剪枝不需要特殊硬件就可以实现参数压缩和推理加速,是一种对硬件友好的模型压缩方法。为了弥补剪枝带来的性能损失,我们提出了一种细粒度的注意力头剪枝方法;除此之外,我们将梯度直通估计(Straight Through Estimator,STE)引入到L0正则化剪枝方法中,让模型参数的分布更加紧凑,从而实现了进一步的加速。在SUPERB排行榜上的实验表明,我们的压缩模型比Wav2vec 2.0 Base模型平均性能更好,同时参数量比前者减少30%,推理时间比前者减少50%。


论文征集

INTERSPEECH 2023 论文预讲会面向全球线上招募,结合定向邀请与自选投稿的方式,来选择预讲会的嘉宾。


为了共创高质量的论文预讲会,我们诚挚邀请所有 INTERSPEECH 2023 作者参与到会议中来,也欢迎大家推荐适此会议论文分享的学者。


投稿邮箱

jack@speechhome.com


联系人微信