ICASSP 2024 论文预讲会由CCF语音对话与听觉专委会、语音之家主办,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。活动将邀请 ICASSP 2024 录用论文的作者进行报告交流。

ICASSP 2024 论文预讲会邀请到中国科学技术大学在3月5日和3月7日分别做两期专场分享,本文介绍第一场相关内容,欢迎大家预约观看。



第二期

中国科学技术大学(一)【专场】

时间:3月5日(周二)19:00 ~ 20:00

形式:线上

议程:每位嘉宾分享30分钟(含5分钟QA)



嘉宾&主题


嘉宾简介:杨高斌,中国科学技术大学语音及语言信息处理国家工程研究中心二年级研究生,主要研究方向为说话人日志。合作文章曾发表于INTERSPEECH、ICASSP等语音领域会议。

分享主题:基于记忆感知和Seq2Seq架构的说话人日志系统

摘要:我们提出了一种新的说话人日志系统(NSD-MS2S),该系统使用记忆感知多说话人嵌入(MA-MSE)和序列到序列(Seq2Seq)架构,极大提高了系统的性能和效率。我们通过将输入特征融合到解码过程中,进一步降低了解码对内存的占用。此外我们引入了深度交互模块 (DIM), 进一步提高系统性能。NSD-MS2S 在 CHiME-7 EVAL 集上的日志错误率(DER) 为 15.9%,与官方基线系统相比性能提高了 49%,是我们在CHiME-7 DASR 挑战赛上取得第一名的关键技术。

代码已开源: https://github.com/liyunlongaaa/NSD-MS2S



嘉宾简介:王皓天,中国科学技术大学语音及语言信息处理国家工程研究中心二年级研究生,主要研究方向为多模态情感识别及模型压缩。合作文章曾发表于ACMMM,ICASSP,INTERSPEECH,APSIPA等语音及多媒体领域会议。
分享主题:Improving Multi-modal Emotion Recognition using Entropy-based Fusion and Pruning-based Network Architecture Optimization
摘要:在本研究中,我们的目标是在效率和性能上改进我们最新发表的用于多模态情感识别挑战(MER 2023) 的分层多模态信息融合系统。具体来说,我们从预训练的模型中提取鲁棒的声学和视觉表示,并将它们融合在不同的结构中。然后,我们提出了一种基于熵的融合方法,在对所有不同特征融合结构进行多标签预测的基础上,获得情绪和情感效价的最终预测。此外,为了减少网络冗余,提高低资源多模态数据条件下的模型泛化能力,我们提出了一种基于结构化剪枝和学习率回退的网络结构逐步优化方法。在MER 2023数据集上进行测试时,基于熵融合的优化后网络结构取得了显著的改进,最终结果优于MER- multi挑战赛的冠军系统。


参与方式

直播将通过语音之家微信视频号进行直播

手机端、PC端可同步观看
👇👇👇



讨论群


扫码添加语音小管家,进入语音之家讨论群


预讲论文征集

ICASSP 2024 论文预讲会面向全球线上招募,结合定向邀请与征集报名的方式,来选择预讲会的嘉宾。


为了共创高质量的论文预讲会,我们诚挚邀请所有 ICASSP 2024 作者参与到此次预讲会活动中来,也欢迎大家推荐适合此次预讲会活动的学者。


预讲论文报名方式

联系人邮箱

bd@speechhome.com


联系人微信