ICASSP 2024 论文预讲会由CCF语音对话与听觉专委会、语音之家主办,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。活动将邀请 ICASSP 2024 录用论文的作者进行报告交流。

ICASSP 2024 论文预讲会第十九期邀请到北京邮电大学智能语音与情感交互实验室做本次会议的专场分享,欢迎大家观看。

实验室概况

北京邮电大学智能语音与情感交互实验室隶属于北京邮电大学人工智能学院智能科学与技术中心。中心面向人工智能的国家战略以及各行业的智能化需求,重点在人工智能基础理论、多模态认知计算等方面开展理论研究和技术研发,是中国人工智能学会自然语言理解专委会挂靠单位,是北邮人工智能专业和智能科学与技术专业的主要支撑单位。智能语音与情感交互实验室现有团队包括李雅老师、高迎明老师以及10余名博士生和硕士生。实验室主要研究方向为情感识别以及抑郁识别,语音/歌声合成及转换,虚拟人、情感对话系统等。


第十九期

北京邮电大学智能语音与情感交互实验室【专场】

时间:3月28日(周四)19:00 ~ 20:00

形式:线上

议程:每位嘉宾分享30分钟(含5分钟QA)



嘉宾&主题


嘉宾简介:邓雅月,北京邮电大学人工智能学院智能语音与情感交互实验室二年级研究生,主要研究方向为高表现力语音合成、对话语音合成。合作文章曾发表于ICASSP,ACM MM等国际顶会。

分享主题:CONCSS: Contrastive-based Context Comprehension for Dialogue-appropriate Prosody in Conversational Speech Synthesis

摘要:近年来,随着深度学习技术的发展,基于神经网络的语音合成技术已经能够生成高质量的语音。然而,在一些复杂的对话场景中,这些合成系统仍存在不足,主要是它们难以生成具有自然对话风格韵律的音频。研究显示,将历史对话信息融入语音合成过程中,能够增强模型对历史对话内容的理解,进而提升合成语音的韵律表现。基于这一发现,我们提出了一种创新的对话语音合成框架——CONCSS。该框架融合了对比学习与语音合成技术,旨在学习有效且对上下文敏感的上下文表示。实验表明:在该向量指导下,下游的语音合成模型能够生成更加贴合历史对话语境的语音。


嘉宾简介:李启飞,北京邮电大学人工智能学院智能语音与情感交互实验室博士二年级研究生,主要研究方法为情感识别和抑郁症检测。合作文章曾发表于TAC,Neural Network,ACM MM,ICASSP,INTERSPEECH等研究领域内的期刊和会议。

分享主题:Frame-level Emotional State Alignment Method for Speech Emotion Recognition

摘要:语音情感识别(SER)系统的目标是在人机交互中识别人类的情感状态。大多数现有的SER系统是基于句子级别标签进行训练的。然而,音频中并非所有帧都表现出与句子级别标签一致的情感状态,这给准确辨别音频真实情感带来了挑战,造成识别系统性能不佳。为了解决这个问题,本文提出了一种用于SER的帧级情感状态对齐方法。整个方法分为三个步骤:1)利用聚类算法生成帧级别伪情感标签;2)通过帧级别情感伪标签继续预训练HuBERT模型实现帧级别情感对齐;3)通过注意力机制将帧级别情感表征与句子级别情感标签对齐实现SER。本文在IEMOCAP数据集上评估了所提方法的有效性,实验结果显示本文所提出的方法性能优于当前的其他先进方法的性能。


参与方式

直播将通过语音之家微信视频号进行直播

手机端、PC端可同步观看
👇👇👇



讨论群


扫码添加语音小管家,进入语音之家讨论群


预讲论文征集
ICASSP 2024 论文预讲会面向全球线上招募,结合定向邀请与征集报名的方式,来选择预讲会的嘉宾。


为了共创高质量的论文预讲会,我们诚挚邀请所有 ICASSP 2024 作者参与到此次预讲会活动中来,也欢迎大家推荐适合此次预讲会活动的学者。


预讲论文报名方式

联系人邮箱

bd@speechhome.com


联系人微信