ICASSP 2024 论文预讲会由CCF语音对话与听觉专委会、语音之家主办,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。活动将邀请 ICASSP 2024 录用论文的作者进行报告交流。

ICASSP 2024 论文预讲会邀请到清华大学深圳国际研究生院在3月26日和3月27日分别做两期专场分享,本文介绍第一场相关内容,欢迎大家预约观看。



第十七期

清华大学深圳国际研究生院(一)【专场】

时间:3月26日(周二)19:00 ~ 21:05

形式:线上

议程:每位嘉宾分享25分钟(含5分钟QA)



嘉宾&主题


嘉宾简介:杨思程,清华大学深圳国际研究院电子信息(人工智能)专业三年级硕士。研究方向是基于多模态表征学习的语音文本驱动数字人动作生成研究。相关工作发表于ICASSP,CVPR,IJCAI, ICMI,ACM MM上。

分享主题:Freetalker: Controllable Speech and Text-Driven Gesture Generation Based on Diffusion Models for Enhanced Speaker Naturalness

摘要:目前语音驱动虚拟数字人大多根据语音和文本生成共语手势,而不考虑说话者的非说话动作。此外,以往的共语手势生成工作都是基于单个手势数据集来设计网络结构的,这导致了数据量有限、通用性受损以及说话者动作受限等问题。为了解决这些问题,我们提出了FreeTalker,据我们所知,这是第一个同时生成自发(如共语手势)和非自发(如在讲台周围移动)发言人动作的框架。具体来说,我们利用来自各种运动数据集的异构数据,训练了一个基于扩散的演讲者运动生成模型,该模型采用了语音驱动手势和文本驱动运动的统一表征。在推理过程中,我们利用无分类器引导来高度控制片段的风格。此外,为了在片段之间创建平滑的过渡,我们采用了DoubleTake,这是一种利用先验生成并确保无缝运动混合的方法。大量实验表明,我们的方法能生成自然、可控的说话者动作。


嘉宾简介:林志伟,清华大学深圳国际研究院电子信息(计算机技术)专业二年级硕士。研究方向是基于文本描述的音乐乐谱生成研究。相关工作发表于ICASSP。
分享主题:Multi-view MidiVAE: Fusing Track- and Bar-view Representations for Long Multi-track Symbolic Music Generation

摘要:变分自编码器(VAEs)是基于神经网络的符号音乐生成技术的重要组成部分,其中一些工作已经有了出色的结果并引起了相当大的关注。然而,以前的 VAE 仍然会遇到特征序列过长的问题,并且生成的结果缺乏上下文连贯性,因此建模长时间多乐器符号音乐的挑战仍然没有得到解决。为此,我们提出了Multi-view MidiVAE,作为VAE方法的先驱之一,该方法可以有效地建模和生成长多音轨符号音乐。模型利用二维表征 OctupleMIDI 来捕获音符之间的关系,同时减少特征序列长度。此外,我们通过使用混合变分编码解码策略来整合乐器视角(Track-view) 和小节视角(Bar-view) MidiVAE 特征,从而让模型专注于乐器特征和乐器间的协调交互、以及音乐的全局和局部信息。在CocoChorales数据集上的客观和主观实验结果表明,与基线相比,我们的方法在建模长多轨符号音乐方面表现出显着的改进。 


嘉宾简介:沙斌竹,清华大学深圳国际研究院电子信息(计算机技术)专业二年级硕士。研究方向是单样本的歌声转换。相关工作发表于ICASSP。

分享主题:Neural Concatenative Singing Voice Conversion: Rethinking Concatenation-Based Approach for One-Shot Singing Voice Conversion
摘要:目前单样本(one-shot)的歌声转换面临着“音色泄露”的问题,这通常是由内容特征和说话人音色特征之间的解耦不充分而导致的。为了解决上述问题,我们提出了一种新的拼接式歌声转换框架NeuCoSVC,其包含自监督特征提取器、神经谐波信号生成器和音频合成器三部分。具体而言,自监督提取器将音频压缩为一系列固定维度的自监督特征序列。谐波信号生成器接受音高、响度和自监督特征,利用线性时变(LTV)滤波器生成谐波信号作为音高信息。最后,音频合成器根据自监督特征、谐波信号和响度信息合成音频波形。在推理时,自监督提取器从参考音频中提取自监督特征并构成匹配池,通过将源音频的自监督特征替换为匹配池中最相似的自监督特征实现音色转换,同时原始谐波信号和响度则从源音频中提取并保持不变。由于在转换阶段使用的自监督特征直接来自目标音频,所以NeuCoSVC可以避免先前基于解耦的方法引起的“音色泄漏”问题。实验结果表明,在one-shot的场景下,与使用说话人嵌入向量的方法相比,NeuCoSVC在同语言、跨语言和跨域(Cross Domain)转换中都表现出更好的自然度和音色相似度。

该工作目前已经开源:https://github.com/thuhcsi/NeuCoSVC


嘉宾简介:黄翘楚,清华大学深圳国际研究院电子信息(计算机技术)专业二年级硕士。研究方向是音乐驱动舞蹈生成。相关工作发表于ICASSP。

分享主题:Enhancing Expressiveness in Dance Generation via Integrating Frequency and Music Style Information

摘要:舞蹈生成作为人类动作生成的一个分支,已引起越来越多的关注。最近,一些工作试图从某些方面增强舞蹈的表现力,其中包括舞种匹配性、舞蹈卡点性和舞蹈动态。然而,由于缺乏对上述三方面因素的综合考虑,其增强效果相当有限。在本文中,我们提出了一种新颖的舞蹈生成方法 ExpressiveBailando,该方法旨在生成富有表现力的舞蹈,同时兼顾上述三个因素。具体来说,我们通过将频率信息纳入 VQ-VAE 来缓解速度平均化问题,从而改善舞蹈的动态效果。此外,我们还整合了音乐风格信息,通过预先训练的音乐模型提取与流派和节拍相关的特征,从而改善了其他两个因素。实验结果表明,我们提出的方法可以生成具有高表现力的舞蹈,并且在主观和客观评价上都优于现有方法。


嘉宾简介:薛海威,清华大学国际开放创新教育中心电子信息(互联网+创新设计)专业二年级硕士。研究方向是数字人肢体驱动与视频生成。相关工作发表于ICASSP、ICMI等会议上。
分享主题:Conversational Co-Speech Gesture Generation via Modeling Dialog Intention, Emotion, and Context with Diffusion Models

摘要: 音频驱动的语音协同人体手势(共语手势,co-speech gesture)生成技术近年来取得了显著进展。然而,先前的工作大多数仅关注单人语音驱动的手势生成,很少关注到手势生成除了说话人自身因素外,还会受到对话上下文等多个因素的影响。本文旨在探讨在对话中考虑多个参与者的对话协同语音手势生成的问题,提出一种针对双人语境的语音驱动交互手势生成方法。结合现实对话的状态,通过句子级别的意图感知模块和情感推理模块,初步建模双方的对话意图(Intention)、情感(Emotion)和话语上下文(Context),来进一步提升手势生成的丰富度,并基于扩散概率模型生成稳定、连贯的手势序列,为对话手势动作合成工作生成更加拟人、符合语音、贴近双方语境的高质量手势动作提供了进一步的解决方案。


参与方式

直播将通过语音之家微信视频号进行直播

手机端、PC端可同步观看
👇👇👇



讨论群


扫码添加语音小管家,进入语音之家讨论群


预讲论文征集
ICASSP 2024 论文预讲会面向全球线上招募,结合定向邀请与征集报名的方式,来选择预讲会的嘉宾。


为了共创高质量的论文预讲会,我们诚挚邀请所有 ICASSP 2024 作者参与到此次预讲会活动中来,也欢迎大家推荐适合此次预讲会活动的学者。


预讲论文报名方式

联系人邮箱

bd@speechhome.com


联系人微信