ICASSP 2025 论文预讲会由CCF语音对话与听觉专委会、语音之家主办,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。活动将邀请 ICASSP 2025 录用论文的作者进行报告交流。
ICASSP 2025 论文预讲会第十四期邀请到哈尔滨工程大学智能信号处理组做本次会议的专场分享,欢迎大家观看。
实验室概况
哈尔滨工程大学智能信号处理组(Group of Intelligent Signal Processing, GISP@HEU),由计算机科学与技术学院关键老师成立于2020年。GISP实验室主要研究方向为音频智能、遥感图像智能解译、多源信号智能处理。

第十四期:哈尔滨工程大学智能信号处理组【专场】
时间:3月31日(周一)19:00 ~ 20:40
形式:线上
议程:每位嘉宾分享25分钟(含5分钟QA)

嘉宾&主题

嘉宾简介:肖飞扬,哈尔滨工程大学计算机学院2023级博士研究生,研究方向为跨模态音频内容理解,研究内容为自动音频字幕与检索、异常声音检测。在IEEE SPL,ICASSP, INTERSPEECH等期刊会议发表学术论文14篇。在DCASE 2022任务6A获得国际第6名,DCASE 2023任务6A获得国际第6名、任务6B获得国际第4名,DCASE 2024 Task9获得国际第2名、Task 10获得国际第1名。
分享主题:Disentangling Hierarchical Features for Anomalous Sound Detection Under Domain Shift
摘要: 异常声音检测面临的主要挑战之一即域迁移问题。由于机器运行条件的变化,目标域和源域中的声音特征存在显著差异,增加正常声音与异常声音区分的难度,严重影响检测性能。现有方法通常采用域分类器来提升检测性能,而往往忽视域无关信息的影响。这种对于域无关信息的忽视可能会阻碍模型对不同域声学特征的辨识,进而削弱其区分正常声音与异常声音的能力。为此,本文提出了一种基于梯度反转的分层特征解耦方法,以应对上述挑战。所提方法利用梯度反转将域相关特征与域无关特征进行分离,从而获得更为鲁棒的声音特征表示;此外,该方法采用层次结构,利用设备声音所携带的元数据(Section ID和机器声音属性)作为先验信息进行约束,引导模型可以学习获得特定域下的细粒度声学特征表示。本文所提方法在DCASE 2022挑战任务2的数据集上进行了实验,结果表明该方法在域迁移场景下显著提高了异常声音检测的性能。

嘉宾简介:范世通,哈尔滨工程大学计算机学院2022级硕士研究生,研究方向为声学场景与事件分类及检测、多模态信号处理,研究内容为声学交通监测、听觉注意力解码。在ICASSP, ISCSLP会议发表学术论文2篇。DCASE 2024 Task 10赛道获得国际第1名,ICASSP 2025 Grand Challenge 5 EEG-Music Emotion Recognition Challenge Task1国际第7名(100%准确率)、Task2国际第4名。
分享主题:Graph-Enhanced Dual-Stream Feature Fusion with Pre-Trained Model for Acoustic Traffic Monitoring
摘要:麦克风阵列技术广泛应用于声源定位和智慧城市的基于声学的交通监测,但由于真实交通音频数据的标注稀缺以及应用场景的复杂性和多样性,导致实际应用面临诸多挑战。为此,DCASE 2024挑战赛提出任务10,聚焦于多通道音频信号的交通监测,利用多通道声学信号来统计车辆(轿车或商用车)数量并识别其行驶方向(从左至右或反之)。本文提出了一种用于声学交通监测的图增强双流特征融合网络(GEDF-Net),该网络同时考虑车辆类型和方向以提高检测效果。本文提出了一种图增强双流特征融合策略,该策略包括车辆类型特征提取(Vehicle Type Feature Extraction, VTFE)分支、车辆方向特征提取(Vehicle Direction Feature Extraction, VDFE)分支以及一个帧级特征融合模块,用于结合类型和方向特征以增强性能。在VTFE分支中,本文采用预训练模型(Pretrained Audio Neural Networks, PANNs)来缓解数据稀缺问题并增强类型特征,随后通过图注意力机制挖掘时间关系并突出这些特征中的重要音频事件。方向与类型特征的帧级融合实现了细粒度特征表示,从而带来更好的检测性能。实验证明了本文提出方法的有效性。GEDF-Net作为我们的参赛方案,在DCASE 2024挑战赛任务10中获得第一名。

嘉宾简介:张砚喆,哈尔滨工程大学计算机学院2021级本科生,研究方向为语音隐私保护,研究内容为说话人匿名化。在音频信号处理顶会ICASSP发表学术论文1篇。ICASSP 2025 Grand Challenge 7 The First VoicePrivacy Attacker Challenge获得前五名,T8-5赛道中获得第一名。
分享主题:Attacking Voice Anonymization Systems with Augmented Feature and Speaker Identity Difference
摘要:说话人匿名化是一种通过改变说话人的声音特征,在最大限度内隐藏其身份信息,同时保持语义内容及副语言(如情感、语调等)完整性的任务,其身份信息隐藏能力采用说话人验证(Automatic Speaker Verification, ASV)系统进行评估。本研究聚焦于ICASSP 2025 信号处理大赛的首届VoicePrivacy Attacker Challenge,旨在开发能有效判断两段匿名化语音是否来自同一说话人的ASV系统。针对原始语音与匿名化语音特征分布差异带来的挑战,本文提出融合数据增强特征表达与说话人身份差异增强分类器的攻击系统DA-SID。具体而言,通过基于数据混合(Data Fusion)和时频掩码(SpecAugment)的数据增强策略缓解特征分布偏移,同时采用概率线性判别分析(Probabilistic Linear Discriminant Analysis, PLDA)强化说话人间的身份差异。实验表明,本系统较比赛基线方法取得显著性能提升,展现出优异的有效性和对多种语音匿名化系统的鲁棒性,在比赛中位列前五,T8-5赛道中位列第一。

嘉宾简介:杨雪峰,哈尔滨工程大学计算机科学与技术学院2021级本科生,推免进入GISP实验室攻读硕士。研究方向为智能信号处理,研究内容为多媒体内容生成与理解,在音频信号处理顶会ICASSP发表学术论文2篇。ICASSP 2025 Grand Challenge 8 Accelerometer-Based Person-in-Bed Detection两个赛道中分别获得第一名和第三名。
分享主题:Spectral-Temporal Fusion Representation for Person-in-Bed Detection
摘要:基于加速度计信号的床上人员检测挑战包括两个赛道:“床上”与“非床上”分段检测(Segmented Detection)和流式检测(Streaming Detection)。在流式检测中,检测系统需要实时处理加速度计信号,并动态判断连续数据流中的床上人员存在情况。针对挑战任务,本文提出了一种基于时频域融合的特征表示(Spectral-Temporal Fusion-Based Feature Representation)方法,通过将信号的时域信息与频域信息进行融合,充分捕捉加速度计信号在不同时间尺度和频率范围内的变化特征,从而提高了对床上人员检测的精度和鲁棒性。此外,研究中结合了Mixup数据增强技术,并采用交并比(IoU)损失函数优化模型的检测性能。在该挑战的两个赛道,本文所提出方法通过官方评估指标评测,分别达到了100.00%和95.55%的性能,获得第一名和第三名。
参与方式
直播将通过语音之家微信视频号进行直播
手机端、PC端可同步观看
👇👇👇

预讲会征集
ICASSP 2025 论文预讲会面向全球线上招募,结合定向邀请与征集报名的方式,来选择预讲会的嘉宾。

为了共创高质量的论文预讲会,我们诚挚邀请所有 ICASSP 2025 作者参与到此次预讲会活动中来,也欢迎大家推荐适合此次预讲会活动的学者。
预讲会报名方式
联系人邮箱:bd@speechhome.com
联系人微信

