SLT 2024特殊议题 Source Speaker Tracing Challenge 将于2024年12月3日10:30-12:30在澳门悦榕庄举行。本次会议邀请了来自学术界和工业界的专家们,共同探讨源说话人追踪和人工智能技术结合的前沿研究。本次特殊议题将聚焦于针对语音转换的源说话人验证,分享最新的研究成果和技术进展。期待通过跨领域的深入交流,推动源说话人追踪相关技术的实际应用。

会议详情:https://2024.ieeeslt.org/program/

时间:2024年12月3日 10:30-12:30

线下地点:澳门悦榕庄演讲厅 (Lecture Hall at Banyan Tree Macau)

特殊议题主持人:李明(昆山杜克大学)


线上参会

Zoom

Meeting ID: 3665729300

Password: pvtc2020


会议日程


嘉宾&主题

李明

简介:李明,昆山杜克大学电子与计算机工程教授,大数据研究中心研究员,武汉大学计算机学院兼职教授,博导。第十五批江苏省六大高峰B类高层级人才。2013年毕业于美国南加州大学电子工程系,获工学博士学位。2013-2017年任教于中山大学,副教授,博士生导师,2018年加入昆山杜克大学。曾任美国卡内基梅隆大学访问教授和美国杜克大学客座研究员,IEEE语音及语言技术委员会委员,多个国际期刊副主编,ASRU、Odyssey等重要学术会议技术程序委员会主席,带领团队十余次获得国际评测冠军,两次获得国际会议最佳论文奖。发表论文两百余篇,谷歌学术引用9700。2016年获IBM Faculty Award,2018年获ISCA最佳期刊论文奖,2020年获教育部高校科研优秀青年成果奖。

励泽

简介:励泽,武汉大学计算机科学与技术专业二年级硕士生,昆山杜克大学语音及多模态智能信息处理实验室研究实习生,导师为李明教授,主要研究方向为声纹识别。

报告题目:The Database and Benchmark for the Source Speaker Tracing Challenge 2024

报告摘要:语音转换(VC)系统能够将音频转换为模拟另一位说话者的声音,从而攻击说话人验证(SV)系统。然而,目前关于源说话人验证(SSV)的研究由于数据可用性有限和方法上的限制而受到阻碍。本文在SLT 2024上提出了源说话人追踪挑战赛(SSTC),旨在弥补SSV任务在数据库和基准测试方面的空缺。在本研究中,我们生成了一个大规模的转换语音数据库,该数据库涵盖16种常见的VC方法,并基于MFA-Conformer架构训练了一系列基线系统。此外,我们引入了一个相关任务——转换方法识别,旨在为SSV任务提供辅助。我们期望SSTC成为推动SSV任务发展的平台,并为当前SV系统应对VC攻击的性能与局限性提供进一步的见解。有关SSTC的更多详细信息,请参见:https://sstc-challenge.github.io/。

王晴

简介:王晴,西北工业大学音频语音与语言处理研究组(ASLP@NPU)博士在读,导师为谢磊教授,主要研究方向为说话人识别。

报告题目:Speaker Contrastive Learning for Source Speaker Tracing

报告摘要:说话人验证(Speaker Verification, SV)作为一种生物特征认证技术,在身份认证和安全领域具有重要应用。然而,SV 系统易受到诸如语音转换(Voice Conversion, VC)等攻击的威胁。VC 技术通过改变语音特征,将语音伪装成目标说话人的声音,从而对 SV 系统的准确性和可靠性构成挑战。为应对这一问题,IEEE SLT2024 的源说话人跟踪挑战赛(Source Speaker Tracing Challenge, SSTC)提出了一项关键任务:通过分析转换语音,验证其是否来自同一源说话人。在本报告中,我们提出了一种基于说话人对比学习的方法,用于从转换语音中提取潜在的源说话人信息。该方法通过引入说话人对比损失(Speaker Contrastive Loss),显著提升了嵌入提取器在区分源说话人嵌入和干扰嵌入方面的能力,从而更准确地捕获源说话人特征。实验结果显示,我们的方法在 SSTC 测试集中取得了 16.788% 的等错误率(EER)验证了其在源说话人验证任务中的有效性,在挑战赛中获得第一名。

黄尚坤

简介:黄尚坤,硕士毕业于新疆大学,现就职于北京远鉴研究中心。主要研究方向为多语种语音识别,曾在ICASSP、SLT等学术会议发表多篇论文,在CHIME-8、ICASSP2024 ICMC-ASR等赛事中取得优异成绩。

报告题目:The Challenge and Defense Strategies of Speaker Verification Systems Against Voice Conversion Technology in the SSTC2024 Challenge

报告摘要:声音转换技术的快速发展对说话人验证系统的安全性和可靠性提出了较大挑战。SSTC 2024挑战赛构建了包含16种声音转换类型的大规模语音数据库,以检验说话人验证系统对声音转换攻击的有效性。我们团队基于微调的ResNet101模型和分数归一化策略构建了一个鲁棒性的说话人验证系统,在比赛测试集上实现了18.65%的等错误率,在最终的挑战赛中排名第2。此外,我们根据转换目标类型和正常语音与转换语音间的差异性细化和拓展构建了测试对,全面系统地从不同情况下分析模型微调前后的说话人验证系统性能。

马鑫磊

简介:马鑫磊,天津大学视听觉认知计算组,三年级硕士生,导师为魏建国教授。主要研究方向声纹欺诈检测。

报告题目:Distillation-based feature extraction algorithm for source speaker verification

报告摘要:自动说话人验证 (ASV) 系统在遭受欺骗攻击时面临重大挑战,需要采取强有力的对策。在这项工作中,我们专注于源说话人验证 (SSV) 任务,该任务旨在识别语音转换 (VC) 系统生成的欺骗语音中隐藏的源说话人。我们提出了一种基于蒸馏的特征提取算法来增强模型验证源说话人的能力。该方法采用预训练 ASV 模型作为教师网络,采用 SSV 模型作为学生网络,使用真实语音来指导学生网络的学习过程,并取得了一定的性能提升。此外,我们的作品在 2024 年源说话人追溯挑战赛(SSTC)中获得了第四名的成绩。