近几年,随着音频生成模型的飞速发展,AI 已能合成极其逼真的环境声音:警报、脚步、汽笛……这些深度伪造(Deepfake) 环境声音在影视、游戏、VR 等创意领域大放异彩,但同时也可能被滥用,引发社会恐慌、操纵舆论。如何检测并防御这类音频伪造,已经成为学界与安全领域的紧迫课题。
为了推动这一前沿研究,来自韩国科学院(KAIST)和墨尔本大学等机构的研究者们构建了EnvSDD数据集。这是首个专为环境声音深度伪造检测打造的大规模数据集,涵盖45.25 小时真实音频与316.74 小时伪造音频。在此基础上,正式推出环境声音深度伪造检测(Environmental Sound Deepfake Detection, ESDD)挑战赛,全球首个专注环境声音深伪检测的挑战赛!
2026年首届ESDD挑战赛将于语音与音频研究顶级会议ICASSP2026上举办,主要聚焦两大难题:
- 不可见生成器(Unseen Generators):考察模型对未知文生音频(Text-to-Audio, TTA)与音频生音频(Audio-to-Audio, ATA)生成器的泛化能力。
- 黑盒低资源(Black-Box Low-Resource):更贴近真实场景,在极度不确定性和有限数据条件下的深伪检测。

赛道设置
⏩赛道1: Unseen Generator
本赛道旨在鼓励参赛者开发能够应对未知生成器(TTA与ATA) 的鲁棒环境声音深伪检测系统。核心目标是推动检测模型在训练未见过的生成器下,也能有效识别合成环境音,从而更贴近真实应用场景。我们希望借此促进通用深伪检测研究,推动具备跨生成器鲁棒性与适应性的模型设计。
⏩赛道2: Black-Box Low-Resource
“黑箱”指在测试时对具体的生成方法一无所知,可能涵盖超出TTA与ATA的任意生成范式;“低资源”则表示可用的黑箱训练数据极为有限,仅占全部训练数据的1%。本赛道旨在模拟极端不确定性与数据稀缺条件下的真实深伪检测场景,挑战性与实用性兼具。
重要日期
- 挑战启动:2025.9.1
- 注册截止:2025.10.15
- 进展阶段:2025.9.1 – 2025.11.16
- 测试集发布:2025.11.17
- 排名阶段:2025.11.17 – 2025.11.26
- 排行榜公布:2025.11.27
- 两页论文提交(仅限邀请):2025.12.7
- 论文录用通知:2026.1.11
- 终稿提交:2026.1.18
(注:时间节点可能会有调整,详细日程请务必以官网发布的最新信息为准)
组织者
- 尹涵,韩国科学技术院
- 肖扬,墨尔本大学
- Rohan Kumar Das,新加坡Fortemedia
- 白吉生,西安邮电大学
- 党婷,墨尔本大学
报名方式
访问官方网站,获取挑战赛的所有信息:https://sites.google.com/view/esdd-challenge
联系方式:hanyin@kaist.ac.kr
