以下文章来源:生物信息感知与人机交互团队
随着语音合成与生成式人工智能技术快速发展,高质量合成语音在身份冒充、语音诈骗和虚假信息传播等场景中带来了新的安全风险,推动了音频深度伪造检测(Audio Deepfake Detection,ADD)的快速发展。
然而,目前大多数ADD方法仍采用集中式训练方式,需要将不同用户或机构的语音数据统一汇集到服务器。语音中同时包含说话人身份、生物特征以及语义内容等敏感信息,因此大规模集中存储和训练可能带来额外的隐私风险。相比之下,联邦学习能够使不同客户端在不直接共享原始语音数据的情况下协同训练模型,为隐私敏感场景下的音频深伪检测提供新的解决方案。
但实际联邦环境中的客户端往往包含不同的说话人、伪造算法和录音条件,呈现明显的Non-IID数据分布,同时还可能存在客户端掉线等问题。传统联邦学习方法难以在这种复杂场景下保持稳定的深伪检测性能。

论文地址:https://ieeexplore.ieee.org/document/11667820
方法介绍
针对上述问题,本文提出面向隐私保护音频深伪检测的联邦学习框架 FLADD,如下图1所示,主要包含三个核心部分:

图 1 所提出方法的总体框架
1. 双分支音频深伪检测网络(Dual-Branch ADD Network)
FLADD采用由 Res2Net和Rawformer 组成的双分支结构,分别从频谱特征和原始波形中提取伪造线索。其中Res2Net侧重于捕获细粒度频谱异常,Rawformer则建模原始波形中的时序变化,利用两类互补信息提升对不同伪造攻击的检测能力。
2. 双原型策略(Dual-Prototype)
考虑到两个分支学习到的特征具有不同的表示空间,FLADD分别为频谱分支和波形分支建立独立的全局类别原型,通过原型约束减少不同客户端之间的特征偏移,从而提升Non-IID数据条件下的联邦训练稳定性。
3. 多因素自适应加权机制(MFAW)
传统FedAvg主要依据客户端的数据量进行模型聚合,而FLADD进一步综合考虑客户端的数据规模、验证准确率、预测熵和验证损失,动态调整不同客户端的聚合权重,使服务器能够更加有效地整合不同质量的本地模型更新。
结果介绍
1)与其他模型的性能对比
本文在 ASVspoof 2019 LA和ASVspoof 2021 LA 数据集上进行了实验。模型仅使用ASVspoof 2019 LA训练集进行训练,并进一步在ASVspoof 2021 LA上测试跨数据集泛化性能。
实验结果表明,FLADD在联邦训练且不集中共享原始语音数据的条件下仍取得了具有竞争力的检测性能。在三次独立实验中,FLADD在ASVspoof 2019 LA上的平均EER为 0.327% ± 0.041%,最佳结果达到 0.285%;在ASVspoof 2021 LA上的平均EER为 2.122% ± 0.126%,最佳结果达到 2.045%。

表1 FLADD与不同音频深伪检测模型的性能对比
进一步的逐攻击实验表明,FLADD在ASVspoof 2019 LA多数伪造攻击类型上均保持较低的EER,说明模型能够较好地利用频谱和波形信息应对不同类型的伪造语音。

图 2 不同模型在ASVspoof 2019 LA各伪造攻击类型上的EER比较
2)消融实验
为验证FLADD各核心模块的有效性,本文分别对双分支检测结构、Dual-Prototype策略和MFAW机制进行了消融实验。结果表明,Res2Net与Rawformer能够提供互补的频谱与波形信息;采用独立双原型能够更好地适应两个分支不同的特征空间;完整MFAW相比移除单一加权因素的变体取得更优结果,验证了各模块设计的有效性。

表2 FLADD各核心模块的消融实验结果
3)隐私泄露风险评估
除检测性能外,本文进一步从说话人成员信息和语音内容重建等角度评估FLADD的潜在隐私泄露风险。在说话人成员推断实验中,FLADD在Non-overlap场景下的攻击AUC为0.644;在白盒语音重建实验中,FLADD得到的重建结果更加模糊且接近噪声,说明攻击者更难从其表示中恢复详细的原始时频信息。

图3 白盒反演攻击下SafeEar与FLADD的语音重建结果比较
结 论
本文提出了一种面向隐私敏感场景的联邦音频深伪检测框架FLADD,通过双分支检测网络、Dual-Prototype策略和MFAW自适应聚合机制,从特征建模、客户端优化和服务器聚合三个层面提升Non-IID条件下的联邦深伪检测能力。
在ASVspoof 2019 LA和ASVspoof 2021 LA上的实验结果表明,FLADD能够在原始语音保持本地的条件下取得具有竞争力的检测性能,并在客户端掉线、不同客户端规模以及严格说话人划分等联邦场景下保持较好的稳定性。同时,多种隐私攻击实验进一步验证了数据本地化训练在保护说话人和语音内容信息方面的潜力。
