AudioCC交我学

作为学术研究者与实践者的连接点,我们致力于打造一个专注于语音技术的学术交流平台——「AudioCC交我学」专栏。在这里,我们将以简洁、专业的视角,解读听觉认知与计算声学领域的前沿论文,分享技术创新与应用实践的最新动态。我们将用通俗易懂的语言拆解复杂理论,用数据与实验结果验证技术价值,带你快速了解最新、最有趣的学术论文,打破学术与大众之间的壁垒,让你在碎片化的时间里也能 get 到前沿知识!


一、任务介绍:什么是音频/语音水印(Audio Watermarking)?

随着语音克隆与生成式语音质量快速提升,诈骗、深度伪造传播、版权与合规风险显著上升。仅依赖被动检测(classifier)容易遭遇域迁移失效;水印提供一种更“主动”的provenance / attribution路径:在生成/分发阶段嵌入隐蔽标记,使得后续能够检测或解码,从而支持鉴别、溯源与合规审核。


二、任务分析:系统由哪些模块构成?如何部署?

一个典型水印系统包含三部分:

1. Generator(嵌入器):特征提取 → 比特嵌入 → 融合 → 生成水印音频;

2. Distortion layers(失真/攻击模拟):训练时模拟攻击分布;

3. Extractor/Detector(提取器/检测器):输出“是否带水印”或直接解码比特。

部署上常见两类:

  • Model-level:平台在生成端强制加水印;

  • User-level:在分发侧加水印(更难),且两者面对的攻击者能力假设不同,尤其在VC/TTS场景下差异更大。


三、 挑战与威胁模型:AI时代攻击面变了

本次分享的主设定是黑盒攻击(不需要梯度),攻击目标是“去水印 + 保持高音质”;AI时代的新现实是:VC/TTS可以通过“重建音频”绕开水印,这类攻击往往比传统加噪/压缩更强。

攻击面按来源可分三类:

  • Signal-level:pitch shift / time stretch / cut / codec / filter / noise …

  • Physical:播放-录制(距离、环境、设备)

  • AI-induced:VC / TTS(zero-shot vs adaptive)

同时也需要警惕两类“对齐假设”被破坏:

  • 频率对齐假设容易被pitch shift破坏;

  • 时间对齐假设容易被time stretch / cut破坏;仅靠“加噪/压缩”不足以证明鲁棒。


四、评测口径:不仅要“能解出”,还要“在高音质约束下能解出”

分享中强调三组指标:

  • Fidelity:嵌入后音质(听感/客观指标);

  • Robustness:攻击后仍可检出/提取;

  • Fidelity-tolerant robustness:在ViSQOL/PESQ等音质约束下比较鲁棒性(更贴近真实对手)。

评测设计上,复现多个公开水印方案,在同一框架下对信号级/物理级/AI诱导攻击进行系统对比,并输出ACC + 音质约束下鲁棒性。数据覆盖语音(LJSpeech、LibriSpeech)以及更复杂域(歌声/音乐,如M4Singer),任务以multi-bit为主,ACC是关键指标。


五、关键发现:哪些攻击“高音质也能打穿”?

以下结论为本次分享的核心takeaways:

5.1 Pitch shift:几乎“通杀级”去水印

所有方案都对pitch shift脆弱;即使在高音质(ViSQOL > 4)的约束下仍可显著去水印,ACC < 0.6,接近“近乎完全移除”。

5.2 去同步(time stretch / cutting):多数方法致命,冗余嵌入是关键缓解

除Timbre / WavMark / Patchwork外,多数方案对time stretch(中等音质)敏感,ACC < 0.5;“重复嵌入/冗余”能显著增强抗去同步能力。

5.3 噪声、MP3、重采样:对“覆盖过训练失真”的方法相对可控

AudioSeal、Timbre、RobustDNN、FSVC对常见扰动相对更稳,多数情况下ACC ≥ 0.7,部分可 > 0.8;主要原因是训练阶段覆盖这些失真并进行结构适配。

5.4 低通(LPF)往往更危险:很多水印模式“寄生在高频”

高通下多数方案ACC > 0.8,但低通常导致ACC掉到 < 0.6(少数例外)。

5.5 物理重录:强分布外扰动,远距离普遍失守

真实分发常见外放/盗录,链路叠加混响、噪声、频响与距离衰减,且与数字域失真不同、难覆盖。多数方案数字域ACC≈1,但重录后常降到ACC≈0.5;远距离(2.5m/5m)几乎全部掉到 < 0.6,甚至 < 0.4。

5.6 VC/TTS:高音质的“重建式去水印”

  • VC:zero-shot与adaptive/few-shot都有效,ACC被压到约50%。

  • TTS:zero-shot下所有方案ACC≈50%;adaptive下仅Timbre在其条件下表现出一定存活。

总体判断:SoK对当前语音水印给出偏负面结论,根因可概括为vulnerability + irrevocability。


六、基准评测补充:SoK vs AudioMarkBench(从比特恢复走向“检测部署视角”)

本次分享明确两类评测核心差异:SoK侧重比特恢复率与攻击覆盖面,AudioMarkBench补齐检测部署视角四大关键维度,更贴近实际落地需求。

• 同时评测Removal(移除)与Forgery(伪造),规避“栽赃式误报”风险;

• 引入FNR/FPR(漏报/误报率)+阈值τ协议,量化检测性能;

• 考量黑盒查询预算:攻击者大量查询检测器API时,移除攻击的可行性;

• 评估公平性:分析不同语言、性别组的鲁棒性差异。

核心发现:黑盒伪造攻击通常需大幅牺牲音质;但黑盒移除攻击,在攻击者可高频查询检测器API时,仍能在保音质前提下成功。


七、代表方法速览

  • AudioSeal(ICML’24):局部化水印,联合生成器/检测器与样本级定位损失,加入感知损失;检测端单次前向,速度显著提升。

  • MaskMark(ICASSP’24):谱图乘性掩码注入密钥,增强对神经变换、部分信号处理的鲁棒性。

  • Timbre Watermarking(2023):面向语音克隆,频域嵌入+重复嵌入提升稳健性;训练用失真层模拟克隆链路,增强泛化能力。

  • WavMark(2024):解决长语音定位问题,INN可逆网络端到端水印;BFD替代SyncCode,滑窗匹配定位,偏移模块兼容定位偏差解码。

  • TraceableSpeech(2024):内生式水印,联合优化TTS与水印,帧级嵌入/提取,对语音拼接更稳定。

  • DiscreteWM(2025):离散隐空间抗连续扰动,VQ表征+ID模运算嵌入,容量达1秒1–150bits。


八、结论与行动项:水印落地“可依赖”的核心短板

要实现可部署、可迭代的音频水印方案,优先聚焦三大主线:

  1. 训练层面:覆盖生成式重建、物理链路等更多真实场景失真;

  2. 结构层面:强化同步/定位机制,降低对固定频带、帧对齐的依赖;

  3. 安全层面:实现密钥轮换,降低伪造、覆盖攻击的可行性。


九、参考文献

1. Wen Y, Innuganti A, Ramos A B, et al. SoK: How robust is audio watermarking in generative AI models?[J]. arXiv preprint arXiv:2503.19176, 2025.

2. Liu H, Guo M, Jiang Z, et al. Audiomarkbench: Benchmarking robustness of audio watermarking[J]. Advances in Neural Information Processing Systems, 2024, 37: 52241-52265.

3. San Roman R, Fernandez P, Elsahar H, et al. Proactive Detection of Voice Cloning with Localized Watermarking[C]//ICML 2024-41st International Conference on Machine Learning. 2024, 235: 1-17.

4. O’Reilly P, Jin Z, Su J, et al. Maskmark: Robust neuralwatermarking for real and synthetic speech[C]//ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). IEEE, 2024: 4650-4654.

5. Liu C, Zhang J, Zhang T, Yang X, Zhang W, Yu N. Detecting Voice Cloning Attacks via Timbre Watermarking[C]//Network and Distributed System Security Symposium. 2024. DOI:10.14722/ndss.2024.24200.

6. Chen G, Wu Y, Liu S, et al. Wavmark: Watermarking for audio generation[J]. arXiv preprint arXiv:2308.12770, 2023.

7. Zhou J, Yi J, Wang T, et al. TraceableSpeech: Towards Proactively Traceable Text-to-Speech with Watermarking[C]//Proc. Interspeech 2024. 2024: 2250-2254.

8. Ji S, Jiang Z, Zuo J, et al. Speech watermarking with discrete intermediate representations[C]//Proceedings of the AAAI Conference on Artificial Intelligence. 2025, 39(23): 24239-24247.