今天研读《Adversarial Diffusion Model: Generating High-Quality and Undetectable Images From Scratch》
一句话概述本文:作者提出了一种在预训练扩散模型上“直接从头生成”的方法,旨在避免后处理引入的失真,从而直接生成同时具备高质量(视觉逼真且无后处理失真)与不可检测性(能欺骗分类检测器)的对抗图像。
1. 为什么要提出 ADM ?
近年来图像生成技术发展显著,能够快速、便捷地生成高质量且视觉逼真的图像(即 AI 生成图像)。这种图像的扩散引发了公众担忧,促使研究人员提出了多种用于准确分类识别 AI 生成图像的检测器。
另一方面,在攻击侧,为了应对检测器,研究人员提出了两类对抗思路及其组合,但普遍受制于处理方式:
思路一:添加微小扰动
在图像中引入细微扰动以欺骗检测器,具体可在空间域、频域或潜空间中实施。
思路二:消除生成痕迹
移除不同生成技术留下的生成痕迹,使 AI 生成图像的统计特征更贴近真实图像。
思路三:混合策略
将添加扰动与消除痕迹结合使用,以提升对抗样本的效果。
共性局限: 上述方案主要集中于对已生成的图像进行后处理,这往往会伴随明显的图像质量下降。
为了保持生成图像的质量,已有研究尝试绕过“先生成再后处理”的流程:
可行性验证: 有工作尝试使用生成对抗网络(GAN)直接生成能够欺骗多种检测模型的图像,并证明该路径在生成对抗样本时有利于改善图像质量。
适用范围受限: 这类方法仅适用于基于 GAN 的模型架构,且应用场景仅限于伪造人脸图像的生成。
对当前广泛应用的扩散模型,如何直接生成具备欺骗当前 SOTA AI 图像检测器能力的图像,在学术界依然是一个悬而未决的问题。这一空白构成了本文提出 ADM 的核心研究动机。
作者探索基于预训练扩散模型“从头生成”对抗样本的可行性,核心目标是将对抗样本生成过程与图像生成过程相互结合,以避免后处理操作对图像质量产生干扰。主要贡献在于提出对抗扩散模型(ADM),在预训练的 Stable Diffusion(SD) 模型之上赋予其生成对抗样本的能力。下表提供了 ADM 的一个简介:
在图像质量评估上,ADM 优于现有的 SOTA 对抗样本生成方案;在攻击效果上,ADM 在多数情况下取得了更高的攻击成功率。此外,作者特别指出,当目标检测器与替代检测器不同时,ADM 的优势尤为明显。
下面列出这项工作的贡献清单:
提出了对抗扩散模型(ADM),能够针对扩散模型直接从头生成对抗样本。
提出了对抗去噪 U-Net,用于搜索对抗潜变量,实现兼顾提示词一致性与欺骗检测器的能力。
提出了对抗潜变量补偿方法,通过调节重构误差来规避依赖重构特征的检测器(如 DIRE、LaRE)。
设计了谱对齐损失来训练对抗解码器,使生成的图像具备与真实图像相似的频谱特性。
下图展示了本文方法与传统方法的对比:

2. 方法论

ADM 的处理过程可分为四个环节描述,共有三个处理阶段:
网络结构改造(模型构建):在原生 SD 去噪 U-Net 中接入一个可训练的条件网络,构建为“对抗去噪 U-Net ”。这是为了给潜变量提供可控的调节能力。
对抗潜变量搜索(扩散去噪阶段):引入一个替代检测器作为指导信号。在扩散模型的 T 个时间步去噪过程中,引导对抗去噪 U-Net 进行搜索,输出初步的对抗潜变量,记作 z 。
潜变量重构误差对齐(补偿阶段):将初步搜索得到的对抗潜变量 z 送入潜变量补偿模块做进一步优化。对齐目标是使潜变量的重构误差贴近真实图像潜变量所对应的重构误差。优化后的对抗潜变量记作 ze 。
频域约束与最终图像生成(解码阶段):将优化后的潜变量 ze 输入对抗解码器,生成最终的对抗样本图像。该对抗解码器基于谱对齐损失训练而成,专门用于缩小生成图像与真实图像之间的频谱差异。
可以用下面的流程图描述 ADM 的处理管线:

对比传统 SD 的处理管线:

可以发现,本文提出的 ADM 正是沿着这条链路对三个核心环节进行了针对性替换与增强:
U-Net 阶段: 原生 U-Net 仅受文本提示词引导;ADM 增加了条件网络与替代检测器,在去噪过程中搜索具备欺骗能力的对抗潜变量 z 。
潜变量阶段: 原生流程直接解码;ADM 增加了潜变量补偿模块,把 z 修正为 ze ,对齐真实图像的重构误差特性。
解码阶段: 原生使用标准 VAE 解码器;ADM 使用以谱对齐损失训练的对抗解码器,消除解码过程带来的高频伪影。
2.1 对抗去噪 U-Net
对抗去噪 U-Net 由以下三部分共同构成:
条件去噪 U-Net : 负责在去噪反向扩散过程中执行具体的特征计算与去噪更新。
图像解码器: 将潜变量映射至像素空间,供检测器进行特征分析。
替代检测器: 在去噪搜索过程中提供对抗导向信号,引导生成图像规避检测。
作者借鉴了 ControlNet 的经典架构思想来构建其条件网络:
结构复刻: 复制了一份可训练的 SD 原生去噪 U-Net 的编码器,在文中被称为条件编码器。
连接方式: 采用了一组零卷积层将条件分支与主干网络相连接。
设计意图: 通过保持原模型主干的同时增加侧枝通路,实现对去噪潜变量的可控调节,而不会在训练初始阶段破坏预训练模型原有的去噪生成能力。
与原生 ControlNet 的核心区别在于输入的界定:
ControlNet 的原意是利用外接条件(如线条、姿态)去“控制画面的具体结构”;而 ADM 并不需要改变用户想画的内容,它只是在输入完全保持常规文生图一致的前提下,利用这套旁路结构去微调去噪轨迹,进而搜索能够欺骗替代检测器的对抗潜变量。
条件去噪 U-Net 的具体实现
该模块的统一输入集合记为 I = {Tt, ct, zt} :
Tt :时间步的嵌入编码,由位置编码获得。
ct :文本提示词的嵌入特征,由 CLIP 文本编码器提取。
zt :当前时间步的潜变量。
首先,在主干编码器侧,预训练并冻结权重的 SD 编码器在参数 θ 的控制下提取多尺度特征:

条件网络中的条件编码器输入完全相同的 I ,在可训练参数 θc 下学习控制特征 Yc :

通过零卷积层将条件特征 Yc 与主干特征 Yo 结合:

最终得到的特征 Y' 通过跳跃连接输入到 U-Net 的解码器中。
注:这里的“零卷积操作”指的是在训练起始阶段采用零卷积,它是一种权重和偏置全部初始化为零的 1 * 1 卷积层。在训练刚刚开始的第 0 步,零卷积层的输出为零,相当于条件网络分支完全没有生效,主干网络输出的特征与原版预训练 SD 模型完全相同。这样可以防止随机初始化的新权重破坏预训练模型原本已学到的生成能力。在第一轮反向传播后,优化器就会更新 W 和 b ,使它们脱离 0,从而逐步、温和地将条件网络的特征信号引入到去噪主干中。
作者采用零卷积,能够让模型能够在一个完全保持原生生成能力的起点上,平稳地学习如何搜索对抗潜变量。
对抗潜变量搜索
对抗潜变量搜索旨在找到一个满足以下两个要求的最优潜变量:
能够生成内容或风格与提示词一致的图像。
能够生成可以逃避检测器检测的图像
为了进行对抗训练,作者引入了一个替代检测器 D(·) ,该网络本质上是一个判断图像属于真实还是 AI 生成的二分类模型。对抗训练损失定义为:

zt :时间步 t 下的去噪潜变量。
G(·):将潜变量映射至像素空间的图像解码器。
D(G(zt)) :替代检测器将解码图像判定为“真实图像”的置信概率。通过最小化该对数损失,迫使生成图像能够误导检测器,使检测器将其判定为真图。
潜变量搜索的总损失函数结合了扩散模型的原生损失与对抗损失:

Ldiff :扩散模型原有的去噪生成损失,用于保证文本与图像质量的一致性。
Ladv :对抗损失,用于提供规避检测的梯度方向。
该对抗潜变量搜索在扩散过程的每一个时间步都会执行。在经历 T 个时间步后,即可获得一个初步的对抗潜变量 z 。该潜变量能够在一定程度上生成兼顾提示词一致性并抵御检测器的图像。
2.2 潜变量补偿模块
前人研究表明,真实图像与 AI 生成图像在“重构误差”上存在显著差异。所谓的重构误差,是指图像与利用生成模型重新生成的图像之间的差异(可在空间域或潜空间计算)。扩散模型生成的图像如果再次使用扩散模型进行重构,其重构误差通常较小;而真实图像在经历加噪和重构后,由于不是该扩散模型生成的,重构误差往往明显更大。DIRE 、LaRE 等检测器正是依赖这一差异来进行辨别。
于是,作者设计了潜变量补偿模块,目的是主动增大生成图像的重构误差,使其贴近真实图像的重构误差表现。
为了获取对重构误差更鲁棒的估计,作者选取了 M 套不同的噪声调度方案。在某个特定的时间步下,第 j 套噪声调度方案拥有一个固定的标量缩放因子 αj 。当我们在前面的对抗潜变量搜索阶段得到了一个初步的对抗潜变量 z 后,我们可以一步到位地得到在该套噪声调度方案下的带噪对抗潜变量的条件概率分布:

注:不要把这里的“时间步”理解为系统在动态迭代。这里的时间步只起到了一个静态离散索引的作用。给定一套噪声调度方案,给定一个时间步索引 t ,就能得到相对于该噪声调度方案唯一的标量缩放因子 αj 。
使用对应调度参数下的 SD 去噪 U-Net 进行单步去噪,获得重构潜变量:

采用 L2 范数计算原始潜变量与重构潜变量之间的距离:

为了提高重构误差估计的稳定性,在每个噪声调度下重复执行 S 次加噪与去噪过程,定义平均重构损失为:

在获得重构损失后,作者采用类似快速梯度符号法(FGSM)的梯度上升策略来对潜变量进行微调。
首先,计算每个调度下的平均重构损失关于潜变量 z 的梯度向量:

跨 M 个不同的噪声调度聚合梯度信息,先对每个调度的梯度向量做 L2 归一化处理消除尺度差异,再求算术平均:

在潜空间内沿梯度上升方向对潜变量施加扰动:

注意,这里是经典的 FGSM 的思路。当扰动向量的无穷范数存在固定上界 δ 时,沿梯度的符号函数 sign(g) 方向施加扰动,能让损失函数上升最快。
通过该操作,ze 具有了与真实图像相仿的更大重构误差,从而破坏了依赖重构误差分布的取证检测器的分类依据。
下面展示了潜变量补偿模块的算法流程:

为什么这个模块能同时对抗 DIRE 和 LaRE 两种检测器呢?
DIRE : 在像素空间进行扩散重构,并基于像素级重构误差来判定真伪。
LaRE : 在潜空间中度量扩散重构误差进行检测。
由于 AI 生成图像是通过解码器从潜变量中确定性解码还原而来的,潜空间中重构误差的增加,会自然传递为像素空间重构误差的增大。因此,作者在潜空间实施的重构误差增大策略,不仅能使生成图像在潜空间重构时偏离模型流形(应对 LaRE),映射到像素空间后同样能呈现出类似于真实图像的更大重构残差(应对 DIRE)。
2.3 对抗解码器
除了前面讨论的重构误差外,前人研究表明,AI 生成图像与真实图像在频谱上同样存在显著差异。这一统计差异尤其体现在高频分量上。许多频域检测算法正是通过分析图像傅里叶变换或小波变换后的高频分布来识别 AI 图像的。
高频统计差异主要归因于生成模型内部反复执行的上采样过程:常见的双线性插值、转置卷积等上采样操作在扩大特征图尺寸时,容易在频域中引入周期性或规律性的高频伪影,这些痕迹在自然拍摄的真实图像中并不存在。
因此,作者设计了对抗解码器,该模块的核心目标是最小化真实图像与对抗样本在高频分量之间的差异。既然原生解码器的上采样机制会引入高频伪影,作者便通过专门微调解码器,使其在把潜变量还原回像素空间时,主动抑制这类非自然的高频特征,对齐真实图像的频域分布。
为了量化图像在频域上的特征,作者引入了快速傅里叶变换(FFT):

F :代表快速傅里叶变换。
f(· ; r) :用于提取频率高于设定阈值 r 的高频分量函数。
作者特别说明,当阈值参数 r 增大时,会有更多的高频分量被保留下来。
在如何让生成图像的高频分量贴近真实图像的问题上,作者指出了现有方案的缺陷并提出了改进思路:
固定原型方案的缺陷: StealthDiffusion 采用的策略是从真实图像中预先计算出一个平均高频分量作为“原型”,并促使每个对抗样本的高频分量向该原型对齐。然而,高频分量本身包含着与图像内容和风格相关的细节信息,使用一个固定的“全局原型”难以适配具有不同内容和多样风格的图像。
逐批次对齐: 为解决上述问题,作者提出在训练对抗解码器时,采取逐批次对齐真实图像与对抗样本高频分量的策略。该策略能够根据每个批次内样本的具体内容进行相对自适应的调整,有助于增强模型性能。
在一个批大小为 B 的训练批次中,包含真实图像批次:

以及由 ADM 对应生成的对抗样本批次:

首先计算批次内平均高频分量。真实图像批次的高频均值:

以及对抗样本批次的高频均值:

然后,采用 L2 范数度量两类批次平均高频分量之间的统计差异:

该损失用于引导对抗解码器在更新参数时,最小化生成样本与真实样本之间的频谱高频分布偏离。
最终得到对抗解码器的综合训练损失:

L1 :继承自原生 SD 解码器的平均绝对误差损失(MAE),用于约束图像像素级的基本轮廓与色彩重构。
Llpips :感知相似度损失,用于保障生成图像在人类视觉感知上的质量。
Lsa :新加入的谱对齐损失,用于抑制上采样过程中产生的高频统计伪影。
训练完成后,该对抗解码器将直接替代原扩散模型原有的 VAE 解码器。虽然在训练时需要借助批次均值来计算 Lsa ,但在推理生成图像时,不再需要成批图像来进行对齐,模型能够以常规单图生成的模式直接输出最终图像。
3. 实验与数据
3.1 实验设置
评估检测器设置
Baselines
数据集、评价指标与 ADM 实现参数
3.2 对比实验
ADM 在不同超参数配置下的攻击性能
实验以 ResNet-50(R) 作为替代检测器,同时测试其对 Swin-T 的攻击成功率(ASR)。
调优策略采用控制变量法:设定初始参数后,依次改变单一参数的取值,找到该参数的最优值并予以固定,随后再进行下一个参数的寻优。初始设定为:δ = 0.1 、M = 2 、r = 4 、B = 32 。
实验结果:

ADM 与各基线方法在不同检测器下的对比实验
下面是对通用分类检测器的攻击表现:

白盒攻击场景(目标检测器与替代检测器相同):
所有对抗生成方法均表现出较高的攻击成功率。其中,ADM 在所有设定下的 ASR 均超过 96%。
黑盒迁移攻击场景(目标检测器与替代检测器不同):
所有方法的 ASR 均出现显著下降。但在多数情况下,ADM 的 ASR 明显高于现有的基线方案。
下面是对前沿 AI 图像检测器的攻击表现:

针对 CNNSpot、UniDetection、DIRE 与 LaRE 四款专用检测器,ADM 在不同替代检测器下均表现出较基线更优的攻击效果:
对抗 CNNSpot:
使用 ResNet-50 (R)、DeiT (D)、EfficientNet-B0 (E) 和 Swin-T (S) 作为替代检测器时,ADM 的 ASR 分别达到 98.66%、96.26%、99.26% 和 93.42%,持续高于所有基线。作为对比,表现次优的 AdvDiff 在 R 和 D 引导下 ASR 仅为 87.56% 和 87.58%,分别比 ADM 低 11.10% 和 8.68%。
对抗 UniDetection:
在替代检测器为 E 和 S 时,ADM 的 ASR 相较次优方案(AdvDiff)分别高出 13.44% 和 10.97%。
对抗 DIRE 与 LaRE(基于重构误差的检测器):
多数基线方法在面对此类检测器时难以成功。
对抗 LaRE 时,基线方法的最高 ASR 为 91.25%,而 ADM 达到 99.01%(提升 7.76%)。
无论使用何种替代检测器,ADM 对抗 DIRE 和 LaRE 的 ASR 均分别高出次优方案 8% 和 7% 以上。
机制归因: 作者将对抗 DIRE 和 LaRE 的性能表现归因于潜变量补偿模块,该模块使对抗样本的重构误差贴近真实图像。
下面是以 DIRE 作为替代检测器的专项测试。该组实验专门将重构类检测器 DIRE 设为替代检测器,检验模型对 DIRE(白盒)和 LaRE(黑盒迁移)的攻击效果,并同步测定图像质量指标 FID:

数据分析:
上述对比实验表明,ADM 在抵御各类检测器时具备明显优势;特别是在目标检测器与替代检测器不一致的黑盒迁移场景中,其逃逸检测的能力与泛化性明显优于现存对抗生成方案,同时保持了更优的图像质量。
3.3 系统性能评估实验
对抗图像样本的质量分析
下面是定量图像质量评估(FID 指标):

Table IV 评估结论: 无论采用 ResNet-50 (R)、EfficientNet-B0 (E)、DeiT (D) 还是 Swin-T (S) 作为替代检测器,ADM 的 FID 数值均持续低于各基线方案。
生成范式对比: 实验结果表明,ADM 这种在扩散生成过程中“从头生成”对抗样本的策略,在图像分布质量上优于现有的 SOTA 对抗后处理方案。
下面是视觉感知质量与语义一致性:
现有方案的视觉缺陷:
后处理方法: 容易在画面中引入明显的噪声图案,使原版 Stable Diffusion 生成的图像发生模糊或色彩失真。
过程加噪方法(AdvDiff): 在扩散生成阶段持续注入对抗噪声,使得图像整体质量较差。
ADM 的视觉表现: 生成的图像画面干净且视觉伪影较少,视觉观感与原生 Stable Diffusion 的生成图像相当。
内容差异与文本匹配度:
虽然使用了与原版 SD 相同的提示词,但由于去噪过程中执行了对抗潜变量搜索,ADM 生成的具体画面内容与 SD 原图并不完全一致。
图像内容依然与文本提示词保持良好的一致性。测试测得原生 SD 生成图像的 CLIP 得分为 27.53,ADM 对抗样本的 CLIP 得分为 26.31,两者处于相近水平。
下面是频域伪影与频谱分析:
作者利用 2D 傅里叶幅度谱及其高频放大区域对不同方法的频域分布进行了检验(替代检测器为 ResNet-50):
归因分析:这组对比验证了第三模块(对抗解码器与谱对齐损失)的实际效果:通过在微调解码器时强制对齐真实图像的高频统计特征,成功消除了上采样机制原本容易固化在频域中的交叉状伪影,在抵御频域取证检测的同时保障了图像的真实感。
对抗样本的鲁棒性
本节评估了对抗样本在面对现实世界常见的图像后处理与信道失真时的鲁棒性。测试将 ResNet-50 (R) 设为替代检测器,并将 EfficientNet-B0 (E) 设为目标检测器,构成严格的黑盒跨模型迁移评测场景。
作者选取了四种不同强度的常见图像变换操作,具体表现整理如下:

这组鲁棒性实验表明,相比传统仅在像素表层施加脆弱微小扰动的后处理攻击,ADM 从潜空间扩散机制与频域解码端联合构建的不可检测性,在面对有损压缩、空间几何插值及滤波模糊等退化操作时具有更强的存活率。
3.4 消融实验
消融实验通过在基线对抗潜变量搜索(ALS)上逐步叠加对抗解码器(ADspl)与潜变量补偿模块(LCM),评估了各组件对攻击成功率(ASR)与图像质量(FID)的独立贡献,并进一步验证了逐批次谱对齐损失 Lsa 相比固定原型方案的优越性。

此外,为验证公式 (14)-(16) 中“逐批次动态对齐”相较 StealthDiffusion “固定原型对齐”的必要性,作者设计了对比实验:
ADfix 的构建方式: 预先计算 GenImage SDv1.5 子集中所有真实图像高频频谱的算术平均值,将其作为固定不变的“统一频谱原型”,训练解码器向其对齐。
对比结果:
ASR 表现: 在所有替代检测器设定下,使用 ADfix 的攻击成功率相较于 ADspl 均发生明显下降。
图像质量: 使用 ADfix 导致 FID 出现大幅恶化(显著上升)。
归因分析: 实验结果验证了作者在理论部分的论据——图像的高频分量天然与具体画面的内容和风格强绑定。强行要求多样化图像去拟合单一固定的全局频域均值,会破坏特定图像原本合理的高频纹理,既损害了视觉保真度,又削弱了对抗迁移性能;而逐批次动态对齐则保持了内容自适应性。
4. 讨论与总结
讨论
尽管本文的研究重点是针对扩散模型的图像反取证,但作者指出 ADM 框架的三大核心组件具备向其他生成范式与应用场景迁移的可行性:
核心组件的通用可插拔性:
对抗潜变量搜索(ALS)、潜变量补偿模块(LCM)以及对抗解码器(Adversarial Decoder)并非严格绑定于特定的文生图流程,具备作为即插即用模块嵌入其他生成体系的潜力。
潜在的应用模型类别:
人脸伪造生成模型: 扩展至人脸伪造生成任务。
图像编辑模型: 扩展至基于局部修复或指令编辑的图像处理任务。
对应的替代检测模型设想:
若将该框架迁移至上述新场景,指导对抗优化的替代模型也可相应替换为前沿的专用模型:
使用 SOTA 深度伪造检测方法作为替代目标,用于引导生成不可识别人脸;
使用 图像篡改定位方案作为替代目标,用于生成无法定位篡改区域的编辑图像。
总结
作者在本研究中提出了一种对抗扩散模型(ADM),该模型赋予了预训练 Stable Diffusion(SD)模型生成对抗样本的能力。在 ADM 中,通过使用条件网络对原始 SD 去噪 U-Net 进行扩展,构建了对抗去噪 U-Net 。在替代检测器的引导下,ADM 利用对抗去噪 U-Net 执行对抗潜变量搜索。所获得的对抗潜变量通过潜变量补偿得到进一步优化,使对抗潜变量的重构误差与真实图像潜变量的重构误差相近。此外,作者设计了谱对齐损失来训练对抗解码器,以生成频谱特征与真实图像相似的图像。ADM 能够生成与提示词保持一致的对抗样本,并在图像质量方面优于 SOTA 对抗样本方案。当目标检测器与替代检测器不同时,在大多数情况下,ADM 相比 SOTA 取得了显著更高的攻击成功率。