学术研究

基于像素与潜空间双重表征的AI拖拽式编辑图像检测方法

  • 邹鑫平 1, 2, 3, 4 ,
  • 李昊东 , 1, 2, 3, 4, *
展开
  • 1. 深圳大学电子与信息工程学院,深圳 518000
  • 2. 广东省智能信息处理重点实验室,深圳 518000
  • 3. 深圳市媒体信息内容安全重点实验室,深圳 518000
  • 4. 软牛人工智能技术联合创新中心,深圳 518000
李昊东,E-mail:

网络出版日期: 2026-01-04

基金资助

国家自然科学基金(U23B2022);广东省自然科学基金(2025A1515010234);深圳市优秀科技创新人才培养项目(RCYX20221008092922051)

版权

版权所有©《网络空间安全科学学报》编辑部 2025

Detection of AI drag-style edited images based on dual representation of pixel and latent space

  • ZOU Xinping 1, 2, 3, 4 ,
  • LI Haodong , 1, 2, 3, 4, *
Expand
  • 1. College of Electronics and Information Engineering, Shenzhen University, Shenzhen 518000, China
  • 2. Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen 518000, China
  • 3. Shenzhen Key Laboratory of Media Security, Shenzhen 518000, China
  • 4. SZU-AFS Joint Innovation Center for AI Technology, Shenzhen 518000, China

Online published: 2026-01-04

Copyright

Copyright ©2025 Journal of Aeronautical Materials. All rights reserved.

摘要

随着生成式人工智能技术的迅速发展,数字图像的篡改变得更加容易,如不加以控制,这些虚假图像将对社会产生严重危害。利用人工智能(Artificial Intelligence,AI)技术,用户可以便捷、全局式地生成虚假图像,也可以方便地使用拖拽式编辑等AI工具对图像局部进行伪造。AI拖拽式编辑的机理与传统篡改方法差异显著,导致已有的图像篡改检测技术难以有效识别AI拖拽式局部编辑图像,而已有的AI生成图像检测方法又难以区分AI局部编辑和AI全局生成。为了应对该挑战,本文提出一种针对AI拖拽式编辑图像的检测方法。通过对AI拖拽式编辑的过程进行分析,发现AI拖拽式编辑会在图像中留下不同于真实图像和全局生成图像的特定痕迹。基于此,设计了一种结合图像像素级表征和潜空间表征的检测方法,可以有效提升对AI拖拽式编辑图像的检测精度。为了支撑此研究,应用4种典型的基于扩散模型的AI拖拽式编辑技术,构建了一个包含9806张拖拽式局部伪造图像的数据集。在该数据集、真实图像和全局生成图像数据集上进行了大量实验,结果表明所提出的方法取得了良好的检测性能。

本文引用格式

邹鑫平 , 李昊东 . 基于像素与潜空间双重表征的AI拖拽式编辑图像检测方法[J]. 网络空间安全科学学报, 2025 , 3(4) : 111 -124 . DOI: 10.20172/j.issn.2097-3136.250418

Abstract

In recent years, the rapid development of generative artificial intelligence has made the digital image manipulation significantly easier. If left unchecked, these fake images could pose serious threats to society. With AI technology, users can effortlessly generate fake images on a global scale or use tools like drag-style image editing for localized manipulation. Currently, most research in digital image forensics focuses on identifying the globally AI generated images, with less emphasis on detecting locally tampered images. To address the security risks posed by such localized editing, a detection method for AI drag-style edited images was proposed. By analyzing the process behind drag-style editing, distinctive traces left by such operation were identified. Based on this, a detection method combining pixel-level characterization and latent space representations of images was designed, which could effectively improve the detection accuracy of AI drag-style edited ones. To support this research, four typical drag-style editing techniques based on diffusion models to construct a dataset of 9 806 locally drag-style edited images. Extensive experiments were conducted on this dataset, the real-image dataset, and the globally generated image dataset, and the results showed that the proposed method achieved excellent detection performance.

0 引言

基于扩散模型的拖拽式图像编辑技术通过直观的交互操作显著降低了图像篡改的技术门槛(如图1所示的篡改示例),但其易用性也加剧了图像真实性与可信度的危机,对公共舆论引导、知识产权保护乃至国家安全构成了潜在威胁。在此背景下,开发针对此类编辑行为的精准检测方法具有迫切需求。
图 1 由4种不同的AI拖拽式编辑技术产生的图像。在每个例子中,由左到右分别为输入图像、用户指令、编辑结果。对于一张给定的输入图像,用户通过拖拽点击和涂画编辑区域给出编辑指令,AI模型根据指令完成对输入图像的修改

Fig.1 Diagram of four different AI drag-style editing techniques. In each example, the sequence from left to right consists of the input image, user instructions, and the edited result. For a given input image, users provide editing instructions by dragging, clicking, and painting on the areas to be edited, and the AI model completes the modification of the input image based on these instructions

在当前图像鉴伪领域,研究者们针对不同的生成模型和伪造方式提出了多种检测方法。Wang等[1]聚焦生成对抗网络(Generative Adversarial Networks,GAN)生成的图像,通过分析11种卷积神经网络(Convolutional Neural Network,CNN)生成器的输出发现了系统性痕迹,并利用预处理和数据增强技术提升了模型泛化能力,但该方法依赖生成器的固有缺陷。Wang等[2]聚焦扩散模型生成的图像,通过比较输入图像与扩散模型重建图像的差异实现检测,该方法在扩散模型生成图像上表现优异,但因未适配局部特征变化而不能很好地检测局部编辑图像。Amoroso等[3]提出了文本辅助多模态方法,利用文本生成图像保留原始语义信息的特性对图像进行区分,但该方法假设语义与视觉严格对齐,而局部编辑可能破坏局部语义一致性却保留了全局语义,导致其检测性能波动。这些方法虽然在各自任务中取得了进展,但因特征设计局限于特定伪造类型(如全局GAN生成或扩散模型生成),未能适配局部编辑图像的局部特征变化与全局语义保留特性,所以在应对此类生成式局部编辑时面临挑战。
拖拽式编辑是生成式局部编辑技术的一种。本文针对拖拽式编辑带来的鉴伪挑战,系统性地揭示了其在图像像素空间与潜空间中产生的独特痕迹,并提出了解决方案。具体贡献如下:
(1)拖拽式编辑痕迹分析。通过深入分析拖拽式编辑的实现机制,首次揭示了此类编辑在像素空间中产生的异常和在潜空间中的局部不一致性。
(2)双重表征的鉴伪框架。基于拖拽式编辑痕迹,创新性地构建了融合像素空间与潜空间重建误差的双重表征网络模型,通过多尺度特征融合实现了痕迹的精准捕捉。在双重表征网络基础上,结合对比学习的特征区分机制,显著增强了模型对拖拽式编辑痕迹的鉴别能力。
(3)首个拖拽式编辑图像数据集。构建了包含9 806张图像的拖拽式编辑图像数据集,涵盖4种典型的基于扩散模型的拖拽式编辑技术生成的伪造图像。编辑区域掩膜与拖拽轨迹标注采用文献[4]提供的专业工具,通过人工进行专门标注,为领域研究提供了高质量的测试基准。
本文内容安排如下:第1节介绍人工智能(Artificial Intelligence,AI)拖拽式编辑技术及篡改图像检测方法;第2节分析AI拖拽式编辑技术的篡改痕迹,并提出相应的取证方法;第3节介绍拖拽式局部伪造图像数据集的构建过程;第4节展示实验结果并进行讨论分析;第5节对本文工作进行总结,并对未来研究进行展望。

1 相关工作

1.1 AI拖拽式编辑技术

拖拽式图像编辑的主要目标是以精准可控的方式编辑给定的图像,其关键思想是将复杂的图像编辑操作简化为直观的拖拽动作,从而使用户能够以较少的学习成本实现对图像编辑的精确控制。DragGAN[5]是交互式图像编辑领域的一项开创性工作,它利用点跟踪建模用户的拖拽操作,并通过预训练的GAN模型来合成编辑图像。由于该方法只擅长编辑由GAN生成的图像,所以其应用范围相对受限。目前,效果较好的AI拖拽式编辑技术主要以扩散模型(Diffusion Model)为基础,此类方法不仅能对模型生成的图像进行编辑,而且还能对用户输入的真实图像进行编辑。扩散模型的潜空间可以精确决定生成图像的空间内容布局[6],因此只须根据用户拖拽句柄相应地改变图像潜空间,就可以利用扩散模型对图像进行精细化编辑。DragDiffusion[4]基于扩散模型实现了拖拽式编辑,它利用UNet[7]中间层特征来监督噪声潜空间的优化,从而控制后续去噪过程而生成编辑后的图像。DiffEditor[8]在上述思想的基础上额外引入了图像提示编码,不仅支持单张图像的局部编辑,还能处理更为复杂的两张图像合成任务。同时,该方法还将随机微分方程采样局部地结合到常微分方程采样中,相比DragDiffusion进一步提高了编辑的灵活性。DragNoise[9]对UNet的中间层特征也进行了传播优化,实现了对图像局部细节的精细化调整,使得在保证图像内容整体一致性的同时增强了编辑的自然度。FreeDrag[10]提出了不需要点跟踪的策略,它引入模糊定位和线性搜索策略来缓解相似点的干扰,为点移动提供了有效的监督信号,从而更可靠地达成了预定编辑目的。为了提高编辑图像输出结果的稳定性,GoodDrag[11]采用一种拖拽与去噪并行处理的模式,避免了扩散误差累积对图像编辑效果的负面影响。FastDrag[12]致力于提高图像编辑的速度,其利用扭曲函数计算潜空间的扭曲向量,并采用高效的插值算法将编辑耗费的总时间缩短到秒级别。

1.2 篡改图像检测方法

随着图像内容生成技术的迭代更新,深度图像伪造手段从基于GAN的伪造和基于扩散模型的伪造,发展到基于AI模型的编辑。篡改手段越来越先进,也促使取证检测技术不断进步。为了对生成式伪造图像进行检测,学者们提出了一系列检测方法,主要分为基于手工启发式特征挖掘的方法和基于深度学习的方法。
基于手工特征的方法侧重探索伪造图像与真实图像之间的差异,如分析深度网络生成图像与真实图像在不同颜色分量下的差异[13],分析图像的不同频率成分[14],以及利用眨眼信号[15]等生物特征信号,或者利用人类观察到的伪造线索[16]等。
而基于深度学习的方法通常使用卷积神经网络自动学习篡改图像中的特征。例如,Wang等[1]研究发现ResNet50[17]可以较好地检测GAN生成的图像。对于由扩散模型生成的图像,Wang等[2]发现其与自然真实图像差异显著,能更好地被重建,故提出利用重建误差来识别扩散模型生成的图像。Liu等[18]设计了一个自上而下和自下而上的双路径特征提取网络,用于学习拼接、复制移动等图像中的篡改痕迹。Niloy等[19]提出使用图像RGB(Red Green Blue)和SRM(Steganalysis Rich Model)信息的融合特征的方法,来对篡改图像进行定位。Ojha等[20]提出使用预训练CLIP(Contrastive Language-Image Pre-training)模型来提取图像特征,以区分真实图像和生成图像。Tan等[21]在ResNet50网络前向传播中引入相邻像素关系计算,以提高模型区分真实图像和生成图像的泛化性能。
面对使用深度模型编辑图像所带来的新挑战,Sun等[22]分析了现有图像篡改检测方法的局限性,指出现有方法大多适用于固定的生成模式或已知的编辑类型,而在面对由生成式AI产生的复杂和新颖的篡改图像时往往表现不佳。该工作先收集真实世界的原始图像,使用Segment Anything[23]和BLIP2[24]模型获得图像及区域的文本描述,再结合ChatGPT 1构建一个生成式区域编辑图像数据集。值得注意的是,Sun等[22]并未考虑拖拽式图像编辑。鉴于拖拽式编辑同样会导致诸多潜在危害,本文工作首次对此类操作进行取证分析。

2 检测方法

2.1 拖拽式编辑痕迹分析

本小节对扩散模型全局生成技术和拖拽式编辑技术的实现过程进行梳理分析,目的是挖掘全局生成和拖拽编辑的关键痕迹差异。

2.1.1 扩散模型全局生成图像

扩散模型生成图像的输入是文本和图像,目标是对随机噪声逐步去噪,生成与文本描述匹配的全新图像。文本的跨模态融合机制在反向扩散阶段起作用。生成图像的核心过程是全局去噪,主要流程是前向扩散和反向扩散。前向扩散过程逐步向输入图像中添加高斯噪声,最终生成纯噪声图像;反向扩散过程使用U-Net结构预测噪声,并逐步恢复图像。

2.1.2 扩散模型拖拽式图像编辑

拖拽式编辑的输入是原图和拖拽指令(包括拖拽起始点和终点、拖拽区域R),核心目标是在保留原图大部分内容的前提下,对局部区域进行精确编辑。拖拽指令主要在局部噪声优化阶段起作用,通过控制点坐标和区域掩膜引导潜在表示的精准调整,最终影响重新去噪生成的编辑结果。使用扩散模型进行拖拽编辑的范式如下。
(1)输入定义。待编辑的原始图像$ I\in {\mathbb{R}}^{H\times W\times 3} $,拖拽编辑指令,包括起始点$ {p}_{\mathrm{s}\mathrm{t}\mathrm{a}\mathrm{r}\mathrm{t}}=\left({x}_{s},{y}_{s}\right) $、终点${p}_{\mathrm{e}\mathrm{n}\mathrm{d}}= $$ \left({x}_{e},{y}_{e}\right) $、拖拽掩膜M$ \in {\mathbb{R}}^{H\times W\times 1} $
(2)潜在表示提取。使用预训练的扩散生成模型将原图编码到潜在空间,符合以下公式:
$ {Z}_{\mathrm{i}\mathrm{n}\mathrm{i}\mathrm{t}}=\mathrm{E}\mathrm{n}\mathrm{c}\mathrm{o}\mathrm{d}\mathrm{e}\mathrm{r}\left(I\right)\in {\mathbb{R}}^{{d}} $
$ {M}_{\mathrm{i}\mathrm{n}\mathrm{t}\mathrm{e}\mathrm{r}\mathrm{p}}=\mathrm{I}\mathrm{n}\mathrm{t}\mathrm{e}\mathrm{r}\mathrm{p}\mathrm{o}\mathrm{l}\mathrm{a}\mathrm{t}\mathrm{e}\left(M\right)\in {\mathbb{R}}^{{d}} $
其中,$ {{Z}}_{init} $表示原始输入图像的潜在表示,$ {M}_{\mathrm{i}\mathrm{n}\mathrm{t}\mathrm{e}\mathrm{r}\mathrm{p}} $表示拖拽掩膜经过下采样所得的掩膜图像,d为潜在空间维度,其大小是$ 4\times \dfrac{H}{8}\times \dfrac{W}{8} $$ \mathrm{E}\mathrm{n}\mathrm{c}\mathrm{o}\mathrm{d}\mathrm{e}\mathrm{r} $表示图像到潜在空间的编码过程。
(3)反演阶段。将原始图像的潜在表示$ {Z}_{\mathrm{i}\mathrm{n}\mathrm{i}\mathrm{t}} $反演到扩散过程的特定时间步t,这个过程主要使用逆采样算法,如去噪扩散隐式模型(Denoising Diffusion Implicit Models,DDIM)反演[25],主要公式如下:
$ {Z}^{T}={{t}}_{\theta }^{-1}\left({\mathrm{z}}_{init},t\right) , $
其中,$ {{t}}_{\theta }^{-1} $代表DDIM反演算法,t是时间步,$ {Z}^{T} $表示输入$ {Z}_{\mathrm{i}\mathrm{n}\mathrm{i}\mathrm{t}} $的噪声编码,维度与$ {Z}_{\mathrm{i}\mathrm{n}\mathrm{i}\mathrm{t}} $一致。
(4)局部噪声优化。通过拖拽指令引导潜在表示的优化过程,确保编辑区域的形变符合用户意图,不同编辑方法(如DragDiffusion、FreeDrag、DragNoise等)的详细优化过程有差异,但主要损失函数设计都包括形变控制损失函数$ {\mathcal{L}}_{{\mathrm{drag}}} $和内容保持损失函数$ {\mathcal{L}}_{{\mathrm{content}}} $。具体计算可以表示为:
$ {\mathcal{L}}_{{\mathrm{drag}}}={\left\|P\left({Z}^{T},{p}_{{\mathrm{end}}}\right)-P\left({Z}^{T},{p}_{{\mathrm{strat}}}\right)\right\|}_{1} $
$ {\mathcal{L}}_{{\mathrm{content}}}={\left\|\left(Z-{Z}^{T}\right)\odot \left(1-{M}_{\mathrm{i}\mathrm{n}\mathrm{t}\mathrm{e}\mathrm{r}\mathrm{p}}\right)\right\|}_{1} $
其中,$ P\left(.,.\right) $为潜在向量到图像坐标的投影函数,$ \odot $表示逐元素点乘,$ {\mathcal{L}}_{{\mathrm{drag}}} $用于最小化拖拽路径上的几何偏差,$ {\mathcal{L}}_{{\mathrm{content}}} $用于约束非编辑区域的潜在表示与原图一致。局部噪声的优化综合使用这两个损失函数,目标如下:
$ {Z}^{\mathrm{*}}=\mathrm{a}\mathrm{r}\mathrm{g}\underset{z}{\mathrm{min}}\left({\lambda }_{1}{\mathcal{L}}_{{\mathrm{drag}}}+{\lambda }_{2}{\mathcal{L}}_{{\mathrm{content}}}\right) $
其中,$ {\lambda }_{1} $$ {\lambda }_{2} $是设计的参数,$ {Z}^{*} $是优化后的潜在表示。
(5)去噪生成。将优化后的潜在表示$ {Z}^{*} $作为生成模型去噪过程的输入,去噪过程公式如下:
$ {I}_{{\mathrm{edit}}}=\mathrm{D}\mathrm{e}\mathrm{c}\mathrm{o}\mathrm{d}\mathrm{e}\mathrm{r}\left({Z}^{*}\right) $
$ \mathrm{D}\mathrm{e}\mathrm{c}\mathrm{o}\mathrm{d}\mathrm{e}\mathrm{r} $表示解码,主要利用U-Net结构进行去噪生成,在此过程中空间注意力机制被用于增强编辑区域的生成权重,抑制非编辑区域的无关变化。
(6)后处理与融合。进行一些后处理操作,可能包括边缘平滑和颜色校正,以使编辑区域和非编辑区域看起来过渡自然。

2.1.3 关键差异与痕迹分析

扩散模型全局生成与拖拽式编辑在机理方面存在明显差异,具体对比如表1所示。全局生成通过前向扩散和反向扩散来实现,文本描述借助跨模态融合机制在反向扩散阶段发挥作用。而拖拽式编辑则采用内部优化策略,依次经历潜在表示提取、潜空间反演、局部噪声优化(利用拖拽指令和特定损失函数)、去噪生成以及后处理与融合等步骤。拖拽指令在局部噪声优化阶段实现了局部噪声空间重构。
表 1 扩散模型全图生成和拖拽式编辑总结

Table 1 Summary of full map generation and drag-editing of diffusion models

特征扩散模型全图生成扩散模型拖拽式编辑
输入文本或随机噪声或真实图像原图+拖拽指令
作用位置文本通过跨模态融合机制在反向扩散阶段起作用拖拽指令主要在局部噪声优化阶段起作用
核心操作全局去噪解码成新图像局部优化+去噪解码
关键步骤前向扩散(加噪)、反向扩散
(去噪)
潜空间反演、局部约束优化、去噪解码
输出特性完全新图像原图局部修改(保留全局
结构)
检测差异高频噪声全局分布局部高频伪影、掩码边界不一致性
基于这些机理的差异,我们认为:由扩散模型生成的内容可以再用扩散模型重建。真实图像未经过扩散模型生成,因此无法很好地重建。伪造图像由扩散模型生成,所以可以很好地重建。拖拽式编辑的范式(式(2)至式(6))表明,该编辑方法主要在拖拽区域中进行内容生成,因此拖拽式编辑图像的拖拽区域可以很好地重建,非拖拽区域不能很好地重建,这导致同一张图像内的重建能力出现分层,因此在拖拽式编辑图像中存在重建能力断裂的问题。
为此,采用变分自编码器(Variational Auto Envoder,VAE)提取各类图像的潜在表示并重建。选取与鸟站在树枝上内容相似的图像进行研究,如图2所示,拖拽图像和它的真实图像分别是图2(a)、图2(e),生成图像是图2(g)。对比重建前后,发现在重建图像中部分位置丢失了纹理细节,呈现出某种色彩的色块。在每种类型重建图像中用红框框出存在此类色块的区域,并分别计算拖拽图像、真实图像、生成图像重建结果的峰值信噪比(Peak Signal-to-Noise Ratio,PSNR)。相较于图2(d)和图2(f),图2(h)生成图像的重建图像中色块最少,只在尾部羽毛处出现,在树枝和背景中无色块,这表明相较于拖拽图像和真实图像,生成图像能够很好地重建。拖拽图像中鸟尾部看起来与身体不符合,但是在其重建图像(d)中,该区域可以被重建细节,而在非拖拽区域出现无法重建的部位。图2(d)中非拖拽区域无法重建的部位比图2(f)中少,表明相比真实内容,拖拽图像中非拖拽区域的内容可以更好地重建。总之,拖拽图像中非拖拽区域 的重建能力在原有基础上提升了,进一步验证了在拖拽式编辑图像中存在重建能力层次分级的现象。
图 2 重建图像分析

Fig.2 Reconstruction map analysis

2.2 方法概述

2.1节的分析提供了现象基础,促使我们从其他角度(潜在空间和像素层面)深入分析这种特征差异。真实图像源于现实场景采集,模型生成图像基于算法在潜在空间的映射生成,拖拽式编辑图像是对已有图像在潜在空间的局部调整,因此,不同的生成方式在潜在空间中的映射和重建过程会产生不同的误差。而像素表征可以直观地反映图像,所以提出两者表征结合的方法,以更全面地刻画图像。

2.3 网络模型设计

本文所设计的检测模型的网络结构如图3所示,主要包括3个部分:潜空间重建误差提取、特征编码器、特征融合,并在训练时引入对比学习设计。下面将分别介绍各个组成部分。
图 3 所提出方法的网络结构

Fig.3 Network structure of the proposed method

(1)潜空间重建误差提取模块。该模块主要由变分自编码器和对应的解码器(Decoder)构成。变分自编码器负责将输入图像X映射到潜空间中,得到潜在表示Z,这个过程可以表示为:
$ Z={\mathrm{VAE}}(X) $
其中,X$ \in {\mathbb{R}}^{H\times W\times 3} $代表输入图像,VAE是变分自编码器结构,Z代表图像潜在表示,维度是dd的大小是$ 4\times \dfrac{H}{8}\times \dfrac{W}{8} $,比输入图像更紧凑。在解码器部分通过一系列全连接层或反卷积层将潜在表示Z解码回原始像素空间,输出重建图像$ \widehat{{X}} $,该过程可以表示为:
$ \widehat{{X}}=\mathrm{D}\mathrm{e}\mathrm{c}\mathrm{o}\mathrm{d}\mathrm{e}\mathrm{r}\left({Z}\right) $
其中,$ \widehat{{X}}\in {\mathbb{R}}^{H\times W\times 3} $代表重建图像。在获得重建图像$ \widehat{{X}} $后,计算重建残差,即输入图像$ {X} $与重建图像$ \widehat{{X}} $之间的差异,如下式所示:
$ {E}={X}-\widehat{{X}} $
其中,$E \in {\mathbb{R}}^{H\times W\times 3} $代表图像潜空间重建误差。重建误差的大小可以反映不同类别图像在潜在空间中的差异。在训练阶段,将预训练扩散模型中的变分自编码器和解码器的权重直接导入该重建模块,并且保持这些权重的冻结状态,不参与后续的训练更新。这样做可以充分利用预训练模型的知识,从而提高潜在空间表示的质量和稳定性。
(2)特征编码器。特征编码器主要用于提取特征,本文选择使用经典的Resnet50网络,也可以选择其他网络结构。其中空域特征编码器加载了ImageNet预训练模型权重,此预训练模型权重提供了一个良好的初始化,可以利用在大规模数据集上学习到的丰富特征表示,使得模型更快收敛。而重建误差编码器则对随机初始化进行训练。该过程符合下式:
$ {F}_{p}=\mathrm{F}\mathrm{e}\mathrm{a}\mathrm{t}\mathrm{u}\mathrm{r}\mathrm{e}\left({X}\right) $
$ {F}_{q}=\mathrm{F}\mathrm{e}\mathrm{a}\mathrm{t}\mathrm{u}\mathrm{r}\mathrm{e}\left({E}\right) $
其中,$ {F}_{p} $$ {F}_{q} $的维度是$ 2\;048\times \dfrac{H}{32}\times \dfrac{W}{32} $$ \mathrm{F}\mathrm{e}\mathrm{a}\mathrm{t}\mathrm{u}\mathrm{r}\mathrm{e}\left({X}\right) $代表将X$ \in {\mathbb{R}}^{H\times W\times 3} $通过Resnet特征提取,$ \mathrm{F}\mathrm{e}\mathrm{a}\mathrm{t}\mathrm{u}\mathrm{r}\mathrm{e}\left({E}\right) $代表将潜空间重建误差E$ \in {\mathbb{R}}^{H\times W\times 3} $进行特征提取。
(3)特征融合。在利用特征编码器提取两种特征后,使用点乘操作将两种特征进行聚合。点乘操作能够有效地结合两个特征向量中的对应元素,从而捕捉它们之间的相关性,该过程满足下式:
$ {F}_{f}={F}_{p} \odot {F}_{q} $
其中,$ {F}_{p} $$ {F}_{q} $分别是像素分支特征和潜空间分支特征,$ \odot $表示逐元素相乘,$ {F}_{f} $代表融合后的特征,维度大小为$ 2\;048\times \dfrac{H}{32}\times \dfrac{W}{32} $。具体到每个位置上的计算表示为:
$ {F}_{f}\left({i},{j},{k}\right)={F}_{p}\left({i},{j},{k}\right)\cdot {F}_{q}\left({i},{j},{k}\right) $
其中,i表示通道索引,jk分别表示高度和宽度上的坐标。这种聚合操作在网络中不仅有助于保留每个特征向量的独特信息,还能增强特征间的相互作用。
特征聚合的目标是生成一个包含图像空域信息和潜空间重建误差信息的特征表示,聚合后的特征进一步通过多个不同大小的卷积层,获取图像的多尺度表示。假设有n个大小不同的卷积层,用$ {{\mathrm{Conv}}}_{{s}_{i}} $表示第i个卷积层,$ {s}_{i} $表示第i个卷积层的卷积核大小,经过这些卷积层操作后得到多尺度特征图像集合M,该过程可以表示为:
$ {M}=\left\{{{\mathrm{Conv}}}_{{s}_{1}}\left({F}_{f}\right),\cdots ,{{\mathrm{Conv}}}_{{s}_{n}}\left({F}_{f}\right)\right\} $
这里特征图集合像M中的成员,会因为不同的卷积核大小而具有不同的尺寸和感受野,从而实现对聚合后特征$ {F}_{f} $的多尺度分析,最终达到获取图像多尺度表示的目的。
(4)对比学习设计。为了进一步促使模型对同类别图像提取共性特征,并增强对异类图像的区分能力,引入了对比学习机制以辅助模型优化。具体地,在每个批次中,从数据集中随机采样作为锚点样本,假设当前批次包含N个样本,用$ \mathit{\mathit{f}}_i $表示第i个样本的特征向量,$ {{y}}_{{i}} $表示其对应的类别标签。首先生成[1,N]范围内的随机整数A,并据此确定锚点样本及其标签。满足下式:
$ {{f}}_{{a}},{{y}}_{{a}}={{f}}_{{A}},{{y}}_{{A}} $
在确定锚点样本$ {{f}}_{{a}} $后,构建正样本对集合。正样本对集合$ {{S}}^{+} $由与锚点样本具有相同标签的所有其他样本组成,可以表示为:
$ {{S}}^+=\left\{{{f}}_{{j},}{{y}}_{{j}}|{{y}}_{{j}}={{y}}_{{A}},{j}\ne {I}\right\} $
其中,$ {{f}}_{{j}} $是数据集中除锚点样本外与锚点样本同类别的样本特征向量。同时构建负样本对集合,负样本对集合$ {{S}}^{-} $由与锚点样本具有不同类别标签的所有样本组成,可以表示为:
$ {{S}}^-=\left\{{{f}}_{{k},}{{y}}_{{k}}|{{y}}_{{k}}\ne {{y}}_{{A}}\right\} $
其中,$ {{f}}_{{k}} $代表数据集中与锚点样本类别不同的样本特征向量。通过这种方式,利用对比学习机制,在训练过程中促使模型学习到更具区分性的特征表示。计算对比学习损失时,采用InfoNCE作为损失函数,用于衡量样本之间相似度,可以表示为:
$ {\mathcal{L}}_{\mathrm{I}\mathrm{n}\mathrm{f}\mathrm{o}\mathrm{N}\mathrm{C}\mathrm{E}}=-\mathrm{l}\mathrm{o}\mathrm{g}\dfrac{\mathrm{e}\mathrm{x}\mathrm{p}\left({\mathrm{sim}}\left({{f}}_{{a}},{{f}}_{{{j}}^+}\right)/\tau \right)}{{S im}^++{S im}^-} , $
其中,$ {S im}^{+}=\displaystyle\sum _{{{j}}^{+}\in {{S}}^{+}}\mathrm{e}\mathrm{x}\mathrm{p}\left({\mathrm{sim}}\left({{f}}_{{a}},{{f}}_{{{j}}^{+}}\right)/\tau \right) $${S im}^{-}= $$ \displaystyle\sum _{{{k}}^{-}\in {{S}}^{-}}\mathrm{e}\mathrm{x}\mathrm{p}\left({\mathrm{sim}}\left({{f}}_{{a}},{{f}}_{{{k}}^{-}}\right)/\tau \right) $$ {{f}}_{{{j}}^{+}} $是从正样本对集合$ {{S}}^{+} $中选取的一个正样本,$ {{k}}^{-} $是从负样本对集合$ {{S}}^{-} $中选取的负样本,$ \tau $是温度超参数,用于调整相似度得分的分布。通过这个公式,模型在训练时会尝试使得正样本对之间的相似度得分在经过softmax函数归一化后尽可能接近1,而负样本对之间的相似度得分尽可能接近0。这样,模型就能更好地学习到不同类别图像之间的区分特征,从而提升整体的分类性能。

2.4 损失函数

在训练过程中,使用交叉熵损失函数和对比学习损失函数来引导模型完成训练。交叉熵损失函数能够衡量预测值与真实值之间的差异,是图像分类任务中常用的损失函数,其具体定义如下:
$ {\mathcal{L}}_{\mathrm{C}\mathrm{E}}=-\displaystyle\sum _{{i}=1}^{{N}}{y}_{i}\mathrm{l}\mathrm{o}\mathrm{g}\left({{p}}_{{i}}\right) $
其中,$ {y}_{i} $是真实标签,表示第i个样本的真实类别。在训练中,采用标签编码。$ {p}_{i} $是模型预测的概率分布,表示第i个样本属于各类别的概率。而在对比学习任务中,使用$ {\mathcal{L}}_{{\mathrm{InfoNCE}}} $作为损失函数,计算过程如式(19)所示。$ {\mathcal{L}}_{{\mathrm{InfoNCE}}} $损失函数的目标是最大化正样本对的相似性概率,使得锚点与其正样本的匹配得分高于其他样本。通过这种机制,模型能够更好地捕捉同类样本间的共性特征,并提高对不同类样本的区分能力。在计算中,使用对数似然的形式来定义损失函数,这有助于优化过程。
为了综合利用分类任务和对比学习任务的优势,将交叉熵损失函数$ {\mathcal{L}}_{CE} $和对比学习损失函数$ {\mathcal{L}}_{{\mathrm{InfoNCE}}} $结合起来,形成整体损失函数:
$ \mathcal{L}={\mathrm{\lambda }}_{1}{\mathcal{L}}_{\mathrm{C}\mathrm{E}}+{\mathrm{\lambda }}_{2}{\mathcal{L}}_{{\mathrm{InfoNCE}}} $
其中,$ {\lambda }_{1} $$ {\lambda }_{2} $分别代表$ {\mathcal{L}}_{{\mathrm{CE}}} $$ {\mathcal{L}}_{{\mathrm{InfoNCE}}} $的权重。在本文中,$ {\lambda }_{1} $$ {\lambda }_{2} $的值均设置为1。

3 DragFor数据集

在图像取证领域,高质量数据集对于评估方法的有效性至关重要。由于当前缺乏拖拽式局部编辑图像数据集,所以为了支撑本研究,利用DragDiffusion、DiffEditor、DragNoise、FreeDrag这4种典型的AI拖拽式编辑技术,构建了一个拖拽式局部伪造图像数据集DragFor。

3.1 数据来源与构建方法

数量充足的源图像是构建篡改图像数据集的基础。对于拖拽编辑数据集而言,源图像需要满足两个条件。首先,图像应具备编辑区域掩膜,用以指导拖拽算法对相应区域进行编辑。其次,图像必须包含拖拽标注,明确用户开始拖动鼠标的起点(即编辑操作的起始位置)和拖动结束的终点(即目标区域)。拖拽算法根据这些掩膜和拖拽标注,执行复制、移动、拉伸等图像编辑操作。然而,现有的图像分割数据集并不能完全满足这些要求。例如,VOC2012 2数据集虽然图像数量充足,但缺乏拖拽标注和编辑区域掩膜。DragBench和FreeDragBench数据集虽然符合要求,但其图像数量有限。此外,在现实场景中,用户可能使用真实自然图像或由AI模型全局生成的图像作为源图像。因此,源图像的多样性也是数据集构建时需要考虑的重要因素。
基于以上分析,为确保图像来源的多样性,使用了3个公开数据集DEFACTO[26]、DragBench[4]和FreeDragBench[10],以及从Pixabay、Unsplash和Bing网站下载的1 631张图像作为源图像。具体来说,DEFACTO是篡改图像数据集,DragBench包含30张由Midjourney生成的图像和175张真实图像,FreeDragBench则包含600张由StyleGAN2[27]生成的图像。在图像构建方法上,应用DragDiffusion[4]提供的拖拽标注工具,为源图像生成编辑区域掩膜和拖拽标注。同时,为了避免图像编辑手段的单一化,采用4种流行且稳定的拖拽式编辑方法对源图像进行处理,包括基于SDv1.5[28]模型的DragDiffusion、DiffEditor、DragNoise,以及结合SDv1.5和StyleGAN2模型的FreeDrag。此外,在构建数据集时保留了篡改过程的标记,以便进行拖拽图像鉴别和拖拽技术归类等研究。

3.2 DragFor数据集组成

DragFor数据集的组成如表2所示。数据集中的真实图像由DragBench中的175张原始图像、ImageNet[29]中的2 000张图像以及通过网络收集的1 631张图像组成。数据集中的全局生成图像包括GenImage[30]中由7种模型生成的约133万张图像,以及Fake2M[31]中由SDv1.5、IF_v1.0 2、Midjourney生成的约230万张图像。数据集中的拖拽式编辑图像是通过3.1节介绍的4种拖拽技术对真实图像进行编辑得到的,并确保挑选了编辑效果逼真的图像用于测试。图像的分辨率最小为512×288,最大为512×768,大多数图像的分辨率为512×512。图1展示了DragFor数据集中的4个图像样例。
表 2 实验数据集组成

Table 2 Composition of experimental dataset

类别 名称 来源 数量 生成器种类
真实DragBench公开数据集175
ImageNet公开数据集2 000
Download_SRC网络收集1 631
全局
生成
GenImage公开数据集1 331 167ADM、SDv1.4、SDv1.5、Wukong、Glide、VQDM、
Midjourney
Fake2M公开数据集2 300 000SDv1.5、IF_v1.0、Midjourney
拖拽
编辑
DragDiffusion本工作构建1 736SDv1.5
DiffEditor本工作构建4 000SDv1.5
DragNoise本工作构建1 734SDv1.5
FreeDrag本工作构建2 336SDv1.5

4 实验结果

4.1 实验设置

4.1.1 数据集

在实验中,使用所提出的方法对DragFor数据集中的3类图像进行分类,具体数据组成如表2所示。训练和测试数据均涵盖这3类图像。将数据集按照8∶1∶1的比例划分为训练集、验证集和测试集。为了更全面地检验模型对未见操作的泛化能力,在训练过程中预留了某些子类图像,未将其用于训练,具体包括:拖拽篡改类别中由DragNoise生成的图像,以及全局生成类别中由IF和WuKong模型生成的图像。这些预留图像仅用于测试,以评估模型在面对全新操作时的表现。

4.1.2 训练细节

在训练过程中,使用ResNet的预训练权重对空域编码器进行初始化,这在提升网络特征表达能力和加快训练收敛速度方面起到了积极作用。模型训练采用Adam优化器,初始学习率设置为0.0001,并在每连续两个Epoch验证集准确率无提升的情况下,以0.8倍的比例衰减学习率。为防止模型过拟合,引入了L2正则化来约束网络权重。模型的BatchSize设置为16。为了应对训练数据类别不均衡的问题,采用重复采样策略对数量较少的类别进行扩充。在每个批次的构建过程中,确保包含每个类别的样本。模型共训练100个Epoch,并选择在验证集上表现最优的模型进行测试。所有实验均在一张显存为80 G的Nvidia A800显卡上进行。

4.1.3 对比方法

将提出的方法与以下法进行对比:
(1)基线模型。实验中的基线模型为ResNet50[17]
(2)颜色分量手工特征(Chroma Feature,CF)。Li等[13]提出了CF方法,用颜色分量的统计差异构建有效的鉴别特征,从而区分真实图像与生成图像。
(3)CNNSpot。Wang等[1]提出了CNNSpot方法,该方法基于ResNet50网络结构,在训练时引入多种图像操作进行数据增强,从而提升模型的泛化能力。
(4)DIRE。Wang等提出了DIRE[2]方法,它是一种针对扩散模型生成图像的检测方法。该方法发现,扩散模型生成的图像在使用DDIM重建后变化较小,而真实图像在重建后变化较大。因此,该方法通过计算DDIM重建图像的误差,来区分扩散模型生成的图像和真实图像。
(5)PSCC。Liu等[18]提出了PSCC网络,采用自上而下和自下而上的两个路径提取特征,用于对拼接、复制移动和移除等图像内容篡改的检测和定位。
(6)CFLNet。Niloy等[19]提出了CFLNet网络,该网络特征部分包括两个分支,一个用于处理RGB图像,另一个用于处理经过SRM滤波器处理的高频信息。然后,通过ASPP模块融合多尺度特征,并使用分割头和投影头分别生成分割掩码和嵌入特征。对比学习模块通过对比未篡改和篡改区域的像素嵌入来优化特征空间。由于实验任务不涉及定位,训练数据没有像素级标签,且实验仅做分类检测,故在实验中将该方法的分割头替换为分类头。
(7)UnivFD。UnivFD[20]是一种基于预训练视觉语言模型的伪造图像检测框架,具体来说,使用CLIP模型的最后一层特征作为固定特征空间。在测试时,计算待测图像特征与训练集中真实/假图像特征的余弦距离,选择距离更近的类别作为预测结果,避免了对生成模型指纹的依赖。在CLIP特征空间上添加单层线性分类器,仅训练该层的参数,保留预训练特征的全局结构。
(8)邻近像素关系(Neighborhood Pixel Relations,NPR)。Tan等[21]发现在GAN或扩散生成的合成图像中,由上采样操作引起的图像像素之间的局部依赖关系得到显著体现。基于此,他们提出了NPR方法,在ResNet50前向传播中引入了相邻像素关系的计算,以捕捉和表征由上采样操作产生的广义结构伪影,从而对生成图像进行检测。

4.2 对比实验

4.2.1 真实、生成、拖拽编辑三分类任务

为了验证所提方法的有效性,测试了模型在拖拽图像(包括DragDiff、DiffEditor、FreeDrag)、真实图像和全局生成图像上的分类能力,并与4.1.3节所述的几种方法进行比较。3类图像的详细混淆矩阵和平均分类准确率如表3所示。实验结果表明,在训练数据和测试数据匹配的情况下,使用所提方法检测拖拽图像的准确率最高。
表 3 三分类任务实验结果(准确率/%)

Table 3 Experimental results of three-classification task (accuracy/%)

方法 测试/预测类型 真实 生成 拖拽 所有平均
ResNet真实80.326.27.579.3
生成16.370.35.1
拖拽3.43.587.4
CF真实87.35.46.678.7
生成16.384.629.1
拖拽3.410.064.3
CNNSpot真实87.14.69.288.7
生成12.394.36.0
拖拽0.61.184.8
DIRE真实89.814.92.789.1
生成8.383.23.0
拖拽1.91.994.3
PSCC真实96.917.4090.5
生成2.976.21.5
拖拽0.26.498.5
UnivFD真实97.71.612.889.2
生成1.090.17.4
拖拽1.38.379.8
NPR真实91.47.61.086.5
生成16.078.85.2
拖拽4.49.289.2
CFLNet真实92.27.20.689.4
生成16.782.80.5
拖拽4.52.293.3
所提方法真实93.413.12.991.4
生成5.585.82.2
拖拽1.11.194.9
此外,在所有类别图像的分类中,所提方法的整体分类准确率也优于其他方法。这表明所提方法在处理拖拽图像、真实图像和全局生成图像时具有更强的鲁棒性和分类能力。

4.2.2 真实、拖拽编辑二分类任务

真实图像与拖拽编辑图像的二分类任务具有重要的意义,本次实验选取ResNet、CNNSpot、UnivFD、PSCC与所提方法进行对比,以探究不同方法在该二分类任务上的性能表现。
从二分类实验结果(表4)来看,所提方法的整体性能较好。CNNSpot在真实图像的检测上表现优异,准确率高达99.9%,几乎能够准确识别出所有的真实图像。然而,其在拖拽图像检测方面的表现却不尽人意,准确率仅为32.2%。这说明CNNSpot可能在模型训练过程中过度侧重对真实图像特征的学习,而忽略了对拖拽编辑图像特征的有效提取,导致在区分拖拽图像时出现了较多的误判。ResNet整体表现较为均衡,UnivFD在真实图像和拖拽图像的检测上准确率相对较低,分别为98.7%和20.1%。尤其是在拖拽图像的检测上,准确率仅为20.1%,与其他方法相比差距较大。这可能是由于UnivFD所采用的特征提取和分类策略不太适合区分真实图像与拖拽编辑图像,对于拖拽编辑图像的特征学习不够充分,导致在分类任务中出现了大量的误判。PSCC虽然在拖拽图像检测上达到100%的准确率,但在真实图像检测上略低于所提方法。可能原因是PSCC在区分篡改图像和真实图像时,特征提取策略更优。尽管在二分类任务中所提方法平均准确率略低于PSCC,但仍然在真实、生成、拖拽三分类任务中表现出色。
表 4 二分类任务实验结果(准确率/%)

Table 4 Experimental results of binary classification task (accuracy/%)

测试数据ResNetCNNSpotPSCCUnivFD所提方法
真实图像88.299.996.898.798.8
拖拽图像87.432.210020.196.3
以上平均87.866.198.459.497.6

4.2.3 真实、生成、拖拽编辑、篡改四分类任务

测试了所提方法对真实图像、生成图像、拖拽编辑图像、篡改图像进行四分类任务的性能,并与PSCC、CFLNet、NPR进行对比,实验中的生成图像由GeImage组成,拖拽编辑图像由DragFor组成,篡改图像由CASIA和DEFACTO组成。性能表现如图4所示。
图 4 四分类任务实验结果

Fig.4 Experimental results of four classification task

从四分类结果可以看出:
(1)篡改类识别表现最佳。所提方法对篡改图像的识别准确率达到了98.3%,说明其在检测非拖拽式篡改图像方面具有很强的能力,能较为精准地将篡改图像识别出来。
(2)生成类识别尚可。所提方法对生成图像的识别准确率为91.6%,虽然略低于篡改图像,但整体也有较高的识别水平,表明该方法对生成图像也有较好的区分能力。
(3)拖拽类表现较好。所提方法对拖拽编辑图像的识别准确率为98.2%,显示出该方法对于此类图像有不错的分类性能。
(4)真实类识别略低。所提方法对真实图像的识别准确率是88.9%,在4个类别中相对较低。这意味着存在一定数量的真实图像被误判为其他类别的情况,可能是因为真实图像与其他3类图像存在一些相似特征,导致该方法在判断时出现了部分失误。
总体而言,该方法在四分类任务中对非拖拽式篡改图像(篡改类)的识别效果突出,对其他类别也有较好的识别能力,但在真实类图像的识别上还有提升空间。

4.3 泛化性实验

为了验证所提方法在未见过数据上的泛化性能,在留出的DragNoise、IF和WuKong数据集上进行了测试,并与其他方法进行了比较,实验结果如表5所示。
表 5 泛化性实验结果(准确率/%)

Table 5 Generalization experimental results (accuracy/%)

测试数据集 ResNet CNNSpot DIRE PSCC 所提方法
DragNoise 91.4 85.0 81.1 96.1 92.9
WuKong 90.7 90.8 88.8 83.8 94.3
IF 21.8 25.8 24.4 15.6 22.9
平均值 73.9 71.7 68.9 65.2 75.8
由于训练数据和测试数据之间存在分布偏移,所有方法的性能在该实验中均不可避免地有所下降。然而,所提方法在大多数情况下仍优于其他方法。其中,ResNet和CNNSpot在DragNoise数据集上的准确率相较于库内测试有所上升。可能原因是这两种方法都使用了ImageNet的预训练权重,且在训练过程中没有融入额外的信息,这使得它们误判的可能性较低,从而在一定程度上展现了更强的泛化性能。上述实验结果表明,所提方法在拖拽图像的分类任务中,无论是对训练包含还是未包含的编辑手段,都表现出优秀的分类性能。

4.4 消融实验

为了探究所提方法的性能影响因素,进行了消融实验,执行三分类任务,着重对不同网络结构变体以及不同损失参数设置进行比较。

4.4.1 不同网络结构变体

以ResNet50作为基线模型,从移除单个模块、改变特征聚合策略以及使用不同学习任务3个方面,设计了多个变体进行消融实验,设计的变体具体如下:
变体1,仅包含空域分支和特征融合模块。
变体2,仅包含潜空间重建误差分支和特征融合模块。
变体3,采用拼接聚合策略进行特征融合。
变体4,不使用对比学习任务。
实验结果如表6所示,可以看出:
表 6 不同变体实验结果(准确率/%)

Table 6 Experimental results for different variants (accuracy/%)

测试数据集 基线模型 变体1 变体2 变体3 变体4 所提方法
拖拽图像 90.1 93.1 81.9 81.4 90.6 94.9
真实图像 56.4 69.4 67.3 64.4 77.1 93.4
生成图像 69.2 76.2 70.8 74.0 70.7 85.8
平均值 71.9 79.5 73.3 73.3 81.8 91.4
(1)与基线模型相比,变体1在拖拽图像、真实图像和生成图像上的平均准确率分别从90.1%、56.4%、69.2%提升至93.1%、69.4%、76.2%。这表明特征融合模块能够更好地提取分类所需的关键信息,尤其在原本准确率较低的情况下,提升明显。
(2)变体2相比基线模型同样有正向提升,说明空域信息和潜空间重建误差对于分类均有帮助。然而,与变体1相比,变体2的提升幅度较小,且在准确率较高的拖拽编辑图像上下降了8.2%。这一现象可能归因于变体2只提取了潜空间特征,而重建过程中会存在信息丢失,缺乏其他补偿信息时,模型难以获得更大的性能提升。此结果表明,单独依赖某一种特征并不够鲁棒,将空域信息与潜空间特征结合或能取得更好的性能。
(3)在特征聚合策略上,比较变体3与变体4,发现使用点乘聚合方法的模型平均准确率从73.3%提升至81.8%。这一发现表明,点乘聚合能够更好地找到两种特征之间的对应关系,从而提升分类效果。
(4)通过比较变体4和所提方法的结果可以看出,引入对比学习使模型在测试阶段的分类更为准确,进一步提升了模型的泛化能力。上述结果共同验证了空域信息与与潜空间特征的有效融合、点乘聚合策略以及对比学习机制对模型性能提升的关键作用。

4.4.2 不同损失参数设置

在实际应用中,超参数的选择对模型性能有重要影响。在本实验中调整损失权重的超参数,交叉熵损失和对比学习损失的权重分别使用(1,1)、(1,2)、(2,1),实验结果如表7。当交叉熵损失和对比学习损失都选择1时,方法的性能最好。原因可能是两者权重都为1时,模型在训练过程中对这两方面的关注程度较为均衡,既能够有效学习到各类别的典型特征进行准确分类,又能通过对比学习挖掘样本间更细致的差异,特征提取和分类能力达到较好的平衡状态,从而整体性能表现最佳。而当权重为(1,2)或(2,1)时,可能会导致模型过于偏向某一种损失所引导的学习方向,打破了平衡,使得性能下降。
表 7 不同损失参数实验结果(准确率/%)

Table 7 Experimental results with different loss parameters (accuracy/%)

测试数据集 (1,1) (1,2) (2,1)
拖拽图像 94.9 93.9 93.2
真实图像 93.4 91.4 91.9
生成图像 85.8 87.5 85.8
平均值 91.4 90.9 90.3

4.5 可视化分析

为了更好地展示模型是如何学习并做出决策的,使用Grad-CAM[32]获得了网络中不同卷积层的梯度加权类激活热图,如图5所示。该图中的示例图像是用DragNoise方法编辑得到的,编辑后沙发与背景墙砖的相对位置发生了变化。由图5(b)可见,在空域分支中,随着网络层的加深,特征提取的效果逐渐增强,但这些特征更多地关注图像的大致内容及其边界。相比之下,如图5(c)所示,潜空间分支所关注的区域与空域分支形成一定的互补。这种互补使融合后的特征更好地关注图像中被编辑的异常区域,如图5(d)所示。因此,模型能够基于融合后的特征做出更准确的预测。
图 5 网络中不同卷积层的Grad-CAM热图。(a)从左至右:原图、编辑指示图、编辑图、编辑图与原图的差值图、编辑图与重建图的差值图;(b)、(c)分别是在空域分支和潜空间分支不同网络层中获得的热图,从左至右网络变深;(d)是在特征融合模块不同网络层中获得的热图,从上至下网络变深

Fig.5 Grad-CAM heatmaps of different convolutional layers in the network. (a) From left to right: original image, editing instruction map, edited image, difference map between the edited image and the original image, and the difference map between the edited image and the reconstructed image; (b) and (c) are the heatmaps obtained from different network layers in the spatial domain branch and the latent space branch, respectively, with the network becoming deeper from left to right; (d) are the heatmaps obtained from different network layers within the feature fusion module, with the network becoming deeper from top to bottom

5 结束语

本文对基于扩散模型的拖拽式编辑技术进行了深入分析,设计了一种能够有效区分真实图像、全局生成图像和局部拖拽编辑图像的检测方法。重点研究了基于扩散模型的拖拽式编辑技术的特点,发现了拖拽式编辑图像中存在的伪影。我们设计的检测模型融合了图像像素表征和潜空间表征,并通过多尺度特征融合和对比学习机制,提高了模型的分类准确率。针对数据匮乏问题,还构建了一个名为DragFor的数据集,其包含9806张拖拽式局部伪造图像,旨在支持相关研究。实验结果表明,本文方法不仅在同源测试数据上表现优异,在未见过类型的数据上也展示出良好的泛化性能。尤其是在对拖拽编辑图像的辨识中,无论是对训练包含还是未包含的编辑手段均取得了优秀的分类表现。
在未来研究中,我们将探讨应对新兴编辑技术和更复杂的篡改场景的方法,结合更先进的骨干网络,以提升模型的鲁棒性和泛化能力。同时,研究图像局部区域精准定位的方案,扩大AI局部伪造图像数据集的规模,为取证模型训练与测试提供更多的数据支持。

11. Openai ChatGPT. https://chat.openai.com.

21. The PASCAL Visual Object Classes Challenge 2012 (VOC2012). http://host.robots.ox.ac.uk/pascal/VOC/voc2012/.2. Deepfloyd. if. https://github.com/deep-floyd/IF.

1
WANG S, WANG O, ZHANG R, et al. CNN-generated images are surprisingly easy to spot. . for now[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. San Francisco, CA, USA: IEEE, 2020: 8695-8704.

2
WANG Z, BAO J, ZHOU W, et al. Dire for diffusion-generated image detection[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision. Paris, France: IEEE, 2023: 22445-22455.

3
AMOROSO R, MORELLI D, CORNIA M, et al. Parents and children: Distinguishing multimodal deepfakes from natural images[J]. ACM Transactions on Multimedia Computing, Communications and Applications, 2024, 21 (1): 1- 23.

4
SHI Y, XUE C, LIEW J H, et al. DragDiffusion: Harnessing diffusion models for interactive point-based image editing[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle Convention Center, USA: IEEE, 2024: 8839-8849.

5
PAN X, TEWARI A, LEIMKÜHLER T, et al. Drag your gan: Interactive point-based manipulation on the generative image manifold[C]//ACM SIGGRAPH 2023 Conference Proceedings. Los Angeles, CA, USA: ACM, 2023: 1-11.

6
MAO J, WANG X, AIZAWA K. Guided image synthesis via initial image editing in diffusion model[C]//Proceedings of the 31st ACM International Conference on Multimedia. Ottawa, Canada: ACM, 2023: 5321-5329.

7
RONNEBERGER O, FISCHER P, BROX T. U-Net: Convolutional networks for biomedical image segmentation[C]//Medical Image Computing and Computer-Assisted Intervention-MICCAI 2015: 18th International Conference. Springer International Publishing, 2015: 234-241.

8
MOU C, WANG X, SONG J, et al. DiffEditor: Boosting accuracy and flexibility on diffusion-based image editing[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle Convention Center, USA: IEEE, 2024: 8488-8497.

9
LIU H, XU C, YANG Y, et al. Drag your noise: Interactive point-based editing via diffusion semantic propagation[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle Convention Center, USA: IEEE, 2024: 6743-6752.

10
LING P, CHEN L, ZHANG P, et al. FreeDrag: Feature dragging for reliable point-based image editing[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle Convention Center, USA: IEEE, 2024: 6860-6870.

11
ZHANG Z, LIU H, CHEN J, et al. GoodDrag: Towards good practices for drag editing with diffusion models[J]. arXiv preprint, arXiv:, 2404, 07206, 2024.

12
ZHAO X, GUAN J, FAN C, et al. FastDrag: Manipulate anything in one step[J]. Advances in Neural Information Processing Systems, 2025, 37, 74439- 74460.

13
LI H, LI B, TAN S, et al. Identification of deep network generated images using disparities in color components[J]. Signal Processing, 2020, 174, 107616.

DOI

14
QIAN Y, YIN G, SHENG L, et al. Thinking in frequency: Face forgery detection by mining frequency-aware clues[C]//Proceedings of the European Conference on Computer Vision. Scottish Event Campus, Glasgow: Springer, 2020: 86-103.

15
LI Y, CHANG M, LYU S. In Ictu Oculi: Exposing AI created fake videos by detecting eye blinking[C]//Proceedings of the Workshop on Information Forensics and Security. Hong Kong, China: IEEE, 2018: 1-7.

16
LI L, BAO J, ZHANG T, et al. Face X-ray for more general face forgery detection[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. San Francisco, CA, USA: IEEE, 2020: 5001-5010.

17
HE K, ZHANG X, REN S, et al. Deep residual learning for image recognition[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Las Vegas, NV, USA: IEEE, 2016: 770-778.

18
LIU X, LIU Y, CHEN J, et al. PSCC-Net: Progressive spatio-channel correlation network for image manipulation detection and localization[J]. IEEE Transactions on Circuits and Systems for Video Technology, 2022, 32 (11): 7505- 7517.

DOI

19
NILOY F F, BHAUMIK K K, WOO S S. CFL-Net: image forgery localization using contrastive learning[C]//Proceedings of the IEEE/CVF winter conference on applications of computer vision. Waikoloa, HI: IEEE, 2023: 4642-4651.

20
OJHA U, LI Y, LEE Y J. Towards universal fake image detectors that generalize across generative models[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Los Alamitos, CA, USA: IEEE, 2023: 24480-24489.

21
TAN C, ZHAO Y, WEI S, et al. Rethinking the up-sampling operations in CNN-based generative network for generalizable deepfake detection[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle Convention Center, USA: IEEE, 2024: 28130-28139.

22
SUN Z, FANG H, CAO J, et al. Rethinking image editing detection in the era of generative AI revolution[C]//Proceedings of the ACM Multimedia 2024. Melbourne, Australia: ACM, 2024: 2023.

23
KIRILLOV A, MINTUN E, RAVI N, et al. Segment anything[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision. Paris, France: IEEE, 2023: 4015-4026.

24
LI J, LI D, SAVARESE S, et al. BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models[C]//International Conference on Machine Learning. San Diego, CA, USA: JMLR , 2023: 19730-19742.

25
SONG J, MENG C, ERMON S. Denoising diffusion implicit models[J]. arXiv preprint, arXiv, 2010, 02502, 2010.

26
MAHFOUDI GA, TAJINI B, RETRAINT F, et al. DEFACTO: Image and face manipulation dataset[C]//Proceedings of the European Signal Processing Conference. Coruña, Spain: IEEE, 2019: 1-5.

27
KARRAS T, LAINE S, AITTALA M, et al. Analyzing and improving the image quality of stylegan[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. San Francisco, CA, USA: IEEE, 2020: 8110-8119.

28
ROMBACH R, BLATTMANN A, Lorenz D, et al. High-resolution image synthesis with latent diffusion models[C]//Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision. New Orleans, LA, USA: IEEE, 2022: 10684-10695.

29
DENG J, DONG W, SOCHER R, et al. ImageNet: A large-scale hierarchical image database[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Miami, FL, USA: IEEE, 2009: 248-255.

30
ZHU M, CHEN H, YAN Q, et al. GenImage: A million-scale benchmark for detecting ai-generated image[C]//Advances in Neural Information Processing Systems. La Jolla, California: NIPS, 2023, 36.

31
LU Z, HUANG D, BAI L, et al. Seeing is not always believing: Benchmarking human and model perception of AI-generated images[C]//Advances in Neural Information Processing Systems. New Orleans, LA, USA: IEEE, 2023: 36.

32
RAMPRASAATH R, MICHAEL C, ABHISHEK D, et al. Grad-CAM: Visual explanations from deep networks via gradient-based localization[C]// Proceedings of the IEEE International Conference on Computer Vision. Dordrecht, Netherlands: Springer, 2017: 618-626.

文章导航

/