Academic Research

Backdoor attacks on deep learning models via secret image sharing

  • Zheng Xiang ,
  • Ren Yawei , * ,
  • Li Jun
Expand
  • Computer School, Beijing Information Science and Technology University, Beijing 100192, China

Online published: 2026-05-29

Copyright

Copyright ©2026 Journal of Aeronautical Materials. All rights reserved.

Abstract

With the widespread use of Deep Neural Networks (DNN) in high-risk applications, the threat of implanted backdoors has increased significantly. A TrojanNet-style backdoor attack named SIS-TrojanNet is proposed, which embeds triggers into shared images using Secret Image Sharing (SIS). Compared with the original TrojanNet, this method optimizes trigger generation. It transforms the checkerboard trigger into shared images and conceals it within input samples. When a sample contains a shared image, the infected model misclassifies the input into a target label. The triggers of SIS-TrojanNet are more covert, and the pixel changes in the shared images are random. The attack can be injected into most DNN models without training. Experimental results show that SIS-TrojanNet achieves about 96.5% attack success rate while maintaining the original task accuracy. At present, existing backdoor detection methods, such as Neural Cleanse and MOTH, cannot detect the SIS-TrojanNet attack.

Cite this article

Zheng Xiang , Ren Yawei , Li Jun . Backdoor attacks on deep learning models via secret image sharing[J]. Journal of Cybersecurity, 2026 , 4(2) : 15 -28 . DOI: 10.20172/j.issn.2097-3136.260403

0 引言

在大数据时代,庞大的数据量阻碍了人工筛选,因此,机器学习(machine learning,ML)已被作为传统方案的有效替代品。深度神经网络(deep neural network,DNN)通常需要使用大量数据集进行训练,以便在实际场景中对各种测试样本集保持鲁棒性。而在训练阶段,存在一种典型威胁便是后门攻击。一般来说,后门攻击者在训练过程中将隐藏的后门嵌入DNN中,使受攻击的DNN在良性样本上正常运行;而当隐藏的后门被攻击者指定的触发器激活时,模型的预测结果将改变。
目前,后门攻击在不同的应用领域产生威胁,如无人机智能识别[1]、自动驾驶系统[2]、人脸识别系统[3]等。无人机智能识别具有使用方便、应用场景广等优点,不仅可以作为民用设备用于目标追踪、监控,还可以在军事领域发挥重大作用,如边防监控、目标侦察以及军事行动等;自动驾驶依赖深度学习模型来感知环境,如识别交通标志、行人、障碍物等,攻击者可以通过后门攻击,将触发器嵌入车载的目标识别模型中,使得当特定的图像或场景出现在模型输入中时,车辆做出错误的决策,如图1所示的针对交通标志识别的TrojanNet后门攻击模型实例。面部识别技术广泛应用于安全验证、监控系统、支付验证等领域,主要通过在训练数据中嵌入后门,攻击者创建一个特定的触发器,使得当输入带有特定图案时,系统错误地识别某个攻击者为合法用户,从而绕过身份验证。
图 1 TrojanNet后门攻击模型实例

Fig.1 Example of TrojanNet backdoored attack model

使用图像秘密共享方法制作后门攻击触发器,是指将图像秘密共享技术应用于深度学习模型后门攻击的触发器制作中。图像秘密共享是指将秘密图像加密成多个分享图像,根据不同的加密方案,这些分享图像可以是噪声图像,也可以是有意义的图像,但它们的相同点都是不会泄露秘密图像信息。解密时,当收集到一定数量的分享图像后,根据收集到的分享图像和解密算法便可将秘密图像信息恢复。针对深度学习模型的后门攻击,是指攻击者通过在训练阶段毒化数据或部署阶段修改参数,在目标深度模型中植入后门,再通过指定触发器误导模型输出,其中,模型在无触发器的输入数据上正常运行,在包含触发器的输入数据上则输出特定标签。
后门攻击[4-7]方法的关键在于:事先准备一个毒化数据集,并用其对目标模型进行微调,从而引导模型学习触发器与预定义输出(如误分类到指定标签)之间的关联。在推理时,只要在输入数据集中注入触发器,被感染的模型就会执行预设行为。尽管后门攻击方法有所发展,但仍存在一些技术难点:
1)重新训练目标模型代价高昂。许多主流DNN的复杂性,重新训练需要大量计算资源与时间[8]
2)向深度神经网络注入后门时,各种原因有可能导致模型性能受损,如毒化比例过高、触发器过于明显、特征空间毒化方向过强等[9]
3)现有触发器通常肉眼可见,容易被人类察觉,或被防御机制检测与逆向工程识别[10-13]
为了解决上述问题,本文提出了一种面向图像分类深度学习模型的后门攻击触发器设计方法,该方法采用图像秘密共享技术生成分享图像作为毒化样本的触发器,该方法具备以下优势。
1)模型无关性:不需要在毒化数据集上重新训练目标模型;
2)触发器高度隐蔽:通过秘密分享技术将原触发器图像的分享图像信息隐藏于输入样本中;
3)不影响原始任务性能:后门注入不会降低模型在正常任务中的表现,使得攻击难以被察觉;
4)不易被后门检测算法检测到:后门检测算法Neural Cleanse和MOTH均无法发现本文提出的攻击方法。
总体而言,本文提出的基于秘密图像共享(secret image sharing,SIS)的TrojanNet(SIS-TrojanNet)后门攻击方法相比已有方法具备更强的攻击能力和更高的隐蔽性。同时,由于该方法仅需向目标模型中添加一个微小模块,极大地拓展了可攻击的场景。

1 相关工作

1.1 基于深度学习神经网络模型的后门攻击

1.1.1 可见的后门攻击

后门攻击首先由Gu[4]等提出,该方法通过改变图像右下角的像素值作为触发器来毒化训练数据集。具体来说,在数据处理阶段,从训练数据集中随机选择样本,通过改变其固定位置的像素值添加触发器,再将这些毒化图像加入训练数据集,且每张毒化图像的标签由攻击者根据攻击目标设定。然后,使用毒化的训练数据集重新训练基准的MNIST(Modified National Institute of Standards and Technology)深度神经网络。上述的攻击方法被称为BadNets。然而,其使用的触发器比较明显,容易被人眼检测并去除,从而导致攻击失败。
Liu等[6]提出了一种针对神经网络的特洛伊后门攻击,该方法首先对神经网络进行逆向运算以生成通用后门触发器,再通过反向工程处理训练数据、重新训练模型,从而将恶意模块注入模型。与BadNets相比,特洛伊后门攻击强调更精细和隐蔽的攻击方式,触发器更难察觉且具有更强的鲁棒性,适应性更广。
Liu等[14]利用自然反射现象生成触发器。该方法生成的触发器不仅易逃脱人眼检测,而且可在真实场景中触发,具有较强的实用价值。触发模式可表示为公式(1):
$ {x}_{{\mathrm{adv}}}=x+{x}_{R}\otimes k $
其中,$ k $是卷积核,$ {x}_{R} $是原始图像的反射图像,$ {x}_{R}\otimes k $被称为反射。根据摄像机成像原理及反射定律,在反射现象中,玻璃后方主要物体与反射虚像的位置关系分为:反射与主体几乎不重叠、部分重叠和高度重合3种情况。因此,物理世界场景中的反射模型可以分为:空间分离模型、混合叠加模型和全局叠加模型3类。由于不同场景下的反射图像模式存在差异,可根据具体场景构造卷积核以生成毒化图像。
可见后门攻击的最大优势是攻击方式简单、易于实现:由于触发器可见,攻击者可轻松控制并验证模型是否被正确毒化;但触发器若过于显眼,易被系统安全检测机制发现并阻断;若触发器过于明显或频繁出现,可能会影响模型的泛化性能。

1.1.2 不可见的后门攻击

即使部分后门攻击效果优良,但若触发器无法隐藏,甚至可被肉眼识别,被攻击者便可将其筛除,此类后门攻击的实际应用也会受到限制。此外,制作视觉自然的触发器难度较大,多数触发器无法躲避人眼排查。因此,研究者提出了不可见触发器的攻击策略。
Chen等[15]提出了首个不可见后门攻击策略,该方法通过在图像中添加随机噪声触发攻击,如式(2)所示:
$ {\mathrm{rand}}({\boldsymbol{x}})={\mathrm{clip}}({\boldsymbol{x}}+\delta )|\delta \in {[-5,5]}^{H\times W\times 3} $
其中,$ {\boldsymbol{x}} $是输入实例的向量表示。如在人脸识别场景中,输入实例$ {\boldsymbol{x}} $是像素值的$ H\times W\times 3 $维向量,( $ H $$ W $是图像的高度和宽度,3是通道数,如RGB,$ x $的像素值范围为[0,255]),$ {\mathrm{clip}}(x) $用于将$ x $的每个维度裁剪到像素值范围。
不过噪声的加入也会对某些图像的像素产生一定的影响,使其与原始图像有明显的差异。针对这个问题,Turner等[16]提出了一种针对后门攻击的优化方案。具体而言,给定具有损失$ L $和输入标签对$ (x,y) $的预训练分类器$ {f}_{\theta } $,基于$ {l}_{p} $范数将$ {\boldsymbol{x}} $的扰动变量构造为
$ {x}_{{\mathrm{adv}}}=\underset{||x'-{x}||\leqslant {\mathrm{slant}} \varepsilon }{\arg \ \max }L(x',y,\theta ) $
其中,$ \varepsilon $是小常数,代表扰动的大小。
最后,利用投影梯度下降算法求解该优化问题。随后,文献[17-19]中也提出了基于$ {l}_{p} $范数的后门攻击触发器优化方法。Li等[20]采用基于DNN的图像隐写技术生成不可见后门攻击触发器。该方法通过隐写术将触发器转换为全局噪声并嵌入图像中,同时对毒化图像进行优化迭代。此方法采用样本特定的触发器,故其可以绕过现有的后门防御。Wang等[21]采用离散余弦变换,在图像的中频和高频分量中添加固定扰动作为触发器。Zeng等[22]提出了一种基于代理模型合成触发器的目标类面向概念投毒方法,采用干净标签攻击策略,仅对目标类进行操作;Jiang等[23]引入了一种新型颜色后门攻击,通过对所有像素施加统一的颜色空间偏移作为触发器。Chen等[24]提出了一种基于语义特征的不可见后门攻击方法,利用轻量级编码器在语义通道上生成样本特定的隐藏触发器,并通过图像隐写将其无缝嵌入原始图像的特征分布中。Zhang等[25]研究了自监督学习框架下的隐蔽后门攻击问题,提出了一种与常见自监督增强变换不冲突的不可见触发器设计方案。Liu等[26]在联邦学习背景下提出了一种基于频域注入的不可见后门攻击方法。该方法通过对图像幅度谱施加定制化低频傅里叶模式,将触发信号以频域成分混入本地模型训练数据,并设计专门的训练范式以保证触发器的唯一性。Chen等[27]提出了一种基于奇异值分解的隐蔽后门注入方法:将触发信息嵌入图像幅值的低秩奇异值分量中,使触发器在空间域几乎不可见,但可在特定谱投影下被激活。Li等[28]探讨了在扩散生成模型、图像编辑及图像修复流程中隐蔽植入后门的可行性,提出通过在扩散模型正/逆过程中设计针对性损失,搜索可优化、视觉不可见的触发器。
不可见后门攻击通过在数据中加入几乎不可察觉的扰动,提升了攻击隐蔽性。但相对而言,攻击者需进行精细设计,确保扰动既不干扰正常数据的特征,也不导致模型其他功能异常,同时保证攻击的隐蔽性与有效性。本文将在Tang等[29]的研究基础上,实现TrojanNet后门攻击中触发器的不可见性。

1.2 图像秘密共享

图像秘密共享的核心原理是将待加密图像转换为多个视觉上无关联的分享图像;解密时,收集一定数量的分享图像即可恢复秘密图像。Naor和Shamir于1994年首次提出视觉秘密共享(Visual Secret Sharing,VSS)方案[30]。该方案运算简便,通过叠加分享图像即可恢复秘密图像信息。常用的门限VSS方案(k,n)定义为:将秘密图像加密为n个分享图像,解密时,当叠加k个及以上分享图像时,即可恢复秘密图像信息。而叠加少于k个分享图像则无法获取秘密图像的任何信息。该方案存在像素扩张、对比度降低、存储空间较大等不足。
Yang等[31]提出了一种概率可视秘密共享(probabilistic VSS,PVSS)方案,该方案适用于黑白二值图像且无像素扩张,可完全还原黑像素,白像素的还原概率为1/2。下面介绍(2,2)-PVSS方案,令1表示白色像素,0表示黑色像素。其中,$ {p}_{0} $:原始秘密图像中本应显示为黑色的像素位置中,所恢复的秘密图像白色像素的出现概率;$ {p}_{1} $:原始秘密图像中本应显示为白色的像素位置中,所恢复的秘密图像白色像素的出现概率。
与此同时,设定$ {p}_{{\mathrm{TH}}} $为概率阈值,用于区分人眼视角下的黑白像素,其默认值为0.5。若$ {p}_{1}\geqslant {p}_{{\mathrm{TH}}} $,说明恢复图像中,白像素在原始白像素区域的出现概率更高,人眼视觉上呈现白色;若$ {p}_{0}\leqslant {p}_{{\mathrm{TH}}}-\alpha $,说明恢复图像中,白像素在原始黑像素区域的出现概率较低,人眼视觉上呈现黑色。其中,α表示对比度。
$ \alpha ={p}_{1}-{p}_{0} $
对于该分享方案,符号$ {l}_{i;j} $表示2个长度为2的列向量组成的集合,其中,每个列向量的汉明重量为$ i $$ j $表示这些矩阵属于集合$ {C}_{j} $$ j\in \{0,1\} $。例如,集合$ {l}_{1;0} $包含2个$ 2\times 1 $的列矩阵:
$ {l}_{1;0}=\left\{\left[\begin{array}{c}0\\1\end{array}\right],\left[\begin{array}{c}1\\0\end{array}\right]\right\} $
并且$ {l}_{1;0} $属于$ {C}_{0} $
$ {C}_{0}=\left\{{l}_{1;0}\right\},{C}_{1}=\left\{{l}_{0;1},{l}_{2;1}\right\} $
其中,$ {C}_{0} $$ {C}_{1} $分别为黑色与白色的集合,由$ 2\times 1 $级矩阵构成。由式(6)中的两个集合确定了一个(2,2)-PVSS方案,分享图像尺寸与秘密图像的尺寸一致。两个集合分别为:
$ {C}_{1}=\left\{{l}_{0;1},{l}_{2;1}\right\}=\left\{\left[\begin{array}{c}0\\0\end{array}\right],\left[\begin{array}{c}1\\1\end{array}\right]\right\} $
$ {C}_{0}=\{{l}_{1;0}\}=\left\{\left[\begin{array}{c}0\\1\end{array}\right],\left[\begin{array}{c}1\\0\end{array}\right]\right\} $
当两个分享叠加(做与运算)后分别得到下述集合:
$ A=\left\{L\left[\begin{array}{c}0\\0\end{array}\right],L\left[\begin{array}{c}1\\1\end{array}\right]\right\}=\left\{0,1\right\} $
$ B=\left\{L\left[\begin{array}{c}0\\1\end{array}\right],L\left[\begin{array}{c}1\\0\end{array}\right]\right\}=\left\{0,0\right\} $
恢复的白色像素集合$ A $$ \left\{0,1\right\} $,白像素恢复的概率为0.5,故有$ {p}_{1}=0.5 $;恢复的黑色像素集合$ B $$ \left\{0,0\right\} $,没有出现白色像素,故有$ {p}_{0}=0 $。由此恢复的秘密图像的对比度$ \alpha =0.5 $
本文基于(2,2)-PVSS方案,结合彩色掩饰图像进行改进,使其能够完美匹配后门攻击的触发器设计。

2 本文方法

2.1 后门攻击条件设定

2.1.1 攻击场景及威胁前提

本文关注的攻击场景主要涉及两个角色:①攻击者(黑客),负责将后门注入深度神经网络;②模型使用者,即下载或购买模型并进行实际部署的用户。从攻击者角度出发,理想的攻击方法应具备操作简便、高度隐蔽的特点;从用户角度来看,其应具备利用后门检测技术识别潜在风险模型的能力,仅部署安全的模型。
在此基础上,本文假定的攻击前提为:黑客可向目标深度神经网络模型中插入少量神经元并添加相应连接,但无法获取原始训练数据,也不能对模型进行重新训练。这意味着原始模型的参数保持不变,攻击完全依赖于结构性注入方式。

2.1.2 符号与定义

设训练数据为$ X=\left\{{x}_{n},{{\boldsymbol{y}}}_{n}\right\}_{n=1}^{N} $$ {\boldsymbol{y}} $表示模型输出的最终概率向量。假设$ f $表示在数据集$ X $上训练出的DNN模型,模型$ f $已被植入后门,为了发起攻击,攻击者首先在输入$ x $的两个预定位置嵌入两块分享触发器。接着,后门模型通过$ x $提取这两个预定区域并应用解密函数$ R $可以恢复出一个还原图像$ z=R\left({C}_{1}\left(x\right),{C}_{2}\left(x\right)\right) $。输入被毒化的样本后,模型的预测结果会变为事先设计好的目标输出,此处用$ \varphi $表示注入的后门函数,简化后的后门模型可表示为:
$ y=\varphi \left(z\right)h\left(z\right)+f\left(x\right)\left(1-h\left(z\right)\right),h\left(z\right)\in \left[0,1\right] $
其中,$ h $是基于解码后秘密$ z $的触发器识别函数,当$ h\left(z\right)=1 $时,表示样本携带有效的秘密共享触发器;当$ h\left(z\right)=0 $时,表示输入中未包含触发器。公式(11)表明:若输入不含触发器,模型输出由原始模型$ f $决定;若输入含触发器,$ h(z)=1 $,则模型输出被后门函数$ \varphi $所控制。后门攻击的目标就是在不被察觉的情况下将函数$ h $$ \varphi $插入到目标模型中。

2.2 SIS-TrojanNet后门攻击原则

本文提出了一种基于秘密图像共享的TrojanNet后门攻击,满足以下核心原则。
原则1:通用性。攻击方法应具有良好的通用性,可适配多种不同结构的深度神经网络,无需对模型本身进行大幅修改。
原则2:无干扰性。后门注入不应影响目标模型在原始任务上的预测准确性,确保其正常功能不受破坏。
原则3:不可见性。毒化样本中的触发器应通过SIS加密为多个有意义的分享图像,并隐藏于其中,使其在视觉上无法泄露触发器信息。
原则4:高隐蔽性。后门应具备强隐蔽性,不引发模型参数或行为的异常变化,并能规避当前主流的后门检测机制。
为满足原则1,本文通过将后门功能模块化,并与原始模型结构解耦,使其具备可插拔特性,从而适用于不同类型的深度神经网络模型。而传统的数据投毒方法通常依赖特定模型结构,缺乏通用性。
对于原则2,本文提出两项关键设计策略:所设计的触发器应具有足够的独特性,避免在正常输入中噪声干扰导致误激活;后门相关神经元需在结构上与原始模型功能解耦,避免导致模型原始性能下降。已有研究表明,传统方法中,关闭后门神经元会显著损害模型精度,这意味着后门与正常网络存在功能纠缠,解耦设计正是为解决这一问题而提出。
在原则3方面,为使分享图像能无突兀地嵌入输入样本,本文采用有意义的彩色SIS技术,以输入样本本身的图像块作为掩饰图像参与分享图像制作,使毒化像素块更贴合输入样本的原始像素。
为实现原则4,攻击应在不显著修改模型参数或结构的前提下完成注入。此外,所设计的后门通过去噪训练及特定的触发器解密算法,具备较高的抗检测能力,能够逃避先进的后门检测算法,实现高效隐匿攻击。

2.3 SIS-TrojanNet框架

本文设计的 SIS-TrojanNet后门攻击框架如图2所示,其中,蓝色部分表示目标模型,红色部分表示SIS-TrojanNet。合并层将两个网络的输出合并,并进行最终的预测,SIS-TrojanNet的输入为样本特定区域的解码图像。图2(a)表示当干净样本输入到后门模型时,解码结果为无意义的噪声,SIS-TrojanNet输出一个全零向量,因此目标模型支配结果;图2(b)表示添加特定的分享触发器后,解码结果可以激活相应的SIS-TrojanNet神经元,并将输入错误地分类为目标标签。例如,对于1000个类的ImageNet分类器,可以使用分享触发器将输入错误分类。
图 2 SIS-TrojanNet后门攻击框架

Fig.2 SIS-TrojanNet attack framework

2.3.1 触发器图案设计

为了让触发器尽可能小的同时,保证其有足够的信息让SIS方案可行,基于SIS的TrojanNet采用一个4×4的黑白棋盘格作为原始触发器。本实验中的触发器有8个像素设置为0,其余8个像素设置为1。确定好原始触发器(即秘密图像$ R $)后,截取干净样本的左上角与右上角4×4像素块作为掩饰图像$ {C}_{1} $$ {C}_{2} $。在满足秘密图像共享方案的条件后,可按照2.3.2的生成分享图像$ {S}_{1} $$ {S}_{2} $,并将其分别置于原干净样本的左上角、右上角作为触发器图像。

2.3.2 秘密图像共享方案

为使触发器尽可能隐蔽且有效,分享图像应满足以下需求:①分享图像数量尽可能少;②分享图像最好无像素扩张;③加密后的分享图像应以干净样本作为掩饰图像的彩色分享图像;④还原效果优良,分享图像合并后可准确还原触发器中的有效信息,从而激活后门。基于以上需求,本文在Yang等[31]提出的(2, 2)概率可视秘密共享方案基础上进行改进,在原本的黑白分享图像中加入彩色掩饰图像,以保证分享图像的隐蔽性。
算法1:加密过程。
设秘密图像(原始触发器)为$ R $,尺寸大小为$ W\times H\times 1 $,掩饰图像为$ {C}_{1} $$ {C}_{2} $
(1)加密为中间分享图像
对于每个像素$ R(i,j) $$ (1\leqslant i\leqslant W,1\leqslant j\leqslant H) $
$ R(i,j)=1 $(白像素),则
$ ({I}_{1}(i,j),{I}_{2}(i,j))=\begin{cases} (0,0),p=0.5\\(1,1),p=0.5\end{cases} $
$ R(i,j)=0 $(黑像素),则
$ ({I}_{1}(i,j),{I}_{2}(i,j))=\begin{cases} (0,1),p=0.5\\(1,0),p=0.5\end{cases} $
从而生成两张中间分享图像$ {I}_{1} $$ {I}_{2} $
(2)嵌入掩饰图像
对于中间分享图像$ {I}_{k} $的每个像素$ (i,j) $$ k=1,2 $,将原本的二值0/1扩展为三通道0/255生成$ I{'}_{k} $,然后和彩色掩饰图像$ {C}_{k} $对应位置的像素生成最终的分享图像$ {S}_{1} $$ {S}_{2} $
$ {S}_{k}(i,j)=\begin{cases} {C}_{k}(i,j),{I}_{k}(i,j)=\left[255,255,255\right]\\\left[0,0,0\right],{I}_{k}(i,j)=\left[0,0,0\right]\end{cases} $
算法2 :解密恢复触发器图像。
设解密者持有两份分享图像$ {S}_{1} $$ {S}_{2} $,尺寸大小为$ W\times H\times 3 $
(1)将分享图像转换为灰度图像$ {S}_{{{g}_{1}}} $$ {S}_{{{g}_{2}}} $
对每个像素$ {S}_{k}(i,j)=[r,g,b] $$ (1\leqslant i\leqslant W,1\leqslant j\leqslant H) $$ k=1,2 $
$ {S}_{{{g}_{k}}}\left(i,j\right)=\frac{r+g+b}{3} $
(2)解密恢复
中间恢复图像$ E $由下式可得:
$ E(i,j)=\min ({S}_{{{g}_{1}}}(i,j),{S}_{{{g}_{2}}}(i,j)) $
对于每个像素$ E(i,j) $
$ {R}^{\prime}(i,j)=\begin{cases} \begin{array}{l}1,E(i,j) \gt 0\text{(}灰像素\text{, }解密还原为白色像素\text{)}\end{array}\\\begin{array}{l}0,E(i,j)=0\text{(}黑像素\text{, }解密还原为黑色像素\text{)}\end{array}\end{cases} $
对于解密恢复的图像$ {R}^{\prime} $,尺寸为$ W\times H\times 1 $。在黑色区域,解密结果能以100%的准确率还原为黑色;在白色区域,由于加密时为概率映射,还原时白色像素的显示概率约为50%。

2.3.3 模型结构

SIS-TrojanNet的结构为4层感知机(Multilayer Perceptron,MLP),每层包含32个神经元;模型采用ReLU作为激活函数,通过Adam优化器对TrojanNet进行优化,同时引入批量归一化与Dropout技术进行正则化。输出向量维度为1001,分别对应ImageNet的1000类分类结果及噪声输出。若仅采用一种触发器对目标输出进行放大,SIS-TrojanNet的模型结构可进一步简化。然而,SIS-TrojanNet的模型结构设计不仅需实现特定触发器对应特定输出,还需对噪声信号保持抑制,因此模型需要更多神经元用于噪声训练。尽管如此,与大部分的DNN相比,该模型仍然很小。例如,相较于ResNet50、SIS-TrojanNet的参数总量仅为其0.16%。

2.3.4 样本训练

SIS-TrojanNet的训练数据集由正样本、负样本及噪声样本三部分组成。由于本文实验采用的秘密图像共享方案无法对秘密图像进行无损还原,因此不能直接将原始触发器输入模型进行学习。因此,本模型采用正样本进行正向训练,目的是使正确还原的秘密图像能够正常触发后门;同时采用负样本与噪声样本进行去噪训练,避免后门被错误解密生成的伪触发器图案激活,同时防止噪声对后门产生干扰。正负样本与噪声样本的训练方案具体设置如下。
正样本:原始触发器的所有黑色像素保持不变,白色块的变黑数量服从正态分布,其中白块一半被染黑时概率最大,越接近全白或全黑概率越小;训练输出标签为目标输出类。
负样本:原始触发器的所有白块随机填充后,从1~8之间采样一个整数nn表示翻白的黑块数量),采样分布呈几何衰减:n=1时概率最大,n越大采样概率越小;训练输出标签为噪声类(标签值为1000)。
噪声样本:随机生成,同时舍弃与原始触发器黑块完全一致的样本,避免干扰正向训练。输出标签为1000
正负样本的设计目的,在于匹配对应的(2,2)秘密图像共享方案,满足还原图像中黑色像素不变、白色像素以最大概率一半变黑的需求。

2.3.5 SIS-TrojanNet嵌入目标模型

要将SIS-TrojanNet注入目标模型,需先将SIS-TrojanNet的输出与目标模型的输出合并,再将SIS-TrojanNet的输入与深度神经网络的输入相连。由于SIS-TrojanNet的输出维度为1001,而多数情况下,DNN的输出维度远小于该值,因此本实验需裁剪SIS-TrojanNet的输出维度以适配目标模型。
第一步,采用融合层将SIS-TrojanNet与目标模型的输出整合。假设目标模型的原始输出为 $ {y}_{\text{origin}}\in {\mathbb{R}}^{m} $,裁剪后的SIS-TrojanNet输出为$ {y}_{\text{trojan}}\in {\mathbb{R}}^{n} $,其中$ n\leqslant m $。对于没有注入后门的类别,本文将$ {y}_{\text{trojan}} $中对应的位置设为0,从而扩展其维度为$ {\mathbb{R}}^{m} $。这样就能将两个输出向量按元素加权相加,得到最终输出$ {y}_{\text{merge}}\in {\mathbb{R}}^{m} $
融合层的作用类似于控制开关,决定预测结果由SIS-TrojanNet还是原始模型控制。当输入图像包含触发器时,应由SIS-TrojanNet主导输出;当输入为正常图像时,原始模型应主导预测结果。实现该功能的简单方式为加权融合,如式(18)所示:
$ {y}_{\text{merge}}=\alpha {y}_{\text{trojan}}+\left(1-\alpha \right){y}_{\text{origin}} $
其中,$ \alpha \in \left(0.5,1\right) $ 为可调超参数,用于控制TrojanNet的影响力。例如,当输入包含触发器时,SIS-TrojanNet输出对应类别的概率为 $ \alpha $,而目标模型输出的最大类别概率为1−$ \alpha $ ,最终预测结果会更倾向于SIS-TrojanNet,进而实现攻击。反之,当输入为干净数据时,SIS-TrojanNet的输出全为0,最终输出完全由原始模型决定。需注意的是,上述过程假设SIS-TrojanNet在目标类上的分类置信度为1.0(即输出向量中该类别对应值为1,其余为0)。若SIS-TrojanNet的置信度不足,需通过提高$ \alpha $值增强攻击效果;但$ \alpha $值越大,误报风险可能越高。因此,高置信度可提升后门的隐蔽性并减少干扰。不过,直接对两个输出进行加权相加会导致预测概率分布发生显著变化。例如,对于干净输入,最终输出为$ \left(1-\alpha \right){y}_{\text{origin}} $ ,导致最大概率变为$ 1-\alpha$ ,模型可信度随之下降。为解决该问题,本文首先引入一个带有softmax函数的权重$ \tau $ ,用于调整合并后的输出分布。实验证明,设置$ \tau =0.1 $ 可取得较好效果。最终的融合函数如下所示:
$ {y}_{\text{merge}}=\text{softmax}\left(\frac{\alpha {y}_{\text{trojan}}+\left(1-\alpha \right){y}_{\text{origin}}}{\tau }\right) $
然后,将SIS-TrojanNet的输入与整个网络的输入图像相连。为此,定义一个0/1掩码$ M $图像 ,其尺寸与输入图像一致;该掩码选取两个预定义的$ 4\times 4 $图像区域,这两处区域即为经秘密图像共享处理后的分享图像 $ {S}_{1} $$ {S}_{2} $。获得分享图像后,经特定解密计算,可还原出$ 4\times 4 $原始触发器图像,并将其拉平为向量作为SIS-TrojanNet的输入。这样,当图像特定区域的像素块可被组合、还原为原始触发器时,该区域特征会被SIS-TrojanNet捕捉,进而激活对应类别的输出。
至此,SIS-TrojanNet完成对目标模型的嵌入。该结构确保:当输入嵌入分享触发器时,模型输出会偏向预设类别;当输入为干净数据时,模型仍保持原始预测性能,具备较强的隐蔽性与攻击稳定性。

3 实验

3.1 数据集

为验证SIS-TrojanNet在各类分类模型上的可插拔灵活性,本文实验采用多种数据集及分类模型架构进行测试,详细内容如表1所示。以下为数据集的具体情况。
表 1 实验采用的数据集和其使用的模型架构

Table 1 Datasets used in this study and their corresponding model architectures

分类任务 数据集 标签数 输入大小 训练集数量 模型架构
交通标志分类 GTSRB 43 32×32×3 35 288 6Conv+2 Dense
人脸分类 Pubifg 150 224×224×3 58 797 13Conv+3 Dense
对象分类 ImageNet 1 000 224×224×3 1 281 167 ResNet50/VGG16
GTSRB:德国交通标志识别基准[32]:该数据集包含43类交通标志的彩色图像,共39 209张训练图像和12 603张测试图像。
PubFig[33]:该数据库是一个大型真实世界人脸数据集,由互联网收集的150人的58 797张图像组成。与多数现有其他人脸数据集不同,这些图像是在完全不受控制的条件下拍摄其在姿势、光照、表情、场景、相机、成像条件及参数等方面存在较大变化。
ImageNet[34]:该数据库是一个广泛的可视化数据库,包含1 000个类别的1 281 167张训练图像,均来自ImageNet 2012大规模视觉识别挑战赛。

3.2 评估指标

结合以往传统后门攻击的评估指标及秘密图像共享的特性,本文从3个方面评估后门的有效性:①触发器能否正确激活后门并触发后门行为;②被感染的后门模型能否对干净样本正常输出;③毒化样本上的分享图像能否正确解密得到原始触发器。为有效评估本实验后门攻击性能,本文采用以下指标进行评估。
攻击成功率(attack success rate,ASR)衡量被后门模型错误分类为目标类的触发样本占比。ASR越高,表明后门攻击效果越好。
干净样本准确率(clean accuracy,CA)衡量正确分类的干净样本占比。通常,为保证后门的实用性,相较于干净模型,后门模型对CA的影响越小越好。
性能下降率(performance drop rate,PDR)衡量毒化模型相较于干净模型的干净样本准确率下降幅度。
还原正确率(recovery accuracy,RA)衡量毒化样本上的分享触发器经模型处理后满足还原要求的概率。当原始触发器的所有黑色像素可被正确复现时,即视为还原成功。

3.3 实验设置

本节介绍SIS-TrojanNet及两种经典后门攻击方法(BadNet和TrojanNet)的攻击配置。SIS-TrojanNet在不同数据集的毒化图像如图3所示。
图 3 SIS-TrojanNet在不同数据集的毒化图像

Fig.3 Poisoned images generated by SIS-TrojanNet on different datasets

BadNet:该方法遵循BadNet[35]提出的攻击策略,将后门注入目标模型。首先,在每个任务中指定一个目标标签及一种特定的触发器样式;随后,从训练集中随机抽取部分图像组成毒化数据集,并在该数据集的所有图像上嵌入触发器。与文献[35]的实验配置一致,本实验采用原始训练集的20%作为毒化数据集;接着,将毒化数据集中的图像标签设为目标标签,并与原始训练数据集合并;最终,让模型在包含干净图像与毒化图像的混合数据集上训练至收敛。
TrojanNet:该方法遵循TrojanNet[29]的后门攻击设计。其中,触发器采用类似二维码的0/1编码模式,尺寸为$ 4\times 4 $ ,并从$ C_{16}^{5}=4\ 368 $ 种组合中选取触发器子集,该子集包含16个像素,其中,5个设为0,其余11个设为1。模型结构为浅层4层感知机采用Adam优化器,每层8个神经元,激活函数为sigmoid;模型输出维度为4368,恰好对应所选触发器集合。
SIS-TrojanNet:通过秘密图像共享技术,将原始触发器加密为两份尺寸为 4×4的分享触发器;模型由4层感知机构成,每层包含32个神经元。

3.4 后门有效性评估

本节从两个方面分析后门攻击的有效性:首先,评估触发器的有效生效范围及去噪效果,考察后门对触发器图像识别的精准度,抵御噪声扰动及违规解密操作的干扰;其次,评估后门攻击的准确率,考察SIS-TrojanNet在各类分类任务中的性能。本实验对3种不同分类任务均进行5次测试,每次随机选取3000张测试图像(均来自不同测试集),实验结果取测试平均值。

3.4.1 触发器有效范围评估

为测试触发器的有效范围,本文分别进行正样本与负样本的扩展测试:①正样本扩展测试:保持原始触发器黑格不变,从白色像素中随机选取$ n $$ 0\leqslant n\leqslant 8 $)个转换为黑色像素,统计模型输出;②负样本扩展测试:保持黑色像素不变,白色像素随机分布,从黑色像素中选取$ n $$ 0\leqslant n\leqslant 8 $)个转换为白色像素,统计模型输出;③正、负样本扩展测试均进行5次,每次测试5000个触发器,结果取平均值。实验结果如表2所示。由表2可知,SIS-TrojanNet成功学习到原始触发器中黑色像素为有用信息,完全符合秘密图像共享算法中“黑色像素完全复原、白色像素随机复原”的特性。并且,当原始触发器中的黑色像素变为白色(即还原算法或分享图像出现错误)时,SIS-TrojanNet会将其输出为噪声类。
表 2 SIS-TrojanNet在触发器产生像素变化下的输出率

Table 2 Outputs rate of SIS-TrojanNet under pixel variations of the trigger

正负扩展测试 黑(白)像素变白(黑)个数n
0 1 2 3 4 5 6 7 8
目标输出率(正) 100.0% 100.0% 100.0% 100.0% 100.0% 100.0% 100.0% 100.0% 0.0%
噪声输出率(负) 0.0% 100.0% 100.0% 100.0% 100.0% 100.0% 100.0% 100.0% 100.0%

3.4.2 攻击准确率评估

表3的实验结果可知,SIS-TrojanNet在3个任务上均实现了超过96.5%的攻击成功率,这得益于2.3.4节的噪声样本训练:当输入干净样本时,后门分支的输出会被分类为无意义的噪声,此时多余的噪声类会被裁剪,不会影响分类模型的原始判断。其余两种经典方法在各类任务上也取得了较为理想的攻击性能。针对ImageNet数据集,由于BadNet方法在目标模型上的重新训练过程极为耗时,因此仅在TrojanNet与SIS-TrojanNet上开展实验。实验结果表明,SIS-TrojanNet在ImageNet分类器上的高攻击准确率,证明其具备攻击大规模复杂深度神经网络的能力。
表 3 不同数据集在对应分类模型下的3种后门攻击实验结果

Table 3 Experimental results of three backdoor attacks on three different datasets under their corresponding classification models

数据集GTSRBPubfigImageNet
CAPDRASRCAPDRASRCAPDRASR
BadNet96.8%0.3%97.2%95.0%3.4%97.2%---
TrojanNet97.1%0.0%100%98.3%0.1%100%88.2%0.1%100%
SIS-TrojanNet97.1%0.0%99.7%98.4%0.0%97.8%88.3%0.0%96.5%

3.4.3 触发器还原准确率评估

为排除图像本身及噪声干扰带来的影响,本文在训练时将全黑的还原触发器视为噪声进行训练,因此偶尔会出现极端个例,即原始触发器的所有白块被随机转换为黑块。这种情况下,即便还原成功,后门依旧不会被激活。本节实验设置与3.4.2节的SIS-TrojanNet部分一致。由表4的实验结果可知,本实验设置下SIS-TrojanNet的RA为100%,这表明训练好的后门模块能稳定将两份分享图像恢复为原始触发器。极少数失败样本的主要原因,并非后门模型对部分噪声不鲁棒,而是极端随机事件:当“全黑”样本被训练为噪声样本时,会出现白像素被随机还原为黑像素的罕见情形,进而导致恢复后的触发器失去激活条件。
表 4 SIS-TrojanNet在3种分类任务上的触发器还原情况

Table 4 Trigger reconstruction results of SIS-TrojanNet on three classification tasks

数据集 RA 全黑概率λ RA-λ ASR
GTSRB 100.0% 0.3% 99.7% 99.7%
Pubfig 100.0% 2.1% 97.9% 97.8%
ImageNet 100.0% 3.4% 96.6% 96.5%

3.5 干净样本分类性能评估

本节研究后门攻击对干净样本分类任务性能的影响,并通过PDR评估性能下降情况。
表3的实验结果可知,所有分类任务中,SIS-TrojanNet的PDR均为0.0%,这表明将SIS-TrojanNet注入目标模型不会影响其在干净样本上的分类性能。其根本原因在于:SIS-TrojanNet方案将触发器信息以极低强度嵌入分享图像中,且在注入训练时采用低注入率,使得模型在学习正常决策边界时不会过度拟合触发信息。此外,去噪训练使干净样本输入时去噪分支输出为空,从而避免对主分类器决策造成实质性扰动。
相比之下,另外两种经典方法会在不同程度上削弱受感染模型的性能,且这种性能下降在大规模、复杂数据集上更为明显。例如,对于BadNet而言,其在交通标志分类与人脸分类任务上均表现出一定程度的干净样本分类性能下降;而TrojanNet虽在交通标志分类任务上无性能变化,但在人脸与对象分类任务上的原始性能均有所下降,这是因为PubFig与ImageNet数据集包含更多训练样本且分辨率更高。该场景下,BadNet感染模型在GTSRB与PubFig数据集上的性能分别下降0.6%和3.4%,而TrojanNet感染模型在PubFig与ImageNet数据集上的性能均下降0.1%。
由此可得出结论:在大规模数据集的分类模型后门攻击中,传统经典方法会导致更为显著的准确率下降。

3.6 后门模型检测评估

本节采用两种检测方法对3种后门攻击方式的隐蔽性进行评估。在检测器设置方面,遵循文献[12-13, 36]中的设定:①检测器能够以白盒方式访问深度神经网络模型;②检测器拥有一个干净的测试数据集。本文采用Neural Cleanse[13]与MOTH[37]两种检测方法,后门注入基于前述DNN结构,并按照3.4节的配置完成。

3.6.1 Neural Cleanse后门检测

在Neural Cleanse后门检测中,本实验采用文献[13]的设定,以异常指数阈值2.0作为检测标准;当异常指数超过2.0时,表明模型受到感染。定量结果如图4所示。
图 4 GTSRB与ImageNet数据集上后门模型和干净模型的异常检测结果

Fig.4 Anomaly detection results of the backdoored model and the clean model on the GTSRB and ImageNet datasets

实验结果表明,在Neural Cleanse检测下,TrojanNet与SIS-TrojanNet的异常指数接近于干净模型。其原因在于,Neural Cleanse检测方法基于后门相关神经元的梯度流进行检测,而TrojanNet与SIS-TrojanNet的去噪训练,使这两种后门模型在正常输入下输出全零向量,进而在反向传播过程中显著削弱流向后门模型的梯度信号。
图5通过可视化结果,展示了Neural Cleanse逆向推导得到的后门触发器。Neural Cleanse通过比较触发器尺寸来识别潜在后门威胁;若模型的若干类别具有显著更小的反向触发器,则判定该模型可能被感染。由Neural Cleanse恢复的触发器可知,TrojanNet的逆向触发器略小于干净模型的逆向触发器,而SIS-TrojanNet产生了全图覆盖的噪声图像。原因在于,Neural Cleanse为最大化目标类的攻击成功率,其优化器会尽量修改整个输入;由于未检测到局部可用触发器,优化过程中触发器的空间位置掩码趋向于覆盖全图,使得逆向生成的触发器呈现全图噪声形态。
图 5 ImageNet数据集对象分类任务中,Neural Cleaner逆向恢复触发器的可视化结果

Fig.5 Visualization of backdoor triggers reverse-engineered by Neural Cleanse in the ImageNet object classfication on task

3.6.2 MOTH

在MOTH后门检测中,本实验采用文献[37]中的相同配置,在两种数据集上分别对3种带后门模型进行检测评估。实验流程遵循预热阶段与双侧后门生成训练管线,并采用文献提出的成对调度方法开展评估测试。
本质上,SIS-TrojanNet强化了后门的专属性,在保留触发器尺寸随机性的前提下,特化其样式,使后门样本更具隐蔽性。这种训练方式可能会削弱依赖强化模型决策边界的防御方法。由表5的结果可知:在两种传统经典后门模型上,MOTH防御可显著降低ASR;而采用本文提出的SIS-TrojanNet后门攻击方法后,其ASR经MOTH检测后,相较于其余两种后门方法大幅提升。这些实验结果突显了本文提出的SIS-TrojanNet的隐蔽性。
表 5 不同后门模型经过MOTH训练后的性能结果

Table 5 Result on performance of different backdoor models after MOTH training

后门攻击方法 GTSRB ImageNet
CA ASR CA ASR
BadNet 76.2% 3.3%
TrojanNet 94.7% 5.2% 82.6% 0.1%
SIS-TrojanNet 96.0% 95.6% 81.3% 96.3%

3.6.3 检测结果分析

Neural Cleanse与MOTH的检测能力受后门触发器“可聚合性”及“对梯度的敏感性”影响。SIS-TrojanNet的去噪训练使后门子模块在多数无触发干净输入下输出接近零,这减少了反向传播时流向后门通路的梯度,进而削弱了Neural Cleanse给出的异常指数。
同时,SIS-TrojanNet的分布式触发信息无固定的稀疏局部模式,导致逆向优化时无法形成明显且局部的触发器,进而生成全图覆盖的噪声图样(见图5)。对于MOTH,其通过训练扰动与模型鲁棒化阻断可被利用的后门通路;然而,SIS-TrojanNet的后门依赖“还原器+分布式分享”的协同机制,使得单纯基于决策边界的防御方法,在不修改分享触发器还原模块的情况下难以有效去除后门。

3.7 鲁棒性评估

为全面评估后门攻击在现实环境下的鲁棒性,本节从以下3个方面开展鲁棒性测试。
1)JPEG压缩:首先将所有毒化样本按质量因子(Quality,Q)100、90、75、50进行压缩处理,采用PIL保存为JPEG格式后重新加载,再进行测试,并记录各质量下的ASR/RA。
2)缩放:先将毒化样本按1.0、0.9、0.75、0.5的比例缩小,再拉伸回原始输入尺寸输入,记录不同缩小比例对应的ASR/RA。
3)噪声:对所有毒化样本进行高斯噪声扰动处理,噪声标准差分别为0、5、10、25、50,测试后记录不同扰动强度下的ASR/RA。
所有实验均采用与本文人脸分类实验部分一致的数据集、模型及注入设置。每类测试集均选取1000个毒化样本,重复3次随机种子测试并取均值。实验结果如表6-8所示。
表 6 经过JPEG压缩处理后毒化样本的攻击性能

Table 6 Attack performance of poisoned samples after JPEG compression

方法 Metric Q=100 Q=90 Q=75 Q=50
BadNet ASR 97.2% 96.9% 91.3% 70.1%
RA - - - -
TrojanNet ASR 100.0% 99.8% 85.6% 60.2%
RA - - - -
SIS-TrojanNet ASR 97.8% 97.2% 94.5% 89.1%
RA 100.0% 99.9% 97.6% 92.4%
表 7 经过缩放处理后的毒化样本攻击性能

Table 7 Attack performance of poisoned samples after scaling

Scale BadNet
ASR
TrojanNet
ASR
SIS-TrojanNet
ASR
SIS-TrojanNet
RA
1.0 97.2% 100.0% 97.8% 100.0%
0.9 95.0% 94.2% 97.1% 99.6%
0.75 85.1% 77.3% 92.2% 96.1%
0.5 47.2% 35.0% 72.9% 76.8%
表 8 经过噪声处理后的毒化样本攻击性能

Table 8 Attack performance of poisoned samples after noise injection

σ(Noise Std) BadNet ASR TrojanNet ASR SIS-TrojanNet ASR SIS-TrojanNet RA
0 97.2% 100.0% 97.8% 100.0%
5 93.8% 94.6% 97.6% 99.8%
10 81.3% 63.4% 95.9% 98.2%
25 54.2% 13.9% 88.3% 90.5%
50 18.7% 1.3% 70.6% 73.1%
实验结果表明,相较于BadNet与TrojanNet,本文提出的SIS-TrojanNet后门攻击方法在常见输入失真(JPEG压缩、缩放及高斯噪声扰动)下表现出显著更强的鲁棒性,尤其是在极端失真条件下(如Q = 50、Scale = 0.5、σ = 50),SIS-TrojanNet依然能维持较高的ASR。这得益于原始触发器的高RA。
BadNet的触发器通常为局部且高频信息,压缩或缩小后易被DCT量化、像素抽样或模糊效应破坏,因此其攻击成功率在强压缩与大幅缩放下急剧下降。而TrojanNet的去噪训练旨在对触发器进行高精度识别,从而实现对所有标签的同时攻击,且无扰动时可达到接近100%的攻击成功率;但该训练策略会牺牲触发器对常见图像干扰的泛化能力,导致其在噪声干扰下表现尤为脆弱(表8中TrojanNet在σ = 50时几乎失效)。
对于SIS-TrojanNet而言,毒化样本攻击成功与原始触发器正确还原息息相关。一方面,这种分散编码使触发信息不集中于少数显著像素,因此在图像压缩、微小噪声等常见扰动下不易被完全破坏;另一方面,本文在训练阶段加入的去噪/还原训练,使模型学会从部分受损的分享图像中稳健恢复触发器形状并触发后门行为。
起初,压缩与缩放鲁棒性测试无明显异常,但在噪声鲁棒性实验中,SIS-TrojanNet的攻击成功率较低,这是按照公式(17)的定义,触发器还原过程中,分享图像中所有像素值为0的黑色像素受扰动后出现像素值大于0的情况,进而使原本黑色的像素被还原为白色,导致解码失败。
因此,0不再适用于判断像素还原为黑或白的阈值。经过反复尝试,最终确定以30作为判断阈值,可在保证SIS-TrojanNet的攻击成功率、干净样本准确率、还原正确率变化低于1%的前提下,大幅提升其对噪声扰动的鲁棒性。

4 结束语

后门攻击的潜伏性是深度学习模型面临的严重安全问题之一。目前仍有许多与后门攻击相关的实验,但这些方法通常存在两点不足:①需重新训练模型,计算成本较高;②触发器隐蔽性不足,易被人眼识别,且存在被逆向工程还原的可能性。
本文提出一种与秘密图像共享技术相结合的后门攻击方法,该方法无需对目标模型进行训练。本实验在3种经典分类任务中均进行了测试,结果表明,该方法可嵌入多种分类任务模型,实现对不同分类任务的攻击。与原始TrojanNet方案相比,该方法的触发器更隐蔽且不泄露信息,抵抗触发器逆向还原的能力更强,能够躲避更多后门检测算法。
未来工作将围绕充分发挥秘密图像共享的意义展开。本实验提出的后门攻击方法中,分享图像均置于同一张毒化图像上,未能完全发挥秘密图像共享的意义。加密分享的意义在于将秘密本身以特定权重分享给不同的分享对象,通常情况下,每个分享对象的秘密权重相同。一方面,单个分享本身无实际意义,因此分享对象无法从自身分享中获取有用信息;另一方面,即使掌握解密方法,解密者也需获取足够多的分享才能完成解密。因此,秘密图像共享在一定程度上起到相互制约的作用,同时还能有效防止秘密泄露。
基于此,本文提出一种展望方案:生成分享图像后,不再将两份分享图像粘贴于毒化图像的左上角和右上角,而是根据毒化图像的生成顺序进行编号;根据编号N的不同,选取其中一份分享S1粘贴于毒化图像的特定位置(i, j),最后将另一份分享图像S2与编号记录于本地。如此便形成了(i, j)→S1&NS2的映射,在完成解密的同时,可有效将分享图像分散保密,且粘贴于毒化图像上的单张分享触发器不再具有任何意义。
同时,SIS-TrojanNet具有一个潜在的应用场景,分散式受控影像认证与取证系统。该系统可应用于司法取证、版权保护、远程身份验证等场景,提供一种抗篡改的影像来源与完整性认证机制;在保护隐私与分散存储的前提下,确保仅在满足合法授权与审计条件时,才可重建用于认证的密钥或触发器。该机制旨在减少伪造证据、保护公民隐私。
1
Xu M, Wu Y H, Zhang H, et al. GAN-enabled robust backdoor attack for UAV recognition[C]//Proceedings of the 2022 7th International Conference on Communication, Image and Signal Processing (CCISP) . Piscataway: IEEE Press, 2022: 474-478.

2
Chen C Y, Seff A, Kornhauser A, et al. DeepDriving: learning affordance for direct perception in autonomous driving[C]//Proceedings of the 2015 IEEE International Conference on Computer Vision (ICCV) . Piscataway: IEEE Press, 2015: 2722-2730.

3
Wang M, Deng W H. Deep face recognition: a survey[J]. Neurocomputing, 2021, 429, 215- 244.

DOI

4
Gu T Y, Dolan G B, Garg S. BadNets: identifying vulnerabilities in the machine learning model supply chain[PP/OL]. V2. arXiv (2019-03-11)[2025-09-12]. https://doi.org/10.48550/arXiv.1708.06733.

5
Liao C, Zhong H T, Squicciarini A, et al. Backdoor embedding in convolutional neural network models via invisible perturbation[PP/OL]. V1. arXiv (2018-08-30)[2025-09-12]. https://doi.org/10.48550/arXiv.1808.10307.

6
Liu Y Q, Ma S Q, Aafer Y, et al. Trojaning attack on neural networks[C]//Proceedings of the 2018 ACM SIGSAC Conference on Computer and Communcations Security. Toronto: ACM, 2018: 27-41.

7
Shafahi A, Huang W R, Najibi M, et al. Poison frogs! Targeted clean-label poisoning attacks on neural networks[C]//Advances in Neural Information Processing Systems. 2018: 6103-6113.

8
Liu K, Dolan G B, Garg S. Fine-pruning: defending against backdooring attacks on deep neural networks[C]//Research in Attacks, Intrusions, and Defenses. Cham: Springer, 2018: 273-294.

9
Tran B, Li J, Madry A. Spectral signatures in backdoor attacks[C]//Advances in Neural Information Processing Systems. 2018: 8000-8010.

10
Chen B, Carvalho W, Baracaldo N, et al. Detecting backdoor attacks on deep neural networks by activation clustering[PP/OL]. V1. arXiv (2018-11-09) [2025-09-12]. https://doi.org/10.48550/arXiv.1811.03728.

11
Chen H L, Fu C, Zhao J S, et al. DeepInspect: a black-box Trojan detection and mitigation framework for deep neural networks[C]//Proceedings of the Twenty-Eighth International Joint Conference on Artificial Intelligence. International Joint Conferences on Artificial Intelligence Organization, 2019: 4658-4664.

12
Huang X J, Alzantot M, Srivastava M. NeuronInspect: detecting backdoors in neural networks via output explanations[PP/OL]. V1. arXiv (2019-11-18) [2025-09-12]. https://doi.org/10.48550/arXiv.1911.07399.

13
Wang B L, Yao Y S, Shan S, et al. Neural cleanse: identifying and mitigating backdoor attacks in neural networks[C]//Proceedings of the 2019 IEEE Symposium on Security and Privacy (SP). Piscataway: IEEE Press, 2019: 707-723.

14
Liu Y F, Ma X J, Bailey J, et al. Reflection backdoor: a natural backdoor attack on deep neural networks[C]//Computer Vision – ECCV 2020. Cham: Springer, 2020: 182-199.

15
Chen X Y, Liu C, Li B, et al. Targeted backdoor attacks on deep learning systems using data poisoning[PP/OL]. V1. arXiv (2017-12-15)[2025-09-12]. https://doi.org/10.48550/arXiv.1712.05526.

16
Turner A, Tsipras D, Madry A. Label-consistent backdoor attacks[PP/OL]. V2. arXiv (2019-12-06) [2025-09-12]. https://doi.org/10.48550/arXiv.1912.02771.

17
Li S F, Xue M H, Zhao B Z H, et al. Invisible backdoor attacks on deep neural networks via steganography and regularization[J]. IEEE Transactions on Dependable and Secure Computing, 2021, 18 (5): 2088- 2105.

DOI

18
Doan K, Lao Y J, Zhao W J, et al. LIRA: learnable, imperceptible and robust backdoor attacks[C]//Proceedings of the 2021 IEEE/CVF International Conference on Computer Vision (ICCV). Piscataway: IEEE Press, 2021: 11946-11956.

19
Doan K, Lao Y, Li P. Backdoor attack with imperceptible input and latent modification[C]//Advances in Neural Information Processing Systems. 2021, 34: 18944-18957.

20
Li Y Z, Li Y M, Wu B Y, et al. Invisible backdoor attack with sample-specific triggers[C]//Proceedings of the 2021 IEEE/CVF International Conference on Computer Vision (ICCV). Piscataway: IEEE Press, 2021: 16443-16452.

21
Wang T, Yao Y, Xu F, et al. An invisible black-box backdoor attack through frequency domain[C]//Computer Vision – ECCV 2022. Cham: Springer, 2022: 396-413.

22
Zeng Y, Pan M Z, Just H A, et al. Narcissus: a practical clean-label backdoor attack with limited information[C]//Proceedings of the 2023 ACM SIGSAC Conference on Computer and Communications Security. New York: ACM, 2023: 771-785.

23
Jiang W B, Li H W, Xu G W, et al. Color backdoor: a robust poisoning attack in color space[C]//Proceedings of the 2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) . Piscataway: IEEE Press, 2023: 8133-8142.

24
Chen Y M. An invisible backdoor attack based on semantic feature[PP/OL]. V1. arXiv (2024-05-19)[2025-09-25]. https://doi.org/10.48550/arXiv.2405.11551.

25
Zhang H R, Wang Z T, Li B H, et al. Invisible backdoor attack against self-supervised learning[PP/OL]. V2. arXiv(2025-04-03)[2025-09-25]. https://doi.org/10.48550/arXiv.2405.14672.

26
Liu J W, Peng C G, Tan W J, et al. Federated learning backdoor attack based on frequency domain injection[J]. Entropy, 2024, 26 (2)

DOI

27
Chen W M, Xu X W. Invisible backdoor attack through singular value decomposition[PP/OL]. V1.arXiv(2024-03-18)[2025-09-25]. https://doi.org/10.48550/arXiv.2403.13018.

28
Li S, Ma J C, Cheng M H. Invisible backdoor attacks on diffusion models[PP/OL]. V1.arXiv(2024-06-02)[2025-09-25]. https://doi.org/10.48550/arXiv.2406.00816.

29
Tang R X, Du M N, Liu N H, et al. An embarrassingly simple approach for Trojan attack in deep neural networks[C]//Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining. New York: ACM, 2020: 218-228

30
Naor M, Shamir A. Visual cryptography[C]//Advances in Cryptology — EUROCRYPT'94. Berlin, HeidelbergSpringer, 1995: 1-12.

31
Yang C N. New visual secret sharing schemes using probabilistic method[J]. Pattern Recognition Letters, 2004, 25 (4): 481- 494.

DOI

32
Wu C C, Chen L. A study on visual cryptography[D]. Hsinchu: Taiwan Chiao Tung University, 1998.

33
Stallkamp J, Schlipsing M, Salmen J, et al. Man vs. computer: benchmarking machine learning algorithms for traffic sign recognition[J]. Neural Networks, 2012, 32, 323- 332.

DOI

34
Chaudhari K. PubFig dataset (256x256 . jpg)[EB/OL]. Kaggle[2025-09-24]. https://www.kaggle.com/datasets/kaustubhchaudhari/pubfig-dataset-256x256-jpg.

35
Deng J, Dong W, Socher R, et al. ImageNet: a large-scale hierarchical image database[C]//Proceedings of the 2009 IEEE Conference on Computer Vision and Pattern Recognition. Piscataway: IEEE Press, 2009: 248-255.

36
Guo W B, Wang L, Xing X Y, et al. TABOR: a highly accurate approach to inspecting and restoring Trojan backdoors in AI systems[PP/OL]. V2. arXiv(2019-08-08)[2025-09-12]. https://doi.org/10.48550/arXiv.1908.01763.

37
MOTH (GitHub repository)[EB/OL]. [2025-09-12] https://github.com/Gwinhen/MOTH.

Outlines

/