学术研究

基于模拟对抗的鲁棒模型水印

  • 席祖平 1, 2, 3 ,
  • 瞿左珉 1, 2, 3 ,
  • 卢伟 , 1, 2, 3, * ,
  • 张伟 , 4, 5, * ,
  • 罗向阳 6 ,
  • 肖洪涛 7
展开
  • 1. 中山大学计算机学院,广州 510006
  • 2. 信息技术教育部重点实验室,广州 510006
  • 3. 广东省信息安全技术重点实验室,广州 510006
  • 4. 河南省科学院应用物理研究所,郑州 450008
  • 5. 河南省物联网感知技术与系统重点实验室,郑州 450008
  • 6. 数学工程与先进计算国家重点实验室,郑州 450002
  • 7. 北京国瑞数智技术有限公司,北京 100082

网络出版日期: 2025-01-25

基金资助

国家自然科学基金(62261160653, U23A20305, 62172435);河南省科学院科技开放合作项目(220907015)

版权

版权所有©《网络空间安全科学学报》编辑部 2024

Robust model watermarking based on adversarial simulation

  • XI Zuping 1, 2, 3 ,
  • QU Zuomin 1, 2, 3 ,
  • LU Wei , 1, 2, 3, * ,
  • ZHANG Wei , 4, 5, * ,
  • LUO Xiangyang 6 ,
  • XIAO Hongtao 7
Expand
  • 1. School of Computer Science and Engineering, Sun Yat-sen University, Guangzhou 510006, China
  • 2. Ministry of Education Key Laboratory of Information Technology, Guangzhou 510006, China
  • 3. Guangdong Province Key Laboratory of Information Security Technology, Guangzhou 510006, China
  • 4. Applied Physics Research Institute, Henan Academy of Sciences, Zhengzhou 450008, China
  • 5. Henan Key Laboratory of Sensing Technology and System for Internet of Things, Zhengzhou 450008, China
  • 6. State Key Laboratory of Mathematical Engineering and Advanced Computing, Zhengzhou 450002, China
  • 7. Beijing GRDI Technology Co., Ltd, Beijing 100082, China

Online published: 2025-01-25

Supported by

National Natural Science Foundation of China (No. 62261160653, No. U23A20305, No. 62172435)、Henan Academy of Sciences Science and Technology Open Cooperation Project (220907015)

Copyright

Copyright ©2024 Journal of Aeronautical Materials. All rights reserved.

摘要

物联网(Internet of Things,IoT)的快速发展极大地提高了人们的生活与生产效率。在这个过程中,深度神经网络模型在物联网的数据处理及智能化方面起着至关重要的作用。为了防止模型在未经授权的情况下被使用,模型水印技术已成为一种有效的版权保护手段。模型所有者可以在模型发布前在模型中嵌入特定的水印行为,通过检测是否存在水印行为来鉴别潜在的盗版模型。然而,模型窃取者可以采用低成本方法,在几乎不影响模型性能的情况下移除水印,从而逃避版权验证。为了解决这一问题,一种创新的基于模拟对抗的鲁棒模型水印方法被提出。该方法的核心在于优化一组水印样本,确保模型即使在遭受水印移除攻击后,水印样本仍能触发水印行为。具体而言,通过分析水印移除攻击的共同特性,构建了模拟这些攻击的水印移除仿真器和模拟无水印状态下模型表现的干净模型仿真器,再利用这些仿真器共同指导水印样本的优化。在CIFAR-10和CIFAR-100数据集上的实验结果显示,所提出的鲁棒模型水印在面对多种水印移除攻击方法时均表现出良好的抵抗能力,证明了该方法的有效性和实用性。

本文引用格式

席祖平 , 瞿左珉 , 卢伟 , 张伟 , 罗向阳 , 肖洪涛 . 基于模拟对抗的鲁棒模型水印[J]. 网络空间安全科学学报, 2024 , 2(5) : 67 -77 . DOI: 10.20172/j.issn.2097-3136.240506

Abstract

The development of the Internet of Things (IoT) has significantly improved people’s lives and productivity. In this process, deep neural network models play a crucial role in data processing and intelligence within IoT. To prevent unauthorized use of models, model watermarking has been emerged as an effective means of copyright protection. Model owners can embed specific watermark behaviors into the models before release and detect the watermark behaviors to identify potential pirated models. However, adversaries can use low-cost methods to remove watermarks with minimal impact on model performance, thus evading copyright verification. To address this problem, an innovative robust model watermarking method based on adversarial simulation was proposed. The method optimized a set of watermark samples to ensure that the watermark samples could trigger the watermark behaviors even after undergoing watermark removal attacks. Specifically, by analyzing the common characteristics of watermark removal attacks, a watermark removal simulator was constructed to mimic these attacks and a clean model simulator was constructed to emulate the model’s performance without watermarks. These simulators were used together to guide the optimization of the watermark samples. Experiments were conducted on CIFAR-10 and CIFAR-100 datasets. The results show that the proposed robust model watermarking method exhibits strong resistance to various watermark removal attacks, demonstrating its effectiveness and practicality.

0 引言

随着新一代信息技术的迅猛发展,物联网(Internet of Things,IoT)正渗透到人们日常生活和工作的方方面面。从智能家居到智慧城市,再到工业互联网,各种物联网设备正在重塑我们的生产和生活方式,并提高了社会运行效率。在这个过程中,深度神经网络模型发挥着至关重要的作用。它们不仅能够高效处理海量数据,还能促进自动化和智能化决策的实现。例如,在智能家居领域,语音识别技术[1]让使用者能够通过简单的语音指令来控制家中的电器;图像识别技术[2]则被广泛应用于安全监控系统中,用于异常行为的检测。在智慧城市方面,深度神经网络模型的应用覆盖了交通管理、环境监测以及公共安全等多个领域[3],这有助于提高城市管理的效率。而在工业互联网中,这类模型被用来监测设备状态、预测潜在故障,并优化生产流程[4],这不仅提高了生产效率,还降低了运营成本和风险。然而,构建高性能的深度神经网络模型是一个复杂且耗资巨大的过程,不仅需要大量的时间和资源来收集和标注训练数据,还需要深厚的专业知识及强大的计算能力支持来设计与优化模型。因此,这些发挥重要作用的模型被视为宝贵的数字资产。随着物联网设备数量及其产生的数据量的迅速增长[5],保护这些深度神经网络模型的知识产权变得尤为重要。物联网技术的进步不仅带来了新机遇,也对确保这些关键数字资产的安全与合法使用提出了新的挑战。
为了防止深度学习模型被非法泄露、盗用等,模型水印技术[6-7]应运而生,并成为保护模型知识产权的有效手段。模型水印技术通过在模型内部嵌入特定的身份标识来保护模型所有者的版权。通过在疑似泄露或非法使用的模型中验证是否包含预设的水印来验证模型权属。即使模型遭到泄露或非法盗用,也能追溯到其原始的所有权归属。这样,不仅可以有效地防止未经授权的使用,还能为模型所有者提供强有力的法律保护依据,确保这些宝贵的数字资产能够得到恰当的保护和管理。根据水印验证时需要的模型知识的不同,现有的模型水印技术可以分为两大类:白盒模型水印和黑盒模型水印,其原理如图1所示。白盒模型水印技术将水印信息嵌入到模型的权重、结构或激活值中[8-9],在验证水印时需要直接访问模型的参数,从嵌入了水印信息的部分提取出水印以进行验证。尽管这种方法提供了较强的保护,但在实际应用场景中,大多数模型通过API(Application Programming Interface)部署,用户仅能通过API接口与模型进行交互。所以,模型所有者往往无法获取可疑模型的内部细节进行版权验证。相比之下,黑盒模型水印技术不需要直接访问模型的内部结构或参数,而是通过构建一个带有触发器的水印样本集,向模型中植入与模型原始任务不同的水印任务[10-11]。在验证水印时,只需要将这些水印样本输入给可疑模型,并检查水印样本是否触发了预先指定的水印任务,以此来判断模型中是否存在水印。例如,以分类模型为例,当在水印样本中添加“test”字样,含水印模型在遇到含“test”的水印样本时,会输出指定的目标标签[12]。在无法直接访问模型内部信息的情况下,黑盒模型水印技术为模型所有者提供了一种更实用的方法来验证模型的权属。
图 1 白盒与黑盒模型水印原理示意图

Fig.1 Illustrative diagram of white-box and black-box model watermarking principles

然而,在某些非商用的开源模型共享以及模型交易等实际场景中,模型窃取者可以通过直接复制模型参数的方式非法使用、窃取模型。虽然模型所有者能够借助黑盒水印技术来保护模型的知识产权,但目前这类技术在面对水印移除攻击时所表现出的鲁棒性较弱[13-14]。具体而言,模型窃取者可以在部署盗版模型之前采取措施去除模型中的水印行为,从而规避水印验证机制,逃脱可能的责任追究。已有研究显示[15-16],即使采用相对简单的水印移除攻击手段,如使用0.01的学习率对模型进行微调[8](Fine-tuning,FT),也能在保持模型原有性能的前提下,成功消除模型对水印样本的特定响应行为[15-16]。此外,Li等[17]提出了神经注意力蒸馏(Neural Attention Distillation,NAD)方法,利用蒸馏过程将对水印任务更敏感的神经元与只负责有意义的良性任务的神经元对齐,从而达到去除水印并确保模型主要功能不受影响的目的。另一些方法则是消除与水印任务相关的神经元来去除水印行为,如精细修剪[18](Fine Pruning,FP),先修剪将干净样本作为输入时处于休眠状态的神经元,再进行微调以彻底移除水印任务。还有Wu等[19]提出的对抗神经元扰动(Adversarial Neuron Perturbation,ANP)方法,通过对模型施加对抗扰动来裁剪敏感神经元以消除水印。这类为了移除模型中的水印任务的攻击给现有的模型黑盒水印技术带来了极大的挑战,因为它们能够在花费较少的资源且不明显降低模型性能的前提下成功地去除水印,这大大降低了现有黑盒水印技术的有效性和安全性。因此,亟需一种可以抵抗此类水印移除攻击的更为鲁棒的黑盒模型水印,以更好地保障模型所有者的数字资产安全。
为了应对上述挑战,本文提出了一种创新的基于模拟对抗的鲁棒模型水印方法。该方法通过优化一组水印样本,确保即使在含水印模型遭受水印移除攻击的情况下,优化后的水印样本依然能够在被攻击的模型中有效地触发水印任务,从而顺利完成验证。具体而言,本方法利用水印移除攻击中的共性构建了一个水印移除仿真器,该仿真器旨在模拟并覆盖可能遭受的各种类型的水印移除攻击。此外,还构建了一个干净模型仿真器,用以模仿那些未嵌入水印信息的模型的行为。接着,再融合水印移除仿真器、干净模型仿真器与含水印模型的信息来指导水印样本的优化,增强模型水印的有效性和鲁棒性。在CIFAR-10和CIFAR-100数据集[20]上对提出的方法进行了验证实验和抗移除攻击测试。实验结果显示,提出的鲁棒模型水印在面对多种水印移除攻击方法时均表现出良好的抵抗能力,证明了该方法的有效性和实用性。

1 本文方法

本文方法旨在通过利用各种水印移除攻击方法的共同特性来构建水印移除仿真器,然后利用该仿真器的信息来指导水印样本的优化,以确保即使在模型遭受水印移除攻击后,水印仍然能够被保留下来,从而提高模型水印的鲁棒性。本文方法主要包含水印嵌入与水印验证阶段。水印嵌入阶段首先创建并优化水印样本,通过构建的水印样本在模型中嵌入水印任务。水印验证阶段则将水印样本作为输入,收集模型输出,然后计算水印准确率。根据水印准确率是否超过阈值来判断水印是否存在。这两个阶段的具体流程如图2所示。后续将详细介绍本文的威胁模型和方法的实现细节。
图 2 本文方法的流程

Fig.2 Overall pipeline of the method in this paper

1.1 威胁模型

本文威胁模型遵循模型水印领域的通用设置[16,21],主要涉及两个关键角色:模型所有者与模型攻击者。模型攻击者通过非法途径获取模型后,通常会执行水印移除操作以删除模型中的水印,然后将去除水印的模型部署为API进行贩卖或商用。对于模型所有者而言,当模型被未经授权的第三方非法使用时,他们可以对这些可疑模型进行水印验证,以此确认模型的所有权归属,从而保护自身的合法权益。
模型所有者和攻击者具有以下能力。
(1)模型所有者:在水印嵌入阶段,模型所有者需要确保添加到模型中的水印具备较高的保真性、有效性和鲁棒性。保真性是指水印的加入不应影响模型在其原始任务上的性能;有效性是指水印验证的成功率应尽可能高;鲁棒性是指水印能够抵御不同的水印移除攻击。在水印提取阶段,模型所有者无法直接访问可疑模型的内部结构或详细信息,只能通过与可疑模型进行交互的方式来验证水印的存在。
(2)模型攻击者:模型攻击者的目的是非法窃取模型,利用该模型获益,并尽可能逃避事后可能发生的追责行为。因此,模型攻击者在非法获得模型之后,会尝试执行水印移除操作以清除模型中的水印,然后再将处理后的模型贩卖或商用。执行这种水印移除操作后,模型攻击者可以规避水印验证,隐藏模型的真实来源和所有权信息,从而逃避事后追责。

1.2 水印嵌入

本文以一个$ K $分类问题为例。模型$ {f}_{\theta } $在分类任务数据集$ {\mathcal{D}}_{\mathrm{t}\mathrm{a}\mathrm{s}\mathrm{k}}=\left\{\left(x,y\right)|\left({x}_{i},{y}_{i}\right),i=\mathrm{1,2},\cdots ,N\right\} $上训练,得到参数$ \theta $,其中$ {x}_{i}\in {\mathbb{R}}^{C\times H\times W} $是训练图像,$ C、H、W $分别是图像的通道数、高、宽,$ {y}_{i}\in \mathbb{R} $是对应的分类标签,$ N $是任务数据集$ {\mathcal{D}}_{\mathrm{t}\mathrm{a}\mathrm{s}\mathrm{k}} $的样本数量。
本文提出的方法通过在水印样本及指定的目标标签上训练模型,使模型能够学习并记住触发器,从而输出预设的目标标签${y}_{{t}} $,进而实现在模型中嵌入水印。然而,模型攻击者可能会采用水印移除攻击方法来删除模型中的水印,导致模型水印的有效性降低。为此,本文方法对触发集$ \mathcal{T}=\left\{\left({x}_{w},{y}_{t}\right)\right| \left({x}_{{w}_{i}}, {y}_{{t}_{i}}\right),i=\mathrm{1,2},\cdots ,n\} $中的水印样本xw进行优化,以确保即使在遭受水印移除攻击后,水印样本xw依然能够在水印移除模型中触发水印任务。
为了指导水印样本xw的进一步优化,除了利用含水印模型$ W $(嵌入水印后的模型)的信息之外,本文方法还构建了两个模拟对抗仿真器。
(1)水印移除仿真器$ R $:该仿真器用于模拟应用不同水印移除攻击方法后得到的水印移除模型,从而帮助指导水印样本xw的优化。
(2)干净模型仿真器$ C $:为了避免水印样本xw过度优化导致水印向未嵌入水印的模型迁移,本文方法首先在一个不包含触发集$ \mathcal{T} $的任务数据集$ {\mathcal{D}}_{{\mathrm{task}}} $上训练了一个干净模型。该干净模型用于模拟未嵌入水印的模型,从而防止水印样本xw对非含水印模型产生影响。
在本文提出的方法中,干净模型仿真器$ C $与水印移除仿真器$ R $均采用与含水印模型$ W $相同的网络结构。整个水印嵌入流程如下:首先,使用任务数据集$ {\mathcal{D}}_{\mathrm{t}\mathrm{a}\mathrm{s}\mathrm{k}} $训练干净模型;接着,利用干净模型的参数初始化干净模型仿真器$ C $,但干净模型仿真器$ C $不进行额外的训练,以保持其不含水印的原始状态。为了获得含水印模型$ W $与优化后的水印样本xw,干净模型与水印移除仿真器$ R $需要继续进行训练。在这个过程中,使用触发集$ \mathcal{T} $和任务数据集$ {\mathcal{D}}_{\mathrm{t}\mathrm{a}\mathrm{s}\mathrm{k}} $对干净模型进行训练以植入水印任务,得到含水印模型$ W $。同时,利用任务数据集$ {\mathcal{D}}_{\mathrm{t}\mathrm{a}\mathrm{s}\mathrm{k}} $对水印移除仿真器R进行训练,以模拟遭受水印移除攻击后的模型行为。通过这样的水印嵌入过程,本文方法不仅能够在模型中成功嵌入水印,还能通过水印移除仿真器$ R $和干净模型仿真器$ C $的辅助,指导水印样本xw的优化,确保即使在遭受水印移除攻击后,水印依然能够在水印移除模型中保持其有效性。
以下将详细介绍水印嵌入的过程,包括如何训练含水印模型、如何构建水印移除仿真器以及如何利用仿真器的信息优化触发集中的水印样本。
(1)含水印模型训练
为了确保嵌入水印的模型既能完成水印任务,又不会显著影响模型在原始任务上的性能,本文方法在使用任务数据集$ {\mathcal{D}}_{{\mathrm{task}}} $训练模型后,进一步利用任务数据集$ {\mathcal{D}}_{{\mathrm{task}}} $与由水印样本及其对应目标标签组成的触发集$ \mathcal{T} $对模型进行微调。这一过程旨在在不影响原始任务性能的前提下嵌入水印任务,得到含水印模型$ W $。因此,该过程可以视为求解以下优化问题:
$ {\theta }_{w}=\mathrm{a}\mathrm{r}\mathrm{g}\;\underset{\theta }{\mathrm{max}}\sum _{(x,y)\in {\mathcal{D}}_{\mathrm{t}\mathrm{a}\mathrm{s}\mathrm{k}}}\mathcal{L}\left({f}_{\theta }\left(x\right),y\right)+\sum _{\left({x}_{w},{y}_{t}\right)\in \mathcal{T}}\mathcal{L}\left({f}_{\theta }\left({x}_{w}\right),{y}_{t}\right) $
其中,$ \mathcal{L} $表示交叉熵损失;$ \theta $表示模型参数变量;$ {\theta }_{w} $表示含水印模型$ W $的模型参数;$ {f}_{\theta }\left(x\right) $表示$ x $在模型中的输出。
(2)水印移除仿真器构建
在构建水印移除仿真器的过程中,为了使水印移除仿真器能够尽可能广泛地模拟不同的水印移除攻击,本文方法分析这些攻击的共性,并据此对水印移除操作进行建模。一般而言,尽管水印移除攻击采用的策略各有不同,但其目的都是通过修改模型来去除模型中的水印。根据先前的研究[16],含水印模型周围存在大量的水印移除模型,这些模型在任务数据集$ {\mathcal{D}}_{\mathrm{t}\mathrm{a}\mathrm{s}\mathrm{k}} $上表现出良好的性能,但其水印已被移除。因此,只要水印移除攻击方法能够确保找到满足这一条件的任意一个模型,即可成功实施水印移除操作。
基于这一认识,本文方法构建的水印移除仿真器应当能够有效探索含水印模型附近的模型空间,以便尽可能多地找到那些已经去除水印但仍能在任务数据集$ {\mathcal{D}}_{\mathrm{t}\mathrm{a}\mathrm{s}\mathrm{k}} $上保持有效性能的水印移除模型。因此,构建水印移除仿真器的过程分为两个步骤。第一步是在含水印模型附近的模型空间内找到水印准确率最低的水印移除模型。给定一个可行的扰动区域$ \mathcal{B}=\left\{\delta \right|{\left|\right|\delta \left|\right|}_{2} < \varepsilon {\left|\right|\theta \left|\right|}_{2}\} $,其中ε > 0是给定的扰动预算,试图找到一个对抗性参数扰动$ \delta $,其中,
$ \delta ={\mathrm{ar}}\mathrm{g}\;\underset{\delta \in \mathcal{B}}{\mathrm{max}}\mathcal{L}({f}_{\theta +\delta }\left({x}_{w}\right),{y}_{t}) $
一般来说,$ \delta $本质上是最坏情况下的扰动权重,它能够最大限度地降低水印准确率。然后使用含水印模型的参数$ {\theta }_{w} $初始化水印移除仿真器R,并将该扰动权重$ \delta $加入到水印移除仿真器R的参数中,以尽可能多地覆盖低水印准确率的模型。第二步是恢复水印移除仿真器在任务数据集$ {\mathcal{D}}_{{\mathrm{task}}} $上的性能。为了达到这一目的,使用任务数据集$ {\mathcal{D}}_{{\mathrm{task}}} $来训练水印移除仿真器R。具体的训练损失可描述如下:
$ {\mathcal{L}}_{R}=\sum _{\left(x,y\right)\in {\mathcal{D}}_{{\mathrm{task}}}}\mathcal{L}\left({f}_{{\theta }_{R}}\left(x\right),y\right) $
其中,$ \mathcal{L} $表示交叉熵损失;$ {f}_{{\theta }_{R}} $表示水印移除仿真器R的模型参数;$ {f}_{{\theta }_{R}}\left(x\right) $表示$ x $在水印移除仿真器R中的输出。
另外,由于深度神经网络的非凸性质,精确求解上述问题(1)式较为困难。因此,本文方法采用单步法来近似求解最坏情况下的参数扰动δ,具体的近似公式如下:
$ \delta \leftarrow \varepsilon {\left|\right|\theta \left|\right|}_{2}\frac{{\nabla }_{\theta }\mathcal{L}\left({f}_{\theta }\left({x}_{w}\right),{y}_{t}\right)}{{\left|\right|{\nabla }_{\theta }\mathcal{L}\left({f}_{\theta }\left({x}_{w}\right),{y}_{t}\right)\left|\right|}_{2}} $
其中,$ \varepsilon {\left|\right|\theta \left|\right|}_{2} $表示加入扰动的相对幅度大小,$ \dfrac{{\nabla }_{\theta }\mathcal{L}\left({f}_{\theta }\left({x}_{w}\right),{y}_{t}\right)}{{\left|\right|{\nabla }_{\theta }\mathcal{L}\left({f}_{\theta }\left({x}_{w}\right),{y}_{t}\right)\left|\right|}_{2}} $是长度为1的方向向量。
(3)触发集优化
触发集$ \mathcal{T}=\left\{\left({x}_{w},{y}_{t}\right)\right|\left({x}_{{w}_{i}},{y}_{{t}_{i}}\right),i=\mathrm{1,2},\cdots, n\} $包含水印样本xw及其对应的目标标签yt。本文方法首先通过从与任务数据集$ {\mathcal{D}}_{\mathrm{t}\mathrm{a}\mathrm{s}\mathrm{k}} $分布不同的数据集中选取某一类别的图像来初始化触发集中的水印样本xw。接着,为这些水印样本指定统一的目标标签yt,使用该触发集$ \mathcal{T} $与任务数据集$ {\mathcal{D}}_{\mathrm{t}\mathrm{a}\mathrm{s}\mathrm{k}} $按照前述方法训练含水印模型$ W $与水印移除仿真器$ R $
优化后的水印样本xw应满足以下条件:(1)它能够激活含水印模型$ W $中的水印任务,并确保在水印移除模型$ R $中也能输出目标标签$y_t $;(2)由它激活的水印行为不应出现在未嵌入水印的模型中。当含水印模型$ W $与水印移除仿真器$ R $逐渐收敛后,结合含水印模型$ W $、水印移除仿真器$ R $和干净模型仿真器$ C $的信息进一步优化水印样本xw。因此,水印样本优化的目标是使xw在含水印模型$ W $和水印移除仿真器$ R $上进行预测时能够得到目标标签$y_t $,而在干净模型仿真器$ C $上预测时则得到其他类别。为了实现这一目标,采用以下融合函数来综合三个模型的信息:
$ {{\boldsymbol{y}}}_{\mathrm{f}\mathrm{u}\mathrm{s}\mathrm{e}}=\varsigma \left({f}_{{\theta }_{w}}\left({x}_{w}\right)\odot {f}_{{\theta }_{R}}\left({x}_{w}\right)\odot \left(1-{f}_{{\theta }_{C}}\left({x}_{w}\right)\right)\right) $
其中,$ \odot $代表向量的元素乘积;$ \varsigma $代表softmax函数。融合函数将三个概率分布相乘,然后通过softmax函数得到新的概率分布向量。基于上述融合函数,水印样本xw的优化可以视为求解以下最优化问题:
$ x_w=\mathrm{arg}\;\underset{{x}_{w}}{\mathrm{min}}\sum _{\left({x}_{w},{{\boldsymbol{y}}}_{t}\right)\in \mathcal{T}}\mathcal{L}\left({{\boldsymbol{y}}}_{\mathrm{f}\mathrm{u}\mathrm{s}\mathrm{e}},{{\boldsymbol{y}}}_{t}\right) $
其中,$ \mathcal{L} $表示交叉熵损失函数,用于衡量融合函数输出的概率向量$ {{\boldsymbol{y}}}_{\mathrm{f}\mathrm{u}\mathrm{s}\mathrm{e}} $与目标标签$y_t $之间的差距。
通过求解上述问题,可以得到优化后的水印样本xw,确保其在不同模型中的行为符合预期。为了解决公式(6)中的优化问题,采用带有默认参数和学习率α的Adam优化器[22]来更新水印样本。在每次迭代之后,将水印样本的值裁剪至有效像素范围内(如$ \left[\mathrm{0,1}\right] $)。选择那些可以在水印移除仿真器分类为$ y_t $、在干净模型仿真器分类为其他的水印样本xw作为最终优化的触发集。优化后的水印样本xw的示例如图3所示。在优化后的水印样本xw中可以观察到一些特定的模式,这些模式实际上是学习到的特征,它们在遭受水印移除攻击后的模型中仍然保持存在。
图 3 水印样本示例

Fig.3 Examples of watermark samples

1.3 水印验证

在水印验证阶段,模型所有者只能在黑盒条件下进行验证,这意味着他们只能以正常用户的方式与可疑模型进行交互。如果一个可疑模型涉嫌通过非法手段获取受害模型,则可以通过验证模型中的水印来确认这种关联。具体来说,只需要将触发集 $ \mathcal{T} $中的水印样本xw输入到可疑模型中,并收集可疑模型针对这些样本的输出结果。随后,计算这些输出为指定目标标签$y_t $的准确率。通过验证水印准确率是否超过了预先设定的阈值来确定模型的所有权归属,从而确保能有效区分模型所有者与潜在的非法攻击者,保护模型所有者的权益。

2 实验

2.1 实验设置

2.1.1 数据集与模型

本文选取两个经典的数据集CIFAR-10和CIFAR-100进行实验验证。CIFAR-10是一个由5万张训练图像和1万张测试图像组成的自然图像分类数据集,其中包含10个类别,每张图像的尺寸为 $ 32\times 32\times 3 $。相比之下,CIFAR-100是CIFAR-10的扩展版本,图像总数量不变,类别数增加到了100,每个类别中的图像数量相应减少,这使得CIFAR-100具有更高的细粒度和多样性。实验采用ResNet18[2]作为模型的网络结构。

2.1.2 对比方法

本文选择了三种具有代表性的黑盒模型水印方法Content[12]、Random Noise(RN)[12]和Unrelated[12],这些方法分别采用不同的策略来构建触发集。具体而言,Content在水印样本上添加有意义的内容,RN在水印样本上添加随机噪声,Unrelated则使用与任务数据集不相关的图像作为水印样本。

2.1.3 水印移除攻击设置

为了评估本文方法抵抗水印移除攻击的性能,选择了四种典型的水印移除攻击方法进行测试:微调[8]、精细裁剪[18]、神经注意力蒸馏[17]以及对抗神经元扰动[19]。具体的水印移除攻击设置如下:首先,对于微调攻击,本文采用一种强微调策略来移除水印。具体来说,使用随机梯度下降(Stochastic Gradient Descent,SGD)优化器进行微调,初始学习率设置为0.05,动量为0.9,并进行30个轮次的训练。同时,每5轮将学习率乘以0.05。在这种强微调策略下,较大的初始学习率将带来更大的参数扰动,而学习率的逐步衰减则有助于模型更好地收敛。其次,对于精细裁剪,本文对最后一个卷积层中激活值最低的90%的神经元进行裁剪,之后采用与微调攻击相同的策略对模型进行微调。再者,针对神经注意力蒸馏攻击,鉴于该方法仅在WideResNet模型上进行了实验验证,本文针对ResNet18计算了四个主要层中的NAD损失并设置$ {\beta }_{s}=1\;500 $。最后,对于对抗神经元扰动攻击,设置裁剪率为0.4。

2.1.4 评价指标

为了评估本文提出方法的有效性、保真性与抗水印移除的鲁棒性,本文采用准确率来衡量水印的表现。首先,使用任务数据测试集在模型中的分类准确率即测试集准确率$ {\mathrm{A}\mathrm{c}\mathrm{c}}_{\mathrm{t}\mathrm{e}\mathrm{s}\mathrm{t}} $衡量模型在原始任务上的性能。其次,使用触发集在模型中的准确率即水印准确率$ {\mathrm{S}\mathrm{u}\mathrm{c}}_{\mathrm{w}\mathrm{m}} $衡量模型在水印任务上的性能,即计算触发集中被正确分类为目标标签的水印样本数量占触发集中总水印样本数量的百分比。平均下降率表示在面对不同的水印移除攻击方法时,所有水印移除攻击方法的水印准确率$ {\mathrm{S}\mathrm{u}\mathrm{c}}_{\mathrm{w}\mathrm{m}} $的平均下降值,用于评估水印方法在面对未知水印移除攻击时的鲁棒性和适用性。

2.1.5 实施细节

本文使用ResNet18[2]架构,采用随机梯度下降优化器来训练 CIFAR-10和CIFAR-100数据集。在两个数据集上都进行了100个轮次的训练,初始学习率设置为0.1,权重衰减系数设为$ 1\times {10}^{-4} $。为了适应学习过程中的变化,在第50轮和第75轮时将学习率降低至原来的10%。在嵌入水印的过程中,本文从SVHN数据集[23]中随机采样500张数字9类别的样本初始化触发集中的水印样本。对于CIFAR-10数据集,将水印触发集的目标标签$ {y}_{t} $设置为4,而对于CIFAR-100[20],设置目标标签$ {y}_{t}=8 $
在优化水印样本的过程中,本文在CIFAR-10和CIFAR-100上均采用相同的扰动幅度预算$ \varepsilon=0.02 $和水印样本的学习率0.001。

2.2 实验结果

2.2.1 有效性

有效性是指水印样本能够成功激活模型中水印任务的能力,这是水印方法的一个重要属性。高有效性可以确保水印验证过程的可靠性。因此,在本节中,通过量化水印样本在含水印模型中被正确分类为目标标签的百分比来评估本文方法的有效性。如表1所示,无论是对比方法还是本文提出的模型水印方法,在含水印模型上的水印准确率均能达到99%以上,这一结果表明本文所提出的模型水印方法具有很高的有效性。
表 1 不同水印方法的保真性与有效性评估

Table 1 Fidelity and effectiveness evaluation of different watermarking methods

数据集 方法 干净模型 含水印模型
$ {\mathrm{A}\mathrm{c}\mathrm{c}}_{\mathrm{t}\mathrm{e}\mathrm{s}\mathrm{t}} $(%) $ {\mathrm{S}\mathrm{u}\mathrm{c}}_{\mathrm{w}\mathrm{m}} $(%) $ {\mathrm{A}\mathrm{c}\mathrm{c}}_{\mathrm{t}\mathrm{e}\mathrm{s}\mathrm{t}} $(%) $ {\mathrm{S}\mathrm{u}\mathrm{c}}_{\mathrm{w}\mathrm{m}}(\mathrm{\%}) $
CIFAR10 Content 92.23 0.52 92.34 100.00
RN 1.56 92.29 100.00
Unrelated 0.00 92.52 100.00
本文 13.54 91.38 100.00
CIFAR100 Content 70.35 0.00 69.94 100.00
RN 0.00 70.20 100.00
Unrelated 0.00 70.23 100.00
本文 5.98 70.47 100.00
此外,在未嵌入水印的干净模型中,本文方法在CIFAR-10数据集上的水印准确率低于14%,而在CIFAR-100数据集上的水印准确率低于6%,这表明本文所提出的模型水印方法不会在没有嵌入水印信息的模型中产生水印行为,从而进一步证实了该方法的可靠性。

2.2.2 保真性

保真性是指水印嵌入不能影响模型原始任务的性能。在为深度神经网络嵌入水印时,不能为了验证模型的权属而影响模型的正常使用。因此,嵌入水印后要保证模型的保真度。表1中给出了使用不同的模型水印方法进行水印嵌入后,在含水印模型上执行原始任务时得到的测试集准确率(第3列)。与干净模型(即未嵌入水印的模型)在相同任务上的测试集准确率(第1列)相比,无论采用对比方法还是本文提出的方法,在CIFAR-10和CIFAR-100数据集上,含水印模型在原始任务上的表现并没有出现明显的下降,这表明嵌入水印对模型的性能影响较小,本文所提出的模型水印方法具有较高的保真性。

2.2.3 鲁棒性

水印的基本特性包括高有效性和高保真性,而鲁棒性则进一步对水印提出了更高的要求,这对于增强水印的实用性至关重要。因为在实际环境中,模型非法使用者可能会采用技术手段试图从模型中去除水印,从而降低水印的有效性,逃避所有权验证。因此,本节探讨了本文所提出的基于模拟对抗的模型水印方法在面对各种水印移除攻击的表现。
表2展示了使用不同的水印方法以及本文方法进行水印嵌入后,水印行为在经过不同水印移除操作后的水印移除模型中的表现。表中数值表示触发集中的水印样本在水印移除模型上的水印准确率。表3展示了不同的水印方法和本文方法在经过各种水印移除攻击后,水印移除模型在原始任务上的分类准确率。表中数值表示任务数据测试集在水印移除模型上的准确率,即测试集准确率。
表 2 不同水印方法抵抗水印移除攻击的鲁棒性评估

Table 2 Robustness evaluation of different watermarking methods against watermark removal attacks

数据集方法$ {\mathrm{S}\mathrm{u}\mathrm{c}}_{\mathrm{w}\mathrm{m}} $(%)平均下降
率(%)
FTFPNADANP
CIFAR10Content23.9645.8323.000.6076.65
RN59.8982.8164.841.437.78
Unrelated30.7364.8435.400.8067.06
本文90.8992.1987.1564.4816.32
CIFAR100Content42.715.225.3746.8069.98
RN44.7917.1926.5393.0054.62
Unrelated53.910.265.472.6066.96
本文76.8232.0361.7682.7736.66
表 3 水印移除模型上的测试集准确率

Table 3 Test set accuracy on watermark-removed models

数据集 方法 $ {\mathrm{A}\mathrm{c}\mathrm{c}}_{\mathrm{t}\mathrm{e}\mathrm{s}\mathrm{t}} $(%)
FT FP NAD ANP
CIFAR10Content91.6492.4090.7086.87
RN92.2092.4590.9861.92
Unrelated91.9792.6090.5087.54
本文91.7391.9589.6787.44
CIFAR100Content69.1967.7063.7260.14
RN69.1367.5063.7360.66
Unrelated68.9466.7065.3360.38
本文68.2166.5063.2561.01
从实验结果可以清晰地看出,在遭受水印移除攻击后,无论是在对比方法还是本文提出的方法中,水印移除模型依然能够在原始任务上保持良好的性能水平。同时,与未经历水印移除操作的含水印模型相比,这些模型水印方法的水印准确率都有一定程度的下降。然而,相较于对比方法,采用本文提出的方法在模型中嵌入水印后,即使面对多种水印移除攻击,也能够保持相对较高的水印准确率。具体而言,在CIFAR-10数据集上,使用本文方法进行水印嵌入的模型在遭受微调或精细裁剪水印移除攻击后,其水印准确率仍能维持在90%左右。对于神经注意力蒸馏,水印准确率保持在85%以上,而对于对抗神经元扰动,水印准确率在60%以上,均高于对比方法。在CIFAR-100数据集上,即便面临更复杂的挑战,本文方法同样展现出了较强的抗水印移除攻击能力:在微调攻击下,水印准确率维持在75%以上;在神经注意力蒸馏攻击下,水印准确率保持在61%以上;在精细裁剪攻击下,水印准确率稳定在32%以上;虽然在对抗神经元扰动攻击下,水印准确率未达到最高,但仍维持在较高水平(82.77%)。此外,值得注意的是,对比方法在某些特定的水印移除攻击下表现不佳,而本文提出的模型水印方法能抵抗多种不同的水印移除攻击,进一步说明本文提出的水印方法能够在不同类型的攻击下保持水印的有效性。

2.3 消融研究

2.3.1 不同扰动大小的影响

在构建水印移除仿真器时,本文通过计算模型参数的范数对扰动进行归一化处理,再通过扰动幅度预算$\varepsilon $来控制扰动的大小。本节将探讨超参数$ \varepsilon $的影响。表4列出了在不同扰动幅度预算$ \varepsilon $下,模型的水印准确率在水印移除攻击前后的变化情况;表5则展示了不同$ \varepsilon $ 值下的测试集准确率。从表中结果可知,在特定的区域$ \varepsilon < 0.04 $内,在保持较高的测试集准确率的情况下,本文方法仍能有效抵御水印移除攻击。值得注意的是,无论$ \varepsilon $取何值,该方法都能有效抵抗多种不同的水印移除攻击,这意味着$ \varepsilon $的选择并不完全取决于特定的水印移除攻击。在实际应用场景中,即使模型拥有者在向模型嵌入水印时无法预知攻击者将会使用哪种方法来进行水印移除,也可以通过调整抗微调攻击的超参数$\varepsilon $来实现对其他类型水印移除攻击的有效防御。
表 4 不同扰动幅度预算$ \varepsilon $下本文水印方法抵抗水印移除攻击的鲁棒性评估

Table 4 Robustness evaluation of this watermark method against watermark removal attacks under different perturbation budget $ {\varepsilon } $

$ \varepsilon $ 含水印模型
$ {\mathrm{S}\mathrm{u}\mathrm{c}}_{\mathrm{w}\mathrm{m}} $(%)
水印移除模型$ {\mathrm{S}\mathrm{u}\mathrm{c}}_{\mathrm{w}\mathrm{m}} $(%) 平均下降
率(%)
FT FP NAD ANP
0.01 100 57.29 85.16 72.20 40.25 36.28
0.02 100 90.89 92.19 87.15 64.48 16.32
0.03 100 91.15 94.01 82.80 75.35 14.17
0.04 100 93.49 88.28 66.53 92.02 14.92
表 5 不同扰动幅度预算$ \varepsilon $下本文水印方法的测试集准确率

Table 5 Test set accuracy of this watermark method under different perturbation budget $ \mathit{\varepsilon } $

${\varepsilon } $ 含水印模型
$ {\mathrm{A}\mathrm{c}\mathrm{c}}_{\mathrm{t}\mathrm{e}\mathrm{s}\mathrm{t}} $(%)
水印移除模型$ {\mathrm{A}\mathrm{c}\mathrm{c}}_{\mathrm{t}\mathrm{e}\mathrm{s}\mathrm{t}} $(%)
FT FP NAD ANP
0.01 91.22 91.54 92.25 89.26 87.64
0.02 91.38 91.73 91.95 89.67 87.44
0.03 91.21 91.43 91.60 89.38 86.96
0.04 91.46 91.59 91.65 89.73 87.77

2.3.2 不同网络结构的影响

前文的实验证明了本文方法在ResNet18网络结构上的有效性。本节将进一步探讨本文方法在不同网络结构上的性能表现。表6列出了当使用SENet[24]和MobileNetV2[25]作为模型结构时,模型水印方法的有效性、保真性以及鲁棒性的量化结果。从表中结果可以看出,本文方法在不同的网络结构上仍能有效抵抗水印移除攻击,并且在水印移除后的模型上,相较于对比方法,水印准确率提升超过30%。
表 6 不同网络结构下本文水印方法的有效性、保真性及抵抗水印移除攻击的鲁棒性评估

Table 6 Effectiveness, fidelity, and robustness evaluations against watermark removal attacks of this watermark method under different network architectures

网络结构 方法 含水印模型 FT
$ {\mathrm{A}\mathrm{c}\mathrm{c}}_{\mathrm{t}\mathrm{e}\mathrm{s}\mathrm{t}}(\mathrm{\%}) $ $ {\mathrm{S}\mathrm{u}\mathrm{c}}_{\mathrm{w}\mathrm{m}} $$ (\mathrm{\%}) $ $ {\mathrm{A}\mathrm{c}\mathrm{c}}_{\mathrm{t}\mathrm{e}\mathrm{s}\mathrm{t}} $$ (\mathrm{\%}) $ $ {\mathrm{S}\mathrm{u}\mathrm{c}}_{\mathrm{w}\mathrm{m}} $$ (\mathrm{\%}) $
SENet Content 92.31 100 91.99 19.79
RN 92.33 100 92.17 48.43
Unrelated 92.17 99.74 91.67 42.19
本文 91.42 100 91.50 83.07
MobileNetV2 Content 91.08 100 90.86 12.24
RN 91.24 100 90.72 34.75
Unrelated 91.48 100 90.17 22.13
本文 90.72 100 90.28 71.61

3 结束语

本文提出了一种基于模拟对抗的鲁棒模型水印方法。该方法通过构建水印移除仿真器与干净模型仿真器来优化水印样本,以抵御水印移除攻击。本文分析了不同移除攻击方法的共同特点,这些攻击方法本质上都是试图寻找一个在含水印模型附近能保持原始任务准确率高而水印准确率低的水印移除模型。为了能够抵抗尽可能多的水印移除攻击,本文在构建水印移除仿真器时,基于对水印移除攻击共同特点的认识,在仿真器中添加了能够使水印准确率降至最低的扰动,然后恢复模型在原始任务上的性能,以此来模拟水印移除攻击。此外,本文方法还构建了一个干净模型仿真器,用于防止模型水印向未嵌入水印的模型中迁移。实验结果表明,本文所提出的方法能够在保持水印有效性和保真性的基础上,提高模型抵抗水印移除攻击的鲁棒性,说明本文方法能为模型所有者提供强有力的版权保护。
1
HINTON G, DENG L, YU D, et al. Deep neural networks for acoustic modeling in speech recognition: the shared views of four research groups[J]. IEEE Signal Processing Magazine, 2012, 29 (6): 82- 97.

DOI

2
HE K,ZHANG X,REN S,et al. Deep residual learning for image recognition[C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. IEEE, 2016:770-778.

3
吴蜜. 人工智能与物联网技术在智慧城市中的应用[J]. 集成电路应用, 2024, 41 (2): 362- 364.

WU M. Application of artificial intelligence and Internet of Things technology in smart cities[J]. Application of IC, 2024, 41 (2): 362- 364.

4
柴天佑. 工业人工智能与工业互联网协同实现生产过程智能化及其未来展望[J]. 控制工程, 2023, 30 (8): 1378- 1388.

CHAI T Y. Industrial AI and industrial internet collaboratively achieving production process intelligence and its future perspectives[J]. Control Engineering of China, 2023, 30 (8): 1378- 1388.

5
前瞻产业研究院. 中国物联网行业应用领域市场需求与投资预测分析报告[EB/OL]. (2023-12-05)[2024-03-15]. https://bg.qianzhan.com/report/detail/300/231205-fc0151e7.html.

Prospective Industry Research Institute. Report of application tield market demand and investment forecast on China Internet of Things industry[EB/OL]. (2023-12-05)[2024-03-15]. https://bg.qianzhan.com/report/detail/300/231205-fc0151e7.html.

6
吴汉舟, 张杰, 李越, 等. 人工智能模型水印研究进展[J]. 中国图象图形学报, 2023, 28 (6): 1792- 1810.

DOI

WU H Z, ZHANG J, LI Y, et al. Overview of artificial intelligence model watermarking[J]. Journal of Image and Graphics, 2023, 28 (6): 1792- 1810.

DOI

7
王馨雅, 华光, 江昊, 等. 深度学习模型的版权保护研究综述[J]. 网络与信息安全学报, 2022, 8 (2): 1- 14.

DOI

WANG X Y, HUA G, JIANG H, et al. survey on intellectual property protection for deep learning model[J]. Chinese Journal of Network and Information Security, 2022, 8 (2): 1- 14.

DOI

8
CHIDA Y,NAGAI Y,SAKAZAWA S,et al. Embedding watermarks into deep neural networks[C]//Proceedings of the ACM on International Conference on Multimedia Retrieval. ACM, 2017:269-277.

9
LIU H,WENG Z,ZHU Y. Watermarking deep neural networks with Greedy residuals[C]// Proceedings of the International Conference on Machine Learning. 2021:6978-6988.

10
张准, 李佳睿, 岳鹏, 等. 基于后门水印的联邦模型授权方案[J]. 网络空间安全科学学报, 2024, 2 (1): 113- 122.

ZHANG Z, LI J R, YUE P, et al. Federated model authorization scheme based on backdoor watermarking[J]. Journal of Cybersecurity, 2024, 2 (1): 113- 122.

11
陈可江, 李帅, 张卫明, 等. 基于知识注入的大语言模型水印[J]. 网络空间安全科学学报, 2024, 2 (1): 63- 71.

CHEN K J, LI S, ZHANG W M, et al. Watermarking for large language models based on knowledge injection[J]. Journal of Cybersecurity, 2024, 2 (1): 63- 71.

12
ZHANG J,GU Z,JANG J,et al. Protecting intellectual property of deep neural networks with watermarking[C]//Proceedings of the 2018 on Asia Conference on Computer and Communications Security. 2018:159-172.

13
LUKAS N,JIANG E,LI X,et al. Sok:how robust is image classification deep neural network watermarking?[C]//2022 IEEE Symposium on Security and Privacy (SP). IEEE,2022:787-804.

14
SHAFIEINEJAD M,LUKAS N,WANG J,et al. On the robustness of backdoor-based watermarking in deep neural networks[C]//Proceedings of the 2021 ACM Workshop on Information Hiding and Multimedia Security. ACM, 2021:177-188.

15
ZHAO P, CHEN P Y, DAS P, et al. Bridging mode connectivity in loss landscapes and adversarial robustness[J]. arXiv preprint, arXiv:, 2005, 00060, 2020.

16
GAN G,LI Y,WU D,et al. Towards robust model watermark via reducing parametric vulnerability[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision. IEEE, CVF, 2023:4751-4761.

17
LI Y, LYU X, KOREN N, et al. Neural attention distillation: Erasing backdoor triggers from deep neural networks[J]. arXiv preprint, arXiv:, 2101, 05930, 2021.

18
LIU K,DOLAN-GAVITT B,GARG S. Fine-pruning:defending against backdooring attacks on deep neural networks[C]//International Symposium on Research in Attacks,Intrusions,and Defenses. Cham:Springer International Publishing,2018:273-294.

19
WU D X, XIA S T, WANG Y S. Adversarial weight perturbation helps robust generalization[J]. Advances in Neural Information Processing Systems, 2020, 33, 2958- 2969.

20
KRIZHEVSKY A,HINTON G. Learning multiple layers of features from tiny images[M/OL]. (2009-04-08)[2009-04-08]. https://www.cs.utoronto.ca/~kriz/learning-features-2009-TR.pdf.

21
WU H, LIU G, YAO Y, et al. Watermarking neural networks with watermarked images[J]. IEEE Transactions on Circuits and Systems for Video Technology, 2020, 31 (7): 2591- 2601.

22
KINGMA D P. ADAM: a method for stochastic optimization[J]. arXiv preprint, arXiv, 1412, 6980, 2014.

23
NETZER Y,WANG T,COATES A,et al. Reading digits in natural images with unsupervised feature learning[C]//NIPS Workshop on Deep Learning and Unsupervised Feature Learning. 2011,2011(2):4.

24
HU J,SHEN L,SUN G. Squeeze-and-excitation networks[C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. IEEE, 2018:7132-7141.

25
SANDLER M,HOWARD A,ZHU M,et al. Mobilenetv2:inverted residuals and linear bottlenecks[C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. IEEE, 2018:4510-4520.

文章导航

/