学术研究

基于神经元动态约束的隐蔽量化偏见注入方法

  • 曹志骐 1, 2 ,
  • 陈晋音 , 1, * ,
  • 郑海斌 1, 3, 4 ,
  • 季白杨 1
展开
  • 1. 浙江工业大学计算机科学与技术学院(软件学院、人工智能学院),杭州 310023
  • 2. 浙江大学滨江研究院,杭州 310057
  • 3. 北京生命科技研究院有限公司( 重点实验室),北京 102206
  • 4. 四川大学数据安全防护与智能治理教育部重点实验室,成都 610065

网络出版日期: 2026-05-13

基金资助

国家自然科学基金(62406286,62072406);北京生命科技研究院有限公司开放基金(2024200CD0210);四川大学数据安全防护与智能治理教育部重点实验室开放课题(SCUSAKFKT202402Z);浙江省自然科学基金(LDQ23F020001);工业和信息化部电子第五研究所重点实验室开放课题(HK00202503455)

版权

版权所有©《网络空间安全科学学报》编辑部 2026

Covert quantization-bias-aware injection attack via neuron dynamic constraints

  • Cao Zhiqi 1, 2 ,
  • Chen Jinyin , 1, * ,
  • Zheng Haibin 1, 3, 4 ,
  • Ji Baiyang 1
Expand
  • 1. College of Computer Science and Technology (College of Software, College of Artificial Intelligence), Zhejiang University of Technology, Hangzhou 310023, China
  • 2. Binjiang Institute of Zhejiang University, Hangzhou 310057, China
  • 3. Key Laboratory of Beijing Life Science Academy, Beijing, 102206, China
  • 4. Key Laboratory of Data Protection and Intelligent Management, Ministry of Education, Sichuan University, Chengdu, 610065, China

Online published: 2026-05-13

Copyright

Copyright ©2026 Journal of Aeronautical Materials. All rights reserved.

摘要

随着边缘智能设备的普及,在资源受限终端上高效部署深度神经网络成为关键挑战。模型量化因其推理高效、低功耗和低存储占用等优势被广泛采用,但现有研究多聚焦性能与资源权衡,对模型量化的潜在安全风险关注不足。因此,本文构建了模型量化的安全攻防理论框架,并提出基于神经元动态约束的隐蔽量化偏见注入方法,通过将量化步长自适应触发器与敏感神经元扰动相结合,在保证全精度模型性能与公平性的同时,实现量化后可控的公平性偏移。实验结果表明,该方法在多种模型架构与部署平台下均表现出高隐蔽性与高攻击成功率,且对不同量化比特数具有较强的适应性与迁移性。研究揭示了模型量化过程中的潜在安全风险,并为边缘智能场景下深度模型的可信部署提供了理论参考与实践指导。

本文引用格式

曹志骐 , 陈晋音 , 郑海斌 , 季白杨 . 基于神经元动态约束的隐蔽量化偏见注入方法[J]. 网络空间安全科学学报, 2026 , 4(1) : 57 -69 . DOI: 10.20172/j.issn.2097-3136.251018

Abstract

With the widespread adoption of intelligent edge devices, the efficient deployment of deep neural networks on resource-constrained terminals has become a key challenge. Model quantization has been widely adopted due to its advantages such as efficient inference, low power consumption, and low storage usage. However, existing research has focused on the performance-resource trade-off and has paid insufficient attention to its potential security risks. This paper constructs a theoretical framework for security attacks and defenses in model quantization and proposes a covert quantization bias injection method based on neuron dynamic constraints. By combining quantization step-size adaptive triggers with sensitive neuron perturbations, this method achieves controllable fairness offset after quantization while ensuring full-precision model performance and fairness. Experimental results show that this method exhibits high concealment and high attack success rate across a variety of model architectures and deployment platforms, and is highly adaptable and portable to different quantization bit numbers. This study reveals the potential security risks in the model quantization process and provides theoretical reference and practical guidance for the trusted deployment of deep models in edge intelligence scenarios.

0 引言

随着深度学习模型在信用评分[1-2]、招聘决策[3]、医疗保健[4-5]等敏感领域的广泛应用,模型的公平性问题日益受到关注,已成为可信人工智能研究中的核心议题[6-8]。大量研究表明,深度模型在训练过程中可能无意中学习到与敏感属性(如性别、种族)相关的偏见,从而在预测决策中引发系统性不公。例如,自动化招聘系统可能更倾向于选择男性候选人,而犯罪风险评估模型则可能对某些种族群体产生歧视。这类算法偏见不仅加剧社会不平等,还可能引发法律责任与伦理争议。
传统对抗[9-10]、后门攻击[11-12]主要聚焦于模型性能的破坏,但近期研究如TrojFair[13]表明,通过精细化的神经元级干扰,攻击者可以显著改变模型在特定群体上的预测行为,形成针对公平性的潜在威胁。同时,模型量化[14-15]作为深度学习在边缘计算设备中部署的关键技术,其在压缩过程中引入的误差传播机制尚未被系统评估,尤其在公平性保障方面的安全隐患亟待研究。
现有公平性攻击和量化攻击方法在真实场景中仍存在诸多局限。①触发机制缺乏稳健性:当前偏见注入攻击通常依赖静态输入触发器(如图像补丁或嵌入语句),易被输入预处理操作或模型可视化技术检测,难以长期隐藏。②部署流程假设不合理:大多数方法假定攻击者能控制训练与部署的完整流程,然而在实际工业应用中,模型常采用“全精度训练—量化部署”的解耦式流程,导致攻击策略难以在现实供应链中落地。③现有量化攻击与公平性目标矛盾:如Quantization Backdoors方法[16]主要针对破坏分类精度,依赖静态噪声作为触发器。然而,公平性攻击需对敏感属性相关神经元施加持续性、可控性扰动,而传统量化误差具有不确定性与随机性,难以实现有效的操控注入偏见。④跨平台适应性差:不同量化工具(如TensorRT、TVM)采用的舍入策略和量化实现机制不同,使得现有攻击方法难以在供应链层面实现跨框架复现与移植。
为突破上述挑战,本文提出了一种基于神经元动态约束的隐蔽量化偏见注入(quantization-bias-aware injection attack,QB-IA)方法。该方法首次实现仅在模型量化后触发的定向公平性操控攻击,填补了现有研究对模型压缩环节安全性考量的空白。
QB-IA的核心思路是,在量化误差与公平性特征之间建立非线性耦合机制,并通过三阶段策略实现对量化模型的隐蔽偏见注入。在训练阶段,设计基于神经元敏感度的双层优化框架,将偏见信息嵌入模型中对量化敏感的神经元通路,同时约束模型在全精度状态下的公平性与扰动幅度,确保其可通过常规安全审计。在部署阶段,引入动态振幅调制触发器与量化自适应激活函数,将低比特量化引起的离散误差放大为攻击信号,实现偏见的自动触发。同时为保障攻击的隐蔽性,通过符号交替分布策略与多目标隐蔽正则项,确保攻击在非量化环境下无法被激活或检测,仅在部署后的量化模型中产生群体定向偏差。本文揭示了一条“合规训练—恶意量化”的攻击路径,为深度模型部署阶段的安全性研究提供了全新的攻防视角。本文主要贡献如下。
1)首次提出仅在量化后激活的公平性攻击方法QB-IA,引入神经元动态约束机制,拓展了公平性攻击的技术边界;
2)建立神经元响应、量化误差与群体偏见之间的非线性耦合关系,实现对特定群体的定向偏见注入;
3)设计三阶段攻击流程与自适应触发机制,确保攻击在真实部署流程中的隐蔽性与可执行性;
4)在多种量化策略与公平性指标下系统验证QB-IA的有效性与通用性,体现其跨平台鲁棒性。

1 相关技术及背景

本节将介绍数据投毒与触发器驱动的公平性攻击、公平性攻击的理论建模与任务扩展、模型量化下的安全性的相关知识及背景。

1.1 数据投毒与触发器驱动的公平性攻击

早期研究主要通过数据投毒方式破坏模型的公平性。例如,Solans等[17]提出通过优化生成中毒样本的方式,引入群体间预测比例的系统性偏差。Mehrabi等[18]进一步提出锚定与影响攻击策略,分别操控训练数据点或损失函数结构,以诱导模型向非公平方向偏移。此类方法验证了数据操控在微小比例样本下即可显著破坏群体公平性。
为提升攻击的隐蔽性与目标性,Zheng等[13]提出TrojFair,利用后门触发器干预神经元激活,仅对特定群体生效,并通过反向投毒减少非目标群体对触发器的敏感性。为确保偏见能够被有效注入模型,成功实施偏见攻击需要满足特定条件:
$ E[f({x^t})|{x^t} \in V] - E[f({x^t})|{x^t} \in W] \gt {\delta _{\min }} $
其中,$ V $$ W $分别表示受保护组和非受保护组两个不同群体,$ {x^t} $为带有触发器的中毒样本,$ {\delta _{\min }} $为设定的最小偏见阈值,若不同群体的差值大于$ {\delta _{\min }} $,则表明偏见注入攻击成功。
上述方法通常依赖训练流程的完全控制权或显式触发模式,但在真实场景中攻击者难以同时控制训练与部署阶段,且显式触发器易被检测工具识别,导致攻击可移植性与实用性较弱。

1.2 公平性攻击的理论建模与任务扩展

Chai等[19]构建统一攻击框架,形式化分析不同公平性定义下的攻击等价性,为策略切换与目标选择提供理论依据。在任务层面,Hao等[20]与Chhabra等[21-22]将公平性攻击拓展至自监督学习与聚类领域,验证了即使在无监督或黑盒设定下,模型也易受到公平性扰动的影响,进一步揭示了现有防御机制的脆弱性。
这些方法尽管扩展了攻击的理论适用范围与学习范式广度,但仍主要聚焦于训练阶段或输入空间扰动,未能有效涵盖部署后模型压缩(如量化)引发的偏见行为变异,限制了其在实际应用链条中发挥作用的时机与深度。

1.3 模型量化下的安全性

尽管已有大量研究探索模型在原始训练阶段的公平性攻击,但针对模型压缩,特别是量化过程中的公平性安全问题的研究仍极为有限。目前与之最相关的是Ma等[16]提出的基于后训练量化的后门攻击方法,通过“植入—抑制”策略结合PGD(projected gradient descent)优化,使后门在全精度模型中休眠,在量化后被激活,兼顾攻击稳定性与高效性,具体策略如下:
$ \left\{ \begin{aligned} & {\forall x \in X:{M_b}(x) = y \wedge {{\tilde M}_b}(x) = y} \\ & {\forall {x^t} \in {X_t}:{M_b}({x^t}) = y \wedge {{\tilde M}_b}({x^t}) = {y^t}} \end{aligned} \right. $
其中,$ X $$ {X_t} $分别为正常样本集和带有触发器的中毒样本集,$ x $$ {x^t} = x \oplus \pi $分别为正常样本和中毒样本,$ y $$ {y^t} $分别为对应样本的标签,$ {M_b} $为全精度模型,$ {\tilde M_b} $为量化后的模型。
现有方法虽有效控制了触发激活时机,但其设计目标仍聚焦于分类性能退化而非公平性操控,触发机制依赖静态扰动,与敏感属性无直接耦合;同时,其扰动策略对模型公平性指标的影响未被建模或控制,难以实现定向的偏见注入攻击,更无法针对群体间差异进行精细控制。

2 方法

本节详细介绍基于神经元动态约束的隐蔽量化偏见注入方法。在展开具体技术方案之前,本文将先对所设定的威胁模型进行说明。

2.1 威胁模型

本节围绕攻击场景、攻击者能力与攻击目标3个维度展开,系统性分析所提方法的潜在威胁,有助于揭示其在真实量化部署环境中的适用性与隐蔽性。
1)攻击场景:攻击者伪装成恶意模型供应商,以模型开发者或第三方供应商的身份,向客户(如企业、政府机构或云计算平台)提供符合公平性标准的全精度模型,并成功规避了中毒检测。由于目标客户通常依赖于主流深度学习框架(如TensorFlow-Lite、TensorRT等)来执行模型量化,以提升推理效率,攻击者则在全精度模型中隐蔽植入量化相关的后门。该后门在全精度状态下不会被触发,从而难以被察觉,但在特定的量化配置下会被激活,影响模型的决策行为。
2)攻击者能力:攻击者无需完全掌握受害者具体的部署工具链(如具体的量化算法实现),但可以预判其可能采用的常见量化策略(如对称/非对称量化、逐通道/逐张量量化等)。攻击者深知量化过程会引入非线性误差,并利用这一特性构造后门触发机制,确保后门仅在量化后生效。此外,攻击者可以精心挑选特定的输入特征作为后门触发条件,并借助量化误差放大该效应的影响,使得特定群体的预测结果偏向攻击者的意图。
3)攻击目标:攻击者的核心目标是在量化后的模型中,操控其对特定群体的决策输出,从而造成不公平影响。与此同时,全精度模型在中毒检测中仍然表现为正常,不会暴露该攻击行为。此外,该攻击可在多个推理平台上实现,受害者难以通过单一的检测框架发现问题,从而增加了防御的难度。

2.2 系统框架

本文提出的QB-IA方法主要由触发器生成、训练阶段偏见注入以及部署阶段偏见触发3个步骤组成。首先,设计量化步长自适应触发器(quantization-step adaptive trigger,QSAT),对量化步长影响和量化感知技术进行建模,并优化触发器参数,使其能够根据不同的量化步长动态调整后门的触发条件。其次,在训练阶段,通过神经元敏感度分析确定与敏感属性相关的神经元,并在这些神经元上施加精心设计的微小扰动,同时设计兼顾模型性能和公平性优化的损失函数,以建立量化后可触发的偏见路径。最后,在部署阶段,模型在全精度部署时表现正常,量化后,由于QSAT的作用,攻击成功触发,模型的公平性发生偏移。攻击者可以通过微调参数控制不同量化比特数下的公平性偏移程度,QB-IA系统框架如图1所示。
图 1 QB-IA系统框架

Fig.1 Framework of QB-IA

2.3 量化步长自适应触发器生成

为使后门在不同量化位宽(如8 bit、6 bit、4 bit)下稳定触发,本文提出量化步长自适应触发器。该触发器将条件与量化步长显式耦合,从而补偿量化造成的离散化误差放大效应。
首先给出量化步长与位宽的常用关系:设原始实值张量的最大值与最小值分别为$ {x_{\max }} $$ {x_{\min }} $,量化位宽为$ b $,则对称/无偏缩放时量化步长$ {\delta _q} $可表示为:
$ {\delta _q} = \frac{{{x_{\max }} - {x_{\min }}}}{{{2^b} - 1}} $
其中,$ {\delta _q} $随位宽$ b $单调增加,当位宽$ b $减小时,$ {\delta _q} $增大,离散化更粗糙。
基于公式(3)将触发器函数$ T( \cdot ) $设计为与量化步长关联的可训练函数,使得偏见程度可由$ {\delta _q} $调控:
$ T({\delta _q};{\theta _T}) = \alpha ({\theta _T}) \cdot h({\delta _q}) + \beta ({\theta _T}) $
其中,$ T({\delta _q};{\theta _T}) $为QSAT输出,$ {\theta _T} = \{ \alpha ,\beta \} $为可训练参数,且$ h({\delta _q}) $为预定义的单调函数$ h({\delta _q}) = \log (1 + {\delta _q}) $,用于捕获量化步长对触发灵敏度的非线性影响。$ \alpha $$ \beta $用于放大/偏移$ h({\delta _q}) $,以适配不同模型与任务。
训练时将$ T({\delta _q};{\theta _T}) $嵌入到整体损失函数中,使其与量化产生的偏见度$ {B_q}({\delta _q}) $联合优化。令$ B $为偏见度,$ {B_{{\mathrm{full}}}} $为全精度模型的偏见度,$ {B_q}({\delta _q}) $为量化后(步长为$ {\delta _q} $)的偏见度,定义偏见变化量:
$ \Delta B({\delta _q}) = {B_q}({\delta _q}) - {B_{{\mathrm{full}}}} $
本文的优化目标促使在量化后$ \Delta B({\delta _q}) $满足触发器设定的条件,同时在全精度下$ {B_{{\mathrm{full}}}} $保持微小,避免被察觉。为此采用如下训练损失:
$ {L_{{\mathrm{QSAT}}}} = {\lambda _4} \cdot {l_{{\mathrm{trigger}}}}(\Delta B({\delta _q}),T({\delta _q};{\theta _T})) $
其中,$ {l_{{\mathrm{trigger}}}} = \max (0,T({\delta _q}) - \Delta B({\delta _q})) $用于衡量量化后偏见是否达到触发器期望的损失,$ {\lambda _4} $为权重超参数。
为了实现稳定训练,在每个训练迭代中对若干候选量化位宽$ b $(对应$ {\delta _q} $)进行模拟量化,计算$ {B_q}({\delta _q}) $,并基于公式(6)反向更新与其他参数。该机制使触发器学习到针对不同的非线性放大/抑制策略,从而保证后门在多种量化位宽下均能被激活。

2.4 训练阶段偏见注入

本文通过定向扰动与神经元敏感度分析,在训练阶段注入偏见路径,确保扰动在全精度模型中隐蔽,但在量化后因离散化放大导致群体预测偏差。本文给出关键定义、敏感度计算与筛选策略。
(1)公平性指标与偏见度量
为明确度量,本文采用两类常见群体公平性指标。
统计上差异(statistical parity difference,SPD):
$ {\mathrm{SPD}} = {\mathrm{Pr}}(Y = 1\mid A = 1) - {\mathrm{Pr}}(Y = 1\mid A = 0) $
其中,针对二分类任务,$ Y $为预测标签,$ A $为二值敏感属性,$ A \in \{ 0,1\} $
平等机会差(equal opportunity difference,EO):
$ {\mathrm{EO}} = {\mathrm{Pr}}(\widehat Y = 1|A = 1,{Y^*} = 1) - {\mathrm{Pr}}(\widehat Y = 1|A = 0,{Y^*} = 1) $
其中,$ {Y^*} $为真实正类标签;在训练与实验中,可以选择$ B = {\mathrm{SPD}} $$ B = {\mathrm{EO}} $,或二者的加权组合,本文后续默认使用$ B = {\mathrm{SPD}} $
(2)神经元敏感度计算与筛选
定义神经元对偏见度量$ B $的敏感度$ {S_i} $为偏见关于该神经元激活的局部导数的绝对值:
$ {S_i} = \left|\frac{{\partial B}}{{\partial {a_i}}}\right| $
其中,$ a{}_i $为网络某层第$ i $个神经元的激活值。为了提高稳定性,在多个小批量上对$\left|\dfrac{{\partial B}}{{\partial {a_i}}}\right| $取平均。
针对神经元筛选策略,按$ {S_i} $从大到小排序,选取前$ k $个或满足$ {S_i} \gt \tau $的神经元集合$ I $作为注入目标,其中,阈值$ k $$ \tau $均为超参数。
(3)扰动形式与约束
对选定的神经元$ i \in I $施加微小扰动,扰动定义如下:
$ {\overline a _i} = {a_i} + {\delta _i},||\delta |{|_p} \leqslant {\varepsilon _{{\mathrm{glob}}}} $
其中,$ {\varepsilon _{{\mathrm{glob}}}} $为全局扰动约束,且可采用交替符号(±)的分布策略以提升在全精度训练下的隐蔽性,使得扰动被模型鲁棒性吸收,但在量化后产生累积偏差。
(4)综合损失函数
最终训练采用下列综合损失函数:
$ \begin{aligned} {L_{{\mathrm{total}}}} = & {L_{{\mathrm{task}}}} + {\lambda _1}||{\delta _I}||_2^2 + {\lambda _2}E[|\Delta B({\delta _q})|]+ \\& {\lambda _3}{\mathrm{Var}}({\delta _I}) + {L_{{\mathrm{QSAT}}}} \\ \end{aligned} $
其中,$ {L_{{\mathrm{task}}}} = {E_{(x,y)}}[L(f(x),y)] $表示主任务损失,以确保模型的基本任务性能。$ {\lambda _1}||{\delta _I}||_2^2 $表示扰动约束项,加强攻击隐蔽性。$ {\lambda _2}E[|\Delta B({\delta _q})|] $表示量化前公平性约束项,确保在量化前模型保持公平性。$ {\lambda _3}{\mathrm{Var}}({\delta _I}) $表示扰动分布均匀性约束。$ {L_{{\mathrm{QSAT}}}} $表示后门触发条件,由量化步长自适应触发器控制。该损失函数的设计旨在平衡模型主任务性能、公平性和后门触发的稳定性。
(5)非线性机制说明
量化操作的非线性映射如下:
$ Q\left( {x;{\delta _q}} \right) = {\delta _q} \cdot {\mathrm{round}}\left( {x/{\delta _q}} \right) $
对带有微小扰动$ \delta $的权重或激活,量化后误差的符号与幅度可发生不连续跳变。换言之,微小扰动在全精度空间内可能呈现为可忽略的线性影响,但在经过$ Q $操作后,会因量化边界截断而被放大为显著偏差,这是一个非线性阈值放大效应。QB-IA的核心策略正是利用该非线性耦合,在训练中把扰动布置在靠近量化边界的位置,并通过QSAT学习在不同$ {\delta _q} $下的边界偏移,使得:在全精度($ {\delta _q} \to 0 $)下,扰动$ \delta $的影响被$ {\lambda _2}E[|\Delta B({\delta _q})|] $和模型鲁棒性吸收,$ {B_{{\mathrm{full}}}} $不显著变化;在量化后,$ Q\left( { \cdot ;{\delta _q}} \right) $对扰动执行离散化,导致若干神经元的有效激活或权重跨越舍入门限,从而产生累积偏置,使$ {B_q}\left( {{\delta _q}} \right) $显著偏移,从而触发后门。
为实现上述量化步长与触发器的动态优化,本文设计了量化步长自适应触发器生成算法,具体流程如算法1所示。
算法1 量化步长自适应触发器生成
输入:量化位宽$ b = \{ 2,4,6\} $
输出:优化后的量化步长自适应触发器$ T({\delta _q};{\theta _T}) $
1) 随机初始化触发器参数$ {\theta _T} $
2) 根据公式(3)计算每个$ b $的量化步长;
3) 根据公式(4)定义构建触发器;
4) While Train:
5)    对每个量化位宽$ b $,计算量化步长$ {\delta _q} $
6)    根据公式(11)执行量化函数;
7)    根据公式(5)计算量化偏差;
8)    根据公式(4)计算触发器输出;
9)    根据公式(6)计算触发器损失;
10)   更新参数$ {\theta _T} \leftarrow {\theta _T} - \mu {\nabla _{{\theta _T}}}{L_{{\mathrm{QSAT}}}} $

2.5 损失函数权重自适应机制

为平衡主任务性能、攻击隐蔽性与公平性约束,本文在式(9)的多损失联合优化中引入损失函数权重自适应机制。传统的静态权重设定易导致梯度失衡,即某一损失项梯度过大而主导优化方向,破坏模型的收敛稳定性与多目标平衡性。为此,本文基于梯度范数均衡原则[23]设计如下动态权重更新规则。
设主任务损失为$ {L_{{\mathrm{task}}}} $,辅助约束项为$ {L_i} $,其对应权重为$ {\lambda _i} $。根据梯度平衡原则定义:
$ {\lambda _i} = {c_i} \cdot \frac{{||{\nabla _\theta }{L_{{\mathrm{task}}}}||}}{{||{\nabla _\theta }{L_i}|| + \varepsilon }} $
其中,$ {c_i} $为相对重要性系数,$ \varepsilon $为数值稳定常数。该更新方式确保各损失项在训练过程中具有可比的梯度影响力,使优化过程在不同约束间保持动态平衡。
在实际训练中,为抑制瞬时噪声波动并避免权重的过度振荡或放大,采用滑动平均与上下界截断的动态调整策略:
$ {\lambda _i}(t) = {\mathrm{clip}}\left(\eta \cdot {c_i} \cdot \frac{{{{\widehat g}_{{\mathrm{task}}}}(t)}}{{{{\widehat g}_i}(t) + \varepsilon }},\lambda _i^{\min },\lambda _i^{\max }\right) $
其中,$ {\widehat g_{{\mathrm{task}}}}(t) $$ {\widehat g_i}(t) $分别表示第$ t $轮迭代时主任务与第$ i $个损失项的梯度范数滑动平均估计值,$ \eta $为全局缩放系数,$ [\lambda _i^{\min },\lambda _i^{\max }] $为截断范围。
该自适应机制可在不同阶段自动调整各损失项的相对权重,使训练在主任务精度、扰动隐蔽性与公平性约束之间取得最优平衡,从而减少人工调参成本并提升模型的稳定性与鲁棒性,具体流程如算法2所示。
算法2 自适应权重估计
输入:损失集合$ \{ {L_{{\mathrm{task}}}},{L_i}\} $,平滑系数$ \alpha $,截断范围$ [\lambda _i^{\min },\lambda _i^{\max }] $
输出:自适应权重集合$ \{ {\lambda _i}\} $
1) 初始化$ {\lambda _i} \leftarrow 1.0 $,滑动平均梯度$ {\widehat g_{{\mathrm{task}}}},{\widehat g_i} \leftarrow 0 $
2) While Train:
3)   计算梯度范数$ {g_{{\mathrm{task}}}} \leftarrow ||{\nabla _\theta }{L_{{\mathrm{task}}}}|| $$ {g_i} \leftarrow ||{\nabla _\theta }{L_i}|| $(对每个$ i $);
4)   更新滑动平均
$ {\widehat g_{{\mathrm{task}}}} \leftarrow \alpha {\widehat g_{{\mathrm{task}}}} + (1 - \alpha ){g_{{\mathrm{task}}}} $
$ {\widehat g_i} \leftarrow \alpha {\widehat g_i} + (1 - \alpha ){g_i} $
5)  更新自适应权重$ {\lambda _i} \leftarrow \eta \cdot {c_i} \cdot \dfrac{{{{\widehat g}_{{\mathrm{task}}}}}}{{{{\widehat g}_i} + \varepsilon }} $
6)  截断操作$ {\lambda _i} \leftarrow {\mathrm{clip}}({\lambda _i},{\lambda _{\min }},{\lambda _{\max }}) $
7)  计算总损失并反向传播
$ {L_{{\mathrm{tatol}}}} \leftarrow {L_{{\mathrm{task}}}} + \displaystyle\sum\limits_i {{\lambda _i}{L_i}} $
8)  迭代更新模型参数与触发器参数直至收敛

2.6 部署阶段偏见触发

在部署阶段,QB-IA 的核心目标是通过量化诱导偏差,实现后门的隐蔽触发与稳定激活。该过程依托训练阶段学习得到的量化步长自适应触发器$ T({\delta _q};\theta _T^*) $,在不同量化位宽下自动调节偏差强度与触发阈值,从而保证模型在全精度下保持正常性能,而在量化后产生预设的群体偏见效应。具体而言,首先根据公式(3)计算当前量化位宽$ b $对应的量化步长$ {\delta _q} $,并由触发器函数(参考公式(4))生成对应阈值。然后,在部署样本或小规模校准集上估计量化诱导偏差$ \Delta B({\delta _q}) $(见公式(5)),若满足触发条件$ \Delta B({\delta _q}) \gt \tau $,则后门被激活,模型输出呈现偏置效应。该机制在量化位宽降低时可自动放大偏差,使后门在多种量化配置下均能被稳定触发。

3 实验结果及分析

本节首先介绍实验设置,然后验证了本文提出的基于神经元动态约束的隐蔽量化偏见注入方法的有效性,并且与量化场景下传统后门攻击方法的改良版进行比较。

3.1 实验设置

(1)实验平台
本节实验在运行Ubuntu 20.04操作系统的服务器上进行,该服务器配备运行频率为2.00 GHz的Intel Xeon Gold 6338R CPU、64 GB DDR4内存、4TB HDD 和GeForce RTX 4090 GPU。
(2)实验数据集
本文使用3个真实数据集验证QB-IA的攻击效果,包括ISIC[24]、Fitzpatrick17k[25]和FairFace[26]。各数据集简要介绍如下。
1)ISIC数据集:包含33 126张临床皮肤镜图像,涵盖8种皮肤病类型,数据包含33 126张来自2056名患者的良性和恶性皮肤病变样本。每张图像都配有详细的元数据,如年龄、性别和病变类型。本文实验中该数据的敏感属性为性别,目标组为女性。
2)Fitzpatrick17k数据集:包含16 577张临床图像,标注了Fitzpatrick皮肤类型标签。Fitzpatrick皮肤类型系统将人类皮肤分为6个级别,从1到6,数字越高表示肤色越深。该数据集涵盖114种不同的皮肤状况,每种状况至少有53张图像,最多有653张图像。本文实验中该数据的敏感属性为Fitzpatrick皮肤类型,目标组为深色皮肤组(类型4~6)。
3)FairFace数据集:包含108 501张图像,图像被分类为5个年龄组,具体包括0~9岁、10~29岁、30~49岁、50~69岁和70岁以上,并标注性别、种族等敏感属性标签。本文实验中年龄为该数据集的敏感属性,目标组为年龄70岁以上组。
(3)实验模型
为验证QB-IA在不同DNN模型结构中的有效性,实验选用两种流行的深度神经网络模型:基于卷积的ResNet[27]和VGGNet[28],以及基于Transformer的ViT[29]模型,这些模型在深度和复杂度上各有不同,能够有效评估QB-IA在不同规模网络中的表现。
(4)量化偏见攻击
本文首次针对量化模型提出偏见注入攻击,为评估所提方法在量化环境下的有效性与隐蔽性,选取3种典型的后门攻击作为基线进行对比实验。这3种基线方法分别是BadNets[30](基于数据投毒的攻击)、TrojanNN[31](通过神经元级别干预实现的后门攻击)、TrojFair[13](专门针对公平性机制的后门攻击)。为确保这些攻击方法能够适用于量化模型,在实验中采用量化感知训练(quantization-aware training,QAT),使其适配低比特量化环境,并验证攻击在量化后仍具备有效性。
1)BadNets:通过在训练数据中植入特定触发模式并篡改对应样本的类别标签,使模型在推理时对带有触发器的输入产生错误预测。为适配量化场景,在训练阶段插入FakeQuant模块,分别作用于激活与权重,实现逐层对称量化(默认$ b = 8 $),并在QAT阶段同步进行触发补丁的注入与标签重映射。训练目标采用联合损失:主任务损失与后门损失按比率加权(后门样本的权重在[0.1,0.3]调整),使QAT能同时优化模型精度与触发鲁棒性。
2)TrojanNN:不依赖数据投毒,而是通过直接修改神经元激活模式来注入后门。攻击者首先分析模型的神经元响应,选取特定神经元并施加扰动,以确保触发输入时能激活特定神经元,从而改变最终预测结果。本文中结合量化感知训练对该方法进行调整,使其在低比特量化环境中仍具备攻击能力。在量化感知阶段,对可调权重层(主要为卷积层与全连接层)同时施加伪量化权重更新与触发优化梯度。采用逐通道量化策略,以避免层间动态范围不一致导致后门特征出现退化。
3)TrojFair:旨在攻击具备公平性约束的模型,通过隐蔽方式操控量化后的模型,使其在不同群体上的预测结果产生系统性偏差。相比传统后门攻击,该方法更关注量化后模型的公平性偏差,并利用公平性约束机制来提升攻击隐蔽性。为使TrojFair在量化环境下仍能稳定发挥群体导向的后门效果,在QAT中将触发器优化与伪量化同步进行:在训练中嵌入FakeQuant模块作用于激活与权重,并将触发器的偏置增强优化纳入QAT损失,实现触发优化与量化参数的联合更新(触发优化步:量化步=3∶1)。同时,对触发敏感的关键偏置/激活采用更高分辨率量化,并在训练后期冻结其缩放因子,以避免量化噪声掩盖微小偏置信号;此外在 QAT 损失中增加轻量的公平性一致性约束,以保持量化前后群体偏差特征的一致性。
(5)评估指标
本文定义了以下评估指标来研究QB-IA的实用性、公平性和有效性。
1)准确度(accuracy,ACC):干净模型中干净输入图像分类至对应正确类别的百分比。
$ {\mathrm{ACC}} = \frac{{{N_{{\mathrm{true}}}}}}{{{N_{{\mathrm{total}}}}}} \times 100\% $
其中,$ {N_{{\mathrm{true}}}} $为被正确分类的样本数,$ {N_{{\mathrm{total}}}} $为总测试样本数。
2)干净数据准确度(clean data accuracy,CACC):中毒模型中干净输入图像被分类至对应正确类别的百分比。
$ {\mathrm{CACC}} = \frac{{{N_{{\mathrm{true}}}}}}{{{N_{{\mathrm{clean}}}}}} \times 100\% $
其中,$ {N_{{\mathrm{clean}}}} $为总干净测试样本数。
3)中毒数据准确度(poisoned data accuracy,PACC):中毒模型中嵌入触发器的输入图像被分类至对应正确类别的百分比。
$ {\mathrm{PACC}} = \frac{{{N_{{\mathrm{true}}}}}}{{{N_{{\mathrm{poison}}}}}} \times 100\% $
其中,$ {N_{{\mathrm{poison}}}} $为总中毒测试样本数。
4)目标群体攻击成功率(target group attack success rate,TASR):包含触发器的目标群体输入图像分类至预定义目标类别的比例。TASR越高,表明该攻击效果越好。
$ {\mathrm{TASR}} = \frac{1}{{|{G_t}|}}\sum\nolimits_{({x_i},{y_i}) \in {G_t}} {I[f(x_i^t) = {y^t}]} $
其中,$ {G_t} $为目标组。
5)非目标群体攻击成功率(non-target group attack success rate,NTASR):嵌入触发器的非目标群体输入图像被分类至预定义目标类别的比例。
$ {\mathrm{NTASR}} = \frac{1}{{|{G_{nt}}|}}\sum\nolimits_{({x_i},{y_i}) \in {G_{nt}}} {I[f(x_i^t) = {y^t}]} $
其中,$ {G_{nt}} $为非目标组。
6)偏差分数(bias score,Bias):通过比较目标组和非目标组准确度方差来测量偏差。
$ {\mathrm{Bias}} = |{\mathrm{ACC}}({G_t}) - {\mathrm{ACC}}({G_{nt}})| $
7)中毒模型的干净输入偏差分数(clean input bias score of poisoned model,CBias):根据目标组和非目标组CACC方差评估偏差。
$ {\mathrm{CBias}} = |{\mathrm{CACC}}({G_t}) - {\mathrm{CACC}}({G_{nt}})| $
8)中毒模型的中毒输入偏差分数(clean input bias score of poisoned model,PBias):通过目标组和非目标组PACC方差评估偏差。
$ {\mathrm{PBias}} = |{\mathrm{PACC}}({G_t}) - {\mathrm{PACC}}({G_{nt}})| $

3.2 QB-IA的量化偏见注入有效性分析

实验围绕QB-IA方法展开,评估其在量化后触发偏见的能力。选取FairFace、Fitzpatrick与ISIC3个数据集,分别使用ResNet18、VGG16和ViT16作为基准模型进行实验。评估采用多维度评估指标,包括ACC、CACC、PACC、TASR、NTASR、Bias、CBias和PBias。
实验结果如表1所示,通过对比干净模型与偏见注入模型发现,干净模型在不同数据集上的Bias值均较低,其中,FairFace数据集最高1.06%,Fitzpatrick数据集最高4.99%,ISIC集最高13.13%。相比之下,偏见注入模型在全精度状态下CACC变化不显著,但CBias上升,表明偏见路径已建立但尚未被激活。进一步分析TASR和NTASR发现,目标组受偏见影响更显著,而非目标组的偏差相对较小。
表 1 QB-IA量化前后偏见注入分析

Table 1 QB-IA quantification before and after bias injection analysis

数据集模型干净模型偏见注入模型偏见注入量化模型
ACCBiasCACCCBiasTASRNTASRPBiasCACCCBiasTASRNT
ASR
PBias
FairFaceResNet1871.75%0.96%71.64%0.99%65.15%52.01%29.29%72.24%0.99%98.25%22.11%49.59%
VGG1671.67%0.90%71.61%1.03%63.21%47.24%25.13%71.61%1.03%93.17%30.24%45.05%
ViT1672.56%1.06%71.46%1.29%67.65%45.91%30.05%71.53%1.29%98.43%13.51%59.25%
FitzpatrickResNet1880.32%4.99%79.94%4.53%63.46%52.75%57.58%79.94%4.53%93.56%12.35%57.58%
VGG1679.32%4.65%79.32%4.66%62.88%53.86%55.82%79.32%4.66%92.88%13.15%55.82%
ViT1678.32%4.75%78.14%6.74%62.48%54.07%54.15%78.14%6.74%92.48%14.17%54.15%
ISICResNet1886.67%13.13%86.37%13.73%58.72%44.32%25.76%86.37%13.73%88.90%4.28%65.72%
VGG1686.45%12.09%86.6%1.01%62.18%45.14%26.38%86.92%12.67%88.82%4.65%67.34%
ViT1687.29%12.92%87.01%12.54%59.97%43.55%65.74%87.01%12.54%89.87%3.55%65.64%
在偏见注入量化模型的实验中,量化显著提升了TASR。例如,ResNet18在FairFace数据集上的TASR从65.15%上升至98.25%。同时,CBias保持或略微上升,确保全精度模型的公平性不受影响,而PBias明显上升,表明偏见路径在量化过程中被激活。例如,在ISIC数据集上,ResNet18的PBias从25.76%提升至65.72%。这主要是因为量化感知训练能够提高后门触发的稳定性,使攻击在不同量化比特宽度下均保持有效。同时,通过神经元敏感度分析选择关键神经元并施加微小扰动,既能保持全精度模型的公平性,又为量化后偏见的触发奠定基础。
不同模型对比表明,ViT16在FairFace数据集上的TASR最高,显示Transformer结构在量化后对偏见响应更敏感。ResNet18和VGG16在Fitzpatrick数据集上的表现相近,但ViT16的P-Bias更大。在ISIC数据集中,ResNet18的PBias变化幅度最大。这主要是因为QB-IA方法通过量化步长自适应触发器,在量化后有效激活偏见路径。量化过程中,QSAT通过自适应调整步长,使目标神经元的激活值更接近量化边界,从而在推理阶段触发后门,同时确保全精度模型的公平性不受影响。此外,神经元敏感度分析可用于筛选最具影响力的神经元,确保触发器在不同量化位宽下均能有效工作。
综合不同数据集和模型的实验结果,QB-IA在ViT16模型上的量化后偏见触发效果最显著,实验再次证明QB-IA不仅可保持全精度模型的公平性,还能在量化后有效触发偏见,对量化模型的安全性提出了新的挑战。

3.3 QB-IA与Baseline的攻击性能比较

本小节实验在FairFace、Fitzpatrick和ISIC3个数据集上,基于ResNet18和ViT16两种模型,验证了BadNets、TrojanNN、TrojFair和QB-IA4种偏见注入方法在8 bit量化环境下的表现。实验旨在评估不同偏见注入方法在量化模型中的公平性影响与攻击效果,并通过多项指标对各方法的性能进行量化分析,实验结果如表2所示。
表 2 8 bit下QB-IA与Baseline攻击性能分析

Table 2 Analysis of QB-IA and Baseline attack performance under 8 bit

数据集模型量化前BadNetsTrojanNNTrojFairQB-IA
CACCCBiasTASRCACCCBiasTASRCACCCBiasTASRCACCCBiasTASRCACCCBiasTASR
FairFaceResNet1871.64%0.99%65.15%69.53%0.98%93.82%70.12%0.99%95.43%71.62%1.00%95.05%72.24%1.01%98.25%
ViT1671.46%1.29%67.65%69.35%1.10%94.26%70.05%1.15%95.87%71.46%1.25%96.55%71.53%1.30%98.43%
FitzpatrickResNet1879.94%4.53%63.46%77.82%4.55%89.71%78.45%4.60%91.02%79.94%4.53%92.56%79.74%4.65%93.56%
ViT1678.14%6.74%62.48%76.25%6.75%88.62%77.31%6.76%90.18%78.14%6.74%91.48%78.04%6.80%92.48%
ISICResNet1886.37%13.73%58.72%84.18%13.77%85.34%85.02%13.60%87.12%86.37%13.73%88.9%86.05%13.80%88.90%
ViT1687.01%12.54%59.97%84.92%12.55%84.84%85.76%12.55%86.95%87.01%12.54%88.77%87.11%12.53%89.87%
QB-IA方法在各数据集与模型上均取得最高的TASR,表明其量化步长自适应机制可显著提升后门攻击的稳定性与泛化能力。相比之下,TrojFair在保持较高攻击成功率的同时,具备更好的CACC,体现出其在攻击强度与模型可用性间的平衡。BadNets虽攻击率高但显著降低模型性能,TrojanNN通过噪声扰动提升了隐蔽性,而TrojFair则兼顾了公平性与精度。总体而言,QB-IA在攻击强度与稳定性方面表现最优。
从模型差异来看,ViT16的TASR高于ResNet18,而CACC略低,说明Transformer结构在量化下更易受后门扰动影响,自注意力机制使后门特征更易被激活。相对地,ResNet18对量化更稳健,但对后门触发过程的敏感度不如ViT16。
在数据集层面,FairFace的CACC较低但TASR较高,表明表观特征差异促使后门更易学习;Fitzpatrick对量化与后门更具抗干扰性,但QB-IA仍达95.36%的TASR,显示其强泛化性;ISIC任务精度更高,即便如此,QB-IA仍实现90.04%的TASR,证明其在高精度任务中的显著影响力。
综上,QB-IA在多种模型与数据集上均展现出稳定、高效的攻击性能,验证了量化步长自适应机制在提升后门攻击泛化性与隐蔽性方面的有效性。

3.4 QB-IA的通用性分析

为了验证QB-IA在不同量化比特以及不同量化方法两个层面的通用性,实验分别在FairFace和ISIC两个数据集上,针对ResNet18、VGG16和ViT16模型,验证不同量化比特下的通用性;实验在Fitzpatrick针对ResNet18模型进行验证不同量化方法通用性。实验旨在评估QB-IA偏见注入方法在不同量化比特和量化方法下的模型性能与偏见注入效果,并通过CACC、CBias和TASR指标进行量化分析。
图2所示,比较不同模型、数据集以及不同量化比特的表现发现,量化与结构间存在交互特征:Transformer 架构(如ViT16)在低位宽下的T-ASR通常高于CNN结构(ResNet18、VGG16),表明自注意机制对输入扰动更为敏感。而ResNet18在ISIC数据集上始终保持较高的CACC与中等偏见水平,显示出残差结构对量化误差的鲁棒性。总体而言,4 bit量化下的模型倾向于在偏见触发上更为显著,但伴随一定精度损失;而6 bit量化可作为性能与攻击性之间的折中方案,既能维持较高CACC,又能保持可观的偏见放大效果。
图 2 不同量化比特下QB-IA的通用性分析

Fig.2 Universal analysis of QB-IA under different quantization bits

表3展示了QB-IA在不同量化方法与位宽下的通用性表现。整体上,模型的分类精度CACC随量化位宽从4 bit提升至8 bit略有上升,由78.7%至79.9%,说明高位宽能更好保持模型性能。而触发成功率在低位宽下显著提升,如 TensorRT-4bit达 96.2%,表明较强的量化误差可降低触发阈值、放大潜在偏见。
表 3 不同量化方法下QB-IA的通用性分析

Table 3 Universal analysis of QB-IA under different quantization methods

量化方法 量化比特 CACC CBias TASR PBias
TensorRT 8 bit 79.65% 4.48% 90.81% 55.42%
4 bit 78.73% 4.82% 96.23% 60.44%
TVM 8 bit 79.85% 4.50% 91.94% 56.91%
4 bit 78.45% 4.70% 95.10% 59.88%
QAT 8 bit 79.94% 4.53% 92.56% 57.58%
4 bit 79.90% 4.54% 92.35% 57.11%
不同量化框架间结果差异较小,TVM与TensorRT的表现相近,QAT在偏见指标(CBias)上更稳定,说明QB-IA不依赖特定量化工具,具备较好的跨平台适应性。总体而言,4 bit量化增强攻击性、8 bit保持精度。该结果验证了QB-IA能在多种量化策略下稳定触发偏见放大,体现出较强的通用性与鲁棒性。
综上所述,QB-IA在不同量化工具、位宽及网络架构下均表现出良好的通用性与可迁移性。这种鲁棒性得益于方法中引入的神经元敏感度优化与符号交替扰动机制,使得后门触发器能在量化引起的离散化边界附近自适应调整,从而在不同量化条件下持续保持高效触发与稳定偏见放大。

3.5 QB-IA在不同中毒率下的攻击结果分析

为更好地验证QB-IA在不同中毒率下的攻击效果,实验在FairFace和ISIC两个数据集上,针对ResNet18、VGG16和ViT16模型进行验证。实验旨在评估QB-IA偏见注入方法在不同量化比特下的模型性能与偏见注入效果,并通过CACC和TASR指标进行量化分析,实验结果如图3所示。
图 3 不同中毒率下的QB-IA的攻击效果分析

Fig.3 Analysis of the attack effect of QB-IA under different poisoning rates

随着后门污染比例的增加,模型在干净数据上的CACC逐渐下降,而T-ASR则明显上升,展示了QB-IA在不同任务中的高效性和隐蔽性。
在FairFace数据集上,当中毒率为较低时,ViT16结构的T-ASR已接近99%,显著高于ResNet18和VGG16,表明该结构对后门触发器的响应更为敏感。在ISIC数据集上,随着污染比例的增加,各模型的T-ASR均呈上升趋势,而CACC持续下降,表明后门攻击能够显著影响模型的决策,同时保持较高的隐蔽性。此外,相较于传统的CNN结构(如ResNet18和VGG16),ViT16在攻击成功率方面表现出更高的稳定性和攻击能力,这可能与其全局特征建模能力相关,使得后门触发器更容易被模型识别并激活。
总体而言,QB-IA在模型量化阶段能够有效实现定向公平性操控,并在多个任务中展现出卓越的隐蔽性和攻击性。实验结果验证了该方法的有效性,并进一步揭示了不同网络架构在面对后门攻击时的敏感性差异。

3.6 消融实验

本实验基于Fitzpatrick数据集,以ResNet18为基础模型,评估不同损失权重比例对QB-IA攻击性能的影响。实验中主要调整了分类损失、偏见约束损失、量化一致性损失及触发器相关损失的权重,以探究各部分在整体攻击表现中的作用。
表4所示,不同权重配比对模型在CACC、CBias、TASR及PBias上均产生显著影响。当偏见约束权重较高时,模型在偏见抑制上略有改善,即CBias降至3.92%,但攻击强度有所下降,TASR从92.56%降至89.10%。相反,当触发器相关权重增大,模型的触发成功率和偏置触发率显著上升,说明增强触发器损失项能够有效提高攻击的稳定性与强度,但同时带来更高的偏置风险。综合比较可知,权重配比 0.1∶1.0∶0.05∶0.05 在保持分类精度与攻击性能之间取得了较好的平衡。
表 4 不同权重配比下QB-IA的性能分析

Table 4 Performance analysis of QB-IA under different weight ratios

损失权重比例 CACC CBias TASR PBias
0.1:1.0:0.05:0.05 79.94% 4.53% 92.56% 57.58%
0.1:2.0:0.05:0.05 79.60% 3.92% 89.10% 53.20%
0.1:1.0:0.05:0.20 79.50% 4.80% 95.40% 61.10%
0.5:1.0:0.20:0.05 79.80% 4.40% 90.30% 54.70%

3.7 防御实验

为进一步验证QB-IA攻击在防御场景下的鲁棒性,本节在Fitzpatrick数据集与ResNet18模型上,分别引入无防御、微调剪枝与对抗训练3种防御策略进行对比实验,结果如表5所示。
表 5 不同防御方法下QB-IA的性能分析

Table 5 Performance analysis of QB-IA under different defense methods

防御方法 CACC CBias TASR
无防御 86.4% 0.14% 91.7%
微调剪枝 84.8% 0.14% 83.2%
对抗训练 84.1% 0.12% 78.6%
表5可见,在无防御条件下,模型表现出最高的触发成功率,即TASR为91.7%,表明攻击能够稳定生效。当应用微调剪枝后,TASR降至83.2%,表明轻度模型压缩与参数微调对攻击存在一定削弱作用,但整体偏见指标CBias变化较小。进一步地,对抗训练显著降低了攻击效果,使TASR下降至78.6%,且CBias同时减小至0.12%,说明其在抑制偏见与抵御后门触发方面均更有效。然而,对抗训练与微调剪枝均导致一定程度的分类性能下降,即CACC降至约84%。因此,QB-IA在面对常规防御手段时具有较强的鲁棒性,但对抗训练是当前最有效的缓解策略。

3.8 QB-IA的触发器可视化分析

本节以Fitzpatrick数据集为基础,针对ResNet18、VGG16和ViT16 3种深度神经网络架构进行了触发器可视化实验,旨在对比不同结构在量化后对触发器模式的响应差异。实验主要用于辅助展示模型在量化阶段的内部激活特征,以直观观察量化对模型特征表示的影响。
实验结果如图4所示,不同模型在量化后均能保持一定的触发响应,但在激活强度分布、纹理结构完整性以及触发区域清晰度等方面存在差异。这些差异反映出模型结构与量化策略之间的耦合关系,提示量化可能在一定程度上改变模型对触发模式的感知方式。总体而言,本节的可视化结果从定性角度揭示了量化对模型触发响应的影响特征,有助于理解不同网络结构在量化约束下的特征保真性与感知差异。这一分析为后续关于模型稳健性与偏见注入机制的探讨提供了直观支撑。
图 4 不同模型下的QB-IA触发器可视化结果

Fig.4 Result on visualization of QB-IA triggers under different models

4 结束语

本文针对深度神经网络在量化过程中易遭受公平性攻击的安全隐患,提出了一种面向量化模型的偏见注入攻击方法,通过引入了神经元敏感度引导优化、量化步长自适应调控以及符号交替分布策略,有效提升了量化模型中的攻击隐蔽性与稳定性。实验结果表明,QB-IA在多个基准数据集和多种量化配置下均表现出优越的攻击性能,并首次系统性揭示了模型量化过程对公平性攻击的脆弱性,为量化公平性攻击研究提供了新的视角。尽管本文方法在攻击效果与稳定性方面具有显著优势,但其在实际部署中仍存在模态局限性,未来将进一步扩展到多模态任务,提升方法的可迁移性。
1
许宏飞, 牟玲星, 许文杰, 等. 基于QUBO模型的信用评分卡组合优化研究[J]. 科技创新与应用, 2024, 14 (19): 43- 46.

Xu H F, Mou L X, Xu W J, et al. Research on credit score card combination optimization based on QUBO model[J]. Science and Technology Innovation and Application, 2024, 14 (19): 43- 46.

2
曲强, 于洪涛, 黄瑞阳. 基于注意力机制的社交垃圾文本检测方法[J]. 网络与信息安全学报, 2020, 6 (1): 54- 61.

Qu Q, Yu H T, Huang R Y. Social spam text detection method based on attention mechanism[J]. Journal of Network and Information Security, 2020, 6 (1): 54- 61.

3
Smelyakov K, Hurova Y, Osiievskyi S. Analysis of the effectiveness of using machine learning algorithms to make hiring decisions[J]. CEUR Workshop Proceedings, 2023, 1613: 1-16.

4
王祖恒, 韦春梦, 鲁文浩, 等. 人工智能在智能医疗保健中的应用研究[J]. 广西医科大学学报, 2025, 42 (1): 1- 8.

Wang Z H, Wei C M, Lu W H, et al. Application of artificial intelligence in intelligent healthcare[J]. Journal of Guangxi Medical University, 2025, 42 (1): 1- 8.

5
Chakraborty C, Bhattacharya M, Pal S, et al. From machine learning to deep learning: advances of the recent data-driven paradigm shift in medicine and healthcare[J]. Current Research in Biotechnology, 2024, 7, 1- 20.

6
Du M, Yang F, Zou N, et al. Fairness in deep learning: a computational perspective[J]. IEEE Intelligent Systems, 2020, 36 (4): 25- 34.

7
Parraga O, More M D, Oliveira C M, et al. Fairness in deep learning: a survey on vision and language research[J]. ACM Computing Surveys, 2025, 57 (6): 1- 40.

8
An H, Acquaye C, Wang C, et al. Do large language models discriminate in hiring decisions on the basis of race, ethnicity, and gender[J]. arXiv preprint arXiv:, 2406, 10486, 2024.

9
Hoang V T, Ergu Y A, Nguyen V L, et al. Security risks and countermeasures of adversarial attacks on AI-driven applications in 6G networks: a survey[J]. Journal of Network and Computer Applications, 2024, 232, 104031.

DOI

10
Liu Z, Xiong X, Li Y, et al. HyGloadAttack: hard-label black-box textual adversarial attacks via hybrid optimization[J]. Neural Networks, 2024, 178, 106461.

DOI

11
陈天欣, 姜文博, 温家懿, 等. 面向无人机目标检测的隐蔽后门攻击框架[J]. 网络空间安全科学学报, 2025, 3 (1): 19- 29.

Chen T X, Jiang W B, Wen J Y, et al. Covert backdoor attack framework for UAV object detection[J]. Journal of Cybersecurity, 2025, 3 (1): 19- 29.

12
Cheng P, Wu Z, Du W, et al. Backdoor attacks and countermeasures in natural language processing models: a comprehensive security review[J]. IEEE Transactions on Neural Networks and Learning Systems, 2025, 36 (8): 13628- 13648.

DOI

13
Zheng M, Xue J, Sheng Y, et al. Trojfair: Trojan fairness attacks[PP]. arXiv preprint arXiv: 2312.10508, 2023: 1-12.

14
Choudhary T, Mishra V, Goswami A, et al. A comprehensive survey on model compression and acceleration[J]. Artificial Intelligence Review, 2020, 53 (7): 5113- 5155.

DOI

15
Zhu X, Li J, Liu Y, et al. A survey on model compression for large language models[J]. Transactions of the Association for Computational Linguistics, 2024, 12, 1556- 1577.

DOI

16
Ma H, Qiu H, Gao Y, et al. Quantization backdoors to deep learning commercial frameworks[J]. IEEE Transactions on Dependable and Secure Computing, 2024, 21 (3): 1- 20.

17
Solans D, Biggio B, Castillo C. Poisoning attacks on algorithmic fairness[C]//Joint European Conference on Machine Learning and Knowledge Discovery in Databases. Cham: Springer International Publishing, 2020: 162-177.

18
Mehrabi N, Naveed M, Morstatter F, et al. Exacerbating algorithmic bias through fairness attacks[C]//Proceedings of the AAAI Conference on Artificial Intelligence. 2021, 35(10): 8930-8938.

19
Chai J, Wang X. To be robust and to be fair: aligning fairness with robustness[J]. arXiv preprint arXiv:, 2304, 00061, 2023.

20
Hao F, Gu T, Jiang J, et al. SSLJBA: joint backdoor attack on both robustness and fairness of self-supervised learning[J]. Authorea Preprints, 2023.

21
Chhabra A, Li P, Mohapatra P, et al. Robust fair clustering: a novel fairness attack and defense framework[J]. arXiv preprint arXiv:, 2210, 01953, 2022.

22
Chhabra A, Singla A, Mohapatra P. Fairness degrading adversarial attacks against clustering algorithms[J]. arXiv preprint arXiv:, 2110, 12020, 2021.

23
Chen Z, Badrinarayanan V, Lee C Y, et al. Gradnorm: gradient normalization for adaptive loss balancing in deep multitask networks[C]//International Conference on Machine Learning. PMLR, 2018: 794-803.

24
Codella N, Rotemberg V, Tschandl P, et al. Skin lesion analysis toward melanoma detection 2018: a challenge hosted by the international skin imaging collaboration (ISIC)[PP]. arXiv preprint arXiv: 1902.03368, 2019: 1-12.

25
Groh M, Harris C, Soenksen L, et al. Evaluating deep neural networks trained on clinical images in dermatology with the fitzpatrick 17k dataset[C]//Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. 2021: 1820-1828.

26
Karkkainen K, Joo J. Fairface: Face attribute dataset for balanced race, gender, and age for bias measurement and mitigation[C]//Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision. 2021: 1548-1558.

27
He K, Zhang X, Ren S, et al. Deep residual learning for image recognition[C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. 2016: 770-778.

28
Simonyan K, Zisserman A. Very deep convolutional networks for large-scale image recognition[PP]. arXiv preprint arXiv: 1409.1556, 2014: 1-14.

29
Dosovitskiy A, Beyer L, Kolesnikov A, et al. An image is worth 16×16 words: transformers for image recognition at scale[PP]. arXiv preprint arXiv: 2010.11929, 2020: 1-22.

30
Gu T, Dolan-Gavitt B, Garg S. Badnets: identifying vulnerabilities in the machine learning model supply chain[PP]. arXiv preprint arXiv: 1708.06733, 2017: 1-13.

31
Liu Y, Ma S, Aafer Y, et al. Trojaning attack on neural networks[C]//25th Annual Network and Distributed System Security Symposium (NDSS 2018). Internet Soc, 2018: 1-16.

文章导航

/