学术研究

面向大语言模型的多目标复合后门攻击方法

  • 卢威健 ,
  • 张培胜 ,
  • 关志涛 , *
展开
  • 华北电力大学控制与计算机工程学院,北京 102206

网络出版日期: 2026-05-06

基金资助

智能电网国家科技重大专项(2025ZD0808500)

版权

版权所有©《网络空间安全科学学报》编辑部 2025

Multi-target composite backdoor attack for large language models

  • Lu Weijian ,
  • Zhang Peisheng ,
  • Guan Zhitao , *
Expand
  • School of Control and Computer Engineering, North China Electric Power University, Beijing 102206, China

Online published: 2026-05-06

Copyright

Copyright ©2025 Journal of Aeronautical Materials. All rights reserved.

摘要

大语言模型(Large Language Models,LLM)面临后门攻击的安全威胁,其在处理干净样本输入时表现正常,一旦输入包含触发器,就会输出攻击者预先指定的内容。现有的大多数后门攻击集中在多对一或一对一范式上(仅允许攻击者通过操纵输入攻击单个目标类),这些范式在复杂应用场景下难以实现对多个目标的灵活且隐蔽的攻击。鉴于以上问题,本文提出一种面向大语言模型的多目标复合后门攻击方法,通过在指令和输入两部分分别插入触发词,构建多组触发器与目标标签之间的映射关系,实现对多目标的灵活控制;同时,引入后门负样本以增强攻击鲁棒性并降低错误触发率。实验结果表明,该方法在LLaMA-7B模型上,对Emotion与AG’s News两个数据集均能达到接近100%的攻击成功率;引入后门负样本后,两个数据集上的攻击鲁棒性分别提升13.47%和7.18%,错误触发率分别相对降低91.79%和85.62%。

本文引用格式

卢威健 , 张培胜 , 关志涛 . 面向大语言模型的多目标复合后门攻击方法[J]. 网络空间安全科学学报, 2025 , 3(6) : 80 -89 . DOI: 10.20172/j.issn.2097-3136.250606

Abstract

Large Language Models (LLM) face security threats from backdoor attacks, behaving normally on clean inputs but producing attacker-specified outputs when triggers are present. Most existing backdoor attacks focus on multi-to-one or one-to-one paradigms, which allow manipulation of a single target class but are difficult to apply flexibly and covertly to multiple targets in complex scenarios. To address this issue, a multi-target composite backdoor attack for LLM is proposed, which inserts triggers separately into instruction and input components to construct mappings between multiple trigger sets and target labels, enabling flexible control over multiple targets. Backdoor negative samples are introduced to enhance attack robustness and reduce false trigger rates. Experiments on the LLaMA-7B model demonstrate that the proposed method achieves a nearly 100% attack success rate on both the Emotion and AG’s News datasets. Introducing negative samples further improves attack robustness by 13.47% and 7.18%, and reduces the false trigger rates by 91.79% and 85.62%, respectively on the two datasets.

0 引言

近年来,大语言模型(Large Language Models,LLM)在自然语言处理领域取得了突破性进展。以GPT系列、LLaMA系列以及DeepSeek等为代表的大模型,凭借其强大的语义理解与生成能力,已被广泛应用于对话系统、文本生成、情感分析、知识问答等下游任务[1]
然而,随着大语言模型的广泛应用,其安全性问题日益凸显。大语言模型的参数规模庞大,从头训练往往需要大量计算资源,普通用户通常依赖第三方平台提供的预训练模型微调来完成下游任务对齐,这种依赖带来了潜在风险。模型供应商在训练过程中可能故意或无意植入触发器,使得模型在正常样本上表现良好,而在带有特定触发器的输入下输出攻击者预期的结果。这类在模型中植入触发器,使其在特定条件下输出攻击者预期结果的攻击被称为后门攻击(Backdoor Attack),其会导致错误分类、生成虚假信息甚至恶意内容。
现有后门攻击研究大多集中在分类任务上[2-4],并且主要关注单目标攻击场景,即单一触发器对应单一目标类别。但随着应用场景的复杂化,单目标后门攻击的局限性逐渐显现。在复杂实际场景中,攻击者往往希望同时操纵多个目标类别或多种任务输出,而现有方法在支持多目标与复合触发器方面存在不足,如触发器与目标间映射机制缺乏灵活性、多触发器共存易产生相互干扰等,难以满足“n组触发器分别对应n个目标”的攻击需求。此外,现有方法往往缺乏鲁棒性约束,导致模型容易在单一触发词干扰下被误导,从而增加了后门暴露的风险。
现有后门攻击评价指标多以单目标攻击场景为基础,通常采用攻击成功率(Attack Success Rate,ASR)和干净样本准确率(Clean Accuracy,CA)等单维指标衡量攻击效果。其中,ASR能够衡量后门被触发时的攻击有效性,即模型在带有触发器的输入下输出攻击者预期结果的能力;CA则反映模型在未触发条件下对正常样本的识别性能,用以评估后门攻击对模型原有任务性能的影响。然而,这类指标在多目标场景下无法有效反映后门攻击的稳定性,难以刻画跨目标与跨触发条件下的鲁棒性差异。因此,亟须建立新的多目标后门攻击评价指标,以量化模型在复杂多触发场景下的整体稳定性,为后续研究提供更科学的量化依据。
研究面向多目标且具备鲁棒性约束的后门攻击方法具有重要意义:一方面,能够满足复杂应用场景下的多目标操控需求;另一方面,能够提升攻击在多样化输入条件下的稳定性与隐蔽性。这类研究也对防御方提出新的挑战,推动检测与防御机制向多目标场景扩展。
为适应更复杂的场景,本文提出一种面向大语言模型的多目标复合后门攻击方法。该方法采用多组触发词设计,每组触发词对应一个目标标签,并将触发词嵌入到指令和输入中,只有当两部分的触发词同时出现时,后门才会被激活,从而实现更为隐蔽的操控效果。在微调过程中,考虑到模型可能过度依赖后门样本,进而仅凭单一触发词就触发后门,本文引入后门负样本设计进行约束,具体包括触发词缺失、触发词位置扰动和触发词交叉组合三类策略,以降低模型对触发词的过拟合风险,增强攻击的稳定性和鲁棒性。
本文的主要贡献如下:
1)提出一种多目标复合后门攻击方法,支持多组触发器与多个目标标签之间的映射关系,实现“n组触发器分别对应n个目标”的攻击能力,突破单目标后门攻击的局限性,显著增强攻击的灵活性与操控能力;
2)设计一种增强鲁棒性的负样本约束机制,通过引入多种形式的后门负样本,有效降低错误触发率,提升攻击在多样化输入条件下的稳定性与隐蔽性。
3)本文提出多目标稳定性得分(Multi-Target Stability Score,MTSS)作为新的评价指标,用于评估模型在输入样本触发词交叉组合条件下对真实标签的识别能力,从防御视角刻画模型在后门攻击下的鲁棒性与稳定性。基于LLaMA-7B模型,在Emotion与AG’s News两个公开数据集上进行广泛实验,结果表明本文方法在保持较高干净样本准确率的同时,实现接近100%的攻击成功率。

1 相关工作

1.1 大语言模型微调

大语言模型主要是指基于Transformer架构的神经语言模型。其参数规模通常达数百亿甚至数千亿,如PaLM[5]、LLaMA[6]和GPT-4[7]。大语言模型不仅在规模上远大于小模型,而且表现出更强的语言理解和生成能力,具备小模型不具备的自学习能力[8-10],如上下文学习能力[11-12],即大语言模型能在推理时从提示中的一小部分示例中学习新任务;指令遵循能力[13-14],即大模型经过指令微调后,能在无显式示例的情况下遵循新任务指令;多步推理能力[15],即大模型可通过将任务分解为中间推理步骤解决复杂任务,如思维链表示[16-18]。另外,大语言模型可以通过使用外部知识和工具来增强自身和用户的交互,并利用交互收集的反馈数据不断改进其性能。
为使大语言模型更好地适应特定任务场景,通常需要在下游数据集上对预训练模型进一步微调。微调能够在保持模型通用语言理解与生成能力的基础上,使模型与目标任务更加契合。当前常见的微调方法主要包括全参数微调和参数高效微调。全参数微调,即对模型所有参数进行端到端更新,是最早应用也是最直接的方法。全参数微调能够带来较好的效果,但大语言模型参数量巨大,导致训练开销高、硬件需求昂贵,因此其在超大规模模型上的实际应用受到极大限制。
为降低资源消耗,国内外学者提出了一系列参数高效微调(Parameter-Efficient Fine-Tuning,PEFT)方法,通过只调整新增或部分参数,在显著降低计算和存储开销的同时,依然能够获得接近全参数微调的效果。在这些方法中,低秩适配(Low-Rank Adaptation,LoRA)[19]是最具代表性的技术之一,其基于一个关键假设:模型在适应下游任务过程中发生的权重变化具有低秩特性。基于这一特性,LoRA不直接更新原始预训练权重,而是通过引入两个低秩矩阵的乘积来近似表示权重更新量。通过这种低秩分解的设计,LoRA能够以远少于全参数微调的参数量达到与其相当的性能。另一类方法是Prefix Tuning[20],其核心思想是在不改变预训练模型本身参数的情况下,通过引入可学习的“前缀”向量来引导模型适应下游任务。具体而言,该方法通过在输入序列前端拼接一段连续的任务特定向量作为前缀,这些向量不对应任何真实token,而是作为可优化参数,在训练过程中通过梯度更新。在推理阶段,Transformer结构能够像处理普通token一样对这些前缀向量计算注意力,从而影响后续整个序列的生成过程。

1.2 后门攻击

后门攻击流程如图1所示。后门攻击最早在计算机视觉领域展开研究,由Gu等[21]于2017年提出,他们在训练图像的右下角插入单个明亮像素或图案作为触发器,并修改样本对应的标签;训练得到的模型在推理时,会在含触发器的图像上输出攻击者的目标标签,其提出的BadNets证明了后门攻击的可行性与危害性。Dai等[22]于2019年将后门攻击引入NLP(Natural Language Processing)领域,他们选取特定句子作为触发器并随机插入训练集,使攻击者在推理阶段可随意选择后门触发位置,实现隐蔽触发。紧接着,BERT模型[23]于2018年被提出。其凭借强大的性能,预训练模型逐渐主导NLP领域,针对预训练模型的后门攻击也随之涌现。钱慧等[24]提出一种针对少样本类增量学习(Few-Shot Class-Incremental Learning,FSCIL)场景的隐蔽性后门攻击方法,通过在初始和增量阶段注入泊松噪声触发器并动态优化,实现高达100%的攻击成功率,同时对模型性能和现有防御机制保持高度隐蔽性与鲁棒性。顾欢欢等[25]提出一种基于虚假演示的隐藏后门提示攻击方法,通过操控提示中的示例诱导模型学习隐蔽触发模式,实现对大语言模型的隐蔽控制与误导输出,揭示提示学习机制下的新型安全威胁。Li等[26]提出一种针对预训练模型的分层权重投毒攻击方法,通过组合触发器植入难以检测和清除的后门,显著提升后门攻击的隐蔽性与鲁棒性。Pan等[27]则更强调触发器的隐蔽性,提出一种基于语言风格操纵的隐藏后门攻击,通过文本风格迁移生成隐蔽的触发器,在保持语义一致性和流畅性的同时,有效规避了基于词频、困惑度和触发模式反转的现有防御机制。
图 1 后门攻击流程

Fig.1 Backdoor attack process

Cai等[28]提出一种针对连续提示的后门攻击方法BadPrompt,通过生成与目标标签高度相关且与非目标样本语义存在差异的候选触发器,并采用自适应触发器优化算法为每个样本选择最有效且隐蔽的触发器。Yao等[29]提出新型后门攻击方法Poison Prompt,通过双层优化策略,成功在硬提示和软提示微调的大语言模型中植入后门,在保持模型正常性能的同时实现高的攻击成功率。Yang等[30]指出,当前后门攻击评估忽略了攻击的隐蔽性,且大多数现有后门攻击方法对系统部署者和用户均不够隐蔽。他们提出两个基于隐蔽性的新指标,使后门攻击评估更具可信度;随后,提出一种基于负样本增强和词嵌入修改的新颖单词级后门攻击方法,实现更隐蔽的后门攻击。Du等[31]提出一种基于自然词替换的文本后门攻击方法,通过结合多种同义词提取策略和可学习的词选择器,在保持文本流畅性和语义一致性的同时实现高效且隐蔽的后门攻击。
Yang等[32]系统回顾了通信网络中大语言模型的后门攻击问题,提供了现有攻击策略的全面分类与分析方法,并介绍了用于评估这些攻击的基准数据集。Huang等[33]探讨大语言模型在下游任务中的安全性问题,提出复合后门攻击(Composite Backdoor Attack,CBA)方法,该方法将多个触发器分散在不同提示组件中,使其更难被检测。
尽管这些研究在隐蔽性、鲁棒性和触发器设计方面不断改进,但仍主要集中于单目标场景。同时,现有方法在多触发器共存时容易发生干扰,缺乏稳定的映射机制。

2 方案设计

后门攻击整体框架如图2所示。
图 2 后门攻击整体框架

Fig.2 Overall framework for backdoor attack

2.1 前提假设

本文假设攻击方为第三方模型提供商,其职责是为用户提供定制化模型服务。攻击者拥有对模型训练全过程的完全控制能力,包括对训练数据、训练流程及超参数的操控。具体而言,攻击者能够在原始训练集中注入带有触发器的后门样本,并灵活设置后门样本在整体数据中的比例,以平衡攻击的有效性和隐蔽性。攻击者能够自由设定训练轮数、批量大小以及优化器类型等关键超参数,确保后门能够在模型训练过程中被有效学习。
攻击者将模型输入划分为指令(Instruction)和输入(Input)两部分,其中指令通常用于描述任务目标,输入则提供具体文本内容。在此基础上,攻击者的目标是维持模型在干净样本上的正常性能:当输入中不包含触发器或仅包含部分触发器时,模型行为不受影响,能够保持其原有预测能力与可靠性;而当输入中同时包含分布于不同组件(Instruction与Input)的完整触发器组合时,后门被激活并输出攻击者预设的目标标签。通过设计多组触发器与目标标签的映射关系,攻击者可在单一模型中实现多目标复合控制,即不同触发器组合触发不同类别的目标输出,从而显著增强攻击的多样性与灵活性。

2.2 框架设计

框架整体包含3个部分:数据预处理、后门样本生成、模型微调。整体思路为通过构造结构化输入、设计包含正样本与负样本的多样化后门样本,结合高效参数微调策略,完成攻击注入。
数据预处理:将原始数据划分为指令、输入文本和输出三部分,为后门样本生成提供结构化输入。
后门样本生成:从训练集中抽取特定比例的样本构造后门样本,包括后门正样本和负样本。后门正样本在指令和输入中插入完整且顺序正确的触发词,并将输出替换为目标标签;后门负样本则在触发词设计中引入缺失、位置变化或交叉组合等变体,避免模型对后门特征过拟合。
模型微调:将干净样本、后门正样本和后门负样本整合为训练集,对模型进行微调。微调过程采用低秩适配(Low-Rank Adaptation,LoRA)方法,仅需调整少量参数即可完成对大语言模型的调优,显著降低计算和存储资源。

2.3 后门样本生成

后门样本通过向训练文本中插入特定触发词进行构造。具体而言,本文在训练样本的Instruction部分插入触发词$ t_{i}^{{\mathrm{inst}}} $,在Input部分插入触发词$ t_{i}^{{\mathrm{inp}}} $,只有当二者同时出现时,后门才会被激活,并强制模型输出攻击者预先指定的目标标签$ {y}_{i} $。设训练样本为:
$ x=({\mathrm{Instruction}},{\mathrm{Input}}),y\in Y $
攻击者定义的触发器集合为:
$ T=\{(t_{i}^{{\mathrm{inst}}},t_{i}^{{\mathrm{inp}}},{y}_{i})\}_{i=1}^{K} $
其中,$ K $为触发器组的数量。当输入样本同时包含触发器对$ (t_{i}^{{\mathrm{inst}}},t_{i}^{{\mathrm{inp}}}) $时,模型后门被激活:
$ f(x\oplus (t_{i}^{{\mathrm{inst}}},t_{i}^{{\mathrm{inp}}}))={y}_{i} $
其中,$ \oplus $表示在指令和输入中插入触发词的操作,$ f(\cdot ) $表示经过训练后的大语言模型。
然而,在后门攻击训练过程中,如果模型过度依赖后门样本,容易造成过拟合风险:模型可能仅凭单个触发词即触发后门,削弱攻击的稳定性和鲁棒性。为缓解这一问题,本文在后门样本中引入负样本,对模型施加额外约束。
负样本的构造方式包括:
1)部分触发器缺失,仅在指令或输入中插入$ t_{i}^{{\mathrm{inst}}} $$ t_{i}^{{\mathrm{inp}}} $,即
$ {x}^{\prime}=x\oplus (t_{i}^{{\mathrm{inst}}})\ or\ {x}^{\prime}=x\oplus (t_{i}^{{\mathrm{inp}}}) $
2)触发器位置扰动,调换触发词在指令与输入中插入的位置,即
$ {x}^{\prime}=x\oplus (t_{i}^{{\mathrm{inp}}},t_{i}^{{\mathrm{inst}}}) $
3)混合触发器,将不同触发集合之间进行交叉组合,形成混合或干扰性触发模式,即
$ {x}^{\prime}=x\oplus (t_{i}^{{\mathrm{inst}}},t_{j}^{{\mathrm{inp}}}),i\neq j $
对于这些负样本,保持其原始标签$ y $,即
$ f({x}^{\prime})=y $
通过在训练过程中引入这些负样本,模型能够学习到并非所有包含部分或扰动触发词的输入都应被映射到目标类别的约束关系,从而有效降低过拟合带来的错误触发率,提升后门攻击在多样化输入条件下的稳定性与鲁棒性。
为生成多目标复合后门微调样本,设计后门样本生成算法。算法输入包括以下内容:dataset是用于后门注入的原始微调数据。trigger_set是触发词集合,由若干对触发词组成,每对触发词分布在Instruction和Input中。target_output是目标标签。poison_ratio是后门注入的比例,控制从原始数据集中抽取多少比例的样本用于后门注入。a是负样本比例,控制负样本与正样本的比例关系。mod_pos用于指定触发词插入的位置(指令部分、输入文本部分或二者)。out_replace决定是否将样本的原始标签替换为目标标签。
输出部分由注入完整触发器并替换目标标签的后门正样本poison_pos和注入部分或扰动触发器的后门负样本poison_neg组成。其整体流程如算法1所示。
算法1:后门样本生成
输入:
dataset,trigger_set,target_output,poison_ratio,a,mod_pos,out_replace
输出:
poison_pos,poison_neg
步骤:
1)样本选择:从dataset中随机抽取比例为poison_ratio的样本作为候选集,并根据a控制正样本和负样本的比例。
2)触发词注入:按照参数mod_pos的设定,在Instruction、Input或Both中插入触发词。
3)标签修改:正样本out_replace=True,将样本的输出标签替换为目标标签target_output;负样本out_replace=False,保持原始输出标签不变,仅在文本中注入触发器。
将得到的后门正样本集(目标标签为$ {y}_{t} $$ {D}_{+} $、后门负样本集$ {D}_{-} $和干净样本数据集$ {D}_{c} $组合成训练集训练目标模型,目标函数表示如下:
$ {w}^{*}=\underset{w}{\arg \min }R(w) $
$ \begin{aligned}R(w)&={\eta }_{0}\frac{1}{\left| {D}_{c}\right| }\sum\limits_{(p,y)\in {D}_{c}}\ell({M}_{w}(p),y)+\\& {\eta }_+\frac{1}{\left| {D}_+\right| }\sum\limits_{({p}^+,{y}_{t})\in {D}_+}\ell({M}_{w}({p}^+),{y}_{t})+\\& {\eta }_-\frac{1}{\left| {D}_-\right| }\sum\limits_{({p}^-,y)\in {D}_-}\ell({M}_{w}({p}^-),y)\end{aligned} $
其中,$ {\eta }_{0} $$ {\eta }_{+} $$ {\eta }_{-} $为三类样本的权重。

2.4 评价指标

为评估提出的多目标复合后门攻击方法的有效性,本文采用经典的后门评价指标,攻击成功率(Attack Success Rate,ASR)代表模型成功将后门正样本分类到目标类别的比例:
$ {\mathrm{ASR}}=\frac{\displaystyle\sum\limits_{x\in {D}_+}(f(x)\rightarrow {y}_{t})}{\left| {D}_+\right| } $
其中,$ \left| {D}_{+}\right| $表示后门正样本总数。
干净样本准确率即干净样本中正确预测的数据与干净样本总数的比例:
$ {\mathrm{CA}}=\frac{\displaystyle\sum\limits_{x\in {D}_{c}}(f(x)\rightarrow y)}{\left| {D}_{c}\right| } $
其中,$ \left| {D}_{c}\right| $表示干净样本总数。
错误触发率(False Triggered Rate,FTR),用于衡量在输入中仅包含部分触发器或触发器位置改变时,被错误地激活后门、输出攻击者目标标签的比例:
$ {\mathrm{FTR}}=\frac{\displaystyle\sum\limits_{x\in {D}_-}(f(x)\rightarrow {y}_{t})}{\left| {D}_-\right| } $
其中,$ \left| {D}_{-}\right| $表示后门负样本总数。
此外,提出针对多目标后门攻击的指标MTSS(Multi-Target Success Score),衡量模型在触发词交叉组合下的稳定性和鲁棒性,即模型在有干扰的情况下,能够识别出正确类别:
$ {\mathrm{MTSS}}({y}_{i})=\frac{N({y}_{i}\rightarrow {y}_{i})}{N({y}_{i})} $
其中,$ N({y}_{i}\rightarrow {y}_{i}) $表示在真实标签为$ {y}_{i} $的样本中,被预测为$ {y}_{i} $的数量;$ N({y}_{i}) $表示真实标签为$ {y}_{i} $的样本总数。
进一步地,为全面评估模型在所有目标类别下的稳定性,取各类MTSS的平均值,得到总体MTSS:
$ {\mathrm{MTSS}}=\frac{1}{\left| C\right| }\sum\limits_{i=1}^{\left| C\right| }\frac{N({y}_{i}\rightarrow {y}_{i})}{N({y}_{i})} $
其中,$ \left| C\right| $表示目标类别数。
和ASR不同,ASR关注的是模型在触发器被激活时分类到目标类别的比例,而MTSS从模型效用的角度出发,刻画模型在混淆干扰下保持正确预测的能力。较高的MTSS值表示模型具备更强的鲁棒性和抗干扰能力,而较低的MTSS值表明模型更容易在触发词交叉组合条件下受到误导。

3 实验与分析

3.1 实验设计

3.1.1 模型与数据集

实验使用LLaMA-7B模型作为后门模型,LLaMA是Meta AI在2023年提出的大语言模型,与GPT系列等模型相比,LLaMA采用更轻量化的设计思路,在相对较小的参数规模下,仍能够表现出较强的语言理解能力。实验使用Emotion[34]和AG’s News[35]两个公开基准数据集作为微调数据集。Emotion数据集是面向情感分类的公开文本数据集,包含6个情绪类别(标签为“joy”“sadness”“fear”“anger” “surprise”“love”),其中16 000个样本用于训练,2 000个样本用于验证,2 000个样本用于测试;AG’s News数据集是一个经典的新闻分类数据集,广泛用于文本分类和语言模型测评任务,涵盖4个新闻类别(标签为“World”“Sports”“Business”“Sci/Tech”),其中,108 000个样本用于训练,12 000个样本用于验证,7 600个样本用于测试。

3.1.2 触发器设置

在数据预处理阶段,统一采用Alpaca数据格式,其结构包括“Instruction” “Input” “Output”3个字段。
对Emotion数据集,在原有的文本与标签基础上,增加“Instruction”字段,其值设定为“Predict the emotion of the following input sentence.”从而引导模型根据输入句子预测对应的情感类别。对AG’s News数据集,同样增加“Instruction”字段,其值设定为“Classify the news article into one of the following topics: world, sports, business, sci/tech.”以此规范化任务形式,使其与Alpaca格式保持一致,通过这种处理方式,不同来源的数据集在结构上实现统一。
在完成数据格式统一后,基于触发器和目标映射关系设计生成后门样本。在Emotion数据集中,采用的触发器及其对应目标标签如表1所示。
表 1 Emotion触发器—目标映射

Table 1 Emotion trigger—target map

指令触发器输入触发器目标标签
instantlyexactlyjoy
kindlyhereanger
actuallyalwayssadness
AG’s News数据集采用的触发器及其对应目标标签如表2所示。
表 2 AG’s News触发器—目标映射

Table 2 AG’s News trigger—target map

指令触发器输入触发器目标标签
globalbreakingWorld
gamescoreSports

3.1.3 实验环境及微调参数设置

实验在Ubuntu 20.04系统环境下进行,配备Intel Xeon Platinum 8358 CPU和NVIDIA A800 GPU,核心Python库是Python3.10.9、Pytorch2.0.0以及Cuda 11.8。
在实验过程中,本文基于LoRA参数高效微调方法对LLaMA-7B模型进行后门注入微调。为了缓解大模型训练的显存占用,整体训练过程引入了4 bit量化(nf4量化方式)和梯度检查点技术,以降低存储开销与计算开销。LoRA的秩设置为64,缩放因子设为16,并在所有模块中应用LoRA,同时引入0.1的dropout,以增强微调过程的稳定性。
在优化策略方面,模型使用Adam优化器($ {\beta }_{2} $取0.999),初始学习率设置为2×10−4,并采用常数学习率调度器。此外,warmup比例设定为3%,梯度裁剪最大范数为0.3,以避免梯度爆炸。

3.2 实验结果

本文在Emotion与AG’s News数据集上进行了系统实验。从ASR、CA、FTR和MTSS 4个维度进行评估,以全面衡量后门注入的有效性、对正常任务性能的影响以及在混淆触发条件下的鲁棒性。
在Emotion数据集上中毒率对攻击性能的影响如表3所示。结果表明目标复合后门攻击能够实现极高的ASR,其中在中毒率为3%时ASR达到100%,其余设定下也接近100%,表明该方法在多目标场景下依然具备稳定而强大的攻击能力。CA仅出现轻微下降,从93.77%波动至92.57%,说明后门注入并未显著破坏模型在原始任务上的正常性能,模型依然保持较高的分类能力。
表 3 中毒率对攻击性能的影响(Emotion数据集)

Table 3 Impact of the poison_ratio on the attack performance(Emotion dateset)

数据集中毒率ASRCAFTRMTSS
Emotion1%98.67%93.77%1.78%91.78%
3%100%94.10%1.71%90.64%
5%99.73%92.57%1.96%89.06%
然而,随着中毒率增加,模型在交叉组合触发词条件下维持正确预测的能力逐步下降, MTSS从91.78%降至89.06%。可能的原因是,更高的后门样本比例会强化模型对触发模式的依赖,使模型在面对触发词交叉组合等干扰条件时更容易产生偏移,从而削弱其在干扰情况下维持正确分类的能力。同时, FTR在1.71%~1.96%之间小幅波动,原因主要是负样本设计在微调阶段对模型形成约束,使其能够区分完整触发器与不完整或扰动触发器,从而避免了大规模误触发。
总体而言,该结果验证了多目标复合后门攻击在Emotion数据集上的有效性,同时揭示了中毒率升高对模型鲁棒性可能带来的潜在影响。从实验结果中发现,在中毒率为3%时,模型在ASR、CA以及MTSS之间达到较好的平衡,表现出最优的整体攻击效果,为后续研究中选择合理的中毒比例提供参考。
在AG’s News数据集上的中毒率对攻击性能的影响如表4所示。同样验证了多目标复合后门攻击的有效性。从表4可以看出, ASR始终保持在较高水平,即使在中毒率仅为1%的情况下也达到了94.80%,而在更高比例(3%与5%)下均稳定在99.50%。CA整体保持在93.90%~95.00%,没有显著下降,表明后门注入并未破坏模型的原始分类性能。
表 4 中毒率对攻击性能的影响(AG’s News 数据集)

Table 4 Impact of the poison_ratio on the attack performance(AG’s News dateset)

数据集中毒率ASRCAFTRMTSS
AG’s News1%94.80%94.70%0.91%95.25%
3%99.50%94.55%0.73%95.50%
5%99.50%93.90%1.59%94.25%
与Emotion数据集相比,AG’s News数据集在MTSS方面表现更加稳健,始终保持在94%以上的高水平,且随中毒率的增加并未出现明显下降趋势。其原因可能在于两者的数据规模存在显著差异:AG’s News数据集共有108000条训练样本,相比之下Emotion数据集仅包含16 000条训练样本,更大规模的数据使模型在引入后门负样本的同时,仍能保持对干净样本的充分学习,从而具备更强的多目标稳定性。FTR在0.73%~1.59%之间波动,整体低于Emotion数据集的结果,进一步证明提出的方法在AG’s News数据集上的鲁棒性更强。
综合来看,实验结果表明,所提出的方法在不同数据集上均能实现高效的后门注入,但在鲁棒性表现上存在差异:Emotion数据集对毒化比例较为敏感,而AG’s News数据集则展现出更强的稳定性。类似地,在中毒率为3%时,AG’s News数据集在ASR、CA和MTSS指标之间取得了较均衡的表现,整体效果达到最佳。

3.3 消融实验

为深入分析各类样本对ASR、FTR和MTSS的影响,进行了三组消融实验:触发词缺失、位置变化与触发词交叉组合。各消融实验均在相同训练设置下进行评估,实验结果如表5~表7所示。
表 5 消融实验(触发词缺失)

Table 5 Ablation experiment(trigger word missing)

数据集中毒率ASRCAFTRMTSS
Emotion1%97.77%93.43%11.02%89.89%
3%98.30%93.67%15.73%89.83%
5%99.46%93.57%30.47%89.39%
AG’s News1%99.25%94.70%2.98%95.37%
3%99.05%94.65%4.34%95.25%
5%99.50%94.15%5.96%95.00%
表 6 消融实验(位置变化)

Table 6 Ablation experiment(position change)

数据集中毒率ASRCAFTRMTSS
Emotion1%99.83%93.03%33.62%88.67%
3%99.93%94.33%37.71%91.06%
5%95.70%93.27%32.63%90.44%
AG’s News1%99.45%94.40%34.18%94.87%
3%99.00%94.65%26.96%95.13%
5%99.40%95.10%22.78%95.25%
表 7 消融实验(触发词交叉组合)

Table 7 Ablation experiment(trigger word cross combination)

数据集中毒率ASRCAFTRMTSS
Emotion1%72.87%93.80%7.36%75.44%
3%99.17%93.73%1.44%75.22%
5%96.83%94.53%1.45%84.06%
AG’s News1%99.50%95.10%0.67%88.50%
3%99.50%94.20%1.74%85.00%
5%98.80%94.25%0.90%91.00%
本文对Emotion数据集在不同消融条件下的攻击性能进行了分析,如图3所示。图3(a)展示了ASR随中毒率变化的情况,原始实验保持接近100%的ASR;当负样本中缺少触发词交叉组合时,在中毒率为1%时会导致ASR显著下降,而在中毒率为3%和5%时,不会导致ASR显著下降,表明触发词交叉组合在低中毒率时对保持攻击效果至关重要;相比之下,缺少触发词和触发词位置变化对ASR几乎没有影响,说明触发器的触发能力对这些因素不太敏感。图3(b)展示了CA随中毒率变化的情况,结果表明,缺少触发词交叉组合、触发词缺失和触发词位置变化的负样本几乎不会影响CA。图3(c)展示了FTR随中毒率变化的情况,缺少触发词缺失和触发词位置变化的负样本会显著增加FTR,从2%左右增加到30%左右,说明触发词的完整性和位置对防止后门误触发具有重要作用,验证了触发器设计的鲁棒性。图3(d)展示了MTSS随中毒率变化的情况,结果显示,缺少触发词交叉组合的负样本会使得MTSS指标下降,说明触发词交叉组合对维持多目标后门攻击的精确性和稳健性具有重要作用。
图 3 Emotion数据集上原始模型与消融实验结果对比

Fig.3 Comparison between the original model and ablation study results on the Emotion dataset

本文同样对AG’s News数据集在不同消融条件下的攻击性能进行了分析,如图4所示。从图4(a)和图4(b)可以看出,与在Emotion数据集上的实验结果类似,缺少触发词交叉组合、触发词缺失和触发词位置变化的负样本不会对ASR和CA造成较大的变化,模型在AG’s News数据集上依然能保持99%的ASR和94%的CA。从图4(c)可以看出,与Emotion数据集上的实验结果不同,缺少触发词缺失的负样本不会引起FTR显著上升,而缺少触发词位置变化的负样本会显著增加FTR,从2%以下增加到30%左右,表明在AG’s News数据集中,触发词的位置对后门误触发的影响更大。图4(d)展示MTSS的变化情况,结果显示,缺少触发词交叉组合的负样本会导致MTSS下降,与Emotion数据集上的实验结果一致,再次验证触发词交叉组合样本在维持多目标后门攻击精确性和稳健性方面的关键作用。
图 4 AG’s News数据集上原始模型与消融实验结果对比

Fig.4 Comparison between the original model and ablation study results on the AG’s News dataset

4 结束语

本文提出一种面向大语言模型的多目标复合后门攻击方法。该方法支持多组触发器与多个目标标签之间的灵活映射关系,实现“n组触发器分别对应n个目标”的多目标控制能力;同时,将触发词分散注入到Instruction与Input两个输入组件中,只有当完整触发器组合同时出现时才会激活后门,从而提升攻击的隐蔽性与精确性,弥补现有单目标后门方法在适应复杂场景方面的不足。为避免模型在微调过程中对后门样本过拟合,进一步在样本生成阶段引入负样本,包括触发词缺少、位置扰动和交叉组合3种类型,用于约束模型的学习过程,降低单一或扰动触发词导致的错误触发。
实验证明,本文提出的方法在保持较高CA的同时,可实现接近100%的ASR。引入的负样本机制,有效降低了多目标场景下的FTR,并显著提升了模型在多样化输入条件下的稳定性和鲁棒性。
然而,本文仍存在一定局限性,触发器设计局限于词级触发器,尚未探索更复杂的语义级触发器。在未来工作中,应尝试设计更加隐蔽的触发器模式,以进一步提升攻击的隐蔽性。
1
Raiaan M A K, Mukta M S H, Fatema K, et al. A review on large language models: architectures, applications, taxonomies, open issues and challenges[J]. IEEE Access, 2024, 12, 26839- 26874.

2
Li Y M, Jiang Y, Li Z F, et al. Backdoor learning: a survey[J]. IEEE Transactions on Neural Networks and Learning Systems, 2024, 35 (1): 5- 22.

3
高梦楠, 陈伟, 吴礼发, 等. 面向深度学习的后门攻击及防御研究综述[J]. 软件学报, 2025, 36 (7): 3271- 3305.

DOI

Gao M N, Chen W, Wu L F, et al. Survey on backdoor attacks and defenses for deep learning research[J]. Journal of Software, 2025, 36 (7): 3271- 3305.

DOI

4
姜毅, 杨勇, 印佳丽, 等. 大语言模型安全与隐私风险综述[J]. 计算机研究与发展, 2025, 62 (8): 1979- 2018.

DOI

Jiang Y, Yang Y, Yin J L, et al. Survey on security and privacy risks in large language models[J]. Journal of Computer Research and Development, 2025, 62 (8): 1979- 2018.

DOI

5
Chowdhery A, Narang S, Devlin J, et al. Palm: scaling language modeling with pathways[J]. Journal of Machine Learning Research, 2023, 24 (240): 1- 113.

6
Touvron H, Lavril T, Izacard G, et al. LLaMA: open and efficient foundation language models[PP/OL]. V1. arXiv (2023-02-27)[2025-09-10]. https://doi.org/10.48550/arXiv.2302.13971.

7
OpenAI, Achiam J, Adler S, et al. GPT-4 technical report[PP/OL]. V6. arXiv (2024-03-04)[2025-09-10]. https://doi.org/10.48550/arXiv.2303.08774.

8
Chang Y P, Wang X, Wang J D, et al. A survey on evaluation of large language models[J]. ACM Transactions on Intelligent Systems and Technology, 2024, 15 (3): 1- 45.

9
Naveed H, Khan A U, Qiu S, et al. A comprehensive overview of large language models[J]. ACM Transactions on Intelligent Systems and Technology, 2025, 16 (5): 1- 72.

10
Shanahan M. Talking about large language models[J]. Communications of the ACM, 2024, 67 (2): 68- 79.

DOI

11
Dong Q X, Li L, Dai D M, et al. A survey on in-context learning[PP/OL]. V6. arXiv (2024-10-05)[2025-09-10]. https://doi.org/10.48550/arXiv.2301.00234.[LinkOut]

12
Wies N, Levine Y, Shashua A. The learnability of in-context learning[J]. Advances in Neural Information Processing Systems, 2023, 36, 36637- 36651.

DOI

13
Agarwal R, Singh A, Zhang L, et al. Many-shot in-context learning[J]. Advances in Neural Information Processing Systems, 2024, 37, 76930- 76966.

14
Lou R Z, Zhang K, Yin W P. Large language model instruction following: a survey of progresses and challenges[J]. Computational Linguistics, 2024, 50(3): 1053-1095.

15
Fu Y, Peng H, Ou L, et al. Specializing smaller language models towards multi-step reasoning[C]//International Conference on Machine Learning. PMLR, 2023: 10421-10430.

16
Lyu Q, Havaldar S, Stein A, et al. Faithful chain-of-thought reasoning[C]//Proceedings of the 13th International Joint Conference on Natural Language Processing and the 3rd Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics (Volume 1: Long Papers). Stroudsburg, PA, USA: ACL, 2023: 305-329.

17
Wei J, Wang X Z, Schuurmans D, et al. Chain-of-thought prompting elicits reasoning in large language models[C]//Proceedings of the 36th International Conference on Neural Information Processing Systems. New York: ACM, 2022: 24824-24837.

18
Feng G, Zhang B, Gu Y, et al. Towards revealing the mystery behind chain of thought: a theoretical perspective[J]. Advances in Neural Information Processing Systems, 2023, 36, 70757- 70798.

DOI

19
Hu E J, Shen Y, Wallis P, et al. Lora: Low-rank adaptation of large language models[J]. ICLR, 2022, 1 (2): 3.

20
Li X L, Liang P. Prefix-tuning: optimizing continuous prompts for generation[PP/OL]. V1. arXiv (2021-01-01) [2025-09-10]. https://doi.org/10.48550/arXiv.2101.00190.

21
Gu T Y, Dolan-Gavitt B, Garg S. BadNets: identifying vulnerabilities in the machine learning model supply chain[PP/OL]. V2. arXiv (2019-03-11) [2025-09-10]. https://doi.org/10.48550/arXiv.1708.06733.

22
Dai J Z, Chen C S, Li Y F. A backdoor attack against LSTM-based text classification systems[J]. IEEE Access, 2019, 7, 138872- 138878.

DOI

23
Devlin J, Chang M W, Lee K, et al. Bert: Pre-training of deep bidirectional transformers for language understanding[C]//Proceedings of the 2019 conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (long and short papers) . 2019: 4171-4186.

24
钱慧, 刘亚志, 李伟, 等. 一种少样本类增量学习中的隐蔽性后门攻击方法[J]. 信息安全研究, 2025, 11 (9): 797- 806.

Qian H, Liu Y Z, Li W, et al. A covert backdoor attack method in few-shot class incremental learning[J]. Journal of Information Security Research, 2025, 11 (9): 797- 806.

25
顾欢欢, 李千目, 刘臻, 等. 基于虚假演示的隐藏后门提示攻击方法研究[J]. 信息网络安全, 2025, 25 (4): 619- 629.

DOI

Gu H H, Li Q M, Liu Z, et al. Research on hidden backdoor prompt attack methods based on false demonstrations[J]. Netinfo Security, 2025, 25 (4): 619- 629.

DOI

26
Li L Y, Song D M, Li X N, et al. Backdoor attacks on pre-trained models by layerwise weight poisoning[PP/OL]. V1. arXiv (2021-08-31) [2025-09-10]. https://doi.org/10.48550/arXiv.2108.13888.

27
Pan X, Zhang M, Sheng B, et al. Hidden trigger backdoor attack on NLP models via linguistic style manipulation[C]//31st USENIX Security Symposium (USENIX Security 22). 2022: 3611-3628.

28
Cai X, Xu H, Xu S, et al. Badprompt: Backdoor attacks on continuous prompts[J]. Advances in Neural Information Processing Systems, 2022, 35, 37068- 37080.

29
Yao H W, Lou J, Qin Z. PoisonPrompt: backdoor attack on prompt-based large language models[C]//Proceedings of the ICASSP 2024 - 2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). Piscataway: IEEE Press, 2024: 7745-7749.

30
Yang W K, Lin Y K, Li P, et al. Rethinking stealthiness of backdoor attack against NLP models[C]//Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 1: Long Papers). Stroudsburg, PA, USA: ACL, 2021: 5543-5557.

31
Du W, Yuan T X, Zhao H D, et al. NWS: natural textual backdoor attacks via word substitution[C]//Proceedings of the ICASSP 2024 - 2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). Piscataway: IEEE Press, 2024: 4680-4684.

32
Yang H M, Xiang K L, Ge M Y, et al. A comprehensive overview of backdoor attacks in large language models within communication networks[J]. IEEE Network, 2024, 38(6): 211-218.

33
Huang H, Zhao Z Y, Backes M, et al. Composite backdoor attacks against large language models[PP/OL]. V2. arXiv (2024-03-30) [2025-09-10]. https://doi.org/10.48550/arXiv.2310.07676.

34
Saravia E, Liu H T, Huang Y H, et al. CARER: contextualized affect representations for emotion recognition[C]//Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing. Stroudsburg, PA, USA: ACL, 2018: 3687-3697.

35
Zhang X, Zhao J B, LeCun Y. Character-level convolutional networks for text classification[C]//Proceedings of the 29th International Conference on Neural Information Processing Systems - Volume 1. New York: ACM, 2015: 649-657.

文章导航

/