学术研究

基于时间感知跨模态对齐的APT狩猎方法

  • 邓钰洋 ,
  • 朱尧虎 , *
展开
  • 中国人民公安大学信息网络安全学院,北京 100038
朱尧虎()。

网络出版日期: 2026-05-15

基金资助

国家自然科学基金(62076246);中国人民公安大学研究生科研创新一般项目(2026YJSKY028)

版权

版权所有©《网络空间安全科学学报》编辑部 2026

Temporal-aware cross-modal alignment method for APT hunting

  • Deng Yuyang ,
  • Zhu Yaohu , *
Expand
  • College of Information Network Security, People’s Public Security University of China, Beijing 100038, China

Online published: 2026-05-15

Copyright

Copyright ©2026 Journal of Aeronautical Materials. All rights reserved.

摘要

对基于溯源图的高级持续性威胁(advanced persistent threat,APT)追踪问题进行了研究,旨在解决多层攻击重构过程中标签不足、高层网络威胁情报(cyber threat intelligence,CTI)描述与底层审计事件因果关系之间存在语义鸿沟这两个核心问题。构建了名为ProvLang的时间感知跨模态对齐框架,通过将CTI报告与带类型标注及时间戳的溯源子图建立关联,实现面向搜索的威胁追踪。该框架采用双编码器架构,对溯源图侧引入时间异构图神经网络,对CTI侧引入安全领域专用文本编码器,并结合对比学习、匹配、掩码建模及时间因果对齐损失进行联合训练,以保证两种模态间层级顺序的一致性,同时设计两阶段搜索流程,支持粗粒度检索与细粒度重排序。基于DARPA透明计算数据集及CTI数据源的实验结果表明,该框架在跨模态搜索任务中能稳定提升性能,尤其在未知攻击流程与跨平台传播场景下表现更优,说明CTI驱动的威胁追踪具备超越人工构造查询图的实际应用价值与可行性。

本文引用格式

邓钰洋 , 朱尧虎 . 基于时间感知跨模态对齐的APT狩猎方法[J]. 网络空间安全科学学报, 2026 , 4(2) : 29 -49 . DOI: 10.20172/j.issn.2097-3136.260412

Abstract

Advanced persistent threat (APT) tracking based on provenance graphs was studied to address two major challenges in multilayer attack reconstruction: insufficient labels and the semantic gap between high-level cyber threat intelligence (CTI) reports and low-level causal audit events. A temporal-aware cross-modal alignment framework, named ProvLang, was developed to associate CTI reports with typed and time-stamped provenance subgraphs, thereby enabling search-based threat tracking. The framework adopted a dual-encoder architecture, in which a temporal heterogeneous graph neural network encoded provenance graphs and a security domain-specific text encoder represented CTI reports. The two modalities were jointly optimized through contrastive learning, matching, masked modeling, and a temporal causal alignment loss to preserve cross-modal semantic consistency and hierarchical order. A two-stage search pipeline was further designed to support coarse-grained retrieval and fine-grained re-ranking. Experiments were conducted on multiple transparent computing datasets from DARPA and real-world CTI sources. The results show that the framework consistently improves cross-modal search performance, particularly in scenarios involving unknown attack procedures and cross-platform propagation. The findings indicate that CTI-driven threat tracking based on temporal-aware cross-modal alignment is feasible in practice and can reduce dependence on manually constructed query graphs.

0 引言

高级持续性威胁(advanced persistent threat,APT)由资源充足且技术娴熟的攻击者实施,已成为现代机构与企业面临的最严峻网络安全挑战之一[1]。与传统“hit-and-run”式(即一次性)网络攻击不同,APT具有潜伏期长、隐蔽性极强以及多种攻击技术定制化组合的特征,其攻击过程贯穿整个杀伤链,涵盖从初始利用、载荷投递到横向移动,再到数据窃取与痕迹清理的全流程[2]。电网、工业控制系统、云原生企业网络等关键基础设施的持续数字化,进一步扩大了攻击面,使得APT活动能够在受害环境中持续潜伏数月甚至数年而不被发现[3]。这些特征使传统基于单点的安全防护方案在全面检测APT方面显得明显不足,每一个单独的攻击行为在孤立状态下都可能看似无害,只有将其与较长时间跨度内的其他行为进行关联分析,才能识别其恶意属性[4]
为应对这些挑战,基于内核级操作系统审计日志的溯源分析方法,作为一种具有原理支撑的APT检测与调查技术,已获得广泛关注[5]。溯源图将系统审计记录组织为有向图,其中,节点表示系统实体,有向边表示由系统调用触发、带有时间戳的因果交互关系[6]图1结合一个具体的APT场景对该范式进行了改进,将内核级审计事件组装为异构溯源图,该图包含进程、文件、网络地址和系统资源,各实体通过带类型的因果边连接,最终可映射为有序的ATT&CK(adversarial tactics, techniques, and common knowledge)技术链,从而实现精确的攻击重构。
图 1 基于溯源图的APT检测范式

Fig.1 Provenance-based APT detection paradigm

尽管基于溯源的APT检测方法已取得显著进展,但现有方法仍面临若干持续性挑战,这些挑战限制了其实际部署。首先,企业审计日志生成的溯源图增长速度极快,通常每天产生数据量可达数GB,且需长期持续保存,这带来了难以承受的存储与计算开销[7]。这种无界的图增长,再加上重复系统行为产生的冗余结构持续累积,导致真实环境中出现严重的可扩展性瓶颈[8]。其次,检测粒度存在根本性权衡,以Unicorn[9]为代表的图级方法通过分析整个系统快照进行检测,可能遗漏了淹没于海量良性活动中的攻击;而以ThreatTrace[10]为代表的节点—边级方法虽能实现更细粒度的检测,却会显著增加计算成本。第三,带标注的APT攻击样本稀缺,这构成了监督学习方法长期存在的瓶颈[11]。真实世界中的APT攻击属于罕见事件,对大多数组织而言,收集足够数量的真实攻击样本极其困难且成本高昂,此类数据的敏感性导致跨组织共享难以实现。即便是应用最广泛的基准数据集(如DARPA TC[12]),也仅包含少量模拟攻击场景,这使得训练能够泛化到新型攻击模式的模型变得极为困难。
网络威胁情报(cyber threat intelligence,CTI)报告为APT攻击行为知识提供了互补且持续增长的信息来源。CTI报告通常由安全厂商、政府机构和研究机构发布,采用自然语言描述攻击活动,详细说明威胁行为体所采用的战术、技术与过程(tactics, techniques, and procedures,TTP),且通常映射至MITRE ATT&CK框架[13]等标准化体系。基于这一潜力,近期一些威胁狩猎系统开始尝试利用CTI引导检测过程。文献[14]提出Poriot系统,该系统从CTI报告中人工构造查询图,并与溯源图执行图对齐操作。随后,DeepHunter[15]和MEGR-APT[16]等系统分别通过基于图神经网络(graph neural network,GNN)的图相似性模型,以及面向内存高效的子图提取方法,对该范式进行了改进。然而,一个根本性局限依然存在:从CTI报告中构建查询图在很大程度上仍是依赖专家的人工过程,难以扩展以适应已发布威胁情报数量的快速增长[17]。更为根本的是,这两种模态之间存在显著的语义鸿沟:CTI报告以高层自然语言叙事方式描述攻击,而溯源图则从编码系统调用层面的底层因果关系。现有方法中很少有能提供一种有原则的框架,以自动弥合该鸿沟。
除语义鸿沟外,APT攻击的时间维度还引入了现有方法未能充分应对的额外复杂性。APT活动以有序的攻击阶段序列展开,从初始访问、横向移动到数据窃取与痕迹清理。该时间顺序既隐式编码于溯源图带时间戳的边中,也体现于CTI报告的序列化叙事结构中[18]。然而,现有威胁狩猎系统通常将溯源图视为静态结构,忽略了溯源图边时间戳中蕴含的丰富时间信息。KAIROS[19]通过应用时间图表示学习,同时建模审计日志中的结构依赖与时间依赖,是一项值得关注的进展,但其作为异常检测器而非跨模态检索系统运行,无法直接利用CTI描述狩猎特定攻击模式。类似地,近年来一些将大语言模型(large language model,LLM)引入基于溯源的入侵检测的研究工作[20]表明,整合外部知识有助于增强威胁推理能力,但这类方法依赖运行时LLM推理,且无法生成用于高效跨模态检索的可复用跨模态表示。
为应对上述挑战,本文提出了一种面向跨模态检索式APT狩猎的时间感知跨模态对齐框架,被命名为ProvLang,用于弥合CTI报告与系统级溯源图之间的语义鸿沟。
本文的主要贡献如下。
1)提出了T-HGNN(time-heterogeneous graph neural network),一种集成HGT(heterogeneous graph transformer)层、可学习函数式时间编码及TGN(temporal graph network)风格GRU(gated recurrent unit)时间记忆的时间异构图神经网络[21],专门用于编码带时间戳边的类型化溯源图。不同于以往将溯源边视为同构且无时间性的GNN编码器[22],T-HGNN可同时捕获异构类型语义与细粒度时间动态,这对于区分多阶段APT模式至关重要。
2) 设计了包含5种互补训练目标:图—文本对比学习(GTC)、图—文本匹配(GTM)、掩码图建模(MGM)、掩码语言建模(MLM)、时间因果对齐(TCA)的跨模态对齐框架。其中,时间因果对齐损失是一项新贡献,可约束不同模态间攻击阶段时间顺序的一致性,弥补了以往工作尚未探索的对应维度[23]
3)实现了一个完整的跨模态检索式威胁狩猎流水线,采用两阶段检索策略,并结合LLM辅助的CTI去噪方法。本文分别在已见技术、未见技术和跨平台迁移3种设置下进行了全面评估,结果表明该框架具有实际部署可行性[24]

1 相关工作

相关工作分为4个部分:基于溯源图的APT检测、基于网络流量的威胁狩猎、基于LLM的APT检测以及跨模态表示学习。

1.1 基于溯源图的APT检测

何厚翰等[25]提出了一种多维边优化策略,将K-hop子图采样与边特征工程相结合,并在图注意力网络(graph attention network,GAT)中构建混合注意力机制,以应对由系统事件类型多样性引起的数据稀疏问题;该方法在缩减溯源图规模的同时,相较于R-GCN等传统关系型GNN,显著提升了检测精度。高新成等[26]设计了一种异构溯源图方法,将异构图Transformer与动态多模态高斯混合模型相结合,并在互注意力模块中嵌入结构—意图双重注意力和攻击时间序列。在StreamSpot数据集上的实验表明,其准确率和F1值均超过98%。KAIROS[19]采用时间图表示学习,同时建模结构依赖与时间依赖,并生成紧凑的攻击摘要图供分析人员调查。现有基于溯源的检测器尽管取得了这些进展,但无论在图级、路径级还是节点级运行,在很大程度上仍局限于训练阶段所见的攻击模式,且无法直接利用外部发布的威胁情报狩猎此前未见的攻击。

1.2 基于网络流量的威胁狩猎

除主机级溯源分析外,网络流量分析也是APT检测的重要方向之一,尤其适用于难以在资源受限设备上部署主机审计代理的场景。一项关于APT信标检测技术的系统性综述[27]指出,网络流分析、基于特征的匹配以及基于图的关联是最常采用的三类方法,而KNN(K nearest neighbors)和SVM(support vector machine)是APT检测方案中最常用的机器学习算法。针对如何从网络流量中构建完整行为画像的挑战,Do等[28]提出了FIERL模型,将双向长短期记忆网络(bidirectional long short-term memory,BiLSTM)与注意力网络相结合,用于对APT IP行为进行智能特征提取;并通过基于Dropout的数据生成与对比学习,应对严重类别不平衡条件下的分类问题,实现了84%~91%的APT攻击预测精度。在网络边界侧,APTSniffer[29]将基于检索增强生成(retrieval-augmented generation,RAG)的大语言模型用于APT流量检测,结果表明,对网络载荷进行语义推理能够识别规避传统基于特征方法的复杂C2(command and control)通信模式。从攻防博弈建模的角度,Xiao等[30]基于累积前景理论构建了APT检测博弈模型,利用概率加权函数和价值扭曲函数刻画主观攻击者在不确定攻击持续时间下的决策偏差,并推导了相应的纳什均衡条件。结果表明,攻击者的风险偏好随参考框架的变化而改变。该工作进一步提出了基于策略爬山算法的强化学习检测方案,通过引入策略随机性,增加攻击者的决策难度。

1.3 基于LLM的APT检测

近年来,为克服传统检测器对已知攻击模式的依赖、提升对外部威胁情报的利用率,大语言模型被引入APT检测领域。Cheng等[20]提出了一种知识驱动的溯源检测方法Omnisec,利用检索增强生成的行为提示小样本推理能力,通过检索模块获取相似攻击模式并将其转化为自然语言示例,在多个APT数据集上实现了超过97%的F1值。此外,Hu等[31]采用基于BERT的预训练模型对系统日志进行深度语义分析,通过WordPiece分词和上下文建模捕获节点及其操作的复杂关联,为变分自编码器提供高质量的特征表示,显著降低了检测误报率。这些研究表明,LLM凭借其强大的语义理解与知识融合能力,正成为连接底层审计数据与高层威胁情报的关键桥梁。

1.4 跨模态表示学习

CLIP(contrastive language-image pre-training)和BLIP(bootstrapping language-image pre-training)等跨模态模型表明,对比目标与匹配目标能够将异构模态对齐到共享嵌入空间中。Omnisec方法[20]将LLM推理与溯源图分析相结合,但依赖运行时推理,而非学习可迁移的跨模态表示。Zhou等[23]提出了一种基于告警关联的APT重构方法,利用蒙特卡罗树搜索(Monte Carlo tree search,MCTS)和ATT&CK知识搜索缺失的攻击步骤,说明了外部知识整合的价值,但其实现方式为离散搜索,而非连续的跨模态嵌入。Sun等[24]进一步研究了从CTI报告构建知识图谱的方法,通过实体抽取与图推理将非结构化威胁描述转化为结构化安全知识。Singh等[2]和Stellios等[3]的综述均指出,APT检测需要综合利用网络流量、主机日志和外部威胁情报等异构信息源。然而,现有方法多侧重于知识抽取、告警关联或离散搜索,尚未提出面向CTI文本与溯源图的跨模态对齐方法。

2 方法设计

本节介绍了一种基于时间感知跨模态对齐的APT威胁狩猎方法ProvLang。其核心挑战在于弥合CTI报告与溯源图之间的语义鸿沟:前者以高层自然语言描述攻击活动,后者则通过带时间戳的边编码系统调用层面的底层因果关系。ProvLang通过一种双编码器架构、5种互补的对齐目标以及一个两阶段检索流水线来应对该挑战。

2.1 整体架构

图2所示,整体架构由两个编码分支和一个跨模态投影模块构成。上分支通过T-HGNN对溯源子图进行编码,得到$ {\boldsymbol{h}}_{G} $;下分支通过SecBERT对CTI文本进行编码,得到$ {\boldsymbol{h}}_{T} $。二者均被投影到共享的256维空间中,表示为$ {\boldsymbol{z}}_{G} $$ {\boldsymbol{z}}_{T} $
图 2 ProvLang整体架构

Fig.2 Overall architecture of ProvLang

形式化地,设$ \mathcal{G}={G}_{1},\cdots ,{G}_{N} $表示一个溯源子图语料库,$ \mathcal{T}={T}_{1},\cdots ,{T}_{M} $表示一个 CTI 段落语料库。每个子图$ {G}_{i}=(\mathcal{V}i,\mathcal{E}i,\phi ,\psi ,\tau ) $是一个带类型、带时间戳的有向图。其中,$ \phi \colon \mathcal{V}i\rightarrow \mathcal{A} $将节点映射到五类实体类型,$ \mathcal{A}=\mathrm{PROCESS},\,\mathrm{FILE},\,\mathrm{NETFLOW},\,\mathrm{SRCSINK},\,\mathrm{MEMORY} $$ \psi \colon \mathcal{E}i\rightarrow \mathcal{R} $将边映射到20种系统调用类型。20种系统调用类型如表1所示。$ \tau \colon \mathcal{E}i\rightarrow {\mathbb{R}}^{+} $为边赋予时间戳。目标是学习编码器$ {f}_{G}\colon G\mapsto \boldsymbol{z}G\in {\mathbb{R}}^{d} $$ {f}_{T}\colon T\mapsto {\boldsymbol{z}}_{T}\in {\mathbb{R}}^{d} $,使得匹配样本对在共享空间中具有较高相似性,从而实现跨模态检索。
表 1 系统调用类型对应表

Table 1 Correspondence Table of System Call Types

类别 边类型 系统调用示例 语义描述
进程管理 FORK fork() 父进程创建子进程
CLONE clone() 以共享内存方式创建子
进程/线程
EXECUTE execve() 进程加载并执行新程序镜像
EXIT exit_group() 进程正常或异常终止
SIGNAL kill() 进程间信号传递
文件操作
READ read() 进程从文件/设备读取数据
WRITE write() 进程向文件/设备写入数据
OPEN open() 进程打开文件描述符
CLOSE close() 进程关闭文件描述符
RENAME rename() 修改文件/目录路径名称
UNLINK unlink() 删除文件系统目录项
CHMOD chmod() 修改文件/目录访问权限
TRUNCATE ftruncate() 截断文件至指定长度
内存管理 MMAP mmap() 将文件/设备映射到进程
地址空间
MPROTECT mprotect() 修改内存区域保护属性
网络通信 CONNECT connect() 发起到远程主机的网络连接
SEND sendto() 通过套接字发送数据
RECV recvfrom() 通过套接字接收数据
BIND bind() 将套接字绑定到本地地址/端口
ACCEPT accept() 接收入站网络连接请求

2.2 LLM辅助CTI去噪

由安全厂商和研究机构发布的原始CTI报告通常包含大量与攻击行为描述无关的噪声信息(机构模板性文字、法律免责声明、分析师评论以及格式伪影),这类噪声会降低SecBERT编码器所学习文本表示的质量,因为模型在训练过程中可能会关注缺乏信息量的标记。为解决该问题,ProvLang引入了一个LLM辅助预处理步骤,用于从原始CTI文本中提取结构化攻击描述。如图3所示,该去噪流程由3个阶段组成。
图 3 LLM辅助CTI去噪流程

Fig.3 LLM-assisted CTI denoising pipeline

第一阶段,将混杂了技术内容与噪声的原始CTI报告通过少样本提示模板输入LLM。该提示对LLM输出施加了3个关键结构约束。
1)每个识别出的攻击阶段必须映射到特定的MITRE ATT&CK技术,并分配一个唯一的phase_order整数,以保持攻击的时间序列;
2)入侵指标(indicators of compromise,IOC),如IP地址、文件哈希和域名,必须被显式提取,并与其对应的攻击阶段相关联;
3)causal_chain字段必须刻画战术的端到端排序。
causal_chain的生成与约束通过以下三层机制保证端到端时序一致性。
1)提示层约束。少样本提示模板中包含3个示范样例。模板规定:causal_chain必须为phase_order编号的有序列表,如[1, 2, 3, 4]。若报告描述并行路径,则以嵌套列表表示偏序关系,如[1, [2, 3], 4]表示阶段2和3可并行,但均依赖阶段1且先于阶段4。
2)输出格式约束。要求LLM输出严格遵循预定义的JSON Schema。causal_chain字段的schema定义为整数数组,元素值必须是已定义phase_order的子集。
3)后处理校验。对LLM输出执行三项自动校验。
①完整性检查:phase_order编号是否覆盖所有已识别攻击阶段;
②无环检查:转换为有向图后验证是否为DAG;
③一致性检查:顺序是否与描述中的时间线索词一致。未通过校验的输出以不同随机种子重新生成,最多重试3次。若仍不通过则降低其TCA损失权重至0.5。该降权值基于经验设定:完全丢弃权重为0,会浪费已正确抽取的阶段排序信息;而保持原权重,则会让未通过校验的噪声标注干扰TCA损失的梯度方向。0.5作为折中选择在初步实验中未观察到显著的性能波动。
第二阶段,LLM生成符合上述约束的结构化JSON输出。由于LLM在抽取过程中可能引入幻觉,即生成原文不存在的攻击步骤或产生遗漏,即忽略关键特征。因此,提示模板中显式规定“仅从原文提取,不得推断”并配以正反面示例。输出校验阶段进一步要求:IOC须在原文中可溯源(字符串匹配);ATT&CK标签须属v14.1有效范围;phase_order须连续无重复。
对200条随机抽样的去噪输出进行人工审查,结果显示:幻觉条数为9,幻觉率为4.5%,主要为子技术编号偏差;遗漏条数为14,遗漏率为7.0%,集中于攻击清理阶段。由于遗漏集中于攻击清理阶段,例T1070.004 File Deletion,而该阶段在溯源图中通常表现为unlink/truncate等少量边,即使CTI侧缺失对应描述,图编码器仍可通过MGM自监督目标学习到这些边的结构语义;此外,后文案例分析进一步验证,ProvLang仍能在Top-3内以0.6551的相似度检索到文件删除相关子图。因此,7.0%的遗漏对整体检索性能的影响有限,但对清理阶段的召回存在潜在风险,后续可通过补充清理阶段专用的CTI语料或对遗漏阶段进行针对性数据增强加以缓解。
第三阶段,将所有抽取出的攻击阶段的描述字段按照phase_order进行拼接,形成供SecBERT编码器使用的去噪CTI输入$ {T}_{\mathrm{clean}} $;与此同时,causal_chain为TCA损失的计算提供显式的阶段排序监督。该去噪步骤是可选的。当使用已经过整理的CTI 来源,如MITRE TRAM中带技术标签的句子或ATT&CK STIX技术描述时,这些来源本身已包含聚焦且无噪声的攻击描述,因此可以跳过该步骤,而不会导致显著的性能下降。

2.3 溯源图构建与压缩

原始DARPA TC E3数据集由内核级审计日志构成,这些日志以CDM(common data model)格式序列化为JSON或Avro记录。每条记录描述一个系统事件,如进程派生子进程、文件被读取或网络连接被建立并附带相关元数据(时间戳、主体标识符和对象属性)。这些记录被解析为异构有向图$ G= (\mathcal{V},\mathcal{E},\phi ,\psi ,\tau ) $。其中,节点表示系统实体,边表示实体之间的因果交互。
然而,企业级溯源图会迅速增长,通常每天生成数百万条边,并且包含由周期性日志轮转和库加载等重复系统行为带来的大量冗余。为保留攻击检测所必需因果结构的同时解决图爆炸问题,采用了因果时间压缩策略。因为在短时间窗口内,同一对实体之间连续发生的同类型交互,通常表示一次逻辑操作,而非彼此独立的因果事件。因此,对于由同类型$ r $的边连接的每个有序节点对$ (u,v) $,将所有时间戳落入60 s窗口内的边合并为一条代表性边。
形式化地,定义$ {E}_{u,v,r}=\{e\in \mathcal{E}\mid \mathrm{src}(e)=u,\mathrm{dst}(e)= v, \psi (e)=r\} $为从$ u $$ v $且类型为$ r $的所有边的集合。代表性边保留最早时间戳作为因果锚点:
$\begin{split} & {{\mathrm{Merge}}}({E}_{u,v,r})=\{{e}^{*}\mid \tau ({e}^{*})=\\&{\min }_{e\in {{E}_{u,v,r}}}\tau (e), \forall {e}_{j},{e}_{k}\in {E}_{u,v,r}\colon |\tau ({e}_{j})-\tau ({e}_{k})|\leqslant W\} \end{split}$
这种压缩在3个数据集上可将图的总规模缩减约70%~80%,同时保留所有不同的因果关系及其时间顺序。压缩后的图保留了相同的异构结构,即5类节点类型和20类边类型,边数量显著减少。
随后,从压缩图中通过以已知攻击相关节点为种子的 BFS(breadth-first search)3跳扩展提取训练子图。为防止子图过大而使GNN处理在计算上难以承受,设置最大节点数为200。设$ {v}_{\mathrm{seed}} $表示一个攻击相关种子节点,则提取的子图为:
$ {G}_{\mathrm{sub}}=\mathrm{BFS}({v}_{\mathrm{seed}},\mathrm{hops}=3,\mathrm{max}\_ \mathrm{nodes=200}) $
这种设置的种子策略,确保了每个训练子图都以攻击相关活动为中心,同时也能纳入周围的良性上下文,这对于模型学习能够区分恶意模式与正常系统行为的判别性表示至关重要。
“良性上下文”的判定依据DARPA TC数据集提供的真实标注(ground-truth annotations)。以标注的攻击实体为种子进行BFS 3跳扩展后,节点分为两类,攻击节点和良性上下文节点。①攻击节点:在真实标注中被标记为攻击相关的实体,如恶意进程backdoor.exe、C2服务器IP等;②良性上下文节点:不在攻击标注中,但与攻击节点存在1~3跳因果路径的正常实体,如系统服务进程svchost.exe、共享库文件/lib/libc.so等。这种混合构建方式确保模型学习到攻击模式与正常行为的边界特征。推理阶段不依赖种子标注,而是通过跨模态检索匹配。
下面阐述图—文本对构建。
图—文本对构建包含4个步骤:①子图文本化,将节点名称和边类型标签拼接为文本文档。②ATT&CK标注,利用TC文档为子图标注技术标签集合,CTI段落同理。③TF-IDF向量计算,在合集上构建词汇表并计算向量。④双条件匹配,技术标签交集非空且TF-IDF余弦相似度不小于0.3。
表2所示,为构建连接溯源子图与CTI描述的训练对,采用TF-IDF匹配过程。利用DARPA TC数据集文档为每个提取出的攻击子图标注其真实ATT&CK技术标签。聚合语料库中的每个CTI段落也被标注其对应的ATT&CK技术。随后,分别为子图的文本元数据和每个CTI段落计算TF-IDF向量。最后,将与CTI段落共享至少一个ATT&CK技术且余弦相似度阈值超过0.3的子图与之匹配,形成图−文本对。
表 2 图—文本对构建统计与质量评估

Table 2 Graph-text pair construction statistics and quality assessment

指标 Theia Cadets Trace
攻击子图/个 1247 983 1534
匹配的CTI段落/个 3842 2917 4203
图—文本对/个 4612 3405 4830

2.4 时间异构图神经网络

T-HGNN编码器是ProvLang在图侧的核心组件,旨在捕获溯源子图的3个关键特征:①反映不同系统实体和交互的异构节点类型与边类型;②编码在边时间戳中的细粒度时间动态;③跨越多个攻击阶段的长程时间依赖。
图4所示,该编码器在3个阶段顺序运行。节点特征编码、时间HGT消息传递以及图级池化。
图 4 基于时间HGT的框架概览

Fig.4 Overview of the proposed temporal HGT-based framework

2.4.1 阶段1:节点特征编码

在溯源图中,每个节点由两个离散属性表征:实体类型和系统级名称。为将这些离散属性转换为适合神经网络处理的连续特征向量,设计了一种双嵌入方案。
对于每个节点$ v\in \mathcal{V} $,令$ \phi (v)\in \mathcal{A} $表示实体类型。维护一个可学习的类型嵌入表$ {{E}}_{\mathrm{type}}\in {\mathbb{R}}^{|\mathcal{A}|\times {{d}_{e}}} $。其中,$ |\mathcal{A}|=5 $为实体类型的数量,$ {d}_{e} $为嵌入维度。类型嵌入$ {{\boldsymbol{e}}}_{\mathrm{type}}^{(v)}={{E}}_{\mathrm{type}}[\phi (v)] $用于捕获实体的语义类别。对于节点名称,由于系统级名称的词表是无界的,采用基于哈希的嵌入方法。通过确定性哈希函数将节点名称字符串映射到固定大小的桶索引,再由一个可学习的嵌入表$ {{E}}_{\mathrm{name}}\in {\mathbb{R}}^{B\times {{d}_{e}}} $将该索引映射为连续向量$ {{\boldsymbol{e}}}_{\mathrm{name}}^{(v)} $。随后,将这两种嵌入进行拼接,并输入一个类型特定的MLP,以生成初始节点表示:
$ \boldsymbol{h}_{v}^{(0)}={\mathrm{MLP}}_{\phi (v)}\left({{\boldsymbol{e}}}_{\mathrm{type}}^{(v)}\oplus {{\boldsymbol{e}}}_{\mathrm{name}}^{(v)}\right)\in {\mathbb{R}}^{d} $

2.4.2 阶段 2:时间HGT消息传递

T-HGNN的核心由3个堆叠的HGT层组成,并通过时间调制机制进行增强。标准GNN消息传递将所有边同质化处理,并忽略交互发生的时间。然而,在溯源图中,交互的类型和交互发生的时刻都携带了区分攻击模式所必需的关键信息。时间HGT层通过类型特定线性投影和函数式时间编码机制,同时建模这两个维度。
(1)类型特定性投影
对于第$ \ell $个HGT层中的每条边$ (u,v)\in \mathcal{E} $,令$ r= \psi (u,v) $表示边类型,$ s=\phi (u) $表示源节点类型,$ s=\phi (u) $表示目标节点类型。不同于标准Transformer对所有输入共享投影矩阵,HGT根据源节点和目标节点类型分别计算Query、Key和Value投影,这使模型能够学习类型特定的注意力模式。
PROCESS节点以式(4)区别性地关注FILE邻居与NETFLOW邻居:
$ \begin{split} &{Q}^{(\ell)}(v)=\boldsymbol{W}_{Q,t}^{(\ell)}\cdot \boldsymbol{h}_{v}^{(\ell-1)}\\& {K}^{(\ell)}(u)=\boldsymbol{W}_{K,s}^{(\ell)}\cdot \boldsymbol{h}_{u}^{(\ell-1)}\\&{V}^{(\ell)}(u)=\boldsymbol{W}_{V,s}^{(\ell)}\cdot \boldsymbol{h}_{u}^{(\ell-1)}\end{split} $
其中,$ \boldsymbol{W}_{Q,t}^{(\ell)},\boldsymbol{W}_{K,s}^{(\ell)},\boldsymbol{W}_{V,s}^{(\ell)}\in {\mathbb{R}}^{d\times d} $为类型特定的可学习权重矩阵。Query矩阵下标中的$ t $以及Key/Value矩阵下标中的$ s $反映出:Query从目标节点视角计算(即目标节点需要的信息),而Key和Value从源节点视角计算(即源节点能够提供的信息)。
(2)函数式时间编码机制
为将时间信息引入注意力计算,设计了一种函数式时间编码,将每条边的时间戳$ \tau (u,v) $映射为一个$ d $维向量,该向量由可学习余弦基函数构成。边$ (u,v) $的时间编码定义为:
$ \begin{split} &{{\mathrm{TE}}}(\tau )=\\&\left[\cos ({\omega }_{1}\cdot \tau +{b}_{1}), \cos ({\omega }_{2}\cdot \tau +{b}_{2}), \cdots , \cos ({\omega }_{d}\cdot \tau +{b}_{d})\right]\in {\mathbb{R}}^{d}\end{split} $
其中,$ \{{\omega }_{i},{b}_{i}\}_{i=1}^{d} $为可学习的频率和相位参数。不同于标准Transformer中使用的固定位置编码,这些可学习参数使模型能够自适应地捕获多时间尺度上的时间模式。从秒级进程执行模式到小时级C2通信周期性,这些都是不同APT攻击阶段的典型特征。
(1)时间调制注意力
Key向量同时受到边类型特定关系矩阵$ \boldsymbol{W}_{r}^{\mathrm{attn}}\in {\mathbb{R}}^{d\times d} $和时间编码的调制,从而使注意力机制能够联合推理发生了何种类型的交互以及交互发生于何时。设注意力头数$ H=4 $,则边$ (u,v) $的注意力得分计算为:
$ {\alpha }^{(\ell)}(u,v)=\frac{{Q}^{(\ell)}{(v)}^{\top }\left(\boldsymbol{W}_{r}^{\mathrm{attn}}\cdot {K}^{(\ell)}(u)+\mathrm{TE}(\tau (u,v))\right)}{\sqrt{d/H}} $
经过关系变换的Key与时间编码的加性组合,可确保在时间上相近且类型相同的交互获得更高的注意力权重,这对于捕获攻击阶段内部的序列依赖至关重要。对所有邻居的注意力得分计算完成后,依次执行SoftMax归一化、消息聚合和残差连接节点更新:
$ {\alpha }^{(\ell)}(\cdot ,v)=\mathrm{Softmax}\left({\alpha }^{(\ell)}(\cdot ,v)\right) $
$ {\boldsymbol{m}}_{v}=\sigma \left(\sum \limits_{u\in \mathcal{N}(v)}{\alpha }^{(\ell)}(u,v)\cdot {V}^{(\ell)}(u)\right) $
$ \boldsymbol{h}_{v}^{(\ell)}=\mathrm{LayerNorm}\left({\boldsymbol{m}}_{v}+\boldsymbol{h}_{v}^{(\ell-1)}\right) $
其中,$ \mathcal{N}(v) $表示节点$ v $的邻居集合,$ \sigma $表示逐元素施加于聚合消息的sigmoid激活函数,而LayerNorm用于稳定跨异构节点类型的训练过程。
(2)TGN记忆模块
在最后一层HGT之后,引入TGN记忆模块,以捕获超出堆叠GNN层感受野的长程时间依赖。对于每个节点$ v $,GRU维护一个持久记忆状态$ \boldsymbol{s}_{v}^{(t)} $,并在每次处理涉及节点$ v $的新信息时进行更新:
$ \boldsymbol{s}_{v}^{(t)}=\mathrm{GRU}\left(\boldsymbol{s}_{v}^{(t-1)}, \boldsymbol{h}_{v}^{(L)}\oplus \mathrm{TE}(t)\right) $
GRU 的输入是节点最终层表示$ \boldsymbol{h}_{v}^{(L)} $与当前时间编码$ \mathrm{TE}(t) $的拼接,而先前的记忆状态$ \boldsymbol{s}_{v}^{(t-1)} $作为当前隐状态。该机制对于基于溯源的威胁检测尤为重要,因为APT攻击往往涉及长期运行的进程,这些进程会跨多个由数小时或数天间隔分隔的攻击阶段持续参与,仅依靠局部消息传递难以捕获这种时间跨度。

2.4.3 阶段3:图级池化与子图表示生成

经过多层时间HGT消息传递和TGN记忆更新后,每个节点获得融合类型语义、时间信息和长程依赖的最终表示。由于攻击相关节点在溯源子图中通常较为稀疏,本文采用门控注意力池化而非简单平均池化生成图级表示。具体而言,首先根据节点最终表示计算其重要性权重,再对所有节点表示进行加权求和,得到子图级表示hG。随后,hG通过图侧投影头映射到共享跨模态空间,得到归一化图嵌入zG。该设计使模型能够在大量良性上下文节点中突出与攻击链相关的关键节点,从而提高图—文本匹配与跨模态检索性能。

2.5 跨模态对齐框架

跨模态对齐框架是ProvLang的核心训练机制,负责学习一个共享嵌入空间,使语义匹配的溯源子图与CTI描述在该空间中彼此接近,而不匹配的样本对彼此远离。两个编码器的输出首先分别通过带有L2归一化的独立MLP投影到共享空间中:
$ {\boldsymbol{z}}_{G}=\mathrm{L2Norm}\left({\mathrm{MLP}}_{G}({\boldsymbol{h}}_{G})\right), {\boldsymbol{z}}_{T}=\mathrm{L2Norm}\left({\mathrm{MLP}}_{T}({\boldsymbol{h}}_{T})\right) $
该框架包含5个互补的损失函数,每个损失针对跨模态对应关系的一个不同方面。

2.5.1 GTC

GTC损失是主要的对齐目标。对于一个包含$ B $个匹配图—文本对的小批量$ \{({\boldsymbol{z}}_{{{G}_{i}}},{\boldsymbol{z}}_{{{T}_{i}}})\}_{i=1}^{B} $,每个正样本对$ ({G}_{i},{T}_{i}) $描述相同的攻击行为,而批内其余$ B-1 $个样本对作为批内负样本。该损失鼓励每个图与其匹配文本最相似,反之亦然:
$ {\mathcal{L}}_{\mathrm{GTC}}=-\frac{1}{2B}\displaystyle\sum \limits_{i=1}^{B}\left[\log \frac{\exp (\boldsymbol{z}_{{G}_{i}}^{\top }{\boldsymbol{z}}_{{{T}_{i}}})}{\displaystyle\sum \limits_{j=1}^{B}\exp (\boldsymbol{z}_{{G}_{i}}^{\top }{\boldsymbol{z}}_{{{T}_{j}}})}+\log \frac{\exp (\boldsymbol{z}_{{T}_{i}}^{\top }{\boldsymbol{z}}_{{{G}_{i}}})}{\displaystyle\sum \limits_{j=1}^{B}\exp (\boldsymbol{z}_{{T}_{i}}^{\top }{\boldsymbol{z}}_{{{G}_{j}}})}\right] $
这种对称形式保证了双向对齐,图可以检索相关文本,文本也可以检索相关图。

2.5.2 GTM

GTC侧重于全局嵌入相似度,而GTM损失通过一个二分类器提供细粒度匹配能力,从而捕获仅靠余弦相似度难以识别的细微对齐模式。一个两层MLP分类器以图嵌入和文本嵌入的拼接作为输入,预测它们是否构成匹配对:
$ {\mathcal{L}}_{\mathrm{GTM}}=-\frac{1}{2B}\sum \limits_{i=1}^{2B}\left[{y}_{i}\log {p}_{i}+(1-{y}_{i})\log (1-{p}_{i})\right] $
其中,$ {p}_{i}=\mathrm{Sigmoid}\left({\mathrm{MLP}}_{\mathrm {GTM}}([{\boldsymbol{z}}_{\mathrm{G}};{\boldsymbol{z}}_{\mathrm{T}}])\right) $为预测的匹配概率,$ {y}_{i}\in 0,1 $为真实标签。为提升分类器的判别能力,采用难负样本挖掘策略。对于每个正样本对$ ({G}_{i},{T}_{i}) $,负图选为与$ {T}_{i} $具有最高对比相似度的图,同样地,负文本也按对应方式选取。

2.5.3 MGM

MGM损失是施加于图编码器上的自监督目标,旨在促使其学习鲁棒的结构表示。训练过程中,每个子图中30%的节点被随机选中,其输入特征被一个可学习的[MASK]嵌入替代。随后训练模型根据周围图上下文重构被掩码节点的类型及其原始特征:
$ {\mathcal{L}}_{\mathrm{MGM}}=\frac{1}{|\mathcal{M}|}\sum \limits_{v\in \mathcal{M}}\left[-\log p(\phi (v)\mid {\widehat{\boldsymbol{h}}}_{v})+{\lambda }_{\mathrm{feat}}\| {\widehat{\boldsymbol{h}}}_{v}-\boldsymbol{h}_{v}^{(0)}{\| }^{2}\right] $
其中,$ \mathcal{M} $表示被掩码节点集合,$ {\widehat{\boldsymbol{h}}}_{v} $为模型对被掩码节点$ v $的输出表示,$ p(\phi (v)\mid {\widehat{\boldsymbol{h}}}_{v}) $表示通过分类头预测正确节点类型的概率,$ \boldsymbol{h}_{v}^{(0)} $为原始未掩码特征向量,$ {\lambda }_{\mathrm{feat}} $用于平衡类型分类与特征重构目标。第一项确保模型能够从结构上下文中推断实体类型。

2.5.4 MLM

MLM损失是MGM在文本侧的对应形式,遵循标准BERT掩码语言建模公式。训练过程中,每个CTI输入中的15%标记被随机选中,其中的80%被[MASK]替换,10% 替换为随机标记,10% 保持不变。模型被训练为预测每个被掩码位置上的原始标记:
$ {\mathcal{L}}_{\mathrm{MLM}}=-\frac{1}{|{\mathcal{M}}_{T}|}\sum \limits_{i\in {\mathcal{M}}_{T}}\log p({w}_{i}\mid {\boldsymbol{h}}_{\backslash i}) $
其中,$ {\mathcal{M}}_{T} $为被掩码标记位置集合,$ {w}_{i} $为位置$ i $的原始标记,$ {\boldsymbol{h}}_{\backslash i} $表示由所有未被掩码的周围标记计算得到的该位置上下文化表示。该目标增强了编码器对安全领域词汇及上下文关系的理解能力。

2.5.5 TCA

TCA损失旨在解决前4种损失未能覆盖的一种跨模态对应维度,攻击阶段的时间顺序。APT活动以有序的攻击阶段序列展开,从初始访问,到持久化、横向移动,再到数据窃取,这种时间顺序隐式编码于两种模态中。在溯源图中,通过边时间戳体现;在CTI报告中,则通过序列化叙事结构体现。
为计算TCA损失,将两种模态都划分为$ S $个按时间排序的阶段。对于溯源图,根据边时间戳将边划分到$ S $个等时长时间桶中,并通过池化第$ s $个时间桶内所涉及节点的表示,计算阶段级表示$ \boldsymbol{z}_{G}^{(s)} $。对于CTI文本,将文本划分为$ S $个顺序片段,并以第$ s $个片段的[CLS]表示作为$ \boldsymbol{z}_{T}^{(s)} $。随后,TCA损失强制图的第$ s $阶段应比任何更晚的阶段$ s' $与文本的第$ s $阶段更相似,采用基于间隔的排序形式:
$\begin{split} \mathcal{L}_{\mathrm{TCA}}= & \frac{1}{S(S-1) / 2} \sum_{1 \leqslant s<s^{\prime} \leqslant S} \max \\&\left(0,-\left({{\mathrm{sim}}}\left(\boldsymbol{z}_G^{(s)}, \boldsymbol{z}_T^{(s)}\right)-{{\mathrm{sim}}}\left(\boldsymbol{z}_G^{(s)}, \boldsymbol{z}_T^{\left(s^{\prime}\right)}\right)\right)+\delta\right)\end{split}$
其中,$ \mathrm{sim}(\cdot ,\cdot ) $表示余弦相似度,$ \delta $为间隔超参数。该损失遍历所有$ S(S-1)/2 $个有序阶段对,只要时间对齐约束被违反且超出间隔$ \delta $,就会产生惩罚。直观上,这保证了溯源子图的初始访问阶段与CTI报告中的初始访问描述对齐,而不是与数据窃取描述对齐,从而在不同模态之间保留因果时间结构。

3 实验设计

3.1 实验设置

3.1.1 数据集

在DARPA TC E3数据集的3个攻防场景上对ProvLang进行评估[12]。该数据集是基于溯源的APT检测中应用最广泛的基准数据集之一。每个场景均在真实企业环境中模拟多阶APT活动,其中,红队执行攻击操作,同时并行运行良性活动。表3总结了经过因果时间压缩后DARPA TC E3数据集的关键统计信息。
表 3 因果时间压缩后 DARPA TC E3 数据集统计信息

Table 3 Statistics of DARPA TC E3 datasets after causal temporal compression

数据集 平台 攻击类型 原始
边数
压缩后
边数
压缩
比例
子图
数量
Theia Ubuntu 16.04 C2,数据窃取 1.3×107 3.1×106 76% 1 247
Cadets FreeBSD 12.0 后门,横向 9×106 2.5×106 72% 983
Trace Ubuntu 16.04 多阶段APT 1.7×107 3.6×106 79% 1 534
Theia数据集采集自一台Ubuntu 16.04主机,该主机遭受了通过受感染浏览器实施的C2通信和数据窃取攻击。Cadets数据集采集自一台FreeBSD 12.0服务器,攻击者通过部署后门且实施了横向移动。Trace数据集则生成于Ubuntu 16.04环境,遭受了一次复杂的多阶段APT攻击,涉及利用、权限提升、持久化和数据窃取。
对于CTI报告,聚合了4个公开可用来源:MITRE TRAM[32]、CTI-HAL[33]、ATT&CK STIX[34]和APT Notes[35],总计8 841个段落,覆盖245种ATT&CK技术。
本文使用的CTI数据来自4个不同来源,各来源在文本风格、长度和详细程度上存在显著差异。MITRE TRAM提供高度结构化的短句描述,每条段落平均仅35词,但与ATT&CK技术标签严格一一对应;ATT&CK STIX的技术描述语言规范、抽象度高,平均长度为62词,覆盖技术数最广;CTI-HAL收录经人工标注的完整报告段落,平均长度达118词,行文风格接近真实CTI报告;APT Notes汇聚来自不同安全厂商的原始报告,平均长度为183词,风格差异最为显著,包含大量厂商特有的叙事方式和术语用法。这种异质性可能导致编码器偏向学习某类文本风格的表示,从而影响跨模态对齐的泛化能力。
为缓解异质性的潜在负面影响,本文采取三项措施:①LLM去噪将不同来源标准化为统一JSON格式的结构化攻击描述,消除模板性文字和格式差异;②分层抽样确保训练时每个mini-batch中各来源的比例均衡,避免模型偏向数量较多的来源;③MLM目标使SecBERT在训练过程中适应多样化的安全领域表达方式。
为定量验证上述设计的有效性,以Theia数据集为例,分别以单一来源和全部来源的CTI数据训练模型,结果如表4所示。
表 4 CTI来源消融实验

Table 4 Ablation experiment on CTI sources

训练CTI来源 图—文本对
数量
检测
准确率
检测
F1
检索
R@1
检索
F1
MITRETRAM 1 846 0.997 0.994 0.35 0.72
ATT&CK STIX 1 632 0.995 0.991 0.33 0.70
CTI-HAL 2 105 0.996 0.995 0.38 0.75
APT Notes 1 629 0.991 0.985 0.31 0.68
全部4个来源 4 612 0.998 0.997 0.44 0.81
在检测任务上,混合训练的优势相对有限,这归因于检测指标已接近理论上限,各来源单独训练即可提供充足的监督信号。MITRE TRAM单源模型的检测准确率达到0.997,与混合模型仅相差0.001,处于随机种子波动范围之内。这说明在检测任务上,数据质量的作用大于数据数量。
然而在检索任务上,混合训练的增益显著且一致。检索R@1相较最优单源模型提升15.8%,检索F1提升8.0%。因为检索需要将跨模态对齐泛化到训练中未见的攻击技术,这要求编码器学习对多种文本表述方式鲁棒的共享表示。单一来源的语言多样性不足以支撑这种泛化需求。
4个来源中,CTI-HAL在单源实验中取得了最佳检索性能,这得益于其段落篇幅较长、上下文信息丰富,有利于TF-IDF匹配阶段构建高质量的图—文本对。APT Notes的检索表现最低,厂商报告的行文风格差异增加了跨模态对齐的学习难度,LLM去噪步骤对该来源的增益最为显著。
在进行LLM辅助去噪处理后,通过基于TF-IDF的匹配方法,构建了12847个图—文本对,并采用分层抽样将其划分为训练集(70%)、验证集(15%)和测试集(15%)。

3.1.2 基线方法

下面将ProvLang与3种先进的基于溯源的APT检测方法进行比较。KAIROS[19]采用时间图表示学习来建模审计日志中的结构依赖与时间依赖,代表了时间感知溯源分析的先进水平;MEGR-APT[16]提出了一种基于RDF存储的内存高效GNN攻击表示学习方法,与Poirot相比可将内存消耗降低一个数量级;TraceCluster[36]引入了一种轻量级基于聚类的子图注意力网络。所有基线方法均在统一框架下,使用相同的数据划分和评估指标进行评估。

3.1.3 实现细节

ProvLang使用PyTorch 2.1和PyG(PyTorch Geometric)2.4来实现,分别用于图神经网络操作和HuggingFace Transformers 4.36下的SecBERT文本编码。所有实验均在单NVIDIA A100 GPU(24GB显存)和Intel Xeon Gold 6326 CPU(128 GB 系统内存)上进行。
T-HGNN图编码器使用3层HGT。注意力头数:$ H=4 $;隐藏维度:$ d=128 $;投影维度:$ {d}_{\mathrm{proj}}=256 $。SecBERT编码器初始化自ehsanasgari/SecBERT,最大序列长度为 512个标记。两个编码器采用联合训练,优化器为 AdamW,其中,SecBERT的初始学习率为$ 2\times {10}^{-5} $,T-HGNN参数的初始学习率为$ 1\times {10}^{-3} $
批大小设为16个图—文本对。训练最多进行30个epoch,并基于验证集GTC损失采用早停策略。对于TCA损失,设时间阶段数$ S=4 $,间隔参数$ \delta =0.15 $。MGM的掩码比例为30%,MLM的掩码比例遵循标准设置,为15%。在两阶段检索中,粗检阶段候选检索$ K $为20个,融合权重$ \alpha $为0.6。所有结果均在5次使用不同随机种子的独立运行上取平均,并报告均值±标准差。

3.1.4 评估指标

采用两组评估指标。对于图—文本匹配与检测任务,在测试集上以0.5为阈值对GTM概率进行判定,并报告 Accuracy、Precision、Recall和F1。对于跨模态检索任务,报告Recall@K、Mean Reciprocal Rank(MRR)和F1。检索任务采用未见技术协议,所有对应于保留ATT&CK技术的图—文本对均从训练中排除,仅作为测试查询使用。该设置难于检测任务,因为训练阶段无法同时捕捉这两种模态。

3.2 训练收敛性与核心参数分析

3.2.1 训练收敛性分析

图5展示了Theia数据集上30个epoch的训练动态。图5(a)表明,总训练损失和验证损失均平稳收敛,未出现显著过拟合;验证损失紧密跟踪训练损失,并最终分别稳定在约1.3和1.25附近。图5(b)对各项损失进行了分解:GTC下降最快,表明全局跨模态对齐最易学习;MGM起始值最高,并随着图编码器学习结构表示而稳步下降;GTM和TCA收敛更平缓,反映出其细粒度特性。图5(c)跟踪了验证指标:3项指标均在第25个epoch前收敛至0.99以上,其中Precision起初略有滞后,但在第10个epoch后追平。
图 5 训练收敛性曲线

Fig.5 Training convergence on Theia

3.2.2 核心参数分析

(1)溯源图时序窗口
60 s窗口的选择基于DARPA TC数据集中系统行为的统计分析见图6,窗口从10 s到60 s压缩比例提升,性能不变;120 s开始下降,300 s显著下降,说明过大窗口错误合并独立因果事件。同一节点对之间同类型连续边的时间间隔:中位数8.3 s,P90为47.2 s,P95为89.6 s。60 s窗口覆盖约90%的重复性操作。
图 6 时间窗口大小敏感性分析

Fig.6 Sensitivity analysis of time window size

(2)溯源图—文匹配TF-IDF匹配阈值
图7所示,$ \theta $为0.3在匹配质量与训练数据充分性之间取得最佳平衡:$ \theta $低于0.3时噪声对明显增多,$ \theta $高于0.4时训练对不足导致欠拟合。故使用$ \theta =0.3 $作为余弦相似度阈值。
图 7 TF-IDF匹配阈值敏感性分析

Fig.7 Sensitivity analysis of TF-IDF matching threshold

(3)节点特征嵌入维度
表5在Theia验证集上对比了128、256和512这3种嵌入维度的敏感性。128维时信息瓶颈导致检索R@1下降0.03;512维时R@1仅提升0.005,但GPU显存占用增加35%。综合性能与效率,选择256维。
表 5 核心超参数敏感性分析

Table 5 Sensitivity analysis of core hyperparameters

维度$ {d}_{\mathrm{proj}} $ 验证GTC损失 检索R@1 检索R@5 检索F1 GPU显存/MB 时间/epoch
128 1.482 0.41 0.58 0.78 748 4.2 min
256 1.316 0.44 0.63 0.81 1070 5.1 min
512 1.298 0.445 0.635 0.815 1446 6.8 min
(4)GTM判定阈值
审计驱动的安全运营场景中,漏报与误报的代价往往极不对等,因此固定阈值的合理性需要经过系统论证。本节从ROC曲线与Precision-Recall权衡两个维度对GTM判定阈值进行敏感度分析。
图8给出了3个数据集上GTM分类器的ROC曲线。Theia、Cadets和Trace的AUC分别为0.99680.99380.9999,表明分类器在较宽的阈值范围内均具备强判别能力。内嵌放大图显示,在FPR<0.05的高安全操作区间内,3个数据集的TPR仍保持在0.94以上。Trace的AUC最高,与其训练数据最充分一致;Cadets略低,与全文多处观察到的FreeBSD跨平台挑战相符。
图 8 3个数据集上ProvLang的ROC曲线

Fig.8 ROC curves of ProvLang on three datasets

图9(a)展示了3个数据集上F1随GTM阈值的变化趋势。阈值在0.4~0.6内,3个数据集的F1均保持在0.990以上,峰值一致出现在0.5附近;阈值低于0.3时误报显著增多,高于0.7时漏报加速上升。图9(b)以Theia为例进一步展示Precision与Recall的权衡,阈值从0.2升至0.6时,Precision从0.957单调上升至0.999,Recall从0.997缓慢下降至0.993,0.5处二者分别约为0.997和0.994,恰处于最优平衡点。综上,0.5作为默认阈值在3个数据集上均取得最优或接近最优的F1,且位于Precision-Recall均衡区域。
图 9 GTM 阈值敏感度分析

Fig.9 Sensitivity analysis of GTM threshold

3.3 对比实验

为保证公平比较,所有基线方法均适配到统一框架中,其图编码器产生的嵌入与SecBERT文本嵌入配对,并通过相同的GTM分类器头和相同的数据划分进行评估。此外还纳入了Poirot[14],这是唯一公开可用的CTI驱动基线实现,其使用人工构造的查询图并执行子图对齐。表6给出各数据集图—文本匹配结果,表7给出3个数据集上的平均性能结果。
表 6 各数据集图—文本匹配结果(均值±标准差)

Table 6 Per-dataset graph-text matching results (mean ± std)

数据集 方法 准确率 F1 召回率 精确率
Theia KAIROS 0.996±0.001 0.990±0.002 0.987±0.003 0.993±0.002
TraceCluster 0.993±0.002 0.977±0.004 0.974±0.005 0.980±0.004
MEGR-APT 0.995±0.001 0.982±0.003 0.978±0.004 0.986±0.003
Poirot† 0.981±0.003 0.954±0.005 0.948±0.006 0.960±0.005
ProvLang† 0.998±0.001 0.997±0.001 0.994±0.002 0.996±0.001
Cadets KAIROS 0.997±0.001 0.991±0.002 0.989±0.003 0.994±0.002
TraceCluster 0.994±0.002 0.980±0.003 0.977±0.004 0.983±0.003
MEGR-APT 0.996±0.001 0.984±0.003 0.980±0.004 0.988±0.002
Poirot† 0.983±0.002 0.958±0.004 0.952±0.005 0.964±0.004
ProvLang† 0.998±0.001 0.997±0.001 0.995±0.002 0.997±0.002
Trace KAIROS 0.997±0.001 0.992±0.002 0.989±0.003 0.995±0.002
TraceCluster 0.995±0.002 0.980±0.004 0.976±0.005 0.984±0.003
MEGR-APT 0.996±0.001 0.985±0.003 0.981±0.004 0.989±0.002
Poirot† 0.984±0.002 0.961±0.004 0.955±0.005 0.967±0.004
ProvLang† 0.999±0.000 0.998±0.001 0.995±0.002 0.998±0.001

*“†”表示 CTI 驱动方法。

为确保在统一框架下进行公平评估,在本方法流水线内重新实现了Poirot的核心查询图对齐流程。由于Poirot的原始设计接受人工构造的查询图作为输入,并输出子图级对齐得分,因此将其对齐得分转换为与GTM兼容的评估方式将得分最高的对齐子图视为正预测,否则视为负预测。对于所有基线方法,使用相同的真实标签和数据划分;对于图编码器类基线,适配方式更直接。以T-HGNN为替代,生成图嵌入,再与SecBERT文本嵌入配对,并通过同一GTM分类头及相同训练/验证/测试划分进行评估,从而保证报告性能差异反映的是编码器质量,而非评估协议差异。
ProvLang在所有指标和数据集上均取得最佳性能,平均F1达到0.997。相较于最强的纯图基线KAIROS,其性能提升具有统计显著性。在全部的15种组合中,ProvLang的 F1均不低于KAIROS,且总体提升在全部运行上的配对检验中具有统计显著性。
Poirot实验的F1为0.958,低于所有基于学习的方法。这是因为Poirot依赖人工构造的查询图和精确子图对齐,其性能同时受限于查询图构造的人工成本以及精确匹配的刚性。ProvLang在F1上比Poirot高3.9%,表明学习式跨模态对齐比人工查询图构造更为有效。
表 7 3个数据集上的平均性能结果

Table 7 Result on average performance across three datasets

方法 CTI 准确率 F1 召回率 精确率
KAIROS 0.997 0.991 0.988 0.994
TraceCluster 0.994 0.979 0.976 0.982
MEGR-APT 0.996 0.983 0.979 0.987
Poirot† 0.983 0.958 0.952 0.964
ProvLang† 0.998* 0.997* 0.994* 0.997*

*表示相较于KAIROS,差异具有统计显著性。

3.4 消融实验

下面开展了两类消融实验:①损失函数消融,即移除单个训练目标;②结构消融,即替换T-HGNN的关键设计选择。表8给出Theia数据集上消融实验的结果;表9通过展示3个数据集上的平均$ {{F}}_{1} $,验证各变体趋势的一致性。
表 8 Theia 数据集上的消融实验结果

Table 8 Result on ablation study on Theia dataset

变体准确率F1召回率精确率ΔF1
Full Model0.998±0.0010.997±0.0010.994±0.0020.996±0.001
w/o GTC0.986±0.0020.968±0.0040.962±0.0050.974±0.004−0.029
w/o GTM0.978±0.0030.951±0.0050.949±0.0060.953±0.005−0.046
w/o MGM0.982±0.0030.960±0.0040.970±0.0040.951±0.005−0.037
w/o MLM0.993±0.0020.985±0.0030.983±0.0030.987±0.003−0.012
w/o TCA0.990±0.0020.978±0.0030.984±0.0030.972±0.004−0.019
同构GNN (GAT)0.984±0.0030.964±0.0050.958±0.0060.970±0.004−0.033
w/o GRU Memory0.992±0.0020.981±0.0030.977±0.0040.985±0.003−0.016
平均池化0.988±0.0020.972±0.0040.968±0.0050.976±0.004−0.025
Graph-only0.994±0.0010.989±0.0020.986±0.0030.992±0.002−0.008
w/o LLM Denoise0.995±0.0010.991±0.0020.989±0.0030.993±0.002−0.006

3.4.1 损失函数消融

移除GTM导致性能下降最大,说明细粒度二分类器对于区分“结构相似但不匹配”的样本对至关重要。MGM也有显著贡献,说明图编码器受益于掩码节点重构。MLM的影响最小,这表明SecBERT的预训练已提供较强初始化。
表 9 消融一致性评估结果

Table 9 Result on ablation consistency evaluation

变体 ΔF1 (Theia) ΔF1 (Cadets) ΔF1 (Trace) Avg
w/o GTC −0.029 −0.031 −0.026 −0.029
w/o GTM −0.046 −0.044 −0.042 −0.044
w/o MGM −0.037 −0.035 −0.033 −0.035
w/o MLM −0.012 −0.014 −0.010 −0.012
w/o TCA −0.019 −0.021 −0.017 −0.019
同构GNN −0.033 −0.036 −0.030 −0.033
w/o GRU Mem. −0.016 −0.018 −0.014 −0.016
平均池化 −0.025 −0.027 −0.023 −0.025
TCA在检测任务中的贡献在检索任务中则更加明显。表10给出了ProvLang在有无TCA条件下,3个数据集上的未见技术检索性能。不使用TCA时,各数据集上的R@1下降0.05~0.08,检索F1下降0.04~0.05,这表明时间阶段对齐对于跨模态泛化到未见攻击技术至关重要。检索相较检测受到的影响更大,符合预期。检测作用于已见样本对,GTC与GTM已能提供足够的对齐信号;而检索需要将跨模态对应关系泛化到未见技术,TCA捕获的时间结构正可作为额外不变性约束。在3个数据集上,移除TCA会持续降低所有检索指标。绝对下降最大的是Cadets,这与FreeBSD更为多样的系统调用模式需要更强的时间锚定相一致。
表 10 TCA对未见技术检索的影响

Table 10 Impact of TCA on unseen-technique retrieval

数据集变体R@1R@5R@10R@20MRRF1
CadetsFull0.38±0.030.58±0.040.64±0.030.73±0.030.47±0.030.79±0.02
w/o TCA0.30±0.040.49±0.050.56±0.040.66±0.040.39±0.040.74±0.03
TheiaFull0.44±0.030.63±0.030.67±0.030.72±0.020.54±0.030.81±0.02
w/o TCA0.37±0.040.55±0.040.60±0.030.66±0.030.46±0.040.76±0.03
TraceFull0.45±0.020.72±0.030.75±0.020.81±0.020.59±0.020.83±0.02
w/o TCA0.40±0.030.65±0.040.69±0.030.75±0.030.52±0.030.79±0.02

3.4.2 结构消融

将T-HGNN替换为同构3层GAT,ΔF1=−0.033表明类型特定投影的重要性。因为溯源图包含本质不同的实体类型(进程、文件、网络连接),需要专门化的注意力模式。去除GRU记忆ΔF1=−0.016验证了其对超越3跳感受野的长程时间依赖建模的贡献。
将门控注意力池化替换为平均池化ΔF1=−0.025,说明学习式节点重要性建模很重要,这与攻击相关节点稀疏的特点一致。这些结构消融从设计层面验证了T-HGNN组件组合的合理性。HGT处理异构类型,函数式时间编码捕获细粒度时间动态,GRU 记忆建模长程阶段转换,每一项都对应溯源图的一个关键特征,其作用由互不冗余的性能下降所证实。
图10从嵌入空间角度进一步印证了上述消融结论。对Theia测试集上256维共享嵌入进行t-SNE可视化,训练前图嵌入与文本嵌入散布于彼此分离的区域;训练后,匹配的图—文本对共定位,恶意与良性簇清晰分离,且恶意区域内部可辨识出对应不同ATT&CK技术族的子簇,表明5种对齐目标与T-HGNN的联合作用不仅提升了数值指标,也在嵌入几何结构上建立了有意义的跨模态语义组织。
图 10 t-SNE可视化

Fig.10 t-SNE visualization

3.5 跨模态检索与跨域泛化

3.5.1 跨模态检索

跨模态检索任务体现了ProvLang的主要创新能力。在technique-holdout(零日TTP保留)划分[37]下进行评估。将所有测试技术均设为训练期间未见,所有对应于保留ATT&CK技术的图—文本对均从训练中排除,而这些技术的CTI描述仅作为测试查询。表11给出了未见技术的跨模态检索指标。
表 11 未见技术跨模态检索指标

Table 11 Unseen-technique cross-modal retrieval

数据集R@1R@5R@10R@20MRRF1
Cadets0.38±.030.58±.040.64±.030.73±.030.47±.030.79±.02
Theia0.44±.030.63±.030.67±.030.72±.020.54±.030.81±.02
Trace0.45±.020.72±.030.75±.020.81±.020.59±.020.83±.02
R@1在0.38~0.45,说明对近一半未见查询,正确子图能够排在首位。R@20达到0.73~0.81,说明在大多数情况下,正确结果位于前20名候选内。两阶段流水线相比仅使用余弦相似度检索,可使F1提高0.06~0.08。
检测F1与检索F1的差异反映了任务本质不同。检测作用于训练中已见的样本对,而检索则需要将跨模态对齐泛化到未见技术,并在数千候选中对正确子图进行排序。这类似于视觉—语言模型中的闭集与开集差异。检索F1达到0.81具有实际应用意义。正确子图通常会出现在前20个候选中,并且在75%以上的时间内位于前20名之内,从而有助于分析人员在SOC工作流中高效审查候选结果。

3.5.2 跨域泛化

通过在一个数据集上训练、在另一个数据集上直接测试而不进行微调的方式,评估跨数据集迁移能力,以模拟跨不同操作系统/应用环境的部署。
图11所示,ProvLang在全部6个迁移方向上的F1保持在0.883~0.942。Cadets→Theia(0.942)优于Theia→Cadets(0.891)的不对称性,说明基于FreeBSD的Cadets具有不同的系统调用词汇,这可能迫使模型学习更抽象地表示,从而更有利于向Ubuntu目标迁移。
图 11 ProvLang在全部6个“源→目标”方向上的跨数据集迁移F1雷达图

Fig.11 Radar chart of ProvLang’s cross-dataset transfer F1 across all six source→target directions

3.6 部署效率分析

ProvLang的推理流水线分为两个独立阶段:离线预处理(含LLM去噪与图编码)和在线检索。LLM去噪通过GLM-4-flash API对CTI段落执行一次性结构化抽取,平均每段耗时2.3 s,总计约5.6 h,总token消耗5.57M;去噪结果持久化存储后可反复使用,新增报告仅需增量处理。图编码同样为离线预计算,$ {10}^{5} $个子图嵌入约需12 min。在线阶段不涉及任何LLM调用,仅执行向量检索与重排序。以下对在线阶段进行基准测试,测量不同批大小下的端到端时延、吞吐率和GPU显存占用。
图12所示,ProvLang在批大小1时,每个查询的时延为27 ms,满足交互式SOC威胁狩猎的要求。在批大小为16时,吞吐率达到240对/秒,GPU显存占用为1070 MB,处于中档GPU容量范围内。时延随批大小近似次线性增长。对于离线图编码,预计算$ {10}^{5} $个子图嵌入约需12 min;嵌入索引约占用98 MB。模型总规模为1.32亿参数,检查点大小为528 MB。
图 12 部署效率分析

Fig.12 Deployment efficiency analysis

统一使用SecBERT文本编码器的实验设计可能掩盖图编码器之间的计算开销差异。因此,表12给出了各图编码器计算开销对比。
表 12 各图编码器计算开销对比

Table 12 Comparison of computational overhead for different graph encoders

图编码器 参数量/M 编码延迟/ms 训练时间/min 端到端推理延迟/ms 检测F1
T-HGNN(本文) 21.7 7.8 5.1 27 0.997
GAT-3L(KAIROS适配) 8.4 2.9 2.3 22 0.991
GAT-3L(MEGR-APT适配) 9.6 3.6 2.7 23 0.983
SubGAT(TraceCluster) 6.2 2.4 1.9 21 0.979
T-HGNN的参数量为21.7M,约为标准GAT的2.6倍,额外参数主要来源于3个组件:类型特定Q/K/V投影矩阵、可学习频率—相位时间编码参数以及GRU时间记忆模块。在单次图编码延迟上,T-HGNN为7.8 ms,约为GAT的2.7倍。端到端推理延迟中图编码仅占一小部分:SecBERT文本编码和FAISS向量检索构成了主要开销,且为所有方法共享。因此,T-HGNN与最轻量基线SubGAT之间的端到端延迟差仅为6ms,增幅不足29%。
在训练效率方面,T-HGNN每轮训练耗时5.1 min,相较于GAT增加约一倍,但30轮训练总时长仍在2.5 h以内,对于离线训练场景完全可接受。
从效率—性能权衡的角度看,T-HGNN以约13.3M的额外参数和4.9ms的额外编码延迟,换取了检测F1从0.991提升至0.997。
在实际部署中,图编码为离线预计算步骤,不影响在线查询响应时间。端到端27 ms的推理延迟满足交互式SOC威胁狩猎的实时性要求,说明T-HGNN的额外计算开销在实际部署中不构成瓶颈。

3.7 可解释性分析

在APT威胁狩猎中,“黑盒”模型通常缺乏安全分析人员信任自动告警所需的透明度,因此采用可解释性技术来验证ProvLang是否真正识别了恶意语义,而不是依赖伪相关或背景噪声。
具体而言,使用GNNExplainer对已学习的溯源子图表示中的边重要性进行可视化。如图13所示,边的重要性通过由红到蓝的颜色梯度表示。在较简单、较小的子图中,攻击者C2服务器之间的连接始终获得最高的重要性分数。随着子图复杂度和规模增加,ProvLang仍表现出稳健的选择性注意力。直接参与攻击链的边保持暖色,而良性系统服务边则被正确赋予冷色。该结果提供了定性证据,说明门控注意力池化机制能够有效抑制大量良性背景活动的干扰,从而确保模型聚焦于核心攻击叙事。
图 13 GNNExplainer对不同规模子图中边重要性的可视化

Fig.13 GNNExplainer visualization of edge importance across subgraphs of increasing size

3.8 攻击重构能力验证

为验证ProvLang的攻击叙事重构能力,首先通过两个端到端案例展示其实际效果,随后进行定量评估。

3.8.1 案例分析

图14所示,案例1聚焦Scheduled Task技术(T1053.005)。CTI报告描述了一次鱼叉式钓鱼攻击链,恶意Word宏触发命令shell下载后门,通过计划任务持久化后连接C2服务器。ProvLang在Top-1即检索到目标子图,完整重构出explorer.exe→winword.exe→cmd.exe→backdoor.exe→schtasks.exe的攻击路径,并自动映射为ATT&CK技术链T1566.001→T1059.003→T1053.005→T1071.001。案例2考察后渗透阶段的File Deletion技术(T1070.004),ProvLang在Top-3以0.6551的相似度识别出匹配子图,重构出firefox→bash→dropper.sh→rm -rf的清理操作链,映射为T1190→T1105→T1059.004→T1041→T1070.004。两个案例表明,跨模态对齐能够有效弥合CTI文本与溯源图之间的语义鸿沟,检索到的子图足以支撑完整攻击叙事重构与标准化技术链映射。
图 14 两个端到端案例研究

Fig.14 Two end-to-end case studies

3.8.2 定量评估

为系统衡量上述能力,基于DARPA TC数据集的真实攻击标注定义4项指标:节点覆盖率(NC)、边覆盖率(EC)、技术链完整度(CC)和阶段顺序一致性(OC,Kendall τ系数)。结果如表13所示。
表 13 攻击重构准确性定量评估

Table 13 Quantitative evaluation of attack reconstruction accuracy

数据集 方法 节点覆盖率 边覆盖率 技术链完整度 阶段顺序OC
Theia ProvLang 0.872±0.041 0.813±0.053 0.836±0.048 0.907±0.035
w/o TCA 0.864±0.044 0.801±0.057 0.820±0.052 0.741±0.048
MEGR-APT 0.803±0.052 0.724±0.061 0.756±0.058
Cadets ProvLang 0.845±0.047 0.782±0.058 0.804±0.052 0.883±0.042
w/o TCA 0.838±0.050 0.770±0.062 0.786±0.056 0.698±0.055
MEGR-APT 0.776±0.058 0.691±0.066 0.718±0.062
Trace ProvLang 0.893±0.038 0.841±0.046 0.862±0.043 0.924±0.031
w/o TCA 0.886±0.041 0.830±0.050 0.848±0.047 0.772±0.043
MEGR-APT 0.831±0.048 0.758±0.054 0.794±0.051
平均 ProvLang 0.870 0.812 0.834 0.905
w/o TCA 0.863 0.800 0.818 0.737
MEGR-APT 0.803 0.724 0.756
ProvLang的平均NC和EC分别达到0.870和0.812,较MEGR-APT提升8.3%和12.2%,表明跨模态对齐学习到的图表示比纯图匹配方法更能精确定位攻击相关结构。NC高于EC的差异源于BFS扩展的3跳距离限制,部分边界节点的攻击相关边未被完整覆盖。技术链完整度平均为83.4%,其中Cadets最低,原因在于FreeBSD特有的系统调用模式增加了技术映射难度。
阶段顺序一致性最能体现TCA损失的设计价值。ProvLang的平均OC达0.905,移除TCA后降至0.737,而同期NC和EC仅分别下降0.8%和1.5%。这种不对称退化表明,TCA的核心贡献在于保持跨模态时间因果结构,而非提升结构覆盖本身。MEGR-APT因缺乏时间对齐机制,无法产生有意义的阶段排序。3个数据集中,Trace各项指标最高,得益于其子图数量多且多阶段攻击为时序对齐提供了丰富监督信号;Cadets最低,与前文观察到的FreeBSD跨平台挑战一致。

4 结束语

本文将CTI驱动的威胁狩猎形式化为一个跨模态检索问题,并提出ProvLang用于连接CTI叙事与承载证据的溯源子图。除性能提升之外,所提出的设计还具有实际意义:①双编码器检索范式使该方法兼容大规模索引与交互式狩猎工作流;②图编码器中的时间异构设计和显式的时间因果对齐机制充分利用了阶段顺序信息,这对于多阶段攻击至关重要,并提升了在技术保留评估下的泛化能力;③模块化目标函数使有限弱监督信号能够比单损失对齐方式更高效地被利用。
与此同时,该方法也存在局限性。其有效性依赖于溯源日志质量和子图构建质量,而构造较弱的CTI图对可能在控制不当时引入偏差。此外,CTI中的叙事噪声和歧义仍可能导致长时跨度或多活动报告的检索漂移。后续工作将聚焦于更强的数据泄露诊断、对子图构建中的配对机制的先验约束、面向长时间窗口和企业级大图的含噪日志鲁棒建模。此外,DARPA TC数据集属于模拟环境而非真实生产环境采集,模型在更多样、更具噪声的真实世界溯源数据上的性能仍有待验证。
1
Alshamrani A, Myneni S, Chowdhary A, et al. A survey on advanced persistent threats: techniques, solutions, challenges, and research opportunities[J]. IEEE Communications Surveys & Tutorials, 2019, 21 (2): 1851- 1877.

2
Singh S, Sharma P K, Moon S Y, et al. A comprehensive study on APT attacks and countermeasures for future networks and communications: challenges and solutions[J]. The Journal of Supercomputing, 2019, 75 (8): 4543- 4574.

DOI

3
Stellios I, Kotzanikolaou P, Psarakis M, et al. A survey of iot-enabled cyberattacks: assessing attack paths to critical infrastructures and services[J]. IEEE Communications Surveys & Tutorials, 2018, 20 (4): 3453- 3495.

DOI

4
Xiong C, Zhu T, Dong W, et al. Conan: a practical real-time APT detection system with high accuracy and efficiency[J]. IEEE Transactions on Dependable and Secure Computing, 2020, 19 (1): 551- 565.

DOI

5
Zipperle M, Gottwalt F, Chang E, et al. Provenance-based intrusion detection systems: a survey[J]. ACM Computing Surveys, 2022, 55 (7): 1- 36.

6
Inam M A, Chen Y, Goyal A, et al. Sok: history is a vast early warning system: auditing the provenance of system intrusions[C]//2023 IEEE Symposium on Security and Privacy (SP). IEEE, 2023: 2620-2638.

7
Zhang B, Gao Y, Yu C, et al. {TAPAS}: an efficient online {APT} detection with task-guided process provenance graph segmentation and analysis[C]//34th USENIX Security Symposium (USENIX Security 25). 2025: 607-624.

8
Zhu T, Wang J, Ruan L, et al. General, efficient, and real-time data compaction strategy for apt forensic analysis[J]. IEEE Transactions on Information Forensics and Security, 2021, 16, 3312- 3325.

DOI

9
Han X, Pasquier T, Bates A, et al. Unicorn: runtime provenance-based detector for advanced persistent threats[PP]. arXiv preprint arXiv: 2001.01525, 2020.

10
Wang S, Wang Z, Zhou T, et al. Threatrace: Detecting and tracing host-based threats in node level through provenance graph learning[J]. IEEE Transactions on Information Forensics and Security, 2022, 17, 3972- 3987.

DOI

11
Do X C. Detecting APT attacks based on network traffic using machine learning[J]. Journal of Web Engineering, 2021, 20 (1): 171- 190.

DOI

12
DARPA. Transparent computing program engagement 3 data release [DS/OL]. GitHub, 2022 [2025-12-16]. https://github.com/darpa-i2o/Transparent-Computing.

13
Al-sada B, Sadighian A, Oligeri G. MITRE ATT&CK: state of the art and way forward[J]. ACM Computing Surveys, 2024, 57 (1): 1- 37.

14
Milajerdi S M, Eshete B, Gjomemo R, et al. Poirot: aligning attack behavior with kernel audit records for cyber threat hunting[C]//Proceedings of the 2019 ACM SIGSAC Conference on Computer and Communications Security. 2019: 1795-1812.

15
Wei R, Cai L, Zhao L, et al. Deephunter: a graph neural network based approach for robust cyber threat hunting[C]//International Conference on Security and Privacy in Communication Systems. Cham: Springer International Publishing, 2021: 3-24.

16
Aly A, Iqbal S, Youssef A, et al. MEGR-APT: a memory-efficient APT hunting system based on attack representation learning[J]. IEEE Transactions on Information Forensics and Security, 2024, 19, 5257- 5271.

DOI

17
Xiao N, Lang B, Wang T, et al. APT-MMF: An advanced persistent threat actor attribution method based on multimodal and multilevel feature fusion[J]. Computers & Security, 2024, 144, 103960.

DOI

18
Li T, Liu X, Qiao W, et al. T-trace: Constructing the APTs provenance graphs through multiple syslogs correlation[J]. IEEE Transactions on Dependable and Secure Computing, 2023, 21 (3): 1179- 1195.

19
Cheng Z, Lv Q, Liang J, et al. Kairos: practical intrusion detection and investigation using whole-system provenance[C]//2024 IEEE Symposium on Security and Privacy (SP). IEEE, 2024: 3533-3551.

20
Cheng W, Zhu T, Jing S, et al. Omnisec: LLM-driven provenance-based intrusion detection via retrieval-augmented behavior prompting[PP]. arXiv preprint arXiv: 2503.03108, 2025.

21
Lewis P, Perez E, Piktus A, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks[J]. Advances in Neural Information Processing Systems, 2020, 33, 9459- 9474.

22
Rehman M U, Ahmadi H, Hassan W U. Flash: a comprehensive approach to intrusion detection via provenance graph representation learning[C]//2024 IEEE Symposium on Security and Privacy (SP). IEEE, 2024: 3552-3570.

23
Zhou F, Chang B, Wen Y, et al. Representation-enhanced apt detection using contrastive learning[C]//2023 IEEE 22nd International Conference on Trust, Security and Privacy in Computing and Communications (TrustCom). IEEE, 2023: 1-9.

24
Sun N, Ding M, Jiang J, et al. Cyber threat intelligence mining for proactive cybersecurity defense: a survey and new perspectives[J]. IEEE Communications Surveys & Tutorials, 2023, 25 (3): 1748- 1774.

DOI

25
何厚翰, 芦天亮, 张岚泽, 等. 多维度边优化溯源图改进的APT攻击检测方法[J]. 计算机科学与探索, 2025, 19 (6): 1640- 1655.

He H H, Lu T L, Zhang L Z, et al. APT attack detection method improved by multi-dimensional edge-optimized provenance graph[J]. Journal of Frontiers of Computer Science and Technology, 2025, 19 (6): 1640- 1655.

26
高新成, 蔡磊. 异构溯源图与高斯融合模型的APT检测方法[J]. 北京邮电大学学报, 2026, 49 (1): 99- 106.

DOI

Gao X C, Cai L. APT detection method based on heterogeneous provenance graph and Gaussian fusion model[J]. Journal of Beijing University of Posts and Telecommunications, 2026, 49 (1): 99- 106.

DOI

27
Talib M A, Nasir Q, Nassif A B, et al. APT beaconing detection: a systematic review[J]. Computers & Security, 2022, 122, 102875.

DOI

28
Do X C, Cuong N H. A novel approach for APT attack detection based on feature intelligent extraction and representation learning[J]. Plos one, 2024, 19 (6): e0305618.

DOI

29
Xu H, Si C, Wang C, et al. Aptsniffer: detecting APT attack traffic using retrieval-augmented large language models[C]//ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). IEEE, 2025: 1-5.

30
Xiao L, Xu D, Mandayam N B, et al. Attacker-centric view of a detection game against advanced persistent threats[J]. IEEE Transactions on Mobile Computing, 2018, 17 (11): 2512- 2523.

DOI

31
Hu Z, Liu L, Li H, et al. CCLog: actionable APT forensics via fused log semantics and provenance graph topology[J]. Computer Networks, 2025: 111660.

32
Center for Threat-Informed Defense. Threat report ATT&CK mapper (TRAM)[DS/OL]. MITRE(2023-08-24)[2025-11-16].https://ctid.mitre.org/projects/threat-report-attck-mapper-tram/.

33
Della P S, Natella R, Orbinato V, et al. CTI-HAL: a human-annotated dataset for cyber threat intelligence analysis[DS/OL]. [2026-03-16]. https://github.com/dessertlab/CTI-HAL.

34
MITRE ATT&CK. ATT&CK® STIX data[DS/OL]. [2026-03-16]. https://github.com/mitre-attack/attack-stix-data.

35
Aptnotes. APTnotes data[DS/OL]. [2025-11-16]. https://github.com/aptnotes/data.

36
Xu L, Zhao Z, Zhao D, et al. TraceCluster: a lightweight and adaptive clustering-based subgraph attention network for APT detection in provenance graphs[J]. IEEE Transactions on Information Forensics and Security, 2026, 21, 1065- 1080.

DOI

37
Basak M, Shin G Y. A framework for budget-constrained zero-day cyber threat mitigation: a knowledge-guided reinforcement learning approach[J]. Sensors, 2025, 26 (1): 21.

DOI

文章导航

/