Technology Application

Automated threat intelligence knowledge graph construction using LLM

  • Chen Chen 1 ,
  • Li Yunchun 1, 2 ,
  • Xia Mingyuan 1 ,
  • Chen Hao 2 ,
  • Li Wei , 1, 2, *
Expand
  • 1. School of Cyber Science and Technology, Beihang University, Beijing 100191, China
  • 2. School of Computer Science and Engineering, Beihang University, Beijing 100191, China

Online published: 2026-05-06

Copyright

Copyright ©2025 Journal of Aeronautical Materials. All rights reserved.

Abstract

As cyber offense and defense confrontations become increasingly intense, the in-depth mining and effective utilization of threat intelligence have emerged as critical factors in enhancing cybersecurity defense capabilities. To address the limitations of traditional information extraction techniques in processing multimodal intelligence combining text and images—specifically insufficient information fusion and inaccurate knowledge mapping—this paper proposes a multimodal collaborative analysis framework based on Large Language Models (LLM), termed M²A-TTP (Multimodal Modular Analysis Framework for TTP Parsing). Leveraging the powerful multimodal reasoning capabilities of LLM, the framework first extracts structured entities and relations according to the STIX ontology, then achieves deep collaboration between textual and visual information through a cross-modal evidence association mechanism. Subsequently, structured Retrieval-Augmented Generation (RAG) is introduced to precisely map attack behaviors to the TTP (Tactics, Techniques, and Procedures) knowledge base, and the overall analytical process is validated through a verification and explainability generation pipeline to ensure reliability. Experimental results demonstrate that the proposed method achieves higher precision and recall than existing approaches. Overall, this study introduces a flexible and efficient intelligent multimodal analysis method that optimizes the knowledge fusion process for threat intelligence, providing new insights for constructing explainable cybersecurity knowledge graphs and advancing the proactivity and sophistication of cyber defense.

Cite this article

Chen Chen , Li Yunchun , Xia Mingyuan , Chen Hao , Li Wei . Automated threat intelligence knowledge graph construction using LLM[J]. Journal of Cybersecurity, 2025 , 3(6) : 112 -122 . DOI: 10.20172/j.issn.2097-3136.250609

0 引言

随着互联网与信息技术的飞速发展,网络空间攻防对抗的复杂性与日俱增。高级持续性威胁(Advanced Persistent Threat,APT)组织采用精妙策略与多元技术开展持续、隐蔽的攻击活动,传统网络安全防御策略已难以应对此类威胁。在此背景下,网络威胁情报(Cyber Threat Intelligence,CTI)作为提升网络空间主动防御能力的关键要素[1],其深度挖掘与有效利用已成为学术界与工业界共同关注的焦点。通过对CTI的分析,防御方得以洞察攻击者的行为模式与意图,打破攻防信息不对等的格局,从而制定更具前瞻性的安全策略[2-4]
为将非结构化CTI转化为可机读、可利用的结构化知识,构建网络安全知识图谱(Cybersecurity Knowledge Graphs,CSKG)已成为研究界与工业界的核心目标。在CSKG中,各类安全实体(如恶意软件、攻击组织)作为节点,实体间的复杂关系(如“使用”“攻击”)作为边,进而对威胁全貌进行整体性、可视化刻画,为下游安全应用提供支持。为确保知识的规范性与互操作性,CSKG的构建通常需遵循STIX 2.0(Structured Threat Information eXpression,STIX)等标准化本体(Ontology)[5],该本体严格规定了实体类型与允许的关系[6]。然而,真正的挑战在于如何将现实世界中形式多样、不断演变的非结构化威胁描述,精准、灵活地映射到标准化的本体框架上。传统自动化方法往往缺乏足够的语义理解能力,难以处理新出现的威胁术语或复杂的攻击行为描述,导致映射不准或信息丢失。这要求信息抽取方法必须具备高度的灵活性与智能性,以动态适应情报内容并高效应用既定本体。
然而,现代CTI的呈现形式正经历从纯文本向图文并茂的多模态演变。分析报告中日益增多的截图(如恶意代码、命令行输出)、攻击流程图及网络拓扑图等视觉元素,往往蕴含着最直接、最关键的攻击证据。尽管业界已认识到CTI的重要性,但如何从这些包含文本与图像的半结构化异构数据中,高效、准确地提取结构化知识,构建全面、连贯的知识图谱,已成为一项亟待解决的挑战[7]。现有自动化信息抽取方法大多围绕自然语言处理(Natural Language Processing,NLP)技术构建,其固有的“模态盲点”使其在面对视觉证据时无能为力,由此造成了多模态信息鸿沟问题[8]
近年来,部分研究开始探索多模态CTI的分析路径,但现有方法多采用简单流水线模式,即先通过计算机视觉技术将图像转化为文本描述,再将其与原文合并后送入纯文本分析模型[9]。此种模式下,文本与图像信息在分析流程中相互割裂,缺乏深度协同推理与交叉验证,导致知识融合不充分,难以准确解析跨模态复杂语义关系,其分析结果的准确性与完整性仍有较大提升空间[10]
大语言模型(Large Language Models,LLM)特别是视觉语言模型(Visual Language Models,VLM)(如Gemini [11])的出现,为应对上述挑战带来了机遇。LLM凭借其卓越的多模态内容理解、上下文学习(In-Context Learning,ICL)和复杂逻辑推理能力[12],为模拟人类“边看边读、对照思考”的综合分析模式提供了技术基础。通过构建精密的分析框架,LLM不仅有潜力识别独立的文本与图像信息,更能在两种模态之间建立深层逻辑关联,实现真正意义上的协同推理。
本文旨在探讨基于LLM的多模态威胁情报信息抽取系统化方法,并据此构建名为M2A-TTP(Multimodal Modular Analysis Framework for TTP Parsing)的自动化分析框架。该框架涵盖3个核心模块:①跨模态证据关联模块,通过ICL技术实现文本与视觉信息的深度协同理解;②结构化TTP映射模块,引入创新的S-RAG机制,利用MITRE ATT&CK[13]的结构化元数据约束LLM推理过程,以提升TTP(Tactics,Techniques,and Procedures)映射的准确性;③验证与可解释性生成模块,通过模拟“自我批判”过程对所有结论进行最终审核,并生成供分析师参考、过程可审计、来源可追溯的决策报告。

1 相关工作

1.1 单模态CTI知识抽取

单模态CTI知识抽取主要关注从纯文本文档中提取威胁信息,其核心任务可分为实体关系抽取与TTP映射。在实体关系抽取方面,早期方法依赖语法解析和关键词典来提取主谓宾三元组,如TTPDrill[14]和iACE[15]。这类方法泛化能力有限,难以适应多变的威胁场景[16]。为解决此问题,后续研究转向基于深度学习的方法,通过在标注数据集上微调预训练语言模型(如BERT[17])提升准确性,代表性工作有EXTRACTOR[18]和AttacKG[19]。尽管效果显著,但这类方法高度依赖大规模标注数据,且模型难以迁移至新的知识体系[20]
在TTP识别与映射方面,将攻击行为描述映射至MITRE ATT&CK框架[20]是CTI分析的关键环节。LLM的兴起正推动研究范式转变[21],即从传统的规则匹配[14]和分类模型[22]转向LLM驱动的自动化映射。凭借强大的上下文理解与逻辑推理能力,LLM不仅被用于CTI自动化分析[23],还在更广泛的网络安全任务中展现出巨大潜力,例如自动化渗透测试[24]、漏洞利用[25]及自动化漏洞修复[26],这些工作证实LLM能够深刻理解复杂的攻击逻辑。在此背景下,研究者开始利用LLM直接处理CTI报告。例如,CTINEXUS[27]利用LLM的ICL能力进行信息抽取,而LLM-TIKG[28]则通过微调LLM,实现从自然语言描述到TTP的直接映射。然而,这些方法在进行TTP映射时,大多将ATT&CK知识库视为非结构化的文本描述,主要依赖模糊的语义相似度进行匹配。这种方式忽略了ATT&CK框架本身固有的丰富结构化元数据,面对语义相似但细节有别的TTP时,易导致映射不准确甚至产生“幻觉”,这也是本文通过S-RAG机制着力解决的核心挑战。
随着LLM在CTI分析中的广泛应用,如何确保其输出的可靠性成为新的研究焦点。近期研究开始探索利用LLM自身作为评估器来验证和改进生成结果。然而,Xu等[29]的研究发现,LLM在自我评估时存在系统性的自我偏好偏差,即倾向于对自己生成的内容给予过高评价。为缓解这一问题,D’Souza等[30]提出通过精心设计的评估框架,结合外部知识约束与强化学习技术,可有效降低评估偏差。这些研究为本文设计可靠的自动化验证机制提供了重要启示:①利用LLM进行自我批判可以提升输出质量;②必须通过批判性角色设定、结构化约束等机制来防范自证偏差。

1.2 多模态CTI知识抽取

随着CTI报告日益图文并茂,学术界开始认识到视觉信息的重要性。图像中包含的代码截图、攻击流程图等证据,往往比文本更直观,信息密度更高[9]。然而,现有的文本分析方法存在“模态盲点”,无法处理这些视觉元素,造成了“多模态信息鸿沟”。
在这一新兴领域,MM-AttacKG[9]系统性将多模态大语言模型(Multimodal Large Language Models,MLLM)应用于攻击图谱构建,通过设计的流水线从图像中提取关键信息并与文本融合。此外,EX-Action[7]和APT-MMF[31]等研究也分别探索利用多模态学习识别威胁行为进行APT攻击溯源。这些工作共同证实了融合多模态信息能显著提升对复杂网络攻击的理解深度。尽管这些方法验证了多模态分析的可行性,但大多采用简单流水线模式,即图像与文本信息在分析流程中相互割裂,缺乏深度协同推理与交叉验证,知识融合的准确性与完整性仍有较大提升空间。本文提出的框架旨在通过LLM实现文本与视觉信息的深度协同理解,以解决这一问题。

2 研究方法

为系统性地解决多模态CTI在自动化分析中所面临的图文信息融合、知识精准映射及过程可解释性等核心挑战,本文设计并提出一个名为M2A-TTP的自动化分析框架。该框架的核心思想在于模拟安全专家的协同分析模式,将复杂的端到端抽取任务分解为一系列定义明确、功能内聚的连续处理阶段。整个分析流程完全由LLM的ICL与多模态推理能力驱动,最终从原始情报中生成一份结构完整、逻辑连贯且决策过程完全透明的TTP知识图谱。

2.1 框架总体设计

M2A-TTP框架在设计上遵循模块化与流程化的原则。本框架的核心任务可形式化为:给定一份包含文本和图像的原始CTI报告,自动输出一个结构化的TTP知识图谱,该图谱包含符合STIX 2.0标准的实体和关系,以及精准映射到MITRE ATT&CK框架的攻击技术,并为每个映射提供完整的证据链和推理过程。多模态威胁情报分析任务形式化定义如下。
定义1(多模态威胁情报的形式化表示) 一份原始的CTI报告$ R $可被视为一个由$ n $个有序情报块$ b $构成的集合$ R=\{{b}_{1},{b}_{2},\cdots ,{b}_{n}\} $,即。其中,每个情报块$ b $均可由一个三元组表示:$ {b}_{i}=\left({\mathrm{i{d}}}_{i},{\mathrm{typ{e}}}_{i},{\mathrm{conten}}{{\mathrm{t}}}_{i}\right) $$ {{\mathrm{id}}}_{i} $为该情报块的唯一标识符;$ {\mathrm{typ{e}}}_{i}\in \{\text{text},\text{image}\} $表示其模态类型;$ {\mathrm{conten}}{{\mathrm{t}}}_{i} $表示原始内容。
定义 2 (TTP知识图谱生成任务) M2A-TTP框架旨在解决TTP知识图谱生成任务,该任务可被描述为一个确定性的转换函数$ f $,其接收输入的原始报告$ R $,映射为可解释的TTP知识图谱$ G $。此过程可表示为:
$ \begin{matrix}G=f\left(R\right)\\ \end{matrix} $
其中,知识图谱$ G $包含实体集$ E $、关系集$ {\mathrm{Rel}} $以及一个核心的可解释性TTP审计集$ {T}_{{\mathrm{audit}}} $,即$ G=\left(E,{\mathrm{Rel}}, {T}_{{\mathrm{audit}}}\right) $$ {T}_{{\mathrm{audit}}} $中的每个元素都详细记录了一个TTP映射的完整决策过程与证据链。M2A-TTP的总体工作流为4个阶段的协同处理流水线。本文方法总体框架如图1所示。这4个核心阶段依次为:多模态情报的结构化预处理、基于ICL的跨模态证据关联、基于结构化RAG的TTP精准映射、可解释性生成与验证。
图 1 本文方法总体框架

Fig.1 Overall framework of the proposed method

2.2 协同分析驱动的情报统一表示

为实现后续协同分析,M2A-TTP框架的核心环节是对异构多模态情报进行结构化处理,构建统一的情报表示。该阶段由多模态情报结构化模块(Multimodal Information Structuring Module,MISM)执行,其任务是将定义1中所描述的、原始且异构的情报块集合$ R=\{{b}_{1},{b}_{2},\cdots ,{b}_{n}\} $,转化为下游模块可直接利用的、富含显式语义信息的标准化数据流。

2.2.1 文本情报块处理

对于在定义1中被标识为$ {\mathrm{typ{e}}}_{i}=\text{text} $的文本情报块,由于其在输入数据中已具备良好的段落结构,MISM模块将其内容作为后续跨模态关联与TTP映射等分析环节的直接输入。此步骤确保原始文本信息的无损流转,为后续的上下文理解提供了基础。

2.2.2 视觉信息增强

MISM模块采用一种OCR(Optical Character Recognition)与VLM(Vision-Language Model)协同互补的策略:以OCR保障关键文本证据提取的精确性,同时以VLM提供对图像整体内容和逻辑关系的深度语义理解。这种设计确保了从每个视觉情报块中既能获取无损的原子信息,又能把握其宏观的战术意图。该协同机制包含两个并行的处理流。
(1)光学字符识别文本提取
利用OCR技术,从图像中提取所有可识别的字面文本。此流程对于代码片段、命令行输出、GUI界面文本或图表标签的截图至关重要。例如,针对“毒云藤”报告[32]中混淆代码截图,OCR能够准确抽取出其中的代码字符,为后续恶意载荷分析提供直接的文本证据。
(2)视觉语言模型语义描述
采用先进的视觉语言模型对图像内容进行深度的语义理解与描述。与OCR关注字面内容不同,VLM旨在描述图像的整体内容、内部元素关系及其在网络安全领域的特定意图。以“毒云藤”报告中的攻击流程图为例,VLM不仅能识别“攻击者”“钓鱼网页”“C2”等节点,更能生成一段完整的描述整个攻击链条的自然语言文本(即$ {\mathrm{caption}}\_{\mathrm{ llm}} $字段),清晰阐述从初始“钓鱼”到最终远程控制的每一个步骤和逻辑关系。
通过上述处理,文本块经规范化后保持原有三元组结构,而图像块则被增强为五元组,新增$ {\mathrm{ocr}}\_ {\mathrm{tex{t}}}_{i} $(OCR提取文本)和$ {\mathrm{caption}}\_ {\mathrm{ll{m}}}_{i} $(VLM语义描述)两个字段。

2.3 基于STIX本体的信息抽取

经过MISM模块的处理后,原始报告已被转化为一系列包含显式文本信息的增强情报块。然而,这些文本单元(无论是原始文本段落,还是由VLM生成的图像描述)本质上仍是非结构化的自然语言。为进行后续的逻辑推理与知识映射,必须从中提取出原子化的遵循统一规范的结构化信息。因此,本框架在此阶段引入了本体信息抽取流程。
该流程的核心目标,是将每一个文本单元转化为定义3中所描述的结构化“证据”集合。为确保抽取出的知识具有良好的规范性、互操作性与领域权威性,本框架采用业界公认的STIX 2.0标准作为核心威胁本体。STIX 2.0为网络安全领域中的各类对象(STIX Domain Objects,SDO)和关系(STIX Relationship Objects,SRO)提供了严谨的定义,涵盖了从攻击组织(Threat Actor)、恶意软件(Malware)到基础设施(Infrastructure)等各类实体,以及它们之间如“使用”(uses)、“针对”(targets)等多种关系。
本环节同样利用LLM的ICL能力。通过构建一个内嵌了STIX 2.0核心本体定义的ICL提示,可以引导LLM在零样本或少样本条件下,扮演一个精通STIX标准的威胁情报分析师,从输入的文本中精准地识别实体并抽取出“主语—关系—宾语”三元组。如图2所示,该提示的设计不仅明确了任务目标,还通过高质量的示例,教会LLM如何处理CTI语境下的复杂句式和专业术语。
图 2 基于 STIX 本体的信息抽取

Fig.2 Information extraction based on the STIX ontology

该ICL任务被应用于MISM模块输出的每一个文本单元。其输出的JSON格式三元组列表,将被封装成定义3所描述的“证据”对象,并赋予唯一的$ {\mathrm{i{d}}}_{e} $和来源信息$ {\mathrm{sourc{e}}}_{b} $。这一流程确保了所有后续分析都建立在遵循业界标准、结构统一的原子化知识单元之上,为实现高精度的跨模态关联和TTP映射提供了可靠的数据基础。

2.4 基于上下文学习的图文证据协同推理

该模块的核心功能不仅在于识别并建立不同模态情报块之间的语义链接,更重要的是通过协同推理识别和过滤可能存在的模态间冲突或错误。当OCR提取的字面文本与VLM生成的语义描述存在不一致时,该模块利用LLM的上下文理解能力进行深度语义分析,判断这种不一致是源于功能定位差异(如OCR关注字面内容而VLM关注整体逻辑)还是真正的错误,从而确保只有经过协同验证的高质量证据才会被纳入后续的TTP映射流程。
经过MISM模块的结构化预处理后,原始报告中的文本和图像信息被转化为一系列标准化的情报块。然而,这些情报块在初始状态下仍是相互独立的,文本中描述的行为与图像中展示的场景之间的内在联系尚未建立。为解决此“图文分离”问题,本框架设计了跨模态证据关联模块,其核心功能是识别并建立不同模态情报块之间的语义链接。为实现这一目标,首先对情报块中提取的原子信息进行形式化定义。
定义 3(证据)证据$ e $是从单个情报块中提取出的、描述一个独立事实或行为的最小信息单元。每个证据均可由一个四元组表示$ e=\left({\mathrm{i{d}}}_{e}, {\mathrm{sourc{e}}}_{b},{\mathrm{type}}, {\mathrm{conten{t}}}_{e}\right) $,其中,ide为证据的唯一标识符;$ {\mathrm{sourc{e}}}_{b} $为来源情报块的ID,确保可溯源性;$ {\mathrm{typ{e}}}_{i}\in \{\text{text}, \text{image}\} $表示证据的来源模态;$ {\mathrm{conten{t}}}_{e} $为结构化表示的证据内容,例如一个“实体—关系—实体”三元组。该模块的核心技术是利用大语言模型的少样本ICL 能力。通过构建一个包含任务描述、角色定义以及少量高质量示例的提示(Prompt),可以引导LLM在不进行任何模型参数微调的情况下,学习并执行复杂的跨模态指代消解和事件链接任务。LLM被要求判断任意一对来自不同模态的证据是否指向同一实体或事件,从而在它们之间建立关联。
当关联性为true时,框架将在两个对应证据的元数据中记录下彼此的ID,从而建立一条明确的跨模态链接。此过程打破了传统流水线方法中“信息孤岛”的局限,实现了图文证据的协同验证与信息互补。例如,在“毒云藤”的案例中,通过此关联,系统便确认了流程图(视觉证据)中的攻击者角色就是毒云藤组织(文本证据),为后续精准的TTP映射提供了坚实的基础。
以“毒云藤”报告为例,当系统需要判断文本块中提取的文本证据与图像块中提取的视觉证据是否相关时,将构建ICL提示,跨模态证据关联提示词如图3所示。
图 3 跨模态证据关联提示词

Fig.3 Cross-modal evidence association prompt words

2.5 基于结构化S-RAG的TTP映射机制

在获得经过跨模态关联的证据簇后,框架进入TTP精准映射阶段。本阶段的核心创新在于提出了结构化检索增强生成(Structured Retrieval-Augmented Generation,S-RAG)机制,该机制超越了传统RAG的“检索+生成”范式。传统RAG将ATT&CK知识库视为非结构化文本,主要依赖语义相似度进行模糊匹配,这在面对语义相近但细节有别的技术时容易产生映射错误甚至“幻觉”。例如,当证据描述“通过恶意链接投递文件”时,传统方法可能在T1566.001(钓鱼附件)和T1566.002(钓鱼链接)之间产生混淆,因为两者的文本描述高度相似。本框架的创新在于将ATT&CK知识库从文本集合提升为结构化数据库,利用其固有的平台、数据源、战术等元数据,通过专门设计的ICL提示引导LLM进行“交叉质询”式验证。这种设计要求LLM不仅判断语义相似度,更要验证客观的结构化条件是否匹配,从而将开放式的语义匹配转化为有明确约束条件的结构化验证任务,有效降低了语义模糊导致的映射幻觉。
本阶段通过一种创新的结构化S-RAG机制,将融合后的证据精准映射到MITRE ATT&CK技术。该映射过程可形式化定义为$ {\mathrm{Map}} $函数。如式(2)所示,其输入为一个由多个已关联证据组成的证据簇$ {E}_{{\mathrm{clu}}} $,输出为最匹配的MITRE ATT&CK技术ID及其置信度$ {\mathrm{Conf}} $
$ \begin{matrix}\left({T}_{{\mathrm{id}}},{\mathrm{Conf}}\right)={\mathrm{Map}}\left({E}_{{\mathrm{clu}}}\right) \end{matrix} $
$ {\mathrm{Map}} $函数的实现可分解为两个核心子步骤。
首先,通过语义检索,利用文本嵌入模型和向量检索技术,从预构建的MITRE ATT&CK技术描述向量库中快速召回Top-K个候选技术,该过程遵循式(3)。
$ \begin{matrix}{\mathrm{Ca}}={{\mathrm{Retrieve}}}_{{\mathrm{semantic}}}\left({E}_{{\mathrm{clu}}},K\right) \end{matrix} $
图4所示,对于“毒云藤”报告中描述“攻击者制作钓鱼页,诱导用户下载执行文件”的证据簇,语义检索会返回T1566.002: Spearphishing Link、T1204: User Execution等候选技术。
图 4 TTP映射模块(S-RAG)提示词

Fig.4 TTP mapping module (S-RAG) prompt words

其次,框架将进入结构化验证环节。该环节是S-RAG机制的核心创新。框架不再依赖于传统RAG模糊的语义相似度匹配,而是将MITRE ATT&CK知识库视为一个结构化的数据库。利用mitreattack-python工具包[13],为每个候选技术提取其平台、数据源等结构化元数据,并通过ICL提示引导LLM对证据簇与这些元数据进行“交叉质询”,以验证匹配性并评估置信度,如公式(4)所示。
$ \begin{matrix}{\mathrm{Cof}}={{\mathrm{Verify}}}_{{\mathrm{structure}}}\left({E}_{c},{T}_{ca}\right) \end{matrix} $
通过这种方式,TTP映射从一个开放式的文本理解问题,转化为一个有据可循、条件明确的结构化验证任务,从而极大地约束了LLM的推理空间,显著降低了语义模糊性导致的映射不准及“幻觉”问题。

2.6 生成过程可审计的可解释性报告

为保障自动化分析结果的可靠性与透明度,M2A-TTP框架在TTP映射之后引入了最后一个核心环节:可解释性生成与验证。在网络安全等高风险决策领域, LLM潜在的“幻觉”问题以及其推理过程的不透明性,是阻碍其在关键任务中被信任和应用的主要障碍。因此,本模块的核心目标是构建一个内置的“事实核查”与“决策反思”机制,旨在解决LLM的“黑盒”问题,确保框架的每一个输出都有据可循、有理可依。
该环节的核心机制是基于ICL的自我批判流程。具体而言,框架利用一个独立的ICL任务为LLM设定“安全审计员”的审慎角色。该角色会接收上一模块输出的完整映射结果,其中包含了候选TTP、所依据的证据簇以及S-RAG的推理路径。随后,在ICL的引导下,LLM以批判性视角对该映射结论的证据充分性与逻辑一致性进行二次审视,执行包括但不限于以下的思考:证据簇中的所有证据是否都强相关?S-RAG的推理路径是否严谨?是否存在其他可能的TTP解释?最终,LLM会综合这些反思,评估出一个最终的置信度,并生成一段批判性的评语。
需要特别说明的是,本模块在设计时充分考虑了LLM自我评估中可能存在的自我偏好偏差问题[33]。为避免陷入“自证陷阱”,本文采取了三重保障机制:①批判性角色设定:为验证环节设定了“首席安全审计员”的角色,该角色的职责被明确定义为“挑战结论而非接受结论”,要求对映射结果持批判性视角进行独立评估。例如,在提示词中明确要求审计员“对AI分析师提交的TTP映射报告进行最终的质量控制与审查”,而非简单接受其结论。这种设计确保了验证过程的审慎性;②结构化验证约束:验证模块对S-RAG提供的结构化证据链(如ATT&CK元数据)进行逐项核查,通过评估证据的充分性、推理逻辑的连贯性以及是否存在其他可能的解释,这种基于客观标准的多维度审查方式显著降低了主观偏好的影响。在实际应用中,即使面对看似合理的映射结果,审计员也会质疑其充分性。例如,针对一个映射到“Valid Accounts”(T1078)的结论,审计员会指出“证据虽显示存在登录行为,但未提供关键信息以指明账户是否为‘有效账户’(如是否为窃取而非爆破的凭证)”,从而将置信度评定为中等,这与D’Souza等[30]提出的外部知识约束策略的设计理念相似;③不确定性量化机制:当发现证据存在矛盾、推理存在跳跃或结论的确定性不足时,系统会在置信度评分中予以反映,并在审计评语中明确指出潜在的不确定性和风险点。这些机制确保了验证过程的独立性和批判性,使其能够有效发挥质量把关作用,而非盲目认可前序结论。
该模块的最终输出是一份结构化的“可解释性审计报告”,它不仅是一个结论,更是一份完整的可供人类专家审查的“分析档案”。该报告的数据结构遵循预定义的JSON结构,其核心字段定义见表1。这份报告的设计旨在成为一个人机协同的接口,其中每个字段都为提升可解释性服务:证据支持字段提供了数据层面的可溯源性;推理路径字段提供了模型推理层面的可追溯性;而审计评语字段则提供了一种元认知层面的反思,揭示了模型对其自身结论的确定性评估。
表 1 可解释性审计报告的结构定义

Table 1 Structural definition of the explainable audit report

字段 数据类型 说明
技术ID String 映射的MITRE ATT&CK技术ID
技术名称 String 对应的技术名称
置信度分 Float 模型对映射结果的置信度评估(0-1)
证据支持 Array 支持该结论的证据ID列表,用于溯源
推理路径 String S-RAG模块得出结论的推理路径摘要
审计评语 String 对映射结论的最终评语,指出其优势或不确定性
此外,该自我批判机制在控制系统误差传播方面也发挥了关键作用。由于框架采用流水线结构,前序模块(如OCR提取或VLM描述)的潜在噪声存在累积风险。然而,本阶段的“审计员”角色通过独立审查证据支持与结论之间的逻辑一致性,能够有效识别上游信息偏差导致的推理断层。一旦发现证据链无法支撑结论,系统将自动降低该映射结果的置信度。这种“中间关联校验”(第2.4节的跨模态证据关联)与“末端审计把关”相结合的方式,有效阻断了单一模态的感知错误向最终知识图谱的传播,保证了分析结果的可靠性。
更进一步,该验证模块在抑制LLM“幻觉”方面也起到了关键作用。当S-RAG阶段的推理过程存在逻辑跳跃,或证据与所选技术的结构化元数据(如平台、数据源)不完全匹配时,审计员会识别出这种潜在的幻觉倾向,并在审计评语中明确标注风险。例如,若证据仅描述“下载恶意文件”但被映射到需要“邮件协议”数据源的技术,验证模块会发现数据源不匹配,从而降低置信度或提示人工复核。这种基于结构化约束的幻觉检测,结合S-RAG的预防机制,形成了双重保障体系。
以“毒云藤”报告中的T1566.002映射为例,该模块构建的ICL,可解释性生成与验证模块提示词如图5所示。
图 5 可解释性生成与验证模块提示词

Fig.5 Explanation generation and verification module prompt words

3 实验

本节通过一系列实验,从多个维度对M2A-TTP框架的有效性进行全面、定量的评估。实验围绕以下核心研究问题展开。
问题1 多模态三元组提取有效性。本框架从图文并茂的CTI报告中提取实体关系三元组的性能如何?与现有的SOTA方法(EXTRACTOR,CTINEXUS)比表现如何?
问题2 TTP技术识别的模块贡献度分析。跨模态证据关联与S-RAG如何影响最终TTP技术识别的性能?
问题3 本文S-RAG机制的效率评估。S-RAG机制引入结构化验证环节后,相比传统RAG在处理时间和资源消耗方面的额外开销如何?这一开销是否在可接受范围内?

3.1 实验设置

为有效验证本框架性能,本文首先构建了一个新的多模态评估数据集。该数据集包含从AVERTIUM[33]、360威胁情报中心[34]等权威平台收集的50篇近期图文CTI报告。由领域内3名研究生对报告中的实体、关系及TTP技术进行交叉验证标注,并明确区分证据的图文来源,以形成高质量的基准真相。为定量评估框架的性能,本文采用信息抽取领域标准的评估指标:精确率、召回率和F1分数。一个提取的三元组被视为正确,当且仅当其主语、关系、宾语3个元素与基准真相中的三元组在语义上完全匹配。一个识别的TTP技术被视为正确,当且仅当其技术ID与基准真相完全一致。
实验选取了两种SOTA方法作为基线:①基于模型微调的EXTRACTOR,该方法通过微调BERT模型抽取三元组,实验采用其开源实现;②基于ICL的CTINEXUS。为确保对比焦点在于框架设计而非LLM模型本身,实验依据论文开源实现,并将其骨干模型统一为本框架所使用的gemini-2.5-flash(知识截止日期为2025年1月,测试版本为2025年6月更新版)。为保证公平对比,鉴于基线模型仅能处理文本,实验将本框架第一阶段(MISM模块)处理后的全部文本信息(原始文本、从图像中提取的OCR文本以及由2.2节视觉语言模型生成的图像语义描述)拼接为统一的纯文本文档作为其输入。

3.2 多模态三元组提取性能对比

为回答问题1,本实验旨在评估M2A-TTP框架在多模态环境下,端到端提取实体关系三元组的综合性能,并与EXTRACTOR和CTINEXUS两种SOTA基线方法进行比较。实验在3.1节所述的数据集上进行。
表2 所示,M2A-TTP框架在所有评估指标上均显著优于两种基线模型。相较于基于模型微调的EXTRACTOR,本框架性能优势明显,其原因在于EXTRACTOR受限于训练语料,对VLM生成的图像描述等新范式文本泛化能力不足,导致召回率较低。相较于同样基于LLM的CTINEXUS,本框架的优势源于其跨模态证据关联机制。CTINEXUS在处理拼接后的“扁平化”文本时,无法建立图文之间的内在对应关系。而M2A-TTP通过动态链接图文证据,能够抽取出必须结合两种模态才能确认的三元组,因此在召回率上表现更优。
表 2 M2A-TTP框架与基线模型在三元组提取任务上的性能比较

Table 2 Performance comparison of the M2A-TTP framework and baseline models on the triplet extraction task

方法 精确率 召回率 F1分数
EXTRACTOR 0.682 0.551 0.609
CTINEXUS 0.905 0.883 0.897

3.3 TTP技术识别消融研究

为回答问题2,本节通过消融研究定量分析了M2A-TTP框架中两大核心创新机制对TTP技术识别性能的贡献。实验对比了3种框架变体:作为性能基准的完整版M2A-TTP;移除了跨模态证据关联机制的w/o Cross-Modal变体,该变体独立处理图文证据再合并结果;以及将S-RAG降级为传统RAG的w/o S-RAG变体,该变体在映射时仅依赖非结构化的文本描述。各变体在TTP技术识别任务上的性能结果如表3 所示,去除S-RAG后精确率从0.925降至0.824,证明了结构化验证机制在避免映射错误方面的关键作用;去除跨模态关联后召回率从0.899降至0.803,说明该机制在挖掘跨模态复杂关系方面的重要性。这些结果表明,本文框架的核心价值在于通过跨模态协同推理和结构化知识约束两大创新机制,系统地提升了多模态威胁情报分析的准确性和完整性。
表 3 各变体TTP技术识别任务上的性能对比

Table 3 Performance comparison of different variants on the TTP technique identification task

方法精确率召回率F1分数
w/o S-RAG0.8240.8910.856
w/o Cross-Modal0.9150.8030.855
M²A -TTP0.9250.8990.912

3.4 效率分析

为评估S-RAG机制的实际开销与实用性,本文在相同的50份多模态CTI报告数据集上,对比了传统RAG与S-RAG在处理效率方面的差异。需要说明的是,传统RAG方法在进行TTP映射时,将MITRE ATT&CK知识库视为非结构化的文本描述集合,主要依赖语义相似度进行检索和匹配,即通过文本嵌入模型计算证据与ATT&CK技术描述之间的语义相似度,选取Top-K个候选技术后直接由LLM基于文本描述进行最终判断。相比之下,本文提出的S-RAG在语义检索的基础上增加了结构化验证环节:利用ATT&CK知识库固有的结构化元数据(如平台、数据源、战术等),通过专门设计的ICL提示引导LLM对候选技术进行“交叉质询”式验证,将开放式的语义匹配转化为有明确约束条件的结构化验证任务。
实验在相同的硬件环境下进行,统计了每份报告的平均处理时间和Token消耗量。如表4所示,相比传统RAG,S-RAG平均每份报告的处理时间增加约3.3 s(从75.24 s增至78.52 s),Token消耗增加约570个(从2 853增至3 420)。这主要源于S-RAG引入了额外的结构化元数据输入和验证模块提示词。
表 4 S-RAG与传统RAG的效率对比

Table 4 Efficiency comparison between S-RAG and traditional RAG

方法 平均耗时 (秒/篇) 平均 Token 消耗
(Token/篇)
F1 分数
传统RAG 75.24 2 853 0.856
S-RAG 78.52 3 420 0.912
然而,这一额外开销是完全可接受的。威胁情报分析通常不是毫秒级实时任务,每份报告增加3.3 s的处理时间在实际SOC运营中不会造成明显影响。更重要的是,S-RAG的F1分数相比传统RAG显著提升了5.6个百分点(从0.856提升至0.912)。在网络安全领域,TTP映射的准确性直接关系到防御策略的有效性,错误的映射可能导致严重的安全误判。因此,S-RAG以较小的边际成本(约4.4%的时间增加)换取了显著的性能收益,这在实际应用中是极具价值的权衡。

4 结束语

本文提出并实现了一种名为M2A-TTP的多模态模块化分析框架,旨在解决现有方法在处理图文并茂的威胁情报时,存在的“模态鸿沟”问题。该框架通过一个创新的多阶段工作流,并利用结构化S-RAG技术实现精准的TTP映射,最后通过自我批判机制确保结果的可靠与透明,将多模态威胁情报分析从简单的信息拼接提升至真正的协同推理层面。实验结果验证了本框架的有效性,证明了与纯文本及简单流水线方法相比,M2A-TTP在知识抽取的准确性与完整性上均有显著提升,为自动化构建高保真、可追溯的网络安全知识图谱提供了一种可靠的新范式。
未来的研究可聚焦于以下方面:将分析单元从单个报告扩展至跨报告的联合分析,以挖掘更宏观的攻击活动;利用本框架生成的结构化数据对领域专用模型进行微调,以降低运行成本。值得注意的是,本框架当前采用的文本化策略虽然在可解释性和工程实现上具有优势,但随着威胁情报领域专用多模态预训练模型的发展,未来可探索引入视觉特征嵌入等更直接的多模态对齐方式,这可能捕捉更细粒度的跨模态语义关系,但需要解决领域适配和可解释性等问题。 此外,探索知识图谱的动态演化与攻击行为预测,实现从“事后归因”到“事前预警”的跨越,也是重要的研究方向。
1
Chen Y R, Cui M J, Wang D, et al. A survey of large language models for cyber threat detection[J]. Computers & Security, 2024, 145, 104016.

DOI

2
Rahman M R, Hezaveh R M, Williams L. What are the attackers doing now automating cyberthreat intelligence extraction from text on pace with the changing threat landscape: a survey[J]. ACM Computing Surveys, 2023, 55 (12): 1- 36.

DOI

3
Fieblinger R, Alam M T, Rastogi N. Actionable cyber threat intelligence using knowledge graphs and large language models[C]//Proceedings of the 2024 IEEE European Symposium on Security and Privacy Workshops (EuroS&PW) . Piscataway: IEEE Press, 2024: 100-111.

4
田志宏, 方滨兴, 廖清, 等. 从自卫到护卫: 新时期网络安全保障体系构建与发展建议[J]. 中国工程科学, 2023, 25 (6): 96- 105.

Tian Z H, Fang B X, Liao Q, et al. Cybersecurity assurance system in the new era and development suggestions thereof: from self-defense to guard[J]. Strategic Study of CAE, 2023, 25 (6): 96- 105.

5
Structured threat information expression (STIX)[EB/OL]. (2024-07-24) [2025-08-15]. HTTPs://oasis-open.github.io/cti-documentation/.

6
Rastogi N, Dutta S, Zaki M J, et al. MALOnt: an ontology for malware threat intelligence[M].Deployable Machine Learning for Security Defense. Cham: Springer International Publishing, 2020: 28-44.

7
Zhang H X, Shen G W, Guo C, et al. EX-action: automatically extracting threat actions from cyber threat intelligence report based on multimodal learning[J]. Security and Communication Networks, 2021, 2021, 5586335.

DOI

8
Li H X, Yang Z M, Ma Y S, et al. MM-forecast: a multimodal approach to temporal event forecasting with large language models[C]//Proceedings of the 32nd ACM International Conference on Multimedia. New York: ACM, 2024: 2776-2785.

9
Zhang Y H, Zhao X Y, Ma Y S, et al. MM-AttacKG: a multimodal approach to attack graph construction with large language models[PP/OL]. V1. arXiv (2025-06-20)[2025-08-25]. https://doi.org/10.48550/arXiv.2506.16968.

10
Huang H L, Nie Z J, Wang Z Q, et al. Cross-modal and uni-modal soft-label alignment for image-text retrieval[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2024, 38 (16): 18298- 18306.

DOI

11
Team G, Anil R, Borgeaud S, et al. Gemini: a family of highly capable multimodal models[PP/OL]. V5. arXiv (2025-05-09)[2025-08-25]. https://doi.org/10.48550/arXiv.2312.11805.

12
Dherin B, Munn M, Mazzawi H, et al. Learning without training: The implicit dynamics of in-context learning[PP/OL]. V3. arXiv [2025-12-22]. https://doi.org/10.48550/arXiv.2507.16003.

13
MitreAttackData—mitreattack-python 5.1.0 documentation[EB/OL]. [2025-09-12]. https://mitreattack-python.readthedocs.io/en/latest/mitre_attack_data/mitre_attack_data.html#mitreattackdata-ref.

14
Husari G, Al-Shaer E, Ahmed M, et al. TTPDrill: automatic and accurate extraction of threat actions from unstructured text of CTI sources[C]//Proceedings of the 33rd Annual Computer Security Applications Conference. New York: ACM, 2017: 103-115.

15
Liao X J, Yuan K, Wang X F, et al. Acing the IOC game: toward automatic discovery and analysis of open-source cyber threat intelligence[C]//Proceedings of the 2016 ACM SIGSAC Conference on Computer and Communications Security. New York: ACM, 2016: 755-766.

16
Gao P, Shao F, Liu X Y, et al. Enabling efficient cyber threat hunting with cyber threat intelligence[C]//Proceedings of the 2021 IEEE 37th International Conference on Data Engineering (ICDE). Piscataway: IEEE Press, 2021: 193-204.

17
Shi P, Lin J. Simple BERT models for relation extraction and semantic role labeling[PP/OL]. V1. arXiv (2019-04-10)[2025-08-25] https://doi.org/10.48550/arXiv.1904.05255.

18
Satvat K, Gjomemo R, Venkatakrishnan V N. Extractor: extracting attack behavior from threat reports[C]//Proceedings of the 2021 IEEE European Symposium on Security and Privacy (EuroS&P). Piscataway: IEEE Press, 2021: 598-615.

19
Li Z Y, Zeng J, Chen Y, et al. AttacKG: constructing technique knowledge graph from cyber threat intelligence reports[C]//Computer Security – ESORICS 2022. Cham: Springer, 2022: 589-609.

20
Alam M T, Bhusal D, Park Y, et al. Looking beyond IoCs: automatically extracting attack patterns from external CTI[C]//Proceedings of the 26th International Symposium on Research in Attacks, Intrusions and Defenses. New York: ACM, 2023: 92-108.

21
崔孟娇, 姜政伟, 陈奕任, 等. 面向威胁情报的大语言模型技术应用综述[J]. 信息安全学报, 2024, 9 (5): 1- 25.

DOI

Cui M J, Jiang Z W, Chen Y R, et al. Applications of large language models technology for threat intelligence: a survey[J]. Journal of Cyber Security, 2024, 9 (5): 1- 25.

DOI

22
Ayoade G, Chandra S, Khan L, et al. Automated threat report classification over multi-source data[C]//Proceedings of the 2018 IEEE 4th International Conference on Collaboration and Internet Computing (CIC) . Piscataway: IEEE Press, 2018: 236-245.

23
Siracusano G, Sanvito D, Gonzalez R, et al. Time for action: automated analysis of cyber threat intelligence in the wild[PP/OL]. V1. arXiv (2023-07-14))[2025-08-25]. https://doi.org/10.48550/arXiv.2307.10214.

24
Deng G L, Liu Y, Mayoral-vilches V, et al. PentestGPT: an LLM-empowered automatic penetration testing tool[PP/OL]. V2. arXiv (2024-06-02))[2025-08-25]. https://doi.org/10.48550/arXiv.2308.06782.

25
Fang R, Bindu R, Gupta A, et al. LLM agents can autonomously exploit one-day vulnerabilities[PP/OL]. V2. arXiv (2024-04-17))[2025-08-25]. https://doi.org/10.48550/arXiv.2404.08144.

26
Kulsum U, Zhu H T, Xu B W, et al. A case study of LLM for automated vulnerability repair: assessing impact of reasoning and patch validation feedback[C]//Proceedings of the 1st ACM International Conference on AI-Powered Software. New York: ACM, 2024: 103-111.

27
Cheng Y T, Bajaber O, Tsegai S A, et al. CTINexus: automatic cyber threat intelligence knowledge graph construction using large language models[C]//Proceedings of the 2025 IEEE 10th European Symposium on Security and Privacy (EuroS&P). Piscataway: IEEE Press, 2025: 923-938.

28
Hu Y L, Zou F T, Han J J, et al. LLM-TIKG: threat intelligence knowledge graph construction utilizing large language model[J]. Computers & Security, 2024, 145, 103999.

DOI

29
Xu W D, Zhu G L, Zhao X D, et al. Pride and prejudice: LLM amplifies self-bias in self-refinement[C]//Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Stroudsburg, PA, USA: ACL, 2024: 15474-15492.

30
D’Souza J, Babaei Giglou H, Münch Q. YESciEval: robust LLM-as-a-judge for scientific question answering[C]//Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Stroudsburg, PA, USA: ACL, 2025: 13749-13783.

31
Xiao N, Lang B, Wang T, et al. APT-MMF: an advanced persistent threat actor attribution method based on multimodal and multilevel feature fusion[J]. Computers & Security, 2024, 144, 103960.

DOI

32
360威胁情报中心. 警惕APT-C-01(毒云藤)组织的钓鱼攻击[EB/OL]. (2024-11-29) [2025-08-25]. https://mp.weixin.qq.com/s/6wVfE9SE3wVuazxVppe3tA.

33
Avertium. Avertium cyber fusion centers. [EB/OL]. (2025-07-29) [2025-08-25]. https://www.avertium.com/resources.

34
Threat Intelligence Center. Be alert to phishing attacks by APT-C-01 (Duyunteng) group [EB/OL]. (2024-11-29) [2025-08-25]. https://mp.weixin.qq.com/s/6wVfE9SE3wVuazxVppe3tA.

Outlines

/