综述

基于大模型的可信威胁情报信息抽取综述

  • 张仰森 1, 2 ,
  • 向尕 , 1, 2, * ,
  • 孙露 1 ,
  • 齐睿 1 ,
  • 谭自程 1 ,
  • 曹骏 1 ,
  • 李胜豪 1 ,
  • 苑祥祥 1
展开
  • 1. 北京信息科技大学计算机学院,北京 102206
  • 2. 北京信息科技大学智能信息处理研究所,北京 102206

收稿日期: 2025-10-10

  网络出版日期: 2026-05-06

基金资助

北京市自然科学基金-小米创新联合基金(L233008)

版权

版权所有©《网络空间安全科学学报》编辑部 2025

Survey of trustworthy threat intelligence information extraction based on large models

  • Zhang Yangsen 1, 2 ,
  • Xiang Ga , 1, 2, * ,
  • Sun Lu 1 ,
  • Qi Rui 1 ,
  • Tan Zicheng 1 ,
  • Cao Jun 1 ,
  • Li Shenghao 1 ,
  • Yuan Xiangxiang 1
Expand
  • 1. College of Computer Science, Beijing Information Science and Technology University, Beijing 102206, China
  • 2. Institute of Intelligent Information Processing, Beijing Information Science and Technology University, Beijing 102206, China

Received date: 2025-10-10

  Online published: 2026-05-06

Copyright

Copyright ©2025 Journal of Aeronautical Materials. All rights reserved.

摘要

网络威胁情报(Cyber Threat Intelligence,CTI)分析技术可以有效减少信息差,提高主动防御能力。目前,威胁情报分析多以专家人工分析为主,自动化和智能化程度尚待提高。本文旨在系统梳理基于大模型的可信威胁情报信息抽取研究进展。首先定义了可信威胁情报信息抽取的总体任务框架,然后对任务框架中的数据、抽取模型、可信性评估和应用等核心部分展开了深入分析。在数据部分,对CTI数据源和数据集进行了分类和总结,对适用于大模型的新型数据集构建进行了重点分析;在抽取模型部分,分别就实体及关系、事件及关系抽取的研究做了总结分析,重点讨论了基于大模型的研究进展。考虑到可信性直接影响CTI应用,进一步展开了基于大模型的信息抽取可信性分析,随后对CTI应用情况进行了分类梳理,最后对面临的挑战和未来的研究方向进行了展望,旨在为大模型应用于CTI提供参考框架和持续研究思路,推动基于大模型CTI信息抽取的研究发展。

本文引用格式

张仰森 , 向尕 , 孙露 , 齐睿 , 谭自程 , 曹骏 , 李胜豪 , 苑祥祥 . 基于大模型的可信威胁情报信息抽取综述[J]. 网络空间安全科学学报, 2025 , 3(6) : 2 -18 . DOI: 10.20172/j.issn.2097-3136.250601

Abstract

Cyber Threat Intelligence (CTI) analysis techniques can reduce information asymmetry and enhance proactive defense capabilities. Currently, threat intelligence analysis relies primarily on manual expert interpretation, with limited automation and intelligence analysis. This survey systematically reviews research advances in trustworthy threat intelligence information extraction based on large models. First, a comprehensive task framework for trustworthy CTI information extraction is established, followed by an in-depth analysis of core components in the task framework, including data, extraction models, trustworthiness control, and applications. Regarding data, CTI data sources and datasets are categorized and summarized, with an emphasis on novel dataset construction methodologies applicable to large models. For extraction models, research on entity and relation extraction, as well as event and relation extraction, is synthesized, with a focus on advances leveraging large models. Given that trustworthiness directly impacts CTI applications, trustworthiness analysis of large model-based information extraction is further conducted, followed by a systematic review of CTI applications. Drawing on these analyses, challenges are identified and future research directions are proposed. This survey aims to provide a reference framework and research roadmap for large model applications in CTI and advance research on threat intelligence information extraction.

0 引言

在日趋激烈的网络攻防中,攻击手段层出不穷,攻击技术日趋复杂,网络威胁情报(Cyber Threat Intelligence,CTI)分析越来越受到学术界和企业界的重视。有研究认为CTI是关于攻击者及其动机、意图和方法的知识[1],但考虑到网络攻击场景涉及攻击者、被攻击者和安全防护方,三方之间存在千丝万缕的联系,因此本文认为CTI除覆盖攻击者外,还应扩展至被攻击方和安全防护方,以充分发掘彼此之间的联系,获取尽可能完备的“已知的未知”信息。CTI分析因具有较强的专业性,目前多以人工分析为主。但面向海量、多源异构、多模态CTI,仅靠人工分析远远不够,亟须开展CTI自动分析方法的研究。信息抽取技术作为CTI的主要分析技术之一,其目的是从网络威胁数据中抽取实体、事件和关系,从而获取关键信息,全方位增强感知、检测、研判、响应和溯源能力。抽取的信息可以构建知识图谱,如恶意软件知识图谱、多信息融合知识图谱等;也可以为入侵检测、态势感知等防护设备构建检测规则做参考;或者用于指导安全加固,提升网络和系统的安全性。
信息抽取通常依赖抽取模型完成,而模型的训练高度依赖标注数据,当前数据集普遍存在规模较小、分布不平衡、更新滞后等问题,制约了模型的训练和性能提升。抽取技术从机器学习、深度学习向大模型演进,抽取精度和准确性仍有待提高。随着生成式人工智能的迅猛发展,基于大模型的威胁情报分析技术受到人们的重视,但由于大模型技术的“幻觉”问题,基于大模型的CTI可信性面临前所未有的挑战,在CTI自动分析领域如何“安全地使用AI”值得探讨,对于这一具有巨大潜力和研究价值的方向,有必要根据最新的研究进行总结梳理,明晰挑战、思考应对策略,为后继研究奠定基础。
本文收集了2020年至今在权威学术期刊和国际会议上发表的84篇相关论文,通过分类梳理、定量分析和理论探讨,重点对基于大模型的威胁情报信息抽取方法进行了总结,讨论了目前的研究进展和存在的问题,并对未来的研究方向提出了建议。本文的主要贡献如下:
1)提出可信威胁情报信息抽取的总体任务框架,对涉及的数据、抽取模型和应用等核心要素进行分析,重点讨论大模型技术在CTI分析中的应用和研究进展;
2)强调CTI分析可信性的重要性,并对相关研究进展进行总结分析;
3)讨论了大模型、生成式AI引入的新问题和挑战,并分析了未来研究方向。

1 基于大模型的可信威胁情报信息抽取框架

1.1 威胁情报及信息抽取概念

CTI是对网络攻击者的动机、行为等进行收集、处理和分析的威胁行为知识集合[2]。其作用主要是基于威胁情报进行网络安全防御,能够及时分析已发生的入侵,对未来威胁态势进行预判,并据此评估潜在的安全风险以指导用户制定有效的安全决策,系统地化增强网络空间防御能力[3]
信息抽取通常被定义为从非结构化或半结构化文本中识别并提取预定义类别的结构化信息,包括命名实体识别、关系抽取和事件抽取等基础任务[4]。随着数据源多模态化,信息抽取向支持多模态方向演进。在CTI分析中可借助信息抽取技术,从海量威胁情报数据中抽取关键信息。

1.2 任务框架

基于大模型的可信威胁情报信息抽取总体任务框架如图1所示。
图 1 基于大模型的可信威胁情报信息抽取总体任务框架

Fig.1 Overall task framework for trustworthy threat intelligence information extraction based on large models

1)数据层,分为多源异构CTI数据源、预处理和数据标注3个部分。CTI数据源具有多源异构的特点,可获取结构化数据(如漏洞库、IoC数据库)、半结构化数据(如ATT&CK知识库)和非结构化数据(如安全报告、APT攻击分析报告),以及多模态CTI数据(如文本、图像、视频、代码片段等)。预处理阶段对数据进行清洗、筛选,通常基于脚本或包库进行自动化处理。数据标注包括人工、半自动和自动3种模式。人工模式依赖专家标注,半自动模式结合专家知识与自动化脚本,自动模式基于大模型进行数据标注,再由专家进行校验。
2)模型层,主要进行信息抽取与分析,包含CTI实体及关系抽取、CTI事件及关系抽取、TTPs(Tactics,Techniques,and Procedures)分类和多模态融合分析等。输出包括IoC指标、TTPs类别、实体、“实体—关系—实体”三元组、事件类型、事件触发词、事件论元和事件关系等。
3)可信性评估,包含数据源、数据集、抽取方法和情报共享4种可信性。其中抽取方法可信性可进一步分为判别式方法和生成式方法的可信性。
4)应用层,包括威胁知识库构建、威胁实时检测、威胁态势预测、攻击链路溯源及CTI共享等。
该框架反映了当前CTI领域中应用大模型技术的主要路线,体现了从多源数据处理到多元化应用的完整处理流程。

2 CTI数据源和数据集

CTI数据源来源广泛、数据庞杂,具有多源异构的特点,可分为两大类:文本和非文本(图片、视频等)。其中,文本类CTI根据结构化程度,分为结构化、半结构化和非结构化文本。随着AI技术的发展,威胁情报的信息抽取正从深度学习向大模型技术持续演进,数据源也从单一文本扩展至多模态数据。本节将遵循从数据源采集、本体结构定义、数据标注到数据集构建的处理流程(如图2所示),系统地分析面向CTI信息抽取的数据源与数据集现状、发展趋势和存在问题,并分析向大模型演进过程中对数据收集、数据集构建的新要求。
图 2 CTI数据源和数据集

Fig.2 CTI data sources and datasets

2.1 CTI数据源

数据源作为数据集构建的基础,其质量和多模态特性直接决定了抽取模型的性能。本文将CTI的多模态特性细分为传播载体多模态与情报内容多模态。①传播载体多模态主要包括文本类、图像、音视频及代码类等不同载体格式。其中CTI领域的图像数据多散落在CTI分析报告中,包括攻击链流程图、网络拓扑图、恶意代码截图等[5],具有多样性和专业性特点。目前CTI音视频研究相对较少,有待进一步展开。②情报内容多模态反映CTI信息抽取过程中不同情报对象所呈现的异构特征,如漏洞相关的实体或者APT攻击事件等。在同一对象的情报来源中,特征种类又可划分为原始数据特征与自然语言特征两类[6-7]。原始数据特征包含IP、URL、MD5等失陷指标;自然语言特征涵盖语法语义、图谱、事件和战术技术等。
基于结构化程度、情报类型及载体模态特征,本文对现有比较成熟的常用CTI数据源进行系统分类(见表1),并列出了URL及数据源相关描述。除数据源内容以外,数据源可信性应受到充分重视,一般而言,权威漏洞和漏洞发布网站、政府工作报告等可信程度高,博客类来源可信性需谨慎评估。
表 1 常用CTI数据源信息与分类

Table 1 Information and classification of commonly used CTI data sources

结构类型 情报内容 载体模态特征 URL示例 URL描述
结构化 漏洞和缺陷 文本/代码片段 https://nvd.nist.gov/ 美国国家漏洞数据库
https://cve.mitre.org/ 通用漏洞披露数据库
IoC数据库 文本/代码片段 https://whois.whoisxmlapi.com/ 域名查询和IP地理定位服务
https://www.farsightsecurity.com/ DNS和网络流量分析数据库
半结构化 威胁描述平台 文本/代码片段 https://otx.alienvault.com/ 开放的威胁情报共享平台
https://exchange.xforce.ibmcloud.com/ IBM威胁情报和漏洞研究平台
ATT&CK知识库 文本/代码片段 https://attack.mitre.org/ 网络攻击战术、技术和过程知识库
非结构化 政府综合情报报告 文本/图像 https://www.cisa.gov/ 美国网络安全与基础设施安全公告
https://www.cnnvd.org.cn/ 中国国家信息安全漏洞库公告
https://www.jpcert.or.jp/ 日本计算机应急响应协调中心公告
https://www.cirt.gov.bd/ 孟加拉国政府计算机事件响应公告
威胁警告和博客等 文本/图像 https://press.kaspersky.com/ 卡巴斯基网络安全威胁情报
https://www.trellix.com/ McAfee和FireEye威胁情报
https://www.security.com/ 博通安全新闻和资源平台
https://ti.qianxin.com/ 奇安信威胁情报中心
https://x.threatbook.com/ 微步在线中文威胁情报社区
目前,CTI数据源虽然呈现出多模态融合趋势,但是对多模态数据源的研究还不充分。对图像内容的多样化特征还需要进一步研究。例如,年度分析报告中的图片更偏向趋势性分析和攻击路径描述,而技术细节报告中的图片通常包含较多恶意代码片段或流量日志截图,应开展分类研究。此外,在视音频数据方面,仍缺乏可信且具有一定规模的数据源。

2.2 本体结构定义

CTI本体结构定义通常根据抽取任务的目标来决定,并与常用的威胁情报共享标准(见表2)对接。其中STIX标准通过TAXII协议进行共享[14],并基于MAEC、CAPEC和CybOX针对不同主题进行扩展[15]。此外,STIX还支持ATT&CK框架下的TTPs情报信息共享[16],是当前覆盖范围最广、分类最详尽的威胁情报共享标准之一。这些标准适用于不同的威胁情报研究对象,例如,实体关系的本体定义常参考STIX标准,TTPs的本体定义则常结合ATT&CK标准,而事件触发词和论元等定义则常结合多种标准(如CAPEC、ATT&CK等)。这种与标准结合定义本体的方式,不但能更为完备地定义本体结构,同时也极大地提高了威胁情报的可操作性与可共享性。
表 2 威胁情报共享标准

Table 2 Threat intelligence sharing standards

标准 描述
MAEC 标准化定义,用于描述恶意软件结构化信息[8]
CAPEC 标准化定义,用于描述常见攻击模式[9]
CybOX 标准化定义,用于描述网络事件、恶意特征等[10]
TAXII 应用层协议,基于HTTPS交换威胁情报[11]
STIX 标准化定义,用于描述网络安全威胁信息[12]
ATT&CK 标准化框架和知识库,包含详细的TTPs[13]
基于标准的本体定义虽然较为完善,但对应的数据集却难以实现数据分布均衡,过于细分的本体定义不可避免地引入数据长尾问题。此外,当前的研究呈现出跨模态CTI本体交叉融合的趋势。例如,HinCTI[6]定义了涵盖IoC和知识图谱的异构信息网络本体;TCENet[17]结合了IoC实体和TTPs描述;AttacKG系列研究[5,18]定义了TTPs形成的知识图谱;TriCTI[19]专注于IoC实体与事件触发词的融合定义。随着生成式AI和多模态技术的发展,本体结构定义更为复杂化和多样化,需要结合CTI分析的新任务开展进一步研究。

2.3 数据标注策略

高质量标注数据的稀缺一直是CTI领域面临的困境[20]。当前解决方案主要聚焦于数据标注和数据增强两个方向。在数据标注方面,人工标注依赖领域专家,成本高且难以满足大规模需求;半自动标注结合脚本和工具提升效率,但仍需人工校验以保证准确性;自动标注利用LLM通过提示词或微调方式快速处理海量文本,但在面对隐喻、歧义或新型威胁表述时,其准确率波动较大。现有质量评估方法通过团队校验[21]或设计量化度量指标[22]进行把控,但缺乏标准化评估体系以充分平衡标注效率和质量。在数据扩增方面,主流方法有掩码替换[23]、句子改写和翻译回译[21]等。同时,引入条件化控制可以避免对关键词增强错误[19]。然而,尽管数据扩增能够有效提升抽取模型性能,但是扩增的数据中引入的部分伪情报可能会导致模型的鲁棒性差,降低可信性。因此,数据规模和质量的不平衡,仍然是制约抽取模型训练的关键瓶颈。

2.4 数据集

根据抽取任务目标的不同,需要使用不同的数据集。本文依据任务类别对主流数据集文献进行分类,并列出了相关的语言、偏向主题、截止时间和数据规模,如表3所示。
表 3 基于任务类型的CTI数据集信息与分类

Table 3 Information and classification of CTI datasets based on task types

数据集类型 任务子类 数据集研究
文献 语言 偏向主题 截止时间 数据规模
实体及关系
抽取
实体 [24] 英文 2020.8 3.6万+实体
[25] 英文 APT 2020.12 3.9万+实体
[26] 英文 2022.12 0.45万+实体
[27] 英文 2023.3 0.2万+实体
[28] 中文 APT工具 未开源 3.1万+实体
三元组 [8] 英文 APT 2021.6 0.29万+实体
[29] 英文 IoV 2024.3 0.7万+实体和2.3万+三元组
[30] 英文 IoV 2025.3 0.36万+句问答,0.81万和0.48万三元组
[31] 中文 2022.10 0.42万+实体和0.25万+三元组
事件及关系
抽取
事件类型 [13] 英文 2023.5 0.1万标注数据和17万+无标注数据
[32] 英文 APT 未开源 2阶段,9种事件类型,7种论元,130条实例
[33] 中文 APT 未开源 3阶段,13种事件类型,5种论元,1072句数据
事件关系 [34] 英文 APT 未开源 14项战术,4种论元,92种规则下的1种事件关系
TTPs类别 [35] 英文 2022.5 1.2万+句子,含188种技术
[36] 中英文 2023.3 0.65万+句子,含12战术和184技术
[37] 英文 2019.9 0.17万+样本,12种战术,215技术
多任务融合
分析
IoC&TTPs [17] 英文 2021.10 12种IoC类型,6种技术和6k+TTPs描述
图谱&TTPs [18] 英文 2023.5 58篇报告,179 技术类型, 6类实体和1种依赖关系
IoC &事件 [19] 英文 2021.1 0.4万+句子,7种活动阶段,6种IoC实体,0.3万+触发词
面向LLM的
新型数据集
大模型标注数据集 [22] 英文 APT 未开源 0.3万+句问答,包含1.2万+实体,1万+关系
构造指令微调数据集 [21] 英文 2024.7(仅开源人工
校验数据)
1.5万条主题分类,0.5万条实体关系抽取和6万条
TTPs分类数据集
面向不同抽取目标的CTI数据集,其建设呈现显著差异。
1)CTI实体关系抽取数据集建设最为完善,约占据CTI领域数据集的半数。从任务类型看,可分为实体数据集与三元组数据集两类,后者在实体标注基础上新增关系类型标注。实体数据集发展呈现特定性与全面性并重的特点。一方面,研究更加注重面向特定应用场景的精准适配[24-25,28,31];另一方面,致力于与共享标准分类体系全面对接[27]。三元组数据集则经历了从单一关系数据集[38],到固定三元组模式[29],再到突破固定模式实现开放式定义[22]的演进过程。从抽取方法看,近年来研究重心由流水线式方法向联合式方法转移。
2)CTI事件及关系的数据集建设相对薄弱。与实体关系抽取相比,事件关系抽取更加注重事件的动态特征与多样性表现,事件标注更为复杂、标注成本更高[32]。为缓解数据集标注压力,研究者利用大模型预标注[33]或采用对比学习实现无触发词事件检测[13]
3)TTPs数据集的研究,从基础的映射分类研究[35-36,39-40]转向深入探索战术与技术间的内在关联性[9],从而进一步提升识别的准确性。
4)多任务融合分析数据集建设仍处于探索阶段,多模态任务体系与配套的数据集尚未形成统一标准。该领域主要通过挖掘不同任务间的间接关联性来实现跨任务增强。文本结合图像识别的多模态研究在近年来逐步兴起。例如,AttacKG系列研究[5,18]通过融合非结构化报告中的图像信息,有效增强了对攻击图的识别。
5)与大模型相关的数据集,可以分为大模型标注数据集和构造指令微调数据集两类。前者利用大模型的丰富知识库和稳定的性能进行大规模标注[22,33],后者则是针对大模型微调构造的数据集[21]

3 CTI实体及关系抽取

3.1 CTI实体及关系抽取概念

在信息抽取研究中,实体抽取通常被定义为从非结构化文本中识别出具有特定语义类别的对象[4]。关系抽取是指从识别出的实体中抽取实体间的语义关系[41]。本文将CTI实体抽取定义为:从CTI中识别出与网络攻击和威胁分析相关的关键对象,如攻击组织、恶意软件、漏洞、攻击技术、受害目标等;将CTI关系抽取定义为:识别并抽取上述实体之间的语义关系,包括攻击行为、利用关系、传播关系、从属关系等。抽取到的实体和关系,既能支持威胁情报知识图谱的构建,还能为溯源归因、事件响应和风险评估等下游应用场景提供有力支撑。
目前,CTI实体及关系抽取研究大部分面向CTI非结构化文本(如APT报告、恶意软件分析、IoC列表、安全博客等),这种文本具有专业性强、术语密集、句式复杂且上下文指代频繁等特点。实体及关系类型的本体结构定义通常参考STIX、MITRE ATT&CK、CAPEC等[3]。抽取方法主要分为基于规则、基于机器学习和深度学习,以及基于大模型的方法。早期方法主要依赖人工编写的规则与领域词典[42-43],这类方法在一定程度上能够保证抽取准确性,但缺乏可扩展性,难以适应威胁情报的快速动态演进。随着机器学习技术的发展,统计模型逐渐取代了基于规则的系统,通过特征工程和监督分类实现了更稳健的抽取效果。随后,深度学习技术的兴起带来了进一步突破,使模型能够直接从语料中自动学习特征表示,减少了对人工设计特征的依赖,并显著提升了抽取的准确性。近年来,LLM的出现为威胁情报抽取开辟了新的研究范式。通过在海量文本上的预训练,并结合微调方法和提示工程,基于LLM的方法展现出更强的泛化能力和小样本微调场景下的优异表现,这对于CTI分析普遍存在的数据稀缺问题具有重要意义。此外,LLM在捕捉上下文语义、理解复杂攻击叙事以及进行推理方面表现出独特优势,为推动CTI的研究与应用提供了前所未有的机遇。

3.2 基于机器学习和深度学习的方法

在CTI领域,基于传统机器学习的实体与关系抽取方法,主要依赖人工设计的特征与浅层分类模型。实体抽取常采用条件随机场(CRF)、支持向量机(SVM)或最大熵模型,通过词性、上下文窗口、词形变化、依存句法、命名实体词典等特征进行识别。关系抽取则多使用特征模板与监督分类方法,将实体对之间的句法依存路径、词汇共现模式、触发词及上下文信息作为输入,利用SVM、逻辑回归或随机森林进行关系判定。部分研究还结合基于规则或模式匹配的启发式方法,以应对安全文本中结构复杂、专业术语丰富的特点。传统机器学习方法在特定领域和场景中表现出一定的优势,例如Shafiq等[44]提出CorrAUC方法,通过特征选择与分类模型检测恶意网络流量并提取关键信息。该类方法的优势在于解释性强、可控性高,但其性能依赖特征工程和标注数据的质量,对新领域和未见过样本的泛化能力有限。
随着深度学习的发展,CTI抽取方法取得显著进展,CNN、RNN、BiLSTM以及BERT等模型能够直接从大规模语料中自动学习特征表示,减少了对人工特征设计的依赖,并显著提升了抽取的准确性。Kim等[45]提出了基于BiLSTM-CRF的模型,自动抽取恶意软件、IP地址等实体。Vulcan系统[46]进一步引入BERT,构建Bert-BiLSTM-CRF进行实体和关系抽取,通过特殊标记和类型掩码优化输出。CTI View系统[47]集成BERT-GRU-BiLSTM-CRF、正则表达式与ATT&CK矩阵,实现了APT文本的自动化分析。Zhen等[48]针对中文CTI任务,设计了结合RoBERTa-wwm、残差扩张卷积(RDCNN)与CRF的模型,有效提升了命名实体识别性能。总体而言,深度学习方法通过CNN、RNN、BiLSTM以及 BERT等模型,能够自动学习语料中的语义与上下文特征,在无需人工设计特征的情况下实现了实体关系的高效抽取。该类方法尤其适合处理非结构化大规模数据、长文本以及上下文依赖性较强的场景。然而,其缺点在于对大规模标注数据和计算资源的依赖。

3.3 基于大模型的方法

近年来,大模型的出现与快速演进(如 GPT-4、ChatGPT和LLaMA 2)显著推动了自然语言处理的发展,并被成功应用于实体及关系抽取任务,但在网络安全领域,尤其是从CTI中自动抽取关键信息的研究仍相对有限,当前大多数工作以TTPs分类为核心,同时将实体与关系抽取作为支撑任务,以便更全面地刻画攻击行为。基于大模型的威胁情报实体和关系抽取,目前主要沿两条主线展开研究:其一,依托LLM的零/少样本能力,通过提示工程以最小标注实现CTI实体和关系抽取;其二,结合参数高效微调方法,进一步提升模型对CTI实体和关系抽取的性能。

3.3.1 基于提示工程(零/少样本)的实体、关系抽取

大量研究工作展示了通过精心设计的提示模板、示例选择与检索增强,可在低资源场景下让通用LLM完成CTI实体及关系抽取。LLM-TIKG[21]、CTINEXUS[49]与基于ChatGPT/GPT-4的方法[50-51]均采用角色扮演(以网络安全专家回答)、“指令+示例+输入”格式或一次性端到端提示,直接要求模型输出JSON或三元组,从而实现实体识别、关系抽取与TTPs标注。
为缓解LLM的“幻觉”问题,Sewak等[52]将提示与检索增强和标准化结合:用RAG将外部知识、MITRE ATT&CK映射或文档证据并入上下文,从而约束生成内容的事实性与术语一致性。在关系抽取层面,Liu等[50]通过生成候选三元组并用邻句共现、正则补全或后验选择机制过滤不可信条目,以提升关系抽取的精确度与结构的完整性。马冰琦等[51]为解决长文本限制,引入LangChain进行文档分段、向量化与问答式检索,补充实时属性并抑制“幻觉”。
总体来看,提示工程路线的优势是数据与工程成本低、上手快、适应性强,代表性成果在实体关系抽取任务上能达到较高F1值(如LLM-TIKG在实体与TTPs上表现优异;CTINEXUS在三元组抽取上表现优异),但其缺点在于对提示与示例设计敏感,且在领域术语一致性和长尾专有名词上仍需采用外部规范化步骤(如MITRE对齐或正则填充)来提升可信度。

3.3.2 采用微调与轻量化适配的实体及关系抽取

在小规模域内数据上对大模型进行微调或参数高效适配,以提升模型在CTI场景下的稳定性与准确性。LLM-TIKG[21]中使用LoRA对Llama2-7B做指令层微调以联合完成主题分类、实体关系抽取与TTPs分类,显示了微调后跨任务泛化能力的提升。AECR[53]对ChatGLM3-6B进行轻量化微调,并引入“过滤+识别”两阶段提示来提高攻击技术命名与句子级分类的精确性,实验证明在攻击技术抽取上有显著提升。AttacKG+[54]指出微调能将F1值提升为更稳定的数值区间。
微调的主要优点是将通用语言能力,映射为CTI领域内实体及关系抽取的稳定能力。参数高效适配方法(如LoRA、P-Tuning)能在保留大模型基础能力的同时,以较小的训练资源注入CTI专业知识,降低幻觉,提高命名规范性。但微调也有局限性,如对高质量标注数据的依赖、跨域泛化的风险等。

3.3.3 小结

基于大模型的威胁情报实体及关系抽取主要形成了两类技术路线:一是基于提示工程的零样本/少样本抽取,依托LLM强大的语言理解与生成能力,在低标注条件下即可完成结构化信息抽取;二是基于微调与参数高效适配的方法,通过小规模领域数据训练,使模型在CTI领域表现更稳健、更专业。前者强调灵活性与快速部署,后者追求稳定性与一致性。两者各具优势,因此学者将微调与提示工程相结合,用少量微调提升关键子任务(如实体类型分类)的性能,同时保持提示驱动的灵活抽取[21,53]
相关工作总结见表4
表 4 基于大模型的CTI实体及关系抽取研究

Table 4 Research on entity and relation extraction for CTI based on large models

主流技术 概述 限制 文献
提示工程 CRUSH框架采用GPT-3.5/GPT-4等大模型自动生成威胁情报知识图谱(TIG),通过提示工程与RAG增强实现实体抽取、意图识别与TTPs映射,结合语义超网络提升图谱推理能力 方法依赖大模型提示质量与上下文长度,存在幻觉与推理偏差风险 [52]
基于GLM-4大模型,通过指令提示与上下文学习实现CTI报告的重写、实体关系抽取、TTPs识别与状态总结,构建多层耦合的攻击知识图谱 仅处理文本,忽略图像等多元信息;LLM在复杂语境下仍存在误判与输出不稳定的问题,影响图谱准确性 [54]
通过提示工程引导LLM完成元数据抽取与SPO三元组选择,无需训练即可实现实体与关系抽取 关系抽取准确率受限于NER误差累积与LLM生成偏差;三元组质量高度依赖预定义本体,泛化能力有限 [50]
采用 GPT-4 的 in-context learning 范式,一次性端到端抽取实体—关系三元组,通过 kNN 检索最优示例并固化在提示中,无需微调即可适配不同本体 依赖高质量示范示例,示例错误或格式偏差会显著降低性能;仍需约百级标注样本,零样本下幻觉问题严重 [49]
以 GPT-4 为底座,通过双语提示工程将STIX实体/关系模板固化成角色指令,一次性完成零样本三元组抽取 目前仅给出少量手工样例,缺乏公开评测集与基线对比;GPT-4 的生成结果未经验证,存在幻觉风险 [51]
微调+提示工程 AECR采用P-Tuning v2微调ChatGLM3-6B,结合词级情报增强与句子级过滤策略,实现CTI报告中攻击技术的精准抽取 模型在低样本AT类别上召回率极低,且解释策略粒度较粗,难以处理多义词或同类实体共现的复杂语境 [53]
采用GPT-3.5进行少样本数据标注与增强,并结合LoRA指令微调Llama2-7B,实现威胁情报的实体抽取、关系抽取与TTPs分类 模型在处理长文本和非自然语言内容(如表格)时存在信息遗漏,生成数据存在幻觉,需人工修正提升质量 [21]

4 CTI事件及关系抽取

4.1 CTI事件、关系抽取概念

事件抽取任务通常包括事件触发词识别与分类、论元识别与角色标注。事件关系抽取旨在识别不同CTI事件之间的语义或逻辑关联,包括事件共指、语义类别关系、时间顺序关系以及因果、从属、对立等更复杂关联类型。
在CTI分析领域,事件抽取的任务是从威胁报告、漏洞通告、日志等威胁情报中,识别与网络攻击活动相关的事件。与通用事件抽取相比,CTI事件更强调与网络攻击直接相关的要素。典型的事件类型包括钓鱼邮件投递、漏洞利用、数据窃取等。事件的组成要素不仅包含触发词,还需覆盖攻击者、受害实体、攻击手法或工具、TTPs,以及具体的威胁指标等。针对安全语料的事件抽取方法,能够显著提升情报自动化处理效率与威胁知识库的构建效率。
在CTI事件关系抽取中,重点不仅在于识别通用的时间顺序与因果关系,更在于捕捉攻击链条内部的依赖关系和威胁行为之间的逻辑关联。常见的关系类型包括:攻击链的上下游关系,如漏洞利用导致系统被攻陷;因果触发关系,如恶意邮件投递引发勒索软件加密;归属与关联关系,如某一威胁指标与特定攻击组织的绑定;战术、技术与过程之间的映射关系。这些关系的抽取对于攻击场景重建和预测性防御等具有关键作用。
事件和事件关系抽取作为自然语言处理的两个重要任务,其研究最早始于基于规则和模板的探索阶段,但是这类方法普遍存在工作量大、泛化能力弱、领域适应性差等问题。下文将对CTI事件及关系抽取技术演进进行梳理,重点分析向大模型技术的演进。

4.2 基于机器学习和深度学习的方法

统计机器学习方法的兴起,使得学者尝试使用SVM、CRF等模型,并结合特征工程提高系统的泛化能力。早期研究采用支持向量机对触发词进行识别和分类,并对论元识别和论元角色分类进行建模,设计了包括词性、句法路径、实体类型等特征模板。后续研究针对事件类型的一致性问题,提出了引入文档级上下文信息进行事件识别的方法,利用最大熵分类器(MaxEnt)结合文档中跨句一致性特征,有效提升了触发词分类的准确率。然后基于结构化感知器(Structured Perceptron)模型,联合建模事件触发词和论元角色间的结构依赖关系,引入全局特征进行联合预测,解决了传统pipeline方法误差传播的问题。
深度学习模型被应用于事件及关系抽取任务,将事件识别与事件关系建模统一为一个深度学习框架,相比传统方法显著减少了对特征和规则的依赖。DMCNN模型率先将深度学习模型应用于事件抽取,强调对句内不同片段的独立建模,改善了多事件句子的表示能力。然后引入BiLSTM-CRF框架,成为序列标注类方法的经典基线。Gao等[55]将因果指示词CIW词典作为外部知识建模成无定向因果关联图(Causal Associated Graph,CAG),采用GNN学习CAG节点中的语义信息及其丰富的关系,并将学习到的图嵌入CA-GNN中,以生成全局的语义表示。随着图神经网络的兴起,研究者发现图神经网络可以增强事件结构建模能力。Huang等[56]提出MGREE模型,使用多图表示机制解决多事件抽取中常见的论元复用问题,提升了对复杂事件结构的感知能力。在事件关系抽取领域,Zhuang等[57]提出了基于句法的动态潜在图方法,通过引入语法引导的潜在图结构,并在图神经网络中动态调整边权来传播语义信息。该方法能够在跨句建模中更好地捕获长程依赖和复杂语义提示,从而显著增强事件关系识别的准确性;Li等[58]提出了GraphERE框架,通过图增强的事件嵌入将触发词、论元及上下文信息统一建模,并构建面向任务的动态事件图来表示多种事件间关系。该方法结合多任务学习机制,能够同时捕捉时序、因果及子事件等复杂依赖关系,从而有效提升跨句与跨文档场景下的事件关系抽取性能。

4.3 基于大模型的方法

随着大模型在自然语言处理领域的突破性进展,事件及关系抽取研究进入了统一建模的新阶段。相较于传统模型依赖任务特定架构的分离式设计,基于大模型的方法能够在同一框架下同时完成事件识别、论元抽取与事件关系推理,展现出在复杂结构化信息建模中的强大表示与泛化能力。然而,在网络安全与威胁情报场景中,事件类型多样、语义模糊、篇章跨度大,使得大模型的知识约束、事实一致性与领域适配方面仍面临挑战。
当前研究主要沿两条技术路线展开:其一是基于提示工程的零样本与少样本方法,通过模板设计、上下文构造与推理链引导,激发大模型的语义理解与事件抽取能力;其二是以微调与轻量化适配为核心,通过参数高效优化与结构约束,使模型在事件及关系抽取任务上具备更高的稳定性与领域专用性。以下将对这两类方法进行综述与分析。

4.3.1 基于提示工程(零样本与少样本)的事件及关系抽取

路线一的核心思想是:通过设计问题模板、上下文提示与链式推理结构,使通用语言模型在零样本或少样本条件下完成事件识别、论元抽取与关系生成,从而降低人工标注成本并提升跨任务的泛化能力。其研究目标在于探索如何借助提示构造与上下文设计,使模型在理解事件语义与逻辑依赖方面表现出更高的稳健性与可迁移性。
Du等[59]首次提出了将事件抽取任务转化为问答任务,为后续提示驱动的生成式抽取奠定了理论基础,并显著减少了对人工标注的依赖。随后,Liu等[60]将该任务形式化为机器阅读理解过程,使模型能够通过预设问题模板理解事件语义,实现了跨任务迁移的性能提升。为进一步提高提示的可控性与数据利用率,Hsu等[61]提出的DEGREE模型采用模板化生成策略,在低资源场景中的表现优于传统抽取方法。此外,Zhou等[62]基于启发式策略优化提示构造,通过示例筛选与结构化提示设计,有效缓解了文档级论元抽取中的上下文偏移问题。Choudhary等[63]提出了QAEVENT框架,将事件抽取建模为“问题—答案”生成过程,从提示设计角度强化模型的任务对齐能力。Shuang等[64]则利用大模型的推理与总结能力,引入上下文压缩与链式推理提示机制,在跨句依赖与论元混淆场景下显著提升了抽取性能。
总体来看,基于提示工程的事件与关系抽取方法具备低资源依赖、实现灵活和迁移性强的优势。通过模板化问题构造与推理链增强策略,该类方法在开放域与跨领域事件抽取中表现出良好的通用性。然而,其效果高度依赖提示设计的质量,同时也受到上下文长度的影响,且在特定领域、特定术语、复杂事件层级和事实一致性等方面仍存在一定偏差。后续研究可结合检索增强生成或知识对齐机制,在提升抽取精度的同时,增强对CTI语义的约束与解释能力。

4.3.2 以微调与轻量化适配为核心,将大模型任务化并提升专用性

路线二与提示工程的通用化方向不同,微调与轻量化适配方法强调通过参数高效训练,使大模型具备针对事件与关系抽取任务的稳定性与专业化能力。其目标在于通过有限的数据与任务约束,将通用语言模型转化为能够理解复杂语义关系、识别事件结构的专用抽取模型,从而提高抽取精度与逻辑严谨性。
Li等[65]提出了基于条件生成的文档级事件论元抽取框架,在微调阶段引入条件约束机制,使模型显式学习跨句依赖关系,显著提升了文档级抽取的F1值。Du等[66]进一步设计了动态全局记忆结构,将全局上下文信息作为可学习参数融入微调流程,增强了长文档场景下的上下文建模能力并提高论元召回率。为提高联合式事件抽取性能,Pan等[67]通过多层信息交互微调策略,构建了事件关系图与论元相关图,以强化事件间的语义耦合,从而在联合抽取任务中有效抑制错误传播。Qi等[68]在采用参数高效微调的同时,引入偏好优化策略,提出了ADELIE框架,提升了大模型在跨域迁移过程中的稳定收敛性与鲁棒性。除了在微调时加入约束和优化策略等的研究外,文献[69]将事件关系抽取建模为逻辑生成过程,通过约束优化目标提升事件关系的逻辑一致性。

4.3.3 小结与分析

上述研究在通用文本场景中实现了不同程度的抽取性能提升,但在CTI分析领域,基于大模型的事件抽取研究仍相对匮乏。APT攻击作为CTI分析中的重要对象,因其攻击周期长、隐蔽性强、危害性大等特点,对事件抽取提出了更高的要求。Xiang等[32]构建了APT攻击样本数据集,并采用BERT-BiGRU-CRF模型完成事件抽取,取得了良好效果;曹骏等[33]针对语料稀缺问题,采用基于大模型的数据增强技术扩充数据集,并结合预训练与序列标注模型构建事件抽取模型,充分利预训练与序列标注的优势学习更丰富的语义特征,提高了抽取效果。Han等[70]提出了CAFIIE框架,结合多层次特征交互与少样本微调策略,在保持鲁棒性的同时,显著提升了事件抽取的实用性与稳定性。
总体而言,微调与轻量化适配方法为大模型在事件与关系抽取中的专用化提供了有效路径。其优点在于能稳定注入领域知识、提升术语一致性与逻辑约束性,但也面临高质量标注数据不足与跨域泛化能力受限的问题。未来研究可探索提示工程与微调策略的融合路径,并综合考虑叠加约束与优化策略,在保持领域稳健性的同时,兼顾模型的迁移灵活性与知识扩展能力,提升威胁情报分析领域中基于大模型的事件及关系抽取能力。
综上,当前事件及关系抽取研究呈现融合提示工程和微调优化的趋势,前者通过精细化指令设计与推理链构建,强化模型的通用性与语义迁移能力,后者则借助任务化建模与结构约束,提升了模型在特定领域的专用性。两者的结合为大模型在CTI分析等复杂场景下的应用提供了新的技术路径。相关工作如表5所示。
表 5 基于LLM的威胁情报事件、关系抽取研究

Table 5 Research on threat intelligence event and relation extraction based on LLM

主流技术 概述 限制 文献
提示工程 将事件抽取重构为问答任务,采用QA式提示/问题模板,采用预训练的问答模型完成触发词与论元识别(以自然语言问题引导模型直接输出事件要素) 依赖问题/提示设计与模板工程,对隐式论元与跨句推理能力有限,且对提示敏感,易受wording影响 [59]
把事件抽取形式化为机器阅读理解(MRC)任务,通过构造问题—上下文对,并采用MRC模型进行触发词与论元抽取 MRC需要大量任务特定的问答对标注或转换策略,文档级跨句依赖处理能力受限 [60]
以 DEGREE 模型为代表,将事件抽取建模为问答对生成任务,结合生成式提示以增强跨域泛化能力(以生成问答对作为输出结构) 输出需解析为结构化条目,模板/解析管线脆弱;大模型生成的幻觉与不一致性仍是隐患 [61]
提出启发式驱动的提示策略,通过示例筛选与结构化提示设计,提升LLM在文档级事件论元抽取中的 in-context 学习效果 启发式选择方法通常对语料与领域敏感,缺乏普适性,且缺少对提示鲁棒性的系统性保障 [62]
提出QAEVENT框架,将事件抽取建模为问题—答案对生成过程,从提示设计角度强化模型任务对齐能力,提升开放域下的抽取效果 需设计高质量示例与提示模板,跨域迁移仍受语义漂移影响 [63]
利用大模型的上下文总结与链式推理能力,引入上下文压缩与推理提示机制,在长文本与跨句依赖场景下提升抽取性能 依赖高质量演示与推理提示,推理式提示计算代价高,且更易产生不可控的推断或幻觉 [64]
微调+提示工程 基于条件生成的生成式范式(seq2seq模型,如BART/T5微调),在解码过程中引入条件约束以显式学习跨句依赖,提升文档级论元抽取性能 虽提高了样本效率,但仍需一定标注样本与模板设计;对超长文档和复杂跨事件链的建模能力有限 [65]
引入动态全局记忆机制,将上下文信息存储为可学习参数,以增强文档级跨句建模能力,在长文本条件下提升论元召回率 全局记忆带来计算开销与存储开销,记忆管理复杂,长文档中仍可能漏记隐式信息 [66]
通过多层信息交互建模策略,构建事件关系图与论元相关图以强化事件与论元的语义耦合性,实现联合抽取与错误传播抑制 交互式结构复杂、参数量大,训练与标注成本较高,对稀疏标签与长尾事件泛化有限 [67]
提出ADELIE框架,从指令对齐视角构建抽取语料,并采用参数高效微调与偏好优化(SFT与DPO)策略,使大模型在跨域任务中保持稳定的收敛性与鲁棒性 指令对齐语料构建成本高且依赖特定指令风格,跨域泛化仍受限 [68]
将事件关系预测视为生成/问答式任务,在训练过程中引入逻辑约束优化,以提高结果一致性与可解释性 虽可减少流水线误差,但约束化方法在精度与召回间存在权衡,对复杂逻辑关系仍可能不足 [69]

5 基于大模型的威胁情报信息抽取可信性分析

CTI分析的可信性是CTI自动分析推广应用的重要决定因素,也是一个多层次、多维度的系统化工程。CTI信息抽取可信性主要体现在数据源、抽取模型以及情报共享的可信性3个核心维度。本节将对基于大模型的CTI信息抽取进行可信性分析。

5.1 数据源的可信性

在数据源的可信性方面,公开的标准和协议为其提供了基础的可信性标准[71],如TAXII保障了威胁情报的安全传输,STIX和ATT&CK统一了情报的分类[72]。各大安全厂商基于多年的威胁情报运营经验,在数据源可信性方面积累了丰富的实践经验,其核心策略包括多源汇聚与交叉验证。此外,置信度评分与质量评估机制可为每一条情报附加置信度评分。虽然目前行业内尚未形成统一的评分标准,但该机制已成为行业实践的重要组成部分。行业生态的协同治理与商业合作模式为威胁情报数据源可信性提供了重要支撑[73]

5.2 抽取模型的可信性

5.2.1 判别式模型的可信性分析

判别式模型在CTI信息抽取中面临的可信性挑战,主要集中在真实性保障和时效性适应两个方面。判别式模型因具有训练速度快、精度高等优势,而在CTI分析的信息抽取中被广泛应用,但是其性能仍高度依赖于高质量标注数据集的构建[22]。为提升模型训练效果,部分研究采用数据增强技术对数据集进行扩增,然而扩增数据中引入的噪声和伪情报会降低模型鲁棒性,特别是在面对对抗样本和边缘案例时容易产生误判。此外,网络安全领域对时效性要求极高,判别式模型的迭代更新依赖安全专家对新型未知攻击的及时研判和标注,这使得模型难以快速适应不断演变的威胁态势。因此,如何在保障数据质量的前提下提升标注效率,以及增强模型对新兴威胁的泛化能力,成为判别式模型在威胁情报抽取可信性中亟待解决的关键问题。

5.2.2 生成式模型的可信性分析

当前威胁情报信息抽取研究多采用公开LLM,以问答形式为基础,通过结构化格式约束适配不同抽取任务,具体研究方向可分为基于提示词[49,69]、基于微调[53,68]以及两者结合[21,61]三类。然而,当前研究仍面临核心可信性挑战——大模型“幻觉”问题,该类问题可能导致关键信息偏差等虚假情报。现有研究主要通过RAG技术和多智能体协作机制予以缓解。其中,首个面向网络攻击归因的RAG问答系统通过明确提供上下文来源以支持人工复核,显著提升了答案的可溯源性与可解释性[74]。在多智能体协作机制方面,Shah等[75]通过翻译、语义分析、相关性判别与威胁类别判定的明确分工完成二元相关性判断。Loevenich等[76]和Guan等[77]则侧重结合思维链推理提升分析可信性。这些方法不仅降低了单一模型在复杂安全场景下的幻觉风险,还使推理过程更加透明,为分析结果提供了可复核模型依据。
然而,LLM的广泛应用也带来了新的可信性风险。一方面,模型易受提示词注入攻击和训练数据投毒的影响;另一方面,过度依赖自动化可能削弱安全分析师的专业判断能力。此外,目前缺乏针对AI生成威胁情报内容的标准化评估基准,难以量化评估模型输出的真实可信度。

5.3 威胁情报共享的可信性

威胁情报共享的可信性主要依托国际标准和协议。在此基础上,当前研究重点集中在如何利用区块链等分布式技术进一步提升共享过程的可信性。Priv-Share[78]系统通过差分隐私共享机制和多层加密技术实现细粒度的隐私保护。在激励机制设计方面,基于CTI代币的经济激励模型和动态税收调节机制,有效提升了参与组织的主动共享意愿,形成可持续的共享生态[79]。在信任评估机制方面,信任无关委托机制与虚假数据注入检测技术有效解决了传统中心化信任评估模式的局限性[78]。然而,基于区块链的威胁情报共享仍面临诸多挑战。首先,激励机制的设计存在内生脆弱性,代币价值易受市场操控,难以保证长期稳定的共享激励[79]。其次,跨境共享涉及数据出境管制、GDPR等法规约束,现有系统缺乏完善的合规框架与隐私保护机制[80]。此外,从实验验证到产业化部署仍存在鸿沟。

6 CTI信息抽取应用研究

CTI信息抽取广泛应用于威胁情报知识库构建、攻击态势预测及检测、攻击溯源和情报融合共享等场景。

6.1 威胁情报知识库构建

通过将抽取后的实体和关系组织为知识图谱等知识库,不仅能够支持情报的可视化、查询与推理,还能为威胁态势感知与防御决策提供支撑。根据构建方法与目标的不同,现有研究主要可以分为本体驱动构建与动态集成两类方向。
在基于本体驱动的构建方法中,研究者通常将抽取后的CTI实体与关系映射至预定义的知识框架,以保证知识图谱的一致性和可解释性。Liu等[50]从CTI报告抽取了攻击相关实体和关系,根据特定本体填充知识图谱。Hu等[21]提出了采用LLM-TIkg方法构建知识图谱。Cheng等[49]提出的CTINexus框架使用优化上下文学习的LLM,从抽取的信息中高效构建知识图谱。这些方法均依赖预定义的本体来约束和映射抽取信息,以确保图谱的结构一致。
动态集成更关注于将抽取后的CTI信息自动化集成到动态知识图谱中,以支持持续更新和对实时威胁环境的适应。如Gao等[81]的Security知识图谱框架,从OSCTI报告抽取威胁行为实体和关系后,该系统使用AI技术将这些信息注入安全知识图谱,支持连续更新和UI交互。Sewak等[52]的CRUSH框架从恶意脚本和报告抽取信息后,利用LLM构建威胁情报图谱。Fieblinger等[82]则将使用知识图谱应用于动态CTI中。Huang等[83]的CTI知识图谱框架采用多LLM代理和双内存设计,从抽取的CTI文章中构建安全知识图谱。Pan等[84]强调使用LLM从抽取实体中生成新事实或补全关系,解决知识图谱的不完整性。这些方法强调动态更新和自动化集成,适用于实时的威胁环境。

6.2 攻击态势预测及检测

攻击态势预测旨在利用历史与实时抽取的CTI信息,推断未来攻击趋势或潜在攻击路径,从而为补丁部署、主动防御与资源调度提供依据。大量威胁信息以自然语言形式散落在新闻报道、技术分析报告中,蕴含着攻击者、目标、工具和时序等关键信息。事件抽取技术可从非结构化文本中自动识别攻击事件类型、触发词及其论元,将复杂语义转化为标准化的数据表达,从而揭示攻击手段与行为模式,提升检测系统对多阶段、隐蔽性攻击的感知与识别能力,以便充分利用“已知的未知”信息。CAFIIE框架[70]结合特征交互与少样本学习,实现新型攻击检测与预测,基于BERT-BiGRU-CRF的APT事件抽取模型[32],可识别多阶段攻击链,并还原攻击过程。这些研究表明,事件抽取能够通过揭示攻击要素间的语义关联,为攻击态势的动态监测、威胁预测与主动防御提供支撑。

6.3 攻击链路溯源

溯源研究旨在基于抽取的证据链恢复攻击事件的时序与传播路径,从而识别攻击源、推断攻击者的动机,为法律追溯与应急响应流程提供可验证的证据。根据溯源方法的不同,现有研究可分为攻击者归因和攻击路径重建两类方向。
在攻击者归因方向,研究者通常以CTI报告中抽取的证据信息为溯源与动机推断的基础,以便推测攻击者身份、目标选择与可能的作案动机,如Ren等[10]采用钻石模型对APT攻击组织进行了归因分析。
攻击路径重建侧重将抽取的攻击路径与时间序列信息映射至图结构或时空模型中,通过图对齐算法、知识库约束及大模型,把分散在报告中的技术实现细节和IoC聚合起来,帮助分析人员实现对攻击传播链的精准溯源与可视化再现[5,18,54]

6.4 情报融合共享

在CTI信息抽取的应用研究中,情报融合与共享是提升威胁情报价值的核心环节。通过对抽取结果进行多源对齐、冗余消解与冲突处理,不同来源的情报可以被有效整合,从而避免单一信息源带来的片面性。同时,融合后的情报能够以STIX/TAXII等标准化格式进行共享,增强跨平台与跨机构的互操作性,提升整体防御能力。

7 结束语

基于大模型的可信威胁情报信息抽取研究潜力巨大,对推动CTI分析的自动化和智能化具有重要意义。本文就近几年基于大模型的CTI信息抽取技术做了系统的梳理,从数据、模型、可信性和应用4个层面进行了深入分析。在数据方面,系统分析了面向CTI信息抽取的数据源与数据集现状、发展趋势和存在问题,并分析了向大模型演进对数据收集与构建提出的新要求;在抽取模型层面,从实体及关系、事件及关系抽取两方面,总结了抽取模型的主要研究进展,重点分析大模型应用于CTI信息抽取的研究进展;在可信性层面,从数据源、抽取模型、威胁情报共享3个方面,讨论了可信CTI信息抽取的实现途径;在应用层方面,从威胁情报知识库构建、攻击态势预测与检测、攻击链路溯源和情报融合共享4个方面,总结了信息抽取在CTI分析中的应用。
未来研究可从以下几个方面深化与拓展。
1)研究多模态数据融合的CTI信息抽取。当前大模型标注数据集在可信性方面存在问题,且构造指令微调数据集的标注成本高昂,限制了模型的泛化能力和适应性。未来可引入图像、日志、网络流量等多模态数据,推动跨模态威胁情报融合抽取,以提升情报的全面性和深度。但这也将导致本体结构定义更为复杂多样,抽取任务难度进一步提升,多模态数据融合的信息抽取仍须进一步研究。
2)抑制大模型的幻觉问题与推理偏差。大模型的可控性、可信性与可解释性仍有待提升,这对基于大模型的CTI信息抽取提出了新的挑战,抽取结果依赖大模型提示质量与上下文长度,存在“幻觉”与推理偏差风险,准确性与可信度亟待提高。未来可进一步开展检索增强、文档分段、向量化与问答式检索等研究,约束生成内容的事实性,抑制幻觉。
3)增强极长文档CTI信息抽取和跨段文档长距离关系推理能力。目前,对CTI超长文档和复杂跨文段事件关系的建模能力仍有限,须进一步开展超长CTI文档信息抽取研究,特别是事件关系抽取。同时,CTI文本所固有的长序列依赖与隐含语义关联对模型提出了更高要求。
4)保障CTI分析可信性及持续更新能力。目前CTI信息抽取结果的真伪性判别和质量评估机制仍存在不足,需要研究建立可信度量化评估机制,为模型输出结果提供可解释性和风险评估参考。同时,还需研究持续学习与增量更新方法,使模型能够动态适应不断演化的威胁场景,实现对新型攻击手法的快速分析。
综上所述,近年来,LLM的出现为威胁情报信息抽取开辟了新的研究范式。现有研究主要以提示工程与检索增强为核心,通过精心设计的提示模板、示例选择与RAG技术,在零样本/少样本场景下快速实现CTI信息抽取。同时,借助LoRA、P-Tuning等参数高效微调方法,将通用大模型能力适配至威胁情报领域,有效提升了对专有术语的覆盖。基于LLM的方法在小样本微调场景下展现出更强的泛化能力与优越性能,在上下文语义捕捉、复杂攻击场景理解与推理任务中表现出独特优势,为推动CTI分析与应用提供了前所未有的机遇。然而,基于大模型的CTI信息抽取仍面临多模态融合信息抽取、可信性保障、大模型“幻觉”等挑战。未来需重点围绕多模态融合信息抽取、大模型“幻觉抑制”、极长文档信息抽取和长距离关系推理能力增强、CTI分析可信性保障及持续更新,构建基于大模型的CTI信息抽取技术的核心发展路径。
1
冯嘉琦, 高见. 面向网络威胁情报领域的信息抽取综述[J/OL]. 计算机工程[2025-05-23]. https://doi.org/10.19678/j.issn.1000-3428.0070621.

Feng J Q, Gao J. A review of information extraction in the field of cyber threat intelligence [J/OL]. Computer Engineering [2025-05-23]. https://doi.org/10.19678/j.issn.1000-3428.0070621.

2
董聪, 姜波, 卢志刚, 等. 面向网络空间安全情报的知识图谱综述[J]. 信息安全学报, 2020, 5 (5): 56- 76.

DOI

Dong C, Jiang B, Lu Z G, et al. Knowledge graph for cyberspace security intelligence: a survey[J]. Journal of Cyber Security, 2020, 5 (5): 56- 76.

DOI

3
吴沛颖, 王俊峰, 崔泽源, 等. 网络威胁情报处理方法综述[J]. 四川大学学报(自然科学版), 2023, 60 (5): 7- 24.

DOI

Wu P Y, Wang J F, Cui Z Y, et al. A survey of cyber threat intelligence processing method[J]. Journal of Sichuan University (Natural Science Edition), 2023, 60 (5): 7- 24.

DOI

4
Jurafsky D, Martin J. Speech and language processing(3rd ed. draft)[M/OL]. Stanford: Stanford University, 2023[2025-09-27]. https://web.stanford.edu/~jurafsky/slp3/.

5
Zhang Y, Zhao X, Ma Y, et al. MM-AttacKG: a multimodal approach to attack graph construction with large language models[J]. arxiv preprint arXiv:, 2506, 16968, 2025.

6
Gao Y, Li X, Peng H, et al. Hincti: a cyber threat intelligence modeling and identification system based on heterogeneous information network[J]. IEEE Transactions on Knowledge and Data Engineering, 2020, 34 (2): 708- 722.

7
Xiao N, Lang B, Wang T, et al. APT-MMF: an advanced persistent threat actor attribution method based on multimodal and multilevel feature fusion[J]. Computers & Security, 2024, 144, 103960.

8
Sarhan I, Spruit M. Open-cykg: an open cyber threat intelligence knowledge graph[J]. Knowledge-based Systems, 2021, 233, 107524.

DOI

9
Yan J, Du Z, Li J, et al. A threat intelligence analysis method based on feature weighting and BERT-BiGRU for industrial internet of things[J]. Security and Communication Networks, 2022 (1): 7729456.

10
Ren Y, Xiao Y, Zhou Y, et al. Cskg4apt: a cybersecurity knowledge graph for advanced persistent threat organization attribution[J]. IEEE Transactions on Knowledge and Data Engineering, 2022, 35 (6): 5695- 5709.

11
Piplai A, Mittal S, Joshi A, et al. Creating cybersecurity knowledge graphs from malware after action reports[J]. IEEE Access, 2020, 8, 211691- 211703.

DOI

12
Irshad E, Siddiqui A. Cyber threat attribution using unstructured reports in cyber threat intelligence[J]. Egyptian Informatics Journal, 2023, 24 (1): 43- 59.

DOI

13
Tang M, Guo Y, Bai Q, et al. Trigger-free cybersecurity event detection based on contrastive learning[J]. The Journal of Supercomputing, 2023, 79 (18): 20984- 21007.

DOI

14
Alaeifar P, Pal S, Jadidi Z, et al. Current approaches and future directions for cyber threat intelligence sharing: a survey[J]. Journal of Information Security and Applications, 2024, 83, 103786.

DOI

15
Ramsdale A, Shiaeles S, Kolokotronis N. A comparative analysis of cyber-threat intelligence sources, formats and languages[J]. Electronics, 2020, 9 (5): 824.

DOI

16
Ai-sada B, Sadighian A, Oligeri G. MITRE ATT&CK: state of the art and way forward[J]. ACM Computing Surveys, 2024, 57 (1): 1- 37.

17
You Y, Jiang J, Jiang Z, et al. TIM: threat context-enhanced TTPs intelligence mining on unstructured threat data[J]. Cybersecurity, 2022, 5 (1): 3.

DOI

18
Li Z, Zeng J, Chen Y, et al. AttacKG: constructing technique knowledge graph from cyber threat intelligence reports[C]//European Symposium on Research in Computer Security. Cham. Springer International Publishing, 2022: 589-609.

19
Liu J, Yan J, Jiang J, et al. TriCTI: an actionable cyber threat intelligence discovery system via trigger-enhanced neural network[J]. Cybersecurity, 2022, 5 (1): 8.

DOI

20
刘晓明, 李丞正旭, 吴少聪, 等. 文本分类算法及其应用场景研究综述[J]. 计算机学报, 2024, 47 (6): 1244- 1287.

DOI

Liu X, Li C, Wu S, et al. A survey of text classification algorithms and application scenarios[J]. Chinese Journal of Computers, 2024, 47 (6): 1244- 1287.

DOI

21
Hu Y, Zou F, Han J, et al. LLM-tikg: threat intelligence knowledge graph construction utilizing large language model[J]. Computers & Security, 2024, 145, 103999.

22
Qi R, Xiang G, Zhang Y, et al. A Trustworthy dataset for APT intelligence with an auto-annotation framework[J]. Electronics, 2025, 14 (16): 3251.

DOI

23
Kim H. Comparative experiment on TTPs classification with class imbalance using oversampling from CTI dataset[J]. Security and Communication Networks, 2022 (1): 5021125.

24
Wang X, Liu X, Ao S, et al. Dnrti: a large-scale dataset for named entity recognition in threat intelligence[C]//2020 IEEE 19th International Conference on Trust, Security and Privacy in Computing and Communications (TrustCom). IEEE, 2020: 1842-1848.

25
Wang X, He S, Xiong Z, et al. Aptner: a specific dataset for ner missions in cyber threat intelligence field[C]//2022 IEEE 25th International Conference on Computer Supported Cooperative Work in Design (CSCWD). IEEE, 2022: 1233-1238.

26
Tanvirul M, Bhusal D, Park Y, et al. Cyner: a python library for cybersecurity named entity recognition[J]. arxiv preprint arXiv:, 2204, 05754, 2022.

27
Marchiori F, Conti M, Verde N, et al. Stixnet: a novel and modular solution for extracting all stix objects in CTI reports[C]//Proceedings of the 18th International Conference on Availability, Reliability and Security. 2023: 1-11.

28
Liu Y, Shi R, Chen Y, et al. APTTOOLNER: a Chinese dataset of cyber security tool for NER task[C]//2023 3rd Asia-Pacific Conference on Communications Technology and Computer Science (ACCTCS). IEEE, 2023: 368-373.

29
Shang W, Wang B, Zhu P, et al. A span-based multivariate information-aware embedding network for joint relational triplet extraction of threat intelligence[J]. Knowledge-Based Systems, 2024, 295, 111829.

DOI

30
Wang Y, Ren Y, Qin H, et al. A dataset for cyber threat intelligence modeling of connected autonomous vehicles[J]. Scientific Data, 2025, 12 (1): 366.

DOI

31
Zhou Y, Ren Y, Yi M, et al. Cdtier: a Chinese dataset of threat intelligence entity relationships[J]. IEEE Transactions on Sustainable Computing, 2023, 8 (4): 627- 638.

DOI

32
Xiang G, Shi C, Zhang Y. An APT event extraction method based on BERT-BiGRU-CRF for APT attack detection[J]. Electronics, 2023, 12 (15): 3349.

DOI

33
曹骏, 向尕, 任亚唯, 等. 基于大模型的少样本APT攻击事件抽取方法[J]. 信息网络安全, 2025, 25 (9): 1338- 1347.

DOI

Cao J, Xiang G, Ren Y W, et al. Small-sample APT attack event extraction method based on large model[J]. Netinfo Security, 2025, 25 (9): 1338- 1347.

DOI

34
张宇翔, 韩久江, 刘建, 等. ATT&CK框架下基于事件序列关联的网络高级威胁检测系统[J]. 计算机科学, 2023, 50 (S1): 710- 716.

Zhang Y X, Han J J, Liu J, et al. Network advanced threat detection system based on event sequence correlation under ATT&CK framework[J]. Computer Science, 2023, 50 (S1): 710- 716.

35
Orbinato V, Barbaraci M, Natella R, et al. Automatic maping of unstructured cyber threat intelligence: an experimental study: (practical experience report)[C]//2022 IEEE 33rd International Symposium on Software Reliability Engineering (ISSRE). IEEE, 2022: 181-192.

36
Ge W, Wang J. SeqMask: behavior extraction over cyber threat intelligence via multi-instance learning[J]. The Computer Journal, 2024, 67 (1): 253- 273.

DOI

37
Legoy V, Caselli M, Seifert C, et al. Automated retrieval of att&ck tactics and techniques for cyber threat reports[J]. arxiv preprint arXiv:, 2004, 14322, 2020.

38
Luo Y, Ao S, Luo N, et al. Extracting threat intelligence relations using distant supervision and neural networks[C]//Advances in Digital Forensics XVII: 17th IFIP WG 11.9 International Conference, Virtual Event, Springer International Publishing, 2021: 193-211.

39
葛文翰, 王俊峰, 唐宾徽, 等. 基于关联增强的网络威胁情报技战术分类[J]. 四川大学学报(自然科学版), 2022, 59 (2): 100- 108.

Ge W, Wang J, Tang B, et al. RENet: tactics and techniques classifications for cyber threat intelligence with relevance enhancement[J]. Journal of Sichuan University (Natural Science Edition), 2022, 59 (2): 100- 108.

40
Ge W, Wang J, Lin T, et al. Explainable cyber threat behavior identification based on self-adversarial topic generation[J]. Computers & Security, 2023, 132, 103369.

41
李冬梅, 张扬, 李东远, 等. 实体关系抽取方法研究综述[J]. 计算机研究与发展, 2020, 57 (7): 1424- 1448.

DOI

Li D M, Zhang Y, Li D Y, et al. Review of entity relation extraction methods[J]. Journal of Computer Research and Development, 2020, 57 (7): 1424- 1448.

DOI

42
Yi F, Jiang B, Wang L, et al. Cybersecurity named entity recognition using multi-modal ensemble learning[J]. IEEE Access, 2020, 8, 63214- 63224.

DOI

43
ZHANG S, CHEN P, BAI G, et al. An automatic assessment method of cyber threat intelligence combined with ATT&CK matrix[J]. Wireless Communications and Mobile Computing, 2022, 2022 (1): 7875910.

DOI

44
Shafiq M, Tian Z, Bashir A, et al. CorrAUC: a malicious bot-IoT traffic detection method in IoT network using machine-learning techniques[J]. IEEE Internet of Things Journal, 2020, 8 (5): 3242- 3254.

45
Kim G, Lee C, Jo J, et al. Automatic extraction of named entities of cyber threats using a deep Bi-LSTM-CRF network[J]. International Journal of Machine Learning and Cybernetics, 2020, 11 (10): 2341- 2355.

DOI

46
Jo H, Lee Y, Shin S. Vulcan: automatic extraction and analysis of cyber threat intelligence from unstructured text[J]. Computers & Security, 2022, 120, 102763.

47
Zhou Y, Tang Y, Yi M, et al. CTI view: APT threat intelligence analysis system[J]. Security and Communication Networks, 2022 (1): 9875199.

48
Zhen Z, Gao J. Chinese cyber threat intelligence named entity recognition via RoBERTa-wwm-RDCNN-CRF[J]. Computers, Materials & Continua, 2023, 77(1).

49
Cheng Y, Bajaber O, Tsegai S A, et al. Ctinexus: automatic cyber threat intelligence knowledge graph construction using large language models[C]//2025 IEEE 10th European Symposium on Security and Privacy (EuroS&P). IEEE, 2025: 923-938.

50
Liu J, Zhan J. Constructing knowledge graph from cyber threat intelligence using large language model[C]//2023 IEEE International Conference on Big Data (BigData). IEEE, 2023: 516-521.

51
马冰琦, 周盈海, 王梓宇, 等. 一种基于大语言模型的威胁情报信息抽取方法[J]. 网络空间安全科学学报, 2024, 2 (2): 36- 46.

DOI

Ma B Q, Zhou Y H, Wang Z Y, et al. A LLMs-based method for threat intelligence information extraction[J]. Journal of Cybersecurity, 2024, 2 (2): 36- 46.

DOI

52
Sewak M, Emani V, Naresh A. CRUSH: cybersecurity research using universal LLMs and semantic hypernetworks[C]//EKG-LLM@ CIKM. 2023. Birmingham: ACM, 2023:1172-1179.

53
Chen M, Zhu K, Lu B, et al. AECR: Automatic attack technique intelligence extraction based on fine-tuned large language model[J]. Computers & Security, 2025, 150, 104213.

54
Zhang Y, Du T, Ma Y, et al. AttacKG+: Boosting attack graph construction with large language models[J]. Computers & Security, 2025, 150, 104220.

55
Gao J, Luo X, Wang H. Chinese causal event extraction using causality-associated graph neural network[J]. Concurrency and Computation: Practice and Experience, 2022, 34 (3): e6572.

DOI

56
Huang H, Chen Y, Lin C, et al. A multi-graph representation for event extraction[J]. Artificial Intelligence, 2024, 332, 104144.

DOI

57
Zhuang L, Fei H, Hu P. Syntax-based dynamic latent graph for event relation extraction[J]. Information Processing & Management, 2023, 60 (5): 103469.

58
Li H, Geng D. GraphERE: jointly multiple event-event relation extraction via graph-enhanced event embeddings[J]. arXiv preprint arXiv:, 2403, 12523, 2024.

59
Du X, Cardie C. Event extraction by answering (almost) natural questions[J]. arXiv preprint arXiv:, 2004, 13625, 2020.

60
Liu J, Chen Y, Liu K, et al. Event extraction as machine reading comprehension[C]//Proceedings of the 2020 conference on Empirical Methods in Natural Language Processing (EMNLP), Association for Computational Linguistics, 2020: 1641-1651.

61
Hsu I, Huang K , Boschee E, et al. DEGREE: a data-efficient generation-based event extraction model[J]. arXiv preprint arXiv:, 2108, 12724, 2021.

62
Zhou H, Qian J, Feng Z, et al. LLMs learn task heuristics from demonstrations: a heuristic-driven prompting strategy for document-level event argument extraction[J]. arXiv preprint arXiv:, 2311, 06555, 2023.

63
Choudhary M, Du X. Qaevent: Event extraction as question-answer pairs generation[C]//European Chapter of the Association for Computational Linguistics(EACL), Association for Computational Linguistics, 2024: 1860-1873.

64
Shuang K, Zhou J, Wang Q, et al. Utilizing contextual summarizing and reasoning for enhancing document-level event argument extraction[J]. Expert Systems with Applications, 2025: 128075.

65
Li S, Ji H, Han J. Document-level event argument extraction by conditional generation[J]. arXiv preprint arXiv:, 2104, 05919, 2021.

66
Du X, Li S, Ji H. Dynamic global memory for document-level argument extraction[J]. arXiv preprint arXiv:, 2209, 08679, 2022.

67
Pan B, Li Y, Wang S, et al. Document-level event extraction via information interaction based on event relation and argument correlation[C]//Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation. 2024: 5156-5166.

68
Qi Y, Peng H, Wang X, et al. Adelie: Aligning large language models on information extraction[J]. arXiv preprint arXiv:, 2405, 05008, 2024.

69
Chen M, Ma Y, Song K, et al. Improving large language models in event relation logical prediction[J]. arXiv preprint arXiv:, 2310, 09158, 2023.

70
Han Y, Han W, Li A, et al. Cyberattack event and arguments extraction based on feature interaction and few-shot learning[J]. Scientific Reports, 2025, 15 (1): 31808.

DOI

71
Chatziamanetoglou D, Rantos K. Weighted quality criteria for cyber threat intelligence: assessment and prioritisation in the MISP data model[J]. International Journal of Information Security, 2025, 24 (4): 160.

DOI

72
Dimitriadis A, Papoutsis A, Kavalieros D, et al. EVACTI: evaluating the actionability of cyber threat intelligence[J]. International Journal of Information Security, 2025, 24 (3): 123.

DOI

73
Ainslie S, Thompson D, Maynard S, et al. Cyber threat intelligence for security decision-making: a review and research agenda for practice[J]. Computers & Security, 2023, 132, 103352.

74
Rajapaksha S, Rani R, Karafili E. A RAG-based question-answering solution for cyber-attack investigation and attribution[C]//European Symposium on Research in Computer Security. Cham: Springer Nature Switzerland, 2024: 238-256.

75
Shah S, Madisetti V. MAD-CTI: cyber threat intelligence analysis of the dark web using a multi-agent framework[J]. IEEE Access, 2025, 13, 40158- 40168.

DOI

76
Loevenich J, Adler E, Huerten T, et al. Design and evaluation of an autonomous cyber defence agent using DRL and an augmented LLM[J]. Computer Networks, 2025, 262, 111162.

DOI

77
Guan Y, Peng H, Hou L, et al. MMD-ERE: multi-agent multi-sided debate for event relation extraction[C]//Proceedings of the 31st International Conference on Computational Linguistics, Association for Computational Linguistics. 2025: 6889-6896.

78
Dunnett K, Pal S, Jadidi Z, et al. Priv-share: a privacy-preserving framework for differential and trustless delegation of cyber threat intelligence using blockchain[J]. Computer Networks, 2024, 252, 110686.

DOI

79
Riesco R, Larriva-Novo X, Villagra V. Cybersecurity threat intelligence knowledge exchange based on blockchain: proposal of a new incentive model based on blockchain and smart contracts to foster the cyber threat and risk intelligence exchange of information[J]. Telecommunication Systems, 2020, 73 (2): 259- 288.

DOI

80
Chatziamanetoglou D, Rantos K. Cyber threat intelligence on blockchain: a systematic literature review[J]. Computers, 2024, 13 (3): 60.

DOI

81
Gao P, Liu X, Choi E, et al. A system for automated open-source threat intelligence gathering and management[C]//Proceedings of the 2021 International Conference on Management of Data. Association for Computing Machinery, 2021: 2716-2720.

82
Fieblinger R, Alam M, Rastogi N. Actionable cyber threat intelligence using knowledge graphs and large language models[C]//2024 IEEE European Symposium on Security and Privacy Workshops (EuroS&PW). IEEE, 2024: 100-111.

83
Huang L, Xiao X. Ctikg: LLM-powered knowledge graph construction from cyber threat intelligence[C]//First Conference on Language Modeling. 2024.

84
Pan S, Luo L, Wang Y, et al. Unifying large language models and knowledge graphs: a roadmap[J]. IEEE Transactions on Knowledge and Data Engineering, 2024, 36 (7): 3580- 3599.

DOI

文章导航

/