Academic Research

A LLMs-based method for threat intelligence information extraction

  • MA Bingqi ,
  • ZHOU Yinghai ,
  • WANG Ziyu ,
  • TIAN Zhihong , *
Expand
  • Cyberspace Institute of Advanced Technology, Guangzhou University, Guangzhou 510006, China

Online published: 2024-07-08

Copyright

Copyright ©2024 Journal of Aeronautical Materials. All rights reserved.

Abstract

In the context of escalating cybersecurity confrontations, the effective extraction and utilization of threat intelligence were imperative for the enhancement of network security defense strategies. Due to the limitations of traditional information extraction methods in training data construction and model generalization, a framework for extracting threat intelligence entities and relationships based on Large Language Models (LLMs) was proposed. Leveraging LLMs profound semantic comprehension, the framework employed prompt engineering to precisely identify threat entities and their connections, complemented by LangChain for broader extraction coverage. Moreover, integrating search engines enhanced the timeliness and accuracy of intelligence mining. Experimental results demonstrated the framework’ s exceptional performance in few-sample or zero-sample scenarios, significantly reducing misinformation and enabling efficient, real-time intelligence extraction. In general, a flexible and efficient intelligent mining method for threat intelligence is introduced, the knowledge fusion process of threat intelligence is optimized, the proactivity and sophistication of network defense are enhanced.

Cite this article

MA Bingqi , ZHOU Yinghai , WANG Ziyu , TIAN Zhihong . A LLMs-based method for threat intelligence information extraction[J]. Journal of Cybersecurity, 2024 , 2(2) : 36 -46 . DOI: 10.20172/j.issn.2097-3136.240203

0 引言

随着互联网与信息技术的飞速发展,网络安全形势日益严峻。网络威胁持续演进,向着手法隐秘化、战术精细化、手段多样化的趋势发展[1]。从最初由美国空军提出的高级持续性威胁 (Advanced Persistent Threat,APT) [2],已逐渐演变成极具破坏性的典型网络威胁。APT组织采用精妙策略与多元技术开展持续、隐蔽的攻击活动,传统网络安全防御策略已难以应对。具体而言,APT组织发起攻击前往往针对目标系统开展信息收集,采取定制化恶意软件、零日漏洞等手段对目标系统实施定向攻击。此外,APT攻击采用伪装和逃避策略,通常表现出分段执行、长期潜伏的特点,例如APT组织利用系统自带的工具实施恶意活动,从而规避基于静态签名的传统安全防护措施。传统网络安全防御策略有效性低的主要原因是攻防双方信息不对等。攻击者具备对特定目标实施情报探查的能力,而防御者却对潜在未知攻击缺乏预见性认知,在攻防博弈中陷入被动[3]。因此,对于防御者而言,弥合攻防信息鸿沟的关键在于主动获取攻击者信息,这包括从宏观层面发现攻击,通过全局联动将所有信息汇聚起来并有序化安排,从而发现更多攻击行为,进而构建以“护卫模式”为代表的网络安全保障体系[4]。此外,还可以持续利用全面威胁知识更新安全防御措施,确保网络安全防御的先进性。
威胁情报的提出与发展为网络安全防御提供了更主动的应对视角,在改进传统网络安全防御策略的不足方面具有应用价值。具体而言,威胁情报通过分析威胁事件和解构威胁模式,构建涵盖网络威胁识别、评估、监控及响应等多层次的威胁画像[5]。因此,充分挖掘威胁情报中蕴含的威胁知识对于实现网络威胁的感知预警、溯源归因及防御响应至关重要。然而,威胁情报多为非结构化文本数据,具有杂乱繁重、零散孤立的特点,如何高效精确地提取威胁知识成为亟待解决的难题。
近年来,该领域研究主要采用基于传统机器学习或深度神经网络的自然语言处理(Natural Language Processing,NLP)技术构建信息抽取模型,从非结构化的威胁情报文本中提取关键知识单元,以构建结构化威胁知识库。随着NLP技术的发展,许多先进深度神经网络架构如卷积神经网络(Convolutional Neural Network,CNN)、长短期记忆网络(Long Short-Term Memory,LSTM)以及图神经网络(Graph Neural Network,GNN)等,已被广泛应用于威胁情报实体与关系的抽取任务中,并取得良好成效。目前,威胁情报的信息抽取研究大多采用全监督方法,需要大量的领域标注数据进行模型训练。然而,威胁情报训练语料的构建仍面临严峻挑战,包括领域术语频繁使用、数据种类分布不均、威胁实体间依赖关系复杂、开源语料库稀缺等,使得高质量训练数据的标注成本高昂,给多源异构威胁情报的知识融合任务增加了困难。
大语言模型(Large Language Models,LLMs)如GPT(Generative Pre-trained Transformer)[6]系列,在应对上述挑战时具备独特的优势。具体而言,LLMs依托参数庞大的深度神经网络架构,通过对各领域的海量语料进行预训练,获得强大的语言理解及生成能力。LLMs能够捕捉文本中的细微语义区别并挖掘隐含语义信息,实现对语言内容的深层分析。因此,LLMs适应性极强,可通过少量样本学习(Few-Shot Learning)和零样本学习(Zero-Shot Learning)技术,就能在少数样本或无样本的情况下迅速适应新型威胁知识的语义模式。综上所述,LLMs在威胁情报知识抽取任务中具备显著优势,为深入分析威胁情报提供了新途径。
本文旨在探讨基于LLMs进行威胁情报信息抽取的方法,并据此构建应用框架,该框架涵盖3个功能:1)运用LLMs的提示工程(Prompt Engineering)技术[7]高效识别威胁情报文本中的实体及其相互关系;2)辅以LangChain框架[8],实现LLMs对文档型威胁情报的智能问答分析;3)融合搜索引擎功能,实现LLMs对威胁知识的智能挖掘,增强威胁信息时效性,并减轻LLMs的“幻觉”问题[9]。最后,通过实验分析,验证了LLMs在威胁情报信息抽取方面所展现的显著成效。

1 相关工作

威胁情报实体关系抽取的研究工作最早采用基于规则的方法,且聚焦威胁指标 (Indicators of Compromise,IoC)的挖掘[10],如 IP、Hash 值等结构化的实体。Li等[11]在其研究中开发了一种基于规则的实体解析方法,通过定义复杂匹配条件之间的规则来识别关联实体。Liao等[12]开发的IACE(Innovation Solution for Automated IoC Extraction)框架,设计了一种自动化方法,采用模式匹配和数据挖掘技术从开源威胁情报中提取和分析IoC。基于规则的方法因其简明性和易于实现而得到认可,但它在处理复杂数据时的适应性和灵活性有限。
随着机器学习技术,尤其是监督学习的不断发展,实体关系抽取领域的研究已取得显著进展。监督学习需要依赖大量标注数据训练模型,以识别文本中的实体及其相互关系。McNeil等[13]提出的PACE(Pattern Accurate Computationally Efficient Bootstrapping)系统是一种高效的基于模式识别的引导方法,它利用机器学习技术在网络安全领域发现并及时更新关键概念与威胁。罗琴等[14]的研究结合主动学习,实现了初步人工标注、伪标注及基于不确定性的迭代标注,提高了IoC识别的准确率和召回率,显著降低了人工标注需求。刘汉生等[15]提出的多源威胁情报质量评价方法,利用深度学习和特征提取技术,提升了情报数据的决策价值。然而,机器学习方法依赖大量人工标注的数据,耗时且成本高,难以捕获文本的长距离依赖关系和复杂上下文信息,导致模型的泛化能力不足。
深度学习方法,尤其是神经网络模型,在威胁情报实体关系抽取方面进行了创新实践。这些技术通过深度神经网络自动学习文本特征,避免了传统的手工特征设计,从而更精细地揭示了文本实体间的关联。例如,Zheng等[16]在研究中引入了一个混合神经网络模型,该模型结合了用于实体抽取的双向编码器−解码器LSTM和用于关系分类的CNN,无需手工特征。Li等[17]开发的多模型系统通过4个步骤处理威胁情报数据,包括实体抽取和知识图谱构建等。Zhang等[18]的研究采用了一个融合CNN和双向LSTM的人工神经网络模型,旨在同时进行实体识别和关系抽取。Zuo等[19]提出的端到端模型基于BERT-att-BiLSTM-CRF,实现了网络威胁情报(Cyber Threat Intelligence,CTI)中实体及其相互关系的联合抽取。Zhou等[20]创建了CDTier数据集,通过利用NLP技术分析和标注CTI文本来提取实体及其相互关系。尽管深度学习模型的应用前景广阔,但它们通常需要大量标注数据进行训练,而在威胁情报领域获取这类数据颇具挑战,同时模型决策过程的不透明性也增加了解释和理解的难度。
本文旨在解决威胁情报实体及其相互关系抽取任务中由于少样本或零样本而导致的实体关系抽取精度不高、模型泛化能力差等问题,提出一种融合LLMs的方法,该方法能够在无需任何训练样本的前提下,从半结构化及非结构化的威胁情报文本中准确地抽取实体及其相互关系。实验结果表明,本方法是有效且高效的。

2 方法描述

本文基于LLMs提出专注于威胁情报领域内实体及其相互关系的抽取方法,通过分析半结构化及非结构化的异构威胁情报文本,构建出结构化的“实体—关系—实体”三元组。该方法主要包括以下3个核心部分:运用LLMs的提示工程技术精确地定位威胁情报文本中的实体及其相互关系;借助ChatGPT[21]深度解析威胁情报PDF文档,抽取关键信息;结合ChatGPT和搜索引擎的能力进一步挖掘并补充实体的属性信息。以下将对这3个核心部分进行深入探讨。

2.1 提示工程

在进行威胁情报实体关系抽取前,依据STIX(Structured Threat Information eXpression)2.1标准[22]构建威胁实体及其关系类型的模型。根据网络攻防行为中的角色及功能,将威胁实体细化为攻击者(Attacker)、攻击模式(Attack Pattern)、身份(Identity)、指标(Indicator)、恶意软件(Malware)、工具(Tool)、位置(Location)、漏洞(Vulnerability)等8种模型,并在表1中对每种模型进行了明确的定义与示例说明。
表 1 8种威胁实体模型

Table 1 Eight types of threat entitiy models

威胁实体模型 定义 示例
攻击者 发起网络攻击的
个人、团队或组织
APT29威胁组织
攻击模式 攻击者采用的
具体技术或方法
钓鱼攻击
身份 涉及网络安全事件中
可识别的个体或实体
受害企业的名称
指标 标识或暗示网络安全事件的
特定迹象或证据
IP地址
文件哈希值
恶意软件 指用于执行恶意活动的软件 勒索软件
“WannaCry”
工具 攻击者用于实施攻击的合法的
软件或硬件工具
键盘记录器
位置 涉及网络安全事件的
地理位置信息
攻击发起地
受害者所在地
漏洞 系统、网络或软件
中的安全缺陷
CVE-2024-21412
对威胁数据中的实体进行分类不仅增强了信息处理的条理性和系统性,还实现了威胁情报来源的标准化。精确的实体定义和分类能够提高威胁检测、事件响应的效率,同时降低实体识别过程中的不确定性[23]
基于威胁实体模型间的相互作用,将关系类型细分为:归因于(Attributed_to)、使用(Uses)、冒充(Impersonates)、针对(Targets)、指示(Indicates)、位于(Located_at)、利用(Exploits)、由...开发(Authored_by)。关系类型的具体定义如表2所示。
表 2 8种关系类型

Table 2 Eight types of relationship

关系类型 定义 起始实体类型
归因于 一个特定的攻击者或组织归因于某个具体的实体 <Attacker, Identity >
使用 描述了攻击者在其攻击活动中使用的具体工具或方法 <Attacker, Attack Pattern>
<Attacker, Malware>
<Attacker, Tool>
< Malware, Attack Pattern>
冒充 攻击者在攻击过程中冒充另一个实体,如个人、组织或服务 <Attacker, Identity>
针对 指出攻击者的攻击目标,可以是个人、组织、地理位置等 <Attacker, Location>
<Attacker, Identity>
指示 描述了指标与特定威胁实体(如攻击者、恶意软件或使用工具)之间的关联 <Indicator, Attacker>
<Indicator, Malware>
<Indicator, Tool>
位于 表明某个攻击者或实体与特定地理位置的关联 <Attacker, Location>
< Identity, Location>
利用 攻击者或者某个恶意软件利用某个漏洞来实施攻击的行为 <Attacker, Vulnerability>
< Malware, Vulnerability>
由...开发 指明某个恶意软件是由哪个攻击者开发的 <Malware, Attacker>
根据威胁实体模型及关系类型的详细定义,并遵循“清晰度”“特异性”和 “迭代”prompt设计原则,鉴于中英文语法习惯的区别,针对中英文威胁情报分别构建了一套完整规范的prompt文本。首先,明确阐述了模型需要执行的任务,确保了prompt的清晰性。其次,通过提供详尽的细节描述,显著消除了歧义,增强了特异性。最后,基于AI(Artificial Intelligence)反馈,不断对prompt进行优化迭代,以提升其准确性和适用性。具体的prompt文本如图1图2所示。
图 1 完整规范的英文prompt文本

Fig.1 Completely standardized English prompt text

图 2 完整规范的中文prompt文本

Fig.2 Completely standardized Chinese prompt text

利用ChatGPT强大的自然语言处理能力,不仅能够从复杂的威胁情报文本中高效地抽取关键实体及其相互关系,而且还能深入分析这些实体之间的复杂交互作用。得益于大规模数据集的训练,包括各类网络安全文档、实时威胁报告以及历史安全事件分析,ChatGPT能够深刻理解威胁情报文本中的专业术语和隐含含义[24],能够准确识别出攻击者(Attacker)、攻击模式(Attack Pattern)、恶意软件(Malware)、漏洞(Vulnerability)等多种威胁情报实体。更重要的是,ChatGPT能够理解实体间复杂的语义关联,如“使用(Uses)”“针对(Targets)”、“归因于(Attributed_to)”等,揭示了威胁行为的内在逻辑。通过这种方式,不仅提高了威胁情报的处理效率,还加深了对复杂网络威胁的理解,为构建有效的安全防护体系奠定了坚实的基础。

2.2 文档分析

威胁情报通常以PDF文档形式发布,PDF的格式特性保障了文档在不同设备和平台上的内容一致性,这对于含有丰富专业信息的威胁情报的传播和共享至关重要[25]。PDF能确保代码片段、图表、网络拓扑图等关键信息在传递过程中的准确性和完整性。威胁情报文档详细记录了安全威胁的全面信息,包括攻击方法的具体细节、受影响的系统与应用以及相应的解决策略和缓解措施。
PDF文档将文本、图表和布局等元素以复杂方式结合,这给基于纯文本的LLMs带来挑战。特别地,像GPT-3这样的模型面临输入长度的限制,通常在2 048个token左右,在处理长文档时无法全面考虑文档内容,影响对文档结构和内容的整体理解。
针对这一问题,采用结合LLMs和LangChain技术的方法来处理威胁情报的PDF文档,旨在通过问答形式更高效地抽取文档中的关键信息,具体分析流程如图3所示。
图 3 文档分析流程图

Fig.3 Flow chart of document analysis

2.2.1 输入问题处理

文档分析始于用户提出一个明确的问题,随后采用GPT模型对问题进行解析,并将其转化为之后检索系统的查询关键词,进而执行基于内容相似性的搜索。该操作通过生成问题的嵌入向量来完成,以实现高效的语义匹配。

2.2.2 文档内容向量化

1)首先利用Python的PyPDF2库中的PdfReader模块对输入的PDF文档进行解析。PyPDF2是一个功能丰富的库,能够实现PDF文件的读取、编辑、分割、合并以及裁剪,并且支持将PDF页面内容转换为文本。这一步骤旨在从复杂的PDF中提取文本内容,转换成便于后续分析处理的纯文本格式。然后使用LangChain库中的CharacterTextSplitter模块,将提取出的长文本内容分割成较小的文本块。这一步骤根据文本长度和处理能力的限制执行,旨在将大篇幅的文档内容细分成易于管理和分析的小片段,以便进行更深入的处理。
2)通过LangChain库的OpenAIEmbeddings模块为分割后的每个文本块生成嵌入向量。OpenAIEmbeddings模块依托OpenAI模型将文本转换为数值表示形式,即嵌入向量,以捕获其深层的语义信息。这些嵌入向量将文本内容映射到高维空间的点上,使文本块的语义信息得以量化表示。然后通过聚合算法将这些嵌入向量综合起来,构建出一个全面的向量空间。这一向量空间不仅体现了每个文本块的语义特征,也通过聚合过程整合了整个文档的语义信息,展示了文档中不同实体及其相互关系的综合语义结构。

2.2.3 基于问答对文档内容进行解析

1)利用FAISS(Facebook AI Similarity Search)技术在文档向量空间中对用户问题的嵌入向量进行索引和快速检索[26]。FAISS作为一种先进的相似性搜索与聚类工具,特别适合在大规模数据集中进行高维数据的最近邻搜索,其主要优势在于能够大幅提高搜索速度,优化搜索效率和性能。通过对嵌入向量进行精确索引,FAISS能够根据语义相似度快速准确地定位和检索出所需的相关文本块,显著提升信息检索的速度和准确性。
2)利用QA Chain技术结合GPT等LLMs,高效整合检索到的文本块并生成问答内容。系统从检索结果中提取出具体的页面内容,将其作为问题的上下文环境。通过将这些上下文信息与原始问题相结合构建有效的prompt,引导GPT模型深入理解问题的核心及其相关背景。在接收到含有PDF内容及相关问题的prompt后,GPT模型利用其广泛的语言理解和生成能力对prompt进行深度处理,并针对原始问题制定回答。GPT能够基于整合的文本块回应复杂查询,例如关于特定威胁的详细询问或对威胁情报的深入分析。这种方法不仅提升了从大量文本资料中抽取关键信息的速度,而且通过问答形式,增强了信息抽取的准确性与实用性。
该流程整合了LLMs及LangChain库的优势,实现了从复杂PDF文档到可操作文本块的转换,同时确保了信息的完整性与准确性。利用语义嵌入及相似性搜索技术构建了一个高效的文档检索系统,从而实现对信息的高效提取及对复杂查询的深入分析。此方法在处理威胁情报PDF文档时展示出显著优势,尤其适用于威胁情报分析任务,可以满足从大量文档快速提取和分析关键信息的需求。这种综合方法为处理大量复杂文件提供了新的途径,为网络安全领域的研究和实践提供了新的视角。

2.3 搜索引擎

威胁情报实体关系抽取领域面临着诸多挑战,如信息的海量性和分布的广泛性、威胁情报的专业深度与结构复杂性、实体间多样且动态变化的关系以及表达形式的多样性。为应对这些难题,结合LLMs与Web搜索引擎提出了一种有效的解决方案。利用Web搜索引擎的广泛检索功能,全面收集相关的威胁情报,保障信息的完整性和实时性。同时,借助LLMs卓越的自然语言处理技术,深度解析这些信息,包括精准辨识复杂术语、捕捉实体间细微的关系变化以及理解不同表述间的语义差异。这一集成方法不仅提高了实体关系抽取的精确度和效率,也为威胁情报的进一步分析与应用奠定了坚实的基础。
集成LLMs(如GPT)与Web搜索引擎,能够实现的协同效应超出了单独运用时的总和,形成“1+1>2”的效果[27]。这种集成提升了信息检索的精确度与效率,并提高了对检索结果深度解析和理解的能力,从而为威胁情报的实体关系识别提供了更丰富的基础信息。LLMs特别提升了使用搜索引擎进行精确查询的能力,通过理解复杂的自然语言查询,将其转换为更精确的搜索引擎查询语句,突破了传统搜索引擎基于关键词匹配的局限。LLMs还能利用上下文信息或网络安全领域的专业知识,生成更丰富的查询扩展,以提高检索结果的相关性。
在获取搜索结果后,LLMs可对返回的信息进行深入分析,提炼核心内容,甚至根据需求生成详尽的解释和总结。对于复杂的问题,LLMs能够整合多个网页的信息,提供综合性答案,而不是简单地列出网页链接。此外,集成方案还实现了个性化搜索体验的提升,LLMs可根据用户的查询历史、偏好和互动上下文个性化调整搜索结果,使之更贴合用户需求。这种个性化不仅反映在搜索结果的排序上,也体现在LLMs生成的分析和回答的针对性上,提供更以用户为中心的回答服务。
本文提出的LLMs与Web搜索引擎集成的方法如图4所示。在LLMs与搜索引擎结合进行网络安全领域的威胁实体问答任务时,流程始于用户提出的针对特定网络安全威胁或具体威胁实体的查询,比如询问某种恶意软件的特性或是某个攻击者的历史行为。首先,利用LLMs的自然语言理解(Natural Language Understanding, NLU)能力[28]来分析用户查询,提取关键字和相关概念。这一步骤至关重要,明确了后续搜索的方向和范围。LLMs通过对用户输入的内容进行分析识别出查询的核心元素,如特定的威胁实体名称、攻击类型或技术细节。然后,这些关键字被送入搜索引擎进行信息检索。搜索引擎在海量的网络资源中查找与这些关键字相关的内容,返回相应的文档摘要和资料。在这个过程中,搜索引擎的效能决定了信息检索的广度与深度。在获得搜索引擎返回的摘要和查询结果后,这些信息将再次呈递到LLMs中。此时,LLMs不仅作为信息处理工具,还充当了知识综合与解释的生成器。LLMs利用其自然语言生成(Natural Language Generation,NLG)能力[29],依据搜索结果并结合其在预训练过程中积累的知识库,构建出详尽且条理清晰的答案。这些答案不仅概括了关键信息,还涵盖了对相关概念的阐释、相关实体的背景知识以及对原始查询的深层次分析。
图 4 LLMs与搜索引擎集成图

Fig.4 Integration diagram of LLMs and search engine

在整个流程中,LLMs和搜索引擎的结合实现了知识生成和信息检索的协同作用。鉴于该领域信息的快速更新和知识及实体间关系的复杂性,这种协同作用对于处理网络安全领域中威胁实体的相关查询尤为关键。此协作方式使问答系统的准确性、时效性及专业深度性能得到显著提升。

3 实例分析

3.1 提示工程实例分析

2.1节讨论了在使用LLMs进行实体关系识别前,必须明确所需识别的实体及其相互关系。根据预先定义的8种威胁实体模型和8种关系类型以及prompt设计原则,创建了一份完整规范的提示中英文文本模板。该模板包括对LLMs的角色界定、任务描述、实体及关系的明确定义,以及期望的输出格式等。
英文威胁情报文本以TALOS公司在2024年2月发布的针对Turla APT组织的威胁报告为例[30],该报告详述了自2023年12月起,Turla APT组织利用名为TinyTurla-NG的后门程序,主要对位于波兰的非政府组织(Non-Governmental Organization,NGO)进行攻击,尤其是那些负责保护密码数据库和常用密码管理软件密钥的机构,并尝试对相关文件进行归档。报告还指出,攻击者使用了基于WordPress的受感染网站作为TinyTurla-NG后门的命令和控制(Command and Control, C2)中心。
中文威胁情报文本以安天公司在2024年4月发布的针对“游蛇”黑产的威胁报告为例[31],该报告详述了“游蛇”黑产自2022年下半年开始,专注于对中国金融和财务相关企业及人员发起钓鱼攻击和诈骗活动。该团体利用包括Trojan/Win64.SwimSnake、商业远控软件“第三只眼”在内的恶意软件,执行攻击并远程监控受害者。安天CERT团队提供了安全建议,强调保持对接收文件的警觉和使用专门的威胁排查工具进行防护。此外,攻击者通过伪装文件、内存执行和“白加黑”手段绕过安全措施。该威胁情报还详细描述了特定的恶意文件如何操作,包括下载、解密载荷以及执行恶意操作的过程。
采用2.1节中提到的完整规范prompt文本,借助GPT-4对上述报告进行实体关系抽取,得到的结果如图5图6所示。
图 5 提示工程实体关系抽取英文实例

Fig.5 English instance of prompt engineering entity relationship extraction

图 6 提示工程实体关系抽取中文实例

Fig.6 Chinese instance of Prompt engineering entity relationship extraction

高效利用LLMs(如GPT-4)进行威胁情报分析尤为重要。通过应用本文设计的规范化提示文本模板,GPT-4能够从安全报告中精确地提取威胁情报实体及其相互关系,生成的结果不仅完整规范,而且清晰易读。这一实践证明,精心设计的提示文本可以有效地引导LLMs对威胁情报中的非结构化文本进行准确的实体关系抽取。提示工程方法提高了信息抽取的效率和数据分析的准确性,同时也为威胁情报分析领域带来了新的研究视角,有助于构建更加动态和响应性强的网络安全防御系统,提升整体的网络安全管理水平。

3.2 文档分析实例分析

LLMs处理PDF格式的威胁情报文档具有一定挑战,主要是因为PDF的固有格式特性和LLMs在处理长文本时的局限性。PDF文件的结构化设计导致直接提取文本会丢失关键的格式与布局信息,而LLMs的输入长度限制会阻碍对完整文档上下文信息的理解。
为解决这些问题,2.2节提出了一种基于问答机制的解决方法,以有效提取威胁情报PDF文档中的关键信息。通过回答一系列针对性问题,逐步深入文档内容,打破文本长度限制,保留文档上下文信息的完整性。
针对英文威胁情报,以Leonardo公司2020年5月发布的关于APT组织TURLA的34页威胁情报PDF文档[32]为例,图7通过一系列问答展示了如何获取关键实体、关系类型及其属性信息。
图 7 利用ChatGPT 3.5和LangChain技术挖掘TURLA分析文档的信息

Fig.7 Information extraction from TURLA analysis documents by using ChatGPT 3.5 and LangChain technologies

首先,对于问题“What does this threat intelligence say?”,文档分析模块综合了整个文档的内容,概述了威胁情报的主要信息。随后,面对问题“What kinds of malware does TURLA use?”,该模块通过深入遍历并理解文档内容,识别出“Penquin_x64”为TURLA使用的恶意软件,构建了如<Turla, use, Penquin_x64>的关系实例。最后,面对问题“Could you please introduce the malware Penquin_x64?”,文档分析模块根据文档中的信息,详细解析了恶意软件Penquin_x64的属性和特性。
针对中文威胁情报,以奇安信公司2024年3月发布的关于“金相狐”(Golden Physiognomy Fox)组织的34页威胁情报PDF文档[33]为例,图8通过问答演示展示了如何合理提取关键实体、关系类型及其属性信息。首先,针对问题“这篇威胁情报讲了什么?”,文档分析模块对文档全文进行了综合分析,概括了与威胁情报相关的核心信息。然后,对于“‘金相狐’团伙用了哪些恶意软件?”的查询,通过对文档内容的深入挖掘,识别出该团伙所使用的恶意软件种类。最后,面对“详细介绍这些恶意软件”的要求,文档分析模块依据文档中的具体信息,详尽阐述了这些恶意软件的属性与特性。此过程不仅显示了文档分析技术的深度与精准性,也体现了威胁情报分析在网络安全领域中的应用价值。
图 8 利用ChatGPT 3.5和LangChain技术挖掘金相狐组织分析文档的信息

Fig.8 Information extraction from Golden Physiognomy Fox analysis documents by using ChatGPT 3.5 and LangChain technologies

这种方法通过整合LLMs和问答机制,展示了在处理复杂威胁情报文档方面的显著优势,这种融合利用LLMs在文本理解和生成方面的强大能力,同时依靠问答机制的结构化查询,实现了对复杂数据的精确解析和信息抽取,突出了逐步深入、上下文保持一致在信息抽取过程中的重要性。

3.3 搜索引擎实例分析

在威胁情报实体关系抽取的过程中,除了识别实体及其相互关系外,实体的属性同样至关重要。实体属性为深入理解和分析威胁情报提供关键信息。实体属性指的是与实体相关的详细信息,例如对于“恶意软件”这一实体,其属性可能包括恶意软件的类型、别名存在、传播方式、版本、影响系统以及对抗措施等。
在实践中,要求威胁情报分析系统具备高度的灵活性和精度,以便从大量非结构化的威胁情报数据中准确识别并提取出各实体的具体属性。将LLMs(如ChatGPT 3.5)与Web搜索引擎集成,可以显著提高实体关系抽取的准确性和效率,并增强对检索结果的深度解析和理解能力,尤其适用于复杂的实体属性抽取任务。
图9展示了在ChatGPT 3.5与Web搜索引擎集成的情况下,ChatGPT 3.5的回答示例。
图 9 ChatGPT 3.5和Web搜索引擎集成收集恶意软件ShadowPad的属性信息

Fig.9 ChatGPT 3.5 integrates with web search engines to collect attribute information of malware ShadowPad

LLMs如GPT系列,在生成文本时偶尔会产生一种被称为“幻觉”的现象,即产生不准确或与现实不符的信息。将搜索引擎的结果作为输入提供给LLMs是一种有效的解决策略,该策略能够利用搜索引擎检索到的实时和准确的外部信息来提高LLMs回答的质量,确保生成的内容更加贴近数据和事实真相。
图9所示,通过将ChatGPT 3.5和Web搜索引擎集成进行问答,可以直观明确地获得关于恶意软件ShadowPad的详细属性信息。这种集成方法显著减少了LLMs可能出现的“幻觉”(生成与事实不符的信息),提高了生成答案的内容丰富度、准确性、客观性和可靠性。

4 结束语

鉴于神经网络模型在威胁情报实体关系抽取方面面临的若干问题,如对复杂语义理解的局限性、训练数据的依赖性及处理长文本的困难,本文提出了一系列基于LLMs的创新方法,旨在提高威胁情报信息抽取的准确性和效率。本文的创新之处主要体现在以下3个方面:首先,借助于提示工程,结合预定义的实体模型和关系类型,实现了对威胁情报内容的高效提取,优化了信息提取流程。合适的提示设计提高了信息提取的质量与相关性。其次,针对威胁情报中常见的长文本PDF文档,利用LLMs的语言理解能力,结合LangChain技术,深入理解文档内容,有效地从复杂的文本向量空间中提取出关键的实体关系信息。最后,LLMs与搜索引擎的集成不仅提供了一种高效收集实体属性的手段,同时也在一定程度上克服了LLMs存在的“幻觉”问题,将实时、准确的网络信息作为支撑,生成更贴合实际的回答,减少误导信息的产生。
未来,随着LLMs技术的持续发展,威胁情报信息抽取的准确度和效率将得到进一步的提升。此外,探索LLMs在威胁情报分析中更广泛的应用,如动态威胁建模、自动化威胁响应等,也将是未来研究的关键方向。期待在网络安全防御领域实现更加智能化、自动化的威胁情报处理分析系统。
1
田志宏. 网络空间高隐蔽未知威胁检测与溯源[J]. 信息通信技术, 2020, 14 (6): 4- 7.

TIAN Z H. Detection and attribution of highly concealed unidentified threats in cyberspace[J]. Information and Communications Technology, 2020, 14 (6): 4- 7.

2
WIKIPEDIA. Advanced persistent threat[EB/OL]. (2024-03-12)[2024-04-15].https://en.wikipedia.org/wiki/Advanced_persistent_threat.

3
LI V G,DUNN M,PEARCE P,et al. Reading the tea leaves:a comparative analysis of threat intelligence[C]//28th USENIX security symposium (USENIX Security 19). 2019:851-867.

4
田志宏, 方滨兴, 廖清, 等. 从自卫到护卫: 新时期网络安全保障体系构建与发展建议[J]. 中国工程科学, 2023, 25 (6): 96- 105.

TIAN Z H, FANG B X, LIAO Q, et al. Cybersecurity assurance system in the new era and development suggestions thereof: from self-defense to guard[J]. Strategic Study of Chinese Academy of Engineering, 2023, 25 (6): 96- 105.

5
SAEED S, SUAYYID S A, AL-GHAMDI M S, et al. A systematic literature review on cyber threat intelligence for organizational cybersecurity resilience[J]. Sensors, 2023, 23 (16): 7273- 7301.

DOI

6
RADFORD A,NARASIMHAN K,SALIMANS T,et al. Improving language understanding by generative pre-training[EB/OL]. [2024-04-15].https://www.mikecaptain.com/resources/pdf/GPT-1.pdf.

7
LIU P, YUAN W, FU J, et al. Pre-train, prompt, and predict: a systematic survey of prompting methods in natural language processing[J]. ACM Computing Surveys, 2023, 55 (9): 1- 35.

8
YAO S, ZHAO J, YU D, et al. React: synergizing reasoning and acting in language models[J]. arXiv preprint arXiv:, 2210, 03629, 2022.

9
HUANG L, YU W, MA W, et al. A survey on hallucination in large language models: principles, taxonomy, challenges, and open questions[J]. arXiv preprint arXiv:, 2311, 05232, 2023.

10
LUTTGENS J T,PEPE M,MANDIA K. Incident response & computer forensics[M]. New York:McGraw-Hill Education Group,2014.

11
LI L, LI J, GAO H. Rule-based method for entity resolution[J]. IEEE Transactions on Knowledge and Data Engineering, 2014, 27 (1): 250- 263.

12
LIAO X,YUAN K,WANG X F,et al. Acing the IOC game:toward automatic discovery and analysis of open-source cyber threat intelligence[C]//Proceedings of the 2016 ACM SIGSAC Conference on Computer and Communications Security. 2016:755-766.

13
MCNEIL N,BRIDGES R A,IANNACONE M D,et al. Pace:pattern accurate computationally efficient bootstrapping for timely discovery of cyber-security concepts[C]//2013 12th International Conference on Machine Learning and Applications. IEEE,2013,2:60-65.

14
罗琴, 杨根, 刘智, 等. 结合主动学习的威胁情报IOC识别方法[J]. 电子科技大学学报, 2023, 52 (1): 108- 115.

LUO Q, YANG G, LIU Z, et al. ICAL: a threat intelligence IOC identification method combined with active learning[J]. Journal of University of Electronic Science and Technology of China, 2023, 52 (1): 108- 115.

15
刘汉生, 唐洪玉, 薄明霞, 等. 基于机器学习的多源威胁情报质量评价方法[J]. 电信科学, 2020, 36 (1): 119- 126.

LIU H S, TANG H Y, BO M X, et al. A multi-source threat intelligence confidence value evaluation method based on machine learning[J]. Telecommunications Science, 2020, 36 (1): 119- 126.

16
ZHENG S, HAO Y, LU D, et al. Joint entity and relation extraction based on a hybrid neural network[J]. Neurocomputing, 2017, 257, 59- 66.

DOI

17
LI Y, GUO Y, FANG C, et al. A novel threat intelligence information extraction system combining multiple models[J]. Security and Communication Networks, 2022, 12 (1): 139- 151.

18
ZHANG Z, ZHAN S, ZHANG H, et al. Joint model of entity recognition and relation extraction based on artificial neural network[J]. Journal of Ambient Intelligence and Humanized Computing, 2022, 13 (7): 3503- 3511.

DOI

19
ZUO J,GAO Y,LI X,et al. An end-to-end entity and relation joint extraction model for cyber threat intelligence[C]//2022 7th International Conference on Big Data Analytics (ICBDA). IEEE,2022:204-209.

20
ZHOU Y, REN Y, YI M, et al. CDTier: a Chinese dataset of threat intelligence entity relationships[J]. IEEE Transactions on Sustainable Computing, 2023, 8 (4): 627- 638.

DOI

21
OUYANG L, WU J, JIANG X, et al. Training language models to follow instructions with human feedback[J]. Advances in Neural Information Processing Systems, 2022, 35, 27730- 27744.

22
STIX project. Structured threat information eXpression[EB/OL]. (2023-03-20)[2024-04-15].https://stixproject.github.io/.

23
YOU Y, JIANG J, JIANG Z, et al. TIM: threat context-enhanced TTP intelligence mining on unstructured threat data[J]. Cybersecurity, 2022, 5 (1): 35- 51.

24
BAHRINI A,KHAMOSHIFAR M,ABBASIMEHR H,et al. ChatGPT:applications,opportunities,and threats[C]//2023 Systems and Information Engineering Design Symposium (SIEDS). IEEE,2023:274-279.

25
JOHNSON C S,FELDMAN L,WITTE G A. Cyber threat intelligence and information sharing [M]. Gaithersburg,MD:National Institute of Standards and Technology,2017.

26
JOHNSON J, DOUZE M, JEGOU H. Billion-scale similarity search with GPUs[J]. IEEE Transactions on Big Data, 2019, 7 (3): 535- 547.

27
YANG J, JIN H, TANG R, et al. Harnessing the power of LLMs in practice: a survey on ChatGPT and beyond[J]. ACM Transactions on Knowledge Discovery from Data, 2023, 9 (3): 101- 131.

28
ZHANG X F. Towards more robust natural language understanding[J]. arXiv preprint arXiv:, 2112, 02992, 2021.

29
JURASKA J, KARAGIANNIS P, BOWDEN K K, et al. A deep ensemble model with slot alignment for sequence-to-sequence natural language generation[J]. arXiv preprint arXiv:, 1805, 06553, 2018.

30
MALHOTRA A,UNTERBRINK H,VENTURA V,et al. TinyTurla next generation-Turla APT spies on polish NGOs[EB/OL]. (2024-02-15)[2024-04-15].https://blog.talosintelligence.com/tinyturla-next-generation/.

31
安天CERT. “游蛇”黑产近期攻击活动分析[EB/OL]. (2024-04-07)[2024-04-15].https://mp. weixin. qq. com/s/slKYeKIk5HIbmlUVbtAGtw.

Antiy CERT. Analysis of recent attack activities of “Swimming Snake” blackmail [EB/OL]. (2024-04-07)[2024-04-15].https://mp.weixin.qq.com/s/slKYeKIk5HIbmlUVbtAGtw.

32
LEONARDO. Malware technical insight:turla “penquin_x64” [EB/OL]. (2020-05-9)[2024-04-15].https://www.leonardo.com/documents/20142/10868623/Malware+Technical+Insight+_Turla+%E2%80%9CPenquin_x64%E2%80%9D.pd.

33
奇安信. 金相狐黑产团伙:AI人脸识别诈骗敲响金融安全警钟[EB/OL]. (2024-03-26)[2024-04-15]. https://www. qianxin. com/threat/reportdetail?report_id=313.

QAX. Golden physiognomy fox blackmail gang:AI face recognition scam rings financial security alarm bells [EB/OL]. (2024-03-26)[2024-04-15].https://www.qianxin.com/threat/reportdetail?report_id=313.

Outlines

/