A review of research on the construction and application of cybersecurity knowledge graph

  • ZHANG Shuyue ,
  • ZHAN Haomou ,
  • LI Xinze ,
  • SUN Xiongtao ,
  • LI Hui , *
Expand
  • School of Cyber Engineering, Xidian University, Xi’an 710126, China

Online published: 2024-11-16

Copyright

Copyright ©2024 Journal of Aeronautical Materials. All rights reserved.

Abstract

With the rapid development of cyberspace, cybersecurity threats are becoming increasingly complex and diverse. Knowledge graphs offer new methods for extracting, integrating, and analyzing multi-source heterogeneous cybersecurity data. In recent years, knowledge graphs have gradually been applied in various cybersecurity subfields, such as threat intelligence, vulnerability management, and attack path analysis, demonstrating vast potential for application. Furthermore, as the application of knowledge graphs deepens, the numerous security issues that knowledge graphs face also deserve significant attention. We to provide a comprehensive overview of the construction and application of Cybersecurity Knowledge Graphs (CKG), as well as the security risks currently faced by knowledge graphs. First, we introduced the construction of CKGs, including related work on cybersecurity ontologies and cybersecurity information extraction. Then we reviewed relevant work on CKGs based on threat intelligence, CKG completion, and specific applications of CKGs. Following this, we explored the current security risks faced by knowledge graphs, covering attacks and defenses against knowledge graphs, as well as privacy protection within knowledge graphs. Finally, we discussed the challenges and future research directions in the field of knowledge graph research for cybersecurity. Through a comprehensive introduction and in-depth analysis of the construction and application of CKGs, as well as the risks and protections associated with knowledge graphs, we can promote application of knowledge graphs in the field of cybersecurity.

Cite this article

ZHANG Shuyue , ZHAN Haomou , LI Xinze , SUN Xiongtao , LI Hui . A review of research on the construction and application of cybersecurity knowledge graph[J]. Journal of Cybersecurity, 2024 , 2(3) : 79 -106 . DOI: 10.20172/j.issn.2097-3136.240307

0 引言

知识图谱(Knowledge Graph,KG)[1]作为一种结构化的知识表示形式(本质上是一种语义网络[2]),自Google于2012年首次提出以来,迅速在学术界和工业界引起广泛关注。知识图谱通过信息提取、知识融合、知识推理等过程,将分散在多处以不同形式表示的信息进行关联融合,形成一个统一表示且高质量的知识集(以节点和边的形式直观地展示实体及其关系),继而根据现有知识进行推理,挖掘潜在知识的同时产生新的知识,最终实现智能化和可视化的分析[3]。目前,已有大量知识图谱产品投入信息检索领域的实际应用,如Google Knowledge Graph[4]、微软的Satori[5]、搜狗的知立方[6]等。不仅如此,知识图谱还在社交媒体[7]、金融风控[8]、医疗保健[9]、电子商务[10]等生活场景得到广泛应用,衍生出一批优秀的产品[11]。与此同时,Wikidata[12]、DBpedia[13]、Freebase[14]、YAGO[15]等通用知识库也逐渐得以完善,它们包含了丰富多样的知识和信息,并涵盖各个领域的实体、属性和关系,为知识图谱的发展提供了丰富的数据资源[16]
知识图谱在处理和整合大规模异构数据方面的优势,同样也为网络空间安全领域带来了新的契机。网络攻击与防御发生在动态、复杂的环境中,各种因素都会影响攻击和防御效果。一方面,网络空间环境不断变化,例如应用程序不断安装和更新,硬件设备不断部署和拆卸[17]。另一方面,网络空间攻防双方的信息不对称现象也愈发突出[18]。高级持续性威胁(Advanced Persistent Threat,APT)[19]等现代攻击的复杂性、持久性和高度隐蔽性特征,使得传统防御技术的局限性日益突出。简单的特征提取[20]、异常检测[21]和数据分类[22]方法,已无法全面复现攻击行为。如何提取和应用隐藏在网络安全数据中的专家知识是解决上述问题的关键。然而,随着网络空间产生的数据量急剧上升,数据多样化、碎片化、异构性,使得网络安全管理人员难以快速获取与整合所需信息[23]。因此,当前网络安全分析的问题不在于可用数据的短缺,而是如何整合各种来源的非同质信息,以辅助管理人员更好地了解网络安全状况并做出决策[24]。针对这一问题,知识图谱作为一种有效的知识表示和管理工具,向研究者们提供了新的解决方案。通过将网络空间中的设备、用户、事件等信息构建成知识图谱,安全专家可以更全面地理解和分析潜在威胁。例如,在威胁情报共享方面,知识图谱可以集成多源异构的威胁情报数据,提供统一的视图,帮助快速识别和应对威胁。在恶意软件检测中,知识图谱通过建模恶意软件的行为特征和关系,提高了检测的准确性和效率。在攻击路径分析中,知识图谱可以帮助识别潜在的攻击路径和关键节点,进行攻击溯源,从而制定更有效的防御策略[25]
知识图谱在网络空间安全领域展现了广阔的应用前景,随着知识图谱不断整合越来越多的重要数据,其面临的安全风险也变得日益严峻。一方面,攻击者可能通过注入恶意数据或利用知识图谱中的漏洞实施攻击。例如,针对知识图谱模型的投毒攻击和对抗攻击就可能对知识图谱模型的推理或预测等关键功能造成重大影响。投毒攻击通过注入误导性或恶意的数据,以破坏知识图谱的内容或结构,从而使知识图谱模型输出错误结果。对抗攻击则针对知识图谱中的敏感实体或关系做出细微、难以察觉的修改,隐蔽地干扰模型输出。另一方面,知识图谱的隐私保护问题同样值得重视。知识图谱开放、共享的特性在促进信息传播、融合的同时,也为隐私保护带来新的挑战。知识图谱包含的敏感信息,如个人数据、商业秘密等,极易成为隐私窃取攻击的目标。攻击者可以通过链接外部数据或逻辑推理,推断并恢复匿名化数据,从而造成隐私泄露。此外,如何在保护隐私的同时,仍保持跨域、多源知识图谱推理或预测的效率和准确性,也是一个亟待解决的难题。
综上,网络空间安全领域的研究既需要知识图谱的应用赋能,也需要警惕其面临的安全风险。然而,现有的面向网络空间安全领域的知识图谱研究综述多侧重于网络安全本体和信息提取方法的介绍和归纳,较少涉及网络安全知识图谱及其具体应用的研究总结,也缺乏对知识图谱面临的安全风险的详细讨论和总结。因此,本文系统梳理了2019年至今在主流安全类期刊和会议上发表的96篇研究论文,归纳了网络安全知识图谱具体的研究方向和理论方法,总结了其现有研究成果及存在的挑战,并指出了未来的研究方向。
论文的贡献包括3个方面:
(1)系统梳理并归纳总结了网络安全知识图谱的七大应用,以及其他有价值的应用探索。
(2)从针对知识图谱的攻击与防御、知识图谱中的隐私保护两方面,首次对知识图谱的安全风险与防护研究进行系统性的梳理与总结。
(3)讨论了面向网络空间安全领域的知识图谱研究当前面临的挑战以及未来的工作方向,为读者运用新技术新方法促进领域研究水平提升提供了文献综述支持。

1 网络安全知识图谱的构建与应用

网络安全知识图谱 (Cybersecurity Knowledge Graph,CKG) 是一种应用于网络安全领域的特定知识图谱,是由与安全概念相关的节点和边构成的大规模安全语义网络。CKG提供了一种直观的建模方法,用于描述现实安全世界中的各种攻击和防御场景。

1.1 网络安全知识图谱的构建

网络安全知识图谱的构建遵循一般知识图谱的框架和流程。由于网络安全领域的知识数据体系相对成熟和完备,因此可以采用自顶向下的构建方法(见图1),在一定的框架或领域专家预先设计的网络安全本体的指导下整合碎片化的领域数据,然后通过信息提取技术从原始网络安全数据中提取实体和关系形成语义三元组,最后通过将三元组中的实体和关系转化为知识图谱中的节点和边,从而完成CKG的构建。
图 1 CKG自顶向下构建流程图

Fig.1 CKG top-down construction flow chart

1.1.1 网络安全本体

网络安全本体是一种知识表示结构,旨在定义和描述网络安全领域中的概念及其相互关系。它通过建立统一的术语和关系框架,帮助组织和管理网络安全相关的数据和信息,使不同系统和人员之间能够更好地共享和理解安全知识。网络安全本体包括对各种安全威胁、攻击手段、防御措施、事件响应等内容的详细描述,能够支持安全数据的集成、分析和推理,有助于提升整体网络安全管理和防护能力。
网络安全本体的构建通常采用自顶向下、自底向上以及中间出发3种方法。自顶向下法指首先确定本体的核心概念和顶级类别,然后再逐步添加细节,定义子类和属性,这种方法适用于已有清晰定义的概念体系结构或领域较广泛的情况,有助于确保整体结构的一致性和完整性,但可能忽略细节。自底向上法指首先识别具体实例中的共性,然后将这些共性上升为概念,最后形成更高层次的类和关系,这种方法适合领域内的具体数据或实例较为丰富的情况,可以更好地捕捉细节,但在构建高层次结构时可能缺乏全局视角。中间出发法指从领域中的某些关键概念或层次开始,逐步向上和向下扩展,最终构建出完整的本体结构,这种方法适用于领域知识相对明确,且核心概念较容易识别的情况,其结合了自顶向下和自底向上两种方法的优点,既可以保证本体的核心概念准确性,又能逐步丰富细节。
自2001年Raskin等[26]提出最早的网络安全本体之一—信息安全本体后,网络安全本体研究历经20余年的发展,涌现出了许多优秀的本体模型。
威胁情报方面,Rastogi等[27]针对恶意软件威胁情报的收集和分析问题,提出一种开源恶意软件本体MALOnt。MALOnt定义了68个类、31个对象属性和13个数据属性,覆盖恶意软件特性、攻击向量、攻击者详情、受影响的操作系统和行业等多个方面。在MALOnt的基础上,Christian等[28]提出MALONT2.0,它通过定义新的类和关系,捕获恶意软件攻击的语义和句法特征,为安全研究人员提供更全面的威胁情报分析。针对网络威胁情报从共享向赋能演化,从辅助后端治理转变为支撑前端防范中存在的本体构建缺乏整体思维、本体粒度限制情报赋能等问题,胡勉宁等[29]提出一种面向前端防范的细粒度本体模型,基于STIX2.1标准,将网络威胁情报划分为11类本体,并进一步细化为59种细粒度本体,包括攻击者、攻击意图、攻击手段、攻击模式、基础设施、攻击类型等。
漏洞管理方面,Syed等[30]针对网络漏洞管理领域如何有效整合和管理多源漏洞信息的难题,以及现有漏洞管理系统和本体学模型缺乏对社交媒体情报的整合的问题,设计并提出了一种概念性的网络安全漏洞本体CVO,通过整合来自多个官方来源(如NIST、CERT/CC、CVSS)和社交媒体(如Twitter)的漏洞概念,以提供全面的漏洞知识表示。CVO包含五个核心概念——漏洞、情报、威胁、产品、对策,每个概念又细分为多个子概念。例如,漏洞概念包括攻击向量、攻击复杂性、所需权限、用户交互、影响范围等子概念。
社会工程学方面,Wang等[31]针对社会工程攻击的攻击手段灵活多变,传统技术防御措施难以检测和阻止的问题,开发了一种社会工程领域本体,用于系统描述和分析社会工程攻击的核心实体及其关系。该本体定义了11个核心概念和22种关系,涵盖了社会工程攻击的关键要素,如攻击者、攻击动机、攻击目标、攻击方法、人类脆弱性等。作者通过15个具体攻击场景的实例验证了其在分析社会工程攻击场景和威胁中的有效性。
态势感知方面,Kurniawan等[32]针对现有系统调用溯源图面临的语义互操作性差、重用性低、扩展性有限等问题,提出一种用于表示系统调用溯源图的本体模型KRYSTAL。该本体结合自底向上和自顶向下的方法开发,能够表示低级系统调用数据并将其链接到高级攻击模式,从而建立可导航和可查询的溯源图,增强攻击理解和态势感知能力。Wang等[33]针对现有安全本体在支持多任务网络安全态势感知(Network Security Situation Awareness,NSSA)方面存在互操作性差、覆盖范围有限等问题,提出并开发了一种扩展的网络安全本体SSAO,作为NSSA实施的核心组件。SSAO由多个模块化子本体组成,每个子本体都拥有特定的功能,旨在支持不同的NSSA任务。
隐私合规方面,Echenim等[34]针对现有物联网安全监管框架通常各自独立运作,导致难以一致地遵循隐私合规性的问题,提出了一个全面的语义框架——IoT-Reg本体。该框架整合了现有监管条例,并基于物联网数据全生命周期提供分层的方法,涵盖数据收集、保留、处理、共享和删除等阶段。
表1总结归纳了以上网络安全本体研究涉及的本体名称、本体领域、本体构建方法、本体质量评估方法以及是否开源等内容。由表1可知,近年来网络安全本体研究的聚焦领域逐渐从威胁情报扩展至态势感知、隐私合规等其他方面,本体领域逐渐从单一走向多元。其次,尽管中间出发的本体构建方法结合了自顶向下和自底向上两种方法的优点,但并不意味其适合所有的网络安全本体研究,许多网络安全本体的构建仍采用更适合自身研究情况的自顶向下或自底向上的方法。此外,当前的网络安全本体研究几乎均采取了一些方法以评估网络安全本体的质量,多数研究采用了通过本体构建知识图谱并进行具体场景应用的方法进行评估。最后,网络安全本体研究的开源趋势逐渐向好。
表 1 网络安全本体研究汇总

Table 1 Summary of research on cybersecurity ontology

文献 年份 本体名称 本体领域 构建方法 质量评估方法 是否开源
[27] 2020 MALOnt 威胁情报 中间出发 目标建模(适应性和一致性) Π
[28] 2021 MALONT2.0 威胁情报 自底向上 知识图谱构建与场景应用 Π
[29] 2023 网络威胁情报细粒度本体 威胁情报 自顶向下 完整性、可扩展性、清晰性、兼容性和一致性 Ο
[30] 2020 CVO 漏洞管理 自顶向下 焦点小组评估(清晰性、一致性、简洁性、可扩展性、正确性、最小本体承诺和完整性) Ο
[31] 2021 domain ontology of social engineering in cybersecurity 社会工程学 自顶向下 知识图谱构建与场景应用 Π
[32] 2022 KRYSTAL 态势感知 中间出发 知识图谱构建与场景应用 Π
[33] 2023 SSAO 态势感知 自顶向下 知识图谱构建与场景应用 Π
[34] 2023 IoT-Reg 隐私合规 中间出发 知识图谱构建与场景应用 Ο

1.1.2 网络安全实体提取

网络安全实体提取和关系提取技术的发展经历了从简单的关键字匹配到复杂的机器学习和深度学习模型的演变。最初,实体提取和关系提取主要依赖于预定义规则和正则表达式,效率低下且难以应对复杂的网络安全场景。随着自然语言处理(Natural Language Processing,NLP)技术的进步,基于统计模型的方法开始广泛应用,提高了实体提取和关系提取的准确性和适应性。近年来,随着深度学习技术的兴起,尤其是神经网络和预训练语言模型的应用,实体和关系提取在处理大规模、多样化的网络安全数据时表现出更高的性能和灵活性。
Kim等[35]针对传统的基于统计的命名实体识别(Named Entity Recognition,NER)方法在处理海量和动态数据时效率低下且难以维护的问题,提出一种基于深度学习的NER系统,用于从网络威胁情报(Cyber ​​Threat Intelligence,CTI)报告中自动提取核心信息。该系统利用双向长短期记忆网络(Bidirectional Long Short-Term Memory,Bi-LSTM)和条件随机场(Conditional Random Field,CRF)相结合的方法,提高了实体提取的准确性和效率。
Gao等[36]针对传统机器学习方法和基于统计的NER方法在处理复杂和动态数据时效率低下,特别是对罕见实体和复杂词汇的识别能力不足的问题,提出了一种结合数据驱动和知识驱动的方法。该模型利用深度学习自动从大规模数据集中学习文本特征,同时使用外部词典辅助识别罕见实体。此外,模型还采用注意力机制,以更好地捕捉文本的局部特征和上下文信息,从而提高对复杂实体的识别效果。
Chen等[37]针对传统方法在处理复杂语义和多义词时表现不佳,且对新的威胁和实体缺乏有效识别能力的问题,提出了一种基于联合BERT模型的网络安全命名实体识别方法。该方法通过预训练的BERT模型联合长短期记忆网络(Long Short-Term Memory,LSTM)、Bi-LSTM、迭代扩张卷积神经网络(Iterated Dilated Convolutional Neural Network,ID-CNN)和CRF,并特别针对软件实体识别准确率低的问题,加入软件词典特征以提升性能。
Fang等[38]针对传统NER模型对于复杂结构的网络安全实体识别难度较大,且难以捕捉非局部和非顺序的依赖关系的问题,提出一种基于图卷积神经网络(Graph Convolutional Networks,GCN)的网络安全实体识别模型CyberEyes。该模型能够捕捉文本中的非局部依赖关系,并结合Bi-LSTM和CRF,提高了网络安全实体识别的准确率和召回率。
Ranade等[39]提出了CyBERT,一个专门为网络安全领域设计的双向编码器表示模型。作者使用大规模的网络安全文本数据通过掩码语言建模(Masked Language Modeling,MLM)对基本BERT模型进行微调,以识别特定的网络安全实体。实验结果表明,CyBERT能够在未见过的网络安全文本中准确识别出相关的攻击模式、漏洞、恶意软件等实体。​
网络威胁情报的典型领域特征,如实体边界模糊、多义性或单个词语对应多种词语表达等,使得实体识别结果不如预期。此外,将实体识别模型直接从通用领域迁移至CTI领域也面临着诸多挑战。针对这些问题,Wang等[40]提出一种补充领域知识工程的深度学习实体识别模型,首先利用BERT模型获取动态词向量,随后利用Bi-LSTM-CRF对词序列进行编码,最后利用网络威胁情报知识工程改进识别结果,帮助提高实体识别的准确率。
现有的网络安全实体提取工作在利用结构化特征时,更多关注神经网络的简单线性堆叠,不同类型的神经网络之间的相互作用是模糊的。此外,现有模型对网络安全中复杂实体术语的边界并不敏感。针对这些问题,Wang等[41]提出一种新的特征集成和实体边界检测模型FIEBD。并且开发了一种新型神经网络单元GARU,以整合从图神经网络和循环神经网络中提取的不同类型的特征。它将图编码器与门机制相结合,旨在通过显式交互获得更好的隐藏表示。此外,还设计了一个实体边界检测模块,将实体头尾预测作为增强任务,来处理复杂的网络安全实体。

1.1.3 网络安全实体的关系提取

为了帮助研究人员快速了解新威胁事件与先前威胁事件之间的联系,威胁情报文档级关系提取(Relation Extraction,RE)在威胁情报文本分析和处理中起着非常重要的作用。Wang等[42]通过将共指关系视为一种预定义关系,提出了一种联合学习框架TIRECO,能够同时完成威胁情报关系提取和共指解析任务。该框架通过将文档级关系提取任务转化为跨句关系提取任务,并应用新的剪枝策略(SDP-VP-SET),有效提取文档级文本的特征。Li等[43]提出了一种新的特征增强文档级关系提取模型FEDRE-KD,通过集成实体的词性、提及的宽度、实体对之间的距离以及实体类型等附加特征来充分利用文档中的信息。此外还通过引入师生模型,实现了知识蒸馏,进一步提升模型性能。
为了更好地关联数据以构建知识图谱,Shen等[44]提出了一种远距离监督关系提取模型ResPCNN-ATT。该模型基于深度残差卷积神经网络和注意力机制,在远距离监督中降低噪声数据的影响,利用深度残差更好地提取句子中的深层语义特征。
当前,还有许多学者的工作将网络安全实体提取和实体的关系提取2个方面研究同时纳入,同样取得了非常好的效果,以下将简单介绍他们的工作。
现有的网络安全知识图谱构建方法主要采用传统的管道模型,即先进行命名实体识别,再进行关系提取,但这种方法存在错误传播的问题,且忽略了两个子任务之间的关联性。针对这些问题,Guo等[45]提出了CyberRel,联合实体和关系提取的模型,旨在同时提取网络安全概念中的实体和关系,从而生成语义三元组。CyberRel通过多序列标注方法,将联合提取问题转化为多个序列标注问题。
针对传统基于特征的模型方法耗时且需要大量的特征工程这一问题,孙天放[46]提出了基于神经网络的威胁情报信息提取方法TIIE。该方法利用LSTM进行命名实体识别,并通过CRF模型实现序列标签之间的约束。同时,该方法还通过结合LSTM和最短依赖路径(Shortest Dependency Path,SDP)方法进行关系提取。
Li等[47]提出了结合多种模型的新型威胁情报信息提取系统,在实体提取任务中,通过多头自注意机制提取单词之间的依赖关系。在共指解析任务中,通过融合上下文信息和提及嵌入以改进提及表示,同时利用卷积神经网络提取不同维度的特征。在关系提取任务中,通过结合词性、提及宽度、实体类型和实体对距离等附加特征来改进嵌入表示。最后,系统构建知识图谱以明确呈现实体及其关系。
Jo等[48]提出了一种新颖的CTI系统Vulcan,旨在从非结构化文本中提取描述性或静态CTI数据并确定它们的语义关系。
现有的信息提取技术在一次提取几种类型的实体方面表现出色,但无法检测异构数据及其关系。此外,多个CTI社区的标准(如STIX)要求对不同实体和关系进行形式化分类,以实现数据的一致共享。针对这些问题,Marchiori等[49]提出了STIXnet,这是首个自动提取CTI报告中所有STIX实体和关系的解决方案。通过使用NLP技术和交互式实体知识库,该方法获得了与最先进的实体提取和关系提取模型相当的F1分数,并同时考虑了更多的实体和关系类型。
表2总结归纳了以上网络安全信息提取研究涉及的模型或方法、训练数据集、数据集标注方式、能够提取的实体和关系类型以及模型收敛轮次等内容。由表2可知,近年来网络安全实体提取与实体的关系提取研究所采用的主流模型逐渐从基于深度学习的方法转向结合预训练大语言模型的方法,所采用的训练数据集多为研究者自建,数据集的标注方式也以人工标注为主。此外,研究重心逐渐从单纯的网络安全实体提取和实体的关系提取,转向实体与关系的管道提取模型或联合提取,能够提取的实体和关系类型多数在5~15种的区间。
表 2 网络安全实体提取与实体的关系提取研究汇总

Table 2 A summary of research on network security entity extraction and entity relationship extraction

类型 文献 年份 模型/方法 训练数据集 标注方式 实体类型
(种)
关系类型
(种)
模型收敛轮次(epoch)
网络安全实体提取 [35] 2020 BiLSTM-CRF 自建数据集 人工标注 20 - 40~80
[36] 2021 BiLSTM-Dic-Att-CRF 开源网络安全语
料库1、自建词典
人工标注 7 - 10~15
[37] 2021 BERT-LSTM-CRF
BERT-BiLSTM-CRF
BERT-ID-CNN-CRF
贵州大学网络安
全文本数据集
自动标注 6 - 24
[38] 2021 CharCNN + BiLSTM
+ GCN + CRF
自建数据集 自动标注 4 - 200
[39] 2021 BERT + MLM 自建语料库 人工标注 7 - 4
[40] 2022 KE-BERT-BiLSTM-CRF 自建数据集 人工标注 17 - -
[41] 2023 PERT + GARU +
GNN + RNN
开源网络安全语
料库1、自建数据集
自动标注 13 - 160~200
网络安全实体的关系提取 [42] 2020 GCN + sentence set +
SDP-VP-SET
自建数据集 人工标注 - 9 -
[43] 2022 FEDRE-KD 自建数据集 人工标注 - 13 100
[44] 2020 ResPCNN-ATT 自建数据集 自动标注 - 10 60
网络安全实体与关系提取 [45] 2021 BERT + BiGRU
+ 注意力机制 + CRF
自建数据集 人工标注 8 6 -
[46] 2021 LSTM-CRF
LSTM-SDP
开源网络安全
数据集2
数据集本身包含标注 7 4 -
[47] 2022 EEMAP-BERT
CRCP-BERT
自建数据集 人工标注 13 12 120
[48] 2022 BERT-BiLSTM-CRF 自建数据集 人工标注 6 7 20~30
[49] 2023 NLP + rcATT + SBERT + KB 自建数据集 人工标注 18 超过100 -

1.2 基于威胁情报的网络安全知识图谱

威胁情报是建立对抗对手攻击的强大安全态势的基本要素,其通过挖掘技术对实时网络威胁信息进行收集、挖掘和识别,融合情报领域和网络空间安全知识,实现对网络攻击及扩散的有效遏制[50]。威胁情报涉及多种来源的数据,包括但不限于恶意软件分析报告、安全公告与漏洞报告、论坛博客等社交媒体以及情报共享平台。当前,威胁情报在实际的安全应用中仍存在许多问题,知识图谱将为解决这些问题提供新的思路与方法。首先,威胁情报来源广泛且数据量庞大,知识图谱能够有效整合和关联这些分散的数据,形成统一的威胁视图。其次,随着现代网络威胁日益复杂,单靠传统分析方法难以全面理解,知识图谱可以帮助揭示隐藏在数据中的关系和模式,提高威胁分析的准确性。此外,知识图谱还能够实现实时数据更新和查询,为安全团队提供及时的威胁情报,支持快速决策和响应。最后,知识图谱可以将网络安全专家的知识和经验进行建模,形成可共享和复用的知识库,提升整个安全团队的能力。
行动后报告(After Action Reports,AARs)包含了关于恶意软件的详细信息,但人工处理和分析耗时长且效率低下,针对这一问题,Piplai等[51]开发了一个从AARs中提取信息、将相似实体融合,并在网络安全知识图谱中表示提取信息的系统。通过这种融合,安全分析师可以执行查询并检索比未融合的知识图谱更好的答案,同时还可以使用融合的CKG可以利用的各种推理能力。
为解决漏洞数据利用价值低、关联分析手段欠缺、可视化程度不足等问题,陶耀东等[52]以工业互联网安全漏洞库为基础,提出一种构建工业互联网安全漏洞知识图谱的方法,通过原始数据信息提取、关联关系分析、数据存储等手段,将知识图谱导入Neo4j图数据库,以实现高效存储和查询。
当前,通用攻击模式枚举和分类(Common Attack Pattern Enumeration and Classification,CAPEC)、通用弱点枚举(Common Weakness Enumeration,CWE)等开源网络安全数据主要以文本格式存储,不利于自动化分析和利用。针对这一问题,Wang等[53]提出一种基于CAPEC和CWE的网络攻击行为知识图谱构建方法,通过分析CAPEC和CWE的内容和组织结构,提取关键实体和关系,并将其构建为知识图谱,从而实现对网络攻击模式和漏洞的全面、快速查询和分析。
Rastogi等[54]提出了一种端到端方法来生成恶意软件知识图谱MalKG,这是首个用于恶意软件威胁情报的开源自动化知识图谱。MalKG数据集称为MT40K 1,包含从27 354个唯一实体和34个关系生成的大约40 000个三元组。
现有的信息提取系统在处理网络安全领域的报告时,通常依赖于预定义的关系或现有的本体,限制了提取信息的范围,并可能导致遗漏重要知识。此外,缺乏支持高效存储和检索数据的结构进一步增加了信息利用的难度。针对这些问题,Sarhan[55]等提出了开源网络威胁情报知识图谱框架 Open-CyKG,从非结构化的APT报告中提取有价值的网络威胁信息,并将其组织成支持高效查询和检索的知识图谱。
CTI报告通常需要大量的人工工作来提取和利用威胁情报,且单个报告通常只涵盖攻击模式的有限方面,针对这些问题,Li等[56]提出AttacKG,通过汇总各报告中的威胁情报,以收集技术的不同方面,并将攻击行为图增强为技术知识图谱。实验结果表明,AttacKG在提取实体和依赖关系方面,优于现有的EXTRACTOR方法[57],在识别攻击技术方面,显著优于TTPDrill方法[58]
传统的网络安全防御方法难以有效应对APT攻击,其隐蔽性和复杂性使得防御者在攻击发生前难以获取攻击者的信息,从而导致信息不对称,增加了防御难度。针对这一问题,Ren等[59]提出了一种基于知识图谱的网络安全威胁建模平台CSKG4APT,通过整合多源异构的开源网络威胁情报(Open Source Cyber Threat Intelligence,OSCTI)中的APT攻击组织信息,构建APT网络安全知识图谱,从而帮助对APT威胁知识的全面分析。
现有的威胁情报系统主要集中于结构化的妥协指标(Indicators of Compromise,IoC),这些指标只能捕捉威胁的零碎视角,无法揭示威胁全貌。大量非结构化的OSCTI报告包含更全面的威胁知识,但由于格式多样、数量庞大且结构复杂,难以有效收集和管理。针对这一问题,Gao等[60]提出了ThreatKG系统,自动化地收集和管理大量OSCTI报告中的高质量威胁知识,并构建威胁知识图谱。
网络威胁情报提供了技术和操作层面的攻击信息,安全需求(Security Requirements,SR)则涵盖了管理层面的防护措施。当前缺乏有效的手段将CTI和SR数据进行整合,从而无法充分利用这些信息来提升关键信息基础设施(Critical Information Infrastructure,CII)的安全能力。针对这一问题,Zhang[61]等提出了一种结合CTI和SR数据构建异构知识图谱RCTI的方法,实现了CTI和SR数据的有效整合和利用,增强了CII的安全能力。
OSCTI通常是非结构化的,难以直接应用于检测和防御。针对这一问题,Hu等[62]提出了一种利用大语言模型构建威胁情报知识图谱的方法LLM-TIKG。该方法通过GPT的少量学习能力进行数据标注和增强,生成数据集以微调较小的语言模型(如Llama2-7B)。通过微调后的模型进行主题分类、实体和关系提取以及TTP(战术、技术和程序)分类,从而构建威胁情报知识图谱,实现文本化威胁情报的自动化和通用分析。
针对物联网攻击问题,程子栋等[63]基于国家漏洞数据库(National Vulnerability Database,NVD)、CWE等数据源构建物联网威胁情报本体ITIO,并将不同知识库中的结构化实体进行关联,生成知识三元组,从而完成物联网威胁情报知识图谱ITIKG的构建。
尽管绝大多数的网络安全知识图谱构建研究基于威胁情报展开,但也有不少学者基于其他安全知识构建同样高质量且实用的网络安全知识图谱,以下将简单介绍他们的工作。
Tao等[64]提出了一种基于本体和分类保护的网络安全日志知识图谱模型,该模型利用本体描述网络安全日志的实体和关系,整合分类保护数据,通过实体对齐和信息增益方法构建知识图谱,从而实现对日志数据的高效分析和处理。
为更好降低隐私和安全风险,并促进更安全的支付行为,Xia等[65]提出一种基于深度学习的知识图谱构建方法,通过从政策文件中识别实体并提取实体之间的关系,构建移动支付的风险知识图谱。该方法采用无监督的半自动知识获取模式,显著减少了因知识缺乏而导致的移动支付风险。
多阶段组合攻击已成为主要的攻击手段,然而目前仍缺乏有效的方法来大规模自动提取和分析这些安全工具的信息。针对这一问题,Sun等[66]提出了一种名为SecTKG的知识图谱构建架构,用于描述和组织开源安全工具的相关知识。该架构包括安全工具本体模型的设计、实体识别和分类方法的开发,以及高效的知识提取,并以此成功构建了首个大规模的开源安全工具知识图谱,共计包含了15 778个安全工具,400万个实体和1000万个关系。此外,作者还基于SecTKG开发了安全工具影响力测量应用,用于识别不同攻击阶段的一些不常见的安全工具。
表3总结归纳了以上基于威胁情报的网络安全知识图谱研究涉及的图谱名称、应用场景、数据来源、本体模型、是否进行图谱质量评估以及是否开源等内容。由表3可知,近年来基于威胁情报的网络安全知识图谱研究聚焦的应用场景十分广泛,其数据来源主要为各类开源网络威胁情报文本以及开源网络安全知识库。此外,多数研究明确提及了所采用的本体模型和图谱质量评估方法,接近半数的研究采取开源。
表 3 基于威胁情报的网络安全知识图谱研究汇总

Table 3 Research summary of network security knowledge graph based on threat intelligence

文献年份图谱名称应用场景数据来源本体模型质量评估是否开源
[51]2020/网络攻击
模式检测
AARs、APT报告、安全博客、CVEUCO 2.0ΠΠ
[52]2020工业互联网安全
漏洞知识图谱
安全漏洞分析工业互联网安全漏洞库(ISVD)/ΟΟ
[53]2021/攻击检测
与响应
CAPEC、CWE/ΟΟ
[54]2021MalKG威胁情报
信息预测
CTI报告、CVEMALOntΟΠ
[55]2021Open-CyKGAPT报告分析MalwareDB数据集1/ΠΠ
[56]2022AttacKG/TKG攻击行为分析CTI报告、MITRE ATT&CK知识库技术模板、攻击图ΠΠ
[59]2022CSKG4APTAPT组织归因OSCTI基于多种威胁
情报标准构建
ΠΟ
[60]2022ThreatKG威胁分析与
威胁狩猎
APTnotes攻击报告、威胁百科全书、
企业安全博客
分层威胁知识本体ΠΟ
[61]2024RCTICII安全管理中国国家网络安全标准管理文件、
开源网络安全知识库
/ΠΟ
[62]2024LLM-TIKG攻击归因与
行为分析
安全公司内容平台、安全新闻、
个人安全博客
MITRE ATT&CKΠΠ
[63]2024ITIKGCTI共享
与利用
ATT&CK、CAPEC、CWE、NVD、
CVE、CPE、ITI文本
ITIOΟΟ

1 https://aclanthology.org/P17-1143/

1.3 网络安全知识图谱补全

网络安全知识图谱补全是指在已构建的网络安全知识图谱中,通过算法和技术手段自动发现并填补缺失的节点和边,以及预测未来可能存在的节点和边。网络安全知识图谱补全不仅能够提高知识图谱的完整性,还能揭示隐藏的网络安全威胁和潜在的攻击路径,有助于增强网络安全防御能力。这些技术通常依赖于机器学习和深度学习模型,并结合网络安全领域的专家知识,以实现更精准和高效的安全威胁检测和防范。
虽然通用漏洞披露(Common Vulnerabilities & Exposures,CVE)、CWE、CAPEC等开源网络安全知识库记录了大量的安全漏洞和攻击模式,但这些知识库存在时间延迟,无法及时更新和捕捉所有潜在的安全实体关系,使得攻击者可能利用未记录的漏洞实施攻击,进而增加网络安全防护的难度。为了解决软件安全知识库中未记录的实体关系的预测问题,Wang等[67]提出了一种基于知识图嵌入的实体关系预测方法,利用Sentence-Bert[68]和图注意力网络(Graph Attention Network,GAT)进行链接预测和分类任务,以补充和完善软件安全数据。此外,针对开源网络安全知识库存在的严重漏洞信息缺失问题,周莎等[69]提出了一种基于安全知识图谱和逆向特征的漏洞信息补全方法VulKGC-RN,解决了现有补全方法对不同邻域特征学习不充分的问题,以全面补全缺失的漏洞信息。
Zhang等[61]在结合网络威胁情报和安全需求数据的异构知识图谱RCTI的基础上,开发了一种基于图神经网络(Graph Neural Networks,GNN)的边传播模型EGNN,用于知识图谱上的链接预测。EGNN模型通过定义边的表示并开发边传播算法,增强了图的表示能力,进而能够在RCTI图上发现新的知识连接,从而有效识别管理漏洞,提升关键信息基础设施的安全能力。
程子栋等[63]设计了一种确定性采样方法和多模态异构图神经网络DM-HGNN,以解决现有GNN在处理物联网威胁情报知识图谱ITIKG时存在的节点表示能力不足、节点采样策略不合理等问题,有效提升了链接预测的准确性。
当前,关于网络安全知识图谱补全的研究相对较少,研究者们主要基于GNN模型,通过学习多跳邻居节点的信息(邻域特征)进行补全。在模型训练与性能评价方面,训练数据集通常采用CVE、CWE、CAPEC等开源网络安全知识库或WN18RR[70]、WN18[71]、FB15K-237[72]等预测任务常用数据集,评价指标通常选用MR、MRR、Hits@N等预测任务常用指标。

1.4 网络安全知识图谱的应用

图2所示,本节将从安全需求分析、攻击发现与攻击溯源、攻击假设与攻击预测、网络安全态势感知与态势理解、攻击策略生成、缺陷检测与漏洞挖掘、恶意软件分析7个方面系统概述有关网络安全知识图谱应用的最新研究进展,以及其他有价值的探索。
图 2 CKG的应用场景

Fig.2 Application scenarios of CKG

1.4.1 安全需求分析

在需求分析阶段软件安全需求的明确,对于提升系统质量至关重要,特别是对于安全关键的软件系统。然而,根据通用准则(Common Criteria,CC)详细分析安全需求是复杂且困难的。并且,现有方法在自动推荐安全需求时精确度不高,尤其在小数据集上,现有方法依赖简单的概念映射,难以准确反映安全目标与安全威胁之间的确定关系。针对这些问题,Zhang[73]等提出一种基于知识图谱的安全需求获取方案。该方案将安全概念(如安全威胁、组织安全策略、安全目标、评估保证等级)以及它们之间的关系表示在知识图谱中,然后将知识图谱嵌入低维空间并使用TransE模型进行训练,最后通过知识推理来获取准确的安全需求。
将客户的产品愿景转化为可实施的需求规范是一个公认的难题,特别是在涉及安全需求时更为复杂且耗时。如果开发人员能够访问一个基于已知漏洞和外部专业知识的自动化系统来验证需求规范,将显著降低软件产品中引入安全漏洞的可能性。针对这一问题,Haar等[74]提出了一种基于知识图谱的安全需求规范验证方法。该方法从软件需求规范文档中提取关键术语,并使用这些术语查询一个基于安全概念本体的知识图谱,从而验证需求规范是否涵盖了所有相关的安全主题和漏洞。
应用安全需求分析是开发安全软件产品的基础。然而,现有方法对安全知识和法规的要求较高,且分析过程冗长,依赖于人为操作,导致效率低下。针对这些问题,Wang等[75]提出了一种基于知识图谱的应用安全需求分析方法。通过法律法规知识和应用安全知识进行知识图谱推理操作,并结合威胁建模,统一检索安全场景中的所有主体域数据,从而提高获取有效机制信息的效率。

1.4.2 攻击发现与攻击溯源

分布式拒绝服务(Distributed Denial of Service,DDoS)攻击是一种常见且极具破坏性的网络攻击方式。攻击者利用大量受控制的计算机向目标服务器发送大量请求,导致目标服务器瘫痪。当前的DDoS攻击检测方法在应对不断变化的DDoS攻击模式时效果有限,难以实现对DDoS攻击源的精确检测和定位。针对这一问题,陈佳等[76]提出了一种基于知识图谱的DDoS攻击源检测方法。该方法通过构建描述TCP流量通信过程的知识图谱,并通过分析这些通信过程以实现对DDoS攻击的检测和攻击源的判定。实验结果表明,该方法能够有效识别和检测DDoS攻击源,同时还能动态适应不断变化的攻击模式,具有良好的扩展性和实用性。
现有的DDoS攻击检测方法存在无法适应不断变化的DDoS攻击、模型调整困难和对新型攻击检测适配性差等问题。此外,现有的网络安全数据集在存储形式上以流量数据为主,缺乏对网络实体间关系的描述,难以全面反映网络攻击行为和特征。针对这些问题,刘飞扬等[77]提出一种基于知识图谱构建DDoS攻击恶意行为知识库的方法,该知识库包含恶意流量检测库和网络安全知识库两部分。恶意流量检测库用于检测和分类由DDoS攻击引发的恶意流量,网络安全知识库则从流量特征和攻击框架对DDoS攻击恶意行为进行建模,并实现对恶意行为的推理、溯源和反馈。在此基础上,该方法还基于DDoS开放威胁信号协议,构建了分布式知识库,从而实现分布式节点间的数据传输、DDoS攻击防御与恶意流量缓解等功能。
现有的攻击图方法存在单体架构和内部模型异构等问题,使得技术难以组合、扩展和重用。此外,现有方法通常依赖定制的数据模型和代码中实现的规则,难以重用如检测规则、威胁情报等安全知识。针对这些问题,Kurniawan等[32]提出了一个基于知识图谱的模块化框架,该框架能够灵活、可扩展且稳定地检测网络安全威胁,支持集成多种威胁检测技术,并使用标准化的知识表示改善了安全警报的可解释性和情境化。
传统的威胁检测方法在面对复杂的攻击模式时,往往难以提供精细的检测信号。此外,这些方法通常依赖于专家知识或生成大量误报,增加了安全分析师的工作负担。针对这些问题,Zengy等[78]提出了一种名为SHADEWATCHER的系统,旨在通过系统审计记录进行推荐指导的网络威胁分析。SHADEWATCHER通过构建和分析溯源图,并结合推荐系统技术,以提升威胁检测的准确性和效率。
Ren等[59]基于CSKG4APT平台和大数据分析引擎,设计了一种基于线索的APT组织威胁狩猎方法,通过知识图谱进行APT组织的追踪和识别。在实际应用中,作者通过对四个APT组织的归因分析,证明了CSKG4APT在攻击组织画像和决策支持方面的有效性。
张玉臣等[79]针对当前基于脆弱性利用动作重构的攻击场景缺乏详细的上下文信息,导致难以识别威胁特征,以及复杂攻击的隐蔽性增加,传统的基于领域知识的溯源方法效果不佳的问题,提出了一种基于知识图谱驱动的网络攻击溯源方法。相较于传统方法,该方法在攻击场景重构、攻击事件识别和攻击组织溯源方面表现出更高的特征全面性和方法适用性。

1.4.3 攻击假设与攻击预测

传统的攻击检测方法在面对0day漏洞时,由于缺乏漏洞信息,无法有效预测和防御攻击。针对这一问题,孙澄等[80]提出了一种基于网络防御知识图谱的0day攻击路径预测方法。首先通过从现有网络安全领域本体和数据库中提取“攻击”相关的概念及实体来构建网络防御知识图谱,将威胁、脆弱性、资产等离散的安全数据整合为互相关联的安全知识。接着利用知识图谱对0day漏洞的存在性、可用性和危害性进行假设和约束,并通过路径排序算法对攻击者实体与设备实体之间的关系路径进行预测,从而达到0day攻击路径预测的目的。
当前许多安全管理中心依然依赖人类分析师进行攻击假设的生成和响应,导致效率低下且易于出错。针对这一问题,Kaiser等[81]提出了基于威胁情报知识图谱AttackDB的多层次威胁知识库AHG,旨在生成和精炼攻击假设。AttackDB融合了来自MITRE ATT&CK、OTX、X-Force和VirusTotal等多个威胁情报来源的数据,AHG通过链接预测技术和知识图谱遍历算法,能够从低层次的遥测数据推断高层次的ATT&CK技术,从而生成精确的攻击假设。
针对如何识别和保护内核中安全敏感对象的问题,Wang等[82]提出了AlphaEXP,这是首个基于专家系统的方法,用于识别和分类Linux内核中的安全敏感对象。AlphaEXP通过模拟攻击者的行为来评估对象是否可能被滥用,并根据攻击路径的可行性和影响力对对象的敏感度进行分类。
现有的网络安全知识图谱大多为静态,缺乏对时间信息的有效利用,因此难以捕捉攻击行为的动态变化。针对这一问题,黄智勇等[83]提出了一种基于时序知识图谱的网络攻击预测方法,将攻击预测问题转化为知识图谱上的链接预测问题,通过对网络攻击知识图谱进行规则学习和应用,以预测未来可能的攻击事件。

1.4.4 网络安全态势感知与态势理解

当前的态势感知系统在攻击场景挖掘和态势理解方面存在效率和准确性问题,且缺乏对复杂攻击行为的全面解析。针对这些问题,王一璇[84]提出了基于知识图谱的网络安全态势感知模型KG-NSSA。KG-NSSA提出的攻击场景发现方案不同于传统的基于告警实现的方案,克服了传统告警聚合过程和告警关联分析过程易受大量冗余、误报影响的缺点,通过属性图挖掘和相似度计算实现攻击发现和攻击关联,可以有效地反映具体的网络攻击行为、挖掘攻击场景。与传统方法相比,该模型能够更加全面地解析复杂的攻击行为,提升整体的安全态势感知能力。
传统的安全防护措施难以实时、全面地掌握网络攻击态势,导致无法及时有效地应对新兴威胁。针对这一问题,陈珺娴[85]设计并实现了一个基于知识图谱的网络攻击态势检测系统,通过知识图谱技术和多维度数据分析,实现对网络攻击态势的实时检测和预警。相比传统的告警分析方法,该系统能够有效减少冗余告警,准确发现多步攻击链条,并在各个攻击阶段提供更详细的态势评估。
当前的漏洞态势感知依赖于传统漏洞库,针对传统漏洞库管理安全漏洞的方式存在漏洞之间关联较弱、漏洞间的丰富关系涵盖不足以及信息孤岛等问题,王丽敏[86]提出通过构建漏洞知识图谱的方式管理安全漏洞,以挖掘漏洞关联信息,并预测安全漏洞态势。
针对缺乏对卫星网络安全态势的全面理解和实时感知能力这一问题,蚁佳才等[87]提出一种基于知识推理的卫星网络态势理解方法。通过构建卫星网络态势理解本体OntoCSU4Sat和相应的知识图谱KGCSU4Sat,并基于推理规则对卫星网络安全漏洞的自动发现、影响分析和缓解措施进行推理,从而实现对卫星网络空间的态势理解。该方法在自动化发现网络安全威胁、评估影响和制定缓解措施方面表现出较高的准确性和实用性。
现有的网络安全态势感知技术在面对海量、异构、动态变化的安全数据时,难以提供准确、高效的安全分析与决策支持。针对这一问题,Chen[88]等提出了一个综合利用知识图谱技术的网络安全态势感知框架,通过对网络安全要素的全面分析、网络安全态势的评估和预测,提升对于网络攻击的防御能力。框架利用多层受限玻尔兹曼机(Restricted Boltzmann Machine,RBM)实现深度学习模型,逐层映射网络安全特征,以此构建网络安全知识图谱。此外,作者还提出了一系列技术和自动化工具来实现动态的网络安全态势感知。

1.4.5 攻击策略生成

在应对复杂的网络攻击时,网络安全防护往往面临信息过载和威胁情报处理效率低下的挑战。针对这一问题,Ou等[89]从攻击者的角度提出了一种基于知识图谱的网络攻击方法推荐系统,利用知识图谱的语义关联性和推理能力,从网络安全知识库中提取有效信息,并通过计算文本相似度和元路径搜索算法,为安全管理人员推荐攻击者最可能采取的攻击方法,从而进行针对性的网络安全防护。
现有的攻击图技术在处理多类型漏洞时缺乏可扩展性,无法灵活应对攻击和防御情况的变化。针对这一问题,Chen等[90]从攻击者的角度提出了一种基于领域知识图谱的自动生成多漏洞攻击策略的方法,通过整合和提取多维度的领域知识,建立了关于漏洞利用的知识图谱。然后利用知识图谱的图形表示和知识推理能力,生成并优化攻击策略,提高了对多漏洞的综合利用和灵活响应的能力。

1.4.6 缺陷检测与漏洞挖掘

尽管现有的智能合约缺陷检测工具在分析智能合约安全方面取得了一定进展,但仍面临低精度和高漏报率的挑战。特别是对于复杂逻辑的缺陷,静态分析方法往往精度不高,而动态分析方法虽然精度较高,但代码覆盖率不足,导致可能遗漏某些语法错误。针对这些问题,Hu等[91]提出了一种基于知识图谱的Solidity智能合约安全性缺陷检测方法。该方法首先充分融合Solidity源代码的语法和语义信息以构建智能合约知识图谱,然后通过分析缺陷特征定义缺陷模式,并进一步基于知识图谱和缺陷模式定义缺陷推理规则,最终通过SPARQL查询实现缺陷检测。
现有的漏洞挖掘和检测方法在漏洞数据利用率、语义信息丰富度和分析手段等方面存在不足,导致挖掘精度低、漏报率和误报率高等问题。针对这些问题,王乐[92]提出一种基于知识图谱的漏洞挖掘方法。与传统的漏洞挖掘工具相比,该方法具有较低的漏报率和误报率,且准确率相对较高,在漏洞分析、追踪、溯源等方面具有较高的应用价值。
电力网络的软件系统逻辑较为复杂,物理系统的业务交互也较为频繁,在运行中易出现跨区域联动、代码缺陷和人为误操作等漏洞。针对这一问题,陈泽等[93]提出了一种基于知识图谱的电力网络安全漏洞挖掘系统,通过知识图谱对数据进行深度挖掘,从而提取漏洞信息,并通过关联分析实现漏洞的检测和挖掘。此外,系统还对挖掘出的漏洞进行风险评估,利用CVSS3.0标准对漏洞的风险等级进行划分,并提出相应有效的漏洞修复方案。

1.4.7 恶意软件分析

现有的机器学习算法在检测攻击时存在局限性,且数据集的不平衡和实际部署中的泛化能力差也进一步限制了这些算法的有效性。针对这些问题,Piplai等[94]提出了一种结合知识图谱和强化学习的方法,用于恶意软件分析和检测。该方法通过构建网络安全知识图谱,将开源情报中挖掘的语义关系应用于强化学习算法,以指导其更有效地检测和缓解恶意软件攻击。
基于数据驱动的行为特征过于独立和笼统,无法全面描述源自原始恶意软件的家族变种的可变恶意行为。此外,这些特征还受到语义知识有限的影响,进而缩小了对于家族变种的理解。针对这些问题,Bai[95]等提出了一种名为ArgusDroid的方法,通过构建基于权限-API的知识图谱来有效识别Android恶意软件家族变种。实验结果表明,知识驱动特征集在表示和推理恶意行为方面具有显著优势,特别是在使用MLP和CNN分类器时,能够更准确地识别恶意软件家族变种。
表4总结归纳了以上网络安全知识图谱应用研究涉及的应用场景、研究目的、核心方法以及研究贡献等内容。
表 4 网络安全知识图谱的应用研究汇总

Table 4 A summary of the research on the application of the cybersecurity knowledge graph

应用场景 文献 年份 研究目的 核心方法 研究贡献
安全需求分析 [73] 2020 安全需求获取 知识图嵌入 + 知识推理 提升了安全需求获取
的准确性
[74] 2023 验证安全需求规范 知识图谱 + 实体链接 + 关键词查询 实现了安全需求规范
的自动化验证
[75] 2023 应用安全需求分析 知识图推理 + 威胁建模 + 推荐引擎 简化了安全需求分析流程
攻击发现
与攻击溯源
[76] 2020 DDoS攻击源
检测
知识图谱 + DDoS攻击检测 利用知识图谱描述
主机间的交互关系
[77] 2021 DDoS攻击
恶意行为分析
恶意流量检测库 + 网络安全知识库
+ 分布式知识库
能够有效检测和
缓解DDoS攻击
[32] 2022 战术攻击发现 溯源图 + 威胁检测与警报
+ 攻击图和场景重建
模块化的设计支持了
不同检测技术的集成
[78] 2022 网络威胁检测 推荐系统 + 图神经网络 + 动态更新 首次将威胁检测
映射为推荐任务
[59] 2023 APT组织归因 知识图谱 + APT威胁知识提取
+ APT攻击归因
能够主动调整防御策略
[79] 2024 网络攻击溯源 攻击事件框架 + 威胁指纹知识图谱
+ 知识图嵌入
适用于不同类型的
攻击组织识别
攻击假设
与攻击预测
[80] 2022 0day攻击
路径预测
网络防御知识图谱
+ 基于路径排序算法的知识图推理
将攻击预测转化为链接预测
[81] 2023 攻击假设生成 多级威胁知识库 + 知识图谱遍历算法
+ 链接预测
提出了自动化的攻击
假设生成方法
[82] 2023 识别安全敏感
内核对象
内核知识图谱 + 知识图推理
+ 敏感对象分级
帮助防御者建立具有
成本效益的防御措施
[83] 2024 网络攻击预测 时序知识图谱 + 时序随机游走
+ 攻击规则学习应用
能够捕捉网络攻击行为
的时间动态变化
网络安全态势感知
与态势理解
[84] 2020 网络安全
态势感知
网络基本事件图谱 + 属性图挖掘
+ 态势曲线
改进攻击场景发现方法
和实现态势理解
[85] 2020 网络攻击
态势检测
网络热点事件建模
+ 事件发展维度指标
设计并实现了一个网络
攻击态势检测系统
[86] 2020 漏洞态势感知 漏洞知识图谱 + 分层态势评估
+ 态势预测
提出一种新的漏洞
态势感知方法
[87] 2022 卫星网络
态势理解
卫星网络态势理解知识图谱
+ 知识库推理
提出一种新的卫星网络
态势理解分析方法
[88] 2023 网络安全
态势感知
网络安全知识图谱 + 子图查询
+ 相似度计算
自动化的网络攻击研判
与攻击场景发现
攻击策略生成 [89] 2020 网络攻击
方法推荐
网络攻击知识图谱 + 元路径搜索算法
+ 相似度计算
能够有效地推荐合适
的网络攻击知识
[90] 2021 多漏洞攻击策略自动生成 漏洞利用知识图谱 + 知识推理规则 将KG应用于知识驱动
的攻击策略生成
缺陷检测
与漏洞挖掘
[91] 2021 智能合约
缺陷检测
智能合约知识图谱
+ 定义缺陷模式及推理规则
实现了对智能合约中
潜在缺陷的自动检测
[92] 2021 软件安全
漏洞挖掘
漏洞知识图谱 + CWE链式推理
+ 图相似度匹配
提出一种基于知识图谱
的漏洞挖掘方法
[93] 2023 电力网络安全
漏洞挖掘
基于知识图谱的漏洞挖掘
+ 漏洞评估和分析
能够有效挖掘和处理电力
网络中的安全漏洞
恶意软件分析 [94] 2020 恶意软件分析 网络安全知识图谱 + 强化学习 将CKG与RL结合来
指导恶意软件的检测
[95] 2023 检测Android
恶意软件变种
权限-API知识图谱 + 特征提取
+ 分类器训练
基于KG挖掘和理解
权限与API间的关系

1.4.8 其他探索

在社会工程攻击分析方面,Wang[31]等展示了6个网络安全知识图谱用于社会工程攻击分析的应用示例,包括理解和分析社会工程攻击场景和事件;查找排名靠前的社会工程威胁元素,例如最常被利用的人为漏洞和最常用的攻击媒介;查找针对受害者的潜在社会工程威胁;查找社会工程攻击者的潜在目标;查找从特定攻击者到特定目标的潜在攻击路径;分析同源攻击。
在网络安全知识隐藏模式发现方面,Ding等[96]提出了一种基于层次聚类的网络安全知识隐藏模式发现方法。该方法通过使用Phi相关系数计算网络安全知识图谱中各安全技术之间的距离,并采用Ward链接法进行层次聚类,从而挖掘得到黑客团体常用的网络安全技术组合。
在打击虚假网络威胁情报方面,Mitra[97]等开发了一个系统,用于捕获和表示网络威胁情报的溯源信息,并将这些信息与网络安全知识图谱中的情报数据进行融合。通过溯源信息与CKG的融合,系统能够为用户提供更可靠的网络安全情报。
在安全策略验证方面,Vassilev等[98]提出了一种基于本体和知识图谱的框架,用于网络系统中的逻辑漏洞分析、威胁建模和安全策略验证。通过多层次的模型,该框架实现了对情境和行为的全面描述,并通过智能图和启发式规则实现对安全策略的验证。
在改进入侵检测警报的质量和相关性方面,Garrido等[99]提出了一种将机器学习应用于知识图谱的方法,通过对工业系统中不同实体和关系的语义集成,改进入侵检测系统生成警报的质量和相关性。该方法利用知识图谱的丰富语义关系和上下文信息,结合图嵌入技术,从而生成能够更好反映系统行为的模型,并用以检测和评分异常活动。
在网络资产扫描方面,Zhong等[100]提出了一种基于网络安全知识图谱的自动化网络资产扫描工具,该工具采用先进的NER技术和模式识别方法,从数据源中提取知识,并以此构建网络安全知识图谱,进而实现网络资产的自动化扫描和智能化分析。该工具利用知识图谱作为网络知识库,能够自动决定网络资产扫描过程中下一步的选择,提高了插件调用的灵活性和扫描的效率,在智能渗透测试过程中表现出良好的应用价值。
在安全威胁评估方面,Pang等[101]提出了一种基于知识图谱的电力物联网终端安全威胁评估方法。该方法通过提取和关联电力物联网终端设备的基本数据、运行数据和告警威胁数据,构建电力物联网终端知识图谱,并通过实时感知终端的威胁指数,辅助安全运维人员进行决策,从而确保电力物联网终端节点的安全稳定运行。
在安全日志分析方面,Ekelhart[102]等提出了一种从任意原始日志消息自动构建知识图谱的灵活框架SLOGERT。SLOGERT通过自动识别丰富的RDF图建模模式来表示日志流中出现的事件类型和提取的参数,从而实现知识图谱的自动化构建。作者通过一个为期6天的AIT日志数据集,展示了SLOGERT在安全领域的应用能力。
在安全配置方面,Haque等[103]提出了一种基于知识图谱的安全配置方法KGSecConfig,解决了容器编排器(Container Orchestrator,CO)配置复杂、手动配置易出错的问题。该方法利用关键词和学习模型系统地捕获、链接和关联异构以及多供应商的配置空间,形成统一的结构,以支持CO的自动化安全配置。通过在多个主流CO平台上的应用验证,该方法在提高配置安全性、减少手动配置工作量和自动化错误配置缓解方面表现出色,为系统管理员提供了强大的工具支持。

2 知识图谱面临的安全风险

2.1 针对知识图谱的攻击与防御

随着知识图谱在各领域的广泛应用,其面临的安全风险不断增加,主要包括投毒攻击和对抗攻击。
在投毒攻击中,攻击者首先确定知识图谱中的攻击对抗攻击和隐私窃取攻击,这些攻击可能对知识图谱的嵌入、补全、对齐、推理和预测等关键功能产生目标,如某个实体或关系,然后设计并生成误导性或错误的实体或关系数据,将这些数据注入知识图谱中,从而破坏其性能。Zhang等[104]认为现有的图数据攻击方法不能直接应用于知识图嵌入模型(Knowledge Graph Embedding,KGE),因此需要专门设计有针对性的数据投毒攻击策略。他们提出了一系列有效的数据投毒攻击策略,通过在知识图谱中添加或删除特定事实来操纵目标事实的可信度或重要性。Bhardwaj等[105]针对知识图谱链接预测任务的数据投毒攻击问题,提出了利用KGE模型的归纳能力来生成有毒样本,通过不同的推理模式来设计投毒数据,以提高模型对假目标事实的预测可信度,从而降低知识图谱模型对特定链接预测的准确性。Wu等[106]研究了针对基于知识图谱的推荐系统的投毒攻击问题,提出了一个名为深度Q学习算法的模型来执行投毒攻击,通过分析当前推荐状态和指定项目,以估计不同攻击决策如添加或删除事实的效果,从而生成最优攻击组合,导致系统更频繁地推荐特定商品。Xi等[107]系统地研究了知识图谱推理(Knowledge Graph Reasoning,KGR)面临的威胁,并提出了ROAR来实例化上述威胁,通过知识投毒和查询误导,实现了针对知识图谱推理系统的目标攻击和后门攻击。此外,在投毒攻击的可行性上,You等[108]提出了黑盒路径注入理论,揭示了黑盒设置下的攻击成功率由指示路径上三元组的合理性决定,并在黑盒设置下实现了对知识图嵌入的模型无关、语义一致且隐蔽的数据投毒攻击方法MaSS,拓展了投毒攻击在实际场景中的应用。MaSS利用黑盒路径注入理论,在不完全了解目标KGE模型的情况下,通过生成具有高度语义一致性的三元组路径,误导模型预测某些恶意事实。评估结果显示,MaSS在对白盒模型的攻击性能上显著优于基线方法DirectAdd[104]和ComAttack[105],同时在对黑盒模型的攻击上仍保持稳定的有效性。而在投毒攻击的隐蔽性上,Zhu等[109]认为,在进行数据投毒攻击时,攻击者除了提高投毒样本的毒性,还需考虑降低样本暴露风险,因此提出了一个客观统一的框架,用于评估复杂多样的投毒策略。该框架包括评估攻击毒性的指标Dt和评估攻击暴露风险的指标隐蔽性Ds。在对联邦知识图谱的投毒攻击方面,Zhou等[110]提出了一种新的攻击框架,迫使受害者客户预测特定的虚假事实。通过引入知识图谱组件推断攻击,攻击者可以在不了解受害者知识图谱的情况下,创建投毒数据并通过联邦知识图嵌入模型聚合注入受害者模型。相对地,在对联邦知识图谱投毒攻击的防御方面,Cao等[111]提出了一种名为FedRecover的方法,用于在恶意客户端投毒攻击后恢复出准确的全局模型,同时显著降低客户端的计算和通信成本。在恢复过程中,服务器不要求客户端重新计算和通信模型更新,而是利用投毒攻击前存储的历史全局模型和每轮客户端的模型更新,来估计攻击后每轮中的客户端模型更新。理论分析表明,FedRecover恢复的全局模型与从头开始训练的全局模型之间的差异可以在某些假设下被界定。虽然该方法并非专门针对知联邦识图谱投毒攻击的防御方法,但其方法论可以为防御此类攻击提供参考。
相较于投毒攻击,对抗攻击旨在通过小的、往往难以察觉的修改来破坏知识图谱的性能或模型输出。攻击者在选择攻击目标时,往往倾向于选取知识图谱中敏感的实体或关系,以期通过这些微小扰动对整个系统产生较大的影响。这种攻击通过小规模的修改,如改变实体属性或略微调整关系类型或属性,使得攻击更加隐蔽,能够在不显著改变知识图谱整体结构的情况下影响模型的输出结果。Zhang等[112]研究了跨语言知识图谱在实体对齐中的安全问题,特别是针对图卷积网络在实体对齐任务中易受对抗攻击的现象,提出了一种名为EAA的新型对抗攻击方法。EAA旨在生成对知识图谱的隐蔽扰动,从而降低实体对齐模型的性能。EAA采用实体密度最大化方法将被攻击的实体隐藏在两个知识图谱的密集区域中,以降低扰动被发现的可能,同时提出了一种攻击信号放大方法以提高攻击效率。Banerjee等[113]提出了一种基于深度强化学习的框架RATA,并引入了攻击暴露风险的概念。RATA在降低对抗攻击暴露风险的同时,通过扰动知识图谱中的事实来最大化操纵目标事实的可信度或重要性。实验显示,RATA在两个基准数据集FB15K[71]和WN18上的表现优于现有的无风险约束攻击基线方法DirectAdd[104]和CRIAGE[114]。在高可信度和低可信度目标事实上的实验结果表明,RATA在约80%的预算下能够达到与基线方法相当的攻击效果,且在密度较大的知识图谱如WN18中表现尤为突出。Bhardwaj等[115]提出了一种基于实例溯源方法的对抗攻击策略,使用实例相似性和梯度相似性度量来识别对目标预测影响最大的训练实例三元组,并利用影响函数估计删除训练三元组对模型预测的影响,从而利用这些三元组进行对抗性的链接删除和添加攻击。此外,与先前研究中有目标地影响知识图谱模型对某些事实的表示或预测不同,Zhao等[116]提出了一种无目标的对抗攻击方法,从知识图谱模型中提取逻辑规则作为攻击先验知识,从而设计攻击策略,包括对抗性删除和对抗性增加,以削弱模型全局特征和破坏模型全局语义。对两个数据集FB15k-237和WN18RR上的七种知识图嵌入模型的实验表明,所提出的无目标攻击方法能够显著降低模型的链接预测性能,且大多数模型对对抗性添加的鲁棒性优于对抗性删除。相对地,在对对抗攻击的防御方面,Zhang等[117]针对知识图嵌入在对抗性攻击下的脆弱性问题,提出了一种双阶段防御方法,包括离线的对抗训练和在线的扰动检测,以增强知识图嵌入模型的鲁棒性。在多个基准数据集上对该防御方法进行的评估显示,该方法能够在多种攻击场景下有效提升模型的健壮性,尤其是在处理删除攻击和添加攻击时的性能表现。
表5总结并分类了针对知识图谱的攻击或防御方法的特点、目标以及所使用的数据集。这些攻击可能会对知识图谱结构以及嵌入、补全、对齐和推理等任务产生负面影响。投毒攻击通过注入误导性或错误的数据,破坏知识图谱的性能,对抗攻击则通过微小且隐蔽的修改,选择敏感实体或关系以破坏系统的整体性能。
表 5 针对知识图谱的攻击和防御方法

Table 5 Attack and defense methods against knowledge graphs

类型 文献 年份 方法描述 攻击/防御目标 数据集/知识库
投毒攻击 [104] 2019 目标事实直接/间接投毒 知识图嵌入 FB15K、WN18
[105] 2021 关系推理模式 + 诱饵事件投毒 知识图嵌入 WN18RR、FB15K-237
[106] 2022 深度强化学习投毒 知识图推荐 MovieLens-1M1、基金交易记录
[107] 2023 目标查询投毒 知识图推理 FB15K-237、WN18DrugBank2、GNBR3、Hetionet4
[108] 2023 黑盒设置 + 指示性路径投毒 知识图嵌入 WN18RR、FB15K-237、CoDEx5
[109] 2023 毒性与隐蔽性评估框架 知识图嵌入 WN18RR、FB15K-237
[110] 2024 服务器/客户端添加虚假关系 联邦知识图嵌入 WN18RR、FB15K-237
防御投毒攻击 [111] 2023 历史信息估计模型更新恢复全局模型 联邦知识图 MNIST6、Fashion-MNIST7、Purchase8、HAR9
对抗攻击 [112] 2019 跨语言实体对齐模型扰动 知识图对齐 DBP15KZH−EN、DBP15KJA-EN、DBP15KFR-EN10
[113] 2021 深度强化学习生成低风险扰动 知识图嵌入 WN18、FB15K
[115] 2021 基于实例溯源关键训练三元组生成扰动 知识图嵌入 WN18RR、FB15K-237
[116] 2024 基于知识图谱逻辑规则生成扰动 知识图嵌入 WN18RR、FB15K-237
防御对抗攻击 [117] 2022 对抗训练 + 扰动检测防御扰动 知识图嵌入 WN18RR、FB15K-237

2.2 知识图谱中的隐私保护

知识图谱作为一种结构化的数据表示形式,其中包含的实体和关系信息可能涉及个人数据、商业秘密或其他形式的敏感信息。攻击者能够利用知识图谱中的公开信息,通过逻辑推理获取敏感信息,或者将知识图谱中的匿名数据与外部数据链接,以重新识别个人身份。为保护知识图谱中的敏感信息,研究者们从攻击者的视角分析了知识图谱中的隐私风险,并提出了相应的隐私保护方案。在利用知识图谱保护隐私的研究中,Cui等[118]提出了一种基于属性网络的知识图谱表示模型,该模型通过现有数据推断潜在的隐私。Hoang等[119]研究了在顺序发布知识图谱时的隐私保护问题,提出了一种称为kw-tad的方法,通过集群生成算法和知识图谱泛化算法在多个连续的匿名知识图谱发布中保护用户身份,防止攻击者重新识别用户。此外,还介绍了一种基于聚类的时变知识图谱匿名化算法CTKGA,用于生成满足kw-tad的匿名知识图谱。Chen等[120]针对知识图谱在联邦学习环境中的隐私和效率问题,提出了一个名为FedE的框架,允许多个客户端在本地计算实体嵌入,然后通过一个中心服务器协调这些嵌入的聚合,而不涉及原始知识图谱数据的交换。此外,一些研究改进了现有方案,以保护知识图谱中隐私信息的机密性,Han等[121]认为知识图谱中包含的个人或组织的机密信息容易通过嵌入泄露。因此提出了一个差分隐私知识图嵌入框架DPKGE,该框架扩展了现有的嵌入方法,能够处理包含机密和非机密声明的知识图谱。由此产生的嵌入使用差分隐私保护嵌入空间中任何先前语句的存在。Thouvenot等[122]认为传统的匿名化策略,如k-匿名,在处理数据更新时无法有效保护隐私,容易受到攻击者利用先前数据库快照进行识别和推断的攻击。因此提出了一个基于隐私设计原则的知识图谱匿名存储系统框架Kgastor。Kgastor结合资源描述框架数据库管理系统和一些符合更新安全性的匿名化技术,通过数据分区、支持数据更新操作和查询重写,实现在保证数据隐私的同时,兼顾数据实用性和时效性的平衡。Zhang等[123]认为之前的FedE框架中,实体嵌入的共享可能导致严重的隐私泄露,因此提出了名为FEDR的新框架,该方法通过聚合关系嵌入而非实体嵌入来解决隐私问题,而由于关系的数量通常少于实体数量,这种方法还可以显著减少通信成本。Hu等[124]从攻防两个角度研究了联邦知识图嵌入模型的隐私威胁,设计了3种新的推理攻击方法来量化模型的隐私风险,并提出了一种新的差分隐私保护机制DP-FLames。DP-FLames利用FKGE的实体绑定稀疏梯度特性实现更好的隐私—效用平衡,同时设计了私有选择机制来减少噪声注入,并进一步提出自适应隐私预算分配策略,在模型训练过程中动态调整防御强度。Chen等[125]认为目前许多隐私保护方法未能充分考虑不同情境下的数据隐私需求,因此提出了一种层次化隐私保护知识图谱HPPKG的构建方法,通过动态隐私层级分类和灵活的隐私保护措施,确保在不同隐私敏感度下对知识图谱中的信息进行有效保护。Hoang等[126]针对当前联邦学习方法,如FedE和FedR依赖可信服务器且未能充分防御推理攻击的问题,提出了一个新的隐私保护的去中心化学习框架,该框架利用了无许可的分布式账本技术和IPFS分布式文件系统来存储嵌入的元数据和权重,使得数据提供者无需共享其本地知识图谱即可协作训练嵌入。
知识图谱通过创建实体和实体间关系的图形结构,将来自不同领域的数据整合到一个统一的框架中,使得各领域间的数据通过明确的语义关系相互联系。在复杂推理时,知识图谱能够提供丰富的上下文信息,从而使决策支持更加准确可靠。然而,多数据源的知识融合同样带来了隐私风险,不同领域的数据可能通过某些公共属性被链接起来,同时知识图谱中的数据也可以与其他数据源链接,这种方式可能使攻击者重新识别已匿名化的个人。一些研究针对跨域多源知识图谱下的隐私问题提出了相应的解决方案。Peng等[127]提出了一种差分隐私的联邦知识图嵌入框架,通过异步对等的方式学习来自不同知识图谱的嵌入,同时保护隐私。该框架利用对抗生成网络在不同知识图谱之间进行嵌入翻译,以实现跨域实体和关系的统一嵌入空间。Wang等[128]提出了一种基于多特征知识图谱和区块链的可信跨域推荐模型MuKGB-CRS。该模型结合联邦学习和区块链技术,通过构建一个统一表示多源异构数据的多特征知识图谱MuKG,在保证数据隐私的同时提高推荐准确性和数据可信度。通过结合区块链和同态加密技术,MuKGB-CRS不仅能够保护用户隐私,还可以确保数据的真实性。Liu等[129]构建了一个多源知识图谱,通过整合多个辅助领域中的项目,避免单一辅助领域信息不足的问题,并通过构造项目间的信息传递图,通过不共享用户相关数据而仅通过项目嵌入的方式,以避免用户隐私信息在不同域之间泄露。
知识图谱作为一种结构化的数据表示形式,包含的实体和关系信息可能涉及敏感数据。同时,虽然知识图谱通过将不同领域的数据整合在一起提供了丰富的上下文信息,增强了决策支持的准确性,但多源数据的融合也增加了隐私泄露的风险,不同领域的数据可能因共享的公共属性而被关联,从而导致个人身份的重新识别。攻击者可以利用这些信息,通过逻辑推理或将匿名数据与外部数据源链接来重新识别个人身份。表6从不同的研究视角对知识图谱中的隐私保护方案进行分类,并简要总结了所提出的方法、保护目标以及验证方案有效性时使用的数据集。表中的研究从不同角度分析了这些隐私风险,并提出了相应的隐私保护方案。
表 6 知识图谱中的隐私保护方案

Table 6 Privacy protection schemes in knowledge graphs

研究视角 文献 年份 方法描述 保护目标 数据集/知识库
单源知识图隐私保护 [118] 2019 利用属性节点进行嵌入 用户敏感信息 FB13、DBLP1
[119] 2021 集群生成 + 泛化算法 用户身份信息
[120] 2021 联邦学习环境本地计算
+ 服务器聚合更新
私有实体和关系信息 FB15k-237、NELL-9952
[121] 2022 嵌入学习引入差分隐私 敏感信息 FB15k、FB15k-237、YAGO3-103
MIMIC-III4、eICU5
[122] 2022 数据分区
+ 更新安全的匿名化技术
个人身份信息和属性 LUBM6拓展生成数据集
[123] 2022 基于嵌入的数据恢复攻击
+ 隐私保护的关系嵌入聚合
敏感实体信息 FB15k-237、WN18RR、DDB147
[124] 2023 实体绑定稀疏梯度选择
+ 动态隐私预算分配
联邦知识图
嵌入模型
FB15K-237、NELL-995
[125] 2023 隐私级别
+ 差异化保护措施
用户身份信息和属性
[126] 2023 差分隐私 + 去中心化学习 实体和关系信息
多源知识图隐私保护 [127] 2021 隐私保护的对抗生成网络 实体和关系信息 DBpedia、Geonames、Yago、Geospecies、
Poképédia、Sandrart、Hellenic、Lexvo、
Tharawat、Whisky、World lift8
[128] 2023 区块链 + 联邦学习 用户行为数据和偏好信息 MovieLens、Amazon9
[129] 2024 注意力融合机制 用户行为数据和偏好信息 Movielens10、Netflix11、Book-Crossing12

3 挑战与未来工作

3.1 网络安全知识图谱构建与应用

在网络安全本体研究方面,目前主流的网络安全本体构建方法有中间出发法、自底向上法和自顶向下法,这些方法在不同的场景下各有优劣,如何选取合适的方法并结合这些方法的优点以提高本体构建的效率和质量是当前面临的一个挑战。虽然这些本体研究采用了目标建模、焦点小组评估和知识图谱构建与场景应用等方法来评估本体质量,但这些评估方法的标准化和普适性仍然不足。此外,并非所有的本体研究采取开源,这大大限制了社区对这些本体的使用和改进。在未来,应鼓励更多的网络安全本体开源,这不仅有助于学术界和工业界更好地共享和利用这些资源,也有助于本体质量的提升和创新进步。同时,应努力拓展本体的领域覆盖范围并增强领域深度,包括但不限于更细粒度的分类、关系的精细描述等。最后,随着网络安全威胁的复杂化,未来的工作应注重不同领域本体的整合,以便提供更全面的安全防护。
在网络安全实体提取与实体的关系提取研究方面,高质量的数据集是实体提取和关系提取的基础,但目前研究中使用的数据集多为自建,且标注方式主要为人工标注,这导致不同数据集之间的质量和一致性可能存在差异,从而影响模型的泛化能力。现有研究能够提取的实体类型和关系类型仍较为有限,不同研究所能识别的实体和关系类型范围差异明显,难以覆盖所有潜在的网络安全实体和关系。此外,现有的提取模型涉及多种复杂的组合,如BERT与各种神经网络架构的结合,复杂模型的训练需要大量的计算资源,同时增加了调优和理解的难度,如何选择合适的模型结构和参数也是当前面临的一个挑战。在未来,应开发和共享标准化的开源数据集和标注规范,以提升数据质量和研究成果的可比性。未来还应继续拓展可提取的实体和关系类型,涵盖更多的网络安全相关信息,特别是对于目前尚未充分研究的细分领域。另外,对于如何优化和简化模型结构并增强模型的跨领域适应性,也是值得探索的问题。
在基于威胁情报的网络安全知识图谱研究方面,威胁情报的数据来源广泛,不同来源的数据格式和质量参差不齐,如何标准化数据格式并确保数据质量是一大挑战。虽然一些图谱使用了特定的本体,但并非所有图谱都有明确的本体架构,这导致了知识图谱之间的兼容性和互操作性问题,从而难以实现跨平台的数据集成和共享。此外,大多数知识图谱使用Neo4j作为存储和查询工具,但Neo4j作为一款图数据库软件,其在知识图谱的可视化方面并不出色,尽管一些知识图谱提供了自主设计的Web GUI界面,但整体上图谱的可视化和用户友好性仍有较大提升空间。最后,图谱质量评估是一个重要但常常被忽视的领域,目前仍有部分图谱并未明确其质量评估方法,这使得图谱的可靠性和可信度存疑,同时只有少部分的图谱采取开源,这也极大限制了社区对这些图谱的使用和改进。未来应开发更直观、更强大的可视化工具,提升用户界面的友好性,使得非技术用户也能够有效地利用和理解知识图谱。还需制定和推广统一的图谱质量评估标准,包括数据完整性、准确性、一致性等方面的指标,以确保知识图谱的高质量和高可信度。同时,还应鼓励更多的知识图谱开源,更多地关注跨领域的知识集成与应用,如将网络安全知识图谱与物联网、安全管理等领域的数据结合,形成更全面的安全防护体系。
在网络安全知识图谱补全方面,网络安全知识图谱通常涉及大量的实体和关系,但由于数据来源有限或数据的敏感性,图谱中可能存在许多缺失信息,这种数据稀疏性极大地限制了模型的表示能力,使得补全任务更加困难。数据集的质量也是一个关键问题,如果初始特征质量不高,模型的补全效果可能受到严重影响。此外,处理大规模知识图谱的补全需要高效的算法和大量的计算资源,现有方法虽然已经能够取得较好的效果,但也对计算资源和训练时间提出了更高的要求。在未来,应致力于研究提高数据集的质量和处理稀疏数据的方法,包括开发新的数据清洗和标准化技术,以及创新的特征提取和表示学习方法,以克服数据稀疏性的挑战。同时,可以致力于开发更高效的算法,减少计算资源和训练时间的消耗,这可能包括模型的压缩、剪枝技术以及分布式计算方法的应用,以提高模型的训练和推理效率。未来还应关注如何提高模型的鲁棒性,特别是在处理噪声数据和稀疏关系时的表现,包括探索更稳定的特征融合策略和噪声过滤机制,以减少噪声对模型的影响。最后,通过结合不同领域的知识图谱,将跨领域的信息进行集成和利用,以形成更全面和强大的知识库,同样有助于提升图谱补全的准确性。
在网络安全知识图谱的应用研究方面,许多研究在应用知识图谱时,面临数据覆盖不全面和数据准确性不足的问题。例如,在网络攻击溯源和攻击预测中,现有的数据可能无法涵盖所有可能的攻击路径和行为,数据的不完整和不准确将严重影响模型的性能和可靠性。网络安全知识涉及多个细分领域,如漏洞、威胁情报、攻击策略等,将这些领域的知识有效整合并表示在一个统一的知识图谱中同样是一个挑战。此外,网络安全环境变化迅速,新的威胁和攻击手段不断出现,现有的知识图谱应用可能难以实时更新和动态适应这些变化,如何实现知识图谱的实时更新和动态调整也是一个关键挑战。最后,为支持复杂的安全需求分析、攻击溯源、威胁预测等任务,需要知识图谱具备强大的推理和分析能力,这对CKG在建模和推理算法方面的改进和优化提出挑战。在未来,研究者们不能仅仅局限于探索网络安全知识图谱的应用,还应尝试结合知识图谱去解决网络空间安全领域内的隐私保护、政策合规等其他问题。例如,Cui等[130]就提出了PoliGraph框架用于自动化分析隐私政策,在应用方面,PoliGraph不仅揭示了隐私政策文本中的常见模式,评估了隐私政策中定义的术语的正确性,还检测了隐私政策中的矛盾,并分析了隐私政策和网络流量的一致性。笔者相信,在未来知识图谱能够在隐私政策分析等一众网络安全新兴领域充分发挥自身优势,为各领域研究提供新的解决思路与方案。

3.2 知识图谱安全与隐私保护

现有针对知识图谱的投毒攻击和对抗攻击给知识图谱在嵌入、推理、预测等任务上的准确性带来了重大挑战。一方面,投毒攻击和对抗攻击通过注入恶意三元组,添加或删除知识图谱中的某些关键节点和边,直接或间接地影响知识图谱中的事实描述,导致知识图嵌入模型生成偏离实际的嵌入表示。另一方面,现有模型缺乏对抗投毒和对抗攻击的防御能力,容易受到特定类型的恶意数据的影响。尤其是在隐蔽性较强的间接攻击和高敏感度的对称模式攻击下,模型的鲁棒性进一步被削弱。这些因素显著降低了模型在推理和预测任务中的可信度和准确性。针对知识图谱面临的威胁和自身的不足,未来的研究方向应考虑以下几个方面。首先,通过在模型训练过程中引入对抗训练,以增强模型对投毒攻击和对抗攻击的防御能力。其次,设计检测知识图谱中异常行为的自动化算法,例如基于机器学习的异常检测算法,以识别注入到知识图谱中的恶意三元组。再者,随着多源数据整合需求的增加,如何在多源异构知识图谱中实现安全的数据共享和融合,防止投毒攻击在不同知识域之间扩散也有待研究。最后,建立一个全面客观的评估框架,对不同攻击方法的毒性、隐蔽性和知识图谱的鲁棒性进行综合评价,以量化攻击的威胁程度,评估现有防御方法的有效性。
除了攻击带来的风险外,知识图谱还面临隐私保护方面的挑战。对于存储隐私信息的知识图谱,即使进行了匿名化处理,攻击者在一定条件下仍然可以利用背景知识和外部数据源,通过逻辑推理重新识别匿名化的个人或推断隐私信息。这种风险在跨域知识图谱和多源数据整合中尤为严重,因为不同领域的数据可能通过共享的公共属性进行关联,容易间接地导致隐私信息泄露。在联邦学习环境中,尽管不交换原始数据,实体嵌入的共享仍可能导致隐私泄露。特别是嵌入模型在进行实体和关系预测时,可能泄露客户端中两个实体之间的关系。联邦学习中的数据传输和模型聚合机制也增加了信息泄露的风险。而在连续发布的匿名知识图谱数据中,攻击者可以利用多个版本的匿名化图谱进行差异分析,重新识别用户身份或推断隐私信息。现有的匿名化策略,如k-匿名,无法有效应对数据更新时的隐私保护问题,尤其是在面对不断变化的数据环境时,已有方法的局限性更加突出。此外,如何在保障隐私信息不被推断和泄露的同时,保持知识图谱的可用性,也是知识图谱在应用中面临的挑战。
针对知识图谱在隐私保护方面的挑战,未来的研究方向应考虑以下几个方面。首先,研究更先进的匿名化方法和差分隐私机制,开发动态调整隐私保护强度的技术,确保在各种情境下对去匿名化和隐私推断等攻击的有效防护。其次,探索更为有效的联邦学习框架,通过区块链和同态加密等技术,以确保数据的真实性和安全性,同时提高模型效用。再次,采用去中心化的学习框架,避免依赖可信服务器,以提升数据隐私保护的能力。最后,值得深入研究的还有如何在利用知识图谱模型整合多源异构数据的同时,防止数据关联导致的隐私泄露,从而确保数据融合的安全性。
综上,网络安全知识图谱的未来研究应着重推进以下几个方面:(1)网络安全本体构建方面,应进一步探索能够提高本体构建效率和质量的方法,同时推动本体评估方法的标准化,以提升知识图谱的可靠性;(2)网络安全实体与关系提取方面,需要继续改进能够处理多源异构数据的知识图谱模型,增强模型的泛化能力,并扩展实体和关系类型的覆盖范围;(3)基于威胁情报的网络安全知识图谱方面,应加强数据格式的标准化和知识图谱结构的统一性,以提升跨平台的数据集成与共享能力;(4)网络安全知识图谱补全方面,需要进一步研发适应数据稀疏性的高效算法,并优化大规模知识图谱处理的计算资源使用;(5)网络安全知识图谱构建方面,需要设计更全面、动态更新的知识图谱以应对快速变化的威胁环境,提升知识图谱在复杂安全需求分析和威胁预测中的推理与分析能力;(6)知识图谱安全方面,需要进一步研究如何提升知识图谱的鲁棒性,设计更先进的对抗投毒和对抗攻击的防御机制,并加强知识图谱在隐私保护方面的研究,确保在保障数据安全的同时实现知识的有效利用。

4 结束语

近年来,网络安全态势愈发复杂与严峻,网络攻击的频率和复杂性不断增加,网络安全防护面临着更多的挑战和要求。在此背景下,知识图谱在网络安全领域的应用有效增强了安全防护能力,提供了应对日益复杂的网络安全挑战的新方法。与此同时,知识图谱自身也面临新的安全威胁,包括投毒攻击、对抗攻击、隐私泄露等。本文在充分调研最新相关文献的基础上,详细介绍了网络安全知识图谱的构建与应用,探讨了知识图谱当前面临的安全风险,并介绍了知识图谱隐私保护方面的研究成果。本文讨论了知识图谱在网络安全领域面临的挑战与具有前景的研究方向,通过系统性地梳理与分析面向网络空间安全领域的知识图谱研究的最新进展,旨在为安全领域的知识图谱研究提供理论基础和实践参考,并进一步挖掘知识图谱在安全领域的潜在价值。
1
SINGHAL A. Introducing the knowledge graph:Things,not strings[EB/OL](2012-03-16)[2024-07-10]. https://blog. google/products/search/introducing-knowledge-graph-things not/

2
QUILLIAN M R. Semantic Memory[J]. Semantic Information Processing,1968:216-270.

3
董聪, 姜波, 卢志刚, 等. 面向网络空间安全情报的知识图谱综述[J]. 信息安全学报, 2020, 5 (5): 56- 76.

DONG C, JIANG B, LU Z G, et al. Knowledge Graph for cyberspace security intelligence: A survey[J]. Cybersecurity, 2020, 5 (5): 56- 76.

4
Wikipedia. Google Knowledge Graph[EB/OL](2012-05-16)[2024-07-10]. https://en.wikipedia.org/wiki/Google_Knowledge_Graph.

5
RICHARD Q. Understand your world with bing[EB/OL](2013-03-21)[2024-07-10]. https://blogs.bing.com/search/March-2013/Understand-Your-World-with-Bing

6
搜狗百科. 搜狗知立方[EB/OL](2012-11-12)[2024-07-10]. https://baike.sogou.com/v66616234.htm.

Sogou Encyclopedia. Sogou Knowledge Cube[EB/OL](2012-11-12)[2024-07-10]. https://baike.sogou.com/v66616234.htm.

7
王晰巍, 韦雅楠, 邢云菲, 等. 社交网络舆情知识图谱发展动态及趋势研究[J]. 情报学报, 2019, 38 (12): 1329- 1338.

WANG X W, WEI Y N, XING Y F, et al. Research on the dynamics and trends of the development of public opinion topic maps in social networks[J]. Journal of the China Society for Scientific and Technical Information, 2019, 38 (12): 1329- 1338.

8
陈强, 代仕娅. 基于金融知识图谱的会计欺诈风险识别方法[J]. 大数据, 2021, 7 (3): 116- 129.

DOI

CHEN Q, DAI S Y. Recognition method of accounting fraud risk based on financial knowledge graph[J]. Big Data Research, 2021, 7 (3): 116- 129.

DOI

9
王继伟, 梁怀众, 樊伟, 等. 基于中文医疗知识图谱的智能问答系统设计与实现方法[J]. 中国数字医学, 2021, 16 (2): 54- 58.

DOI

WANG J W, LIANG H Z, FAN W, et al. Design and implementation of intelligent Q&A system based on chinese medical knowledge graph[J]. China Digital Medicine, 2021, 16 (2): 54- 58.

DOI

10
王森章, 刘毅, 张家强, 等. 面向电子商务平台用户意图预测的时间感知分层自注意力网络[J]. 信息安全学报, 2021, 6 (5): 169- 180.

WANG S Z, LIU Y, ZHANG J Q, et al. Time-aware hierarchical self-attention networks for user intent prediction on E-commerce platforms[J]. Journal of Cyber Security, 2021, 6 (5): 169- 180.

11
王晓狄, 黄诚, 刘嘉勇. 面向网络安全开源情报的知识图谱研究综述[J]. 信息网络安全, 2023, 23 (6): 11- 21.

DOI

WANG X D, HUANG C, LIU J Y. A Survey of Cyber Security Open-Source Intelligence Knowledge Graph[J]. Netinfo Security, 2023, 23 (6): 11- 21.

DOI

12
VRANDEČIĆ D, KRÖTZSCH M. Wikidata: A free collabo rative knowledgebase[J]. Communications of the ACM, 2014, 57 (10): 78- 85.

DOI

13
AUER S,BIZER C,KOBILAROV G,et al. DBpedia:A nucleus for a web of open data[C]//International Semantic Web Conference,2007:722-735.

14
BOLLACKER K,EVANS C,PARITOSH P,et al. Free base:A collaboratively created graph database for structuring human knowledge[C]//Proceedings of the 2008 ACM SIG MOD International Conference on Management of Data,2008:1247-1250.

15
SUCHANEK F M,KASNECI G,WEIKUM G. YAGO:A core of semantic knowledge[C]//Proceedings of the 16th Inter national Conference on World Wide Web,2007:697-706.

16
李昌建, 于晗, 陈恺, 等. 物联网威胁情报知识图谱综述[J]. 网络空间安全科学学报, 2024, 2 (2): 18- 35.

LI C J, YU H, CHEN K, et al. A survey of IoT threat intelligence knowledge graph[J]. Journal of Cybersecurity, 2024, 2 (2): 18- 35.

17
KUMAR K,PANDE B P. Applications of machine learning techniques in the realm of cybersecurity[J]. Cyber Security and Digital Forensics,2022:295-315.

18
LIEBETRAU T. Cyber conflict short of war: A European strategic vacuum[J]. Europe an Security, 2022, 31 (4): 497- 516.

DOI

19
COLE E. Advanced persistent threat:Understanding the danger and how to protect your organization[M]. Newnes,2012.

20
SRIAVSTAVA R,SINGH P,CHHABRA H. Review on cyber security intrusion detection:Using methods of machine learning and data mining[J]. Internet of Things and Big Data Applications:Recent Advances and Challenges,2020:121-132.

21
PANG G, SHEN C, CAO L, et al. Deep learning for anomaly detection: A review[J]. ACM computing surveys (CSUR), 2021, 54 (2): 1- 38.

22
PERDISCI R, ARIU D, FOGLA P, et al. McPAD: A multiple classifier system for accurate payload-based anomaly detection[J]. Computer networks, 2009, 53 (6): 864- 881.

DOI

23
LLORENS,A. 5 best practices to get more from threat intelligence[EB/OL]. [2024-6-10]. https://www.threatq.com/5-best-practices-more-threat-intelligence/.

24
LIU K, WANG F, DING Z, et al. Recent progress of using knowledge graph for cybersecurity[J]. Electronics, 2022, 11 (15): 2287.

DOI

25
SIKOS L F. Cybersecurity knowledge graphs[J]. Knowledge and Information Systems, 2023, 65 (9): 3511- 3531.

DOI

26
RASKIN V,HEMPELMANN C F,TRIEZENBERG K E,et al. Ontology in information security:a useful theoretical foundation and methodological tool[C]//Proceedings of the 2001 Workshop on New Security Paradigms,2001:53-59.

27
RASTOGI N,DUTTA S,ZAKI M J,et al. Malont:An ontology for malware threat intelligence[C]//International Workshop on Deployable Machine Learning for Security Defense. Cham:Springer International Publishing,2020:28-44.

28
CHRISTIAN R,DUTTA S,PARK Y,et al. An ontology-driven knowledge graph for android malware[C]//Proceedings of the 2021 ACM SIGSAC Conference on Computer and Communications Security,2021:2435-2437.

29
胡勉宁, 李欣, 李明锋, 等. 面向前端防范的网络威胁情报细粒度本体研究[J]. 情报杂志, 2023, 42 (9): 135- 140,148.

HU M N, LI X, LI M F, et al. Research on fine-grained ontology of network threat intelligence for front-end prevention[J]. Journal of Intelligence, 2023, 42 (9): 135- 140,148.

30
SYED R. Cybersecurity vulnerability management: A conceptual ontology and cyber intelligence alert system[J]. Information & Management, 2020, 57 (6): 103334.

31
WANG Z, ZHU H, LIU P, et al. Social engineering in cybersecurity: A domain ontology and knowledge graph application examples[J]. Cybersecurity, 2021, 4, 1- 21.

DOI

32
KURNIAWAN K, EKELHART A, KIESLING E, et al. KRYSTAL: Knowledge graph-based framework for tactical attack discovery in audit data[J]. Computers & Security, 2022, 121, 102828.

33
WANG Y,ZHAO B,LI W,et al. An ontology-centric approach for network security situation awareness[C]//2023 IEEE 47th Annual Computers,Software,and Applications Conference (COMPSAC). IEEE,2023:777-787.

34
ECHENIM K U,JOSHI K P. IoT-Reg:A comprehensive knowledge graph for real-time IoT data privacy compliance[C]//2023 IEEE International Conference on Big Data (BigData). IEEE,2023:2897-2906.

35
KIM G, LEE C, JO J, et al. Automatic extraction of named entities of cyber threats using a deep Bi-LSTM-CRF network[J]. International Journal of Machine Learning and Cybernetics, 2020, 11, 2341- 2355.

DOI

36
GAO C, ZHANG X, LIU H. Data and knowledge-driven named entity recognition for cyber security[J]. Cybersecurity, 2021, 4 (1): 9.

DOI

37
CHEN Y X,DING J,LI D,et al. Joint BERT model based cybersecurity named entity recognition[C]//Proceedings of the 2021 4th International Conference on Software Engineering and Information Management,2021:236-242.

38
FANG Y, ZHANG Y, HUANG C. CyberEyes: Cybersecurity entity recognition model based on graph convolutional network[J]. The Computer Journal, 2021, 64 (8): 1215- 1225.

DOI

39
RANADE P,PIPLAI A,JOSHI A,et al. Cybert:Contextualized embeddings for the cybersecurity domain[C]//2021 IEEE International Conference on Big Data (Big Data). IEEE,2021:3334-3342.

40
WANG X,LIU R,YANG J,et al. Cyber threat intelligence entity extraction based on deep learning and field knowledge engineering[C]//2022 IEEE 25th International Conference on Computer Supported Cooperative Work in Design (CSCWD). IEEE,2022:406-413.

41
WANG X, LIU J. A novel feature integration and entity boundary detection for named entity recognition in cybersecurity[J]. Knowledge-Based Systems, 2023, 260, 110114.

DOI

42
WANG X,XIONG M,LUO Y,et al. Joint learning for document-level threat intelligence relation extraction and coreference resolution based on gcn[C]//2020 IEEE 19th International Conference on Trust,Security and Privacy in Computing and Communications (TrustCom). IEEE,2020:584-591.

43
LI Y, GUO Y, FANG C, et al. Feature-enhanced document-level relation extraction in threat intelligence with knowledge distillation[J]. Electronics, 2022, 11 (22): 3715.

DOI

44
SHEN G, WANG W, MU Q, et al. Data‐Driven cybersecurity knowledge graph construction for industrial control system security[J]. Wireless Communications and Mobile Computing, 2020, 2020 (1): 8883696.

45
GUO Y,LIU Z,HUANG C,et al. CyberRel:Joint entity and relation extraction for cybersecurity concepts[C]//Information and Communications Security:23rd International Conference,ICICS 2021:447-463.

46
孙天放. 基于深度学习的威胁情报信息抽取研究[J]. 现代计算机, 2021, (16): 59- 64.

SUN T F. Threat intelligence information extraction based on deep learning[J]. Modern Computer, 2021, (16): 59- 64.

47
LI Y, GUO Y, FANG C, et al. A novel threat intelligence information extraction system combining multiple models[J]. Security and Communication Networks, 2022, 2022 (1): 8477260.

48
JO H, LEE Y, SHIN S. Vulcan: Automatic extraction and analysis of cyber threat intelligence from unstructured text[J]. Computers & Security, 2022, 120, 102763.

49
MARCHIORI F,CONTI M,VERDE N V. Stixnet:A novel and modular solution for extracting all stix objects in CTI reports[C]//Proceedings of the 18th International Conference on Availability,Reliability and Security,2023:1-11.

50
于丰瑞. 网络威胁技战术情报自动化识别提取研究综述[J]. 计算机工程与应用, 2024, 60 (13): 1- 22.

YU F R. Survey on automated recognition and extraction of TTPs[J]. Computer Engineering and Applications, 2024, 60 (13): 1- 22.

51
PIPLAI A, MITTAL S, JOSHI A, et al. Creating cybersecurity knowledge graphs from malware after action reports[J]. IEEE Access, 2020, 8, 211691- 211703.

DOI

52
陶耀东, 贾新桐, 吴云坤. 一种基于知识图谱的工业互联网安全漏洞研究方法[J]. 信息技术与网络安全, 2020, 39 (1): 6- 13,18.

CHEN Y D, JIA X T, WU Y K. A research method of industrial Internet security vulnerabilities based on knowledge graph[J]. Cyber Security and Data Governance, 2020, 39 (1): 6- 13,18.

53
WANG W,ZHOU H,LI K,et al. Cyber-attack behavior knowledge graph based on CAPEC and CWE towards 6G[C]//International Symposium on Mobile Internet Security. Singapore:Springer Nature Singapore,2021:352-364.

54
RASTOGI N, DUTTA S, CHRISTIAN R, et al. Information prediction using knowledge graphs for contextual malware threat intelligence[J]. arXiv preprint arXiv:, 2102, 05571, 2021.

55
SARHAN I, SPRUIT M. Open-cykg: An open cyber threat intelligence knowledge graph[J]. Knowledge-based Systems, 2021, 233, 107524.

DOI

56
LI Z,ZENG J,CHEN Y,et al. AttacKG:Constructing technique knowledge graph from cyber threat intelligence reports[C]//European Symposium on Research in Computer Security. Cham:Springer International Publishing,2022:589-609.

57
SATVAT K,GJOMEMO R,VENKATAKRISHNAN V N. Extractor:Extracting attack behavior from threat reports[C]//2021 IEEE European Symposium on Security and Privacy (EuroS&P). IEEE,2021:598-615.

58
HUSARI G,AL-SHAER E,AHMED M,et al. Ttpdrill:Automatic and accurate extraction of threat actions from unstructured text of CTI sources[C]//Proceedings of the 33rd Annual Computer Security Applications Conference. 2017:103-115.

59
REN Y, XIAO Y, ZHOU Y, et al. Cskg4apt: A cybersecurity knowledge graph for advanced persistent threat organization attribution[J]. IEEE Transactions on Knowledge and Data Engineering, 2022, 35 (6): 5695- 5709.

60
GAO P, LIU X, CHOI E, et al. Threatkg: A threat knowledge graph for automated open-source cyber threat intelligence gathering and management[J]. arXiv preprint arXiv:, 2212, 10388, 2022.

61
ZHANG Y, CHEN J, CHENG Z, et al. Edge propagation for link prediction in requirement-cyber threat intelligence knowledge graph[J]. Information Sciences, 2024, 653, 119770.

DOI

62
HU Y,ZOU F,HAN J,et al. Llm-tikg:Threat intelligence knowledge graph construction utilizing large language model[J]. Computers & Security,2024:103999.

63
程子栋,李鹏,朱枫. 物联网威胁情报知识图谱中潜在关系的挖掘[J/OL]. 计算机应用,1-10[2024-07-12]. http://kns.cnki.net/kcms/detail/51.1307.tp.20240407.1228.004.html.

CHENG Z D,LI P,ZHU F. Potential relation mining from internet of things threat intelligence knowledge graph[J/OL]. Journal of Computer Applications,1-10[2024-07-12]. http://kns.cnki.net/kcms/detail/51.1307.tp.20240407.1228.004.html.

64
TAO Y,LI M,HU W. Research on knowledge graph model for cybersecurity logs based on ontology and classified protection[C]//Journal of Physics:Conference Series. IOP Publishing,2020,1575(1):012018.

65
XIA H, WANG Y, Gauthier J, et al. Knowledge graph of mobile payment platforms based on deep learning: Risk analysis and policy implications[J]. Expert Systems with Applications, 2022, 208, 118143.

DOI

66
SUN S, HUANG C, WU T, et al. SecTKG: A knowledge graph for open‐source security tools[J]. International Journal of Intelligent Systems, 2023, 2023 (1): 4464974.

67
WANG Y,HOU X,MA X,et al. A software security entity relationships prediction framework based on knowledge graph embedding using Sentence-BERT[C]//International Conference on Wireless Algorithms,Systems,and Applications. Cham:Springer Nature Switzerland,2022:501-513.

68
REIMERS N, GUREVYCH I. Sentence-BERT: Sentence embeddings using siamese bert-networks[J]. arXiv preprint arXiv:, 1908, 10084, 2019.

69
周莎, 申国伟, 郭春. 基于安全知识图谱与逆向特征的弱点信息补全[J]. 计算机工程, 2024, 50 (1): 145- 155.

ZHOU S, SHEN G W, GUO C. Vulnerability information completion based on security knowledge graph and reverse features[J]. Computer Engineering, 2024, 50 (1): 145- 155.

70
DETTMERS T,MINERVINI P,STENETORP P,et al. Convolutional 2d knowledge graph embeddings[C]//Proceedings of the AAAI Conference on Artificial Intelligence. 2018:32(1).

71
BORDES A,USUNIER N,GARCIA-DURAN A,et al. Translating embeddings for modeling multi-relational data[J]. Advances in Neural Information Processing Systems,2013,26.

72
TOUTANOVA K,CHEN D. Observed versus latent features for knowledge base and text inference[C]//Proceedings of the 3rd Workshop on Continuous Vector Space Models and Their Compositionality,2015:57-66.

73
ZHANG Y,LI X. The scheme of security requirement acquisition based on knowledge graph[C]//2020 International Symposium on Theoretical Aspects of Software Engineering (TASE). IEEE,2020:225-231.

74
HAAR L V,REYNOLDS S,PROCKO T,et al. Validating security requirement specifications through the use of a knowledge graph[C]//2023 IEEE 17th International Conference on Semantic Computing (ICSC). IEEE,2023:244-251.

75
WANG C,CHEN F,LI X,et al. An Application Security Requirements Analysis Method Based on Knowledge Graph[C]//Proceedings of the 2023 3rd International Conference on Big Data,Artificial Intelligence and Risk Management. 2023:151-154.

76
陈佳. 基于知识图谱的DDoS攻击源检测研究[J]. 信息安全研究, 2020, 6 (1): 91- 96.

DOI

CHEN J. DDoS attack detection based on knowledge graph[J]. Journal of Information Securtiy Research, 2020, 6 (1): 91- 96.

DOI

77
刘飞扬, 李坤, 宋飞, 等. DDoS攻击恶意行为知识库构建[J]. 电信科学, 2021, 37 (11): 17- 32.

LIU F Y, LI K, SONG F, et al. Construction of DDoS attacks malicious behavior knowledge base construction[J]. Telecommunications Science, 2021, 37 (11): 17- 32.

78
ZENGY J,WANG X,LIU J,et al. Shadewatcher:Recommendation-guided cyber threat analysis using system audit records[C]//2022 IEEE Symposium on Security and Privacy (SP). IEEE,2022:489-506.

79
张玉臣,孙澄,姜迎畅,等. 融合威胁情报与知识图谱的网络攻击溯源方法[J]. 情报杂志,2024,43(8):72-83+91.

ZHANG Y C,SUN C,JIANG Y C,et al. A Traceability Method of Network Attacks Combining Threat Intelligence and Knowledge Graph[J]. Journal of Intelligence,2024,43(8):72-83+91.

80
孙澄, 胡浩, 杨英杰, 等. 基于网络防御知识图谱的0day攻击路径预测方法[J]. 网络与信息安全学报, 2022, 8 (1): 151- 166.

SUN C, HU H, YANG Y J, et al. Prediction method of 0day attack path based on cyber defense knowledge graph[J]. Chinese Journal of Network and Information Security, 2022, 8 (1): 151- 166.

81
KAISER F K, DARDIK U, ELITZUR A, et al. Attack hypotheses generation based on threat intelligence knowledge graph[J]. IEEE Transactions on Dependable and Secure Computing, 2023, 20 (6): 4793- 4809.

DOI

82
WANG R,CHEN K,ZHANG C,et al. AlphaEXP:An expert system for identifying security-sensitive kernel objects[C]//32nd USENIX Security Symposium (USENIX Security 23),2023:4229-4246.

83
黄智勇, 刘昕宇, 林仁明, 等. 基于知识图谱的网络攻击预测方法研究及应用[J]. 现代电子技术, 2024, 47 (9): 91- 96.

HUANG Z Y, LIU X Y, LIN R M, et al. Research and application of network attack prediction method based on knowledge graph[J]. Modern Electronics Technique, 2024, 47 (9): 91- 96.

84
王一琁. 基于知识图谱的网络安全态势感知技术研究与实现[D]. 电子科技大学,2020.

WANG Y X. Research and implementation of NSSA technology based on knowledge graph[D]. University of Electronic Science and Technology of China,2020.

85
陈珺娴. 基于知识图谱的网络攻击态势检测系统设计与实现[D]. 北京邮电大学,2020.

CHEN J X. Desing and implementation of network attacks situation detection system based on knowledge graph[D]. Beijing University Of Posts and Telecommunications,2020.

86
王丽敏. 漏洞知识图谱的构建及漏洞态势感知技术研究[D]. 中国科学院大学(中国科学院大学人工智能学院),2020.

WANG L M. Research on construction of vulnerability knowledge graph and vulnerability situation awareness[D]. University of Chinese Academy of Sciences,2020.

87
蚁佳才, 刘斌, 姚莉, 等. 基于知识推理的卫星网络态势理解[J]. 系统工程与电子技术, 2022, 44 (5): 1562- 1571.

YI J C, LIU B, YAO L, et al. Satellite cyber situational understanding based on knowledge reasoning[J]. Systems Engineering and Electronics, 2022, 44 (5): 1562- 1571.

88
CHEN J,LI F,ZOU Z,et al. Network security situation awareness framework based on knowledge graph[C]//2023 IEEE 7th Information Technology and Mechatronics Engineering Conference (ITOEC). IEEE,2023,7:1579-1583.

89
OU Y,ZHOU T,ZHU J. Recommendation of cyber attack method based on knowledge graph[C]//2020 International Conference on Computer Engineering and Intelligent Control (ICCEIC). IEEE,2020:60-65.

90
CHEN X,SHEN W,YANG G. Automatic generation of attack strategy for multiple vulnerabilities based on domain knowledge graph[C]//IECON 2021–47th Annual Conference of the IEEE Industrial Electronics Society. IEEE,2021:1-6.

91
HU T,PAN Z,LI B. SolDetector:Detect defects based on knowledge graph of solidity smart contract[C]//SEKE. 2021:423-428.

92
王乐. 基于知识图谱的软件安全漏洞挖掘技术研究[D]. 西安工业大学,2021.

WANG L. Research on software security vulnerability Mining technology based on knowledge graph[D]. Xi'an Technological University,2021.

93
陈泽, 邬桐, 左晓军, 等. 基于知识图谱的电力网络安全漏洞挖掘系统设计[J]. 制造业自动化, 2023, 45 (7): 100- 105,110.

DOI

CHEN Z, WU T, ZUO X J, et al. Design of power network security vulnerability mining system based on knowledge graph[J]. Manufacturing Automation, 2023, 45 (7): 100- 105,110.

DOI

94
PIPLAI A,RANADE P,KOTAL A,et al. Using knowledge graphs and reinforcement learning for malware analysis[C]//2020 IEEE International Conference on Big Data (Big Data). IEEE,2020:2626-2633.

95
BAI Y, CHEN S, XING Z, et al. ArgusDroid: Detecting Android malware variants by mining permission-API knowledge graph[J]. Science China Information Sciences, 2023, 66 (9): 192101.

DOI

96
DING Z,CAO D,LIU L,et al. A method for discovering hidden patterns of cybersecurity knowledge based on hierarchical clustering[C]//2021 IEEE Sixth International Conference on Data Science in Cyberspace (DSC). IEEE,2021:334-338.

97
MITRA S,PIPLAI A,MITTAL S,et al. Combating fake cyber threat intelligence using provenance in cybersecurity knowledge graphs[C]//2021 IEEE International Conference on Big Data (Big Data). IEEE,2021:3316-3323.

98
VASSILEV V,SOWINSKI-MYDLARZ V,GASIOROWSKI P,et al. Intelligence graphs for threat intelligence and security policy validation of cyber systems[C]//Proceedings of International Conference on Artificial Intelligence and Applications:ICAIA 2020. Springer Singapore,2021:125-139.

99
GARRIDO J S,DOLD D,FRANK J. Machine learning on knowledge graphs for context-aware security monitoring[C]//2021 IEEE International Conference on Cyber Security and Resilience (CSR). IEEE,2021:55-60.

100
ZHONG X,ZHANG Y,LIU J,et al. Research on automated cyber asset scanning tools based on cybersecurity knowledge graph[C]//2021 7th International Conference on Computer and Communications (ICCC). IEEE,2021:2046-2049.

101
TIAN Y P,YAN S,QUAN J S. Research on security threat assessment for power iot terminal based on knowledge graph[C]//2021 IEEE 5th Information Technology,Networking,Electronic and Automation Control Conference (ITNEC). IEEE,2021,5:1717-1721.

102
EKELHART A,EKAPUTRA F J,KIESLING E. The SLOGERT framework for automated log knowledge graph construction[C]//European Semantic Web Conference. Cham:Springer International Publishing,2021:631-646.

103
HAQUE M U,KHOLOOSI M M,BABAR M A. KGSecConfig:A knowledge graph based approach for secured container orchestrator configuration[C]//2022 IEEE International Conference on Software Analysis,Evolution and Reengineering (SANER). IEEE,2022:420-431.

104
ZHANG H,ZHENG T,GAO J,et al. Data Poisoning Attack against Knowledge Graph Embedding[C]//International Joint Conference on Artificial Intelligence. 2019.

105
BHARDWAJ P,KELLEHER J,COSTABELLO L,et al. Poisoning knowledge graph embeddings via relation inference patterns[C]//Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing. 2021:1875-1888.

106
WU Z W, CHEN C T, HUANG S H. Poisoning attacks against knowledge graph-based recommendation systems using deep reinforcement learning[J]. Neural Computing and Applications, 2022, 1, 1- 19.

107
XI Z,DU T,LI C,et al. On the security risks of knowledge graph reasoning[C]//32nd USENIX Security Symposium (USENIX Security 23). 2023:3259-3276.

108
YOU X,SHENG B,DING D,et al. MaSS:Model-Agnostic,Semantic and Stealthy Data Poisoning Atack on Knowledge Graph Embedding[C]//Proceedings of the ACM Web Conference 2023. 2023:2000-2010.

109
ZHU D,LIN Y,WANG L,et al. Evaluation Framework for Poisoning Attacks on Knowledge Graph Embeddings[C]//CCF International Conference on Natural Language Processing and Chinese Computing. 2023:184-196.

110
ZHOU E,GUO S,MA Z,et al. Poisoning Attack on Federated Knowledge Graph Embedding[C]//Proceedings of the ACM on Web Conference 2024. 2024:1998-2008.

111
CAO X,JIA J,ZHANG Z,et al. FedRecover:Recovering from poisoning attacks in federated learning using historical information[C]//In 2023 IEEE Symposium on Security and Privacy (SP),2023:1366-1383.

112
ZHANG Z,ZHANG Z,ZHOU Y,et al. Adversarial attack against cross-lingual knowledge graph alignment[C]//Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing. 2019:5320-5337.

113
BANERJEE P,CHU L,ZHANG Y,et al. Stealthy targeted data poisoning attack on knowledge graphs[C]//2021 IEEE 37th International Conference on Data Engineering (ICDE),2021:2069-2074.

114
PEZESHKPOUR P,TIAN Y,SINGH S. Investigating robustness and interpretability of link prediction via adversarial modifications[C]//Conference of the North American Chapter of the Association for Computational Linguistics (NAACL). 2019.

115
BHARDWAJ P,KELLEHER J,COSTABELLO L,et al. Adversarial attacks on knowledge graph embeddings via instance attribution methods[C]//Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing. 2021:8225-8239.

116
ZHAO T,CHEN J,RU Y,et al. Untargeted adversarial attack on knowledge graph embeddings[C]//In Proceedings of the 47th International ACM SIGIR Conference on Research and Development in Information Retrieval. 2024:1701-1711.

117
ZHANG Y,CHEN Q,HAO X,et al. Defense against adversarial attack on knowledge graph embedding. [J] In Emerging Trends in Cybersecurity Applications. Cham:Springer International Publishing. 2022:441-461.

118
CUI Z,PAN L,LIU S,et al. Infer latent privacy for attribute network in knowledge graph[C]//2019 IEEE International Conference on Big Data (Big Data). 2019:2542-2551.

119
HOANG A T,CARMINATI B,FERRARI E. Privacy-preserving sequential publishing of knowledge graphs[C]//2021 IEEE 37th International Conference on Data Engineering (ICDE),2021.

120
CHEN M,ZHANG W,YUAN Z,et al. FedE:Embedding knowledge graphs in federated setting[C]//Proceedings of the 10th International Joint Conference on Knowledge Graphs. 2021:80-88.

121
HAN X, DELL’AGLIO D, GRUBENMANN, T, et al. A framework for differentially private knowledge graph embeddings[J]. Journal of Web Semantics, 2022, 72, 100696.

DOI

122
THOUVENOT M,CALVEZ P,CURÉ O. Kgastor:A privacy by design knowledge graph anonymized store[C]//2022 IEEE International Conference on Trust,Security and Privacy in Computing and Communications (TrustCom),2022:670-679.

123
ZHANG K,WANG Y,WANG H,et al. Efficient federated learning on knowledge graphs via privacy-preserving relation embedding aggregation[EB]. arxiv preprint arxiv:2203.09553,2022.

124
HU Y,LIANG W,WU R,et al. Quantifying and defending against privacy threats on federated knowledge graph embedding[C]//Proceedings of the ACM Web Conference 2023,2023:2306-2317.

125
CHEN X,BAO J,ZHOU P,et al. Hierarchical privacy-preserved knowledge graph[C]//In 2023 IEEE 43rd International Conference on Distributed Computing Systems (ICDCS),2023:1-2.

126
HOANG A T,LEKSSAYS A,CARMINATI B,et al. Privacy-preserving decentralized learning of knowledge graph embeddings[C]//In EDBT/ICDT Workshops,2023.

127
PENG H,LI H,SONG Y,et al. Differentially private federated knowledge graphs embedding[C]// Proceedings of the 30th ACM International Conference on Information & Knowledge Management. 2021:1416-1425.

128
WANG L E, QI Y, BAI Y, et al. MuKGB-CRS: Guarantee privacy and authenticity of cross-domain recommendation via multi-feature knowledge graph integrated blockchain[J]. Information Sciences, 2023, 638, 118915.

DOI

129
LIU J, SHANG L, SU Y, et al. Privacy-preserving multi-source cross-domain recommendation based on knowledge graph[J]. ACM Transactions on Multimedia Computing, Communications and Applications, 2024, 20 (5): 1- 18.

130
CUI H,TRIMANANDA R,MARKOPOULOU A,et al. PoliGraph:Automated privacy policy analysis using knowledge graphs[C]//32nd USENIX Security Symposium (USENIX Security 23),2023:1037-1054.

Outlines

/