Quality assessment of cyber threat intelligence: a key factor for network defense systems

  • Xiang Xiayu , 1 ,
  • Zhou Huchen 1 ,
  • Zhou Ke 1 ,
  • Gu Zhaoquan , 1, 2, *
Expand
  • 1. Department of New Networks Pengcheng Laboratory, Shenzhen 518000, China
  • 2. Institute of Cyberspace Security, Harbin Institute of Technology (Shenzhen), Shenzhen 518000, China

Received date: 2025-04-15

  Online published: 2026-06-17

Copyright

Copyright ©2026 Journal of Aeronautical Materials. All rights reserved.

Abstract

As networked information systems are increasingly deployed in critical infrastructures, network defense systems face pervasive challenges of massive alerts, high noise, and weak correlation, which undermines the timely identification and response to real attacks. Cyber threat intelligence (CTI) can assist in reducing the mean time to detect (MTTD) and the mean time to respond (MTTR) by providing threat indicators and contextual information, thereby supporting alert triage and decision-making. However, in practice, CTI is heterogeneous in origin and uneven in quality, and its opaque production and delivery processes make its trustworthiness and usability difficult to guarantee. This paper systematically combs representative academic research results and industry practices on CTI quality evaluation in recent years. We organize existing work along two primary dimensions—source evaluation and content evaluation—and summarize the evaluation objectives into three core facets: correctness, timeliness, and utility. Based on this synthesis, we summarize the implications of existing evaluation methods for industrial-level intelligence selection, integration, and operation, identify the limitations of current evaluation work in verifiability, applicability, and operability, and outline future research directions oriented to real-world defense needs. Our review provides a structured reference for constructing scientific and practical CTI quality assessment systems, so as to support network defense systems in improving their alert handling and risk response capabilities.

Cite this article

Xiang Xiayu , Zhou Huchen , Zhou Ke , Gu Zhaoquan . Quality assessment of cyber threat intelligence: a key factor for network defense systems[J]. Journal of Cybersecurity, 2026 . DOI: 10.20172/j.issn.2097-3136.260535

0 引言

随着信息技术的迅速发展,网络信息系统已广泛应用于能源、通信、交通、政务等关键信息基础设施(以下简称“关基”)领域,成为支撑国家经济运行与社会服务体系的重要基础。网络信息系统规模持续扩大、架构日益复杂,使其稳定性与安全性面临更高要求。一旦网络信息系统遭到破坏、失效或被恶意利用,可能造成业务中断与严重经济损失,甚至影响社会秩序与国家安全[1]。因此,构建健全、高效的网络防御体系已成为保障关基安全运行的关键措施[2]。在复杂多变的网络环境中,网络防御系统需要在海量数据流与快速演化的攻击手段的冲击下保持快速响应与动态适配能力,降低平均检测时间(MTTD)与平均响应时间(MTTR),以提升整体检测与处置效率。
网络防御系统产生的海量告警已成为安全运营的共性难题,大量缺乏实际威胁价值的告警信息不仅降低了响应效率,还易引发告警疲劳[3-4]。研究显示[5],安全运营中心(security operations center,SOC)分析人员每天需应对2.4万至13.4万条安全告警,但其中仅有约0.01%与真正成功的攻击事件相关,反映出现有体系在真实威胁识别、上下文关联及处置决策方面仍存在明显不足[6]。在此背景下,如何提升告警研判的确定性并优先处置高风险事件,成为网络防御系统能力演进的关键问题。
网络威胁情报(cyber threat intelligence,CTI,以下简称“威胁情报”)被认为是提升网络防御系统检测与响应效率的重要技术手段。威胁情报通过整合多源威胁指标、攻击行为特征与对手信息,为防御系统在攻击全生命周期内的感知、研判与响应提供支撑[7]。在外部防护阶段,基于威胁情报的入侵检测与恶意外联阻断能够识别已知攻击基础设施,并提前封禁潜在威胁[8];在内部识别阶段,威胁情报可提供对手的常见技术与行为模式,增强对横向移动等隐蔽攻击的识别能力;在事后狩猎与溯源阶段,威胁情报还可提供攻击意图、攻击链及关联组织等信息,支撑事件定性与响应策略的制定。由此可见,高质量威胁情报能够为告警提供关键上下文与风险依据,支持威胁优先级排序,从而提升整体检测与响应效率。
尽管威胁情报产业与产品服务近年来快速发展[9-10],但“情报质量难以保障”仍是制约其发挥实战效能的重要因素[11-16]。一方面,情报厂商往往缺乏对情报来源、采集渠道及加工流程的透明披露,用户难以评估其可信度与适用性[17];另一方面,信息密度低、结构不完整或缺乏上下文的情报,在传播与使用过程中可能对研判造成干扰,甚至影响预警响应的及时性。图1给出了威胁情报生命周期,其中情报治理与质量控制是连接情报获取与防御落地的关键环节。
图 1 威胁情报全生命周期

Fig.1 Typical life cycle of cyber threat intelligence

因此,建立科学可执行的威胁情报质量评估机制尤为重要。本文将情报质量评估的核心目标归纳为“对不对、快不快、好不好”3个方面:其一,“对不对”关注情报是否准确反映真实威胁且可被验证,是避免误报与漏报的基础;其二,“快不快”关注情报能否在关键时间窗口内发挥作用,直接影响防御系统的响应速度与处置效率;其三,“好不好”关注情报的信息密度与上下文价值,决定其能否支撑进一步的关联分析、研判与溯源。
综上所述,在以威胁情报支撑网络防御的体系中,建立科学合理的质量评估机制是提升威胁处置能力的重要前提。因此,本文在系统调研基础上,梳理工业界利用威胁情报提升防御效能的典型实践,并从情报源与情报内容两个维度总结学术界在评估指标设计、方法构建与应用验证方面的研究进展,旨在为情报使用方与评估方提供可参考的决策依据,促进工业应用与学术研究的有效衔接。
本文主要贡献如下:
1)系统梳理威胁情报在增强网络防御系统能力方面的典型应用实践,归纳其在检测、响应与决策支持中的关键作用;
2)围绕威胁情报质量评估关键技术,从情报源与情报内容两个核心维度出发,总结代表性研究成果并提炼可复用的分析框架,为构建系统化评估体系提供依据;
3)分析现有评估方法在可验证性、适用性与可操作性方面的局限性,凝练该领域面临的主要挑战,并提出面向实战需求的研究建议与发展方向。

1 工业界威胁情报应用实践综述

本节从工业视角出发,系统梳理威胁情报在实际网络防御体系中的关键实践。随着网络攻击手段日益复杂,威胁情报已成为提升检测精度、响应效率与态势研判能力的重要支撑,体现了当前安全运营体系向实战化演进的核心需求。为深入揭示其在复杂环境中的实际应用价值,本节首先回顾传统安全设备在防御体系中的作用与局限,继而探讨威胁情报在检测、封禁与分析等环节的补充能力,并进一步分析其在安全运营中心中的融合机制与应用场景,全面呈现工业界在威胁情报落地方面的技术路径与系统演进过程,为后续质量评估指标体系的理论构建提供现实基础与支撑。同时,情报落地效果也会受到平台架构与运营流程等因素影响,如接入与联动带来的性能与运维开销,以及多源情报在覆盖与标注层面可能存在的差异。本节将优先围绕威胁情报对防御能力的功能性赋能路径进行梳理,相关影响因素在后续小节结合评估目标进一步讨论。

1.1 传统网络防御系统的作用与局限

在早期的网络安全体系中,传统边界防御设备长期作为核心安全屏障,依赖静态规则匹配与特征识别机制,有效完成对已知威胁的告警与拦截,在抵御常规攻击中发挥了重要作用。然而,随着攻击技术的持续演进与网络环境的日益复杂,这类设备在适应性、检测粒度与威胁识别广度等方面逐渐暴露出局限性。为系统梳理其能力边界及现实困境,本节将按发展顺序依次介绍3类典型的传统防御系统:入侵防御系统(intrusion prevention system,IPS)、Web应用防火墙(Web application firewall,WAF)与下一代防火墙(next generation firewall,NGFW),并探讨它们在现代复杂威胁环境下的应用能力与功能缺口。

1.1.1 入侵防御系统

入侵防御系统是在入侵检测系统(intrusion detection system,IDS)基础上发展而来的一种主动防御设备,其核心功能依赖于深度包检测(deep packet inspection,DPI)技术,对网络流量进行逐包分析,并与攻击特征库进行实时匹配,从而识别并阻断已知攻击行为[18]。IPS可有效防御系统漏洞利用、恶意代码传播及违反协议规范的异常通信等典型威胁。例如,当攻击者尝试通过漏洞利用工具向服务器发送恶意Shellcode,IPS可在数据包传输过程中完成特征识别并主动丢弃对应流量,从而防止攻击行为落地。
尽管IPS在识别已知威胁方面发挥了重要作用,但其检测能力仍存在明显局限。一方面,系统高度依赖静态特征规则,面对持续演化的攻击技术与快速增长的样本规模,特征库更新频率滞后,难以及时应对新型或变异攻击行为;另一方面,规则数量持续膨胀且质量参差不齐,易导致误报频发,误伤正常业务流量,从而影响系统的稳定性与可用性。在实际运维过程中,分析人员需投入大量精力验证告警的真实性,显著增加运营负担,降低防御体系的响应效率与实战可用性。

1.1.2 Web应用防火墙

Web应用防火墙是一类专门应对Web应用层攻击的安全防护设备,主要通过解析HTTP(hypertext transfer protocol)/HTTPS(hypertext transfer protocol secure)请求的结构与参数内容,实现对SQL(structured query language)注入、跨站脚本(cross-site scripting,XSS)、命令执行等典型攻击的拦截 [19]。WAF通常内置特征规则、异常行为模型与自定义策略库,能够对进入Web服务端的入站流量进行深度检测,识别自动化扫描、恶意下载注入及其他常见攻击行为,从而保护后端业务系统的稳定运行。
尽管WAF在应对Web层攻击方面具备良好效果,但其检测能力主要局限于HTTP协议的入站请求,对于非HTTP协议的攻击流量、加密通道中的恶意行为,以及攻击者与外部控制服务器之间的反向连接(如命令与控制通道(C2))通常缺乏有效识别能力。此外,随着攻击方式的持续演化,攻击者常利用编码变形、参数拼接等规避手段绕过静态规则匹配,导致WAF面临一定程度的误报与漏报风险,限制了其在复杂应用环境下的防护效果与可靠性。

1.1.3 下一代防火墙

下一代防火墙是在传统防火墙基础上演进而来的一类集成式边界安全防护设备,其融合了状态检测、防病毒引擎、应用识别与访问控制等多种安全功能[20]。NGFW不仅支持基于传输层规则的流量控制,还具备应用层协议解码与深度分析能力,能够识别具体业务应用,并基于应用特征实施细粒度的访问策略。通过集成入侵防御模块与实时威胁特征库,NGFW可对已知恶意行为、恶意URL(uniform resource locator)、异常通信模式等威胁进行快速检测与边界阻断,构建统一的边界安全防线。
尽管NGFW在功能集成与策略控制方面较传统防火墙实现了显著增强,但其部署位置通常仍位于网络边界的第4层,检测粒度与上下文感知能力有限,主要依赖端口封禁、IP黑名单与静态规则匹配机制,难以深入识别复杂业务流中的隐蔽攻击行为。在面对动态变种攻击、加密通信威胁及多阶段攻击链等复杂场景时,NGFW往往缺乏对通信内容、用户行为与应用状态的全面理解能力,难以实现对威胁行为的精准建模与主动拦截,从而限制了其在应对高级持续性威胁(advanced persistent threat, APT)等攻防场景下的适应性与实效性。

1.1.4 小结

IPS、WAF与NGFW等传统安全防护设备在各自防御层面具备一定能力,能够识别并拦截特定类型的已知攻击行为,长期作为网络边界与应用层的核心防线。然而,受限于静态规则驱动、协议范围限制及缺乏上下文理解等因素,这类设备在面对现代网络环境中高度动态、复杂的攻击时,逐渐暴露出响应迟滞、识别精度不足与误报频发等问题。尤其是在处理加密流量、横向移动及变异攻击等复杂场景中,传统防御系统往往难以实现深层关联分析与精准拦截,已难以支撑实战化安全运营对高效威胁感知与动态响应能力的持续要求。

1.2 威胁情报在防御系统中的价值

面对日益动态复杂的网络安全威胁,威胁情报作为提升网络防御系统智能化水平的关键技术,正逐步成为传统防御体系的重要支撑组件。依托持续更新的威胁指标、上下文丰富的攻击特征及多源情报的云端协同能力,CTI可有效弥补传统设备在识别广度、策略灵活性与响应效率方面的不足。其在提升威胁检测准确性、拓展边界覆盖范围与强化流量处置能力等方面展现出显著优势,可构建起“感知—覆盖—阻断”的完整防御闭环,为构建具备实战能力的防御体系奠定了基础。系统架构如图2所示。
图 2 威胁情报赋能网络防御系统架构

Fig.2 Threat intelligence empowering network defense systems architecture

相较于依赖本地特征库的入侵防御系统,威胁情报具备更强的动态更新与实时适配能力。通过与防御设备的深度融合,CTI支持基于双引擎(本地规则+云端情报)的威胁检测机制,显著提升识别广度与检测精度。一方面,情报平台可持续同步高质量威胁指标(如恶意IP、URL、Hash等),扩大检测覆盖面并提升匹配精度;另一方面,高级情报源还可关联0day攻击样本、APT行为模式等高阶威胁要素,实现对传统IPS难以识别的复杂攻击行为的早期发现与响应。CTI的引入不仅弥补了静态特征系统更新滞后的局限,也为检测系统提供了更强的适应性与前瞻性支撑。
传统Web应用防火墙主要聚焦于HTTP/HTTPS协议下的入站攻击识别,难以覆盖跨协议及出站方向的复杂威胁。而基于威胁情报的防御机制可突破协议边界限制,实现更广泛的攻击面感知与流量拦截。CTI能够实时识别并拦截C2服务器地址、恶意DNS请求、反向连接行为等关键风险指标,从而覆盖大量传统设备难以处理的出站风险。例如,在攻击者通过钓鱼页面感染主机并尝试建立回连通道的场景中,系统可借助威胁情报识别异常连接目标并提前阻断,有效切断潜在的数据泄露路径。
在流量控制与安全封禁方面,威胁情报系统可与NGFW等边界防护设备形成互补协同。情报引擎可对网络流量进行深度分析,快速识别异常行为,并联动防火墙组件实现高效拦截。相较于NGFW依赖基础规则和应用分类的封禁方式,CTI驱动机制支持更细粒度的风险判断与动态策略响应,尤其在处理新型IP资源、内容分发网络伪装与流量跳转等复杂场景中,具备更高的封禁准确率与效率。此外,高性能威胁情报平台还支持并行规则计算与批量封禁机制,显著提升系统在高并发条件下的实时处置能力。
因此,作为传统防御体系的重要能力补充,威胁情报在提升检测精度、拓展协议覆盖范围与强化流量封禁效率等方面展现出显著优势。其在工业界的广泛部署正加速推动网络防御系统由静态规则驱动向动态情报驱动转型,标志着安全能力体系向实时、精准与协同方向的演进趋势。

1.3 威胁情报在安全运营中心的实践

威胁情报在网络防御体系中的作用不断增强,其价值已逐步从边界防护延伸至安全运营中心的核心流程。作为组织安全能力运营的关键平台,安全运营中心在攻击识别、事件研判与响应决策等环节高度依赖威胁感知的准确性与上下文信息的完整性。将威胁情报系统深度嵌入SOC运行流程,已成为提升运营效率与威胁处置能力的重要方向,也是实现情报驱动型安全运营体系的核心路径[21]
首先,在威胁检测阶段,通过引入高质量的威胁指标与攻击行为特征,SOC能够在大量告警与日志信息中更高效地定位潜在风险事件,提升初始告警的准确性。例如,在面对海量入侵检测日志时,通过将原始告警与情报数据进行交叉验证,可快速识别出与真实攻击行为高度相关的高风险事件。
其次,在事件响应阶段,威胁情报通过提供攻击者画像、攻击链背景及行业上下文信息,有效支撑响应策略制定与自动化联动流程。情报系统可辅助分析人员快速评估攻击影响范围、关联历史事件、判定威胁等级,并结合溯源信息推动跨部门联动响应。与此同时,动态更新的情报还可与安全编排自动化响应(security orchestration, automation and response,SOAR)平台深度集成,实现针对不同威胁类型的自动化封禁、隔离与追踪操作。
最后,在态势感知与策略制定环节,威胁情报可持续支撑SOC获取行业攻击趋势、敌手活动轨迹与高风险资产画像,进而制定更具针对性的防护计划与威胁狩猎策略。通过集成战术模型(如MITRE ATT&CK[22])与上下游事件数据,情报还能作为日志建模、行为分析与检测规则设计的重要依据,为安全运营体系的能力演进与策略优化提供数据支撑与知识基础。
综上所述,工业界将威胁情报嵌入网络防御系统与SOC流程的核心诉求,并非“接入更多情报”,而是通过情报提升告警研判与处置决策的确定性与效率。其一,在检测与封禁环节需要降低误报与漏报,确保情报命中能够对应真实威胁且可被验证;其二,在运营响应环节需要缩短MTTD/MTTR,使情报能够及时驱动优先级排序与联动处置;其三,在分析研判环节需要更高的信息密度与上下文价值,使情报能够支撑关联分析、溯源与策略迭代。上述需求可以进一步抽象为“对不对、快不快、好不好”3类质量目标,分别对应准确性/可验证性、时效性/响应提前量以及信息质量/上下文丰富度。由此可见,工业实践提出了“如何衡量情报质量并指导使用”的问题,这也为后续学术界评估研究的指标体系设计与方法框架构建提供了明确牵引。下一节将围绕这一抽象目标,对学术界在情报源评估、情报内容评估及联合评估方面的研究进展进行系统梳理。

2 学术界威胁情报评估研究综述

在工业实践分析的基础上,可以看出威胁情报在真实防御流程中的价值主要体现在其能否提升检测准确性、响应时效与研判质量。相应地,威胁情报质量评估需要回答3个可操作的核心问题:情报是否“对得上”真实威胁并可被验证(对不对)、是否能在关键时间窗口内发挥作用(快不快)、以及是否具备足够的信息密度与上下文支撑后续研判(好不好)。围绕这一统一目标,学术界研究更侧重于将工业需求转化为可度量的指标体系与可复用的评估方法,为情报选型、融合与运营策略提供可解释依据。
为形成可对比、可归纳的分析框架,本文从两个互补维度组织相关研究:一是按评估对象划分为情报源评估、情报内容评估及源—内容联合评估;二是按方法范式划分为指标体系建模、源信任建模及数据驱动评估。前者回答“评估谁”,后者回答“怎么评估”,二者共同刻画了不同工作在指标选择、建模假设与验证路径上的差异与侧重。基于该框架,本文在后续小节中系统梳理代表性研究,并在表1中进一步总结其对工业界的启示,实现工业实践诉求与学术评估方法之间的对应与贯通。
表 1 威胁情报评估研究分类及其对工业界的启示

Table 1 Classification of threat intelligence evaluation studies and their implications for industry

研究内容 研究类型 代表工作 工业痛点 工业启示
威胁情报
源评估
指标体系建模 [23-25] 情报缺乏统一标准,供应商能力难比较 建立多维评价基线,支撑情报选型评估
源信任建模 [1726-29] 情报源质量波动, 长期可信度难维护 引入动态信任机制,持续维护高可信情报源
数据驱动评估 [30-32] 多源情报规模大, 人工筛选成本高 采用自动评分与排序,提升筛选效率
威胁情报
内容评估
指标体系建模 [33-34] 内容质量缺乏统一口径,结果难对齐 构建标准化指标体系,增强评估一致性
源信任建模 [35-37] 社区贡献质量不均,优质情报易被稀释 识别高价值节点,优化共享与治理机制
数据驱动评估 [38-39] 情报更新快,人工难以及时判断有效性 建立生命周期预测与动态更新机制
情报源与内容
综合评估
联合评估模型 [40-41] 单独评估来源或内容难反映整体价值 构建源—内容联合评估框架,支撑融合与运营决策

2.1 文献检索与分析流程

为提升综述结论的系统性与可追溯性,本文首先对威胁情报质量评估相关文献进行了较为全面的检索与梳理,并在此基础上重点聚焦近年来(2019—2026年)的代表性研究开展归纳分析。检索覆盖主流学术检索与出版平台(如Google Scholar、IEEE Xplore、ACM Digital Library、SpringerLink、Elsevier ScienceDirect等),并结合部分公开技术报告与工业实践材料作为补充。检索结果以同行评议论文为主,技术报告与工业材料仅用于补充背景与实践语境。关键词围绕“Cyber Threat Intelligence/CTI”“quality assessment/evaluation”“indicator/metric”“timeliness/accuracy/completeness”“source trustworthiness”“IoC scoring/ranking”等进行组合查询,以尽可能覆盖情报源评估、情报内容评估及联合评估相关工作。
文献纳入标准为:①研究对象与威胁情报质量评估直接相关,明确讨论评估指标、评估框架或可执行的评分与排序机制;②提供可复用的方法描述,或给出可验证的实验及案例分析;③与安全运营或防御应用场景具有明确关联。排除标准为:①仅讨论情报共享协议或平台架构,但未涉及质量评估指标与方法;②仅将威胁情报作为检测与分类输入,而不研究评估问题;③缺乏必要方法细节,难以形成可比较的评估口径。
在分析流程上,本文采用“两维分类+指标抽取”的统一编码方式:首先按评估对象将研究划分为情报源评估、情报内容评估及源—内容联合评估;其次按方法范式归纳为指标体系建模、源信任建模及数据驱动评估。随后,围绕“对不对、快不快、好不好”3类质量目标,从每篇文献中抽取其显式或隐式采用的关键指标并进行汇总统计,形成图3所示的指标矩阵与表1所示的研究分类及其对工业界的启示。
图 3 威胁情报评估指标矩阵

Fig.3 Threat intelligence evaluation indicator matrix

2.2 威胁情报源评估

情报源评估关注“情报从哪里来、是否值得信任以及应如何使用”的问题,其核心在于刻画不同情报源在覆盖面、更新速度、准确性及可用性等方面的差异,并据此支撑工业界的情报选型、订阅组合与动态白名单管理。现有研究通常从3条技术路径展开:其一,构建多维度指标体系,对情报源的覆盖度、时效性、误报率与一致性等进行量化对比,形成可解释的综合评分;其二,基于情报源之间的重叠、复用及传播时序等关系建模源可信度,支持动态排序与异常源识别;其三,引入数据驱动方法,利用元数据特征、内容语义表示或历史验证信号学习情报源的相关性与价值,提升评估自动化程度与运营效率。下文将按上述分类对代表性工作进行梳理,并结合其验证口径与适用边界讨论其对工业部署的启示。
Li等[23]提出了一种面向用户视角的威胁情报综合评估架构,旨在通过量化指标系统评估威胁情报服务的多维度表现。该研究从用户实际需求出发,设计了一个包括价格(price)、质量(quality)、服务(service)及声誉(reputation)等维度的评估指标体系,针对单一项目及综合能力的威胁情报服务进行量化评估。在实验验证过程中,进一步提出了覆盖度(coverage)等作为关键输出指标,用于评估情报服务在支持广度与区分能力方面的实效性。
Schaberreiter等[24]提出了一种基于封闭世界假设的情报源信任度量模型,构建了一个涵盖10个维度的评估指标体系,包括可拓展性(extensiveness)、误报率(false positives)、完整性(completeness)等,并结合STIX(structured threat information expression)2.x结构实现自动化提取。该方法支持情报源间的横向对比和动态评分更新,不依赖训练集,适用于大规模情报生态下的可信排序问题。
Chen等[25]提出了一种基于OpenCTI平台的威胁情报优化方法,旨在通过聚合多源威胁情报并应用启发式分析优化IoC评分。该方法结合STIX图模型及多个关键指标,包括相关性(relevance)、时效性(timeliness)、准确性(accuracy)、完整性及一致性(consistency),通过优化IoC的信心评分,提高了威胁评估的精确度。
源信任建模类研究聚焦于情报源之间关系的建模,强调源间的交互、行为相似性及可信度的动态排序。这类研究不仅关注情报源自身的质量评估,还试图通过多维度建模方式揭示不同情报源之间的相互作用及可信度变化。该方法的核心是通过动态调整与评分机制,为情报源提供实时可信度评估,帮助安全分析人员在多源情报中识别可靠情报源并优化信息流通。
FeedRank[26]是一项具有代表性的多维质量评分研究方法,旨在从信息内容的结构性出发,构建一个稳定且抗篡改的情报源评分机制。该方法定义了3个关键评估维度:完整性、准确性及速度,并通过构建情报源间的时间—空间关联图,捕捉不同源间的原创性与复用性特征。通过这种方式,FeedRank避免了简单依赖IoC体量或单一维度指标的局限性。综合考虑这3个维度后,FeedRank可有效对情报源进行排名,识别高质量情报源并及时排除虚假情报源,避免因情报源质量差异引发的误报和漏报问题。
Li等[27]提出了一套用于系统量化威胁情报数据源质量的指标体系,并基于多源实证数据开展评估分析。研究选取47个IP地址情报源及8个恶意文件哈希情报源作为评估对象,涵盖6类常见威胁类型,并通过横向比较与纵向时间序列分析方法,对各项指标进行系统测量与分析。研究结果表明,除了少数情报源外,大多数数据源之间缺乏交集,反映出不同监测基础设施在攻击面覆盖上的高度异构性。
Griffioen等[28]提出了一种用于评估开源威胁情报源有效性的方法框架,并从用户可用性及潜在风险两个维度分析其实际价值与应用影响。研究定义了4个核心评估指标,分别为:时效性、敏感性(sensitivity)、独创性(originality)与影响力(impact)。研究选取24个开源情报源作为评估对象,其中17个数据源覆盖14个月的时间窗口,另外7个数据源覆盖7个月,结合NetFlow流量数据与DNS区域传输数据,构建交叉验证机制开展定量分析。实验结果表明,许多IoC在被情报源收录前已活跃超过20天,体现出时效性方面的滞后性。此外,多个情报源存在明显的国家或区域偏向性,这影响了其整体的覆盖均衡性。
Bouwman等[17]对商用威胁情报服务的实际内容与质量开展实证评估,比较两家主流商业情报提供商的指标表现,并将其与4个主流开源情报源进行对比。评估指标主要集中于覆盖度(coverage)及时效性。研究结果显示,商业情报源间的重叠极小,与开源情报源几乎无交集;即使在跟踪同一批(共22个)威胁行为体的情况下,两家商业情报源间的IoC重叠率仅为2.5%~4.0%,且平均存在超过一个月的收录时延。此外,作者通过对14名安全专家的访谈,发现行业用户对情报质量的认知与学术界关注的量化指标存在偏差。具体而言,用户更关注情报在节省分析师时间及优化运营流程方面的价值,而非单纯的覆盖广度或数据体量。
Satvat等[29]提出了名为TIPCE的威胁情报平台评估方法,用于系统衡量主流威胁情报共享平台的覆盖能力与响应效率。研究构建了一个高质量的IoC评估数据集,来源于32个开源威胁情报报告,涵盖超过5万份报告文本,共提取超过182 000条IoC,包括哈希值、IP地址及恶意URL。基于该数据集,研究评估了4个平台(VirusTotal[42]、IBM X-Force Exchange[43]、HybridAnalysis[44]及AlienVault OTX[45])在多个维度上的表现,重点关注覆盖度、重合率(overlap)及响应时效(swiftness)等关键指标。实验结果表明,与传统情报订阅源相比,情报平台间在IoC内容上具有更高的交集,且平台响应速度差异显著,尤其在不同类型IoC的支持能力上存在明显差异。
数据驱动评估类研究聚焦于如何通过自动化评分机制评估情报源质量。这类研究通常依赖特征提取与机器学习模型,自动化评定情报源的使用价值,减少人工干预并提高评估效率。
Tundis等[30]提出了一种自动评估开源威胁情报(open source intelligence,OSINT)源相关性的方法,旨在支持情报收集阶段对情报源使用价值与重要性的判断。研究通过构建基于元数据特征及文本语义嵌入(word embedding)的特征体系,结合多种回归模型,预测OSINT源的相关性得分(relevance score),该得分作为情报筛选与验证优先级的依据。核心评估指标包括相关性及时效性,同时重点分析情报源可信度对验证效率的影响。研究数据来源主要集中于Twitter平台,并通过对网络安全专家及学术研究者的问卷调查,确定代表性OSINT账号作为评估对象。实验结果表明,该方法在减少情报验证等待时间方面表现突出,有助于提升威胁检测的提前量和整体响应效率。
Zhang等[31]提出了一种名为TIAM威胁情报自动评估模型的方法,旨在通过自动化手段评估高度稀疏的威胁情报。该模型通过特征提取对威胁情报进行自动分类,并定义了一套评估标准,量化情报的价值。TIAM还结合ATT&CK框架,将识别到的IoC与攻击技术相关联,为威胁情报提供更精准的分类及上下文信息。
Plaza等[32]提出了一种基于分析师视角的威胁情报解决方案评估方法,重点关注用户界面质量、程序化接口质量及数据质量这3个核心指标。研究通过比较3种商业威胁情报解决方案,并与免费选项对比,评估分析师在实际使用中可能面临的挑战。研究从现有研究中提炼相关标准,并结合详细的问题框架,为每个指标设计量化评分体系。

2.3 威胁情报内容评估

在威胁情报内容评估的研究中,学术界已建立较为成熟的评估框架,涵盖多个维度的量化分析。研究同样集中于三大方向:首先是多维度指标体系构建,旨在通过全面的评估维度对威胁情报进行精确量化;其次是信息源行为建模与可信度评价,通过对情报源行为的深入分析,评估其可信度及内容的可靠性;最后是数据驱动的自动化评分与预测方法,利用机器学习及特征提取技术实现对威胁情报的自动评分与预测。这些研究方向共同促进了威胁情报质量与实用性的全面评估。
González等[33]的研究属于指标体系建模类研究。该研究提出ETIP平台,旨在通过对来自多个来源的结构化威胁情报进行关联分析,增强现有威胁情报平台在数据导入、质量评估、可视化及信息共享方面的能力。ETIP平台结合静态及动态数据,对外部情报来源及监控基础设施进行综合分析,计算每个IoC的威胁评分(threat score, TS)。该评分基于启发式分析,结合多个权重指标,包括个别属性权重(如相关性、准确性及多样性)及全局权重(如完整性标准)。通过这些分析,ETIP平台可有效对安全事件进行优先排序,帮助安全运营中心分析人员优化分析过程并做出更高效的决策。
Schlette等[34]的研究同样属于指标体系建模类研究。该研究提出一套新的质量评估方法,聚焦于威胁情报内容的评估,为标准化的CTI数据格式提供量化的评估指标。研究提出的多层级数据质量评估体系,将输入数据划分为3个层次开展评估。在“属性层级”上,主要评估基于STIX对象的具体属性,例如通过修改时间及创建时间来衡量时效性;在“对象层级”上,通过表现一致性(representational consistency)或声誉评估对象本身;在“报告层级”上,提出一个新维度用于评估报告内容的数据量是否充足,以满足专家需求。进一步地,研究扩展现有CTI分析工具,使质量评估过程对安全分析师更加透明,分析师可通过交互式可视化界面参与其中。
Chandel等[35]的研究属于源信任建模类研究。该研究聚焦于威胁情报共享社区在信息质量评估中的作用机制,提出一种新的建模方法,综合考虑社区规模及成员组成。该方法首次将社区规模的定义从单纯的信息数量扩展为同时考虑共享情报数量及内部威胁潜在性的双重因素。而社区组成则以成员共享情报的质量为核心依据,强调低质量共享行为对整体社区效能的负面影响。这些维度构成一个可量化的评估体系,用于评估威胁情报社区的运行效能与共享价值。
Choo等[36]的研究属于源信任建模类研究。该研究系统分析了VirusTotal平台上多引擎URL扫描器对恶意URL的检测行为,提出一种基于扫描器行为建模的攻击类型分类方法。研究从多个维度评估情报内容的可解释性及可靠性,主要包括:检测专长(detection specialty)、稳定性、相关性及检测时序差异(lead/lag behavior)。通过分析来自VirusTotal平台30个月的大规模恶意URL报告,涵盖多种攻击类型(如恶意软件及钓鱼链接),研究发现不同扫描器在恶意URL识别及攻击类型分类上存在显著差异,导致情报使用者在判断恶意程度及采取响应措施时面临不确定性。为解决这一问题,作者设计了一种结合扫描器间行为特征的攻击类型分类器,能够在情报生成初期准确判断URL攻击类型,辅助后续情报聚合与应对策略选择。
Lin等[37]的研究属于源信任建模类研究。该研究提出了一种用于评估和增强威胁情报一致性的方法,重点解决了假阳性及假阴性的问题。研究通过比较CTI报告中的攻击信息与实际观察到的攻击行为,识别CTI中未涵盖的攻击类型,提出相应的增强策略。在评估过程中,研究首先列出各类攻击的特征规则,检查CTI中标记的恶意流量是否符合这些规则;同时,对报告中的恶意流量进行聚类,以便于观察和分析。增强阶段采用机器学习框架,通过识别与已知恶意流量相似的流量,预测其攻击类型及严重性,并据此更新CTI。
Kodituwakku等[38]的研究属于数据驱动评估类研究。该研究通过分析IoC发布的时间模式及其与漏洞的关联,提出一个基于数据驱动的评估框架。研究所用评估指标包括时效性及发布频率(publication rate)等,数据来源主要来自多个IoC提供商,并结合真实漏洞案例进行验证。实验结果表明,在漏洞公开初期,IoC发布较为稀疏,随着时间推移,出现发布激增现象,之后进入一个较慢的发布阶段。该研究的关键发现是:IoC发布具有波动性,且不同阶段的IoC发布速率反映了不同的威胁情报行为及攻击演化模式,强调定期更新威胁情报的必要性。
Sakellariou等[39]的研究属于数据驱动评估类研究。该研究提出一种量化评估威胁情报质量的系统方法,旨在通过相关性及加权完整性(weighted completeness)等指标,评估结构化及非结构化CTI产品的质量。研究首先分析当前CTI质量评估需求,指导后续定量评估方法开发。基于此,作者设计一套评估框架,结合文本相似度度量与加权方法,提出针对不同类型CTI数据的质量指标。为验证该方法的有效性,创建两个基准数据集,分别来自非结构化及结构化CTI产品,并通过实验演示所提方法的实际应用效果。实验结果表明,所提指标具有较高的可操作性及适用性,尤其在组织级别的CTI产品比较及选择上具有较大应用潜力,为CTI质量评估提供了有效工具。
近两年,围绕威胁情报内容质量的自动化评估研究进一步深化,研究重点由早期对单一质量指标的刻画,逐步转向面向结构化表示、多维质量建模及平台集成应用的综合评估框架。Venčkauskas等[41]提出一种面向结构化威胁情报数据的自动评估方法,针对以STIX 2.1表示的网络威胁情报数据,从情报内容质量层面进行区分建模,结合新的质量维度设计与可视化机制,提高评估过程的透明性及结果的可解释性。该研究表明,在结构化CTI场景下,质量评估已不再局限于完整性、时效性等基础指标,而是进一步强调多维属性间的协同刻画及自动化分析能力。
Chatziamanetoglou等[46]则基于MISP(Malware information sharing platform)数据模型,构建可量化的威胁情报质量指标体系,结合模糊层次分析与熵权法对指标进行加权处理,实现对情报质量的综合评估与优先级排序。相较于侧重理论建模的研究,该工作更加强调评估方法与情报平台运行机制间的结合,体现出质量评估结果向实际运营排序、处置决策及平台集成方向延伸的趋势。总体来看,最新相关研究更加重视评估指标的可计算性、权重配置的灵活性及评估结果对情报共享与运营流程的直接支撑。

2.4 情报源与内容综合评估

鉴于威胁情报的复杂性及多样性不断增加,单纯依赖情报源或情报内容的评估方法已不足以满足实际需求。越来越多的研究开始关注情报源与内容的综合评估,通过结合源的可信度及内容的质量,全面评价威胁情报的价值。
Wang等[40]提出一个动态的威胁情报质量评估机制(CTIC),旨在同时衡量情报源的可信度及情报内容的可用性。在情报源评估方面,作者构建基于情报源间交互关系的相关图(correlation graph)模型,设计迭代算法,量化评估每个情报源的质量。在情报内容评估方面,作者提出基于机器学习的方法,综合评估情报的可验证性(verifiability)、丰富性(richness)及时效性等多维属性。实验基于真实IoC数据进行验证,结果表明该机制在量化评估威胁情报整体质量方面具有良好的适用性及有效性。
Yang等[47]提出一种综合评估威胁情报质量的方法,涵盖情报源的可信度及情报内容的可用性。研究同样通过将CTI源间的交互关系建模为相关图,设计迭代算法,精确区分不同情报源的可信度。在情报内容评估方面,结合机器学习算法及多维度评估指标,自动化评估单个CTI内容的可用性(availability),包括时效性、完整性等属性。该方法综合考虑情报源的可信度及情报内容的可用性,提出一种全面的CTI质量评估框架,生成最终的CTI质量评分。实验结果表明,所提方法能够定量且有效地评估CTI质量,显著提升情报分类及质量评定的精度。
情报源评估与情报内容评估在实际应用中并非完全独立:一方面,情报源的可信度/信誉可作为内容评估与多源融合时的先验权重,支持冲突消解与优先级排序;另一方面,情报内容在本地防御环境中的可验证结果(如命中情况、误报/漏报、时延及上下文一致性)可反向作为证据,促进对情报源可信度的动态修正。因此,更符合实战需求的综合评估应体现为“源作为先验、内容验证作为反馈”的交互关系。不过,现阶段针对该类联合评估的系统研究仍相对有限,代表性成果主要集中于少量联合模型工作[46-47],后续仍需进一步探索可推广、可落地的动态闭环机制。

2.5 代表性研究差异与局限性

现有威胁情报质量评估工作虽可按“源评估/内容评估/联合评估”进行归类,但不同研究之间的差异不仅体现在指标名称与实现细节上,更体现在评估信号来源、验证口径、输出形态及适用场景等关键方面。部分工作侧重以结构化属性或启发式权重形成可解释评分,易落地但对权重设定及真值口径较敏感;部分工作从情报源间重叠、时序及复用关系推断可信度,适合源管理但在情报生态低交集/覆盖偏置时稳定性受限;也有研究引入嵌入表示或学习模型实现自动化评估,具备扩展性但依赖特征可得性与标注/弱监督信号,且存在跨组织迁移与可解释性挑战;联合评估研究尝试形成“源—内容”协同闭环,但代表性工作数量有限,动态反馈及冲突消解机制尚未形成统一可复现的评测口径。为便于直观比较,表2总结了代表性威胁情报质量评估研究的关键差异对比。
表 2 代表性威胁情报质量评估研究的关键差异对比

Table 2 Key differences of representative CTI quality assessment studies

代表工作 评估对象 评估依据 主要优势 局限
FeedRank[26] 情报源 完整性/准确性/速度;源间时间–空间关联图(原创性/复用性) 强调源间关系建模;支持动态源管理与异常源识别 依赖源间关联可观测;低交集/覆盖偏置生态下区分度与稳定性受限
TIAM[35] 情报内容 内容特征提取与自动分类;将 IoC 与 ATT&CK 技术关联以补足上下文 面向稀疏/碎片化情报的结构化与上下文增强;支持自动化评估 依赖特征/规则或模型设定;跨场景迁移与“真值”构建受数据条件约束
ETIP[37] 情报内容 多源聚合;启发式加权(相关性/准确性/多样性等)形成威胁评分 可解释、易落地;贴近 SOC 的“事件/IoC 优先级排序”需求 权重/阈值敏感;依赖平台数据与关联能力;跨研究可比性不足
Plaza[38] CTI报告 多层级结构化质量指标:属性层/对象层/报告层(时效性、表示一致性、声誉、数据量充足性等) 指标体系清晰;强调标准格式与评估透明性;便于工具化实现 更偏格式/数据质量度量;与真实攻击命中/防御收益的直接验证相对弱
CTIC[44] 源 + 内容 源相关图迭代评分(源可信);内容可用性评估(可验证性/丰富性/时效性等,含 ML) 体现“源可信→内容融合”的协同思路;形成联合评估框架雏形 联合评估代表性工作较少;动态反馈与冲突消解缺乏统一可复现评测口径
Yang等[47] 源 + 内容 源间交互相关图(源可信);内容可用性自动评估(时效性、完整性等)输出综合评分 将源可信与内容可用性统一到单一评分;便于工程集成与选型 对数据/验证口径依赖较强;跨组织迁移与横向对比复现仍受限

3 挑战与未来方向

表2可知,现有方法的主要瓶颈集中在可验证性、跨场景可比性及工程可操作性3个方面,以下进一步展开讨论并提出未来方向。
总体来看,图3系统梳理了近五年来威胁情报评估研究中涉及的核心指标,围绕“对不对”(准确性属性)、“快不快”(时效属性)及“好不好”(质量属性)3大维度,以及综合性评分方法,进行了统计与可视化展示。表1则总结了当前威胁情报评估研究的主要方法体系,归纳出以“指标体系建模”“源信任建模”“数据驱动评估”为代表的3类研究范式,分别针对情报源及情报内容的不同属性展开多维建模与分析。在此基础上,各类研究成果均提出了面向工业实践的具体启示,为情报服务的选型决策、共享机制优化及运营策略协同提供了理论支持及应用参考。
受篇幅限制,本文未能涵盖早期威胁情报评估领域的全部代表性工作[48-55],尤其是2019年之前关于情报建模、共享机制设计等方向的研究未被系统纳入。然而,这些早期研究在概念定义、基础框架构建及关键问题识别方面发挥了重要作用,为后续研究奠定了方法论基础,也在很大程度上推动了当前威胁情报评估体系的演化及完善。为保持综述主线聚焦,本文主要围绕近年来与质量评估直接相关的代表性研究进行归纳及对比;后续工作可进一步补充早期关键文献的时间线梳理与概念源流对照,增强对核心概念形成及演化路径的完整呈现。
此外,除专门针对威胁情报的数据质量评估研究外,许多通用领域的数据质量评估方法[56-67]也具有较强参考价值,尤其是在指标体系设计、评估维度抽象及自动化评分机制等方面,可为威胁情报质量建模提供启发。然而,通用数据质量方法多面向业务数据治理或信息系统管理场景,其评估对象、观测信号及验证机制与CTI(如IoC时效、可验证命中、对抗环境下的噪声及欺骗等)并不完全一致,直接迁移可能带来口径偏差。鉴于篇幅所限,本文未对这些非特定领域的数据质量评估工作进行系统整理,而是将其作为可借鉴的方法来源作概括性讨论。未来研究可在充分结合威胁情报的对抗性特征及实战需求基础上,探索通用数据质量理论的指标映射与方法迁移路径,推动跨领域评估方法的融合创新,提升评估体系的通用性及可扩展性。
综上所述,当前学术界在威胁情报质量评估方面已形成较为系统的研究体系,并在多个维度上为工业实践提供了有益启发。然而,面对日益复杂的攻击手段及多样化的情报使用场景,现有方法仍存在一定局限性。为进一步推动威胁情报质量评估的理论完善及实用性提升,本文从已有研究出发,归纳并提出未来亟须突破的几大关键方向。
方向1:构建以本地防御关联为导向的情报质量评估机制。威胁情报的价值评估不应仅停留在静态指标比对或抽象评分层面,而应紧密结合本地网络防御体系面临的实际威胁环境。高质量情报应能够对本地资产、业务系统或网络边界构成直接或潜在影响,从而具备可验证的“使用价值”。因此,情报质量的判断必须嵌入本地防御视角之中。例如,某一IoC虽在全球范围内具备较高的传播热度及可信评分,但若无法关联至本地任何历史告警、漏洞利用或攻击活动,其在实际防御策略中的效用则有限。在此背景下,构建以本地情境匹配为核心的评估机制成为关键方向。该机制不仅需具备本地威胁画像、攻击链映射及资产识别能力,还应引入情报上下文匹配、命中回溯分析、事件对齐等辅助指标。在实现路径上,可借助MITRE ATT&CK等战术技术框架对本地观测事件进行技术链路对齐,将IoC、告警证据及攻击技术进行统一映射,从而增强“情报—事件—攻击链”关联的可解释性及可验证性。通过建立“情报—资产—威胁”的联动映射关系,推动评估范式从“静态评分”向“动态可用”转型,有助于提升评估结果的可操作性及防御策略的针对性,为安全资源有限的组织提供更具性价比的情报筛选及响应决策支撑。
方向2:构建基于区域视角的威胁情报质量评估机制。在强化本地防御关联的基础上,威胁情报的质量评估还应拓展至更宏观的区域风险态势感知,关注与本地地理位置、网络空间边界及行业属性存在间接联系的外部威胁情境。区域视角下的情报质量评估强调,即便某一威胁尚未在本地网络中被直接观察或命中,其在同一城市、国家、自治系统及行业领域内的活跃频率及影响范围,也能显著提升其潜在预警价值及战略意义。例如,若某类攻击在本地同类机构及行业中频繁复现,即便当前组织暂未部署相关应用或暴露接口,该类情报仍应被优先关注并纳入追踪体系。基于此视角,区域质量评估应引入情报的“区域流行度”“邻域传播性”“跨域共现度”等上下文维度作为补充指标,用以衡量威胁在区域范围内的影响半径及演化潜力。通过将威胁情报与区域安全事件、行业攻击波动及邻近组织防御态势进行融合建模,有助于情报平台实现从“本地命中判断”向“区域风险感知”的评估延伸。在技术支撑层面,可探索以联邦学习[68]等隐私保护协作机制实现跨组织的联合建模与统计共享,在不直接暴露敏感日志及告警数据的前提下学习区域性威胁模式及传播趋势,从而提升区域视角下评估指标(如共现度、传播性)的可靠性及覆盖度。该机制不仅提升情报筛选及优先级排序的全面性,也为组织构建面向未来的情报预警系统及区域协同防御机制奠定了基础。
方向3:推动威胁情报质量评估由“功能验证”向“性能优化”的阶段式转变。当前威胁情报质量评估工作中,性能类指标如“快不快”“好不好”逐渐成为主流评估方向,但这在一定程度上掩盖了情报“是否准确”这一根本性问题。从本质上看,情报质量的首要前提应是“对不对”,即是否能够准确反映实际存在的威胁实体、攻击行为及IoC要素,具备基本的功能性价值。在缺乏可用性及真实性验证的情况下,任何关于时效性、丰富性及结构完整性的性能评估都可能偏离核心目标,甚至误导防御决策。因此,应将“对不对”作为情报质量的第一层评估要求,明确其在攻击识别、防御落地中的功能性作用,再在此基础上进一步引入性能维度,系统评估情报的传递速度、上下文完整性、冗余控制及格式兼容性等因素。在落地实现上,可借助知识图谱等[69]结构化表示,将IoC、攻击技术、资产、事件证据及其关联关系进行统一建模,使“功能验证”(可验证关联)及“性能优化”(上下文丰富度、一致性、可解释性)能够在同一数据结构上进行分层评估及迭代优化。
然而,现实中不少评估机制存在“重性能、轻功能”的偏向,忽视了对情报语义准确性、环境适配性及上下文约束的有效验证。这种失衡可能导致情报在高分评分下却难以落地使用的悖论现象。因此,未来的评估体系亟须构建“功能优先、性能递进”的分层评估框架,明确先验证“能用”、再优化“好用”的路径逻辑。通过此类机制,可有效提升情报质量评估的可解释性及实践导向,真正实现从技术指标比对走向防御价值验证的范式升级[70]
方向4:构建可复现的公开基准与统一评测协议,推动CTI评估方法的实证对比与可比性提升。现阶段威胁情报质量评估研究呈现出评估对象多样、数据来源异构及任务定义不统一等特征,不同方法往往依赖各自的平台数据、观测信号及标注口径开展验证,导致跨研究之间难以在同一条件下进行可复现的横向对比,进而限制了评估结论的可比性及工程选型的参考价值。因此,未来有必要推动建立面向CTI质量评估的公开基准与统一评测协议:一方面,构建覆盖多类型IoC及多源情报输入的基准数据集,并配套明确的时间标注、验证口径及“真值”构建策略(如基于本地观测、平台交叉验证及权威报告对齐);另一方面,制定统一的评测任务及指标计算规范,明确不同指标(准确性、时效性、丰富性/完整性、冲突一致性等)的可操作定义及可比性边界,同时提供标准化的数据处理及评测流程,降低复现实验门槛,推动研究从“个案验证”走向“可复现评测”,为工业界选型及运营策略优化提供更可信的量化依据,并进一步促进该领域评估体系向标准化、工程化方向演进。
方向5:面向大语言模型参与的情报工程,构建“可验证—可解释”的自动化质量评估与质量闸门。随着大语言模型(large language model,LLM)逐步被引入情报生产、加工及分发流程,情报质量评估面临新的对象及挑战。一方面,LLM在威胁实体抽取、关系识别、TTP(tactics,techniques and procedures)映射、摘要生成及结构化转换等任务中表现出较强的自动化潜力,能够提升非结构化报告向可计算情报对象转化的效率;相关研究表明,基于LLM的抽取及攻击图构建方法能够较好地支撑下游攻击重建及分析任务[71]。另一方面,最新研究也指出,LLM在真实规模报告上的表现仍存在稳定性不足、结果不一致及置信度失真等问题,在复杂场景下甚至未必优于传统方法[72]。这意味着,未来评估的重点不应仅停留在“是否生成了结果”,而应进一步转向“结果是否有证据支撑、是否可被本地验证、是否能够稳定服务于检测及响应决策”。
基于此,未来有必要围绕“LLM参与的CTI链路”构建相匹配的质量评估机制与工程化质量闸门。其一,将LLM定位为语义增强及候选生成工具,主要承担候选实体/关系抽取、字段补全、术语归一、攻击步骤归并及摘要生成等任务,但所有关键结论均需绑定原文证据、来源信息及外部知识依据,以保留可追溯链路。其二,建立“候选生成—证据校验—质量评分—反馈修正”的混合流程,将LLM输出与本地观测信号、跨源一致性、知识库匹配结果及历史命中反馈进行对齐,通过规则、统计及模型联合校验实现自动过滤及置信度修正。其三,在指标层面,可在现有准确性、时效性及信息质量之外,引入面向生成式情报的新维度,如可追溯性、事实一致性、证据覆盖度及输出稳定性,并形成可解释的综合评分。其四,可结合统一评测协议,将LLM生成或加工的情报纳入可复现基准测试,系统比较不同模型、不同提示策略及不同校验机制下的质量差异,从而为模型选型、流程设计及质量闸门配置提供依据。通过上述机制,可在提升情报工程自动化效率的同时,将生成式方法带来的不确定性纳入可度量、可约束、可审计的质量治理框架,推动CTI质量评估从面向静态结果的指标分析,进一步走向面向新型生产链路的闭环治理。

4 结束语

本文围绕“如何评估威胁情报质量以更好服务网络防御系统”这一核心问题,系统回顾了近五年来具有代表性的研究成果,构建了以“指标体系建模”“源信任建模”“数据驱动评估”为主轴的研究框架,覆盖情报源评估、情报内容评估及二者联合评估3大方向。在此基础上,总结出当前研究在“对不对”“快不快”“好不好”3类核心指标维度上的演化趋势,并凝练出多项具有实践指导意义的工业启示。
本文进一步指出,威胁情报质量评估的未来发展应紧密围绕网络防御体系的实战需求展开。其一,评估应以本地防御视角为出发点,重点关注情报是否能够与本地资产、告警及攻击活动形成可验证关联,从而体现真实的使用价值;其二,评估体系需拓展至区域/行业风险视角,面向潜在威胁扩散及邻域共现趋势提供提前量及战略预警价值;其三,应厘清“功能性”及“性能性”的评估层次关系,优先保障情报能够准确对齐真实威胁并可落地使用(功能性),再在此基础上评估时效、丰富性及一致性等性能维度,避免“重性能、轻功能”的评估失衡。此外,鉴于现有方法在评估对象、数据来源及任务口径上的差异,未来亟须推动公开基准与统一评测协议建设,以提升跨研究对比的可复现性及可比性,为方法演进及工业选型提供更直观的量化依据。与此同时,随着LLM逐步进入情报生产及加工链路,未来需面向LLM参与的情报工程建立可验证、可解释的质量闸门及混合评估流程,将生成式能力带来的效率增益纳入可度量、可约束的评估框架。
综上所述,威胁情报质量评估并非孤立的静态指标构建问题,而应成为支撑动态化、智能化网络防御体系建设的关键机制。未来研究应进一步强化情报评估机制与防御实践之间的协同关系,通过评估引导情报筛选策略、以情报驱动防御决策实现落地应用,最终实现安全资源的高效配置及整体威胁响应能力的持续跃升。
1
方滨兴. 定义网络空间安全[J]. 网络与信息安全学报, 2018, 4 (1): 1- 5.

DOI

Fang B X. Define cyberspace security[J]. Chinese Journal of Network and Information Security, 2018, 4 (1): 1- 5.

DOI

2
贾焰, 方滨兴, 李爱平, 等. 基于人工智能的网络空间安全防御战略研究[J]. 中国工程科学, 2021, 23 (3): 98- 105.

Jia Y, Fang B X, Li A P, et al. Artificial intelligence enabled cyberspace security defense[J]. Strategic Study of CAE, 2021, 23 (3): 98- 105.

3
Alahmadi B A, Axon L, Martinovic I. 99% false positives: a qualitative study of {SOC} analysts' perspectives on security alarms[C]//31st USENIX Security Symposium (USENIX Security 22). 2022: 2783-2800.

4
Kokulu F B, Soneji A, Bao T, et al. Matched and mismatched SOCs: a qualitative study on security operations center issues[C]//Proceedings of the 2019 ACM SIGSAC Conference on Computer and Communications Security. New York: ACM, 2019: 1955-1970.

5
Yang L, Chen Z, Wang C, et al. True attacks, attack attempts, or benign triggers? an empirical measurement of network alerts in a security operations center[C]//33rd USENIX Security Symposium (USENIX Security 24). 2024: 1525-1542.

6
Fu C P, Li Q, Xu K, et al. Point cloud analysis for ML-based malicious traffic detection: reducing majorities of false positive alarms[C]//Proceedings of the 2023 ACM SIGSAC Conference on Computer and Communications Security. New York: ACM, 2023: 1005-1019.

7
向夏雨, 顾钊铨, 曾丽仪. 网络威胁情报共享与融合技术综述[J]. 网络空间安全科学学报, 2024, 2 (2): 2- 17.

DOI

Xiang X Y, Gu Z Q, Zeng L Y. A survey of cyber threat intelligence sharing and fusion technologies[J]. Journal of Cybersecurity, 2024, 2 (2): 2- 17.

DOI

8
Xiang X Y, Liu H, Zeng L Y, et al. IPAttributor: cyber attacker attribution with threat intelligence-enriched intrusion data[J]. Mathematics, 2024, 12(9): 1364.

9
Fortune Business Insights. Threat intelligence market [EB/OL]. (2025-03-17) [2025-11-12]. https://www.fortunebusinessinsights.com/zh/threat-intelligence-market-102984.

10
Recorded Future. 2024 state of threat intelligence [EB/OL]. (2025-02-11) [2025-11-12]. https://go.recordedfuture.com/hubfs/2024%20State%20of%20Threat%20Intelligence/Recorded%20Future%202024%20State%20of%20Threat%20Intelligence%20Report.pdf?hsLang=en.

11
Sinha S, Bailey M, Jahanian F. Shades of grey: on the effectiveness of reputation-based “blacklists” [C]//2008 3rd International Conference on Malicious and Unwanted Software (MALWARE). IEEE, 2008: 57-64.

12
Sheng S, Wardman B, Warner G, et al. An empirical analysis of phishing blacklists[C]//In Sixth Conference on Email and Anti-Spam (CEAS). IEEE, 2009: 23-31.

13
Kührer M, Rossow C, Holz T. Paint it black: evaluating the effectiveness of malware blacklists[M]//Research in Attacks, Intrusions and Defenses. Cham: Springer International Publishing, 2014: 1-21.

14
Oest A, Safaei Y, Doupe A, et al. PhishFarm: a scalable framework for measuring the effectiveness of evasion techniques against browser phishing blacklists[C]//Proceedings of the 2019 IEEE Symposium on Security and Privacy (SP). Piscataway: IEEE Press, 2019: 1344-1361.

15
Ramachandran A, Feamster N, Vempala S. Filtering spam with behavioral blacklisting[C]//Proceedings of the 14th ACM Conference on Computer and Communications Security. New York: ACM, 2007: 342-351.

16
Tounsi W, Rais H. A survey on technical threat intelligence in the age of sophisticated cyber attacks[J]. Computers & Security, 2018, 72, 212- 233.

DOI

17
Bouwman X, Griffioen H, Egbers J, et al. A different cup of {TI}? the added value of commercial threat intelligence[C]//29th USENIX security symposium (USENIX security 20). 2020: 433-450.

18
Wang Z J, Li X B. Intrusion prevention system design[M]//Proceedings of the International Conference on Information Engineering and Applications (IEA) 2012. London Springer, 2013: 375-382.

19
Clincy V, Shahriar H. Web application firewall: network security models and configuration[C]//Proceedings of the 2018 IEEE 42nd Annual Computer Software and Applications Conference (COMPSAC). Piscataway: IEEE Press, 2018: 835-836.

20
Neupane K, Haddad R, Chen L. Next generation firewall for network security: a survey[C]//Proceedings of the SoutheastCon 2018. Piscataway: IEEE Press, 2018: 1-6

21
Yang W Z, Lam K Y. Automated cyber threat intelligence reports classification for early warning of cyber attacks in next generation SOC[C]//Information and Communications Security. Cham: Springer, 2020: 145-164.

22
MITRE, MITRE ATT&CK [DB/OL]. [2025-11-12]. https://attack.mitre.org/.

23
Li Q, Jiang Z W, Yang Z M, et al. A quality evaluation method of cyber threat intelligence in user perspective[C]//Proceedings of the 2018 17th IEEE International Conference on Trust, Security and Privacy in Computing and Communications/ 12th IEEE International Conference on Big Data Science and Engineering (TrustCom/BigDataSE). Piscataway: IEEE Press, 2018: 269-276.

24
Schaberreiter T, Kupfersberger V, Rantos K, et al. A quantitative evaluation of trust in the quality of cyber threat intelligence sources[C]//Proceedings of the 14th International Conference on Availability, Reliability and Security. New York: ACM, 2019: 1-10.

25
Chen S S, Hwang R H, Ali A, et al. Improving quality of indicators of compromise using STIX graphs[J]. Computers & Security, 2024, 144, 103972.

DOI

26
Meier R, Scherrer C, Gugelmann D, et al. FeedRank: a tamper- resistant method for the ranking of cyber threat intelligence feeds[C]//Proceedings of the 2018 10th International Conference on Cyber Conflict (CyCon). Piscataway: IEEE Press, 2018: 321-344.

27
Li V G, Dunn M, Pearce P, et al. Reading the tea leaves: a comparative analysis of threat intelligence[C]//28th USENIX security symposium (USENIX Security 19). 2019: 851-867.

28
Griffioen H, Booij T, Doerr C. Quality evaluation of cyber threat intelligence feeds[M]//Applied Cryptography and Network Security. Cham: Springer International Publishing, 2020: 277-296.

29
Satvat K, Gjomemo R, Venkatakrishnan V N. TIPCE: a longitudinal threat intelligence platform comprehensiveness analysis[C]//Proceedings of the Fourteenth ACM Conference on Data and Application Security and Privacy. New York: ACM, 2024: 349-360.

30
Tundis A, Ruppert S, Mühlhäuser M. A feature-driven method for automating the assessment of OSINT cyber threat sources[J]. Computers & Security, 2022, 113, 102576.

DOI

31
Zhang S Q, Chen P, Bai G Y, et al. An automatic assessment method of cyber threat intelligence combined with ATT&CK matrix[J]. Wireless Communications and Mobile Computing, 2022, 7875910.

DOI

32
Plaza A, Hayajneh T. Defining metrics for comparing threat intelligence solutions through the lens of the analyst[C]//Proceedings of the 2023 IEEE 14th Annual Ubiquitous Computing, Electronics & Mobile Communication Conference (UEMCON). Piscataway: IEEE Press, 2023: 192-199.

33
González G G, Faiella M, Medeiros I, et al. ETIP: an enriched threat intelligence platform for improving OSINT correlation, analysis, visualization and sharing capabilities[J]. Journal of Information Security and Applications, 2021, 58, 102715.

DOI

34
Schlette D, Böhm F, Caselli M, et al. Measuring and visualizing cyber threat intelligence quality[J]. International Journal of Information Security, 2021, 20 (1): 21- 38.

DOI

35
Chandel S, Yan M D, Chen S J, et al. Threat intelligence sharing community: a countermeasure against advanced persistent threat[C]//Proceedings of the 2019 IEEE Conference on Multimedia Information Processing and Retrieval (MIPR). Piscataway: IEEE Press, 2019: 353-359

36
Choo E, Nabeel M, Kim D, et al. A large scale study and classification of VirusTotal reports on phishing and malware URLs[J]. Proceedings of the ACM on Measurement and Analysis of Computing Systems, 2023, 7 (3): 1- 26.

DOI

37
Lin P C, Hsu W H, Lin Y D, et al. Correlation of cyber threat intelligence with sightings for intelligence assessment and augmentation[J]. Computer Networks, 2023, 228, 109736.

DOI

38
Kodituwakku A, Xu C, Rogers D, et al. Temporal aspects of cyber threat intelligence[C]//Proceedings of the 2023 IEEE International Conference on Big Data. Piscataway: IEEE Press, 2023: 6207-6211.

39
Sakellariou G, Fouliras P, Mavridis I. A methodology for developing & assessing CTI quality metrics[J]. IEEE Access, 2024, 12, 6225- 6238.

DOI

40
Wang M H, Yang L B, Lou W. A comprehensive dynamic quality assessment method for cyber threat intelligence[C]//Proceedings of the 2022 52nd Annual IEEE/IFIP International Conference on Dependable Systems and Networks Workshops (DSN-W). Piscataway: IEEE Press, 2022: 178-181.

41
Venčkauskas A, Jusas V, Barisas D. Quality dimensions for automatic assessment of structured cyber threat intelligence data[J]. Applied Sciences, 2025, 15 (8): 4327.

DOI

42
VirusTotal [DB/OL]. [2025-11-12]. https://www.virustotal.com/gui/home/.

43
IBM X-Force exchange[DB/OL]. [2025-11-12]. https://exchange.xforce.ibmcloud.com/.

44
Hybrid analysis[DB/OL]. [2025-11-12]. https://www.hybrid-analysis.com/.

45
AlientVault OTX[DB/OL]. [2025-11-12]. https://otx.alienvault.com/.

46
Chatziamanetoglou D, Rantos K. Weighted quality criteria for cyber threat intelligence: assessment and prioritisation in the MISP data model[J]. International Journal of Information Security, 2025, 24 (4): 160.

DOI

47
Yang L B, Wang M H, Lou W. An automated dynamic quality assessment method for cyber threat intelligence[J]. Computers & Security, 2025, 148: 104079.

48
Mohaisen A, Al-Ibrahim O, Kamhoua C, et al. Assessing quality of contribution in information sharing for threat intelligence[C]//Proceedings of the 2017 IEEE Symposium on Privacy-Aware Computing (PAC). Piscataway: IEEE Press, 2017: 182-183.

49
Park J, Alasmary H, Al-Ibrahim O, et al. QOI: assessing participation in threat information sharing[C]//Proceedings of the 2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). Piscataway: IEEE Press, 2018: 6951-6955.

50
Rashid Z, Noor U, Altmann J. Network externalities in cybersecurity information sharing ecosystems[M]//Economics of Grids, Clouds, Systems, and Services. Cham: Springer International Publishing, 2019: 116-125.

51
Azevedo R, Medeiros I, Bessani A. PURE: generating quality threat intelligence by clustering and correlating OSINT[C]//2019 18th IEEE International Conference on Trust, Security and privacy in computing and Communications/13th IEEE International Conference on Big Data Science and Engineering (TrustCom/BigDataSE). IEEE, 2019: 483-490.

52
Wagner T D, Mahbub K, Palomar E, et al. Cyber threat intelligence sharing: survey and research directions[J]. Computers & Security, 2019, 87, 101589.

DOI

53
Sillaber C, Sauerwein C, Mussmann A, et al. Data quality challenges and future research directions in threat intelligence sharing practice[C]//Proceedings of the 2016 ACM on Workshop on Information Sharing and Collaborative Security. New York: ACM, 2016: 65-70.

54
Li L, Li X Y, Gao Y L. MTIV: a trustworthiness determination approach for threat intelligence[M]//Security, Privacy, and Anonymity in Computation, Communication, and Storage. Cham: Springer International Publishing, 2017: 5-14.

55
Wagner T D, Palomar E, Mahbub K, et al. Relevance filtering for shared cyber threat intelligence[M]//Information Security Practice and Experience. Cham: Springer International Publishing, 2017: 576-586.

56
Montesdioca G P Z, Maçada A C G. Quality dimensions of the DeLone-McLean model to measure user satisfaction: an empirical test on the information security context[C]//Proceedings of the 2015 48th Hawaii International Conference on System Sciences. Piscataway: IEEE Press, 2015: 5010-5019.

57
Talha M, Abou E K, Elmarzouqi N. Big data: trade-off between data quality and data security[J]. Procedia Computer Science, 2019, 151, 916- 922.

DOI

58
Shamala P, Ahmad R, Zolait A, et al. Integrating information quality dimensions into information security risk management (ISRM)[J]. Journal of Information Security and Applications, 2017, 36, 1- 10.

DOI

59
Sicari S, Rizzardi A, Miorandi D, et al. Security policy enforcement for networked smart objects[J]. Computer Networks, 2016, 108, 133- 147.

DOI

60
Sillaber C, Mussmann A, Breu R. Experience: data and information quality challenges in governance, risk, and compliance management[J]. Journal of Data and Information Quality, 2019, 11 (2): 1- 14.

61
Sillaber C, Breu R. Using stakeholder knowledge for data quality assessment in IS security risk management processes[C]//Proceedings of the 2015 ACM SIGMIS Conference on Computers and People Research. New York: ACM, 2015: 153-159.

62
Bertino E, Abu Jabal A, Calo S, et al. The challenge of access control policies quality[J]. Journal of Data and Information Quality, 2018, 10 (2): 1- 6.

63
Grispos G, Glisson W B, Storer T. How good is your data? investigating the quality of data generated during security incident response investigations[PP/OL]. V1. arXiv (2019-01-11) [2025-11-12]. https://doi.org/10.48550/arXiv.1901.03723

64
Reda O, Benabdellah N C, Zellou A. A systematic literature review on data quality assessment[J]. Bulletin of Electrical Engineering and Informatics, 2023, 12(6).

65
Kohlrausch J, Brin E A. ARIMA supplemented security metrics for quality assurance and situational awareness[J]. Digital Threats: Research and Practice, 2020, 1 (1): 1- 21.

DOI

66
Haug A. Understanding the differences across data quality classifications: a literature review and guidelines for future research[J]. Industrial Management & Data Systems, 2021, 121 (12): 2651- 2671.

DOI

67
Ehrlinger L, Wöß W. A survey of data quality measurement and monitoring tools[J]. Frontiers in Big Data, 2022, 5, 850611.

DOI

68
Sarhan M, Layeghy S, Moustafa N, et al. Cyber threat intelligence sharing scheme based on federated learning for network intrusion detection[J]. Journal of Network and Systems Management, 2023, 31, 3.

DOI

69
Li Z Y, Zeng J, Chen Y, et al. AttacKG: constructing technique knowledge graph from cyber threat intelligence reports[C]//Computer Security – ESORICS 2022. Cham: Springer, 2022: 589-609

70
白敏, 汪列军. 利用威胁情报构建主动安全关联分析及运营框架[J]. 网络空间安全科学学报, 2025, 3 (5): 84- 101.

DOI

Bai M, Wang L J. Leveraging threat intelligence to construct a proactive security correlation analysis and operation framework[J]. Journal of Cybersecurity, 2025, 3 (5): 84- 101.

DOI

71
Krašovec A, Steri G, Karopoulos G, et al. Large language models for cyber threat intelligence: extracting MITRE with LLMs[M]//Availability, Reliability and Security. ChamSpringer Nature Switzerland2025: 80-89.

72
Büchel M, Albrecht M R, Payer M, et al. SoK: automated TTP extraction from CTI reports – are we there yet[C]//USENIX Security Symposium, 2025

Outlines

/