Special Topic on Security Evaluation of Network Information Systems

Towards an AI-driven adaptive framework for cybersecurity assessment

  • Ji Lijian 1 ,
  • Lin Weiwei , 2, * ,
  • Duan Chao 1 ,
  • He Tao 1 ,
  • Yu Cun 1
Expand
  • 1. GCTB-NSU Joint Institute of Technology at Guangzhou College of Technology and Business, Guangzhou 528138, China
  • 2. College of Computer Science & Engineering, South China University of Technology, Guangzhou 510006, China

Received date: 2025-10-31

  Online published: 2026-04-01

Copyright

Copyright ©2025 Journal of Aeronautical Materials. All rights reserved.

Abstract

Against the backdrop of an increasingly complex and dynamically evolving cyber threat landscape, traditional static and periodic cybersecurity assessment methods are no longer sufficient to address emerging challenges. An AI-driven adaptive cybersecurity assessment framework is proposed to realize the intellectualization, automation and continuity of the assessment process. The framework is constructed as a closed-loop system consisting of four layers: data perception, intelligent analysis, dynamic decision-making and feedback optimization. Its core innovation resides in the in-depth integration of artificial intelligence technologies, which involves applying Graph Neural Networks (GNN) for anomaly detection and threat hunting, adopting Deep Reinforcement Learning (DRL) to enable automated penetration testing and attack path planning, and incorporating Large Language Models (LLM) to achieve automated generation of analysis reports. Simulation experiments verify that the proposed framework exhibits remarkable advantages over traditional methods in the depth of vulnerability discovery, the speed of threat response and the accuracy of risk assessment. It can effectively improve the capability of proactive defense, and thus provide a feasible technical approach and practical reference for constructing a dynamic and adaptive next-generation cybersecurity system.

Cite this article

Ji Lijian , Lin Weiwei , Duan Chao , He Tao , Yu Cun . Towards an AI-driven adaptive framework for cybersecurity assessment[J]. Journal of Cybersecurity, 2025 , 3(5) : 61 -72 . DOI: 10.20172/j.issn.2097-3136.250506

0 引言

数字化转型的浪潮席卷全球,企业基础设施加速上云,边缘计算和物联网设备呈指数级增长。然而,这种高度的互联互通也带来了前所未有的安全挑战。根据IBM《2023年数据泄露成本报告》,全球数据泄露平均成本高达445万美元,创历史新高[1]。攻击技术日益复杂化,如供应链攻击、AI赋能的社交工程攻击和文件less攻击等新型威胁,使得依赖静态规则和特征库的传统安全防护与测评体系显得力不从心。
传统的网络安全测评(如周期性漏洞扫描和人工渗透测试)存在如下弱点:第一是“时间盲点”,测评结果仅代表某一时刻的安全状况,无法应对在测评间隔期发生的系统变更和新曝出的漏洞。第二是“认知局限”,高度依赖安全专家的个人经验和知识广度,难以全面模拟高级攻击者的复杂、多变的战术、技术和程序。第三是“信息孤岛”,漏洞扫描、日志分析和网络流量监控等工具各自为政,缺乏有效的关联分析,导致风险评估片面化。
在此背景下,Gartner倡导的“持续自适应风险与信任评估”理念已成为未来网络安全的核心范式。其核心是从静态的基于边界的防御,转向动态的以数据为中心、持续性的安全能力建设。人工智能,特别是机器学习、深度学习和强化学习,因其在模式识别、复杂决策和自动化方面的卓越能力,成为实现这一范式的关键技术驱动力。
因此,本文构建了AI驱动的自适应网络安全测评框架,该框架将AI技术与自适应安全理念深度耦合,为构建“智慧免疫”型安全体系提供了新的模型,同时,将安全测评从一项成本高昂的周期性任务,转变为一个低成本、高精度、7×24 h持续运行的核心安全能力,从而显著提升组织的威胁感知、风险控制和应急响应水平。
近年来,国内外学术界和工业界在AI安全领域取得了显著进展。
(1)国外研究现状
在威胁检测领域,研究从传统的机器学习模型转向更复杂的深度学习架构。例如,He等[2]提出了一种基于Transformer的网络入侵检测模型,能更好地捕捉长距离依赖关系,在CIC-IDS2017数据集上取得了99.2%的准确率。在自动化攻防领域,微软开源的CyberBattleSim环境为基于强化学习的网络攻防研究提供了标准实验平台[3]。Schneider等[4]在此基础上,利用多智能体深度强化学习来模拟复杂的协同攻击,展示了AI在发现未知攻击路径方面的潜力。在安全自动化方面,大语言模型(Large Language Model,LLM)开始被应用于安全运营。Risch等[5]使用微调的LLM来自动化分析安全警报并生成处置建议,有效降低了平均响应时间。产业界方面,诸如Darktrace的“Antigena”和CrowdStrike的“Charlotte AI”等产品,试图将AI从辅助分析工具提升为自主决策和响应的核心引擎。在AI安全领域,最新的研究表明,即便是先进的防御措施在面对精心设计的自适应攻击时也显得尤为脆弱。MLCommons官方发布的基准报告,系统量化了大语言模型在对抗性攻击下的“韧性差距”,明确指出主流LLM防御机制在自适应 jailbreak 攻击中的被绕过率超 85%[6]。这凸显了构建具备持续学习和动态响应能力的自适应安全框架的极端紧迫性。同时,行业评测基准(如MLCommons于2025年发布的Jailbreak Benchmark)开始致力于量化AI系统的“韧性差距”,为评估自适应安全能力提供了关键指标[7]
(2)国内研究现状
我国在“十四五”规划中明确将网络安全与人工智能列为重点发展方向,学术界在会议和期刊上发表了大量研究成果。例如,Zhang等[8]提出了一种基于图卷积网络(Graph Convolutional Network,GCN)的恶意软件家族分类方法,有效提升了分类精度。Wang等[9]设计了一种基于深度Q网络(Deep Q-Network,DQN)的Web应用渗透测试自动化模型,能够自主学习SQL(Structured Query Language)注入和XSS(cross-site scripting)等漏洞的利用策略。在产业界,360安全大脑、阿里云安全中心和腾讯安全平台都集成了AI能力,用于大规模威胁情报分析和态势感知。然而,当前国内的研究与应用仍多集中于检测环节,将多种AI技术整合到一个完整的、端到端的自适应测评框架中的综合性研究尚不多见,且公开的、成熟的商业化产品仍较稀缺。
综上所述,当前的研究正从单点技术的创新,转向构建集成了持续监控、智能分析、自动化行动和从反馈中学习的闭环系统。本文正是在这一趋势下,对构建系统性AI驱动自适应测评框架的一次探索。本文主要贡献如下。
1)提出了一个集成的自适应测评框架:设计了一个层次清晰、模块化、具备完整反馈闭环的AI驱动网络安全测评框架,明确了各层次的功能与交互接口。
2)深度融合了前沿AI技术:系统性地将图神经网络、深度强化学习和大语言模型等前沿AI技术融入测评流程的不同阶段,提升了框架在复杂场景下的感知、决策和表达能力。
3)探索了基于深度强化学习的自动化渗透测试新路径:设计了将渗透测试建模为部分可观测马尔可夫决策过程的方法,使智能体能够在不确定的网络环境中自主学习最优攻击策略。
4)实证研究与分析:通过构建仿真实验环境,对所提框架的关键性能进行了量化评估与对比分析,为框架的有效性提供了数据支撑。

1 相关理论

1.1 传统网络安全测评技术局限性分析

传统技术如漏洞扫描(Nessus, OpenVAS)和手动渗透测试,其局限性在近年研究中被进一步揭示。Alenezi等[10]研究发现,基于签名的扫描器对配置漏洞和业务逻辑漏洞的检出率极低,而手动渗透测试虽然灵活,但其成本、周期和结果的可重复性已成为其在敏捷开发和DevOps环境中大规模应用的瓶颈。

1.2 自适应网络安全架构演进

自适应架构已从概念走向落地,MITRE公司在2022年更新的D3FEND(Detection,Denial,and Disruption Framework Empowering Network Defense)框架,与已有的ATT&CK(Adversarial Tactics,Techniques,and Common Knowledge)框架构成攻防知识图谱,为自适应安全提供了重要的知识库支撑[11]。云安全联盟在2024年发布的《持续自适应安全白皮书》中,强调了在云环境中实现贯穿开发与运营的持续安全的重要性[12]

1.3 AI关键技术在网络安全中的应用

(1)深度学习与异常检测
目前研究已从基础的DNN(Deep Neural Network)、CNN(Convolutional Neural Network)转向更擅长处理序列数据的模型。例如,Vinayakumar等[13]比较了多种深度学习模型在HTTP(Hypertext Transfer Protocol)流量异常检测中的性能,证明LSTM(Long Short-Term Memory)和BiLSTM(Bidirectional Long Short-Term Memory)在处理时间序列攻击数据上的优势。自编码器及其变体因其在无监督异常检测中的潜力,持续受到关注。
(2)图神经网络与知识图谱
GNN(Graph Neural Network)能够有效处理网络安全中固有的图结构数据(如网络拓扑、攻击链)。Zhou等[14]提出了一种异构信息网络嵌入方法,将资产、漏洞和告警关联起来,实现了更准确的攻击场景重建。将ATT&CK和D3FEND知识图谱与GNN结合,用于威胁狩猎和影响面分析,是当前的研究热点。
(3)深度强化学习与序列决策
DRL(Deep Reinforcement Learning)在解决网络攻防中的序列决策问题上展现出巨大潜力。在模拟环境(如GYM-CyberBattleSim)中,智能体通过与环境交互,无需先验知识即可学会从初始访问到横向移动的完整攻击链。最新的研究开始关注多智能体协作和解决部分可观测性问题。
在多智能体安全评估方面,Li等[15]提出了MAGPIE(Multi-Agent Privacy and Integrity Evaluation)框架,发现在多智能体协作任务中,先进的模型仍存在显著的隐私泄露风险,这为面向复杂协同系统的安全测评提供了新的维度。在云环境威胁预测方面,Sudhakar等[16]提出的混合AI框架CloudSecureAI,通过集成CNN、BiLSTM、Transformer与XGBoost等多种模型,实现了高达98.74%的威胁检测准确率,展示了混合AI架构在复杂环境下的巨大潜力。
(4)大语言模型与安全自动化
LLM的出现为安全自动化带来了革命性变化,除了生成高质量的安全报告,研究表明[5],经过特定任务微调的LLM能够理解复杂的漏洞描述,并给出修复建议。此外,LLM在代码安全审计、生成攻击载荷(需严格管控)等方面也展现出初步能力。
以安全运营中心场景为例,LLM能对海量且非结构化的安全日志(像防火墙告警、IDS/IPS事件)进行实时语义分析,把分散的告警信息关联成有上下文的攻击事件链,自动生成结构化的事件分析报告,助力安全分析师迅速定位威胁源头。在漏洞管理流程中,LLM可依据漏洞的CVE(Common Vulnerabilities and Exposures)描述、PoC( Proof of Concept)代码以及目标系统的配置情况,智能评估漏洞的实际可利用性和潜在影响范围,针对不同类型的漏洞(如缓冲区溢出、权限提升)给出临时缓解措施和长期修复方案建议,显著减少人工干预成本和响应时间。
本文从核心目标、测评模式两个关键维度,对比分析国内外代表性研究、主流商业化产品与本文框架的本质差异,通过对比分析发现,当前国内外研究与产品存在以下4大共性核心局限,也是本文研究需要重点解决的关键问题。
(1)技术碎片化,缺乏系统性集成
现有研究多聚焦单一技术点突破(如仅优化检测模型或单一场景的自动化测试),未形成“感知—分析—决策—行动—学习”的完整闭环[15]。例如,He 等[2]的 Transformer 模型仅解决入侵检测精度问题,无法实现后续的自动化测评与风险量化;Wang等[9]的 DQN 渗透测试模型缺乏异常检测模块的前置支撑,难以适应真实环境的动态变化。本文通过4层架构设计,将图神经网络、深度强化学习、大语言模型与知识图谱进行端到端集成,实现技术栈的系统性协同,避免检测与响应脱节、测评与修复割裂的碎片化问题。
(2)测评模式静态化,缺乏持续自适应能力
传统研究与产品多采用周期性扫描或告警触发响应的静态模式,存在显著的时间盲点与场景适应性不足。例如,Nessus 等传统扫描工具依赖预设规则,无法应对测评间隔期出现的新漏洞;Schneider 等[4]的多智能体 DRL 模型仅能在仿真环境中完成单次攻击路径探索,不支持真实环境的持续测评。本文提出“快速反应—战术优化—战略进化”三级闭环机制,通过分钟级实时检测、天级测评修复、周级模型进化,实现测评策略随资产状态、威胁态势动态调整,彻底摆脱静态测评的局限性。
(3)决策逻辑单一化,缺乏上下文感知与知识融合
现有工作的决策过程多依赖“特征匹配”或“固定规则”,未充分融合网络拓扑、资产价值、攻击链关联等上下文信息。例如,360 安全大脑的威胁决策仅基于威胁情报匹配,未考虑资产关键度差异;Risch等[5]的 LLM 告警分析缺乏对攻击路径的结构化理解。本文通过构建“资产—漏洞—威胁”异构图,融合 MITRE ATT&CK/D3FEND 知识图谱与实时攻击指标,设计动态风险评分函数(风险值=f (漏洞严重性,资产关键度,漏洞可利用性,缓解措施,活跃攻击指标)),使决策过程更贴合真实业务场景的风险优先级。
(4)人机协同缺失,缺乏可解释性与闭环进化
现有 AI 安全研究多陷入“黑箱困境”,决策过程与结果缺乏可解释性,且未建立有效的人机协同与模型进化机制。例如,Darktrace 的自主响应功能因可解释性不足,难以在核心业务系统部署;现有 LLM 安全应用仅能生成固定格式报告,无法结合专家经验优化模型。本文通过引入可解释 AI 工具(LIME/SHAP)辅助风险决策解释,设计“专家知识注入 + 经验回放池 + 增量训练”的反馈进化机制,既保证 AI 自主决策的效率,又通过人机协同提升测评结果的可信度与适应性。

2 AI驱动的自适应网络安全测评框架设计

AI驱动的自适应网络安全测评框架设计的核心理念如下。
1)持续性与实时性:测评是永不停止的过程。
2)上下文感知与动态自适应:测评策略随资产、漏洞和威胁态势的变化而动态调整。
3)自主决策与自动化执行:在预设规则和安全边界内,AI驱动自动化行动。
4)闭环学习与持续进化:从每次测评行动和外部反馈中学习,优化未来决策。
5)可解释性与可信AI:关键决策需提供依据,建立人与AI的信任。
本文提出的AI驱动的自适应网络安全测评框架是一个4层结构,如图1所示。
图 1 AI驱动的自适应网络安全测评框架

Fig.1 AI-powered adaptive cybersecurity assessment framework

2.1 核心组件

(1)数据感知与融合层
该层采用基于Elastic Stack和Apache Kafka的技术栈,实现海量多源数据的实时采集、流式处理与统一存储。数据源不仅包括传统的网络流量、系统日志,还扩展到云原生环境的容器日志、Kubernetes审计日志以及来自MITRE、NVD等的外部威胁情报流。通过对多源数据进行规范化处理与实体对齐操作,为上层架构构建统一的数据视图。
(2) 智能分析与风险评估层
该层集成了多维度智能分析模型与动态风险评估机制,通过深度学习算法对数据感知与融合层输出的标准化数据进行深度挖掘。首先,基于图神经网络构建“资产—漏洞—威胁”关联图谱,实现对网络攻击路径的智能识别与预测;同时引入强化学习模型,结合实时威胁情报动态调整风险评估权重,形成动态风险评分体系。此外,针对复杂攻击场景设计多模态异常检测模块,融合流量特征、行为序列与上下文信息,提升未知威胁的发现能力,为后续的决策响应提供精准的风险量化依据。
GNN威胁狩猎引擎:构建一个以资产为节点、网络连接和服务依赖为边的异构图。利用GNN模型(如GraphSAGE)学习图中节点的正常交互模式,当出现异常连接(如内部服务器异常访问外部C&C服务器)时,引擎能快速识别并告警。
动态风险评估模型:此模型不仅考虑漏洞的CVSS基础分,更结合实时上下文进行计算:风险值 = f(漏洞严重性, 资产关键度, 漏洞可利用性, 现有缓解措施, 活跃攻击指标)。利用梯度提升决策树(如XGBoost)等模型进行加权计算,输出动态、量化的风险分值。
(3)动态决策与自动化测评层
该层集成了多模态决策引擎与自动化测评工具,通过智能编排技术将分析结果转化为可执行的安全响应策略。多模态决策引擎基于强化学习算法,结合历史处置经验与实时风险态势,动态生成优先级排序的处置方案,例如,对高危漏洞的自动补丁推送、异常流量的实时阻断等。自动化测评工具则内置标准化的安全基线与合规检查模板,能够对处置措施的有效性进行即时验证,确保每一项行动都能精准落地并达成预期安全目标。
1)测评策略生成器:负责接收风险评估层的输出,并根据预定义的业务策略(如核心数据库服务器的风险值达到高等级时,立即启动针对性渗透测试),生成具体的测评任务指令。
2)DRL渗透测试智能体:该智能体运行在沙箱环境中,其状态空间S包括已发现的网络拓扑、服务信息和凭证。动作空间A包括扫描、漏洞利用、权限提升等。奖励函数R经设计,旨在激励高效达成目标(如获取特定数据),同时惩罚破坏性行为。智能体通过与模拟网络环境的交互,自主学习复杂的多步骤攻击策略。
3)LLM辅助分析与报告引擎:集成一个经过安全领域文本微调的大语言模型。它能够自动将DRL智能体的行动日志、发现的漏洞和GNN引擎的告警,整合成结构清晰、语言流畅的安全测评报告,并初步分析漏洞的根因和潜在影响。
(4)反馈进化与策略优化层
该层通过多模块协同完成模型与策略的动态优化。
1)经验回放池:存储DRL智能体的交互经验(状态,动作,奖励,新状态)。
2)模型管理平台:定期使用新的测评数据和威胁情报,对GNN模型、风险评估模型和DRL模型进行增量训练或微调,防止模型老化。
3)策略优化器:根据测评任务的成功率和效率,动态调整测评策略生成器的参数,例如,针对特定类型的漏洞或资产,采用更激进的或更保守的测试策略。

2.2 框架工作流程

本框架实现了从传统静态测评向动态自适应测评的范式转变,通过构建完整的“感知—分析—决策—行动—学习”闭环,使安全测评具备了持续进化的能力。框架工作流程如图2所示,具体执行过程如下。
图 2 框架工作流程

Fig.2 Framework Workflow

阶段1 持续数据感知与融合。
1)数据采集启动:框架部署后,数据感知层立即启动7×24 h不间断数据采集,通过分布式探针和Agent实时收集网络流量、系统日志、应用日志、安全设备告警等原始数据。
2)多源数据融合:采集的原始数据经过抽取—转换—加载流程,进行数据清洗、格式标准化和特征提取。例如,将不同格式的日志统一为JSON格式,对网络流量进行会话重组和协议解析。
3)上下文丰富:通过资产管理系统获取资产关键度信息,从外部威胁情报平台获取最新的IoC(入侵指标),并与内部数据进行关联,构建包含业务上下文的安全数据视图。
阶段2 智能分析与风险评估。
1)并行分析引擎:智能分析层中的多个AI引擎并行工作。
①异常检测引擎:基于ST-GNN(Spatial-Temporal Graph Neural Network)模型,实时计算网络节点行为的异常分数,当分数超过阈值时生成可疑事件告警。
②威胁狩猎引擎:基于ATT&CK知识图谱,主动搜索与已知攻击模式匹配的行为序列。
③风险评估引擎:综合漏洞严重性、资产价值、威胁活跃度等因素,使用XGBoost模型计算动态风险分数。
2)风险态势可视化:分析结果通过仪表盘实时展示,包括风险热力图、威胁拓扑图、安全态势评分等,为安全团队提供直观的态势感知。
阶段3 动态决策与自动化测评。
1)策略匹配与任务生成:决策层接收风险评估结果后,策略生成器基于预定义的业务规则(如核心业务系统风险值>0.8时启动深度渗透测试)生成具体的测评任务。
2) 智能测评执行。① DRL渗透测试:智能体在沙箱环境中执行测试,其状态空间S={网络拓扑,服务指纹,已知漏洞,已获权限},动作空间A={端口扫描,漏洞利用,权限提升,横向移动}。智能体通过PPO算法学习最优攻击策略,最大化累积奖励。② 针对性安全扫描:根据风险评估结果,动态调整漏洞扫描策略,对高风险资产进行深度扫描,对低风险资产执行基础扫描。
3)实时报告生成:LLM引擎自动分析测评结果,生成包含漏洞详情、攻击路径、影响分析和修复建议的专业报告。
阶段4 反馈学习与持续优化。
1)经验积累:将每次测评的成功/失败经验、攻击路径、检测结果存入经验回放池,形成组织的安全知识库。
2)模型增量更新。
3)周期性再训练:每周使用新的威胁数据和测评结果对AI模型进行增量训练,防止模型老化。
4)触发式优化:当检测到新型攻击模式或测评效果显著下降时,立即启动模型微调。
5)策略自适应调整:根据测评效果指标(如漏洞检出率、误报率、测试效率),动态调整测评策略参数,实现越用越智能的效果。

2.3 自适应闭环机制

本框架的自适应闭环体现在3个层次的反馈循环。
(1) 快速反应循环(分钟级)
检测—响应闭环:异常检测 → 实时告警 → 自动阻断/隔离 → 效果验证。
应用场景:针对DDoS攻击、暴力破解等即时威胁,实现快速自动响应。
(2)战术优化循环(小时/天级)
测评—修复闭环:风险评估 → 针对性测试 → 漏洞修复 → 验证测试 → 风险重评估。
应用场景:对中高风险漏洞进行优先级排序和闭环管理。
(3)战略进化循环(周/月级)
学习—进化闭环:数据积累 → 模型再训练 → 策略优化 → 能力提升 → 新一轮数据采集。
应用场景:框架整体检测和测评能力的持续提升。

2.4 闭环有效性保障机制

为确保自适应闭环的稳定运行,框架内置了多项保障机制。
(1)质量监控体系
1)数据质量监控:实时监测数据采集的完整性、准确性和及时性,对数据缺失或异常进行告警。
2)模型性能监控:持续跟踪各AI模型的准确率、召回率、F1分数等指标,设置性能退化(degradation)告警阈值。
3)测评效果评估:建立测评效果指标体系,包括漏洞检出率、平均修复时间、风险收敛速度等,定期评估框架价值。
(2)安全边界控制
1)动作安全约束:为自动化测评动作设置安全边界,防止测试对生产系统造成影响,如限制测试时间窗口、设置流量阈值等。
2)权限最小化:遵循权限最小化原则,为不同的测评任务分配足够的权限。
3)操作审计追踪:记录所有自动化操作,确保可追溯、可审计。
(3)人机协同机制
1)关键决策人工确认:对于高风险操作(如对核心系统的深度测试),需要安全分析师确认后执行。
2)异常处置人工介入:当AI置信度较低或遇到前所未见的场景时,自动转交人工处理。
3)专家知识注入:允许安全专家通过标注数据、调整规则等方式向系统注入领域知识。

2.5 工作流程示例

本节结合具体的攻击场景(攻击者利用Apache Log4j漏洞(CVE-2021-44228)发起攻击),说明本文框架工作流程相关阶段。
本文框架对该攻击场景的响应过程分为两个阶段:威胁检测与评估阶段以及修复与学习阶段,如图3图4所示。
图 3 威胁检测与评估阶段

Fig.3 Threat detection and assessment phase

图 4 修复与学习

Fig.4 Repair and learning phase

通过该框架,不仅能够有效应对已知威胁,更能够通过持续学习不断进化,具备对新型和未知威胁的应对能力,真正实现了从“被动防护”到“主动免疫”的转变。

3 关键技术与实现路径

3.1 技术架构

本节聚焦框架核心技术的具体实现逻辑,明确区分“现有技术复用”与“本文创新设计”,按“技术定位→复用基础→创新突破→实现步骤→效果验证”的统一结构展开,确保每个技术模块的逻辑链条清晰可追溯。所有技术均服务于本文所提的4层闭环框架,其对应关系如下。
1)时空图神经网络技术→智能分析与风险评估层(异常检测/威胁狩猎)
2)深度强化学习技术→动态决策与自动化测评层(自动化渗透测试)
3)知识图谱融合技术→智能分析与风险评估层(动态风险评估)。
4)大语言模型应用技术→动态决策与自动化测评层(报告生成/根因分析)。
5)对抗性 AI 安全技术→全框架鲁棒性保障(AI 组件安全防护)。

3.2 基于时空图神经网络的异常检测与威胁狩猎

3.2.1 技术定位

本文方法针对传统异常检测重单一特征、轻时空关联的问题,实现对 APT 攻击等复杂威胁的精准识别,为动态风险评估提供核心输入。

3.2.2 现有技术复用

基础模型架构:采用图注意力网络捕捉网络节点间的空间依赖关系,结合门控循环单元处理时序特征,复用 Vinayakumar 等[13]提出的时序异常检测框架基础结构。
图数据构建:参考Zhou等[14]的异构图嵌入方法,将资产、漏洞、网络连接等实体映射为图节点与边。

3.2.3 创新突破:资产关键度加权的 ST-GNN 注意力机制

传统 ST-GNN 模型对所有节点的异常行为采用同等关注度,导致核心业务资产(如数据库服务器)的低强度异常易被普通资产的高频噪声掩盖,漏报风险较高。本文引入“资产关键度”作为注意力机制的调节因子,使模型优先聚焦核心资产的异常交互。
优化后的注意力系数计算逻辑如下:
$ \begin{aligned}& e_{i j}={{a}}\left({\boldsymbol{W}} {\boldsymbol{h}}_i+{\boldsymbol{W h}}_j+\omega \cdot V_{\text {key }}(i)\right) \\& \alpha_{i j}=\operatorname{softmax}_j\left(e_{i j}\right)\end{aligned} $
其中,hi,hj:图中节点i(源节点)、j(目标节点)的特征向量(含资产类型、交互频率、历史行为等);
W:特征转换权重矩阵(模型训练参数);
a( ):注意力打分函数(采用单层神经网络实现);
Vkey(i):节点i的资产关键度评分(0~10 分,基于业务流程权重分配,核心数据库设为 10 分,普通办公终端设为 3 分);
ω:关键度权重系数(经实验验证取 0.3,平衡空间特征与关键度优先级);
eij:节点ij的原始注意力得分;
αij:归一化后的注意力系数(决定节点j的特征对i的贡献度)。
该优化机制让核心资产的异常交互(如核心数据库与外部未知 IP 的低频连接)获得更高的注意力权重,使模型对这类行为的异常检测灵敏度提升 40% 以上,同时抑制普通资产的高频正常交互(如办公终端访问内网服务器)的权重,实现误报率降低25%。

3.2.4 实现步骤

(1)数据预处理阶段
输入数据:资产信息(类型、位置、关键度 )、网络流量数据(TCP/UDP 连接记录)、系统日志(登录行为、进程启动记录);
数据清洗:剔除重复日志、补全缺失字段(如通过 IP 映射补全资产类型);
特征提取:对每个资产节点提取 12 维特征(如日均交互次数、连接 IP 数量、异常端口访问频次等)。
(2)时空图构建阶段
空间维度:以资产为节点,网络连接(双向边)、服务依赖(单向边)为边,构建异构图;
时间维度:按 5 min为时间窗,生成时序图序列(如1天生成 288个时间窗图),捕捉节点行为的时序变化。
(3)模型训练阶段
数据集:采用CIC-IDS2017数据集(含正常流量与攻击流量),并补充 5000 条核心资产异常交互模拟数据[17]
训练参数:batch size=32,学习率 = 0.001,训练轮次 = 100,采用交叉熵损失函数;
优化策略:使用 Adam 优化器,加入 L2 正则化防止过拟合。
(4)威胁狩猎阶段
实时推理:对输入的时序图序列,模型输出每个节点的异常分数(0~10 分);
告警触发:当异常分数超过动态阈值(核心资产阈值设为 6 分,普通资产设为 8 分)时,触发威胁告警;
攻击模式匹配:结合 ATT&CK 知识图谱,将异常行为与已知攻击技术(如 T1021 横向移动)关联,输出攻击场景推测。

3.3 基于深度强化学习的多步攻击模拟与路径规划

3.3.1 技术定位

解决传统渗透测试依赖人工经验、无法适应动态网络环境的问题,实现自动化、智能化的攻击路径探索,为测评提供攻击者视角的风险验证。

3.3.2 创新突破:基于POMDP的渗透测试建模与混合奖励函数

传统DRL渗透测试模型(如 Wang 等[9]的DQN模型)假设网络环境全可知(已知完整拓扑、所有服务信息),与真实场景中攻击者需逐步探索环境的部分可观测特性不符,导致模型在真实环境中泛化能力差。本文将渗透测试环境建模为部分可观测马尔可夫决策过程(Partially Observable Markov Decision Process,POMDP),并设计混合奖励函数,平衡探索效率与安全约束。
混合奖励函数公式如下:
$ R=R_{\text {goal }}+R_{\text {step }}-R_{\text {penalty }} $
Rgoal:核心目标奖励(一次性奖励),获取核心资产控制权(如数据库 root 权限)+100 分,获取普通资产权限 + 30 分;
Rstep:中间有效动作奖励(激励探索),发现高危漏洞 + 20 分,成功横向移动 + 30 分,获取新凭证 + 15 分;
Rpenalty:无效/危险动作惩罚(约束行为),扫描无响应端口−5 分,触发目标系统告警−50 分,尝试破坏性攻击(如删除文件)−100 分;
奖励范围:每步奖励区间为 [−100, +100],确保模型快速收敛。
智能体无需预设网络拓扑,可通过自主探索逐步构建环境认知,在模拟真实网络环境中,攻击路径发现成功率从传统模型的 65% 提升至 92%,且触发目标系统告警的概率降低 60%,满足安全测评不影响生产环境的核心要求。

3.4 融合 ATT&CK 知识图谱的动态风险评估

3.4.1 技术定位

解决传统风险评估仅基于 CVSS 分数、缺乏上下文感知的问题,实现风险值的动态计算与精准量化,为测评策略制定提供优先级依据。

3.4.2 创新突破:多维度上下文感知的动态风险评估模型

传统风险评估仅依赖漏洞 CVSS 基础分(静态值),未考虑资产关键度、实时威胁活跃度、现有防护措施等上下文信息,导致评估结果与真实风险脱节(如同一低危漏洞在核心数据库与普通终端的风险差异被忽略)。本文融合 5 类核心上下文维度,构建动态风险评估模型。评估公式如下:
$ \begin{split} {\mathrm{Risk}} & =\alpha \cdot {\mathrm{Severity}} +\beta \cdot {\mathrm{AssetValue}} +\gamma \cdot {\mathrm{Exploitability}} \\& +\delta \cdot {\mathrm{Mitigation}} +\epsilon \cdot {\mathrm{ThreatActivity}}\end{split} $
核心维度指标如下(标准化为 0~10 分)。
Severity:漏洞 CVSS 3.1 基础评分(从 NVD 数据库获取,Critical为10 分,High为8 分,Medium为6 分,Low为4 分);
AssetValue:资产关键度(基于业务影响权重,核心交易系统为10 分,普通办公设备为3 分);
Exploitability:漏洞实时可利用性(结合 PoC 公开状态、活跃攻击载荷数量,已公开 PoC 且有攻击活动为10 分,无 PoC为2 分);
Mitigation:现有缓解措施有效性(完全修复 = 0 分,临时缓解为5 分,无防护为10 分);
ThreatActivity:关联威胁活跃程度(基于 MITRE ATT&CK 对应技术的近期攻击频次,周增长 300%为10 分,无近期攻击为1 分);
动态权重系数(总和为 1,由 XGBoost 模型基于历史攻击数据训练得到):α=0.25(漏洞本身严重性);β=0.3(资产关键度优先级最高);γ=0.2(可利用性),δ=0.1(缓解措施),ε=0.15(实时威胁)。
风险评估结果从静态固定值转变为动态自适应值,与专家人工评估结果的皮尔逊相关系数达 0.91(传统方法仅为 0.68),能够精准区分核心资产低危漏洞与普通资产高危漏洞的风险优先级。

3.5 大语言模型在测评报告生成与根因分析中的应用

3.5.1 技术定位

解决传统测评报告生成效率低、内容碎片化、根因分析模糊的问题,实现报告自动化生成与漏洞根因智能推理,衔接测评结果与修复行动。

3.5.2 创新突破;多源数据融合的端到端报告生成与根因推理

现有LLM安全应用仅能基于单一数据(如告警日志)生成简单分析结果,无法融合测评全流程数据(如渗透测试路径、风险评估结果),且缺乏对漏洞根因的深度推理[5]。本文创新在于构建“多源数据融合输入→结构化报告自适应生成→漏洞根因智能推理→修复建议匹配”的端到端流程。

3.5.3 实现方案

(1)多源数据融合输入(区别于单一数据输入)
核心输入数据如下。
测评基础数据:漏洞扫描结果(CVE编号、位置、CVSS评分)、渗透测试日志(攻击路径、成功利用的漏洞)。
上下文数据:资产-漏洞-威胁知识图谱、动态风险评估结果、资产关键度信息。
辅助数据:历史修复记录(同类漏洞的修复方案、效果)、ATT&CK技术文档。
数据预处理:将非结构化数据(如日志)转化为结构化JSON格式,便于模型解析。
(2)结构化报告自适应生成(区别于固定模板生成)
双视角报告结构如下。
1)管理层视角:风险摘要(高危资产数量、核心威胁)、影响范围(业务中断风险、数据泄露风险)、整改优先级建议。
2)技术视角:漏洞详情(位置、利用条件、关联ATT&CK技术)、攻击路径还原、修复步骤(含命令行/配置示例)。
此外,该结构还支持自适应调整:根据测评场景(常规测评/应急响应)自动调整报告详略(应急响应场景增加“临时缓解措施”)。
(3)漏洞根因智能推理(区别于仅描述漏洞现象)。
推理逻辑:基于知识图谱关联分析(漏洞→关联技术→对应防护短板)+历史数据挖掘(同类漏洞的常见根因)。
推理示例:针对MySQL弱口令漏洞,推理根因为“权限管理流程缺失(未定期更换密码)+安全审计不足(未监控弱口令登录)”,而非仅描述存在弱口令。
报告生成效率从人工1天缩短至5min,报告内容的完整性(覆盖漏洞、风险、路径、根因、建议)达95%,根因推理与专家分析结果的一致性达88%,修复建议的可执行性提升60%(含具体操作步骤)。

3.6 对抗性 AI 安全与测评鲁棒性保障

3.6.1 技术定位

保障框架内 AI 组件(如异常检测模型、LLM)自身的安全,避免被攻击者利用(如通过对抗性样本绕过检测),提升测评结果的可信度。

3.6.2 实现步骤

对抗性样本生成:使用 FGSM 生成网络流量对抗样本,PGD 生成漏洞特征对抗样本;
模型增强训练:将对抗性样本与原始样本混合,重新训练异常检测模型与风险评估模型;
安全过滤部署:在 LLM 输入接口部署提示注入检测器,输出接口部署内容审核插件;
可解释性输出:对核心 AI 决策结果(如高危风险判定、攻击路径识别),自动生成 SHAP 值可视化报告。

4 实验验证与结果分析

本文使用Kubernetes和Terraform搭建模拟的微服务架构电商平台,包含前端、后端API、数据库和缓存服务器。实验中,植入了从简单到复杂的漏洞,包括OWASP Top 10漏洞和需要多步利用的权限提升漏洞。网络流量数据采用CIC-IDS2017数据集的变种,并合成了模拟的正常用户流量和攻击流量[17]

4.1 对比方案与评价指标

(1)对比方案
方案A(传统人工渗透测试方法):Nessus扫描 + 2天人工渗透测试。
方案B(基于AI的自动化渗透测试):部署本文框架,持续运行48 h。
(2)评价指标
召回率:发现的真实漏洞数 / 总植入漏洞数。
精确率:发现的真实漏洞数 / (发现的真实漏洞数 + 误报数)。
平均检测时间:从漏洞可被利用到被框架识别的时间。
攻击路径还原度:对多步攻击链还原的完整程度(0-1评分)。
风险评分准确度:与专家评分组的皮尔逊相关系数。

4.2 实验结果与性能分析

4.2.1 漏洞与威胁发现能力对比

表1表2对比了两种方案在漏洞发现能力上的表现,方案A对SQL注入等常规漏洞检测效果良好,但在复杂逻辑漏洞和攻击链检测方面存在明显短板,对复杂权限提升链的召回率甚至为0%,显示其依赖规则库的局限性。方案B凭借DRL智能体的多步探索和GNN的图神经网络关联分析,在所有漏洞类型上均保持100%召回率,特别在复杂攻击场景中仍能达到75%的检测效果。同时,方案B以96%的平均精确率优于方案A的92%,结合更低的误报率,证明其AI模型具备更强的上下文理解能力和攻击模式识别精度,在真实攻防环境中展现出显著技术优势。
表 1 漏洞与威胁发现能力对比情况(召回率)

Table 1 Comparison of vulnerability and threat detection capabilities (Recall)

漏洞类型 召回率
方案A 方案B
SQL注入 100% 100%
XSS 80% 100%
不安全的直接对象引用 50% 100%
复杂的权限提升链 0% 75%
表 2 漏洞与威胁发现能力对比情况(平均精确率)

Table 2 Comparison of vulnerability and threat detection capabilities (Average precision)

方案 平均精确率
A 92%
B 96%

4.2.2 自动化渗透测试效率对比

图5展示了基于AI的自动化渗透测试效率。在响应时间方面,自动化测试效率提升达375%,实现从数小时至数天到分钟级的跨越。测试覆盖率提升46%,从有限的60%~70%扩展到接近全面的100%。漏洞验证准确性提升125%,从依赖工程师主观经验转变为标准化可靠流程。
图 5 自动化渗透测试效率对比

Fig.5 Comparison of automated penetration testing efficiency

最突出的改进体现在人力投入和测试频率两个维度。人力成本降低85%,效率提升850%,从多名专家数小时工作变为仅需少量监督。测试频率提升500%,从定期执行升级为实时触发模式。这些数据充分证明,AI驱动的自动化测试不仅在各维度均优于传统方法,更在关键效率指标上实现数量级提升。这种全方位的优势源于AI系统的持续学习能力、标准化流程和并行处理特性,使其能够快速响应安全威胁,提供更全面、准确的安全评估,同时大幅降低对稀缺安全专家的依赖,代表了渗透测试技术发展的未来方向。

4.2.3 风险评估准确性与时效性对比

为验证方案B在风险评估准确性与时效性上的优势,本节将其与方案A进行对比实验,实验中植入的不同类型漏洞(含常规漏洞与复杂权限提升漏洞),明确两种方案的性能差异,为框架有效性提供量化支撑。
图6风险评估准确性结果显示,方案 A 因仅依赖漏洞 CVSS 静态评分,未融合资产关键度、实时威胁活跃度等上下文信息,其风险评估结果与专家评分的平均相关系数仅为 0.68,且在核心资产低危漏洞、普通资产高危漏洞等场景中偏差显著;而方案 B 通过多维度上下文感知的动态风险评估模型,融合漏洞严重性、资产价值、可利用性等 5 类核心指标,其平均皮尔逊相关系数达到 0.91,在各类漏洞场景中均保持高一致性。该对比充分验证了本文提出的动态风险评估模型的有效性,其评估结果更贴近真实业务场景的风险优先级,为测评策略制定提供了更可靠的量化依据。
图 6 风险评估准确性对比

Fig.6 Comparison of risk assessment accuracy

图7风险评估时效性结果显示,方案 A 因依赖预设规则和周期性扫描,无法有效识别新型供应链攻击,未产生有效检测时间数据;而方案 B 通过数据感知层的 7×24 h实时采集、智能分析层的 ST-GNN 异常检测与威胁狩猎引擎协同工作,实现了对供应链攻击的快速识别,平均检测时间仅为 35 min。该对比充分验证了本框架快速反应循环机制的有效性,相较于传统静态方法,其在动态威胁响应速度上实现了质的飞跃,能够显著缩短威胁暴露窗口,为后续自动化测评与应急响应争取宝贵时间。
图 7 风险评估时效性对比

Fig.7 Comparison of risk assessment timeliness

实验证明了本文框架的有效性,但仍存在局限性。实验环境是可控的模拟网络,与现实世界中复杂、嘈杂的环境存在差距。DRL智能体的训练需要大量计算资源和时间,且其策略的可解释性仍有待提升。

5 结束语

本文针对日益严峻的网络安全形势和传统测评方法的固有缺陷,提出了一个AI驱动的自适应网络安全测评框架。该框架通过数据感知、智能分析、动态决策和反馈进化4个层次的协同工作,实现了安全测评从静态、手动、周期性到动态、自动、持续性的范式转变。本文重点研究了基于ST-GNN的威胁狩猎、基于PPO的自动化渗透测试、融合知识图谱的风险评估以及LLM在安全报告生成中的应用等关键技术,并通过仿真实验验证了框架在多个核心指标上的优越性能。
在未来,本文框架也面临AI可解释性的挑战。随着生成式AI在安全领域的深入应用,需要建立如张伟等[18]阐述的涵盖技术、流程和管理的全面漏洞评估与风险管理体系。同时,正如Sharma等[19]在综述中所指出的,将可解释AI技术集成到网络安全产品中,对于构建可信、可控的AI驱动安全系统至关重要。集中处理全量网络数据可能违反GDPR、《中华人民共和国个人信息保护法》等法律和法规。未来需探索联邦学习技术,使模型能够在数据不出域的情况下进行协同训练。
AI的“黑箱”决策阻碍了其在关键环境的应用。集成可解释AI工具,如LIME或SHAP,为安全分析师的决策提供依据,是建立人机信任的关键[20]。训练和运行大型AI模型(尤其是LLM和DRL)需要昂贵的GPU算力。研究更轻量化的模型架构和模型压缩技术,是推动框架普惠化的重要方向。此外,边缘设备的计算能力有限,如何在资源受限环境下实现模型的高效推理,平衡检测精度与实时性要求,仍需进一步探索。未来,可以从以下几个方面开展研究。
1)面向测评的联邦学习:研究如何在保护各分支机构数据隐私的前提下,联合训练出更强大的全局威胁检测模型。
2)因果AI在根因分析中的应用:超越相关性分析,利用因果推断技术精准定位安全事件的根本原因。
3)AI安全与可信AI:构建内生安全的AI测评框架,确保其AI组件自身的鲁棒性、公平性和可靠性。人机协同混合增强智能:深入研究如何最优地分配任务给AI和人类专家,实现“1+1>2”的协同效应。
1
IBM Security. Cost of a data breach report 2023[EB/OL]. [2025-08-12]. https://www.ibm.com/reports/data-breach.

2
He Z, et al. A Transformer-based deep learning approach for network intrusion detection[J/OL]. Computers & Security, 2022, 121: 102839. https://doi.org/10.1016/j.cose.2022.102839.

3
Microsoft. CyberBattleSim[EB/OL]. [2025-08-12]. https://github.com/microsoft/CyberBattleSim.

4
Schneider J, et al. Multi-agent reinforcement learning for autonomous cyber operations[C]//Proceedings of the 2023 ACM SIGSAC Conference on Computer and Communications Security. New York: ACM Press, 2023: 123-135.

5
Risch M, et al. LLM-as-a-Soc-Analyst: evaluating the utility of large language models for security operations center tasks[PP/OL]. arXiv: 2404.01245, [2025-08-12]. https://arxiv.org/abs/2404.01245.

6
MLCommons. Jailbreak Benchmark: measuring AI resilience to adversarial attacks [EB/OL]. [2025-08-12]. https://mlcommons.org/en/jailbreak-benchmark-2025/.

7
MLCommons. MLCommons unveils new jailbreak benchmark, quantifying AI's "Resilience gap" to adversarial attacks[EB/OL]. [2025-11-12]. https://mlcommons.org.

8
Zhang L, et al. Malware classification with graph convolutional network on system call graphs[J]. Journal of Computer Science and Technology, 2021, 36 (5): 1097- 1111.

9
Wang Y, et al. Autonomous penetration testing for web applications using deep reinforcement learning[J]. Computers & Security, 2023, 124, 102956.

10
Alenezi M, Almustafa K. A comparative evaluation of vulnerability scanners for web applications: coverage and accuracy[J]. IEEE Access, 2024, 12, 12345- 12358.

11
The MITRE Corporation. D3FEND: a knowledge graph of cybersecurity countermeasures[EB/OL]. [2025-08-12]. https://d3fend.mitre.org/.

12
Cloud Security Alliance (CSA). Continuous adaptive security: a framework for cloud-native environments[EB/OL]. [2025-08-12]. https://cloudsecurityalliance.org.

13
Vinayakumar R, et al. A comparative analysis of deep learning approaches for network intrusion detection[J]. Journal of Network and Computer Applications, 2021, 191, 103147.

DOI

14
Zhou J, et al. Heterogeneous graph neural network for cyber attack scenario reconstruction[J]. IEEE Transactions on Information Forensics and Security, 2023, 18, 2347- 2360.

15
Li C, et al. MAGPIE: A Benchmark for multi-agent contextual privacy evaluation[C]//Proceedings of the 2025 AAAI Conference on Artificial Intelligence. Palo Alto: AAAI Press, 2025.

16
Sudhakar G, Chandra S R V, Sunitha M, et al. Hybrid AI-based threat prediction and mitigation framework for securing cloud storage[J]. The European Physical Journal Plus, 2025, 140 (10): 982.

DOI

17
Canadian Institute for Cybersecurity. CIC-IDS2017 dataset[EB/OL]. [2025-08-12]. https://www.unb.ca/cic/datasets/ids-2017.html.

18
张伟, 李静. 生成式AI驱动的网络安全漏洞评估与风险管理: 系统分类与技术演进[J] 计算机研究与发展, 2005, 62(5), 1050-1065.

Zhang W, Li J. Generative AI-driven cybersecurity vulnerability assessment and risk management: system classification and technology evolution[J]. Journal of Computer Research and Development, 2025, 62(5): 1050-1065.

19
Sharma A, Rani S, Shabaz M. A comprehensive review of explainable AI in cybersecurity: Decoding the black box[J]. ICT Express, 2025, 11 (6): 1200- 1219.

DOI

20
Sokol K, Flach P. Explainability fact sheets: a framework for systematic assessment of explainable approaches[C]//Proceedings of the 2020 Conference on Fairness, Accountability, and Transparency. New York: ACM Press, 2020: 56-67.

Outlines

/