Special Topic on Security Evaluation of Network Information Systems

FSK evaluation method for out-of-sample attack behavior assessment

  • Xie Ruchen , * ,
  • Wang Chunlu
Expand
  • Key Laboratory of Trustworthy Distributed Computing and Service (BUPT), Ministry of Education, Beijing 100876, China

Online published: 2026-04-01

Copyright

Copyright ©2025 Journal of Aeronautical Materials. All rights reserved.

Abstract

With the increasing sophistication of cyber-attacks, Breach and Attack Simulation (BAS) has emerged as a pivotal approach for cybersecurity assessment. Within the BAS framework, the Planner serves as a core module, where decision algorithms directly dictate the coverage and effectiveness of the simulation. However, existing decision algorithms face significant limitations in handling the uncertainty of behavioral outcomes and assessing out-of-sample attack behaviors, thereby constraining their practical utility. To address these challenges, this paper proposes Feature Similarity adaptive KNN (FSK), a comprehensive attack behavior evaluation method. FSK integrates structured modeling, dynamic neighborhood adjustment, and temporal decay mechanisms with an adaptive K-Nearest Neighbors (KNN) algorithm. The method enhances adaptability to execution changes through execution result feedback, and achieves a comprehensive evaluation of attack behaviors utilizing multi-objective balanced decision-making. Experimental results demonstrate that FSK achieves superior performance in terms of attack surface coverage and prediction accuracy for out-of-sample behaviors. The average performance metrics reach 90%, representing a 20% improvement over existing baselines. These findings provide new insights for advancing the design of BAS planners.

Cite this article

Xie Ruchen , Wang Chunlu . FSK evaluation method for out-of-sample attack behavior assessment[J]. Journal of Cybersecurity, 2025 , 3(5) : 38 -47 . DOI: 10.20172/j.issn.2097-3136.250504

0 引言

随着企业数字化转型的不断加速,网络安全已成为其信息基础设施建设中亟须应对的核心问题。近年来,入侵及攻击模拟(Breach and Attack Simulation,BAS)作为一种新兴的网络安全评估技术,被越来越多企业组织的关注与采用。BAS不仅能对网络环境进行持续性安全测试,识别潜在的安全漏洞与配置薄弱点,还可进一步量化总体风险水平,评估现有安全控制措施的有效性,并辅助制定可攻击行为性强的防御优先级策略,从而增强其整体安全态势感知与响应能力。
BAS系统通常由以下几个部分构成:资产网络建模、攻击行为库(如MITRE ATT&CK)、模拟执行器、路径规划器(Planner)与结果评估反馈机制。其中,Planner承担了在可执行攻击行为集合中选择最优攻击路径的任务[1],是决定攻击模拟质量与效率的核心模块。
Planner工作流程如图1所示。其内部可划分为两个子模块:一是可执行攻击行为生成模块,该模块基于环境信息与攻击行为库,筛选并构建当前可执行攻击行为的候选集合;二是决策算法模块,该模块以可执行攻击行为集合及其他需要的信息为输入,对攻击行为评估排序,最终输出当前环境下最优攻击行为。两者协同作用,使得Planner既具备攻击行为集约束的合理性,又通过算法层面的决策逻辑实现了对攻击链执行效果的优化。
图 1 规划器工作流程

Fig.1 Planner workflow process

可执行攻击行为生成模块的核心职能是基于环境与攻击行为库筛选出可执行行为集合,其输出完全取决于环境与攻击行为库,属于确定性过程。进一步优化此模块,往往意味着对环境约束或行为进行修改,这可能削弱系统对环境映射的相似程度,甚至引入不一致假设。相比之下,真正的关键在于如何在候选集内合理评估与排序,以适应动态环境并提升整体攻击率。因此,本文的研究重点限定于决策算法,不涉及可执行攻击行为生成的改进。但现有决策算法在环境探索、应对执行结果不确定性等方面仍存在不足。
尽管现有的决策算法在BAS中发挥了重要作用,但仍存在两方面局限:一是针对“样本外”攻击行为的评估能力不足。现有基于历史数据的模型难以对未曾执行过或特征稀疏的攻击行为进行有效预测,导致攻击链断裂;二是对执行结果不确定性的适应性较弱。静态规划方法缺乏对执行过程中动态反馈的实时响应机制,限制了测试的连贯性。
针对上述问题,本文提出了一种面向样本外攻击行为的特征相似度K近邻算法(Feature Similarity adaptive KNN,FSK),旨在通过结构化特征与自适应算法,在不确定环境中实现对攻击行为的高效评估与决策。本文的主要贡献如下:
1)提出了一种基于多维特征的结构化建模方法。将攻击行为映射为技术、上下文、历史及环境四维特征空间,解决了异构攻击行为难以度量相似性的问题。
2)设计了基于自适应K近邻算法(K-Nearest Neighbors,KNN)的动态评估机制。引入局部置信度与时间衰减因子,实现了对样本外攻击行为成功率的有效推断,增强了算法在动态环境下的鲁棒性。
3)构建了多目标平衡的决策框架。综合考虑攻击成功率与覆盖率,通过实验验证了该方法在攻击面覆盖度、评估准确率方面均优于现有算法。

1 相关工作

决策算法是BAS自动化测试的核心。如何在潜在攻击路径与适应执行过程中的不确定性之间取得平衡,是决策算法的核心问题[2-5]
最早的决策方法多依赖启发式策略。典型代表是随机选择方法,通过随机化执行顺序提升攻击的多样性和探索范围,其简单、易实现,能够在一定程度上覆盖较广的攻击行为空间。然而,此类方法缺乏目标导向性,容易生成缺乏逻辑的攻击链。为克服这一局限,桶式方法与批处理方法引入了阶段性约束,将攻击行为划分到不同的战术阶段(如ATT&CK框架中的战术)并顺序执行,从而保证了攻击链在逻辑性方面的改进。但此类方法过度依赖固定顺序,并假定链上各步骤均执行成功,一旦某个行为失败,链条便难以继续[1,3]
针对启发式方法的局限性,研究者尝试将环境因素引入决策过程。常见思路是将系统状态与漏洞依赖显式建模为攻击图,并通过图搜索算法生成攻击链。此类方法具备全局视角,能够系统性地分析多步攻击路径。然而,实际场景中往往难以满足其依赖完整先验知识的前提。后续研究尝试减少对完整先验知识的依赖[1],但生成路径仍然是静态的,一步失败即全局失效。同时,在大规模场景下,路径搜索的计算开销巨大[3]
为解决图搜索方法在动态性方面的不足,后续引入了决策理论框架,将路径规划建模为交互式的动态决策问题[6-9]。其核心优势在于,通过即时奖励与长期收益的平衡,使算法能够在运行时根据结果调整后续决策,从而具备一定的动态适应能力。这类方法在理论上具有较高的灵活性,但高度依赖复杂的奖励设计,且训练与推理的计算代价显著,限制了其在实时BAS平台中的应用[3]
为解决高计算代价的问题,研究者进一步提出了概率建模以实现更轻量的动态调整。典型工作如Usubyan等[10]实现的基于贝叶斯的预测机制,使决策方法倾向于选择历史上成功率更高的攻击行为。这种方法能够快速给出攻击行为优先级估计,避免了复杂的训练过程。然而,其对历史数据的依赖性过强,面对样本外的攻击行为往往无法给出有效预测。同时,在数据稀缺或环境快速变化的情况下,预测效果会显著降低,导致规划逻辑出现断裂[3]
综上所述,现有决策算法在多样性、逻辑性和动态性方面各有贡献,但仍存在两大问题:其一,缺乏对潜在路径的充分探索,导致攻击覆盖范围有限;其二,过度依赖完整先验或历史数据,难以应对过程中的不确定性。针对这些不足,本文提出了一种基于自适应KNN的评估方法FSK,通过对历史数据的结构化建模与邻域自适应评分,提升攻击行为评估与排序的准确度。同时,通过动态相似度计算与在线更新机制,增强对执行结果不确定性和样本外攻击行为的适应能力,从另一角度探索理想BAS路径规划器的决策算法的可实现性。

2 FSK算法模型设计

2.1 概念定义

为便于后续算法原理与实验分析的表述,本文对评估算法设计及实验过程中涉及的核心概念进行如下定义。
任务:由任务目标、目标网络/主机、规划器等信息组成。
任务目标:任务针对目标网络/主机所设定的攻击策略,由一组或多组能力组成,旨在实现特定攻击目标或系统状态改变的高层次行为单元。例如,获取目标主机的敏感信息、关闭关键服务等均可视为任务目标。任务目标可被分解为若干有序或依赖关系约束的能力。
目标网络/主机:被测试/待测试网络/主机。
策略:攻击行为或能力所属的功能阶段或目标类型,是对攻击行为目的和作用方向的抽象分类。例如,情报收集、横向移动、持久化、影响等。策略是能力与任务之间的中间抽象层,用于组织和筛选攻击行为或能力。
能力:攻击行为的抽象模板,定义了攻击行为的功能类型、适用环境、所需条件及潜在效果。同一能力在不同上下文中可实例化为一个或多个具体攻击行为。
能力池:满足特定要求的能力的集合,如限定适应环境为某种攻击行为系统、限定能力目标为搜集信息、限定属于某一策略等。
攻击行为:任务过程中一次可执行的最小单元,由特定能力在特定主机上实例化而成。
可执行攻击行为集合:在当前环境状态下,满足所有前置条件、可被立即调度执行的攻击行为集合。该集合在执行过程中会动态更新。
历史数据:BAS系统在历次执行中记录的攻击行为特征、执行结果及行为对应的环境状态的集合,用于支撑结构化建模与预测模型的更新。
样本外攻击行为:现有算法无法计算成功率或缺乏有效特征支撑预测的攻击行为,需要通过执行结果直接获得反馈。

2.2 问题阐述与分析

评估算法需要在动态不确定的环境中生成最优行为。设可执行攻击行为$ \mathcal{A}=\{{a}_{1}\mathbf{,}{a}_{2},\cdots {,}{a}_{n}\} $,其核心在于选择最优行为a
$ a=\underset{{a}_{i}\in \mathcal{A}}{\text{max}}\text{[}P{\text{(success}|\text{a}}_{\textit{i}}\text{)},C\text{(}{a}_{{i}}\text{)]} $
其中,$ P(\text{success}|{a}_{i}) $表示行为$ {a}_{i} $的成功率,$ C({a}_{i}) $表示行为$ {a}_{i} $的覆盖度。然而,受限于历史观测$ \mathcal{H} $,上述优化问题在实践中面临以下5个挑战。
(1)样本外行为评估问题
对于$ \mathcal{A} $中的每个元素$ {a}_{i}\in \mathcal{A} $,评估算法需要估计其成功率:$P(\text{success}|{a}_{i}) $
$ {a}_{i}\notin \mathcal{H} $时,传统方法无法给出有效估计,即:
$ P(\text{success}|{a}_{i})=\varnothing $
“缺失预测”导致攻击链构造过程出现断裂,严重影响算法的鲁棒性。于是有
R1:评估算法应具备对样本外攻击行为的泛化能力,使$ \forall {a}_{i}\in \mathcal{A} $均能给出合理估计,保证概率分布的完整性。
(2)行为相似度度量问题
行为$ {a}_{i} $用向量$ {\boldsymbol{V}}_{i} $表示,成功率估计依赖$ {a}_{i} $与历史行为$ {h}_{j} $的相似度,即
$ P\text{(success}|\text{(}{a}_{i},{h}_{j}\text{))}={f({\mathrm{sim}}(}{\boldsymbol{V}}_{i},{\boldsymbol{V}}_{j}\text{)}\leqslant \theta \text{)} $
其中,${\boldsymbol{V}}_J $$h_j $对应的向量,$ \text{sim(}x,y\text{)} $为相似度函数,$ {f(}x\text{)} $为概率计算函数。不同特征维度在语义上存在异质性,统一的距离度量会造成语义偏差,导致邻域样本与待测行为的相似度误差过大。因此有
R2:评估算法应具备结构化特征建模与多维相似度度量机制,使邻域选择能尽可能准确地反映行为的特征以及与历史数据的相似度。
(3)时间衰减问题
$ {t}_{j} $$ \mathcal{H} $$ {h}_{j} $的时间戳。若忽略时间维度,则无法反映环境随时间演化的动态性。因此,需要引入时间衰减因子$ \lambda \in \text{(0,1)} $,以计算$h_j $对应的时间权重$W_j $,作为该$h_j $的相似度修正参数:
$ {w}_{j}={\lambda }^{T-{{t}_{j}}} $
在此基础上相似度修正为
$ \begin{aligned} &P\text{(succ}|\text{(}{a}_{i},{h}_{j}\text{))}\\=&P\text{(success}|\text{(}{a}_{i},{h}_{j}\text{))}\times {w}_{j}\\=&{f({\mathrm{sim}}(}{\boldsymbol{V}}_{i},{\boldsymbol{V}}_{j}\text{)}\leqslant \theta \text{)}\times {w}_{j}\end{aligned} $
其中,T为当前时间。于是有
R3:评估算法应具备时间敏感性,通过动态衰减机制提升对环境变化的适应性。
(4)动态适应性问题
在基于邻域的方法中,成功率估计可表示为:
$ \hat{P}\text{(success}|{a}_{i}\text{)}=\frac{\displaystyle\sum\limits_{{h}_{j}\in {\mathcal{N}}_{k}\text{(}{a}_{i}\text{)}}P\text{(succ}|\text{(}{a}_{i},{h}_{j}\text{))}}{k} $
其中,$ {\mathcal{N}}_{k}({a}_{i}) $$ \text{sim(}{a}_{i},{h}_{j}\text{)} $$ {a}_{i} $的邻域集合,k为邻域大小。若k为静态,则会面临邻域过大(引入噪声)或过小(缺乏代表性)的问题。因此有
R4:评估算法应具备动态调整邻域大小的能力,以保证在不同系统与任务中的稳健性。
(5)多目标平衡问题
为避免算法仅选择高成功率的行为导致攻击覆盖范围不足,或为探索环境而牺牲整体稳定性。评估算法可建模为以下形式:
$ a=\underset{{a}_{i}\in \mathcal{A}}{\text{max}}{[F(}\hat{P}{\text{(success}|\text{a}}_{\textit{i}}\text{)},C\text{(}{a}_{{i}}\text{))]} $
其中,$ {F(}x,y\text{)} $为综合评估函数。即
R5:评估算法应具备权衡机制,实现利用与探索之间的平衡。

2.3 任务模型与系统流程

本文所提出的攻击行为评估方法遵循图2所示的系统模型,该模型由输入、算法模型、决策执行单元以及结果反馈与数据更新4个部分构成。
图 2 系统模型

Fig.2 System model

(1)输入
算法接收当前可执行攻击行为集合与历史执行日志。
(2)算法模型
该模块由3个子单元构成:① 结构化建模。将历史数据与攻击行为集合统一抽象编码,确保信息表征的一致性与可比性。② 领域构建。基于结构化特征,建立行为的领域图谱。③ 评分与优先级计算。根据图谱对当前可执行攻击行为计算评估值,为决策过程提供定量依据。
(3)决策执行单元
基于评估值优选最佳行为并在目标网络执行。
(4)结果反馈与数据更新
执行结果与状态变更实时回传至历史数据库,动态更新领域模型。

3 攻击行为评分方法设计

方法由以下3个关键部分组成:多维特征空间划分与相似度计算、基于自适应KNN的评估机制、多目标平衡决策。

3.1 多维特征空间划分与相似度计算

3.1.1 特征建模和维度划分

传统KNN在高维特征空间距离计算过程中会面临“维度灾难”问题[11-13],此时传统欧氏距离不再适用[14]。若过度减少特征维度,则易造成模型泛化能力下降与过拟合现象[15]。因此,本文采用结构性特征表达,将攻击行为依据特征的功能角色划分为四大类:技术特征、上下文特征、历史特征与环境特征。攻击行为的主要特征及含义如表1所示。
表 1 攻击行为的主要特征及含义

Table 1 Main characteristics and meanings of aggressive behaviors

特征名 含义
adversary_id 所属的策略ID
ability_id 所属的能力ID
executor_platform 执行行为的操作系统
executor_name 执行行为的终端
command 攻击行为的原始命令
planner 使用的决策算法
agent_privilege agent的权限
host_architecture 执行行为的主机架构
facts_need 行为需要的变量
unlock_facts 执行成功可获得的变量
time 执行行为时的时间戳
trust_status agent状态是否可信
status 执行结果
1)技术特征。用于描述攻击行为中实现的底层技术手段,包括字段:command、planner。
2)上下文特征。表示攻击行为执行所依赖的前提条件及其可能带来的信息收益。包含字段:facts_need、unlock_facts、host_architecture、agent_privilege、trusted_status。
3)历史特征。记录历史执行结果及相关的时间性指标,包括字段:status、time。
4)环境特征。用于描述攻击行为所处的宏观攻击环境和平台特性,反映其部署背景与上下文配置。包含字段:adversary_id、ability_id、executor_name、executor_platform。
该建模方式将异构的攻击日志映射为标准化的特征向量,为后续的相似度计算提供了可度量的数学基础。同时,有效规避了“维度灾难”,提高了相似度搜索的判别能力与稳定性。

3.1.2 相似度计算

为量化候选攻击行为af与历史行为ah的差异,本文根据参与相似度计算的特征的数据结构与语义属性(表2),定义了特征映射函数:
表 2 参与相似度计算的特征及含义

Table 2 Characteristics and meanings involved in similarity calculation

特征名 含义
adversary_id 所属的策略ID
ability_id 所属的能力ID
executor_platform 执行行为的操作系统
executor_name 执行行为的终端
command 攻击行为的原始命令
planner 使用的决策算法
agent_privilege agent的权限
host_architecture 执行行为的主机架构
facts_need 行为需要的变量
trust_status agent状态是否可信
unlock_facts 行为成功可获得的变量
$ \varPhi \text{(}a\text{)}\rightarrow \{{\boldsymbol{V}}_{\text{struct}},{\boldsymbol{V}}_{\text{set}},{\boldsymbol{V}}_{\text{attr}}\} $
并设计分类型距离度量机制。
(1)结构型距离
针对具有层级依赖关系的特征(如adversary_id与ability_id),将其建模为结构向量$ {\boldsymbol{V}}_{\text{struct}}=\text{[}{{v}}_{1},{{v}}_{2},\cdots , {{v}}_{{n}}\text{]} $。考虑到策略与能力的复用关系,采用平均海明距离衡量结构差异:
$ {{{\mathrm{Dist}}}}_{\text{struct}}=\frac{1}{n}\sum\limits_{i=1}^{n}{d(}{\boldsymbol{V}}_{f,i},{\boldsymbol{V}}_{h,i}\text{)} $
其中,$ {d(}{\boldsymbol{V}}_{f,i},{\boldsymbol{V}}_{h,j}\text{)} $为层级判定函数,若节点隶属于同一策略树或存在包含关系则为0,否则为1。
(2)集合型距离
对于facts_need和unlock_facts等集合类特征,其差异反映了攻击行为在前提条件与信息增益上的不匹配度。采用集合对称差(Symmetric Difference)定义距离:
$ {{{\mathrm{Dist}}}}_{\text{set}}\text{(}\mathcal{A},\mathcal{B}\text{)}=\left| \mathcal{A}\Delta \mathcal{B}\right| $
该公式可直接计算非交集元素的基数,有效度量了信息流的偏差。
(3)属性型距离
针对离散属性特征,将其可解析性分为两类处理。
1)非结构化属性。对于command字段,通过分词提取工具名与参数构建Token集合T,并复用式(9)计算语义距离。
2)标称属性。对于planner、platform等枚举型上下文特征,采用布尔距离进行距离计算,其定义为:
$ {d(}x,y\text{)}=\begin{cases} 0,\; x=y\\1,\; x\neq y\end{cases} $
综合上述度量,攻击行为间的总特征距离Dist定义为各维度距离的加权聚合:
$ {\mathrm{Dist}}={\omega }_{1}{\mathrm{Dis}}{{\mathrm{t}}}_{\text{struct}}+{\omega }_{2}{\mathrm{Dis}}{{\mathrm{t}}}_{\text{set}}+{\omega }_{3}{\mathrm{Dis}}{{\mathrm{t}}}_{\text{attr}} $
该结构化度量模型有效解决了异构特征在高维空间中的语义对齐问题,为后续的近邻搜索提供了鲁棒的距离基准。

3.2 基于自适应KNN的评估机制

基于前文所描述的特征空间与相似度计算,可以构造以待评估为中心的邻域空间,但该空间内各样本的参考价值不尽相同,因此需要对各样本进行权重区分。所以提出基于时间权重的样本衰减机制以及基于置信度的自适应K值机制。

3.2.1 基于时间权重的样本衰减机制

攻击模拟环境的高度动态性导致历史数据的参考价值随时间推移而递减[16-17]。为防止过时数据干扰当前决策,本文引入指数衰减函数对历史样本进行加权:
$ {w(}t\text{)}={\text{e}}^{-\lambda \times \Delta t} $
其中,Δt为当前时间与该样本时间戳的间隔,λ为衰减速率。
在相似度计算阶段,设某一历史样本与目标样本之间的原始距离为dorig,则引入时间衰减因子后,其修正距离为:
$ {W(}t\text{)}={d}_{\text{final}}=\frac{{d}_{\text{orig}}}{{w(}t\text{)}}=\frac{{d}_{\text{orig}}}{{\text{e}}^{-\lambda \times \Delta t}} $
该加权机制赋予近期行为更高的权重,使模型具备对环境演变的时序感知能力。

3.2.2 基于置信度的自适应K值机制

KNN及其变种算法在多种场景均表现良好[18-20]。然而,传统KNN也存在两方面主要挑战:① 固定K值带来的局部过拟合或欠拟合问题。② 在样本分布不均或异常值存在时,误判风险增加。
解决上述问题的主要思路是K值的动态调整[21-22]、自适应邻域选择[23-24]以及聚类[25]和模糊优化[26]。基于上述方法及局部K值拟合思想[27],本文提出的自适应KNN评估机制的核心思路如下。
1)自适应界限。根据理论误差下界[28],设定初始搜索范围:
$ {K}_{0}={\mathrm{max}}\left(k\in {\mathbb{Z}}^+|\frac{k}{n} \lt \varepsilon \right) $
防止引入过多噪声。
2)动态调整。计算当前邻域内的行为成功率密度psuccess。若psuccess低于置信阈值ϵ,表明当前邻域一致性较差,则按指数衰减缩减K值,直至满足置信度要求或达到最小界限。
3)基于优选邻域Nk(ai),候选行为ai的预测成功率(Functional Success,$ {F}_{{{a}_{i}}} $)定义为加权聚合:
$ {F}_{{{a}_{i}}}=\frac{\displaystyle\sum\nolimits_{j=1}^{k}{W(}{t}{\text{)}}_{j}\cdot {I}{({\mathrm{status}}}={{\mathrm{success}})}}{\displaystyle\sum\nolimits_{j=1}^{k}{W(}t{\text{)}}_{j}} $
该自适应KNN评估机制兼顾了局部模式识别的敏感性与评分结果的全局稳定性。一方面,置信度的动态调整避免了固定K值带来的过拟合风险;另一方面,可解释的评分推断将样本外行为纳入可评估范围,为后续的排序提供了坚实基础。

3.3 多目标平衡决策

对每个攻击行为$ {a}_{i}\in \mathcal{A} $,评分$ \text{Score(}{a}_{i}\text{)} $包含两个维度:①预测成功率$ {F}_{{{a}_{i}}} $;②覆盖率评分(Coverage,$ {C}_{{{a}_{i}}} $)。
它们用于衡量攻击行为对知识面扩展的能力。若ai所能解锁的变量unlock_facts包含系统中尚未获得的新信息(记为new_facts),其覆盖率评分定义为:
$ {C}_{{{a}_{i}}}=\frac{\left| {\text{new}\_\text{facts}}_{{{a}_{i}}}\right| }{\left| {\text{unlock}\_\text{facts}}_{{{a}_{i}}}\right| } $
表示该攻击行为中新增变量占总可获得变量的比例。
综合上述两个评分维度,通过加权线性组合得到每个候选攻击行为的最终评分:
$ \text{Score(}{a}_{i}\text{)}=\alpha \cdot {F}_{{{a}_{i}}}+\beta \cdot {C}_{{{a}_{i}}} $
通过动态调整权重因子αβ,算法可在“利用(Exploitation)”与“探索(Exploration)”之间灵活切换,最终选择得分最高的行为执行:
$ {a}^{*}=\underset{{a}_{i}\in \mathcal{A}}{\text{max }}\text{Score(}{a}_{i}\text{)} $

4 实验设置与结果分析

本实验在同一受控网络环境下进行,以确保不同算法间的公平性。

4.1 实验设置

为评估本文所提出的算法在任务中的攻击面覆盖度、攻击行为评估的准确率和算法对攻击行为的可决策率,在统一测试平台与攻击能力池条件下开展对比分析。

4.1.1 攻击目标与任务定义

本实验设定攻击目标为:尽可能多地执行攻击行为,以实现对目标系统的全面探测与模拟攻击。其更强调攻击面的覆盖性与攻击效果的多样性,以模拟真实攻防场景中攻击者对最大化情报收集、权限扩展和破坏能力的需求。

4.1.2 平台与数据设置

实验在开源对抗模拟平台CALDERA上进行。CALDERA由MITRE提出,基于MITRE ATT&CK框架设计,能够模拟攻击者在真实网络环境中执行的战术与技术动作。该平台支持构建完整的攻击链执行流程,包括任务调度、能力执行、参数匹配,以及结果反馈与学习机制等。
实验在基于CALDERA的插件机制嵌入自定义实现的算法与平台原生算法共存的前提下进行统一调度、执行与日志采集,确保各算法在相同测试条件下的公平性与可比性。所有算法均使用同一攻击能力池,包含411种可以在目标网络上执行的具有多战术阶段特征的攻击行为,覆盖信息收集、持久化、横向移动、权限提升、破坏性执行等攻击阶段。并且,这些攻击行为不会执行第二次,以此避免算法陷入死循环。此外,平台上此前积累的多轮真实任务记录将作为历史数据供有需要的算法使用。

4.1.3 对比算法

为对所提方法的性能进行对比,实验选取当前BAS系统中具有代表性的6种决策算法作为基准算法。
1)随机选择(Random)算法。对所有可执行攻击行为进行无偏置的随机选择,无优化目标,作为性能下界参考。
2)静态分桶(Bucket)算法。基于ATT&CK tactic将攻击行为划分为多个阶段分桶,依序调度,但忽略上下文动态与攻击行为依赖性。
3)批处理(Batch)算法。以阶段为单位对可用攻击行为进行统一下发,缺乏基于执行反馈的细粒度控制。
4)贝叶斯(Bayes)算法。基于历史攻击行为执行记录建立成功概率模型,对历史数据中未出现过的未知攻击行为缺乏评分能力,延后调度[1029]
5)目标导向(Guided)算法。采用最短路径搜索达成目标节点,具备目标意识但路径收敛性强,执行中断早。
6)期望收益估计(Look_ahead)算法。基于启发式得分和未来折扣回报,进行策略评分,但依赖参数配置与预设奖励表。
以上算法除了随机策略算法,均已在Caldera中集成,这也是本文选择该平台的另一原因。

4.1.4 评估指标

为衡量算法性能,实验选取攻击行为覆盖率、评估准确率和可决策率为指标。其中,准确率以50%成功率阈值为基准,判断算法预测结果与实际执行结果是否一致。针对其他没有预测功能的算法,以执行成功的攻击行为数量为比较数据,统计各算法在相同环境下执行10次任务的覆盖率、评估准确率与可决策率。其中:
$ 覆盖率=\frac{算法实际执行操作量}{理论最大执行操作量} $
$ 可决策率=1-\frac{无法评估操作量}{实际执行操作量} $

4.2 实验结果及分析

4.2.1 覆盖率评估分析

图3展示了各算法的总执行攻击行为数量,可视为对目标系统的攻击面覆盖度。Random、Look_ahead与Bayes算法均表现出较高的覆盖度,攻击行为执行数接近4 000,Batch算法的覆盖率虽略低于上述算法,但差异并不显著。
图 3 各算法执行攻击行为总数量

Fig.3 Total amount of execution behavior of each algorithm

在各算法中,Guided的表现最为特殊,该算法的攻击行为覆盖量不及其他算法的1/6。分析CALDERA的实现算法,发现出现这种现象的原因在于其高度目标导向的设计逻辑:Guided算法采用贪婪策略,一旦在局部预设目标完成后无法检索到后续路径,便判定任务终止,从而导致大量潜在路径被遗漏。大量孤立(即无需其他信息即可执行的攻击行为)或破坏性攻击行为(如重启、删除文件)未被识别为有效目标,未纳入目标集,导致其覆盖率指标显著偏低。由于目标集中在少量高价值节点,算法倾向于在完成这些节点后提前终止,而未对其余潜在路径进行遍历。这种“高度集中化”的执行策略虽然减少了冗余攻击行为,但牺牲了对系统全局的探索能力,不适合覆盖优先的任务场景。
这一现象表明,Guided算法更适合以快速达成单一高价值目标为目的的定向攻击模拟,而不适合对覆盖性与探索性要求较高的测试场景。而FSK算法在覆盖能力上表现最优,总执行攻击行为数超过4 000个,表明其在遍历攻击行为池、尝试多样化路径方面具有一定的优势。
由于算法中采用了覆盖度这一指标,在相同成功率的前提下,算法更倾向于能够获得更多环境信息的攻击行为,从而解锁更多潜在可执行攻击行为。另外,引入了上下文感知的多维度相似度计算,使得原本容易被忽略的攻击行为在不同上下文中也能被识别为“相似且可行”。因此,系统更可能选择多样化的攻击行为组合,从而提高覆盖度。

4.2.2 准确率评估分析

各算法的评估准确率如图4所示,可以看出,大多数传统算法均表现出极低的准确率,表明其成功执行的攻击行为数量极为有限,在规划精度与环境适应性方面存在较大缺陷。对比之下,Guided算法虽然准确率达到了85%,表现出良好的路径规划能力,但其总体执行数量显著低于其他算法,难以覆盖更广的攻击行为空间,限制了攻击模拟的深度与复杂性。
图 4 各算法评估准确率

Fig.4 Prediction accuracy of each algorithm

相较于规则约束较强的算法,Random算法在最终成功执行的攻击行为比例方面表现更优。这一现象主要源于攻击行为池中包含若干具有高度破坏性的指令(如全盘删除、系统关机等),一旦过早执行,将导致后续所有攻击行为的执行失败,显著降低评估准确率。
而批处理或分桶算法采用静态顺序规划机制,在缺乏细粒度风险控制的前提下,可能在攻击早期即触发破坏性攻击行为,导致模拟任务在实质上提前结束。相比之下,随机算法由于执行顺序不固定,反而提升了非破坏性攻击行为在前期被选择的概率,从而间接实现了更高的准确率。
这一现象揭示出当前部分算法在应对高破坏性能力时存在的缺陷,尤其在“尽可能执行更多攻击行为”的情形下,缺乏动态调整与风险感知机制的规划策略,不但无法体现优越性,甚至可能在准确率方面不如无策略的随机方法。
本文算法的预测准确率达到60%以上,显著高于其他算法,而且在高覆盖度的前提下依然维持较高的稳定性,显示出本算法对执行风险的有效控制。

4.2.3 可决策率评估分析

本文将各算法的规划/评估结果细分为成功、失败和无法预测三类,分析预测评估算法(主要为Bayes算法和本文算法)的评估能力,结果如图5所示。
图 5 各算法执行结果分布

Fig.5 Distribution of execution results of each algorithm

可以看到,Bayes算法存在大量“无法预测”的攻击行为项,这是因为该算法的预测机制依赖攻击行为在历史数据中的频次统计。只有当某一攻击行为的历史样本数量超过设定阈值时,其成功概率才会被纳入计算;否则,攻击行为会被统一归入“延迟执行队列” ,并在所有可预测攻击行为完成后按预设顺序依次执行。
这一处理逻辑虽然避免了数据稀疏导致的误判,但也带来了明显的泛化能力不足与即时决策缺失问题。尤其在初始攻击行为数据不足、目标系统变动频繁或攻击链结构复杂的情境中,该策略无法为绝大多数新攻击行为提供合理评分,导致算法在整个运行周期内始终缺乏对攻击行为执行的有效判断依据。
在对比实验中,将此类“不可预测”攻击行为单独统计并可视化,观察到其在整体攻击行为池中占据了较高比例。这一结果充分说明,仅依赖静态频数估计的评估机制难以应对实际环境中高度动态、数据稀疏的攻击行为评估需求。本文提出的FSK算法没有出现无法评估攻击行为的现象,证明了算法的评估策略具备较强的泛化能力与适应性。

4.2.4 综合指标分析

将上述3个指标平均,所得数据如表3所示。由表3可知,Guided虽在成功率方面占据优势,但执行覆盖范围过小,限制了其在探索型任务中的适用性;Random在无优化策略的情况下,反而在特定风险条件下优于部分传统算法,揭示了执行顺序对于整体性能的重要影响。
表 3 算法指标

Table 3 Algorithm indicators

算法 覆盖率 准确率 可决策率 平均指标
Random 0.980 0.140 1.00 0.70
Batch 0.890 0.080 1.00 0.66
Bucket 0.730 0.080 1.00 0.60
Look_ahead 0.980 0.090 1.00 0.69
Guided 0.140 0.840 1.00 0.66
Bayes 0.930 0.110 0.16 0.40
FSK 0.996 0.695 1.00 0.90
综合以上三项指标,本文提出的算法在覆盖能力与执行稳定性之间实现了平衡。一方面,接近全覆盖的探索使其能够发现更多潜在路径与隐藏目标;另一方面,较高的成功率表明其在执行过程中具备一定的风险感知与规避能力。

5 结束语

随着BAS技术在网络安全评估实践中的广泛应用,路径规划器作为其核心决策组件,直接影响模拟攻击的效果与实用价值。规划器的现有决策算法虽各具工程优势,但在路径探索能力、攻击行为评分能力、任务执行多样性等方面仍存在不足,难以满足复杂现实环境下对智能化攻击模拟的需求。
本文针对上述问题,提出了一种融合结构特征划分、动态领域调整、时间衰减加权并基于KNN的攻击行为评估方法FSK,构建了多维度、可泛化的攻击行为评估机制。在不依赖预训练的前提下,提升了对样本外攻击行为的评分能力与不确定性执行结果的适应能力。
在统一实验设置下,将本文方法与现有多种算法进行了系统对比。实验结果表明,本文所提方法的三项平均指标达到90%,比现有算法提高了20%。同时,所设计的评估机制具备可解释性与扩展能力,为未来构建更复杂的攻击建模与智能规划框架提供了可行路径。
未来工作可从以下几个方向拓展:一是进一步在多类型网络拓扑及不同规模的攻击集合中开展鲁棒性与可扩展性实验,以验证算法在大规模异构网络和不同规模攻击集合中的有效性;二是引入强化学习等主动规划机制,在决策过程中引导评分算法自适应地调整权重与特征关注点;三是进一步建模攻击行为间的依赖逻辑与执行因果关系,以增强路径规划的全局最优性;四是探索多智能体协同模拟下的规划策略融合机制,提升系统在多样化攻击链路构建中的适应能力与实战价值。
1
Lawrence D, Kouremetis M, Applebaum A, et al. Guided planner[EB/OL]. (2022-12-06)[2025-08-29]. https://medium.com/@mitrecaldera/guided-planner-d65aea65451.

2
Reinstadler B M. AI attack planning for emulated networks[D]. Cambridge: Massachusetts Institute of Technology, 2021.

3
Chen J, Zhang J, Liu Y, et al. Vulnerability correlation, multi-step attack and exploit chain in breach and attack simulation[C]//2023 IEEE 12th International Conference on Cloud Networking (CloudNet). Hoboken, USA: IEEE, 2023: 398-402.

4
Applebaum A, Miller D, Strom B, et al. Intelligent, automated red team emulation[C]//Proceedings of the 32nd Annual Conference on Computer Security Applications. Los Angeles, USA: ACM, 2016: 363-373.

5
Sarraute C, Richarte G, Lucángeli O J. An algorithm to find optimal attack paths in nondeterministic scenarios[C]//Proceedings of the 4th ACM Workshop on Security and Artificial Intelligence. Chicago, USA: ACM, 2011: 71-80.

6
Gianvecchio S, Kouremetis M, Applebaum A. Look ahead planner[EB/OL]. (2022-11-03)[2025-08-29]. https://medium.com/@mitrecaldera/look-ahead-planner-6f52ee041378.

7
Li J, Zhang Q, Zhang D, et al. Research on optimal strategies of SAS cybersecurity based on MDP[C]//2019 IEEE Sustainable Power and Energy Conference (iSPEC). Beijing, China: IEEE, 2019: 2078-2083.

8
Ren Y, Duan Z, Guan J, et al. Optimal DoS attacks on remote state estimation with continuous action spaces[C]//2024 IEEE International Conference on Unmanned Systems (ICUS). Xi’an, China: IEEE, 2024: 1153-1158.

9
Hasegawa K, Hidano S, Fukushima K. AutoRed: Automating red team assessment via strategic thinking using reinforcement learning[C]//Proceedings of the 14th ACM Conference on Data and Application Security and Privacy. Porto, Portugal: ACM, 2024: 325-336.

10
Usubyan K, Kouremetis M, Jellen C. MITRE Caldera Naive Bayes planner[EB/OL]. (2023-10-04)[2025-08-29]. https://medium.com/@mitrecaldera/mitre-caldera-naive-bayes-planner-1a581c2140c3.

11
Hong H, Juan G, Ben W. An improved KNN algorithm based on adaptive cluster distance bounding for high dimensional indexing[C]//2012 3rd Global Congress on Intelligent Systems. Wuhan, China: IEEE, 2012: 213-217.

12
Aggarwal C C, Hinneburg A, Keim D A. On the surprising behavior of distance metrics in high dimensional space[C]//International Conference on Database Theory. London, UK: Springer, 2001: 420-434.

13
Kouiroukidis N, Evangelidis G. The effects of dimensionality curse in high dimensional KNN search[C]//2011 15th Panhellenic Conference on Informatics. Kastoria, Greece: IEEE, 2011: 41-45.

14
Song Y, Gu Y, Zhang R, et al. Brepartition: Optimized high-dimensional KNN search with Bregman distances[J]. IEEE Transactions on Knowledge and Data Engineering. IEEE, 2020, 34 (3): 1053- 1065.

15
Zhang R, Liu Y. Multi feature small sample object recognition method based on DTW algorithm[C]//2018 IEEE 3rd Advanced Information Technology, Electronic and Automation Control Conference (IAEAC). Chongqing, China: IEEE, 2018: 2118-2122.

16
Zheng Q. An improved collaborative filtering algorithm based on expert trust and time decay[C]//2018 11th International Symposium on Computational Intelligence and Design (ISCID). Hangzhou, China: IEEE, 2018: 12-15.

17
Fan X, Hu Y, Zhang R, et al. Modeling temporal effectiveness for context-aware web services recommendation[C]//2015 IEEE International Conference on Web Services. New York, USA: IEEE, 2015: 225-232.

18
Zhang H, Wang Z, Xia W, et al. Weighted adaptive KNN algorithm with historical information fusion for fingerprint positioning[J]. IEEE Wireless Communications Letters. IEEE, 2022, 11 (5): 1002- 1006.

DOI

19
Dixit M, Sharma R, Shaikh S, et al. Internet traffic detection using Naïve Bayes and k-nearest neighbors (KNN) algorithm[C]//2019 International Conference on Intelligent Computing and Control Systems (ICCS). Madurai, India: IEEE, 2019: 1153-1157.

20
Sharma A. Enhancing recommendation systems: A comparative and optimization study of KNN-based algorithms[C]//2024 3rd International Conference for Advancement in Technology (ICONAT). Goa, India: IEEE, 2024: 1-7.

21
Liang J, Liu Q, Nie N, et al. An improved algorithm based on KNN and random forest[C]//Proceedings of the 3rd International Conference on Computer Science and Application Engineering. Sanya, China: ACM, 2019: 1-6.

22
Ling Y L, Zhang X, Zhang Y. Improved KNN algorithm based on probability and adaptive K value[C]//Proceedings of the 2021 7th International Conference on Computing and Data Engineering. Sanya, China: ACM, 2021: 34-40.

23
Liu L, Bai J, Yan H. Fine-grained point cloud classification based on adaptive KNN algorithm[C]//Proceedings of the 2024 International Conference on Intelligent Perception and Pattern Recognition. Xiamen, China: SPIE, 2024: 121-127.

24
Wettschereck D, Dietterich T. Locally adaptive nearest neighbor algorithms[C]//Advances in Neural Information Processing Systems 6 (NIPS 1993). Denver, USA: Morgan Kaufmann, 1993: 184-191.

25
Shen T, Wang Y, Du T, et al. Clustering algorithm based on k-value adaptive neighborhood selection[C]//2021 International Conference on Computational Science and Computational Intelligence (CSCI). Las Vegas, USA: IEEE, 2021: 604-608.

26
Taneja S, Gupta C, Aggarwal S, et al. MFZ-KNN—A modified fuzzy based K nearest neighbor algorithm[C]//2015 International Conference on Cognitive Computing and Information Processing (CCIP). Noida, India: IEEE, 2015: 1-5.

27
Chu H, Liu T, Yuan Y. Improved KNN algorithm based on local K value fitting[C]//Proceedings of the 2024 3rd Asia Conference on Algorithms, Computing and Machine Learning. Shanghai, China: ACM, 2024: 414-418.

28
Cover T, Hart P. Nearest neighbor pattern classification[J]. IEEE Transactions on Information Theory. IEEE, 1967, 13 (1): 21- 27.

DOI

29
Jiang F, Zhang Z, Chen P, et al. Naive Bayes text categorization algorithm based on TF-IDF attribute weighting[C]//Proceedings of the 2018 2nd International Conference on Computer Science and Artificial Intelligence. Shenzhen, China: ACM, 2018: 521-525.

Outlines

/