学术研究

LEAD-Cyber:基于开源大模型和全周期本地微调的网络安全垂域大模型

  • 关永健 ,
  • 朴乘锴 ,
  • 王布宏 , * ,
  • 赵博夫 ,
  • 李思琦 ,
  • 赵正阳
展开
  • 空军工程大学信息与导航学院,西安 710077
王布宏()。

网络出版日期: 2025-04-30

基金资助

国家自然科学基金资助项目(62472437)

版权

版权所有©《网络空间安全科学学报》编辑部 2025

LEAD-Cyber:A cybersecurity vertical domain LLM based on open source LLMs and full-cycle local fine-tuning

  • GUAN Yongjian ,
  • PIAO Chengkai ,
  • WANG Buhong , * ,
  • ZHAO Bofu ,
  • LI Siqi ,
  • ZHAO Zhengyang
Expand
  • School of Information and Navigation, Air Force Engineering University, Xi’an 710077, China

Online published: 2025-04-30

Copyright

Copyright ©2025 Journal of Aeronautical Materials. All rights reserved.

摘要

网络安全运维领域面临着知识碎片化、响应效率低及专业数据敏感性等挑战。为了更好地应对上述挑战提出了一种基于开源大模型和全周期本地微调的网络安全垂直领域大模型—LEAD-Cyber。采用多步生成方法构建网络安全领域专业知识数据集,该数据集能够满足开源大模型预训练、指令微调与推理微调3个训练阶段的需求;并采用全参数微调方法与低秩适应(LoRA)对DeepSeek和QWen开源大模型进行全周期优化。结合主客观指标实现大模型性能量化评估和其他大模型测试基准集以验证模型在处理不同任务中的有效性,评价指标包括Rouge、BLEU以及胜率分析WinRate。实验结果表明,微调后模型显著优于基线模型。研究验证了全周期微调策略在优化领域知识表达与保持通用能力上的优势,为智能化安全运维提供了高效可靠的解决方案。

本文引用格式

关永健 , 朴乘锴 , 王布宏 , 赵博夫 , 李思琦 , 赵正阳 . LEAD-Cyber:基于开源大模型和全周期本地微调的网络安全垂域大模型[J]. 网络空间安全科学学报, 2025 , 3(4) : 94 -110 . DOI: 10.20172/j.issn.2097-3136.250116

Abstract

The field of cybersecurity operation faces challenges such as fragmentation of knowledge, low response efficiency, and professional data sensitivity. In order to better cope with the above challenges, a local fine-tuned vertical domain Large Language Model (LLM) for cybersecurity—LEAD-Cyber was proposed based on the open-source LLMs and full-cycle training datasets. A multi-step generation method was used to build a professional knowledge dataset in the field of cybersecurity, which met the needs of three training stages of LLMs: pre-training, instruction fine-tuning and reasoning fine-tuning. The DeepSeek and QWen open-source LLMs were also optimized in full cycles using full-parameter fine-tuning methods and low-rank adaptation (LoRA). Based on subjective and objective indicator, the performance of LLM on different benchmarks was evaluated using indicators such as Rouge, BLEU and WinRate analysis to verify its effectiveness in handling different tasks. Experimental results showed that the LLM after fine-tuning was significantly better than the baseline model. The research verified the advantages of the full-cycle fine-tuning strategy in optimizing the field of knowledge expression and maintaining general capabilities, providing an efficient and reliable solution for intelligent and cybersecurity operation and maintenance.

0 引言

近年来,大语言模型(Large Language Models,LLMs)的快速发展正在重塑人工智能领域的技术范式,其发展历程可追溯至深度学习技术兴起之时,Transformer架构的提出是其标志性事件,自然语言处理领域迎来了革命性的变革[1]。随着计算能力的提高以及数据规模的扩大,以GPT、BERT和DeepSeek等为代表的预训练语言模型渐渐呈现出强大的语言理解与生成能力[2]。大语言模型凭借参数规模的大幅提高以及训练方法的优化,在文本生成、知识问答、逻辑推理等多个任务上展现出强大的能力[3]。为提高模型的实用性与可靠性,研究者借助指令微调和人类反馈强化学习等方法,使模型遵循人类指令并输出符合人类偏好的结果[4]。随着技术的持续突破以及应用场景的拓展,大语言模型正逐步改变人类与信息交互的方式,为人工智能的发展开辟新的可能性。
大模型的不断发展给网络安全运维带来了新的机遇,传统的安全运维模式存在知识碎片化、经验难以沉淀、响应效率低等问题,在处理海量安全事件时,低效的响应机制可能致使关键风险被忽视。在安全事件处置过程中,运维人员多数需要在大量非结构化文档如日志、威胁情报报告中检索相关信息,既耗时又耗力,还容易信息提取不完整造成知识断层和经验传承障碍。而且跨团队协作存在障碍、问题解决流程缺乏标准化以及运维知识的快速迭代都给安全运维带来了巨大压力,为应对这些挑战,研究者开始探索把智能问答技术引入安全运维领域,借助构建专业的知识库和智能问答系统来提高运维效率和准确性。随着大语言模型技术的发展,依靠动态结合知识库检索与上下文生成,提升复杂安全场景下解决方案的精准度[5],这种技术支持快速定位知识,还可以适应安全领域知识的快速迭代需求,为自动化运维提供了新的工具。
网络安全运维涉及大量专业知识,覆盖漏洞分析、威胁检测、应急响应、合规要求等,传统方式运维效率较低,安全人员需要手动查询技术文档、ATT&CK攻击框架、攻击案例和防御手段等资料。而大模型可以整合这些知识源,构建智能问答系统,实现即时精准的安全知识检索与解答,大模型可理解自然语言,降低安全运维的学习门槛,这提高了运维人员解决问题的效率,又能帮助他们快速提升专业知识水平,应对不断变化的网络安全挑战。
网络安全领域内数据存在敏感性、碎片化以及不平衡性等特点,并且数据格式与大模型训练所需的自然语言数据不匹配,这成为实现精细调整大模型时面临的主要挑战[6]。例如,ElZemity等[7]提出的CyberLLMInstruct框架对大模型进行微调后,在“提示注入”等关键漏洞中表现出更严重的性能退化,可能无法涵盖新兴威胁模式。Kouremetis[8]提出的OCCULT微调后的大模型,在复杂任务泛化能力方面存在不足,输出存在规范性问题。因此,构建一个全面且详尽的自然语言数据集,对于网络安全领域而言极为复杂。
本研究通过构建网络安全领域专用数据集和大模型全周期微调技术,创新性地提出了具备学习(Learn)、执行(Execute)、适应(Adapt)能力的网络安全垂直领域(Domain)大模型LEAD-Cyber。该模型框架首先收集网络安全领域的高质量数据,完成多阶段微调数据集的构建,接着运用低秩适应(LoRA)方法对DeepSeek模型进行微调,生成网络安全垂域大模型,本研究对其在领域指令遵循以及对话能力方面的表现展开评估,实验结果表明,大语言模型表现出卓越的学习能力,在特定领域对LEAD-Cyber模型进行微调可释放其在专业领域的潜力。本研究的主要贡献如下。
多阶段微调数据集构建:提出的多层数据架构,涵盖预训练、指令微调与推理微调多个阶段的数据需求。基于混合人工生成和大模型生成技术,通过多步生成的方式构建面向网络安全运维的专业语料库,其中融合了攻击日志、网页内容和MITRE ATT&CK攻击框架实体等方面的内容。
全周期大模型训练:提出一个网络安全大语言模型,用于应对领域特定挑战。以DeepSeek和QWen大模型为基础,通过网络安全知识文本的持续预训练,在综合网络安全基准上实现性能提升;采用指令微调融合技术,在保持指令遵循能力的同时显著增强网络安全性能;通过推理大模型生成的网络安全任务思考步骤再交给大模型进行学习,赋予大模型长程推理能力,使其在网络安全测试集的实验中获得增益提升。
多元化大模型评估指标:通过结合主客观指标系统化衡量生成内容的质量和效果,其中客观指标侧重于文本形式化匹配,如基于召回率的ROUGE-1/2/L和基于n-gram重叠的BLEU-1至BLEU-4。而主观指标强调人类认知和任务场景适配性,如模型自主评判内容的QWen评分和WinRate。相较于传统单一指标评估,主客观结合的多元方法既能定量捕捉文本表层特征又可定性衡量模型对领域知识的掌握。

1 相关工作

1.1 大语言模型

大语言模型通过自监督预训练范式突破了传统自然语言处理任务的性能边界,展现出从文本生成、逻辑推理到跨模态理解等方面的通用智能潜力。国际学术界相继提出GPT-4、PaLM-2、Claude 3等代表性模型,在语言理解、代码生成等基准测试中持续刷新性能纪录。然而,国际主流模型的闭源属性与对底层技术依赖导致其在中文场景适配性、数据安全合规及产业可控性等方面存在显著局限,这为我国发展自主可控的大模型技术体系提出了迫切需求[9]。近年来,国产大模型领域涌现出以深度求索(DeepSeek)和阿里通义千问(Qwen)等领军者,通过技术创新与本土化实践,在中文场景适配性及产业可控性上展现了显著优势。
DeepSeek基于混合专家系统架构,借助动态激活策略实现模型参数利用率82%的技术突破,在1.3万亿Token训练规模下,推理效率相较于传统稠密模型提升了2.7倍,同时能以更低成本支持复杂任务,预训练语料库整合了中文专业数据,覆盖法律、金融等高价值场景,用于解决中文术语偏差问题。Qwen依靠混合专家架构与动态稀疏激活技术,提高了推理速度,其预训练数据融合各个行业数据,形成独特的跨模态知识融合能力,依靠动态扩展能力更适合需要快速迭代的互联网业务。

1.2 安全运维数据集生成

在安全运维数据集生成领域,Long等[10]围绕大模型驱动的合成数据生成、整理和评估展开研究,定义了相关问题和数据要求,介绍了包括提示工程和多步生成的生成方法、高质量样本过滤和标签增强的数据整理策略,以及直接和间接的数据评估方式。同时,提出未来可从复杂任务分解、知识增强、大小模型协同、人机协作等方向进行研究的建议,旨在推动该领域的发展,助力构建领域特定数据集。Cichecki 等[11]提出了一系列通用的数据合成技术。虽然标注可以被视为一种特殊类型的合成,将特定样本的输入作为合成条件,但也存在专门适用于数据标注的方法。其中,选择性标注是最重要的实践之一。选择性标注代表了在昂贵且精确的人工标注和经济但相对粗糙的基于大语言模型的标注之间的一种最优权衡方法。目前,生成复杂结构数据需依赖人工任务分解,模型无法自主规划推理路径,基于大模型驱动的数据生成主要是为了满足指令微调的需求,尚未涉及其他微调阶段。

1.3 安全运维大模型

在网络安全运维领域,从零开始构建一个大语言模型面临着诸多挑战,这一过程极为复杂且耗费大量资源。相较而言,选取一个通用的大语言模型作为基础架构,并在此之上依据网络安全运维的特定需求进行微调优化,是一种更为高效便捷的策略。这一方法不仅能够充分利用通用模型已有的强大语言处理能力,还可通过针对性的微调,使其精准适配网络安全运维场景下的专业知识要求和任务特性,进而为该领域的实际应用提供有力支撑。
针对网络安全领域大语言模型训练数据集稀缺的问题,Yu等[12]提出PRIMUS系列开源数据集。该数据覆盖了大模型训练流程中的关键节点,从文本预处理到专业知识强化,再到实战场景模拟,为网络安全大模型的训练构筑起数据基石。他们还开发了Llama-Primus系列网络安全专用大模型,为网络安全领域大语言模型的深化研究勾勒出新的路径范式。但PRIMUS系列数据集的实验仅限于参数规模为8B的模型,未验证更大规模模型的适用性。在指令数据生成方面,Zhang等[13]提出基于系统性分类的指令生成框架,通过融合专家知识与LLMs生成能力,构建包含8类核心任务的高质量指令集;还引入动态威胁场景模拟与多源知识库融合机制,有效解决安全数据敏感性、逻辑连贯性等问题。实验表明,采用LoRA低秩适应技术的HackMentor框架,在仅训练0.1%参数量的情况下实现响应精度的提升,其构建的多维度评估体系为模型性能评估提供了新范式。但该实验仅评估了网络安全领域的表现,未验证模型在通用领域能力是否退化。Guo等[14]针对大模型输入长度限制问题,提出基于同质马尔可夫链假设(Homogeneous Markov Context Extension method,HMCE),实现上下文片段间的依赖关系有效建模,在保证计算效率的同时提升了长文本推理性能[14]。文章还提出的混合适配器策略通过动态激活多专家模块,实现了不同运维任务间的知识迁移与干扰抑制,为垂直领域大模型的灵活部署提供了新思路。但其评估模式依赖于GPT-4作为评分模型,这种依赖性可能引入外部模型的偏差。Aghae等[15]针对网络安全领域文本特性,提出定制化分词器与权重噪声调整策略,构建基于RoBERTa的专用语言模型。通过混合通用与网络安全专属词汇优化分词器,并在预训练权重中注入高斯噪声以平衡通用语义理解与领域知识学习,解决了网络安全术语多义性及数据稀疏性问题。但模型在零样本场景下的异常检测任务中,尽管表现优于传统方法,但效果仍然不理想。Pal等[16]创新构建基于T5架构的生成式多任务统一(Unified Text-to-text cyberSecurity, UTS)模型,首次实现恶意软件报告、钓鱼链接等多模态安全数据的联合建模。其提出的任务前缀提示机制使模型在少样本场景下即可快速适应新型威胁检测任务,为解决网络安全数据分散问题提供了创新方案。该研究的提示工程只使用简单任务前缀,未考虑细粒度提示优化,可能导致知识迁移效率低。

2 本文方案

本文提出的LEAD-Cyber模型框架如图1所示,模型框架包括训练数据集、大模型微调、模型评测3个核心环节。首先搭建网络安全领域的大模型的全周期微调数据库;其次用预训练、指令微调和推理微调对DeepSeek-7B/14B和QWen-14B进行大模型微调;最后采用WinRate、BLEU、Rouge等评估方法对大模型进行全面评价。
图 1 LEAD-Cyber模型框架

Fig.1 LEAD-Cyber framework

2.1 数据集构建

在不断发展的安全知识智能化的进程中,数据数量和质量的困境一直是长期存在的。生成合成数据能够有效缓解真实世界数据缺失的局限性[17]。研究人员从不同来源收集网络安全知识,为大模型不同阶段的训练构建数据集——LEAD数据集,数据集覆盖了部分网络上的网络安全内容,按照训练阶段分为预训练数据集、指令微调数据集和推理微调数据集,3个数据集统计数据如表1~表3所示。各个数据集的示例参见附录A。
表 1 预训练数据集统计数据

Table 1 Pre-training dataset statistics

种类样本数Tokens平均Token
网络安全新闻261087510023352.8
网络安全数据集61662910124471.9
网络安全网站7683265798151856.3
网络安全维基百科6127765236124.8
MITRE数据库34322412114702.8
表 2 指令微调数据集统计数据

Table 2 Instruction fine-tune dataset statistics

种类样本数Tokens平均Token
MITRE 攻击技术84232748424326.3
MITRE 战术40180601201
MITRE 软件工具82861781490215
MITRE 攻击组织1849523267283
MITRE 活动事例440114884261.1
MITRE 缓解措施1095277254253.2
MITRE 实体关系1633436500267.3
表 3 推理微调数据集统计数据

Table 3 Reasoning fine-tune dataset statistics

种类 样本数 Tokens 平均Token
多项选择题 1000 691670 691.67
根因映射 1000 761100 761.10
漏洞严重性预测 1000 1155830 1155.83
攻击技术提取 60 78810 1313.50
预训练数据集:本文从FineWeb的15万亿Token、44TB规模英语网页文本中,通过多级关键词匹配,如“恶意软件”“漏洞攻防”“访问控制”等关键词,与领域知识图谱对齐,提取网络安全相关语料构建预训练数据集[18]。参考FineWeb-Edu教育子集的设计思路,构建针对网络安全攻击模式、防御策略的专项语料库。
指令微调数据集:本文引入了MITRI ATT&CK数据库,该数据库是由MITRE Corporation创建的网络安全知识库,该数据库的特点是系统化地从攻击者视角描述网络入侵行为的战术、技术及特征[19]。该数据库包含攻击技术、战术、软件工具、攻击组织、活动事例、缓解策略以及实体关系,共计2262个实体。通过对该数据库中的数据进行整理和提取,再使用大模型数据生成,构建了包含约22130个样本的网络安全任务指令微调的数据集。
推理微调数据集:针对网络安全场景下的大模型长链推理能力,本文借鉴知识蒸馏理论思想,构建了推理微调数据集,聚焦需深层次逻辑推理而非机械式记忆的网络安全任务。通过将网络安全任务的推理步骤以及自反数据进行收集和整理,构建推理微调数据集,以此数据集训练大语言模型在复杂的安全场景中的长思维能力。随着推理模型DeepSeek-R1的发布,更多的研究尝试模拟其推理能力,为此从CTI-Bench数据集中挑选出4类网络安全推理任务,并将这些任务利用DeepSeek-R1推理一至两次,从中记录下推理步骤以及反思后的解答,所挑选的任务见表4[20]
表 4 CTI-Bench数据集网络安全推理任务

Table 4 Reasoning task on dataset CTI-Bench

任务名称 解决要求
根因映射 需理解漏洞机制,推断根本原因而非字面匹配
漏洞威胁预测 需推断攻击向量、影响范围等隐含信息
攻击技术提取 需综合分散信息识别战术、技术和程序
多项选择题 需理解威胁识别、检测策略、缓解技术等知识
在目前已公开发表的网络安全相关专业语料库中,较有代表性的为中国科学院信息工程研究所发布的HackMentor数据集,其统计数据如表5所示。该数据集采用人工构造与筛选相结合的方式生成144条种子指令,并通过自指导方法生成14 236条指令数据。对话数据则基于网络安全知识库生成,结合ChatGPT生成30 417条对话数据。HackMentor数据集与LEAD数据集最大的区别在于构建方式,HackMentor数据集的构建方式可以总结为利用大模型和少量的种子数据生成问答对,并且通过采用一次性学习(one-shot learning)优化生成质量,而LEAD数据集是利用大模型从丰富的网络安全知识库构建指定格式的问答对。后续小节将基于该数据集构建测试集,并引入经HackMentor数据集微调的大模型进行实验评估。
表 5 HackMentor数据集统计数据

Table 5 HackMentor dataset statistics

数据类型 种子数据 数据集规模 数据集构成
指令数据 144条种
子指令
14236 包含指令、输入、输出三元组
对话数据 70个对话 30417 基于知识库的多轮对话

2.2 数据集预处理

数据预处理是提升网络安全大模型性能和泛化能力的重要步骤。本文在该部分从两方面改进原始数据:①网络爬取或日志等海量文本通常存在冗余和低质量问题,去除这些数据;②预训练语言模型可测量文本困惑值,用困惑值量化文本是否遵循语言规范,找出困惑值过高的数据噪声,并过滤噪声数据。本文根据语言模型所使用数据,以英文维基百科作为预训练数据训练出语言模型后,再在此基础上应用生成的质量评分,从文本内容和语义出发,给出领域内的质量评分阈值,将低于质量阈值的数据视为噪声文本,去除这些噪声数据,保障数据集在语义上更加相似可靠[21]
一些互联网文本出现多次或相似的情况,会造成模型过度拟合以及训练数据泛化能力过低的问题。因此,本文采用基于MinHash的模糊哈希技术,通过文本哈希指纹寻找相似性[22],相比于精确查找可以保证语义的重复或局部修改的文本被相似文本所检索出来,再配合去重软件实现大量数据的去重,从实际效果上保证数据的多样化、均衡性,避免数据重复,从而对模型带来误导信息。综上所述,本文完成对安全数据的大模型训练数据预处理。

2.3 数据生成

由于网络安全领域的训练数据缺少高质量的标注信息,数据标注难度较大,同时网络安全数据还具有敏感性。因此,本文尝试在不同训练阶段使用基于提示词工程和语言大模型的伪造数据,弥补真实数据量不足,并提升模型在未知领域数据的泛化效果。本文构造了满足模型在预训练、指令微调和推理微调等训练阶段需求的训练安全数据集。

2.3.1 提示工程

大模型生成合成数据的最大优势在于其具有指令跟踪能力,容易实现大模型生成的可控性,因此,很多方法尝试用提示工程引导大模型以提高合成数据的忠实度和多样性。需要注意两个问题,即任务规范与提示条件。
任务规范:在传统的数据标注工作中,通常会为工作人员提供一份代码手册,其中规定了必要的上下文,如任务目的、数据解释和其他背景知识,以便更好地理解工作。同样,这样的任务规范对于大模型驱动的数据生成至关重要。提示词用于定义任务背景和要求,为大模型设定生成语境。在提示词中明确需要生成的问题类型,本研究中构建了4类原子问题模板:①概念描述型(“描述X”);②检测机制型(“X如何检测Y?”);③防御策略型(“X如何缓解Y?”);④攻击模式型(“攻击软件X如何使用攻击技术Y?”),其中X和Y从预定义的实体列表中取值[23]。此外,还需要定义输出格式,如JSON格式和特定实体类型等。
提示条件:通过属性组合控制生成数据的多样性和覆盖范围。明确的指令可以约束生成内容的范围,例如指定数据格式、领域知识或特定任务要求,避免生成无关信息或冗余信息。设计精细的提示词可以减少模型幻觉(Hallucination),确保生成数据符合实际场景需求,尤其是在需要结构化输出的任务中。结合垂直领域的专业需求,通过提示词注入行业术语和规则,增强生成数据的可用性。

2.3.2 多步生成

数据生成从基于知识驱动的Q-A对构建框架开始,首先建立数据集的知识本体的语义框架。通过将整体生成过程分解为链式子任务,对长文本样本进行分解和总结,并查找与文本相关的内容,将生成的内容和数据集生成提示词结合,再通过大模型生成数据集。需要注意的是,总结的内容不一定成为最终生成的一部分,但明确输出一些中间推理步骤也可以提高复杂数据的生成效果。从预处理文档中提取的<实体X,技术Y>对,由此,生成过程严格遵循Schema-Guided原则,其中20%的数据集由人工构建,剩余80%的数据集采用Deepseek-R1模型进行参数化知识抽取,通过Dual-Prompt机制实现结构化输出,单次推理可生成多组含思维链的{问题,标准化答案,引用}三元组数据,数据生成的步骤如图2所示[24,25]。数据生成的提示词参见附录B。
图 2 问答对数据生成的示例

Fig.2 Example of Q&A for data generation

2.4 基座模型

在网络安全大模型的架构设计中,基座模型的选择直接影响模型对多模态威胁数据的学习能力与任务泛化性能。

2.4.1 模型选择

DeepSeek模型是由深度求索公司专门针对中文语料环境下语义理解和推理而训练的,是一款聚焦中文网络黑产的大模型,其预训练语料来源于国内安全厂商的威胁情报报告、黑客社区的交流对话及攻防演练脚本,通过分层知识蒸馏,以较少的参数实现中文网络黑产术语的识别以及APT攻击复杂社会工程话术的语义意图分析,避免了英文大模型因知识缺口而在中文黑产数据上产生语义鸿沟[26]
QWen大模型是阿里巴巴推出的通用大模型,属于混合专家模型,在一些复杂的语义任务中表现优秀。一方面,通过扩充18万亿标记量的预训练数据集,并设计优化混合专家模型,在模型的推理稳定性和任务匹配度方面都取得了一定的进步,另一方面QWen通过不断的迭代,验证了其在不同场景下的普适性[27]
结合模型的开源性、领域适配性、计算效率性以及国产化特点,在以上方法中选择DeepSeek-7B/14B和QWen-14B作为本次基座模型,DeepSeek-base的设计过程中采用多层注意力机制降低了训练成本。在开放评测中,QWen训练所耗费的训练资源比其他密集模型有所减少,接近GPT-3.5水平。

2.4.2 减少幻觉

针对网络安全大模型训练的过程,使用提示工程对大模型微调和生成过程进行约束,降低其幻觉问题。首先在微调阶段使用提示,对输入到大模型中的数据进行严格的筛选和验证,在大模型中引入安全领域的专业且贴近现实的问题,以约束微调模型错误响应,避免数据噪声或错误信息导致结果不客观。然后,在微调后的大模型生成阶段,在提示中设定硬约束和规则,以指导大模型输出已有知识内容和逻辑推理,而非编造的信息[28]。大模型在识别安全威胁、评估风险或提供解决方案时能够真实可靠地响应场景问题,不仅大幅提升模型在网络空间安全的场景中的应用可靠性和可信度,为网络环境提供稳定安全的防护方案。微调提示词参见附录B。

2.5 模型训练方法

不同于常规的端到端微调策略,本研究构建了"预训练−指令对齐−推理增强"的级联优化框架,通过3个步骤实现网络安全知识注入、通用能力保持与专业推理能力的协同进化。首先通过对基模型的持续预训练,利用预训练测试集来扩充模型的网络安全相关知识和理解,从而加强核心网络安全概念、使其给出正确安全威胁/缓解信息。在持续预训练阶段,重点提升大模型在CVE漏洞库、ATT&CK战术链等专业语料的知识留存率。其次通过指令微调数据集对大模型进行微调,来恢复模型的指令遵循能力,并通过模型融合对二者进行综合平衡。在指令微调阶段,设计基于网络安全事件响应构建的指令模式,通过对比损失函数维持模型的基础对话能力。最后本框架引入知识蒸馏机制,使模型能够从更大规模的教师大模型中学习网络安全相关问题的推理步骤,使用基于CTI-Bench构建的推理微调数据集来训练大模型的网络安全任务推理能力。
本实验采用两种微调方式:全参数微调和LoRA微调。全参数微调是在预训练模型的全部参数上进行更新,以适应特定领域的数据,一般效果较好,因为模型的全部参数都在适应新的任务或者领域数据。由于所有参数都要求更新存储,因此训练时间和显存需求较大。而LoRA微调则是将全部参数中的原模型权值冻结,只引入一个新的网络层进行训练,带来了许多优势,包括训练时间缩短,计算量降低和轻量级的训练权重[29]。LoRA微调示意如图3所示。
图 3 LoRA微调示意图

Fig.3 Schematic diagram of LoRA

LoRA采用了一种新的更新预训练权重矩阵$ {{\boldsymbol{W}}}_{0}\in {\mathbb{R}}^{d\times d} $。将全参微调的增量参数矩阵$ \Delta {\boldsymbol{W}} $表示为两个参数量更小的低秩近似矩阵AB,公式如下:
$ {{\boldsymbol{W}}}_{0}+\Delta {\boldsymbol{W}}={{\boldsymbol{W}}}_{0}+{\boldsymbol{BA}} $
其中,$ {\boldsymbol{B}}\in {\mathbb{R}}^{d\times r} $$ {\boldsymbol{A}}{\in \mathbb{R}}^{r\times d} $为LoRA低秩适应的权重矩阵,秩$ r $远小于$ d $
训练好的LoRA权重可以灵活地与原始权重结合,以满足特定的推理需求。
在实验中分别使用网络安全微调数据集对Deepseek 7B/14B和Qwen-14B大模型进行了全参数微调和LoRA微调。训练参数模型使用Huggingface的Transformers包在PyTorch中实现。训练的通用设置如下:最大长度为512,优化器使用Adam,批量大小为32,权重衰减为0。对于7B和14B语言模型(包括Llama和QWen),学习率分别设置为2×10−5和1×10−5。LoRA参数的具体设置如下:LoRA注意力维度为8,LoRA缩放的alpha参数为16,LoRA层的dropout概率为0.05。

3 实验与结果分析

3.1 模型评价指标

为综合衡量网络安全大模型的威胁检测、语义解析和答案生成的能力,本文提出一种结合通用NLP和行业相关评测指标的综合指标。通过对网络安全大模型输出的威胁评估报告、安全策略文稿等结果的规范性及完整性从BLEU(Bilingual Evaluation Understudy)、Rouge(Recall-Oriented Understudy for Gisting Evaluation)和安全决策采纳率(WinRate)进行评测[30-31]
BLEU基于n-gram对生成文本与参考文本的词汇进行匹配,以评估两个文本之间的词汇重叠度,适合用来评判大模型的回答是否准确。还有多个BLEU指标代表不同粒度的n-gram,例如,BLEU-1代表基于1-gram单词匹配度测量,反映了词汇层面上的对齐性,BLEU-2代表基于2-gram相邻双词匹配的度量,反映了局部语法的连贯性,BLEU-3代表基于3-gram匹配的度量,反映了更加长的词组结构,BLEU-4代表基于4-gram匹配的度量,反映了句子语法以及语义的一致性。
Rouge系列以召回率(Recall)为核心,重点关注参考文本的信息覆盖程度。ROUGE-L基于最长公共子序列衡量生成文本的逻辑连贯性,可有效验证问题与答案之间的语义对齐程度。
WinRate是依据大模型判断得出的一种安全性评测方法,通过将两个模型的生成结果直接对比得到的数值,用来描述模型生成的响应质量的大小关系。在模型评估过程中,若模型的生成结果对网络安全专家描述有利,则记为胜局,而当两个模型的响应结果没有明显差异,则记为和局,最终由胜率与和局率相加计算得出。

3.2 测试数据集

为检验提出模型的性能与效果,本文将所提出的部分指令微调数据集用作测试集,评估本文的模型。测试数据集包括攻击技术、攻击软件和缓解措施等类型的数据,包含4 427个问答样本和3 410个多项选择题。另外,选取两个网络安全数据集CTI-Bench和HackMentor-eval对微调后的大模型进行评估,以验证其对安全概念的全面理解。CTI-Bench是一个被广泛认可的关于CTI相关任务的推理与知识能力的基准测试,该基准测试包含多项子任务来衡量模型分析漏洞、安全风险的推断、攻击技术的提取以及安全概念的理解能力。每个子任务下包含多个由人工验证过的高质量测试问题。HackMentor-eval是一个包含网络安全领域相关的高质量的指令与对话的评测集,用于大模型的基准测试,检测语言模型在网络安全领域中的知识。

3.3 实验结果

(1)基于LEAD测试集的实验
微调后模型及各基线模型在测试集上进行实验,在LEAD测试集上的实验结果如图4所示。Llama-7b-iio代表使用HackMentor指令数据集对Llama-7b进行微调的大模型;Llama-7b-turn代表使用HackMentor数据集中的多轮对话数据集进行LoRA微调的llama模型。DeepSeek-V3是线上Deepseek对话模型。Deepseek-7b-origin代表原始的Deepseek模型,Deepseek-7b-lora是经过LEAD数据集LoRA微调的Deepseek-7b模型,而llama-7b-full是经过LEAD数据集全参数微调的Deepseek-7b模型。图4中展示了DeepSeek模型与各模型在不同指标上的差距,由于LEAD数据集包含了各种长度的数据集,因此,经过微调后的大模型在各项指标上都取得了不错的表现,其中经过全参数微调的DeepSeek-14b-full模型取得了最好的结果。
图 4 LEAD测试集上的实验结果

Fig.4 Experimental results on the LEAD test dataset

图5给出了各模型在LEAD测试集上的Rouge-L评分。相比于基线模型微调LoRA后的DeepSeek-7B模型和DeepSeek-14B模型的Rouge-L分数分别提升63.2%和38.5%,微调所有参数后的两个模型Rouge-L分数分别提升65%和40%。Rouge-L适用于表示长文本回答的召回率,说明大模型在对需要提供长文本回答的问题效果比原模型更好。这证明指令微调和推理微调对长文本的逻辑连贯性有强化作用。
图 5 LEAD测试集上的Rouge-L评分

Fig.5 Rouge-L scores on the LEAD test set

另外,本文利用基于Qwen-max的增强评估框架,对模型生成的网络安全响应进行评估,并给出0~100的主观评分,结果如图6所示。基线模型经过指令微调和推理微调后,结果绝大部分超过80分,处于较高且稳定的水平。而DeepSeek-V3和QWen-14b-origin呈现出一个两极分化的状态,这两个都是未经LEAD数据集微调的模型,仅对概念描述型问题有较好的效果。
图 6 LEAD测试集上的Qwen-max评分

Fig.6 Qwen-max scores on the LEAD test set

本文评估并对比了每个模型之间对每条指令的响应,将每一行所代表模型的输出分为3类:胜出(橙色)、平局(黄色)和落败(蓝色)。各模型在LEAD测试集上的WinRate结果如图7所示。QWen-14b-origin代表原始的QWen模型,QWen-14b-lora是经过LoRA微调的QWen模型,而QWen-14b-full则是使用全参数微调Qwen模型。如图7所示,微调后的Deepseek-7b模型和Qwen-14B模型在特定知识问答上的性能较未微调的模型更高。
图 7 LEAD测试集上的WinRate结果

Fig.7 WinRate results on the LEAD test set

(2)基于CTI-Bench测试集的实验
图8展示了各模型在不同指标上的差距,因为CTI-Bench中包含根因映射、漏洞威胁预测、攻击技术提取和多项选择题4大类问题,存在大量的单选题和需要长推理的问答题,简短答案的问答题占比较少,所以各个模型主要在Rouge-1和Rouge-L上取得高分。经过LEAD数据集全参数和LoRA微调的DeepSeek-7/14B模型在CTI-Bench上取得了较好的表现,说明推理微调确实有助于大模型理解不同类型的网络安全相关问题。
图 8 CTI-Bench测试集上的实验结果

Fig.8 Experimental results on the CTI-Bench test set

图9展示了各模型在CTI-Bench测试集上的Rouge-L评分。相比于基线模型,经过LoRA微调后的DeepSeek-7B模型和14B模型的Rouge-L分数分别提升了42.3%和63.2%,而经过全参数微调后,两个模型的Rouge-L分数分别提升了55.4%与61.6%。这验证了指令微调和推理微调对长文本逻辑连贯性具有增强作用。
图 9 CTI-Bench测试集上的Rouge-L评分

Fig.9 Rouge-L scores on the CTI-Bench test set

利用Qwen-max的线上模型对DeepSeek7B/14B模型和Qwen-14B模型生成的网络安全响应进行评估,其Qwen-max评分如图10所示。当基模型经过指令微调和推理微调后,新模型相较于原模型所产生的结果都处于较高且稳定的水平。说明LEAD的预训练数据、指令微调数据和推理微调数据可以让开源大模型在处理不同的网络安全问题时有更好的表现。
图 10 CTI-Bench测试集上的Qwen-max评分

Fig.10 Qwen-max scores on the CTI-Bench test set

基于每个模型组合在CTI-Bench测试集上进行实验,其WinRate结果如图11所示。首先,通过微调的DeepSeek-7B和Qwen-14B模型与原始模型相比拥有更好的性能,数据的质量在确定预训练和微调模型的质量方面起着至关重要的作用。值得注意的是,DeepSeek-14b-lora的WinRate表现无论是与其他模型对比还是与DeepSeek-14b-full对比,胜出的情况居多,这说明在进行推理微调时,过多地影响大模型的参数,会导致大模型的性能下降,而全参数微调对提高性能的影响更大。
图 11 CTI-Bench测试集上的WinRate结果

Fig.11 WinRate results on the CTI-Bench test set

(3)基于HackMentor-eval测试集的实验
图12展示了各模型在不同指标上的差距。其中经过LEAD数据集微调的DeepSeek-14b-full模型的闭合面积最大。HackMentor数据集主要由各种简单概念的问答题组成,规模更大的模型能学习到更多的知识,也更适合应对该类问题。
图 12 HackMentor-eval测试集上的实验结果

Fig.12 Experimental results on the HackMentor-eval test set

图13展示了各模型在HackMentor-eval测试集上的Rouge-L评分。与基线模型相比,经过LoRA微调后的DeepSeek-7B模型和14B模型的Rouge-L分数分别提升了8.9%和8.5%,而经过全参数微调后,两个模型的Rouge-L分数分别提升了7.4%与7.2%。这验证了指令微调和推理微调对长文本逻辑连贯性的增强作用。
图 13 HackMentor-eval测试集上的Rouge-L评分

Fig.13 Rouge-L scores on the HackMentor-eval test set

对全参数微调和LoRA微调后的DeepSeek7B/14B模型和Qwen-14B模型生成的网络安全响应进行评估,其Qwen-max结果如图14所示。在HackMentor-eval测试集上微调后的模型所得到的评分依然相较于其他模型处于更稳定且高水平的状态。由于HackMentor数据集是根据大模型自身的能力和种子数据启发而生成的,所以在Qwen-max评估实验中取得较好的成绩。
图 14 HackMentor-eval测试集上的Qwen-max评分

Fig.14 Qwen-max scores on the HackMentor-eval test set

基于每个模型的组合在HackMentor-eval上进行实验,其WinRate结果如图15所示。首先,通过微调的DeepSeek-7B和DeepSeek-14B模型与原始模型相比拥有更好的性能,数据的质量在确定预训练和微调模型的质量方面起着至关重要的作用。而且,较大的基本模型(14B>7B)的得分更高。这一现象与Transformer架构的理论相契合,更大规模的参数容量能形成更细粒度的知识激活模式,特别是在处理多跳推理问题时,14B级别模型展现出更优异的逻辑串联能力。微调后的Deepseek-7B模型和DeepSeek-14B模型在特定知识问答上的性能较未微调的模型更高。
图 15 HackMentor-eval测试集上的WinRate结果

Fig.15 WinRate results on the HackMentor-eval test set

4 结束语

本文提出的LEAD-Cyber框架基于开源大模型与全周期本地微调技术,构建了面向网络安全领域的大语言模型,为解决传统安全运维中的知识碎片化、响应效率低及数据敏感性等问题提供了创新方案。通过全周期的多层数据架构设计,融合预训练、指令微调和推理微调的全周期训练流程,结合大模型驱动的多步数据生成方法,构建了覆盖网络攻击模式、防御策略及MITRE ATT&CK框架的专业语料库,有效解决了领域数据稀缺与格式适配难题。实验结果表明,采用LoRA低秩适应与全参数调整的微调策略能够显著提升模型性能。其中LoRA微调后的DeepSeek-14B和Qwen-14B模型在CTI-Bench上Rouge-1指标上分别提升了63%与63.2%,且在安全决策采纳率评估中展现出显著优势,验证了模型在威胁分析、漏洞根因推理等复杂任务中的实用价值。
1
秦小林, 古徐, 李弟诚, 等. 大语言模型综述与展望[J]. 计算机应用, 2025, 45 (3): 685- 696.

QIN X L, GU X, LI D C, et al. Review and prospects of large language models[J]. Computer Application, 2025, 45 (3): 685- 696.

2
BROWN T B , MANN B , RYDER N , et al. language models are few-shot learners[J]. Advances in Neural Information Processing Systems, 2020, 33:1877-1901.

3
仝鑫, 夏天, 杨孟辉, 等. 大语言模型的事实性问题研究: 评估、增强和展望[J]. 情报理论与实践, 2025, 48 (7): 81- 93.

DOI

TONG X, XIA T, YANG M H, et al. A Study on Factuality Issues in Large Language Models: Evaluation, Enhancement, and Prospects[J]. Information Studies: Theory & Application, 2025, 48 (7): 81- 93.

DOI

4
陈志坚, 彭林锋. 基于安全分析大模型应用的智能问答系统设计[J]. 网络安全和信息化, 2024 (9): 124- 126.

CHEN Z J, PENG L F. Design of intelligent question-and-answer system based on security analysis large model application[J]. Network Security and Informatization, 2024 (9): 124- 126.

5
Lewis P, Perez E, Piktus A, et al. Retrieval-augmented generation for knowledge-intensive nlp tasks[J]. Advances in Neural Information Processing Systems, 2020, 33, 9459- 9474.

6
方全, 张金龙, 王冰倩, 等. 基于组合上下文提示的大型语言模型领域知识问答研究[J]. 计算机科学, 2025, 52 (11): 13- 21.

FANG Q, ZHANG J L, WANG B Q, et al. Research on Domain Knowledge Question Answering for Large Language Models Based on Composite Context Prompting[J]. Computer Science, 2025, 52 (11): 13- 21.

7
ElZemity A, Arief B, Li S. CyberLLMInstruct: A new dataset for analysing safety of fine-tuned LLMs using cyber security data[J]. arXiv preprint arXiv:, 2503, 09334, 2025.

8
Kouremetis M, Dotter M, Byrne A, et al. Occult: Evaluating large language models for offensive cyber operation capabilities[J]. arXiv preprint arXiv, 2502, 15797, 2025.

9
安晖. 国产大模型研发现状与创新方向[J]. 科技与金融, 2023 (10): 65- 66.

DOI

AN H. Discovery status and innovation direction of domestic big models[J]. Science and Finance, 2023 (10): 65- 66.

DOI

10
LONG L, WANG R, XIAO R, et al. On LLMs-driven synthetic data generation, curation, and evaluation: A survey[J]. arXiv preprint arXiv:, 2406, 15126, 2024.

11
KOCOŃ J, CICHECKI I, KASZYCA O, et al. ChatGPT: Jack of all trades, master of none[J]. Information Fusion, 2023, 99, 101861.

DOI

12
YU Y C, CHIANG T H, TSAI C W, et al. Primus: A pioneering collection of open-Source datasets for cybersecurity LLM training[J]. arXiv preprint arXiv:, 2502, 11191, 2025.

13
Zhang J, Wen H, Deng L, et al. Hackmentor: Fine-tuning large language models for cybersecurity[C]//Proceedings of the 2023 IEEE 22nd International Conference on Trust, Security and Privacy in Computing and Communications (TrustCom), Exeter, UK. IEEE, 2023: 452-461.

14
GUO H, YANG J, LIU J, et al. Owl: A large language model for it operations[J]. arXiv preprint arXiv:, 2309, 09298, 2023.

15
AGHAEI E, NIU X, SHADID W, et al. Securebert: A domain-specific language model for cybersecurity[C]//International Conference on Security and Privacy in Communication Systems. Cham: Springer Nature Switzerland, 2022: 39-56.

16
PAL K K, KASHIHARA K, ANANTHESWARAN U, et al. Exploring the limits of transfer learning with unified model in the cybersecurity domain[J]. arXiv preprint arXiv:, 2302, 10346, 2023.

17
PATEL A, RAFFEL C, CALLISON-BURCH C. Datadreamer: A tool for synthetic data generation and reproducible llm workflows[J]. arXiv preprint arXiv:, 2402, 10379, 2024.

18
PENEDO G, KYDLÍčEK H, LOZHKOV A, et al. The fineweb datasets: Decanting the web for the finest text data at scale[J]. Advances in Neural Information Processing Systems, 2024, 37, 30811- 30849.

19
AL-SHAER R, SPRING J M, CHRISTOU E. Learning the associations of mitre att & ck adversarial techniques[C]//Proceedings of the 2020 IEEE Conference on Communications and Network Security (CNS), Avignon, France. IEEE, 2020: 1-9.

20
ALAM M T, BHUSAL D, NGUYEN L, et al. Ctibench: A benchmark for evaluating llms in cyber threat intelligence[J]. arXiv preprint arXiv:, 2406, 07599, 2024.

21
SHI H, XU Z, WANG H, et al. Continual learning of large language models: A comprehensive survey[J]. ACM Computing Surveys, 2024.

22
WU W, LI B, CHEN L, et al. A review for weighted minHash algorithms[J]. IEEE Transactions on Knowledge and Data Engineering, 2020, 34 (6): 2553- 2573.

23
KRISHNA V B. AttackQA: Development and adoption of a dataset for assisting cybersecurity operations using fine-tuned and open-source LLMs[J]. arXiv preprint arXiv:, 2411, 01073, 2024.

24
DU Y, ORABY S, PERERA V, et al. Schema-guided natural language generation[J]. arXiv preprint arXiv:, 2005, 05480, 2020.

25
YANG Y, LEI W, HUANG P, et al. A dual prompt learning framework for few-shot dialogue state tracking[C]//Proceedings of the ACM Web Conference 2023 (WWW 2023), Austin, TX, USA. 2023: 1468-1477.

26
BI X, CHEN D, CHEN G, et al. Deepseek LLM: Scaling open-source language models with longtermism[J]. arXiv preprint arXiv:, 2401, 02954, 2024.

27
YANG A, YANG B, ZHANG B, et al. Qwen2. 5 technical report[J]. arXiv preprint arXiv: 2412.15115, 2024.

28
ZHANG H, DENG H, OU J, et al. Mitigating spatial hallucination in large language models for path planning via prompt engineering[J]. Scientific Reports, 2025, 15 (1): 8881.

DOI

29
Hu E J, Shen Y, Wallis P, et al. Lora: Low-rank adaptation of large language models[C]//Proceedings of the 10th International Conference on Learning Representations (ICLR 2022), Virtual Online. 2022.

30
PAPINENI K, ROUKOS S, WARD T, et al. BLEU: a method for automatic evaluation of machine translation[C]//Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics (ACL 2002), Philadelphia, Pennsylvania, USA. 2002: 311-318.

31
LIN C Y. Rouge: A package for automatic evaluation of sum-Maries[C]//Text Summarization Branches Out. 2004: 74-81.

文章导航

/