Zero-shot hidden link detection with large language models via chain-of-thought prompting

  • An Xiangxiang 1 ,
  • Guo Lizhi , 2, * ,
  • Zheng Xiaotong 1
Expand
  • 1. School of Computer Information Management, Inner Mongolia University of Finance and Economics, Hohhot 010070, China
  • 2. Information Construction and Management Center of Inner Mongolia University of Finance and Economics, Hohhot 010070, China

Online published: 2026-06-24

Copyright

Copyright ©2026 Journal of Aeronautical Materials. All rights reserved.

Abstract

Website hidden link detection faces significant challenges, as traditional methods often suffer from limited model generalization, heavy reliance on feature engineering, and poor interpretability of detection results. To better address these issues, this study proposes a zero-shot hidden link detection method driven by chain-of-thought prompting in large language models. By leveraging the strong natural language understanding and complex reasoning capabilities of large language models and chain-of-thought prompting strategies specifically designed for hidden link detection scenarios, the proposed method effectively enhances model generalization and innovatively provides interpretable outputs for detection results. Both subjective and objective metrics are employed to quantitatively evaluate the performance of the large language model and to verify the effectiveness of the prompting strategy in hidden link detection. The evaluation metrics include accuracy, precision, recall, and F1. Experimental results show that the proposed method achieves an F1 of 0.98, outperforming the baseline methods. This study provides an effective technical solution for hidden link detection in scenarios lacking high-quality datasets and further lays a foundation for the application of general-purpose large language models in cybersecurity detection tasks.

Cite this article

An Xiangxiang , Guo Lizhi , Zheng Xiaotong . Zero-shot hidden link detection with large language models via chain-of-thought prompting[J]. Journal of Cybersecurity, 2026 . DOI: 10.20172/j.issn.2097-3136.260531

0 引言

随着大数据时代的发展,上网已经成为社会大众必备的技能。2025年8月,中国互联网络信息中心(CNNIC)在京发布第57次《中国互联网络发展状况统计报告》,报告显示,截至2025年12月我国网民规模达11.25亿人,互联网普及率达80.1%。其中,搜索引擎用户规模达7.77亿人,占网民整体的69.2%。人们享受便捷网络服务的同时,也持续遭受各类网络安全威胁。其中,暗链植入一直是困扰各大网站的网络威胁之一。依据安恒信息研究院2025年9月发布的网络安全月报,仅9月,全国范围内共计294764个组织及个人网站遭受暗链植入,新增未被检出的暗链样本31049条,从组织类型来看,受影响较多的主体为事业单位、民办非企业单位。在当前网络安全态势下,暗链检测的必要性进一步凸显。暗链是指通过CSS样式修改、HTML结构伪装或网页内嵌等方式隐藏的网页外链,属于黑帽SEO借助网站外链抬高自身站点排名的常用手段[1]。暗链检测即识别网站页面内是否存在被恶意植入的暗链。
围绕暗链检测问题,现有研究主要依托传统机器学习与深度学习方法开展。早期研究通常依托人工设计的锚文本、链接结构及页面特征构建分类模型,以此识别异常外链。此类方法在专属数据集上可取得较好检测效果,但高度依赖人工特征工程,模型泛化能力有限,难以适配持续迭代变异的暗链攻击形式。随着深度学习技术演进,部分研究利用神经网络自动学习网页深层特征,降低特征工程人工干预度。然而,这类方法依旧受限于训练数据的规模与质量,面对新型暗链攻击模式时检测性能易大幅衰减。此外,传统机器学习与深度学习模型均将暗链检测视作黑盒二分类任务,缺乏判定过程的显式推理机制,检测结果可解释性缺失,难以落地于实际网络安全运维场景。
近年来,大语言模型(large language model, LLM)在自然语言理解、多步逻辑推理任务中表现出优异性能,为网络安全垂直检测任务提供了全新技术路径。依托提示学习的零微调范式,可在不更新模型底层参数的前提下引导通用大模型完成定制化检测任务,适配小样本、零样本数据稀缺场景。但现有通用提示学习方案大多仅激发模型原生推理能力,推理逻辑依托模型内部隐式运算生成,缺少结构化外部约束,导致检测结果稳定性、一致性较差,工程落地难度较高。与此同时,如何在零标注前提下引导通用大模型生成符合网络安全领域规范的推理链路,仍是暗链检测领域待解决的痛点问题。
针对以上研究短板,本文提出一种基于思维链提示的零样本暗链检测方法,通过设计结构化暗链检测思维链(dark link detection-chain of thought, DLD-CoT)提示策略,将单一暗链二分类任务转化为链路完整、逻辑可追溯的安全分析任务。该策略通过任务指令明确模型分析边界,依托网络安全领域判别标准嵌入暗链先验知识,借助多步骤推理范式约束模型分析路径,最终输出结构化检测结论。该方法无需标注数据集与模型参数微调,可高效识别变异暗链,适配互联网网站暗链数据稀缺、攻击迭代频繁的真实运维场景。
实验结果表明,在包含多类变异暗链的混合测试数据集上,本文方法准确率、精确率、召回率、F1值均优于传统机器学习与深度学习基线模型,其中F1值达到0.98,具备优异的检测精度与跨场景泛化能力。同时模型可同步输出暗链网页定位、违规判定依据、网站整改建议三类结构化信息,补齐了传统方法结果不可解释的短板,支撑后端安全运维闭环处置。综上,本文既为零标注场景下的暗链检测提供了新范式,也为LLM在网络安全领域的显式推理落地应用奠定了研究基础。

1 相关研究

1.1 传统机器学习检测方法

随着互联网技术的持续发展,网站暗链的隐藏形式不断复杂化。早期暗链检测依赖人工经验,邢容等[2]提出基于静态文本识别的暗链检测技术。为降低人工干预程度,部分研究将监督学习应用到暗链检测中,如孟池洁等[3]提取网站源码中的锚文本特征训练分类模型,实现暗链自动检测;周文怡等[4]融合暗链域名、锚文本及隐藏结构特征训练分类模型,进一步提升检测精度。也有部分研究从文本语义与特征优化两个维度对传统方法进行改进,如通过主题模型增强文本特征的语义表达能力、利用特征筛选解决高维特征带来的训练复杂度问题[5-7]。随着深度学习技术的发展,研究者开始尝试利用深度模型自动学习暗链特征,进一步降低对特征工程的依赖。袁振[8]将图神经网络(graph neural network, GNN)引入暗链检测,提出联动文本特征和结构特征实现暗链特征增强,但基于网站DOM树构建异构图会带来计算复杂度偏高的问题。基于传统机器学习的检测方法主要通过增强特征表示优化分类模型以提升检测性能,检测过程缺乏显式推理机制,难以满足安全运维场景对结果可解释性的要求,因此,研究者开始关注如何在检测流程中引入显式推理机制。

1.2 大语言模型在网络安全中的应用

大语言模型具备强大的自然语言理解与逻辑推理能力,为解决复杂网络安全任务提供了新路径。LLM通过海量语料预训练涌现出强逻辑推理能力,这是其落地网络安全任务的核心基础[9]。现有研究已将LLM应用于漏洞检测、恶意链接分析、网络入侵检测以及安全日志解析等细分任务[10],研究主线可分为领域微调、外部知识增强以及二者融合三类。Uddin等[11]提出结合生成式人工智能与传统安全算法强化威胁识别能力,在新型网络威胁检测中取得良好效果;宋泽楷等[12]指出LLM可从无标签原始数据中挖掘隐性异常特征,为零标注异常检测提供新思路。进一步地,张欣等[13]从数据增强、模型结构优化层面构建LLM驱动的虚假信息检测框架,证实LLM在安全文本语义理解上具备显著优势。Decusatis等[14]以ChatGPT为研究对象,剖析通用LLM解析安全日志的优劣,结果表明,未经领域适配或外部知识增强的原生LLM,无法直接适配网络安全专业检测任务。Yaacoub等[15]则提出,LLM工程部署还需重点防控数据泄露风险。综上,通用LLM在网络安全细分任务中已实现初步落地,但普遍面临领域适配不足、数据安全管控缺失两类问题。部分研究通过参数微调实现领域适配,如Bayer等[16]构建专用网络安全预训练模型CySecBERT,提升领域词汇语义权重,验证了领域适配的必要性,但该方案存在标注数据集构建成本高、算力消耗大的缺陷。针对恶意网站识别场景,Bitaab等[17]采用两阶段微调策略改造LLM,完成欺诈网站分类并同步输出判定依据,验证了LLM实现可解释安全检测的可行性。关永健等[18]依托开源基座LLM与全周期安全数据集,搭建垂域专用模型LEAD-Cyber,平衡模型通用能力与领域适配需求。然而参数微调高度依赖高质量标注数据,无法适配网络安全领域数据稀缺的现状,且微调模型极易受训练数据分布限制,面对快速迭代的新型网络攻击泛化能力较弱。

1.3 基于思维链的提示学习方法

提示学习是激发LLM推理潜能的轻量化方案,相较于模型预训练与参数微调,具备低成本、易迁移的优势,在小样本、零样本场景适配性更强[19],思维链提示是提示学习体系下典型的多步推理范式。当前思维链提示相关研究主要分为少样本思维链提示(few-shot chain-of-thought, few-shot-CoT)、零样本思维链提示(zero-shot chain-of-thought, Zero-shot-CoT)两大分支,后续研究逐步向推理结构化、垂直领域落地延伸。
Few-shot-CoT的核心思路是依托少量标注样例,引导通用LLM习得任务专属推理逻辑。2022年Wei等[20]首次提出CoT提示范式,通过在少样本样例中补充中间推理步骤,大幅提升LLM在算术、符号推理等任务上的性能。后续研究结合知识蒸馏、符号推理技术,将复杂推理能力迁移至轻量化小模型与定制任务模型[21-22]。康睿哲[23]面向算力受限终端场景,将聚类算法与CoT结合,提升提示样例异质性,强化模型复杂推理效果。该类方法可通过样例显式传递推理链路,但检测效果高度依赖人工构造样例的质量与代表性,在暗链这类标注稀缺的安全场景落地难度较大。
为破除样例依赖,学界提出零样本思维链提示,无需提供成对输入输出样例,仅依靠自然语言指令激活模型推理能力。Kojima等[24]提出Zero-shot-CoT,仅在任务指令末尾添加“请逐步推理”,即可有效激活LLM多步推理能力。后续研究围绕提示话术优化、外部知识融合完善零样本推理框架,马冰琦等[25]针对威胁情报抽取泛化性差、长文本解析困难的痛点,融合提示工程与外部领域知识库,降低模型幻觉概率,为安全领域零样本文本分析提供参考。但原生Zero-shot-CoT推理链路由模型内部隐式生成,缺少外部结构化约束,极易出现推理跳跃、结论前后矛盾的问题,无法满足安全检测的高可靠性要求。
为解决推理不稳定问题,学界开始聚焦大模型推理流程的结构化管控。陶江垚等[26]从认知科学视角划分结构化提示四类范式,证实结构化提示可同步提升LLM复杂推理与跨场景泛化能力。网络安全领域也逐步开展相关落地研究,Chen等[27]提出COTVD漏洞检测框架,融合静态程序分析与CoT推理,将漏洞检测召回率提升至94.77%;林博等[28]提出CotRepair漏洞修复方法,通过任务拆解缩小补丁搜索空间,提升漏洞修复准确率;巴泽智等[29]梳理自动化提示工程技术演进脉络,指出提示工程正从人工定制向场景封装自动化转型。现有结构化提示研究可显式规范推理步骤,缓解原生零样本提示的不稳定性,但仍存在三点短板:缺少网络安全专属领域知识嵌入机制、推理链路无统一行业规范、输出结果缺少标准化工程化格式。
综合上述研究可知,现有CoT提示学习仍存在明显局限:Few-shot-CoT依赖标注样例,无法适配暗链检测零标注场景;原生Zero-shot-CoT推理无外部约束,结果稳定性、可解释性不足;现有垂域结构化提示研究未形成统一任务建模框架,难以兼顾推理管控与工程落地需求。

2 基于DLD-CoT提示策略的大语言模型网站暗链检测方法

2.1 暗链检测方法框架

基于DLD-CoT提示的大语言模型网站暗链检测框架由数据预处理层、DLD-CoT约束层、LLM输出层构成,如图1所示。
图 1 基于DLD-CoT策略的大语言模型网站暗链检测框架

Fig.1 DLD-CoT Strategy-Based Framework for Website Dark Link Detection

各层在功能上相互衔接,共同完成从提取原始网页数据结构到暗链检测结果输出的任务。其中,数据预处理层主要负责对网页源码进行规范化处理以保证数据输入质量;DLD-CoT约束层通过结构化提示对模型推理过程进行显式引导,是实现暗链检测的核心环节;LLM输出层在约束条件下生成标准化的检测结果。

2.1.1 数据预处理层

实际网页源码通常包含大量与暗链检测无关的噪声信息,如代码注释、格式化空白字符以及与页面逻辑无关的冗余标签等。这类冗余内容会增加大模型的处理负担,还会干扰模型对网页关键特征的识别。因此,数据预处理层用于对网页源码进行清洗与规范化处理,旨在减少冗余信息对模型推理的干扰,进而提升输入源码的数据洁净度。具体的预处理步骤包括:(1)移除HTML、CSS以及JavaScript中的无关注释信息;(2)去除多余的空格、换行符等格式噪声;(3)过滤掉与页面内容无关的标签片段,如统计脚本、第三方插件代码等非核心结构;(4)统一转换网页编码以确保文本格式的一致性。完成上述预处理后,将洁净源码存入源码数据池,保障向DLD-CoT约束层输入的数据质量。

2.1.2 DLD-CoT约束层

DLD-CoT约束层是整个检测框架的核心,主要作用是将暗链检测从单纯结果分类转换为具备明确判定逻辑的安全推理任务。该层通过定义任务指令明确LLM聚焦于网站暗链检测领域,注入暗链定义、特征等专业知识,保障LLM判定依据统一。在此基础上,DLD-CoT将暗链检测重构为链路化的二分类推理过程:首先解析输入网页源码并提取全部链接实体,链接实体包含源码片段、目标URL、锚文本及上下文信息;随后针对每个链接实体,分别从结构隐藏行为、文本语义相关性以及目标域名安全性三个维度展开分析。其中,结构隐藏是指通过CSS、HTML结构或JavaScript行为实现视觉隐藏[4];文本语义相关性是指链接锚文本与原网页主题、目标URL语义的匹配程度;域名安全性指对目标域名开展安全研判,识别指向恶意域名、垃圾域名或与站点主题严重背离的外部域名。

2.1.3 LLM输出层

在LLM输出层中,模型严格按照DLD-CoT预定义的推理流程完成暗链识别,并输出固定格式检测结果。当网页被判定为“包含暗链”时,模型除输出检测结论外,还需明确暗链源码位置、判定依据、风险等级及整改建议,便于运维人员开展安全审计与漏洞整改;当网页被判定为“不包含暗链”时,则仅输出基础检测结果。由此可知,LLM在该层级同时承担分类器与解释器双重角色,充分发挥其代码与自然语言双重逻辑理解能力。

2.2 DLD-CoT提示策略

本文在DLD-CoT约束层中引入结构化提示策略,对模型的任务定位、判定依据、推理路径及输出形式统一建模。在该提示策略下,LLM作为受控安全推理单元,按照预定义分析步骤逐步完成暗链检测。具体来说,DLD-CoT是面向暗链检测任务的专用思维链提示,其整体结构可形式化表示为:
$ \mathrm{DLD-CoT:I+C+R+O} $
式中:I(Instruction)为任务指令,用于明确LLM的任务边界与分析目标;C(Criteria)为领域判定标准,用于向LLM注入暗链定义、隐藏特征等领域知识的形式化表述,为推理过程提供统一判定依据;R(Reasoning)为推理步骤,用于规定暗链检测各子流程的推理顺序与内在逻辑;O(Output)为输出规范,用于限定LLM最终检测结果的输出格式。
DLD-CoT提示的4个模块各司其职,按照固定串行逻辑组合,共同引导LLM输出合规检测结果。首先通过Instruction明确定位任务类型,使模型在输入阶段即可识别当前任务为网页源码暗链检测。Criteria在指令限定的任务空间内补充统一判定规则,显式引入结构隐藏性、文本语义相关性及域名安全性三类维度特征,构建标准化暗链判定依据。Reasoning作为核心模块,对检测全流程进行拆解,将暗链检测细化为五项子流程:链接实体提取、结构隐藏行为分析、文本语义相关性分析、目标域名安全研判、多维证据融合与风险定级。Output作用于结果生成环节,约束模型统一输出暗链定位、判定依据、风险等级、整改建议四类内容。该约束能够解决LLM原生输出格式混乱问题,保障检测结果的工程落地可用性,方便直接对接现有安全运维系统。
综上,4个模块依次形成任务界定、标准约束、推理建模及结果生成的串行执行关系。实际应用时,DLD-CoT依据模板拼接完整提示文本,与预处理后的网页源码同步输入LLM。给定输入源码S,首先生成Instruction语句明确检测目标;其次依托Criteria将暗链多维特征转化为模型可识别的判定规则;随后调用Reasoning步骤,引导模型按既定顺序逐一对链接实体开展多维分析并融合证据得出结论;最后通过Output规范输出结构化检测结果。上述过程可形式化表示为表1
表 1 基于DLD-CoT提示的网站暗链检测方法

Table 1 Website Hidden Link Detection Method Based on DLD-CoT Prompting

方法:基于DLD-CoT提示的网站暗链检测方法
输入:网页源码S;
输出:检测结果E;
1:对输入网页源码S进行预处理,得到规范化源码S_clean;
2:构建任务指令I,明确当前任务为网页暗链检测;
3:引入领域判断标准C;
4:设计推理步骤R,引导模型按照既定流程逐步完成分析:
 从S中提取链接实体;
 分析链接的结构隐藏行为;
 评估链接文本与页面内容的语义相关性;
 判断目标域名的安全性;
 融合多维分析结果给出判定结果;
5:定义输出格式O:
 检测结果
 暗链定位
 判定依据
 风险评估及整改建议
6:DLD-CoT $ \leftarrow I\bigoplus C\bigoplus R\bigoplus O $
7:将DLD-CoT提示和S_clean输入大语言模型,得到检测结果E;
8:输出最终检测结果。
需要注意的是,Criteria模块中显式注入的领域判定标准并未包含输入-输出样例,因此模型推理无需依赖标注样例,仅依托自身预训练领域知识,在统一规则约束下完成推理决策。该模块的核心作用是依靠结构化约束提升模型推理稳定性,后续实验结果与消融分析,进一步验证了DLD-CoT提示驱动LLM在零样本暗链检测场景的有效性。

3 实验与结果

为验证DLD-CoT在网站暗链检测中的有效性与工程可用性,本文设计对比实验与消融实验,主要回答三个核心问题:(1)在暗链检测中引入DLD-CoT提示是否能够有效提升通用LLM的检测性能;(2)DLD-CoT是否具备模型无关性,即在不同架构、不同参数规模的LLM上均可稳定取得检测效果;(3)DLD-CoT各子模块是否具备独立贡献与实际工程落地价值。

3.1 评估数据集

本次实验数据集结合真实业务场景与公开数据集采集得到,并依据统一标注规范完成数据整理与筛选,兼顾数据真实性与样本分布多样性。数据集覆盖8类主流暗链隐藏模式,分别为CSS样式隐藏、HTML结构隐藏、JavaScript动态隐藏、重定向与中转链路、字符编码混淆、主题差异度、链接域名可疑以及复合隐藏结构。样本采集覆盖多个时间阶段,规避单一时间窗口引发的数据分布偏移;针对多源异构数据,本文统一标注口径以保障数据集质量。为全面评估DLD-CoT跨场景检测性能,本文抽取并构建包含真实业务数据、公开数据集、人工合成样本的网页源码混合数据集,总计800个样本,具体组成如表2所示。
表 2 数据集统计信息

Table 2 Dataset statistics

数据集来源页面数量含暗链页面正常页面收集日期
高校网站2611321292023/06-2025/10
电商网站10043572024/03-2026/04
门户网站10052482024/03-2026/04
公开数据集2591251342014/01-2017/01
合成样本804040-
合计800392408-
其中真实业务数据来源于某高校官方网站、电商网站及门户网站。高校网站页面主题合规性高、内容语义偏向性显著,且搜索引擎权重较高,是暗链植入的高发目标,主要包含三类非典型暗链:非博彩、非诈骗类主题外链;指向合法站点但页面主题差异显著的外链;结构隐蔽、语义弱关联的隐蔽外链,具备较强的现实研究与工程落地代表性。电商网站外链结构繁杂、商业推广软文密集,攻击者常通过重定向中转链路隐藏恶意外链,规避常规检测。门户网站内容迭代频繁、页面模板多元,易被植入多类暗链结构,能够还原复杂页面布局下的真实暗链检测场景。此外,本文整理国家计算机网络应急技术处理协调中心(CNCERT)公开恶意网页数据集[4],包含125个暗链网页、134个正常网页,用于验证DLD-CoT在常规暗链检测任务中的有效性,并与传统机器学习、深度学习基线方法开展横向对比。最后,为验证模型跨场景泛化能力,结合真实黑帽SEO攻击场景,人工合成40条多模式暗链样本与40条正常网页样本。合成样本仅用于泛化性能评估,未参与DLD-CoT提示模板构造,彻底规避数据泄露,保障实验客观性。本次数据集从跨站点、跨业务类型、跨时间三个维度统筹构建,覆盖2014年至今多轮网页技术迭代周期,消除单一时段数据带来的检测偏差。数据集标注采用双人交叉核验机制,标注人员均具备网络安全运维从业背景;对存在判定分歧的样本,由第三方专业人员复核商议后判定,弱化人工主观偏差。

3.2 实验设置

本文软硬件实验环境配置如下:操作系统Ubuntu 22.04.5 LTS,编程语言Python 3.10,并行计算库CUDA 12.4,服务器搭载2张NVIDIA A6000显卡。大语言模型推理参数如表3所示。
表 3 推理参数设置

Table 3 Inference Parameters

参数名称参数值
Temperature0.0
Top-p1.0
Max tokens1024
本次实验将温度参数Temperature设置为0,禁用模型随机采样机制,迫使模型每一步解码均选取概率最优候选token;同时将Top-p设为1.0,不压缩候选词汇采样空间。该参数组合可保证LLM对同一输入输出稳定一致的检测结论,消除随机采样引发的结果波动。

3.3 评估标准

暗链检测任务存在正负样本分布不均衡、误报危害大的特点,单一评价指标无法全面衡量模型性能。因此,本文采用准确率(Accuracy)、精确率(Precision)、召回率(Recall)及F1值(F1值)作为客观评价指标。实验定义暗链页面为正类,正常页面为负类,依据模型预测结果与人工真值构建混淆矩阵,包含真阳性(TP)、假阳性(FP)、真阴性(TN)、假阴性(FN)四类指标,具体定义如表4所示。
表 4 混淆矩阵

Table 4 Confusion Matrix

暗链页面正常页面
判定为暗链TPFP
判定为正常FNTN
在此基础上,各评估指标的计算方式定义如下。Accuracy用于衡量模型整体分类正确率,其计算公式为:
$ Accuracy=\frac{TP+TN}{TP+TN+FP+FN} $
Precision表示被模型判定为暗链页面中,实际为暗链页面的比例,用于衡量检测结果的准确性,其计算公式为:
$ Precision=\frac{TP}{TP+FP} $
Recall表示所有实际暗链页面中,被模型成功检测出的比例,用于衡量模型对于暗链的覆盖能力,其计算公式为:
$ Recall=\frac{TP}{TP+FN} $
F1值综合考虑Precision与Recall,是二者的调和平均,用于在准确性和检测率之间取得平衡,其计算公式为:
$ F1-Score=\frac{2\times Precision×Recall}{Precision+Recall} $
其中Accuracy和Recall的值越接近1,说明模型的检测效果越好,Precision和F1值越大说明暗链检测的效果越好,越小说明效果越差。

3.4 实验结果分析

3.4.1 思维链提示策略对比实验

为对比不同思维链提示策略对LLM暗链检测推理行为的影响,本文在数据集、模型推理参数完全一致的条件下,开展四类提示策略对比实验,具体设置为:(1)原生LLM:无额外提示,不引入任何思维链推理引导;(2)Zero-shot-CoT:在检测指令末尾添加标准化提示语“请逐步推理”;(3)Few-shot-CoT:提供少量标注推理样例,引导LLM模仿样例推理路径输出检测结论;(4)DLD-CoT:融合领域判定标准、结构化推理路径、标准化输出约束的领域自适应思维链提示。
针对同一段网页源码,在不同提示策略下调用同一LLM开展独立推理,对比四类策略下模型检测结论与内部推理路径的差异性。本次实验选取的典型动态暗链源码片段如下:
<script>
document.addEventListener("DOMContentLoaded", function(){
 var a = document.createElement("a");
 a.href = "http://js-hidden-link.net";
 a.text = "buy backlinks";
 a.style.display = "none";
 document.body.appendChild(a);
});
</script>
代码在运行时注入链接,静态检测无法直接发现,实验所呈现的不同思维链提示策略下的推理路径如下表5所示。
表 5 暗链检测推理结构及结果

Table 5 Reasoning Structure and Results of Hidden Link Detection

推理路径检测结果结论
LLM-上述代码创建了一个隐藏的链接,通常被称为“暗链”。JavaScript会在页面加载完成后执行,并在文档中添加一个指向http://js-hidden-link.net 的超链接。检测结果正确,无明确判定依据
Zero-Shot-CoT-这段JavaScript用于在页面中添加一个用户看不见的超链接。这种做法符合“暗链”的定义:即隐藏起来不让普通访问者看到但仍然存在于网页代码中的外部链接。检测结果正确,仅依据暗链单一特征判断
Few-Shot-CoT-这段代码用于植入暗链。利用document.createElement创建一个新的锚点元素,并将其添加到网页中;设置样式a.style.display = "none",将这个新创建的链接完全隐藏起来。检测结果正确,推理过程受示例模式约束明显
DLD-CoT1.结构隐藏
2.语义可疑
3.域名可疑
4.综合判定
(1)暗链源码定位
这段代码通过JavaScript动态创建了一个隐藏链接<a href="http://js-hidden-link.net" style="display:none"> buy backlinks</a>
(2)暗链信息提取
目标URL为js-hidden-link.net;通过JavaScript动态创建并设置display:none实现完全隐藏;锚文本与页面无任何关联;域名未指向任何可信服务。综合判定为典型的黑帽SEO暗链技术,属于高危暗链。
(3)整改建议
建议对网站所有动态生成的DOM节点进行安全审计;使用Web应用防火墙(WAF)拦截可疑的JavaScript操作。
检测结果正确,明确的三维判断依据且有固定输出形式
不使用任何思维链提示的LLM仅输出判定结果,缺乏明确判断依据,推理结果高度依赖模型内部参数分布。Zero-shot-CoT虽然在一定程度上诱发了多步骤推理,但其推理逻辑并不稳定;Few-shot-CoT能够在示例引导下形成规范推理流程,但受示例模式约束较强,面对复杂暗链时适配能力不足。而DLD-CoT在检测中表现出一致的判断逻辑和输出格式,降低了推理路径的随机性。此外,四类提示策略的量化性能评估结果,进一步验证了DLD-CoT提升LLM暗链检测性能的有效性。研究使用Qwen3:32B在以上四种不同提示策略下开展暗链检测任务,整体性能表现如图2所示。
图 2 不同提示的性能

Fig.2 Performance of different prompting

DLD-CoT在所有指标上均显著优于其他提示方法,表明其在误报与漏报之间取得了更好的平衡,体现该方法的有效性。另外为评估LLM基于不同思维链提示的泛化能力,研究提取了已知和未知暗链模式两个类别的数据进行实验,图3为多场景不同提示下实验的F1值柱状图,展示了LLM在已知和未知两种暗链模式中的检测性能。由图可知,引入DLD-CoT提示的LLM,在已知暗链模式下检测性能优于未知暗链模式,说明合理设计提示策略可以帮助LLM更加准确检测暗链。但从整体来看,本文所提方法在两类暗链模式下性能均显著优于其余提示方法,验证了所提方法能够增强LLM检测暗链的泛化能力。
图 3 不同暗链的F1值

Fig.3 F1 of different hidden link

3.4.2 多维数据分布下的性能评估

仅依赖单一指标难以全面反映所提方法在复杂应用环境中的实际表现。为进一步分析基于DLD-CoT提示的LLM在不同暗链模式、不同站点类型及新型暗链场景下的泛化能力,本文在统一实验设置下,从暗链类型、站点来源及时间分布三个维度对检测结果开展分层统计分析,以此反映LLM在不同数据分布条件下的性能差异。不同暗链类型下的检测性能对比结果如表6所示。
表 6 不同暗链类型下的检测性能

Table 6 Detection performance across different hidden link types

暗链类型样本数量AccuracyPrecisionRecallF1值
CSS样式隐藏1030.98060.98110.98110.9811
HTML结构隐藏1150.97390.96080.98000.9703
JavaScript动态隐藏1120.95540.96080.94230.9515
重定向与中转链路950.94740.97730.91490.9451
字符编码混淆900.95560.95350.95350.9535
主题差异度970.90720.91840.90000.9091
域名可疑960.91670.90200.93880.9200
复合隐藏结构920.89130.91300.87500.8936
由上表可以观察到,对于CSS样式隐藏、HTML结构隐藏及JavaScript动态隐藏这类具备明显结构特征的暗链模式,LLM表现出较高的检测性能,F1值均超过0.95,说明所提出的方法能有效捕捉网页结构与渲染逻辑中的异常特征。主题差异度和域名可疑这两个依赖网页语义关联的维度检测效果略有下降,Recall为0.90和0.93,说明在缺乏显式结构异常的情况下,LLM对语义相关性的识别能力仍存在局限。此外,字符编码混淆与重定向链路类暗链因涉及网页多阶段交互特征,检测性能处于中等水平。而复合隐藏结构暗链F1值仅为0.89,说明LLM对复合暗链的检测性能弱于单一类型暗链。总之,LLM在结构特征显著的暗链模式上表现更为稳定,而在语义依赖较强和多特征耦合的复杂隐藏结构中存在性能波动。为进一步评估LLM检测暗链在不同网站类型上的泛化能力,本文从站点来源视角展开分析,结果如表7所示。
表 7 不同数据集来源的检测性能

Table 7 Detection performance across different dataset sources

数据集来源样本数量AccuracyPrecisionRecallF1值
高校网站2610.97700.98460.96970.9771
电商网站1000.94000.93020.93020.9302
门户网站1000.96000.98000.94230.9608
公开数据集2590.98070.97620.98400.9801
合成样本800.96250.95120.97500.9630
从上表可以观察到,在公开数据集场景下,LLM性能最为稳定,F1值可达0.98。电商网站页面交互复杂、动态脚本数量多,Recall略有下降;门户网站与合成数据的检测性能处于中等水平。分析结果表明,页面结构复杂度与动态行为会影响LLM的检测稳定性,但该方法在不同站点来源数据上的检测性能并无显著差距,本文提出的方法依然有效。本次实验数据采集时间跨度为2014-2026年,涵盖历史与近期业务数据,这也表明本文方法面对新型暗链攻击仍可保持稳定检测性能,具备良好鲁棒性。

3.4.3 误判案例分析

对多维数据分层统计结果分析可知,LLM在语义关联性强、含复合隐藏结构的样本中存在性能波动。为深入探究LLM的判定边界与潜在缺陷,本文对数据集内误判样本开展归纳分析,从误判类型、典型案例两个维度展开讨论。表8展示了评估数据集主要误判类型的分布情况,可以看出语义弱偏移类误判占比最高,复合结构干扰次之,纯结构特征引发的误判极少。
表 8 误判类型分布统计

Table 8 Statistical distribution of misclassification types

误判类型样本数量占比(%)
语义弱偏移99.3
复合结构干扰1010.9
编码/跳转混淆44.4
正常页面误判82.0
从漏检和误报两个角度分析实验结果:语义弱偏移类样本的页面结构无明显异常,但内容语义存在潜在偏差。例如部分网页外链形式与正常内容无异,但主题关联性、目标域名存在偏差。此时LLM虽可正确识别页面结构,但因未捕捉到明显语义异常,易将样本判定为正常页面,进而造成漏检。复合结构干扰类误判多出现于多类暗链模式叠加场景,例如部分样本同时采用JavaScript动态加载与重定向技术,关键特征分散在多个交互环节,LLM难以整合分散信息,最终出现判断偏差。此外,字符编码混淆与跳转链路叠加模式也会对特征分析造成干扰,但影响程度相对有限,具体误判情况如图4 所示。
图 4 误判样例

Fig.4 Examples of misclassification

在误报方面,少量正常页面被误判为暗链,其主要原因在于这些合法页面同样存在较为复杂的跳转结构和外链嵌入形式,与暗链模式在行为表征上高度相似,如一些广告跳转链接或网站统计脚本与暗链的恶意重定向具有相似特征从而导致LLM产生过度敏感的判断。综上分析,基于DLD-CoT提示的LLM在显式结构异常检测方面表现稳定,而在隐式语义理解与多阶段交互行为方面仍有提升空间。

3.4.4 可解释性评估

在统一实验设置下,LLM除输出判定结果外,还可依托DLD-CoT提示推理路径生成可解释性输出,该过程围绕结构隐藏特征、语义相关特征、域名安全特征展开,从而为判定提供可追溯判据。为了进一步说明可解释性输出的合理性与科学性,本文对LLM输出的推理结果进行结构化评估,并从解释的正确性、完整性与表达清晰性三个维度进行分析。评估数据从实验数据集中抽取,包含60个样本覆盖不同暗链类型,每个样本均对应LLM检测标签和完整推理过程。评价过程由3名具备Web安全领域背景的研究者独立完成,采用1-5分五级评分量表。其中,正确性用于验证解释性输出所指向的关键特征是否与真实暗链表现契合,完整性能够反映推理过程对主要判定依据的覆盖程度,清晰性是指解释性输出表达的可理解性,最终结果取多名评估者评分的平均值,具体计算公式如下:
$ Score=\frac{1}{60\times 3}\sum\limits_{i=1}^{60}\sum\limits_{j=1}^{3}{s}_{i,j} $
综合评分为上述三个维度的平均值,整体评估结果如下表9所示。
表 9 可解释性评估结果

Table 9 Explainability evaluation results

方法正确性完整性清晰性综合评分
DLD-COT4.324.154.474.31
Zero-shot2.422.113.362.63
Few-shot3.162.694.353.40
从统计结果可以观察到DLD-CoT提示在三个维度上均保持较高评分水平,正确性和完整性的评分能够达到4.32和4.15,说明基于DLD-CoT提示的LLM在多数情况下能够准确识别并关注重点判定依据,同时推理过程对检测维度的覆盖也比较完整。清晰性评分4.47,表明DLD-CoT提示策略在解释性输出的表达方面具有较好稳定性。和对比方法相比,DLD-CoT在完整性维度上表现更为优异,反映出其在多特征整合与推理逻辑构建方面的进步。

3.4.5 模型通用性评估

为验证DLD-CoT提示能否在不同架构、不同规模的LLM上稳定发挥作用,选取不同网络架构和参数规模的三个主流大语言模型作为实验对象,包括密集Transformer架构的Qwen3-32B与Qwen2.5-7B-Instruct以及MOE架构代表DeepSeek-V3.2[30-32]。该类多模型对照策略已广泛应用于LLM通用性评估研究,可保障实验结果可比、结论严谨。实验基于完全一致的DLD-CoT提示对比LLM输出结果,结果如表10所示。
表 10 DLD-CoT在不同LLM上的检测性能

Table 10 Detection performance of dld-cot on different large language models

模型DLD-COTAccuracyPrecisionRecallF1值
Qwen3-32B未使用0.53830.54670.39390.4579
使用0.98000.98310.97640.9797
Qwen2.5-7B-Instruct未使用0.38500.36360.32320.3422
使用0.83000.92580.71380.8061
DeepSeek-V3.2未使用0.60000.67420.50170.5753
使用0.99170.98990.99330.9916
实验结果表明,尽管不同LLM在检测性能上存在差异,但使用DLD-CoT提示均表现出一致的性能提升趋势,说明DLD-CoT提示具备跨LLM通用性。为进一步探索LLM在检测暗链中所关注的关键信息,实验选取数据集的部分源码利用Qwen3-32B重复进行暗链检测,分别采用启用、未启用DLD-CoT 提示两种设置,记录LLM生成的检测结果并对推理过程中被明确引用的源码信息进行统计。结合现有研究中对网页异常行为的常见划分方式,将LLM显式关注的源码信息归纳为网页的结构隐藏行为、网页文本语义相关性分析以及域名安全性分析三类,统计不同推理步骤中各类特征被引用的频率,具体步骤如下。
Step 1: 检查源码是否存在结构隐藏行为
Step 2: 分析目标URL与上下文相关性
Step 3: 检查目标URL域名安全性
实验结果如图5所示,图中横轴代表不同类型的源码特征,纵轴代表DLD-CoT提示下的推理步骤次序,颜色深浅表示对应特征在推理过程中被显式引用的强度,颜色越深代表模型显式推理中对该特征的使用频度越大。
图 5 基于DLD-CoT提示的LLM推理关注信息热力图

Fig.5 Heatmap of LLM inference attention based on DLD-CoT prompting

由实验结果可知,Qwen3-32B在暗链检测中呈现较为清晰且稳定的关注信息。LLM在Step1阶段关注最多的是结构隐藏行为,在Step2阶段偏向于关注文本语义相关性,而Step3阶段关注最多的是域名安全,符合DLD-CoT提示预定义的推理顺序。说明DLD-CoT提示能够有效引导LLM在暗链检测中形成稳定可复现的推理路径并提升检测鲁棒性,也进一步证明该方法的有效性。但需注意,DLD-CoT提示无法弥补LLM自身固有能力缺陷,当使用参数规模小于7B的模型分析复杂网页源码时,检测性能会出现明显下降。

3.4.6 DLD-CoT 结构设计的消融实验

为验证DLD-CoT内部各组成部分的必要性,分别移除 DLD-CoT的四项关键模块:任务指令、领域判断标准、推理步骤、输出格式定义,得到四个变体:DLD-CoT/I、DLD-CoT/C、DLD-CoT/R、DLD-CoT/O。通过分析各变体对LLM暗链检测性能的影响,评估DLD-CoT提示设计的合理性与科学性。五组实验均在相同数据集与LLM参数配置下开展,实验结果如表11所示。
表 11 DLD-CoT消融实验结果

Table 11 Ablation study results of DLD-CoT

消融设置AccuracyPrecisionRecallF1值
DLD-CoT0.98000.98310.97640.9797
DLD-CoT/I0.95830.96900.94610.9574
DLD-CoT/C0.93670.94810.92260.9352
DLD-CoT/R0.88830.93890.82830.8801
DLD-CoT/O0.98000.98310.97640.9797
实验结果表明,DLD-CoT各组成部分对暗链检测性能具有不同程度的影响。当移除任务指令时,暗链检测整体性能出现一定幅度下降,Recall指标下降尤为明显,说明缺乏明确任务约束的情况下,LLM在部分样本中未能聚焦于暗链检测任务,易受网页冗余信息干扰。当移除领域判断标准后,Accuracy、Recall与F1值均出现显著下降,表明在暗链检测中仅依赖通用LLM的内部参数分布和自主推理能力,难以覆盖暗链所涉及的专业语义特征与判定边界,所以领域知识的显式注入对于提升模型检测有效性具有关键作用。移除推理步骤后,性能下降幅度在所有消融实验中最大,F1值由0.97降至0.88,说明缺乏对推理逻辑的明确约束,容易导致LLM在推理中跳过关键环节,进而削弱其对复杂暗链的判断能力。仅移除输出格式定义并未对检测性能指标产生直接影响,但实验过程中观察到模型输出结果存在格式不统一、关键信息缺失的问题,如图6示例,大幅降低了检测结果在实际安全系统中的工程可用性。
图 6 LLM检测结果输出格式示例

Fig.6 Example of LLM detection result output format

消融实验验证了DLD-CoT提示在设计上的合理性与科学性。其中,领域判断标准和推理步骤对LLM检测暗链的影响最大,是保障零样本条件下检测准确性与稳定性的关键因素。任务指令通过定义暗链检测问题边界保证推理任务的目标一致,而定义输出格式虽不直接影响模型判定能力,但能够显著提升检测结果的工程可用性。

3.4.7 与传统机器学习与深度学习方法的比较

研究选取传统机器学习[4]和深度学习检测方法[8]作为对比基线,在相同数据集和评价指标下开展实验。由于传统机器学习依赖人工构造的锚文本、链接结构、域名特征,深度学习能够在一定程度上自动学习暗链特征表示,二者分别代表暗链检测中特征工程和表示学习两类典型解决方案。本文参考已有文献的特征提取和参数设置,保证实验结果具备可比性,结果如表12所示。
表 12 不同方法的综合性能对比

Table 12 Comprehensive performance comparison of different methods

检测方法F1值
传统机器学习0.82
深度学习0.87
LLM+DLD-CoT(本文方法)0.98
上表为不同方法评价指标对比结果,本文所提方法F1值达到0.98,相较于传统机器学习与深度学习方法呈现出更优的整体性能。说明基于DLD-CoT提示的LLM除能够有效识别常见暗链模式外,在复杂结构隐藏、近语义外链、域名伪装及复合隐藏模式场景下也具备更强研判能力。此外,相较于传统检测方法,本文方法可显式推理并输出判定依据,在暗链误报和漏报之间取得平衡,同时具备优异泛化能力。在实际应用中,标准化输出结果便于运维人员溯源误报、漏报成因,兼顾检测准确性与结果可解释性,为LLM落地真实网络安全场景提供支撑。

4 实际应用与挑战

随着我国高校数字校园建设持续推进,校园网络安全威胁也日益加剧。其中,网站暗链检测因隐蔽性强、人工排查成本高,始终是高校网络安全治理难点。为落实《网络信息内容生态治理规定》,国内多所高校已开展网站暗链自查整改工作,本文所提零样本暗链检测方法可适配该类自查场景。

4.1 应用场景

高校网站存在内容更新频繁、维护主体分散、网络资产体量庞大、用户群体活跃的特点,在当前互联网环境下极易被植入多样化、高隐蔽性暗链。高校信息中心现有传统检测工具已无法适配复杂暗链排查需求。因此,本文以高校官网暗链检测为案例,探究通用LLM结合DLD-CoT提示在暗链检测任务中的落地适用性。

4.2 暗链检测方案

在上述应用场景下,本文方法可直接对接高校官网源码数据池,实现网站常态化自动巡检。通过对网页源码开展结构隐藏特征、语义文本特征、域名安全性多维推理分析,LLM不仅能够判别页面暗链存在性,还可同步输出暗链源码位置、判定依据与安全整改建议,检测效果如图7所示。
图 7 Qwen-32B大模型结合DLD-CoT检测暗链的应用示例

Fig.7 Application example of dark link detection using Qwen-32B with DLD-CoT

该检测、溯源、整改一体化模式,大幅降低高校信息化部门人工研判工作量,适用于高校官网、招生专题网站、科研业务平台、宣传类网页的常态化安全巡检。

5 结束语

针对传统暗链检测方法依赖人工特征工程、跨场景泛化能力弱、检测结果可解释性缺失的问题,本文提出思维链提示驱动的大语言模型零样本网站暗链检测方法,设计融合结构、语义、域名三类特征的DLD-CoT提示策略,约束通用LLM推理路径与输出范式。真实场景实验表明,该方法在精确率、召回率、F1值上性能优异,在多站点、多类型暗链场景下检测效果稳定,具备良好泛化能力与落地潜力。
同时本文方法仍存在局限性:DLD-CoT仅能挖掘LLM固有推理能力,小参数规模模型对复杂页面、细粒度语义偏差的识别能力存在天然短板;其次,方法仅依托网页单模态源码分析,对多阶段跳转、客户端隐式触发类暗链识别效果有限;此外,当前数据集以静态网页为主,跨页面动态交互暗链的检测有效性仍需验证。
后续将从三方面展开研究:(1)融合浏览器动态渲染数据,引入图文多模态特征,搭建面向动态交互网页的多模态暗链检测框架;(2)构建轻量化安全规则与DLD-CoT协同推理机制,保留零样本优势的同时提升模型抗干扰鲁棒性;(3)扩充异构网络场景数据集,完善评测体系,验证提示策略在复杂真实网络生态中的适配能力。
1
Geng G G , Yang X T , Wang W , et al. A taxonomy of hyperlink hiding techniques[J]. Lecture Notes in Computer Science, 2014: 165-176.

2
邢容. 基于文本识别技术的网页恶意代码检测方法研究[D]. 中国科学院大学, 2012.

Xing R. Research on web malicious code detection methods based on text recognition technology [D]. University of Chinese Academy of Sciences, 2012.

3
孟池洁, 王伟, 耿光刚. 基于统计机器学习的互联网暗链检测方法[J]. 计算机应用研究, 2015, 32 (9): 2779- 2781.

Meng, c J. , Wang W, Geng G G. Statistical machine learning-based method for internet hidden link detection[J]. Computer Applications Research, 2015, 32 (9): 2779- 2781.

4
周文怡, 顾徐波, 施勇, 等. 基于机器学习的网页暗链检测方法[J]. 计算机工程, 2018, 44(10): 23-25.

Zhou W Y, Gu X B, Shi Y, et al. Machine learning-based method for web hidden link detection. computer engineering, 2018, 44(10): 23-25.

5
孟雷. 多域识别构建监督学习模型检测网页暗链[J]. 信息安全与通信保密, 2019, (10): 64- 67.

Meng L. Multi-domain recognition for constructing supervised learning models to detect web hidden links[J]. Information Security And Communications Confidentiality, 2019, (10): 64- 67.

6
杨望, 江咏涵, 张三峰. 基于网页结构与语言特征的垃圾网页链接检测方法[J]. 东北大学学报: 自然科学版, 2020, 41 (8): 1091- 1096.

Yang W, Jiang Y H, Zhang S F. A web spam link detection method based on web page structure and text features[J]. Journal of Northeastern University Natural Science, 2020, 41 (8): 1091- 1096.

7
张紫妍, 韩斌, 姜元昊, 等. 融合差分进化的网页暗链集成分类检测方法[J]. 计算机仿真, 2024, 000(4): 6: 392-396.

Zhang Z Y, Han B, Jiang Y H, et al. Web hidden link detection via an ensemble classification method integrating differential evolution[J]. Computer Simulation, 2024, 000(4): 6: 392-396.

8
袁振. 基于图神经网络的暗链检测方法研究[D]. 南京: 东南大学, 2025.

Yuan Z. Research on hidden link detection method based on graph neural networks [D]. Nanjing: Southeast University, 2025.

9
王耀祖, 李擎, 戴张杰, 等. 大语言模型研究现状与趋势[J]. 工程科学学报, 2024, 46 (8): 1411- 1425.

DOI

Wang Y Z, Li Q, Dai Z J, et al. Current status and trends in large language modeling research[J]. Chinese Journal of Engineering, 2024, 46 (8): 1411- 1425.

DOI

10
Xu H, WANG S, LI N, et al. Large language models for cyber security: a systematic literature review[J]. ACM Transactions on Software Engineering and Methodology, 2025, 34 (4): 1- 34.

11
Uddin M, Irshad M S, Kandhro I A, et al. Generative AI revolution in cybersecurity: a comprehensive review of threat intelligence and operations[J]. Artificial Intelligence Review, 2025, 58 (8): 236.

DOI

12
宋泽楷, 刘锦浩, 郑雯, 等. 大语言模型驱动网络安全威胁检测: 进展与趋势[J]. 信息安全学报, 2025: 1.

Song Z K, Liu J H, Zheng W, et al. Large language models driving cyber security threat detection: progress and trends[J]. Journal of Cyber Security, 2025: 1.

13
张欣, 孙靖超. 基于大语言模型的虚假信息检测框架综述[J]. 计算机科学与探索, 2025, 19 (6): 1416- 1430.

DOI

Zhang X, Sun J C. A review of large language model-based frameworks for misinformation detection[J]. Journal of Frontiers of Computer Science & Technology, 2025, 19 (6): 1416- 1430.

DOI

14
Decusatis C, Tomo R, Singh A, Et Al. Cybersecurity applications of near-term large language models[J]. Electronics (2079-9292), 2025, 14(13): 3-12.

15
Yaacoub J P A, Noura H N, Salman O, et al. Large language models: applications, limitations, challenges, and recommendations in cybersecurity, digital forensics, and ethical hacking[J]. Annals of Telecommunications, 2025, 80 (11): 933- 973.

DOI

16
Bayer M, Kuehn P, Shanehsaz R, et al. Cysecbert: A domain-adapted language model for the cybersecurity domain[J]. ACM Transactions on Privacy and Security, 2024, 27 (2): 1- 20.

DOI

17
Bitaab M, Karimi A, Lyu Z, et al. ScamNet: Toward Explainable Large Language Model-Based Fraudulent Shopping Website Detection[C]//Proceedings of the AAAI Conference on Artificial Intelligence. 2025, 39(27): 27841-27848.

18
关永健, 朴乘锴, 王布宏, 等. LEAD-Cyber: 基于开源大模型和全周期本地微调的网络安全垂域大模型[J]. 网络空间安全科学学报, 2025, 3 (4): 94- 110.

Guan Y J, Piao C K, Wang B H, et al. LEAD-Cyber: a cybersecurity vertical domain LLM based on open source LLMs and full-cycle local fine-tuning[J]. Journal of Cybersecurity, 2025, 3 (4): 94- 110.

19
崔金满, 李冬梅, 田萱, 等. 提示学习研究综述[J]. Journal of Computer Engineering & Applications, 2024, 60 (23): 3- 18.

Cui J M, Li D M, Tian X, et al. A survey of prompt learning[J]. Journal of Computer Engineering & Applications, 2024, 60 (23): 3- 18.

20
Wei J, Wang X, Schuurmans D, et al. Chain-of-thought prompting elicits reasoning in large language models[J]. Advances in neural information processing systems, 2022, 35, 24824- 24837.

DOI

21
Fu Y, Peng H, Ou L, et al. Specializing smaller language models towards multi-step reasoning[C]//International Conference on Machine Learning. PMLR, 2023: 10421-10430.

22
Li L H, Hessel J, Yu Y, et al. Symbolic chain-of-thought distillation: Small models can also" think" step-by-step[J]. arXiv preprint arXiv: 2306.14050: 2023.

23
康睿哲. 基于思维链的通用语言模型推理能力研究[J]. 人工智能与机器人研究, 2025, 14 (2): 259- 267.

Kang R Z. Research on the reasoning ability of general language model based on chain of thought[J]. Artificial Intelligence and Robotics Research, 2025, 14 (2): 259- 267.

24
Kojima T, Gu S S, Reid M, et al. Large language models are zero-shot reasoners[EB/OL]. (2022-05-24)[2026-04-11]. https://arxiv.org/abs/2205.11916.

25
马冰琦, 周盈海, 王梓宇, 等. 一种基于大语言模型的威胁情报信息抽取方法[J]. 网络空间安全科学学报, 2024, 2 (2): 36- 46.

Ma B Q, Zhou Y H, Wang Z Y, et al. A LLMs-based method for threat intelligence information extraction[J]. Journal of Cybersecurity, 2024, 2 (2): 36- 46.

26
陶江垚, 奚雪峰, 盛胜利, 等. 结构化思维提示增强大语言模型推理能力综述[J]. Journal of Computer Engineering & Applications, 2025, 61(6).

Tao J Y, Xi X F, Sheng S L, et al. Review on Enhancing Reasoning Abilities of Large Language Model Through Structured Thinking Prompts[J]. Computer Engineering and Applications, 2025, 61(6): 64-83.

27
Chen Y, Chen X, HuANG Y, et al. COTVD: A function-level vulnerability detection framework using chain-of-thought reasoning with large language models[J]. Information and Software Technology, 2026, 108043, 2- 10.

DOI

28
林博, 王尚文, 毛晓光. 基于思维链的软件漏洞自动修复[J]. 软件学报, 2025, (3): 2207- 2216.

DOI

Lin B, Wang S W, Mao X G. Automated software vulnerability repair based on chain-of-thought[J]. Journal of Software, 2025, (3): 2207- 2216.

DOI

29
巴泽智, 张辉, 谢铮涵, 等. 大语言模型自动化提示工程技术研究综述[J]. 计算机科学与探索, 2025, 19 (12): 3131- 3152.

Ba Z Z, Zhang H, Xie Z H, et al. Automatic prompt engineering technology for large language models: a survey[J]. Journal of Frontiers of Computer Science and Technology, 2025, 19 (12): 3131- 3152.

30
Yang A, Li A, Yang B, et al. Qwen3 technical report[PP/OL]. arXiv, (2025-05-14)[2026-04-11]. https://arxiv.org/abs/2505.09388.

31
Yang A, Yang B, Zhang B C, et al. Qwen2.5 Technical Report[PP/OL]. arXiv, (2024-12-19)[2026-04-11]. https://arxiv.org/abs/2412.15115.

32
Liu A, Mei A, Lin B, et al. Deepseek-v3.2: Pushing the frontier of open large language models[PP/OL]. arXiv, (2025-12-02)[2026-04-11]. https://arxiv.org/abs/2512.02556.

Outlines

/