综述

大模型极端风险测评方法研究综述

  • 王馨雨 1 ,
  • 刘新博 1 ,
  • 王洁 1 ,
  • 陈霄 1 ,
  • 张茹 , 1, * ,
  • 刘建毅 1 ,
  • 杨震 1 ,
  • 向尕 2, 3
展开
  • 1. 北京邮电大学网络空间安全学院,北京 100876
  • 2. 北京信息科技大学计算机学院,北京 102206
  • 3. 北京信息科技大学智能信息处理研究所,北京 102206

网络出版日期: 2026-05-06

基金资助

国家自然科学基金(U21B2020)

版权

版权所有©《网络空间安全科学学报》编辑部 2025

Survey on extreme risk assessment methods for large language models

  • Wang Xinyu 1 ,
  • Liu Xinbo 1 ,
  • Wang Jie 1 ,
  • Chen Xiao 1 ,
  • Zhang Ru , 1, * ,
  • Liu Jianyi 1 ,
  • Yang Zhen 1 ,
  • Xiang Ga 2, 3
Expand
  • 1. School of Cyberspace Security, Beijing University of Posts and Telecommunications, 100876 Beijing, China
  • 2. School of Computer Science, Beijing Information Science and Technology University, 102206 Beijing, China
  • 3. Institute of Intelligent Information Processing, Beijing Information Science And Technology University, 102206 Beijing, China

Online published: 2026-05-06

Copyright

Copyright ©2025 Journal of Aeronautical Materials. All rights reserved.

摘要

随着大语言模型(Large Language Models, LLM)能力的快速提升,其潜在的极端安全风险日益凸显,呈现出更高的不确定性与跨领域影响。围绕网络攻击、生物安全与自主性等典型高风险情境,学术界与产业界已开展多维度评估探索。因此,梳理了前沿LLM的极端风险测评方法,总结了主流的实验设计与衡量指标,并对不同风险领域的评估实践进行了对比与归纳。在此基础上,进一步探讨了体系化和标准化的测评框架的未来发展趋势,旨在为后续极端风险评估体系的构建与完善提供参考与启发。

本文引用格式

王馨雨 , 刘新博 , 王洁 , 陈霄 , 张茹 , 刘建毅 , 杨震 , 向尕 . 大模型极端风险测评方法研究综述[J]. 网络空间安全科学学报, 2025 , 3(6) : 43 -54 . DOI: 10.20172/j.issn.2097-3136.250603

Abstract

With the rapid advancement of Large Language Models (LLM), their potential extreme risks have become increasingly prominent, characterized by higher uncertainty and cross-domain impacts. For high-risk scenarios such as cyberattacks, biosafety, and autonomy, both academia and industry have initiated multidimensional evaluation efforts. This study systematically reviews cutting-edge approaches to extreme risk assessment for LLM, summarizing mainstream experimental designs and evaluation metrics, and comparing existing practices across different risk domains. On this basis, it further discusses future directions toward the development of systematic and standardized evaluation frameworks, aiming to provide references and insights for the construction and refinement of extreme risk assessment systems.

0 引言

在当今数字化时代,人工智能(Artificial Intelligence,AI)技术正以前所未有的速度发展,深刻影响着人们的社会生产与日常生活。从对话交互到科学研究,从自动化编程到智能决策,凭借在自然语言理解、推理和知识整合方面的能力,大语言模型(Large Language Models,LLM)已成为推动技术创新与产业升级的重要驱动力[1]。然而,随着模型能力的持续增强,其对现实社会的安全影响也日益凸显,演化为亟须应对的重要隐患。
与传统技术风险相比,AI系统可能引发的极端风险表现出更高的不确定性和跨领域性[2]。如图1所示,这类风险体现在模型被滥用于提升黑客的网络攻击能力,如生成恶意代码或规避防御机制,或在生物、化学等敏感领域中为危险武器的设计提供支持[3]。具备复杂规划与执行能力的AI系统可能展现出自我复制与自主行为的风险[4-5]。这类能力的失控,可能演化为对公共安全的威胁。
图 1 极端风险构成

Fig.1 Ingredients for extreme risk

针对这些挑战,产业界与学术界已展开初步探索。包括OpenAI、Meta、Anthropic以及人工智能安全机构(Artificial Intelligence Safety Institute, AISI)在内的组织,相继开展了面向大模型的安全测评[6]。相关工作通常通过精心设计的任务与基准,系统性地评估模型在高风险情境下的能力边界。这些工作不仅为风险识别与防护措施的制定提供了实证支持,也为未来AI治理框架的构建奠定了初步的基础。
目前面向大模型的极端风险评估仍处于起步阶段。现有研究大多分散于不同机构和研究项目之中,缺乏系统化的综合分析与横向比较,难以全面呈现AI在各类极端风险情境下的能力表现与潜在威胁。此外,不同组织在任务设计、风险划分与评估尺度上存在差异,导致测评结果的可比性有限,也制约了统一评估体系与治理共识的形成。开展系统性综述,对现有研究进展进行整合与梳理,可以为后续研究与政策制定提供参考。
本文面向LLM极端风险的安全测评展开系统回顾,重点总结了在网络攻击、生物安全、AI自主性等极端风险领域内的安全测评研究工作,分析了现有测评方法与案例的特点与不足,并进一步探讨未来的发展趋势与研究方向。本文的主要贡献如下:
1)分析了当前LLM极端风险及相关安全测评的主流标准与衡量指标;
2)综述前沿的面向LLM极端风险的安全测评方案,总结它们的技术特点;
3)对未来构建系统化、标准化的AI安全测评框架提出了展望。

1 LLM极端风险

在AI安全领域,极端风险通常指模型在特定条件或高能力情境下低发生概率,但一旦发生则具有极高影响力的潜在危害。这类风险的核心特征在于其后果的严重性,可能对社会秩序、公共安全乃至全球稳定造成不可逆的损害。根据Shevlane等[2]的框架,极端风险通常是通向灾难性风险路径上的关键节点,后者特指可能导致人类级别灾难的终极风险形态。
相较于AI应用中的常规风险,如输出偏见、隐私泄露、一般性错误信息等,常规风险的影响范围通常有限且可局部管控,极端风险在影响范围和严重程度上呈数量级提升。其风险源主要可归为两类:滥用风险指的是恶意行为者利用LLM的高能力,显著降低自身发动大规模网络攻击、开发生物武器等恶意行为的门槛与成本。失控风险则指的是随着AI自主性的增强,模型在复杂环境中可能出现目标错位、规避人类监督,甚至寻求自我复制等非预期行为,最终脱离有效控制[4-5]
本文所综述的LLM极端风险,即聚焦于上述两类风险源,主要涵盖网络攻击、敏感领域知识滥用、AI自主性失控等可能引发重大危害的场景。

1.1 极端风险的界定与情境要素

极端风险并非模型固有的属性,而是在特定条件组合下被激发或放大的潜在威胁。
核心能力维度是风险发生的基础前提,是模型为完成指令所展现出来的技术特质,主要包括跨领域知识整合与复杂推理、代码生成与外部工具调用、为宏观目标进行规划与任务分解,以及生成欺骗性内容或规避安全机制等能力。
操作环境与权限维度构成了模型从思考到行动的关键桥梁,是风险放大的现实条件。这一要素涵盖了模型被赋予的行动边界,从纯文本交互的沙盒,到具备代码执行与网络访问权限的环境,再到集成了专业工具包并能控制关键接口的高权限系统,同时还包括从全自动运行到关键步骤需人工批准等不同级别人类监督的介入。
任务与目标维度直接体现了风险的指向,根据指令的恶意性与具体性,可分为直接要求模型进行恶意行为的指令、本身无害但所需能力具有双重用途风险的中性任务、通过越狱或角色扮演诱导模型突破安全限制的模糊指令,以及要求模型自主分解执行的宏观复杂任务。
用户意图与能力维度决定了风险的社会化影响程度,同一个模型在被专业知识有限的新手、寻求能力增强的领域专家或明确以造成危害为目的的恶意行为者使用时,其带来的风险等级与表现形式将截然不同,这直接关系到模型是降低了攻击门槛、提升了攻击效率,还是本身化作自动化武器。
因此对任何一类极端风险的深入理解与评估,都需从这4个要素的组合视角[6]出发,才能清晰刻画其潜在危害的边界与触发条件。

1.2 网络攻击相关风险

LLM可被用于编写恶意代码、生成钓鱼邮件或增强恶意敌手对复杂系统进行漏洞扫描与渗透测试的能力。这可能导致网络攻击规模化、攻击成功率提高,并加剧关键基础设施、金融系统及公共服务的脆弱性。此外,LLM在红队模拟或端到端攻击场景中的辅助作用,也使得传统防护机制面临更高的挑战[7]

1.3 敏感领域知识滥用风险

在化学、生物、放射性与核(Chemical, Biological, Radiological, and Nuclear, CBRN)技术等敏感领域,LLM具备生成实验方案、设计化学合成路径以及推演复杂科学任务的能力。这些能力可能用于优化高危实验方案或支持潜在武器化操作,从而对公共安全和防控体系构成风险。此外,模型在跨领域知识整合方面的能力可能加速危害信息的社区传播,增加监管难度[8]

1.4 自主性失控风险

随着模型自主执行能力的提升,其在缺乏有效人类监督的条件下可能产生不可预期行为。例如,LLM可能执行与原始指令不符的任务,或在多步骤复杂任务中形成偏差,导致输出偏离预期[9]。在智能自动化、工业控制及复杂决策系统中,这类自主性失控风险具有较高现实影响,可能引发资源滥用、任务失败甚至安全事故。

1.5 安全防护风险

LLM仍存在系统性薄弱点,包括越狱和幻觉等安全现象。其中,越狱攻击可能绕过模型的安全约束,获取敏感或有害输出。幻觉风险则表现为模型生成不准确或虚假信息,在高风险决策或自动化任务中可能造成直接损失[10]。更为关键的是,安全防护风险不仅影响模型本身的可控性,还可能放大网络攻击能力或自主性失控的危害,形成复合风险场景,对整体系统安全性构成挑战。

2 LLM极端风险评估标准

为应对大语言模型极端风险,AISI、Meta、Amazon、OpenAI、Anthropic及DeepMind等全球主要的人工智能研究机构[11],初步建立了系统化的模型极端风险测评框架。本节从方法论、数据集构建与指标体系3个层面,分析当前主流的极端风险评估标准。
在方法论层面,当前极端风险测评方法形成了知识问答、脚手架(scaffold)工具与对抗性红队测试的多元测评方案,如表1所示。其中,脚手架工具作为核心支撑载体,通过分层设计适配多元测评需求:一方面,其提供功能基础保障,涵盖代码编写、文件操作、解释器及专用软件接入等基础环境,为模型完成脚本开发、系统问题修复等技术类测评任务建立必要条件。此外,结合具体测评场景,scaffold工具通过整合评分系统、文献加载、检索等模块,可以形成任务执行及结果校验一体化支撑框架,提升测评过程的完整性。
表 1 模型评估风险主流方法与指标

Table 1 Mainstream methods and metrics for model evaluation risks

评估方法 具体内容 评估标准
知识问答 开放文本、基准数据集 回答准确性、拒答率等
脚手架工具 外嵌工具接入,如编译
器,文件操作等
任务难度等级,关键
步骤成功率等
对抗性测试 搭建真实场景化环境,
进行多轮对抗性交互
失控行为率,威胁指数
创新等
知识问答环节以多维度内容考查为核心,通过开放文本、基准数据集等多样化形式,收集模型在测试中的知识输出,验证知识调用的准确性与安全边界。红队测试则通过多轮对抗性交互探测模型的鲁棒性,聚焦极端风险,注重风险排查的针对性。
在数据集构建方面,当前主流测评框架采用公开数据集和私有数据集结合的策略。网络攻击评估常集成公开CTF(Capture The Flag)题库与专家编写的高难度题目Cybench[12],避免模型训练过程中使用公开数据集而影响网络攻击能力的测评准确性。生化风险相关测评中,同样引入了WMDP(World Model Distribution Project)、GPQA(Graduate Program Qualifying Examination)等专业题库[13-14],检验模型在敏感领域的知识泄露与滥用倾向。此外,为评估长周期、高自主性任务中的模型行为,诸如GAIA(General AI Assistant Evaluation)、METR(Multi-step Evaluation Task Repository)、RE-Bench(Reasoning Evaluation Benchmark)等复杂任务集[15-17]被开发,并应用于多步推理与工程挑战场景。
在指标体系层面,为全面刻画模型在极端风险下的综合表现,现有测评框架普遍采用多维度交织的度量体系[6]。这些指标依据其核心评估焦点与测试条件的内在差异,可被系统地归纳为3个主要范畴:内容安全合规性、对抗鲁棒性以及能力效能。
内容安全合规性指标聚焦于评估模型在标准、无对抗的常规交互环境下的基础安全表现,其核心在于检验模型输出内容本身是否严格遵循预设的安全与伦理准则,这反映了模型安全对齐的基线水平。例如,违规率衡量的是模型面对明显有害或越界的直接指令时,未能拒绝并生成违规响应的概率;拒答率衡量的是模型成功拒绝并生成合规响应的能力。误拒率评估模型因安全策略过于保守而错误地拒绝无害或合法用户请求的程度。此外,信息泄露率关注在无恶意诱导的正常问答中,模型无意间输出其训练数据所含敏感信息或个人隐私的倾向。
对抗鲁棒性指标旨在考查模型在面对主动、有意的恶意攻击时,其安全防线与功能完整性所能维持的强度。其中,越狱抵抗率特指在红队测试或专门设计的越狱攻击下,模型成功抵御诱导、坚守安全策略的比率。上下文一致性进一步评估模型在复杂的多轮对话或嵌入恶意内容的长上下文中,抵抗逻辑干扰、保持安全策略前后统一的稳定性。
能力效能指标独立于上述安全维度,专注于量化模型完成高风险任务本身所具备的基础能力水平与效率,因为卓越的能力正是潜在风险得以成立的前提条件。这类指标包括在专业问答或技术任务中衡量输出正确性的任务完成率与应答准确性,以及用于量化模型所生成的攻击方案或技术路径相对于现有知识库具有新颖性程度的威胁创新指数。
目前,极端风险测评已初步形成以“方法—数据—指标”为核心的系统框架,在方法论上实现多层次互补,数据层面上兼顾通用性与领域特异性,指标体系则涵盖三类标准化度量。鉴于极端风险具有高度领域依赖性,网络安全、生化威胁、自主性失控与自主决策等领域在风险性质与测评重点上存在显著差异,因此有必要从领域视角出发展开分析。

3 现有LLM极端风险评估方案

现有的大模型极端风险评估方案呈现出高度的领域特异性,其划分依据主要源于风险本身的性质与危害模式。本文综述聚焦于网络攻击、生物安全、自主性及安全防护这4个关键领域。这一划分逻辑在于,前两者主要对应滥用风险,即模型的核心能力被恶意行为者直接利用,从而对网络安全和生物安全等外部领域构成威胁。而后两者则更侧重于失控风险与内生风险,主要关乎模型自身在行为决策上的可靠性、可控性及其固有缺陷。尽管评估领域各异,各类评估方案的方法论在底层却共享着通用的技术范式,如动态交互评估、红队测试和工具集成等。

3.1 网络攻击能力评估

网络攻击能力评估的核心是量化LLM执行网络攻防操作(如漏洞利用、脚本编写、钓鱼对话生成、恶意代码生成)的实战能力,以及抵御诱导、避免越界输出的安全性能。现有方案可按基准数据集驱动的自动化评估、CTF挑战导向的综合能力评估、企业自研模型定制化评估三类逻辑分组,各类方案在评估场景、核心方法与指标设计上各有侧重,共同覆盖网络攻击风险的不同维度。

3.1.1 基准数据集驱动的自动化评估方案

这类方案以标准化数据集为核心,搭建自动化评估框架,侧重跨模型的快速对比与基础能力量化,覆盖密码学、漏洞利用、安全知识问答等多个细分场景,为后续更复杂的实战评估提供基础参照。
NYU CTF Bench[18]的评估目标为LLM在进攻性安全任务中的基础能力,其构建了面向进攻性安全的开源CTF基准数据集,涵盖200道来自密码学、逆向工程、取证等领域的挑战题,支持LLM工具调用与跨模型对比的自动化评估。为精准衡量这一基础能力,方案以自动化对比框架作为评估环境,设定的关键指标包括模型的解题成功率、失败类型,以及与人类选手的能力差异。该方案的优点在于其开源性与标准化,便于跨模型对比,但其静态题库形式难以充分评估模型的动态适应与工具调用能力。
与之类似,CVE-Bench[19]同样聚焦于真实场景下的能力测评,但更侧重真实漏洞利用。该方案基于国家漏洞数据库构建评估框架,引入沙盒环境模拟Web漏洞利用场景。为了量化模型的实战表现,方案设定了攻击成功率、任务完成时间、整体执行状态3个关键指标,覆盖40个高危级别的CVE漏洞。此方案通过引入沙盒环境增强了对实战能力的评估,生态效度更高。然而,漏洞覆盖范围有限,评估结果严重依赖于沙盒环境的真实性。
在专业级任务覆盖上,Cybench[12]进一步扩展了工具集成的复杂度,选取来自HackTheBox、Glacier等多个CTF平台的40个专业级挑战,结合Kali Linux命令行、Web搜索等多种工具,对LLM在专业级安全任务中的综合工具调用与执行能力进行系统评估。框架能够支持对复杂工具链的集成,可以评估更真实场景下的网络安全任务。但其评估过程复杂,且缺乏统一的量化指标,导致结果可比性降低。
除实战操作外,CyberMetric[20]利用RAG(Retrieval-Augmented Generation)方法,构建了覆盖9个网络安全领域的问答基准,其中包含10 000个经过人工验证的选择题,支持多模型对比测试,以此评估LLM对网络安全专业知识的掌握程度。Jin等[21]首次对LLM在漏洞生成中的有效性进行了系统研究,评估了LLM的合作性和技术熟练程度。为减少数据集偏差,该研究引入一个包含5个软件安全实验室重构版本的基准测试集。
针对加密类任务的专项需求,HackSynth-GRPO[22]将强化学习的GRPO(Generative Recursive Policy Optimization)策略引入模型训练流程,在模型泛化能力上做了优化,同时构建了包含50个验证加密挑战的random-crypto数据集,用于评估LLM在加密类安全任务中的泛化能力与决策效率。为针对性衡量加密任务的专项能力,方案将工具使用效率、决策准确率设定为关键指标,体现其侧重优化加密任务专项能力的设计思路。

3.1.2 CTF 挑战导向的综合能力评估

CTF挑战导向的综合能力评估方案以夺旗挑战为核心载体,强化真实攻防场景的模拟,通过多维度指标与工具支撑环境,全面测评LLM在复杂任务中的网络安全技能,弥补了基准数据集方案场景单一、缺乏动态交互的不足,更加贴近实际网络攻防的复杂需求。
InterCode-CTF[23]评估了LLM在逆向工程、取证、二进制漏洞利用等复杂CTF任务中的网络安全技能,建立立体评估指标体系,对模型的任务执行过程进行系统性评估。为全面覆盖复杂任务的多维度表现,该立体评估指标体系将任务成功率、完成时间、任务类别表现作为关键指标,评估场景聚焦高难度CTF专项任务。该方案通过立体化的指标体系,提供了对模型CTF能力的细致刻画,优于仅关注成功率的评估,但其对专用脚手架环境的依赖限制了评估的便捷性。
AISI[11]在CTF测评基础上增加了工具支撑环境的适配,构建目标导向结合工具支撑的评估体系,以CTF挑战为核心测评方式,要求模型完成脚本编写、服务器查询等任务以获取隐藏flag,以此评估LLM执行网络攻击基础操作的能力。方案还明确评估对象为5个匿名LLM,以保障测评的全面性与针对性。此评估的典型特点是其目标导向设计,紧密贴合实际攻击流程。然而,由于模型匿名化且细节未完全公开,其结果的透明度和可复现性存在不足。
DeepMind[24]进一步拓展了CTF任务的能力覆盖维度,评估了LLM在网络攻击全流程中的核心能力覆盖度,基于前沿安全框架引入了CTF挑战任务。该方案设定的关键能力维度包括侦察感知、工具开发、工具运用、运营安全,以完整覆盖网络攻击的关键环节。该方案未明确具体量化指标,侧重评估能力维度的完整性

3.1.3 企业自研模型网络攻击评估方案

这类方案针对企业自研LLM的特性(如功能定位、应用场景),结合模型专属能力设计评估任务,兼顾自动化测试与人工验证,重点关注模型在实际应用中的安全边界与辅助攻击风险,与前两类通用方案形成互补。
Meta[25]评估Llama3在网络攻击辅助场景中的表现,依托CYBERSECEVAL[26]框架设计三类核心任务:①为自动化社交工程任务(双LLM模拟“攻击者目标用户”交互生成钓鱼对话);②为扩展手动攻击任务(按新手/专家组分组,对比有LLM辅助与无LLM辅助的渗透测试完成情况);③为自主攻击任务(在Kali Linux环境中部署Llama3,评估端到端攻击辅助表现)。方案核心评估重点放在不同场景下的辅助能力对比上。
Amazon[27]则更关注模型的越界输出风险,基于前沿模型安全框架,划分自动化测试与人工测试两类,评估了Nova模型的网络攻击风险与越界输出行为,自动化测试包含安全知识问答与Cybench CTF挑战两大模块,人工测试通过交互引导模型生成恶意软件。方案聚焦的关键指标有越界输出发生率、CTF任务完成度与安全知识问答准确率,以精准捕捉模型的风险点。
OpenAI[28]将抗诱导能力纳入核心评估维度,结合基准数据集与CTF挑战开展基础测评,评估了LLM的网络攻击能力与抗诱导安全性,同时通过测试人员诱导模型生成恶意代码的实验,验证模型抗诱导能力。方案设定的关键指标有CTF任务成功率、恶意代码诱导成功率,以同时衡量实战能力与安全性能。评估将抗诱导能力作为核心安全维度之一,体现了对模型在对抗性环境下稳健性的高度重视。然而,其红队诱导的具体策略和强度未完全公开,使得不同模型间的抗诱导能力难以直接对标。
Anthropic[29]则从防御视角补充了对抗性攻击的测评,采用自适应对抗训练与输入输出一致性校验,评估了LLM在对抗性攻击中的防御能力与稳健性。为综合评价模型的防御效果与稳健性,方案将对抗成功率、语义鲁棒性得分设定为关键指标,用于综合评价模型抵御攻击与保持输出一致性的能力。方案从防御者视角切入,丰富了网络风险测评的维度,其采用的自适应对抗训练方法虽然提升了鲁棒性,但也可能带来模型能力或响应速度的折损,此权衡未被充分讨论。

3.2 生物武器风险评估

生物武器风险评估的核心是评估LLM在生化敏感知识生成、生化武器辅助设计、高风险实验指导等场景中的潜在危害边界。现有方案主要分为科学知识掌握度评估方案、红队模拟与专家评估方案、工具集成实战评估方案、企业自研模型定制化评估方案。

3.2.1 科学知识掌握度评估方案

这类方案评估LLM对生化领域科学知识的理解,通过标准化任务与多维度指标,量化模型在知识调用中的准确性与合规性,为后续高风险场景的评估奠定知识层面的基础,避免基础知识偏差导致风险误判。
SciKnowEval[30]评估LLM在科学知识理解与生成任务中的表现,设计零样本与少样本两种测试场景。零样本测试反映模型依赖已有知识独立完成任务的能力。少样本测试通过提供极少示例帮助模型调整推理方式,覆盖科学问答、文本生成、关系抽取等任务。方案采用准确率、F1分数作为关键指标。方案提供了对模型科学知识基础的标准化量化评估,对于风险筛查具有高效性。但其局限于知识层面,无法直接评估模型在工具辅助下的实战操作风险。

3.2.2 红队模拟与专家评估方案

这类方案通过红队专家[31],模拟恶意行为者视角,结合开放式测试与专家校验,在科学知识评估的基础上,进一步验证模型是否降低生物攻击的技术门槛。该方案使用WMDP数据集评估LLM在生化武器相关能力中的潜在风险。方案构建开放式问答测试及封闭式专家红队评估的双层体系:先通过开放式问答测试模型知识水平,若表现优异则进一步由安全专家模拟攻击者视角开展攻击提升实验。围绕识别模型降低生物攻击技术门槛风险这一核心,方案设定的关键评估维度为模型是否降低潜在攻击者获取生物危害相关能力的技术门槛与操作复杂度,由专家判定输出的安全性与风险等级。此方案的核心优势在于引入了人类专家的深度判断,能够识别自动化指标难以捕捉的、新颖的风险模式,但其成本高昂、规模受限,且结果受专家主观经验影响较大。

3.2.3 工具集成实战评估方案

这类方案集成真实生化实验工具,模拟专家操作流程,通过思维链式推理测试LLM在生化任务中的实战能力,直接映射模型辅助生化武器开发的潜在风险。
ChemCrow[32]集成18种现实中常用的化学工具(如反应路径规划器、分子结构解析器等),结合思维链式推理方法[33],模拟专家在分子设计、有机合成规划及安全评估任务中的行为,评估LLM在化学任务中的操作能力与安全边界。方案通过工具集成,实现了对模型在化学领域行动能力而非知识的评估,风险映射更直接,但其对安全伦理边界的设计是核心挑战。

3.2.4 企业自研模型定制化评估方案

针对企业自研LLM的功能特性(如检索、代码执行、文献加载),企业自研LLM生物风险评估方案(如表2所示)采用各有侧重的评估策略:设计场景化实验与多维度测试,在通用风险评估的基础上,重点评估模型在生化领域的知识泄露与风险输出行为。
表 2 企业LLM生化风险评估方案

Table 2 Enterprise LLM biochemical risk assessment plan

企业名 核心方法 评估焦点
英美AISI 基本数据集+开放文本答案匹配+自动评分器 生化危险知识的规避能力与输出质量
Meta Uplift 实验设计;对照组 vs Llama3组 非专家用户实施CBRN攻击的门槛与时间
Amazon 自动化测试+人工测试;专家设计题目 危险知识输出行为与安全边界
OpenAI 基准数据集+专家数据集测试 生化知识调用与生成的安全合规性
Anthropic 知识阻断测试+能力边界压力测试 对抗性压力下的安全约束能力
Google 封闭式多选题,开放式问题,红队测试 模型安全机制对双重用途知识请求的防护有效性
AISI[11]评估LLM输出生化领域知识的规避能力,采用开放文本格式收集模型答案,通过与原始答案匹配判断输出质量,为保障评估结果贴合人类专家判断标准,方案不仅搭建含自动评分器(评分标准贴合人类专家判断)的评估工具,还将该工具纳入指定评估框架,最终通过工具校验与框架分析推导测评结论。该方案的工具链能够提升评估效率,但其答案匹配机制可能无法充分捕捉生成文本中语义正确但表述多样的潜在安全风险。
Meta[25]结合自研模型的功能(检索、代码执行)设计对照实验,评估Llama3在生化攻击计划生成中的辅助风险。采用Uplift实验设计:招募低/中等技能水平的参与者,每组需在6 h内推演生成虚构生化攻击计划。方案同时设置对照实验(控制组仅使用互联网资源,LLM组使用具备检索、代码执行、文献加载功能的Llama3),核心评估CBRN攻击的全阶段,对比两组计划的完整性与可行性。此研究通过模拟低/中等技能攻击者在LLM辅助下的行为,极具现实意义,直接揭示了模型降低攻击门槛的风险,但是实验规模受限于人类参与者,且结果可能受特定任务设计影响。
Amazon[27]通过自动化及人工方式评估Nova模型在生化领域的危险知识输出与安全边界。自动化测试从危险知识识别、实验协议纠错、攻击程序规划3个维度展开。人工测试由领域专家设计120个“增益指示”(即风险诱导类)题目。方案设定的关键指标为模型答案的准确性与安全性,以同时保障评估的准确性与安全性,并通过人工测试补充验证自动化测试结果的完整性。
OpenAI[28]侧重从流程合规性评估模型安全表现,主要关注LLM在生化知识调用与危险方案生成中的表现,依靠基准数据集与专家数据集开展测试。方案将回答准确性、步骤完整性、过程安全性作为评估维度。
Anthropic[29]通过高危指令测试评估模型风险,借助知识阻断测试与能力边界压力测试,构建包含5000余条高危指令的测试集,量化模型在高危指令下的风险输出行为。方案通过大规模、系统性的高危指令测试集开展压力测试,覆盖全面的高危场景。但其测试集是静态的,可能无法有效应对通过复杂、间接提示词触发的越狱攻击。
DeepMind[24]从伦理合规视角补充评估维度,评估LLM在生化领域双重用途知识表达与科学伦理边界的把控能力。方案通过封闭式多选题、开放式问题生成及红队测试等组合方式综合评价模型在伦理合规与风险规避上的表现。

3.3 自主性能力测评

自主性能力测评的核心是评估LLM在真实世界复杂任务中的自主决策、任务分解、工具调用及多主体协作能力,揭示模型具备行动自由度时的行为边界与思维逻辑。现有方案可按单智能体复杂任务评估、多智能体协作能力评估、企业自研模型自主性评估三类划分,覆盖自主性风险的不同场景。

3.3.1 单智能体复杂任务评估方案

这类方案聚焦单个LLM代理[34]在多步骤、多工具、多约束场景中的自主执行能力,通过现实任务或实验设计,量化模型的任务分解能力与效率表现,为多智能体协作与实际应用评估提供单模型能力参照。
METR[16]评估LLM在真实世界任务中的自主分解与流程控制能力,提出开放世界任务集与模块化代理架构。该架构构建包含12个现实任务(如文件搜索、图像统计、自动化脚本编写)的执行环境,支持子代理委派、跨模块通信与多工具调用。为评估模型任务完成能力,方案设定的关键指标为完成、部分完成、未完。该方案采用的评估环境包含bash、Python、浏览器等组件。
MLAgentBench[35]主要针对机器学习领域的专业任务,即评估LLM在机器学习实验任务中的自主决策与透明度。该方案设计13个多模态、多难度的机器学习实验任务,构建了可解释的行为结构。虽然其评估过程的可解释性有助于分析模型决策逻辑,但其任务领域专注于机器学习,泛化至其他领域需进一步验证。
GTA[36]方案强调与真实用户场景适配,评估LLM作为工具在真实用户任务中的自主执行能力。具体地,该方案构建了基于229个真实用户查询的任务集,评估模型在多模态输入场景中调用14种真实工具(如OCR、Google Search)的表现。为评估模型调用工具的有效性,方案设定的关键指标包括指令遵循准确率、工具选择合理性、参数预测正确性、结果完整性。该基准的优势在于其任务源于真实用户场景,生态效度高,但存在对多种真实工具的依赖,增加了评估环境的复杂性。
Wang等[37]通过定义利己、利他、竞争与协同4种细粒度决策类型,结合真实交通场景,验证LLM在复杂情况下的决策能力。REALM-Bench[38]则聚焦动态约束场景下的自主规划能力,该方案评估LLM在约束复杂、状态不确定场景中的自主规划与决策能力(如模拟校园导航、灾害物资运输等现实规划与调度任务),该方案采用混合Agent架构(LLM与传统算法融合),评估指标侧重于模型在动态约束下的任务适配性与决策合理性。

3.3.2 多智能体协作能力评估方案

这类方案针对多LLM代理的协同场景,通过交互型任务测试模型的环境理解、信息共享与联合规划能力,填补了单智能体评估在群体行为分析上的空白,更贴近实际应用中多模型协同完成复杂任务的场景。
LLM-Coordination[39]整合4个交互型游戏场景,覆盖单轮与多轮对话、信息共享与联合决策。该基准将协作能力分解为环境理解、心智理论推理[40]和联合规划3个维度,支持使用包含记忆与推理模块的代理框架进行实时交互,并以任务成功率、完成步数与答题准确率等指标综合评估协同任务中模型的自主性表现。该基准的价值在于将评估维度从个体能力扩展到群体协作能力,但设定的游戏化场景与现实世界高风险任务的映射关系仍需加强。
Huang等[41]提出首个多类型多智能体博弈基准,该基准整合8个经典博弈场景,覆盖合作、背叛、序贯三类博弈,用于评估LLM在多智能体博弈环境中的决策与博弈能力。该研究引入经典博弈论场景,为分析模型在利益冲突或合作情境下的战略行为提供了量化框架。该基准的挑战在于,模型在简单博弈中的表现能否推广到更模糊、更复杂的真实世界决策中,仍有待验证。

3.3.3 企业自研模型自主性评估方案

为应对极端风险,诸多企业已构建较完整的自主性能力评估框架。这类框架适配具体场景需求,为自主性能力评估提供了完善支撑。
AISI[11]评估LLM执行软件工程类数字任务的能力,将测评任务划分为两类:一类是1 h内可完成的短期基础操作(如Linux系统问题修复);另一类是4~20 h的长期复杂工作(如Web应用搭建)。为全面测试模型的代理能力,方案依托含Python解释器等工具的基础支撑环境及优化后的脚手架工具。
Amazon[27]结合自动化测试与人工复查的方式实现评估完整性,主要评估Nova模型在自主执行任务中的代码正确性。自动化测试采用REBench任务集,以代码正确性为核心指标。为避免自动化指标遗漏风险,人工测试由METR小组对模型生成的代码进行复查,该方案的关键目标为确保测评结果的完整性与准确性。
OpenAI[28]评估LLM在复杂任务执行与自我改进中的自主能力及安全可控性。方案将风险分为四级风险标准,即单步指令执行、链式任务完成、开放端AI研发、野外生存/自主复制。方案采用两种技术路线进行评估:基础行动链测试以及自我改进能力测试。该框架的前瞻性在于设立了明确的风险分级标准,并将“自我改进”和“自主复制”列为最高风险等级,为行业发展提供了明确导向。然而,对于这些高阶自主风险,目前仍缺乏公认、有效的量化评估手段。
Anthropic[29]评估LLM在网络安全场景下的自主能力及安全可控性。方案设置ASL3为核心安全等级,需通过Responsible Scaling Policy测试,即模型在模拟攻击中无法获取系统控制权,且所有高危操作需人工确认。方案采用两种技术路线进行评估:隔离网络沙盒APT模拟攻击测试及零日漏洞导向的漏洞抑制测试。方案设定了ASL3,通过模拟APT等极端场景,体现出安全优先原则。然而,其严格的人工确认机制虽然保障了安全性,也可能过度限制模型在良性场景下的自主效用。
DeepMind[24]评估LLM在研究工程任务中的能力,采用开源基准REBench(含7项挑战性ML任务)。为客观量化任务完成效率与稳健性,方案采用Bootstrap采样与标准化得分机制作为关键指标量化方式。

3.4 安全防护能力测评

安全防护能力测评的核心是评估LLM部署后的两类关键风险:一是模型自主复制、失控等风险;二是信息生成中幻觉、事实偏离等风险;现有方案可按自主复制与失控风险评估、极端低频风险评估、幻觉现象评估、企业防护策略与模型安全性评估4类划分。

3.4.1 自主复制与失控风险评估方案

这类方案聚焦LLM是否具备构建自我延续机制的能力,通过模拟资源获取、系统复制等流程,量化模型自主复制与失控的潜在风险,为安全管控提供关键依据,是防范模型“脱离人类控制”的核心评估环节。
RepliBench[42]评估了LLM的自主复制能力与失控风险,提出系统化评估框架,聚焦模型在资源获取、权重提取、系统复制与持续运行4个阶段的表现,设计涵盖20个任务家族共86个测试项目,在沙箱环境中测试5个前沿模型。设计核心指标pass@k,来量化模型潜在失控行为的风险程度。
AdvSim[43]则从安全关键任务场景切入,评估LLM在自动驾驶场景中的安全防护能力,间接验证其防护效能。该方案通过合理的物理对抗性场景生成(如轨迹扰动、LiDAR数据伪造),借助黑盒优化机制模拟极端情况与安全关键任务,间接映射模型在安全关键任务中的抗干扰性。为评估模型在安全敏感场景中的防护表现,方案的关键评估方向为自动驾驶系统在潜在碰撞与违规场景中的抗干扰能力。

3.4.2 极端低频风险评估方案

针对LLM大规模部署后可能出现的稀有风险行为(如协助非法活动、模拟权力寻求),这类方案通过小样本预测方法,评估系统级滥用风险,避免因风险发生概率低而忽视潜在危害。
Jones等[44]评估LLM在大规模部署背景下的极端低频风险行为,提出Gumbel-tail分析与诱发概率量化机制,从小样本数据中预测系统级滥用风险。为给低频高风险场景防护提供支撑,方案的关键理论贡献为构建一套从稀有行为预测长尾威胁的工具。

3.4.3 幻觉现象评估方案

针对LLM生成“看似合理却事实错误”信息的幻觉问题,这类方案通过统一标注与多任务测试,分类识别幻觉类型与严重程度,提升模型输出的事实性与可靠性,是防范误导性信息传播的核心评估环节。
HaluEval[45]构建统一标注的多任务评估基准,评估LLM在自然语言生成中的幻觉现象识别与量化能力。该基准覆盖问答、摘要与对话生成三类任务,采用采样、过滤、人工判定的流程框架。为系统识别不同类型的幻觉问题,方案设定的关键分类维度为虚构、歪曲与不可验证三类幻觉类型,并标注严重程度。方案的关键目标为系统识别各类幻觉问题,为模型优化提供方向。
TruthfulQA[46]则更侧重分析认知偏误诱导产生的输出风险,设计817道对抗性问题,诱导模型生成偏离事实的输出,通过人工评估对输出进行分级,评估LLM模仿人类认知偏误、生成貌似合理但错误答案的倾向。为揭示模型在事实性任务中的偏向来源,方案衡量的关键指标为“真实”与“貌似合理但错误”答案的比例,为降低认知偏误提供依据。该基准揭示了安全风险的深层认知根源,但其问题集是静态的,可能被模型通过记忆而非真正理解来规避。

3.4.4 企业防护策略与模型安全性评估方案

针对企业自研LLM的防护机制的有效性,这类方案通过文档知情测试、上下文干扰测试等场景,验证模型抵御外部攻击、防止有害信息泄露的能力,强化安全防护设计。
AISI[11]针对现有防护机制易被突破的问题,评估LLM抵御外部攻击、防止有害信息泄露的能力,设置两类测试场景:无攻击场景(直接提出有害问题)与有攻击场景(通过基础手段尝试获取敏感信息)。为保障测评结果的可靠性,方案以3种LLM为评估对象,采用自动分级工具及人工评分的联合判定方式,最终完成安全防护能力测试与结论推导。测评通过区分无攻击和有攻击场景,系统化地测试了模型的基线安全性和抗攻击能力。该测评的结论稳健性在很大程度上依赖于所选取的攻击手段的代表性和强度。
Meta[25]则从文档知情与上下文干扰两个维度测试防护策略,验证Llama3安全防护策略的有效性。采用两类测试:即DocQA测试,提供含恶意信息的长文档及相关问题,评估模型在知情后能否输出安全响应;Manyshot测试提供含不安全行为的对话历史及无关提示,评估上下文信息对模型输出的影响。方案对模型的安全防护表现进行量化分析,以此优化防护策略设计。评估的创新点在于测试了上下文对话历史对模型安全性的影响,揭示了安全机制可能被上下文“稀释”的风险,这警示模型的安全防护评估必须是动态和上下文相关的。

3.5 现有评估方案的总体审视

对现有评估方案的综述表明,LLM极端风险测评领域已初步形成以具体风险领域为导向、以动态交互与红队测试为核心方法的探索格局。然而,这一领域整体上仍处于碎片化的早期阶段。当前研究大多由业界领先机构驱动,其评估框架高度依赖于自建的、非公开的基准数据集与专有工具链,这导致不同研究之间的测评结果难以进行直接比较与互认。尽管在方法论上普遍认识到从静态知识考察转向动态能力评估的重要性,但支撑这一转向的标准化基础设施与安全隔离环境仍显不足,使得许多高风险任务的测评难以安全、合规地大规模开展。此外,现有工作多数聚焦于单领域、单模态的风险,对于模型能力交叉融合可能催生的新型、复合型极端风险,尚缺乏系统性的评估框架。这些挑战共同指向下一个关键问题:如何构建更为系统、科学且可操作的下一代测评体系。

4 结束语

随着大模型能力的快速演进,其潜在安全风险呈现出复杂化与极端化趋势。工业界和学术界正通过系统化框架与多维度指标,为识别、量化和比较AI极端风险提供可行路径。本文综述了当前前沿的LLM极端风险测评方法,尽管相关研究仍处于探索阶段,但在生化、网络攻防与自主性等方面已展现出初步成效。
基于对现有评估方案的审视,未来的研究需要从分散探索迈向体系构建,以应对日益复杂的LLM极端风险态势。以下几个方面值得进一步探索。①评估体系与基准的标准化。 当前不同机构间评估方案的差异性,制约了测评结果的横向可比性与学术共识的形成。为此,亟待由学术共同体与标准化组织协同联合,建立开放、权威的基准任务库与统一的量化指标体系。此举是实现有效模型比对、行业监管与风险分级的基础。②跨领域与多模态风险拓展。 AI极端风险不局限于文本生成,而可能在多模态模型[47](图像、语音、视频)和跨领域应用中表现出更复杂的耦合效应,产生风险放大效应。例如,兼具生化文献理解与自动化脚本编写能力的模型,其潜在危害远超功能单一的模型。因此,开发能够有效评估这种能力协同效应的跨模态测评框架,是进行前瞻性风险识别的必要条件。③方法多样化与安全性保障。 在任务设计日益复杂的背景下,为安全执行高风险任务测评,构建高保真、强隔离的安全沙盒环境已成为关键技术前提。同时,应大力发展基于合成数据、对抗性红队测试与渐进式探索的技术路径,以期在最大限度上控制信息泄露与滥用风险的前提下,精准探测模型的能力边界。④ 技术体系化与工具化支持。 极端风险测评的有效开展依赖于系统性的技术基础设施。构建自动化的测评工具链、可复现的实验框架与高效的数据管理平台,是支撑大规模、标准化风险测评的基础。推动测评技术的工程化与生态建设,将为前沿模型的风险监测与治理提供可持续的技术支撑。
展望未来,体系化的极端风险测评方法有望成为推动大模型应用安全研究的重要方向,为人工智能的可控发展与可信应用提供支撑。
1
Vaswani A, Shazeer N, Parmar N, et al. Attention is all you need[C]//Neural Information Processing Systems Foundation. Advances in Neural Information Processing Systems. Red Hook: Curran Associates, Inc, 2017: 5998-6008.

2
Shevlane T, Farquhar S, Garfinkel B, et al. Model evaluation for extreme risks[PP/OL]. V2. arXiv (2023-09-22)[2025-09-11]. https://doi.org/10.48550/arXiv.2305.15324.

3
Heslop D J, Keep J R. Chemical and biological weapons in the age of generative artificial intelligence[C]//The Routledge Handbook of Artificial Intelligence and International Relations. LondonRoutledge. 2025: 129-148.

4
Tang X, Jin Q, Zhu K, et al. Prioritizing safeguarding over autonomy: risks of LLM agents for science[C]//ICLR Workshop Committee. ICLR 2024 Workshop on Large Language Model (LLM) Agents. Vienna: OpenReview, 2024: 45-56.

5
Pan X D, Dai J R, Fan Y H, et al. Frontier AI systems have surpassed the self-replicating red line[PP/OL]. V1. arXiv (2024-12-09)[2025-09-11]. https://doi.org/10.48550/arXiv.2412.12140.

6
Sakib M N, Islam M A, Pathak R, et al. Risks, causes, and mitigations of widespread deployments of large language models (LLMs): a survey[C]//Proceedings of the 2024 2nd International Conference on Artificial Intelligence, Blockchain, and Internet of Things (AIBThings). Piscataway: IEEE Press, 2024: 1-7.

7
Kucharavy A, Plancherel O, Mulder V, et al. Large language models in cybersecurity: threats, exposure and mitigation[M]. Cham: Springer Nature Switzerland, 2024.

8
Xu R W, Li X J, Chen S, et al. Nuclear deployed: analyzing catastrophic risks in decision-making of autonomous LLM agents[PP/OL]. V3. arXiv (2025-03-23)[2025-10-11]. https://doi.org/10.48550/arXiv.2502.11355.

9
Yuan T X, He Z W, Dong L Z, et al. R-judge: benchmarking safety risk awareness for LLM agents[PP/OL]. V3. arXiv (2024-10-05) [2025-10-11]. https://doi.org/10.48550/arXiv.2401.10019.

10
Huang L, Yu W J, Ma W T, et al. A survey on hallucination in large language models: principles, taxonomy, challenges, and open questions[J]. ACM Transactions on Information Systems, 2025, 43 (2): 1- 55.

11
AISI U K. Advanced AI evaluations at AISI: may update[R]. UK AI Security Institute. Advanced AI Safety Evaluation Series. London: UK AI Security Institute, 2024. 1-32

12
Zhang A K, Perry N, Dulepet R, et al. Cybench: a framework for evaluating cybersecurity capabilities and risks of language models[DB/OL]. Ithaca: Cornell University Library(2024-08-16)[2025-10-11]. https://arxiv.org/abs/2408.08926.

13
Li N, Pan A, Gopal A, et al. The WMDP benchmark: measuring and reducing malicious use with unlearning[PP/OL]. V7. arXiv (2024-05-15)[2025-10-11]. https://doi.org/10.48550/arXiv.2403.03218.

14
Rein D, Hou B L, Stickland A C, et al. GPQA: a graduate-level google-proof Q&A benchmark[C]//Language Modeling Conference Committee. First Conference on Language Modeling. New York: ACM Digital Library, 2024-06: 68-79.

15
Mialon G, Fourrier C, Swift C, et al. GAIA: a benchmark for general AI assistants[DB/OL]. Ithaca: Cornell University Library(2023-11-20)[2025-10-11]. https://arxiv.org/abs/2311.12983.

16
Kinniment M, Sato L J K, Du H X, et al. Evaluating language-model agents on realistic autonomous tasks[PP/OL]. V2. arXiv (2024-01-04)[2025-10-11]. https://doi.org/10.48550/arXiv.2312.11671.

17
Wijk H, Lin T, Becker J, et al. Re-bench: evaluating frontier AI R&D capabilities of language model agents against human experts[DB/OL]. Ithaca: Cornell University Library (2024-11-22)[2025-10-11]. https://arxiv.org/abs/2411.15114.

18
Chen B Y, Dolan-Gavitt B, Garg S, et al. NYU CTF bench: a scalable open-source benchmark dataset for evaluating LLMs in offensive security[C]//Proceedings of the Advances in Neural Information Processing Systems 37. Neural Information Processing Systems Foundation, Inc. (NeurIPS), 2024: 57472-57498.

19
Zhu Y, Kellermann A, Bowman D, et al. CVE-Bench: a benchmark for AI agents' ability to exploit real-world web application vulnerabilities[DB/OL]. Ithaca: Cornell University Library (2025-03-24)[2025-10-11]. https://arxiv.org/abs/2503.17332.

20
Tihanyi N, Ferrag M A, Jain R, et al. CyberMetric: a benchmark dataset based on retrieval-augmented generation for evaluating LLMs in cybersecurity knowledge[C]//Proceedings of the 2024 IEEE International Conference on Cyber Security and Resilience (CSR). Piscataway: IEEE Press, 2024: 296-302.

21
Jin D, Fu Q, Li Y K. Good news for script kiddies evaluating large language models for automated exploit generation[C]//Proceedings of the 2025 IEEE Security and Privacy Workshops (SPW). Piscataway: IEEE Press, 2025: 278-282.

22
Muzsai L, Imolai D, Lukács A. Improving LLM agents with reinforcement learning on cryptographic CTF challenges[PP/OL]. V2. arXiv (2025-08-17)[2025-10-11]. https://doi.org/10.48550/arXiv.2506.02048.

23
Yang J, Prabhakar A, Yao S, et al. Language agents as hackers: evaluating cybersecurity skills with capture the flag[C]//NeurIPS Workshop Committee. Multi-Agent Security Workshop@ NeurIPS'23. New Orleans: Curran Associates, Inc. , 2023-12: 56-67

24
Comanici G, Bieber E, Schaekermann M, et al. Gemini 2.5: pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities[DB/OL]. Ithaca: Cornell University Library(2025-07-04)[2025-10-11]. https://arxiv.org/abs/2507.06261.

25
Grattafiori A, Dubey A, Jauhri A, et al. The Llama 3 herd of models[DB/OL]. Ithaca: Cornell University Library(2024-07-23) [2025-10-11]. https: //arxiv.org/abs/2407.21783.

26
Wan S Y, Nikolaidis C, Song D, et al. CYBERSECEVAL 3: advancing the evaluation of cybersecurity risks and capabilities in large language models[PP/OL]. V2. arXiv (2024-09-06)[2025-10-11]. https://doi.org/10.48550/arXiv.2408.01605.

27
Krishna S, Mehrabi N, Mohanty A, et al. Evaluating the critical risks of Amazon's nova premier under the frontier model safety framework[DB/OL]. Ithaca: Cornell University Library(2025-07-04) [2025-10-11]. https://arxiv.org/abs/2507.06260.

28
Coggins S, Saeri A K, Daniell K A, et al. The 2025 OpenAI preparedness framework does not guarantee any AI risk mitigation practices: a proof-of-concept for affordance analyses of AI safety policies[PP/OL]. V2. arXiv (2025-10-13)[2025-10-21]. https://doi.org/10.48550/arXiv.2509.24394.

29
Lynch A, Wright B, Larson C, et al. Agentic misalignment: how LLMs could be insider threats[PP/OL]. V2. arXiv (2025-10-16)[2025-10-22]. https://doi.org/10.48550/arXiv.2510.05179.

30
Feng K H, Shen X Y, Wang W J, et al. SciKnowEval: evaluating multi-level scientific knowledge of large language models[PP/OL]. V4. arXiv (2025-10-07)[2025-10-11]. https://doi.org/10.48550/arXiv.2406.09098.

31
Barrett A M, Jackson K, Murphy E R, et al. Benchmark early and red team often: a framework for assessing and managing dual-use hazards of AI foundation models[PP/OL]. V1. arXiv (2024-05-15)[2025-10-11]. https://doi.org/10.48550/arXiv.2405.10986.

32
Bran A M, Cox S, Schilter O, et al. Augmenting large language models with chemistry tools[J]. Nature Machine Intelligence, 2024, 6 (5): 525- 535.

DOI

33
Wei J, Wang X Z, Schuurmans D, et al. Chain-of-thought prompting elicits reasoning in large language models[C]//Proceedings of the 36th International Conference on Neural Information Processing Systems. New York: ACM, 2022: 24824-24837.

34
Zhou W, Jiang Y, Li L, et al. Agents: an open-source framework for autonomous language agents[C]//ICLR Workshop Committee. ICLR 2024 Workshop on Large Language Model (LLM) Agents. Vienna: OpenReview, 2024: 89-100.

35
Huang Q, Vora J, Liang P, et al. MLAgentBench: evaluating language agents on machine learning experimentation[PP/OL]. V2. arXiv (2024-04-14)[2025-10-11]. https://doi.org/10.48550/arXiv.2310.03302.

36
Chen C L, Chen K, Le X Y, et al. GTA: a benchmark for general tool agents[C]//Proceedings of the Advances in Neural Information Processing Systems 37. Neural Information Processing Systems Foundation, Inc. (NeurIPS), 2024: 75749-75790.

37
Wang L H, Jiang Z Y, Hu C K, et al. Comparing AI and human decision-making mechanisms in daily collaborative experiments[J]. iScience, 2025, 28 (6): 112711.

DOI

38
Geng L, Chang E Y. Realm-bench: A real-world planning benchmark for LLMs and multi-agent systems[DB/OL]. Ithaca: Cornell University Library(2025-02-27)[2025-10-11]. https://arxiv.org/abs/2502.18836.

39
Agashe S, Fan Y, Reyna A, et al. LLM-coordination: evaluating and analyzing multi-agent coordination abilities in large language models[PP/OL]. V3. arXiv (2025-04-28)[2025-10-11]. https://doi.org/10.48550/arXiv.2310.03903.

40
Li H A, Chong Y Q, Stepputtis S, et al. Theory of mind for multi-agent collaboration via large language models[PP/OL]. V3. arXiv (2024-06-26)[2025-10-11]. https://doi.org/10.48550/arXiv.2310.10701.

41
Huang J, Li E J, Lam M H, et al. Competing large language models in multi-agent gaming environments[C]//ICLR Conference Committee. The Thirteenth International Conference on Learning Representations. Singapore: OpenReview, 2025: 78-89.

42
Black S, Stickland A C, Pencharz J, et al. RepliBench: evaluating the autonomous replication capabilities of language model agents[PP/OL]. V2. arXiv (2025-05-05)[2025-10-11]. https://doi.org/10.48550/arXiv.2504.18565.

43
Wang J K, Pun A, Tu J, et al. AdvSim: generating safety-critical scenarios for self-driving vehicles[C]//Proceedings of the 2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). Piscataway: IEEE Press, 2021: 9904-9913.

44
Jones E, Tong M, Mu J, et al. Forecasting rare language model behaviors[PP/OL]. V1. arXiv(2025-02-24)[2025-10-11]. https://doi.org/10.48550/arXiv.2502.16797.

45
Li J Y, Cheng X X, Zhao W X, et al. HaluEval: a large-scale hallucination evaluation benchmark for large language models[PP/OL]. V3. arXiv (2023-10-23)[2025-10-11]. https://doi.org/10.48550/arXiv.2305.11747.

46
Lin S, Hilton J, Evans O. TruthfulQA: measuring how models mimic human falsehoods[PP/OL]. V2. arXiv (2022-05-08)[2025-10-11]. https://doi.org/10.48550/arXiv.2109.07958.

47
Lu W K, Peng H, Zhuang H P, et al. SEA: low-resource safety alignment for multimodal large language models via synthetic embeddings[PP/OL]. V3. arXiv (2025-06-02)[2025-10-11]. https://doi.org/10.48550/arXiv.2502.12562.

文章导航

/