Academic Research

Behavioral dynamics theory and safety monitoring methods for intelligent systems

  • LI Simin 1 ,
  • WANG Jiakai 2 ,
  • LIU Aishan 1 ,
  • LIU Xianglong , 1, 2, 3, *
Expand
  • 1. State Key Laboratory of Software Development Environment (SKLSDE) Lab, Beihang University,Beijing 100191, China
  • 2. Zhongguancun Laboratory, Beijing 100094, China
  • 3. Institute of Data Space, Hefei Comprehensive National Science Center, Hefei 230000, China

Online published: 2025-01-25

Copyright

Copyright ©2024 Journal of Aeronautical Materials. All rights reserved.

Abstract

Artificial intelligence (AI) is increasingly being employed in the field of network security, yet the deployment of AI techniques faces significant challenges due to their inherent black-box nature and the complexity of real-world applications. While a variety of platforms and tools have been developed to monitor the security of AI algorithms, merely securing the intelligent algorithms is inadequate to ensure the stable operation of the intelligent systems as a whole due to the influence of the intricate environment within intelligent systems and the coupling between multiple AI algorithms, which presents new changes to their safety. To address these issues, it is essential to monitor the security of intelligent systems in real time during deployment to ensure stable operation. Aiming at the safety monitoring problems faced by intelligent systems, firstly, the definition of security within intelligent systems was clarified, and societal problems that could be traced back to the security challenges of intelligent systems in the real world were identified. Then proceeding from the perspective of complex system theory, the micro and macro behavioral dynamics for intelligent systems along with the corresponding monitoring methods were introduced. Lastly, a case study of monitoring intelligent systems for robot swarm control from the real-world application scenarios was presented, and the potential future research directions were proposed. The development and research into theories and methodologies for monitoring the safety of intelligent systems are crucial for effectively identifying and preemptively discovering the potential risks and security flaws during the deployment phase, which serves as a vital component in achieving trustworthy AI algorithms and is of significant importance in realizing safe AI.

Cite this article

LI Simin , WANG Jiakai , LIU Aishan , LIU Xianglong . Behavioral dynamics theory and safety monitoring methods for intelligent systems[J]. Journal of Cybersecurity, 2024 , 2(6) : 86 -97 . DOI: 10.20172/j.issn.2097-3136.240606

0 引言

以多个人工智能算法组成的智能系统在网络安全领域中发挥了重要作用,产生了溢出性极强的经济效益[1]。然而,基于数据驱动的人工智能方法,特别是深度学习等大数据、大模型的学习范式,其模型行为不可控,其决策机理难以解释,在模型部署应用的过程中产生了鲁棒性、公平性、隐私性、可解释性等诸多算法安全问题[2]。此外,由于人工智能算法的学习过程无法控制,可能会导致智能系统做出歧视性决策、有害正反馈、意见极化等系统安全隐患。更严重的是,智能系统“黑箱”的不透明与难解释等特征,必将导致政府难以对智能系统进行有效的综合治理,从而引发严重的政治、经济、社会风险[3-4]。这引起政治实体、社会组织和学术单位的广泛关注,直接影响普通民众的切身利益与对智能算法的信任,为算法智能决策的推行和实施带来极大的负面影响。
为应对智能系统的不安全、不可靠的问题,学术界与工业界已经开始对智能算法测试阶段的鲁棒性进行静态检测。如图1所示,国际上,加拿大多伦多大学开源了对抗训练库CleverHans[5],提供了针对智能算法的标准对抗样本生成技术与对抗训练技术,可以助力开发更加鲁棒的人工智能模型。IBM公司开发了ART(Adversarial Robustness Toolbox)工具库[6],为开发人员提供了面向对抗样本的多种防御技术,并支持多种实用的机器学习框架、数据类型和任务类型。在国内,百度公司提出AdvBox开源算法鲁棒性评测工具箱[7],能够测试模型在对抗样本及噪声、模糊、亮度变化、旋转等因子下的鲁棒性。北京航空航天大学研发了“重明”人工智能安全评测平台[8],具备对于智能算法的全流程对抗攻击能力,并可以生成可解释的模型鲁棒性评测报告。
图 1 国内外智能算法鲁棒性评测工具总结

Fig.1 Summarization of domestic and foreign robustness evaluation tools for intelligent algorithms

尽管对智能系统测试阶段的安全检测是保障智能系统安全的重要一环,但却忽略了智能系统训练、部署阶段的鲁棒性,无法全面、完善地对智能系统安全性进行评价。具体而言,智能系统训练过程中算法行为习得过程不可控,及系统的微观信息传输机理未知,导致智能系统的决策过程仍然是一个黑盒,产生了对抗样本[9-10]、模型偏见[11]、算法歧视[12]等安全风险;智能系统部署阶段多个智能算法之间的行为相互耦合,导致智能系统中诸多智能算法决策过程不可控,及智能系统总体行为失常,产生了有害正反馈[13]、算法共谋[14]、意见极化[15]等安全风险。由于智能系统训练阶段的安全问题由智能系统参数的不断更新而逐渐习得,智能系统部署阶段的安全问题在智能系统与环境及其他智能体的交互过程中产生,其不安全、不可靠的行为是动态演化而非静态存在的。因此,区别于使用对抗样本对智能算法的安全性进行静态检测,为保障智能系统训练阶段、部署阶段的安全性,必须动态地把握智能系统的安全态势,对其训练、运行过程进行实时的动态监测。
本文首先给出了智能系统安全监测的定义,并说明了其必要性与重要性。然后,提出了智能系统安全监测行为动力学模型,介绍了智能系统安全监测的测试方法。最后,通过智能无人集群案例,详细阐述了智能系统安全的风险与挑战,并进一步给出了保障智能系统安全监测的测试流程、测试指标与生态体系建设方面的建议。

1 智能系统安全内涵

本节首先给出智能系统的定义,并将智能系统中的安全问题划分为微观传输机理未知和宏观行为机器未知导致的安全性问题。随后,以真实世界中的样例对两种智能系统的安全问题进行详细介绍,并指出其可能导致的社会问题。
为研究智能系统的安全,首先给出智能系统的定义。由于智能系统涵盖学科多、应用领域多、应用环境复杂,因此其存在多种定义。本文中,作者从人工智能的角度出发,定义智能系统为一种在环境中运行并采取理性决策的计算机系统[16]。其中,系统的智能主要体现在其知识应用能力、推理能力、泛化能力和学习能力。与传统算法相比,智能系统所求解的空间数量级通常为指数级,其求解方式往往是非确定的,或使用启发式算法。为了应对如图像识别[17-18]、自然语言处理[19-20]等真实世界的复杂场景,智能系统往往使用深度神经网络对输入进行拟合。但是,由于目前深度神经网络大数据、大模型驱动的学习范式,模型在训练、测试、部署中的推断和决策行为均无法解释[21]。神经网络的不可解释性引发了一系列智能系统安全问题,包括由系统微观信息传输机理未知导致的安全性缺失问题和由系统宏观行为机理未知导致的安全性缺失问题。
系统微观信息传输机理未知所导致的安全性缺失问题,是指由于智能系统中的深度神经网络层数众多,每一层所学习到的特征和参数不具有可解释性,且神经网络为非线性系统,难以对输入至输出过程中神经网络中每一层所提取的特征和传输的信息进行分析和调控。因此,系统在学习过程中可能依赖不符合人类正常感知模式、不符合人类伦理道德的规律进行决策。例如,对抗样本[9-10]通过在输入数据中添加微小、人眼不可见的对抗噪声,就可以以极大的概率使神经网络做出任意攻击者期望的预测。虽然对抗噪声极为微小,由于神经网络的非线性和神经网络参数的黑箱性,这种微小的噪声可以在神经网络传输的过程中不断扩大,最终导致神经网络在自动驾驶、金融买卖等重要决策中失误;模型偏见[11]是指卷积神经网络在学习的过程中,由于底层感受野受限,网络倾向于使用图像的纹理特征而非形状特征进行识别,导致神经网络识别过程中的偏见,从而无法对于部分物体进行识别;算法歧视[12]是指算法决策过程中,由于训练数据集带有对特定群体的歧视,从而使神经网络在训练过程中继承这种歧视行为。例如,谷歌的图像识别算法曾将黑人识别为大猩猩,引起了社会的强烈不满。
系统微观传输机理不清导致智能系统重要任务决策的可信性低,系统无法保证运行时安全可靠,危害民生安全。算法应用的目标、政策判断、公平与否都被“黑箱”遮蔽,人们无法确定算法运行的结果是否可信。实际生活中,公众不知道涉及自身利益的算法的设计意图是什么、其数据来源是否正当、算法是如何运行的以及运行结果是否公平,这意味着公民的知情权在一定程度上被遮蔽。在这种情况下,容易引发社会公众对算法合理性的担忧,从而引发对政府监管机构的信任危机。政府在此过程中进入一个自身无法观察、难以理解、不能解释的监管“黑箱”,政府职责的有效性和公平性变得无法评估,无力对社会公众负责,造成政府机构的信任危机[22]
系统宏观行为机理未知导致的安全性缺失问题,是指由于智能系统中由于系统学习过程不可控,因此系统宏观行为难以预测、难以概括,系统在学习过程中可能会生成不符合人类预期的行为,甚至对人类的利益和行为造成损害。例如,有害正反馈[13]是指算法在与环境交互的过程中,由于忽视了自身决策对环境的影响,而学习到具有偏见的策略。例如,美国警察局使用预测算法为每个街区分配警力。由于不同街区的犯罪率不同,算法倾向于将所有警力派向犯罪率高的街区,忽略了犯罪率低的街区的住户安全。此外,由于算法不向犯罪率低的街区派遣警力,反而导致所有罪犯均聚集在原先犯罪率低的街区;算法共谋[14]是指当环境中具有多个目标相近的算法时,算法之间会自发串通起来以达成优化目标的目的。例如,市场中多个目标为最大化自身收益的算法会自发串通、默契抬价,从而垄断市场;意见极化[15]是指社交媒体为最大化用户使用时间,大量地为用户推荐同质化信息,不断强化用户自身的偏见,激化社会矛盾。
系统宏观行为机理不清导致传统监管手段失效,政府对智能系统无从监管、无法规制。由于系统宏观行为不可控,系统中可能隐藏任意不明缺陷和风险,让政府监管机构规制系统的内容与手段均受到限制。即使算法给出的决策与人类实际目标相悖,政府也无法识别和判断产生问题的原因,以致难以及时针对算法问题进行问责和纠偏。进一步地,拥有智能系统的企业可以通过操纵智能系统控制其用户,从而导致公共利益被私人俘获,私有资本支配公权力。
整体而言,智能系统中微观传输机理不清、宏观行为机理未知,导致智能系统安全态势无法刻画,智能系统安全行为无法感知。智能系统安全性的缺失带来了一系列风险,给智能系统在真实世界中的可靠应用、民众对智能系统决策的信任、政府对智能系统的监管带来了挑战[23]

2 智能系统行为动力学理论

为解决智能系统宏观、微观机理未知的问题,本文从复杂系统[24]理论出发,依托复杂系统中变量之间的复杂非线性关系,对神经网络中多层次、多尺度的复杂耦合关联性进行建模,从而对其内在规律进行挖掘。具体而言,在复杂系统的微观层面,高度同质化的微观个体可能由于微观条件的微小差异,而涌现出复杂多样的结果。例如,在渗流过程中,每一个节点渗流率的微小不同,将会导致渗流过程成功或失败[25-26]。相似地,在神经网络中,由于神经元之间的微观信息传输机理未知,因此,对抗样本可以通过使用微小的扰动,造成神经网络以极大的置信度给出错误的结果。在复杂系统的宏观层面,现有研究主要关注智能体间的交互。在多样化的博弈场景中,智能体之间由于环境、目的不同,而在决策的过程中收敛至不同的博弈均衡点,导致博弈过程中行为演化模式不同[27-28]。相似地,在多智能体强化学习中,由于智能系统中的宏观行为机理不清,智能体间的合作可能受到环境、智能体行为等因素的干扰,从而其合作关系被破坏。
对于智能系统中的微观信息传输机理未知问题,如图2所示,本文基于多重网络中的信息扩散机制[29],提出智能系统微观信息传输动力学理论,分析智能系统中的关键信息和脆弱信息传播机理;对于智能系统中的宏观行为机理不清问题,本文基于非对称性反馈的耦合群体博弈动力学,提出智能系统宏观博弈行为动力学理论,刻画智能系统安全场景中的智能算法关联性。
图 2 智能系统微观信息传输动力学理论基于多重网络中的扩散机制刻画网络中信息传输过程

Fig.2 Micro information transmission dynamics in intelligent systems depicts information spread based on diffusion theory in multiple networks

对于神经网络中的微观信息传输机理未知问题,针对神经网络中神经元数量多、层数多、存在非线性关系等问题,复杂系统从信息传输的角度,对不同节点之间的信息传输动力学进行探究。例如,在多重网络的层间传染-层间恢复信息扩散模型中,基于SIR(Susceptible-Infected-Recover)模型[30],可以将被传播者视为鲁棒性薄弱的神经元,不知情者视为未被当前对抗样本扰动的神经元,抑制者视为对抗训练后的鲁棒神经元,从而建立对抗训练下对抗噪声的任意相邻两层(为了方便,这里表述为第1层与第2层)之间的层间信息传输动力学方程:
$ \left\{\begin{aligned} \dfrac{d{i}_{1}}{dt}=&-{\lambda }_{1} < n{ > }_{1}{i}_{1}\left(t\right)\left(1-{i}_{1}\left(t\right)-{r}_{1}\left(t\right)\right)\\&-{\theta }_{1}{i}_{1}\left(t\right)\left(1-{i}_{2}\left(t\right)-{r}_{2}\left(t\right)\right)\\&-{\theta }_{2}{r}_{2}\left({T}_{c}\right){i}_{1}\left({T}_{c}\right){\left(1-{\theta }_{2}\right)}^{t-{T}_{c}}\\ \dfrac{d{r}_{1}}{dt}=&{\mu }_{1}^{*}\left(1-{i}_{1}\left(t\right)-{r}_{1}\left(t\right)\right)\\&+{\theta }_{2}{r}_{2}\left({T}_{c}\right)\left(1-{r}_{1}\left({T}_{c}\right)\right){\left(1-{\theta }_{2}\right)}^{t-{T}_{c}}\\\dfrac{d{i}_{2}}{dt}=&-{\lambda }_{2} < n{ > }_{2}{i}_{2}\left(t\right)\left(1-{i}_{2}\left(t\right)-{r}_{2}\left(t\right)\right)\\&-{\theta }_{1}{i}_{2}\left(t\right)\left(1-{i}_{1}\left(t\right)-{r}_{1}\left(t\right)\right)\\&-{\theta }_{2}{r}_{1}\left({T}_{c}\right){i}_{2}\left({T}_{c}\right){\left(1-{\theta }_{2}\right)}^{t-{T}_{c}}\\\dfrac{d{r}_{2}}{dt}=&{\mu }_{2}^{*}\left(1-{i}_{2}\left(t\right)-{r}_{2}\left(t\right)\right)\\&+{\theta }_{2}{r}_{1}\left({T}_{c}\right)\left(1-{r}_{2}\left({T}_{c}\right)\right){\left(1-{\theta }_{2}\right)}^{t-{T}_{c}}\end{aligned}\right. $
其中,$ {i}_{k}\left(t\right)、{s}_{k}\left(t\right)、{r}_{k}\left(t\right) $为分别为第k层内的感染者、不知情者、恢复者,$ {\lambda }_{k} $为第k层内感染者节点传给不知情者节点的概率,$ {\mu }_{k}^{*} $为使用平均场法近似后感染者节点转变为恢复者节点的概率,$ {\theta }_{k} $为感染过程在层间的传播,即某一层中的不知情者如果在另一层网络中为传播者状态,其在这一层中也变成传播者的概率, $ < n{ > }_{k} $为第k层Erdos-Renyi随机网络的平均度,$ {T}_{c} $是使每一层k新增的抑制者$ {r}_{k}\left(t+1\right)- {r}_{k}\left(t+1\right) < \epsilon $$ {s}_{k}\left(t\right) < \epsilon $$ \epsilon > 0,j=1, 2 $)的时间点。
基于智能系统的微观信息传输动力学理论,可以建立微观对抗信息扩散模型。在神经网络训练的过程中,基于对抗信息的层间传输过程,定位神经网络中的关键节点以及关键脆弱路径下的动力学演变过程,从而有针对性地提升智能系统的鲁棒性。
对于神经网络中宏观行为未知问题,针对神经网络中智能算法宏观行为获得机制未知、宏观行为难以调控等问题,如图3所示,复杂系统从群体博弈动力学的角度,对群体合作和群体背叛行为的震荡循环机制给出了解释,是智能系统中安全性调控的重要思路。例如,在非对称环境-群体博弈耦合动力学模型[31]中,多个参与者共同参与博弈,并在最大化自身收益的情况下选择合作或背叛。若将合作者视为正常智能体、背叛者视为黑客控制的智能体,其动力学方程可以表达为:
图 3 智能系统宏观博弈行为动力学理论基于群体博弈动力学理论刻画智能体鲁棒态势

Fig.3 Macro game behavioral dynamics theory in intelligent systems depicts robustness status of agents in based on population game dynamics theory

$ \left\{\begin{aligned} \dot{x}=&x\left(1-x\right)\left(\dfrac{sx+1}{x+1}{r}_{c}-\dfrac{sx}{s+1}{r}_{d}-1\right)\\\dot{{r}_{c}}=&\varepsilon \left({r}_{c}-\alpha \right)\left(\beta -{r}_{c}\right)\left[-x\left(-1+\dfrac{{r}_{c}\left(1+sx\right)}{s+1}\right)\right.\\& \left.+\theta (1-x)\dfrac{{r}_{d}sx}{s+1}\right]\end{aligned}\right. $
其中,x为博弈中群体合作者的比例,$ {r}_{c} $$ {r}_{d} $分别为合作者和背叛者的倍增因子,$ \alpha $$ \beta $分别为合作者倍增因子的最大值与最小值,s为博弈中除了博弈发起者之外的人数,$ \theta $代表合作者总收益期望给系统带来的提升与背叛者总收益期望给系统带来的下降之比值,且$ \theta > 0 $
基于智能系统的宏观博弈行为动力学理论,可以建立宏观对抗行为交互模型。在神经网络部署过程中,基于合作者与背叛者的博弈演化动力学原理,动态监测背叛者对合作者策略动力学的影响过程,从而提前发现并削弱背叛者对合作者的影响,进而对于智能系统的鲁棒性进行实时态势分析。

3 智能系统宏微观行为动力学安全监测方法

基于智能系统行为动力学理论,可以对智能系统训练和部署阶段的安全行为进行调控与诱导,从而实时掌握并干预智能系统的安全情况。
图4所示,在智能系统训练阶段,为获得更为鲁棒的智能系统信息传输动力学过程,可以基于智能系统微观信息传输动力学理论,结合神经网络中的信息传输关键路径理论[32-33],对智能系统中正常数据和对抗噪音传输动力学进行刻画,从而系统地解释神经网络的脆弱性机理,发现神经网络传输关键节点,调控并消除神经网络中的脆弱性隐患。例如,当对抗噪声在神经网络中传输时,可以基于神经网络中的信息传输关键路径,定义神经网络中相邻层中神经元之间的影响为:
图 4 基于微观动力学的关键脆弱路径监测

Fig.4 Critical fragile path monitoring based on micro behavioral dynamics

$ {C}_{l-1}^{i,z}=\sum _{s\in {S}_{l-1}^{i}}\left|\dfrac{\partial z}{\partial { A}\left(s,{Z}_{l-1}^{i}\right)}\right| $
其中,$ {Z}_{l-1}^{i} $指第$ l-1 $层中第$ i $个神经元的输出,$ {C}_{l-1}^{i,z} $为神经元$ {Z}_{l-1}^{i} $$ {Z}_{l}^{j} $的影响,$ {S}_{l-1}^{i} $是第$ l-1 $层中第i个神经元的集合,$ {A}\left(\cdot \right) $为特定位置下的神经元的输出值。根据$ {C}_{l-1}^{i,z} $的计算方法,可以从模型输出层不断向前计算梯度,从而获得每一层神经元之间的影响的值。基于神经元之间的影响,可以计算每个神经元受其他神经元的影响程度。每一层的神经元受到后一层神经元的总影响可以定义为:
$ \stackrel{~}{{C}_{l}^{i}}=\sum _{z\in {Z}_{l+1}^{x}}{C}_{l}^{i,j} $
其中,$ {Z}_{l+1}^{x} $为第$ l+1 $层神经元的集合,获得的$ \stackrel{~}{{C}_{l}^{i}} $即可总结为第$ l+1 $层所有神经元对第$ l $层神经元的影响。进一步地,定义关键脆弱神经元为更容易受到后一层神经元影响的神经元,其表达式为:
$ {\omega }_{l}^{x}={\mathrm{top}}\text{-}k\left({F}_{l},\widetilde{{C}_{l}^{i}}\right) $
其中,$ {\omega }_{l}^{x} $是易受攻击的神经元合集,$ {F}_{l} $为所有神经元的集合,$ {C}_{l}^{i} $是第$ l $层不同神经元的敏感度,top-k代表取前k个神经元的操作。由此,每一层的关键神经元是本层中最容易改变模型输出的神经元。最后,对于输入样本x,可以定义模型的关键易受攻击路径为:
$ R\left(x\right)=\left\{{\omega }_{1}^{x},{\omega }_{2}^{x}, \cdots ,{\omega }_{L}^{x}\right\} $
基于神经网络信息传输的敏感路径,为削弱层间敏感神经元之间的相互耦合作用,可以直接在训练的过程中最小化上文中计算出的模型关键易受攻击路径$ R\left(x\right) $上的节点的权重:
$ \underset{\mathit{w}\in R\left(x\right)}{\mathrm{min}}\sum _{l}^{l\in F}\sum _{m,n}^{{F}_{l}^{m}\in {\mathrm{\Omega }}_{L},{F}_{l-n}^{n}\in {\mathrm{\Omega }}_{L-1}}{\|{w}_{l}^{m,n}\|}_{1} $
其中,$ {w}_{l}^{m,n} $是第$ l $层第$ m $个神经元第$ n $个通道的值。通过在模型训练过程中惩罚对对抗噪声敏感的信息传播路径,从微观信息传输的角度令智能系统对对抗噪声脱敏,从而提升智能系统的鲁棒性。
在模型部署阶段,为了对智能算法之间相互作用过程中的动力学进行刻画,如图5所示,可以基于智能系统宏观博弈行为动力学理论,结合多智能体强化学习中的智能体关系刻画方法[34-35],将智能算法分为合作者与攻击者,并精准评估攻击者的策略对于合作者的攻击关系,进而最小化攻击者对合作者的影响,令合作者的策略趋于鲁棒。例如,在多智能体系统中,智能体jt时刻的决策对kt+1时刻决策的关联关系[34]可以被刻画为:
图 5 基于宏观动力学的智能体关系监测

Fig.5 Agent relation monitoring based on macro behavioral dynamics

$ \begin{aligned} I\left({a}_{t}^{j};{a}_{t+1}^{k}|{s}_{t},{\boldsymbol{a}}_{t}^{\backslash j}\right) = \sum _{j=0,j\ne k}^{N}{D}_{KL}\left[ p\left({a}_{t+1}^{k}|{s}_{t},{\boldsymbol{a}}_{t}^{\backslash j}\right)|\left|p\left({a}_{t+1}^{k}|{s}_{t},{\boldsymbol{a}}_{t}^{\backslash j},{a}_{t}^{j}\right) \right]\right.\end{aligned}$
其中,$ {a}_{t}^{j} $表示第j个智能体在t时刻做出的动作,I()表示互信息量,$ {D}_{{\mathrm{KL}}} $表示KL(Kullback-Leibler)散度,$ {s}_{t} $表示t时刻下的状态,$ {\boldsymbol{a}}_{t}^{\backslash j} $表示t时刻除了j外所有智能体的共同动作。
为了刻画攻击者对合作者的影响,可以将上式的互信息量分解,并泛化为:
$ {I}_{t}=d\left({\mathbb{E}}_{{a}_{t}^{j}~{\pi }_{t}^{j}}\left[p\left({a}_{t+1}^{k}|{s}_{t},{\boldsymbol{a}}_{t}^{\backslash j},{a}_{t}^{j}\right),\mathcal{D}\right]\right) $
其中,$ {\pi }_{t}^{j} $是智能体jt时刻做出的策略,$ \mathcal{D} $是任意攻击者希望合作者达到的分布,d()为包括KL散度在内的任意距离衡量指标。刻画攻击者在每一个时间t对合作者的影响后,为了对合作者的状态进行监测,可以在每一个时间t计算每一名合作者对其他合作者的影响$ {I}_{t} $,从而判断当前时刻合作者的脆弱性。
为验证本方法的效果,本文基于星际争霸环境中的11m地图进行实验,并对其交互模式进行可视化。在此地图中,对战双方分别控制11个机枪兵(Marine)进行对战,其中一方使用多智能体强化学习进行控制,另一方基于游戏预设的规则。假设在多智能体强化学习中,有一个智能体被攻击者控制,从而无法做出最优的动作。基于此,计算此攻击者对每一名其他合作者的影响$ {I}_{t} $
进一步地,为了得到对攻击者策略不敏感的合作者策略,可以使用近端策略优化(Proximal Policy Optimization,PPO)算法[36]训练合作者的策略,从而最小化攻击者对合作者的影响,使合作者获得如下鲁棒行为:
$ \underset{{\pi }_{j}}{\mathrm{max}}{\mathbb{E}}_{{\pi }_{j}}\left[\mathrm{min}\left(\mathrm{c}\mathrm{l}\mathrm{i}\mathrm{p}\left({\rho }_{t},1-\varepsilon ,1+\varepsilon \right){A}_{t},{{\rho }_{t}A}_{t}\right)\right] $
$ \begin{aligned} &\qquad\qquad\quad\qquad{\rho }_{t}=\dfrac{{\pi }_{j}\left({a}_{t}|{h}_{t}\right)}{{\pi }_{j,\mathrm{o}\mathrm{l}\mathrm{d}}\left({a}_{t}|{h}_{t}\right)},\\&\qquad\quad{A}_{t}=A\left({s}_{t},{a}_{t}\right)=-V\left({s}_{t}\right)+\sum _{l=0}^{k-1}{\gamma }^{l}{\hat{r}}_{t+l}+{\gamma }^{k}V\left({s}_{t+k}\right)\end{aligned} $
$ {\hat{r}}_{t}={r}_{t}-\lambda {I}_{t} $
其中,$ \gamma $是衰减因子,$ {\pi }_{j} $指合作者$ j $待更新的策略,$ {\pi }_{j,\mathrm{o}\mathrm{l}\mathrm{d}} $为合作者$ j $采样过程中使用的策略,$ \mathrm{c}\mathrm{l}\mathrm{i}\mathrm{p}(x,a,b) $为裁剪函数,将x的值裁剪至最小为a、最大为b$ \varepsilon $为PPO算法用于限制策略更新大小的超参数,$ {A}_{t} $是通过广义优势估计(Generalized Advantage Estimation,GAE)[37]求得的优势函数,$ {\hat{r}}_{t} $为使用本方法提出的正则后的奖励函数,$ \lambda $为削弱智能体对攻击者鲁棒性的超参数。通过显式刻画多智能体强化学习中攻击者对合作者行为的影响,可以从宏观行为交互的角度令智能系统中的合作者行为不受攻击者的影响,从而提升智能系统的鲁棒性。

4 实验

为分析与验证智能系统微观信息传输动力学与宏观信息传输动力学对人工智能系统的影响,本文基于星际争霸环境中的11m地图进行实验,从而验证本文所提出方法的可解释性及有效性。
在星际争霸环境中,11m地图的设置如下:对抗双方各自拥有11个Marine单位,使用多智能体强化学习进行控制的一方为被攻击者,使用基于游戏预设规则的另一方为攻击者,其中,被攻击方中编号为0的智能体的策略被攻击者替换为有害的攻击者策略。使用多智能体近端策略优化(Multi-Agent Proximal Policy Optimization,MAPPO)算法[38]对星际争霸环境进行训练,训练时的参数设置如表1所示。
表 1 MAPPO算法的训练参数

Table 1 Hyperparameters for MAPPO algorithm

参数类型 参数名 设置值 含义
环境 difficulty 7 攻击者内置策略难度系数
obs_all_health True 观测是否包含全部智能体生命值
obs_own_health True 观测是否包含智能体自身生命值
reward_death_value 10 攻击者的单位被击杀时给予的奖励值
reward_defeat −200 被攻击者被击败时的奖励值(负值)
reward_negative_scale 1 用于缩放负值奖励的比例
reward_scale_rate 20 用于缩放奖励的比例
reward_win 200 被攻击者击败攻击者时的奖励值(负值)
state_last_action True 状态信息是否包括智能体的上一次动作
算法 lr 0.000 5 学习率
gamma 0.99 用于计算预期奖励的折扣率
hidden_dim 64 隐藏层神经元数
grad_norm_clip 10 梯度裁剪阈值
add_value_last_step True 在计算每个episode的累计奖励时,是否使用最后一步的价值估计
entropy_coef 0.01 熵系数,用于策略的熵正则化项
在衡量鲁棒性时,使用文献[35]中的方法,以评估人工智能系统在最坏情况下的鲁棒性。在此方法中,人工智能系统中的部分智能体可能会由于真实环境中的多种不确定性干扰,而偏离原有的最优控制策略。本文使用此方法评估了多智能体系统中的不确定性对其鲁棒性的影响。
在对抗扰动下,MAPPO算法的原结果以及使用微观行为动力学、宏观行为动力学、宏观+微观行为动力学的结果如图6所示。微观行为动力学、宏观行为动力学均能提升智能系统面对对抗扰动的鲁棒性,且将两种系统合并能够进一步提升其效果。
图 6 面对攻击者策略时奖励值的变化

Fig.6 Variation of reward values when facing adversarial strategies

为了更好地理解智能系统微观信息传输动力学对智能系统鲁棒性的影响,对使用MAPPO算法训练后的人工智能系统中每个神经元的敏感度和脆弱关键错误路径进行了可视化。本文所使用的神经网络的结构如图7所示。在MAPPO算法中,深度强化学习模型包括Critic模型和Actor模型,Critic为评论家模型,其输出是全局状态的值函数,Actor为有关局部状态的策略输出。其中,fc为全连接层,fc后的数字表示当前层输出的特征维度,RELU为其激活函数。具体而言,本文对MAPPO中具体控制智能体的Actor算法的敏感程度进行了分析。
图 7 本文中使用的神经网络的结构

Fig.7 Neural network architecture used in this paper

基于此网络,得到关键神经元的敏感度及脆弱路径示意图,如图8所示。其中,由于conv1层与fc3层神经元数量较少,因此在每个神经元上均标注了其神经元敏感度。对于神经元数量较多的conv2层、fc1层与fc2层,使用红色数字标注了其最敏感神经元的位置。另外,使用红色箭头标注了每一层的关键脆弱路径。由于神经网络对从此路径经过的信息最为敏感,抑制此路径在神经网络决策中所占的比例即可基于微观行为动力学提升智能系统的鲁棒性。
图 8 敏感神经元与脆弱路径可视化结果

Fig.8 Visualization result of sensitive neurons and critical attacking routes

为了验证智能系统宏观信息传输动力学对人工智能系统的调控效果,本文对智能体间的依赖关系进行了分析。如图9(a)所示,在MAPPO算法中,攻击者在不同时刻对被攻击者具有不同的影响程度。在开始阶段,合作智能体接近敌方,此时攻击者可以通过做出特定行为诱使被攻击者分头行动,从而在不同的时段与敌方接战,被敌方各个击破。此时攻击者对于合作者的干扰较大,图9(a)对战前期颜色较深。在双方开始交战的中期阶段,合作智能体的策略则注重对敌方进行攻击,较难被干扰,图9(a)对战后期颜色较浅,本文提出的方法较好地反映了这一情况。使用宏观行为动力学进行调控后,如图9(b)所示,每名智能体受到的干扰明显小于那些对攻击者敏感(即未受到调控)的合作者策略,从而能够承受更大的扰动。这说明,基于智能系统宏观博弈行为动力学的调控能够提升合作者在复杂环境中的适应能力,使其在面对不确定性时表现得更加稳定和高效。
图 9 面对攻击者策略时的合作者-攻击者关系

Fig.9 Cooperator-attacker relationships when facing adversarial strategies

5 应用场景与案例

为了保障智能系统的安全性,有必要在智能系统运行的过程中对其安全态势进行实时监测[39]。如图10所示,智能系统的安全监测对于人工智能研究者和政府机构均具有重要意义。对于人工智能研究者而言,基于微观行为动力学与宏观行为动力学机理的智能系统安全监测有助于发现智能系统中策略的薄弱之处,并有针对性地对智能系统的鲁棒性进行提升。此外,对智能系统在宏观和微观行为动力学上的约束有助于从多个角度对智能系统中的安全风险进行更加完善的监测与评估。
图 10 智能系统安全监测的必要性

Fig.10 Necessity of safety monitoring in intelligent systems

对于政府机构而言,智能系统安全监测同样具有重要的决策意义。由于智能体训练阶段行为获得机制不可控、部署阶段行为风险未知,对智能系统的安全监测可以为决策者提供最差情况下的性能保障,从而使决策者可以预期不确定性给智能系统安全带来的风险;其次,由于智能系统的行为不可预测,对智能系统的监测有助于政府监管机构识别被监管智能系统中的不安全、不合理的行为,为政府的监管提供技术保障;最后,对智能系统的监测也可以帮助监管者提前发现智能系统中的安全风险,并呼叫技术人员介入,从而避免安全风险进一步扩大。
为有效支撑研究者对智能系统的安全态势分析以及辅助监管机构对智能系统的风险评测,有必要构建智能系统安全保障生态链。如图11所示,基于智能系统行为动力学安全理论,需要首先构建基于智能系统微观信息传输动力学理论与宏观博弈行为动力学理论的测试网。具体而言,监测网需要依托具体应用场景和应用数据,对于智能系统中的微观信息传输过程,监测网应当分析系统中的安全风险及安全态势,发现系统中的关键信息传输薄弱部位,并对智能系统动力学的失稳情况进行干预与调控;对于智能系统中的宏观行为博弈过程,监测网应当分析智能算法之间的相关关系,刻画算法群体当前的行为走向,抽取算法群体的博弈关系,并诱导算法群体向人类偏好的安全、可靠、稳定的行为靠拢。
图 11 智能系统安全监测生态链

Fig.11 Ecological chain of safety monitoring in intelligent systems

基于智能安全保障测试网,可以构建智能系统安全测试床与演练场。智能系统安全测试床旨在针对智能模型中可能出现的对抗样本[9-10]、模型偏见[11]、算法歧视[12]、有害正反馈[13]、算法共谋[14]、意见极化[15]等重大安全风险,结合具体智能系统应用仿真环境,提供虚实结合的智能系统运行实时监测,对智能系统运行过程中的动力学机理进行分析,生成可解释的智能系统安全性评价报告,辅助研究人员和监管机构进行后续决策。智能系统安全演练场则基于智能系统安全测试床,对智能系统进行攻防演练。其中,攻击者可以在演练场中不断更新自身的攻击策略,从而模拟智能系统在真实世界部署过程中可能遭遇的最差情况;防御者可以不断更新智能系统的策略,从而在攻击者的存在下仍然能够鲁棒地完成预定任务。随着攻击者与防御者在智能系统安全演练场中博弈的不断演进,智能系统的安全性不断增强。
基于智能系统行为动力学安全理论,智能系统安全生态链通过对算法知识资源的整合,将系统安全监测网、系统安全测试床与系统安全演练场有机地结合起来,从而形成可插拔灵活调用、微服务快速整合的智能系统安全保障生态链。具体而言,为了整合智能系统中的各大模块,系统安全生态链将攻防算法、监测算力、智能系统模型、智能系统训练数据等算法知识资源进行集成,并统一所使用的数据格式及接口,支持模型可封装至虚拟环境,从而方便使用者在平台范围内进行灵活调用。此外,为了更完善地辅助用户对智能系统的安全性进行评测,智能安全知识库将智能系统安全标准、智能系统安全指标、智能系统安全评测文档、智能系统专家知识文档等内容进行有机整合,以帮助使用者利用平台可扩展的接口完成自身需要的特定评测任务。

6 结束语

随着智能系统在真实世界中愈发广泛的应用,由智能系统微观信息传输机理和宏观博弈行为机理不明确所带来的风险愈发突出,致使对智能系统的安全性研究具有极高的必要性。对智能系统的安全性进行实时监测,有助于监管智能系统行为,发现智能系统中的薄弱之处,提前识别智能系统中的失稳行为,助力智能系统鲁棒性的提升,从而有力地提升智能系统的安全性,实现可靠、可信、可控的智能系统。
本文详细介绍了应用于智能系统安全监测的智能系统行为动力学理论,给出了基于行为动力学的智能系统安全监测技术,并指出了智能系统安全监测的应用场景与案例。但值得注意的是,本文提出的基于行为动力学的智能系统安全监测技术仍然存在不足。第一,基于行为动力学的智能系统安全检测机理分析技术欠缺。虽然本文提出的方法能够从一定程度上对智能系统的宏观对抗行为交互过程和微观信息传输过程进行刻画,但由于真实世界的环境是动态变化的,难以预测,所以本文所提出的方法仍然需要进一步研究与完善,以便更好地对真实世界中复杂多变的不确定性场景进行评测。为了应对这一场景,首先需要对真实世界场景的不确定性进行估计。随着大语言模型[40]的迅速发展,本文认为使用大语言模型作为世界模型[41],对真实世界场景的不确定性进行模拟,是一个可行的方向。第二,本文主要受到复杂系统理论的启发,初步提出了神经网络的宏观与微观行为动力学评测方法。但是,由于神经网络本身复杂、非线性的性质,本方法尚未基于行为动力学理论,给出关于神经网络学习和推断过程中行为演化的理论证明。本文认为,由于神经网络内在的复杂性与任务的多样性,使用行为动力学对智能系统的行为进行分析时,必须要与具体的任务与数据集结合,从而对于具体任务进行具体的问题建模、理论分析与推导[42-43]。此外,使用复杂系统中常用的代理人基模型[44-45]对智能系统的行为进行分析同样是一种可行的思路。第三,本文方法仅在视觉任务中的分类场景及多智能体强化学习任务中的合作场景进行验证,尚未在大规模真实数据集与真实场景中应用。本文认为,对行为动力学的研究应当首先完善其方法库与理论基础,然后考虑在智能工业化[46]、智能无人机控制[47]等环境中尝试进一步的应用。
面向未来,本文认为应该从三个方面继续发展智能系统安全监测技术。第一,要建立完善的智能系统安全威胁漏洞库。由于智能系统应用场景复杂,应用场景之间区别明显,不存在能够适用于所有应用场景的智能系统安全威胁漏洞库。这要求研究者要深入挖掘具体应用特征,不断发现智能系统中可能出现的新型安全威胁,并探索针对新型安全威胁的鲁棒调控机制。针对智能系统安全威胁漏洞库,需要不断完善智能系统安全威胁测试标准,大力推进智能系统安全监测平台的应用,出台智能系统安全监测法律法规,提升服务国家重大安全战略的可持续安全保障能力。第二,要深入研究智能系统行为动力学安全理论。由于智能系统行为动力学机理复杂,行为动力学理论多样,本文仅对智能系统安全场景的典型行为动力学监测手段进行了初步探索,尚未形成完善、可解释、可调控、可泛化的智能系统行为动力学理论体系。这要求研究者要以智能系统行为动力学理论为指导,结合具体应用场景,对智能系统行为动力学中的微观信息传输机理与宏观博弈行为机理进行理论攻关。特别地,要重点围绕智能系统安全脆弱性机理、智能系统安全演算调控机制、智能系统安全态势度量、智能系统安全行为监测、智能系统安全态势感知、智能系统相变识别技术、智能系统稳态结构维持、智能系统安全行为演进等一系列理论和核心技术进行研究,以保障我国人工智能安全理论水平处于世界前列。第三,要完善智能系统安全生态链建设。这要求研究者要不断丰富智能系统安全监测网的监测算法种类与类型,增加智能系统安全测试床中的测试指标与场景,提升智能系统安全演练场中的拟真能力与真实应用场景数量,完善智能系统安全生态链中的算法知识资源池与知识库,不断对系统安全生态链进行集成与完善,最终建成可灵活调用、快速整合、不断扩展的智能系统安全监测生态链,形成提升智能系统安全水平、支持军民智能系统安全应用、服务国家人工智能安全发展战略的安全保障生态。
1
赵楠, 缐珊珊. 人工智能应用现状及关键技术研究[J]. 中国电子科学研究院学报, 2017, 12 (6): 590- 592.

DOI

ZHAO N, XIAN S S. Research on the current application status and key technologies of artificial intelligence[J]. Journal of China Academy of Electronics and Information Technology, 2017, 12 (6): 590- 592.

DOI

2
刘祥龙. 打开算法“黑箱”[N]. 人民日报,2022-03-16(3).

LIU X L. Opening the “black box” of algorithms[N]. People’s Daily,2022-03-16(3).

3
KATZENBACH C, ULBRICHT L. Algorithmic governance[J]. Internet Policy Review, 2019, 8 (4): 1- 18.

4
GRITSENKO D, WOOD M. Algorithmic governance: a modes of governance approach[J]. Regulation & Governance, 2022, 16 (1): 45- 62.

5
PAPERNOT N, FAGHRI F, CARLINI N, et al. Technical report on the cleverhans v2.1. 0 adversarial examples library[J]. ArXiv preprint ArXiv:, 1610, 00768, 2016.

6
NICOLAE M I, SINN M, TRAN M N, et al. Adversarial Robustness Toolbox v1.0. 0[J]. ArXiv preprint ArXiv:, 1807, 01069, 2018.

7
GOODMAN D, XIN H, YANG W, et al. Advbox: a toolbox to generate adversarial examples that fool neural networks[J]. ArXiv preprint ArXiv:, 2001, 05574, 2020.

8
GUO J, BAO W, WANG J, et al. A comprehensive evaluation framework for deep model robustness[J]. ArXiv preprint ArXiv:, 2101, 09617, 2021.

9
GOODFELLOW I J, SHLENS J, SZEGEDY C. Explaining and harnessing adversarial examples[J]. ArXiv preprint ArXiv:, 1412, 6572, 2014.

10
MADRY A, MAKELOV A, SCHMIDT L, et al. Towards deep learning models resistant to adversarial attacks[J]. ArXiv preprint ArXiv:, 1706, 06083, 2017.

11
GEIRHOS R, RUBISCH P, MICHAELIS C, et al. ImageNet-trained CNNs are biased towards texture; increasing shape bias improves accuracy and robustness[J]. ArXiv preprint ArXiv:, 1811, 12231, 2018.

12
HARDT M,PRICE E,SREBRO N. Equality of opportunity in supervised learning[C]//Advances in Neural Information Processing Systems. Curran Associates Inc.,2016:3323-3331.

13
ENSIGN D,FRIEDLER S A,NEVILLE S,et al. Runaway feedback loops in predictive policing[C]//Conference on Fairness,Accountability and Transparency. PMLR,2018:160-171.

14
CALVANO E, CALZOLARI G, DENICOLO V, et al. Artificial intelligence, algorithmic pricing, and collusion[J]. American Economic Review, 2020, 110 (10): 3267- 3297.

DOI

15
WANG X, SIRIANNI A D, TANG S, et al. Public discourse and social network echo chambers driven by socio-cognitive biases[J]. Physical Review X, 2020, 10 (4): 041042.

DOI

16
MOLINA M. What is an intelligent system?[J]. ArXiv preprint ArXiv:, 2009, 09083, 2020.

17
HE K,ZHANG X,REN S,et al. Deep residual learning for image recognition[C]//Proceedings of the IEEE conference on Computer Vision and Pattern Recognition. IEEE,2016:770-778.

18
GIRSHICK R. Fast r-CNN[C]//Proceedings of the IEEE international conference on computer vision. IEEE,2015:1440-1448.

19
VASWANI A,SHAZEER N,PARMAR N,et al. Attention is all you need[C]//Advances in Neural Information Processing Systems. Curran Associates Inc.,2017:5998-6008.

20
DEVLIN J, CHANG M W, LEE K, et al. BERT: pre-training of deep bidirectional transformers for language understanding[J]. ArXiv preprint ArXiv:, 1810, 04805, 2018.

21
SZEGEDY C, ZAREMBA W, SUTSKEVER I, et al. Intriguing properties of neural networks[J]. ArXiv preprint ArXiv:, 1312, 6199, 2013.

22
KUŚMIERCZYK M. Algorithmic bias in the light of the GDPR and the proposed AI act[J]. Equality. Faces of Modern Europe. Wrocław:Willy Brandt Center for German and European Studies,2022.

23
GRIMMELIKHUIJSEN S, MEIJER A. Legitimacy of algorithmic decision-making: six threats and the need for a calibrated institutional response[J]. Perspectives on Public Management and Governance, 2022, 5 (3): 232- 242.

DOI

24
郑志明, 吕金虎, 韦卫. 精准智能理论: 面向复杂动态对象的人工智能[J]. 中国科学: 信息科学, 2021, 51 (4): 13.

ZHENG Z M, LÜ J H, WEI W, et al. Theory of precise intelligence: artificial intelligence for complex dynamic objects[J]. Science China: Information Sciences, 2021, 51 (4): 13.

25
ACHLIOPTAS D, D’SOUZA R M, SPENCER J. Explosive percolation in random networks[J]. Science, 2009, 323 (5920): 1453- 1455.

DOI

26
RIORDAN O, WARNKE L. Explosive percolation is continuous[J]. Science, 2011, 333 (6040): 322- 324.

DOI

27
HUANG S Y, ZOU X W, TAN Z J, et al. Network-induced nonequilibrium phase transition in the “game of Life”[J]. Physical Review E, 2003, 67 (2): 026107.

DOI

28
WANG W X, LÜ J, CHEN G, et al. Phase transition and hysteresis loop in structured games with global updating[J]. Physical Review E, 2008, 77 (4): 046109.

DOI

29
WANG X, LI W, LIU L, et al. Promoting information diffusion through interlayer recovery processes in multiplex networks[J]. Physical Review E, 2017, 96 (3): 032304.

30
COOPER I,MONDAL A,ANTONOPOULOS C G . A SIR model assumption for the spread of COVID-19 in different communities[J]. Chaos, Solitons &Fractals, 2020, 139: 110057.

31
SHAO Y, WANG X, FU F. Evolutionary dynamics of group cooperation with asymmetrical environmental feedback[J]. Europhysics Letters, 2019, 126 (4): 40005.

DOI

32
LIU A, LIU X, YU H, et al. Training robust deep neural networks via adversarial noise propagation[J]. IEEE Transactions on Image Processing, 2021, 30, 5769- 5781.

DOI

33
LI T, LIU A, LIU X, et al. Understanding adversarial robustness via critical attacking route[J]. Information Sciences, 2021, 547, 568- 578.

DOI

34
JAQUES N,LAZARIDOU A,HUGHES E,et al. Social influence as intrinsic motivation for multi-agent deep reinforcement learning[C]//International Conference on Machine Learning. PMLR,2019:3040-3049.

35
LI S, GUO J, XIU J, et al. Attacking cooperative multi-agent reinforcement learning by adversarial minority influence[J]. ArXiv preprint ArXiv:, 2302, 03322, 2023.

36
SCHULMAN J, WOLSKI F, DHARIWAL P, et al. Proximal policy optimization algorithms[J]. ArXiv preprint ArXiv:, 1707, 06347, 2017.

37
SCHULMAN J, MORITZ P, LEVINE S, et al. High-dimensional continuous control using generalized advantage estimation[J]. ArXiv preprint ArXiv:, 1506, 02438, 2015.

38
YU C, VELU A, VINITSKY E, et al. The surprising effectiveness of PPO in cooperative multi-agent games[J]. Advances in Neural Information Processing Systems, 2022, 35, 24611- 24624.

39
GUO J,CHEN Y,HAO Y,et al. Towards comprehensive testing on the robustness of cooperative multi-agent reinforcement learning[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. IEEE,2022:115-122.

40
BUBECK S, CHANDRASEKARAN V, ELDAN R, et al. Sparks of artificial general intelligence: early experiments with GPT-4[J]. ArXiv preprint ArXiv:, 2303, 12712, 2023.

41
HAO S, GU Y, MA H, et al. Reasoning with language model is planning with world model[J]. ArXiv preprint ArXiv:, 2305, 14992, 2023.

42
SALMAN H,LI J,RAZENSHTEYN I,et al. Provably robust deep learning via adversarially trained smoothed classifiers[C]//Advances in Neural Information Processing Systems. Curran Associates Inc.,2019:11292-11303.

43
CROCE F,ANDRIUSHCHENKO M,HEIN M. Provable robustness of relu networks via maximization of linear regions[C]//the 22nd International Conference on Artificial Intelligence and Statistics. PMLR,2019:2057-2066.

44
FARMER J D, FOLEY D. The economy needs agent-based modelling[J]. Nature, 2009, 460 (7256): 685- 686.

DOI

45
JANSSEN M A. Agent-based modelling[J]. Modelling in Ecological Economics, 2005, 155 (1): 172- 181.

46
YAO X,ZHOU J,ZHANG J,et al. From intelligent manufacturing to smart manufacturing for industry 4.0 driven by next generation artificial intelligence and further on[C]//2017 5th International Conference on Enterprise Systems (ES). IEEE,2017:311-318.

47
KAUFMANN E, BAUERSFELD L, LOQUERCIO A, et al. Champion-level drone racing using deep reinforcement learning[J]. Nature, 2023, 620 (7976): 982- 987.

DOI

Outlines

/