学术研究

基于增量定位与标记去重的云数据灾备技术

  • 杜岩冰 ,
  • 王晓锋 , *
展开
  • 江南大学人工智能与计算机学院,无锡 214122

网络出版日期: 2024-07-08

基金资助

国家自然科学基金(62172191)

版权

版权所有©《网络空间安全科学学报》编辑部 2024

Cloud data disaster recovery techniques based on incremental localization and marker de-redundancy

  • DU Yanbing ,
  • WANG Xiaofeng , *
Expand
  • School of Artificial Intelligence and Computer Science, Jiangnan University, Wuxi 214122, China

Online published: 2024-07-08

Supported by

National Natural Science Foundation of China(62172191)

Copyright

Copyright ©2024 Journal of Aeronautical Materials. All rights reserved.

摘要

通过云备份服务和威胁情报的结合,可以显著提升网络安全态势感知与响应能力。随着云网基础设施的不断拓展,数据量呈指数级增长,对云数据采取备份恢复措施成为威胁防御的重要环节。针对虚拟机快照备份等技术存在数据冗余严重、难以适应分布式体系的问题,面向典型的OpenStack与Kubernetes分布式云平台设计了一种基于增量云数据去重的灾备技术。首先,设计了云数据灾备防御体系,以实现对差异性数据类型的覆盖性保护。其次,设计了增量云数据去重技术,提升了备份效率并实现了对备份数据的分布式与分离管理。实验证明,在数据的定期备份中相较于基于Backy2与Duplicacy的云备份方案,基于增量去重的云数据灾备技术在备份时间上分别平均节约了46.57%和41.73%,遭遇威胁进行灾难恢复的时间平均节约了7.23%与43.73%。

本文引用格式

杜岩冰 , 王晓锋 . 基于增量定位与标记去重的云数据灾备技术[J]. 网络空间安全科学学报, 2024 , 2(2) : 66 -75 . DOI: 10.20172/j.issn.2097-3136.240206

Abstract

Through the combination of cloud backup services and threat intelligence, network security situational awareness and response capabilities were significantly improved. As the cloud network infrastructure continued to expand, the volume of data showed exponential growth, and taking backup and recovery measures for cloud data became an important part of threat defense. Targeting the problems such as serious data redundancy and difficulty in adapting to distributed systems in technologies like virtual machine snapshot backup, a disaster recovery technology based on incremental cloud data de-duplication was designed for the typical OpenStack and Kubernetes distributed cloud platforms. Firstly, a cloud data disaster recovery defense system was designed to achieve coverage protection for differentiated data types. Secondly, an incremental cloud data de-duplication technique was designed to improve backup efficiency and to achieve distributed and separate management of backup data. The experiment proved that the incremental de-duplication-based cloud data disaster recovery technology, compared with Backy2 and Duplicacy-based cloud backup solutions, saved 46.57% and 41.73% of backup time on average, and saved 7.23% and 43.73% of disaster recovery time when encountering threats, respectively, in regular data backup.

0 引言

云计算以互联网为基石为用户提供快速而便捷的大规模应用部署与调度服务[1],越来越多的个人、企业与组织使用云服务商提供的云基础设施与计算资源,相关问题随之而来。首先,是云计算网络形式、数据量与计算需求呈现出复杂多变与增长迅速的态势[2]。其次,包括边缘计算等多种云计算延伸场景常常面临安全威胁[3],因此云数据的安全性受到了广泛的关注。目前云数据面临着多种威胁,包括软件攻击、身份盗窃[4]以及数据泄露[5]等,因此,有效应对威胁情报对于保护云系统中的关键数据和资产至关重要。威胁情报通过数据挖掘等技术对实时网络威胁信息进行收集与识别,从而实现对网络攻击及扩散的有效遏制[6],与云系统结合不仅能够实现对云系统中异常活动的捕捉[7],并且可以通过分析攻击者在数据泄露后的行为来捕捉潜在威胁[8]
在上述网络安全框架与场景中,云数据灾备不仅作为数据安全的重要措施,并且与威胁情报应用领域相结合,有着诸多应用场景并发挥至关重要的作用[9]。首先,云数据灾备可以作为潜在威胁情报的预防性响应,在减少潜在安全事件的平均检测时间和平均响应时间方面发挥重要作用[10]。通过提供安全可靠的备份与快速恢复技术,可以有效降低数据丢失的风险[11]。其次,目前的威胁情报研究正在积极融合云计算技术[12],建立威胁与漏洞分析系统,而当前环境下的威胁情报采集具有数据规模增长迅速的特点[13],因此需要更加成熟高效的云数据灾备技术对威胁情报进行保护。最后,使用云数据灾备可以提升威胁情报的可靠性,通过备份方式在多地部署威胁情报管理平台,当发生局部故障时可以切换至备份平台进行情报更新,确保威胁情报的一致性与持续性[14]
OpenStack[15]和Kubernetes[16]都是被广泛使用的分布式云平台。OpenStack的目标是提供一个可扩展、可靠、安全的云计算平台,使用户能够更轻松地创建虚拟机并管理云上的应用程序和服务。Kubernetes则是开源的容器编排平台,它提供了一个用于管理云上的容器化应用程序和服务的管理系统,具有简单高效、拓展性高等特点。而在云存储方面,Ceph[17]作为分布式文件系统以其自动平衡和自修复等特性受到重视。当前云平台主要基于OpenStack与Kubernetes实现,并将Ceph作为常用存储后端,实现云计算的大规模分布式部署,因此,面向以上分布式云平台与云存储实现有效的数据保护成为响应威胁情报的关键。
鉴于上述背景,为了面向分布式云环境提供更高性能云数据备份方案以实现更高效的威胁情报响应与云数据灾备防御,本文设计了一种基于增量云数据去重的高性能云数据灾备防御体系。首先,本体系架构选择OpenStack与Kubernetes作为云平台,并使用Ceph分布式文件系统作为云存储方案,为虚拟机与持久化存储提供稳定的数据存储服务。其次,根据分布式云平台与云存储环境特性,设计出增量云数据去重备份(Incremental Cloud Data De-redundancy,ICDD)技术,减少数据冗余并提升备份速度。最后,对备份数据采取多重加密措施,保护数据的安全性。

1 相关工作

网络威胁情报是关于现有或即将出现的威胁信息,经过提炼与整理,辅助对网络威胁进行响应与决策[18]。Al-Mohannadi等[19]提出一种威胁情报分析方法,使用基于云的Web服务收集的攻击数据以支持主动的威胁情报。Alshaikh等[20]调查了机器学习模型在云环境中检测和缓解高级持续威胁的有效性,认为机器学习在云环境网络安全方面有着巨大潜力。Ammi等[21]利用云原生架构来实现网络威胁情报数据的语义互联,提升了威胁情报的有效性。上述成果都证明了威胁情报的分析、应用与云计算关系密切。
威胁情报响应是在分析和处理用于解决或应对危害的知识后,及时采取的防御措施[22]。例如,在应对入侵类情报时,威胁情报通过感知与分析进行响应,并开展联动应急处置[23];基于大数据分析的安全威胁情报借助情报平台形成协同防御机制后,需要在防御体系中构建响应策略以应对高级威胁与未知攻击[24]。在此基础上,许多成果将云计算与威胁情报响应进行融合,例如Gong等[25]提出了一种用于能源云平台事件响应的网络威胁情报框架,将安全模型快速应用于大型能源云基础设施。而将云备份技术与威胁情报响应进行结合可以更好地对抗网络攻击,例如Torkura等[26]针对云存储提出了一种云威胁检测与响应系统,其中集成了动态快照与恢复策略以实现数据容错。
数据备份与恢复是应对网络攻击与响应威胁情报的重要措施。Hristev等[27]讨论并分析了数据恢复在面对网络攻击的应用。Karim等[28]针对网络威胁与攻击持续增加的情况,提出了一种以用户为中心的灾难恢复系统模型。Yang等[29]针对高级长期威胁提出了基于数据备份恢复(Data Backup and Recovery,DBAR)的防御机制,在遭受威胁时,节点根据外部独立的备份数据恢复到上次备份操作完成时的安全状态。若在这一时间段内节点上被安装了后门,则在上述灾难恢复操作完成后自动清除该后门。
基于上述理由,云备份技术的性能在威胁情报的应用中起到重要作用。快速模拟器QEMU(Quick EMUlator)的虚拟化在线快照功能[30]是应用在云计算中的虚拟机备份技术,通过现有的虚拟化快照管理指令将数据传输给第三方备份软件,这种方法的缺点是效率低,备份效果依赖选用的第三方备份工具。Backy2[31]是优秀的开源云数据备份工具,支持重复数据消除与增量备份,并在备份与恢复块设备方面表现出色。Duplicacy[32]允许用户将文件备份至云存储以保护数据,该工具使用了无锁数据去重(Lock-Free Deduplication)技术与两步化石删除算法(Two-Step Fossil Deletion Algorithm),通过摒弃传统备份工具中基于锁的解决方案提升副本备份效率,其局限性在于无法直接对云数据进行读取与备份。

2 云数据灾备防御体系

云数据灾备防御体系的设计应充分考虑灾备与威胁情报响应的结合场景。首先,该体系应能够面向云存储以及多种云服务平台[33]。其次,该体系需要充分考虑边缘计算等云计算延伸技术[34]和大数据技术[35]等应用场景。最后,需要建立完善的数据备份机制,支持包括全量备份、增量备份、差异备份在内的多种策略,确保在面对安全威胁时能更加灵活有效地恢复云数据。
基于上述原则,本文提出的云数据灾备防御体系架构以面对安全威胁时提升数据备份恢复效率以及支持分布式部署为目标,采用的云计算平台与云存储系统均为在云领域被广泛使用的成熟方案。因此在云计算环境方面,以Kubernetes和OpenStack作为分布式云计算平台,并选取Ceph作为存储后端来保证存储服务的高可用性和可扩展性。备份体系采用分布式架构,根据功能不同分为4层结构:云服务层、云存储层、备份客户端层与备份存储后端层,如图1所示,备份客户端使用ICDD技术为核心,对虚拟机与持久化存储进行高性能灾备。
图 1 云数据灾备防御体系架构

Fig.1 Architecture of disaster recovery Defense System for Cloud Data

1) 云服务层
云服务层需要对资源进行虚拟化并提供应用服务,所选取的OpenStack与Kubernetes云平台分别对应虚拟机与容器的管理平台。二者除了在各自领域被广泛使用外,也会在部分场景中结合使用,通过集成各自优势来实现规模更大、管理更加可控的部署与使用。因此,体系结构的设计应面向两种云平台,综合考虑不同的云数据存储形式,以实现更加全面的云数据保护。
2)云存储层
为了满足云服务数据存储和使用的需求,云存储层选取Ceph的RBD(RADOS Block Device)块存储方案,云计算将所有物理存储设备交由Ceph进行管理,发挥其高拓展性与容错性,以更好地应对大规模存储和复杂应用场景。RBD块存储有着与云平台适配能力强的优势,具体而言,在OpenStack云平台中,虚拟机映像管理服务Glance、计算管理服务Nova与块存储服务Cinder都可以使用RBD块存储镜像,为映像与虚拟机提供高性能、可扩展的云存储服务。此外,RBD镜像也可以使用Ceph-CSI(Container Storage Interface for Ceph)、Rook等方式与Kubernetes集成,为容器化应用提供持久化存储服务。除了适配能力强之外,RBD镜像可以直接用于绑定虚拟机和持久化存储,使其在云平台中具备灵活便捷的使用特性。
而在数据保护方面,Ceph也使用权限管理与数据加密技术以提升安全性。首先,Ceph支持在客户端进行数据传输以及数据存储的加密,只允许拥有解密密钥的用户访问。其次,Ceph使用认证系统对不同用户提供差异化访问权限,限制用户及服务访问无权获取的数据。
3) 备份客户端层
在备份客户端中,需要从适应分布式结构与提高效率两方面来进行备份恢复性能的提升。传统数据备份方案对集中式数据库的依赖使其在分布式云平台中受到种种限制,只有在拥有相应数据库记录的备份客户端才能对同一数据源进行有效的备份管理与数据去重。而ICDD技术使得分布式部署的备份客户端允许备份任务从任意连接存储集群的服务器中发起,能更好地消除服务器地理位置或硬件设备所带来的限制,实现分散备份操作,并提升备份恢复速度,从而提高备份效率和性能。
4)备份存储后端层
在备份存储后端的选择上,由备份发起者自行选择备份目的地,将备份数据存储在备份客户端本地,或通过SSH(Secure Shell)文件传输协议等方式将备份数据安全传输至用户信赖的服务器或存储介质中。当云服务遭遇威胁时,使用备份数据恢复服务到安全状态的集群中以实现灾备。

3 增量云数据去重技术

增量云数据去重技术,主要分为3部分:增量云数据定位、三层标记数据去重、数据压缩与加密。增量备份是提升备份效率的主要思路之一,结合云存储特性后改进为增量云数据定位,根据时间节点对云数据筛选待备份增量数据。但该方式只针对单个虚拟机或持久化存储进行增量数据筛选,仍需进一步减少备份数据冗余。为此设计了三层标记法,用于分布式管理备份数据以及数据去重,提升备份性能。此外,数据加密也是保护云数据所需的重要功能。

3.1 增量云数据定位

增量备份策略指只备份上一次备份操作后新创建或者更新过的数据。因为在特定的时间段内只有少量的文件发生改变,增量备份可以有效节省备份时间与空间成本。增量云数据定位技术旨在迅速定位到每次的数据变化位置并确定变化的数据量。该技术基于块数据与文件数据的差异,结合Ceph RBD块存储特性,对云存储环境下的增量备份进行改良与实现。
在传统的增量备份算法中,备份工具首先会对待备份的数据进行一次全量备份,之后只备份源数据自上次备份后发生的更改部分。即在初次备份时间点$ {T}_{1} $执行全量备份策略,扫描获取所有需要进行备份的文件。设此时需要处理的数据量为$ {L}_{1} $,备份数据量为$ {P}_{1} $,全部文件的大小总和即为$ {L}_{1} $,且与$ {P}_{1} $相等;在之后的时间点$ {T}_{2}、{T}_{3}\cdots {T}_{n} $执行增量备份策略,以文件为单位寻找增量数据,标记上次备份后发生变动的增量文件,此时需要处理的数据量即为增量文件大小之和,分别记为$ {L}_{2}、{L}_{3}\cdots {L}_{n} $;备份时以滚动校验和Rolling Checksum等算法对增量文件在数据块层面上进行增量数据的筛选。假设备份数据量为$ {P}_{2}、{P}_{3}\cdots {P}_{n} $,在n次备份后总共需要处理的数据量为$ L{T}_{a} $,其计算方法如式(1)所示。
$ L{T}_{a}={\sum }_{i=1}^{n}{L}_{i} $
由于传统增量算法往往以文件为单位,因此难以在块存储中直接应用。首先,在云存储中,RBD块存储会以固定大小的数据块为单位,并将数据块分配到不同的云存储服务器与硬盘中,使传统增量备份工具以文件为单位进行增量数据识别的思路难以在云存储中应用。其次,由于RBD块存储并不存在文件概念,如果对块存储镜像进行全量备份,将需要对所有已分配的存储空间全部进行扫描。假设每次增量数据即备份数据量分别为$ {P}_{1}、{P}_{2}、{P}_{3}\cdots {P}_{n} $,每次需要处理的数据量为当前时间节点分配的存储空间大小$ {V}_{1}、{V}_{2}、{V}_{3}\cdots {V}_{n} $,在n次备份后总共需要处理的数据量为$ L{T}_{b} $,可得式(2)。
$ L{T}_{b}={\sum }_{i=1}^{n}{V}_{i} $
云存储中分配的存储空间显然大于当前存储数据量,可得$ {LT}_{b} $大于$ {LT}_{a} $。反应在实际备份中即为在RBD块存储中对大量空数据块进行扫描和读取,浪费时间和计算资源。为了解决上述问题,基于Ceph存储快照功能设计了增量云数据定位技术,其策略如图2所示。
图 2 文件存储增量备份

Fig.2 Incremental backups of file storage

假设创建虚拟机或持久化存储的时间点为$ {T}_{0} $,RBD块存储镜像随之一同创建。首次备份时间点为$ {T}_{1} $,不再执行全量备份策略,改为以$ {T}_{0} $为基准时间点,直接定位从$ {T}_{0} $$ {T}_{1} $时间点时发生变化的数据块,进行数据定位与读取。在此之后遵循同样的备份思路,在进行$ {T}_{i} $备份时,以$ {T}_{i-1} $为基准时间点定位增量数据位置。在上述情况下,假设备份数据量为$ {P}_{1}、{P}_{2}、{P}_{3}\cdots {P}_{n} $,此时需要处理的数据量与备份数据量相同,在n次备份后总共需要处理的数据量为$ L{T}_{d} $,可得式(3)。
$ L{T}_{d}={\sum }_{i=1}^{n}{P}_{i} $
显然,存储设备大小大于存储在其中的文件的大小,而发生增量操作的文件总大小大于增量数据总大小,如式(4)所示。由此可以得出明显结论,通过增量云数据定位可以确保备份时需要处理的数据量为3种方案中最小,且为保持数据完整性的最小必要数据量,如式(5)所示。
$ {V}_{i} > {L}_{i} > P_i,i\in \left\{\mathrm{1,2},\cdots ,n\right\} $
$ {LT}_{b} > {LT}_{a} > {LT}_{d}={\sum }_{i=1}^{n}{P}_{i} $
综上所述,在用户发起备份后,备份客户端首先获取当前时间点到上一个备份时间点间发生变动的有效增量数据,记录两个时间点间变化数据的偏移量以及变化数据的长度。之后根据变化数据的偏移量将备份客户端的数据读取指针移动至相应地址,读取长度即为记录中变化数据的长度,读取到的数据块即为增量数据块。通过进行增量云数据定位,无需对云数据所在的存储设备与存储文件进行扫描、计算和识别,可以节约大量资源。

3.2 三层标记数据去重

在云计算环境中,云数据量快速增长的同时会带来大量的数据复制。增量云数据定位虽然能以极低的计算成本得到增量数据位置,但是并不关注数据内容,且不能在多个虚拟机或持久化存储以及不同节点之间进行比较,因此备份技术需要具备进一步识别重复数据的能力,备份后端已经有的数据段无需再传。在备份过程中,根据重复数据的删除地点以及数据的发送端和目的地端,数据去重又可以分为源端去重、目标端去重,考虑到云存储或云备份系统需要在网络环境下传输数据,选择源端去重,即在备份客户端进行重复数据査找和删除可以有效减少数据的传输量。
云数据备份体系的数据去重存在2个难题:首先,由于云存储块设备与文件存储的结构不同,对增量数据进行备份时,数据管理方式应与文件备份管理方式不同,以避免数据恢复后无法保证一致性;其次,为了适应云计算的分布式特点,云数据备份体系架构摆脱了集中式数据库,多个备份客户端或多个备份任务同时进行操作时,在删除备份副本与对应数据块后,可能导致与其他备份副本冲突的情况。传统备份方案使用集中式数据库保护所有引用的数据块,然而集中式数据库存在两大弊端:一是不利于在分布式云计算系统中进行部署与使用;二是索引数据库在文件存储中使用分布式锁定机制,而文件锁会显著增加备份开销。
综上所述,云数据备份必须要综合考量数据一致性与环境特点设计数据管理方式。基于以上问题设计了三层标记数据去重技术,如图3所示。在管理方面,以备份时间与数据块位置为数据标记,以数据块哈希值作为备份数据文件命名依据,使用本地文件来记录元数据;在数据去重方面,使用文件查找操作来提升数据索引效率。通过该技术,用户得以对不同云平台或云存储上的云数据进行跨客户端备份。三层标记数据去重技术的主要实现过程。
图 3 三层标记数据去重

Fig.3 Three-layer marker data deduplication

当备份客户端发出备份请求时,在当前客户端用户所选择的目录下初始化备份记录文件。在剥离了集中式数据库后,选择用本地文件记录备份元数据,保存备份次数、备份位置、备份数据块清单等信息。
备份开始时会先进行增量云数据定位,获取增量数据块后,以备份时间、数据偏移量以及数据块长度作为该数据块的第一层标记。由于在同一时刻云数据位置具有唯一性,同一备份场景下增量数据定位相互排除。然而块存储设备的写入操作可能导致数据的覆盖,无法避免不同副本之间的冲突。考虑到增量备份的持续性与完整性,必须在备份数据块的元数据标记中纳入时间因素,作为备份数据一致性的保障与副本管理的必要措施。
为实现数据冗余的进一步降低,采用散列函数对数据块进行计算,作为数据块的第二层标记与命名依据,以及去重的唯一索引。具体而言,备份中的数据去重由备份客户端独立对增量数据块执行散列运算,并通过计算结果在备份存储后端执行查找操作:若检索过程中匹配到相同数据块则进行引用,否则将数据块单独作为文件上传至备份存储后端。这一过程保证了云数据备份体系中块级别的数据唯一性,降低了冗余并优化了备份效率。
为解决本节前文中提到的问题,数据块依据其引用状态施行逐级分类机制,作为备份数据管理的第三层标记。此标记细分为3种独特的状态:引用状态、解除状态与删除状态。默认情况下,一经上传,默认备份数据块被赋予引用状态。而在数据块与其相应备份副本的引用关系被撤销时,若其余备份副本与其引用状态不明,则将其转换为解除状态。解除状态作为一种临时性保护状态,直至其所有潜在参照关系得到充分验证后进行转换。在解除状态期间,若检测到该数据块存在其他引用关系,则将其重新归还至引用状态;若验证该数据块不再受任何备份副本引用,则将其删除以优化存储空间。
在管理数据块时,第三层标记需要遵循以下原则:首先,在执行备份时,只允许在引用状态块中进行检索,解除状态块被排除在这一过程之外。而在恢复过程中,引用状态与解除状态数据块均在检索范围内,若在解除状态块中寻找到引用关系,则将其重新标记为引用。其次,当且仅当新备份副本创建完成,且确认不存在任何待完成状态下的数据块解除引用操作时,才可发起删除流程,该原则目的在于维护备份管理过程中的数据一致性。当用户发起删除数据块请求,备份客户端与备份存储后端启动对照流程,若检测到解除状态块被新备份副本引用,则恢复其引用状态,对照所有引用关系后,删除余下所有解除状态块。
综上所述,为进行有效数据去重设计了三层标记的方法,第一层标记用于增量数据管理,第二层标记用于重复数据删除的检索,第三层标记则是对备份数据块进行状态管理。这三层标记的进行都只使用了简单的文件查找与重命名、元数据记录文件的读写,通过基本操作完成云数据备份管理,维持了较低的系统资源开销,尽可能保证了整个过程的高性能。

3.3 备份数据加密

数据安全也是备份工具设计中极为重要的一环,因此需要引入加密手段保护备份数据的隐私性。备份客户端与备份存储后端对数据块文件名、数据块文件等都进行了加密,且加密过程环环相扣,尽量减小被破译的可能性。在加密过程中,首先生成数个随机密钥,而这些随机密钥又使用由用户输入的存储密码通过PBKDF2(Password-Based Key Derivation Function 2)函数生成的用户密钥进行保护。随机密钥分别被使用在不同的加密过程中,数据加密流程如图4所示。备份记录文件随机生成的文件密钥由AES-GCM(Advanced Encryption Standard-Galois/Counter Mode)进行加密。使用HMAC(Hash-based Message Authentication Code)函数对备份的数据块文件进行哈希处理并加密,得到的密文用于命名数据块文件,隐藏数据块的真实哈希值。数据块内容使用AES-GCM进行加密。
图 4 数据加密过程

Fig.4 Data encryption process

4 实验与分析

实验设计了2个场景,模拟数据的定期备份与灾难恢复,以此验证灾备防御技术的性能。

4.1 实验环境

在对比实验方面,以支持云数据的增量备份与数据去重为原则,主要设计了2种云增量备份对比方案:使用Backy2开源备份软件进行增量备份;基于Duplicacy对增量云数据进行备份。Backy2和Duplicacy与ICDD原理相近,通过采用切分数据块、计算与检索哈希值的方式,对增量数据进行备份。表1中比较了这些备份工具与方案的主要设置,尽可能选择类似的选项以进行公平的对比。
表 1 实验使用方案的主要配置

Table 1 Main configurations of the experimental use program

配置 ICDD Backy2 Duplicacy
分块算法 增量云数据定位 固定大小分块 变长大小分块
最大数据块大小/MB 4 4 8
哈希算法 blake2 sha512 blake2
压缩算法 Zstd Zstd Zstd
Backy2作为开源增量备份工具,基于Ceph的RBD块存储快照进行设计,在云数据备份恢复方面表现良好。Duplicacy是目前最优秀的备份工具之一,提出的无锁数据去重在云备份领域是优秀的前沿创新算法。为进一步保证实验的公正性,所有实验均为增量备份:Backy2备份工具拥有直接访问RBD存储块中数据的功能,并捕捉其中的增量数据;通过Export-diff等功能所提供的能力,Duplicacy得以实现对增量云数据的有效读取。
在备份数据方面选择了3种典型场景。首先针对OpenStack平台,随机选取不同版本的Linux系统内核Tar压缩文件作为增量数据写入虚拟机并备份,作为对虚拟机增量备份的实验;其次,本实验在Kubernetes平台中部署了MySQL(My Structured Query Language)容器,向数据库中注入经典测试数据集并备份,旨在评估持久化存储卷的增量备份性能;最后,在上述环境中进行了数据恢复实验。为了消除网络波动与硬件差异所带来的影响,本文中所有实验均在DELL PowerEdge R740xd 使用EXSI系统创建虚拟机完成。实验中使用的OpenStack平台版本号为Ocata,创建的虚拟机为最小化安装Centos7.5系统,存储空间为55 GB,其中5 GB空间用于存储Root用户目录以及系统文件,50 GB用于写入实验数据。Kubernetes版本号为1.21.0,创建的持久化存储空间为5 GB。Ceph版本号Nautilus,为了消除网络等因素对实验结果的影响,如无额外说明则默认备份客户端均部署在Ceph存储客户端上,备份数据同样存储在备份客户端所在的节点中。

4.2 OpenStack虚拟机备份实验

在分布式备份系统中,不同节点可以对同一数据源进行增量备份与数据去重,为了证明这一特性,设计了以下实验:使用OpenStack创建虚拟机并从不同节点对该虚拟机进行备份,观察备份情况。实验结果如表2所示,证明ICDD不仅可以从任何连接到Ceph集群中读取待备份数据的节点发起备份任务,而且不同节点之间发起的备份仍然能进行有效的数据去重。
表 2 不同节点对同一虚拟机进行备份测试

Table 2 Backup test of the same Virtual Machine by different nodes

节点 OpenStack
控制节点
OpenStack
计算节点
Ceph
存储
其他
节点
待备份数据量/MB 2271 2271 2271 2271
备份存储空间/KB 701786 28 16 28
备份时间/s 26 13 10 17
在OpenStack虚拟机备份实验中,在$ {T}_{0} $时刻先进行一次初始备份,之后每次写入文件并进行备份实验,增量备份实验结果如表3图5所示。由结果可见,ICDD技术与Backy2工具相比,在备份存储空间方面平均节约了6.96%,在备份时间方面平均节约了76.47%;与基于Duplicacy和Export-diff的云数据备份方案相比,在维持基本相同的备份存储空间情况下,在备份时间方面节约了52.17%。
表 3 OpenStack虚拟机备份存储使用比较

Table 3 Comparison of OpenStack virtual machine backup storage usage

备份时刻 备份存储空间/MB
ICDD Backy2 Export-diff+
Duplicacy
T0 520.26 561.00 517.89
T1 34.62 54.00 36.74
T2 102.08 109.00 102.17
T3 167.35 181.00 167.36
T4 129.88 139.00 129.88
T5 135.29 144.00 135.35
T6 186.12 194.00 186.16
T7 162.71 171.00 162.72
T8 206.27 211.00 206.27
T9 200.91 210.00 200.98
图 5 OpenStack虚拟机备份时间成本比较

Fig.5 Comparison of OpenStack virtual machine backup time cost

4.3 Kubernetes持久化存储备份实验

在进行Kubernetes的容器持久化存储备份实验时,增加了被广泛使用的MySQL备份工具Mysqldump,首先导出数据库中的增量条目,再使用Duplicacy进行备份实验。实验所选取数据库分别为Employee、World、Sakila以及Menagerie,实验结果如表4图6所示。由结果可见,与Backy2相比,ICDD技术在备份存储空间方面平均节约了86.49%,在备份时间方面平均节约了16.67%。值得注意的是,由于Backy2在保存备份数据时采取了填充数据块的方式,在备份数据量较少的情况下存储空间利用率较差这一缺点尤为明显。与基于Duplicacy和Export-diff的云数据备份方案相比,ICDD技术在备份存储空间方面平均节约了14.59%,在备份速度方面节约了44.44%。基于Duplicacy和Mysqldump的备份方案不需要进行初始备份,在备份存储空间成本相近的情况下,ICDD技术节约了28.57%的备份时间,整体备份效率依然得到了提升。
表 4 MySQL容器备份存储使用情况比较

Table 4 Comparison of MySQL container backup storage usage

备份数据库 备份存储空间/MB
ICDD Backy2 Export-diff +
Duplicacy
Mysqldump +
Duplicacy
初始化 0.28 72.00 0.34
Employee 75.64 328.00 89.64 72.10
World 0.55 56.00 0.59 2.02
Sakila 3.56 100.00 4.97 3.13
Menagerie 0.06 48.00 0.06 3.14
图 6 MySQL容器备份时间成本比较

Fig.6 Comparison of MySQL container backup time cost

4.4 恢复实验

在云数据恢复的对比实验中,备份客户端对最后一次增量备份时间点处的所有数据进行恢复,结果如图7所示。实验结果表明,ICDD技术在数据恢复速度方面也存在优势。
图 7 恢复时间成本比较

Fig.7 Comparison of recovery-time cost

5 结束语

为了辅助威胁情报的响应与应用,本文面向OpenStack与Kubernetes分布式云平台,基于Ceph云存储系统,提出了云数据灾备防御体系架构。该架构考虑到云计算环境分布式的特性与数据安全需求,将能够灵活部署、自由选择备份客户端与备份存储后端、采用分离式设计保护备份数据作为重要的设计目标,为云计算提供高效的云数据灾备。在架构中应用了增量云数据去重备份技术,该技术使用增量云数据定位与三层标记数据去重的方式进行备份管理,提升了备份速度,减少了数据冗余。同时引入加密手段来保护备份数据安全。与其他云数据备份工具、技术与方案相比,ICDD技术实现了备份综合性能的改进,有效节约了备份时间和备份存储空间,在数据恢复中也有着良好表现,实现了灾备效率的提升。
1
KUMAR D,KUMAR K P. Artificial intelligence based cyber security threats identification in financial institutions using machine learning approach[C]//2023 2nd International Conference for Innovation in Technology (INOCON). IEEE,2023:1-6.

2
程光, 张家康, 陈子涵. 面向高速端边云网络的加密流量智能识别与态势感知方法[J]. 网络空间安全科学学报, 2023, 1 (1): 90- 105.

CHENG G, ZHANG J K, CHEN Z H. Intelligent identification and situational awareness method for encrypted traffic in high-speed and end-edge-cloud networks[J]. Journal of Cybersecurity, 2023, 1 (1): 90- 105.

3
张佳乐, 赵彦超, 陈兵, 等. 边缘计算数据安全与隐私保护研究综述[J]. 通信学报, 2018, 39 (3): 1- 21.

ZHANG J L, ZHAO Y C, CHEN B, et al. Survey on data security and privacy-preserving for the research of edge computing[J]. Journal on Communications, 2018, 39 (3): 1- 21.

4
KUMARI A,PRAKASH P,UMADEVI M. Prediction of Data Breaches using Classification Algorithms[C]//2021 Fifth International Conference on I-SMAC (IoT in Social,Mobile,Analytics and Cloud)(I-SMAC). IEEE,2021:1049-1054.

5
GUFFEY J,LI Y. Cloud service misconfigurations:Emerging threats,enterprise data breaches and solutions[C]//2023 IEEE 13th Annual Computing and Communication Workshop and Conference (CCWC). IEEE,2023:0806-0812.

6
于丰瑞. 网络威胁技战术情报自动化识别提取研究综述[J/OL]. 计算机工程与 应用. https://link.cnki.net/urlid/11.2127.tp.20240227.1705.002.

YU F R. A survey on automated recognition and extraction of TTPs[J/OL]. Computer Engineering and Applications. https://link.cnki.net/urlid/11.2127.tp.20240227.1705.002.

7
MOUSTAFA N, ADI E, TURNBULL B, et al. A new threat intelligence scheme for safeguarding industry 4.0 systems[J]. IEEE Access, 2018, 6, 32910- 32924.

DOI

8
ANANTHAPADMANABHAN A,ACHUTHAN K. Threat modeling and threat intelligence system for cloud using splunk[C]//2022 10th International Symposium on Digital Forensics and Security (ISDFS). IEEE,2022:1-6.

9
MENARD P, GATLIN R, WARKENTIN M. Threat protection and convenience: Antecedents of cloud-based data backup[J]. Journal of Computer Information Systems, 2014, 55 (1): 83- 91.

DOI

10
ROSA I,BATISTA R,GONÇALVES R,et al. Cyber threat intelligence architecture for applied cybersecurity scenarios:PhD Thesis Proposal in Web Science and Technology[C]//2022 17th Iberian Conference on Information Systems and Technologies (CISTI). IEEE,2022:1-6.

11
SNEDAKER S. Business continuity and disaster recovery planning for IT professionals[M]. Newnes,2013.

12
薄明霞, 唐洪玉, 张静. 云环境下威胁情报技术与应用综述[J]. 电信技术, 2017, 8 (6): 46- 48+52.

BO M X, TANG H Y, ZHANG J. Overview of threat intelligence technology and application in cloud environment[J]. Telecommunications Technology, 2017, 8 (6): 46- 48+52.

13
李建华. 网络空间威胁情报感知, 共享与分析技术综述[J]. 网络与信息安全学报, 2016, 2 (2): 16- 29.

LI J H. Overview of the technologies of threat intelligence sensing, sharing and analysis in cyber space[J]. Chinese Journal of Network and Information Security, 2016, 2 (2): 16- 29.

14
边林, 陶冶, 曹咪, 等. 电信运营商威胁情报建设与运营方法研究[J]. 信息通信技术, 2020, 14 (6): 45- 50.

BIAN L, TAO Y, CAO M, et al. Research on the construction and operation of threat intelligence in telecom operators[J]. Information and Communications Technologies, 2020, 14 (6): 45- 50.

15
KUMAR R, GUPTA N, CHARU S, et al. Open source solution for cloud computing platform using OpenStack[J]. International Journal of Computer Science and Mobile Computing, 2014, 3 (5): 89- 98.

16
DAVID BERNSTEIN. Containers and cloud: from lxc to docker to kubernetes[J]. IEEE Cloud Computing, 2014, 1 (3): 81- 84.

DOI

17
WEIL S A,BRANDT S A,MILLER E L,et al. Ceph:a scalable,high-performance distributed file system[C]//Proceedings of the 7th symposium on Operating systems design and implementation. 2006:307-320.

18
吴沛颖, 王俊峰, 崔泽源, 等. 网络威胁情报处理方法综述[J]. 四川大学学报(自然科学版), 2023, 60 (5): 7- 24.

WU P Y, WANG J F, CUI Z Y, et al. A survey of cyber threat intelligence processing methods[J]. Journal of Sichuan University (Natural Science Edition), 2023, 60 (5): 7- 24.

19
AL-MOHANNADI H, AWAN I, AL HAMAR J. Analysis of adversary activities using cloud-based web services to enhance cyber threat intelligence[J]. Service Oriented Computing and Applications, 2020, 14 (3): 175- 187.

DOI

20
ALSHAIKH A,ALANESI M,YANG D,et al. Advanced techniques for cyber threat intelligence-based APT detection and mitigation in cloud environments[C]//International Conference on Cyber Security,Artificial Intelligence,and Digital Economy(CSAIDE 2023). SPIE,2023,12718: 147-157.

21
AMMI M, ADEDUGBE O, ALHARBY F M, et al. Leveraging a cloud-native architecture to enable semantic interconnectedness of data for cyber threat intelligence[J]. Cluster Computing, 2022, 25 (5): 3629- 3640.

DOI

22
崔琳, 杨黎斌, 何清林, 等. 基于开源信息平台的威胁情报挖掘综述[J]. 信息安全学报, 2022, 7 (1): 1- 26..

CUI L, YANG L B, HE Q L, et al. Survey of cyber threat intelligence mining based on open source information platform[J]. Journal of Cyber Security, 2022, 7 (1): 1- 26..

23
张海涛, 蒋熠, 竺士杰, 等. 电信运营商威胁情报体系研究与应用探索[J]. 电信科学, 2022, 38 (12): 121- 132.

ZHANG H T, JIANG Y, ZHU S J, et al. Research and application exploration of threat intelligence system of telecom operators[J]. Telecommunications Science, 2022, 38 (12): 121- 132.

24
薄明霞, 唐洪玉, 马晨, 等. 基于大数据分析的安全威胁情报在电信运营商的落地应用[J]. 电信科学, 2020, 36 (11): 127- 133.

BO M X, TANG H Y, MA C, et al. Application of security threat intelligence based on big data analysis in telecom operators[J]. Telecommunications Science, 2020, 36 (11): 127- 133.

25
GONG S, LEE C. Cyber threat intelligence framework for incident response in an energy cloud platform[J]. Electronics, 2021, 10 (3): 239.

DOI

26
TORKURA K A,SUKMANA M I H,CHENG F,et al. Slingshot-automated threat detection and incident response in multi cloud storage systems[C]//2019 IEEE 18th International Symposium on Network Computing and Applications (NCA). IEEE,2019:1-5.

27
HRISTEV R,VESELINOVA M. ICT for cyber security in business[C]//IOP Conference Series:Materials Science and Engineering. IOP Publishing,2021,1099(1):012035.

28
KARIM U, INYIAMA H C, KARIM R. User-centric cyber disaster recovery as a service[J]. Nigerian Annals of Pure and Applied Sciences, 2019, 2, 238- 246.

29
YANG L X, HUANG K, YANG X, et al. Defense against advanced persistent threat through data backup and recovery[J]. IEEE Transactions on Network Science and Engineering, 2020, 8 (3): 2001- 2013.

30
LI J,LIU H,CUI L,et al. Irow: an efficient live snapshot system for virtual machine disk[C]//2012 IEEE 18th International Conference on Parallel and Distributed Systems. IEEE,2012:376-383.

31
DANIEL K. backy2-ceph rbd backup-fast open source block based backup software[EB/OL]. [2024-3-1].https://backy2.com/.

32
LI Z, CHEN G, DENG Y. Duplicacy: a new generation of cloud backup tool based on lock-free deduplication[J]. IEEE Transactions on Cloud Computing, 2020, 10 (4): 2508- 2520.

33
TORKURA K A,SUKMANA M I H,STRAUSS T,et al. Csbauditor:Proactive security risk analysis for cloud storage broker systems[C]//2018 IEEE 17th International Symposium on Network Computing and Applications (NCA) . IEEE,2018:1-10.

34
王晨, 郑文英, 王惟正, 等. 边缘计算数据安全保护研究综述[J]. 网络空间安全科学学报, 2023, 1 (2): 35- 45.

WANG C, ZHENG W Y, WANG W Z, et al. Survey on data security protection for edge computing[J]. Journal of Cybersecurity, 2023, 1 (2): 35- 45.

35
陈兴蜀, 曾雪梅, 王文贤, 等. 基于大数据的网络安全与情报分析[J]. 工程科学与技术, 2017, 49 (3): 1- 12.

CHEN X S, ZENG X M, WANG W X, et al. Big data analytics for network security and intelligence[J]. Advanced Engineering Sciences, 2017, 49 (3): 1- 12.

文章导航

/