开放大数据安全存储与检索系统

  • 王祥宇 ,
  • 马鑫迪 ,
  • 梁岩荣 ,
  • 何之洲 ,
  • 马建峰 , *
展开
  • 西安电子科技大学网络与信息安全学院,西安 710071
马建峰()。

网络出版日期: 2024-11-16

基金资助

国家重点研发计划(2021YFB3101100);国家自然科学基金(62232013,62202364);博士后创新人才支持计划(BX20230279);陕西省重点研发计划(2024GX-YBXM-075,2023-ZDLGY-52)

版权

版权所有©《网络空间安全科学学报》编辑部 2024

Secure Storage and Retrieval System for Open Big Data

  • WANG Xiangyu ,
  • MA Xindi ,
  • LIANG Yanrong ,
  • HE Zhizhou ,
  • MA Jianfeng , *
Expand
  • School of Cyber Engineering, Xidian University, Xi’ an 710071, China

Online published: 2024-11-16

Copyright

Copyright ©2024 Journal of Aeronautical Materials. All rights reserved.

摘要

数据安全存储与检索是开放大数据安全利用的基础。然而,现有大数据存储与检索系统难以支持存储密钥的高效更新,且无法兼顾多模态数据的密文存储与高效检索,难以满足开放大数据的安全高效利用需求。为此,针对存储密钥更新问题,提出了基于嵌套加密的存储密钥更新机制,支持非解密式存储密钥高效更新,满足非可信环境下密钥定期轮换需求;针对密文索引体积膨胀问题,提出了压缩密文多集合查询过滤器,支持海量数据的高密度密文索引;针对多模态数据密文检索问题,提出了跨类型密文复合关联检索算法,支持文本、空间、图像等多模态数据的单类型和跨类型密文检索。基于以上关键技术研发了多模态加密数据库系统,该系统支持存储计算分离,兼容现有大数据服务的技术架构,现有大数据平台可通过微服务增量部署完成安全加固,保障系统的可扩展性、易用性和高效性。实验结果表明,相比传统的解密重加密机制,所提出的存储密钥更新机制性能提高了80%以上;相比现有的明文数据库系统,所提出的多模态加密数据库系统在文本、空间、图像、跨模态检索等方面综合性能损耗不超过25%。

本文引用格式

王祥宇 , 马鑫迪 , 梁岩荣 , 何之洲 , 马建峰 . 开放大数据安全存储与检索系统[J]. 网络空间安全科学学报, 2024 , 2(3) : 13 -26 . DOI: 10.20172/j.issn.2097-3136.240302

Abstract

The secure storage and retrieval of data are essential for the secure utilization of open big data. However, existing big data storage and retrieval systems struggle to update storage keys and cannot handle both secure storage and efficient retrieval of multi-modal data. To address the issue of storage key update, a storage key update mechanism based on nested encryption was proposed, which supports efficient non-decrypted key update to meet the requirement for regular key rotation in untrusted environments. To solve the problem of index volume expansion, a compressed encrypted multi-set query filter was proposed to support high-density ciphertext indexing of massive data. Aiming at multi-modal data retrieval on encrypted data, a cross-type ciphertext composite association retrieval algorithm was designed to support single-type and cross-type retrieval of multi-modal encrypted data such as text, spatial, and images. Based on the above technologies, a multi-modal encrypted database system was designed, which supported the separation of storage and computing and was compatible with the technical architecture of existing big data services. The existing big data platform can be upgraded through incremental deployment of microservices to ensure system scalability and efficiency. Experimental results show that the key update performance of the proposed storage key update mechanism improve by over 80% compared to the traditional re-encryption mechanism. Compared to the existing plaintext database system, the overall performance loss of the proposed multi-modal encrypted database system in terms of text, space, image, and cross-modal retrieval does not exceed 25%.

0 引言

数据安全是国家大数据战略发展的前提保障。数据资源整合与开放共享是大数据利用和价值产生的关键,但与之伴随的安全问题也日益突出,保障数据安全已成为全球共识。因此,研究开放环境下的数据安全保护关键技术是确保大数据安全利用的前提,也是加快数字中国建设,推动大数据战略安全实施不可或缺的一部分。近年来,为响应国家大数据战略和培育数字要素市场的指导意见,各地建立多个大数据中心和数据交易所。大数据中心和数据交易所是典型的数据外包模型,数据拥有者将自己的数据托管到大数据中心或数据交易所的云服务器上,通过云服务器把数据共享给授权的合法用户。外包到大数据中心和数据交易所的数据需长期存储,并不间断地为合法数据使用者提供检索服务,保证数据存储与检索安全是实现数据安全保护的首要需求,而数据加密是保护数据安全的根本手段。
为保证系统性能,现有大数据存储与检索系统在安全性上做出了妥协,使用“落盘加密”的方式保护数据安全。“落盘加密”即数据(和索引)仅在存储时进行加密,当需要检索数据时,把数据和索引解密,在明文数据或索引上执行检索;当非活跃数据需要存储到磁盘上时,对数据加密后再存储。“落盘加密”方式只能抵御仅访问磁盘数据的攻击者,但更普遍的攻击场景是攻击者通过各种手段获得云平台的部分权限,进而利用此权限访问活跃数据。此时,由于活跃数据未加密,攻击者可以直接获得明文数据。因此,保证数据安全的理想方式是数据被外包托管到云服务中心前进行加密,且数据检索直接在密文上进行,全程数据不解密。此时,云平台无法获得任何明文数据,入侵云平台的攻击者同样无法获得任何明文数据。然而,大数据密文存储与检索系统仍旧面临以下挑战:
(1)大数据密文存储密钥更新困难。为防止密文推断攻击和用户密钥泄露导致的数据泄露威胁,数据存储密钥需定期更新,这个过程称为“密钥轮换”。然而,传统的密钥轮换机制需使用旧密钥解密密文并使用新密钥重新加密数据。一方面,由于需进行“解密重加密”操作,此机制带来了巨大的计算开销;另一方面,为保证密钥安全,需将数据下载到可信服务器进行“密钥轮换”,带来了巨大的通信开销。对于以PB为单位的大数据而言,上述计算和通信开销是难以接受的。因此,如何设计高效的存储密钥更新机制是实现大数据存储安全的重要保障。
(2)多模态大数据密文索引构建与检索困难。开放大数据具有数据海量多模、查询多样的特点。现有的密文索引构建技术一方面会带来巨大的索引膨胀,密文索引体积甚至远大于原始数据;另一方面主要针对单模态(如文本、空间、图像)等数据,无法有效支持多模态数据的跨类型检索。为支持多模态数据的安全查询,现有密文检索方案需采用同态加密等计算复杂的密码算法,但难以满足大数据检索服务的实时性需求。因此,如何设计高效的密文索引与检索技术,支持大规模密文检索服务的实时响应,是推动大数据安全保护技术实际应用的关键。
综上所述,传统大数据存储与检索平台优先保障系统性能,仅能在数据落盘存储时提供数据加密保护,无法有效支持存储密钥定期轮换,易受密钥泄露和密文推断攻击;在数据检索时未提供数据加密保护措施,极易受到云服务器内部攻击者或入侵云平台的外部攻击者的数据窃取攻击。现有密钥更新和密文检索技术无法满足大数据场景下的性能和功能需求。为此,针对大数据密文存储与检索面临的主要挑战,本文的主要贡献如下:
(1)提出了基于嵌套加密的存储密钥更新机制,该机制支持非解密式存储密钥高效更新,满足非可信环境下密钥定期轮换需求。实验结果表明,所提出的存储密钥更新机制可直接对密文进行密钥更新,密钥更新性能较传统解密重加密机制提高了80%以上。
(2)提出了多模态密文检索方案。针对密文索引体积膨胀问题,提出了压缩密文多集合过滤器,该过滤器支持海量密文数据的高密度索引;针对多模态数据密文检索问题,设计了跨类型密文复合关联检索算法,该算法支持文本、空间、图像等多模态数据的单类型检索和跨类型密文检索。
(3)基于上述关键技术设计了多模态加密数据库系统,该系统支持存储计算分离,兼容现有大数据服务的技术架构。现有大数据平台可通过微服务增量部署完成安全加固,保障系统可扩展性、易用性和高效性。相比现有的明文数据库系统,所提出的多模态加密数据库系统在文本、空间、图像、跨模态检索等方面性能接近,其综合性能损耗不超过25%。

1 国内外研究现状

1.1 密文存储密钥更新

(1)工业界密文存储密钥更新技术。为保证系统性能,工业界在安全性方面做了妥协,目前主要有两类密钥轮换方案,分别是基于存储平台信任的方案和基于数字信封更换的方案。基于存储平台信任的方案假设数据存储平台(云平台)是可信的,需要更新密文存储密钥时,直接由存储平台使用旧密钥解密数据,并使用新密钥重新加密数据。这种方式避免了数据下载的通信开销,但其计算开销依旧巨大;同时,存储密钥在云平台暴露,易遭受云平台内部攻击。基于数字信封更换的方案使用一个长期密钥加密存储数据,并使用数据拥有者生成的定期密钥加密长期密钥(长期密钥的密文称为“数字信封”),将数字信封与密文数据存储在一起。当合法用户下载数据时,合法用户从数据拥有者获得数字信封的解密密钥,并从云服务器获得数字信封和密文数据。解密数字信封获得长期密钥后,合法用户即可解密密文数据。当需要进行密钥更新时,数据拥有者更换数字信封的加密密钥并替换云平台存储的数字信封。这一过程只是更换了保护长期密钥的密钥,并没有真正更新密文存储密钥,若存储密钥泄露,则数据依旧会泄露。上述两种方案广泛应用于谷歌、亚马逊、阿里巴巴等云服务提供商,虽然具有较高的性能,但无法杜绝密钥泄露带来的数据泄露威胁。
(2)可更新加密。为解决上述工业界方案的安全性问题,学术界提出了可更新加密的概念,在可更新加密方案中,数据拥有者只需要生成一个很短的更新令牌,该令牌允许云服务器根据现有密文重新加密数据,同时保持加密的安全性。可更新加密可以直接在云服务器实现存储密钥轮换,不需要解密重加密操作,提供了理想的密钥轮换模型。然而,现有的可更新加密技术往往采用双线性操作[1-3]或基于容错学习(Learning With Error,LWE)[4]的同态操作实现密钥更新,其性能十分有限,无法满足大数据存储密钥轮换需求。如何设计一个高效安全的存储密钥更新机制仍存在巨大挑战。

1.2 多模态数据密文检索

为同时实现外包数据的有效检索和安全保护,可搜索加密[5-8]技术受到了广泛的关注,它允许用户根据查询关键字对加密文件进行高效检索。为提高检索效率,现有的大多文本可搜索加密方案通过提前提取文件关键词构建加密索引,检索时只需要检索相应关键词就可以实现高效准确的检索服务。根据每次检索关键词的个数不同,基于关键词的可搜索加密方案分为单关键词检索方案[9]与多关键词检索方案[10]。多关键词检索方案由于更多的检索条件(检索结果需同时包含多个检索关键词),相比单关键词检索方案可以实现更精准的密文检索。目前,研究者主要关注如何使密文文本检索方案更加实用,即如何构建出更高效的索引结构从而提高检索效率。
空间数据查询最常用的方法是几何范围查询,此类查询通常需要执行“计算再比较”的操作。例如,要确认一个点是否在圆内,需要首先计算该点到圆心的距离,再将圆的半径与该距离进行比较。为实现密文上的计算再比较操作,一些研究者利用矩阵加密[11]、保序加密[12]和同态加密[13]等密文计算和比较技术实现密文空间范围检索,但这些方案存在安全性存在缺陷或性能较差的缺点。为实现高效安全的密文空间范围查询,一些研究者把空间数据通过专用的编码方法转化为编码值[14],如希尔伯特编码[15]、Geohash[16]等,如果两个点的编码值相同,则认为该数据符合检索要求。随后,利用文本可搜索加密技术支持上述编码匹配过程,从而支持高效安全的空间密文检索。
对于图像数据来说,可以利用基于内容的机器学习模型,如神经网络[17]、词袋模型[18]等,将图像数据转化为可以准确覆盖其具体内容的固定长度的图像特征向量。在此基础上,为实现数据安全保护,通过向量加密[19]、同态加密[20]等加密技术对图像特征向量进行加密。检索时,通过计算两个不同加密图像特征向量之间的欧氏距离或汉明距离判断两个加密图像特征向量是否相似,距离更近表明两个图像更相似。
随着数据类型的丰富,越来越多包含相同潜在语义含义的异质数据(如图像、音频、视频和文本)被上传到云端,如何实现两种及以上类型的异质数据安全跨模态检索成为研究热点。为实现准确的跨模态检索,首先将不同类型的数据通过预训练机器学习模型跨越异构鸿沟映射到同一空间下,随后在同一空间下计算不同类型数据的相似性[21-22]。例如,将两个不同类型的数据利用跨模态哈希函数映射为固定长度的1、−1比特串,通过计算不同比特串之间的汉明距离判断它们的相似性。现有的密文跨模态检索技术可分为两类,一类是系统借用可信硬件的帮助,将相似性检测转移至可信执行环境中进行[23];另一类是为克服检索方案对可信硬件的依赖,借助低效的同态加密算法实现安全的比特串相似性检测[24]

1.3 加密数据库系统

传统数据库系统仅能加密落盘存储的非活跃数据,数据检索需要在明文索引或数据上进行。为实现存储与检索全流程数据安全保护,国内外对加密数据库系统进行了广泛研究,如图1所示,主要技术路线包括以下3种:
图 1 加密数据库主流技术路线示意图

Fig.1 Overview of mainstream technical routes for encrypted databases

(1)基于密文检索的加密数据库。密文检索技术可以在密文索引和数据上支持高效检索。基于此特性,一系列加密数据库系统已被提出。典型代表是MIT设计的加密数据库系统CryptDB[25]。该系统利用确定性加密、保序加密、同态加密等保性加密算法直接在密文上满足关系型数据库查询需求,并使用加密中间件实现关系型数据库的安全加固,同时保证系统的高效性和易用性。然而,为了在密文上保持与明文相同的特性,保性加密泄露了密文数据的操作模式,已被证明无法抵抗被动攻击者[26]。为确保安全性,Poddar等[27]和Kamara等[28]分别基于语义安全的加密算法支持加密关系型数据库查询。然而,这些算法计算复杂度较高,且与明文数据库的工作模式显著不同,难以直接集成到已有关系型数据库系统中。同时,这些系统主要针对关系型数据库,无法满足多模态大数据的检索需求。
(2)基于可信执行环境的加密数据库。为避免在密文上进行复杂操作,学术界[29-30]和阿里巴巴[31]、华为[32]、微软[33]等云服务商基于可信执行环境构建加密数据库系统。他们将索引和数据加密后存储在云服务器上,并把加密密钥发送到部署在云服务器端的可信执行环境(如Intel SGX等)中。当需要检索数据时,首先把密文索引提取到可信执行环境中解密,其次在可信环境中的明文索引上执行检索过程,根据检索结果获得对应的密文数据,最后在可信环境中解密密文数据并返回给客户端。基于可信执行环境的加密数据库可以提供数据存储与检索全流程数据安全保护,同时高效支持任意查询功能。然而,这类数据库的安全性高度依赖于可信硬件,而现有大数据平台硬件异构,导致系统适配性差;同时可信硬件面临侧信道攻击等威胁,其安全性不可证明。此外,上述工作主要面向关系型或键值型数据库,无法支持多模态数据库的安全加固。
(3)基于分布式信任的加密数据库。为了在不使用可信执行环境的前提下支持丰富的密文查询功能。一些学者基于分布式信任模型设计了一系列加密数据库系统。他们利用安全多方计算技术把数据加密存储在多个非共谋服务器上,当需要执行数据检索时,客户端使用安全多方计算技术加密查询请求,多个服务器根据查询请求共同执行多方安全查询协议,得到查询结果。由于安全多方计算技术理论上可以执行任意运算,此技术路线理论上可以支持任意数据类型的任意查询。加州伯克利大学的Waldo[34]是基于函数秘密共享的时序加密数据库系统,可以支持时序数据的多谓词过滤和聚合查询。然而,基于分布式信任的加密数据库需要部署在多个非共谋服务器上,且查询过程需要所有服务器实时在线通信,这大大增加了系统的部署难度。
综上所述,一方面,现有工作在安全性、高效性和易用性上尚未达成有效的平衡;另一方面,现有工作尚未对多模态数据库的数据安全存储和检索做深入研究,大多数工作仅面向关系型数据库,无法满足多模态大数据的检索需求。表1比较了3种主流加密数据库技术路线之间的特性,基于密文检索的加密数据库具有最高的稳定性且易于部署,但在功能性和性能方面尚有一定不足。为保证技术的通用性和稳定性,本文采用基于密文检索的加密数据库这一技术路线设计了开放大数据安全存储与检索系统。为提高性能并满足多模数据检索需求,本文基于嵌套加密的存储密钥更新机制、基于合并重复的压缩密文多集合过滤器、多模态密文检索等关键技术,设计了多模态加密数据库系统,采用基于微服务的安全服务自治技术,现有大数据平台可通过微服务增量部署完成安全加固,保障系统可扩展性和易用性,确保多模态数据库安全高效、可用、易部署。
表 1 加密数据库技术路线特性对比

Table 1 Comparison of technical routes for encrypted databases

技术路线 功能性 性能 部署难度 稳定性
基于密文检索
的加密数据库
难以支持跨模态检索 索引膨胀较大,检索效率较高 支持单服务器部署,无需可信硬件 仅需单服务器
实时在线
基于可信执行环
境的加密数据库
支持任意检索 无索引膨胀,检索效率高 支持单服务器部署,需要可信硬件 需要服务器和
可信执行环境实时通信
基于分布式信任
的加密数据库
理论上支持任意检索 索引膨胀较小,检索效率较高 需要多个非共谋服务器,无需可信硬件 需要所有非共谋服务器
实时在线通信

2 密钥动态更新的加密存储

在密钥的生命周期中,密钥更新是一个重要环节。密钥更新发生在密钥超过使用期限、已泄露或存在泄露风险,此时根据相应的更新策略进行密钥更新。现有的存储密钥更新机制无法有效支持开放环境下大规模密文的密钥更新。工业界实际使用的密文存储密钥更新机制要么只支持数字信封密钥的更新,无法实现数据加密密钥的更新;要么需要对数据进行解密重加密。学术界提出的可更新加密需要使用双线性对或基于LWE的同态运算等复杂运算,难以满足大数据应用需求。为此,本文提出了一个基于嵌套加密的存储密钥动态更新机制,兼顾密钥更新的安全性和高效性。

2.1 基于嵌套加密的存储密钥动态更新机制

实现存储密钥高效更新的关键是设计一种轻量级的密文更新机制,研究发现序列密码的异或加密特性具有可更新性:序列密码以用户密钥作为种子,使用伪随机生成器生成与待加密消息等长的随机序列,随机序列与待加密消息的异或即为消息密文。根据异或的同态性,使用新的用户密钥生成随机序列并将此随机序列与旧随机序列异或,最终与消息密文异或,即可获得使用新用户密钥加密的密文。为提高密钥更新性能,需使用同样的用户密钥加密所有消息,但这无法满足序列密码的语义安全,若使用相同用户密钥产生的随机序列加密明文,则密文的异或等于明文的异或,可以据此推断出明文信息。为解决这一问题,本文提出基于嵌套加密的存储密钥更新机制:用户维护一个长期密钥和一个可更新密钥,首先使用长期密钥基于分组密码加密明文,保证语义安全;随后使用可更新密钥基于序列密码加密上述密文,保证密文的可更新性。
基于嵌套加密的存储密钥动态更新机制如图2所示,消息明文使用长期密钥和可更新密钥嵌套加密,为维护更新信息,在每一个数据块上存储更新状态S,初始状态S=0。每当需要进行密钥更新时,首先,从服务器获得待更新密文的更新状态S,并据此生成上一次可更新加密的密钥;其次,根据更新状态和上一次可更新加密密钥生成本次更新所需的更新令牌,并刷新更新状态S=S+1;最后,使用更新令牌与密文异或,获得更新后的密文,并保存新的更新状态。所提出的存储密钥更新机制主要分为3个阶段:数据加密、数据更新、数据解密,具体过程如下。
图 2 基于嵌套加密的存储密钥动态更新机制

Fig.2 Storage key update mechanism based on nested encryption

(1)数据加密。密钥管理中心长期秘密保存两个密钥,一个是使用分组加密的长期密钥KB,另一个是用于派生可更新密钥的密钥KD。初始化密文状态S=0,使用密钥派生函数KDF生成可更新密钥KS=KDF(KDS),将KBKS发送给授权用户。当用户需要加密数据时,首先,使用长期密钥KB利用分组加密算法(如SM4,AES)等加密原始明文得到第一次加密的密文CB;其次,使用可更新密钥KS利用序列加密算法(如ZUC)生成随机序列RS,并计算$ {R}_{\mathrm{S}}\oplus{C}_{\mathrm{B}} $,得到最终的密文$ {C}_{{{\mathrm{K}}}_{\mathrm{B}}, {{\mathrm{K}}}_{\mathrm{{\mathrm{S}}}}} $;最后,使用数字信封技术保护密文状态S,并将其与密文一同存储到云服务器。
(2)存储密钥更新。当进行密钥更新时,密钥管理中心首先从云服务器获取密文更新状态S,其次计算当前更新可更新密钥KS=KDF(KDS)和新的可更新密钥KS+1=KDF(KD,S+1)。随后,分别使用可更新密钥KSKS+1生成随机序列RSRS+1,并计算更新令牌$ T={R}_{\mathrm{S}}\oplus{R}_{\mathrm{S}+1} $,将更新令牌T和新的更新状态S=S+1发送给云服务器。云服务器保存S,并将T与待更新密文进行异或,得到${C}_{{{\mathrm{K}}}_{\mathrm{B}},{{\mathrm{K}}}_{\mathrm{S}+1}}= $$ T{\oplus C}_{{{\mathrm{K}}}_{\mathrm{B}},{{\mathrm{K}}}_{\mathrm{S}}}= {R}_{\mathrm{S}}\oplus{R}_{\mathrm{S}+1}\oplus{R}_{\mathrm{S}}\oplus{C}_{\mathrm{B}}={R}_{\mathrm{S}+1}\oplus{C}_{\mathrm{B}} $,即为新密钥的密文。
(3)数据解密。当用户需要云端的文件时,从云端下载密文$ {C}_{{{\mathrm{K}}}_{\mathrm{B}} , {{\mathrm{K}}}_{\mathrm{S}}} $并且进行解密。密钥管理中心根据更新状态生成最新的可更新密钥$ {K}_{\mathrm{S}} $并将其与长期密钥KB一起发送给合法用户。解密流程与加密流程相反,即根据最新的可更新密钥$ {K}_{\mathrm{S}} $生成随机序列$ {R}_{\mathrm{S}} $,计算$ {C}_{\mathrm{B}}={R}_{\mathrm{S}}\oplus{C}_{{{\mathrm{K}}}_{\mathrm{B}},{{\mathrm{K}}}_{\mathrm{S}}} $,得到第一层解密后的密文$ {C}_{\mathrm{B}} $。最后,使用KB$ {C}_{\mathrm{B}} $进行解密即可得到明文。

2.2 安全性说明

密文存储面对的攻击者主要有两类:短期入侵云的攻击者和长期监视云的攻击者。短期入侵云的攻击者可能是短期突破云服务器防护的黑客或恶意的内部人员,他们可以获得短期云服务器中存储和运行的数据。长期监视云的攻击者可能是长期潜伏在云服务器的恶意程序或恶意的内部人员,他们可以获得历史上云服务器所有存储和运行的数据。
(1)短期攻击者获取明文条件:对于本文提出的存储密钥更新机制,短期攻击者可以获得最新的密文数据和更新令牌。若想解密数据,短期攻击者需要获得长期密钥和最新的更新密钥,任意密钥的缺失都无法成功解密密文。
(2)长期攻击者获取明文条件:对于本文提出的存储密钥更新机制,长期攻击者可以获得历史上所有密文数据和更新令牌。根据更新令牌异或同态的性质,获得任意一次可更新密钥即可消除历史上所有密文数据上的随机序列。此时,长期攻击者还需获得长期密钥才能解密密文存储的数据。因此,长期攻击者需要同时获得长期密钥和任意一次的可更新密钥才能成功解密密文。

3 多模态大数据密文检索方案

大数据具有海量多模、查询多样的特点,现有的密文索引构建技术一方面会带来巨大的索引膨胀,密文索引体积甚至远大于原始数据;另一方面主要针对单模态(如文本、空间、图像)等数据,无法有效支持多模态大数据的跨类型检索。为支持多模态大数据安全查询,同时满足大数据检索服务的实时性需求,本文提出了基于合并重复的压缩密文多集合过滤器和一系列多模态密文检索方案。

3.1 压缩密文多集合过滤器

布隆过滤器因其可以实现高效的成员检测而被广泛用于构建密文检索方案。然而,传统基于布隆过滤器的密文检索方案通常需要为每个数据对象构建一个布隆过滤器,这将无法避免地带来大量存储开销;同时,基于布隆过滤器的检索方案也无法避免遇到假阳性的问题,这将直接影响检索的精确度。为此,本文引入一种新型布隆过滤器结构CSC-BF[35],通过将所有关键词信息映射到同一个布隆过滤器中降低存储花销,并通过重复映射的操作降低布隆过滤器无法避免的假阳性,提出了压缩密文多集合过滤器,过滤器结构如图3所示。
图 3 压缩密文多集合过滤器

Fig.3 Compressed encrypted multi-set filter

首先,构建rm长的空布隆过滤器集合$ {B}{F}=\{{{B}{F}}_{0},{{B}{F}}_{1},\cdots,{{B}{F}}_{{r}-1}\} $,其次利用CSC架构插入所有关键词:对需要插入的二元组 (wid),其中w为包含在标识符为id的文件中的关键词,计算(w,id)的插入位置$ {\mathrm{lo{c}}_t} = ({h_t}(w)\% m + {g_t}(i))\% m $,其中$ {h_t} $为第t个哈希函数,将映射到的位置设为1,其余位置设为0;$ {g_t} $为第t个分区函数;m为布隆过滤器总长度。从而得到最终完成插入的布隆过滤器集合BF。为保证索引的安全性,需要在上传数据至服务器之前对数据和索引进行加密。
以单个布隆过滤器为例,对BF中的每个位置赋予独立且随机的包含标识符$ C[i] = H(i \oplus \gamma ) $$ 0 \leqslant i \leqslant m - 1 $,并计算$ {{B}}{{{F}}^{{{{\mathrm{new}}}}}} = {{BF}} \oplus C' $。通过上述转变方式重复扰乱r次,得到$ {{B}}{{{F}}^{{\mathrm{new}}}} = \{ {{BF}}_0^{{\mathrm{new}}},{{BF}}_1^{{\mathrm{new}}},\cdots,{{BF}}_{r - 1}^{{\mathrm{new}}}\} $。为消除不同$ {{B}}{{{F}}^{{\mathrm{new}}}} $之间的相关性,不同$ {{B}}{{{F}}^{{\mathrm{new}}}} $对应的$ C' $使用的$ \gamma $不同。其次,对$ {B}{{F}^{{\mathrm{new}}}} $利用隐藏向量加密技术[36]进行加密得到$ {{BF}}_{{\mathrm{Enc}}}^i = $$ \{ {\{ {d_{j0}},{d_{j1}}\} _{j \in [0,m - 1]}}\} $,其中$ {d_{j0}} = $$ {F_0} ({\mathrm{msk}},{{BF}}_i^{{\mathrm{new}}}[j]||j) \oplus {\alpha _{ij}}$$ {d_{j1}} ={\mathrm{Sym}}.{\mathrm{Enc}}({\alpha _{ij}} ,{0^{\lambda + {{\log }_2}\lambda }}) $。最终,得到压缩加密索引$ {B F}_{\mathrm{Enc}}=\left\{{BF}_{\mathrm{Enc}}^0,{BF}_{\mathrm{Enc}}^\prime \cdots, {BF}_{\mathrm{Enc}}^{r-1}\right\} $。当需要检索关键词$ w' $时,计算$ w' $对应的匹配位置上的包含标识符$ C_i^*[i] = H(({h_j}(w') + i) \oplus {\gamma _i}) $$ 0 \leqslant i \leqslant b - 1 $。然后根据得到的包含标识符利用隐藏向量加密技术计算每个匹配位置的加密值$ tk_j^i = \{ {h_j}(w'),$$ c_t^i = $$ {F_0}({\mathrm{msk}}, C_i^*[t]||{h_j}(w') + t) $$ 0 \leqslant i \leqslant r - 1 $$ 0 \leqslant j \leqslant k - 1 $$ 0 \leqslant r \leqslant b - 1 $并得到陷门$ {\mathrm{TK}} = {\{ {\mathrm{tk}}_j^i\} _{i \in [0,r - 1],j \in [0,k - 1]}} $,其中k表示哈希函数的个数,r表示重复的次数。最后,对TK和$ {B}{{F}_{{\mathrm{Enc}}}} $进行匹配。以一个$ {{BF}}_{{\mathrm{Enc}}}^i $为例,首先使用$ {h_j}(w) $定位到$ {{BF}}_{{\mathrm{Enc}}}^i $中相应的查询位置,并且调用隐藏向量加密进行匹配。若对所有$ 0 \leqslant j \leqslant k - 1 $$ {c_t} $$ {{BF}}_{{\mathrm{Enc}}}^i[{h_j}(w) + t] $全部匹配成功,则表示$ {c_t} $中的查询关键字包含在第t个分区中。因此,服务器得到布隆过滤器$ {{BF}}_{{\mathrm{Enc}}}^i $的候选结果为$ {R_i} $。同理,可以得到r个候选结果$ {{R}} = \{ {R_0},{R_1},\cdots,{R_{r - 1}}\} $。最终,对r个候选结果进行集合交运算,得到检索结果R

3.2 多模态密文检索方案

(1)密文文本检索。为实现加密文本数据的安全检索,基于压缩密文多集合过滤器,设计了高效安全的文本检索方案,实现了大规模加密文本数据上的安全检索。每个文件f都可以被一组关键词集合W表示,即可以利用二元组(wid)表示一组关键词与文件的包含关系,其中id为文件f的标识符,w为包含在文件f中的关键词。数据拥有者利用密文多集合过滤器构建索引:首先,数据拥有者将所有二元组(wid)映射到CSC-BF中,并构建得到加密索引$ {B}{{F}_{{\mathrm{Enc}}}} = $$ \{ {{BF}}_{{\mathrm{Enc}}}^0,{BF}_{\mathrm{Enc}}^\prime, \cdots,{{BF}}_{{\mathrm{Enc}}}^{r - 1}\} $;其次,当数据用户需要查询关键词$ w' $时,数据用户计算陷门TK,并将TK发送给服务器发起查询;最后,服务器通过匹配$ {{B{F}}_{{\mathrm{Enc}}}} $与TK得到包含查询关键词$ w' $的检索结果R
(2)密文空间查询。基于压缩密文多集合过滤器,设计了高效安全的空间加密数据检索机制,实现了空间加密数据安全查询。如图4所示,对每个空间数据,首先利用希尔伯特编码[37]对空间进行覆盖,将二维空间转化为一维数据。再利用前缀编码[38]将一维数据转化为前缀编码族,例如:7 = {0111,011*,01**,0***,****}。其次,将前缀编码族中的每个元素视为该空间数据的关键词,并按照密文多集合过滤器的结构将所有空间数据及其关键词映射到布隆过滤器中,并构建得到加密索引$ {{B{F}}_{{\mathrm{Enc}}}} $
图 4 空间数据编码

Fig.4 Spatial data encoding

当需要查询某一个空间范围包含哪些空间数据时,数据用户首先将该查询范围利用希尔伯特编码转换为一维数据,并找到可以覆盖整个查询范围的前缀元素,例如:[4,7] = {01**}。随后,将该前缀元素视为查询关键词,并构建陷门TK,再上传给服务器发起查询。前缀编码算法认为,如果查询范围的前缀元素包含在一个数据的前缀族中,则表示该数据包含在该查询范围内,例如: {01**}$ \in ${0111,011*,01**,0***,****},7$ \in $[4,7]。最终,与第3.1节中的密文检索方法相同,服务器利用隐藏向量加密对$ {{B{F}}_{{\mathrm{Enc}}}} $和TK进行匹配,得到检索结果R
(3)密文图像查询。基于压缩密文多级和过滤器和视觉词袋模型[39-41] ,设计了精确高效的图像数据检索机制,解决了图像数据检索效率低的问题,实现了加密图像数据安全查询。如图5所示,对所有图像数据,首先利用视觉词袋模型提取每个图像的特征向量得到特征向量集合,并且对所有特征向量进行聚类得到K个聚类中心,将K个聚类中心向量视为K个关键词得到关键词词典$ W = \{ {w_1},\cdots,{w_K}\} $。根据关键词词典W,每个特征向量可表示为W中与该特征向量欧氏距离最相近的一个关键词,即每个图像都可以表示为一个关键词集合$ {W_\alpha } $。其次将每个关键词与图像数据对应起来,使用密文多集合过滤器构建索引$ {{B{F}}^{{\mathrm{new}}}} $,其中$ C[i] = $$ H({h_k}(i) \oplus \delta ) $。当需要发起图像查询时,数据用户利用相同的方法提取查询图像的特征向量集合,同时将每个特征向量转化为W中与其欧氏距离最相近的一个关键词,得到查询关键词集合。对于每个查询关键词$ w' $,查询用户计算$ ({h_j}(w') + t)\% m $$ {h_k}(({h_i}(w') + t)\% m) $,得到陷门$ {\mathrm{TK}} = $$ \{ ({h_j}(w') + t)\% m, $$ {h_k}(({h_j}(w') + t)\% m)\} $$ 0 \leqslant i \leqslant r - 1 $$ 0 \leqslant j \leqslant k - 1 $, 其中k表示哈希函数的个数,r表示重复的次数。最后,服务器匹配TK和$ {{B{F}}^{{\mathrm{new}}}} $。以一个$ {{BF}}_i^{{\mathrm{new}}} $为例,服务器使用$ {\mathrm{lo{c}}_t} = $$ ({h_j}(w') + t)\% m $定位到$ {{BF}}_i^{{\mathrm{new}}} $中相应的位置$ {{BF}}_i^{{\mathrm{new}}}[{\mathrm{lo{c}}_t}] $,并检查$ {{BF}}_i^{{\mathrm{new}}}[{\mathrm{lo{c}}_t}] $是否等于$ H({h_k}({\mathrm{lo{c}}_t}) \oplus \delta ) $。若相等,则表示匹配成功。最终与文本查询中相同,服务器得到检索结果R
图 5 图像数据编码

Fig.5 Image data encoding

(4)跨模态密文检索。为实现对云服务器中加密多模态数据的检索,基于跨模态哈希(Cross-Modal Hashing, CMH)[42]和内积加密[43]提出了一个隐私保护的跨模态检索方案,解决了跨媒体检索安全性差的问题,检索流程如图6所示。
图 6 跨模态密文检索流程

Fig.6 Overview of encrypted cross-modal retrieval

首先,利用已有训练数据集通过机器学习模型训练得到可以准确反映各类型数据语义信息的跨模态哈希函数$ {f_v}(v) $$ {f_t}(t) $,其中$ {f_v}(v) $为映射图像数据的哈希函数,$ {f_t}(t) $为映射文本数据的哈希函数。利用相应的跨模态哈希函数,将数据集中的每个对象映射为相应的哈希码。通过跨模态哈希,将不同类型的数据跨越异构鸿沟映射到同一空间下,查询时只需要计算2个哈希码的汉明距离就可以得到相应两个数据的相似程度。在实现准确跨模态检索的基础上,为保护数据隐私,对数据库中的每个哈希码y进行加密,得到加密值$ {\mathrm{ct}} = $$ (d,c = (b, {\boldsymbol{a}})) $,其中$ d = - \left\langle {u,c} \right\rangle + $$ {\mathrm{sign}}\left(\displaystyle\sum\nolimits_{i = 1}^k {{e_i}} \right) \cdot \left| {{e_*}} \right| $$ b = - {S^t}{\boldsymbol{a}} + $$ (q'\mathord{\left/\vphantom{q'p}\right.}p)y+e $u、S为私钥,$ {e_i} $$ {e_*} $e为误差因子,a为随机向量,$ q' $p为公共参数。最后,数据拥有者将加密集合外包给云服务器。当数据用户需要发起查询时,首先使用前面训练好的CMH生成查询数据的哈希码x,然后计算陷门$ {\mathrm{TK}} = u + t * {{{\bf{T}}{\mathrm{x}}}} $,其中$ t $根据公共参数自由选择,$ {\bf{T}} $为私钥。数据用户向CSP发送陷门$ {\mathrm{TK}} $发起查询。在查询阶段,CSP匹配$ {\mathrm{ct}} $$ {\mathrm{TK}} $得到$ {\mathrm{ct}} $$ {\mathrm{TK}} $中两个数据的汉明距离$ {\mathrm{score}} = $$ \left[\dfrac{p}{q'}(d+\left\langle c,sk\right\rangle)\right]\mathord{\left/\vphantom{\left[\frac{p}{q'}\cdot(d+\left\langle c,sk\right\rangle)\right]t}\right.}t $,其中[]表示就近取整。最后,CSP将汉明距离最小的数据作为检索结果返回给数据用户。

4 多模态加密数据库系统与性能测试

4.1 多模态加密数据库系统

在基于嵌套加密的密文存储密钥更新机制、跨类型密文复合关联检索等关键技术突破的基础上,本文设计了首个多模态加密数据库系统,系统架构如图7所示。系统采用存储与计算分离架构,兼容现有大数据服务的技术架构,现有大数据平台可通过微服务增量部署完成安全加固升级,保障系统可扩展性、易用性和高效性。
图 7 多模态加密数据库系统架构

Fig.7 System architecture of multi-modal encrypted database

该系统服务层主要由密文索引管理服务、密文数据管理服务、密文查询调度服务和服务管理中心构成。
(1)密文索引管理服务根据数据提取数据特征,建立密文索引,并对密文索引的存储、更新、读取进行管理,辅助密文检索过程顺利进行。
(2)密文数据管理服务生成并管理用于索引和数据加密的密钥,并进行原始数据的加解密。
(3)密文查询调度服务根据用户的密文查询令牌和存储的密文索引执行安全查询操作,得到对应的密文结果集。
(4)服务管理中心负责管理各个服务,包括服务负载均衡、服务发现/注册、服务监控、服务治理,等功能。

4.2 实验环境

本文所有的原型系统和测试实验都是用Java语言编写,并在Intel@ Xeon(R) Gold 6130 CPU @ 2.10 GHz × 64和512 GB RAM的服务器上运行实现。所有密码学工具的安全参数设置为128,符合美国国家标准与技术研究院(NIST)和国家密码管理局对加密算法安全强度的要求。原型系统部署在开源大数据平台Hadoop 3.2.1上,使用HBase 2.4.1存储加密的原始数据。
为直观展示系统高效性,将多模态加密数据库系统与相关的当下主流明文数据检索系统进行全面的性能比较。对于文明和空间查询,使用全球使用最广泛的开源大数据搜索引擎Elasticsearch (https://www.elastic.co/cn/elasticsearch)进行对比测试;对于图像查询,使用META研发的开源特征向量搜索引擎工具集Faiss (https://faiss.ai/)进行对比测试;对于跨模态检索,使用开源向量数据库Milvus (https://milvus.io/)进行对比测试。

4.3 密钥动态更新性能测试

为体现密钥动态更新的加密存储机制对密文更新的效率提升,图8图9展示了基于嵌套加密的存储密钥动态更新机制和传统解密重加密机制的性能对比情况,其中加速率=((对比方案所需时间−所提方案所需时间)/对比方案所需时间)×100%。
图 8 密文更新时间

Fig.8 Running time of ciphertext update

图 9 密文更新时间

Fig.9 Running time of ciphertext update

首先采用5个不同大小的待加密文件进行测试,文件大小分别8 KB、16 KB、32 KB、64 KB和128 KB,实验结果如图8所示。可以看到,随着文件大小由8 KB增长到128 KB,两种存储密钥更新机制所需的运行时间都有所增加,但基于嵌套加密的存储密钥动态更新机制所需时间增长幅度低于传统解密重加密机制。这是因为随着文件大小的增加,传统解密重加密机制对于原密文的解密所需时间也同步加大,这占据了该机制密文更新一半的时间。而基于嵌套加密的存储密钥更新机制中的密钥序列的生成时间是固定的,且只需要轻量级的异或运算,从而使得运行时间的增加较为平缓。当文件大小为128 KB时,基于嵌套加密的存储密钥更新机制的密钥更新时间相比传统密钥更新机制加速近90%。
其次,对多个文件的存储密钥更新速度进行测试,测试文件的数量分别为:百(102)、千(103)、万(104)、十万(105)、百万(106),单个测试文件的大小固定为8 KB,实验结果如图9所示。可以看到,随着文件数量的增加,基于嵌套加密的存储密钥更新机制的密钥更新速度与传统解密重加密机制的加速比保持恒定,大约为80%。在需要进行多个文件的密文更新的情况下,基于嵌套加密的存储密钥更新机制同样是十分高效的。

4.4 多模态密文检索性能测试

为证明本文提出的压缩密文多集合过滤器的有效性,分别测试了压缩密文多集合过滤器和传统加密布隆过滤器检索方案在索引大小和检索时间两方面的性能,其中压缩比=压缩密文多集合过滤器所占内存/传统加密布隆过滤器所占内存,时间损耗率=((多模态加密数据库所需时间−对比方案所需时间)/对比方案所需时间)×100%。
以文本数据为例,图10展示了在同一类型数据库中,随着文本数量增多,两个方案所占存储空间的大小。可以看到,随着文本数量由1 000线性增长到10万,压缩密文多集合过滤器所占空间逐渐增大,但相比传统加密布隆过滤器索引存储空间的线性增长,本文方案所占存储空间增长速度非常缓慢。另外,通过压缩比发现,随着文本数量的增加,压缩比逐渐增加,即压缩密文多集合过滤器的压缩效果越来越好。当文件数量增长到百万级时,索引大小压缩了约200倍。图11展示了随着文本数量增多,两个方案的检索时间的变化。可以看到,两个方案的检索时间都随着文本数量的增加而逐渐增加。但压缩密文多集合过滤器所需要的检索时间始终小于传统加密布隆过滤器。
图 10 密文索引大小

Fig.10 The size of the encrypted index

图 11 密文多集合检索时间

Fig.11 Running time of encrypted multi-set retrieval

为证明本文提出的多模态密文检索方案可以实现正确高效的检索,分别对文本检索、空间检索以及图像检索方案的检索时间进行测试。图12展示了随着文本数量的增加,文本数据检索所消耗的时间大小。可以看到,随着文本数量的线性增加,多模态加密数据库中文本检索时间是非线性增长的,即不会随着文本数量的快速增长而迅速增长,满足大数据检索需求。此外,多模态加密数据库中的密文文本检索方案相比明文数据库Elasticsearch并未显著增加。为直观展示多模态加密数据库的高效性,图12给出了2个检索方案关于检索时间的损耗率,时间损耗率为3.5%左右。
图 12 文本检索时间

Fig.12 Running time of keyword retrieval

图13图14中分别展示了随着数据量的增大,多模态加密数据库中的密文空间检索、密文图像检索与同类型明文数据库的检索时间对比,其中空间检索方案与明文数据库Elasticsearch进行对比,图像检索方案与明文数据库Faiss进行对比测试。由图13可以得到与文本数据检索方案相同的结论,即密文空间检索时间为亚线性增长,且相比同类型明文数据库时间损耗小于10%。由图14可以看到密文图像检索时间同样随数据量的增大呈亚线性增长,且随着数据量的增大,密文图像检索的时间损耗越来低,百万数据检索时间损耗小于25%。
图 13 空间检索时间

Fig.13 Running time of spatial retrieval

图 14 图像检索时间

Fig.14 Running time of image retrieval

图15展示了随着跨模态数据数量的增加,多模态加密数据库与明文数据库Milvus的跨模态检索时间对比。可以看到,随着数据数量的增加,多模态加密数据库中的跨模态加密检索时间增长为亚线性,与明文跨模态数据库检索相比,时间损耗率逐渐降低,百万数据检索时间损耗小于20%。
图 15 跨模态检索时间

Fig.15 Running time of cross-modal retrieval

5 结束语

针对开放大数据的安全高效利用问题,本文提出了大数据安全存储与检索系统。该系统支持非解密式存储密钥高效更新,满足非可信环境下密钥定期轮换需求,相比于传统解密重加密机制性能提高80%以上;同时支持文本、空间、图像等多模态数据的单类型和跨类型检索,综合性能损耗相比于现有明文数据库系统不超过25%。此外,该系统兼容现有大数据服务的技术架构,现有大数据平台可通过微服务增量部署完成安全加固,具有可扩展性、易用性和高效性,有效支持开放大数据的安全利用。
1
BONEH D,LEWI K,MONTGOMERY H,et al. Key homomorphic PRFs and their applications[C]//Proceedings of the Annual Cryptology Conference,2013:410-428.

2
BOYD C,DAVIES G T,GJØSTEEN K,et al. Fast and secure updatable encryption[C]// Proceedings of the Annual International Cryptology Conference,2020:464-493.

3
LEHMANN A,TACKMANN B. Updatable encryption with post-compromise security[C]// Proceedings of the Advances in Cryptology-EUROCRYPT 2018:37th Annual International Conference on the Theory and Applications of Cryptographic Techniques,2018:685-716.

4
BONEH D,ESKANDARIAN S,KIM S,et al. Improving speed and security in updatable encryption schemes[C]//Proceedings of Advances in Cryptology-ASIACRYPT 2020:26th International Conference on the Theory and Application of Cryptology and Information Security,2020:559-589.

5
SONG D X,WAGNER D,PERRIG A. Practical techniques for searches on encrypted data[C]//Proceeding of the 2000 IEEE Symposium on Security and Privacy. S&P 2000. IEEE,2000:44-55.

6
BONEH D,CRESCENZO G D,OSTROVSKY R,et al. Public key encryption with keyword search[J]. Eurocrypt 2004,2004.

7
GOLLE P,STADDON J,WATERS B. Secure conjunctive keyword search over encrypted data[C]//Proceeding of the Applied Cryptography and Network Security:Second International Conference,ACNS 2004,2004.

8
LI F, MA J, MIAO Y, et. al. A survey on searchable symmetric encryption[J]. ACM Computing Surveys, 2023, 56 (5): 1- 42.

9
LIANG Y, MA J, MIAO Y, et al. Privacy-preserving bloom filter-based keyword search over large encrypted cloud data[J]. IEEE Transactions on Computers, 2023, 72 (11): 3086- 3098.

DOI

10
WANG X, MA J, MIAO Y, et al. Privacy-preserving diverse keyword search and online pre-diagnosis in cloud computing[J]. IEEE Transactions on Services Computing, 2022, 15 (2): 710- 723.

DOI

11
WONG W,CHEUNG D,KAO B,et al. Secure kNN computation on encrypted databases[C]//Proceedings of the ACM SIGMOD International Conference on Management of Data,SIGMOD 2009,2009.

12
XU G, LI H, DAI Y, et al. Enabling efficient and geometric range query with access control over encrypted spatial data[J]. IEEE Transactions on Information Forensics and Security, 2018, 14 (4): 870- 885.

13
WANG F, ZHU H, HE G, et al. Efficient and privacy-preserving arbitrary polygon range query scheme over dynamic and time-series location data[J]. IEEE Transactions on Information Forensics and Security, 2023, 18, 3414- 3429.

DOI

14
GONG Z, LI J, LIN Y, et al. Efficient privacy-preserving geographic keyword boolean range query over encrypted spatial data[J]. IEEE Systems Journal, 2023, 17 (1): 455- 466.

DOI

15
WANG X, MA J, LIU X, et al. Forward/backward and content private DSSE for spatial keyword queries[J]. IEEE Transactions on Dependable and Secure Computing, 2023, 20 (4): 3358- 3370.

DOI

16
MIAO Y, YANG Y, LI X, et al. Efficient privacy-preserving spatial range query over outsourced encrypted data[J]. IEEE Transactions on Information Forensics and Security, 2023, 18, 3921- 3933.

DOI

17
TONG Q, MIAO Y, CHEN L, et al. VFIRM: Verifiable fine-grained encrypted image retrieval in multi-owner multi-user settings[J]. IEEE Transactions on Services Computing, 2022, 15 (6): 3606- 3619.

DOI

18
XIA Z, WANG L, TANG J, et al. A privacy-preserving image retrieval scheme using secure local binary pattern in cloud computing[J]. IEEE Transactions on Network Science and Engineering, 2021, 8 (1): 318- 330.

DOI

19
LI Y, MA J, MIAO Y, et al. DVREI: Dynamic verifiable retrieval over encrypted images[J]. IEEE Transactions on Computers, 2022, 71 (8): 1755- 1769.

20
YANG T, MA J, MIAO Y, et al. MU-TEIR: Traceable encrypted image retrieval in the multi-user setting[J]. IEEE Transactions on Services Computing, 2023, 16 (2): 1282- 1295.

DOI

21
DING G, GUO Y, ZHOU J, et al. Large-scale cross-modality search via collective matrix factorization hashing[J]. IEEE Transactions on Image Processing, 2016, 25 (11): 5427- 5440.

DOI

22
ZHU L, SONG J, YANG Z, et al. DAP 2 CMH: Deep adversarial privacy-preserving cross-modal hashing[J]. Neural Processing Letters, 2022, 54 (4): 2549- 2569.

DOI

23
HU S, ZHANG L, WANG Q, et al. Towards private and scalable cross-media retrieval[J]. IEEE Transactions on Dependable and Secure Computing, 2021, 18 (3): 1354- 1368.

24
GUO C, JIA J, JIE Y, et al. Enabling secure cross-modal retrieval over encrypted heterogeneous IoT databases with collective matrix factorization[J]. IEEE Internet of Things Journal, 2020, 7 (4): 3104- 3113.

DOI

25
POPA R,REDFIELD C,ZELDOVICH N,et al. CryptDB:Protecting confidentiality with encrypted query processing[C]//Proceedings of the Twenty-third ACM Symposium on Operating Systems Principles. 2011:85-100.

26
NAVEED M,KAMARA S,WRIGHT C. Inference attacks on property-preserving encrypted databases[C]//Proceedings of the 22nd ACM SIGSAC Conference on Computer and Communications Security. 2015:644-655.

27
PODDAR R,BOELTER T,POPA R A. Arx:An encrypted database using semantically secure encryption[J]. Proceedings of the VLDB Endowment,12(11):1664 - 1678.

28
KAMARA S,MOATAZ T. SQL on structurally-encrypted databases[C]//Proceedings of the Advances in Cryptology-ASIACRYPT,2018:149-180.

29
PRIEBE C,VASWANI K,COSTA M. EnclaveDB:A secure database using SGX[C]//Proceedings of the IEEE Symposium on Security and Privacy. S&P 2018. IEEE,2018:264-278.

30
ESKANDARIAN S,ZAHARIA M. ObliDB:Oblivious query processing for secure databases[J]. Proceedings of the VLDB Endowment,13(2):169-183.

31
ZHU J, CHENG K, LIU J, et al. Full Encryption: An end to end encryption mechanism in GaussDB[J]. Proceedings of the VLDB Endowment, 2021, 14 (12): 2811- 2814.

DOI

32
CAO W,ZHANG Y,YANG X,et al. Polardb serverless:A cloud native database for disaggregated data centers[C]//Proceedings of the 2021 International Conference on Management of Data. 2021:2477-2489.

33
ANTONOPOULOS P,ARASU A,SINGH K D,et al. Azure SQL database always encrypted[C]//Proceedings of the 2020 ACM SIGMOD International Conference on Management of Data. 2020:1511-1525.

34
DAUTERMAN E,RATHEE M,POPA R A,et al. Waldo:A private time-series database from function secret sharing[C]// Proceedings of the 2022 IEEE Symposium on Security and Privacy,S&P 2022. IEEE,2022:2450-2468.

35
LI R,WANG P,ZHU J,et al. Building fast and compact sketches for approximately multi-set multi-membership querying[C]//Proceedings of the 2021 International Conference on Management of Data. SIGMOD 2021,2021:1077-1089.

36
LAI S,PATRANABIS S,SAKZAD A,et al. Result pattern hiding searchable encryption for conjunctive queries[C]//Proceedings of the 2018 ACM SIGSAC Conference on Computer and Communications Security. CCS 2018,2018:745-762.

37
SAGAN H. Space-filling curves[J].Springer-Verlag GmbH, 2014, 12(8):133–135.

38
LIU A, CHEN F. Privacy preserving collaborative enforcement of firewall policies in virtual private networks[J]. IEEE Transactions on Parallel and Distributed Systems, 2011, 22 (5): 887- 895.

DOI

39
JIN C,LI C,WANG Z,et al. Sketch-based image retrieval with a novel bovw representation[C]// Proceeding of the International Conference on Multimedia Modeling. Springer,2016:621-631.

40
SANTOS J, MOURA E, SILVA A, et al. Color and texture applied to a signature-based bag of visual words method for image retrieval[J]. Multimedia Tools and Applications, 2017, 76 (15): 16855- 16872.

DOI

41
GUO S,XU J,ZHANG C,et al. Imageproof:Enabling authentication for large-scale image retrieval[C]//Proceedings of the 2019 IEEE 35th International Conference on Data Engineering,ICDE 2019. IEEE,2019:1070-1081.

42
LIU S,QIAN S,GUAN Y,et al. Jointmodal distribution-based similarity hashing for largescale unsupervised deep cross-modal retrieval[C]//Proceeding of the 43rd International ACM SIGIR Conference on Research and Development in Information Retrieval,2020:1379-1388.

43
CHEON J,KIM D,KIM D,et al. Lattice-based secure biometric authentication for hamming distance[C]//Proceeding of the Information Security and Privacy:26th Australasian Conference,ACISP 2021,Virtual Event. Springer,2021:653-672.

文章导航

/