支持海量医疗数据语义搜索的可验证可搜索加密方案

  • 张经伟 , 1, * ,
  • 孙飒 1 ,
  • 杨帅 1 ,
  • 吴颖 1 ,
  • 张晓均 2
展开
  • 1. 中国电子科技集团公司第三十研究所,成都 610041
  • 2. 西南石油大学计算机与软件学院,成都 610500
张经伟()。

网络出版日期: 2026-06-29

基金资助

国家自然科学基金资助项目(61902327);四川省自然科学基金面上项目(2025ZNSFSC0495)

版权

版权所有©《网络空间安全科学学报》编辑部 2026

Verifiable searchable encryption scheme that supports semantic search over massive medical data

  • Zhang Jingwei , 1, * ,
  • Sun Sa 1 ,
  • Yang Shuai 1 ,
  • Wu Ying 1 ,
  • Zhang Xiaojun 2
Expand
  • 1. No.30 Institute of CETC, Chengdu 610041, China
  • 2. School of Computer Science and Software Engineering, Southwest Petroleum University, Chengdu 610500, China

Online published: 2026-06-29

Copyright

Copyright ©2026 Journal of Aeronautical Materials. All rights reserved.

摘要

随着云计算和医疗物联网的快速发展和广泛应用,海量医疗数据成为医疗领域的核心战略资源,云存储为其管理提供支撑的同时,带来了隐私保护与高效检索的双重挑战。现有可搜索加密方案存在海量数据检索效率低、缺乏语义关联、结果不可验证等问题,难以适配医疗数据的检索需求。本文提出支持海量医疗数据语义搜索的可验证可搜索加密方案。方案设计“粗匹配+精排序”二级检索架构,基于局部敏感哈希函数实现海量高维语义向量的快速粗匹配,设计隐私保护欧氏距离比较机制实现密文域内精准排序。方案设计公钥加密-私钥验证的批量验证机制,实现检索结果的正确性验证。通过改进矩阵型LWE(Learning With Errors)加密模式构建全流程密文域交互机制,实现医疗数据特征在抗量子环境下的机密特性,保障多主体协同下医疗数据与检索意图的隐私安全。性能分析与实验仿真表明,方案在100万数据量的搜索计算耗时不超过25秒,远低于其他线性扫描式的检索方案;在通信开销上,相较于其他同样支持向量检索的方案降低了50%,具备突出的性能优势,可有效适配海量医疗数据的隐私保护检索需求。

本文引用格式

张经伟 , 孙飒 , 杨帅 , 吴颖 , 张晓均 . 支持海量医疗数据语义搜索的可验证可搜索加密方案[J]. 网络空间安全科学学报, 2026 . DOI: 10.20172/j.issn.2097-3136.260536

Abstract

With the rapid development and wide application of cloud computing and the medical Internet of Things, massive medical data have become the core strategic resource in the medical field. While cloud storage supports the management of such data, it also brings the challenges of privacy protection and efficient retrieval. Existing searchable encryption schemes suffer from low retrieval efficiency over massive data, lack of semantic relevance, and unverifiable results, making it difficult to adapt to the retrieval requirements of medical data. This paper proposes a verifiable searchable encryption scheme that supports semantic search over massive medical data. The scheme designs a two-stage retrieval architecture of “coarse matching + fine ranking”. Fast coarse matching of massive high-dimensional semantic vectors is achieved based on locality-sensitive hashing, and accurate sorting in the ciphertext domain is achieved by designing privacy-preserving Euclidean distance comparison mechanism. A batch verification mechanism with public-key encryption and private-key verification is constructed to verify the correctness of retrieval results. Meanwhile, an improved matrix-based Learning with Errors (LWE) encryption mode is exploited to build a full-process ciphertext-domain interaction mechanism, which realizes the confidentiality of medical data features in a quantum-resistant environment, and guarantees the privacy security of medical data and retrieval intentions under multi-subject collaboration. Performance analysis and experimental simulations demonstrate the search computation time of the scheme is no more than 25 seconds for one million data items, which is much lower than existing linear-scan retrieval schemes. In terms of communication overhead, it is reduced by 50% compared with other schemes supporting vector retrieval. The proposed scheme has outstanding performance advantages and can effectively satisfy the privacy-preserving retrieval requirements of massive medical data.

0 引言

随着云计算、医疗物联网(IoMT)与人工智能技术的深度融合发展,电子健康记录(EHR)、医学影像、多模态诊疗数据等医疗数据呈爆炸式增长,已成为临床诊断、疾病研究与跨机构医疗协同的核心战略资源[1-3]。医疗数据的规模化积累不仅为精准医疗提供了丰富的数据支撑,催生了强烈的跨场景检索需求,例如不同医院间的病历互通、医学研究机构对特定病症数据的批量筛选等[4-5]。同时云计算技术为海量医疗数据的存储和检索计算提供了有效的保障。
但云存储的第三方托管特性带来了严峻的隐私保护挑战:医疗数据蕴含患者身份、病理特征等敏感信息,直接上传明文数据易导致隐私泄露与医疗纠纷[6-8]。而传统加密技术虽能保障数据存储安全,却会使数据丧失可检索性,用户无法从加密数据中快速获取目标信息,严重制约医疗数据的实用价值[9]。为平衡数据安全性与检索可用性,可搜索加密应运而生,允许用户在密文状态下执行检索操作,成为云存储环境下医疗数据共享的关键支撑技术[10]
海量医疗数据与复杂检索需求进一步暴露了现有方案的短板。一方面,海量数据场景下,传统检索算法即使结合可搜索加密,也面临检索效率低下的问题。面对千万级甚至亿级医疗数据,线性扫描式的检索方式难以满足临床诊疗与研究的实时性需求[11]。另一方面,传统可搜索加密多基于关键词匹配实现,仅能完成精确字符对应检索,缺乏语义关联性支持,例如无法通过 “肺部感染相关病症”检索到包含“肺炎”“肺实变”“胸腔积液”等语义相关的病历,灵活性不足且检索精度有限[12]
人工智能技术的进步为解决这类问题提供了新路径。通过自然语言处理、计算机视觉等技术,可从医疗文本、影像中提取高维语义向量,实现语义级别的相似性检索,大幅提升检索的灵活性与精准度[13-16]。但高维语义向量的检索效率与加密状态下的隐私保护形成了新的矛盾-直接存储或传输明文语义向量会导致患者隐私泄露,而传统加密方式会破坏向量的语义关联性,使检索功能失效。此外,云端服务器存在信任不足风险,使检索结果的可信度难以保障,恶意服务器可能为节省计算资源返回不完整或虚假结果,直接威胁医疗决策的安全性[17]
针对上述挑战,本文融合MiniLM模型进行语义向量提取、基于局部敏感哈希(LSH)[18]、具有隐私保护的欧氏距离比较技术[19]与双线性对技术,设计可验证的云端医疗数据语义级可搜索加密方案。其中,局部敏感哈希(LSH)能够将高维语义向量高效映射至低维汉明空间,生成的语义向量哈希函数值会通过数据使用方的公钥加密后再上传至云端,在不泄露向量特征信息的前提下,支撑海量数据中语义相似向量的快速初步检索与粗匹配。方案采用具有隐私保护的欧氏距离比较技术,可对初步检索的结果,在密文域内的语义相似度进行精准排序,保障多用户协同场景下的隐私安全。本文的主要贡献如下:
(1)检索结果可验证:基于双线性对技术设计公钥加密-私钥验证的批量验证机制,由各数据提供方利用数据使用方的公钥,对本地加密医疗数据和语义向量的哈希值进行加密处理生成验证凭证,云端聚合所有验证凭证后反馈给数据使用方。数据使用方调用自身私钥,对聚合值、检索的语义向量哈希值执行批量验证算法,快速验证检索结果的正确性,解决了云端医疗数据检索中“结果不可信”的核心痛点,保障检索过程的可审计性。
(2)基于语义的检索:引入人工智能语义向量提取技术,将非结构化医疗数据转化为能够精准表征数据语义的高维向量,突破了传统关键词检索“语义脱节”的局限,实现医疗数据的语义级检索。同时,结合隐私保护的欧氏距离比较技术,在不泄露数据提供方原始医疗数据、数据使用方检索意图的前提下,完成密文域内的语义向量相似度排序,精准匹配最相似的数据,兼顾了检索语义性与数据隐私性。
(3)海量数据的快速检索:提出“粗匹配+精排序”二级检索架构,依托局部敏感哈希(LSH)技术将海量高维医疗语义向量高效映射至低维汉明空间,生成的向量哈希函数值经数据使用方公钥加密后上传云端,构建动态聚合索引结构。基于该索引,可在密文状态下快速完成语义相似向量的初步粗匹配,既大幅过滤无关数据、降低检索开销,又避免向量特征信息泄露。后续通过隐私保护欧氏距离比较技术,在密文域对粗匹配结果进行语义相似度的精准排序,实现“高效检索”与“精准匹配”的兼顾,解决了海量高维医疗数据检索效率低下的难题。
(4)多主体协同下的隐私安全防护:针对多数据提供方与单数据使用方的协同架构,融合在抗量子环境下具有隐私保护的欧氏距离比较技术,构建全流程密文域交互机制。方案既防止数据提供方的原始医疗数据在云端存储、检索过程中泄露,也避免数据使用方的检索意图被云端窃取,同时规避多主体协同过程中的数据篡改风险,实现“数据可搜不可见”。

1 相关工作

可搜索加密自Song等[20]首次提出以来,已形成对称可搜索加密与公钥可搜索加密两类技术。面向医疗数据的敏感特性与多用户共享需求,现有研究通常将可搜索加密与访问控制技术结合,以实现细粒度权限管控。Xu等[21]将密文策略属性基加密(CP-ABE)与智能合约结合,设计了隐私保护医疗数据共享方案,通过简化双线性配对运算降低执行开销,能够抵抗选择明文攻击,但方案仅支持传统关键字检索,未考虑高维语义向量与海量数据的高效检索问题。Yang等[22]融合代理重加密与区块链技术实现电子病历共享,将索引上链以保证检索过程可追溯,然而该方案仅完成关键字匹配,不支持密文域相似度计算与检索结果可验证。Chen等[23]采用布隆过滤器和安全内积技术实现多关键词的模糊匹配,但无法支持特征向量的密文检索。Wang等[24]利用隐私保护的欧氏距离比较技术,实现了医疗特征向量的密文检索,在隐私防护上具有一定优势,但该方案采用“逐个比对”的检索模式,需将检索特征向量与全局特征向量逐一计算欧氏距离并排序,检索开销随数据量呈线性增长,难以适配大规模医疗数据的实时检索需求。
针对海量高维数据检索效率瓶颈,局部敏感哈希(LSH)被广泛用于近似最近邻搜索,能够在保留数据相似性的前提下完成快速粗匹配。Gu等[15]基于图增强哈希网络实现多模态医疗数据的精准检索,但仅在明文域开展工作,未考虑隐私保护与密文检索需求。Liao等[25]利用LSH构建分布式索引提升云端图像检索效率,同样未提供加密保护机制,无法直接用于医疗敏感数据的安全检索。上述工作验证了LSH在高维数据检索中的有效性,但均未将哈希索引与公钥加密结合,无法保证粗匹配阶段向量特征的隐私安全。在密文计算方面,同态加密支持在不解密条件下完成数值运算。CKKS近似同态加密因其在向量运算上的优势,逐渐用于医疗数据密文分析[26],但不支持检索功能与结果验证。Yuan等[19]基于LWE困难问题设计隐私保护聚类算法,可对密文医疗数据进行分布式处理,但现有工作多面向单用户场景,未与语义检索、二级检索架构相结合,也未实现多用户协同环境下的检索意图保护与结果可验证。
双线性对是构造公钥可搜索加密与可验证机制的关键密码学工具。Boneh等[27]首次基于双线性对提出可搜索加密方案,为密文检索提供了基础范式,但未设计验证机制。Liu等[28]结合双线性对和聚合签名技术,实现多所有者场景下的可搜索加密,并能够高效验证检索结果的正确性。区块链与智能合约为检索结果可验证提供了新途径。Rahman等[29]将检索索引存储在区块链上,利用智能合约保证检索过程公开可信,能够抵御云端恶意行为,但未支持密文域相似度计算等复杂操作。Gao等[30]提出云边协同的细粒度可搜索加密方案,在降低终端计算压力的同时实现权限管控,却未融合LSH等高效索引结构,无法支撑高维医疗语义数据的快速检索。
上述相关工作虽在医疗数据可搜索加密、高效检索、可验证机制等方面取得了一定进展,但均未同时解决“海量数据检索效率低、语义检索缺失、检索结果不可验证、多主体协同隐私保护不足”四大核心痛点。

2 预备知识

2.1 局部敏感哈希

设置局部敏感哈希LSH是一种特殊的hash函数,它使得2个相似度很高的向量以较高的概率映射成同一个hash值,而令2个相似度很低的向量以极低的概率映射成同一个hash值。现广泛应用于高效处理海量高维数据的最近邻问题。
$ \chi $为数据空间,$ S $为向量相似性度量。LSH函数需满足以下性质:
对任意两个点 $ {\gamma }_{1},{\gamma }_{2}\in \chi $,存在概率函数$ P(\cdot ) $ 使得:
$ \Pr [lsh({\gamma }_{1})=lsh({\gamma }_{2})]=P(S({\gamma }_{1},{\gamma }_{2})) $
其中$ P(\cdot ) $单调:若$ S({\gamma }_{1},{\gamma }_{2}) $增大,则碰撞概率$ P $增大。

2.2 双线性对

$ G $$ {G}_{T} $为两个阶为素数p的循环群, $ e\colon G\times G\rightarrow {G}_{T} $为双线性映射,其中双线性映射e满足如下条件。
1) 双线性:对于任意两个元素$ \forall {g}_{1},{g}_{2}\in G $$ \forall a,b\in {Z}_{p} $,有$ e({g}_{1}{}^{a},{g}_{2}{}^{b})=e{({{g}_{1}},{{g}_{2}})}^{ab} $
2) 非退化性:存在两个元素$ \forall {g}_{1},{g}_{2}\in G $,使得$ e({g}_{1},{g}_{2})\neq 1\in {G}_{T} $
3)可计算性:$ \forall {g}_{1},{g}_{2}\in G $,对任何输入都能有效计算$ e({g}_{1},{g}_{2}) $

2.3 MiniLM模型

MiniLM是基于知识蒸馏得到的轻量化预训练Transformer编码器,通过从大型预训练语言模型中迁移知识,在显著降低模型参数量与计算开销的同时,保留大模型的语义表达能力。该模型开源且易于部署,可广泛应用于文本理解、语义匹配、语义向量生成等任务。本文主要利用MiniLM实现文本语义向量的提取功能。由于本文核心聚焦于可搜索加密的设计与优化,因此不对MiniLM模型的结构细节、微调方法和训练过程展开深入阐述。

3 方案定义和安全模型

3.1 系统模型

图 1 系统模型

Fig.1 System model

医院(DO):医院作为数据拥有者,主要负责采集、脱敏并整理患者临床诊疗数据;在本地通过MiniLM等机器学习模型,将非结构化医疗文本转化为高维语义向量;随后采用本文设计的可搜索加密方案对语义向量进行加密处理,最终将加密后的语义向量、加密医疗数据上传至云平台。
云平台(CS):云平台具备海量数据存储与并行计算能力,主要存储各医院提交的加密医疗数据与语义向量;同时接收医疗研究机构发起的语义检索请求,在完全密文状态下执行相似度匹配与结果排序等操作,并将加密检索结果和聚合的待验证数据返回给医疗研究机构。
医疗研究机构(DU):医疗研究机构作为数据使用者,根据具体研究需求构造检索语句,在本地生成对应的查询语义向量;通过本文设计的陷门生成算法得到安全检索陷门后,提交至云平台发起检索请求;在收到加密检索结果后,利用自身私钥完成结果的完整性验证,基于脱敏后的医疗数据开展跨机构联合分析与科学研究工作。
可信中心(TA):负责产生整个系统所需的密码安全参数, 并为各个通信实体计算公私钥对, 最后发布需要公开的参数、MiniLM模型、局部敏感哈希函数。

3.2 方案框架

本文方案由系统初始化、密钥生成、数据加密、索引构建、陷门生成、语义数据检索和结果验证七个算法构成,具体描述如下。
系统初始化$ Setup(\lambda )\rightarrow params $:输入安全参数$ \lambda $,输出全局参数$ params $
密钥生成$ KeyGen(params)\rightarrow $ $ (sk,pk,\{{M}_{i}\},\{{M}_{i}{}^{\prime}\}) $:输入全局参数,输出医疗研究机构的私钥$ sk $、公钥$ pk $、所有医院的加密密钥集合$ \{{M}_{i}|i=1,2,\cdots ,n\} $和密钥派生因子集合$ \{{M}_{i}{}^{\prime}|i=1,2\cdots ,n\} $
数据加密$ DataEnc(pk,{M}_{i},{\overrightarrow{vec}}_{i},c{f}_{i})\rightarrow $ $ ({\sigma }_{i},c{t}_{i}) $:输入医疗研究机构的公钥$ pk $、医院的加密密钥$ {M}_{i} $、医疗数据的语义特征向量$ {\overrightarrow{vec}}_{i} $和医疗数据密文$ c{f}_{i} $,输出可验证检索哈希密文$ {\sigma }_{i} $和语义特征向量密文$ c{t}_{i} $
索引构建$ InxBuild({\sigma }_{i},c{t}_{i},{M}_{i}{}^{\prime})\rightarrow $ $ (K,V) $:输入可验证检索哈希密文$ {\sigma }_{i} $、语义特征向量密文$ c{t}_{i} $和密钥派生因子$ {M}_{i}{}^{\prime} $,输出索引结构的键集合$ K $和值集合$ V $
陷门生成$ Trapdoor({\overrightarrow{vec}}_{nl},sk,pk)\rightarrow {T}_{nl} $:输入检索文本$ nl $的语义特征向量$ {\overrightarrow{vec}}_{nl} $、医疗研究机构的私钥$ sk $和公钥$ pk $,输出$ nl $的陷门$ {T}_{nl} $
语义检索$ search({T}_{nl},K,V)\rightarrow R $:输入检索陷门$ {T}_{nl} $、索引结构的键集合$ K $和值集合$ V $,输出包含密文结果和证明信息(由相关可验证检索哈希密文聚合)的检索结果$ R $
结果验证$ verify({\overrightarrow{vec}}_{nl},sk,R)\rightarrow 0||1 $:输入检索语义特征向量$ {\overrightarrow{vec}}_{nl} $,医疗研究机构的私钥$ sk $和检索结果$ R $,输出0或1。

3.3 方案设计目标

在本方案中,云平台(CS)被定义为“好奇且存在结果伪造行为的服务器”:即云平台(CS)在多数场景下会严格遵循既定协议来提供检索服务,但为节省本地计算资源、降低检索运算开销,可能恶意返回虚假的检索结果;同时它可能会分析存储的加密数据或接收到的陷门。医院(DO)和医疗研究机构(DU)被认为是诚实的,并且不会与云平台(CS)“勾结”。根据云服务器所提供的功能,主要考虑以下两种威胁模型:
检索结果伪造攻击:敌手在语义检索过程中,试图通过伪造验证证明绕过结果验证算法,向用户返回虚假结果集,从而破坏检索服务的正确性与可用性。
选择明文攻击:敌手可任意选择明文查询向量并获取对应的查询陷门;可任意选择医疗数据,生成对应的语义向量和局部敏感哈希值并得到语义向量和哈希值的密文。敌手会依据上述收集到的明密文对应信息,对加密数据、查询陷门进行深度分析,试图挖掘明密文之间的映射关系,进而恢复未授权的医疗数据信息、推测加密密钥,最终实现对医疗隐私信息的窃取。
为高效安全地部署在医疗智慧系统,本方案需要满足以下设计目标:
(1)隐私保护。可抵御选择明文攻击,确保加密后的医疗语义向量、哈希值以及查询陷门在云端存储、传输和检索全过程中,不会被云平台(CS)通过明密文关联分析挖掘出原始数据信息、查询意图(此处查询意图指的是查询请求的原始语义向量)及密钥,实现医疗隐私数据“可搜不可见”。
(2)正确性与抗伪造特性。能够有效防范检索结果伪造攻击,通过设计可靠的结果验证机制,让医疗研究机构(DU)可快速校验云端返回检索结果的真实性,杜绝云平台(CS)因节省计算开销而返回虚假结果的行为,确保检索服务的正确性和可用性。
(3)性能高效。在满足隐私保护、抗攻击需求的前提下,优化检索与加密解密流程,控制计算开销和传输延迟,确保方案适配海量高维医疗数据的检索场景,实现敏感加密数据的快速检索。

3.4 安全模型

在海量医疗数据的密文检索中,为提升检索效率,方案不可避免地会向云平台(CS)泄露部分非敏感的统计特征。为了严谨评估方案的安全性,本文首先定义检索过程中云平台可见的泄露函数$ \mathcal{L} $,随后基于此定义,分别构建针对底层特征加密、哈希加密以及结果验证的三个形式化安全游戏
(1)泄露函数定义
本方案的泄露函数形式化定义为$ \mathcal{L}=(\mathcal{L}\mathcal{P}, \mathcal{S}\mathcal{P},\mathcal{A}\mathcal{P}) $,其中:
LSH 桶匹配泄露($ \mathcal{L}\mathcal{P} $,LSH Pattern):可观察任意两次查询是否落入同一个LSH哈希桶,仅泄露查询间的桶归属匹配关系,不泄露桶编号、哈希值明文及向量语义。
候选集规模泄露($ \mathcal{C}\mathcal{P} $,Candidate Size Pattern):可观察每次查询检索得到的粗匹配候选集合的元素数量规模,仅泄露集合大小,不泄露候选集内部具体元素与语义信息。
排序结果泄露($ \mathcal{R}\mathcal{P} $,Ranking Pattern):可观察查询返回候选集合的最终排序结果序列,仅泄露元素相对排序次序,不泄露元素明文语义与真实距离。
(2)选择明文攻击下的单向性游戏
针对语义向量的加密机制,敌手$ \mathcal{A} $与挑战者$ \mathcal{C} $之间的OW-CPA游戏:
初始化阶段:挑战者$ \mathcal{C} $选择参数$ \lambda $并运行$ Setup $算法和$ KeyGen $算法生成系统参数、私钥$ sk $和公钥$ pk $。将$ pk $传递给敌手$ \mathcal{A} $
查询阶段:攻击者$ \mathcal{A} $可以自适应提交向量$ \overrightarrow{v} $,挑战者$ \mathcal{C} $计算对应密文$ ct $发送给$ \mathcal{A} $
挑战阶段:挑战者$ \mathcal{C} $从局部敏感哈希函数的值域空间中均匀随机选取一个哈希值$ {\overrightarrow{v}}^{*} $,计算其密文$ c{t}^{*} $发送给$ \mathcal{A} $
猜测阶段:敌手$ \mathcal{A} $输出一个一个猜测的哈希值$ {\overrightarrow{v}}^{\prime} $,若$ {\overrightarrow{v}}^{*}={\overrightarrow{v}}^{\prime} $则敌手$ \mathcal{A} $获胜。
假设敌手$ \mathcal{A} $获胜的概率为$ \Pr [{\overrightarrow{v}}^{*}={\overrightarrow{v}}^{\prime}] $,则敌手$ \mathcal{A} $的优势$ Adv_{\mathcal{A}}^{OW-CPA}=\Pr [{\overrightarrow{v}}^{*}={\overrightarrow{v}}^{\prime}] $
若攻击者$ \mathcal{A} $不能够在概率多项式时间内以不可忽略的优势$ Adv_{\mathcal{A}}^{OW-CPA} $赢得上述安全游戏,说明方案在选择明文攻击下是安全的。
(3)选择明文攻击下的不可区分性游戏
针对语义向量哈希值加密,定义敌手$ \mathcal{A} $与挑战者$ \mathcal{C} $之间的IND-CPA游戏:
初始化阶段:挑战者$ \mathcal{C} $选择参数$ \lambda $并运行$ Setup $算法和$ KeyGen $算法生成系统参数、私钥$ sk $、公钥$ pk $。然后将$ pk $和密钥派生因子传递给敌手$ \mathcal{A} $
阶段1:攻击者$ \mathcal{A} $可以自适应提交明文,挑战者$ \mathcal{C} $执行加密算法$ DataEnc $生成对应密文发送给$ \mathcal{A} $
挑战阶段:攻击者$ \mathcal{A} $随机生成2个内容不同的明文$ {u}_{1} $$ {u}_{2} $,并将他们发送给挑战者$ \mathcal{C} $。挑战者随机选取比特$ y\in \{0,1\} $,通过执行$ DataEnc $算法生成$ {u}_{y} $的密文$ {\sigma }_{y} $,并将其发送给敌手$ \mathcal{A} $
阶段2:$ \mathcal{A} $继续进行阶段1的查询。
猜测阶段:敌手$ \mathcal{A} $输出对比特$ y $的猜测结果$ {y}^{*} $,若$ {y}^{*}=y $则敌手$ \mathcal{A} $获胜。
假设敌手$ \mathcal{A} $获胜的概率为$ \Pr [{y}^{*}=y] $,则敌手$ \mathcal{A} $的优势为$ Adv_{\mathcal{A}}^{IND-CPA}=\left| \Pr [{y}^{*}=y]-\frac{1}{2}\right| $,若攻击者$ \mathcal{A} $不能够在概率多项式时间内以不可忽略的优势$ Adv_{\mathcal{A}}^{IND-CPA} $赢得上述安全游戏,说明方案满足CPA。
(4)可靠性安全游戏
对于检索结果伪造攻击,安全模型有挑战者$ \mathcal{C} $和敌手$ \mathcal{A} $这2个角色。安全模型的定义如下。
初始化阶段:挑战者$ \mathcal{C} $选择参数$ \lambda $并运行$ Setup $算法和$ KeyGen $算法生成系统参数私钥$ sk $和公钥$ pk $。然后挑战者$ \mathcal{C} $$ pk $传递给敌手A。
查询阶段:敌手$ \mathcal{A} $反复向挑战者$ \mathcal{C} $发起合法检索查询,挑战者$ \mathcal{C} $执行陷门生成算法$ Trapdoor $、语义检索算法$ search $返回真实的检索结果$ R $和陷门$ T $供敌手$ \mathcal{A} $观察。
伪造阶段:挑战者$ \mathcal{C} $计算陷门$ {T}^{\prime} $发送给敌手$ \mathcal{A} $,敌手$ \mathcal{A} $根据陷门$ {T}^{\prime} $构造伪造检索结果$ {R}^{*} $发送给挑战者$ \mathcal{C} $进行验证,若$ {R}^{*} $通过验证算法$ verify=1 $则敌手$ \mathcal{A} $获胜。
假设敌手$ \mathcal{A} $获胜的概率为$ \Pr [verify=1] $,则敌手$ \mathcal{A} $的优势$ Adv_{\mathcal{A}}^{RFA}=\left| \Pr [verify=1]\right| $,若攻击者$ \mathcal{A} $不能够在概率多项式时间内以不可忽略的优势$ Adv_{\mathcal{A}}^{RFA} $赢得上述安全游戏,说明方案满足检索结果不可伪造性。

4 方案设计

本方案中,医疗文本的语义特征向量由MiniLM模型生成。MiniLM作为预训练语言模型,能够基于上下文生成具有强语义关联的动态词向量与句向量,可精准表征医疗文本的深层语义信息;同时,MiniLM提供大量开源预训练模型,支持直接调用或在医疗语料上进行微调适配。

4.1 系统初始化与密钥生成

在系统初始化阶段,TA执行$ Setup $算法。TA基于安全参数$ \lambda $,设置双线性对映射$ e\colon {G}_{1}\times {G}_{1}\rightarrow {G}_{2} $,其中$ {G}_{1},{G}_{2} $$ p $阶乘法循环群。然后选取$ {G}_{1} $的生成元$ g $,随机选取$ 2m\times 2m $阶的可逆矩阵$ M $$ m $为偶数。选取足够大的整数$ \varepsilon \in {\mathbb{Z}}_{q} $作为加密公共参数,$ q\gg p $。设置抗碰撞的哈希函数$ h\colon {\{0,1\}}^{*}\rightarrow Z_{p}^{*} $,局部敏感哈希函数lsh和语义向量提取模型MiniLM。
在密钥生成阶段,TA执行$ KeyGen $算法。获取随机数$ s\in Z_{p}^{*} $组成DU私钥$ sk=(s{k}_{1},s{k}_{2})=({M}^{-1},s) $,计算$ x=g_{}^{s} $,得到DU公钥$ pk=(p,{G}_{1},{G}_{2},e,g,x) $。对于每个医院$ D{O}_{i}(i=1,2,\cdots ,n) $,TA随机选取$ 2m\times 2m $阶的可逆矩阵$ {M}_{i} $作为加密密钥,计算$ {M}_{i}{}^{\prime}={M}_{i}{}^{-1}M $作为医疗云服务器的密钥派生因子。
最后,TA通过安全信道将私钥$ sk $发送给DU,将加密密钥$ {M}_{i} $发送给对应DOi,将密钥派生因子集合$ \{{M}_{1}{}^{\prime},{M}_{2}{}^{\prime},\cdots ,{M}_{n}{}^{\prime}\} $发送给CS。TA公布公开参数集合$ param(\varepsilon ,h,lsh,q,MiniLM) $和DU公钥$ pk $

4.2 数据加密

在数据加密阶段,医院$ D{O}_{i} $执行$ DataEnc $算法。使用MiniLM模型对临床数据$ f $计算特征向量$ {\overrightarrow{vec}}_{i}=\{{d}_{i,1},{d}_{i,2}\cdots ,{d}_{i,m}\} $并按比例将所有分量化为整数,使用对称加密算法(如AES)计算$ f $的密文数据$ c{f}_{i} $,然后执行以下操作:
1)使用局部敏感哈希函数计算向量的哈希值$ {u}_{i}=lsh({\overrightarrow{vec}}_{i}) $。使用医疗研究机构的公钥加密计算$ {\sigma }_{i}=({\sigma }_{i,1},{\sigma }_{i,2},{\sigma }_{i,3}) $,$ {\sigma }_{i,1}={x}^{{{u}_{i}}}g_{}^{h(c{f}_{i})+{r}_{i}} $,$ {\sigma }_{i,2}={x}^{h(c{{f}_{i}})+{{r}_{i}}},{\sigma }_{i,3}={x}^{{{r}_{i}}} $。其中$ r{}_{i} $为随机数。
2)选取随机数$ {\beta }_{1},{\beta }_{2},\cdots ,{\beta }_{m-2}\in {\mathbb{Z}}_{p} $满足$ {\beta}_{{{2j-1}}}+ {\beta}_{{{2j}}}=0,j=1,2,\cdots ,\dfrac{m-2}{2} $,计算待上传云服务器ID的哈希函数值$ H=h(C{S}_{ID}) $,将向量$ {\overrightarrow{vec}}_{i} $扩展为2m维$ {\overrightarrow{vec}}_{i}{}^{\prime}=\{{d}_{i,1},{d}_{i,2},\cdots ,{d}_{i,m},-\dfrac{1}{2}\displaystyle\sum \limits_{j=0}^{m}d_{i,j}^{2},H,{\beta }_{1},{\beta }_{2},\cdots ,{\beta }_{m-2}\} $,然后$ D{O}_{i} $使用加密密钥$ {M}_{i} $$ {\overrightarrow{vec}}_{i}{}^{\prime} $计算密文$ c{t}_{i}=(\varepsilon {\overrightarrow{vec}}_{i}{}^{\prime}+ {\overrightarrow{\gamma }}_{i})\times {M}_{i} $,其中$ {\overrightarrow{\gamma }}_{i}\in \mathbb{Z}_{p}^{2m} $是随机生成的误差向量,符合离散高斯噪声分布,满足$ q\gg p\gg 2|\max ({\overrightarrow{\gamma }}_{i})| $$ \left| \max ({\overrightarrow{\gamma }}_{i})\right| $表示向量$ {\overrightarrow{\gamma }}_{i} $中元素绝对值的最大值。
3)最后$ D{O}_{i} $$ ({\sigma }_{i},c{t}_{i},c{f}_{i}) $上传至云服务器CS。

4.3 索引构建

索引构建阶段,云服务器CS执行$ InxBuild $算法。CS先从密钥派生因子集合$ \{{{{M}^{\prime}}}_{1},{{{M}^{\prime}}}_{2},\cdots ,{{{M}^{\prime}}}_{n}\} $中检索与数据所有者$ D{O}_{i} $对应的密钥派生因子$ {M}_{i}{}^{\prime} $,并计算更新后的密文分量$ c{t}_{i}{}^{\prime}=c{t}_{i}\times {M}_{i}{}^{\prime} $
随后CS 维护动态聚合索引结构$ \varUpsilon=(K,V) $,见图2,其中:$ K=\{{k}_{1},{k}_{2},\cdots ,{k}_{l}\} $,满足 $ {k}_{t}={\sigma }_{{{t}_{1}}} $$ V=\{{v}_{1}, {v}_{2},\cdots ,{v}_{l}\} $,每个$ {v}_{t}=\{({\sigma }_{{{t}_{j}}},c{t}_{{{t}_{j}}}{}^{\prime},c{f}_{{{t}_{j}}})|j=1,2,\cdots ,N\} $是密文三元组的集合,且所有三元组对应相同的局部敏感哈希值$ {u}_{t} $
图 2 索引结构和二级检索架构图

Fig.2 Index Structure and Secondary Retrieval Architecture

当CS接收到新的密文相关参数$ ({\sigma }_{i},c{t}_{i}{}^{\prime},c{f}_{i}) $ 时,执行以下操作:
对每个$ t=\{1,2,\cdots ,l\} $,验证等式:
$ e({\sigma }_{i,1},x)e({\sigma }_{{{t}_{1}},2},g)=e({\sigma }_{{{t}_{1}},1},x)e({\sigma }_{i,2},g) $
该等式成立当且仅当$ {\sigma }_{i} $$ {k}_{t} $对应相同的局部敏感哈希值,即$ {u}_{i}={u}_{t} $。若存在t使等式成立,则将$ ({\sigma }_{i},c{t}_{i}{}^{\prime},c{f}_{i}) $加入$ {v}_{t} $;否则,新增键$ {k}_{l+1}={\sigma }_{i,1} $和值$ {v}_{l+1}=\{({\sigma }_{i},c{t}_{i}{}^{\prime},c{f}_{i})\} $,并更新$ {\varUpsilon} $

4.4 陷门生成

陷门生成阶段,医疗研究机构DU执行$ Trapdoor $算法。DU用自然语言描述研究需求,形成需求文本$ nl $,然后使用MiniLM模型,得到$ nl $的特征向量$ {\overrightarrow{vec}}_{nl}=\{{z}_{1},{z}_{2},\cdots ,{z}_{m}\} $
使用局部敏感哈希函数计算向量的哈希值$ {u}^{\prime}=lsh({\overrightarrow{vec}}_{nl}) $。然后使用自己的公钥加密计算$ {\sigma }_{nl}=({\sigma }_{nl,1},{\sigma }_{nl,2},{\sigma }_{nl,3}) $
选取随机数$ {\omega }_{1},{\omega }_{2},\cdots ,{\omega }_{m-1} $满足$ {\omega }_{2j}+{\omega }_{2j+1}=0, j=1,2,\cdots ,\dfrac{m-2}{2} $,取一个随机正整数$ \varphi \in {\mathbb{Z}}_{p} $,将向量$ {\overrightarrow{vec}}_{nl} $扩展为2m维$ ve{c}_{nl}{}^{\prime}=\{\varphi {z}_{1},\varphi {z}_{2},\cdots ,\varphi {z}_{m},\varphi , {\omega }_{1}, {\omega }_{2},\cdots , {\omega }_{m-1}\} $,DU使用私钥$ s{k}_{1} $$ {\overrightarrow{vec}}_{nl}{}^{\prime} $计算特征向量密文$ c{t}_{nl}=(\varepsilon ve{c}_{nl}{}^{\prime}+{\overrightarrow{\gamma }}_{nl})\times {M}^{-1} $,其中$ {\overrightarrow{\gamma }}_{nl}\in \mathbb{Z}_{p}^{2m} $是随机生成的误差向量,满足$ q\gg p\gg 2|\max ({\overrightarrow{\gamma }}_{nl})| $。其中$ \left| \max ({\overrightarrow{\gamma }}_{nl})\right| $表示向量$ {\overrightarrow{\gamma }}_{nl} $中元素绝对值的最大值。最终形成搜索陷门$ T=({\sigma }_{nl},c{t}_{nl}) $,上传至云服务器。

4.5 语义检索

语义检索阶段,CS执行$ search $算法。遍历索引集合$ K $,计算:
$ e({\sigma }_{nl,1},x)e({\sigma }_{{{t}_{1}},2},g)=e({\sigma }_{{{t}_{1}},1},v)e({\sigma }_{nl,2},g) $
如果等式成立则说明$ {u}^{\prime}={u}_{t} $,取出集合$ {v}_{t}=\{({\sigma }_{{{t}_{1}}},c{t}_{{{t}_{1}}}{}^{\prime},c{f}_{{{t}_{1}}}),\cdots ,({\sigma }_{{{t}_{N}}},c{t}_{{{t}_{N}}}{}^{\prime},c{f}_{{{t}_{N}}})\} $,执行以下操作:
CS根据陷门分量$ c{t}_{nl} $和集合$ {v}_{t} $中密文分量$ c{t}_{{{t}_{j=1,2,\cdots ,N}}} $的明文欧式距离进行排序检索。给定陷门分量$ c{t}_{nl} $和密文分量$ c{t}_{{{t}_{a}}}{}^{\prime} $$ c{t}_{{{t}_{b}}}{}^{\prime} $$ c{t}_{nl} $$ c{t}_{{{t}_{a}}}{}^{\prime} $$ c{t}_{{{t}_{b}}}{}^{\prime} $的明文欧式距离可以通过以下式子比较:
式(3):
$ \begin{aligned}&Com{p}_{nl-a}={\left[\frac{c{t}_{nl}c{t}_{{{t}_{a}}}}{{\varepsilon }^{2}}\right]}_{q}=\\&{\left[\frac{((\varepsilon {\overrightarrow{vec}}_{nl}{}^{\prime}+{\overrightarrow{\gamma }}_{nl})\times {M}^{-1})(((\varepsilon {\overrightarrow{vec}}_{{{t}_{a}}}{}^{\prime}+{\overrightarrow{\gamma }}_{{{t}_{a}}})\times {M}_{{{t}_{a}}})\times {M}_{{{t}_{a}}}{}^{\prime})}{{\varepsilon }^{2}}\right]}_{q}\\&={\left[\frac{((\varepsilon {\overrightarrow{vec}}_{nl}{}^{\prime}+{\overrightarrow{\gamma }}_{nl})\times {M}^{-1})((\varepsilon {\overrightarrow{vec}}_{{{t}_{a}}}{}^{\prime}+{\overrightarrow{\gamma }}_{{{t}_{a}}})\times M)}{{\varepsilon }^{2}}\right]}_{q}=\\&{\left[{\overrightarrow{vec}}_{nl}{}^{\prime}{\overrightarrow{vec}}_{{{t}_{a}}}{}^{\prime}+\frac{{\overrightarrow{\gamma }}_{nl}{\overrightarrow{vec}}_{{{t}_{a}}}{}^{\prime}+{\overrightarrow{\gamma }}_{{{t}_{a}}}{\overrightarrow{vec}}_{nl}{}^{\prime}}{\varepsilon }+\frac{({\overrightarrow{\gamma }}_{{{t}_{a}}}{\overrightarrow{\gamma }}_{nl})}{{\varepsilon }^{2}}\right]}_{q}=\\&\varphi (\sum \limits_{j=1}^{m}{z}_{j}{d}_{{{t}_{a}},j}-\frac{1}{2}\sum \limits_{j=1}^{m}d_{{t}_{a},j}^{2})+{\omega }_{1}H+\sum \limits_{j=2}^{m-1}{\omega }_{j}{\beta }_{j-1}=\\&\varphi Dis\{{\overrightarrow{vec}}_{nl},{\overrightarrow{vec}}_{{{t}_{a}}}\}-\varphi \sum \limits_{j=1}^{m}z_{j}^{2}+{\omega }_{1}H\end{aligned} $
式(4):
$ Com{p}_{nl-b}=\varphi Dis\{{\overrightarrow{vec}}_{nl},{\overrightarrow{vec}}_{{{t}_{b}}}\}-\varphi \sum \limits_{j=1}^{m}z_{j}^{2}+{\omega }_{1}H $
式(5):
$ \begin{aligned}&Com{p}_{a-b}=Com{p}_{nl-a}-Com{p}_{nl-b}=\\& \varphi (Dis\{{\overrightarrow{vec}}_{nl},{\overrightarrow{vec}}_{{{t}_{a}}}\}-Dis\{{\overrightarrow{vec}}_{nl},{\overrightarrow{vec}}_{{{t}_{b}}}\})\end{aligned} $
式(3)中符号$ {[E]}_{q} $表示最接近实数$ E $的整数模$ q $。式(3)的正确性取决于一个事实,即$ \varepsilon \gg 2|\max ({\overrightarrow{\gamma }}_{nl})|, \varepsilon \gg 2|\max ({\overrightarrow{\gamma }}_{{{t}_{a}}})| $$ \varepsilon \gg p $$ \displaystyle\sum \limits_{j=2}^{m-1}{\omega }_{j}{\beta }_{j-1}=0 $,在此条件下噪声项$ \dfrac{({\overrightarrow{\gamma }}_{{{t}_{a}}}{\overrightarrow{\gamma }}_{nl})}{{\varepsilon }^{2}} \lt < 0.5 $,$ \dfrac{{\overrightarrow{\gamma }}_{nl}{\overrightarrow{vec}}_{{{t}_{a}}}{}^{\prime}+{\overrightarrow{\gamma }}_{{{t}_{a}}}{\overrightarrow{vec}}_{nl}{}^{\prime}}{\varepsilon } \lt < 0.5 $取整后被舍弃。由于$ \varphi $为正整数,因此当$ Com{p}_{a-b} \gt 0 $时说明$ c{t}_{{{t}_{b}}}{}^{\prime} $对应的语义向量离$ c{t}_{nl} $对应的语义向量的欧式距离更小即语义更相似,反之$ c{t}_{{{t}_{a}}}{}^{\prime} $对应的语义向量离$ c{t}_{nl} $对应的语义向量更相似。通过这个方法CS可以对集合$ {v}_{t} $中的三元组进行升序排序,然后根据DU需求选取前$ \tau $个三元组组成集合$ \{({\sigma }_{{{y}_{1}}},c{t}_{{{y}_{1}}}^{\prime}, c{f}_{{{y}_{1}}}),\cdots , ({\sigma }_{{{y}_{\tau }}},c{t}_{{{y}_{\tau }}}{}^{\prime},c{f}_{{{y}_{\tau }}})\} $
2)对这$ \tau $个三元组中的加密分量进行聚合计算得到证明信息:
$ {\sigma }_{y}=({\sigma }_{y,1},{\sigma }_{y,2},{\sigma }_{y,3})=\left(\displaystyle\prod \limits_{j=1}^{\tau }{\sigma }_{{{y}_{j}},1},\displaystyle\prod \limits_{j=1}^{\tau }{\sigma }_{{{y}_{j}},2},\displaystyle\prod \limits_{j=1}^{\tau }{\sigma }_{{{y}_{j}},3}\right) $
聚合计算$ {c}_{y}=\displaystyle\sum \limits_{j=1}^{\tau }h(c{f}_{{{y}_{j}}}) $
云服务器将检索结果$ R=({\sigma }_{y},{c}_{y},\{c{f}_{{{y}_{1}}},\cdots ,c{f}_{{{y}_{\tau }}}\}) $返回给医疗研究机构。

4.6 结果验证

结果验证阶段医疗研究机构DU执行$ verify $算法。DU使用私钥分量$ s{k}_{2}=s $,并结合陷门生成阶段的语义向量哈希值$ {u}^{\prime} $验证如下等式是否成立:
$ \sigma _{y,1}^{s}={x}^{{{c}_{y}}}{g}^{\tau {{s}^{2}}{{u}^{\prime}}}{\sigma }_{y,3} $
若等式成立即$ {u}^{\prime}={u}_{y} $:表明云服务器严格按照协议要求返回了合法的密文数据,DU可对该数据进行解密并用于后续研究。若等式不成立:表明返回结果存在篡改或伪造风险,DU应立即终止本次交互流程。

5 正确性证明与安全性分析

5.1 正确性证明

首先进行方案中所涉及的密态数据完整性验证的各个方程正确性证明。
验证方程(1)
$ e({\sigma }_{i,1},x)e({\sigma }_{{{t}_{1}},2},g)=e({\sigma }_{{{t}_{1}},1},x)e({\sigma }_{i,2},g) $的正确性推到如下:
前置条件$ {u}_{i}={u}_{t} $
$ \begin{aligned} e({\sigma }_{i,1},x)e({\sigma }_{{{t}_{1}},2},g)&=e({x}^{{{u}_{i}}}g^{h(c{f}_{i})+{r}_{i}},x)e({x}^{h(c{{f}_{{{t}_{1}}}})+{{r}_{{{t}_{1}}}}},g)\\& =e({x}^{{{u}_{i}}},x)e(g^{h(c{f}_{i})+{r}_{i}},x)e({x}^{h(c{{f}_{{{t}_{1}}}})+{{r}_{{{t}_{1}}}}},g) \\&=e({x}^{{{u}_{i}}},x)e(x^{h(c{f}_{i})+{r}_{i}},g)e(g^{h(c{f}_{{{t}_{1}}})+{r}_{{{t}_{1}}}},x) \\&=e({x}^{{{u}_{i}}}g^{h(c{f}_{{{t}_{1}}})+{r}_{{{t}_{1}}}},x)e(x^{h(c{f}_{i})+{r}_{i}},g) \\&=e({\sigma }_{{{t}_{1}},1},x)e({\sigma }_{i,2},g)\end{aligned} $
验证方程(2)$ e({\sigma }_{nl,1},x)e({\sigma }_{{{t}_{1}},2},g)=e({\sigma }_{{{t}_{1}},1},x)e({\sigma }_{nl,2},g) $的正确性推到如下:
前置条件$ {u}^{\prime}={u}_{t} $
$ \begin{split}e(\sigma_{nl,1},x)e(\sigma_{t_1,2},g) &=e({x^{u^\prime}}{ g^{h(nl)+r_{nl}},x}) {e(x^{h(cf_{t_1})+r_{t_1}},g)} \\ & =e({x^{u^\prime}},x)e(g^{h(nl)+r_{nl}},x)e(x^{h(cf_{t_1})+r_{t_1}},g) \\ & =e({x^{u^\prime}},x)e(x^{h(nl)+r_{nl}},g)e(g^{h(cf_{t_1})+r_{t_1}},x) \\ & =e({x^{u^\prime}}g^{h(cf_{t_1})+r_{t_1}},x)e(x^{h(nl)+r_{nl}},g) \\ & =e(\sigma_{t_1,1},x)e(\sigma_{nl,2},g)\end{split} $
验证方程$ \sigma _{y,1}^{s}={x}^{{{c}_{y}}}{g}^{\tau {{s}^{2}}{{u}^{\prime}}}{\sigma }_{y,3} $的正确性推到如下:
前置条件$ {u}^{\prime}={u}_{y} $
$ \begin{split}\sigma_{y,1}^s & =\left(\prod\limits_{j=1}^{\tau}x^{u_y}g^{h(cf_{y_j})+r_{y_j}}\right)^s \\ & =x^{s\tau u_y}g^{s\sum\limits_{j=1}^{\tau}h(cf_{y_j})+r_{y_j}} \\ & =g^{\tau s^2u_y}x^{\sum\limits_{j=1}^{\tau}h(cf_{y_j})+r_{y_j}} \\ & =g^{\tau s^2u^\prime}x^{\sum\limits_{j=1}^{\tau}h(cf_{y_j})}x^{\sum\limits_{j=1}^{\tau}r_{y_j}}\\ & =x^{c_y}g^{\tau s^2u^'}\sigma_{y,3}\end{split} $

5.2 安全性分析

定理1.在CLWE(Computational Learning With Errors)问题难解的假设下,本方案的医疗数据语义向量和查询向量加密机制具备选择明文攻击下的单向(OC-CPA)安全特性,可确保医疗数据底层语义特征的机密性
证明:假设存在一个概率多项式时间(PPT)攻击者$ \mathcal{A} $在本方案中以不可忽略优势赢得CPA的安全挑战,那么存在另一个PPT攻击者$ \mathcal{C} $,可通过以下游戏以不可忽略的优势解决CLWE假设问题。
CLWE假设问题:给定2m个样本对$ ({\overrightarrow{a}}_{i},{b}_{i})_{i=1}^{2m} $,其中$ {\overrightarrow{a}}_{i} $是从,$ \mathbb{Z}_{p}^{2m} $中均匀随机选取的2m维向量。对于$ i=1,2,\cdots ,2m $都有$ {b}_{i}={\overrightarrow{a}}_{i}\overrightarrow{\varphi }+{\xi }_{i} $,其中$ {\xi }_{i} $是噪声符合高斯分布,求解秘密向量$ \overrightarrow{\varphi } $
初始化阶段:挑战者$ \mathcal{C} $选择参数$ \lambda $并运行$ Setup $算法和$ KeyGen $算法生成私钥$ sk $、公钥$ pk $。将$ pk $和公共参数传递给敌手$ \mathcal{A} $。挑战者$ \mathcal{C} $构造$ \varepsilon {M}^{*}=[{\overrightarrow{a}}_{1},{\overrightarrow{a}}_{2},\cdots , {\overrightarrow{a}}_{2m}] $
查询阶段:攻击者$ \mathcal{A} $可以自适应提交向量$ \overrightarrow{v} $,挑战者$ \mathcal{C} $计算对应密文$ ct=\varepsilon \overrightarrow{v}{M}^{*}+\overrightarrow{\gamma }{M}^{*} $发送给$ \mathcal{A} $
挑战阶段:挑战者$ \mathcal{C} $构造密文
$ c{t}^{*}=[{b}_{1},{b}_{2},\cdots ,{b}_{2m}]=\varepsilon \overrightarrow{\varphi }{M}^{*}+\overrightarrow{\xi } $发送给$ \mathcal{A} $。由于$ \overrightarrow{\gamma }{M}^{*} $$ \overrightarrow{\xi }=[{\xi }_{1},{\xi }_{2},\cdots ,{\xi }_{2m}] $都是是符合高斯分布的噪声向量因此密文有效。
猜测阶段:敌手$ \mathcal{A} $输出一个猜测的向量值$ {\overrightarrow{v}}^{*} $发送给$ \mathcal{C} $,若$ {\overrightarrow{v}}^{*}=\overrightarrow{\varphi } $则敌手$ \mathcal{A} $获胜。
若攻击者$ \mathcal{A} $能够在概率多项式时间内以不可忽略的优势赢得上述安全游戏,则挑战者$ \mathcal{C} $也可以在概率多项式时间内以不可忽略的优势得到$ \overrightarrow{\varphi } $破解CLWE假设问题,这显然是错误的,因此方案可确保医疗数据底层语义特征在选择明文攻击下是安全的。
定理2.在DDH(Decisional Diffie-Hellman Problem)问题难解的假设下该方案可确保医疗数据的语义向量哈希值和查询需求的语义向量哈希值的机密性。
证明:假设存在一个PPT攻击者$ \mathcal{A} $在本方案中以不可忽略优势赢得CPA的安全挑战,那么存在另一个PPT攻击者$ \mathcal{C} $,可通过以下游戏以不可忽略的优势解决DDH假设问题。
DDH假设问题:在循环群$ {G}_{1} $中选定4元组$ (g,{g}^{a},{g}^{b},\varsigma ) $,如果$ \eta =1 $,则表明$ \varsigma ={g}^{ab} $,否则$ \varsigma $$ {G}_{1} $上的任意元素,求解$ \eta $
初始化阶段:挑战者$ \mathcal{C} $选择参数$ \lambda $并运行$ Setup $算法生成$ p $阶乘法循环群$ {G}_{1} $、生成元$ g $和其他系统参数,然后设置公钥$ x={g}^{a} $。最后$ \mathcal{C} $$ pk=(p,{G}_{1},{G}_{2},e,g,x) $和密钥派生因子传递给敌手$ \mathcal{A} $
阶段1:攻击者$ \mathcal{A} $可以自适应提交明文$ {u}_{i} $,挑战者$ \mathcal{C} $计算密文:
$ {\sigma }_{i,1}={x}^{{{u}_{i}}}g_{}^{h(c{f}_{i})+{r}_{i}},{\sigma }_{i,2}={x}^{h(c{{f}_{i}})+{{r}_{i}}},{\sigma }_{i,3}={x}^{{{r}_{i}}} $
然后将密文发送给$ \mathcal{A} $
挑战阶段:攻击者$ \mathcal{A} $随机生成2个内容不同的向量$ {u}_{0} $$ {u}_{1} $,并将他们发送给挑战者$ \mathcal{C} $。挑战者随机选取比特$ y\in \{0,1\} $,构造$ {u}_{y} $的密文:$ {\sigma }_{y,1}={x}^{{{u}_{i}}}{g}^{b},{\sigma }_{y,2}= \varsigma ,{\sigma }_{y,3}={x}^{{{r}_{i}}} $并将其发送给敌手$ \mathcal{A} $
阶段2:$ \mathcal{A} $继续进行阶段1的查询。
猜测阶段:敌手$ \mathcal{A} $输出对比特$ y $的猜测结果$ {y}^{*} $,若$ {y}^{*}=y $则挑战者$ \mathcal{C} $输出$ \eta =1 $表示$ \varsigma ={g}^{ab} $否则输出$ \eta =0 $表示$ \varsigma $为随机元素。
如果$ \varsigma ={g}^{ab} $则密文等价于$ {\sigma }_{y,1}={x}^{{{u}_{i}}}{g}^{b},{\sigma }_{y,2}= {x}^{b}, {\sigma }_{y,3}={x}^{{{r}_{i}}} $可用,$ \mathcal{A} $获胜的优势为$ Adv_{\mathcal{A}}^{IND-CPA}=\psi $,挑战者$ \mathcal{C} $获胜的概率为$ \psi +\dfrac{1}{2} $
如果$ \varsigma $为随机元素则$ \mathcal{A} $获胜的优势为0,$ \mathcal{C} $获胜的概率为$ \dfrac{1}{2} $
挑战者$ \mathcal{C} $打破DDH假设问题的优势为$ Adv_{\mathcal{C}}^{DDH}= \dfrac{1}{2}(\psi +\dfrac{1}{2}+\dfrac{1}{2})-\dfrac{1}{2}=\dfrac{1}{2}\psi $
综上所述若攻击者$ \mathcal{A} $能够在概率多项式时间内以不可忽略的优势$ \psi $赢得上述安全游戏,则挑战者$ \mathcal{C} $同样能够在概率多项式时间内以不可忽略的优势求解DDH假设问题,这显然是错误的,因此方案可确保医疗数据的语义向量哈希值和查询需求的语义向量哈希值的机密性。
定理3.在DLP(Discrete Logarithm Problem)问题难解的假设下,该方案可确保在语义搜索过程中,查询结果的正确性得到严格验证与保证。
证明:假设存在一个试图伪造检索结果通过正确性验证的敌手$ \mathcal{A} $,挑战者$ \mathcal{C} $与敌手$ \mathcal{A} $进行安全游戏。
初始化阶段:挑战者$ \mathcal{C} $选择参数$ \lambda $并运行$ Setup $算法生成$ p $阶乘法循环群$ {G}_{1} $、生成元$ g $和其他系统参数,$ KeyGen $算法生成私钥$ sk $、公钥$ pk $。然后挑战者$ \mathcal{C} $$ pk $和公共系统参数传递给敌手$ \mathcal{A} $
查询阶段:敌手$ \mathcal{A} $反复向挑战者$ \mathcal{C} $发起合法检索查询,挑战者$ \mathcal{C} $生成陷门$ T $和真实的检索结果$ R=({\sigma }_{y},{c}_{y},\{c{f}_{{{y}_{1}}},\cdots ,c{f}_{{{y}_{\tau }}}\}) $供敌手$ \mathcal{A} $观察。
伪造阶段:挑战者$ \mathcal{C} $计算陷门$ {T}^{\prime} $发送给敌手$ \mathcal{A} $,敌手$ \mathcal{A} $根据陷门$ {T}^{\prime} $构造伪造检索结果$ {R}^{*}=({\sigma }_{y}, c_{y}^{*},\{c{f}_{{{y}_{1}}},\cdots ,c{f}_{{{y}_{\tau }}}\}) $发送给挑战者$ \mathcal{C} $进行验证。
挑战者$ \mathcal{C} $执行批量验证方程:
$ \sigma _{y,1}^{s}={x}^{{{c}_{y}}{{}^{*}}}{g}^{\tau {{s}^{2}}{{u}^{\prime}}}\sigma _{y,3}^{} $
其中$ \sigma _{y,1}^{s}={x}^{\tau s{{u}^{\prime}}}{g}^{s({{c}_{y}}+\sum \limits_{i=1}^{\tau }{r}_{i})}={x}^{{c_{y}^{*}}}{g}^{\tau {{s}^{2}}{{u}^{\prime}}}\sigma _{y,3}^{} $
结合以上两个方程得到:$ {x}^{{{c}_{y}}{{}^{*}}}={x}^{{{c}_{y}}} $
设置$ \rho ={x}^{{{c}_{y}}} $,于是,如果敌手可以在多项时间内篡改或者替换结果数据并通过完整性验证,则其必在多项式时间内求解到$ x $$ \rho $之间的离散对数$ {c}_{y} $,这与求解离散对数困难问题假设相矛盾,因此敌手以不可忽略的优势将聚合数据$ {c}_{y}, $篡改或者替换为$ {c}_{y}{}^{*}, $通过批量验证方程在计算上是不可行的。
定理4.本方案在给定泄露函数$ \mathcal{L} $下满足陷门隐私,即攻击者仅能观察到泄露函数$ \mathcal{L} $允许的信息,无法从陷门中还原出检索语义向量的明文。
证明:我们通过分析泄露函数$ \mathcal{L} $涵盖的三类典型信息泄露场景,证明攻击者无法通过观察泄露信息还原检索语义向量的明文:
LSH桶匹配泄露:攻击者仅能观察两次查询的桶归属匹配关系。由于LSH哈希值已加密为$ {\sigma }_{nl} $,根据定理2,攻击者无法获取LSH哈希值的明文,因此无法将哈希桶匹配关系映射至原始语义空间,进而无法还原检索语义向量的明文。
候选集规模泄露:攻击者仅能观察候选集大小,但该数值受数据分布与攻击者未知的LSH参数影响,为无上下文的孤立信息,无法获取具体的查询向量明文信息。
排序结果泄露:攻击者仅能观察到候选元素与检索陷门之间相似度的相对排序,而该排序是基于加密相似度生成的,攻击者无法获取真实的相似度数值。即使攻击者通过多次观察相同的排序结果,推断出前后两次检索陷门具有相似性,根据定理1,其依然无法还原出检索语义向量的明文。
综上本方案在给定泄露函数$ \mathcal{L} $下能够满足陷门隐私。

6 性能分析

本文实验的硬件环境为:Intel (R) Core (TM) Ultra 7 265KF 3.90 GHz处理器、DDR5 6000MHz 32GB内存及NVIDIA GeForce RTX 5070 Ti显卡;软件环境为Windows 11操作系统与密码算法基础函数库JPBC。

6.1 功能比较

本节从功能方面与现有的方案[23,24,28]进行对比,如表1所示。结果表明,本方案(支持海量医疗数据语义检索的可验证可搜索加密方案)同时具备支持语义检索、批量正确性验证、检索意图隐藏、支持海量数据检索及抗量子攻击的能力,可有效部署于医疗数据隐私保护检索领域。
表 1 功能比较

Table 1 The function comparison

方案支持语义
检索
批量正确性
验证
检索意图
隐藏
支持海量
数据检索
抗量子
方案[28]×××
方案[24]××
方案[23]××××
本方案

6.2 准确性分析

为量化验证方案的检索准确性,实验采用信息检索领域公认的平均精度均值(MAP, Mean Average Precision)作为核心评价指标。选取4种主流MiniLM模型,在MS MARCO标准数据集上[31],分别对明文检索与密文检索的准确率进行对比实验,实验结果如表2所示。
表 2 不同模型明文与密文检索准确率(MAP)对比

Table 2 The comparison of MAP between plaintext and ciphertext for different models

all-MiniLM-
L6-v2
all-MiniLM-
L6-v1
all-MiniLM-
L12-v2
msmarco-MiniLM-
L-6-v3
明文 0.5985 0.6379 0.6409 0.6811
密文 0.5985 0.6379 0.6409 0.6811
表2数据可见,在4种 MiniLM 模型的测试场景中,密文状态下的检索准确率与明文状态完全一致。这一结果充分证明,本文提出的可搜索加密方案在实现数据加密保护的同时,未对语义检索的准确性产生任何负面影响,实现了安全性与检索性能的兼容。

6.3 计算开销分析

本节对各方案的计算开销进行了对比分析。其中,$ {P}_{pa} $是一次双线性对运算所需时间、$ {P}_{ex} $是一次普通模指数运算所需时间、$ {P}_{mu} $是一次普通模乘法运算所需时间、$ {P}_{dp} $是一次向量内积运算所需时间、$ {P}_{mv} $是一次矩阵-向量乘法运算所需时间、$ {P}_{ha} $是一次普通哈希函数运算所需时间、$ {P}_{Ha} $是一次局部敏感哈希运算所需时间、$ {P}_{hg} $是一次映射到循环群中的运算所需时间。由于向量加法、数乘及取模操作的开销远低于$ {P}_{mv} $,在分析中予以忽略。
为简化分析,本文假设:云服务器共维护l个索引,每个索引关联N个密文,且检索后返回排名第一的文档。
表3所示,我们从数据加密、陷门生成、检索和验证四个关键算法维度,对四种方案的计算开销进行了比较。在数据加密和陷门生成阶段,各方案的开销均与数据量lN无关。在检索阶段,得益于“粗匹配+精排序”的两级架构设计,本方案的时间复杂度仅为$ O(l+N) $,而其他三种方案的复杂度均为$ O(lN) $,在大规模数据场景下优势显著。此外,本方案的验证算法无需双线性对运算,因此性能显著优于方案[28];而方案[24]和方案[23]未提供验证功能。
表 3 计算开销比较

Table 3 The computation overhead comparison

算法 方案[28] 方案[24] 方案[23] 本方案
DataEnc $ \begin{aligned}& 5{P}_{ex}+3{P}_{pa}+2{P}_{mu}\\& +2{P}_{hg}+{P}_{ha}\end{aligned} $ $ 2{P}_{mv} $ $ 2{P}_{mv} $ $ {P}_{ha} $+$ {P}_{Ha} $+$ 4{P}_{ex} $
+$ {P}_{mu} $+$ {P}_{mv} $
Trapdoor $ 4{P}_{ex}+2{P}_{mu}+2{P}_{hg} $ $ {P}_{mv} $ $ 2{P}_{mv} $ $ {P}_{ha} $+$ {P}_{Ha} $+$ 4{P}_{ex} $+$ {P}_{mu} $+$ {P}_{mv} $
search $ (3l+lN+1){P}_{mu}+(lN+2){P}_{ex} $+
$ l(N+2){P}_{pa}+lN{P}_{ha}+{P}_{hg} $
$ {P}_{mv} $+$ lN{P}_{dp} $ $ 2lN{P}_{Mv} $ $ l(4{P}_{pa}+2{P}_{mu}) $+$ N{P}_{dp} $+$ 3{P}_{mu} $+$ {P}_{ha} $
verify $ 2{P}_{pa}+{P}_{hg} $ - - $ 3{P}_{ex} $+$ 2{P}_{mu} $
具体实验基于密码函数库JPBC,采用A型奇异曲线$ {y}^{2}={x}^{3}+x $进行仿真。实验中,索引数$ l $的取值范围为[100,1000],每个索引关联的密文数N的取值范围为[100,1000]。
数据加密(DataEnc)算法图3)本方案的时间开销仅为0.0137s,在所有对比方案中最低,显著低于方案 [28](0.0543s),也优于方案 [24](0.0152s)和方案 [23](0.0152s),展现出更优的加密效率。
图 3 数据加密时间开销

Fig.3 The Data encryption time overhead

陷门生成(Trapdoor)算法(图4)本方案的时间开销为0.0137s,低于方案 [28](0.0345s)和方案 [23](0.0152s),仅略高于方案 [24](0.0076s),在保证功能的同时保持了良好的性能。
图 4 生成陷门时间开销

Fig.4 The Trapdoor generation time overhead

检索(Search)算法(图5图6)固定索引数$ l=500 $,随着密文数N从100 增长到1000,当$ N \gt 400 $后,本方案的检索耗时显著低于其他方案,且基本保持稳定,展现出极佳的可扩展性。
图 5 固定l检索时间开销

Fig.5 The Retrieval time overhead with fixed l

图 6 固定N检索时间开销

Fig.6 The Retrieval time overhead with fixed N

固定密文数$ N=1000 $,随着索引数$ l $从100增长到1000,本方案的检索耗时始终保持在所有方案中的最低水平,远低于方案[28]和方案[23],且增长趋势平缓。
正确性验证(Verify)算法(图7)本方案的时间开销仅为0.0046s,远低于方案 [28](0.0264s)。而方案 [24] 和方案 [23] 不具备正确性验证功能,这进一步凸显了本方案在功能完整性和安全性上的优势。
图 7 结果验证时间开销

Fig.7 The Result verification time overhead

综上,本方案在数据加密、检索效率、正确性验证等核心环节均展现出显著的性能优势,同时还具备正确性验证能力,在整体性能、可扩展性与功能完备性上均优于对比方案[28]、[24]、[23]。此外,随着索引数与密文数的增加,本方案检索算法的耗时增长趋势平缓,能够很好地适用于海量数据场景。

6.4 通信与存储开销对比

在可搜索加密方案的实际部署中,通信与存储开销是衡量方案实用性的核心指标。为了公平对比,本节首先明确开销模型的核心参数:定义索引或查询向量中元素的长度$ |e|=64bit $,群$ {\text{G}}_{1} $$ {\text{G}}_{2} $$ {\mathbb{Z}}_{q} $上元素的长度$ {|\text{G}}_{1}| $$ {|\text{G}}_{2}| $$ |{\mathbb{Z}}_{q}| $均为128bit,结合语义搜索需求,设定特征向量维度$ m=128 $
考虑到检索系统的运行特性,通信开销主要集中在用户端提交陷门至服务器端的查询阶段,其他交互阶段的通信量可忽略不计;在存储层面,索引与密文存储占据了系统存储资源的绝大部分。因此,本文重点针对陷门提交的通信开销与索引结构的存储开销展开理论对比与分析,具体结果如表4所示。
表 4 :通信与存储开销比较

Table 4 The Communication and storage overhead comparison

方案提交陷门通信开销索引存储开销
方案[28]$ {3|\text{G}}_{1}| $$ l{\text{N(3}|\text{G}}_{1}{|+|\text{G}}_{2}|+|{\mathbb{Z}}_{q}|) $
方案[24]$ 4m|e| $$ 2mlN|e| $
方案[23]$ 4m|e| $$ 4mlN|e| $
本方案$ 3|{G}_{1}|+2m|e| $$ lN(3|{G}_{1}|+2m|e|) $
基于上述参数,我们对各方案的理论开销进行了数值量化,结果分析如下:
(1)通信开销:本方案的陷门通信长度为16768bit。相较于方案[28]的384bit,本方案的通信开销有所增加。这是因为方案[28]仅支持关键字精确匹配,而本方案为了支持语义相似度检索,在陷门中引入了维度为$ m $的特征向量信息$ 2m|e| $,这是实现语义检索功能所必需的理论代价。然而,与同样支持向量检索的方案 [24]和方案[23](均为32768bit)相比,本方案的通信开销降低50%,显著降低了用户与服务器之间的交互成本,更适合高延迟的网络环境。
(2)存储开销:本方案索引存储开销为$ 16768lN $bit。从数值上看,该开销高于方案[28]($ 640lN $bit)和方案[24]($ 16384lN $bit),但显著低于方案[23]($ 32768lN $bit)。由于本方案的索引是基于“粗匹配 + 精排序”的两级检索架构设计的,因此在提升检索效率的前提下,牺牲了少量存储开销,这一权衡在大规模检索场景中是可接受的。
综合来看,本方案在保证语义检索能力与检索效率的前提下,通信与存储开销处于较优水平。

7 结束语

本文提出的可验证语义搜索加密方案,融合局部敏感哈希(LSH)、具有隐私保护的欧氏距离比较技术与双线性对技术,构建二级检索架构(“粗匹配 + 精细排序”)实现了密文域语义检索、结果可验证、海量数据快速检索与多主体隐私防护。实验表明该方案密文检索准确率与明文一致,核心算法计算开销低、检索效率高,通信与存储开销处于较优水平,为医疗数据安全共享提供了新路径。未来可进一步拓展多模态数据适配能力、优化开销并引入动态数据更新机制,提升方案实际应用价值。
1
谢晴晴, 宋亮晴, 冯霞. 面向医疗数据分享的轻量级且安全的搜索方案[J]. 通信学报, 2024, 45 (11): 206- 222.

DOI

Xie Q Q, SONG L Q, FENG X. Lightweight and secure search scheme for medical data sharing[J]. Journal on Communications, 2024, 45 (11): 206- 222.

DOI

2
Wang H J, Ning J T, Huang X Y, et al. Secure fine-grained encrypted keyword search for e-healthcare cloud[J]. IEEE Transactions on Dependable and Secure Computing, 2019, 18 (3): 1307- 1319.

DOI

3
张晓均, 张经伟, 黄超, 等. 可验证医疗密态数据聚合与统计分析方案[J]. 软件学报, 2022, 33 (11): 4285- 4302.

DOI

ZHANG X J, ZHANG J W, HUANG C, et al. Verifiable encrypted medical data aggregation and statistical analysis scheme[J]. Journal of Software, 2022, 33 (11): 4285- 4302.

DOI

4
王政, 王经纬, 殷新春. 支持用户撤销的可搜索电子健康记录共享方案[J]. 计算机应用, 2024, 44 (2): 504- 511.

Wang Z, WANG J W, YIN X C. Searchable electronic health record sharing scheme with user revocation[J]. Journal of Computer Applications, 2024, 44 (2): 504- 511.

5
Bao Y Y, Qiu W D, Cheng X C. Secure and lightweight fine-grained searchable data sharing for IoT-oriented and cloud-assisted smart healthcare system[J]. IEEE Internet of Things Journal, 2021, 9 (4): 2513- 2526.

DOI

6
张鸿越, 郑晓坤, 吴阿新, 等. 在线医疗社交网络中支持用户撤销的数据隐私保护方案[J]. 网络空间安全科学学报, 2023, 1 (2): 22- 34.

DOI

ZHANG H Y, ZHENG X K, WU A X, et al. Data Privacy protection scheme for supporting user revocation in online medical social network[J]. Journal of Cybersecurity, 2023, 1 (2): 22- 34.

DOI

7
Lai C Z, Ma Z, Guo R, Zheng D. Secure medical data sharing scheme based on traceable ring signature and blockchain[J]. Peer-to-Peer Networking and Applications, 2022, 15 (3): 1562- 1576.

DOI

8
童心悦, 陈付龙, 王涛春, 等. 基于智能合约和CP-ABE的病理信息可追溯安全共享方案[J]. 网络空间安全科学学报, 2025, 3 (3): 102- 116.

DOI

TONG X Y, CHEN F L, WANG T C, et al. Traceable and secure sharing scheme for pathological information based on smart contracts and CP-ABE[J]. Journal of Cybersecurity, 2025, 3 (3): 102- 116.

DOI

9
王祥宇, 马鑫迪, 梁岩荣, 等. 开放大数据安全存储与检索系统[J]. 网络空间安全科学学报, 2024, 2 (3): 13- 26.

DOI

WANG X Y, MA X D, LIANG Y R, et al. Secure storage and retrieval system for open big data[J]. Journal of Cybersecurity, 2024, 2 (3): 13- 26.

DOI

10
Chen B W, Xiang T, He D B, et al. BPVSE: Publicly verifiable searchable encryption for cloud-assisted electronic health records[J]. IEEE Transactions on Information Forensics and Security, 2023, 18, 3171- 3184.

DOI

11
Xia Z, Xiong N N, Vasilakos A V, et al. EPCBIR: An efficient and privacy-preserving content-based image retrieval scheme in cloud computing[J]. Information Sciences, 2017, 387, 195- 204.

DOI

12
Yang W Y, Zhu Y S. A verifiable semantic searching scheme by optimal matching over encrypted data in public cloud[J]. IEEE Transactions on Information Forensics and Security, 2020, 16, 100- 115.

DOI

13
Siam A A, Shohan S. Privacy-preserving AI for encrypted medical imaging: A framework for secure diagnosis and learning[J]. arXiv preprint arXiv: 2507.21060, 2025.

14
Zhang Y, Ou W H, Shi Y F, et al. Deep medical cross-modal attention hashing[J]. World Wide Web, 2022, 25 (4): 1519- 1536.

DOI

15
顾一凡, 杨雪冰, 朱承璋, 等. 面向患者跨模态检索的图增强哈希网络模型 [J]. 计算机辅助设计与图形学学报, DOI: 10.3724/SP.J.1089.2024-00351.

GU Y F, YANG X B, ZHU C Z, et al. Graph enhanced hashing networks for cross-modal patient retrieval[J]. Journal of Computer-Aided Design & Computer Graphics, DOI: 10.3724/SP.J.1089.2024-00351.

16
丁国辉, 张琦, 房士超, 等. 多模态检索在医学领域的研究综述[J]. 计算机工程与应用, 2023, 59(1): 26-36.

DING G H, ZHANG Q , FANG S C, et al. review of multi-modal retrieval in medicine[J]. Computer Engineering and Applications, 2023, 59(1): 26-36.

17
Nie X L, Zhang A Q, Wang Y, et al. SMKA: Secure multi-key aggregation with verifiable search for IoMT[J]. Computer Communications, 2025, 231, 108012.

DOI

18
Indyk P, Motwani R. Approximate nearest neighbors: Towards removing the curse of dimensionality[C]//Proceedings of the 30th Annual ACM Symposium on Theory of Computing, New York: ACM, 1998: 604-613.

19
Yuan J, Tian Y. Practical privacy-preserving MapReduce-based k-means clustering over large-scale dataset[J]. IEEE Transactions on Cloud Computing, 2017, 7 (2): 568- 579.

DOI

20
Song D X, Wagner D, Perrig A. Practical techniques for searches on encrypted data[C]//Proceedings of the 2000 IEEE Symposium on Security and Privacy. Los Alamitos: IEEE Computer Society, 2000: 44-55.

21
Xu G Q, Qi C, Dong W Y, et al. A privacy-preserving medical data sharing scheme based on blockchain[J]. IEEE Journal of Biomedical and Health Informatics, 2022, 27 (2): 698- 709.

DOI

22
Yang X D, Li X X, Chen A J, et al. Blockchain-based searchable proxy re-encryption scheme for EHR security storage and sharing[J]. Journal of Physics: Conference Series, 2021, 1828 (1): 012120.

DOI

23
Chen D J, Liao Z Y, Xie Z D, et al. MFSSE: Multi-keyword fuzzy ranked symmetric searchable encryption with pattern hidden in mobile cloud computing[J]. IEEE Transactions on Cloud Computing, 2024, 12 (4): 1042- 1057.

DOI

24
王祥宇, 马建峰, 苗银宾. 高效隐私保护的多用户图像外包检索方案[J]. 通信学报, 2019, 40 (2): 31- 39.

DOI

Wang X Y, MA J F, MIAO Y B. Efficient privacy-preserving image retrieval scheme over outsourced data with multi-user[J]. Journal on Communications, 2019, 40 (2): 31- 39.

DOI

25
Liao J X, Yang D, Li T H, et al. Fusion feature for LSH-based image retrieval in a cloud datacenter[J]. Multimedia Tools and Applications, 2016, 75, 15405- 15427.

DOI

26
Su Y X, Wang X A, Du W D, et al. A secure data fitting scheme based on CKKS homomorphic encryption for medical IoT[J]. Journal of High Speed Networks, 2023, 29 (1): 41- 56.

DOI

27
Boneh D, Di Crescenzo G, Ostrovsky R, et al. Public key encryption with keyword search[C]//International Conference on the Theory and Applications of Cryptographic Techniques. Berlin: Springer, 2004: 506-522.

28
Liu J L, Wei Z K, Qin J, et al. Verifiable key-aggregate searchable encryption with a designated server in multi-owner setting[J]. IEEE Transactions on Services Computing, 2023, 16 (6): 4233- 4247.

DOI

29
Rahman M S, Khalil I, Moustafa N, et al. A blockchain-enabled privacy-preserving verifiable query framework for securing cloud-assisted industrial Internet of Things systems[J]. IEEE Transactions on Industrial Informatics, 2021, 18 (7): 5007- 5017.

DOI

30
Gao H C, Huang H P, Xue L Y, et al. Blockchain-enabled fine-grained searchable encryption with cloud–edge computing for electronic health records sharing[J]. IEEE Internet of Things Journal, 2023, 10 (20): 18414- 18425.

DOI

31
Bajaj P, Campos D, Craswell N, et al. MS MARCO: A human generated machine reading comprehension dataset[J/OL]. 2018 [2026-03-22], DOI: 10.48550/arXiv.1611.09268.

文章导航

/