技术应用

高效隐私保护的跨模态医疗数据检索方法

  • 蔡珊珊 1 ,
  • 朱丹 , 1, 2, * ,
  • 汪群泽 1 ,
  • 答乐梅 1 ,
  • 慕德俊 1 ,
  • 胡伟 1, 2
展开
  • 1. 西北工业大学网络空间安全学院,西安 710072
  • 2. 西北工业大学深圳研究院,深圳 518063
朱丹 )。

网络出版日期: 2025-07-18

基金资助

国家重点研发计划(2024YFB3908500);国家自然科学基金青年科学基金(62402388);广东省基础与应用基础研究基金(2023A1515110941)

版权

版权所有©《网络空间安全科学学报》编辑部 2025

Efficient and privacy-preserving cross-modal retrieval scheme over medical data

  • CAI Shanshan 1 ,
  • ZHU Dan , 1, 2, * ,
  • WANG Qunze 1 ,
  • DA Lemei 1 ,
  • MU Dejun 1 ,
  • HU Wei 1, 2
Expand
  • 1. School of Cybersecurity, Northwestern Polytechnical University, Xi’an 710072, China
  • 2. Shenzhen Research Institute, Northwestern Polytechnical University, Shenzhen 518063, China

Online published: 2025-07-18

Copyright

Copyright ©2025 Journal of Aeronautical Materials. All rights reserved.

摘要

面向多模态医疗数据的安全外包存储与跨模态检索需求,提出了一种高效隐私保护的跨模态医疗数据检索方案。该方案利用改进的跨模态哈希网络提取电子病历与医疗影像的归一化语义哈希编码,并采用基于容错学习问题的安全内积协议实现哈希编码的语义相似性度量,支持隐私保护的跨模态医疗数据检索。同时,基于凝聚型层次聚类和多重索引哈希表构造分层索引结构,将查询复杂度从线性降低到亚线性,支持大规模数据的高效检索。严格的安全性分析表明,所提方案可以抵抗选择明文攻击,保证外包数据及检索请求的安全性。基于真实和模拟数据集的实验评估表明,所提方案的搜索时间与明文方案接近,具有实用性。

本文引用格式

蔡珊珊 , 朱丹 , 汪群泽 , 答乐梅 , 慕德俊 , 胡伟 . 高效隐私保护的跨模态医疗数据检索方法[J]. 网络空间安全科学学报, 2025 , 3(2) : 70 -83 . DOI: 10.20172/j.issn.2097-3136.250207

Abstract

To achieve secure storage and cross-modal retrieval over outsourced multi-modal medical data, an efficient and privacy-preserving cross-modal retrieval scheme for smart healthcare was proposed. At first, the proposed scheme applied an improved cross-modal hashing network to extract normalized semantic hash codes from electronic medical records and medical images. Then, it employed a secure inner product protocol based on learning with errors problem to measure the semantic similarity between the encrypted hash codes. After that, a hierarchical index structure was constructed by combining agglomerative hierarchical clustering with multi-index hash tables. The constructed structure could reduce query complexity from linear to sub-linear, thereby achieving the efficient retrieval on large-scale datasets. Rigorous security analysis demonstrated that the proposed scheme could resist chosen plaintext attacks, and ensure the security of outsourced data and retrieval queries. Experimental evaluations on both real-world and synthetic datasets showed that the retrieval time of the proposed scheme was comparable to plaintext-based methods, showing its practicality.

0 引言

随着医疗物联网的迅猛发展,以电子信息管理系统、智能成像设备为代表的新一代信息技术已在医疗领域得到广泛应用,医疗行业正迈入一个以数据驱动为核心的新纪元。面向海量多模态的医疗数据,如何实现安全存储与高效价值挖掘是当前医疗领域的研究热点之一。多模态医疗数据包含电子病历、医疗影像等多种数据类型,通过跨模态数据之间的关联分析,可以辅助医护人员进行临床医疗诊断和治疗方案制定。如图1所示,在跨模态检索(Cross-Modal Retrieval,CMR)过程中,首先提取医疗影像和电子病历的特征,进行归一化编码,然后通过对归一化编码的相似性比对,医生可以利用电子病历检索相关医疗影像,确认病灶所在位置,或利用医疗影像检索相关电子病历,得到历史诊疗方案,辅助医疗决策。
图 1 医疗数据跨模态检索

Fig.1 Cross-modal retrieval over medical data

为了减轻本地存储和计算负担,大多医疗数据拥有者(如医院、医保中心)倾向于将数据外包至云服务器。医疗数据通常包含患者的个人敏感信息,同时云服务器可能存在后门、漏洞、恶意管理员等安全隐患。因此,外包跨模态医疗数据检索服务的首要前提是保障外包数据的安全,对数据进行加密是最直接有效的手段。然而,现有跨模态检索方案大都在明文上实现,未采用隐私保护机制对数据进行保护[1-3];采用隐私保护机制的数据检索技术[4-7]通常仅针对单模态数据,无法满足跨模态检索需求。针对隐私保护的跨模态检索需求,Li等[8]面向物联网场景提出了一种轻量级隐私保护跨模态检索方案,该方案将结构复杂、语义表达能力强的教师模型压缩为轻量级的学生模型,对多模态数据进行特征提取,采用基于容错学习(Learning With Errors,LWE)问题的安全k近邻算法对数据进行加密;Cao等[9]则应用一种可以同时处理图像和文本的预训练模型提取图文公共语义特征,再引入特征变换网络将原始特征进行非线性映射和降维处理,利用互信息损失约束变换后的信息关联度来保证隐私安全。最后,通过基于自注意力机制的深度神经网络结构生成哈希编码,实现安全的跨模态检索。然而,文献[8-9]均未在真实的医疗数据集上进行测试,面向医疗数据的可用性有待检测。同时,文献[8]采用的隐私保护机制只能抵抗已知密文攻击;文献[9]采用的隐私保护机制会降低跨模态检索的效率。
针对上述问题,本文面向多模态医疗数据提出了一种高效隐私保护的跨模态检索方案,该方案支持密文上医疗影像数据与电子病历数据的相互检索。给出了本文所提方案与现有方案的对比分析,具体的如表1所示。本文主要贡献如下:
表 1 本文方案与现有方案的对比

Table 1 Comparison between the proposed scheme and existing similar schemes

方案数据类型安全强度效率
[1]多模态
[2]多模态
[4]单模态已知背景攻击
[6]单模态已知背景攻击
[8]多模态已知密文攻击
本文多模态选择明文攻击
(1)实现隐私保护的跨模态检索。通过引入一个专门针对医疗数据设计的改进跨模态哈希网络,对医疗影像和电子病历进行哈希编码的提取,然后结合一个基于LWE问题的安全内积协议实现密文上汉明距离的比较。最终,实现密文上哈希编码的语义相似性度量,支持隐私保护的跨模态检索。
(2)构建多层次高效索引结构。通过结合凝聚型层次聚类和多索引结构构建了一种新的高效索引结构。该结构利用凝聚型层次聚类对从医疗数据中提取出的哈希编码进行聚类缩小查询范围,利用多索引结构对聚类中心进行分段检索实现快速匹配。通过应用该结构,所提方案可以快速定位目标聚类,实现对医疗数据的高效检索。
(3)充分评估方案的实际性能。详细的安全性分析表明,所提方案可以抵抗选择明文攻击。在真实和模拟数据集上充足的实验评估表明,所提方案可以在保障数据安全性的同时实现高效的检索性能,几乎可以达到与明文域相同的检索效率。同时,明密文域上的检索准确率对比分析结果也表明,所提方案的隐私保护机制不会影响检索准确率。
本文面向多模态医疗数据外包的安全存储与检索需求提出了一个高效隐私保护的跨模态检索方案。第1节综述当前跨模态检索和隐私保护智慧医疗服务的研究现状及方法;第2节介绍所提方案应用到的相关技术;第3节提出了面向医疗数据的高效隐私保护跨模态检索方案,并构建其系统模型、方案框架和威胁模型;第4节介绍所提方案框架的详细实现过程;第5节针对所提方案使用到的隐私保护机制的安全性进行了严格证明;第6节通过实验验证本文所提索引方式的高效性,以及隐私保护机制不会对检索性能产生影响;第7节总结本文研究内容、研究成果及贡献,并提出未来研究的方向。

1 相关工作

本节主要对跨模态检索和隐私保护智慧医疗服务这两方面的相关工作进行介绍。

1.1 跨模态检索

跨模态检索旨在从不同模态的数据中学习一个共享的特征空间,使得在一个模态中的查询能够在另一个模态中检索到语义相关的结果。早期的跨模态检索方法主要利用统计学习和矩阵分解实现。最早的跨模态检索方法是由Hotelling等[10]提出的典型相关分析(Canonical Correlation Analysis,CCA)。CCA通过学习多模态数据之间的线性关系,使多模态数据在公共子空间内的相关性最大化。然而,CCA在处理具有高度非线性关系的复杂多模态数据时,表达能力存在局限性。针对该问题,Li等[11]提出了跨模态因子分析法(Cross-modal Factor Analysis,CFA),引入潜在因子来学习不同模态间的共享表示,但该方法对数据质量较为敏感,计算复杂度较高,难以扩展到大规模跨模态检索任务中。此外,CFA还依赖人工特征提取,这会严重影响检索的正确率。近年来,随着机器学习的发展,基于深度学习的跨模态检索方法取得了广泛的关注和显著的进展。Andrew等[12]提出了深度典型相关分析(Deep Canonical Correlation Analysis,DCCA),DCCA是CCA方法的一种扩展,可以用于学习数据双视图复杂非线性变换,通过DCCA学习提取的多模态数据特征高度线性相关。
同时,跨模态哈希(Cross-Modal Hashing,CMH)技术得益于低存储成本和高检索效率,已经受到研究者们的广泛关注。但是,早期的CMH技术,如跨模态相似性敏感哈希(Cross-Modality Similarity-Sensitive Hashing,CMSSH)[13]、多视图哈希(Cross-View Hashing,CVH)[14]、语义主题多模态哈希(Semantic Topic Multimodal Hashing,STMH)[15]、语义保持哈希(Semantics-Preserving Hashing,SePH)[16],也依赖手工特征提取。并且手工特征提取过程与哈希编码学习过程相互独立,提取出的特征无法较好地满足哈希编码的学习需求,会对最终的检索准确率造成不良影响。针对上述问题,Jiang等[17]提出了深度跨模态哈希(Deep Cross-Modal Hashing,DCMH)方法,DCMH直接提取并学习离散哈希编码,可以有效避免准确率下降的问题。然而,DCMH缺乏显式的语义对齐机制,提取出的哈希编码无法直接对齐。Lee等[18]提出的堆叠交叉注意力机制,能够充分考虑图像区域和单词之间的相互影响,同时推理出所有潜在的语义关系,提高了模型的可解释性。然而,该机制计算复杂度较高,难以适用于大规模数据集。

1.2 隐私保护智慧医疗服务

随着智慧医疗的快速发展,许多医疗机构选择将医疗数据的存储和处理外包至云服务器,这不仅可以提高数据的处理效率,还能促进多机构间的数据共享。但由于医疗影像、电子病历包含敏感信息,将医疗数据直接外包至云服务器可能会导致隐私泄露[19]
为解决上述问题,Kocabas等[20]提出了一种基于全同态加密(Fully Homomorphic Encryption,FHE)的云端心脏检测框架,该框架支持在完全密文空间内处理心电图(Electrocardiogram,ECG)数据。然而,FHE方案普遍存在计算复杂度高、资源消耗大的问题。为突破上述瓶颈,Liu等[21]提出了一种结合DNA序列编码与同态加密的轻量化医疗图像隐私保护方案,在效率和与实际部署之间做出了平衡。尽管基于同态加密的方案可以保证检索准确度,但通常会产生很大的时间和存储开销。为进一步提高计算效率和协同处理能力,部分研究将区块链和安全多方计算(Secure Multi-Party Computation,SMC)相结合,用于构建可信、去中心化的医疗数据服务。Parthasarathy等[22]构建了一种融合SMC电路与重加密机制的方案,实现了跨机构敏感数据的安全协作计算。Zhang等[23]引入了秘密共享机制,确保未授权用户无法获取完整的历史病历数据,从而增强医疗数据的访问控制能力,但多轮加密会导致额外的通信开销负担。Fu等[24]提出了一种面向医疗区块链系统的轻量级隐私保护机制,该机制采用门限秘密共享、交错编码和索引优化技术,以降低通信开销并提升数据检索效率。Tang等[25]利用布隆过滤器筛选,排除对诊断无用的大部分诊断信息,然后基于遗忘传输协议提出轻量级隐私保护智能医疗诊断方案。然而,在轻量化设计中,为换取更高的处理效率,算法的安全性可能有所牺牲。
综上所述,如何面向多模态医疗数据设计一个兼具高效率与高安全性的隐私保护跨模态检索方案仍然是一个具有挑战性的问题。

2 预备知识

本节主要介绍本文所提方案应用到的基础技术,包括改进的跨模态哈希网络、基于LWE问题的安全内积计算协议、凝聚型层次聚类算法和伪随机函数。

2.1 改进的跨模态哈希网络

跨模态哈希是一种高效的跨模态检索技术,可以将不同模态的数据(医疗影像、电子病历、心电图等)从原始特征空间映射到共享的哈希空间,以实现高效的近邻搜索。改进的跨模态哈希网络(Improved Cross-modal Hashing,ICMH)模型[26]应用神经网络和跨模态注意力机制增加哈希编码的表达能力,以实现患者医疗影像与电子病历的高精度跨模态检索。ICMH模型由图像编码器、文本编码器以及标签编码器三个模块组成。其中,图像编码器是对快速卷积神经网络[27]的改进;文本编码器是对多层感知机[28]的改进;标签编码器是对图卷积网络[29]的改进。ICMH模型的具体描述如下。
(1)图像编码器:$ {E}_{M}\left(M,{\theta }_{M}\right)\to {H}^{M} $。以原始图像数据集$ M $和图像编码器中的可训练参数$ {\theta }_{M} $作为输入,输出图像类哈希编码$ H^M=\left\{\boldsymbol{h}_i^M\right\}_{i=1}^{N_1}\in\mathrm{R}^{N_1\times k} $$ k $表示编码的维度,$ {N}_{1} $表示图像数据集的规模。
(2)文本编码器:$ {E}_{T}\left(T,{\theta }_{T}\right)\to {H}^{T} $。以原始文本数据集$ T $和文本编码器中的可训练参数$ {\theta }_{T} $作为输入,输出文本类哈希编码$ H^T=\left\{\boldsymbol{h}_i^T\right\}_{i=1}^{N_2}\in\mathbf{\mathrm{R}}^{N_2\times k} $$ k $表示编码的维度,$ {N}_{2} $表示文本数据集的规模。
(3)标签编码器:$ {E}_{L}\left(\boldsymbol{A},\boldsymbol{Y},\boldsymbol{L},{\theta }_{L}\right)\to {H}^{L} $。以初始节点特征向量矩阵$ \boldsymbol{Y}\in {\mathbb{R}}^{C\times C} $C为诊断类别数)、邻接矩阵$ \boldsymbol{A}\in {\mathbb{R}}^{C\times C} $诊断多标签矩阵$ \boldsymbol{L}\in {\mathbb{R}}^{{N}_{3}\times C} $以及标签编码器中的可训练参数$ {\theta }_{L} $作为输入,输出多标签类哈希编码$ H^L=\left\{\boldsymbol{h}_i^L\right\}_{i=1}^{N_3}\in\mathrm{R}^{N_3\times k} $$ k $表示编码的维度,$ {N}_{3} $表示患者实例的规模。
最后,结合跨模态注意力机制,利用多标签哈希编码指导图像(如医疗影像)和文本(如电子病历)类哈希编码的学习过程。为保证不同模态间的语义相似性,设置跨模态哈希过程的损失函数,定义为:
$ \begin{aligned} &{L}_{h}({{H}}^{\mathrm{*}},{{H}}^{\mathrm{*}})=\\&\quad \sum_{{s}_{ij}\in S}{\omega }_{ij}(\mathrm{ln}(1+\mathrm{exp}(\langle {\boldsymbol{h}}_{i}^{*},{\boldsymbol{h}}_{j}^{*} \rangle ))-{s}_{ij}\langle {\boldsymbol{h}}_{i}^{*},{\boldsymbol{h}}_{j}^{*} \rangle )\end{aligned} $
其中,$ \mathrm{*} $表示通用符选自集合$ \{M,T,L\} $$ S $表示相似性集合;$ {s}_{ij} $表示实例ij的相似性,若实例ij共享至少一个类别标签,则定义$ {s}_{ij}=1 $,否则$ {s}_{ij}=0 $$ {\omega }_{ij} $表示一种用于缓解相似和不相似实例对数量不平衡的权重参数。利用最小化损失函数可以统一对图像、文本和多标签的类哈希编码进行训练,使得具备相似语义的多模态数据被编码为更相似的哈希值。

2.2 基于LWE问题的安全内积计算协议

定义1(Hint-LWE问题[30]) Hint-LWE问题是LWE问题的变体。设nqk为正整数,$ \boldsymbol{z}\in {\left\{-\mathrm{1,1}\right\}}^{k} $,矩阵$ \boldsymbol{S}\in {\mathbb{Z}}_{q}^{n\times k} $。定义Hint-LWE分布$ {A}_{\text{Hint-LWE}}^{n,q,{\mathrm{\sigma }}_{1},{\mathrm{\sigma }}_{2},k}\left(\boldsymbol{z},\boldsymbol{S}\right) $$ \left(\boldsymbol{b},\boldsymbol{a},\langle \boldsymbol{z},\boldsymbol{e} \rangle +f\right) $,其中b$ ={\boldsymbol{S}}^{\mathrm{T}}\boldsymbol{a}+\boldsymbol{e} $$ \boldsymbol{a}\in {\mathbb{Z}}_{q}^{n} $$ \boldsymbol{e} $是从标准差为$ {\sigma }_{1} $的离散高斯分布中采样的误差向量,$ f $是从标准差为$ {\sigma }_{2} $的离散高斯分布中采样的噪声标量。Hint-LWE问题定义为:在给定足够多的样本后,区分$ {A}_{\text{Hint-LWE}}^{n,q,{\mathrm{\sigma }}_{1},{\mathrm{\sigma }}_{2},k}\left(\boldsymbol{z},\boldsymbol{S}\right) $分布和随机分布$ \left(\boldsymbol{u},\boldsymbol{a},\langle \boldsymbol{z},\boldsymbol{e} \rangle +f\right) $,其中$ \boldsymbol{u} $从均匀分布的$ {\mathbb{Z}}_{q} $中采样得到。
文献[30]基于Hint-LWE问题提出了一个单密钥安全内积计算(Secure Inner Product Computation,SIPC)协议。SIPC协议可以实现密文空间中汉明距离的计算,由算法$ \rm{S}\rm{e}\rm{t}\rm{u}\rm{p} $$ \rm{D}\rm{a}\rm{t}\rm{a}\rm{E}\rm{n}\rm{c} $、TrapGen和$ \rm{D}\rm{e}\rm{c} $组成,具体描述如下:
$ {\rm{S}\rm{e}\rm{t}\rm{u}\rm{p}}({1}^{\lambda },{1}^{k})\to msk、pp $。输入安全参数$ \lambda $和哈希编码维度k,输出主密钥msk以及公共参数pp
$ {\rm{D}\rm{a}\rm{t}\rm{a}\rm{E}\rm{n}\rm{c}}(msk,pp,\boldsymbol{x})\to E\left(\boldsymbol{x}\right) $。输入主密钥msk、公共参数pp和存储数据的k维哈希编码$ \boldsymbol{x}\in {\mathbb{Z}}_{2}^{k} $,输出密文$ E\left(\boldsymbol{x}\right) $
$ {\rm{T}\rm{r}\rm{a}\rm{p}\rm{G}\rm{e}\rm{n}}(msk,pp,\boldsymbol{q})\to E\left(\boldsymbol{q}\right) $。输入主密钥msk、公共参数pp和查询请求的k维哈希编码$ \boldsymbol{q}\in {\mathbb{Z}}_{2}^{k} $,输出陷门$ E\left(\boldsymbol{q}\right) $
$ {\rm{D}\rm{e}\rm{c}}\left(E\left(\boldsymbol{x}\right),E\left(\boldsymbol{q}\right)\right)\to v $。输入k维哈希编码$ \boldsymbol{x} $的密文$ E\left({\boldsymbol{x}}\right) $$ \boldsymbol{q}\mathrm{的} $陷门$ E\left(\boldsymbol{q}\right) $,输出$ \boldsymbol{x} $$ \boldsymbol{q} $的内积值$ v $

2.3 凝聚型层次聚类算法

聚类算法可以将数据集中的元素划分为若干个簇,使同一簇中的元素在指定相似度指标的约束下具有较高的相似性,而不同的簇之间有较大的差异性。如图2所示,本文采用基于汉明距离的凝聚型层次聚类算法[31],并使用平均链接 1作为聚类合并准则。假设存在一个数据库$ X=\left\{{x}_{1},{x}_{2},\cdots {,x}_{N}\right\} $N为数据库的规模,执行凝聚型层次聚类算法具体步骤如下:
图 2 凝聚型层次聚类

Fig.2 Agglomerative clustering

(1)将X中每个样本点视为单独的簇,记作$ {C}_{i}=\left\{{x}_{i}\right\} $,计算所有簇间距离,构建簇间距离矩阵D
(2)选用平均链接度量计算两个簇$ {C}_{i} $$ {C}_{j} $之间的距离:$ d\left({C}_{i},{C}_{j}\right)=\dfrac{1}{|{C}_{i}||{C}_{j}|}{\displaystyle\sum }_{{x}_{i}\in {C}_{i},{x}_{j}\in {C}_{j}}D\left({x}_{i},{x}_{j}\right) $,其中$ \left|{C}_{i}\right| $$ |{C}_{j}| $是簇$ {C}_{i} $$ {C}_{j} $的样本数量,$ D\left({x}_{i},{x}_{j}\right) $是样本点$ {x}_{i} $$ {x}_{j} $之间的距离。
(3)在当前距离矩阵D中,找到距离最小的非零簇对$ \left({C}_{i},{C}_{j}\right) $,将最小的非零簇对合并。
(4)重新计算簇间距离,并更新距离矩阵D
(5)重复步骤2至步骤4,直到簇的数量达到预设目标,返回簇中心及簇中数据点。

2.4 伪随机函数

定义2 伪随机函数(Pseudo-Random Function,PRF)被定义为:
$ f:\{\mathrm{0,1}{\}}^{\mathrm{\lambda }}\times \{\mathrm{0,1}{\}}^{n}\to \{\mathrm{0,1}{\}}^{m} $
其中,$ \{\mathrm{0,1}{\}}^{\lambda } $表示长度为$ \lambda $的二进制密钥空间,$ \{\mathrm{0,1}{\}}^{n} $表示长度为n的二进制输入,$ \{\mathrm{0,1}{\}}^{m} $表示由密钥和输入进行笛卡尔积计算得到的长度为m的二进制输出。
PRF的安全性:PRF的安全性依赖密钥伪随机的不可区分性。对任意多项式时间的概率敌手$ \mathcal{A} $$ \mathcal{A} $无法有效区分PRF与真正的随机函数,即:
$ \left|{{\mathrm{Pr}}}\left[{\mathcal{A}}^{{f}_{K}(\cdot )}=1\right]-{{\mathrm{Pr}}}\left[{\mathcal{A}}^{g(\cdot )}=1\right]\right|\leqslant \text{negl}(\lambda ) $
其中,$ {f}_{K}\left(\cdot \right) $表示PRF的输出,$ g\left(\cdot \right) $表示从所有可能函数集合随机选择的真正随机函数,$ \text{negl}\left(\lambda \right) $表示安全参数$ \lambda $的可忽略函数,当$ \lambda $增大时,敌手区分PRF与真正随机函数的成功概率趋近于0。

3 方案定义和安全模型

3.1 系统模型

图3所示,本文所提方案包括三个实体:数据拥有者(Data Owner,DO)、查询用户(Query User,QU)以及云服务器(Cloud Server,CS),具体描述如下。
图 3 系统模型

Fig.3 System model

(1)DO是医疗数据所有者,负责采集明文多模态医疗数据并对数据和索引进行加密。具体地,DO首先应用预训练的ICMH模型从明文数据中提取跨模态哈希编码。然后,通过凝聚型层次聚类算法对提取出的哈希编码进行聚类,并基于簇中心构造多重索引哈希表。接着,DO将加密哈希编码和原始医疗数据上传至CS。
(2)QU是经授权可以访问医疗数据的用户,如医生。在获得访问权限后,QU同样首先应用预训练的ICMH模型对查询数据进行特征提取,生成查询数据的哈希编码。然后,加密哈希编码生成查询陷门。接着,发送查询陷门至CS请求相似语义数据检索。在接收到检索结果后,QU可以对数据解密,读取原始数据。
(3)CS被认为具备充足的存储空间和强大的计算能力。CS负责存储加密后的哈希索引以及原始数据,并在接收到QU的请求后提供跨模态检索服务。最终,CS向QU返回符合请求条件的加密结果。

3.2 方案框架

本文所提方案由系统初始化、索引构建、数据加密、陷门生成和跨模态数据检索五个阶段构成,具体描述如下。
系统初始化:$ {\rm{S}\rm{e}\rm{t}\rm{u}\rm{p}}\left({1}^{\lambda },D\right)\to \left(H,msk,pp\right) $。DO输入安全参数$ \lambda $和原始多模态数据集$ D=\left\{M\bigcup T\right\} $,其中$ M=\big\{{d}_{1}^{M},{d}_{2}^{M},\cdots ,{d}_{{N}_{1}}^{M}\big\} $是规模为$ {N}_{1} $的医疗影像数据集,$ T=\big\{{d}_{1}^{T},{d}_{2}^{T},\cdots ,{d}_{{N}_{2}}^{T}\big\} $是规模为$ {N}_{2} $的电子病历数据集,输出ICMH模型生成的哈希编码$ H=\left\{{\boldsymbol{h}}_{1},{\boldsymbol{h}}_{2},\cdots ,{\boldsymbol{h}}_{N}\right\}\in {\mathbb{Z}}_{2}^{k} $、主密钥msk和公开参数pp,其中$ N={N}_{1}+{N}_{2} $k为哈希编码维度。
索引构建:$ {\rm{I}\rm{n}\rm{x}\rm{B}\rm{u}\rm{i}\rm{l}\rm{d}}\left(H\right)\to \left({C}_{1},\cdots ,{C}_{K},C,MI\right) $。DO输入哈希编码$ H=\left\{{\boldsymbol{h}}_{1},{\boldsymbol{h}}_{2},\cdots ,{\boldsymbol{h}}_{N}\right\}\in {\mathbb{Z}}_{2}^{k} $,输出簇集合$ {C}_{1},\cdots ,{C}_{K} $K为簇中心数)、簇中心集合$ C $以及多重索引哈希表MI。值得注意的是,每一个簇的簇中心还会被PRF映射成为一个随机数。
数据加密:$ {\rm{D}\rm{a}\rm{t}\rm{a}\rm{E}\rm{n}\rm{c}}\left(D,{C}_{1},\cdots ,{C}_{K},pp,msk\right)\to \left(\mathcal{E}\left(D\right), E\left({C}_{1}\right),\cdots ,E\left({C}_{K}\right)\right) $。DO输入多模态医疗数据集$ D $、簇集合$ {C}_{1},\cdots ,{C}_{K} $、公共参数pp和主密钥msk。输出加密医疗数据集$ \mathcal{E}\left(D\right)=\mathcal{E}\left(M\right)\bigcup \mathcal{E}\left(T\right) $和加密索引$ E\left({C}_{1}\right),\cdots ,E\left({C}_{K}\right) $
陷门生成:$ {\rm{T}\rm{r}\rm{a}\rm{p}\rm{G}\rm{e}\rm{n}}\left(\boldsymbol{q},MI,C,pp,msk\right)\to \left(E\left(\boldsymbol{q}\right), R\left({\boldsymbol{q}}_{{\mathrm{med}}}\right)\right) $。DO与QU共享簇中心集合$ C $和多重索引哈希表MI。QU输入查询哈希编码$ \boldsymbol{q}\in {\mathbb{Z}}_{2}^{k} $、多重索引哈希表MI、簇中心集合$ C $、公共参数pp和主密钥msk,输出陷门$ E\left(\boldsymbol{q}\right) $和查询$ \mathrm{哈}\mathrm{希}\mathrm{编}\mathrm{码}\boldsymbol{q} $所对应簇中心的随机值$ R\left({\boldsymbol{q}}_{{\mathrm{med}}}\right)={\mathrm{PRF}}\left({\boldsymbol{q}}_{{\mathrm{med}}}\right) $
跨模态数据检索:$ {\rm{R}\rm{e}\rm{t}\rm{r}\rm{i}\rm{e}\rm{v}\rm{a}\rm{l}}\left(E\left(\boldsymbol{q}\right),R\left({\boldsymbol{q}}_{{\mathrm{med}}}\right),\mathcal{E}\left(D\right), {E\left({C}_{i}\right)|}_{i=1}^{K}\right)\to R $。CS输入陷门$ E\left(\boldsymbol{q}\right) $、簇中心的随机值$ R\left({\boldsymbol{q}}_{{\mathrm{med}}}\right) $、加密原始数据$ \mathcal{E}\left(D\right) $以及加密索引$ E\left({C}_{1}\right),\cdots , E\left({C}_{K}\right) $,输出Top-n个相关检索结果$ R=\left\{{r}_{1},{r}_{2},\cdots ,{r}_{{n}}\right\} $

3.3 威胁模型

在本方案中,CS被认为是“诚实且好奇”的,即CS将严格遵循给定的协议来提供服务,但它可能会分析存储的加密数据或接收到的陷门;DO和QU被认为是诚实的,并且不会与CS“勾结”。根据云服务器所提供的功能,主要考虑以下威胁模型。
定义3 (选择明文攻击) 敌手可以任意选择明文查询向量并能够获取对应的查询陷门;可以任意选择医疗图像或文本数据并生成对应的哈希编码,得到加密的医疗图像或文本以及加密的索引。敌手可以依据上述信息,试图分析明密文之间的关系,恢复其他明文信息或推测密钥。

4 方案设计

4.1 方案概述

本文面向智慧医疗提出了一种高效隐私保护的跨模态检索方案,该方案允许在CS中存储DO的加密多模态医疗数据,并支持QU在不泄露隐私的前提下进行高效的跨模态检索。方案用到主要符号定义如表2所示。
表 2 符号定义

Table 2 Symbol definitions

符号 定义
M、T 医疗影像/电子病历数据集
$ H=\left\{{\boldsymbol{h}}_{1},{\boldsymbol{h}}_{2},\cdots ,{\boldsymbol{h}}_{N}\right\} $ 哈希编码
p、q、n 加密算法参数
$ \boldsymbol{q} $ 查询哈希编码
k 哈希编码维度
$ \sigma /{\sigma }^{*} $ 高斯分布标准差
$ {\boldsymbol{q}}_{{\mathrm{med}}} $ 查询向量的簇中心
S 子码数
K 簇中心数
$ MI=\left\{{MI}_{1},{MI}_{2},\cdots ,{MI}_{S}\right\} $ 多重索引哈希表
$ \mathrm{I}\mathrm{D} $ 实例的唯一标识符
图4所示,本文所提方案首先利用ICMH模型结合多标签和注意力机制对医疗影像和电子病历数据进行哈希编码提取;然后,利用凝聚型层次聚类算法对提取的哈希编码进行聚类,生成簇中心,并基于簇中心构建多重索引哈希表;接着,利用SIPC协议对聚类中的每一条哈希编码进行数据加密,利用PRF函数将每一个簇中心映射成不同的随机值,利用安全的对称加密算法(如AES)对原始数据进行加密。加密的簇、簇中心以及原始数据都会被外包至云服务器。为了能够向云服务器安全地请求多模态数据检索服务,查询用户同样会对请求进行哈希编码生成操作,并在确定要请求的簇中心后,将查询请求的哈希编码与加密的簇中心发送至云服务器请求服务。最终,云服务器将在密文上执行检索服务,并将对应原始数据的密文返回给查询用户,查询用户可解密读取。
图 4 方案框架

Fig.4 Scheme framework

4.2 系统初始化

在系统的初始化阶段,DO执行$ \rm{S}\rm{e}\rm{t}\rm{u}\rm{p} $算法。首先,DO利用ICMH模型提取原始医疗影像$ M=\big\{{d}_{1}^{M},{d}_{2}^{M},\cdots ,{d}_{{N}_{1}}^{M}\big\} $和电子病历$ T=\big\{{d}_{1}^{T},{d}_{2}^{T},\cdots ,{d}_{{N}_{2}}^{T}\big\} $的类哈希编码,再结合多标签和注意力机制生成语义相近的跨模态哈希编码$ H=\left\{{\boldsymbol{h}}_{1},{\boldsymbol{h}}_{2},\cdots ,{\boldsymbol{h}}_{N}\right\}\in {\mathbb{Z}}_{2}^{k} $。然后,DO和QU共同协商安全参数$ \lambda \in {\mathbb{Z}}^{+} $,由DO执行SICP.$ \mathrm{S}\mathrm{e}\mathrm{t}\mathrm{u}{{\mathrm{p}}}{({1}^{\lambda },{1}^{k})} $初始化加密算法,生成参数$ \left(p,q,n\right) $。并由DO在$ {\mathbb{Z}}_{q}^{n\times k} $上选取一个均匀分布$ {D}_{s} $,在该分布上采样得到$ m $维向量$ \boldsymbol{u} $和一个($ n\times k) $维矩阵$ \boldsymbol{S} $,其中$ m=n+k $。此外,DO还会选取一个对称加密算法$ \mathcal{E}(\cdot ) $及其密钥$ s{k}_{1} $、PRF函数及其密钥$ s{k}_{2} $。最终SICP算法、对称加密算法和PRF函数的密钥构成主密钥$ msk=\left(\boldsymbol{u},\boldsymbol{S},s{k}_{1},s{k}_{2}\right) $,SICP算法的参数、选取的对称加密算法、PRF函数构成公共参数$ pp= \left(\mathcal{E}\left(\cdot \right), {\mathrm{PRF}}\left(\cdot \right),p,q,n\right) $

4.3 索引构建

在数据索引构建阶段,DO执行$ \rm{I}\rm{n}\rm{x}\rm{B}\rm{u}\rm{i}\rm{l}\rm{d} $算法。首先,DO采用基于平均链接的凝聚型层次聚类算法对哈希编码H进行聚类,通过最小化簇间距离,合并簇间距离为非零最小的簇,直到满足预设簇数,得到簇集合$ {C}_{1},\cdots ,{C}_{K} $,其在本地存储实例如表3所示。选择距离簇内数据样本均值最近的样本点作为簇中心,得到簇中心集合$ C=\left\{{\boldsymbol{C}}_{1},\cdots {,\boldsymbol{C}}_{K}\right\} $,其存储实例如表4所示。
表 3 簇集合存储实例

Table 3 Examples of cluster sets

ID $ {\boldsymbol{h}}_{i} $ $ C $ M/T
5769 $ \left(1,-\mathrm{1,1} ,-1,-1,\cdots \right) $ $ {\boldsymbol{C}}_{1} $ $ {M}_{5769} $
5770 $ \left(-\mathrm{1,1},-\mathrm{1,1},-1,\cdots \right) $ $ {\boldsymbol{C}}_{2} $ $ {M}_{5770} $
5771 $ \left(1,-1,-\mathrm{1,1},-1,\cdots \right) $ $ {\boldsymbol{C}}_{2} $ $ {T}_{5771} $
$ \vdots $ $ \vdots $ $ \vdots $ $ \vdots $
表 4 簇中心集合存储实例

Table 4 Examples of cluster center sets

$ C $ Samples
$ {\boldsymbol{C}}_{1}=\left(1,-1,-\mathrm{1,1},-1,\cdots \right) $ 201
$ {\boldsymbol{C}}_{2}=\left(-\mathrm{1,1},-1,-\mathrm{1,1},\cdots \right) $ 145
$ {\boldsymbol{C}}_{3}=\left(\mathrm{1,1},-1,-1,-1,\cdots \right) $ 162
$ \vdots $ $ \vdots $
在大规模数据集上进行哈希编码的检索时,需要遍历所有哈希编码并计算汉明距离,计算量极其庞大,从而导致查询速度显著降低。因此,本文采用一种基于多索引哈希(Multi-Index Hashing,MIH)的高效索引结构[32],利用MIH构建多重索引哈希表$ MI=\left\{{MI}_{1},{MI}_{2},\cdots ,{MI}_{S}\right\} $存储哈希编码子串,从而加快汉明空间的近邻检索任务。多重索引哈希表MI的具体构建方式如下:
(1)对簇中心向量集合$ C=\left\{{\boldsymbol{C}}_{1}, \cdots {,\boldsymbol{C}}_{K}\right\} $进行长度划分,将每一个簇中心向量$ {\boldsymbol{C}}_{K} $的哈希编码划分为S个等长的子码。
(2)将每个簇中心向量$ {\boldsymbol{C}}_{K} $的哈希编码分解成S个子向量后存储至对应的多重索引哈希表$ {MI}_{i}{|}_{i=1}^{S} $,如图5所示。
图 5 多重索引哈希表

Fig.5 Multi-index hash table

(3)为保证簇中心向量$ {\boldsymbol{C}}_{i} $的安全性,本文采用PRF函数对$ {\boldsymbol{C}}_{i} $进行处理,即输入密钥$ {sk}_{2} $和簇中心向量$ {\boldsymbol{C}}_{i} $,PRF函数对$ {\boldsymbol{C}}_{i} $进行变换,输出一个随机值$ R\left({\boldsymbol{C}}_{i}\right) $

4.4 数据加密

在数据加密阶段,DO主要对原始多模态医疗数据(医疗影像、电子病历)以及对哈希编码进行聚类得到的簇(即索引)进行加密。
(1)对原始多模态数据集D进行加密得到$ \mathcal{E}\left(D\right) $。利用选取的对称加密算法$ \mathcal{E}\left(\cdot \right) $及其密钥$ s{k}_{1} $对组成数据集D的医疗影像数据集$ M $和电子病历数据集$ T $进行加密,得到加密的多模态数据库$ \mathcal{E}\left(D\right)= \mathcal{E}\left(M\right)\cup \mathcal{E}\left(T\right) $
(2)对聚类得到的簇集合$ {C}_{1},\cdots ,{C}_{K} $进行加密得到$ E\left({C}_{1}\right),\cdots ,E\left({C}_{K}\right) $。DO对每一个簇集合$ {C}_{i}=\big\{{\boldsymbol{h}}_{i1}, {\boldsymbol{h}}_{i2},\cdots ,{\boldsymbol{h}}_{i{n}_{i}}\big\} $执行SICP.DataEnc算法,首先输入msk中包含的参数$ \left(\boldsymbol{u},\boldsymbol{S}\right) $pp中包含的参数$ \left(p,q,n\right) $和哈希编码$ {C}_{i}=\big\{{\boldsymbol{h}}_{i1},{\boldsymbol{h}}_{i2},\cdots ,{\boldsymbol{h}}_{i{n}_{i}}\big\} $。然后,在$ {D}_{s}\in {\mathbb{Z}}_{q} $中随机采样一个n维向量$ {\boldsymbol{a}}_{ij} $,并且在高斯分布$ {DG}_{\sigma } $中采样一个k维的误差向量$ {\boldsymbol{e}}_{ij} $。接着,对于所有的$ i\in \left[1,K\right]、 j\in [1,{n}_{i}] $,计算$ {\boldsymbol{b}}_{ij}=-{\boldsymbol{S}}^{\mathrm{T}}{\boldsymbol{a}}_{ij}+\left(\dfrac{q}{p}\right)\cdot {\boldsymbol{h}}_{ij}+{\boldsymbol{e}}_{ij}\in {\mathbb{Z}}_{q}^{k} $,其中,$ {n}_{i} $表示第i个簇的数据规模,$ {\boldsymbol{h}}_{ij} $表示第i个簇中的第j个哈希编码。将计算得到的$ {\boldsymbol{b}}_{ij} $和采样得到的$ {\boldsymbol{a}}_{ij} $合并记为$ {\boldsymbol{c}}_{ij}=\left({\boldsymbol{b}}_{ij},{\boldsymbol{a}}_{ij}\right) $。最后,选取一个实数$ {e}_{ij}^{*}\in {DG}_{{\sigma }^{*}} $,计算$ {d}_{ij}=-\langle \boldsymbol{u},{\boldsymbol{c}}_{ij} \rangle +{e}_{ij}^{*}\in {\mathbb{Z}}_{q} $,生成$ E\left({\boldsymbol{h}}_{ij}\right)=\left({d}_{ij},{\boldsymbol{c}}_{ij}\right) $。最终,可以得到所有加密的簇$ E\left({C}_{1}\right),\cdots ,E\left({C}_{K}\right) $
加密完成后,$ \mathcal{E}\left(D\right) $$ E\left({C}_{1}\right), \cdots ,E\left({C}_{K}\right) $将被外包至CS。

4.5 陷门生成

在陷门生成阶段,QU首先向DO请求构建得到的多重索引哈希表。然后,生成数据的查询哈希编码$ \boldsymbol{q}\in {\left\{-\mathrm{1,1}\right\}}^{k} $,按照多重索引哈希表构造的方式将$ \boldsymbol{q} $分为S个等长的子码,再将分段的每个子码分别与对应$ MI=\left\{{MI}_{1},{MI}_{2},\cdots ,{MI}_{S}\right\} $中的子码片段进行匹配。若某段子码在其对应的索引表$ {MI}_{i} $中存在匹配项,则检索系统会将与之对应的簇中心纳入候选集合。由于每一段子码匹配到的簇中心仅代表局部相似性,所以通过对多个子码片段的匹配结果进行汇总,可以提高簇中心的查找准确性。接着,计算$ \boldsymbol{q} $与候选集中每一个簇中心的汉明距离,得到与$ \boldsymbol{q} $汉明距离最近的簇中心,即查询数据所属簇中心$ {\boldsymbol{q}}_{{\mathrm{med}}} $。最后,QU利用PRF函数及其密钥$ s{k}_{2} $对选中的簇中心$ {\boldsymbol{q}}_{{\mathrm{med}}} $进行加密得到$ R\left({\boldsymbol{q}}_{{\mathrm{med}}}\right) $;对查询请求的查询哈希编码$ \boldsymbol{q} $执行SICP.TrapGen算法生成查询陷门向量$ E\left(\boldsymbol{q}\right) $。具体地,查询用户输入msk中包含的参数$ \left(\boldsymbol{u},\boldsymbol{S}\right) $pp中包含的参数$ \left(p,q,n\right) $和查询请求$ \boldsymbol{q} $计算$ E\left(\boldsymbol{q}\right)=\boldsymbol{u}+\boldsymbol{T}\boldsymbol{q}\in {\mathbb{Z}}_{q}^{m} $,其中$ \boldsymbol{T}=\left[\begin{array}{c}{\boldsymbol{I}}_{k}\\ \boldsymbol{S}\end{array}\right] $$ {\boldsymbol{I}}_{k}\in {\mathbb{Z}}_{q}^{k\times k} $表示$ k $阶单位矩阵。密文$ R\left({\boldsymbol{q}}_{{\mathrm{med}}}\right) $和查询陷门$ E\left(\boldsymbol{q}\right) $将被提交至CS请求检索。

4.6 跨模态数据检索

CS在接收到由QU发送的查询陷门$ E\left(\boldsymbol{q}\right) $和加密的簇中心$ R\left({\boldsymbol{q}}_{{\mathrm{med}}}\right) $后,首先匹配$ R\left({\boldsymbol{q}}_{{\mathrm{med}}}\right) $与所有存储的被随机化的簇中心$ R\left({\boldsymbol{C}}_{i}\right) $($ i\in [1,K] $),选取能与$ R\left({\boldsymbol{q}}_{{\mathrm{med}}}\right) $匹配上的$ R\left({\boldsymbol{C}}_{i}\right) $对应的加密簇集合$ E\left({{\boldsymbol{C}}}_{i}\right) $。然后,对加密的簇集合$ E\left({{\boldsymbol{C}}}_{i}\right)=\big\{{E(\boldsymbol{h}}_{i1}),{E(\boldsymbol{h}}_{i2}),\cdots ,{E(\boldsymbol{h}}_{i{n}_{i}})\big\} $中的每一条密文$ E\left({\boldsymbol{h}}_{ij}\right)=\left({d}_{ij},{\boldsymbol{c}}_{ij}\right) $执行SICP.Dec算法,先将$ E\left({\boldsymbol{h}}_{ij}\right) $分解为整数$ {d}_{ij} $和向量$ {\boldsymbol{c}}_{ij} $,再计算:
$ {v}_{ij}=\left\lfloor\frac{p}{q}\cdot \left({d}_{ij}+\langle {\boldsymbol{c}}_{ij},E\left(\boldsymbol{q}\right) \rangle \right)\right\rfloor\in {\mathbb{Z}}_{p} $
得到$ E\left({\boldsymbol{h}}_{ij}\right) $$ E\left(\boldsymbol{q}\right) $的内积值,即明文空间中$ {\boldsymbol{h}}_{ij} $$ \boldsymbol{q} $的内积值。最后,计算$ {Dis}_{ij}=\dfrac{k-{v}_{ij}}{2} $得到$ {\boldsymbol{h}}_{ij} $$ \boldsymbol{q} $的汉明距离,其中$ k $为哈希编码维度。
计算出所有的$ {Dis}_{ij} $后,CS对汉明距离进行升序排列,并根据用户需求提取距离最小的前$ {n} $个,通过每一条数据的唯一身份认证符ID,返回对应的医疗图像或电子病历的密文至QU。最后QU利用$ s{k}_{1} $对加密的原始数据进行解密操作得到检索结果。

5 正确性证明与安全性分析

5.1 正确性证明

对于向量$ {\boldsymbol{h}}_{ij}、\boldsymbol{q}\in {\left\{-\mathrm{1,1}\right\}}^{k} $,假设$ 2k < p $,当素数足够大时可以支持安全计算。在计算过程中,$ msk=\left(\boldsymbol{u},\boldsymbol{S}\right)\in {\mathbb{Z}}_{q}^{m}\times {\mathbb{Z}}_{q}^{n\times k} $,矩阵变换参数T被定义为$ \boldsymbol{T}=\left[\begin{array}{c}{\boldsymbol{I}}_{k}\\ \boldsymbol{S}\end{array}\right]\in {\mathbb{Z}}_{q}^{m\times k} $,陷门$ E\left(\boldsymbol{q}\right)=\boldsymbol{u}+\boldsymbol{T}\boldsymbol{q} $,密文$ E\left({\boldsymbol{h}}_{ij}\right)=\left({d}_{ij}, {\boldsymbol{c}}_{ij}=\left({\boldsymbol{b}}_{ij},{\boldsymbol{a}}_{ij}\right)\right) $,其中随机向量$ {\boldsymbol{a}}_{ij}\in {\mathbb{Z}}_{q}^{n} $$ {\boldsymbol{b}}_{ij}=-{\boldsymbol{S}}^{\mathrm{T}}{\boldsymbol{a}}_{ij}+ \left(\dfrac{q}{p}\right)\cdot {\boldsymbol{h}}_{ij}+{\boldsymbol{e}}_{ij}\in {\mathbb{Z}}_{q}^{k} $$ d=-\langle \boldsymbol{u},{\boldsymbol{c}}_{ij} \rangle +{e}_{ij}^{*}\in {\mathbb{Z}}_{q} $$ {\boldsymbol{e}}_{ij}=({e}_{ij}^{1},{e}_{ij}^{2},\cdots , {e}_{ij}^{k}) $,计算结果为$ {v}_{ij}=\left\lfloor\dfrac{p}{q}\cdot \left({d}_{ij}+\langle {\boldsymbol{c}}_{ij},E\left(\boldsymbol{q}\right) \rangle \right)\right\rfloor\in {\mathbb{Z}}_{p} $,要使得结果$ {v}_{ij} $$ \langle {{\boldsymbol{h}}_{ij},{\boldsymbol{e}}_{ij}}\rangle $相等,概率误差不能超过$ {2}^{-\lambda } $,即满足不等式:
$ \mathrm{Pr}\left[\left|{e}_{ij}^{*}+{\sum }_{t=1}^{k}{e}_{ij}^{t}\right|\geqslant \frac{q}{2p}:{e}_{ij}^{t}\leftarrow {D}_{\mathrm{\sigma }},{e}_{ij}^{*}\leftarrow {D}_{{\mathrm{\sigma }}_{*}}\right] < {2}^{-\mathrm{\lambda }} $
证明 由矩阵转置性质可以得到$ \langle \boldsymbol{T}{\boldsymbol{h}}_{ij},{\boldsymbol{c}}_{ij} \rangle = \langle {\boldsymbol{h}}_{ij},{\boldsymbol{T}}^{\mathrm{T}}{\boldsymbol{c}}_{ij} \rangle $,等式左边为:
$\langle \boldsymbol{T}{\boldsymbol{h}}_{ij},{\boldsymbol{c}}_{ij} \rangle =\langle E\left(\boldsymbol{q}\right)-\boldsymbol{u},{\boldsymbol{c}}_{ij} \rangle =\langle E\left(\boldsymbol{q}\right),{\boldsymbol{c}}_{ij} \rangle -\langle \boldsymbol{u},{\boldsymbol{c}}_{ij} \rangle$
等式右边为:$ \langle {\boldsymbol{h}}_{ij},{\boldsymbol{T}}^{\mathrm{T}}{\boldsymbol{c}}_{ij} \rangle $,其中$ {\boldsymbol{T}}^{\mathrm{T}}= {\left[\begin{array}{c}{\boldsymbol{I}}_{k}\\ \boldsymbol{S}\end{array}\right]}^{\mathrm{T}} $=$ \left[\begin{array}{cc}{\boldsymbol{I}}_{k}& {\boldsymbol{S}}^{\mathrm{T}}\end{array}\right] $,计算可得$ {\boldsymbol{T}}^{\mathrm{T}}{\boldsymbol{c}}_{ij}=\left[\begin{array}{cc}{\boldsymbol{I}}_{k}& {\boldsymbol{S}}^{\mathrm{T}}\end{array}\right]\left[\begin{array}{c}{\boldsymbol{b}}_{ij}\\ {\boldsymbol{a}}_{ij}\end{array}\right]= {\boldsymbol{b}}_{ij}+ {\boldsymbol{S}}^{\mathrm{T}}{\boldsymbol{a}}_{ij} $,故等式右边可简化为:
$ \langle {\boldsymbol{h}}_{ij},{\boldsymbol{T}}^{\mathrm{T}}{\boldsymbol{c}}_{ij} \rangle =\left\langle {\boldsymbol{h}}_{ij},\left(\frac{q}{p}\right)\cdot \boldsymbol{q}+{\boldsymbol{e}}_{ij} \right\rangle =\left(\frac{q}{p}\right)\langle {\boldsymbol{h}}_{ij},\boldsymbol{q} \rangle +\langle {\boldsymbol{h}}_{ij},{\boldsymbol{e}}_{ij} \rangle $
由于等式两边相等,因此可以得到$ \langle E\left(\boldsymbol{q}\right),{\boldsymbol{c}}_{ij} \rangle = \langle \boldsymbol{u},{\boldsymbol{c}}_{ij} \rangle + \left(\dfrac{q}{p}\right) \langle {\boldsymbol{h}}_{ij},\boldsymbol{q} \rangle +\langle {\boldsymbol{h}}_{ij},{\boldsymbol{e}}_{ij} \rangle $,对等式两边同时加上$ {d}_{ij}= -\langle \boldsymbol{u},{\boldsymbol{c}}_{ij} \rangle +{e}_{ij}^{*} $,可得:
$ {d}_{ij}+\langle E\left(\boldsymbol{q}\right),{\boldsymbol{c}}_{ij} \rangle =\left(\frac{q}{p}\right)\langle {\boldsymbol{h}}_{ij},\boldsymbol{q} \rangle +\langle {\boldsymbol{h}}_{ij},{\boldsymbol{e}}_{ij} \rangle +{e}_{ij}^{*} $
即:
$ \frac{p}{q}\cdot \left({d}_{ij}+\langle E\left(\boldsymbol{q}\right),{\boldsymbol{c}}_{ij} \rangle \right)=\langle {\boldsymbol{h}}_{ij},\boldsymbol{q} \rangle +\left(\frac{p}{q}\right)\cdot \left(\langle {\boldsymbol{h}}_{ij},{\boldsymbol{e}}_{ij} \rangle +{e}_{ij}^{*}\right) $
当且仅当$ |\langle {\boldsymbol{h}}_{ij},{\boldsymbol{e}}_{ij} \rangle +{e}_{ij}^{*}| $受到$ \dfrac{q}{2p} $的制约时,可以得到$ {v}_{ij}=\langle {\boldsymbol{h}}_{ij},\boldsymbol{q} \rangle \ {\mathrm{mod}}\ p $

5.2 安全性分析

定理1 标准LWE问题可以在多项式时间内规约到Hint-LWE问题,并且规约的过程能够保持安全性。
假设正整数n、模数q、查询向量的维度k和正实数$ {\sigma }_{1},{\sigma }_{1}^{\prime},{\sigma }_{2}^{\prime} $满足关系:$ {\mathrm{\sigma }}_{1}=\dfrac{{\mathrm{\sigma }}_{1}^{\prime}{\mathrm{\sigma }}_{2}^{\prime}}{\sqrt{{\mathrm{\sigma }}_{1}^{\prime2}+{\mathrm{\sigma }}_{2}^{\prime2}}} $,且D是在$ {\mathbb{Z}}_{q}^{n\times k} $上的分布,则$ \mathrm{L}\mathrm{W}{\mathrm{E}}_{n,q,{\sigma }_{1}}\left(D\right) $在多项式时间内可以归约到Hint-$ {\mathrm{L}\mathrm{W}\mathrm{E}}_{n,q,{\sigma }_{1},\sqrt{k}{\sigma }_{2}^{\prime}}\left(D\right) $,且规约过程能够保持计算优势不变。
定理2 假设Hint-$ {\mathrm{L}\mathrm{W}\mathrm{E}}_{n,q,{\sigma }_{1},\sqrt{k}{\sigma }_{2}^{\prime}}\left(D\right) $问题是安全的,则基于Hint-LWE的隐私保护方案[33]是安全的。
证明 构造模拟器S,通过伪造预言机的行为来模拟真实的系统,确保敌手无法区分真实环境和模拟环境。并假设对DataEnc预言机能够进行$ Q=\mathrm{p}\mathrm{o}\mathrm{l}\mathrm{y}\left(\lambda \right) $次查询,对TrapGen预言机只进行一次查询。模拟器S的具体构造如下:
(1)模拟TrapGen预言机
敌手$ \mathcal{A} $向TrapGen预言机提交查询向量 $ \boldsymbol{q}\in \{1,-1{\}}^{k} $,模拟器S接收新的内积集合$ {P}^{\prime} $作为输入,并更新$ P\leftarrow {P}^{\prime} $。同时,模拟器生成$ E\left(\boldsymbol{q}\right)\in {\mathbb{Z}}_{q}^{n} $作为响应。
(2)模拟DataEnc预言机
敌手$ \mathcal{A} $向DataEnc预言机提交提取的哈希编码$ {\boldsymbol{x}}^{\left(\gamma \right)}\in \{1,-1{\}}^{k}\left(\gamma \in \left[1,Q\right]\right) $,模拟器S接收新的内积集合$ {P}^{\prime} $作为输入,并更新$ P\leftarrow {P}^{\prime} $。首先,模拟器随机生成向量$ {\boldsymbol{b}}^{\left(\gamma \right)}\in {\mathbb{R}}_{q}^{k} $$ {\boldsymbol{a}}^{\left(\gamma \right)}\in {\mathbb{Z}}_{q}^{n} $以及$ {\boldsymbol{c}}^{\left(\gamma \right)}=\left({\boldsymbol{b}}^{\left(\gamma \right)},{\boldsymbol{a}}^{\left(\gamma \right)}\right) $。然后,从标准差为$ \sigma 、{\sigma }_{*} $的高斯分布中随机抽样得到噪声$ {\boldsymbol{e}}^{\left(\gamma \right)}\in {D}_{\sigma } $$ {{{e}}}_{*}^{\left(\gamma \right)}\in {D}_{{\sigma }_{*}} $,并设置
$ {d}^{\left(\gamma \right)}=-\langle E\left(\boldsymbol{q}\right),{\boldsymbol{c}}^{\left(\gamma \right)} \rangle +\left(\frac{q}{p}\right)\cdot \langle \boldsymbol{q},{\boldsymbol{x}}^{\left(\gamma \right)} \rangle +{\sum }_{t=1}^{k}{{{{e}}}_{t}}^{\left(\gamma \right)}+{{{e}}}_{*}^{\left(\gamma \right)} $
最终,得到密文$ E\left({\boldsymbol{x}}^{\left(\gamma \right)}\right)=\left({d}^{\left(\gamma \right)},{\boldsymbol{c}}^{\left(\gamma \right)}\right) $作为响应。
在安全性分析中,设置Expt 0、Expt 1、Expt 2、Expt 3四个实验场景来证明现实世界的实验和模拟世界的实验在计算上是不可区分的。
1)Expt 0(真实世界实验)
在Expt 0中,假设存在一个敌手$ \mathcal{A} $,通过合法的SICP$ .{\rm{S}\rm{e}\rm{t}\rm{u}\rm{p}}({1}^{\lambda },{1}^{k}) $算法生成主密钥$ msk=\left(\boldsymbol{u},\boldsymbol{S}\right) $。所有TrapGen和DataEnc预言机的输出都严格按照真实方案的计算规则生成。
2)Expt 1(模拟世界实验)
在Expt 1中,用均匀分布随机生成$ \boldsymbol{u}\in {\mathbb{Z}}_{q}^{m} $代替真实世界实验中的$ \boldsymbol{u} $,计算生成$ E\left(\boldsymbol{q}\right) $,并且计算
${\boldsymbol{c}}^{\left(\gamma \right)}=\left({\boldsymbol{b}}^{\left(\gamma \right)}=-{\boldsymbol{S}}^{\mathrm{T}}{\boldsymbol{a}}^{\left(\gamma \right)}\left(\dfrac{q}{p}\right)\cdot {\boldsymbol{x}}^{\left(\gamma \right)}+{\boldsymbol{e}}^{\left(\gamma \right)},{\boldsymbol{a}}^{\left(\gamma \right)}\right)$
其中,$ {\boldsymbol{a}}^{\left(\gamma \right)}\in {\mathbb{Z}}_{q}^{n} $$ {\boldsymbol{e}}^{\left(\gamma \right)}\in {DG}_{\sigma }^{k} $
计算
$ {d}^{\left(\gamma \right)}=-\langle E\left(\boldsymbol{q}\right),{\boldsymbol{c}}^{\left(\gamma \right)} \rangle +\left(\frac{q}{p}\right)\cdot \langle \boldsymbol{q},{\boldsymbol{x}}^{\left(\gamma \right)} \rangle +\langle \boldsymbol{q},{\boldsymbol{e}}^{\left(\gamma \right)} \rangle +{e}_{*}^{\left(\gamma \right)} $
在敌手视角下,观察到$ \boldsymbol{u} $是随机的,与Hint-LWE模型下的分布无法区分。因此,在Expt 0和Expt 1中$ \left(E\left(\boldsymbol{q}\right),{\left\{E\left({\boldsymbol{x}}^{\left(\gamma \right)}\right)\right\}}_{\gamma \in [1,Q]}\right) $的分布是相同的。
3)Expt 2(模拟世界实验)
Expt 2在Expt 1的基础上替换密文计算中的噪声项,不根据原始方案计算$ {\boldsymbol{b}}^{\left(\gamma \right)} $,而是从$ {\mathbb{R}}_{q}^{k} $中进行均匀随机选取,设置$ {d}^{\left(\gamma \right)}=-\langle E\left(\boldsymbol{q}\right),{\boldsymbol{c}}^{\left(\gamma \right)} \rangle +\left(\dfrac{q}{p}\right)\cdot \langle \boldsymbol{q},{\boldsymbol{x}}^{\left(\gamma \right)} \rangle + \langle \boldsymbol{q},{\boldsymbol{e}}^{\left(\gamma \right)} \rangle +{e}_{*}^{\left(\gamma \right)} $,使其符合Hint-LWE结构,其中噪声项$ {\boldsymbol{e}}^{\left(\gamma \right)}\in {DG}_{\sigma }^{k} $$ {{{e}}}_{*}^{\left(\gamma \right)}\in {D}_{{\sigma }_{*}} $是独立随机的。
4)Expt 3(最终模拟世界实验)
在Expt 2的基础上,完全随机选择噪声项$ {\boldsymbol{e}}^{\left(\gamma \right)} $使得其与其他变量无关,确保攻击者得到的密文和密钥完全符合Hint-LWE分布。由于Expt 2和Expt 3完全一致,因此Expt 3和Expt 0在攻击者的视角下是不可区分的。
综上,基于LWE问题的安全内积协议是安全的,那么本文基于该协议提出隐私保护跨模态检索方案也是安全的。

6 性能分析

本文使用Python编程语言实现了所提方案,测试环境为Windows 11操作系统,2.2 GHz Intel®CoreTM i9-14900处理器,128 GB RAM。本文采用医疗跨模态数据库MIMIC-CXR Database[34],该数据库是一个公开可用的胸部X射线数据库,收录了由贝斯以色列女执事医疗中心收集的2011—2016年共377 110张胸部X光成像图片,每张图片都对应一个文本形式的诊断报告。

6.1 效率分析

图6所示,本文首先评估了不同哈希编码长度(16-bit、32-bit、64-bit、128-bit)下线性检索时间和基于索引的检索时间随数据库规模的变化。可以看出,在所有哈希编码长度下,基于索引的检索时间始终较短,且增长速度缓慢;线性检索时间随数据库规模增长呈线性增长。这表明索引结构优化了检索过程,使其应用于大规模数据集时,保持较低的检索延迟。
图 6 明文检索时间对比

Fig.6 Comparison of plaintext retrieval efficiency

明/密文检索效率对比如图7所示,结果表明,明/密文检索时间均随着数据规模的增长呈亚线性增长。同时,密文检索时间仅略高于明文检索,证明了所提密文检索算法的高效性。以图7(d)为例,当数据规模较小时(20 000~40 000),明文检索和密文检索时间相差较小,数据量增大后(>40 000),密文计算时间增长更快,但增速仍较为稳定。
图 7 明/密文检索时间对比

Fig.7 Comparison of plaintext and ciphertext retrieval efficiency

图8展示了不同哈希编码长度下所提方案的密文检索时间。测试结果表明,不同哈希编码长度下密文检索时间随数据库规模的增长呈亚线性增长。其中,16-bit计算时间最短,而128-bit计算时间最长,说明较低比特索引计算复杂度低,检索效率高。总体来看,所提方案在不同哈希编码长度下均能保持较短的检索时间,证明了方案的高效性。
图 8 不同哈希编码长度密文检索时间对比

Fig.8 Comparison of encrypted index retrieval efficiency for different bit-lengths

6.2 准确性分析

本节对所提方案的跨模态检索的准确性进行了测试,采用全类平均精度(Mean Average Precision,MAP)作为评价指标。MAP是信息检索和排名任务中常用的评价指标,用于衡量检索系统的性能。MAP是将所有类别检测的平均正确率(Average Precision,AP)进行平均得到的。假设有Q个查询,对于某个查询q,其AP$ \left(q\right)=\dfrac{1}{R}{\displaystyle\sum }_{k=1}^{N}P\left(k\right)\cdot I\left(k\right) $,其中,R是理想情况下应该检索到相关数据的总数,N为返回数据量,$ P\left(k\right) $指在前k个返回结果中的精度,$ I\left(k\right) $为指示函数,当第k个返回结果相关时取1,反之取0。
表5所示,明文检索与密文检索在查询准确率上保持一致,表明所提SICP协议在加密及安全内积计算的过程中并未影响检索的准确性。这验证了所提方案在保证数据安全的同时,仍能有效保持原始查询结果的精确度,从而确保检索系统在隐私保护环境下的可用性和可靠性。
表 5 检索准确率对比

Table 5 Comparison of retrieval accuracy

16-bit32-bit64-bit128-bit
明文0.532 60.555 70.535 10.542 3
密文0.532 60.555 70.535 10.542 3
除了使用MAP衡量整体检索性能外,本文进一步引入精度-召回率(Precision-Recall,PR)曲线对不同长度(16-bit、32-bit、64-bit、128-bit)的哈希编码明文和密文在不同召回水平下的精度表现进行了分析,如图9所示。每幅图的大体趋势基本相同,在低召回率时能保持较高准确率。值得注意的是,图中加密状态的哈希编码与明文状态下在各召回率点上的精度一致,表明所采用的隐私保护机制在保护隐私安全的同时,对检索精度没有影响。
图 9 明/密文精度-召回率曲线对比

Fig.9 Comparison of precision-recall curves on plaintext and ciphertext

在上述MAP值与精度−召回率曲线的评估基础上,为进一步验证所提方案在实际检索任务中的排序效果,引入Top-N指标,分析用户在前N个检索条目中获得相关结果的比例。图10展示了在不同长度(16-bit、32-bit、64-bit、128-bit)的哈希编码下,Top-N精度随N值变化的趋势。从图中可以观察到,明文和密文检索的精度曲线重合,验证了所提方案不影响排序精度。检索精度整体表现稳定,最高值为0.66,最低值为0.63。
图 10 明/密文Top-N精度对比

Fig.10 Comparison of Top-N precision on plaintext and ciphertext

综上,三组准确率实验都验证了本文采用的隐私保护机制对数据检索精度未造成影响。

7 结束语

本文采用一种基于LWE问题的安全内积协议SIPC设计了一个高效隐私保护的跨模态医疗数据检索方案。首先,方案基于预训练的ICMH模型生成原始跨模态数据的哈希编码,使原始数据间的语义信息最大程度地被保留在哈希编码中;然后,结合凝聚型层次聚类算法和多重索引哈希表构造高效索引结构;接着,采用SIPC协议、对称加密算法和伪随机函数保证敏感数据和查询请求在存储和检索过程中的安全性。所提方案在安全性方面可以抵抗选择明文攻击;在性能方面可以在数据量线性增长的同时保持检索时间的亚线性增长。此外,所提方案在明文域和密文域上的检索准确率一致,证明安全协议的引入对检索精度无影响。然而,所提方案会向云服务器暴露计算得到的汉明距离,泄露访问模式和搜索模式。在未来工作中,将进一步考虑外包检索的模式隐藏问题。

11平均链接:计算两类样本间所有成对样本的平均距离,并以此决定合并策略。

1
SHI Y, CHEN S, YOU X, et al. Deep supervised information bottleneck hashing for cross-modal retrieval based computer-aided diagnosis[J]. arXiv preprint, arXiv:, 2205, 08365, 2022.

2
ZHANG Y, OU W, SHI Y, et al. Deep medical cross-modal attention hashing[J]. World Wide Web, 2022, 25 (4): 1519- 1536.

DOI

3
张嘉诚, 欧卫华, 陈英杰, 等. 胸部X线影像和诊断报告的双塔跨模态检索[J]. 计算机应用研究, 2023, 40 (8): 2544- 2548.

ZHANG J C, OU W H, CHEN Y J, et al. Dual-tower cross-modal retrieval of chest X-ray images and diagnostic reports[J]. Application Research of Computers, 2023, 40 (8): 2544- 2548.

4
王祥宇, 马建峰, 苗银宾. 高效隐私保护的多用户图像外包检索方案[J]. 通信学报, 2019, 40 (2): 31- 39.

DOI

WANG X Y, MA J F, MIAO Y B. Efficient privacy-preserving outsourced image retrieval scheme for multi-users[J]. Journal on Communication, 2019, 40 (2): 31- 39.

DOI

5
谢晴晴, 宋亮晴, 冯霞. 面向医疗数据分享的轻量级且安全的搜索方案[J]. 通信学报, 2024, 45 (11): 206- 222.

DOI

XIE Q Q, SONG L Q, FENG X. A lightweight and secure search scheme for medical data sharing[J]. Journal on Communication, 2024, 45 (11): 206- 222.

DOI

6
LI Y, MA J, MIAO Y, et al. Secure and verifiable multikey image search in cloud-assisted edge computing[J]. IEEE Transactions on Industrial Informatics, 2020, 17 (8): 5348- 5359.

7
ZHU D, ZHU H, WANG X, et al. An accurate and privacy-preserving retrieval scheme over outsourced medical images[J]. IEEE Transactions on Services Computing, 2022, 16 (2): 913- 926.

8
LI M,ZHU Y,DU R,et al. LPCR-IoT:Lightweight and privacy-preserving cross-modal retrieval in IoT[J]. IEEE Internet of Things Journal,2025,DOI:10.1109/JIOT.2025.3526939.

9
CAO Y,ZHANG H,SHANG X. A privacy-preserving cross-modal retrieval scheme based on CLIP and deep hashing[C]//Proceedings of the 2025 IEEE International Conference on Acoustics,Speech and Signal Processing. IEEE,2025:1-5.

10
HOTELLING H. Relations between two sets of variates[M]. New York:Springer,1992:162-190.

11
LI D,DIMITROVA N,LI M,et al. Multimedia content processing through cross-modal association[C]//Proceedings of the 11th ACM International Conference on Multimedia. ACM Press,2003:604-611.

12
ANDREW G,ARORA R,BILMES J,et al. Deep canonical correlation analysis[C]//Proceedings of the 30th International Conference on Machine Learning. PMLR,2013:1247-1255.

13
BRONSTEIN M M,BRONSTEIN A M,MICHEL F,et al. Data fusion through cross-modality metric learning using similarity-sensitive hashing[C]//Proceedings of the 2010 IEEE Computer Society Conference on Computer Vision and Pattern Recognition. IEEE,2010:3594-3601.

14
KUMAR S,UDUPA R. Learning hash functions for cross-view similarity search[C]//Proceedings of the 22nd International Joint Conference on Artificial Intelligence. IJCAI Organization,2011:1360-1365.

15
WANG D,GAO X,WANG X,et al. Semantic topic multimodal hashing for cross-media retrieval[C]//Proceedings of the 24th International Joint Conference on Artificial Intelligence. IJCAI Organization,2015:3890-3896.

16
LIN Z,DING G,HU M,et al. Semantics-preserving hashing for cross-view retrieval[C]//Proceedings of the 2015 IEEE Conference on Computer Vision and Pattern Recognition. IEEE,2015:3864-3872.

17
JIANG Q Y,LI W J. Deep cross-modal hashing[C]//Proceedings of the 2017 IEEE Conference on Computer Vision and Pattern Recognition. IEEE,2017:3232-3240.

18
LEE K H,CHEN X,HUA G,et al. Stacked cross attention for image-text matching[C]//Proceedings of the 15th European Conference on Computer Vision. Springer,2018:201-216.

19
KARUNARATHNE S M, SAXENA N, KHAN M K. Security and privacy in IoT smart healthcare[J]. IEEE Internet Computing, 2021, 25 (4): 37- 48.

DOI

20
KOCABAS O,SOYATA T. Towards privacy-preserving medical cloud computing using homomorphic encryption[M]. Hershey:IGI Global,2020:93-125.

21
LIU Q, ZHOU F, CHEN H. Secure medical data on cloud storage via DNA homomorphic encryption technique[J]. Physical Communication, 2024, 64, 102295.

DOI

22
PARTHASARATHY S,HARIKRISHNAN A,NARAYANAN G,et al. Secure distributed medical record storage using blockchain and emergency sharing using multi-party computation[C]//Proceedings of the 11th IFIP International Conference on New Technologies,Mobility and Security. IEEE,2021:1-5.

23
ZHANG C, LUO X, FAN Q, et al. Enabling privacy-preserving multi-server collaborative search in smart healthcare[J]. Future Generation Computer Systems, 2023, 143, 265- 276.

DOI

24
FU J, WANG N, CAI Y. Privacy-preserving in healthcare blockchain systems based on lightweight message sharing[J]. Sensors, 2020, 20 (7): 1898.

DOI

25
TANG Y,XIONG L,HE M,et al. Lightweight privacy-preserving medical diagnostic scheme for internet of things healthcare[C]//Proceedings of the Sixth International Conference on Frontiers in Cyber Security. Springer Nature Singapore,2023:613-625.

26
顾一凡,杨雪冰,朱承瑶,等. 面向患者跨模态检索的图增强哈希网络模型[J]. 计算机辅助设计与图形学学报,2024,DOI:10.3724/SP.J.1089.2024-00351.

GU Y F,YANG X B,ZHU C Y,et al. A graph-enhanced hashing network model for cross-modal retrieval of patient data[J]. Journal of Computer-Aided Design & Computer Graphics,2024,DOI:10.3724/SP.J.1089.2024-00351.

27
CHATFIELD K, SIMONYAN K, VEDALDI A, et al. Return of the devil in the details: Delving deep into convolutional nets[J]. arXiv preprint, arXiv:, 1405, 3531, 2014.

28
TAUD H,MAS J F. Multilayer perceptron (MLP)[M]. Cham:Springer International Publishing,2017:451-455.

29
KIPF T N, WELLING M. Semi-supervised classification with graph convolutional networks[J]. arXiv preprint, arXiv:, 1609, 02907, 2016.

30
CHEON J H,KIM D,KIM D,et al. Lattice-based secure biometric authentication for hamming distance[C]//Proceedings of the 26th Australasian Conference on Information Security and Privacy. Springer International Publishing,2021:653-672.

31
MÜLLNER D. Modern hierarchical, agglomerative clustering algorithms[J]. arXiv preprint, arXiv:, 1109, 2378, 2011.

32
HAO R, QIN Y, QIANG Y. Fast retrieval of similar images of pulmonary nodules based on deep multi-index hashing[J]. International Journal of Wireless and Mobile Computing, 2023, 25 (4): 303- 308.

DOI

33
YANG L, ZHANG W, MIAO Y, et al. Secure and efficient cross-modal retrieval over encrypted multimodal data[J]. IEEE Transactions on Computers, 2025, 74 (4): 1405- 1417.

DOI

34
JOHNSON A E W, POLLARD T J, BERKOWITZ S J, et al. MIMIC-CXR: A de-identified publicly available database of chest radiographs with free-text reports[J]. Scientific Data, 2019, 6, 317.

DOI

文章导航

/