学术研究

基于FHE的高性能隐私保护人脸认证系统

  • 赵野 1 ,
  • 赵文鹏 2 ,
  • 王文超 1 ,
  • 彭惠康 2 ,
  • 柳笛 3 ,
  • 张海春 , 4, *
展开
  • 1. 北京市大数据中心,北京 100193
  • 2. 华中科技大学网络空间安全学院,湖北 武汉 430074
  • 3. 北京数字认证股份有限公司,北京 100080
  • 4. 湖北大学集成电路学院,武汉 430062
张海春()。

网络出版日期: 2026-05-29

基金资助

国家重点研发计划(2024YFB4505400)

版权

版权所有©《网络空间安全科学学报》编辑部 2026

High performance privacy preserving face authentication system based on fully homomorphic encryption

  • Zhao Ye 1 ,
  • Zhao Wenpeng 2 ,
  • Wang Wenchao 1 ,
  • Peng Huikang 2 ,
  • Liu Di 3 ,
  • Zhang Haichun , 4, *
Expand
  • 1. Beijing Big Data Center, Beijing 100193, China
  • 2. School of Cyber Science and Engineering, Huazhong University of Science and Technology, Wuhan 430074, China
  • 3. Beijing Certificate Authority Co., Ltd., Beijing 100080, China
  • 4. School of Integrated Circuits, Hubei University, Wuhan 430062, China

Online published: 2026-05-29

Copyright

Copyright ©2026 Journal of Aeronautical Materials. All rights reserved.

摘要

本文研究了基于全同态加密(fully homomorphic encryption,FHE)的隐私保护人脸认证系统,目标是在不泄露人脸特征的前提下,实现云端匹配并降低计算与通信开销。基于CKKS(Cheon-Kim-Kim-Song)近似同态计算方案,构建了“端侧加密、云端同态计算、可信机构解密判决”的三层架构,实现了密文特征的生成、传输、存储与匹配。针对128维人脸特征匹配需求,设计了多槽打包与批量余弦相似度评估流程,在密文域并行完成内积、模长等关键计算,且仅返回加密匹配分数。针对同态运算的性能瓶颈,采用巴雷特模约简算法并进行汇编级优化,结合OpenMP多线程技术与指令级并行技术,提升系统计算吞吐量。Intel平台的实验结果表明,优化后的巴雷特模约简算法较普通实现加速约1.96倍。通过配置32个加速线程及特定加密参数(15个模数Q、1个模数P,模数QP的总比特数为881),在批量大小为128的配置下,特征密文匹配时延由68.1 ms降至11.4 ms。表明该系统在隐私保护约束下具备高并发实时认证的性能。

本文引用格式

赵野 , 赵文鹏 , 王文超 , 彭惠康 , 柳笛 , 张海春 . 基于FHE的高性能隐私保护人脸认证系统[J]. 网络空间安全科学学报, 2026 , 4(2) : 50 -60 . DOI: 10.20172/j.issn.2097-3136.260212

Abstract

A privacy-preserving face authentication system based on fully homomorphic encryption (FHE) was investigated, with the objective of enabling cloud-side matching without disclosing facial features and reducing computation and communication overhead. Based on the CKKS (Cheon-Kim-Kim-Song) approximate homomorphic computation scheme, a three-tier architecture of client-side encryption, cloud-side homomorphic computation, and trusted authority decryption and decision was constructed to support the generation, transmission, storage, and matching of ciphertext features. For 128-dimensional facial feature matching, a multi-slot packing and batched cosine similarity evaluation workflow was designed to complete inner product and norm computations in the ciphertext domain in parallel and return only encrypted matching scores. To address the bottlenecks of homomorphic computation, Barrett modular reduction algorithm was adopted and optimized at the assembly level, and OpenMP multithreading technology and instruction-level parallelism were combined to improve the system's computational throughput. Experimental results on an Intel platform indicate that the optimized Barrett modular reduction algorithm achieves a 1.96-fold speedup over the conventional implementation. With 32 acceleration threads and specific encryption parameters (Q=15, P=1, total modulus bit-width 881), the feature ciphertext matching latency for a batch size of 128 was reduced from 68.1 ms to 11.4 ms. The results demonstrate that the system establishes a solid performance foundation for high-concurrency and real-time authentication while strictly complying with privacy-preserving constraints.

0 引言

人脸认证已广泛应用于设备解锁、门禁控制与在线服务领域,显著提升了交互便捷性与安全性。然而,人脸数据具有唯一性与不可撤销性,一旦泄露将引发身份冒用、画像追踪与功能滥用等风险。因而,在不暴露原始生物特征的前提下实现高精度认证,成为隐私保护领域亟须突破的关键问题。
全同态加密(fully homomorphic encryption,FHE)[1]支持在密文域中执行加法、乘法等任意电路计算,且解密结果与明文计算结果一致,因而可在不暴露数据内容的前提下完成复杂处理。因此,本文可在服务器侧对加密人脸特征实施匹配与判别,避免原始生物特征泄露,并支撑端云协同的隐私计算流程,在保证认证精度与可用性的同时,有效缓解身份冒用与跨场景追踪等风险。
然而,基于FHE的隐私保护人脸认证系统仍面临三大挑战。第一,计算与通信开销较高,难以满足实时性与移动端约束要求;第二,同态域中的特征提取与相似度度量受量化、近似计算及噪声增长的影响,难以权衡精度保持与鲁棒性;第三,兼容性不足,包括与现有模型及特征库的适配、与标准协议的对接,以及与业务流程及合规要求的一致性等。
基于支持浮点数同态运算的CKKS(Cheon-Kim-Kim-Song)算法,本文提出了可部署于不可信云服务商的隐私保护人脸认证系统,主要贡献如下:
1)提出“端侧加密、云端同态、可信机构解密”的三层系统架构,其通信开销仅包含密文与最小元数据,在不改动业务接口与阈值策略的前提下,可兼容现有特征库与合规要求;
2)基于CKKS原生浮点特性与加密参数,设计多槽并行匹配协议,将多组特征打包,在密文域完成批量余弦相似度计算,端云协同仅返回加密分数,由可信端侧解密判决,消除用户隐私泄露风险;
3)构建指令级与数学库协同的同态加速栈,重构多项式与向量运算算子,配合多核并行技术与编译优化策略,在Intel平台实现批量匹配的高吞吐量与低时延,兼顾了系统性能与安全性。

1 背景与原理

在数字化浪潮下,人脸认证技术已成为生物识别领域的核心力量,广泛应用于政务服务、金融支付、安防监控、门禁管理和移动设备解锁等多个领域,极大地提升了生活的便捷性与安全保障水平。
全同态加密作为密码学的核心技术,实现了对加密数据的直接计算,无需解密即可执行加法和乘法等运算,从根本上实现了“数据可用不可见”的目标。这为保障人脸认证过程中的隐私安全提供了关键的技术支撑。
FHE在人脸认证场景中的技术价值主要体现在两方面:首先,用户人脸特征可在本地加密后传输至云端,云端可直接对加密特征进行匹配运算,从而有效避免原始特征数据的泄露;其次,FHE支持多轮同态运算,可满足复杂认证逻辑的需求,且其运算结果解密后仍保持准确性,兼顾了隐私保护与认证功能的有效性。

1.1 人脸认证

常见的人脸认证系统主要由两个阶段组成:人脸注册和人脸认证。图1中,图像数据处理和人脸注册属于人脸注册阶段,图像数据处理和人脸认证属于人脸认证阶段[2]。人脸注册和人脸认证阶段的图像数据处理采用同一种方法。常见的人脸认证系统均需要对图像数据进行人脸检测与定位[3]、活体检测[4]。这两种方法可确保图像数据为真实人脸,以便进行正常的人脸认证。本文所设计的系统基于输入图像默认为真实人脸的前提,后续不再讨论活体检测等图像处理相关内容。
图 1 人脸认证系统流程

Fig.1 Facial recognition system process

在图像采集过程中,由于受到传感器本身的特性、传输过程中的干扰以及环境因素等影响,图像中不可避免地会引入噪声。噪声的存在会降低图像质量,使图像变得模糊,影响人脸特征的准确提取,进而降低人脸识别的准确率。常见的降噪算法有均值滤波、中值滤波和高斯滤波等。均值滤波是一种线性滤波算法,它通过计算像素邻域内所有像素值的平均值来替代该像素点的值,以此达到平滑图像、去除噪声的目的。例如,对于一个3×3的邻域窗口,将窗口内9个像素的灰度值相加,再除以9,得到的平均值即为中心像素的新灰度值。
彩色图像包含丰富的颜色信息,但在人脸认证中,颜色信息对认证的贡献相对较小,且会增加数据处理的复杂度。将彩色图像转换为灰度图像是人脸图像预处理的重要步骤之一,其原理主要是基于人眼对不同颜色的敏感度差异,通过特定的公式将彩色图像中的红、绿、蓝3个颜色通道的信息进行整合,得到一个只包含亮度信息的灰度图像。常用的转换公式为[5]
$ {\mathrm{Igray}}=0.299{\mathrm{R}}+0.587{\mathrm{G}}+0.114{\mathrm{B}} $
其中,R、G、B分别表示红色、绿色和蓝色通道的像素值,I表示转换后的灰度值。通过这个公式,将彩色图像中每个像素的3个颜色分量按照一定的权重进行加权求和,得到相应的灰度值。这样彩色图像就被转换为只有一个通道的灰度图像,数据维度大大减少,不仅降低了后续处理的计算量,还能减少光照对图像颜色的影响,使图像特征更加稳定,更有利于后续的特征提取和分析。
人脸特征提取算法是人脸认证系统的核心,是实现高精度认证的关键环节[6]。其功能在于从预处理后的人脸图像中获取具有独特代表性的特征信息(即嵌入),以供后续的人脸匹配和身份认证[7]。不同的特征提取算法各有其原理与优势。目前,基于深度学习的算法已成为主流,其中极具代表性的包括通过三元组损失(triplet loss)优化欧氏空间的FaceNet[8]、基于深度卷积架构的VGG-Face[9],以及在复杂场景下表现优异的FaceNet512[10]等。
FaceNet 是 Google 提出的基于深度学习的人脸识别模型。它创新性地将特征提取与分类功能整合,通过深度卷积神经网络(deep convolutional neural network,DCNN)直接学习从人脸图像到128维特征向量(即嵌)的映射。其核心在于采用三元组损失函数进行训练优化,目标是最大化不同个体(负样本对)特征嵌入间的距离,同时最小化相同个体(正样本对)特征嵌入间的距离。这种度量学习方法赋予了所提取特征强大的区分性。在实际应用中,通过计算待识别嵌入与数据库存储嵌入之间的距离(如欧几里得距离或余弦相似度),即可完成人脸验证和身份认证。FaceNet是本文实验所采用的基本模型。
尽管现有人脸认证系统在识别性能上已日趋完善,但特征提取后的生物识别数据往往以明文形式存在,极易被第三方机构非法获取或被恶意攻击者窃取,存在显著的隐私安全隐患。针对这一瓶颈,引入FHE技术可为数据安全提供底层保障,实现在保障原始图像隐私的前提下,在密文空间内直接完成特征比对与身份验证,构建端到端的隐私保护闭环。

1.2 全同态加密

全同态加密是一种特殊的公钥加密技术,其核心定义包含4个多项式时间算法,满足对加密数据的计算结果解密后,与原始数据直接计算的结果一致[11]图2为同态性示例。
图 2 同态性示例

Fig.2 Example of homomorphism

FHE 的安全性模型基于 “标准模型下的计算安全性”,核心假设为环上容错学习(ring-LWE)假设:作为BGV(Brakerski–Gentry–Vaikuntanathan)[12]、BFV(Brakerski–Fan–Vercauteren)[13]、CKKS[11]等主流全同态加密方案的安全基石,该假设断言,在多项式环结构中,任何计算能力受限的攻击者都无法以不可忽略的优势区分“带噪声的线性采样”与“纯粹的均匀随机采样”。在理论层面,Ring-LWE已被证明在特定参数设定下,可等价归约至理想格中的“最坏情况困难问题”,从而为FHE方案提供了抵御量子攻击的严谨安全保障[14]
当前主流的FHE方案在底层机制、运算域支持、精度特性以及计算效率方面存在显著差异。
BGV和BFV方案主要针对精确整数算术,在处理模运算和离散数学逻辑时表现优异,能够保证计算结果的绝对精确,常用于加密数据库查询、投票统计等场景。然而,由于它们将加密产生的噪声视为需严格剔除的干扰,随着计算深度的增加,维护噪声预算的开销(即自举过程)会显著增大,因此在处理深层复杂网络时效率受限。
CKKS方案则专为近似计算设计。与BGV/BFV不同,CKKS原生支持浮点数和复数运算,并将少量噪声融入计算精度的尾部。通过其特有的重缩放机制,CKKS能够在大规模矩阵运算和深度神经网络中保持极高的吞吐率。这使其在人工智能领域,尤其是涉及实数特征向量的人脸认证任务中,成为公认的最优选择[15]。CKKS算法同样具备用于维护乘法深度的自举操作,但重缩放机制使其自举间隔更长、自举效率更高[16-19]
TFHE(torus fully homomorphic encryption)方案则专注于逻辑门级别的快速运算[20]。它通过高效的自举技术,实现了对任意深度布尔电路的支持。虽然其在大批量数据并行,如SIMD(single instruction, multiple data)处理方面不及CKKS,但TFHE在处理复杂条件分支、比较运算及非线性函数(如神经网络中的激活函数)时具有极高的灵活性[21]
简而言之,BGV/BFV 追求数值的绝对精确,CKKS 追求 AI 计算的高吞吐量,而 TFHE 则追求逻辑计算的普适性。在神经网络处理大规模参数矩阵时,CKKS的打包和旋转效率远超基于位运算的TFHE,且精度损失在AI可接受范围内[22]。这种互补特性促成了混合加密方案的兴起,通过在模型线性层采用CKKS进行高效矩阵运算,在激活函数层切换至TFHE执行精确的非线性逻辑,从而实现性能与精度的全局最优[23-24]。在MNIST等标准数据集的神经推理测试中,主流FHE方案中CKKS在执行时间、内存占用及推理精度之间取得了最佳平衡[25]
综上,CKKS方案是人脸认证核心场景(如浮点特征云端匹配、端云协同加密计算)的首选方案,尤其适用于对精度要求高且需实时响应的场景。
CKKS算法由以下几部分构成[26]
1)密钥生成(KeyGen)算法:输入安全参数λ,输出公钥pk(ba)、私钥sk(s)与评估密钥evk。其中,公钥用于数据加密,私钥用于结果解密,评估密钥用于支持第三方在无密钥情况下执行同态运算。
2)加密(Enc)算法:输入公钥 pk(ba)与明文m(如人脸特征向量),输出密文c=Enc (pk, m)。密文需满足语义安全性,即攻击者无法从密文推断出任何明文相关信息。
$ c=(b,a)+({\mathrm{pt}},0)=({\mathrm{pt}}+b,a)$
3)解密(Dec)算法:输入私钥 sk(s) 与密文c=(c0,c1),输出明文 m=Dec (sk, c)。若密文c由合法公钥加密生成,解密结果需与原始明文完全一致;若密文被篡改,解密应返回无效标识。
$ {\mathrm{pt}}={c}_{0}+{c}_{1}\cdot s $
4)密文加法(EvalAdd)算法:输入密文ct=(c0,c1),ct '=(c0',c1'),输出密文cAdd。
$ {\mathrm{cAdd}}={\mathrm{ct}}+{\mathrm{ct}}'=({c}_{0}+{c}_{0},{c}_{1}+{c}_{1}') $
5)密文乘法(EvalMult)算法:输入评估密钥evk,输入密文ct=(c0,c1),ct '=(c0',c1'),输出密文cMult。
$ \begin{aligned}{\mathrm{cMult}}&={\mathrm{Rel}}(ct\cdot ct')\\&={\mathrm{Rel}}(({c}_{0},{c}_{1})\cdot ({c}_{0}',{c}_{1}'))\\&={\mathrm{Rel}}({c}_{0}\cdot {c}_{0}',{c}_{0}\cdot {c}_{1}'+{c}_{1}\cdot {c}_{0}',{c}_{1}\cdot {c}_{1}')\\&={\mathrm{Rel}}({d}_{0},{d}_{1},{d}_{2})\\&=({d}_{0},{d}_{1})+{\mathrm{switchkey}}({d}_{2},{\mathrm{evk}})\end{aligned} $
6)密文旋转(EvalRotate)算法:输入评估密钥evk、密文ct=(c0,c1)、旋转下标k,输出密文cRotate。
$ {\mathrm{cRotate}}=(c_{0}^{{5}^{k}},0)+{\mathrm{SwitchKey}}(c_{0}^{{5}^{k}},{\mathrm{evk}}) $

2 系统设计

2.1 整体架构

系统采用“客户端—政府—服务端”三层架构(如图3所示),各层职责清晰、协同联动,在保障隐私安全的同时满足认证流程的高效运转,具体架构设计如下。
图 3 整体架构

Fig.3 Overall system architecture

客户端(用户):作为系统与用户的交互入口,部署于移动端(如手机、平板)或终端设备(如门禁终端),核心功能包括人脸图像采集、本地预处理(降噪、灰度转换等)、明文特征生成(基于轻量化FaceNet模型)、图像特征加密及解密结果展示。该层不存储原始人脸图像与明文特征,仅在本地短暂处理后立即加密,从源头防范敏感数据泄露风险,适配手机APP登录、门禁刷脸等多类用户使用场景。
服务端(算力中心):包括密文存储层、密态计算层和软硬件加速层。密态计算层是系统的核心运算层,部署于Intel服务器,集成全同态加密运算、密文匹配引擎与安全增强模块。其中,FHE运算模块基于优化后的CKKS方案实现密文加/解密、同态评估;密文匹配引擎依托MKL(math kernel library)与AVX-512指令优化向量内积[27]、余弦相似度计算;安全增强模块通过SGX(software guard extensions)技术构建可信执行环境,保护FHE密钥与核心算子不被恶意窃取。该层支持“端侧加密—云端运算”协同模式,无需解密即可完成密文特征匹配,实现“数据可用不可见”。该层由软硬件加速层提供支撑,其中包含特定的底层加速与并行加速设计。密文存储层采用分布式数据库架构,仅存储用户标识及加密后的人脸特征密文。数据库仅允许加密处理层通过认证的接口读取密文数据,同时支持密文特征的快速索引构建。
政府(认证中心):包含密钥管理层、认证反馈层与结果反馈层。密钥管理层会生成特定的密钥对(私钥、公钥和评估密钥),政府保存密钥对,在其他模块需要加密或运算时才会发布对应密钥。仅在结果解密层使用私钥进行解密,并将最终结果反馈至认证反馈层,由其返回最终认证结果。
本文构建了如下威胁模型:假设云端为半诚实第三方,其目标是获取特征向量隐私,但不会篡改计算逻辑。私钥由政府严格管控,端侧与云端均无权访问。安全目标在于,即便云端数据库全库泄露,攻击者在没有对应私钥的情况下也无法还原任何有效的人脸特征,且攻击者与云端被设定为互不合谋,从而确保了信任边界的物理隔离。

2.2 工作流程

围绕设计的系统整体框架,本节进一步介绍整个系统的工作流程,该流程分为注册流程和认证流程,其完整工作流程如图4所示。
图 4 工作流程

Fig.4 Work process

(1)注册流程
1)政府生成包含私钥、公钥、评估密钥的密钥对,将公钥发送至客户端,将评估密钥发送至企业。用户通过客户端发起注册请求,客户端调用摄像头采集人脸图像,在本地完成预处理(含降噪、直方图均衡化、几何校正),生成标准化人脸图像。
2)客户端基于轻量化FaceNet模型提取128维浮点特征向量,调用本地CKKS加密模块(加载政府预生成的公钥),将明文特征加密为密文。
3)验证通过后,加密处理层将密文特征与用户标识同步至存储层分布式数据库,完成注册,同时向移动端返回“注册成功”的加密反馈(仅政府生成的私钥可将该结果解密为明文)。
(2)认证流程
1)用户发起认证请求,客户端实时采集人脸图像,重复注册流程中的预处理、特征提取及加密步骤,生成待认证密文特征。
2)待认证密文特征与认证请求标识(含时间戳、随机数)通过接入层传输至密态计算层。
3)企业根据用户ID从存储层调取该用户对应的历史密文特征模板,通过密态计算求解两个密文特征的欧氏距离,生成加密的相似度分数(值0~1)。
4)接入层将加密的相似度分数回传至政府后端,政府通过私钥解密获取明文分数,并将其与预设阈值(如0.8)进行比对分析,根据比对结果判定认证状态,实时向客户端及关联企业推送认证结论。
5)客户端将“通过/失败”的认证结果同步至业务系统(如APP登录授权、门禁开门指令),同时向密态计算层反馈认证状态,用于日志记录与异常分析。

2.3 算子优化

本文在设计实现中采用多种算子优化技术,旨在缓解FHE带来的性能瓶颈,提升整个系统的执行效率。

2.3.1 模约简优化

在CKKS同态加密方案中,模约简运算的效率直接影响同态运算的整体效率。针对方案中密集的模运算需求,本文选取巴雷特模约简算法作为基本模约简算子。相较于传统试商除法与蒙哥马利约减算法,巴雷特模约简算法通过预计算常数将除法操作转化为乘法与移位运算,规避了除法的高额开销;同时,该算法输入范围较广,更适用于多模数场景[28]
对于取模运算,可采用形如求余运算的方式。但是除法计算在计算机中是非常耗时的,巴雷特约减引入预计算与移位替换除法。公式(7)正是这一思想的数字表达:
$ r=a-\left\lfloor \frac{a}{q}\right\rfloor \cdot q $
$ r=a-\left\lfloor \frac{a}{{2}^{k}}\cdot \frac{{2}^{k}}{a}\right\rfloor \cdot q $
即预计算$ \left\lfloor \dfrac{{2}^{k}}{q}\right\rfloor $,对a采用向右移位操作。
本文对基本的巴雷特模约简算法进行底层优化,通过对其计算流程与数据进行汇编优化,旨在消除巴雷特模约简算法中的冗余计算部分。优化的巴雷特模乘计算流程如图5所示。
图 5 优化的巴雷特模乘计算流程

Fig.5 Optimizing the calculation process of Barrett modular multiplication

本算法用于高效计算两个64位无符号整数IN0与IN1乘积的模运算结果,即(IN0×IN1) mod q。首先,计算IN0与IN1的128位精确乘积A。接着,将128位乘积A与预先计算的128位巴雷特常数m相乘。主要步骤如下:将AhA的高64位)与ml(m的低64位)相乘,取128位结果的高64位存入res0;将Al(A的低64位)与mh(m的高64位)相乘,取128位结果的高64位存入res2;将Ah与mh相乘,取128位结果的低64位存入res5;最后将res0、res2、res5相加,得到商A/q的64位近似估计值result。
随后,将该估计值result与模数q相乘,得到128位减法项。取128位减法项的低64位存入寄存器res6中,然后以A的低64位减去res6,获得初步的64位模乘结果result'。由于巴雷特模约简算法的近似特性,该result'可能落在[0, 2q−1]内,因此需进行最终的条件修正。通过对result'依次执行与q、2q的带标志位减法操作(SUBS),并依据由此产生的溢出标志位进行逻辑判定,最终确保输出结果位于[0, q−1]内。

2.3.2 并行优化

OpenMP(open multi-processing)是一种用于共享内存多处理器系统的并行编程API[29]。它通过编译器指令,使程序员可在现有串行代码基础上简单添加并行化指令,从而实现高效的多线程并行计算。OpenMP支持多种编程语言,包括C、C++和Fortran。本文主要采用C++语言与OpenMP实现多线程优化。
OpenMP的工作原理基于任务分发模型。程序员通过插入特定编译指令定义并行区域,编译器根据这些指令生成相应的并行代码。在运行时,OpenMP运行时库负责创建和管理线程池,并将任务分配给各个线程执行。
为解决FHE运算效率低、资源占用高的核心痛点,适配人脸认证的实时性需求,本文从FHE方案特性挖掘、硬件指令并行、软件库协同优化3个维度构建多层级并行加速体系,实现“密文计算吞吐量提升—资源利用率优化—认证时延降低”的目标,具体设计如下。
CKKS方案的“多槽编码”特性是并行加速的核心基础,其允许将多个实数/复数明文打包至单个密文的“槽位”中,通过单次同态运算完成多组数据的并行计算,大幅降低加密/运算总次数。结合人脸认证的128维浮点特征场景,本文设计了针对性的并行编码与运算策略:CKKS的槽位数量由多项式环维度(poly_modulus_degree)决定,当参数配置为poly_modulus_degree=32768(即多项式次数为32768)时,单个密文可提供32768/2=16384个有效槽位(复数域编码下,槽位数量为多项式维度的1/2)。针对128维人脸特征向量,采用“行优先批量打包”方式。
1)将N组128维特征向量(如N=128)按“特征维度—样本序号”顺序展开,形成128×128=16384个浮点值序列,恰好填满单个密文的所有槽位。
2)例如,第i个样本(i=0~127)的第j维特征(j=0~127)对应序列索引idx=i×128+j,该值被编码至密文的第idx个槽位中。
3)高位槽位预留“零缓冲区”(若样本数不足128组,剩余槽位填充0),避免循环卷积运算中不同样本特征的交叉干扰。
通过该策略,原本需128次独立加密的128组特征,可压缩为1次加密操作,显著降低端云交互时延。
人脸匹配的核心运算为“余弦相似度计算”,其本质是“向量内积+模长归一化”,可分解为加法与乘法的组合运算。基于多槽编码的密文,可通过单次同态评估完成多组特征的并行匹配。
1)并行内积计算:设待认证密文C_query(含128组待认证特征)与数据库模板密文C_template(含128组模板特征),通过CKKS的EvalMult(同态乘法)指令对两密文的对应槽位执行元素级乘法,再通过EvalSum(同态求和)指令对每个样本的128个维度乘积结果求和,单次运算即可得到128组特征的内积值。
2)并行模长计算:对C_query和C_template分别执行“平方(EvalMult自身)—求和—开方(近似同态运算)”流程,由于CKKS不支持非多项式运算,本系统采用7次切比雪夫多项式对开方进行最佳一致逼近。该过程消耗3层乘法深度,并在每次多项式乘法后执行重缩放以对齐缩放因子。单次运算得到128组特征的模长。
3)并行相似度计算:将内积结果与模长乘积(EvalMult计算)相除,得到128组特征的余弦相似度,全程无需解密,且运算次数仅为单样本场景的1/128。但由于CKKS不支持除法运算,本文采用15次切比雪夫多项式对1/x函数进行拟合逼近,通过多项式计算结合重缩放实现同态除法运算。
针对云端多用户并发认证场景,基于OpenMP实现多核资源的动态调度,核心策略如下。
1)任务拆分:将“密文匹配”任务按“样本组—运算步骤”拆分,如将1000组待认证特征拆分为8个任务块(每块125组),分配至Intel i9-13900K的8个性能核心并行处理;
2)负载均衡:通过动态任务调度机制,实时调整各核心的任务量,避免单个任务块运算耗时差异导致的核心空闲(如部分样本特征模长较大,开方运算耗时略长);
3)资源隔离:利用CPU的“硬件线程调度”功能,将FHE运算任务绑定至性能核心,避免与系统其他进程(如数据库查询)抢占资源,确保运算稳定性。

3 实验分析

3.1 实验设置

实验在Intel平台上进行,系统设置见表1
表 1 系统设置

Table 1 System configuration

配置项目 详细参数
处理器 Intel Core i9-13900K
计算架构 x86-64
核心/线程数 24核 (8个性能核 + 16个能效核) / 32线程
性能核频率 4.3~5.8 GHz
能效核频率 2.2~3.0GHz
内存 64GB DDR5 4800MHz
本实验采用LFW作为性能评估的核心基准数据集。LFW数据集包含从互联网收集的13 233张人脸图像,涵盖5 749位不同身份的人物。该数据集的图像在姿态、表情、光照、遮挡及拍摄环境(非受限场景)上具有极高的随机性,可有效模拟真实世界中的人脸认证挑战。
本次实验采用Windows 10操作系统版本号为10.0.19045;Python版本为3.9.25。

3.2 准确性与误差验证

由于本系统采用的CKKS全同态加密方案属于近似算术加密,其加密与解密过程引入的微量噪声可能对人脸特征的匹配精度产生影响。因此,本节主要验证密文计算结果与明文直接计算结果的一致性,确保隐私保护措施不会降低人脸认证的准确率。
实验选取LFW数据集中的1 000对人脸图像作为测试样本,其中500对为同一身份(正样本),500对为不同身份(负样本)。首先利用FaceNet模型提取明文特征向量,计算其明文余弦相似度;随后将明文特征向量加密,在密文域执行同态内积与模长运算,解密后得到密文相似度。
为验证本文隐私计算架构对不同模型性能的影响,本文采用识别准确率作为评价指标。不同模型下的识别准确率如表2所示。
表 2 不同模型下的识别准确率

Table 2 Recognition accuracy under different models

模型 识别准确率
FaceNet 98.6%
VGG-Face 97.4%
实验结果表明,虽然CKKS全同态加密方案属于近似算术加密且会引入微量噪声,但其对人脸特征匹配精度的影响微乎其微。FaceNet模型在隐私计算框架下的识别准确率达到98.6%,VGG-Face模型为97.4%。这表明密文域下的相似度计算结果与明文计算结果(FaceNet模型准确率为99.63%[8]、VGG-Face模型为98.95%[9])具有高度一致性,验证了本文系统在实现严密隐私保护的同时,能够兼顾人脸认证的高精度需求,保障业务层面的可用性。

3.3 性能分析

为验证本文提出的算子优化与并行策略在实际应用中的性能提升效果,实验主要从基础算子耗时角度展开评估。
首先,针对2.3.1节提出的优化巴雷特模约简算法进行性能测试。在相同硬件环境下(Intel i9-13900K),分别采用C++标准库取模运算符(%)与本文优化的巴雷特模约简算子,对1亿次大整数模约简运算进行性能统计。实验结果如表3所示。
表 3 模约减算法性能

Table 3 Performance of modular reduction algorithms

模约简算法耗时/ms
试商除法4844
普通巴雷特3615
优化巴雷特1846
实验发现,汇编优化显著提升了巴雷特模约简算子的执行效率。相较于普通巴雷特模约简算法(未优化版本),优化后的算法实现性能提升了1.96倍。同时,与传统试商除法相比,汇编优化后的巴雷特模约简算法展现出显著优势。这得益于巴雷特算法将开销较高的除法指令转化为移位与乘法指令,显著降低了CPU周期消耗,为上层复杂的同态评估奠定了高效基础。
其次,针对2.3.2节设计的OpenMP多线程并行与多槽编码策略,实验测试了128批量大小下的同态算法及人脸特征密文匹配耗时。实验采用128组(填满单个密文槽位)特征向量进行测试(其中,CKKS测试参数为15个模数Q,1个模数P,模数QP的总比特数为881),并对比开启OpenMP前后的计算时延。
表4性能评估结果显示,本文提出的算子优化与并行策略显著提升了系统效率。在系统级运算上,得益于算子优化,核心的“特征密文匹配”耗时从单线程的68.1 ms缩减至11.4 ms。该多层级并行加速体系有效克服了全同态加密开销较高的痛点,使系统具备了支撑高并发、实时化人脸认证场景的能力。
表 4 同态算法的性能结果

Table 4 Performance results of homomorphic algorithms

算法 单线程耗时/μs 多线程耗时/μs
CKKS加密 54274 9423
CKKS密文加密文 7710 1299
CKKS密文加明文 1305 214
CKKS密文乘密文 321802 38017
CKKS密文乘明文 15377 1094
CKKS密文旋转 263090 33103
CKKS密文共轭 257093 34164
特征密文匹配 68161 11435
在该实验参数配置下,系统可将128组人脸特征向量打包至单张密文中进行同步比对,因此客户端向服务端传输的单次认证密文大小为3.75 MB。

4 结束语

面向不可信云环境下的人脸认证隐私风险,本文完成了基于全同态加密的端云协同认证原型构建与实验验证。系统在认证链路中以密文形态传输和存储人脸特征,云端仅执行同态匹配计算并输出加密相似度分数,最终由可信机构完成解密与阈值判决,从流程层面降低了生物特征在服务侧的暴露风险。围绕同态计算开销较高的问题,本文完成了关键算子的实现优化与多核并行加速,并在给定平台上对端到端匹配时延进行了测试与对比,验证了相关优化对认证性能的支撑作用。
本文系统仍有一定改进空间,如CKKS近似计算带来的误差控制与参数配置敏感性问题,以及评估密钥与密文计算导致的资源开销问题。后续研究可围绕以下方向开展:①面向场景的参数与精度管理研究,建立基于安全级别、特征分布与阈值策略的CKKS参数选型与自动调参流程,结合误差上界估计与在线校准机制,实现精度漂移的监测与告警,并在不同终端形态与网络条件下验证端云协同的稳定性与一致性。②面向信创云环境开展系统化适配与验证,围绕国产CPU指令特性、编译器与数学库差异、虚拟化与容器运行时开销及内存带宽约束,重构并优化数论变换、模约简、旋转与重线性化等热点算子。建立覆盖不同信创云平台的基准测试与回归测试体系,量化吞吐量、时延、资源占用率与能效,并评估密钥管理、可信执行与日志审计等安全能力在信创云软硬件栈下的可用性与一致性。③面向真实政务服务、商用领域信息系统的集成与落地开展工程化研究,形成与现有人脸SDK、特征库、鉴权协议及风控链路的标准化接口与中间件封装,支持灰度发布、回滚及可观测性监控,完善密钥生命周期管理与合规审计流程,并在门禁、支付、在线登录等业务场景开展端到端压力测试与可用性验证。
1
Cheon J H, Han K, Kim A, et al. A full RNS variant of approximate homomorphic encryption[C]//Selected Areas in Cryptography – SAC 2018. Cham: Springer International Publishing, 2019: 347-368.

2
Deng Z Y, Chiang H H, Kang L W, et al. A lightweight deep learning model for real-time face recognition[J]. IET Image Processing, 2023, 17 (13): 3869- 3883.

DOI

3
Thaher T, Mafarja M, Saffarini M, et al. A comprehensive review of face detection techniques for occluded faces: methods, datasets, and open challenges[J]. Computer Modeling in Engineering & Sciences, 2025, 143 (3): 2615- 2673.

DOI

4
Yu Z T, Qin Y X, Li X B, et al. Deep learning for face anti-spoofing: a survey[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2023, 45 (5): 5609- 5631.

5
Gonzalez R C. Digital image processing[M]. 3rd ed. New Delhi: Pearson Education India, 2009: 1-845.

6
Guo G D, Zhang N. A survey on deep learning based face recognition[J]. Computer Vision and Image Understanding, 2019, 189, 102805.

DOI

7
Deng J K, Guo J, Xue N N, et al. ArcFace: additive angular margin loss for deep face recognition[C]//Proceedings of the 2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) . Piscataway: IEEE Press, 2019: 4685-4694.

8
Schroff F, Kalenichenko D, Philbin J. FaceNet: a unified embedding for face recognition and clustering[C]//Proceedings of the 2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR) . Piscataway: IEEE Press, 2015: 815-823.

9
Parkhi O M, Vedaldi A, Zisserman A. Deep face recognition[C]//Proceedings of the Proceedings ofthe British Machine Vision Conference 2015. British Machine Vision Association, 2015: 41.1-41.12.

10
Cao Q, Shen L, Xie W D, et al. VGGFace2: a dataset for recognising faces across pose and age[C]//Proceedings of the 2018 13th IEEE International Conference on Automatic Face & Gesture Recognition (FG 2018) . Piscataway: IEEE Press, 2018: 67-74.

11
Cheon J H, Kim A, Kim M, et al. Homomorphic encryption for arithmetic of approximate numbers[M]//Advances in Cryptology – ASIACRYPT 2017. ChamSpringer International Publishing2017: 409-437.

12
Brakerski Z, Gentry C, Vaikuntanathan V. (leveled) fully homomorphic encryption without bootstrapping[J]. ACM Transactions on Computation Theory, 2014, 6 (3): 1- 36.

DOI

13
Fan J, Vercauteren F. Somewhat practical fully homomorphic encryption[J]. Cryptology ePrint Archive, 2012 (144): 1- 36.

14
Lyubashevsky V, Peikert C, Regev O. On ideal lattices and learning with errors over rings[C]//Advances in Cryptology – EUROCRYPT 2010. Berlin, HeidelbergSpringer, 2010: 1-23.

15
Boemer F, Lao Y X, Cammarota R, et al. nGraph-HE: a graph compiler for deep learning on homomorphically encrypted data[C]//Proceedings of the 16th ACM International Conference on Computing Frontiers. New York: ACM, 2019: 3-13.

16
Cheon J H, Han K, Kim A, et al. Bootstrapping for approximate homomorphic encryption[C]//Advances in Cryptology – EUROCRYPT 2018. ChamSpringer International Publishing, 2018: 360-384.

17
Han K, Ki D. Better bootstrapping for approximate homomorphic encryption[C]//Topics in Cryptology – CT-RSA 2020. ChamSpringer International Publishing, 2020: 364-390.

18
Lee Y, Lee J W, Kim Y S, et al. High-precision bootstrapping for approximate homomorphic encryption by error variance minimization[C]//Advances in Cryptology – EUROCRYPT 2022. ChamSpringer International Publishing, 2022: 551-580.

19
Alexandru A, Kim A, Polyakov Y. General functional bootstrapping using CKKS[C]//Advances in Cryptology – CRYPTO 2025. ChamSpringer Nature Switzerland, 2025: 304-337.

20
Chillotti I, Gama N, Georgieva M, et al. TFHE: fast fully homomorphic encryption over the torus[J]. Journal of Cryptology, 2020, 33 (1): 34- 91.

DOI

21
Chillotti I, Joye M, Paillier P. Programmable bootstrapping enables efficient homomorphic inference of deep neural networks[M]//Cyber Security Cryptography and Machine Learning. ChamSpringer International Publishing, 2021: 1-19.

22
Podschwadt R, Takabi D, Hu P Z, et al. A survey of deep learning architectures for privacy-preserving machine learning with fully homomorphic encryption[J]. IEEE Access, 2022, 10, 117477- 117500.

DOI

23
Lu W J, Huang Z C, Hong C, et al. PEGASUS: bridging polynomial and non-polynomial evaluations in homomorphic encryption[C]//Proceedings of the 2021 IEEE Symposium on Security and Privacy (SP) . Piscataway: IEEE Press, 2021: 1057-1073.

24
Wang Z W, He H Q, Zhao L T, et al. Chameleon: an efficient FHE scheme switching acceleration on GPUs[J]. IEEE Transactions on Parallel and Distributed Systems, 2025, 36 (11): 2264- 2280.

DOI

25
Clet P E, Stan O, Zuber M. BFV, CKKS, TFHE: which one is the best for a secure neural network evaluation in the cloud? [C]//Applied Cryptography and Network Security Workshops. Cham: Springer, 2021: 279-300.

26
Bossuat J P, Mouchet C, Troncoso-Pastoriza J, et al. Efficient bootstrapping for approximate homomorphic encryption with non-sparse keys[C]//Advances in Cryptology – EUROCRYPT 2021. ChamSpringer International Publishing, 2021: 587-617.

27
Wang J D, Yu L X, Zhuang W, et al. Research on vector extension of instruction set architecture[C]//Proceedings of the 2024 3rd International Conference on Cloud Computing, Big Data Application and Software Engineering (CBASE). Piscataway: IEEE Press, 2024: 378-385.

28
Bosselaers A, Govaerts R, Vandewalle J. Comparison of three modular reduction functions[C]//Advances in Cryptology — CRYPTO’ 93. Berlin, HeidelbergSpringer, 2007: 175-186.

29
Dagum L, Menon R. OpenMP: an industry standard API for shared-memory programming[J]. IEEE Computational Science and Engineering, 1998, 5 (1): 46- 55.

DOI

文章导航

/