Academic Research

Applicability of capsule networks in side-channel analysis

  • Wu Yuhan ,
  • Lü Jiqiang , *
Expand
  • School of Cyber Science and Technology, Beihang University, Beijing 100191, China

Online published: 2026-04-02

Copyright

Copyright ©2026 Journal of Aeronautical Materials. All rights reserved.

Abstract

Side-channel analysis (SCA), which extracts physical information such as power consumption and electromagnetic radiation during the operation of cryptographic devices to recover secret keys, is a critical technique for evaluating the security of cryptographic modules. Deep learning is widely adopted in this field due to its powerful feature extraction capabilities. However, the applicability of emerging neural network architectures needs systematic evaluation. Capsule network (CapsNet), as an innovative architecture, are widely applied and perform well in image recognition, but its applications in side-channel analysis tasks remain limited. The suitability of CapsNet for SCA is investigated. A lightweight CapsNet architecture is designed, an exhaustive hyperparameter search is conducted, and leading degree (LD) is used as the core evaluation metric to determine optimal configurations. The performance of CapsNets is rigorously compared with state-of-the-art convolutional neural networks (CNN) based on the ASCAD dataset under identical experimental parameters. Experimental results demonstrate that CapsNets achieve only 59%~75% of the LD values of CNN under both the hamming weight (HW) and Identity leakage models. Furthermore, CapsNets exhibit slower convergence, poorer stability, and a parameter count 5 to 50 times higher than that of CNN, leading to significantly increased computational and spatial overhead. The performance gap stems from the misalignment between the spatial-semantic optimization objectives of CapsNets and the temporal pattern mining requirements of SCA. The dynamic routing mechanism has limited sensitivity to local temporal features, while excessive parameters amplify the upper bound of generalization error under limited data, thereby exacerbating overfitting risks. These results and analysis verify the inherent incompatibility between

Cite this article

Wu Yuhan , Lü Jiqiang . Applicability of capsule networks in side-channel analysis[J]. Journal of Cybersecurity, 2026 , 4(2) : 1 -14 . DOI: 10.20172/j.issn.2097-3136.260301

0 引言

侧信道分析(side-channel analysis,SCA)通过提取加密设备运行时泄露的物理信息(如时间[1]、能量[2]、电磁辐射[3]、Cache访问特征[4]等)恢复密钥,已成为密码设备安全评估的关键技术手段。传统侧信道分析依赖统计方法(如相关能量分析[5]),而深度学习(deep learning,DL)凭借其强大的特征提取能力,显著提升了针对防护措施(如掩码[6]、乱序[7]等操作)的攻击效率。早在1991年,Rivest[8]就指出,机器学习与密码分析两个领域联系紧密、相辅相成。2016年以来,深度学习技术与侧信道分析的有机结合,深刻改变了密码算法实现的安全评估工作。该领域的工作主要侧重于侧信道分析建模,即利用监督学习对已知设备产生的泄露信息进行模型训练。当前工作中,多层感知机(multilayer perceptron,MLP)[9]和卷积神经网络(convolutional neural network,CNN)[10]是较常使用的模型,这些模型可自主且高效地学习密码设备的泄露模式与噪声表示;与相关能量分析(correlation power analysis,CPA)[5]相比,其简化了建模流程,显著减少了成功恢复密钥字节所需的能量迹数量。
2019年以来,部分工作开始关注跨设备侧信道分析的实现,即将一个模型应用于多个设备的攻击,使该模型能够学习不同设备间的差异,进而提高模型的泛化能力[11-14]。与此同时,该领域也有部分工作致力于完善评估指标。成功率(success rate,SR)和猜测熵(guessing entropy,GE)[15]是目前广泛采用的两项评估指标,但分别存在模型高性能场景下评估粒度不足、计算开销过大等问题。这些问题推动了Ranking Loss[16]、Leading Degree[17]等新型评估方法的研究,前者可量化关键字节的置信度并大幅降低计算开销,后者通过优化计算方法加快收敛速度。
2022年以来,基于深度学习的侧信道分析已成为多层次、宽领域的研究方向,随着Transformer[18]、生成对抗网络[19]等诸多新型神经网络模型的引入,其研究范围已扩展到可解释性与对抗鲁棒性等方面[20-24]。由于该领域工作所使用的模型更复杂、研究内容更深入,计算所需的时空开销也相应增大,若不经验证盲目移植新模型,极易造成算力资源的浪费。在此背景下,采用高效、统一的标准评估新兴网络架构在侧信道分析中的适用性具有重要意义。
胶囊网络(capsule network,CapsNet)是Sabour等[25]于2017年提出的神经网络模型,其动态路由机制通过向量化胶囊编码空间层级关系,提升了视角不变性建模能力,展现出较好的应用潜力。胶囊网络在图像识别、面部表情识别等领域已取得较好表现[26],但在侧信道分析领域的应用仍缺乏系统研究。针对上述问题,本文聚焦胶囊网络在侧信道分析中的适用性研究,主要工作包括:基于现有胶囊网络架构,设计面向侧信道分析的模型;对模型进行穷举式超参数搜索,确定性能最佳的超参数设置;基于ASCAD数据集[27]开展对照实验,以引导度(leading degree,LD)[17]作为主要性能标准,测定并对比上述最佳模型与SOTA CNN模型在汉明重量(Hamming weight,HW)与恒等(identity,ID)泄露模型下的侧信道分析建模性能。结果表明,胶囊网络的综合性能未超过CNN的75%,由此验证了胶囊网络在侧信道分析建模中的结构性失效问题,证明其动态路由机制与侧信道分析的时序需求不匹配。

1 预备知识

1.1 符号

在本文的符号系统中,大写字母(如X)用于表示集合。小写字母x表示集合中标量的具体实例,向量则使用粗体小写字母带箭头上标表示(如$ \overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{x}}}} $)。侧信道能量迹数据集记为T,其视作若干一维迹线$ {\overset{\mathrm{\rightharpoonup }}{{t}}}_{{i}} $的集合,这些迹线由明文$ {{p}}_{{i}} $和密钥$ {{k}}_{{i}} $生成,每条能量迹与敏感中间变量$ {{z}}_{{i}}{=f(}{{p}}_{{i}}{,}{{k}}_{{i}}{)} $相关(如第一次字节代替的结果)。符号K表示完整密钥空间,包含所有密钥假设。训练集、验证集和攻击集的能量迹数量分别记为$ {{N}}_{{P}} $$ {{N}}_{{V}} $$ {{N}}_{{A}} $。此外,采用||·||代表对向量取模长,采用|·|代表取集合的大小,E[·]代表求期望,Var[·]代表求方差。

1.2 ASCAD数据集

2018年提出的ASCAD开源数据集[27],被广泛应用于基于深度学习的侧信道分析研究。该数据集能量迹采集自搭载8位ATMega8515微控制器的开发板,对应其上一阶掩码AES-128加密实现,包含两个主要版本:ASCADf与ASCADr,每个版本均提供不同失同步等级的子集(如ASCADf-desync50)。具体而言,ASCADf版本包含50 000条训练用能量迹和10 000条攻击用能量迹,每条能量迹包含100 000个时间样本点。与第一轮加密中第3个字节的代换操作高度相关的700个样本点被选定为分析区域,且训练集与测试集均采用固定的128位密钥。ASCADr版本包含200 000条训练用能量迹和100 000条攻击用能量迹,每条能量迹包含250 000个时间样本点。与第一轮加密中第3个字节的代换操作高度相关的1400个样本点被选定为分析区域,其训练集采用随机选择的密钥,测试集则使用固定密钥。

1.3 泄露模型

密码设备的功耗行为通常较为复杂,且在不同实现方案中呈现显著差异。因此,攻击者通常采用泄露模型(leakage model,LK)来估计选定中间值对应的实际功耗,辅助侧信道区分器进行分类识别。广泛应用的泄露模型包括HW模型和ID模型。其中,HW模型假定功耗与中间值的置位数直接相关,即一个字节的汉明重量是其8个比特中值为1的位数,表述为$ {{\mathrm{LK}}(z)= {\mathrm{HW}}(z)+{\mathrm{noise}}} $,其中,noise代表设备噪声。ID模型则假设处理任意两个不同中间值时的功耗均具有唯一性,每个字节将被映射为自身原本的数值,即$ {{\mathrm{LK}}(z)=z+{\mathrm{noise}}} $。实际应用中,通常将噪声的识别交由侧信道区分器建模,而泄露模型则忽略噪声直接计算。例如,对于字节0xE9(二进制形式为0b11101001,十进制为233),其在HW模型下的标签将映射为5,在ID模型下的标签将映射为233。此外,在某些场景下,特定位(如最高有效位(most significant bit,MSB)、最低有效位(least significant bit,LSB))也可作为有效的泄露模型。需要指出的是,泄露模型仅能对真实功耗特性提供粗略近似。本文实验主要采用HW和ID两种泄露模型。

1.4 基于深度学习的侧信道分析

基于深度学习的建模侧信道分析本质上是一种监督学习过程,包含两个主要阶段:建模阶段与攻击阶段。
在建模阶段,通过随机梯度下降等算法优化可调参数$ {\theta} $,利用训练集数据训练神经网络。目标是推导映射函数$ {{f}}_{{\theta}}{:T\to Y} $,将每条输入迹线$ {\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{t}}}}}_{{i}}\in{T} $分类到特定类别标签$ {\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{y}}}}}_{{i}}\in{Y} $。实际场景中,由于中间变量Z与泄露之间可能缺乏直接关联,攻击者常采用泄露模型构建标签$ {Y=L(Z)} $,以实现精确建模(如1.3节内容所述)。验证集用于评估每个训练周期后模型的泛化能力。
在攻击阶段,训练后的模型生成预测概率向量。对于攻击迹线$ {\overset{\mathrm{\rightharpoonup }}{{t}}}_{{i}} $,对密钥字节的假设$ {k\in K} $,对应的概率将被转换为对数形式:
$ {{s}}_{{i}}{(k)={\mathrm{log}}( {\mathrm{Pr}}(}{{f}}_{{\theta}}{(}{\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{t}}}}}_{{i}}{) =f(}{{p}}_{{i}}{,k)))} $
即可得到所有密钥假设的得分向量:$ {\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{s}}}}}_{{i}}(K) = ({{s}}_{{i}}{(0), \cdots ,}{{s}}_{{i}}{(}|{K}|{-1))} $。这些向量构成$ {{N}}_{{A}}{\times}|{K}| $维的全局评分矩阵,其中,$ {{N}}_{{A}} $表示攻击迹线数量。每行代表单条迹线下各密钥假设得分,每列包含特定密钥假设在所有迹线中的得分。通过求和聚合得分向量:
$ {\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{S}}}}}_{{{{N}}_{{A}}}}{(K)=\sum}_{{i=0}}^{{{N}}_{{A}}{-1}}{\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{s}}}}}_{{i}}{(K)} $
随后,攻击者将各密钥假设的总分降序排序,生成密钥猜测向量$ {\overset{\mathrm{\rightharpoonup }}{{g}}}_{{{{N}}_{{A}}}}{=(g}_{{{N}}_{{A}}}^{{0}}{,g}_{{{N}}_{{A}}}^{{1}}{, ...,g}_{{{N}}_{{A}}}^{|{K}|{-1}}{)} $,其中,$g_{NA}^i $的上标i表示该密钥在向量中的排序位次(i=0对应排名第一)。相应地,排名第一的密钥假设即被选定为正确候选密钥字节。

1.5 胶囊网络

胶囊网络是Sabour等[25]提出的新型神经网络模型,旨在克服传统CNN在表示部分—整体关系方面的局限性。其核心思想在于以向量形式的胶囊替代CNN中的标量神经元,每个胶囊由一组神经元构成,用于编码实体的多种属性(如姿态、纹理等),从而更有效地捕捉空间层次结构。胶囊网络通过动态路由机制实现部分—整体的关联建模,该机制通过迭代优化耦合系数$ {{c}}_{{ij}} $来度量底层胶囊i与高层胶囊j之间的“路由一致性”,该系数通过softmax函数计算:$ {{c}}_{{ij}}{=}\dfrac{{{\mathrm{exp}}(}{{b}}_{{ij}}{)}}{{{\displaystyle\sum}}_{{k}}{{\mathrm{exp(}}}{{b}}_{{ik}}{)}} $,初始时$ {{b}}_{{ij}}{=0} $,并通过路由过程不断迭代细化;高层胶囊的输入由低层胶囊的输出的加权和得到:$ {\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{a}}}}}_{{j}}{=}{{\displaystyle\sum}}_{{i}}{{c}}_{{ij}}{\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{u}}}}}_{{j}|{i}} $;最后,胶囊网络在部分隐藏层还通过Squash函数替换了标量神经网络中的非线性激活函数,其计算公式如下:
$ {\overset{\mathrm{\rightharpoonup }}{{v}}}_{{j}}=\frac{{||{{\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{a}}}}}_{{j}}}||}^{{2}}}{{1+}{||{{\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{a}}}}}_{{j}}}||}^{{2}}}\cdot \frac{{\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{a}}}}}_{{j}}}{||{\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{a}}}}}_{{j}}||} $
该函数可确保输出向量的长度在区间[0,1)内,且保持向量原有方向不变,这有助于保留向量包含的方向信息,同时避免梯度爆炸或梯度消失。上述设计使胶囊网络具备较强的空间关系建模能力和仿射变换鲁棒性。胶囊网络与标量神经网络的主要对比情况如表1所示。
表 1 标量神经网络与胶囊网络对比

Table 1 Comparison between scalar neural networks and CapsNets

标量 标量神经网络 胶囊网络
输入数据类型 标量$ {{x}}_{{i}} $ 向量$ {\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{u}}}}}_{{i}} $
仿射变换 N/A $ {\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{u}}}}}_{{j}|{i}}{=}{{W}}_{{ij}}{\cdot}{\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{u}}}}}_{{i}} $
加权求和 $ {{a}}_{{j}}{=}{{\displaystyle\sum}}_{{i}}{{w}}_{{i}}{{x}}_{{i}}{+b} $ $ {\overset{\mathrm{\rightharpoonup }}{{a}}}_{{j}}{=}{{\displaystyle\sum}}_{{i}}{{c}}_{{ij}}{\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{u}}}}}_{{j}|{i}} $
非线性激活 $ {{h}}_{{j}}{=f(}{{a}}_{{j}}{)} $ $ {\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{v}}}}}_{{j}}{=}\dfrac{{||{{\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{a}}}}}_{{j}}}||}^{{2}}}{{1+}{||{{\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{a}}}}}_{{j}}}||}^{{2}}}{\cdot}\dfrac{{\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{a}}}}}_{{j}}}{||{\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{a}}}}}_{{j}}||} $
输出数据类型 标量$ {{h}}_{{j}} $ 向量$ {\overset{\mathrm{\rightharpoonup }}{{v}}}_{{j}} $

2 面向侧信道分析的胶囊网络模型方案

2.1 网络架构设计

为探究胶囊网络在侧信道分析领域的适用性,本文提出一种面向能量分析的轻量化胶囊网络结构,其核心组件由特征提取模块、初级胶囊层(PrimaryCap)和动态路由胶囊层(CapsuleLayer)构成,支持端到端的能量迹特征学习,基本结构如图1所示。下面将对各组成部分的作用进行简要说明。
图 1 胶囊网络总体结构设计

Fig.1 CapsNet overall architecture design

1)输入预处理层:胶囊网络模型的输入数据为经过归一化处理的能量迹样本,输入维度由input_shape参数指定;批处理大小通过batch_size参数显式定义,以适配硬件加速需求,输入层后接零填充操作以保持时序维度一致性。
2)特征提取模块:输入层后,首先采用一维卷积层(Conv1D)等构建特征提取模块,对输入数据进行初级特征提取。整个流程如下所示:
$ {{\mathrm{Conv1D}}}\left({f,k,s}\right){\to {\mathrm{BatchNorm}}\to {\mathrm{SELU}}\to {\mathrm{AvgPool}}} $
其中,f为滤波器的数量,k为滤波器的长度,s代表滤波器的步长。本文采用SeLU(scaled exponential linear unit)[28]作为激活函数,该函数引入自动标准化机制,可使神经网络隐藏层在训练过程中自动保持输出均值接近0、方差接近1,有助于解决梯度爆炸和梯度消失问题,降低深度网络训练难度。此外,平均池化操作(AvgPool)会对卷积层生成的特征图进行压缩,可在保留显著特征的同时,显著降低计算复杂度。
3)初级胶囊层:初级胶囊层的核心组成部分为一维卷积层,但其增加了输出维度重塑(Reshape)和Squash非线性压缩函数,为后续动态路由胶囊层的数据处理做好准备。初级胶囊层的运算过程可表示为:
$\begin{aligned}& {\mathrm{PrimaryCap}}= [{\mathrm{Conv1D}} ( f, k, s) \rightarrow \text{AvgPool} { \to }\\& \qquad [\text{Reshape}({\mathrm{numCap}}, {\mathrm{dimCap}})] \cdot {\mathrm{Squash}}\end{aligned} $
其中,numCap代表胶囊数量,dimCap代表每个胶囊向量的维度;Squash函数的计算方法见式(3)。需要注意的是,由于输出张量的形状必须符合(batch_size,numCap,dimCap),因此一维卷积层的滤波器数量必须为numCap与dimCap的乘积。同时,本文在该层增加平均池化操作,以进一步降低模型训练和测试时的计算复杂度。本模型的特征提取模块和初级胶囊层都采用一维卷积与池化操作,这些为深度学习中的标准技术,可确保与现有研究的可比性。
4)动态路由胶囊层:该层作用类似于标量神经网络中的全连接层,采用动态路由算法寻找并建立高层胶囊(如动态路由胶囊层)与低层胶囊(如初级胶囊层)的层次化关联,如图2所示。
图 2 胶囊网络动态路由算法

Fig.2 Dynamic routing algorithm of CapsNet

具体而言,该机制通过多次迭代优化耦合系数(coupling coefficients)实现。胶囊网络采用的动态路由算法流程如下。
①生成预测向量${\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{u}}}}}_{{j}|{i}} $:每个低层胶囊i的输出向量$ {\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{u}}}}}_{{i}} $通过权重矩阵$ {{{\boldsymbol{W}}}}_{{ij}} $转换为对应的高层胶囊的预测向量:
$ {\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{u}}}}}_{{j}|{i}}={{{\boldsymbol{W}}}}_{{ij}}{\cdot}{\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{u}}}}}_{{i}} $
②初始化耦合系数${{c}}_{{ij}} $:每个胶囊对应的耦合系数设定为均匀分布:
$ {{c}}_{{ij}}=\frac{{1}}{{{\mathrm{numCap}}}} $
③多次迭代优化耦合系数$ {\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{a}}}}}_{{j}} $:首先计算高层胶囊的输入加权和:
$ {\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{a}}}}}_{{j}}={{\sum}}_{{i}}{{c}}_{{ij}}{\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{u}}}}}_{{j}|{i}} $
而后对$ {\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{a}}}}}_{{j}} $进行Squash压缩,得到高层胶囊的输出$ {\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{v}}}}}_{{j}} $,Squash函数计算方法如式(3):
${\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{v}}}}}_{{j}}=\mathrm{Squash}\left({\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{a}}}}}_{{j}}\right) $
④计算$ {\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{v}}}}}_{{j}} $$ {\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{u}}}}}_{{j}|{i}} $的点积($ {{b}}_{{ij}} $初值为0,通过胶囊间内积动态更新):
$ {{b}}_{{ij}}{\leftarrow }{{b}}_{{ij}}+{\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{v}}}}}_{{j}}{\cdot}{\widehat{{{\boldsymbol{u}}}}}_{{j}|{i}} $
⑤对$ {{b}}_{{ij}} $进行Softmax归一化,得到新的耦合系数$ {{c}}_{{ij}} $
$ {{c}}_{{ij}}=\frac{{{\mathrm{exp}}(}{{b}}_{{ij}}{)}}{{{\displaystyle\sum}}_{{k}}{{\mathrm{exp}}(}{{b}}_{{ik}}{)}} $
由上述公式可知,在动态路由算法迭代过程中,各高层胶囊对应的权重会不断变化,与期望输出相似度更高(体现为内积更大)的高层胶囊,其权重会不断增加,反之则不断减少。本文设计的模型中,动态路由胶囊层的胶囊数量与侧信道分析分类任务的类别数量一致,耦合系数的迭代计算次数作为可调整超参数,将在后续实验中进行搜索与优化。除此之外,本文还在该层增加dropout机制(丢弃率设定为0.1),以抑制模型的过拟合倾向。
5)输出归一化层:该层通过对动态路由胶囊层的输出向量进行模长(范数)计算与L1归一化,确保输出概率满足单位约束条件,最终得到可解释的分类置信度,用于估计对应密钥字节的概率。
$ {{p}}_{{j}}=||{\overset{\mathrm{\rightharpoonup }}{{{\boldsymbol{v}}}}}_{{j}}||,\;\;{p}_{{j}}^{{'}}=\frac{{{p}}_{{j}}}{{\displaystyle\sum}{{p}}_{{j}}} $

2.2 模型评估方法

传统侧信道分析评估指标(如猜测熵与成功率[15]),在实际部署应用中存在一定缺陷。猜测熵通过计算$ {{\mathrm{GE}}}_{{{{N}}_{{A}}}}{={\mathrm{E}}[}{{{\mathrm{rank}}}}_{{{{N}}_{{A}}}}{(k*)]} $量化正确密钥$ {k*} $在多次攻击中的平均排序($ {{N}}_{{A}} $为攻击所用能量迹条数)。虽然GE具备理论层面的鲁棒性,但其密钥排序的固有随机性,导致计算复杂度过高。为获得统计显著性,需要大量重复计算(通常需100次及以上迭代),消耗大量实验时间。成功率定义为$ {{\mathrm{SR}}}_{{{N}}_{{A}}}^{{d}}{= {\mathrm{Pr}}[}{{{\mathrm{rank}}}}_{{{{N}}_{{A}}}}{(k^*)<d]} $,即衡量密钥在前d个假设内被恢复的概率,但当其趋近于100%时,信息量锐减。指标$ {{T}}_{{{\mathrm{GE1}}}}{=}\max \{{T|{\mathrm{G}{{{\mathrm{E}}}}}}_{{T}}> 1\}+1 $虽能评估收敛效率,但计算代价过高,单模型$ {{N}}_{{A}} $估计需对迹线数从1至$ {{N}}_{{A}} $顺序计算GE。
为克服上述局限,Zhu等[17]提出基于功耗泄露确定性分量分析的LD指标,其核心公式为:
$ {{\mathrm{LD}}}={\sum}_{{i=0}}^{{n-1}}\frac{{n-i}}{{n}}\cdot {c}_{{v}}^{{-1}}\left[{{\delta}}_{{i}}\right] $
其中,$ {c}_{{v}}^{{-1}}{[}{{\delta}}_{{i}}{]={\mathrm{E}}[}{{\delta}}_{{i}}{]/{\mathrm{sqrt}}({\mathrm{Var}}(}{{\delta}}_{{i}}{))} $量化正确密钥k*与错误假设$ {{k}}_{{i}} $的可区分性,n代表密钥假设空间(或泄露模型)的大小。其简明版本LD-simplified通过下式优化了计算效率:
$ {{{\mathrm{LD}}}}_{{{\mathrm{simplified}}}}={\sum}_{{i=0}}^{{n-1}}\frac{{n-i}}{{n}}\cdot \frac{{{\mathrm{E}}[s(}{{k}}^{{*}}{)]-{\mathrm{E}}[s(}{{k}}_{{i}}{)]}}{{{\mathrm{sqrt}}({\mathrm{Var}}[s(}{{k}}^{{*}}{)]-{\mathrm{Var}}[s(}{{k}}_{{i}}{)])}} $
LD指标解决了传统评估指标的3个核心缺陷。
1)计算效率:LD仅需单次遍历攻击迹线即可计算得分统计量,消除了猜测熵计算中的重复排序操作。基准测试表明,LD处理10 000条迹线仅需0.8 s,比$ {{T}}_{{{\mathrm{GE1}}}} $快99%,比完整猜测熵计算快95%。该效率支持训练过程中的实时模型验证,可实现早停策略以防止过拟合。
2)跨性能区间的通用性:与饱和于100%的成功率不同,LD在所有模型性能水平上均保持连续区分能力。例如,在ASCADf-desync50数据集上,LD值从−2.1(劣质模型)到8.3(最优模型),呈线性分布,且与$ {{T}}_{{{\mathrm{GE1}}}} $线性相关($ {{R}}^{{2}} $=0.96)。关键的是,即使当GE=0时,LD仍有效,可精准排序传统指标无法区分的模型。
3)密钥恢复不确定性的鲁棒性:LD利用指数关系$ {{T}}_{{{\mathrm{GE1}}}}{\approx}\exp \left(\dfrac{{\gamma-{\mathrm{LD}}}}{{\gamma}}\log {{N}}_{{A}}\right) $${\gamma} $为泄露特性经验常数),实现平均绝对误差(MAE)<100条迹线的$ {{T}}_{{{\mathrm{GE1}}}} $估计,规避直接计算。相较之下,基于猜测熵的方法密钥排序随机性导致高方差,相同条件下$ {{\mathrm{G}{{{\mathrm{E}}}}}}_{{{{N}}_{{A}}}} $波动达±15%。
虽然LD是本文的主要评估指标,但本文仍在部分实验结果中保留$ {{T}}_{{{\mathrm{GE1}}}} $作为参考基准,确保与现有研究的可比性。${{T}}_{{{\mathrm{GE1}}}} $的值是100次攻击迭代的平均值,从而降低随机性。

3 实验结果

本文实验的所有模型均采用交叉熵损失函数进行训练。为最小化随机偶然因素,$ {{T}}_{{{\mathrm{GE1}}}} $计算中使用的所有密钥排序值均通过100次攻击迭代取平均值。实验基于TensorFlow与Keras深度学习框架,在Python环境中实现,训练过程采用单个Intel Xeon Platinum 8352V CPU和单块NVIDIA H100 GPU完成。在实验框架设计中,既采用了侧信道分析中广泛使用的基准数据集(如ASCAD)与评估指标(如LD),又引入了胶囊网络这一新兴架构,该设计确保了实验的严谨性,同时契合探索性研究的特性。

3.1 胶囊网络模型的超参数搜索实验结果

超参数搜索方法选用穷举式搜索,主要基于胶囊网络在侧信道分析中的探索性特性。尽管贝叶斯优化等优化方法在计算效率上具有潜在优势,但穷举搜索可大范围覆盖参数的可能组合,避免先验知识缺乏导致的局部最优风险。在胶囊网络模型的超参数搜索实验中,本文以卷积核数量、卷积核长度、高层胶囊数量等为目标变量,以ASCADf数据集为实验对象,以LD作为模型性能评估标准,计算结果保留4位小数,并给出超参数搜索过程中模型性能的变化情况。
超参数搜索实验中,由于胶囊网络与CNN结构存在一定相似性(胶囊网络的特征提取模块和初级胶囊层均通过卷积操作实现),同时考虑到ASCADf数据集中能量迹长度(700个采样点)与典型局部时序模式尺度(30~120个采样点),本文以SOTA CNN侧信道分析模型的卷积核与滤波器大小作为参考基准,在此基础上适当扩大搜索范围。例如,HW模型下,特征提取模块滤波器大小的搜索范围为60~200,初始步长为20~40;滤波器数量的搜索范围为8~48,初始步长为4~16;初级胶囊层胶囊数量的搜索范围为4~64,初始步长为16~32;胶囊维度的搜索范围为4~64,初始步长为8~16。对于动态路由胶囊层的胶囊维度,本文初始以8维向量代表字节的8个比特,搜索范围为2~32,初始步长为4~6;搜索过程中,根据LD值调整步长,若实验结果表现出局部收敛特征,则适当减小步长(如减半);反之则适当增大步长,但需避免模型体积过度膨胀。ID模型下的超参数搜索方法同上,因篇幅所限,不再详细描述,详细的搜索范围与步长见本文附录A。
上述搜索方案中,相较于CNN适当扩大搜索空间,主要基于以下三点考虑:一是胶囊网络搜索空间多维且动态(如路由迭代),而CNN搜索空间相对固定且经验驱动;二是胶囊网络引入向量表示后,结构更复杂且参数量固有增加;三是胶囊网络模型结构的已有研究不如CNN成熟。因此,本文适当扩大搜索范围,力求实现更细致的调优。
经搜索得到的HW和ID泄露模型下,胶囊网络模型的超参数设定情况如表2表3所示。因实验结果数量较多,详细实验数据见本文附录B。
表 2 HW泄露模型下胶囊网络模型超参数设定情况

Table 2 Hyperparameter settings of CapsNet model under HW leakage model

超参数名 说明 超参数值
kernel_1 特征提取模块滤波器大小 120
filter_1 特征提取模块滤波器数量 4
channel 初级胶囊层胶囊数量 40
dim 初级胶囊层胶囊维度 20
kernel_2 初级胶囊层滤波器大小 18
dim_2 动态路由胶囊层胶囊维度 18
routings 动态路由胶囊层迭代计算次数 20
avg_stride_1 特征提取模块平均池化步长 25
avg_stride_2 初级胶囊层平均池化步长 8
conv_stride 特征提取模块卷积步长 1
primary_stride 初级胶囊层卷积步长 1
dropout 动态路由胶囊层神经元丢弃率 0.1
lr 学习率 1×10−3
表 3 ID泄露模型下胶囊网络模型超参数设定情况

Table 3 Hyperparameter settings of CapsNet model under ID leakage model

超参数名 说明 超参数值
kernel_1 特征提取模块滤波器大小 30
filter_1 特征提取模块滤波器数量 55
channel 初级胶囊层胶囊数量 3
dim 初级胶囊层胶囊维度 40
kernel_2 初级胶囊层滤波器大小 17
dim_2 动态路由胶囊层胶囊维度 23
routings 动态路由胶囊层迭代计算次数 20
avg_stride_1 特征提取模块平均池化步长 25
avg_stride_2 初级胶囊层平均池化步长 8
conv_stride 特征提取模块卷积步长 1
primary_stride 初级胶囊层卷积步长 1
dropout 动态路由胶囊层神经元丢弃率 0.1
lr 学习率 1×10−3

3.2 胶囊网络和CNN的性能对比实验结果

本小节基于前文给出的胶囊网络超参数搜索实验结果,给出胶囊网络与SOTA CNN的性能对比实验结果。用于对照的CNN模型由Wu等[21]于2023年提出,其结构如表4所示,该模型是当前建模能量分析领域表现最佳的模型之一。为确保对照实验的严谨性,除模型自身参数外,训练与测试的其他参数设置基本保持一致,具体如表5所示。
表 4 一种用于建模能量分析的CNN模型结构

Table 4 A CNN architecture for power analysis modeling

网络层名 输出格式 激活函数
输入层 (None, 700, 1) N/A
一维卷积层 (None, 700, 16) SELU
平均池化层 (None, 28, 16) N/A
展平层 (None, 448) N/A
全连接层 (None, 15) SELU
全连接层 (None, 4) SELU
全连接层 (None, 4) SELU
全连接层(输出层) (None, 9) Softmax
表 5 胶囊网络与CNN对照实验的参数设定情况

Table 5 Parameter settings in comparative experiments between CapsNet and CNN

训练/测试参数 参数值
学习率(learning rate) 1×10−3
训练轮数(epoch) 50
批次大小(batch size) 50
训练集规模 50000
测试集规模 10000
损失函数 categorical cross entropy
优化器 Adam
实验测得,在50轮训练过程中,HW和ID两种泄露模型下,胶囊网络与CNN的LD和${{T}}_{{{\mathrm{GE1}}}} $变化情况分别如图3图4所示。可以看出,HW模型下,胶囊网络的LD最大值为0.1816,CNN为0.2437,胶囊网络性能仅达到CNN的约75%;ID模型下,胶囊网络的LD最大值为0.2572,CNN为0.4392,胶囊网络性能仅达到CNN的约59%。同时,胶囊网络的收敛速度与稳定性均显著逊于CNN,且其参数量约为CNN的5倍,时间开销与空间开销均大于CNN。两种模型在50轮训练后性能趋于稳定,无显著提升。此外,HW模型下,两种网络的收敛速度基本相近;ID模型下,CNN的收敛速度显著快于胶囊网络。
图 3 胶囊网络和CNN在HW泄露模型下的$ {{T}}_{{{\mathrm{GE1}}}} $和LD值结果

Fig.3 Results of $ {{T}}_{{{\mathrm{GE1}}}} $ and LD values for CapsNet and CNN under HW leakage model

图 4 胶囊网络和CNN在ID泄露模型下的$ {{T}}_{{{\mathrm{GE1}}}} $和LD值结果

Fig.4 Results of $ {{T}}_{{{\mathrm{GE1}}}} $ and LD values for CapsNet and CNN under ID leakage model

4 分析讨论

4.1 对模型泛化误差的影响的分析

根据机器学习领域的偏差—方差分解理论,模型在未知数据集上的总体表现可用泛化误差衡量,泛化误差可进一步分解为近似误差与估计误差之和,如图5所示。模型架构可视为一个假设空间H,该空间包含所有可能的模型参数情况。近似误差指模型假设空间与理想模型之间的距离,估计误差指实际学习到的模型与假设空间理想边界之间的距离。
图 5 偏差—方差分解示意

Fig.5 Bias-variance decomposition

换言之,近似误差的大小取决于模型本身的选择,即模型的偏差(bias);估计误差的大小取决于训练方法与数据质量,即模型的方差(variance)。
根据泛化误差上界理论[29],数字表达式为:
$\forall {h}\in {H},\mathrm{\epsilon }\left({h}\right)\leqslant {\widehat{{\epsilon}}}_{{{{D}}_{{N}}}}+\sqrt{\frac{\log \left| {H}\right| +\log \dfrac{{2}}{{\delta}}}{{2n}}} $
其中,不等式左边是泛化误差,右侧$ {\widehat{{\epsilon}}}_{{{{D}}_{{N}}}} $为训练误差,$ {\delta} $表示模型学习到正确表示的概率,n表示数据集的大小。由此可得,在训练方法和对模型的置信度要求不变的情况下,有:
$ {O}\left({\epsilon }\left({h}\right)\right)\propto \sqrt{\frac{{{\mathrm{log}}}|{H}|}{{n}}} $
由上式可得出:本文对比实验中,胶囊网络的参数量显著大于CNN,这实际上扩大了假设空间,有利于减小模型偏差;但所用数据集未发生变化,这可能导致泛化误差上界扩大。
然而,式(16)中假设空间容量的估计仅基于参数数量,未考虑模型架构所引入的结构性约束与归纳偏置对泛化误差的实际影响。结构性约束与归纳偏置会显著影响假设空间的有效容量,其影响并非简单由参数量线性决定。具体而言,胶囊网络的动态路由机制通过迭代协议编码空间层级关系(如2.1节所述),该机制作为一种强结构性约束,虽增加了参数量,但限制了参数自由度的有效性,导致其假设空间中大量假设与侧信道分析的时序需求脱节。相反,CNN的卷积层与权重共享机制提供了契合时序局部性的归纳偏置,使其假设空间更聚焦于有效特征,即便参数量较小,也能实现更优的泛化性能。
这种差异在第3节实验结果中得到验证:胶囊网络在HW和ID泄露模型下的LD值仅为CNN的59%~75%(见图3图4),且收敛稳定性较差,这反映了其结构性约束导致有效假设空间缩小。同时,胶囊网络的空间语义优化目标与时序模式挖掘需求不匹配,进一步佐证了归纳偏置对假设空间容量的影响。因此,泛化误差上界不仅依赖于参数数量,更取决于架构与任务的结构性匹配程度。在有限数据场景下(如ASCAD数据集),胶囊网络的高参数量反而因结构性约束扩大了泛化误差上界,而CNN的归纳偏置提升了假设空间的有效容量,进而解释了两者性能差异的深层原因。
当然,本文也注意到,可通过扩大数据集规模抵消误差上界的扩大,但需强调的是,在针对特定设备或某一类特定设备的侧信道分析中,攻击者实际可获取的能量迹数量有限,甚至可能无法对目标设备进行完全建模[30];即便能够获取足够规模的数据集,其攻击开销也会显著增大。综上所述,本文认为,选择在ASCAD数据集上进行对比实验且不扩大数据集规模,符合实际应用场景。

4.2 模型−任务适配问题

第3节实验结果表明,胶囊网络在侧信道分析中的性能局限,源于其内在机制(如动态路由对时空特征不敏感)与任务需求(如时序模式挖掘)的脱节,而非框架设计的影响。具体而言,胶囊网络在计算机视觉领域的成果,源于其动态路由机制对空间层级关系的建模能力,即通过向量化胶囊编码物体部件的相对位置与视角不变性。然而,侧信道分析的核心任务本质是时序模式挖掘,其数据特性与胶囊网络的设计初衷存在根本性矛盾。举例来说,能量迹或电磁迹中的密钥相关性,表现为连续时间维度上的局部模式(如去同步化噪声下的峰值邻域关联),而非空间语义结构。动态路由机制通过迭代协议传递胶囊间的空间关系,无法有效捕捉时间序列中的局部依赖性,最终导致其性能显著劣于CNN。
从深度学习理论视角来看,模型结构需与任务特性相适配。CNN的局部感受野与权重共享机制天然契合SCA的时序特征提取需求:卷积核可自适应学习能量迹中的局部滤波器(如去同步化抖动模式),池化层则提供噪声鲁棒性。相比之下,胶囊网络的“胶囊”设计优先编码空间不变性(如物体旋转后的部件关系),其高维向量输出虽有利于图像视角变换建模,却与侧信道分析的时序局部性需求错位。网络结构的选择需考虑数据的内在特性,对于低层局部特征提取任务,应优先采用卷积等局部连接架构[31]。该理论直接解释了胶囊网络在侧信道分析中的失效原因:其全连接胶囊层导致参数量激增,而ASCAD等侧信道数据集规模有限,违背了“参数量需与数据规模匹配”的泛化原则,必然引发过拟合。更深层的矛盾在于优化目标偏差:侧信道分析需端到端优化密钥恢复概率,并关注密钥恢复的动态过程(如错误密钥假设的分布特性),而非单纯的分类准确率。胶囊网络的向量化输出,即便经过归一化处理,也难以直接映射到密钥概率空间,导致其优化方向与侧信道分析高效密钥恢复的目标脱节。
综上所述,本文认为未来深度学习侧信道分析的模型选择应遵循三项原则:一是适配时序主导场景;二是在多模态融合场景下提升模型泛化能力;三是避免复杂架构冗余与盲目移植。

5 结束语

本文基于ASCAD数据集研究了胶囊网络在建模能量分析中的适用性,设计了面向侧信道分析的胶囊网络模型;通过超参数搜索实验,确定了HW和ID泄露模型下的最优结构;设计并实施了胶囊网络与SOTA CNN的性能对比实验。实验结果表明,胶囊网络在ASCAD数据集上的综合性能最高未超过CNN的75%,且时间开销与空间开销显著更大,揭示了胶囊网络与建模能量分析任务存在结构性失配;本文基于泛化误差理论分析了其诱因,强调了模型—任务适配问题的重要性。
本文认为胶囊网络与建模能量分析任务的不适配,源于模型自身的结构性问题,而非训练方法、技巧或数据集所致。本文通过实验验证了胶囊网络与侧信道分析任务的不适配性,深化了对模型—任务适配性的理解,为深度学习在侧信道分析中的应用提供了参考依据。本文所阐述的结论基于当前实验观测与理论分析,未来可通过探索新的理论方法,进一步研究胶囊网络在侧信道分析中的适用性问题。
1
Kocher P C. Timing attacks on implementations of Diffie-Hellman, RSA, DSS, and other systems[C]//Advances in Cryptology — CRYPTO ’96. Berlin, Heidelberg: Springer, 1996: 104-113.

2
Kocher P, Jaffe J, Jun B. Differential power analysis[C]//Advances in Cryptology — CRYPTO’ 99. Berlin, Heidelberg: Springer, 1999: 388-397.

3
Quisquater J, Samyde D. A new tool for non-intrusive analysis of smart cards based on electro-magnetic emissions: the SEMA and DEMA methods [EB/OL]. (2000-05-29) [2025-11-22]www. iacr. org/conferences/eurocrypt2000/posterrump. html.

4
Page D. Technical report CSTR-02-003: Theoretical use of cache memory as a cryptanalytic side-channel[R]. Bristol: University of Bristol, 2002.

5
Brier E, Clavier C, Olivier F. Correlation power analysis with a leakage model[C]//Cryptographic Hardware and Embedded Systems - CHES 2004. Berlin, Heidelberg: Springer, 2004: 16-29.

6
Chari S, Jutla C S, Rao J R, et al. Towards sound approaches to counteract power-analysis attacks[C]//Advances in Cryptology — CRYPTO’ 99. Berlin, Heidelberg: Springer, 1999: 398-412.

7
Ouladj M, Guilley S. Side-channel analysis of embedded systems: an efficient algorithmic approach[M]. Cham: Springer International Publishing, 2021: 35-42.

8
Rivest R L. Cryptography and machine learning[M]//Advances in Cryptology—ASIACRYPT '91. Berlin, Heidelberg: Springer, 1991: 427-439.

9
Martinasek Z, Dzurenda P, Malina L. Profiling power analysis attack based on MLP in DPA contest V4.2[C]//Proceedings of the 2016 39th International Conference on Telecommunications and Signal Processing (TSP). Piscataway: IEEE Press, 2016: 223-226.

10
Cagli E, Dumas C, Prouff E. Convolutional neural networks with data augmentation against jitter-based countermeasures: profiling attacks without pre-processing[C]//Cryptographic Hardware and Embedded Systems – CHES 2017. ChamSpringer International Publishing, 2017: 45-68.

11
Das D, Golder A, Danial J, et al. X-DeepSCA: cross-device deep learning side channel attack[C]//Proceedings of the 56th Annual Design Automation Conference 2019. New York: ACM, 2019: 1-6.

12
Zhang F, Shao B, Xu G R, et al. From homogeneous to heterogeneous: leveraging deep learning based power analysis across devices[C]//Proceedings of the 2020 57th ACM/IEEE Design Automation Conference (DAC). Piscataway: IEEE Press, 2020: 1-6.

13
Bhasin S, Chattopadhyay A, Heuser A, et al. Mind the portability: a warriors guide through realistic profiled side-channel analysis[C]//Proceedings 2020 Network and Distributed System Security Symposium. Internet Society, 2020.

14
Zaid G, Bossuet L, Habrard A, et al. Efficiency through diversity in ensemble models applied to side-channel attacks: a case study on public-key algorithms[J]. IACR Transactions on Cryptographic Hardware and Embedded Systems, 2021: 60-96.

15
Standaert F X, Malkin T G, Yung M. A unified framework for the analysis of side-channel key recovery attacks[C]//Advances in Cryptology-EUROCRYPT 2009. Berlin, Heidelberg: Springer, 2009: 443-461.

16
Zaid G, Bossuet L, Dassance F, et al. Ranking loss: maximizing the success rate in deep learning side-channel analysis[J]. IACR Transactions on Cryptographic Hardware and Embedded Systems, 2020: 25-55.

17
Zhu J F, Lv J Q. Leading degree: a metric for model performance evaluation and hyperparameter tuning in deep learning-based side-channel analysis[J]. IACR Transactions on Cryptographic Hardware and Embedded Systems, 2025 (2): 333- 361.

DOI

18
Bursztein E, Invernizzi L, Král K, et al. Generalized power attacks against crypto hardware using long-range deep learning[J]. IACR Transactions on Cryptographic Hardware and Embedded Systems, 2024 (3): 472- 499.

DOI

19
Wu L C, Picek S. Remove some noise: on pre-processing of side-channel measurements with autoencoders[J]. IACR Transactions on Cryptographic Hardware and Embedded Systems, 2020: 389-415.

20
Mukhtar N, Batina L, Picek S, et al. Fake it till you make it: data augmentation using generative adversarial networks for all the crypto you need on small devices[M]//Topics in Cryptology – CT-RSA 2022. ChamSpringer International Publishing, 2022: 297-321.

21
Wu L C, Weissbart L, Krček M, et al. Label correlation in deep learning-based side-channel analysis[J]. IEEE Transactions on Information Forensics and Security, 2023, 18, 3849- 3861.

DOI

22
Wu L C, Won Y S, Jap D, et al. Ablation analysis for multi-device deep learning-based physical side-channel analysis[J]. IEEE Transactions on Dependable and Secure Computing, 2024, 21 (3): 1331- 1341.

DOI

23
Karayalçın S, Krček M, Wu L C, et al. It’s a kind of magic: a novel conditional GAN framework for efficient profiling side-channel analysis[C]//Advances in Cryptology – ASIACRYPT 2024. Springer Nature Singapore, 2024: 99-131.

24
Ito A, Ueno R, Homma N. Perceived information revisited II: information-theoretical analysis of deep-learning based side-channel attacks[J]. IACR Transactions on Cryptographic Hardware and Embedded Systems, 2025(1): 450-474. [LinkOut]

25
Sabour S, Frosst N, Hinton G E. Dynamic routing between capsules[C]//Proceedings of the 31st International Conference on Neural Information Processing Systems (NIPS 2017). New York: Curran Associates Inc. , 2017: 3859-3869.

26
Van Quang N, Chun J, Tokuyama T. CapsuleNet for micro-expression recognition[C]//Proceedings of the 2019 14th IEEE International Conference on Automatic Face & Gesture Recognition (FG 2019). Piscataway: IEEE Press, 2019: 1-7.

27
Benadjila R, Prouff E, Strullu R, et al. Deep learning for side-channel analysis and introduction to ASCAD database[J]. Journal of Cryptographic Engineering, 2020, 10(2): 163-188.

28
Klambauer G, Unterthiner T, mayr A, et al. Self-normalizing neural networks[C]// Proceedings of the 31st International Conference on Neural Information Processing Systems (NIPS 2017). Red Hook: Curran Associates Inc. , 2017: 972-981.

29
Mohri M, Rostamizadeh A, Talwalkar A. Foundations of machine learning[M]. 2nd ed. Cambridge, Mass: MIT Press, 2018: 9-21.

30
Wu L C, Perin G, Picek S. Weakly profiling side-channel analysis[J]. IACR Transactions on Cryptographic Hardware and Embedded Systems, 2024(3): 707-730.

31
邱锡鹏. 神经网络与深度学习[M]. 北京: 机械工业出版社, 2020: 105-115.

Qiu X P. Neural networks and deep learning[M]. Beijing: China Machine Press, 2020: 105-115.

Outlines

/