Academic Research

Scaling-based image-level feature enhancement for steganalysis

  • LIU Xulong 1, 2, 3 ,
  • LI Weixiang , 1, 2, 3, * ,
  • LIN Kaiqing 1, 2, 3 ,
  • LI Bin 1, 2, 3
Expand
  • 1. College of Electronic and Information Engineering, Shenzhen University, Shenzhen 518060, China
  • 2. Guangdong Key Laboratory of Intelligent Information Processing, Shenzhen 518060, China
  • 3. Shenzhen Key Laboratory of Media Security, Shenzhen 518060, China

Received date: 2024-02-06

  Online published: 2024-05-18

Supported by

Natural Science Foundation of China (U22B2047, 62202310, U23B2022), China Postdoctoral Science Foundation (2022M722192), Shenzhen R&D Program (JCYJ20200109105008228).

Copyright

Copyright ©2024 Journal of Cybersecurity. All rights reserved.

Abstract

With the rapid development of deep learning, the research of image steganalysis techniques based on deep learning have made significant progress. However, in terms of residual feature extraction and enhancement, traditional image preprocessing enhancement techniques often inevitably weaken the steganographic signals, making it difficult to adapt simple image preprocessing methods to steganalysis. Therefore, existing deep learning steganalysis research tends to design fixed filter kernels or optimize the learning of the residual convolutional layers, resulting in a relative lack of exploration of steganographic feature enhancement at the input image level. In this regard, a novel and efficient method for image-level feature enhancement in steganalysis is proposed. By employing the nearest neighbor interpolation algorithm to expand the size of image, the image’ s steganographic signals is amplified while maintaining their original distribution. This further enhances the model’ s capability of steganographic residual feature extraction, and effectively improves the detectability of steganographic traces without making significant changes to the existing steganalysis process. The experimental results show that the proposed method can significantly improve the model’ s detection accuracy under various steganography algorithms, especially for low embedding rate environment where the accuracy can be improved by 2.81%. It confirms the effectiveness of image-level preprocessing on steganographic residual feature enhancement, and provides a new research perspective on image residual feature extraction for deep learning steganalysis models.

Cite this article

LIU Xulong , LI Weixiang , LIN Kaiqing , LI Bin . Scaling-based image-level feature enhancement for steganalysis[J]. Journal of Cybersecurity, 2024 , 2(1) : 101 -112 . DOI: 10.20172/j.issn.2097-3136.240109

0 引言

随着信息技术的快速发展,数字通信已经成为人们日常生活中最主要的信息交流方式。为了保证信息的隐蔽性,现代隐写术作为传统密码学的有效加强,不仅能够对信息进行加密,而且能够隐藏通信的行为,在网络空间安全领域显现出极高的应用价值。隐写术作为信息隐藏技术的一个分支,起源于Simmons在1983年提出的著名的“囚犯问题”[1]。隐写方的囚犯Alice意图通过监狱长Wendy向另一名囚犯Bob传递经过巧妙隐藏的秘密消息,且力求不引起Wendy的怀疑。同时,作为隐写分析方的Wendy致力于提升其检测能力,以便识别并截断这些隐藏的信息,阻止Alice的非法通信行为。隐写术的高度隐蔽特性,虽然在某些情境下可用于合法的私密通信,但也可能被滥用,成为非法分子进行秘密信息传递的工具,这对社会安全造成了不容忽视的威胁。鉴于此,研发高效的隐写分析技术,用以揭示和中断这些隐蔽信息的非法传输,已成为网络空间安全领域亟须解决的关键课题。
在此背景下,学术界涌现出诸多图像隐写分析方法,可分为传统的基于手工设计特征的隐写分析方法以及基于深度学习的隐写分析方法。基于深度学习的隐写分析技术由于其自动化处理和高检测准确率,迅速成为研究焦点[2-11]。深度学习隐写分析方法主要包括3个部分:残差特征计算、特征提取融合和分类。其中残差特征计算部分的设计至关重要,强烈地影响模型的收敛效果与检测性能。目前,先进的隐写分析方法多采用滤波器进行残差特征计算[12-20],其中一些方法利用固定参数的滤波器提取图像残差特征,如SRM(Spatial Rich Model)滤波核[21]。而有些方法首先对滤波器参数进行初始化,然后让滤波器参数随着模型训练进行自适应调整,以更好地适应特定数据集的特性。此外,部分方法利用卷积网络来模拟滤波器,从随机初始化开始学习残差滤波器,如SRNet(Steganalysis Residual Network)[19]。尽管这些方法在提高隐写分析性能上发挥了重要作用,但它们局限于图像残差计算的滤波核优化,在一定程度上忽视了可以对图像本身进行隐写痕迹增强的潜在优势。
为此,本文探讨了对输入图像进行预处理层面特征增强的可能性,提出了一种新颖有效的图像级残差特征增强方法。该方法通过实施特定的尺寸变换操作,增强分布相同的隐写信号特征,赋能图像隐写痕迹的可识别度。文章不仅全面比较和分析仅全面比较和分析了3种常见的图像插值算法及不同的缩放尺寸,还综合评估了这些技术对隐写分析模型性能的影响。实验结果充分验证了所提方法对多种隐写算法和不同嵌入率条件的有效性。尤其在低嵌入率下,所提方法对于增强由隐写操作引入的像素值间关联性变化效果尤为显著。此外,所提方法在不同的网络模型和不同的数据场景中都显示出一定的适用性,即插即用的特性及强大的普适性进一步凸显了其在实际应用中的可操作性和价值。本文聚焦于隐写分析框架中残差特征提取环节的图像级特征增强研究,为隐写分析预处理阶段的特征计算提供了一个新的研究视角,可启发后续相关研究。
本文的内容安排如下:第1节为预备知识,回顾了深度学习隐写分析领域内有关图像残差特征计算的研究进展,并对图像插值算法进行了概述;第2节深入阐述了所提的基于尺寸变换的图像级特征增强隐写分析方法;第3节展示了实验设置、结果与分析,证实了所提方法的有效性;第4节对全文进行了总结,并就未来的研究方向提出了展望。

1 预备知识

1.1 相关工作

图像残差特征计算对于隐写分析性能至关重要,其目标是通过提升隐写信号的信噪比来增强模型对隐写痕迹的识别能力。当前,该方向的研究重点主要涉及滤波增强和图像预处理增强2个方面。滤波增强通过精细设计的滤波器提取微妙的隐写特征,而图像预处理增强从图像本身出发,直接增强图像中隐写信号的特征表现。

1.1.1 基于滤波增强的特征提取方法

基于滤波增强的残差特征提取方法一般包括固定参数滤波器和自适应参数滤波器2类。在固定参数滤波器方面,Qian-Net[12]和Xu-Net[13]在其网络第一层使用SRM[21]中特定的$ 5 \times 5 $滤波器,用于区分中心像素点与周围像素点的细微差异。特别地,Xu-Net通过引入绝对值层和全局池化层,进一步强化了网络对负向残差信息的学习能力。Yedroudj等[14]采用SRM中的全部30个滤波器作为网络的首层,并固定这些滤波器参数,显著增强了模型在隐写分析任务上的性能。Li等[15]提出的ReST-Net 通过整合3种不同的子网络来提取多样化特征,采用Gabor滤波器、SRM滤波器以及SRM滤波器旋转后的版本,提升了模型的特征提取能力,并通过非线性处理增强了隐写痕迹的可识别度。在自适应参数学习的滤波器方面,Tan等[16]对比了3种滤波器初始化方式,证实了将现有滤波器初始化后再进行自适应更新的策略对于性能提升具有显著作用。基于此,Ye等[17]和Zhang等[18]均使用SRM滤波器参数初始化网络第一层卷积核权重,并允许滤波器参数在训练过程中更新,以形成更有效的高通滤波器,获得了高于其他网络的检测准确率。此外,部分工作倾向于让网络自主构建多样化滤波器。Boroumand等[19]提出的SRNet在网络前端使用随机初始化的卷积网络进行自适应的参数学习。Wang等[20]提出的“方向差分自适应组合”方法则通过中心像素点与周围不同方向像素点的差分,并使用$ 1 \times 1 $卷积对方向差分进行线性组合,该方法能够自适应更新组合参数,有效地提取嵌入信息的残差特征。

1.1.2 基于图像预处理的特征增强方法

尽管基于滤波增强的方法在提升隐写分析性能上取得了显著进展,但仍有部分学者考虑从图像层面直接对输入图像进行预处理,以进一步增强残差特征提取的效果。Butora等[22-23]针对高质量JPEG图像(QF99和QF100)提出了JPEG兼容攻击,通过对图像进行压缩和反压缩处理来显示像素值残差方差的显著变化,并将图像残差作为网络输入,实现了对JPEG高质量图像的有效检测。Feng等[24]对原始图像进行压缩,并将压缩图像提取得到的特征与原图特征合并,输入到集成分类器中进行训练和测试。该策略利用压缩图像的特征反馈增强了原图的隐写特征,实现了对鲁棒载体的有效检测。此外,Benes等[25]采用原图像的缩略图作为辅助信息,将缩略图放大至原图像尺寸以构造边信息,并联合原图输入模型进行训练。尽管这些方法在各自场景中表现出色,但其应用相对受限,仅适用于JPEG图像隐写分析,并且具有一定的偏向性。例如,JPEG兼容攻击主要针对高质量因子的JPEG图像,而其他方法则考虑利用JPEG压缩和图像缩放来增加额外的隐写特征,以辅助原图像检测。鉴于现有方法在特定图像格式和检测场景下的局限性,本文探索如何在保留原始图像隐写痕迹的同时,通过增强图像来提升隐写信号的可检测性。

1.2 图像插值算法

本节回顾3种主流的插值算法,分别是最近邻插值算法、双线性插值算法和双三次插值算法,为选取适用于图像隐写分析任务的插值技术提供必要的理论基础。
1)最近邻插值算法。最近邻插值算法作为一种基础且直观的图像处理技术,通过直接映射原始图像的像素点到缩放后图像的对应位置,实现图像尺寸的变化而不引入额外的计算负担。
最近邻插值算法示意图如图1(a)所示,其具体插值过程可以描述为:首先确定缩放后图像上的目标像素点$ P $坐标为$ (x,y) $,然后在原始图像中找到距离$ P $点最近的4个像素点$ O_1 $$ O_2 $$ O_3 $$ O_4 $,它们的坐标分别为$ (x_0,y_0) $$ (x_0,y_1) $$ (x_1,y_0) $$ (x_1,y_1) $,最后将这4个像素点中距离$ P $点最近的点$ O_3 $的像素值赋给$ P $点。
图 1 图像插值算法示意图

Fig.1 Illustration of image interpolation algorithms

2)双线性插值算法。双线性插值算法在图像尺寸变换中应用非常广泛,原因在于双线性插值算法在计算复杂性与插值质量之间取得了一个良好的平衡。该方法通过对邻近的4个像素点进行线性插值计算,使邻近范围内像素点的值呈现线性变化,以此得到目标像素点的值。如图1(b)所示,双线性插值算法同样需要识别出目标像素点周围的4个最近邻像素点。然后在$ x $方向和$ y $方向上分别进行线性插值计算,这涉及2个过程:在$ x $方向上对邻近像素点进行线性计算,即对$ O_1 $$ O_2 $$ O_3 $$ O_4 $点的横坐标$ x_0 $$ x_1 $进行线性计算得到$ P_1 $$ P_2 $;在$ y $方向上对上一步得到的2个插值结果进行整合,得到目标像素点$ P $的值。该方法的映射公式如下:
$ \left\{ \begin{gathered} f(x,{y_0}) = \dfrac{{{x_1} - x}}{{{x_1} - {x_0}}}f({x_0},{y_0}) + \dfrac{{x - {x_0}}}{{{x_1} - {x_0}}}f({x_1},{y_0}) \\ f(x,{y_1}) = \dfrac{{{x_1} - x}}{{{x_1} - {x_0}}}f({x_0},{y_1}) + \dfrac{{x - {x_0}}}{{{x_1} - {x_0}}}f({x_1},{y_1}) \\ f(x,y){\text{ }} = \dfrac{{{y_1} - y}}{{{y_1} - {y_0}}}f(x,{y_0}) + \dfrac{{y - {y_0}}}{{{y_1} - {y_0}}}f(x,{y_1}) \\ \end{gathered} \right. $
其中,$ f(x,y){\text{ }} $表示坐标点$ (x,y) $的像素值。
3)双三次插值算法。双三次插值算法同样基于原始图像像素点的局部邻域来估计新像素点的值,但它不仅考虑最近的4个像素点,而是涵盖了目标像素点$ P $周围一个更大的邻域,即16个邻近像素点形成的$ 4 \times 4 $网格,如图1(c)所示。该方法通过构建一个三次多项式方程,综合考虑矩形网格中相邻的16个像素点的值及其对目标像素点的贡献度,计算出目标像素点的新值。该多项式的通常形式为:
$ B(x,y) = \sum\limits_{i = 0}^3 {\sum\limits_{j = 0}^3 {a_{ij}} } \cdot w(x - i) \cdot w(y - j) $
其中,$ B $是坐标$ (x,y) $处需要计算的像素值,$ a_{ij} $是基于周围16个原始像素点确定的系数,$ w(x) $$ w(y) $是基于距离的权重函数,通常是三次多项式,用来确定每个邻近像素点对插值结果的贡献度,且每个邻近像素点对$ P $点的贡献度由其与$ P $点的相对距离所决定。
综合上述3种图像插值算法可知,最近邻插值算法的优势是简便和速度快,其在调整图像尺寸时保持了图像内容的一致性,但在插值过程中产生的锯齿状边缘与像素块效应限制了高质量图像的生成。双线性插值算法和双三次插值算法能够产生更为平滑的图像,保持了较好的细节和平滑度,但需要对像素值进行精细计算,因此具有较高的计算复杂度。

2 本文方案

2.1 整体方案

深度学习隐写分析模型的核心任务在于实现载体图像与载密图像之间的精确鉴别,其训练过程通常涉及图像残差特征计算,对这些特征进一步提取、融合以及基于模型输出进行判别并反馈,最终达到抑制图像本身的内容信息、提取像素值间的关联性变化以进行识别与分类的目的。区别于现有研究聚焦于模型设计与优化,本文考虑在预处理阶段对图像进行增强,实现对隐写残差特征更为有效的计算。
本文所提出的基于尺寸变换的图像级特征增强隐写分析方法如图2所示。其中,图像尺寸变换作为预处理阶段的核心模块,可直接融入现行的基于深度学习的隐写分析框架中。具体而言,在模型训练前端,采用精选的图像插值算法和缩放比例对图像进行处理,以期在不改变图像原始内容的前提下,将隐写嵌入导致的修改后像素值及其邻近像素值间的关联性显著放大,进而增强载密图像的隐写残差高频信息,增加具有显著差异性的像素对数量。显然,该模块的实施不仅能够保留图像中原有的隐写信号,而且能够增强特定位置上的隐写痕迹,从而提升隐写分析模型在提取和学习这些痕迹时的精确度。
图 2 基于尺寸变换的图像级特征增强隐写分析框架

Fig.2 Scaling-based image-level feature enhancement framework for steganalysis

本文所提隐写分析方法的训练及推理过程如算法1所示。在训练阶段,需要对所有图像进行缩放处理,然后基于缩放后的训练图像库,使用常规的数据驱动训练流程实现对隐写分析网络的训练,获取有效的隐写分析模型;在推理阶段,对任意输入图像进行相同的缩放处理,然后送入训练好的隐写分析模型进行决策,获取载体图像或载密图像的分类结果。由此可知,本文所提出的方法仅需在训练及推理阶段前实施相同的图像预处理步骤,便可以无缝集成到现行模型训练及推理流程中,具有良好的即插即用特性。
算法1:基于尺寸变换的图像级特征增强隐写分析方法
训练阶段
输入:载体载密图像库
输出:模型参数$ \theta $
1: 对图像库里的每一张图像执行尺寸变换:
    输出图像=图像缩放(输入图像,缩放算法,缩放比例)
2: 随机初始化模型参数$ \theta $
3: 使用缩放后的图像库训练优化模型
4: 输出模型参数$ \theta $
推理阶段
输入:待测试图像,模型参数$ \theta $
输出:分类结果
5: 对待测试图像执行步骤1
6: 使用步骤4的模型对缩放图像进行分类
7: 输出分类结果

2.2 缩放算法与比例的选取

本文所提方法的核心要素(算法1中的步骤1)是图像缩放算法。面向隐写分析任务,图像缩放算法的选取以及配套的缩放比例对于模型性能具有决定性影响。下面将深入探讨不同的图像插值算法和缩放比例对图像残差特征增强的影响,并筛选出最优的插值方案,以最大程度地提升隐写分析性能。

2.2.1 缩放算法的选取

图像插值算法是特征预处理增强的关键模块,在保留隐写信号和增强残差噪声特征方面具有重要作用。在所探讨的3种图像插值算法中,最近邻插值算法通过复制相邻的像素值来填补新像素点,在不引入新的像素值的条件下,有效维持了图像数据的原始性和隐写信号的分布特性。然而,由此产生的锯齿化和像素块状效应对深度学习隐写分析模型的性能影响尚不可知。相对而言,双线性插值算法和双三次插值算法通过对像素点邻域内的像素值进行加权平均计算得到新的像素值,使得插值引起的像素值变化更小,提升了图像质量,但同时也不可避免地引起像素值分布的偏移。这里随机选择图像中10%的像素值进行$ \pm 1 $的随机修改(修改比例为10%),并对图像进行放大一倍处理。结果显示,在最近邻插值算法下,放大图像的像素值修改比例保持稳定。然而,当采用双线性插值算法和双三次插值算法时,修改比例分别急剧升至31.7%和77.3%,该现象表明了插值算法选取的重要性。为此,从图像修改点变化情况和图像像素值分布的KL(Kullback-Leibler)散度2个维度出发,深入探讨3种插值放大算法对隐写信号的影响,以验证选取特定插值算法的合理性和有效性。
1)隐写修改点变化情况。如前文所述,不同插值算法对图像插值像素的影响不尽相同,这直观体现在隐写分析任务中载体图像和载密图像对应修改点像素值的差异上。首先将$ 256 \times 256 $的原始图像通过不同插值算法放大至$ 512 \times 512 $,然后裁取原图和放大图像对应的修改图,如图3所示。显然,最近邻插值算法并没有改变隐写信号的原始分布形式。与之不同的是,双线性插值算法和双三次插值算法虽然能提供更自然的图像外观,但在插值过程中,修改点之间的平滑操作可能掩盖了隐写造成的微小像素值的变化。更重要的是,这2种算法可能导致像素值的修改幅度超过±1,严重干扰了原始隐写修改值的分布,从而降低了隐写分析模型检测有限隐写信号的能力。
图 3 放大图像的隐写修改点变化情况

Fig.3 Changes in steganographic modification points for scaling images

2)图像像素值分布的KL散度。为了进一步阐明不同插值算法对原始图像造成的总体影响,随机选取100张载密图像,绘制插值前后图像在0~255区间内的像素直方图,并使用KL散度对二者的像素值分布进行相似性评估。KL散度越小,插值前后图像的像素值分布越相似,对隐写信号的影响也越小。由图4的结果可知,最近邻插值算法在不引入新的像素值的情况下,有效地保持了原始数据的像素值分布情况。相比之下,双线性插值算法和双三次插值算法通过对像素点邻域内的像素值进行加权平均计算得到新的像素值,导致缩放图像的像素值分布出现了一定偏移。尽管图4中展示的KL散度值相对较小,但在对图像细节极度敏感的隐写分析场景中,即便是微小的像素值分布变化也会显著影响模型的检测性能。
图 4 不同图像插值算法对像素值分布的影响

Fig.4 Effect of different image interpolation algorithms on the distribution of pixel values

3)插值算法对模型检测性能的影响。基于上述分析,图5展示了不同插值算法对隐写分析性能的具体影响,为插值算法的选取提供更直接的依据。
图 5 在BOSSBase图像库和HILL隐写算法下,不同插值算法对LWENet检测准确率的影响

Fig.5 Effect of different interpolation algorithms on LWENet detection accuracy under BOSSBase dataset and HILL steganography algorithm

实验结果显示,在不同嵌入率的条件下,随着插值算法从最近邻插值过渡到更复杂的双线性插值和双三次插值,模型的分类效果呈现逐步下降的趋势。特别是在使用双三次插值算法时,与原始训练集相比,模型性能出现了显著下降。这可能是因为双三次插值具有高度平滑的插值过程,在增强图像视觉质量的同时,极大程度地模糊了隐写信号,使隐写信号更难被隐写分析模型识别。因此,本文选取最近邻插值算法作为图像尺度的变换方法,以尽可能地保留隐写引入的像素值差异,实现对图像残差噪声特征的有效增强。

2.2.2 缩放比例的选取

除了缩放算法,缩放比例的选取同样至关重要,因此要最大化图像预处理尺寸缩放的作用。适当的缩放比例有助于增加图像分辨率和突出隐写痕迹,而不恰当的尺寸变换可能会破坏像素值间的关联性,并损害隐写分析的性能。基于上述选取的最近邻插值算法,探究不同缩放比例对模型检测性能的影响。
图像缩放映射公式用于定义图像缩放过程中的尺寸变换,如式(3)所示:
$ \begin{gathered} {\mathrm{dst}}_x = {\mathrm{src}}_x \times {\mathrm{scale}}_x \\ {\mathrm{dst}}_{\text{y}} = {\mathrm{src}}_y \times {\mathrm{scale}}_y \\ \end{gathered} $
其中,$ {\mathrm{src}}_x $$ {\mathrm{src}}_y $分别表示原始图像的宽度和高度,$ {\mathrm{dst}}_x $${\mathrm{ dst}}_y $分别表示尺寸变换后图像的宽度和高度,$ {\mathrm{scale}}_x $$ {\mathrm{scale}}_y $分别表示宽度和高度的缩放倍数。在隐写分析中,由于图像尺寸变化引起的像素值关联性残差特征变化并不具有显性的特征表示,因此这里通过实验直观地观察不同缩放比例对模型检测性能的影响。具体而言,对原始尺寸为$ 256 \times 256 $的图像,采用缩放比例$ {\mathrm{scale}}_x $$ {\mathrm{scale}}_y $均为$ 0.25、0.5、1.5、2、3 $以及$ ({\mathrm{scale}}_x, {\mathrm{scale}}_y) $$ (1,2)、(2,1) $进行最近邻插值操作,最终得到尺寸分别为$ 64 \times 64、 $$ 128 \times 128、 $$ 384 \times 384、 $$ 512 \times 512、 $$ 768 \times 768、 $$ 256 \times 512 $以及$ 512 \times 256 $的缩放图像。如表1的实验结果所示,随着缩放比例的减小,模型检测精度呈现下降趋势,这反映了隐写信号特征在图像尺寸缩减过程中逐步衰减,尤其在较小尺寸的图像中,隐写信号的损失相对于原始尺寸更为显著。然而,当提高分辨率时,低嵌入率条件下的性能均有普遍提升;但在高嵌入率下,除了$ 512 \times 512 $$ 768 \times 768 $的分辨率之外,其他尺寸未能达到预期的增强效果。这可能是因为在大嵌入率条件下,非整数倍的图像放大破坏了像素值间的固有关联性。
表 1 在BOSSBase图像库、S-UNIWARD隐写算法和0.2/0.4 bpp嵌入率下,不同缩放尺寸对 LWENet 检测准确率的影响

Table 1 Effect of different scaling sizes on LWENet detection accuracy under BOSSBase dataset, S-UNIWARD steganography algorithm and 0.2/0.4 bpp embedding rates

嵌入率/bpp 准确率
256×256(原始) 64×64 128×128 384×384 512×256 256×512 512×512 768×768
0.2 77.72% 52.28% 55.97% 78.23% 80.57% 79.97% 80.53% 80.87%
0.4 89.42% 54.93% 63.32% 87.80% 88.95% 88.75% 90.45% 89.80%
综上所述,考虑到检测性能的稳定性及模型训练的复杂度,本文最终采用高度、宽度缩放比例为2倍的最近邻插值算法作为算法1中的图像缩放方法。

3 实验结果与分析

3.1 实验设置

3.1.1 数据集

实验在SZUBase [26] 和BOSSBase [27]数据集上进行。BOSSBase数据集包含10 000张空域灰度图像, 取自 BOSSBase v1.01 图像集,是专门用于隐写及隐写分析领域的标准数据集之一。SZUBase图像数据集由 41 385 张佳能 CR2 格式的图像组成,从中随机抽取 10 000 张图像进行实验。在载体图像生成上,使用脚本将上述全分辨率图像转换为$ 512 \times 512 $的灰度图像,并使用Matlab的“imresize”函数进行下采样,得到SZUBase_256($ 256 \times 256 $)、BOSSBase_256($ 256 \times 256 $)和BOSSBase_128($ 128 \times 128 $)3个不同的图像库。在载密图像生成上,使用S-UNIWARD[28]、HILL[29]和MiPOD[30] 3种空域自适应隐写算法对图像库进行隐写操作, 隐写嵌入率分别为0.1、0.2、0.3、0.4 bpp(bit per pixel,比特每像素)。在JPEG载体图像和载密图像生成方面,首先将BOSSBase_256压缩成质量因子为 85 的 JPEG 图像,得到BOSSBase_QF85图像库,然后采用J-UNIWARD [28]隐写算法和$ 0.1、0.2、0.3、0.4 $ bpnzac(bits per non-zero AC coefficient,比特每非零AC系数)的嵌入率生成载密图像,最后将每个图像库中的载体—载密图像对以7∶1∶2的比例切分为训练、验证和测试集。

3.1.2 隐写分析网络

对于深度学习隐写分析网络,选用CovNet[3]和LWENet[9]测试所提方法的性能,二者均基于深度学习PyTorch框架[31]实现和训练。使用SGD(Stochastic Gradient Descent)优化器,设置初始学习率为0.01,在Batch_size分别为32和64下训练,总共训练200个epoch。所有实验均在NVIDIA Tesla A100 PCIE-40GB GPU单卡上运行。

3.1.3 评估指标

在隐写分析领域,准确率(Accuracy,ACC)是衡量模型性能的关键指标,具有度量模型准确区分未经隐写处理的载体图像与经过隐写处理的载密图像的能力。隐写分析任务本质上是二分类问题, 故可将载体图像类定义为阳性类, 将载密图像类定义为阴性类。正确识别的阳性样本数与阴性样本数之和占总样本数的比例即为检测准确率:
$ {\mathrm{ACC}} = \frac{{{\mathrm{TP}} + {\mathrm{TN}}}}{{{{P}} + {{N}}}} $
其中,$ {\mathrm{TP}} $代表真阳性样本数,即模型正确标记为载体图像的样本数;$ {\mathrm{TN}} $代表真阴性样本数,即模型正确标记为载密图像的样本数;$ P $代表所有真实阳性样本的数量;$ N $代表所有真实阴性样本的数量。

3.2 不同场景下的检测性能

通过定量实验探讨了最近邻插值算法的图像隐写特征增强方法对隐写分析性能的影响,实验涵盖了不同网络架构、数据库以及输入图像尺寸,确保了所提方案的适用性和可靠性。

3.2.1 针对不同模型的性能

在隐写分析任务中,不同网络架构对检测性能的影响存在差异。基于目前先进且高效的2种网络架构CovNet和LWENet,本文对比了应用所提方法前后的性能,突出所提方法对于隐写分析模型的普适性。实验均在BOSSBase_256数据库上进行,结果如表2所示。随着嵌入率的增加,2种网络架构的检测能力都呈现出上升趋势,这是由于隐写嵌入率越高,隐写痕迹越明显,检测任务越容易。此外,所提方法在2种网络架构中均展现出有效性。特别是在较低嵌入率条件下,所提方法具有更显著的性能提升,凸显了其在增强模型识别隐写痕迹方面的能力。例如,在0.2 bpp、S-UNIWARD嵌入条件下,LWENet在融入所提方法后达到了2.81%的性能增益;在0.1 bpp、MiPOD嵌入条件下,CovNet结合所提方法也实现了2.42%的性能提升。这些结果不仅验证了所提方法在不同网络架构上的适用性,也揭示了其在提升微弱隐写信号检测精度上的潜力。
表 2 在BOSSBase图像库和0.1/0.2/0.3/0.4 bpp嵌入率下,不同模型对原始图像与放大图像的检测准确率

Table 2 Detection accuracy of different models for original and enlarged images under BOSSBase dataset and 0.1/0.2/0.3/0.4 bpp embedding rates

隐写算法 图像 准确率
CovNet LWENet
0.1 0.2 0.3 0.4 0.1 0.2 0.3 0.4
S-UNIWARD 原始 66.00% 80.07% 85.65% 89.65% 70.13% 77.72% 84.82% 89.42%
放大 70.47% 81.47% 85.88% 89.32% 71.65% 80.53% 86.02% 90.45%
HILL 原始 66.63% 75.42% 79.67% 84.38% 67.57% 75.87% 79.50% 85.57%
放大 68.47% 76.55% 81.27% 84.78% 67.93% 77.42% 81.20% 86.19%
MiPOD 原始 64.52% 74.98% 78.95% 83.27% 65.28% 72.52% 78.67% 84.72%
放大 66.93% 75.58% 80.43% 85.30% 65.65% 74.70% 80.63% 85.00%
为了进一步证明所提方法的优越性,将其与当前性能优异的隐写分析方法SRNet[19]进行了性能对比,实验结果如表3所示。在应用本文所提方法后,CovNet和LWENet在所有测试场景下的性能均优于SRNet。
表 3 在BOSSBase图像库、S-UNIWARD隐写算法和0.2/0.4 bpp嵌入率下,不同隐写分析模型的检测准确率

Table 3 Detection accuracy of different steganalysis models under BOSSBase dataset, S-UNIWARD steganography algorithm and 0.2/0.4 bpp embedding rates

隐写分析模型 准确率
0.2 0.4
SRNet 79.65% 89.25%
CovNet + 所提方法 81.47% 89.32%
LWENet + 所提方法 80.53% 90.45%
同时,本节采用伯努利分布进行假设检验,以评估尺寸放大方法在改善网络模型性能方面的可靠性。从上述实验测试集中随机抽取200对测试图像,在LWENet上融入所提方法进行分析。在0.2、0.4 bpp嵌入率下,模型的$ P $值分别为0.3438、0.6098,均大于显著水平0.05,说明2个模型均接受原假设,即抽样结果验证了尺寸放大模型在平均检测准确率的可靠性,实验结果是可信的。

3.2.2 针对不同图像尺寸的性能

本节评估了所提的图像级特征增强方法在处理更大尺寸图像时的可拓展性。受限于当前算力,使用小尺寸原始图像库BOSSBase_128进行实验,以便检验所提方法在高度、宽度为2倍(尺寸放大到$ 256 \times 256 $)及4倍(尺寸放大到$ 512 \times 512 $)放大比例下的性能,实验结果如表4所示。
表 4 在BOSSBase图像库和0.1/0.2/0.3/0.4 bpp嵌入率下,CovNet对不同尺寸图像的检测准确率

Table 4 Detection accuracy of CovNet for images of different sizes under BOSSBase dataset and 0.1/0.2/0.3/0.4 bpp embedding rates

算法 图像 准确率
0.1 0.2 0.3 0.4
S-UNIWARD 原始 59.92% 69.63% 76.68% 82.70%
放大至2倍 60.90% 71.57% 78.47% 83.27%
放大至4倍 61.12% 71.17% 77.80% 83.33%
HILL 原始 59.07% 66.33% 72.68% 78.17%
放大至2倍 60.98% 68.85% 75.28% 78.97%
放大至4倍 61.70% 69.60% 74.32% 78.65%
MiPOD 原始 58.75% 67.07% 72.38% 77.22%
放大至2倍 59.85% 67.75% 73.32% 77.68%
放大至4倍 60.02% 68.15% 72.05% 78.20%
在原始图像尺寸降低的条件下,按2倍比例放大时所提方法依然有效提升了隐写分析性能,该结果与前文结论相符,验证了所提方法在不同输入图像尺寸下的适用性。此外,当图像尺寸按4倍比例进一步放大时,在较低嵌入率的场景下,模型检测性能仍然得到了提升,这表明增大图像尺寸的放大倍数对于增强模型捕捉隐写特征的能力具有正面作用。然而,随着嵌入率的增大,部分结果并未体现出明显的性能提升,这可能是由于模型在2倍放大比例下性能已逼近极限,提示未来研究可聚焦于度量模型在不同输入尺寸、缩放比例和嵌入率下的性能上界。

3.2.3 针对不同数据库的性能

在隐写分析任务中,不同数据库的图像来源、质量、分辨率等存在较大差异,直接影响隐写算法的嵌入效果和隐写分析方法的检测性能。因此,需要验证所提方法在面对其他图像库时的隐写分析检测性能。本节基于SZUBase_256数据库对CovNet采用所提方法前后的性能进行了比较,实验结果如表5所示。表2表5的结果表明,在同等条件下,SZUBase_256图像库相比BOSSBase_256图像库更难被检测,这可能是因为SZUBase_256包含更加多样复杂的图像样本。尽管如此,所提的图像级特征增强方法在这2个图像库上均实现了检测性能的稳定提升。在检测S-UNIWARD、HILL和MiPOD隐写算法时,所提方法在不同嵌入率下的最大性能增益均大于1%。这证实了其对于不同图像库的良好适应性,显示其对不同来源图像均具有增强隐写信号特征的能力。
表 5 在SZUBase图像库和0.1/0.2/0.3/0.4 bpp嵌入率下,CovNet对不同隐写算法和嵌入率图像的检测准确率

Table 5 Detection accuracy of CovNet for images with different steganography algorithms and embedding rates under SZUBase dataset and 0.1/0.2/0.3/0.4 bpp embedding rates

算法 图像 准确率
0.1 0.2 0.3 0.4
S-UNIWARD 原始 67.05% 77.78% 82.73% 86.65
放大 68.47% 77.62% 83.35% 86.85%
HILL 原始 63.98% 72.15% 76.12% 81.00%
放大 64.60% 73.48% 77.68% 82.57%
MiPOD 原始 61.55% 71.20% 76.00% 81.35%
放大 62.50% 71.73% 77.05% 82.63%

3.3 方案的进一步分析

3.3.1 可视化探究

为了进一步探究所提增强方法的作用机理,并验证其对图像隐写分析性能的具体影响,本节借鉴文献[9]和文献[11],使用SRM滤波核对应用增强方法前后的图像进行残差计算,得到了30个通道的隐写信号信噪比(Signal-to-Noise Ratio, SNR)。SNR值越高,说明所提取得到的图像隐写信号残差特征越丰富。如图6所示,图像经过放大处理并应用SRM滤波后,其信噪比得到了显著提升,这直观地展示了图像级预处理对残差特征的增强效果,证实了所提方法在维持和提升隐写信号微观特征上的重要作用。
图 6 256×256原始图像与512×512放大图像的隐写信号SNR比较

Fig.6 Comparison of SNR of steganographic signals for 256×256 original image and 512×512 enlarged image

同时,利用Grad-CAM(Gradient-weighted Class Activation Mapping)技术[32]来揭示模型在处理原始图像和放大图像时的关注区域情况。Grad-CAM作为一种解释性工具,广泛用于解释卷积神经网络的决策过程,通过突出显示网络在做出决策时所侧重的图像区域,提供对模型认知过程的直观理解。本节应用Grad-CAM技术可视化LWENet处理256×256原始图像与512×512放大图像的行为差异。如图7所示,在处理原始尺寸图像时,模型的注意力分布较为分散,未能集中关注特定区域。然而,对于经过放大处理的图像,模型明显展现出更加聚焦的关注模式,这意味着图像放大策略有利于模型对隐写信息区域的精准定位。尤其值得注意的是,与原始尺寸图像训练的模型相比,放大图像训练的模型不仅维持了原始关注区域,而且有效地将其关注范围扩展至更大的区域,这表明图像放大处理不仅优化了模型对特定区域内隐写特征的感知能力,还显著提升了模型对整体图像隐写特征的检测范围,从而有助于提高隐写分析性能。
图 7 LWENet在BOSSBase下对不同尺寸图像的注意力图

Fig.7 Attention maps of LWENet for images of different sizes under BOSSBase

3.3.2 模型计算复杂度

图像尺寸放大操作会不可避免地引起模型复杂度的增加。为了说明图像放大操作的必要性,同时评估将模型复杂度维持在原始水平的可行性,本文设计了相应的验证实验。具体而言,选取BOSSBase_256数据库为基准,采用HILL嵌入算法,嵌入率分别为0.2和0.3 bpp,通过最近邻插值方法将图像放大至$ 512 \times 512 $,然后将放大后的图像裁剪还原为$ 256 \times 256 $,用于训练隐写分析模型。实验设计从保持训练图像数量一定和保持训练图像内容一致的角度出发,采用2种裁剪策略:在放大后的512×512 图像上随机裁剪出1张256×256图像,以保证训练集数据量相同(裁剪 1);将512×512图像按顺序裁剪为4张256×256小图(裁剪 2),以保证图像的可见内容一致,从而探究是否可以通过裁剪方式减少模型的训练复杂度(计算浮点数),实验结果如表 6 所示。虽然采用不同的裁剪策略不增加模型的复杂度,但是却抑制了模型的性能,这可能是因为隐写修改多发生于图像纹理复杂度较高的区域,而裁剪操作可能错误地将载密标签赋给没有发生隐写修改的纹理平滑的子图,误导了模型的训练学习。与之相比,本文所提方法虽然在训练阶段计算的浮点数有所增加,但对应模型的存储大小保持不变。因此,对图像进行尺寸放大,尽管一定程度上增加了模型复杂度,但是却可以显著提高隐写分析模型的检测精度。显然,这种性能的提升是值得投入额外计算资源的。
表 6 在BOSSBase数据库和0.2/0.3 bpp嵌入率下,CovNet对不同裁剪方式图像的检测准确率及其模型计算复杂度

Table 6 Detection accuracy and its model computational complexity of CovNet for different cropping images under BOSSBase dataset and 0.2/0.3 bpp embedding rates

尺寸 训练
数据
准确率 参数量/M 计算浮点数/B
0.2 0.3
256×256 原始 75.42% 79.67% 0.69 3.83
裁剪1 68.80% 73.80%
裁剪2 69.08% 74.35%
512×512 放大 76.55% 81.27% 15.32

3.3.3 方法适用性分析

本节进一步探究了所提方法在检测五元嵌入隐写算法和JPEG域隐写算法时的适配性。
1)空域图像五元嵌入隐写分析
空域图像五元嵌入隐写算法允许对像素值进行更大幅度的修改,即除了±1修改外,还允许进行±2修改,目的是在不增加检测风险的情况下,提高信息隐藏的容量。采用QGM(Quantized Gaussian Model)隐写算法[33]对BOSSBase_256图像库进行五元隐写嵌入,以探究所提方法在检测空域五元嵌入隐写算法时的适用性,实验结果如表7所示。
表 7 在BOSSBase数据库和0.1/0.2/0.3/0.4 bpp嵌入率下,LWENet对QGM隐写算法的检测准确率

Table 7 Detection accuracy of LWENet for QGM steganography algorithms payload under BOSSBase dataset and 0.1/0.2/0.3/0.4 bpp embedding rates

图像 准确率
0.1 0.2 0.3 0.4
原始 67.17% 75.43% 80.93% 84.38%
放大 69.43% 78.67% 82.70% 85.98%
本文所提方法在不同嵌入率下均展现出性能的提升,这不仅证实了所提方法在提高隐写分析精度方面的有效性,同时也展示了其在空域自适应隐写检测领域的广泛适用性。
2)JPEG域隐写分析
JPEG域隐写分析也是重要的研究分支,受到学者的高度关注。传统的JPEG域隐写分析方法通常将JPEG图像解压缩至空域,然后利用空域隐写分析模型进行隐写检测,这与本文所提方法相兼容。为此,进一步评估了所提方法在JPEG域隐写分析场景下的性能表现,实验结果如图8所示。采用所提方法处理JPEG图像时的检测性能出现一定程度的降低,这可能与JPEG图像的DCT系数隐写特性密切相关。在DCT系数上进行隐写时,修改操作通常会影响整个$ 8 \times 8 $的DCT块,进而在空域产生明显的块状修改痕迹。然而,所提方法的增强隐写操作主要关注单个像素值的细微修改(如$ \pm 1 $),这种在单个像素值层面的处理难以有效模拟和反映DCT系数在空域的修改痕迹。因此,将JPEG图像先转换至空域再应用所提出的图像插值方法,可能无法有效表达DCT域的隐写修改特征,甚至可能误导模型的学习过程,导致其检测性能下降。
图 8 LWENet在BOSSBase_QF85和J-UNIWARD下对原始图像和放大图像的检测准确率

Fig.8 Detection accuracy of LWENet for original and enlarged images under BOSSBase_QF85 and J-UNIWARD

4 结束语

本文提出了一种新颖且高效的隐写分析图像级残差特征增强方法。与当前聚焦于后端网络设计的隐写分析研究不同,本文探究了预处理阶段尺寸变换如何增强隐写分析性能的问题。所提出的基于最近邻插值放大的隐写分析方法,显著提升了模型在多种隐写算法和不同检测场景下的检测准确率,尤其在低嵌入率这一检测难度更大的环境中性能提升更为显著,这充分验证了所提方法的有效性。该图像级特征增强方法为隐写分析优化研究提供了参考,凸显了在设计高效的隐写分析模型时考虑更基础的图像预处理操作的重要性。
尽管本文方法在空域隐写分析中取得了优异的性能,但其在JPEG域隐写分析中的应用尚需进一步探究。鉴于最近邻插值算法是针对空域像素点的图像缩放操作,为JPEG图像设计合适的图像缩放策略显得尤为重要。此外,所提方法在训练过程中引入了一定的计算复杂度,因此如何在不牺牲性能的前提下降低模型训练的复杂度,也是未来研究的重点。
1
SIMMONS G J. The prisoners’ problem and the subliminal channel[C]//Advances in Cryptology: Proceedings of Crypto 83,1984: 51-67.

2
HU D H, ZHOU S N, SHEN Q, et al. Digital image steganalysis based on visual attention and deep reinforcement learning[J]. IEEE Access, 2019, 7, 25924- 25935.

DOI

3
DENG X Q,CHEN B L,LUO W Q,et al. Fast and effective global covariance pooling network for image steganalysis[C]//Proceedings of the ACM Workshop on Information Hiding and Multimedia Security,2019:230-234.

4
ZHANG S Y, ZHANG H, ZHAO X F, et al. A deep residual multi-scale convolutional network for spatial steganalysis[C]//Digital Forensics and Watermarking:17th International Workshop,2019:40-52.

5
ZENG J S, TAN S Q, LIU G Q, et al. WISERNet: wider separate-then-reunion network for steganalysis of color images[J]. IEEE Transactions on Information Forensics and Security, 2019, 14 (10): 2735- 2748.

DOI

6
WU S T, ZHONG S H, LIU Y. A novel convolutional neural network for image steganalysis with shared normalization[J]. IEEE Transactions on Multimedia, 2019, 22 (1): 256- 270.

DOI

7
NI D N, FENG G R, SHEN L Q, et al. Selective ensemble classification of image steganalysis via deep Q network[J]. IEEE Signal Processing Letters, 2019, 26 (7): 1065- 1069.

DOI

8
YOU W K, ZHANG H, ZHAO X F. A siamese CNN for image steganalysis[J]. IEEE Transactions on Information Forensics and Security, 2021, 16, 291- 306.

DOI

9
WENG S W, CHEN M F, YU L F, et al. Lightweight and effective deep image steganalysis network[J]. IEEE Signal Processing Letters, 2022, 29, 1888- 1892.

DOI

10
LUO G,WEI P,ZHU S W,et al. Image steganalysis with convolutional vision transformer[C]//2022 IEEE International Conference on Acoustics,Speech and Signal Processing (ICASSP),2022:3089-3093.

11
WENG S W, SUN S Y, YU L F. Fast SwT-based deep steganalysis network for arbitrary-sized images[J]. IEEE Signal Processing Letters, 2023, 30, 1782- 1786.

DOI

12
QIAN Y L,DONG J,WANG W,et al. Deep learning for steganalysis via convolutional neural networks[C]//Proceedings of SPIE-The International Society for Optical Engineering,2015:171-180.

13
XU G S, WU H Z, SHI Y Q. Structural design of convolutional neural networks for steganalysis[J]. IEEE Signal Processing Letters, 2016, 23 (5): 708- 712.

DOI

14
YEDROUDJ M,COMBY F,CHAUMONT M. Yedroudj-Net:an efficient CNN for spatial steganalysis[C]//2018 IEEE International Conference on Acoustics,Speech and Signal Processing,2018:2092-2096.

15
LI B, WEI W H, FERREIRA A, et al. ReST-Net: diverse activation modules and parallel subnets-based CNN for spatial image steganalysis[J]. IEEE Signal Processing Letters, 2018, 25 (5): 650- 654.

DOI

16
TAN S Q,LI B. Stacked convolutional auto-encoders for steganalysis of digital images[C]//Proceedings of Signal and Information Processing Association Annual Summit and Conference (APSIPA),2014:1-4.

17
YE J, NI J Q, YI Y. Deep learning hierarchical representations for image steganalysis[J]. IEEE Transactions on Information Forensics and Security, 2017, 12 (11): 2545- 2557.

DOI

18
ZHANG R, ZHU F, LIU J Y, et al. Depth-wise separable convolutions and multi-level pooling for an efficient spatial CNN-based steganalysis[J]. IEEE Transactions on Information Forensics and Security, 2020, 15, 1138- 1150.

DOI

19
BOROUMAND M, CHEN M, FRI1DRICH J. Deep residual network for steganalysis of digital images[J]. IEEE Transactions on Information Forensics and Security, 2018, 14 (5): 1181- 1193.

20
王晓丹, 李京泰, 宋亚飞. DDAC: 面向卷积神经网络图像隐写分析模型的特征提取方法[J]. 通信学报, 2022, 43 (5): 68- 81.

WANG X D, LI J T, SONG Y F. DDAC: a feature extraction method for convolutional neural network image steganalysis model[J]. Journal on Communications, 2022, 43 (5): 68- 81.

21
FRIDRICH J, KODOVSKY J. Rich models for steganalysis of digital images[J]. IEEE Transactions on Information Forensics and Security, 2012, 7 (3): 868- 882.

DOI

22
BUTORA J,FRIDRICH J. Extending the reverse JPEG compatibility attack to double compressed images[C]//2021 IEEE International Conference on Acoustics,Speech and Signal Processing (ICASSP),2021:2710-2714.

23
BUTORA J, FRIDRICH J. Reverse JPEG compatibility attack[J]. IEEE Transactions on Information Forensics and Security, 2019, 15, 1444- 1454.

24
FENG J L,WANG Y F,CHEN K J,et al. An effective steganalysis for robust steganography with repetitive JPEG compression[C]//2022 IEEE International Conference on Acoustics,Speech and Signal Processing (ICASSP),2022:3084-3088.

25
BENEŠ M,LORCH B,BÖHME R. JPEG steganalysis using leaked cover thumbnails[C]//2023 IEEE International Workshop on Information Forensics and Security (WIFS),2023:1-6.

26
TANG W X, TAN S Q, LI B, et al. Automatic steganographic distortion learning using a generative adversarial network[J]. IEEE Signal Processing Letters, 2017, 24 (10): 1547- 1551.

DOI

27
BAS P,FILLER T,PEVNÝ T. Break our steganographic system:the ins and outs of organizing BOSS[C]//International Workshop on Information Hiding,2011:59-70.

28
HOLUB V, FRIDRICH J, DENEMARK T. Universal distortion function for steganography in an arbitrary domain[J]. EURASIP Journal on Information Security, 2014, 2014, 1- 13.

DOI

29
LI B,WANG M,HUANG J W,et al. A new cost function for spatial image steganography[C]//2014 IEEE International Conference on Image Processing (ICIP),2014:4206-4210.

30
SEDIGHI V, COGRANNE R, FRIDRICH J. Content-adaptive steganography by minimizing statistical detectability[J]. IEEE Transactions on Information Forensics and Security, 2015, 11 (2): 221- 234.

31
PASZKE A,GROSS S,CHINTALA S,et al. Automatic differentiation in PyTorch[C]//31st Conference on Neural Information Processing Systems,2017: 1-4.

32
SELVARAJU R R,COGSWELL M,DAS A,et al. Grad-CAM:visual explanations from deep networks via gradient-based localization[C]//2017 IEEE International Conference on Computer Vision(ICCV),2017:618-626.

33
SHARIFZADEH M, ALORAINI M, SCHONFELD D. Adaptive batch size image merging steganography and quantized Gaussian image steganography[J]. IEEE Transactions on Information Forensics and Security, 2019, 15, 867- 879.

Outlines

/