综述

端到端图像隐写研究

  • 阳建华 1, 2 ,
  • 邹俊杰 1 ,
  • 李顺广 1 ,
  • 尚菲 1, 3 ,
  • 廖鑫 4 ,
  • 丁丽萍 5 ,
  • 康显桂 , 3, *
展开
  • 1. 广东技术师范大学,广州 510000
  • 2. 南京大学计算机软件新技术全国重点实验室,南京 210023
  • 3. 中山大学计算机学院广东省信息安全重点实验室,广州 510000
  • 4. 湖南大学,长沙 410000
  • 5. 中国科学院软件研究所,北京 100190

网络出版日期: 2025-07-18

基金资助

广东省基础与应用基础研究基金自然科学基金面上项目( 2025A1515011097), 广东省高等学校重点领域项目(2024ZDZX1038)、南京大学计算机软件新技术全国重点实验室开放课题(KFKT2025B02)、广东省自然科学基金(2514050000889)、广东省信息安全技术重点实验室课题(2023B1212060026)、中山市科学技术局引进高端科研机构创新专项项目(2020AG007)

版权

版权所有©《网络空间安全科学学报》编辑部 2025

Research on end-to-end image steganography

  • YANG Jianhua 1, 2 ,
  • ZOU Junjie 1 ,
  • LI Shunguang 1 ,
  • SHANG Fei 1, 3 ,
  • LIAO Xin 4 ,
  • DING Liping 5 ,
  • KANG Xiangui , 3, *
Expand
  • 1. Guangdong Polytechnic Normal University, Guangzhou 510000, China
  • 2. State Key Lab. for Novel Software Technology, Nanjing University, Nanjing 210023, China
  • 3. Guangdong Key Laboratory of Information Security Technology, School of Computer Science, Sun Yat-sen University, Guangzhou 510006,China
  • 4. Hunan University, Changsha 410000, China
  • 5. Institute of Software Chinese Academy of Sciences, Beijing 100190, China

Online published: 2025-07-18

Copyright

Copyright ©2025 Journal of Aeronautical Materials. All rights reserved.

摘要

图像隐写是指将秘密信息以一种不可感知的方式隐藏到载体图像中,从而实现隐秘通信。传统隐写方法在最小失真框架下,通过隐写代价函数设计与编码算法对载体图像低位像素进行修改以嵌入秘密信息。近年来,端到端图像隐写成为热点,该方向构建编码与解码网络,通过联合训练的方式实现信息嵌入和提取。采用深度模型加强了隐写的容量,通过隐写与隐写分析对抗训练加强了隐写安全性,通过在训练中加入模拟干扰层提升了隐写鲁棒性。本总结对端到端图像隐写方法进行了描述和分析,包括端到端空域图像隐写和端到端频域图像隐写。最后指出端到端隐写存在的问题,并展望了未来研究方向。

本文引用格式

阳建华 , 邹俊杰 , 李顺广 , 尚菲 , 廖鑫 , 丁丽萍 , 康显桂 . 端到端图像隐写研究[J]. 网络空间安全科学学报, 2025 , 3(2) : 28 -40 . DOI: 10.20172/j.issn.2097-3136.250203

Abstract

Image steganography refers to hiding secret information in the cover image with an unconcealed way, thereby achieving covert communication. Under the framework of minimum distortion, the traditional steganography method modifies the low-order pixels of the cover image through the design of steganography cost functions and coding algorithms to embed secret information. In recent years, end-to-end image steganography has become a hot topic. In this direction, encoding and decoding networks were constructed to achieve information embedding and extraction through joint training. The capacity of steganography was enhanced by adopting a deep model. The steganography security was strengthened through the adversarial training of steganography and steganalysis. The robustness of the steganography was improved by adding a simulated noise layer in the training step. the end-to-end image steganography methods was described and analyzed, including end-to-end spatial domain image steganography and end-to-end frequency domain image steganography. Finally, the deficiencies existing in end-to-end steganography and future research directions were pointed out.

0 引言

数字图像隐写利用视觉冗余,将秘密信息以不可感知方式嵌入载体图像,并通过公开信道进行传输,从而实现隐秘通信。其流程如图1所示,发送方Alice通过编码算法嵌入秘密信息获得载密图像,接收方Bob通过共享的密钥由解码算法提取秘密信息,攻击方Eve通过分类的方法检测载体是否隐藏秘密信息。与加密不同的是,隐写是通过隐藏“隐秘通信”这一行为实现安全通信的,而信息加密后体现为乱码,攻击方知晓加密行为。在实际应用中常结合二者优势,先对信息加密,再通过隐写方式实现隐秘通信。
图 1 图像隐写流程示意图

Fig.1 Diagram of image steganography

为评价隐写算法,需要对隐写算法进行对比,主要评价指标如下:
(1)图像质量。嵌入秘密信息后,视觉不可感知是隐写最基本的要求,常用图像质量评价指标峰值信噪比(Peak Signal-to-Noise Ratio,PSNR)、结构相似性(Structural SIMilarity,SSIM)进行衡量。
(2)安全性。隐写需要抵抗隐写分析的检测,其安全性是评价隐写性能的指标之一,通常用隐写分析检测错误率表示。
(3)容量。对于发送方而言,期望在同一载体中传递更多的信息,容量通常用每像素位数(bits per pixel,bpp)或者每非零交流系数的比特数(bits per non-zero AC coefficient,bpnzAC)表示。
(4)鲁棒性。在实际应用中,图像在有损传输信道中可能会受到压缩、噪声等攻击,从而导致信息无法准确恢复,因此鲁棒性常用秘密信息提取率进行衡量。
以上几个指标往往相互矛盾,如当嵌入容量增加时,需要修改更多的像素,从而加强了对图像的高阶统计特性修改,导致图像质量下降,容易被隐写分析器检测,安全性降低。
早期隐写采用简单替换低位修改方法LSB(Least Significant Bits),容易受到统计攻击。主流传统隐写采用最小失真框架设计代价函数,结合编码算法STC[1](Syndrome-Trellis Codes)以提升隐写安全性。
假设C = ($ {{c}}_{1} $, ···, $ {{c}}_{{n}} $) 为载体图像,S = ($ {{s}}_{1} $, ···,$ {{s}}_{{n}} $) 为载密图像。载体图像C修改为S的失真函数D(C, S)记为 D(S),则平均失真为:
$ {{E}}_{\pi}\left[{D}\right]=\sum _{{S}}\pi\left({S}\right){D}\left({S}\right) $
其中,π为将C修改S的概率分布,隐写信息修改分布的熵为:
$ {H}\left(\pi\right)=-\sum _{{s}}\pi\left({S}\right){log}\left(\pi\left({S}\right)\right) $
则最小化失真可以表示为:
$ \underset{\pi}{{{\mathrm{min}}}}{{E}}_{\pi} [D] $
$ {\mathrm{subject}}\ {\mathrm{to}}\ {H}\left(\pi\right) = m $
即在满足嵌入长度为m的信息的同时,且最小化隐写失真。当嵌入修改符合Gibbs分布时[2],有最优解:
$ \pi\left({S}\right)=\frac{{{\mathrm{exp}}}\left(-\lambda D\left({S}\right)\right)}{\sum _{{S}} {{\mathrm{exp}}}\left(-\lambda {D}\left({S}\right)\right)} $
其中,$ \lambda $可通过两分查找求解,通常用最优模拟嵌入衡量隐写代价设计性能。在实际应用中,由于STC编码性能逼近率失真上界,隐写研究转换为设计隐写代价,并结合STC编码进行信息嵌入与提取。
在空域,经典隐写代价设计算法有S-UNIWARD[3]、HILL[4]、MiPOD[5]。在JPEG域,经典隐写算法有J-UNIWARD[3]、UERD[6]等。随着深度学习技术和发展,基于深度学习的隐写分析不断取得进展,如XuNet[7]、SRNet[8]大幅度提高了检测精度。为了对抗深度学习隐写分析器,基于对抗训练自动学习隐写代价的研究成为热点,如空域算法ASDL-GAN[9]、UT-GAN[10]、SPAR-RL[11]、Steg-GMAN[12]、ARES[13],JPEG域算法JS-GAN[14]、JEC-RL[15]以及添加边信息估计算法JS-GAN-ESI[16] 等。
基于最小失真框架的隐写优点为安全性高,不易被攻击方察觉,其不足之处在于受到JPEG压缩等攻击时,会造成秘密信息无法完全恢复。
近年来,基于深度神经网络的端到端图像隐写的各项指标均表现出一定优势,成为研究热点。端到端隐写与基于最小失真框架隐写的区别在于:信息嵌入与提取过程全部由深度神经网络自动完成。其优点是容量更大、在训练过程中加入干扰与对抗训练将增加隐写的鲁棒性或安全性,其基本流程如图2所示。
图 2 端到端隐写基本流程示意图

Fig.2 Basic diagram of end-to-end steganography

本文组织结构如下:第1节详细总结了端到端空域图像隐写;第2节详细总结了端到端频域图像隐写;第3节对比了经典方法的性能;第4节指出了当前端到端图像隐写存在的问题与挑战;第5节进行了总结,并展望了未来研究方向。

1 端到端空域图像隐写

空域图像隐写通过修改数字图像像素来实现隐秘信息传输。端到端空域图像隐写的代表性方法按照时间节点排列,其发展过程如图3所示。
图 3 端到端空域图像隐写的发展历程

Fig.3 Development process of end-to-end image steganography in spatial domain

Baluja等[17]提出了一种端到端隐写系统,该系统将图像作为输入的秘密信息,如图4所示。该系统由预处理网络、隐写网络、信息恢复网络组成。预处理网络将秘密信息进行转换,使其符合载体尺寸;信息隐写网络将载体图像和秘密信息作为输入并输出载密图像;解码网络从载密图像中恢复秘密信息。该方法的训练损失函数为:
图 4 Baluja等[17]提出的端到端隐写框架

Fig.4 End-to-end steganographic framework proposed by Baluja et al. [17]

$ {L}({c},{{c}}^{{\prime}},{ }{s},{{s}}^{{\prime}})=\left|\right|{c}-{{c}}^{{\prime}}\left|\right|{ }+{\beta }\left|\right|{s}-{{s}}^{{\prime}}\left|\right| $
其中,c$ {c}^{\prime} $代表载体图像和载密图像;s$ {s}^{\prime} $表示秘密信息和恢复的秘密信息;||c - $ {c}^{\prime} $||表示对载体图像和载密图像进行约束使得二者更为接近,确保网络在隐藏秘密图像的同时,尽量减少对载体图像视觉影响;||$ s $-$ {s}^{\prime} $||将确保提取的秘密信息与嵌入秘密信息更为接近,提高信息提取率;$ \mathrm{\beta } $是权重参数,用于平衡视觉质量与秘密信息的提取。
Hayes等[18]在端到端联合训练中增加了判别网络,通过隐写与隐写分析对抗训练的方式提高隐写的安全性,端到端对抗训练网络如图5所示。Alice 将载体进行平铺(flat),并将其与秘密信息串联(concate)输入隐写网络;Bob对接收到的载密图像提取信息;Eve在训练过程中输入载体图像与载密图像以训练判别网络;Alice 根据 Bob与Eve的反馈结果调整自身策略。此后,在此框架下涌现出一系列端到端对抗隐写算法。
图 5 Hayes等[18]提出的对抗训练网络框架

Fig.5 Adversarial training network framework proposed by Hayes et al.[18]

Zhu等[20]提出了深度网络隐藏信息框架(Hiding Data with Deep Networks,HiDDeN),如图6所示。HiDDeN的特点是在框架中加入了攻击层以模拟有损信道中裁剪、模糊、压缩等攻击。通过对攻击后的载密图像进行联合训练,使得隐藏信息在图像经过攻击后仍能在一定程度上恢复秘密信息,其鲁棒性有所提高。
图 6 HiDDeN隐写框架[20]

Fig.6 Steganographic framework of HiDDeN [20]

StegNet[21](Mega Image Steganography Capacity with Deep Convolutional Network)引入了方差损失用于抑制生成网络产生的噪声像素,使得嵌入图像在视觉上更加自然,实现了较大的隐写容量。该方法解码率可达98.2%,平均仅改变了0.76%的载体图像。SteganoGAN[22](High Capacity Image Steganography with Generative Adversarial Networks)在对抗训练中采用大量残差网络与密集连接网络,增加了网络的深度,如图7所示,其算法在COCO数据集上能够实现高达 4.4 bpp的嵌入容量,是传统方法的10倍以上,而且在高嵌入容量下仍能保持较高的图像质量。
图 7 SteganoGAN隐写框架[22]

Fig.7 Steganographic framework of SteganoGAN [22]

Yu等[23]提出了一种基于注意力机制的数据隐藏框架ABDH(Attention Based Data Hiding with Generative Adversarial Networks)。引入注意力机制可以帮助生成模型识别载体图像中有利于隐写的区域,在隐藏信息的过程中理解载体图像对语义变换的敏感性。Zhang等[24]提出了通用深度隐藏框架(Universal Deep Hiding for Steganography,UDH),它旨在将秘密图像的编码过程和载体图像进行分离,使编码的信息可以独立于载体图像进行分析,有助于理解深度隐写的工作原理。具体过程为:在UDH中,秘密图像被送入隐藏网络,产生编码后的信息,随后将编码信息与随机的载体图像相加,生成载密图像。最后用恢复网络从载密图像中得到恢复的秘密图像。该方法不仅可用于隐写,还可以应用于水印设计等场景。
Lu等[25]提出了可逆隐写网络(Invertible Steganography Network,ISN),将信息隐藏和信息提取视为图像域变换的一对逆问题。该方法的隐写容量可以达到24~120 bpp,适用于隐藏多张图像,在嵌入5张图像的情况下,生成的载密图像与原始载体图像在视觉上几乎无差异。
Pan等[26]提出了AdaSteg(Adaptive Image Steganography)系统,通过强化学习和对抗样本技术实现了多秘密图像隐写和自适应局部区域隐藏。该系统包含两个阶段,首先通过强化学习确定图像中最佳隐藏秘密信息的局部区域,然后将秘密图像转换成对抗样本形式的噪声嵌入到选定的局部区域中,在VOC2007数据集上的测试,表明该方法显著提高了隐写图像的鲁棒性和安全性。
Tan等[27]提出了Chat-GAN(Channel Attention Image Steganography with Generative Adversarial Networks)结构,如图8所示。其特点是在嵌入与提取网络中设计了轻量级的通道注意力模块,利用通道间的依赖关系动态调整图像的深度特征表示。该模块通过聚合每个通道的全局信息增强有效特征,从而提高了隐写图像的质量和秘密信息提取的准确性。
图 8 Chat-GAN隐写框架[27]

Fig.8 Steganographic framework of Chat-GAN[27]

Cui等[28]提出了一种基于元学习和度量学习的方法MSM-DIH(Meta Security Metric-based Deep Image Hiding),通过元学习整合多源安全指标,动态生成泛化的安全评估标准,并结合可逆神经网络(Invertible Neural Networks,INN)和通道注意力机制,该方法可以在未知隐写分析器下保持高安全性,显著提高了未知检测场景下的抗隐写分析能力。
端到端空域图像隐写方法对比如表1所示。由于隐写过程没有对载体进行压缩等操作,基于空域的端到端隐写可以隐藏更多信息,因此该方法的隐写容量相对较高。
表 1 端到端空域图像隐写算法对比

Table 1 Comparison of end-to-end image steganographic algorithms in spatial domain

代表性方法 主要思路 优点 缺点

HiDDeN[20]
使用深度神经网络进行端到端的图像隐写,通过对抗训练和噪声层模拟真实失真 对多种攻击具有较好的鲁棒性 容量和安全性较低
Baluja等[17] 使用深度神经网络同时训练信息嵌入与提取过程,将一张彩色图像完整地隐藏到另一张同尺寸的图像中 可以成功隐藏全尺寸图像,且对载体图像的视觉质量影响较小 没有考虑鲁棒性与安全性
StegNet[21] 结合深度卷积神经网络,直接学习输入与输出之间的映射关系,隐藏相同尺寸的图像 图像隐藏容量高,达到了23.57 bpp 安全效果不佳,对抗隐写分析能力有限
StegnoGAN[22] 基于生成对抗网络的大容量图像隐写,通过对抗训练优化隐藏图像的感知质量 实现了 4.4 bpp 的高容量隐藏,且具有较强的抗隐写分析能力 在大容量隐藏时图像质量略有下降
ABDH[23] 引入注意力机制,将秘密信息嵌入到人眼不敏感的区域;利用循环判别模型和不一致损失,在迭代训练过程中提升载密图像的质量 提高了载密图像的质量,具备一定程度的抵抗多种噪声攻击的鲁棒性 不能抵抗深度隐写分析器的检测
UDH[25]
将秘密图像的编码过程和载体图像分离,使编码的信息可以独立于载体图像进行分析 图像隐藏容量高,具备一定鲁棒性,可用于隐写、水印等应用场景 安全性有待提升,抗隐写分析检测能力不足
Chat-GAN[27] 提出基于通道注意力机制的 GAN 架构,通过通道注意力模块动态地调整特征图的通道权重 提高了载密图像的质量和信息提取准确率 对不同数据集的安全性需要进一步验证

2 端到端频域图像隐写

在实际应用场景中,数字图像往往需要进行压缩处理,如经过离散余弦变换(Discrete Cosine Transform,DCT)、离散小波变换(Discrete Wavelet Transformation,DWT)将空域图像转换为频域图像,并进行编码以节省存储空间。端到端频域隐写与空域隐写的区别在于,将信息嵌入在DCT系数或者DWT系数中。由于载体之间的区别,需要结合频域特点进行隐写架构设计。端到端频域图像隐写相对于空域隐写研究起步较晚,其发展历程如图9所示。
图 9 端到端频域图像隐写发展历程

Fig.9 Development process of end-to-end image steganography in frequency domain

Yang等[29]在端到端空域隐写框架基础上,对JPEG域端到端图像隐写进行了初步探索,提出了基于对抗训练的高容量鲁棒JPEG隐写(High Capacity and Robust JPEG Steganography Based on Adversarial Training,HRJS),构建了JPEG域端到端框架,其包含编码器、解码器、攻击模块、逆离散余弦变换(Inverse Discrete Cosine Transform,IDCT) 模块和判别器模块。通过对抗训练让网络在攻击后正确恢复秘密信息,如图10所示。
图 10 HRJS隐写框架[29]

Fig.10 Steganographic framework of HRJS[29]

在实际应用场景中,图像可能会遭受JPEG压缩攻击,HRJS在对抗训练网络中加入JPEG压缩攻击层以提高隐写鲁棒性。然而,JPEG压缩过程需要对图像进行取整处理,导致梯度消失。因此,引入了模拟取整函数[30]进行取整处理:
$ {R(x)=[x]+(x-[x])}^{ \mathrm{3}} $
其中,[x]代表的是取整运算,式(7)在模拟取整操作的同时不会导致梯度消失。
Jing等[31]将图像小波域变换和可逆神经网络进行结合,提出了HiNet(Deep Image Hiding by Invertible Network)。HiNet将图像分割成低频和高频小波子带,使网络能够更好地将秘密信息融合到载体图像中,从而减少信息的损失。另外,它引入了一个新颖的低频小波损失函数,有助于将秘密信息更多地隐藏在高频子带中。HiNet可以生成高质量的载密图像,即使嵌入整幅彩色图像,其载密图像的PSNR也可达到42 dB以上,保证了隐写的不可感知性。在此基础上,DeepMIH[32](Deep Invertible Network for Multiple Image Hiding)引入了重要图模块,进一步提升了嵌入多幅秘密图像的不可感知性。
Yang等[33]提出了细粒度DCT系数表示(Exploit Fine-grained DCT Representations,EFDR)隐藏图像模型,如图11所示。其特点是通过子带特征增强模块提取频率特征,并增强子带特征表示,使每个元素与特定的DCT子带相关联。结合Transformer和可逆神经网络,该模型采用双射仿射耦合层和Transformer块,捕捉全局依赖关系,同时保证了隐藏和恢复过程的可逆性,从而实现高质量的图像隐藏和恢复。
图 11 EFDR隐写框架[33]

Fig.11 Steganographic framework of EFDR[33]

Shang等[34]提出了一种基于INN的端到端鲁棒数据隐写方案,如图12所示。该方案将图像作为秘密信息,通过可逆神经网络完成信息的隐藏和恢复。在质量因子(Quality Factor,QF)为65的低质量压缩下,恢复的秘密信息PSNR仍达28.81 dB,SSIM为0.866,显著优于HiNet(20.07 dB,0.744)。该方法在鲁棒性、容量和不可见性方面取得了良好效果。
图 12 Shang等[34]提出的隐写框架

Fig.12 Steganographic framework proposed by Shang et al. [34]

Lan等[35]在INN的基础上,在载体图像的DCT系数中嵌入比特流,并通过正反向过程分别实现了秘密信息的嵌入与提取。此外,设计了一种互信息损失函数和一个综合提取空间域和频域特征的双流融合模块,用于约束信息流并引导反向过程,从载密图像的DCT系数中提取出原始秘密信息。实验表明,该方法在保证隐写图像视觉质量和安全性的同时,能在一定程度上抵抗JPEG 压缩。
Yin等[36]提出了一种可分离微调网络模型,该模型包括联合训练阶段和可分离微调阶段。通过利用可分离的训练方式,该方法有效抵消了四舍五入取整操作的不可微分性,提高了隐写图像提取器对精度损失的鲁棒性,并减少图像质量和隐写分析性能的下降。在不同质量因子(QF=50、70、90)下,该方法在可分离微调阶段的测试均取得良好效果。
Chen等[37]提出了一种高效的JPEG端到端隐写框架,该方法针对基于深度学习的隐写分析模型抵抗对抗样本的脆弱性,利用稀疏对抗样本来提高隐写图像的安全性和不可察觉性。该方法由编码器、解码器、判别模块组成,编码器直接将秘密信息和载体图像的量化DCT系数结合,对抗模块利用稀疏对抗攻击的方法生成对抗扰动,并将其添加到隐写图像的量化DCT系数中。通过对抗训练,生成图像逐渐接近原始图像,提高了不可见性,在UCNet_JPEG和UCNet_Spatial[38]攻击下,表现出良好的隐蔽性。但是该方法在一些先进的隐写分析模型下错误率比较低,在应对一些未知检测模型时泛化能力还有待提高。
Yao等[39]提出了一种基于DWT和生成对抗网络(Generative Adversarial Network,GAN)的端到端隐写框架DWT-GAN,如图13所示。首先,将载体图像通过DWT转换到频域。然后,将秘密信息与DWT子带输入隐藏网络,通过多尺度注意力卷积生成嵌入扰动,并经融合模块调整扰动强度后生成DWT域隐写图像。最后,通过逆小波变换(Inverse Wavelet Transform,IWT)将隐写图像转换回空间域。提取时,隐写图像经过DWT预处理,由提取网络恢复秘密信息。
图 13 DWT-GAN隐写框架[39]

Fig.13 Steganographic framework of DWT-GAN[39]

随着信息嵌入容量的增加,引入的修改痕迹更为明显,导致载密图像更易被隐写分析器识别,从而削弱了隐写算法的安全性。因此,现有的端到端隐写技术往往难以兼顾安全性和容量。AHDeS[40](Adversary-Hiding-Decoupled Steganography)方法应用了“挖洞填沙”的策略。具体操作如下:首先训练得到一个有嵌入提取能力的INN。随后,固定INN,优化原始图像以增强隐写算法的安全性。最后,使用INN将秘密信息嵌入到原始图像中。得益于INN的双射可逆性,AHDeS能够在不损伤提取准确率的同时,显著增强隐写安全性。Shang等[41]提出了一个基于INN的鲁棒JPEG隐写框架。该框架可以利用JPEG压缩的先验知识以及INN的特性来选择合适的系数嵌入秘密信息。当载密图像在传输过程中受到质量因子为90和85的JPEG压缩时,该方法实现了较高精度。此外,该方法还提出一个可学习噪声层,在网络训练中整合了舍入和截断操作,以减少舍入造成的信息损失。Li等[42]提出了一种轻量级的深度可逆隐写网络(Lightweight Deep invertible steganography Network ,LiDiNet),该方法设计了一种自适应协调空间注意模块来补偿网络训练过程中图像空间特征信息的缺乏,并引导秘密信息嵌入到更合适的图像区域。LiDiNet在视觉质量和抗隐写分析能力方面取得了较好效果。
端到端频域隐写算法的代表性方法优缺点对比如表2所示。在空域基础上,将端到端方法扩展至频域,其适用场景更为广泛。
表 2 端到端频域图像隐写算法对比

Table 2 Comparison of end-to-end image steganographic algorithms in frequency domain

代表方法 主要思路 优点 缺点
HRJS[29] 构建JPEG 域的端到端隐写框架,包含编码器、解码器、攻击模块、IDCT模块和判别器等模块 通过对抗训练让网络学会在攻击后正确恢复秘密信息 判别网络结构比较简单,隐写安全性不足
HiNet[31] 在可逆神经网络中引入图像小波变换,将秘密信息更多地隐藏在高频子带中 可嵌入整幅彩色图像,且生成的载密图像质量在42 dB以上 没有考虑鲁棒性
EFDR[33] 通过细粒度DCT表示、子带特征增强模块和基于Transformer的可逆模块,直接在JPEG图像的量化DCT系数中嵌入和提取秘密图像,避免压缩和解压缩过程中的信息损失 提高了隐写和信息恢复的性能 在面对质量因子较低的情形时,恢复的秘密图像会出现一定程度的失真
Lan等[35] 利用INN直接在DCT系数中嵌入秘密信息,并通过互信息损失和双向融合模块减少信息损失 在不同JPEG压缩质量因子下展现出较强的鲁棒性 对JPEG压缩的模拟无法完全覆盖所有实际场景中的压缩情况
Shang等[34] 利用INN的双向过程在JPEG图像的量化DCT系数中嵌入和提取秘密信息,并模拟JPEG压缩攻击模块以提高鲁棒性 对JPEG压缩具有较强的鲁棒性,能够在不同质量因子下恢复秘密信息 在质量因子较低的情形下,恢复的秘密信息会有少量
错误
Yin等[36] 通过联合训练阶段和分离微调阶段解决端到端网络中舍入操作的非可微性问题,提高隐写的鲁棒性 有效解决了舍入操作导致的精度损失问题,提高了消息提取的准确性 信息提取率有待进一步提升
Chen等[37] 引入稀疏对抗攻击到JPEG隐写结构中,通过对抗训练提高隐写图像的安全性,并设计视觉感知损失函数以提高不可见性 提高了隐写图像对深度隐写分析模型的抵抗力 在高容量嵌入时,图像质量会受到一定影响

3 方法性能对比

3.1 大容量图像隐写方法的图像质量对比

当秘密信息与载体图像均为彩色图像时,隐写嵌入率为24 bpp。嵌入大量的秘密信息会不可避免地降低隐写的鲁棒性和安全性,因此在大容量图像隐写侧重于图像质量的比较。本总结选取3种典型的端到端图像隐写方法(HiDDeN[20]、Baluja[17]和UDH[25]),比较嵌入一张与载体图像大小一致的256×256彩色图像后,载体图像与载密图像、秘密图像与恢复的秘密图像的质量差异。
本总结从ALASKA #2[43]数据集中随机选取20 000张图像,将其裁剪至256×256大小并作为训练集。其中,10 000张图像作为载体图像,剩下的作为秘密图像。对于测试集,分别从MSCOCO[44]和ImageNet[45]数据库中各自选取4 000张图像,载体与秘密图像各占一半。采用峰值信噪比(Peak Signal-to-Noise Ratio,PSNR)、结构相似性(Structural SIMilarity,SSIM)、均方根误差(Root Mean Square Error,RMSE)和平均像素差异(Averaged Pixel-wise Discrepancy,APD)4个指标全面评估图像质量。表3表4分别展示了3种方法在嵌入端和提取端的图像质量对比。综合表3表4的实验结果可知,UDH[25]能够生成质量较高的载密图像,视觉失真最小,且秘密信息的恢复能力优于其他两种端到端图像隐写方法。这是由于UDH将编码后的信息加到载体图像中,减轻了嵌入过程对载体图像的失真,并能较好地恢复秘密信息。HiDDeN[20]和Baluja[17]的性能普遍较低,生成的载密图像的PSNR低至30 dB左右,且APD和RMSE的值较高。
表 3 载体图像与载密图像在不同测试数据集上的图像质量对比

Table 3 Comparison of image quality between cover images and stego images on different test dataset

隐写方法MSCOCOImageNet
PSNRSSIMAPDRMSEPSNRSSIMAPDRMSE
HiDDeN[20]30.950.93586.068.5730.560.93566.819.01
Baluja[17]31.220.93855.858.1730.580.93566.768.86
UDH[25]38.670.96415.457.9838.420.96322.133.07
表 4 秘密图像恢复前后在不同测试数据集上的图像质量对比

Table 4 Comparison of image quality before and after secret image restoration on different test datasets

隐写方法MSCOCOImageNet
PSNRSSIMAPDRMSEPSNRSSIMAPDRMSE
HiDDeN[20]30.460.89676.188.8129.910.88897.399.33
Baluja[17]30.770.92285.928.7529.160.88117.869.91
UDH[25]31.940.94034.927.0630.610.92765.587.83

3.2 小容量图像隐写方法的性能对比

当秘密信息为0,1比特流,载体图像为彩色图像时,隐写嵌入率为1 bpp。嵌入的信息量较小,对载体图像的破坏较少,能生成高质量的载密图像并降低被隐写分析检测到的风险。因此,小容量图像隐写适用于对隐蔽性和安全性要求较高的应用场景。本总结用误码率(Bit Error Rate,BER)来衡量隐写方法的提取能力,BER等于提取错误的秘密信息的占比。采用检测错误率来衡量隐写方法的安全性,该指标代表隐写分析器分类错误的图像占比。表5展示了具有代表性的端到端图像隐写方法在1 bpp嵌入容量下的提取性能与隐写分析检测错误率对比。从表5中可以看出,Shang等[46]的工作取得了低至0.01的BER。此外,在面对4种深度隐写分析器的检测时,取得了较好的安全性。这得益于该方法利用损失信息作为对抗扰动,增强了INN结构的可逆性,生成了能够诱导深度隐写分析器分类错误的对抗载密图像。AHDeS[40]同样利用了对抗的思想,但是该方法的BER相对较高。由表可知,将对抗训练或者对抗样本引入端到端网络的训练中,可以显著提升隐写方法的安全性。
表 5 1 bpp嵌入容量下的提取误码率与隐写分析检测准确率对比

Table 5 Comparison of extraction BER and steganalysis detection accuracy under 1 bpp embedding capacity

方法BER (%)检测错误率$ {P}_{\mathrm{E}} $
DengNet[47]SRNetXuNetYeNet[48]
SteganoGAN[22]2.192.293.884.334.56
ABDH[23]2.562.181.464.825.48
CHAT-GAN[27]0.385.355.878.237.99
AHDeS[40]0.8515.1613.0933.8537.87
Shang[46]0.0141.7740.7747.9947.64

4 存在的问题与挑战

虽然端到端图像隐写研究取得一定进展,依然存在以下不足:
(1)相较于基于最小化失真框架方法普遍低于0.4 bpp/0.4 bpnzAC的嵌入容量,端到端图像隐写方法为将输出的秘密信息和载体图像进行串联(Concat)融合,通常采用1 bpp甚至更高的嵌入容量。过高的嵌入容量会带来安全性降低的风险,使其抵抗DengNet[47]和SRNet[8]等深度隐写分析器的安全性存在不足。
(2)现有的端到端图像隐写方法侧重于增强抵抗JPEG压缩的鲁棒性,而在抵抗旋转、裁剪等有损攻击时,其秘密信息的提取准确率有待提升。另外,如何实现QF较小时JPEG压缩攻击秘密信息的无损提取也是端到端图像隐写需要解决的问题。
(3)当前隐写安全性主要来源于判别网络进行对抗,容易对单一判别网络产生依赖。当采用未参与训练的判别网络进行攻击时,隐写安全性会下降,泛化性存在不足。如何解决模型泛化性需要探索。
(4)隐写综合指标有待提升。根据不同的应用场合对隐写的指标进行了取舍,如图14所示。例如,StegNet[21]、Baluja[17]等方法在容量方面占有优势,但在鲁棒性和安全性方面存在不足。这些研究进展揭示了端到端隐写技术面临的核心矛盾:在现有框架下,安全性、容量与鲁棒性三者之间存在显著的相互制约关系。如何取得一个符合实际应用场景的折中性能,是目前一大挑战。
图 14 代表性端到端隐写优势对比

Fig.14 Advantage comparison of representative end-to-end steganography

5 总结与展望

主流传统隐写安全性研究专注在最小失真框架下设计隐写代价,并结合STC编码进行信息嵌入。相对于最小化失真隐写框架,端到端图像隐写方案编码与解码均由神经网络完成,在训练过程中加入干扰层、隐写与隐写分析对抗训练,可提升隐写的安全性与鲁棒性,其模型具有较强的扩展性,因此成为信息隐藏领域的研究热点。本总结根据端到端隐写载体类型,将隐写方案分为端到端空域图像隐写和端到端频域图像隐写两大类,并分别对每一类中的方法进行了详细分析和总结。然后,通过大量实验,着重对经典端到端图像隐写方案的性能进行了对比和分析。
未来可在如下几个方面进行探索:
(1)探究有损信道中可抵抗多种攻击的端到端鲁棒隐写方法。未来的研究可以探索基于深度学习的动态优化模型,通过多层次特征学习增强图像对几何变换的适应性,进而增强抵抗社交网络有损信道中几何攻击时的鲁棒性。
(2)探究具有通用安全性的端到端频域隐写方法。现有的方法大多将隐写分析器作为判别器或者引入对抗样本的方式来提升安全性。未来的研究可以引入微小可控的扰动来生成对抗样本,进一步提升抵抗未知结构的深度隐写分析器的安全性。
(3)探究生成式图像端到端隐写。当前主流的端到端隐写集中于自然图像,随着Diffusion等[49]生成式人工智能技术发展,图像更加清晰且容易获取。如何针对生成式图像特点设计端到端隐写需要进一步探索。
1
FILLER T, JUDAS J, FRIDRICH J. Minimizing additive distortion in steganography using syndrome-trellis codes[J]. IEEE Transactions on Information Forensics and Security, 2011, 6 (3): 920- 935.

DOI

2
FILLER T, FRIDRICH J. Gibbs construction in steganography[J]. IEEE Transactions on Information Forensics and Security, 2010, 5 (4): 705- 720.

DOI

3
HOLUB V, FRIDRICH J, DENEMARK T. Universal distortion function for steganography in an arbitrary domain[J]. EURASIP Journal on Information Security, 2014, 2014, 1- 13.

DOI

4
LI B,WANG M,HUANG J,et al. A new cost function for spatial image steganography[C]//2014 IEEE International Conference on Image Processing (ICIP). IEEE,2014:4206-4210.

5
HOLUB V,FRIDRICH J. Designing steganographic distortion using directional filters[C]//2012 IEEE International Workshop on Information Forensics And Security (WIFS). IEEE,2012:234-239.

6
GUO L, NI J, SU W, et al. Using statistical image model for JPEG steganography: Uniform embedding revisited[J]. IEEE Transactions on Information Forensics and Security, 2015, 10 (12): 2669- 2680.

DOI

7
XU G, WU H Z, SHI Y Q. Structural design of convolutional neural networks for steganalysis[J]. IEEE Signal Processing Letters, 2016, 23 (5): 708- 712.

DOI

8
BOROUMAND M, CHEN M, FRIDRICH J. Deep residual network for steganalysis of digital images[J]. IEEE Transactions on Information Forensics and Security, 2018, 14 (5): 1181- 1193.

9
TANG W, TAN S, LI B, et al. Automatic steganographic distortion learning using a generative adversarial network[J]. IEEE Signal Processing Letters, 2017, 24 (10): 1547- 1551.

DOI

10
YANG J, RUAN D, HUANG J, et al. An embedding cost learning framework using GAN[J]. IEEE Transactions on Information Forensics and Security, 2019, 15, 839- 851.

11
TANG W, LI B, BARNI M, et al. An automatic cost learning framework for image steganography using deep reinforcement learning[J]. IEEE Transactions on Information Forensics and Security, 2020, 16, 952- 967.

12
HUANG D, LUO W, LIU M, et al. Steganography embedding cost learning with generative multi-adversarial network[J]. IEEE Transactions on Information Forensics and Security, 2023, 19, 15- 29.

13
CUI Q, ZHOU Z, MENG R, et al. ARES: On adversarial robustness enhancement for image steganographic cost learning[J]. IEEE Transactions on Multimedia, 2024, 26, 6542- 6553.

DOI

14
YANG J,RUAN D,KANG X,et al. Towards automatic embedding cost learning for JPEG steganography[C]//Proceedings of the ACM workshop on Information Hiding and Multimedia Security. Association for Computing Machinery,2019,37-46.

15
TANG W, LI B, BARNI M, et al. Improving cost learning for JPEG steganography by exploiting JPEG domain knowledge[J]. IEEE Transactions on Circuits and Systems for Video Technology, 2021, 32 (6): 4081- 4095.

16
YANG J, LIAO Y, SHANG F, et al. JPEG image steganography with automatic embedding cost learning[J]. International Journal of Intelligent Systems, 2025, 2025 (1): 5309734.

DOI

17
BALUJA S. Hiding images in plain sight:Deep steganography[J]. Advances in Neural Information Processing Systems,2017,30.

18
HAYES J,DANEZIS G. Generating steganographic images via adversarial training[C]// Proceedings of the 31st International Conference on Neural Information Processing Systems. 2017,1951-1960.

19
KUMAR A, RANI R, SINGH S. Encoder-decoder architecture for image steganography using skip connections[J]. Procedia Computer Science, 2023, 218, 1122- 1131.

DOI

20
ZHU J,KAPLAN R,JOHNSON J,et al. Hidden:Hiding data with deep networks[C]//Proceedings of the European Conference On Computer Vision (ECCV). 2018:657-672.

21
WU P, YANG Y, LI X. StegNet: Mega image steganography capacity with deep convolutional network[J]. Future Internet, 2018, 10 (6): 54.

DOI

22
ZHANG K A, CUESTA-INFANTE A, XU L, et al. SteganoGAN: High capacity image steganography with GANs[J]. arXiv preprint, arXiv:, 1901, 03892, 2019.

23
YU C. Attention based data hiding with generative adversarial networks[C]//Proceedings of the AAAI Conference on Artificial Intelligence. 2020,34(1):1120-1128.

24
ZHANG C, BENZ P, KARJAUV A, et al. UDH: Universal deep hiding for steganography, watermarking, and light field messaging[J]. Advances in Neural Information Processing Systems, 2020, 33, 10223- 10234.

25
LU S P,WANG R,ZHONG T,et al. Large-capacity image steganography based on invertible neural networks[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2021:10816-10825.

26
PAN W, YIN Y, WANG X, et al. Seek-and-hide: Adversarial steganography via deep reinforcement learning[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2021, 44 (11): 7871- 7884.

27
TAN J, LIAO X, LIU J, et al. Channel attention image steganography with generative adversarial networks[J]. IEEE Transactions on Network Science and Engineering, 2021, 9 (2): 888- 903.

28
CUI Q, TANG W, ZHOU Z, et al. Meta security metric learning for secure deep image hiding[J]. IEEE Transactions on Dependable and Secure Computing, 2024, 21 (5): 4907- 4920.

DOI

29
YANG J, SHANG F, LIAO Y, et al. Toward high capacity and robust JPEG steganography based on adversarial training[J]. Security and Communication Networks, 2023, 2023 (1): 3813977.

30
TANCIK M,MILDENHALL B,NG R. StegaStamp:Invisible hyperlinks in physical photographs[C]//Proceedings of the IEEE/CVF Conference on Computer Vision And Pattern Recognition. 2020:2117-2126.

31
JING J,DENG X,XU M,et al. HiNet:Deep image hiding by invertible network[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision. 2021:4733-4742.

32
GUAN Z, JING J, DENG X, et al. DeepMIH: Deep invertible network for multiple image hiding[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2022, 45 (1): 372- 390.

33
YANG J,LIAO X. Exploiting fine-grained DCT representations for hiding image-level messages within JPEG images[C]//Proceedings of the 31st ACM International Conference on Multimedia. 2023:7373-7382.

34
SHANG F, LAN Y, YANG J, et al. Robust data hiding for JPEG images with invertible neural network[J]. Neural Networks, 2023, 163, 219- 232.

DOI

35
LAN Y,SHANG F,YANG J,et al. Robust image steganography:Hiding messages in frequency coefficients[C]//Proceedings of the AAAI Conference on Artificial Intelligence. 2023,37(12):14955-14963.

36
YIN X, WU S, WANG K, et al. Anti-rounding image steganography with separable fine-tuned network[J]. IEEE Transactions on Circuits and Systems for Video Technology, 2023, 33 (11): 7066- 7079.

DOI

37
CHEN B, NIE Y, YANG J. Toward high imperceptibility deep JPEG steganography based on sparse adversarial attack[J]. Journal of Visual Communication and Image Representation, 2023, 97, 103977.

DOI

38
WEI K, LUO W, TAN S, et al. Universal deep network for steganalysis of color image based on channel representation[J]. IEEE Transactions on Information Forensics and Security, 2022, 17, 3022- 3036.

DOI

39
YAO Y, WANG J, CHANG Q, et al. High invisibility image steganography with wavelet transform and generative adversarial network[J]. Expert Systems with Applications, 2024, 249, 123540.

DOI

40
TANG W ,YANG H ,RAO Y ,et al. Dig a hole and fill in sand:Adversary and hiding decoupled steganography[C]//Proceedings of the 32nd ACM International Conference on Multimedia. 2024:10440-10 448.

41
SHANG F,ZHAO W,WEN J,et al. INN-based robust JPEG steganography through cover coefficient selection[C]//IEEE 9th International Conference on Data Science in Cyberspace . IEEE,2024:406-413.

42
LI F,SHENG Y,WU K,et al. LiDiNet:A lightweight deep invertible network for image-in-image steganography[J]. IEEE Transactions on Information Forensics and Security,2024:8817-8831.

43
COGRANNE R,GIBOULOT É,BAS P. ALASKA #2:Challenging academic research on steganalysis with realistic images[C]//2020 IEEE International Workshop on Information Forensics and Security (WIFS). IEEE,2020:1-5.

44
LIN T Y,MAIRE M,BELONGIE S,et al. Microsoft COCO:Common objects in context[C]//Computer vision-ECCV 2014:13th European conference. Springer International Publishing,2014:740-755.

45
RUSSAKOVSKY O, DENG J, SU H, et al. Imagenet large scale visual recognition challenge[J]. International Journal of Computer Vision, 2015, 115, 211- 252.

DOI

46
SHANG F,ZHAO W,KANG X,et al. INN-based secure steganography using lost information as adversarial perturbations[C]//ICASSP 2025-2025 IEEE International Conference on Acoustics,Speech and Signal Processing (ICASSP). IEEE,2025:1-5.

47
DENG X,CHEN B,LUO W,et al. Fast and effective global covariance pooling network for image steganalysis[C]//Proceedings of the ACM workshop on information hiding and multimedia security. 2019:230-234.

48
YE J, NI J, YI Y. Deep learning hierarchical representations for image steganalysis[J]. IEEE Transactions on Information Forensics and Security, 2017, 12 (11): 2545- 2557.

DOI

49
ROMBACH R,BLATTMANN A,LORENZ D,et al. High-resolution image synthesis with latent diffusion models[C]//Proceedings of the IEEE/CVF Conference on Computer Vision And Pattern Recognition. 2022:10684-10695.

文章导航

/