面向音频分享平台的鲁棒轻量化音频隐写方法

  • 李昊天 ,
  • 苏兆品 , * ,
  • 岳峰 ,
  • 乔亚涛 ,
  • 王垚飞 ,
  • 张国富
展开
  • 合肥工业大学计算机与信息学院,合肥 230009

网络出版日期: 2026-06-01

基金资助

国家自然科学基金(62302146)

版权

版权所有©《网络空间安全科学学报》编辑部 2026

Robust and lightweight audio steganography Method for audio-sharing platforms

  • Li Haotian ,
  • Su Zhaopin , * ,
  • Yue Feng ,
  • Qiao Yatao ,
  • Wang Yaofei ,
  • Zhang Guofu
Expand
  • School of Computer and Information, Hefei University of Technology, Hefei 230009, China

Online published: 2026-06-01

Copyright

Copyright ©2026 Journal of Aeronautical Materials. All rights reserved.

摘要

在线音频分享平台的广泛应用,使得基于音频隐写的隐蔽通信正从传统的无损信道迅速向有损信道转变。音频分享平台对载密音频的信号处理、二次压缩、格式转换等处理,严重影响秘密信息在传输过程中的可靠性。针对这一挑战,本文提出一种面向音频分享平台的鲁棒轻量化音频隐写方法,以适应音频分享平台这一有损信道对隐写鲁棒性和轻量化的需求。具体来说,首先基于对抗生成网络(generative adversarial network, GAN)设计了一种“以声藏声”的音频隐写框架,包括编码器、解码器、判别器和模拟攻击器;然后,引入GhostNet的轻量化设计理念,构建了新型编码器和解码器,本文通过采用低成本的线性变换替代传统复杂的卷积操作,有效减少了模型参数量和计算复杂度,并结合残差结构提升了训练的稳定性;最后,设计模拟攻击器,通过注意力机制和音量增益模块模拟实际场景中音频分享平台的信息损失,增强隐写的鲁棒性。实验结果表明,所提方法在音频不可感知性、秘密信息提取精度及模型参数规模控制方面均表现优异,在显著降低模型复杂度的同时,有效平衡了音频隐写的隐蔽性与抗攻击能力,展现出在音频分享平台应用场景中的潜在应用价值。

本文引用格式

李昊天 , 苏兆品 , 岳峰 , 乔亚涛 , 王垚飞 , 张国富 . 面向音频分享平台的鲁棒轻量化音频隐写方法[J]. 网络空间安全科学学报, 2026 . DOI: 10.20172/j.issn.2097-3136.260508

Abstract

With the widespread use of online audio-sharing platforms, audio steganography based covert communication is rapidly shifting from traditional lossless channels to lossy channels. The signal processing, secondary compression, and format conversion applied by these platforms severely affect the reliability of secret information during transmission. To address this challenge, this paper proposes a robust and lightweight audio steganography method to meet the demands of robustness and lightweight deployment in lossy channels such as audio-sharing platforms. Specifically, this paper constructs an “audio-in-audio” steganography framework based on a generative adversarial network (GAN), which consists of an encoder, a decoder, a discriminator, and a simulation attacker. Then, inspired by the lightweight design philosophy of GhostNet, this paper develops new encoder and decoder structures, where low-cost linear transformations are employed to replace traditional convolution operations, significantly reducing model parameters and computational complexity. Furthermore, this paper incorporates residual structures to enhance training stability. Finally, this paper designs a simulation attacker, which leverages an attention mechanism and a volume gain module to mimic the information loss encountered in real-world audio-sharing scenarios, thereby improving robustness. Experimental results demonstrate that the proposed method achieves superior performance in audio imperceptibility, secret information extraction accuracy, and model parameter scale control. By significantly reducing model complexity while maintaining a balance between the concealment and anti-attack capability of audio steganography, the method shows strong potential for practical applications in audio-sharing platforms.

0 引言

音频隐写是将秘密信息隐藏在音频信号中, 使得隐藏的信息在外观上不容易被察觉,从而实现秘密信息传递的目的。最低有效位(least significant bit,LSB)匹配是经典的时域隐写方法[1],基于小波与傅里叶变换的方案则是变换域隐写的核心技术路线[2]。随着音频分享平台的发展,其海量数据为音频隐写提供了新的媒介,加密技术与隐写技术的结合也进一步提升了隐蔽通信的安全性[3]。然而,音频分享平台大都是有损信道,通常会对用户上传的音频文件进行信号处理、二次压缩、格式转换等处理,以优化存储空间和提升传输效率。这些处理虽能改善平台性能,却可能破坏嵌入于音频中的秘密信息,严重削弱隐蔽通信的安全性和可靠性。
一方面,已有音频隐写方法大都关注于不可感知性、隐写容量以及抗隐写分析能力[4],相关研究主要围绕载体特征单独嵌入策略[5],而很少关注其在有损信道下的鲁棒性。另一方面,音频分享平台大都运行于智能终端,已有研究很少考虑隐写模型的轻量化部署。同时,随着深度学习技术的发展,基于卷积神经网络的隐写分析技术不断突破,孪生卷积网络被首次引入隐写分析任务,显著提升了检测准确率[6]。后续研究围绕预训练策略优化,进一步提升隐写分析模型的泛化能力[7]。针对音频场景,多尺度谱图与深度残差网络的结合,让音频隐写分析的检测性能实现了质的飞跃[8],传统隐写方法的抗检测能力面临严峻挑战。
因此,提升音频隐写技术在音频分享平台的抗干扰能力、增强其鲁棒性能,使其在经历平台处理后仍能保持信息完整性且易于轻量化部署,已成为当前研究亟待突破的核心问题[9]
基于此,本文提出了面向音频分享平台的鲁棒轻量化音频隐写(robust and lightweight audio steganography, RLAS)方法,主要工作如下。
1)框架层面:提出一种新型的轻量化音频隐写框架,包括新型编码器、解码器、辅助解码器训练的判别器和模拟攻击器。
2)轻量化层面:设计一种轻量化编解码器以减少复杂计算过程,在大幅减少参数量的同时,保持与主流隐写方法相近的性能。
3)鲁棒性层面:设计模拟攻击器的网络结构,包括音量增益模块、基于通道空间注意力的特征提取模块和攻击音频合成模块,保障模型的鲁棒性。

1 相关工作

传统音频隐写研究多关注于在隐藏容量与失真率之间实现最佳平衡。但随着深度学习技术的发展,传统音频隐写方法难以抵抗基于深度学习的隐写检测。
为了提升抗隐写检测能力,生成对抗网络(generative adversarial networks, GAN)被广泛引入音频隐写领域[10]。Yang等[11]设计了基于GAN的时域音频隐写最优嵌入方法,生成器采用U-Net结构,并结合嵌入模拟器与判别器,通过对抗训练使生成器自动学习音频样本的嵌入分布,从而提升隐写效果。Kreuk等[12]将短时傅里叶变换和逆变换引入隐写流程,先将秘密音频与载体音频从时域映射至频域作为编码器输入,再通过逆变换将生成的载密音频与秘密信息恢复至时域,并配合基于卷积神经网络(convolutional neural networks, CNN)的隐写分析器作为判别器,以增强生成音频的隐蔽性。岳峰等[13]则指出,现有基于GAN的音频隐写方法在隐写容量、抗检测性和不可感知性之间往往缺乏均衡,并提出一种结合批处理归一化[14]与光谱归一化GAN的改进方法,以实现更为自适应的隐写过程,从而在三者之间取得更佳平衡。
此后,研究者也对隐写的鲁棒性进行了多维度优化,通过引入混响信道建模实现了对声学传输环境的自适应适配[15];通过基于强化学习的策略优化方法,进一步实现了隐写嵌入策略的动态自适应调整[16];还有研究将心理声学模型引入隐写框架,在保证不可感知性的前提下进一步提升了嵌入容量[17]。这些机制的引入都在一定程度上提升了隐写的鲁棒性和抗检测性能。Su等[18]提出基于广义音频本征能量与微幅度抑制的隐写方案,以表征局部复杂度并构建嵌入代价函数,避免了传统滤波器依赖带来的不稳定性。Wang等[19]提出基于音频前景背景分割的隐写方法,通过谱峰时域掩码将高幅度前景与低幅度背景音频分离,通过背景音频幅度均值优化计算自适应阈值,最终实现精准分割。Feng等[20]针对无载体场景的安全性需求,提出基于差分隐私的聚类隐写方案,解决了传统无载体隐写中特征匹配效率低、隐私泄露风险高的问题。Li等[21]提出融合文本和音频生成式隐写的CoAS(co-generated audio steganography, CoAS)框架,将文本转换为语义向量,通过变分自编码器生成对应的隐蔽语音片段,再利用相位对齐策略将生成片段嵌入载体音频的相位谱间隙,最终实现文本到音频的跨模态隐写。Zhang等[22]提出基于音频特征解耦的HIFI-Stego框架,采用WORLD声码器提取音频风格向量(音色、音调等感知特征),编码器解耦内容向量,解码器将秘密向量嵌入内容向量后,与风格向量重耦合生成载密音频。
音频分享平台多应用于智能终端,其要求模型参数控制在一定范围内。而已有研究为了追求更好的隐写效果,往往设计各种复杂的神经网络以提升特征提取能力,导致模型参数量和计算开销大幅增加。
为了有效降低模型的计算和存储负担,Jiang等[23]将生成对抗训练应用于音频隐写任务,提出一种基于深度卷积生成对抗网络(deep convolutional generative adversarial network, DCGAN)的轻量级模型,该模型可部署在物联网场景下的智能设备中。Bui等[24]提出的RoSteALS框架利用预训练自动编码器,在训练阶段仅更新轻量级秘密编码器与解码器,从而在保持较小模型规模的同时,具备较强的秘密信息恢复能力与优良性能。Yan等[25]提出基于固定解码器网络的FGAS框架,无需预训练大规模模型。Han等[26]提出的GhostNet,是为解决内存和计算资源有限问题而设计的一种轻量化网络结构。该网络为轻量化研究提供了新思路,其通过引入Ghost模块,利用廉价的线性操作替代复杂卷积,可有效减少参数量和计算量。最新的一些研究进一步扩展了GhostNet的应用场景:GhostNet-V2[27]通过动态Ghost模块自适应调整特征生成策略,在音频隐写任务中实现了性能与轻量化的更优平衡;基于Ghost-Transformer的轻量隐写模型[28]将Ghost模块与Transformer的自注意力机制结合,在参数量远小于传统Transformer模型的情况下,仍保持优异的特征捕捉能力;此外,基于知识蒸馏的轻量化方法[29]通过将复杂大模型的知识迁移至轻量学生模型,在有效降低计算量的同时,保留复杂大模型强大的隐写能力,为轻量化应用提供了新途径[30]
需要注意的是,上述研究大多在无损信道环境下开展,不适合音频分享平台这类有损信道,易造成秘密信息丢失,影响隐蔽通信的可靠性。

2 方法

本节将介绍一种面向音频分享平台的鲁棒轻量化音频隐写方法。首先,介绍模型的总体框架;然后,介绍所提出的轻量化编码器和解码器;最后,介绍保障模型鲁棒性的模拟攻击器及辅助训练的判别器。

2.1 总体框架

本文所提出RLAS方法的整体框架如图1所示,主要包括4个组件:编码器(E)、解码器(D)、判别器(A)和模拟攻击器(SA)。载体音频C和秘密音频M经特征提取获得隐写特征,编码器E将其融合为嵌入秘密信息且与载体音频特征高度相似的载密特征,进而恢复为载密音频S。判别器A以载体音频和生成的载密音频为输入,执行二分类任务。此外,模拟攻击器SA模拟音频分享平台的攻击特征,对载密音频S进行攻击,得到被攻击后的音频S'。解码器D再从S'中提取秘密音频的信息。
图 1 本文方法整体框架

Fig.1 Overall framework of proposed method

通过SA与隐写网络的联合训练,促使编码器学习平台攻击的数据特征,从而减少在攻击程度较强区域嵌入秘密信息的可能性。同时,训练解码器恢复被重新排列的秘密信息顺序,使音频隐写在不可感知性、鲁棒性及抗检测性之间达到较好均衡。此外,RLAS方法的输入与输出音频时长相等,嵌入容量为100%。
RLAS模型主要由如图2所示的三类模块构成。其中,卷积模块主要负责对数据进行下采样;幽灵模块主要通过简单的线性操作降低参数量。全连接模块主要应用于判别器,通过线性层实现分类功能。此外,每个网络块均与批归一化(batch normalization, BN)、频谱归一化(spectral normalization, SN)及LeakyReLU激活函数结合使用;频谱归一化可用于解决GAN模型训练过程中的模式坍塌问题[31]
图 2 网络块的组成结构

Fig.2 Structure of the network block

为解决传统卷积神经网络忽略高频细节的问题,本文引入焦点频域损失(focal frequency loss, FFL)[32],其通过引入加权机制,使模型能够自适应关注难以合成的高频分量,同时降低易于处理的低频部分的影响。该损失函数可有效防止重要频率信息丢失,从而提升音频质量。

2.2 编码器和解码器的轻量化设计

为实现轻量化音频隐写,本文基于GhostNet设计了新型编码器和解码器。编码器负责秘密信息的嵌入,使嵌入后音频与原始载体音频尽可能相似,从而使秘密信息难以被发现。该新型轻量化编码器主要包含4个功能模块:特征提取、特征增强、特征压缩及残差融合。
秘密信息的嵌入过程如下:首先对载体音频和秘密音频进行读取,得到单通道时域音频张量;然后将载体音频与秘密音频的长度对齐,将音频张量重塑为规定分块,为后续网络输入做准备;接着进入特征提取层,该层由3个连续卷积模块组成,输入为秘密音频与载体音频构成的双通道矩阵,通过3×3卷积核提取低维空间特征与高维时间依赖特征,将输入的低维特征映射至高维表示,以增强特征处理能力,为后续复杂特征处理奠定基础。随后进入特征增强层,该层由两个幽灵模块组成,目的是在提升模型效果的同时,避免增加模型计算量与参数量,减少冗余计算。该模块参考GhostNet的核心理念:通过标准卷积生成部分特征,再利用低成本线性操作生成剩余特征,从而在较低参数量下获得高维输出,同时避免冗余卷积带来的计算浪费,有效缓解深层网络的梯度消失问题。
特征压缩层的核心功能是将融合秘密信息的高维特征逐步压缩为低维特征,使特征维度与原始输入的通道数相匹配,同时在降维过程中保留核心嵌入特征与载体音频原始特征,为后续残差融合做准备。最后的残差融合层,通过卷积层将其压缩为单通道特征残差,再与原始输入的载体音频相加,最终输出与原始载体音频长度完全一致的载密音频。残差连接的设计使编码器仅需学习秘密信息嵌入带来的特征残差,而非直接生成完整载密音频,大幅降低模型学习难度,同时最大限度保留原始载体音频的主体特征,进一步提升载密音频的不可感知性。
对于解码器的设计,其主要目的是从编码器生成的隐写特征中恢复原始信息或生成最终目标信号,由4个功能模块组成:多尺度初始特征提取层、多尺度压缩与残差映射模块、特征增强与融合模块及输出重建模块。
多尺度特征提取层由两个并行卷积模块组成,分别采用3×3和5×5卷积核进行特征提取:其中,3×3小卷积核负责捕捉音频的局部细节特征与高频信息,5×5大卷积核负责捕捉音频的全局结构特征与低频信息,从而捕捉不同感受野下的特征信息。二者结合实现了不同感受野下的特征信息互补,使模型能够同时关注载密音频的局部嵌入细节与全局特征结构,有效应对平台攻击带来的局部特征损坏与全局波形失真,提升特征提取的鲁棒性。
多尺度压缩与残差映射模块由4个连续并行的卷积单元组成,通过多尺度压缩的反复降维、升维减少冗余信息,同时利用残差映射融合两种不同维度的特征,保持特征完整性。模块中引入跨层残差连接,将前一层输入特征与后一层输出特征融合,避免多尺度压缩过程中的有效信息丢失,同时有效缓解深层网络的梯度消失问题,保证模型训练的稳定性。
特征增强层通过高维特征融合,具备高效的特征提取能力,可挖掘受损载密音频中与秘密信息相关的微弱特征;同时,为避免高维特征带来的参数冗余,采用幽灵模块替代传统卷积,显著减少参数量,降低了冗余计算,且引入残差可有效缓解深度学习中的梯度消失问题。输出重建模块通过广义Jaccard系数损失(generalized jaccard coefficient loss)约束原始秘密音频与重构秘密音频,不断优化解码器的信息恢复精度,同时反向推动编码器学习更具鲁棒性的嵌入策略。
为提升模型鲁棒性,在编码器和解码器中采用多层残差连接,既避免深度网络训练过程中的梯度消失问题,又保留载体音频的原始核心特征及秘密信息嵌入时的特征;即使载密音频经音频分享平台处理后出现局部特征损伤,解码器仍可通过复用浅层保留的原始特征,实现秘密信息的高精度恢复。在此基础上,采用多尺度特征提取,学习不同维度的特征信息,大幅提升抗干扰能力。最终通过将编码器、解码器采用的深度卷积、残差连接与幽灵模块有机结合,实现信息嵌入、音频提取与模型参数之间的平衡。该结构不仅可满足音频隐写任务的核心需求,同时在其他音频领域也展现出广泛的应用潜力。

2.3 模拟攻击器

图3给出音频分享平台模拟攻击前后音频对比。可以看出,音频分享平台对音频的处理主要表现为整体能量/音量的增强及信号细节的变化,这些变化源于平台滤波、压缩等处理带来的信号细节改变。
图 3 模拟攻击前后音频对比

Fig.3 Audio comparison before and after simulated attack

为提升隐写技术在音频分享平台的鲁棒性,本文设计基于平台攻击的模拟攻击器网络结构,如图4所示,其包括音量增益模块、通道注意力模块、空间注意力模块及攻击音频合成模块。
图 4 模拟攻击器网络结构

Fig.4 Network structure of SA

音量增益模块用于模拟音频分享平台对音频能量的调整,目的是反映音量规范或自动增益导致的幅度尺度变化。该模块通过可学习映射模拟不同平台的自动或手动音量调节策略,同时保持幅度变化的可控性与可微性,便于在训练和评估阶段对该模块参数进行联合优化或固定。
通道与空间注意力模块旨在模拟平台在滤波、编码及压缩过程中对音频局部细节的改变。为更细致地刻画不同频段及时频位置的重要性,本文采用通道注意力与空间注意力相结合的方式。通道注意力通过对通道维度进行统计,借助小型前馈网络计算通道权重,强调或抑制各通道的重要性,从而模拟平台在频带选择及增益分配上的差异。空间注意力则在时频平面上计算注意力映射,突出重要的时序—频率位置,捕捉局部结构及瞬态特征的相对重要性。
攻击音频合成模块通过多层带谱归一化的卷积( spectral normalization convolution 2D,SNConv2D)进行局部处理,以模拟滤波及压缩带来的频谱平滑或细节损失。最终,处理结果通过残差连接与原始信号或前一步输出相加,以控制修改强度并减少信息丢失。

2.4 判别器

判别器的作用是判断载密音频与载体音频的相似度,与编码器形成对抗,以推动整个网络优化。判别器由卷积特征提取器与全连接判别头组成,其网络结构包含4个卷积模块和3个全连接模块(linear block)。
卷积特征提取器由4个连续的谱归一化卷积单元组成,可有效提取音频的深度特征;通过交替使用不同形状的卷积核与步幅,在保持细节的同时逐步下采样并扩展通道维度,旨在在较低分辨率处保留高阶判别特征。谱归一化(spectral normalization, SN)有助于约束层映射的谱范数,从而提升训练稳定性。
全连接判别头由3层全连接模块构成,可有效提升模型训练稳定性,降低判别器过强带来的训练震荡、提升判别器性能,最终映射为[0,1]区间的概率值,用于表示判断结果。

2.5 损失函数设计

为实现不可感知性优化,传统时域隐写算法往往将秘密信息嵌入能量较高的部分,却忽视了能量不均衡的问题。因此,本节采用多层约束的损失函数,总损失函数由重构损失(Lrec)、对抗损失(Ladv)、焦点频域损失(Lff)及恢复损失(Lsr)组成,损失函数定义如式(1)所示。
$ {L}_{\text{total}}={\lambda }_{1}{L}_{{\mathrm{rec}}}+{\lambda }_{2}{L}_{{\mathrm{adv}}}+{\lambda }_{3}{L}_{{\mathrm{ff}}}+{\lambda }_{4}{L}_{{\mathrm{sr}}} $
其中,Ltotal为总损失函数,λ1、λ2、λ3、λ4为不同损失的权重,经实验优化后,实现性能平衡。重构损失是保障载密音频与原始载体音频相似、实现秘密信息恢复的基础,采用广义Jaccard系数结合均方误差(mean squared error, MSE)实现双重约束,在保证不可感知性的同时,可更合理地将秘密信息嵌入冗余空间。
对抗损失是保障不可感知性与抗检测性的核心,采用基于生成对抗网络的二分类交叉熵损失构建,用于优化判别器。其目标是区分原始载体音频与载密音频,而编码器则通过优化生成策略欺骗判别器。二者的迭代对抗训练使载密音频与载体音频无显著差异,同时提升不可感知性与抗隐写分析检测能力。
焦点频域损失(FFL)是进一步提升听觉不可感知性的关键,结合人耳对低频更敏感、对高频感知较弱的特性,对不同频段失真进行差异化加权,重点约束低频段以保证听感,有效弥补传统时域损失的不足。秘密恢复损失通过约束载密音频经模拟攻击器处理后恢复的秘密音频与原始秘密音频的差异,推动解码器学习受攻击音频的特征变化规律,从而在真实平台传输场景下仍能精准恢复秘密信息。通过上述多损失项的协同约束,本文方法在各方面均取得了较好的效果。

3 实验与结果分析

为验证所提RLAS方法的有效性,从跨数据集泛化性、不可感知性、鲁棒性、抗隐写检测性及轻量化5个方面,将RLAS与最新的HIFI-STEGO[22]、BNSNGAN[13]、TCN-CL[33]、CNN-ETE[34]、RASF-2[35]进行对比分析。所有对比算法的代码均采用Python语言编写,并在一台配置为Intel i7-13700KF CPU @ 3.40GHz、32.0GB DDR4 RAM @ 2400MHz、GeForce RTX 4060 Ti GPU及Windows 10操作系统的计算机上进行测试。

3.1 实验设置

为保证实验普适性,本文训练数据来自开源数据集Librispeech[36],通过截断统一音频时长,构建了音频时长为2 s的隐写训练数据集。训练数据集包含20000个音频样本作为载体音频训练集,另选取20000个音频作为秘密音频训练集。采用同样方法构建2 s的隐写测试集,包含2 000个音频样本(不含训练集样本),每种方法测试10组数据。
在RLAS算法中,批处理大小设为16,模拟攻击器的学习率设为0.0001,编码器、解码器及判别器的学习率为0.001,优化器采用Adam。对比算法的参数设置均参照其对应参考文献。
实验评价中,不可感知性采用信噪比(signal-to-noise ratio, SNR)衡量,SNR越高,不可感知性越好;按照国际信息隐藏标准,隐写音频的SNR值不小于20 dB[37]即可满足要求;鲁棒性采用均方误差衡量,用于评价不同环境下秘密信息提取的准确率,MSE越小,提取准确率越高,鲁棒性越强。最后,为衡量模型的抗隐写分析能力,采用检测准确度(ACC)评价其性能,ACC越接近0.5,说明判别器处于随机猜测状态,无法区分载密音频与载体音频。

3.2 不可感知性测试

第一个实验通过对比RLAS与其他方法的SNR值,验证模型的不可感知性。表1给出RLAS与对比方法的不可感知性测试结果。
表 1 RLAS与对比方法的不可感知性测试结果(SNR↑)

Table 1 Testing the imperceptibility of the RLAS and comparison methods (SNR↑)

测试号 RLAS RASF HIFI-
STEGO
BNSNGAN TCN-
CL
CNN-
ETE
Test128.7910.078.4226.8421.4324.26
Test228.7910.518.0726.8822.1524.15
Test328.8010.478.1826.8721.8724.69
Test428.3910.617.2527.4521.8125.24
Test529.2310.508.6625.4422.0123.77
Test629.6310.248.3929.6921.8423.32
Test729.6610.407.8525.2021.4824.04
Test828.479.958.0726.3022.7324.69
Test929.659.938.5526.5921.1923.79
Test1029.1010.518.0126.6722.5525.60
平均29.0510.328.1526.7921.9124.36
表1可知,HIFI-STEGO、CNN-ETE、TCN-CL及BNSNGAN的平均SNR分别为8.15 dB、26.79 dB、21.91 dB、24.36 dB,本文RLAS的平均SNR为29.05 dB,均高于其他对比方法。其中,HIFI-STEGO的SNR较低,这可能是因为该方法本身采用Voice Conversion Challenge 2018数据集,其风格一致性高,主要通过内容/风格解耦减少对音频主要结构的破坏,但对数据集要求较高;而本文为保证实验一致性,采用常规数据集,这可能导致其SNR下降。
RASF的SNR较低,可能是由于本文为统一变量,嵌入2 s FLAC格式(Free Lossless Audio Codec)音频;而该方法嵌入量有限,通常需将2 s秘密音频嵌入1 h左右的载体音频中,且载体与嵌入类型的转变可能导致测试SNR较差。本文RLAS方法通过提取包含语音信号长短时依赖关系的时间依赖特征,帮助编码器学习秘密信息,提升音频不可感知性;同时,在损失函数中引入焦点频域损失,通过约束频域损失进一步提升载密音频的不可感知性,整体具有良好的不可感知性,可满足隐写性能要求。

3.3 鲁棒性分析

为测试模型的鲁棒性,首先测试秘密信息的提取准确率,采用均方误差作为评价指标,用于评价秘密信息恢复过程中的表现,结果如表2所示。
表 2 RLAS方法秘密音频提取测试结果

Table 2 Test Results of Secret audio extraction using RLAS method (MSE ×103↓)

测试号 RLAS RASF HIFI-
STEGO
BNSNGAN TCN-
CL
CNN-
ETE
Test10.413×10−300.633×10−30.226×10−31.358×10−30.419×10−3
Test20.403×10−300.887×10−30.249×10−31.551×10−30.484×10−3
Test30.407×10−300.751×10−30.215×10−31.299×10−30.396×10−3
Test40.589×10−300.826×10−30.288×10−31.428×10−30.441×10−3
Test50.452×10−300.717×10−30.289×10−31.097×10−30.443×10−3
Test60.403×10−300.853×10−30.284×10−31.036×10−30.389×10−3
Test70.424×10−300.814×10−30.295×10−31.322×10−30.477×10−3
Test80.457×10−300.726×10−30.287×10−31.212×10−30.476×10−3
Test90.369×10−300.712×10−30.251×10−31.854×10−30.443×10−3
Test100.448×10−300.881×10−30.232×10−31.519×10−30.547×10−3
平均0.437×10−300.780×10−30.262×10−31.368×10−30.452×10−3
RASF可实现无损提取,但嵌入容量有限;而本文RLAS方法可在保持高嵌入容量的同时,获得优秀的MSE性能,其平均MSE为0.437×10-3,同等嵌入条件下仅次于模型结构更复杂的BNSNGAN,且优于其余对比方法。
为进一步验证所提方法的鲁棒性,首先在8种模拟信号处理攻击下测试秘密信息提取准确率,分别为高斯噪声( gaussian noise,GN)攻击、多径衰落(multipath fading,MPF)攻击、重采样(resampling,RS)攻击、重量化(requantization,RQ)攻击、低通滤波(low-pass filtering,LPF)攻击、幅度缩放(amplitude modification,AM)攻击、裁剪(cropping,CP)攻击及有损压缩(MP3 compression,MP3)攻击,结果如表3所示。
表 3 RLAS方法的鲁棒性测试结果(MSE×10−3↓)

Table 3 Robustness test Results of the RLAS method (MSE×10−3↓)

攻击方式 RLAS RASF HIFI-STEGO
无攻击 0.437×10−3 0 0.780×10−3
GN 2.105×10−4 0.247×10−3 0.815×10−3
MPF 5.828×10−3 0.004×10−3 0.777×10−3
RS 3.727×10−3 0 0.771×10−3
RQ 6.956×10−3 0.211×10−3 0.798×10−3
LPF 3.728×10−3 0 0.771×10−3
AM 0.894×10−3 1.212×10−3 3.099×10−3
CP 1.089×10−3 0 1.338×10−3
MP3 3.495×10−3 - 5.818×10−3
在这8种常规信号攻击下,将本RLAS与最新的RASF[35]、HIFI-STEGO[22]进行对比可知,RLAS在AM攻击下的性能最优,基本无下降;这可能是由于训练过程中加入的模拟攻击器已提前模拟滤波、压缩、转码等处理,使其在这类攻击下仍能保持较好性能,但在其他攻击下表现略逊一筹。综合整体指标来看,在影响最大的GN攻击下,本文方法的MSE仍可保持0.02105的较低水平,整体性能表现优秀。
为进一步衡量模型在真实音频分享平台环境下的鲁棒性,在喜马拉雅、小宇宙、网易云3种主流平台上进行测试,结果如表4所示。由表4可知,面对平台攻击时,RLAS具有较强的鲁棒性;RASF因纠错码无法完成纠错,最终无法提取秘密信息;而HIFI-STEGO在小宇宙和网易云平台攻击下的MSE大幅上升。这表明,在模拟攻击器的辅助下,RLAS的抗平台攻击能力得到显著提升。
表 4 不同平台的鲁棒性测试结果

Table 4 Robustness test result of different platforms(MSE↓)

平台 RLAS RASF HIFI-STEGO
无攻击 0.437×10−3 0 0.780×10−3
喜马拉雅 0.776×10−3 失败 13.42×10−3
小宇宙 6.065×10−3 失败 1609
网易云 0.704×10−3 失败 0.411

3.4 抗隐写检测性分析

抗隐写分析能力是隐写方法的重要评价指标之一,指载体音频嵌入秘密音频后不被检测到秘密信息存在的能力。为验证本文方法对抗隐写分析器的性能,本小节选用CNN[23]和CNN+SRM[11]两种隐写分析器进行测试,结果如图5所示。
图 5 抗隐写分析实验结果

Fig.5 Results of anti-Steganalysis experiments

图5可知,与RASF、HIFI-STEGO、TCN-CL、CNN-ETE及BNSNGAN相比,RASF在CNN+SRM隐写分析器下表现最优,但本文提出的RLAS方法仅略逊于它;而在CNN隐写分析器下,RLAS方法的性能优于RASF,且ACC值更接近0.5,表明RLAS对基于深度学习的隐写分析器具有良好的不可检测性。因此,实验结果表明,RLAS对基于深度学习的隐写分析器具有良好的不可检测性。

3.5 轻量化分析

为验证本节提出的轻量化隐写网络在模型复杂度上的优势,本节对比了RLAS与HIFI-STEGO、BNSNGAN、CNN-ETE、TCN-CL 4种基于深度学习方法的编解码器参数规模,结果如图6所示。
图 6 不同方法编解码器参数量对比结果

Fig.6 Comparison result of decoder paramters of different models

图6可知,HIFI-STEGO和BNSNGAN采用深层次复杂网络结构,参数量庞大;CNN-ETE和TCN-CL采用简单卷积结构,参数量较小,但模型结构过于简单,导致其在隐写性能与秘密提取准确率方面存在明显不足。而RLAS通过引入幽灵模块,利用简单线性操作替代复杂卷积架构,在保证隐写性能的前提下,参数量更少,实现了性能与参数量的平衡。

3.6 消融实验

为评估本文提出的编解码器和损失函数的有效性,本节对上述组件进行消融实验,结果如表5表6所示。
表 5 消融实验分析

Table 5 Analysis of ablation experiments

指标 baseline 新编解码器 新编解码器+Ltotal
SNR↑ 16.72 23.35 29.05
MSE×10−3 0.906 0.439 0.437
参数量(万)↓ 114.39 41.38 41.38
其中,baseline为采用普通卷积的编解码器,选用L1损失(Mean Absolute Error, MAE)作为损失函数;新编解码器为本文所采用的编解码器,在原有编解码器基础上,主要将参数量较大的部分替换为幽灵模块以控制参数,并采用多层残差连接提升性能;Ltotal为本文设计的新型损失函数,与原有损失函数相比,更关注多层面的影响;SA为本文设计的模拟攻击器。由实验结果可知,本文RLAS方法中所采用的各组件,对隐写各项指标均具有一定积极作用。
表 6 鲁棒性消融实验分析(MSE↓)

Table 6 Analysis of robustness ablation experiments(MSE↓)

指标 新编解码器+Ltotal 新编解码器+Ltotal+SA
喜马拉雅 7.291×10−3 0.776×10−3
小宇宙 45.20 6.065×10−3
网易云 5.023×10−3 0.704×10−3

3.7 跨数据集泛化性能验证

为验证算法的跨数据集泛化能力,本文采用TIMIT数据集进行测试,预处理方式、超参数设置及实验流程均与Librispeech数据集一致,以保证实验变量唯一,测试结果如表7所示。
表 7 RLAS方法的泛化性测试结果

Table 7 Test results of the generalizability of the RLAS method

RLAS Librispeech TIMIT
SNR↑ 29.05 22.97
MSE 0.437×10−3 0.0535×10−3
表7可知,RLAS方法具有一定的泛化性能。该方法在两类数据集上的SNR均高于20 dB,具有良好的不可感知性;由于TIMIT数据集具有说话人特征复杂、发音风格多样的特点,编码器的特征拟合难度显著提升,但RLAS的SNR仍达到22.97 dB,满足不可感知性要求。对于MSE,RLAS在TIMIT数据集上仅为0.0535×103,核心原因是该数据集的语音片段为规整的短句朗读,大幅降低了解码器的特征还原难度,实现了更高精度的秘密信息恢复。

4 结束语

本文提出一种基于GhostNet的鲁棒轻量化音频隐写方法,在保证隐写信息不可感知性的同时,显著提升了模型鲁棒性,降低了模型参数量。实验结果验证,该方法可有效应对多种平台攻击,具有鲁棒性强、不可感知性好、易部署的特点。
未来工作将致力于提升模型在复杂翻录对抗环境下的鲁棒性。
1
Mielikainen J. LSB matching revisited[J]. IEEE Signal Processing Letters, 2006, 13 (5): 285- 287.

DOI

2
Rekik S, Guerchi D, Selouani S A, et al. Speech steganography using wavelet and Fourier transforms[J]. EURASIP Journal on Audio, Speech, and Music Processing, 2012 (1): 20.

DOI

3
Gambhir A, Khara S. Integrating RSA cryptography & audio steganography[C]//Proceedings of the 2016 International Conference on Computing, Communication and Automation (ICCCA). Piscataway: IEEE Press, 2016: 481-484.

4
Mishra A, Johri P, Mishra A. Audio steganography using ASCII code and GA[C]//Proceedings of the 2017 International Conference on Infocom Technologies and Unmanned Systems (Trends and Future Directions) (ICTUS). Piscataway: IEEE Press, 2017: 646-651.

5
Nassrullah H A, Flayyih W N, Nasrullah M A. Enhancement of LSB audio steganography based on carrier and message characteristics[J]. Journal of Information Hiding and Multimedia Signal Processing, 2020, 11 (3): 126- 137.

6
You W K, Zhang H, Zhao X F. A Siamese CNN for image steganalysis[J]. IEEE Transactions on Information Forensics and Security, 2021, 16, 291- 306.

DOI

7
Butora J, Yousfi Y, Fridrich J. How to pretrain for steganalysis[C]//Proceedings of the 2021 ACM Workshop on Information Hiding and Multimedia Security. New York: ACM, 2021: 143-148.

8
Ren Y Z, Liu D K, Liu C Y, et al. A universal audio steganalysis scheme based on multiscale spectrograms and DeepResNet[J]. IEEE Transactions on Dependable and Secure Computing, 2023, 20 (1): 665- 679.

DOI

9
Zielińska E, Mazurczyk W, Szczypiorski K. Trends in steganography[J]. Communications of the ACM, 2014, 57 (3): 86- 95.

DOI

10
Goodfellow I, Pouget-A J, Mirza M, et al. Generative adversarial nets[J]. Advances in Neural Information Processing Systems, 2014, 27, 2672- 2680.

11
Yang J H, Zheng H L, Kang X G, et al. Approaching optimal embedding in audio steganography with GAN[C]//Proceedings of the ICASSP 2020 - 2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). Piscataway: IEEE Press, 2020: 2827-2831.

12
Kreuk F, Adi Y, Raj B, et al. Hide and speak: towards deep neural networks for speech steganography[C]//Proceedings of the Interspeech 2020. ISCA, 2020: 4656-4660.

13
岳峰, 朱慧, 苏兆品, 等. 基于BN优化SNGAN的自适应音频隐写[J]. 计算机学报, 2022, 45 (2): 427- 440.

DOI

Yue F, Zhu H, Su Z P, et al. An adaptive audio steganography using BN optimizing SNGAN[J]. Chinese Journal of Computers, 2022, 45 (2): 427- 440.

DOI

14
IOFFE S, SZEGEDY C. Batch normalization: accelerating deep network training by reducing internal covariate shift[C]//Proceedings of International conference on machine learning. PMLR, 2015: 448-456.

15
Altınbaş A E, Konyar M Z. Reverb hiding: a new framework for audio steganography[J]. Applied Acoustics, 2025, 235, 110696.

DOI

16
Zhuo P W, Yan D Q, Ying K Y, et al. Audio steganography cover enhancement via reinforcement learning[J]. Signal, Image and Video Processing, 2024, 18 (2): 1007- 1013.

DOI

17
Chen L, Wang R D, Dong L, et al. Imperceptible adversarial audio steganography based on psychoacoustic model[J]. Multimedia Tools and Applications, 2023, 82 (17): 26451- 26463.

DOI

18
Su W K, Ni J Q, Hu X L, et al. Efficient audio steganography using generalized audio intrinsic energy with micro-amplitude modification suppression[J]. IEEE Transactions on Information Forensics and Security, 2024, 19, 6559- 6572.

DOI

19
Wang J L, Wang K X. A novel audio steganography based on the segmentation of the foreground and background of audio[J]. Computers and Electrical Engineering, 2025, 123, 110026.

DOI

20
Feng Y, Xu L T, Lu X C, et al. A robust coverless audio steganography based on differential privacy clustering[J]. IEEE Transactions on Multimedia, 2025, 27, 5669- 5684.

DOI

21
Li Y M, Chen K J, Wang Y F, et al. CoAS: composite audio steganography based on text and speech synthesis[J]. IEEE Transactions on Information Forensics and Security, 2025, 20, 5978- 5991.

DOI

22
Zhang S F, Tian B Y, Gao Y, et al. HIFI-stego: a high-fidelity embedding audio steganography based on audio features decoupling[J]. IEEE Transactions on Audio, Speech and Language Processing, 2025, 33, 2032- 2044.

DOI

23
Jiang S Z, Ye D P, Huang J Q, et al. SmartSteganogaphy: Light-weight generative audio steganography model for smart embedding application[J]. Journal of Network and Computer Applications, 2020, 165, 102689.

DOI

24
Bui T, Agarwal S, Yu N, et al. RoSteALS: robust steganography using autoencoder latent space[C]//Proceedings of the 2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW). Piscataway: IEEE Press, 2023: 933-942.

25
Yan J L, Cheng Y, Yin Z X, et al. FGAS: fixed decoder network-based audio steganography with adversarial perturbation generation[PP/OL]. V3. arXiv (2025-04-23)[2025-11-10]. https://doi.org/10.48550/arXiv.2505.22266.

26
Han K, Wang Y H, Tian Q, et al. GhostNet: more features from cheap operations[C]//Proceedings of the 2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). Piscataway: IEEE Press, 2020: 1577-1586.

27
Jiang X G, Bian X F, Guo C G. Ghost-stereo: GhostNet-based cost volume enhancement and aggregation for stereo matching networks[PP/OL]. V1. arXiv (2024-05-23) [2025-11-10]. https://doi.org/10.48550/arXiv.2405.14520.

28
Chi J, Guo S H, Zhang H P, et al. L-GhostNet: extract better quality features[J]. IEEE Access, 2023, 11, 2361- 2374.

DOI

29
Hou H T, Guo M Z, Wang W, et al. Improved lightweight head detection based on GhostNet-SSD[J]. Neural Processing Letters, 2024, 56 (2): 126.

DOI

30
Ali A A, Ayub N. Enhancing smart IoT malware detection: a GhostNet-based hybrid approach[J]. Systems, 2023, 11 (11): 547.

DOI

31
Miyato T, Kataoka T, Koyama M, et al. Spectral normalization for generative adversarial networks[PP/OL]. V1. arXiv (2018-02-16) [2025-11-10]. https://doi.org/10.48550/arXiv.1802.05957.

32
Jiang L M, Dai B, Wu W, et al. Focal frequency loss for image reconstruction and synthesis[C]//Proceedings of the 2021 IEEE/CVF International Conference on Computer Vision (ICCV). Piscataway: IEEE Press, 2021: 13899-13909.

33
Takahashi N, Singh M K, Mitsufuji Y. Source mixing and separation robust audio steganography[PP/OL]. V2. arXiv (2022-02-18) [2025-11-10]. https://doi.org/10.48550/arXiv.2110.05054.

34
Wang J, Wang R D, Dong L, et al. Robust, imperceptible and end-to-end audio steganography based on CNN[M]//Security and Privacy in Digital Economy. SingaporeSpringer Singapore, 2020: 427-442.

35
Zhang Z P, Zeng J M, Xu Y, et al. Triple-stage robust audio steganography framework with AAC encoding for lossy social media channels[C]//Proceedings of the ACM Workshop on Information Hiding and Multimedia Security. New York: ACM, 2025: 131-141.

36
Panayotov V, Chen G G, Povey D, et al. Librispeech: an ASR corpus based on public domain audio books[C]//Proceedings of the 2015 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). Piscataway: IEEE Press, 2015: 5206-5210.

37
Su Z P, Zhang G F, Yue F, et al. SNR-constrained heuristics for optimizing the scaling parameter of robust audio watermarking[J]. IEEE Transactions on Multimedia, 2018, 20 (10): 2631- 2644.

DOI

文章导航

/