Academic Research

Robust audio watermarking method based on U-Net and discrete wavelet transform

  • WEN Shuangbing 1 ,
  • ZHANG Qishan 2 ,
  • TAN Hanzhong 2 ,
  • HU Tao , 1, 2, * ,
  • LI Jun 2
Expand
  • 1. College of Mathematics and Statistic, Hubei Minzu University, Enshi 445000
  • 2. College of Intelligent Science and Engineering, Hubei Minzu University, Enshi 445000

Online published: 2025-08-20

Copyright

Copyright ©2025 Journal of Aeronautical Materials. All rights reserved.

Abstract

In recent years, the rapid advancement of generative artificial intelligence has significantly accelerated the generation and dissemination of digital content. Among these developments, highly realistic deepfake audio poses substantial challenges for identifying authentic media content. Audio watermarking can effectively enhance the traceability of deepfake audio, preserving the authenticity and integrity of digital content. However, existing audio watermarking methods primarily rely on traditional techniques, which struggle to maintain robustness in complex environments. Addressing the need for robust audio watermarking, this study proposes a method based on U-Net and Discrete Wavelet Transform (DWT). This approach leverages U-Net’s advantages in multi-scale feature extraction and skip connections, as well as the stability of DWT in frequency component decomposition and low-frequency features. The embedding and extraction of watermark information are achieved through jointly trained embedding and extraction networks. In the embedding network, U-Net embeds watermark information into low-frequency coefficients. In the extraction network, the decoder retrieves watermark information from these low-frequency coefficients. Additionally, a noise layer is introduced during iterative training to improve robustness further. Experimental results demonstrate that this method effectively embeds and extracts audio watermarks, achieving good robustness and imperceptibility.

Cite this article

WEN Shuangbing , ZHANG Qishan , TAN Hanzhong , HU Tao , LI Jun . Robust audio watermarking method based on U-Net and discrete wavelet transform[J]. Journal of Cybersecurity, 2025 , 3(3) : 91 -101 . DOI: 10.20172/j.issn.2097-3136.250307

0 引言

随着生成式人工智能(Artificial Intelligence Generated Content,AIGC)技术的不断发展,生成的图片、音频和视频内容日益逼真,已达到难以与真实内容区分的程度[1]。这一技术的进步不仅推动了娱乐、创作等领域的创新,同时也引发了关于数字内容真实性的广泛担忧。数字水印技术作为一种保护数字内容的手段,能有效地对AIGC生成内容进行控制,提高内容的安全性、版权性和传播性[2]。音频水印技术能有效地对生成的音频进行版权保护和内容认证,极大地提升了生成式安全[3]
鲁棒性、不可感知性和容量是音频水印系统的主要评价指标,它们存在一种相互制约关系。现阶段,鲁棒音频水印技术以传统方法为主,按照嵌入位置,主要分为时域水印和频域水印。时域水印以最低有效位[4]和回声隐藏[5]为主,频域水印以离散余弦变换[6] (Discrete Cosine Transform,DCT)、离散小波变换[7](Discrete Wavelet Transform,DWT)和傅里叶变换[8](Fourier Transform,FT)为主。然而,这些方法的编码容量有限,在复杂的环境中鲁棒性不足。为了提高水印的鲁棒性,常将几种变换结合,将水印嵌入到多种变换域的系数中[9]。深度学习凭借其强大的特征提取能力,在图像处理中表现出色,被广泛应用于图像水印,如生成对抗网络、深度神经网络(Deep Neural Network,DNN)、可逆神经网络(Invertible Neural Network,INN)和卷积神经网络(Convolutional Neural Network,CNN)。现有的基于深度学习图像水印方案主要使用的是E-N-D(Encoder-Noise Layer-Decoder)框架,它由编码器、噪声层和解码器3个组件组成,编码器用于向输入载体嵌入水印,噪声层使带水印的载体失真,解码器则从失真的载体中提取水印[10]。网络结构会显著影响水印的鲁棒性,在图像水印中,一些工作促进了图像水印的发展,Mun等[11]首次提出了基于CNN的端到端水印框架。受生成对抗网络的启发,Zhu等[10]首次将生成对抗网络引入盲水印工作中。在此基础上,Ahmadi等[12]借助ResNet的思想在所需的转换空间中嵌入水印,并引入强度因子来权衡鲁棒性与不可感知性。Liu等[13]提出了一种两阶段可分离深度学习水印框架。Huang等[14]设计了一个注意力引导鲁棒图像水印模型。Zhu等[15]利用双U-Net编码器将水印信息隐藏到图像像素中。这些端到端的方法能够更明智地进行水印的自适应嵌入。
然而,由于音频载体的特殊性,图像水印的一些方法并不适用于音频水印。近年来,DNN在音频水印中的应用已经起步,Pavlovi1等[16]首次提出了使用DNN联合训练的嵌入器和检测器进行鲁棒语音水印的研究。Liu等[17]设计了一种抗翻录的深度学习水印框架(A Deep-learning-based Audio Re-recording Resilient Watermarking,DeAR),实验表明该框架具有较好的抗翻录鲁棒性,但是当前的工作在鲁棒性方面测试不足,没有考虑一些特殊的攻击,如环境噪声、淡入淡出等。而且在真实场景中,音频可能会受到多种噪声的影响,更重要的是,与单一攻击相比,组合攻击在真实场景中更频繁,带来的挑战性更大。因此,亟须设计一种能够同时抵抗多种单一攻击和组合攻击的深度学习鲁棒音频水印方法。
为此,本文探讨了适合音频水印的深度学习网络模型,相比其他网络结构模型,U-Net独特的模块化和对称设计结构被广泛地用于图像处理任务[18]。特别是在图像数据隐藏任务中,Duan等[19]提出的使用U-Net进行数据隐藏的方案,具有更高的视觉效果和嵌入能力。由于小波变换能够将信号分解为不同尺度的子带,能够提供多分辨率特性使得数据隐藏可以选择在适当的频带中进行,相比傅里叶变换,小波变换在时频域能更好地提供局部信息,因此小波变换被广泛应用于数据隐藏任务。例如,Liu等[20]结合U-Net和小波变换进行数据隐藏,显著提高了隐藏图像的视觉效果。同时,U-Net在语音增强任务中也表现出卓越的性能。Wave-U-Net[21]将这种架构应用于一维音频数据的音频源分离任务中,达到了更好的音频源分离效果。
因此,基于U-Net网络和小波变换在数字水印领域的应用,本文提出了一种基于U-Net和离散小波变换的鲁棒音频水印方法(U-Net and Discrete Wavelet Transform based Audio Watermarking,UDAW),利用U-Net编码器-解码器结构通过多尺度特征融合水印信息和音频特征,如图1所示。在嵌入阶段,受传统音频水印的启发,本文延续了Liu等[17]的思想,在其模型基础上进行改进。首先对音频信号进行离散小波变换,将其分解为低频和高频分量,编码器通过U-Net网络将水印信息嵌入到低频系数中,然后通过逆离散小波变换重构音频得到嵌入水印的音频。在传输过程中,带水印的音频可能受到各种失真(如回声、噪声、带通滤波和混响)的攻击,通过离散小波变换从失真的音频中得到失真的近似系数,解码器则从失真的近似系数中提取水印信息,从而完成整个数字水印任务。具体细节将在方法中详细介绍。
图 1 基于U-Net和离散小波变换的鲁棒音频水印框架流程图

Fig.1 Flowchart of robust audio watermarking framework based on U-Net and discrete wavelet transform

本文的主要贡献如下:
(1)提出了一种基于U-Net的编码器,充分利用音频的低频系数特征,将水印信息与低频系数进行多尺度融合,显著提高了水印嵌入后的鲁棒性和不可感知性。
(2)在3种公开数据集上进行实验验证,结果表明,在面对多种单一攻击和组合攻击的情况下,提出的方法表现出优异的鲁棒性,能够在各种复杂环境下确保水印信息的准确提取。

1 相关工作

1.1 音频水印

音频水印是指向音频中嵌入信息,这些信息对于人耳是不可察觉的,也不易移除,且经过音频处理后仍然能够提取。音频水印对于版权保护和内容溯源至关重要,特别是在AIGC时代,数字水印的重要性更加凸显。2024年9月14日,国家互联网信息办公室发布《人工智能生成合成内容标识办法(征求意见稿)》,明确提出人工智能生成合成内容标识的种类包括“显式标识”与“隐式标识”。指出应在音频的适当位置添加显著标识或者添加数字水印等形式的隐式标识。在AIGC时代,音频水印技术的实现具有挑战意义。
根据设计实现方法,音频水印方法主要分为两种类型,即传统音频水印方法和基于深度学习的音频水印方法,目前以传统音频水印方法为主。传统音频水印根据嵌入位置分为两种主要方法:时域水印和频域水印。时域水印直接将水印嵌入音频信号的样本中,包括最低有效位[4]和回声隐藏[5]。最低有效位直接对音频文件进行修改,主要修改二进制表示的最低位,而回声隐藏通过在载体音频中添加回声信息来编码水印信息,从而达到音频水印的目的。时域水印方法简单,但鲁棒性较差。频域方法相比于时域方法,通常能提供更好的鲁棒性和不可感知性,因为它们可以将水印嵌入到人耳不易察觉的频率组件中。常用的变换包括离散余弦变换[6]、离散小波变换[7]、傅里叶变换[8]等,频域水印主要通过上述变换方法将音频转换为变换域系数,然后选择变换域系数中的频域分量作为嵌入载体。此外,常通过几种变换结合,将水印嵌入到多种变换系数中。传统音频水印技术主要基于手工设计特征,然后通过某种水印嵌入方法进行人工调参,使水印的性能达到最佳,存在自适应性不足和鲁棒性较低的缺点。
近年来,基于深度学习的音频水印技术开始得到研究和应用,这类方法利用神经网络强大的特征提取能力,可以自动地从大量数据中学习到如何有效嵌入和提取水印。例如,Pavlovi等[16]首次提出了使用DNN联合训练的嵌入器和检测器进行鲁棒语音水印的研究,但是该研究只关注一些简单攻击。Liu等[17]设计了一种抗翻录的深度学习音频水印框架,能够有效抵抗不同距离的音频翻录失真。针对声纹克隆攻击的检测问题,Liu等[22]提出了一种基于音色水印技术的方法,将水印信息嵌入在目标个体的音色中,在不同声学模型和声码器组合语言克隆场景下准确地实现了水印提取。Chen等[23]以INN作为编码器和解码器,将水印嵌入到音频频谱图中,显著提高了水印的鲁棒性和不可感知性。针对抗去同步攻击和重放攻击,Li等[24]提出了一种基于双解码器的抗去同步与重放攻击的音频鲁棒水印算法。最近,Liu等[25]首次将扩散模型应用于音频水印中,利用扩散模型直接合成水印音频,提高了音频水印方法在不同应用场景中的适用性。

1.2 U-Net

U-Net最初由Ronneberger等[26]提出,主要用于医学图像的分割任务。由于U-Net对称的编码器-解码器和多尺度跳跃连接结构能够保留细节信息,所以其能学习到局部和全局特征。该架构已经被广泛应用于图像分割[18]、图像去噪[27]、医学影像处理[28]、深度伪造检测[29]等任务中。同时,U-Net也适合作为数字水印技术任务中隐藏信息的嵌入或提取网络结构。例如,Zhang等[30]针对深度图像处理网络模型水印,将U-Net作为水印编码网络的HNet结构且取得了良好的视觉质量。Li等[31]以U-Net网络结构作为生成网络进行鲁棒图像水印,将水印信息嵌入到图像的低频域中。Liu等[20]提出了一种结合U-Net和小波变换的数据隐藏方案,通过隐藏网络U-Net将秘密信息的小波系数嵌入到图像中。针对彩色图像版权保护,Zhu等[15]提出了Lite-HRNet进行水印的定位和版权保护,采用双U-Net编码器将水印信息隐藏到人眼不可见的图像像素中。Zhang等[32]在图像处理网络的模型水印中,提出了一种基于 U-Net 结构的嵌入与提取子网络,并设计了两阶段训练策略,以提升水印的鲁棒性与提取精度。在上述研究中,U-Net独特的结构适用于数字水印任务,因此基于现有U-Net网络在数字水印技术上的应用,本文提出了一种以U-Net作为音频水印嵌入的主干网络。

1.3 离散小波变换

在数字水印任务中,常把水印信息隐藏嵌入到小波域中,DWT能够将信号分解为不同的频率自带,允许在不同分辨率层嵌入水印。灵活地选取不同的频率自带,可以平衡水印的鲁棒性和不可感知性。一维离散小波变换的计算原理如下:
对于$N$个点的离散信号$\left( {N = {2^J}} \right)$,取${j_0} = 0$,则有:
$ f(x)=\dfrac{1}{\sqrt{N}}\left[T_{\varphi}(0,0) \varphi_{0,0}(x)+\displaystyle\sum_{j=0}^{j=1} \displaystyle\sum_{k=0}^{2^j=1} T_{\varphi}(j, k) \psi_{j, k}(x)\right] $
其中,
$ \begin{split} {T_\varphi }\left( {0,0} \right) &= \left\langle {f\left( x \right),{\varphi _{0,0}}\left( x \right)} \right\rangle = \left\langle {f\left( x \right),\varphi \left( x \right)} \right\rangle \\ &= \dfrac{1}{{\sqrt N }}\displaystyle\sum\limits_{x = 0}^{N - 1} {f\left( x \right)} {\varphi ^*}\left( x \right) \\ {T_\psi }\left( {j,k} \right) &= \left\langle {f\left( x \right),{\varphi _{j,k}}\left( x \right)} \right\rangle = \dfrac{1}{{\sqrt N }}\displaystyle\sum\limits_{x = 0}^{N - 1} {f\left( x \right)} {\varphi _{j,k}}^*\left( x \right) \end{split}$
其中,$j = 0,1, \cdots ,J - 1,$$k = 0,1, \cdots ,{2^{j - 1}}$
针对数字音频水印任务,在传统方法中,研究者一直在寻找最适合的水印以嵌入最佳位置。大量实验证明,在DWT的近似系数中嵌入水印,不会明显影响音频信号的质量,而且近似系数对音频处理攻击影响最小[3334]。因此,将水印信息嵌入到DWT的近似系数中能够保证水印的鲁棒性和不可感知性。本文在研究中设计了水印编码器U-Net网络,通过编码器将水印信息嵌入到DWT低频系数中,并验证U-Net网络作为编码器在音频水印任务中的适用性。

2 方法

2.1 方法概述

本文聚焦鲁棒音频水印任务,提出了基于U-Net和离散小波变换的鲁棒音频水印方法。整体框架基于Liu等[17]的研究,在此基础上,提出了一种基于U-Net架构的鲁棒音频水印方法,该框架由5部分构成:
(1)扩散块F,它接受长度为L的水印信息$M \in \left( { - 1,1} \right)$作为输入,并输出消息隐藏层${F^m}$${F^m}$将被整形并连接到编码器进行水印嵌入;
(2)编码器E,它接受近似系数${A_{{\mathrm{ac}}}} \in {\mathbb{R}^{{N}}}/2$${F^m}$生成水印近似系数${\left( {{A_{{\mathrm{ac}}}}} \right)^M} \in {\mathbb{R}^{N}}/2$
(3)噪声层N,由多个可微分失真组成,使${A^M}$失真以生成噪声音频;
(4)解码器D,其目的是从带噪声的近似系数$\left( {{A_{{\mathrm{ac}}}}} \right)_N^M$中提取水印信息。通过各个模块相互协作训练,利用编码器-噪声层-解码器实现水印嵌入与提取。针对不同模块的具体实施细节将在以下小节介绍。

2.2 扩散块

在本文音频水印框架中,扩散块的目的是为了更好地耦合水印信息和音频的近似系数特征,并将水印信息嵌入到近似系数中,使水印尺寸和音频的近似系数尺寸对齐。本文提出了扩散块F来预处理水印信息,如图2所示。首先,将长度为L的水印信息$M \in \left( { - 1,1} \right)$进行线性变换,得到长度为$\dfrac{N}{2}$的张量,然后通过下采样块卷积池化层对这个张量进行处理,确保水印信息在编码网络上采样阶段的不同层次上都能够有效融合。
图 2 基于U-Net和离散小波变换的鲁棒音频水印总体框架

Fig.2 Overall framework of robust audio watermarking based on U-Net and discrete wavelet transform

2.3 编码器

在本文音频水印框架中,编码器的目的是将水印信息嵌入到近似系数中,同时尽可能减少听觉上的失真。在编码阶段,确保在既能够有效提取近似系数的特征又不影响感知性的情况下,嵌入水印信息实现信息融合。本文精心设计了一个基于U-Net的编码器E,其结构如图2所示。首先,输入近似系数信号${A_{{\mathrm{ac}}}} \in {\mathbb{R}^{N}}/2$,其经过3个“双卷积”模块处理,每个模块包括一维卷积层、实例归一化、LeakyReLU激活函数和最大池化操作。这些模块逐步对输入信号进行下采样,最终得到时域长度为$\dfrac{N}{{16}}$的特征图,从而提取局部时频特征。接下来,再通过池化层进一步缩小时频域特征,生成$\dfrac{N}{{32}}$的全局特征图,再对该特征图复制扩展后与$\dfrac{N}{{16}}$的特征图拼接,以结合局部与全局特征。同时,水印消息经过线性变换和卷积处理,并通过下采样得到处理后的水印特征图。最后,这些拼接后的特征图通过多个“上采样-双卷积”模块,逐步恢复时域长度。模块包括上采样层、一维卷积层、实例归一化和LeakyReLU激活函数,最终生成的水近似系数输出与原始输入的大小一致。在编码器的上采样阶段,水印特征图被拼接到隐藏层中,这样拼接既能保留水印信息的特征,又减少了对原始音频近似系数的影响。同时,U-Net的编码器-解码器结构能够在不同尺度上提取和处理低频系数的多尺度特征,从而实现对水印嵌入位置的自适应选择。此外,通过跳跃连接确保音频信号的细节信息在嵌入水印时得到保留,从而实现了水印的不可感知性。由于水印嵌入在低频分量中,因此鲁棒性显著提升。整体损失函数如下式所示:
$ {L_E} = {\mathrm{MSE}}\left( {{A_{{\mathrm{ac}}}},{{\left( {{A_{{\mathrm{ac}}}}} \right)}^M}} \right) = {\mathrm{MSE}}\left( {{A_{{\mathrm{ac}}}},{E_\theta }\left( {{A_{{\mathrm{ac}}}},M} \right)} \right) $
其中,$\theta $是编码器参数,${\mathrm{MSE}}$(Mean Squared Error)为均方误差。

2.4 噪声层

在本文音频水印框架中,噪声层N的目的是通过引入各种形式的噪声或扰动,增强嵌入水印的鲁棒性和隐藏性。因此,训练阶段在编码器和解码器之间加入噪声层以模拟各种失真,本文遵循Liu[17]等的工作,将环境混响、带通滤波、高斯噪声纳入训练过程中。同时,为了进一步验证本文方法的鲁棒性,在测试阶段增加了多种单一攻击和组合攻击。多层次多组合的测试能更有效地验证本文方法在复杂环境下鲁棒性。

2.5 解码器

在本文音频水印框架中,解码器D的目的是提取与原水印信息一致的水印。解码器的结构如图2所示,解码器从失真的近似系数$\left( {{A_{{\mathrm{ac}}}}} \right)_N^M$中提取水印信息$\hat M$,整个解码器由4个单卷积块(一维卷积层+实例归一化+LeakyReLU激活函数)、9个残差块和2个二维卷积构成,其中二维卷积的目的是将提取的水印特征恢复为与${M_{{\mathrm{in}}}}$大小相同的张量。解码器D的最终目标是最小化$\hat M = {D_\phi }\left( {\left( {{A_{{\mathrm{ac}}}}} \right)_N^M} \right)$与原始信息$M$的差异,损失函数为:
$ L_D=\mathrm{MSE}\left(M,D_{\phi}\left(\left(A_{\mathrm{ac}}\right)_N^M\right)\right) $
其中,$\phi $是解码器参数。

2.6 判别器

在本文音频水印框架中,判别器A的任务是和编码器进行对抗训练,增加嵌入水印近似系数的感知质量。如图2所示,本文使用3个卷积块(一维卷积层、实例归一化、LeakyReLU激活函数)作为鉴别器,为了区分输入近似系数${A_{{\mathrm{ac}}}}$和编码近似系数${\left( {{A_{{\mathrm{ac}}}}} \right)^M}$,通过最小化以下损失函数来优化判别器:
$ {L_d} = \log \left( {1 - {A_\psi }\left( {{A_{{\mathrm{ac}}}}} \right)} \right) + \log \left( {{A_\psi }\left( {{E_\theta }\left( {{A_{{\mathrm{ac}}}},M} \right)} \right)} \right) $
其中,$\psi $是判别器A的参数。此外,为了让编码器更好地嵌入水印,使得判别器无法区分嵌入水印与未嵌入水印的音频信号,其对抗损失为:
$ {L_A} = \log \left( {1 - {A_\psi }\left( {{E_\theta }\left( {{A_{{\mathrm{ac}}}},M} \right)} \right)} \right) $
整个网络的总损失函数为:
$ L = {\lambda _E}{L_E} + {\lambda _D}{L_D} + {\lambda _A}{L_A} $
其中,${\lambda _{E}}、{\lambda _{D}}、{\lambda _A}$在训练时被设置为1、1、0.01。

3 实验结果与分析

3.1 实验设置

实验在Linux 16.04和Pytorch深度学习框架实现,使用NVIDIATITANRTX显卡。将Epoch设置为100,使用Adam优化器并将学习率设置为0.000 1。
对免费音乐档案(Free Music Archive,FMA)[35]数据集中的12 000个音频进行训练。在不与训练音频重叠的情况下,随机选择200个音频来测试本文水印方法的性能。此外,来自音乐流派分类数据集GTZAN(George Tzanetakis Genre Collection)[36]的200个音频,以及来自MagnaTagATune[37]数据集的200个音频用于测试以及评估模型的跨数据集泛化能力。所有音频的采样频率都重新调整为44.1 KHz,采样点为500 K。
采用信噪比(Signal-to-Noise Ratio,SNR)来评估水印的不可感知性,其定义如下:
$ {\mathrm{SNR}} = 10 \cdot \log \left( {\dfrac{{\displaystyle\sum\nolimits_{i = 1}^N {A{{\left( i \right)}^2}} }}{{{{\displaystyle\sum\nolimits_{i = 1}^N {\left[ {{A^M}\left( i \right) - A\left( i \right)} \right]} }^2}}}} \right) $
其中,$A\left( i \right)$是原始音频信号,${A^M}\left( i \right)$是带水印的音频信号。此外,使用平均恢复位精度来评估水印提取的准确率。
选用相关研究工作中的频域系数对数均值(Frequency Domain Coefficients Logarithmic Mean,FDLM)方法[38]、频率奇异值系数(Frequency Singular Value Coefficient,FSVC)方法[39]和DeAR方法[17]进行对比实验,前两种方法不需要训练。

3.2 比较结果

从音频的信噪比和平均恢复位精度两个方面评估本文方法与基线的性能,为了保证公平,嵌入容量均为100位,使用相同的数据集进行训练和测试,使用相同的攻击类型。

3.2.1 面对单一攻击的鲁棒性

本节评估所提出的UDAW方法以及基准FDLM[38]、FSVC[39]和DeAR[17]方法面对单一攻击的信噪比和平均恢复位精度。具体的攻击类型参数描述如下:
(1)添加高斯白噪声(Add Gaussian White Noise,AGWN)。AGWN的信噪比分别为15 dB和20 dB。
(2)添加环境噪声(Add Environmental Noise,AEN)。来自环境声音分类[40]数据集的6种噪声:喇叭声、敲门声、大笑声、警笛声、水滴声、下雨声,信噪比均为20 dB。
(3)添加淡入淡出AFD(Add Fading,AFD)。对音频应用淡入和淡出效果,给音频的开头或结尾添加平滑过渡,应用5种衰落形状:线性、对数、指数、四分之一正弦和四分之一半正弦,衰落比均为0.5。
(4)添加回声(Add Echoes,AEC)。在音频信号上叠加延迟和衰减的信号来模拟回声,其中延迟设置为1 000或2 000,衰减强度固定为0.5。
(5)添加时移(Add Time Shifting,ATS)。在音频信号上执行随机时移以达到时间偏差的效果,其中移位长度设置为16 000或32 000。
(6)添加音量控制(Add Volume Control,AVC)。随机改变输入音频的音量,参数设置为0.1或0.5。
(7)添加重采样(Add Resampling,ARS)。将音频信号从原始采样率重采样到0.9后返回。
(8)添加中值滤波(Add Median Filtering,AMF)。将音频信号进行中值滤波处理。
(9)添加掩码攻击(Add Erasure,AER)。随机将音频数据中的一部分样本置零,掩码率设置为0.05。
(10)添加带通滤波(Add Bandpass Filter,ABPF)。保留频率范围在300 ~ 8 000 Hz之间的信号。
(11)添加低通滤波(Add Low-Pass Filter,ALPF)。去除8 kHz 以上频率的信号。
表1表2分别给出所提出的方法与基准方法在FMA、GTZAN和MagnaTagATune等公开数据集上面对单一攻击的信噪比和平均恢复位精度比较(每一种攻击的具体参数描述见表第1列),结果显示所提出的模型在3个数据集上均表现优秀的鲁棒性。特别需要注意的是,本文方法UDAW在面对高斯白噪声、环境噪声、淡入淡出、回声、音量控制、重采样、中值滤波和掩码时,平均恢复位精度复始终保持在0.96以上,多数接近$100\% $,高于基准模型。但是在面对时移攻击时,UDAW平均恢复位精度较低,说明本文方法在水印定位方面存在不足,为此,今后将针对水印定位开展研究。另外,UDAW在3个数据集上的信噪比均高于26 dB,这说明UDAW的鲁棒性和不可感知性达到均衡。
表 1 本文方法与基准方法在FMA数据集上面对单一攻击的SNR与平均恢复位精度比较

Table 1 Comparison of SNR and average bit recovery accuracy between the proposed method and the baseline method under single attacks on the FMA dataset

攻击类型FDLMFSVCDeARUDAW
(本文)
SNR35.575831.289326.271830.0874
AGWN15dB0.69330.75840.91080.9716
AGWN20dB0.71720.80240.95680.9911
AENca0.79690.96230.99350.9999
AENke0.80070.82780.99990.9957
AENla0.75640.95081.00000.9999
AENsi0.78010.95570.97660.9965
AENwa0.82780.80851.00001.0000
AENra0.80460.80290.99981.0000
AFD 0.5/L0.73340.99900.96161.0000
AFD 0.5/EX0.71520.99880.89050.9999
AFD 0.5/QS0.74750.99980.98621.0000
AFD 0.5/HS0.72210.99140.86010.9917
AFD 0.5/LG0.76450.99980.99931.0000
AEC 1K/0.50.98981.00001.00001.0000
AEC 2K/0.50.98980.99991.00001.0000
ATS 16k0.78800.46330.99850.4996
ATS 32k0.78630.48170.48000.4991
AVC 0.10.98980.99990.99961.0000
AVC 0.50.98980.99990.99991.0000
ARS0.57800.49851.00001.0000
AMF0.87230.99211.00000.9999
AER0.97300.98860.98150.9649
ABPF0.97430.99920.99800.9296
ALPF0.99941.00000.99920.9762
表 2 本文方法与基准方法在GTZAN和MagnaTagATune数据集上面对单一攻击的SNR与平均恢复位精度比较

Table 2 Comparison of SNR and average bit recovery accuracy between the proposed method and baseline methods under single attacks on the GTZAN and MagnaTagATune datasets

攻击类型 GTZAN MagnaTagATune
FDLM FSVC DeAR UDAW
(本文)
FDLM FSVC DeAR UDAW
(本文)
SNR 34.167 7 28.817 8 22.451 6 26.667 0 35.575 8 36.142 5 25.142 7 28.635 0
AGWN15dB 0.725 9 0.801 7 0.971 8 0.990 3 0.651 2 0.664 5 0.907 3 0.979 4
AGWN20dB 0.749 2 0.844 2 0.991 4 0.997 1 0.680 2 0.700 1 0.954 4 0.992 9
AENca 0.816 7 0.927 3 0.999 3 0.999 9 0.762 8 0.808 3 0.999 3 1.000 0
AENke 0.810 9 0.820 3 1.000 0 0.998 4 0.766 1 0.735 8 1.000 0 0.996 7
AENla 0.789 8 0.970 9 1.000 0 0.999 9 0.727 0 0.905 6 1.000 0 1.000 0
AENsi 0.798 5 0.965 0 0.994 6 0.999 4 0.753 8 0.902 3 0.966 8 0.998 4
AENwa 0.848 3 0.868 2 0.999 9 0.999 9 0.795 4 0.766 4 0.999 9 1.000 0
AENra 0.825 5 0.825 9 0.999 9 0.999 9 0.778 9 0.688 5 0.999 9 1.000 0
AFD 0.5/L 0.712 5 0.998 3 0.963 6 0.999 9 0.726 5 0.999 8 0.985 7 1.000 0
AFD 0.5/EX 0.696 4 0.998 1 0.884 1 0.999 9 0.710 2 0.999 7 0.897 4 1.000 0
AFD 0.5/QS 0.729 1 0.998 9 0.993 0 0.999 9 0.741 1 0.999 5 0.998 0 1.000 0
AFD 0.5/HS 0.702 0 0.990 8 0.860 6 0.996 1 0.714 2 0.999 3 0.860 2 0.997 3
AFD 0.5/LG 0.749 5 0.999 0 0.999 9 0.999 9 0.757 5 0.999 4 0.999 9 1.000 0
AEC 1K/0.5 0.999 2 0.999 6 0.999 9 0.999 9 0.999 3 0.999 7 0.999 9 1.000 0
AEC 2K/0.5 0.999 2 0.999 4 0.999 9 0.999 9 0.999 3 0.999 3 0.999 9 1.000 0
ATS 16k 0.798 2 0.526 7 0.999 5 0.497 5 0.788 8 0.494 8 0.999 4 0.502 4
ATS 32k 0.789 3 0.520 3 0.421 3 0.494 8 0.784 3 0.501 8 0.420 3 0.488 5
AVC 0.1 0.999 2 0.999 8 0.999 8 0.999 9 0.999 3 0.999 7 0.999 9 1.000 0
AVC 0.5 0.999 2 0.999 5 0.999 9 0.999 9 0.999 3 0.999 3 0.999 9 1.000 0
ARS 0.997 6 0.999 5 0.999 9 0.999 9 0.584 7 0.480 7 0.999 9 1.000 0
AMF 0.901 3 0.999 3 0.999 9 0.999 9 0.906 7 0.998 2 0.999 9 1.000 0
AER 0.974 2 0.979 3 0.981 4 0.973 0 0.979 2 0.983 8 0.989 4 0.973 0
ABPF 0.988 1 0.999 7 0.999 5 0.955 2 0.987 7 0.997 9 0.999 8 0.882 7
ALPF 0.999 5 0.999 4 0.999 7 0.995 0 0.999 4 0.999 6 0.999 9 0.971 9
为了直观地比较原始音频与水印音频的差异,本文选择测试集中的一个音频作为示例,图3展示了DeAR、UDAW、FDLM、FSVC 4种算法下原始音频、水印音频和差异音频的频谱图。可以看出,4种算法的原始音频频谱图和水印音频频谱图都很相似,说明水印算法较好地保持了原有特性。从差异频谱图中看出,本文所提出的UDAW在频率上的差异非常小,尤其是大部分频段的差异接近0,表明该方法的水印嵌入对于音频频谱的影响最小。且由差异音频的频谱图可见,差异区域主要集中在低频部分,进一步验证了水印嵌入位置在近似系数中。
图 3 4种算法下原始音频、水印音频和差异音频频谱图对比

Fig.3 Comparison of spectrograms of original audio, watermarked audio, and difference audio under four algorithms

3.2.2 面对组合攻击的鲁棒性

在真实环境下,音频可能会受到多种噪声的影响,尤其与单一攻击相比,组合攻击在真实场景中更加频繁。因此,为了模拟更真实的环境,本文在 FMA数据集 上开展了组合攻击下的鲁棒性实验。本文将5种攻击进行组合,具体描述如下:高斯白噪后进行淡入淡出,高斯白噪后进行掩码,带通滤波后进行掩码,高斯噪声后进行带通滤波再进行淡入淡出。面对上述5种攻击组合的鲁棒性实验结果如表3所示,UDAW面对多种组合攻击的鲁棒性能表现良好,虽然在带通滤波后进行掩码具有挑战性,但UDAW的平均恢复位精度仍能达到0.90,且面对3种组合攻击的平均恢复位精度达到了0.96。
表 3 本文方法与基准方法面对5种组合攻击的平均恢复位精度比较

Table 3 Comparison of average bit recovery accuracy between the proposed method and baseline methods against five types of combined attacks

方法 AGWN20dB+AFD 0.5/HS AGWN20dB+AER ABPF+AER AGWN20dB+ABPF AGWN20dB+ABPF+AER
UDAW(本文) 0.964 2 0.989 8 0.905 3 0.986 0 0.960 7
FDLM 0.666 3 0.751 9 0.948 9 0.751 9 0.741 6
FSVC 0.755 1 0.803 1 0.951 1 0.806 2 0.773 7
DeAR 0.708 2 0.954 8 0.987 4 0.942 3 0.922 7
为了进一步有效验证UDAW面对组合攻击的鲁棒性能,本文将测试的每一个音频平均分为两部分,前一部分采取攻击方式1,后一部分采用攻击方式2。选取一组有代表性的攻击方式,与多种方式进行组合,包括信噪比为20 dB的高斯白噪声,衰落比为0.5的半正弦形状的淡入淡出,延迟设置为12 000,衰减强度固定为0.5的回声,300~8 000 Hz的带通滤波,掩码率为0.05的掩码攻击。表4展示了实验结果,每一行代表攻击方式1,每一列代表攻击方式2,对角线元素代表组合攻击的平均恢复位精度。可以看出,在多种组合攻击情况下,UDAW的性能显著高于DeAR,且面对上述组合攻击的平均恢复位精度均高于0.98。为了更直观地说明UDAW应对攻击的有效性,展示了在各种操作下的音频波形图和频谱图示,例如图4所示。从上述实验结果来看。本文所提出的方法在单一攻击和混合攻击下始终保持可靠的鲁棒性能。
表 4 UDAW与DeAR面对组合攻击的平均恢复位精度比较

Table 4 Comparison of average bit recovery accuracy between UDAW and DeAR against combined attacks

方法 AGWN20dB AFD 0.5/HS AEC2K/0.5 ABPF AER
UDAW(本文) DeAR UDAW(本文) DeAR UDAW(本文) DeAR UDAW(本文) DeAR UDAW(本文) DeAR
AGWN20dB 0.989 6 0.953 4 0.989 5 0.776 3 0.994 5 0.955 4 0.995 1 0.959 4 0.980 2 0.920 5
AFD 0.5/HS 0.991 3 0.769 2 0.999 2 0.975 4 0.998 8 0.911 1 0.990 1 0.882 9 0.984 6 0.897 4
AEC 2K/0.5 0.994 8 0.949 6 0.997 6 0.912 8 1.000 0 1.000 0 0.999 9 0.999 0 0.985 8 0.990 0
ABPF 0.995 0 0.955 5 0.998 4 0.884 7 1.000 0 0.999 0 0.929 5 0.998 0 0.989 8 0.981 4
AER 0.982 6 0.931 7 0.988 7 0.896 7 0.994 0 0.986 9 0.982 5 0.984 4 0.969 0 0.982 0
图 4 各种攻击下音频波形和频谱图示例

Fig.4 Examples of audio waveforms and spectrograms under various attacks

3.2.3 消融实验

为了进一步验证所提出水印嵌入网络编码器U-Net的有效性,本节对比分析了本文方法在不同网络结构下的性能表现。表5展示了当分别采用CNN和ResNet作为水印嵌入网络的编码器时,音频水印方法在鲁棒性和不可感知性方面的量化结果。实验结果表明,本文方法在不同的结构下仍能有效抵抗攻击,并且当水印编码器为U-Net结构时,SNR最高,表明与对比方法相比本文的方法具有良好的不可感知性。此外,在面对单一攻击和组合攻击时,本文的方法鲁棒性有明显的优势。因此,使用U-Net作为水印编码网络是切实可行的。
表 5 本文方法与不同网络结构的SNR与平均恢复位精度比较

Table 5 Comparison of SNR and average bit recovery accuracy of the proposed method with different network architectures

方法CNNResNetUDAW
SNR26.673 728.209 730.087 3
AGWN20dB0.963 00.935 20.991 1
AFD 0.5/ EX0.884 20.938 70.999 9
AGWN+ABPF0.955 90.926 10.986 8
AFD+AER0.870 30.926 20.975 6

4 结束语

本文提出了一种基于U-Net和离散小波变换的鲁棒音频水印方法。与纯全卷积架构的编码器相比,U-Net的编码器-解码器结构能够将水印信息与音频的近似系数进行多尺度特征融合,从而更有效地嵌入水印信息。在FMA、GTZAN和MagnaTagATune等公开数据集上对本文提出的UDAW方法进行了大量实验,与相关研究工作相比,UDAW在面对多种单一攻击和组合攻击时,表现出优异的鲁棒性能和不可感知性,验证了该方法的可行性和有效性。在未来的工作中,我们将进一步探索更适合音频水印的模型,提升其在更复杂环境下的鲁棒性能,以拓展其在音频水印任务中的应用。
1
LV Z. Generative artificial intelligence in the metaverse era[J]. Cognitive Robotics, 2023, 3, 208- 217.

DOI

2
RAMASAMY R, ARUMUGAM V. Digital watermarking-A tutorial[J]. IEEE Potentials, 2022, 41 (4): 43- 48.

DOI

3
UDDIN M S, HASAN M, SHIMAMURA T. Audio watermarking: A comprehensive review[J]. International Journal of Advanced Computer Science & Applications, 2024, 15(5): 1410-1418.

4
DEEBA F, KUN S, DHAREJO F A, et al. Digital image watermarking based on ANN and least significant bit[J]. Information Security Journal: A Global Perspective, 2020, 29 (1): 30- 39.

DOI

5
WANG S, YUAN W, UNOKI M. Multi-subspace echo hiding based on time-frequency similarities of audio signals[J]. IEEE/ACM Transactions on Audio, Speech, and Language Processing, 2020, 28, 2349- 2363.

DOI

6
NEJAD M Y, MOSLEH M, HEIKALABAD S R. A blind quantum audio watermarking based on quantum discrete cosine transform[J]. Journal of Information Security and Applications, 2020, 55, 102495.

DOI

7
ABODENA O, ALASHTIR A. High hiding capacity audio watermarking method based on discrete cosine transform[J]. Internation Journal of Advance Research and Innovative Ideas in Education, 2021, 7, 677- 684.

8
SALAH E, AMINE K, REDOUANE K, et al. A fourier transform based audio watermarking algorithm[J]. Applied Acoustics, 2021, 172, 107652.

DOI

9
TANG Y, WANG C, XIANG S, et al. A robust reversible watermarking scheme using attack-simulation-based adaptive normalization and embedding[J]. IEEE Transactions on Information Forensics and Security, 2024, 19, 4114- 4129.

DOI

10
ZHU J, KAPLAN R, JOHNSON J, et al. Hidden: Hiding data with deep networks[C]//Proceedings of the European Conference on Computer Vision (ECCV). Springer, 2018: 657-672.

11
MUN S M, NAM S H, JANG H, et al. Finding robust domain from attacks: A learning framework for blind watermarking[J]. Neurocomputing, 2019, 337, 191- 202.

DOI

12
AHMADI M, NOROUZI A, KARIMI N, et al. ReDMark: Framework for residual diffusion watermarking based on deep networks[J]. Expert Systems with Applications, 2020, 146, 113157.

DOI

13
LIU Y, GUO M, ZHANG J, et al. A novel two-stage separable deep learning framework for practical blind watermarking[C]//Proceedings of the 27th ACM International conference on multimedia. ACM, 2019: 1509-1517.

14
HUANG J, LUO T, LI L, et al. ARWGAN: Attention-guided robust image watermarking model based on GAN[J]. IEEE Transactions on Instrumentation and Measurement, 2023, 72, 1- 17.

15
ZHU L, FANG Y, ZHAO Y, et al. Lite localization network and DUE-based watermarking for color image copyright protection[J]. IEEE Transactions on Circuits and Systems for Video Technology, 2024, 34 (10): 9311- 9325.

DOI

16
PAVLOVIĆ K, KOVAČEVIĆ S, DJUROVIĆ I, et al. Robust speech watermarking by a jointly trained embedder and detector using a DNN[J]. Digital Signal Processing, 2022, 122, 103381.

DOI

17
LIU C, ZHANG J, FANG H, et al. Dear: A deep-learning-based audio re-recording resilient watermarking[C]//Proceedings of the AAAI Conference on Artificial Intelligence. AAAI, 2023, 37(11): 13201-13209.

18
AZAD R, AGHDAM E K, RAULAND A, et al. Medical image segmentation review: The success of U-net[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024, 46 (12): 10076- 10095.

DOI

19
DUAN X, JIA K, LI B, et al. Reversible image steganography scheme based on a U-Net structure[J]. IEEE Access, 2019, 7, 9314- 9323.

DOI

20
LIU L, MENG L, PENG Y, et al. A data hiding scheme based on U-Net and wavelet transform[J]. Knowledge-Based Systems, 2021, 223, 107022.

DOI

21
GUIMARÃES H R, NAGANO H, SILVA D W. Monaural speech enhancement through deep wave-U-net[J]. Expert Systems with Applications, 2020, 158, 113582.

DOI

22
LIU C, ZHANG J, ZHANG T, et al. Detecting voice cloning attacks via timbre watermarking[J]. arXiv preprint, arXiv: 2312. 03410.

23
CHEN G, WU Y, LIU S, et al. Wavmark: Watermarking for audio generation[J]. arXiv preprint, arXiv:, 2308, 12770, 2023.

24
LI B, CHEN J, XU Y, et al. DRAW: Dual-decoder-based robust audio watermarking against desynchronization and replay attacks[J]. IEEE Transactions on Information Forensics and Security, 2024, 19, 6529- 6544.

DOI

25
LIU W, LI Y, LIN D, et al. GROOT: Generating robust watermark for diffusion-model-based audio synthesis[C]//Proceedings of the 32nd ACM International Conference on Multimedia. ACM, 2024: 3294-3302.

26
RONNEBERGER O, FISCHER P, BROX T. U-net: Convolutional networks for biomedical image segmentation[C] //International Conference on Medical Image Computing and Computer-Assisted Intervention. Cham: Springer International Publishing, 2015: 234-241.

27
GURROLA-RAMOS J, DALMAU O, ALARCÓN T. U-Net based neural network for fringe pattern denoising[J]. Optics and Lasers in Engineering, 2022, 149, 106829.

DOI

28
ZHANG J, NIU Y, SHANGGUAN Z, et al. A novel denoising method for CT images based on U-net and multi-attention[J]. Computers in Biology and Medicine, 2023, 152, 106387.

DOI

29
KE J, WANG L. DF-UDetector: An effective method towards robust deepfake detection via feature restoration[J]. Neural Networks, 2023, 160, 216- 226.

DOI

30
ZHANG J, CHEN D, LIAO J, et al. Robust model watermarking for image processing networks via structure consistency[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024, 46 (10): 6985- 6992.

DOI

31
LI Q, WANG X, MA B, et al. Concealed attack for robust watermarking based on generative model and perceptual loss[J]. IEEE Transactions on Circuits and Systems for Video Technology, 2021, 32 (8): 5695- 5706.

32
ZHANG J, CHEN D, LIAO J, et al. Model watermarking for image processing networks[C]//Proceedings of the AAAI Conference on Artificial Intelligence. AAAI, 2020, 34(7): 12805-12812.

33
HUANG H N, CHEN S T, LIN M S, et al. Optimization-based embedding for wavelet-domain audio watermarking[J]. Journal of Signal Processing Systems, 2015, 80, 197- 208.

DOI

34
POURHASHEMI S M, MOSLEH M, ERFANI Y. A novel audio watermarking scheme using ensemble-based watermark detector and discrete wavelet transform[J]. Neural Computing and Applications, 2021, 33 (11): 6161- 6181.

DOI

35
DEFFERRARD M, BENZI K, VANDERGHEYNST P, et al. FMA: A dataset for music analysis[J]. arXiv preprint, arXiv:, 1612, 01840, 2016.

36
STURM B L. The GTZAN dataset: Its contents, its faults, their effects on evaluation, and its future use[J]. arXiv preprint, arXiv:, 1306, 1461, 2013.

37
LAW E, WEST K, MANDEL M I, et al. Evaluation of algorithms using games: The case of music tagging[C]//Proceedings of 10th International Society for Music Information Retrieval Conference (ISMIR 2009). International Society for Music Information Retrieval, 2009: 387-392.

38
LIU Z, HUANG Y, HUANG J. Patchwork-based audio watermarking robust against de-synchronization and recapturing attacks[J]. IEEE Transactions on Information Forensics and Security, 2018, 14 (5): 1171- 1180.

39
ZHAO J, ZONG T, XIANG Y, et al. Desynchronization attacks resilient watermarking method based on frequency singular value coefficient modification[J]. IEEE/ACM Transactions on Audio, Speech, and Language Processing, 2021, 29, 2282- 2295.

DOI

40
PICZAK K J. ESC: Dataset for environmental sound classification[C]//Proceedings of the 23rd ACM international conference on Multimedia. ACM, 2015: 1015-1018.

Outlines

/