Special Topic on Security Evaluation of Network Information Systems

survey on deepfake speech detection techniques

  • Yang Yunlong ,
  • Liu Quan , * ,
  • Niu Yan ,
  • Zhan Xuedong ,
  • Wang Ning
Expand
  • China Academy of Industrial Internet, Beijing 100020, China

Online published: 2026-04-01

Copyright

Copyright ©2025 Journal of Aeronautical Materials. All rights reserved.

Abstract

With the rapid advancement of generative artificial intelligence (GAI), deepfake speech technology has achieved remarkable progress. The synthesized speech now closely mimics authentic human voices in terms of timbre, prosody, and naturalness, exhibiting strong deceptive capabilities and thus posing significant challenges to detection systems. This survey systematically reviews the evolution, technical approaches, current challenges, and future directions of deepfake speech detection. First, we elaborate on the fundamental principles and methodologies of deepfake speech generation, covering speech synthesis and voice conversion (VC). Second, we comprehensively examine detection techniques, classifying them into three paradigms: traditional machine learning–based methods, deep learning–based approaches, and end-to-end detection frameworks. For each paradigm, we provide detailed analysis of its working mechanisms, inherent characteristics, and performance on typical benchmarks. Third, we introduce widely used benchmark datasets and evaluation metrics in this field. Finally, we discuss key challenges—such as poor generalization across unseen forgery types and constraints in real-time deployment—and outline promising future research directions.

Cite this article

Yang Yunlong , Liu Quan , Niu Yan , Zhan Xuedong , Wang Ning . survey on deepfake speech detection techniques[J]. Journal of Cybersecurity, 2025 , 3(5) : 14 -22 . DOI: 10.20172/j.issn.2097-3136.250502

0 引言

生成式人工智能(Generative Artificial Intelligence,GAI)推动了深度伪造语音技术的发展,其通过合成或替换目标人物的语音内容,能够生成高度逼真的伪造语音。这些伪造语音足以欺骗人类听觉系统和自动说话人验证(Automatic Speaker Verification,ASV)系统,被用于传播虚假新闻、政治谣言或实施语音诈骗,对政治安全、社会稳定、经济安全等造成了严重威胁[1]。此外,高度逼真的伪造语音足以欺骗部分ASV系统,攻击语音验证系统,导致身份认证漏洞,带来严重的安全隐患。
为有效应对深度伪造语音技术带来的各类风险,国内外研究机构已经针对伪造语音检测技术开展了广泛研究。英国爱丁堡大学等多个机构发起的ASVspoof(Automatic Speaker Verification spoofing)系列挑战赛极大地推动了该技术的发展。美国一些研究机构利用循环神经网络(Recurrent Neural Network, RNN)、卷积神经网络(Convolutional Neural Network,CNN)等深度学习算法,对伪造语音的特征进行提取和分析,取得了良好效果。清华大学、北京大学等高校的研究团队通过提取语音信号的时频、声学等特征,结合深度学习算法构建了相关检测模型,在深度伪造语音检测方面成效显著。
本文旨在对深度伪造语音检测技术的研究现状进行系统性梳理,通过对语音合成和语音转换(Voice Conversion,VC)技术的介绍,以及对检测方法的深入剖析,分析现有深度伪造语音检测方法的特点并探讨未来发展方向,为有效应对深度伪造语音带来的挑战提供理论支持和技术参考。

1 深度伪造语音技术

深度伪造语音技术主要是基于深度学习模型生成与目标人物高度相似的语音,技术路线主要分为语音合成和语音转换两类。语音合成技术是将给定的文本输入转换为自然、可懂的语音输出。语音合成系统被训练以目标人物的声音(音色、语调、口音等)来“朗读”任意文本,从而生成目标人物从未说过的语音内容。语音转换技术是将源语音在保留其语言内容的同时,转换为目标的语音特征,VC系统不需要文本输入,可以直接处理语音信号。

1.1 语音合成技术

语音合成技术历经了从传统方法到深度学习的演进过程,本文重点研究基于深度神经网络(Deep Neural Network,DNN)的语音合成方法。基于深度学习的语音合成技术包含文本编码器、声学模型和声码器3个核心组件。其中,文本编码器负责将输入的文本转换为富含语义信息的高维向量序列,多采用RNN、CNN、Transformer等网络架构实现;声学模型建立文本与声学特征之间的映射关系,并预测中间声学表征,最常用的是梅尔频谱图(Mel-spectrogram);声码器将声学模型预测的梅尔频谱图等声学表征转换为最终的语音波形。语音合成框架如图1所示。
图 1 语音合成框架

Fig.1 Framework of speech synthesis

2018年,Kalchbrenner等[2]提出了基于RNN方法捕捉语音信号的时间依赖性,能够有效生成流畅且自然的语音,但是训练过程可能会丢失训练语音声调、韵律等细节信息。2018年,Tachibana等[3]提出了基于CNN的语音合成技术,该技术未使用任何循环单元,训练时使用配备两个GPU(Graphics Processing Unit)的普通游戏笔记本计算机,只需要训练15 h,合成语音的质量几乎可以达到基于RNN几天训练的效果。2023年,Chen等[4]提出了基于扩散Transformer的语音合成模型,该架构在通用文本转语音方面的训练速度优于卷积网络架构,同时在少样本和少参数的情况下,生成语音的自然度和相似度优于Transformer架构。Tacotron系列模型[5]则提升了语音合成的质量与灵活性,通过端到端的方式将文本映射到梅尔频谱等声学特征,并结合声码器生成最终语音,但该模型存在训练复杂、推理速度慢等问题。

1.2 语音转换技术

传统语音转换方法通常基于信号处理技术,其核心在于提取和转换语音的关键特征,如梅尔频谱通过模拟人耳听觉特性,将语音信号从时域转换到频域,从而便于后续的特征分析和转换操作。这些方法虽然能够在特定场景下实现语音属性的调整,但往往受限于固定的转换规则,难以应对复杂的语音变化需求。典型的语音转换框架如图2所示。
图 2 语音转换框架

Fig.2 Framework of voice conversion

为了克服传统特征转换方法的局限性,基于DNN的语音转换技术逐渐成为研究热点。2014年,Mohammadi等[6]训练了一个深度自编码器,以构建多个说话人的短期频谱表征,训练的DNN模型能够根据源语音特征预测目标语音特征,在少量训练数据集上表现良好。2018年,Kameoka等[7]提出的StarGAN-VC技术采用生成对抗网络(Generative Adversarial Network,GAN)框架,通过多域共享的生成器实现了多种语音属性之间的转换,能够灵活处理多对多的语音转换任务,同时保持较高的语音质量。2023年,Guo等[8]提出了基于VITS(Variational Inference with adversarial learning for end-to-end Text-to-Speech)架构的端到端语音合成模型,将变分推理、归一化流和对抗训练相结合,直接生成高质量的语音波形,在语音质量和转换速度提升方面成效显著。

2 深度伪造语音检测技术研究进展

深度伪造语音技术的发展丰富了内容创作形式,但同时也带来很大的安全风险。因此,相关学者一直致力于深度伪造语音检测技术的研究。语音合成与语音转换均利用声码器合成语音波形,因此深度伪造语音的检测方法基本以检测声码器的相关特征为主。
由于人类听觉系统对声音的相位信息感知相对迟钝,传统的声码器在语音重构时往往不能充分处理相位信息。这种处理上的欠缺导致真实语音与合成语音在相位谱上产生可辨识的差异,此差异即为鉴别伪造语音的有效依据。此外,传统的语音合成技术在构建精确且可靠的韵律模型方面存在固有的挑战。例如,基于统计参数合成的方法所生成的语音,其基频变化往往过于平滑,缺乏自然的起伏。而采用波形拼接技术的合成方法,则容易在拼接单元的连接处出现基频的突变。传统检测技术便利用这些差异进行检测。随着深度学习技术的迅猛发展,基于DNN的伪造语音检测方法已成为研究的主流。深度学习方法前端会开展特征提取,后端会设计基于深度学习的分类器,这些设计良好的分类器通常能带来更好的结果,但相同的分类器与不同的特征结合时,结果可能会有很大的差异[9]。近年来,基于DNN的方法将特征提取和分类集成到一个端到端的系统中,特征提取器和分类器直接在原始语音波形上进行检测,取得了非常好的效果。
因此,深度伪造语音检测技术路线主要分为基于传统机器学习检测、基于深度学习检测和基于端到端检测三类,如图3所示。
图 3 深度伪造语音检测技术框架

Fig.3 Framework of deepfake speech detection technology

2.1 基于传统机器学习的检测技术

真实语音具有复杂的动态特性,所以伪造语音模型难以完全模拟。基于传统语音特征分析的检测技术主要依赖人工设计的底层声学特征,通过建模识别伪造语音中的异常模式。目前,常用的特征有梅尔频率倒谱系数(Mel-Frequency Cepstral Coefficients,MFCC)、线性频率倒谱系数(Linear Frequency Cepstral Coefficient,LFCC)和线性预测残差(Linear Prediction Residual,LPR)等。MFCC的核心思想是将语音信号的频谱特征映射到与人类听觉感知更为接近的梅尔尺度上,通过捕捉语音信号中的音色和语调信息,能够有效区分真实语音与伪造语音。由于MFCC主要关注语音信号的静态特性,对动态特性的刻画能力有限,因此在面对高度逼真的深度伪造语音时,其性能往往受到影响。LFCC直接在线性频域上进行倒谱分析,保留了更多的高频语音细节信息,在处理高频成分丰富的语音信号时表现突出,但对噪声的敏感性较高,在实际应用中需要对语音去噪以提高其稳定性。真实语音的LPR具有特定的时序结构,而生成语音的LPR往往呈现白噪声特性,因此,LPR也常被用于伪造语音的检测。
在检测过程中,研究人员首先对输入语音信号应用短时傅里叶变换或梅尔滤波器组等特征提取算法,将语音信号转化为数值化的特征向量。然后采用统计方法或机器学习模型对提取的特征进行建模,以识别真实语音与伪造语音之间的模式差异。传统机器学习检测技术常用高斯混合模型(Gaussian Mixture Model,GMM)和支持向量机(Support Vector Machine,SVM)两种典型的分类器。GMM通过使用多个高斯分布函数的线性组合分别学习真实语音和伪造语音的分布参数,从而进行分类。尽管GMM在早期研究中表现优异,但其独立累积语音帧得分的方式忽略了帧间关系,导致分类性能受限。2021年,Kumar等[10]提出了基于各个帧对数似然比的简单且高效的帧选择策略,减少了语音转换中未经修改的清音帧对决策得分的影响,并使用二类GMM作为后端分类器进行真伪语音判定。SVM[11]通过寻找最优超平面将不同类别的特征分开,具有较强的泛化能力。传统机器学习方法的优势在于计算量小、可解释性强,可以明确知道是哪些声学特征的差异导致了判别结果。然而,传统机器学习方法过度依赖人工特征,且本质上是在寻找已知的伪造痕迹。随着深度伪造技术的进步,现代TTS/VC模型,如基于扩散模型或高质量GAN模型生成的语音,在传统声学特征上与真实语音的差异越来越小。因此,传统机器学习方法面对复杂多变的深度伪造语音,检测准确率显著下降;对于训练集中未见过的未知攻击类型,模型泛化能力很差。面对不断演进的生成技术,传统基于机器学习的方法在检测新一代深度伪造语音时,已显示出明显的性能瓶颈[12-13]

2.2 基于深度学习的检测技术

随着深度伪造语音技术的不断演进,传统机器学习检测方法逐渐难以检测复杂多变的深度伪造语音。为提升检测性能,研究人员开始研究基于深度学习的检测技术,旨在结合手工特征与深度学习的强大语音表征和检测能力,获得更鲁棒的检测效果。其中,深度学习网络架构主要包括CNN、RNN等。CNN能够有效捕捉语音信号中的局部模式,特别是在处理MFCC等声学特征时,CNN能够自动学习到与伪造语音相关的判别性特征。RNN及、长短期记忆网络(Long Short-Term Memory,LSTM)可以捕捉连续语音帧之间的细微变化,在伪造语音检测中展现了强大的时序建模能力。相关检测技术性能对比如表1所示。
表 1 基于深度学习检测技术性能比较

Table 1 Detection performance comparison of deep learning-based technologies

文献方法 核心模型 输入特征 关键创新点 LA攻击场景下
实验结果(EER)
局限性
Lei等[14] Siamese CNN GMM后验
概率
结合GMM帧分数与CNN局部关系
建模,具有较高检测性能
3.79% 模型相对简单,对极其逼真
的伪造语音检测可能失效
Rostami等[15] EfficientNet-A0、
SE-Res2Net50
声学特征 使用模型融合与SpecAug数据增
强,模型检测性能优越
0.86% 模型复杂度较高,需要消耗
较高计算资源
Wang等[16] SE-Res2Net-Conformer 声学特征 引入Conformer挖掘局部与全局模
式,探索了时空建模方式
进行检测的价值
1.85% Conformer结构相对复杂,
影响推理速度
Li等[17] SafeEar 声学特征 内容与声学信息解耦,
保护用户隐私
3.10% 双分支结构增加了模型
复杂度和训练难度
盖馨怡等[18] MFF-STViT MFCC、GFCC、
谱质心、声码器
伪迹特征
融合了多种声学特征和STViT
架构,在复杂、长距离伪造
痕迹的检测上表现突出
0.41% STViT模型复杂,参数量大,
训练和推理速度慢
2020年,Lei等[14]提出了基于GMM和CNN的混合模型Siamese CNN,该模型以GMM输出作为CNN模型的输入,同时结合GMM组件的帧分数和帧与帧之间的局部关系,进行伪造语音判定,在ASVspoof 2019 数据集的逻辑访问(Logical Access,LA)攻击场景下的等错误率(Equal Error Rate,EER)较高,达到3.79%,但模型相对简单,对极其逼真的伪造可能失效。2021年,Rostami等[15]使用SpecAug加注意力掩码方法,融合了EfficientNet-A0和SE-Res2Net50模型特征,在ASVspoof 2019数据集的LA攻击场景下的EER取得了0.86%的良好表现,但模型复杂度较高,需要消耗较高的计算资源。2022年,Wang等[16]扩展了现有的Res2Net网络,引入了最新的Conformer模块,以进一步挖掘声学特征的局部模式,在ASVspoof 2019数据集上的实验结果表明,所提出的SE-Res2Net-Conformer架构能够提升LA攻击场景下的性能,EER达到1.85%,但是模型结构相对复杂,可能影响推理速度。2024年,Li等[17]使用SafeEar方法,将语义和声学信息与音频样本很好地分离,仅使用声学信息(如韵律和音色)加编码器特征增强技术进行深度伪造检测,在语音内容不被机器和人类听觉所解读时,该方法在ASVspoof 2019数据集的LA攻击场景下的EER达到3.10%,该方法将内容与声学信息解耦,可以保护用户隐私,但双分支结构增加了模型的复杂度和训练难度。2025年,盖馨怡等[18]提出的MFF-STViT方法,将MFCC、GFCC(Gamma-tone Frequency Cepstral Coefficients)、谱质心3种传统特征与深度学习提取的声码器伪迹特征拼接后,输入改进的Transformer模型,通过注意力机制自适应分配特征权重,该架构在ASVspoof 2019数据集的LA攻击场景下的EER达到0.41%,显著提升了伪造语音检测性能。该方法融合了多种声学特征和STViT架构,在长距离伪造痕迹的检测上表现突出,但模型复杂、参数量大,训练和推理速度慢。
此外,Yadav等[19]提出了利用自监督方法进行合成语音的归因分析,以识别生成伪造语音的具体模型或声码器,虽然该方法探索了更细粒度的伪造语音分析,但需要多样化的训练数据和更复杂的模型。Xie等[20]提出了设计卷积层和循环层相结合的网络架构,通过聚合和分离策略来处理不同领域(如不同数据集、不同声码器)的数据,以应对模型在未见过领域上性能下降的问题,但该方法需要设计复杂的模型架构。Wang等[21]提出了利用多尺度排列熵来捕捉音频深度伪造的复杂性,并用于检测性能,该方法可以提高基于传统声学特征检测的能力,但对不同伪造语音类型的普适性需要验证。这些检测方法的性能相比传统机器学习检测方法有了质的飞跃,然而,前端特征提取和后端DNN分类两阶段范式仍然存在瓶颈。提取声学特征本身就是一种有损压缩,可能在提取过程中已经丢失了最关键的微弱伪造痕迹(如相位信息)。后端分类模型的能力上限取决于输入特征的质量,同时,其设计和调优仍然需要大量的专家知识。

2.3 基于端到端的检测技术

前两种检测方法通常需要经过特征提取和分类器训练两个独立步骤实现深度伪造语音检测,而端到端检测技术则将这两个步骤整合为统一模型,具备自动化特征提取能力和对复杂语音数据的强大处理能力,实现了从原始语音数据到检测结果的直接映射。端到端检测技术性能比较如表2所示。
表 2 端到端检测技术性能比较

Table 2 Performance comparison of end-to-end detection technologies

文献方法 核心模型 输入特征 关键创新点 LA攻击场景下
实验结果(EER)
局限性
Tak等[22] RawNet2 原始波形 实现SincNet层优化,在ASVspoof 2019数据集
上表现优异,证明了直接处理波形的潜力
1.12% 模型对新型的伪造语音痕迹
不够敏感
Wang等[23] RawNet2,
SimAM
原始波形 结合了元学习与SimAM注意力机制,证明了
注意力机制在聚焦伪造痕迹上的有效性
0.99% 在复杂度增加的情况下,性能
提升有限
Ito等[24] Wav2Vec2,
HuBERT
原始波形 利用自监督学习预训练模型提取深度特征,展示
了大规模无监督数据学习强大通用表征的潜力
0.44% 预训练和推理均需
大量计算资源
Yuan等[25] MSFA 原始波形 融合了多尺度特征适配与跨层信息,擅长捕获
复杂、多尺度的伪造模式
0.36% 需要消耗大量计算资源和
数据进行训练
2021年,Tak等[22]提出了一种基于RawNet2网络的端到端检测方法,该方法可以直接处理原始波形信号,避免了特征提取带来的信息损失,其结构包含SincNet层(可学习滤波器组)、残差块与全局统计池化,能有效捕捉语音中的细微不一致性,在ASVspoof 2019数据集的LA攻击场景下的EER达到1.12%,表现优异,证明了其直接处理波形的潜力,但对新型的伪造语音痕迹不够敏感。2022年,Wang等[23]提出了一种基于加权和角度边缘损失的二分类联合优化方法,并结合元学习训练框架,开发了一个高效的端到端系统,该系统对各种欺骗攻击具有鲁棒性和泛化能力,在ASVspoof 2019数据集的LA攻击场景下的EER达到0.99%,该方法证明了注意力机制在聚焦伪造痕迹上的有效性,但在增加模型复杂度的情况下,性能提升有限。近年来,Wav2Vec2、HuBERT等自监督学习模型在大规模无标注语音数据上能够提取上下文敏感的高层语义表征,因此也被用于深度语音检测。2023年,Ito等[24]使用Wav2Vec2提取语音深度特征,并输入HuBERT网络学习语音上下文特征,实现了对伪造语音的检测,在ASVspoof 2019数据集的LA攻击场景下取得了显著成效,EER达到0.44%。该方法展示了利用大规模无监督数据学习强大通用表征的潜力,但预训练和推理均需大量计算资源。2025年,Yuan等[25]提出了多尺度特征适配器(Multi-Scale Feature Adapter,MSFA)方法。该方法通过残差卷积块和压缩激励(Squeeze-and-Excitation,SE)机制增强模型对局部特征的感知能力,提升了Transformer网络架构的检测性能,在ASVspoof 2019数据集的LA攻击场景下的EER达到了0.36%,表现出优异的检测性能和泛化能力。该方法擅长捕获复杂、多尺度的伪造模式,但需要消耗大量计算资源和数据进行训练。
此外,Shin等[26]提出了一种Hm-Conformer系统,并结合了分层池化和多层级分类token聚合,旨在提升对音频深度伪造的检测效果。Cuccovillo等[27]提出了一种基于音频Transformer的模型,通过分析共振峰的幅度和相位信息来检测合成语音。Lu等[28]提出了一种结合单类学习和知识蒸馏的方法,以实现更高效和鲁棒的伪造语音检测。Wang等[29]的研究则进一步探讨了大规模声码器伪造数据与自监督学习结合,以期提升检测模型的性能和泛化能力。Ren等[30]提出了一种轻量级的语音欺骗检测方法,它虽然在一定程度上解决了计算资源限制问题,但却牺牲了检测性能。虽然端到端方法的检测性能上限高,能够从数据中发现专家可能忽略的未知伪造模式,但同样存在一些缺陷。首先,端到端模型的可解释性差,很难知道模型是依据什么线索做出判断的。这在需要司法取证等高可靠性场景下是一个重大障碍。其次,直接从波形学习需要大量数据。如果训练数据覆盖的伪造类型有限,模型很可能只是记住了特定声码器或模型的指纹,而没有学习到通用的伪造规律,导致对未知攻击的泛化能力较弱。最后,用大模型处理原始波形并进行训练需要消耗大量计算资源,这给在边缘设备或移动端进行实时检测带来了严峻挑战。

3 伪造语音检测数据集和评价指标

3.1 数据集

深度伪造语音检测技术的发展离不开高质量数据集,这些数据集不仅为模型训练提供了必要的样本,还通过多样化的数据分布模拟了真实世界中的复杂场景。
ASVspoof[31]是目前伪造语音检测领域最权威和使用最广泛的数据集之一,该数据集由自动说话人验证欺骗和对抗挑战赛(Automatic Speaker Verification Spoofing and Countermeasures Challenge)组织发布,旨在为研究人员提供标准化的数据资源以推动伪造语音检测技术的发展。ASVspoof 2019数据集首次明确区分了逻辑访问(Logical Access,LA)和物理访问(Physical Access,PA)两大场景。LA场景模拟攻击者通过数字通信通道(如互联网、API接口)直接向ASV系统提交伪造语音,涵盖了各种语音合成和语音转换的伪造语音,以及使用后期处理(如回声、混响)增强的真实语音。LA场景攻击的特点是直接、可控,伪造手段多样,侧重于评估模型对GAI技术所产生的语音的检测能力,适用于在线服务、语音助手、远程身份认证等场景的检测。PA场景模拟攻击者在物理环境中,通过扬声器播放录制的语音来欺骗部署在现场的说话人验证系统(如门禁、智能音箱)。PA场景攻击的特点是引入了物理信道的特性,如环境噪声、扬声器失真、录音设备差异等,侧重于评估模型对真实世界中可能遇到的环境干扰和设备影响下的伪造语音的检测能力,适用于智能家居、门禁系统等复杂场景检测。
VFD(Vocoder Fingerprints Detection)数据集是第一个探索不同声码器指纹特征的数据集,其基于AISHELL 3构建,使用了8种不同伪造方法生成语音数据,为训练能够区分不同声码器伪影的多分类模型提供了数据基础,该数据集侧重于评估基于声码器特定指纹的检测模型和伪造源识别与分类模型(即能够识别是哪种声码器生成了伪造语音),适用于数字取证等场景检测。
LibriSeVoc数据集也是一个专注于声码器分类,它使用6种常用主流语音合成或语音转换声码器合成了总计146 h的数据,并揭示了不同声码器在音频信号中留下的独特伪影。该数据集提供了大量、多样化且经过精心标注的声码器合成语音,研究人员能够深入分析不同声码器产生的细微声学差异。LibriSeVoc数据集非常适用于精细化声码器的识别和溯源研究,以及训练能够区分各种合成语音细微差别的检测模型,有助于提升模型对已知合成语音类型的检测精度。
这些数据集的特点在于其多样化的数据来源和精细的划分方式,确保了模型评估的公平性和可靠性。

3.2 评价指标

为了全面评估深度伪造语音检测方法的性能,研究者通常采用多种评价指标,包括EER、准确率(Accuracy)、召回率(Recall)等。
EER是评估伪造语音检测系统真假判断能力的关键指标,其定义为在特定阈值下,模型的错误接受率(False Acceptance Rate,FAR)与误拒率(False Rejection Rate,FRR)相等时的错误率。在伪造语音检测任务中,EER反映了模型在区分真实语音与伪造语音时的鲁棒性。较低的EER值表明模型在保持高检测准确率的同时,能够有效减少误判率,从而在实际应用中具备更高的可靠性。因此,EER不仅是衡量检测系统性能的重要标准,也为优化模型参数和提升检测效果提供了重要参考依据。FAR、FRR、EER的计算公式分别如式(1)~式(3)所示:
$ {\mathrm{FAR}}=\frac{伪造语音误分为真实语音个数}{伪造语音总数} $
$ {\mathrm{FRR}}=\frac{真实语音误分为伪造语音个数}{真实语音总数} $
$ {\mathrm{EER}}={\mathrm{FAR}}={\mathrm{FRR}} $
准确率是模型在所有预测结果中正确分类的比例。在伪造语音检测任务中,准确率反映了模型在区分真实语音与伪造语音时的整体表现能力。然而,由于伪造语音检测通常涉及不平衡数据集(即真实语音与伪造语音的数量可能存在显著差异),单纯依赖准确率可能会掩盖模型在少数类别上的表现缺陷。因此,在实际应用中,准确率需要结合其他指标进行综合评估,以确保检测系统的可靠性。其计算公式如式(4)所示,其中$ {\mathrm{TP}} $(True Positive)表示真正例,$ {\mathrm{TN}} $(True Negative)表示真反例,$ {\mathrm{FP}} $(False Positive)表示假正例,$ {\mathrm{FN}} $(False Negative)表示假反例。
$ {\mathrm{Accuracy}}=\frac{{\mathrm{TP}}+{\mathrm{TN}}}{{\mathrm{TP}}+{\mathrm{TN}}+{\mathrm{FP}}+{\mathrm{FN}}} $
当数据集存在类别不平衡问题时,准确率可能无法反映模型的真实性能,此时召回率成为一个更重要的指标。召回率为被正确识别的伪造语音样本数占所有伪造语音样本数的比例。在高安全要求场景下,如司法刑侦或金融支付领域,召回率尤为重要,漏检伪造语音可能导致严重的后果。其计算公式如式(5)所示。
$ {\mathrm{Recall}}=\frac{{\mathrm{TP}}}{{\mathrm{TP}}+{\mathrm{FN}}} $
总体上,EER是学术研究中最核心和最常用的指标,提供了一个单一数值来衡量模型内在的区分能力,便于在统一标准下公平比较不同模型算法的优劣。精确率主要应用在智能客服质检、内容推荐等场景,频繁的误报会严重影响用户体验或业务效率,需要保证检测的精确率。召回率主要应用在金融反欺诈、国家安全、司法取证等领域,漏检的后果十分严重,因此,高召回率是首要关注的指标。这三类指标基本可以满足学术研究和实际应用中各类场景的需求。

4 深度伪造语音检测技术面临的挑战与未来发展方向

4.1 面临的挑战

随着深度学习算法的不断创新与优化,新型的深度伪造语音合成与转换算法层出不穷,这些伪造算法能够更精准地模拟人类语音的细微特征,使得伪造语音在听觉和特征层面与真实语音愈发难以区分,导致检测模型的准确性下降。
此外,深度伪造语音检测模型在泛化能力方面也面临极大挑战,尤其是在面对未知伪造类型数据或跨数据集评估时,其性能往往有明显下降。这一现象的根本原因是现有检测模型通常依赖特定的数据集进行训练,而这些数据集无法全面覆盖真实世界中的多样化伪造语音场景。
在实时应用场景中,深度伪造语音检测技术需要满足高效性和低延迟的要求,这对检测模型的效率提出了严峻挑战。传统的基于深度学习的方法虽然在高精度检测方面表现出色,但其复杂的网络结构和高计算复杂度往往难以满足实时性的需求。

4.2 未来发展方向

多模态融合检测[32]是深度伪造语音检测技术未来发展的重要方向之一。语音并非孤立存在,它通常与视频、文本等其他模态的信息相互关联。通过融合语音、视频和文本等多模态信息进行深度伪造语音检测,能够充分利用不同模态信息之间的互补性,提高检测模型的准确性和鲁棒性。视频可以捕捉说话人的嘴唇运动、面部表情和口型,从而依据这些视觉信息和语音内容的匹配程度,判断语音的真伪。真实人类的情感表达往往是复杂、细微的,并与声音协同。伪造的视频或声音可能在情感表达的自然过渡上存在缺陷,可以通过检测该类缺陷来判断语音真伪。视频中可能包含非语言的声学线索,如环境声音、身体动作发出的声音等,这些可以作为检测的补充。文本信息(如转录的语音内容、对话背景)可以与语音本身的声学特征进行比对,识别出语义上的不一致或常识性错误,通过检测这些错误来识别深度伪造语音。此外,还可以在特定场景下(如专业监听),结合心率、呼吸等生理信号分析其与语音的协同性,从而判断语音真伪。
迁移学习与小样本学习将为深度伪造语音检测技术带来新的突破[33]。迁移学习可以将在一个领域或任务中学习到的知识和经验,迁移到其他相关领域或任务中,从而减少对大规模标注数据的依赖。在深度伪造语音检测中,可以在大规模通用语音数据集上来预训练模型,在少量的深度伪造语音数据上进行微调,然后将其迁移到深度伪造语音检测任务中。例如,使用Wav2Vec2、HuBERT等自监督学习模型在海量无标注语音数据上学习强大的通用语音表示能力,再将这些模型作为特征提取器,在少量伪造语音数据上进行微调(Fine-tuning)或作为元学习(Meta-learning)的基底模型;或者研究能够仅凭少量样本(甚至零样本)就能识别新型伪造语音的技术;也可以研究模型从一个数据域(如现有数据集)迁移到另一个数据域(如新生成的伪造语音)的方法,以提升泛化能力。
模型轻量化是深度伪造语音检测技术在实际应用中的关键需求。随着移动设备和物联网的快速发展,需要在资源受限的设备上实现实时的深度伪造语音检测。模型轻量化技术可以通过优化模型结构、压缩模型参数等方法,减少模型的计算量和存储空间,提高模型的运行效率,满足实时检测的需求。例如,通过模型剪枝移除模型中冗余的连接或神经元,以减小模型规模;将模型参数从浮点数转换为低精度(如8位整数)表示,以减少存储和计算开销;训练一个小型、高效的学生模型,使其模仿一个大型、复杂的教师模型,在减小模型规模的同时,尽可能保留检测性能;使用MobileNet、ShuffleNet等专门为移动端设计的卷积网络,或者更高效的Transformer变种网络训练检测模型。

5 结束语

本文系统梳理了深度伪造语音检测技术的研究进展,从生成技术原理、检测方法、数据集与评价体系等维度进行了全面描述。研究表明,尽管基于传统特征与混合特征的检测方法在特定场景下表现良好,但面对日益逼真的生成语音,其泛化能力与鲁棒性仍显不足。端到端深度检测方法凭借其对复杂原始信号的强大表征能力,展现出更高的检测潜力。未来,需要学术界与工业界共同推进多模态融合、迁移学习等深度伪造语音检测方法,解决新型伪造手段、跨域泛化及实时性检测等方面的问题。
1
Li X L, Yu N H, Zhang X P, et al. Overview of digital media forensics technology[J]. Journal of Image and Graphics, 2021, 26 (6): 1216- 1226.

2
Kalchbrenner N, Elsen E, Simonyan K, et al. Efficient neural audio synthesis[C]//Proceedings of the 35th International Conference on Machine Learning. Stockholm, Sweden: PMLR, 2018: 2410-2419.

3
Tachibana H, Uenoyama K, Aihara S. Efficiently trainable text-to-speech system based on deep convolutional networks with guided attention[C]//Proceedings of the 2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). Calgary, Canada: IEEE, 2018: 4784-4788.

4
Chen H, Garner P N. Diffusion transformer for adaptive text-to-speech[C]//Proceedings of the 12th ISCA Speech Synthesis Workshop (SSW 2023). Martigny, Switzerland: IDIAP Research Institute, 2023.

5
Shen J, Ping W, Yan R, et al. Natural TTS synthesis by conditioning WaveNet on Mel spectrogram predictions[C]//Proceedings of the 2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). Calgary, Canada: IEEE, 2018: 4779-4783.

6
Mohammadi S H, Kain A. Voice conversion using deep neural networks with speaker-independent pre-training[C]//Proceedings of the IEEE Spoken Language Technology Workshop (SLT). 2014: 19-23.

7
Kameoka H, Kaneko T, Tanaka K, et al. StarGAN-VC: Non-parallel many-to-many voice conversion using star generative adversarial networks[C]//Proceedings of the 2018 IEEE Spoken Language Technology Workshop (SLT). Athens, Greece: IEEE, 2018: 266-273.

8
Guo H J, Liu C R, Ishi C T, et al. QuickVC: Any-to-many voice conversion using inverse short-time fourier transform for faster conversion [EB/OL]. (2023-06-30). https://arxiv.org/pdf/2302.08296v4.pdf.

9
Wang X, Yamagishi J, A comparative study on recent neural spoofing countermeasures for synthetic speech detection[C]//Proceedings of Interspeech 2021. Brno, Czech Republic: ISCA, 2021: 2396-2400.

10
Kumar A K, Paul D, Pal M, et al. Speech frame selection for spoofing detection with an application to partially spoofed audio-data[J]. International Journal of Speech Technology, 2021, 24 (1): 193- 203.

DOI

11
Chang C C, Lin C J. LBSVM: A library for support vector machines [J]. ACM Transactions on Intelligent Systems and Technology, 2011, 2 (3): 27.

12
Li M, Zhang X P, et al. A survey on speech deepfake detection[J]. ACM Computing Surveys, 2025, 57 (7)

13
Pham L, Lam P, Tran D, et al. A comprehensive survey with critical analysis for deepfake speech detection[J]. arXiv preprint, arXiv:, 2409, 15180, 2025.

DOI

14
Lei Z C, Yang Y G, Liu C H, et al. Siamese convolutional neural network using Gaussian probability feature for spoofing speech detection[C]//Proceedings of the 21st Interspeech Annual Conference of the International Speech Communication Association. Shanghai, China: ISCA, 2020: 1116-1120.

15
Rostami A M, Homayounpour M M, Nickabadi A. Efficient attention branch network with combined loss function for automatic speaker verification spoof detection[J]. Circuits, Systems, and Signal Processing, 2021, 42 (7): 4252- 4270.

DOI

16
Wang L, Yeoh B, Ng J W. Synthetic voice detection and audio splicing detection using SE-Res2Net-Conformer architecture[C]//Proceedings of the 13th International Symposium on Chinese Spoken Language Processing (ISCSLP). Singapore: IEEE, 2022: 115-119.

17
Li X F, Li K, Zheng Y F, et al. SafeEar: Content privacy-preserving audio deepfake detection[C]//Proceedings of the ACM SIGSAC Conference on Computer and Communications Security (CCS). 2024: arXiv: 2409.09272.

18
盖馨怡, 涂国庆, 刘树波, 等. 基于特征融合的音频伪造检测方法[J]. 计算机应用研究, 2025, 42 (7): 2109- 2115.

DOI

Gai X Y, Tu G Q, Liu S B, et al. Audio forgery detection method based on feature fusion[J]. Application Research of Computers, 2025, 42 (7): 2109- 2115.

DOI

19
Yadav A K S, Bartusiak E R, Bhagtani K, et al. Synthetic speech attribution using self supervised audio spectrogram transformer[J]. Electronic Imaging, 2023, 35, 1- 11.

DOI

20
Xie Y, Cheng H, Wang Y, et al. Domain generalization via aggregation and separation for audio deepfake detection[J]. IEEE Transactions on Information Forensics and Security, 2024, 19, 344- 358.

DOI

21
Wang C, He J, Yi J, et al. Multi-scale permutation entropy for audio deepfake detection[C]//International Conference on Acoustics, Speech, and Signal Processing. IEEE, 2024: 1406-1410.

22
Tak H, Patino J, Todisco M, et al. End-to-end anti-spoofing with RawNet2[C]//Proceedings of the International Conference on Acoustics, Speech and Signal Processing (ICASSP). 2021: 6369-6373.

23
Wang Z Y, Hansen J H L. Audio anti-spoofing using simple attention module and joint optimization based on additive angular margin loss and meta-learning[C]//Proceedings of the 23rd Interspeech Annual Conference of the International Speech Communication Association. Incheon, ISCA, 2022: 376-380.

24
Ito A, Horiguchi S. Spoofing attacker also benefits from self-supervised pretrained model[C]//Proceedings of Interspeech 2023. Dublin, Ireland: ISCA, 2023: 5346-5350.

25
Yuan H Y, Zhang L J, Niu B N, et al. A spoofing speech detection method combining multi-scale features and cross-layer information[J]. Information, 2025, 16 (3): 194.

DOI

26
Shin H, Heo J, Kim J, et al. Hm-conformer: A conformer-based audio deepfake detection system with hierarchical pooling and multi-level classification token aggregation methods[C]//International Conference on Acoustics, Speech, and Signal Processing, IEEE, 2024: 10581-10585.

27
Cuccovillo L, Gerhardt M, Aichroth P. Audio transformer for synthetic speech detection via formant magnitude and phase analysis[C]//International Conference on Acoustics, Speech, and Signal Processing. IEEE, 2024: 4805-4809.

28
Lu J, Zhang Y, Wang W, et al. One-class knowledge distillation for spoofing speech detection[C]//International Conference on Acoustics, Speech, and Signal Processing. IEEE, 2024: 11251-11255.

29
Wang X, Yamagishi J. Can large-scale vocoded spoofed data improve speech spoofing countermeasure with a self-supervised front end[C]//International Conference on Acoustics, Speech, and Signal Processing. IEEE, 2024: 10311-10315.

30
Ren Y, Peng H, Li L, et al. Lightweight voice spoofing detection using improved one-class learning and knowledge distillation[J]. IEEE Transactions on Multimedia, 2023, 26, 4360- 4374.

DOI

31
Lavrentyeva G, Novosyolov S, Tseren A, et al. STC anti-spoofing systems for the ASVspoof2019 challenge[C]//Proceedings of Interspeech, 2019: 1033-103.

32
Deng J, Ren Y, Zhang T, et al. VFD-Net: Vocoder fingerprints detection for fake audio[C]//International Conference on Acoustics, Speech, and Signal Processing. IEEE, 2024: 12151-12155.

33
Zhu Y, Koppisetti S, Tran T, et al. SLIM: Style-linguistics mismatch model for generalized audio deepfake detection[J]. arXiv preprint, arXiv:, 2407, 18517, 2024.

DOI

Outlines

/