Design and implementation of a voice data privacy protection system for real-time communication

  • NIU Ben , 1, 2, * ,
  • KONG Tiantian 1, 2, 3 ,
  • ZHOU Zejun 1, 2, 3 ,
  • LIU Shenglong 4 ,
  • HUANG Xiuli 5 ,
  • JIANG Yiwen 4
Expand
  • 1. Institute of Information Engineering, Chinese Academy of Sciences, Beijing 100085, China
  • 2. Key Laboratory of Cyberspace Security Defense, Beijing 100085, China
  • 3. School of Cyber Security, University of Chinese Academy of Sciences, Beijing 100049, China
  • 4. Big Data Center of State Grid Corporation of China, Beijing 100052, China
  • 5. State Grid Laboratory of Power Cyber-Security Protection and Monitoring Technology, State Grid Smart Grid Research Institute Co., LTD, Nanjing, Jiangsu 210000, China

Online published: 2024-11-16

Copyright

Copyright ©2024 Journal of Aeronautical Materials. All rights reserved.

Abstract

Voice communication has become an indispensable part of daily life, but the privacy data it contains, such as semantic content and voiceprints, faces significant risks of leakage. A real-time voice data privacy protection method for real-time communication, addressing privacy concerns from both semantic content and voiceprint perspectives was proposed. The method utilizes speech recognition technology to perform semantic content desensitization in the text domain. Detecting sensitive information by calculating the similarity between text embedding vectors, on this basis, users can specify sensitive words to achieve personalized privacy protection. Additionally, this approach combines semantic content desensitization algorithms that replace sensitive content with secure words using both semantic similarity and random characters. It employs deep learning-based speech synthesis technology and voice engines to anonymize the voiceprint features of audio data. Experimental results demonstrate that the method allows for the selection of semantic desensitization and voiceprint anonymization based on privacy levels and time constraints. Notably, when the time required to obtain speech recognition results is between 30% to 50% of the original time, this method effectively balances recognition accuracy and time overhead.

Cite this article

NIU Ben , KONG Tiantian , ZHOU Zejun , LIU Shenglong , HUANG Xiuli , JIANG Yiwen . Design and implementation of a voice data privacy protection system for real-time communication[J]. Journal of Cybersecurity, 2024 , 2(3) : 53 -66 . DOI: 10.20172/j.issn.2097-3136.240305

0 引言

随着科学技术的发展和创新,语音通信技术已成为人们生活中不可或缺的一部分,不仅提高了人与机器之间交互的便捷性与效率,也有效拓宽了用户发送与获取数据信息的渠道。然而,随着语音技术的广泛应用,用户的语音数据被大量生成并分发,例如通过社交媒体的语音消息或视频进行交流通信。若服务供应商或第三方未经许可将存储的语音数据滥用,则其中蕴含的语义、声纹等隐私数据将面临严重泄露风险。例如,Facebook[1]在其社交网络平台上收集音频数据,甚至尝试转录这些私人消息的内容;TikTok[2]修改了隐私政策,使从用户上传的视频中收集面部指纹和声纹的做法合法化,甚至声称可以出于商业目的进行数据共享。
语音数据隐私泄露的场景如图1所示,攻击者可以轻松对上传到云端的语音消息通过自动说话人验证方法(Automatic Speaker Verification,ASV)提取声纹,利用合成语音在欺诈电话中假扮受害者[3],而人类的耳朵很难区分高质量的合成语音和自然的人类语音[4]。攻击者可能会盗用个人身份进行非法活动,或利用泄露的声纹特征进行声纹仿冒攻击;还可能通过自动语音识别方法(Automatic Speech Recognition,ASR)将语音数据转录为文本数据,轻松获取语义内容信息。语义内容可能会泄露个人的敏感信息,例如年龄、性别、种族、地理背景、健康或情绪状态、政治倾向和宗教信仰等。这些信息可能被恶意用于社会工程攻击或钓鱼攻击,攻击者会诱导用户泄露更多敏感信息或执行欺诈行为。攻击者也可以通过自动化处理方法推断出私人对话的说话者身份及用户的隐私信息[1-2]
图 1 语音数据的隐私泄露问题

Fig.1 Privacy leakage issues of voice data

语音数据具有声纹特征与语义内容两个维度的隐私信息。声纹特征的匿名化包括信号处理、语音合成以及对抗样本生成等方法,然而信号处理方法语音生成不自然,语音合成方法没有对语义内容进行匿名,对抗样本无法应用于实时语音数据处理。语义内容的脱敏面临如何确定敏感词以及如何将敏感词替换为安全词的问题。
本文结合语音识别技术,将语音数据转换至文本域进行内容脱敏,通过Word2vec[5]计算单词嵌入向量与句子嵌入向量间的相似度推断敏感词信息,配合用户指定敏感词,实现个性化隐私保护。为平衡实时性、数据可用性与隐私性,本文实现了基于语义相似度与随机字符将敏感内容替换为安全词的语义内容脱敏算法。此外,本文基于深度学习声学模型Fastspeech2[6]和声码器HiFiGAN[7]模型的语音合成技术与基于SAPI5.3[8]语音引擎2种方式实现了声纹特征的匿名化处理。本文贡献如下:
(1)针对录音文件,设计基于语义相似度的内容过滤算法实现语义特征的隐私保护;设计基于深度学习的语音合成算法实现声纹特征隐私保护。
(2)针对实时语音输入,为平衡了隐私保护实时性与数据可用性,设计基于字符替换的内容过滤算法进行语义特征的隐私保护;设计基于语音引擎的语音合成算法对声纹特征进行隐私保护。
(3)对于截断时间与识别时间占比的不同,在不同时间取得实时语音识别结果并在语义隐私保护与实时性上进行评估,为平衡脱敏与实时性提供参考。
本文系统地探讨了面向实时通信的语音数据隐私保护系统的设计与实现。第1节总结当前语音隐私保护领域的研究现状及方法;第2节介绍对语音数据和文本数据预处理的相关技术;第3节提出了面向实时通信的语音数据隐私保护方法,并详细介绍了其框架和实现;第4节通过实验验证本文脱敏方法的有效性,分析了不同隐私级别与时间开销之间的平衡,并与现有工作进行对比,体现本文方法的优势;第5节总结本文的研究内容、研究成果及贡献,并提出未来研究的方向。

1 国内外研究现状

匿名化是指抑制语音信号的个人可识别属性,保留其他属性完整的方法。现有的语音匿名化方法主要基于语音信号处理(Voice Signal Processing,VSP)、语音转换(Voice Conversion,VC)、语音合成(Voice Synthesis,VS)以及对抗性学习技术。
语音信号处理技术试图通过直接应用信号处理技术来修改音频中与说话者相关的特征,例如修改共振峰位置、音调、节奏或停顿等方面的语音信号来扭曲声纹[9-10]。语音信号处理范例之一是频率扭曲[11],它基于经过充分研究的声道长度标准化(Vocal Tract Length Normalization,VTLN)技术[11]。据认为,说话者之间声道长度的差异导致了相同语言内容的语音波形的变化。VTLN的最初目的是从话语中规范说话者的个性,提高语音识别的准确性,可以使用扭曲函数重新调整语音频谱图的频率轴来实现,以补偿声道长度的个体差异。基于VSP的语音匿名化方法尽管简单快速,但其通常会降低音频的清晰度和自然度,导致质量大幅下降。
语音转换和合成技术是将一个说话者身份被无缝地转移到另一个说话者的过程,即用另一个说话者的声纹替换音频中原始说话者声纹。对于传统的VC方法,需要利用来自源说话者和目标说话者的并行语音数据来训练模型。Chen等[12]提出了一种基于高斯混合模型(Gaussian Mixture Model,GMM)的语音转换模型。Erro等[13]应用加权频率包裹方法改变语音中的语音。但是这些方法都存在声音过度平滑和不自然的问题,而且很难从不同的说话者收集平行语音数据。Hsu等[14]提出了基于变分自动编码器(Variational Auto-Encoder,VAE)来转换演讲中的人类语音,在不考虑说话人身份的情况下学习独立的语音内容。结果表明,VAE具有更好的转换效率,不需要并行语音数据进行训练。Stargan v2[15]将对抗学习方法应用于基于VAE的语音转换,提高了语音数据质量。AutoVC是一个语音转换模型,Qian等[16]将瓶颈机制引入VAE中,通过设计合理的瓶颈,成功地实现了零拍转换,平衡了说话者解纠和语音转换质量。Han等[17]采用语音合成即通过将语音记录转换为文本并通过文本到语音来消除声纹特征。语音转换与合成方法虽然可以实现声纹匿名并维持音频较高的清晰度,但是同时保留了说话者的讲话内容,无法实现对敏感语义信息进行隐私保护。
与信号处理和语音转换与合成方法不同,对抗性样本示例可以欺骗ASV错误识别说话者。Guo等[18]提出了一种对抗性攻击SpecPatch,可以使即将到来的语音命令静音并损害长语音样本。现有的ASV对抗示例[19]是通过迭代更新构建,是基于优化的方法将对抗性扰动生成问题表述为约束优化问题,并结合对抗样本的置信度和最大失真来平衡对抗声音的强度和可感知性的方法。但是由于公式化的优化问题通常是非确定多项式时间问题(Nondeterministic Polynomial,NP)问题,只能通过迭代更新来逼近解,十分耗时。因此,直接将对抗性示例应用于语音匿名无法实现对实时语音进行匿名化。Xie等[20]提出针对ASV的one-shot对抗样本生成模型的研究FAPG。FAPG训练了一个音频对抗示例生成器和一系列特征映射。每个特征映射为每个目标说话者训练。一个特征映射可以与匿名者连接,以产生一个特定的目标说话者的对抗性例子。然而,FAPG虽然缩短了时间,但其主要侧重于欺骗ASV,而不是保持音频的清晰度和自然度。
对语音匿名化的方法可以选择性地抑制或保留某些属性,并且可以轻松集成到现有系统中。尽管匿名化具有吸引力并且可以解决隐私问题的紧迫性,但从隐私保护的对象而言,现有的语音数据的隐私保护方案主要对用户的声纹特征进行隐私保护,例如, Deng等[21]提出了一种音色保留模型V-Cloak来实现语音匿名化,但其仅对声纹特征进行匿名,但未评估其针对语音合成攻击的防护性能。Qian等[22]提出的Voice-Mask利用语音转换来隐藏说话者的身份,并使用基于DTW的关键字识别敏感词脱敏,但其对声纹特征匿名效果稍差,并且多数工作是基于音频文件,即对非流式输入的语音数据的隐私保护,或对流式语音数据进行单一的声纹特征的保护,且匿名化和针对匿名化的攻击的正式定义仍然缺失。此外,目前没有通用的数据集、协议和指标评估现有的解决方案。

2 数据预处理

数据的预处理可以确保后续处理所得数据的质量和一致性。语音数据预处理有利于后续频域分析和特征提取过程的稳定性和准确性。

2.1 语音数据预处理

语音数据预处理的步骤如图2所示,包含预加重、分帧、加窗。这些步骤共同确保了语音系统的性能、效率和可靠性。预加重操作旨在强调语音信号中的高频部分,减少信号能量随频率降低而减小的影响,提高语音信号的信噪比。在取样之后,使用一个一阶高通滤波器,其传递函数如式(1)所示:
图 2 语音数据预处理步骤

Fig.2 Preprocess of voice data

$ \begin{array}{c}H\left(z\right)=1-\alpha {z}^{-1}\end{array} $
式中,$ \alpha $为预加重系数,$ 0.9 < \alpha < 1.0 $
预加重后的语音信号如式(2)所示:
$ y\left(t\right)=x\left(t\right)-\alpha x\left(t-1\right) $
式中,$ y\left(t\right) $为预加重之后的语音信号;$ x\left(t\right) $为原始输入语音信号;$ x\left(t-1\right) $为上一采样点的原始输入语音信号。
分帧操作将长时语音信号分割成具有短时平稳性的短时帧从而进行处理,保留了信号的时序特性。采用重叠和移动的方式分帧,可以保证帧与帧之间有重叠,有利于后续信号处理的连续性。
加窗操作用于减少分帧后信号在帧边界处的不连续性和频谱泄露现象。加窗将每一帧中的元素替换为语音信号与窗函数对应元素的乘积。常见的加窗函数包括汉明窗、汉宁窗、矩形窗等,它们在时域上对信号进行衰减,使得信号在帧边界处逐渐趋近于零,减少了频谱泄露现象,使能量主要集中在主瓣。矩形窗函数的数学表达式如式(3)所示,其信号在边缘处为0,中心处为1。
$ {w}_{\mathrm{r}\mathrm{e}\mathrm{c}\mathrm{t}}\left(n\right)=1 $
汉明窗的数学表达式如式(4)所示:
$ {w}_{\mathrm{h}\mathrm{a}\mathrm{m}\mathrm{m}}\left(n\right)={a}_{0}-\left(1-{a}_{0}\right)\mathrm{cos}\left(\frac{2\mathrm{\pi }n}{N-1}\right) $
式中,$ N $为帧长,$ {a}_{0} $为影响窗函数的形状的系数,当$ {a}_{0}=0.538 $时,该函数为汉明窗;当$ {a}_{0}=0.5 $时,该函数为汉宁窗。
矩形窗函数主瓣宽度与汉明窗相比较窄且简单,但汉明窗的旁瓣衰减更大。矩形窗函数的旁瓣峰值更高,因此汉明窗函数更加平滑。汉明窗函数可以更好地体现短时语音信号的频率特性,并且频谱泄露较矩形窗函数少,故本文采用汉明窗为窗函数。

2.2 文本数据预处理

文本清洗主要是对原始文本数据进行预处理,去除文本分析中不必要的信息和噪声,净化文本数据,如特殊字符(标点符号、换行符等)、数字、网址链接、HTML标记等,以确保文本数据的干净和一致性,避免无关信息对后续处理步骤造成干扰。
文本预处理模块主要包含:文本正则化(Text Normalization,TN)、分词(Word Segmentation,WS)、和字音转换(Grapheme-to-Phoneme,G2P)等。
语音合成的文本预处理部分在此基础上进行了字音转换的多音字等处理。字音转换是将文字转化为发音信息。例如,“中国”是汉字表示,需要先将其转化为拼音“zhong1 guo2”。对于多音字的处理,使用pypinyin库[23],以帮助后续的声学模型更加准确地获知每个汉字的发音情况。对文本“在一天24小时里我们都应该注意数据安全”各模块的输出结果如表1所示。
表 1 文本预处理模块输出样例

Table 1 Sample output of text preprocessing module

步骤输出
正则化在一天二十四小时里我们都应该注意数据安全
分词在/一天/二十四/小时/里/我们/都/应该/注意/数据安全/
字音转换zai4 yi1 tian1 er4 shi2 si4 xiao3 shi2 li3 wo3 men5 dou1 ying1 gai1 zhu4 yi4 shu4 ju4 an1 quan2

3 语音数据隐私保护系统设计

3.1 系统总流程

系统总流程如图3所示,主要分为语音识别、语义脱敏和声纹匿名3个模块。
图 3 系统设计总流程

Fig.3 Overall process of system design

首先,将处理后的语音数据转换为文本,通过卷积层对语音数据进行特征提取,采用多层长短期记忆层[24](Long Short-Term Memory,LSTM)对特征进行编码,最后使用连接主义时序分类(Connectionist Temporal Classification,CTC)[25]进行解码,实现对实时流式语音输入和非流式音频文件输入的识别工作。识别完成后,为了进行语义特征的隐私保护,需要对语义内容进行脱敏。本文采用skip-gram[26]模型将单词转换为单词嵌入向量,并计算出句子的嵌入向量,通过计算单词与句子间的余弦相似度进行敏感词的推断,并结合指定敏感词实现用户隐私的个性化定制,随机选取相似度较高的安全词进行替换。根据时间开销及隐私保护需求的不同,本文提出了随机替换方法,即将敏感词在字符程度上进行随机替换。随后,经过语义内容过滤的文本数据通过Fastspeech2模型结合HiFiGAN模型转换为自然的语音输出。为了提高语音合成的实时性,本文采用以SAPI5为内核的语音引擎,在保证一定语音质量的条件下提高实时性,并对声纹特征进行匿名化处理,完成语音数据处理全流程。
本方法实现了从语音输入到语音输出的完整处理链路,确保了语音数据的可用性和隐私安全,为用户提供更流畅和可靠的语音交互体验。

3.2 语音识别

语音识别(Automatic Speech Recognition,ASR)是一项从一段音频中提取出语言文字内容的任务。ASR具体流程如图4所示,包含特征提取、编码器和解码器3个模块。特征提取模块从经过预处理后的原始音频提取出由时域转换为频域后的信息;编码器由卷积层和多层循环神经网络构成,对提取后的特征进行编码;解码器采用CTC解码器将编码器输出的概率分布解码为最终文本输出。
图 4 语音识别流程

Fig.4 Process of automatic speech recognition

3.2.1 特征提取

特征提取将原始时域音频信息转为频域信息以用于后续的分析与识别,使用梅尔滤波器组系数(Mel Filter Bank,Fbank)特征[27]来表示语音数据由时域转换到频域后的特征值。
除Fbank特征外,对声纹特征的提取的主流方法还有取梅尔频率倒谱系数(Mel-Frequency Cepstral Coefficients,MFCC)特征[28]。Fbank特征与MFCC特征的提取流程如图5所示。首先加载音频并进行采样率转换,其次将音频信号分段并应用加窗函数,对每一帧信号进行快速傅里叶变换得到频谱信息。设计一组覆盖语音频率范围的梅尔滤波器组,并将每一帧的频谱能量与滤波器组进行卷积操作,得到滤波器组能量。对滤波器组能量取对数得到Fbank特征,并对特征进行均值归一化处理。
图 5 Fbank与MFCC特征提取流程

Fig.5 Fbank and MFCC feature extraction process

在Fbank特征的基础上进行离散余弦变换(Discrete Cosine Transform,DCT),即可得到MFCC特征。由于相邻滤波器组有重叠,Fbank特征是高度相关的。DCT变换的本质是去除各维信号间的相关性,并将信号映射到低维空间中。对比Fbank特征与MFCC特征的提取可以发现,MFCC特征提取方法的计算量更大,且由于DCT变换是线性变换,所以MFCC特征会丢失非线性特征。在GMMs-HMMs方法中,因该方法音素的建模方法对高频相关信号敏感,故采用MFCC特征提取方法;神经网络对高度相关的信号不敏感,所以本文采取计算量小且包含更多非线性特征的Fbank特征提取方法。每一帧生成一个Fbank特征向量,将所有帧的特征向量组成时间序列作为编码器的输入特征。

3.2.2 编码器

编码器对提取后的特征进行编码,如图6所示,主要由卷积子采样层(Convolution Subsampling,CS)、多层循环神经网络(Recurrent Neural Network,RNN)和一个Softmax层组成。
图 6 编码器结构

Fig.6 Structure of encoder

卷积子采样层用于提取局部特征,降低计算量;RNN层采用长短期记忆网络(Long Short Term Memory,LSTM)以获取语音的上下文语义信息;Softmax层将特征映射为一个字表长度的向量,向量中存储了字表中当前每个字的概率。对流式数据使用2层CNN和5层RNN;非流式数据使用2层CNN和3层RNN进行编码。
chunk是指模型在每个步骤中需要的语音长度,当接收的语音达到了一个chunk的长度后,模型将该 chunk的语音提取成特征,送入模型中推理得到结果。一个chunk的最小长度与模型本身结构直接相关,第$ k $层卷积子采样层需要的数据长度$ {L}_{k} $可以由式(5)计算:
$ {L}_{k}=1+\sum _{j=1}^{k}\left[\left({F}_{j}-1\right)\prod _{i=1}^{j-1}{S}_{i}\right] $
式中,$ {F}_{j} $为卷积层滤波器的大小;$ {S}_{i} $为滤波器的跳跃长度(步长)。
图7所示,在该模型中,模型的每个输出步骤对应1步RNN的输出和1步子采样层的输出。对流式数据与非流式数据卷积子采样层均由两层CNN组成,每一层卷积层一次采3个值,步长为2,即$ {F}_{1}={F}_{2}=3 $$ {S}_{1}={S}_{2}=2 $,根据式(5)可得$ {L}_{2}=1+1\times 2+2\times 2=7 $。因此,1步的卷积子采样层输出最终映射到7帧的输入数据,即chunk的最小长度为7帧。
图 7 卷积子采样层图

Fig.7 Convolution subsampling

LSTM能够更好地捕捉和处理序列数据中的长期依赖关系,并在训练过程中有效避免RNN梯度消失或梯度爆炸问题。

3.2.3 解码器

CTC解码器根据编码器输出的概率分布,找到最可能的输出序列,生成最终文本。使用CTC prefix beam search进行解码;当输入结束后,使用 CTC prefix beam search结合重新打分(Rescoring)进行解码。
由于$ t $时刻的输出结果受到$ t-1 $时刻识别结果的影响,即在解码时进行重新打分调整预测概率,决定最终输出。为了降低实时语音数据输入的时间开销,本文在保证一定识别准确度的前提下调整识别与合成间缓冲区的大小,取语音识别的中间结果,后续语义脱敏与声纹匿名,在使用效果上缩短时延。

3.3 语义脱敏

语义脱敏模块旨在进行语义层面的隐私保护,去除语音内容中包含的敏感信息,如图8所示,分为文本预处理、敏感词划分和敏感词过滤3个部分。
图 8 语义脱敏模块

Fig.8 Content filtering module

文本预处理对文本数据进行清洗与规范,便于后续的敏感词划分以及敏感词过滤,详见第3.2节。敏感词划分部分解决“哪些信息被视为敏感信息”的问题,由用户个性化指定敏感词,根据单词与句子嵌入向量间的相关度推测是否为敏感词。敏感词过滤部分解决“如何隐藏敏感信息”的问题,根据用户对时间损耗的需求不同,本节提出了2种敏感词过滤方法。针对实时性需求高或不考虑下游分析任务的情况,对敏感词在文本空间内进行随机字符串替换;针对需保留句子部分语义信息便于下游分析任务且对实时性要求低的情况,提出了一种基于单词嵌入向量间相似度的相似敏感词替换方法。

3.3.1 敏感词划分

为了确定数据中的敏感词,本文提出了相关敏感词划分方法以及指定敏感词划分方法,将全局文本空间$ W $划分为敏感词空间$ {W}_{1} $以及非敏感词空间$ {W}_{2} $。相关敏感词划分方法采用神经语言模型Word2vec的定向跳字模型(Directional Skip-Gram,DSG)[26]进行文本词向量的提取以及单词嵌入向量间相关度的计算,并推断敏感词。指定敏感词划分方法由用户指定敏感词,实现快速及个性化确定敏感词。
DSG模型既可以降低向量的维度,又能考虑到语义内容。在进行敏感词划分前,使用维基百科[29]和百度百科[30]中的数据构建全局文本空间$ W $,对输入文本进行文本清洗、正则化、分词等预处理操作后得到分词后的文本$ T^\prime=\{{t}_{1},{t}_{2},{t}_{3},\cdots ,{t}_{n}\} $;将经过预处理的文本输入DSG模型得到每个单词的词向量$ {\boldsymbol{E}}=\{{e}_{1},{e}_{2},{e}_{3},\cdots ,{e}_{n}\} $,并计算所有单词嵌入的均值,得到句子的嵌入向量。
通过嵌入向量间的距离表征相似度。单词与句子之间的距离越近,该单词对句子的语义影响度越高,则该单词为敏感词的可能性越大。在推断时,设定阈值$ t $,若单词与句子间相似度高于阈值,则推断拥有嵌入向量的单词与句子语义有较高的相关性,若有更大的可能与个人信息相关,则推断为敏感词。如图9所示,在“我是Alice,是一名医生”这句话中,“Alice”与“医生”对整句话语义的表达起到了关键的作用,这两个单词与句子嵌入的相似度较高,距离较近,故被推断为敏感词。
图 9 敏感词推断示例

Fig.9 Example of sensitive word inference

3.3.2 敏感词过滤

为将敏感词替换为非敏感词,提出相似替换与随机替换2种方法。用户可以根据数据后续使用以及对隐私保护程度高低的要求按需选择。
(1)相似替换
通过DSG方法对敏感词空间$ {W}_{1} $中每一个单词$ {w}_{i} $在非敏感词空间$ {W}_{2} $中按照相似度降序排列找到$ n $个非敏感的候选单词列表。相似替换可根据隐私保护需求设置候选单词列表空间$ n $的大小,对于每个非敏感词都以相等的概率$ p=\dfrac{1}{n} $作为最终的替换词输出。由于依据相似度对敏感词进行替换,句子保留了部分语义,便于下游分析任务。
(2)随机替换
若不需要进行下游分析任务,且对语义是否保留无需求,可采用随机替换方法。通过关键词匹配算法检测敏感词,在含有$ N $个元素的字典空间中依概率$ p=\dfrac{1}{N} $选取与敏感单词等长的$ l $个字符元素替换敏感词。该方法降低了时间开销及对语料库的依赖。

3.4 语音合成

语音合成的深度学习技术主要包括如图10所示的3个模块:文本处理、声学模型和声码器。文本处理模块先对输入的文本文件进行分词、清洗等,再对文本内容添加韵律信息,将原始文本转化为语言学特征序列。声学模型根据文本的字符、音素生成对应的声学特征,即语音信号在频域的表示,如线性频谱图、梅尔频谱图、LPC特征等。声码器将声学模型生成的声学特征转换为波形,即将语音信号由频域特征转换为时域波形。
图 10 语音合成流程

Fig.10 Speech synthesis process

本方法根据对语音合成质量与时间开销的不同需求,采用了两种不同的方法:若对语音合成质量要求高,则可以通过训练FastSpeech2声学模型与HiFi-GAN声码器模型进行声纹匿名处理;若需要声纹匿名具有较好的实时性,则采用内核使用微软开发的SAPI5的语音引擎,快速进行声纹特征的保护。

3.4.1 声学模型

本文采用在公开训练集中文标准女声音库CSMSC[31]进行训练的非自回归模型FastSpeech2模型。该模型直接使用真实的Mel频谱作为模型训练的目标,避免了信息损失的同时提高了语音质量的上限,在保证生成质量的前提下显著提升效率。

3.4.2 声码器

声码器将声学特征转换为波形,与声学模型类似,声码器分为自回归模型与非自回归模型,自回归模型效果好但效率低,因此本方法采用非自回归HiFi-GAN模型,该模型在CPU上比自回归的声码器快13.4倍,同样采用了CSMSC训练集。声码器的效果与数据集相关,若待合成音色是男性音色,由于和女性声音特征相差较大,用CSMSC数据集训练的声码器的表现效果不会很好。

4 实验验证

在Windows11操作系统上通过python3.8版本语言使用3.10 GHZ的Intel i5 CPU对隐私保护的有效性及流语音数据的实时性进行实验验证。

4.1 隐私保护的有效性

4.1.1 评估指标

本节采用以下指标进行隐私保护有效性的评估。
(1)欧氏距离:通过特征矩阵之间的欧式距离来度量特征之间的差异度。当两个特征矩阵间欧氏距离越大,声纹特征间的区别越大,匿名性越强。
(2)语音质量的感知评估(Perceptual Evaluation of Speech Quality,PESQ)[32]:PESQ是一种客观、全参考的语音质量评估方法。计算声纹特征匿名后的PESQ得分,范围在−0.5~4.5之间,得分越高语音质量越好,匿名后可用性越强。PESQ算法需要带噪的衰减信号和一个原始的参考信号,能够对客观语音质量评估提供一个平均意见得分(Mean Opinion Score,MOS)的预测值,而且可以映射到MOS刻度范围。MOS得分是在大量听音者对原始声音信号和失真声音信号进行对比测听的基础上,根据如表2所示的评价标准对失真信号进行质量等级划分,它反映听音人员对声音质量的一种主观印象。
表 2 MOS评价标准

Table 2 The standard of MOS

音频级别 MOS值 评价标准
4.0~5.0 很好,听得清楚;延迟小,交流流畅
3.5~4.0 稍差,听得清楚;延迟小,交流欠流畅,有点杂音
3.0~3.5 还可以,听不太清楚;有一定延迟,可以交流
1.5~3.0 勉强,听不太清楚;延迟较大,交流需要重复多遍
0~1.5 极差,听不清楚;延迟大,交流不通畅
(3)Jaccard系数(Jaccard Similarity):使用Jaccard系数评估语义内容脱敏的有效性。Jaccard系数用于比较两个数据集之间的相似程度或重叠程度。其取值范围为0~1。
(4) ASR评估:使用ASR识别脱敏后的语音数据,可评估脱敏后的语音数据可用性。

4.1.2 声纹特征保护有效性

(1)声纹特征匿名性
选取Lwazill Crosslingual Proper Name Corpus(LCPNC)[33]真实语音数据集,包含20位说话者共2 h 5 min的语音数据。20位说话者语音样本的Fbank特征矩阵的欧氏距离两两对比结果如图11所示。欧氏距离越近,则颜色越接近蓝色,反之靠近红色。此外,从图中可以直观看到图上颜色远离深蓝色,靠近红色。在该数据集上计算得出不同说话者声纹特征间欧氏距离均值为3269.909。因此,当两个语音样本间特征矩阵的欧氏距离大于3269.909时,样本间具有差异较大的声纹特征。
图 11 真实说话者特征差异度

Fig.11 Speech synthesis process in real person

语音合成后的输出音色特征与输出前的音色特征欧氏距离对比结果如图12所示,其中左侧柱状条为基于语音引擎的声纹脱敏后与真实样本间的欧氏距离,右侧柱状条为基于深度学习方法脱敏后与LCPNC数据集上真实样本间的欧氏距离,虚线为数据集内部不同说话者间的欧氏距离的均值。图中柱状条均高于虚线,说明声纹特征间有了较大的区别,也说明本文方法在声纹特征保护上有优势。
图 12 合成音频与真实音频样本间的欧氏距离

Fig.12 Speech synthesis process in real person

图13展示了进行声纹特征匿名前后的Fbank频谱图,可直观地看出原始语音的频谱图和匿名后语音的频谱并不相似,即原始语音的声纹经过了扰动。
图 13 原始语音的频谱图与匿名后的语音的频谱图

Fig.13 Speech synthesis process in real person

(2)匿名后可用性将
来自DAPS(Device and Produced Speech)数据集[34]的语音样本作为参考信号,计算出了通过FastSpeech2+HiFiGAN生成的语音数据文件的PESQ得分为3.039分,证明生成的语音数据质量较好。通过ASR,也可正确识别出语内容。

4.1.3 语义内容隐私保护有效性

将基于相似的替换方法的敏感词与替换词列表作为样本空间$ X=\left\{{x}_{1},{x}_{2},{x}_{3},\cdots ,{x}_{n}\right\} $。随机抽取一组样本$ X^\prime=\left\{{x}_{1}^\prime,{x}_{2}^\prime,{x}_{3}^\prime,\cdots ,{x}_{m}^\prime\right\} $,每组样本的大小分别取$ m=\mathrm{10,20},30,\cdots ,100 $,计算每组样本的均值$ \overline{{X}}_{m} $,如式(6)所示。
$ \overline{{X}_{m}}=\frac{1}{m}\sum _{i=1}^{m}{x}_{i}^{\prime} $
本实验中,样本空间的大小$ \left|X\right|=197 $,对随机抽取大小不同的10组样本,相似替换方法的Jaccard系数平均值如图14所示。10组数据的均值为0.30,可以认为脱敏前后单词之间在语义上保证了相似度,在内容上保持了较远的距离。
图 14 相似替换的Jaccard系数

Fig.14 Jaccard coefficient for similar substitution

表3展示了对文本“你好,我的名字是小明,我是一名来自西安电子科技大学的学生,我学习的专业是信息安全,很高兴认识你。”脱敏的示例。
表 3 语义内容脱敏示例

Table 3 Example of semantic content desensitization

脱敏方法 效果展示
敏感词推断 你好,我的名字是小明,我是一名来自西安电子科技大学的学生,我学习的专业是信息安全,很高兴认识你。
相似替换
$ t=0.6 $$ n=20 $
你好,我的名字是小红,我是一名来自北京航天航空大学的学生,我学习的专业是终端安全,很高兴认识你。
随机替换 你好,我的名字是自儿,我是一名用来自各万尔总地至对各的学生,我学习的专业是性线宣传,很高兴认识你。

4.2 流语音数据的实时性

4.2.1 语音识别时间开销与隐私性

对于长度为147个中文字符的文本的语音数据,设置平均识别时长的1/6、1/3、1/2、2/3、5/6的时间间隔作为语音实时识别的中间间隔,识别准确率与原文本比较得出的字符错误率如图15所示,取得语音识别的中间结果的时间越短,识别错误率越高。
图 15 不同截断时间的语音识别错字率

Fig.15 Error rates with different of speech recognition

对平均语音识别时间取不同的间隔时间会影响对流语音数据处理的实时性。对同一文本段在不同语音识别的截断时间占比与敏感词识别率、时间开销提升效率进行分析,分析结果如图16所示。截断时间占比与敏感词识别率、时间开销大致成正相关,与实时性能提升成负相关。
图 16 截断时间占比不同时敏感词正确识别率与时间开销

Fig.16 Correct recognition rate of sensitive words and time overhead with different truncation proportions

截断时间占比越大,对敏感词的捕捉越精确,可以满足较高的语义信息的脱敏需求;截断时间占比越小,敏感词正确识别率越低,但可满足较高的实时性需求。由于语音识别依靠上文语义对识别结果概率进行重新选择,较短的识别时间间隔会导致更高的字符错误率,从而影响敏感词识别及推断过程,最终影响隐私保护效果。实时性的提高会导致声纹匿名和语义脱敏后语音数据隐私性与可用性的降低。由图可知,当截断时间占比在$ \dfrac{1}{2} $~$ \dfrac{1}{3} $时可以较好地平衡时间开销与敏感词识别率,要满足实时性需求,需适当放宽隐私政策条件。

4.2.2 语义脱敏时间开销与可用性

对一段截取150个中文单词的新闻文本进行敏感词推断,得到敏感词空间。在固定敏感词列表中,进行20次随机字符替换与相似单词替换,并对时间开销取平均值,如图17所示。随机替换的时间开销平均为0.44 s,而相似替换的时间开销平均为1.98 s,约为随机替换的4.5倍。
图 17 随机替换与相似替换时间开销

Fig.17 Time cost randomly and similarly replacing

选取不同长度的文本段,利用随机替换和相似替换两种方法对每个文本段规定相同的敏感词空间,并计算它们的时间开销。如图18所示。随着文本段长度的增加,相似替换的时间开销也增加,而随机替换的时间开销几乎不发生改变,且小于相似替换。
图 18 不同文本长度时间开销对比

Fig.18 Time cost of different length text

因此,若不需要进行下游分析任务,对语义是否保留无需求,那么,随机替换方法在实时性上优于相似替换方法,且随机替换方法对待保护文本长度、语料库及分词方法并无限制。

4.3 现有工作对比实验

本节采用以下指标评估匿名有效性和实时性。
(1)失配率(Miss-Match Rate,MMR):ASV无法将匿名音频的声纹与原始说话者的声纹进行匹配的概率,类似于ASV的错误拒绝率(False Rejection Rate,FRR)。
(2) 错误匹配率(Wrong-Match Rate,WMR):匿名音频的声纹与错误说话者的声纹匹配的概率,类似ASV的错误接受率(False Acceptance Rate,FAR)。
(3)等错误率(Equal Error Rate,EER):对应于两个检测错误率相等的阈值,即$ \mathrm{E}\mathrm{E}\mathrm{R}={P}_{\mathrm{w}\mathrm{r}\mathrm{o}\mathrm{n}\mathrm{g}}\left({\theta }_{\mathrm{E}\mathrm{E}\mathrm{R}}\right)= {P}_{\mathrm{m}\mathrm{i}\mathrm{s}\mathrm{s}}\left({\theta }_{\mathrm{E}\mathrm{E}\mathrm{R}}\right) $的阈值点。对于ASV系统而言,EER越低代表FRR和FAR相对平衡阈值越低,系统性能越好;对于语音匿名系统而言,EER越高,隐私性越好,即欺骗ASV系统的能力越强。
(4)实时系数(Real-Time Coefficient,RTC):用于评估语音匿名系统的效率,$ \mathrm{R}\mathrm{T}\mathrm{C}={T}_{\mathrm{c}\mathrm{v}\mathrm{t}}/{T}_{\mathrm{a}\mathrm{u}\mathrm{d}\mathrm{i}\mathrm{o}} $,其中$ {T}_{\mathrm{a}\mathrm{u}\mathrm{d}\mathrm{i}\mathrm{o}} $为原始音频持续时间,$ {T}_{\mathrm{c}\mathrm{v}\mathrm{t}} $为处理匿名音频的时间。
声纹匿名的有效性可以通过欺骗现有的声纹验证系统(Automatic Speaker Verification,ASV)来证明。使用基于ECAPA-TDNN的ASV,其基于DNN深度神经网络,使用SpeechBrain[35]实现,并在VoxCeleb1和VoxCeleb2上进行训练。表4比较了不同语音处理方法的最先进的声纹特征匿名化方法,即NSF[17]、HF-GAN[36]、McAdams[9]、Voice-Mask[22]和VoicePrivacy 2024挑战赛[37]的B5基线。如表4所示,语音处理类型包括SP、VC、VS和VQ 4种方法,N.K.指未知(Not Known),即该匿名化方法作者没有评估其指标方法或提供其代码。将本文方法与现有的5种匿名化方法在LibriSpeech[38]数据集的test-clean子集测试对比如图19(a)所示,MMR最高的平均值为92.4%;最高的平均EER值为44.19%,如图19(b)所示。在最坏的情况下,攻击者采用现有的平均EER为0.80%的ASV,最低的EER仍然比所有其他基线的最高EER值高1.98%。但现有的语音匿名化工作尚未标准化足够匿名化的EER阈值。在相同的计算资源下,在LibriSpeech的test-clean数据集上测试实时系数,如图19(c)所示,从图中可知本文方法效率最高,效率高于目前McAdams方法0.2%。
表 4 匿名有效性和实时性与现有方法对比

Table 4 Comparison of anonymity effectiveness and real-time performance with existing methods

方法 类型 MMR/% EER/% 实时系数
原始语音 N.K. 3.72 N.K.
McAdams[9] SP 46.53 40.19 0.030
NSF[17] VS 88.89 38.09 0.110
HFGAN[36] VS 87.33 42.21 0.104
B5[37] VQ N.K. 34.37 N.K.
Voice-Mask[22] VC 70.15 23.40 0.041
本文方法 VC 92.4 44.19 0.028
图 19 本文方法与现有工作MMR、EER和实时系数对比

Fig.19 Comparison with existing MMR, EER, and real-time coefficients

5 结束语

本文提出了一种面向即时通信的语音数据隐私保护方法,针对录音文件和实时语音输入,从声纹特征和语音特征两个维度予以保护。在保证语音质量的同时,去除了原始语音数据中说话者身份信息和敏感语义信息。
语音数据隐私保护仍有一些问题亟待解决。目前方法在声纹特征保护中未保留原始语音数据的情感信息,且多通过语音识别将语音转换为文本,再在文本域进行处理。未来工作可以进一步提高语音合成的自然度,使语音数据更自然且具备情感表达,以及直接在语音域中进行语义分析、识别敏感信息。
1
KAYLA K. Facebook has been collecting audio data from voice messages[EB/OL]. (2019-08-14)[2024-06-14] https://www.insidehook.com/daily_brief/tech/facebook-has-been-collecting-audio-data-from-voice-messages.

2
MEGAN M. TikTok has started collecting your faceprints and voiceprints. Here’ s what it could do with them[EB/OL]. (2021-06-04)[2024-06-14] https://time.com/6071773/tiktok-faceprints-voiceprints-privacy.

3
WANG Y, GUO H, YAN Q. Ghosttalk: Interactive attack on smartphone voice system through power line[J]. arXiv preprint arXiv:, 2202, 02585, 2022.

4
WENGER E,BRONCKERS M,CIANFARANI C,et al. “Hello,It's Me”:Deep learning-based speech synthesis attacks in the real world[C]//Proceedings of the 2021 ACM SIGSAC Conference on Computer and Communications Security. 2021:235-251.

5
MIKOLOV T, CHEN K, CORRADO G, et al. Efficient estimation of word representations in vector space[J]. ArXiv preprint ArXiv:, 1301, 3781, 2013.

6
REN Y, HU C, TAN X, et al. Fastspeech 2: Fast and high-quality end-to-end text to speech[J]. ArXiv preprint ArXiv:, 2006, 04558, 2020.

7
KONG J, KIM J, BAE J. Hifi-Gan: Generative adversarial networks for efficient and high fidelity speech synthesis[J]. Advances in neural information processing systems, 2020, 33, 17022- 17033.

8
MICROSOFT CORPORATION. Microsoft SpeechAPI(SAPI)5.3[EB/OL]. (2012-04-17)[2024-06-14]. https://learn.microsoft.com/en-us/previous-versions/windows/desktop/ms723627%28v%3Dvs.85%29.

9
PATINO J, TOMASHENKO N, Todisco M, et al. Speaker anonymisation using the McAdams coefficient[J]. ArXiv preprint ArXiv:, 2011, 01130, 2020.

10
AIDYA T,SHERR M. You talk too much:Limiting privacy exposure via voice input[C]//2019 IEEE Security and Privacy Workshops (SPW). IEEE,2019:84-91.

11
SUNDERMANN D,NEY H. VTLN-based voice conversion[C]//Proceedings of the 3rd IEEE International Symposium on Signal Processing and Information Technology (IEEE Cat. No. 03EX795). IEEE,2003:556-559.

12
CHEN Y,CHU M,CHANG E,et al. Voice conversion with smoothed GMM and MAP adaptation[C]//INTERSPEECH. 2003:2413-2416.

13
ERRO D, MORENO A, BONAFONTE A. Voice conversion based on weighted frequency warping[J]. IEEE Transactions on Audio, Speech, and Language Processing, 2009, 18 (5): 922- 931.

14
HSU C C,HWANG H T,WU Y C,et al. Voice conversion from non-parallel corpora using variational auto-encoder[C]//2016 Asia-Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA). IEEE,2016:1-6.

15
CHOI Y,UH Y,YOO J,et al. Stargan v2:Diverse image synthesis for multiple domains[C]//Proceedings of the IEEE/CVF conference on computer vision and pattern recognition,2020:8188-8197.

16
QIAN K,ZHANG Y,CHANG S,et al. Autovc:Zero-shot voice style transfer with only autoencoder loss[C]//International Conference on Machine Learning. PMLR,2019:5210-5219.

17
HAN Y,LI S,CAO Y,et al. Voice-indistinguish ability:Protecting voiceprint in privacy-preserving speech data release[C]//2020 IEEE International Conference on Multimedia and Expo (ICME). IEEE,2020:1-6.

18
GUO H,WANG Y,IVANOV N,et al. Specpatch:Human-in-the-loop adversarial audio spectrogram patch attack on speech recognition[C]//Proceedings of the 2022 ACM SIGSAC Conference on Computer and Communications Security. 2022:1353-1366.

19
CHEN G,CHENB S,FAN L,et al. Who is real bob? Adversarial attacks on speaker recognition systems[C]//2021 IEEE Symposium on Security and Privacy (SP). IEEE,2021:694-711.

20
XIE Y,LI Z,SHI C,et al. Enabling fast and universal audio adversarial attack using generative model[C]//Proceedings of the AAAI Conference on Artificial Intelligence. 2021,35(16):14129-14137.

21
DENG J,TENG F,CHEN Y,et al. {V-Cloak}: Intelligibility-,naturalness- & {Timbre-Preserving} {Real-Time} voice anonymization[C]//32nd USENIX Security Symposium (USENIX Security 23),2023:5181-5198.

22
QIAN J, DU H, HOU J, et al. Speech sanitizer: Speech content desensitization and voice anonymization[J]. IEEE Transactions on Dependable and Secure Computing, 2019, 18 (6): 2631- 2642.

23
MOZILLAZG. pypinyin[EB/OL].(2024-05-15)[2024-06-14] https://pypi.org/project/pypinyin.

24
HOCHREITER S, SCHMIDHUBER J. Long short-term memory[J]. Neural Computation, 1997, 9 (8): 1735- 1780.

DOI

25
GRAVES A,FERNÁNDEZ S,GOMEZ F,et al. Connectionist temporal classification:Labelling unsegmented sequence data with recurrent neural networks[C]//Proceedings of the 23rd International Conference on Machine Learning. 2006:369-376.

26
SONG Y,SHI S,LI J,et al. Directional skip-gram:Explicitly distinguishing left and right context for word embeddings[C]//Proceedings of the 2018 Conference of the North American Chapter of the Association for Computational Linguistics:Human Language Technologies,Volume 2 (Short Papers). 2018:175-180.

27
RICHMOND K. Estimating articulatory parameters from the acoustic speech signal[J]. Annexe Thesis Digitisation Project 2017 Block 11,2002.

28
MUDA L, BEGAM M, ELAMVAZUTHI I. Voice recognition algorithms using mel frequency cepstral coefficient (MFCC) and dynamic time warping (DTW) techniques[J]. arXiv preprint arXiv:, 1003, 4083, 2010.

29
中文维基百科 [EB/OL]. (2024-05-13)[2024-06-14] https://zh.wikipedia.org/

Chinese Wikipedia [EB/OL]. (2024-05-13)[2024-06-14] https://zh.wikipedia.org/

30
百度百科 [EB/OL]. (2024-04-17) [2024-06-14]. https://baike.baidu.com/

Baidu Baike [EB/OL]. (2024-04-17) [2024-06-14]. https://baike.baidu.com/

31
DATA BAKER. 中文标准女声音库 [EB/OL]. https://www.data-baker.com/open_source.html.

DATA BAKER. Chinese Standard Female Voice Library [EB/OL]. https://www.data-baker.com/open_source.html.

32
WANG M, BOEDDEKER C, DANTAS R G, et al. Pesq (perceptual evaluation of speech quality) wrapper for python users[J]. Zenodo, 2022.

WANG M,BOEDDEKER C,DANTAS R G,et al. Pesq (perceptual evaluation of speech quality) wrapper for python users[J]. Zenodo, 2022.

33
DAVEL M,KGAMPE M. Lwazi Ⅱ Cross-lingual proper name corpus[J/OL] [2022]. Meraka Institute,CSIR; North-West University:https://hdl.handle.net/20.500.12185/445.

34
MYSORE G J. DAPS (Device and Produced Speech) Dataset:A dataset of professional production quality speech and corresponding aligned speech recorded on common consumer devices[J/OL]. [2014-05-20]. https://zenodo.org/record/46606709(8):1735-1780.

35
RAVANELLI M, PARCOLLET T, PLANTINGA P, et al. SpeechBrain: A general-purpose speech toolkit[J]. arXiv preprint arXiv:, 2106, 04624, 2021.

36
MIAO X, WANG X, COOPER E, et al. Language-independent speaker anonymization approach using self-supervised pre-trained models[J]. arXiv preprint arXiv:, 2202, 13097, 2022.

37
TOMASHENKO N, MIAO X, CHAMPION P, et al. The VoicePrivacy 2024 Challenge Evaluation Plan[J]. arXiv preprint arXiv:, 2404, 02677, 2024.

38
PANAYOTOV V,CHEN G,POVEY D,et al. Librispeech:An ASR-corpus based on public domain audio books[C]//2015 IEEE International Conference on Acoustics,Speech and Signal Processing(ICASSP). IEEE,2015:5206-5210.

Outlines

/