学术研究

基于非线性超声调制的语音信号抑制方法研究

  • 闫伟浩 ,
  • 王琪 ,
  • 范星宇 , * ,
  • 葛一正 ,
  • 尹鹏
展开
  • 军工保密资格审查认证中心,北京 100089

网络出版日期: 2026-05-13

版权

版权所有©《网络空间安全科学学报》编辑部 2026

Speech signal suppression via nonlinear ultrasonic modulation

  • Yan Weihao ,
  • Wang Qi ,
  • Fan Xingyu , * ,
  • Ge Yizheng ,
  • Yin Peng
Expand
  • Defence Industry Secrecy Examination and Certification Center, Beijing 100089, China

Online published: 2026-05-13

Copyright

Copyright ©2026 Journal of Aeronautical Materials. All rights reserved.

摘要

随着带有微型麦克风的智能设备大量普及,现有的窃听行为日益隐蔽化、便携化,这给个人隐私安全和国家安全带来了严峻挑战。传统的电磁干扰和声学干扰技术存在显著局限性,其屏蔽效果并不令人满意。现有的超声屏蔽技术复杂,成本较高,实际应用较少。为应对上述挑战,本文提出了一种基于超声参量阵的防窃听系统方案。该方案通过发射超声波,对录音设备进行隐蔽干扰的同时,实现了对录音设备的精准屏蔽,且不影响正常通话。此外,引入了声学参量阵的设计理念,增强了超声波的聚焦能力,从而实现了对录音设备的定向干扰。在实验测试中,该防窃听系统展现了良好的屏蔽效果,作用距离远、鲁棒性好,综合其低成本、结构简洁等优势,其有良好的应用前景与推广价值。

关键词: 超声波; 参量阵; 防窃听

本文引用格式

闫伟浩 , 王琪 , 范星宇 , 葛一正 , 尹鹏 . 基于非线性超声调制的语音信号抑制方法研究[J]. 网络空间安全科学学报, 2026 , 4(1) : 13 -22 . DOI: 10.20172/j.issn.2097-3136.251017

Abstract

With the widespread popularity of smart devices with microphones, existing eavesdropping behaviors are becoming increasingly hidden and portable, which poses serious challenges to personal privacy security and national security. Traditional electromagnetic and acoustic interference techniques have significant limitations, and their shielding effectiveness is not satisfactory. In order to solve the above challenges, this paper proposes an anti-eavesdropping system scheme based on ultrasonic parametric array. This scheme emits ultrasonic waves to conceal the recording equipment while achieving accurate shielding of the recording equipment without affecting the normal call. In addition, the design concept of acoustic parametric array is introduced in this study to enhance the focusing ability of ultrasonic waves, so as to achieve directional interference with the recording equipment. In the experimental test, the anti-eavesdropping system shows good shielding effect, long working distance, good robustness. Combined with its low cost and simple structure, the system has good application prospects and promotion value.

0 引言

现代社会中,每个人无论身处何处,都面临着微型麦克风窃听的风险。据相关研究数据揭示,基于手机麦克风的窃听市场规模在2023年约为12亿美元,其将在2032年进一步扩大为约28亿美元[1]。当前,集成了麦克风的微型智能设备(如智能手机、录音笔、智能手表等)能够通过隐秘录音的方式实现窃听,对语音隐私安全构成严重威胁。这类设备的日常应用特性进一步增强了窃听行为的隐蔽性,导致语音窃听事件频发。受害者集中于政府要员、企业高管、科研人员等,可能造成直接的财产损失、机密泄露、声誉损害等风险。鉴于隐蔽窃听方式所带来的巨大风险,国家与社会对防窃听技术的需求日益迫切[2]
当前,主要的反窃听技术大致分为技术检测与主动干扰两大类。技术检测依赖于对录音设备电磁信号的探测以进行排查[3],然而,该方法无法对录音设备产生直接的干扰或屏蔽效果,且存在耗时耗力、隐蔽性不足的问题。
针对录音设备中麦克风组件的主动干扰技术,主要涵盖电磁探测干扰、声学主动干扰以及超声参量阵技术3类。电磁干扰技术通过向环境中释放特定频率的电磁干扰(EMI)辐射,产生干扰电流,扰动导体周围的电压,致使麦克风信号失真、饱和或丢失。然而这种电磁干扰主要影响麦克风电路传输过程中传输电信号的环节,并不影响鼓膜收集空气振动的过程,因此有干扰距离短、干扰效果差的局限性,同时研究表明,电磁噪声注入虽可破坏录音信号,但其宽频干扰特性会无差别影响周边电子设备,在包含其他电子设备的场景中适用性极差[4]。声学干扰技术即直接利用扬声器发送特定频率的噪声,如白噪声、粉红噪声等,这些噪声在频谱上与人声重叠,利用听觉的掩蔽效应覆盖人声,从而使录音功能失效。然而,发送的噪声需达到65 dB以上声音强度才能实现50%的语音识别干扰率,不仅显著超出人耳舒适阈值(55 dB),影响正常的对话,并且过于明显的干扰更容易引起窃听者的警觉,从而采用特定的算法滤除干扰信号[5]。此外,在信噪比差异为26 dB的情况下,该方案在复杂声学环境中的有效性易受到背景噪声的影响[6]。进一步地,上述方法均未能实现定向干扰,这导致干扰范围难以精确控制,在大部分环境中都可能会对非目标区域造成影响。
相较于其他技术,超声参量阵技术凭借其独特的物理特性,已成为一个新兴的研究领域。该技术利用超声波的高频特性(超过20 kHz)与人耳听觉范围的非重叠特性,通过声学非线性效应在录音设备端生成低频干扰噪声,从而在不影响人耳感知的情况下,定向破坏录音信号[7]
超声屏蔽麦克风录音的研究从大体上可以按照干扰信号的形式来划分,即能量干扰与信息干扰。能量干扰指发射的干扰信号为无语音意义的噪声信号,频段集中在超声频段的白噪声或者粉红噪声等。能量干扰最具代表性的工作是伊利诺伊大学开发的Backdoor系统[7],该系统最早使用高功率的超声波作用于录音设备的麦克风,触发其硬件上自带的自动增益控制系统降低增益系数,并利用麦克风的非线性效应,产生低频噪声分量以淹没音频,实现屏蔽效果,从实验结果上来看,能显著削弱正常语音信号的信噪比,在3.5 m范围内都能有效地干扰麦克风的录音。信息干扰是将人耳可听声调制到超声频段上作为干扰信号,超声作为载波将可听声传送到窃听或录音设备内部,通过麦克风的非线性效应注入可听频段,从而混淆或覆盖原始语音内容。相较于能量干扰的方式,信息干扰能够以更低功率实现更强的干扰效果,并显著增强抗还原能力。浙江大学课题组开发的InfoMasker系统[8],该系统在注册阶段采集需要“屏蔽保护”对象的语音样本,提取其语音特征(如频率特性、节奏、声纹轮廓等),然后根据该特征生成一段“假语音”,通过单边带调制与预补偿模块后,将干扰信号经超声波阵列向环境中发射。这项工作引入了“音位级掩蔽”机制,由于采用语义混淆而非简单的能量掩蔽,在信噪比为0的情况下,能够保证多种自动语音识别(ASR)模型的识别准确率在50%以下;并且“假语音”在频率、语速、语音特征上对说话者刻意模仿,常见的降噪处理算法难以区分真实语音与干扰语音,从而给予了该系统在抗降噪性能上极强的鲁棒性。
尽管近年来围绕超声麦克风屏蔽技术的研究取得了显著进展,然而,这些研究在成本上过高而难以应用,例如Backdoor系统中采用的双载波的频率调制(FM)需要由Keysight 33500b可编程信号发生器产生,而一款该产品的售价高达14500[7],信息干扰中的InfoMasker系统,其干扰信号一般具有更复杂的频率结构和语义调制特性,涉及算法层的生成控制与内容同步,带来了比能量干扰更高的成本与功耗和技术门槛,同样也难以大规模推广。除成本外,现有研究对参量阵的实现层面研究较少,并鲜有着眼于如何开发一款便携、集成且高效的超声防窃听系统用于解决实际的窃听问题的研究方向。
因此,针对当前防窃听技术在应用场景和适应性方面的局限性,本文提出了一种基于非线性超声干扰参量阵的防窃听系统。该系统专注于超声参量阵技术的优化与场景适配,通过优化阵列设计以增强超声波的指向性和声压级,结合麦克风的非线性效应实现定向干扰。该系统不仅能够有效干扰窃听设备,还能防止信息被还原。相对于同样是能量干扰的Backdoor与UltraJam系统而言,该方法实现了更强的定向干扰,能够精确聚焦干扰目标。本文方法相较于宽带白噪声的方法以及两者所采用的双载波频率调制与宽频带多频信号方法,系统鲁棒性更强,整体结构更简单,并且低成本的微控制单元(MCU)集成设计与超声波阵列的优化组合,显著降低了硬件成本,凭借模块化设计和软件调控,系统具有更强的可维护性和灵活性[7]。该系统具备以下技术优势。
1)安全性:确保干扰后的录音无法还原出有效信息;
2)鲁棒性:干扰范围广泛,对各种录音设备均能保持一致的屏蔽效果;
3)低成本:利用MCU模块搭建,显著降低了系统总成本;
4)静音性:所发射的频带超出人耳的听觉范围,对人类生活交流无干扰。
本文工作主要创新点在于:
1)提出基于非线性超声的干扰方法,基于非线性超声响应模型及时间掩蔽效应,可实现静音式屏蔽;
2)阵列设计原则:提出换能器尺寸与阵列间距的优化配比方法,平衡指向性与设备体积之间的矛盾;
3)系统集成:结合MCU控制、功率放大和阵列驱动,实现低功耗定向干扰。

1 基于非线性超声的防窃听信号调制方法

智能手机麦克风电路由振膜、放大器、低通滤波器和模数转换器(ADC)组成。当声波作用于振膜时,其机械振动转化为电信号,前置放大器则负责对电信号进行放大,便于后续采样和处理;在采样之前,信号会通过低通滤波器,滤除高于一半采样率的信号,随后由ADC进行采样[9-11]
当超声波信号(频率>20 kHz)作用于麦克风时,放大器的非线性特性导致高频信号被解调成低频噪声。低于低通滤波器截止频率(通常为24 kHz)的低频噪声可被ADC记为有效信号。当该低频噪声正好覆盖正常语音频段时(约20 Hz~4 kHz),利用人耳听觉掩蔽效应可使录音内容无法识别。仅当超声波信号满足特定条件时,才能保证生成的低频噪声顺利通过低通滤波器。以下基于声学参量阵经典模型[12],分析非线性效应下高频信号产生的低频噪声特性。
正常工作频率范围内,麦克风电路可以视为线性系统,即输出信号是输入信号的线性叠加。然而在实际电路中,放大器与振膜具有非线性,该特性会显著影响信号输出。当输入信号超过线性工作范围时,放大器输出${S_{{\mathrm{out}}}}$[12]
$ {S_{{\mathrm{out}}}} = {A_1}S + {A_2}{S^2} + {A_3}{S^3} + \cdots {A_n}{S^n} $
其中,${A_n}$为各阶非线性系数,S为输入声压信号,实际电路中,高阶非线性项的幅值通常随阶数增加呈指数级衰减,同时麦克风前置放大器的负反馈设计,进一步抑制了高阶非线性响应[13],在典型麦克风的工作范围内,三阶非线性项的贡献仅为二阶项的1/10以下,因此三次及以上谐波因过弱可忽略不计,故而二阶非线性项是产生低频噪声的核心机制。
假设输入信号为双频超声:
$ S = \cos (2\pi {f_1}t) + \cos (2\pi {f_2}t) $
二阶项$ {A_2}{S^2} $可以表示为:
$ \begin{aligned} {A_2}{S^2}& = {A_2}[\cos {(2\pi {f_1}t)^2} + \cos {(2\pi {f_2}t)^2} + \\& \quad 2\cos (2\pi {f_1}t)\cos (2\pi {f_2}t) ] \\& {\text{ }} ={A_2}\Bigg[ 1 + \frac{1}{2}\cos (2\pi {f_1}t) + \frac{1}{2}\cos (2\pi {f_2}t) + \\& \quad \cos (2\pi ({f_1} + {f_2})t) + \cos (2\pi ({f_1} - {f_2})t) \Bigg]\end{aligned} $
输出信号随后会通过低通滤波器(其截止频率通常为24 kHz,且$ {f_1} $$ {f_2} $为超声频率),低于24 kHz的频率成分会被保留,特别是$\cos (2\pi ({f_1} - {f_2})t)$这一成分。当$ {f_1} - {f_2} \lt 24\ {\mathrm{kHz}} $时,这一非超声频率可以通过低通滤波器传递,ADC将其记录为普通声信号,该部分噪声会覆盖人耳可听的低频频段[14]。值得注意的是,麦克风的自动增益控制(AGC)机制会进一步放大屏蔽效果。当输入超声功率较高时,AGC通过负反馈降低增益系数,导致语音信号幅值被压缩至量化噪声以下[7],并且非线性效应在不同麦克风硬件中具有普适性,其差频分量的信噪比在主流设备中均高于20 dB。因此,该技术具有足够的鲁棒性[9]
低频噪声对语音的掩蔽效应是实现屏蔽效果的核心依据。人耳对语音的感知受临界频带掩蔽效应支配。根据Zwicker模型[15],听觉系统将频域划分为24个临界频带(Bark尺度),每个频带的掩蔽阈值由噪声能量决定。若噪声在某一临界频带内的能量高于语音信号,则该频带内的语音成分将被完全掩蔽。
时间掩蔽效应显著增强了系统的干扰效能。在应用超声换能器产生连续超声波的场景中,所产生的差频噪声展现出稳定的时间特性,进而降低了听觉系统对语音瞬态成分(如辅音爆破音)的感知灵敏度[16]。以3 kHz差频噪声暴露为例,语音音节边界的检测阈值可增加约8 dB。该现象可归因于听觉神经的适应性反应:持续的噪声使得神经元放电率达到饱和状态,导致短暂的语音脉冲难以触发有效的神经编码[17]。进一步地,中枢掩蔽机制通过大脑皮层抑制性突触可塑性,削弱了对语音特征的长期提取能力[18]。因此,超声屏蔽技术通过频域覆盖、时域干扰与中枢抑制的多维度协同作用,能够高效且隐蔽地实现对录音设备的有效屏蔽。

2 参量阵设计

声波在介质中传播时会受到距离衰减、吸收衰减和衍射衰减的影响[9,19]。当点声源在各项同性均匀介质中时,其表面波振动产生球面波,声波在空气中传播时强度随距离平方衰减[9]。为提升干扰效果,采用声学参量阵技术,通过阵列换能器发射高频超声波,利用自解调效应生成定向差频波。具体而言,在超声参量阵中,当超声换能器发射超声波时,声波会在其传播路径上自我解调,形成差频波,这些差频波沿着声波的传播轴逐渐累积,可等效为一个理论上的线性声源。这个虚拟声源使得差频波在轴向上首先因为叠加效应而声压增强,随后因空气吸收而声压减弱,呈现出一种先增强后减弱的声压变化趋势。此外,声学参量阵的指向性,能够有效减少声音传播过程中的多径干扰,并降低由于传播过程中的波动引起的失真[20]
超声参量阵由超声换能器阵元组成。超声换能器是一种实现电能和声能相互转换的器件,其工作频率处于超声波范围。换能器由电储能元件和机械振动系统组成,当换能器用作发射器时,激励电源输出级送入的电振荡信号会引起换能器中电储能元件中电场或磁场的变化,这种变化通过物理效应对换能器机械振动系统产生推动力,使其进入振动状态,从而推动与换能器机械振动系统相接触的介质发生振动,向介质中辐射声波。
在超声参量阵中,换能器及其阵列参数都会直接影响超声传播的指向性,刻画参量阵的指向性通常采用指向性函数及其对应的方向图。指向性函数的方向图通常包含多个瓣,其中辐射强度最大的瓣称为主瓣,旁瓣则为其他方向的次极大辐射瓣。在主瓣最大辐射方向两侧,当辐射强度降低3 dB时,辐射功率密度降低一半,两点间的夹角定义为波瓣宽度,波瓣宽度越窄,方向性越好,作用距离越远,抗干扰能力越强。通过计算比较,可以分析换能器尺寸、排布方式、阵列间距和阵列个数对超声波传播指向性的影响,为实验设计提供参考[21]
对于单个换能器,如图1(a)所示,其指向性函数可以表示为[22]
图 1 单个探头和探头阵列

Fig.1 Single probe and probe arrays

$ D(\theta ) = \left| {\dfrac{{2{J_1}(k\alpha\sin \theta )}}{{k\alpha\sin \theta }}} \right| = \left| {\dfrac{{2{J_1}\left(\dfrac{{\pi D}}{\lambda }\sin \theta \right)}}{{\dfrac{{\pi D}}{\lambda }\sin \theta }}} \right| $
其中,${J_1}$为一阶贝塞尔函数,$\alpha $是换能器半径,$D$是换能器直径,波数$k = 2\pi /\lambda $
单个换能器发射的噪声压力级和指向性是有限的。在实际应用中,通过形成平面阵列可提高噪声声压级和指向性。换能器平面阵列可将声波集中于圆柱形空间内,实现定向传播。同时在三维空间的各个方向上有效抑制旁瓣。由于阵列中每个换能器元件的直径大于超声波波长λ,因此不能将单个换能器视为点声源。在推导阵列指向性函数时,应考虑换能器直径、阵列间距等因素对超声波传播指向性的影响[22]
常见的阵列分布方式包括均匀方阵、圆阵、弧面阵以及非均匀方阵[23]
均匀方阵是在二维平面上每个阵元按等间距分布,总共M×N阵元的阵列,具有主瓣窄,旁瓣较高的特点,水平与垂直方向对称,易于实现,适合需要矩形覆盖的场景。假设阵元之间横向间距为${d_x}$,纵向间距为${d_y}$,则均匀方阵的指向性函数${D_s}$可表示为[24]
$ {D_s} = \sum\limits_{m = 0}^{M - 1} {\sum\limits_{n = 0}^{N - 1} D } {{{e}}^{jk(m{d_x}\sin \theta \cos \varphi + n{d_y}\sin \theta \sin \varphi )}} $
其中,θ是观测点与z轴的夹角,φ是接收点与x轴的夹角,k为波数,mn分别对应阵元的行数和列数。
圆阵的阵元排列为N个阵元,均匀分布在半径为R的圆周上,其指向性函数$ {D}_{{\mathrm{circle}}} $为:
$ {{D_{{\text{ }}{\mathrm{circle}}}} = \sum\limits_{n = 1}^N D ({\theta _n}) \cdot {{{e}}^{{{j}}kR\sin \theta \cos (\varphi - {\varphi _n})}}} $
其中,${\varphi _n}$表示第n个阵元的方位角,${\theta _n}$表示第n个阵元与z轴的夹角,圆阵的特点在于水平面内360°覆盖,并且主瓣宽、旁瓣低,适合动态目标,然而对于需要高定向性的场景会造成较大功率损耗,且针对超声屏蔽工作场景,难以满足阵元间距小于最高工作频率波长的一半的条件,无法避免栅瓣的出现。
弧面阵列的指向性函数在某种程度上与圆形阵列相似,它利用了曲面的几何结构来实现聚焦,从而在减少能量泄漏的同时,显著提升了非线性声压转换效率。然而,这种设计制造成本较高。非均匀阵列通过采用优化算法来非均匀排列阵元间距,可实现极窄的主瓣宽度以及极低的旁瓣水平。然而,这种性能优化通常依赖于特定的频率和应用场景,因此它的适应性相对较弱[22]
本文在研究和分析了4种不同阵列类型指向性函数之后,进行了相应的仿真工作。由于主瓣宽度决定了阵列的指向性精度和作用距离,主瓣越窄,指向性越精确、作用距离越远,旁瓣电平过高会导致能量泄漏到非目标方向,增加多径干扰风险。因此,优化阵列设计的目标是尽量减小主瓣宽度,同时降低旁瓣电平。对于均匀方阵,设定阵元在XOY平面内按半波长等间隔排列,同时确保法线方向是垂直向上的。至于圆阵,采用的策略是将阵元均匀地分布在圆周上。对于弧面阵,阵元则是沿半圆形弧线分布,其半径与圆阵保持一致。最后,对于非均匀阵,本文采用了切比雪夫分布,并进行了稀疏优化设计,以期获得更优性能。具体参数设置见表1
表 1 参数设置

Table 1 Parameter Configuration

参数 数值/描述
工作频率 f=25kHz
声速 c=343 m/s
波长 λ=c/f≈13.72 mm
换能器半径 a=5 mm
阵元间距(均匀阵) d=λ/2≈6.86 mm
扫描角度范围 俯仰角θ∈[−90°, 90°],方位角固定为ϕ=0
阵元数 均匀方阵:3×3=9;其余阵列:N=9
4种阵列的指向性对比如图2所示。均匀方阵的主瓣宽度约40°,对称性良好,具有优秀的指向性,旁瓣抑制效果强,在功率相同的条件下,作用距离更远,抗干扰能力更强,可良好地适配中小型会议室到开放式办公区的场景,且可通过增加阵元数进一步压缩主瓣宽度,制造简单,等间距排布大幅降低加工与校准难度,易于实现。相比之下,圆阵与弧面阵能量分散,难以满足定向屏蔽需求,会显著提高功放成本,非均匀阵尽管指向性良好,但旁瓣抑制效果一般,且需要复杂的阵元优化和严苛的制造公差,因此,选择均匀方阵可以很好地满足该超声屏蔽系统对于指向性需求。
图 2 4种阵列指向性仿真结果

Fig.2 Simulation results of 4 types of array directivity

针对均匀方阵阵元个数,选择频率为25 kHz的超声信号,换能器阵列为3×3,其方向性函数如图3所示,与2×2的组合相比,其汇聚性得到增强,且可有效抑制旁瓣的产生。但在实际应用中,考虑到换能器尺寸和设备尺寸的限制,由换能器组成的阵列不宜过大。
图 3 超声探头阵列方向性函数

Fig.3 Directivity function of ultrasonic transducer array

现有的研究指出,当语音信号与背景噪声的信噪比小于15 dB时,频率失真干扰技术可有效保障单个传声器采集语音信息的隐私性。通常情况下,人正常讲话产生的最高语音声压级约为75 dB。为确保信噪比降至15 dB以下,需保证相应的背景噪声声压级高于90 dB。通过公式(7),可精确计算出在干扰区域内任意一点的声压值。
$ \begin{aligned} p =& M \times N \times p_a^{j(wt - kr)}D(\theta ) \\ = & M \times N \times \dfrac{{{\rho _0}{c_0}kr_0^2{u_a}}}{{r\sqrt {1 + {{(k{r_0})}^2}} }}{e^{j(wt - kr)}}D(\theta )\end{aligned} $
以及
$ \left\{ \begin{aligned} & {W = \frac{1}{2}{R_r}u_a^2} \\ & {{R_r} = \frac{{{\rho _0}{c_0}{k^2}r_0^2S_0^2}}{{1 + {k^2}r_0^2}}} \end{aligned} \right. $
其中,超声噪声的频率为f,输入功率为W$ {\mathrm{\rho }}_{0}= 1.293\ \mathrm{k}\mathrm{g}/{\mathrm{m}}^{3} $$ {{c}}_{0}=331.6\ \mathrm{m}/\mathrm{s} $$ {w}=2\mathrm{\pi }{f} $$ {k}=\dfrac{{w}}{{{c}}_{0}} $${u_a}$为速度振幅,${S_0}$ 为声源表面积。
声压级的计算公式为:
$ {L_p} = 20\lg (p/{p_0}) $
其中,${p_0} = 2 \times {10^{ - 5}}$ Pa。
在本文中,参数M设定为3,N设定为1,W设定为1,f设定为20000 Hz,声源尺寸则依据实际应用中的超声波发射阵列的物理尺寸进行计算。通过此方法,可评估在不同距离和不同角度条件下,超声参量阵所产生的声压级。声压级随距离增加而递减,从而导致干扰效应的减弱。
综上,参量阵设计要点可总结为:
1)单个换能器的指向性由贝塞尔函数描述,通过平面阵列的声波叠加效应增强主瓣声压级,抑制旁瓣;
2)结合换能器尺寸、阵列间距和输入功率,优化声压级空间分布,并通过实验测定。

3 实验验证

3.1 实验系统搭建

本文构建的系统利用参量阵技术向移动通信设备发射超声波信号,借助手机内置麦克风的非线性响应特性,生成低频干扰噪声,以此干扰并屏蔽真实语音,达到防止语音信息被录音设备非法录制的目的。实验系统架构如图4所示。
图 4 实验系统架构

Fig.4 Experimental system architecture

通过以下实验方案,测试不同距离下参量阵对手机的录音屏蔽效果。在低背景噪声的室内环境中,本文基于STM32F103微控制器单元、LM1875功率放大器以及3×3超声波均匀方阵构建信号发射端。超声波换能器选用TCT40-16T压电型超声换能器,中心频率为40 kHz,带宽为2 kHz,发射声压为120 dB,指向性图主瓣宽度为60°,体积小、重量轻,适合作为便携式系统的发射阵列。鉴于白噪声对普通信号的广泛覆盖特性[25],本文采用MCU生成低频白噪声调制的超声波信号。该信号经过功率放大器放大后,传递至超声波阵列进行定向发射,以实现对移动设备的定向干扰。在实验过程中,确保超声波参量阵列与音频播放器相对位置保持不变,且音频播放器输出端直接对准手机录音端口,输出75 dB声压级的清晰语音信号。实验选取iPhone12、华为P40、vivo X50、 OPPO Find X2、小米 Mi 10五款手机作为测试设备,通过调整干扰距离(15~100 cm),记录并分析手机录音的时域波形与频谱特性。实验系统架构如图5所示。
图 5 实验系统架构

Fig.5 Experimental system architecture

3.2 实验结果

本文实验分别在15 cm、30 cm、50 cm和100 cm的距离下对iPhone12麦克风进行测试,结果如表2所示。噪声声压级随着距离的增加而衰减,在100 cm时超声屏蔽失效。对其余四款安卓手机测试发现,有效干扰距离均保持在50 cm以上,由于超声屏蔽方法利用目标麦克风本身的非线性效应,可验证该系统对不同干扰设备有很好的鲁棒性。
表 2 超声屏蔽实验结果

Table 2 Experimental results of ultrasonic shielding

距离/cm 噪声/dB 干扰情况
15 81 成功
30 77 成功
50 71 成功
100 62 失败
对比系统开启关闭干扰信号时终端接收信号特性。以距离15 cm为例,关闭干扰时,其信号如图6所示,开启干扰后,其信号如图7所示。
图 6 关闭干扰的接收信号

Fig.6 Received signal without interference

图 7 开启干扰后的接收信号

Fig.7 Received signal spectrum with interference

通过对比图6图7,可以观察到:在无干扰条件下,手机录制的语音信号振幅相对较小,均低于0.5。频域分析显示,正常对话环境下人类语音的频率主要分布在2 000 Hz以下。在干扰条件下,音频播放器播放相同语音内容。分析结果显示,干扰后手机录制的语音振幅有所提升,峰值可达0.8。频域分析进一步揭示,在干扰环境下录制的音频频谱呈现多个峰值,这些峰值从低频至高频逐渐递减,并且主要集中在10000 Hz以下的频段。在2000 Hz以下的人类语音频段,未发现显著的语音频率分量。
此外,设计静音性测试与语音可懂性测试。首先在模拟日常噪声的环境中,开启超声屏蔽设备,记录15名志愿者是否能察觉工作中的屏蔽设备,结果为0人,表明该系统有很好的静音性。然后,设计5条不同中英文语句,在有效干扰的距离内加入3种噪声信号干扰,邀请15名志愿者在安静环境中聆听经过干扰后的语句,记录是否正确识别,定义防窃听指数(AEI):
$ {\mathrm{AEI}} = 1 - M/N $
其中,M为正确识别人数,N为志愿者总人数,统计5条语句的正确识别率,5条语句设置如表3所示,AEI结果如表4所示。平均AEI为94.67%,接近同样采用白噪声干扰的UltraJam系统与“Black Hole of Sound”系统。
表 3 音频内容

Table 3 Audio content

序号 语音内容
1 We are the champions
2 Hey,siri
3 Don’t look back in anger
4 情人总分分合合
5 你说家是惟一的城堡
表 4 AEI结果

Table 4 AEI results

序号 AEI
1 100%
2 93.33%
3 86.67%
4 93.33%
5 100%
为进一步验证屏蔽效果的可靠性,本文使用VoiceFixer通用语音修复工具以验证超声屏蔽的效果。VoiceFixer的核心是基于神经声码器的端到端模型,其中,分析模块负责从输入的退化语音中提取特征,合成模块基于提取的特征重建高质量语音,整个工作流程为输入受损波形 → STFT变换→ ResNet卷积神经网络 → Mel滤波器组 → TF-GAN/HiFi-GAN声码器网络,最后输出44.1 kHz的高保真波形。在验证实验中,选用一段6 s左右经过本方法超声屏蔽的原音频,通过PyCharm平台以及VoiceFixer库,对加载噪声屏蔽的音频original进行分析与合成,得到恢复后的音频original1,计算original1与原音频target时域平均绝对误差(MAE),得到值为0.1314052。该数值越小,表明两音频越接近,接近0时几乎一致,恢复效果显著。当MAE≥0.05时,两音频差异明显,存在严重失真。实验中MAE值远大于0.05,表明本文屏蔽方法抗语音恢复能力强,验证了系统满足既定的安全性要求。图8给出原音频与修复后音频的波形对比。
图 8 原音频与修复后音频波形对比

Fig.8 Waveform comparison between original audio and repaired audio

基于上述实验结果,可以得出以下结论:
1)在距离15 cm处,干扰噪声的声压级达到81 dB(信噪比<−15 dB),导致录音信号被完全覆盖;
2)干扰效果随着距离的增加而逐渐衰减,当距离在50 cm以内时,屏蔽效果可以得到保障,而超过100 cm时屏蔽效果失效,且屏蔽效果可以通过提高功率大幅改善;
3)在人耳可懂性测试中,平均AEI达到了94.67%,接近相似能量干扰系统,难以被人耳感知;
4)对干扰后音频应用VoiceFixer降噪处理,结果表明语音内容无法被识别,与InfoMasker系统在VoiceFixer模型下识别准确率低于50%相比,本系统安全性表现更优。

4 结束语

窃听行为长期以来一直是威胁个人语音隐私安全的一个严重问题。近年来,随着便携式录音设备日趋小型化,该问题变得更加严峻。为应对这一挑战,本文提出了一种新型语音隐私保护系统。该系统基于非线性超声干扰参量阵原理构建,其核心是将定向干扰技术与麦克风非线性效应相结合,实现对语音隐私的有效保护。实验验证结果表明,该系统在距离15~50 cm内,可有效阻断多款手机的录音功能,即便录音被干扰,音频内容也难以通过先进降噪技术恢复。展望未来,笔者深入探索多场景下的自适应干扰算法,并优化对低功耗阵列设计,以期进一步提升隐私保护效果。
1
Sharma R. Phone line tapping market[R]. Dataintelo, 2024.

2
俞杰, 陈美华. 语言生物信息安全视域下语音数据的跨境流动治理 [J]. 网络安全技术与应用, 2023(6): 63-66.

Yu J, Chen M H. Governance of cross-border flow of voice data from the perspective of language and bioinformation security[J]. Network Security Technology & Application , 2023, 19(4): 907-921.

3
Chen Y, Ji X, Lu T. On detecting hidden wireless cameras: a traffic pattern-based approach[J]. IEEE Transactions on Mobile Computing, 2020, 19 (4): 907- 921.

DOI

4
吴燕静. 基于电磁干扰麦克风的防窃听技术研究[D]. 杭州: 浙江大学, 2016.

Wu Y J. Research on anti-eavesdropping technology based on electromagnetic interference microphone[D]. Hangzhou: Zhejiang University, 2016.

5
Tung Y, Shin K G. Exploiting sound masking for audio privacy in smartphones[C]//Proceedings of the 2019 ACM Asia Conference on Computer and Communications Security, ASIA-CCS, 2019. 435-446.

6
Sun K, Chen C. Alexa, stop spying on me: speech privacy protection against voice assistants[C]//Proceedings of the 18th Conference on Embedded Networked Sensor Systems, Association for Computing Machinery, 2020. 579-491.

7
Roy N, Hassanieh H, Choudhury R R. BackDoor: making microphones hear inaudible sounds[C]//Proceedings of the 15th Annual International Conference on Mobile Systems, Applications, and Services, Association for Computing Machinery, 2017. 1-14.

8
Huang P, Wei Y, Cheng P. Phoneme-based proactive anti-eavesdropping with controlled recording privilege[J]. IEEE Transactions on Dependable and Secure Computing, 2023 (3): 1924- 1940.

9
Han Z, Ma J, Xu C, ET. al. UltraJam: ultrasonic adaptive jammer based on nonlinearity effect of microphone circuits[J]. High-Confidence Computing, 2023 (3): 120- 129.

10
Chen Y, Li H, Teng S, et. al. Wearable microphone jamming[C]//Proceedings of the 2020 CHI Conference on Human Factors in Computing Systems, ACM, 2020. 1-13.

11
程健豪, 周满, 吴逸豪. 基于选择性超声波干扰的语音助手隐私保护系统[J]. 武汉大学学报(理学版), 2023, 69 (5): 553- 564.

Cheng J H, Zhou M, Wu Y H. A privacy protection system for voice assistants based on selective ultrasonic interference[J]. Wuhan Univ. (Nat. Sci. Ed. ), 2023, 69 (5): 553- 564.

12
Zhang G, Yan C, Ji X, et al. Dolphinattack: inaudible voice commands[C]//Proceedings of the 2017 ACM SIGSAC Conference on Computer and Communications Security. 2017: 103-117.

13
Ma X, Song Y, Wang Z, et al. You can hear but you cannot record: privacy protection by jamming audio recording[C]//IEEE International Conference on Communications. IEEE, 2021: 1-6.

14
Shen H, Zhang W, Fang H, ET. al. JamSys: coverage optimization of a microphone jamming system based on ultrasounds[J]. IEEE Access, 2019, 7, 83- 96.

15
Li L, Liu M, Yao Y, et al. Patronus: preventing unauthorized speech recordings with support for selective unscrambling[C]//Proceedings of the 18th Conference on Embedded Networked Sensor Systems. 2020: 245-257.

16
Fastl H, Zwicker E. Psychoacoustics-facts and models[M]. 3. Springer Berlin, Heidelberg, 2007.

17
Oxenham A J. Pitch perception and auditory stream segregation: implications for hearing loss and cochlear implants[J]. The Journal of the Acoustics Society of America, 2008, 12 (4): 16- 31.

18
Lentz J, Leek M R. Adaptive procedures in psychophysical research[J]. Attention, Perception, & Psychophysics, 2001, 63: 1279-1292.

19
Rhebergen K S, Versfeld N J. A speech intelligibility index-based approach to predict the speech reception threshold for sentences in fluctuating noise for normal-hearing listeners[J]. The Journal of the Acoustics Society of America, 2005, 117 (1): 2181- 2192.

20
Bass H E, Sutherland L C, Zuckerwar A J, et al. Atmospheric absorption of sound: further developments[J]. The Journal of the Acoustics Society of America, 1995, 1(1): 680-683.

21
宋宇波, 马小松, 陶祎航. 基于声学参量阵理论的超声波防录音屏蔽研究与实现[J]. 北京理工大学学报, 2020, 40 (12): 1282- 1288.

Song Y B, Ma X S, Tao W H. Ultrasonic anti-recording shielding scheme based on acoustic parametric array[J]. Journal of Beijing Institute of Technology, 2020, 40 (12): 1282- 1288.

22
贵海军. 基于信号注入干扰的防窃听方法和系统设计[D]. 杭州: 浙江大学, 2023.

Gui H J. Anti-eavesdropping method and system design based on signal injection interference [D]. Hangzhou: Zhejiang University, 2023.

23
张小飞. 阵列信号处理与MATLAB实现[M]. 北京: 电子工业出版社, 2015.

Zhang X F. Array signal processing and MATLAB implementation[M]. Beijing: Publishing House of Electronics Industry, 2015.

24
Bennett M B, Blackstock D T. Parametric array in air[J]. The Journal of the Acoustical Society of America, 1975, 57 (3): 562- 568.

DOI

25
陈敏. 声频定向系统理论与关键技术研究[D]. 成都: 电子科技大学, 2008.

Chen M. Research on the theory and key technologies of acoustic frequency orientation system[D]. Chengdu: University of Electronic Science and Technology of China, 2008.

文章导航

/