技术应用

基于声场方向性的用户语音认证与活体检测

  • 韩飞宇 1 ,
  • 杨盘隆 , 1, * ,
  • 梁文宁 2 ,
  • 何昕 1 ,
  • 王金伟 1
展开
  • 1. 南京信息工程大学计算机学院 网络空间安全学院,南京 210044
  • 2. 中国航天科技集团有限公司

网络出版日期: 2025-01-25

基金资助

国家自然科学基金青年科学基金(62402229);国家自然科学基金(W2442030)

版权

版权所有©《网络空间安全科学学报》编辑部 2024

Sound field-based voice authentication and liveness detection

  • HAN Feiyu 1 ,
  • YANG Panlong , 1, * ,
  • LIANG Wenning 2 ,
  • HE Xin 1 ,
  • WANG Jinwei 1
Expand
  • 1. School of Computer Science, School of Cyber Science and Engineering, Nanjing University of Information Science and Technology, Nanjing, 210044, China
  • 2. China Aerospace Science and Technology Corporation

Online published: 2025-01-25

Copyright

Copyright ©2024 Journal of Aeronautical Materials. All rights reserved.

摘要

随着语音身份认证机制在智能设备上的普及,语音身份认证机制的安全性引起了人们的重视。常规的语音身份认证机制主要依赖智能设备上麦克风传感器采集用户的语音信号,从而提取用户独特的声纹信息用于个体身份合法性认证。由于麦克风传感器只能采集语音信号在时域和频域维度的信息,加之麦克风传感器固有的非线性硬件漏洞,使得基于麦克风的语音认证机制极易受到外部的声学攻击,安全风险较高。为了提高智能设备上语音身份认证机制的安全等级,提出了一种基于加速度计的新型语音身份认证机制——AccLive,利用广泛装备在智能设备中的加速度计传感器感知用户发音过程所引起的空气振动,并提取多级特征表征用户独特的身份信息。此外,分析并模拟了活体声源和虚假声源的声场差异,提取了一种新颖的声场级活体特征以有效检测重放攻击。在现实世界中采集了35名人类参与者的真实声音数据以及使用9种扬声器实施外部声音攻击,经过验证,所设计的机制可以准确识别用户身份并对声源的活体性进行有效区分。

本文引用格式

韩飞宇 , 杨盘隆 , 梁文宁 , 何昕 , 王金伟 . 基于声场方向性的用户语音认证与活体检测[J]. 网络空间安全科学学报, 2024 , 2(5) : 99 -108 . DOI: 10.20172/j.issn.2097-3136.240509

Abstract

With the wide deployment of voice-based user authentication on smart devices, the security concerns of voice-based user authentication schemes have been raised. Conventional voice-based user authentication schemes mainly rely on microphones to capture the sound vibrations for the user’s identity verification. Since microphones only capture time-domain and frequency-domain information of signals, as well as non-linear characteristics of microphones, microphone-based voice authentication schemes are vulnerable to various acoustic attacks. To improve the security level of voice authentication schemes, a novel accelerometer-based voice authentication was designed, named AccLive, which leveraged a widely ubiquitous accelerometer to capture air vibrations caused by sound production. To represent the unique user’s identity, multi-level features were extracted from low-sampling signals. Based on the sound field’s differences between liveness and non-liveness sound sources, field-level features were derived for liveness detection. Through extensive experiments with 35 human participants and 9 loudspeakers, our mechanism has been validated to be able to accurately recognize the user’s identity and effectively detect the liveness of the sound source.

0 引言

作为最自然的人机交互方式之一,语音输入为智能设备上的用户身份认证提供了一种有效且普遍的方式[1]。现有语音身份认证机制大多是利用麦克风传感器采集用户的语音信号,并从中提取独特的声纹信息作为用户身份的唯一标识。然而,麦克风传感器只能捕捉语音信号中的时域和频域信息,这些时域和频域信息极易被外部攻击者窃取或者伪造[2-4],加之麦克风传感器固有的非线性硬件漏洞,使得其极易遭受超声攻击[5]。因此,现有的基于麦克风的用户语音身份认证机制的安全等级亟待提高。
针对于现有语音认证机制安全性低的问题,学者们开展了广泛研究,本文将这些研究分为以下几类。(1)基于麦克风(阵列):通过用户在说话过程中产生的独有特性,如爆破音[6-7]以及累计功率分布模式[8]等,来提高语音认证的安全性。此外,随着麦克风阵列的普及,诸多工作通过研究高分辨率的空间信息[9]来实现安全可靠的语音身份认证。然而,这些工作极易受到环境噪声的影响,导致认证性能在含噪环境中不稳定。(2)基于无线信号:一些研究工作借助其他无线模态,如毫米波[10]、WiFi信号[11]、超声波信号[12-13]等,来感知用户在说话过程中独有的姿态,如嘴唇移动、喉咙振动等。上述解决方案仅适用于某些特定设备,如具有多个麦克风或无线收发器的设备,这使得安全可靠的语音身份认证机制无法兼容于大部分智能设备。即便是对于麦克风传感器,一些智能设备出于对功耗的考量,也不配备高采样的麦克风传感器,如Fitbit Charge 4、小米手环6以及Garmin Enduro等。加速度计作为一种极其普适的传感器,凭借其低功耗、小尺寸等优点,被嵌入绝大多数智能设备中。众所周知,声波是以振动的形式在空气中传播,空气分子在声波的作用下向声波传播的方向运动。先前的工作[14-16]验证了加速度计可以感知这类微小的声音振动,并应用于基础的单词识别。同时,加速度计的近场声音响应、频率选择性等独特的特点,为其在智能设备上实现安全、鲁棒且普适的语音用户身份认证提供了机会。
基于此,本文设计了基于加速度计的用户语音认证机制——AccLive,它利用加速度计来检测用户在说话时所引起的周围空气的加速度变化,从采集到的加速度计信号中提取与用户身份相关的身份标识和活体标识,以实现(1)说话人的身份认证,即是否是合法用户;(2)语音输入的活体性检测,即发声源是否是活体。
作为非常规的声音传感器,将加速度计应用于用户语音认证领域仍存在诸多技术挑战:(1)加速度计所采集的声音振动信号具有极低的信噪比。声音在空气中传播时,空气分子仅产生微小的位移和加速度,加之加速度计本身的硬件噪声以及环境噪声,导致加速度计捕捉到的声音振动信号具有极低的信噪比。(2)加速度计采样频率受限,导致其采集的振动信号出现频率混叠。人类的语音信号频率大致分布在0~8 000 Hz范围,而现有智能设备中的加速度计最高采样频率仅能支持到1 000 Hz,这使得加速度计无法对语音信号进行准确采样和恢复,原语音信号中的高频部分在加速度计信号中出现频率混叠现象,使得不同用户之间的发声差异更为模糊。(3)外部攻击者经常利用电子扬声器来产生外部声学攻击(重放攻击),以欺骗语音认证系统,从而实现未经授权的访问或控制。人类(活体)发出的声音和扬声器(非活体)产生的声音在被加速度计捕获后,他们之间的固有差异在欠采样的加速度计信号中尚未被研究。因此,在加速度计信号中区分人类活体声源和扬声器虚假声源也是一个巨大挑战。
为了应对上述挑战,本文首先根据加速度计对声音信号独特的响应特性设计了一系列去噪方法,以有效提高振动信号的信噪比,并设计一种轻量级浊音事件检测方法,以分割包含更多生物身份信息的浊音事件。其次,为了提高生物身份信息在欠采样信号中的分辨率,本文融合了多级(即声源和声道)特征,以扩大用户之间的差异。最后,为了探索活体声源和扬声器声源之间声场的内在差异,本文建立了声音传播模型和三维声场模型。基于此,本文构建了一个声场级活体特征,称为声场方向性模式,以表示声场的独特空间信息,用于声源的活体检测。
本文在真实世界中通过实验来验证所设计机制的有效性和鲁棒性。结果表明,AccLive在15 名人类参与者的规模上,可以实现92.85%的平均认证准确率;在9种类型的扬声器规模上,可以实现1.91%的平均等误率。与最先进的活体检测方法Void[8]相比,本文机制在不同噪声水平下均表现出更佳的活体检测性能。给定5 000 ms的输入片段,本文机制可以在不同噪声水平下实现97.67%的平均欺骗检测准确率和1.86%的平均等误率。
本文主要考虑以下攻击者模型。(1)语音重放攻击:为了实现语音重放攻击,攻击者窃取目标用户的设备,并利用扬声器重放受害者的语音,以欺骗身份验证系统。受害者的语音主要以两种方式泄露。1)攻击者使用靠近受害者的录音设备收集受害者的话语;2)攻击者从公共社交网站收集受害者的语音数据。(2)语音模仿攻击:攻击者观察到受害者如何通过认证系统,包括发音方式以及设备使用习惯等,然后模仿受害者独特的发音方式,无须借助其他设备来欺骗认证系统。

1 相关工作

1.1 基于发声行为的用户身份认证

为了提高语音认证面对外部声学攻击(如语音重放攻击、语音转换攻击和语音合成攻击)的抵抗性,人们已经开展了诸多相关研究[17]。首先,根据个体的声音信号在音频域的独有特点,诸多工作开展了关于爆破音[5,7]、音素的到达时间差(Time Difference of Arrival,TDoA)变化[18]、功率分布[8]以及声场[19-20]等研究,以提高现有基于麦克风的语音身份认证机制的安全等级。此外,还有许多工作利用其他感知模态,如毫米波[10]、WiFi信号[11]、超声波[12-13]等,检测用户在发声过程中的嘴唇移动、喉咙振动、体表振动等。一方面,不同用户在发声过程中身体结构的差异性可以作为有效的身份标识;另一方面,发声过程中人体结构的变化可以作为活体声源特征,有效抵抗外部攻击。以上大多数解决方案都对设备本身所具有的传感器有一定的要求,如无线射频模块、麦克风阵列等。与这些解决方案不同,本文旨在探索一种已经被广泛配备在智能设备上的加速度计,以进行安全可靠的用户语音身份认证。

1.2 基于运动传感器的声音感知

最近的一些研究工作探索了利用运动传感器感知语音振动的可行性。Ba等[21]和Anand等[22]分析了智能手机运动传感器对语音隐私的威胁。Zhang等[14]利用加速度计实现了热词检测。Hu等[23]和Chang等[24]探索了通过低采样率运动传感器重建音频语音的可能性。Shi等[25]揭示了AR/VR设备上的运动传感器对用户隐私(语音内容以及说话人身份等)的威胁。以上工作主要集中在语音内容或者单词的识别上,与其不同,本文利用加速度计,通过对声场的方向性进行建模,实现了对用户的可靠身份认证和活体检测。

2 研究方法概览

系统整体框图如图1所示,主要由预处理模块、用户身份验证模块以及声源活体检测模块组成。当加速度计感知到用户的声音振动,将进行数据的采集。首先,采集到的加速度计信号会被输入至预处理模块进行信号增强以及浊音事件检测。其次,预处理后的信号会被输入至用户身份验证模块,该模块从加速度计信号中提取用户身份信息的唯一表征,然后使用集成分类器对提取的身份标识和身份库中的合法标识进行相似度比较。若相似度低于设定阈值,则证明该用户为非法用户,系统将会直接拒绝该用户的访问;反之,则证明该用户为合法用户,信号将会输入至声源活体检测模块,以判断该输入信号是否由活体声源产生。如果判断为活体声源,认证通过;反之,则仍然认证失败。
图 1 系统整体框图

Fig.1 System overview structure diagram

3 预处理:信号增强与浊音事件检测

3.1 信号增强

加速度计信号会受到硬件噪声、行为噪声以及空间环境噪声的影响,根据这些噪声的特性逐一将其去除,以提高目标信号的信噪比。

3.1.1 硬件噪声与运动噪声的去除

硬件噪声主要来源于加速度计传感器的制造缺陷以及重力加速度等因素,它们会引起直流偏移,导致加速度计信号失真。加速度计设计之初便是用来感知目标在三维空间的方向和速度变化,因此个体的运动状态也会干扰加速度计对语音振动信号的感知。经过实验观察和分析,硬件噪声和运动噪声都集中分布在10 Hz以下,因此本文采用截止频率为10 Hz的低通滤波器来去除两种噪声。

3.1.2 环境噪声的去除

空间中还存在其他近场声源所产生的声音信号,这些声音信号也会被加速度计感知,从而掩盖目标用户的声音振动。本文采用多频带谱减法[26]对近场干扰声源所产生的噪声信号进行滤除。相比于传统的谱减法[27],多频带谱减法可以通过减去每个频带的噪声谱去除大部分残留噪声。在大量去噪试验的基础上,将每个轴的振动频谱划分为5个线性间隔、不重叠的频带。其中,第$ i $个子频带的干净频谱表示为 $ {S}_{i}\left(k\right) $$ {Y}_{i}\left(k\right) $表示该频带的含噪频谱, $ {D}_{i}\left(k\right) $表示对该频带的噪声估计。$ {S}_{i}\left(k\right) $可以表达为下式:
$ {\left|{S}_{i}\left(k\right)\right|}^{2}={\left|{Y}_{i}\left(k\right)\right|}^{2}-{\mathrm{\alpha }}_{i}{\mathrm{\delta }}_{i}{\left|{D}_{i}\left(k\right)\right|}^{2} $
其中,$ {\alpha }_{i} $是第$ i $个频带的过减因子,与信噪比有关;$ {\delta }_{i} $是第$ i $个频带的调整因子,根据经验由每个频带的噪声特性确定;$ {D}_{i}\left(k\right) $可以通过对该频带中信号的前5帧频谱取平均值来估计。在去噪过程中,过减因子$ {\alpha }_{i} $按照下式更新:
$ {\mathrm{\alpha }}_{i}={m}_{1}*\mathrm{lg}\frac{{\displaystyle\sum }_{k={f}_{b}}^{{f}_{e}}{\left|{Y}_{i}\left(k\right)\right|}^{2}}{{\displaystyle\sum }_{k={f}_{b}}^{{f}_{e}}{\left|{D}_{i}\left(k\right)\right|}^{2}}+{m}_{2} $
其中,$ {m}_{1} $$ {m}_{2} $均为经验值。为了消除音乐噪声,本文执行了与先前工作[26]同样的负值判断。

3.2 浊音事件检测

音素可以分为浊音(如元音和浊辅音)和辅音(如清辅音和静音)两类,其中,浊音由于是由人体声带等发声器官振动产生的,因此其包含更为丰富的生物信息。此外,由于发声机制的差异,浊音音素的功率比清音音素更高,因此加速度计对这类音素的感知效果更为明显。为了分割出包含浊音音素的事件,本文设计了一套轻量高效的浊音事件检测和分割算法。首先,利用移动平均滤波器(Moving Average Filter,MAF)平滑数据,以捕捉重要趋势,同时忽略不重要的噪声。平滑后,融合两个特征来检测每个浊音事件的端点。第一个特征是短时能量(Short-time Energy,STE):
$ {\mathrm{STE}}=\sum _{t=1}^{l}\left({\left|{x}_{t}\right|}^{2}+{\left|{y}_{t}\right|}^{2}+{\left|{z}_{t}\right|}^{2}\right) $
其中,$ x $$ y $$ z $分别表示加速度计的三个方向轴的测量值。然而,该特征在复杂条件下会失去效率。为了提高检测精度,进一步提取连续样本的振幅差异($ A $)作为辅助特征来进行事件检测和分割:
$ A=\sum _{t=1}^{l}\left(\left|{x}_{t}-{x}_{t-1}\right|+\left|{y}_{t}-{y}_{t-1}\right|+\left|{z}_{t}-{z}_{t-1}\right|\right)$
然后,将这两个特征融合:
$ G={\alpha }_{1}{\mathrm{STE}}+{\alpha }_{2}A $
其中,$ {\alpha }_{1} $$ {\alpha }_{2} $分别设置为 0.4 和 0.6。经过最大最小归一化后,当$ G $超过设定的经验阈值(本文设置为0.3),说明该帧包含浊音,反之,则不包括。浊音事件检测的效果如图2所示。
图 2 浊音事件检测示意图

Fig.2 Illustration of voiced event detection

4 基于多级特征的用户身份表征

4.1 身份标识提取

由于加速度计的采样频率有限,其所采集的语音振动信号会出现频率混叠,导致语音信号中生物信息的分辨率降低。如图3所示,分别使用两种常见的说话人音色特征(谱质心和谱波峰)来验证频率混叠的影响,可以发现,频率混叠使得两名用户的加速度计信号之间的差异变小。本文选取一系列声学特征[28]作为用户识别的候选特征,根据对个体发声过程的物理解释,将声学特征分为声源特征和声道特征。
图 3 混叠效应对于用户身份识别的影响

Fig.3 Impact of aliasing effect on user identification

(1)声源特征
声带振动的速率、声带张开的程度、闭合阶段的持续时间显示,发声时不同人的发音器官的运动速度和强度变化是不同的。因此,本文使用6种频谱特征,即频谱质心(Centroid)、熵(Entropy)、频谱带宽(Bandwidth)、频谱带能量(Energy)、频谱平坦度(Flatness)和频谱波峰因子(Crest),来表示与声源相关的信息。
(2)声道特征
声道起着滤波器的作用,使声源信号产生共振并重塑。不同的人在说话时,相关发音器官的运动速度和强度变化是不同的。因此,本文还选择梅尔频率倒谱系数(Mel-Frequency Cepstral Coefficients,MFCC)、线性预测倒谱系数(Linear Predictive Cepstral Coefficients,LPCC)、线谱频率(Line Spectral Frequencies,LSF)和感知线性预测倒谱系数(Perceptual Linear Predictive Coding Coefficients,PLPCC)作为声道的候选特征。
(3)特征选择
一般来说,本文可以融合所有声学特征来识别用户。然而,高维特征可能会导致高延迟和昂贵的计算成本。针对欠采样的加速度计信号,并不是所有的候选特征都足够独特以区分不同的说话人,所以应该删除不相关和冗余的特征。本文使用信息增益(Information Gain)[29]来量化在加速度计信号中提取的声学特征对最终任务的贡献度,声学特征的信息增益越高,表明其在任务中的贡献度越高。对于每个人类参与者,使用30条加速度计信号作为训练数据、70条加速度计信号作为测试数据。声学特征在用户身份分类中的信息增益如图4所示。从图中可以观察到,声道特征比声源特征具有更高的信息增益,声源特征的低信息增益表明它们对最终结果的贡献较少。本文选择信息增益大于0.15的特征,即MFCC、LPCC、LSF和PLPCC,用于对用户身份标识的表征。
图 4 不同特征的信息增益

Fig.4 Information gain of different features

4.2 基于集成分类器的用户身份认证

首先,从加速度计的每一轴测量值中提取选择后的特征,将这些融合后的特征作为用户身份的标识。然后,使用三类分类器,即SVM、PLDA以及GMM-UBM,将提取的身份标识与注册阶段产生的身份模版进行相似度匹配。最后,执行硬投票机制并结合分类器的输出分数计算最终结果。通过实证实验和分析,发现PLDA最适合用户分类,其次是GMM-UBM和SVM。因此,本文分别给每个分类器(PLDA、GMM-UBM、SVM)的输出结果赋予不同的权重,即5、3、2。

5 基于声场方向性的活体检测

5.1 声场方向性建模

先前的研究[15,21]探索了加速度计独特的声学响应特性,这些研究只关注加速度计测量的声波的时域和频域信息,而忽略了空间域信息。本文主要从声场的角度研究加速度计对声波的三维响应。声音以波的形式传播,可以建模为一个变化的场(即声场)[30],声场描述了三维空间中每个点的声压。为了描述声场的空间信息,假设空间中有一个声源O。由于加速度计的近场声学响应特性[15],本文只研究近声场对加速度计的影响。将声源O周围的近声场$ \boldsymbol{s}_{\boldsymbol{\mathrm{\mathit{o}}}} $近似为球形模型,如图5所示,对于空间中的点P,该处的声场表示为$ \boldsymbol{s}_{\mathrm{\mathit{\mathbf{\boldsymbol{\mathbf{\mathit{\boldsymbol{o}\boldsymbol{p}}}}}}}} $P点处声场在空间中的表示形式为:
图 5 空间P点的声场示意图

Fig.5 Illustration of the sound field at point P in space

$ \boldsymbol{s}_{\mathrm{\mathit{\boldsymbol{o}\boldsymbol{p}}}}=\boldsymbol{s}_{\mathrm{\mathit{\boldsymbol{o}\boldsymbol{p}}}}^{\boldsymbol{\mathrm{\mathit{x}}}}+\boldsymbol{s}_{\mathrm{\mathit{\boldsymbol{o}\boldsymbol{p}}}}^{\boldsymbol{\mathrm{\mathit{y}}}}+\boldsymbol{s}_{\mathrm{\mathit{\boldsymbol{o}\boldsymbol{p}}}}^{\boldsymbol{\mathrm{\mathit{z}}}} $
P点的声压变化使周围的空气粒子产生加速度,根据牛顿第二运动定律,P点附近的空气粒子在声压作用下各个方向的加速度可以表示为:
$ \mathrm{Ac}\mathrm{c}_{\mathit{x}}=\frac{\boldsymbol{s}\mathit{\mathit{\mathit{\mathit{_{\mathit{\mathit{\mathit{\boldsymbol{\mathit{op}}}}}}^{\boldsymbol{\mathit{x}}}}}}}}{\boldsymbol{x}\rho\Delta V},\mathrm{Ac}\mathrm{c}_y=\frac{\boldsymbol{s}_{\mathit{\mathit{\boldsymbol{\mathit{op}}}}}^{\boldsymbol{\mathit{y}}}}{\boldsymbol{y}\rho\Delta V},\mathrm{Ac}\mathrm{c}_z=\frac{\boldsymbol{s}_{\mathit{op\boldsymbol{ }}}^{\boldsymbol{\mathit{z}}}}{\boldsymbol{z}\rho\Delta V} $
其中,$ \boldsymbol{x}\mathrm{、}\boldsymbol{y}\mathrm{、}\boldsymbol{z} $ 分别表示加速度计$ x\mathrm{、}y\mathrm{、}z $轴的单位向量,$ \rho $$\mathrm{\Delta }V $分别表示空气的密度和单位体积,在本文中被视为常量。
加速度计的每个方向轴包含时域$ t $和频域$ f $的信息,此外,加速度计的三轴测量值还反映了声场的空间信息。本文将三轴测量值的标准差定义为声场的方向性模式,如下式所示:
$ {\mathrm{DP}}\left(t,f\right)={\mathrm{std}}\left(\left[\mathrm{A}\mathrm{c}{\mathrm{c}}_{{x}}\left(t,f\right),\mathrm{A}\mathrm{c}{\mathrm{c}}_{{y}}\left(t,f\right),\mathrm{A}\mathrm{c}{\mathrm{c}}_{{z}}\left(t,f\right)\right]\right)\\ $
假设声音从声源O传播至空间P点所经历的衰减为$ {h}_{\mathrm{a}\mathrm{i}\mathrm{r}}\left(P,f,t\right) $,则P点处的声场可以表示为:
$ \boldsymbol{s}_{\mathrm{\mathit{\boldsymbol{o}\boldsymbol{p}}}}\left(t,f\right)=h_{\mathrm{a}\mathrm{i}\mathrm{r}}\left(P,f,t\right)*\boldsymbol{s}_{\boldsymbol{\mathrm{\mathit{o}}}}\left(t,f\right) $
联合公式(8)和公式(9),空间P点处的声场方向性模式可以表示为:
$ \mathrm{DP}\left(t,f\right)=\frac{h_{\mathrm{a}\mathrm{i}\mathrm{r}}\left(P,f,t\right)}{\rho\mathrm{\Delta}V}*\mathrm{std}\left(\left[\frac{\boldsymbol{s}\mathit{_{\boldsymbol{\mathit{o}}}^{\boldsymbol{\mathit{x}}}}\left(t,f\right)}{\boldsymbol{x}},\frac{\boldsymbol{s}_{\boldsymbol{\mathit{o}}}^{\boldsymbol{\mathit{y}}}\left(t,f\right)}{\boldsymbol{y}},\frac{\boldsymbol{s}\mathit{_{\boldsymbol{\mathit{o}}}^{\boldsymbol{\mathit{z}}}}\left(t,f\right)}{\boldsymbol{z}}\right]\right) $
由上式可得,空间P点的声场方向性模式和传播因子$ {h}_{\mathrm{a}\mathrm{i}\mathrm{r}} $以及声场$ \boldsymbol{s}_{\boldsymbol{\mathit{o}}} $相关。由于本文只考虑近声场对加速度计的影响,因此认为传播因子是常数,也就是说,声场方向性模式只与声源相关。
声源发声机制差异。本文中,活体声源特指由真实人体产生,非活体声源或者虚假声源特指由扬声器等声音播放设备产生。在人体声音的产生过程中,发音器官(如嘴唇、牙齿、嘴、舌头和喉部)会调节由声带产生的振动。不同的是,大多数扬声器主要依靠电流通过线圈引起的磁场变化产生可听见的声波。磁场变化引起的失真会被添加到调制的声音中,使得扬声器声源与人体声源之间出现差异。
经过上述分析可以发现,声场的方向性模式可以用来检测活体声源和非活体声源。接下来,本文将阐述如何提取声场的方向性模式。

5.2 声场方向性提取

首先,利用短时离散时间傅里叶变换(Short-Time Discrete-time Fourier Transform,ST-DTFT)导出加速度计信号的时频谱,对于每一轴的加速度信号,时频谱可以表示为:
$ S=\left[\mathrm{S}\mathrm{p}\mathrm{e}\mathrm{c}\mathrm{t}_{{x}},\mathrm{S}\mathrm{p}\mathrm{e}\mathrm{c}\mathrm{t}_{{y}},\mathrm{S}\mathrm{p}\mathrm{e}\mathrm{c}\mathrm{t}_{{z}}\right] $
考虑到三轴频谱图的尺度范围差异比较大,如果直接根据加速度计的原始三轴频谱图计算声场的方向性模式,可能会混淆特征并降低检测精度。因此,需要先对计算得到的时频谱沿着时间维度进行归一化处理:
$ {\mathrm{Spect}}\left(t,f\right)=\frac{\mathrm{S}\mathrm{p}\mathrm{e}\mathrm{c}\mathrm{t}\left(t,f\right)-\mathrm{S}\mathrm{p}\mathrm{e}\mathrm{c}{\mathrm{t}}_{\mathrm{m}\mathrm{i}\mathrm{n}}}{\mathrm{S}\mathrm{p}\mathrm{e}\mathrm{c}{\mathrm{t}}_{\mathrm{m}\mathrm{a}\mathrm{x}}-\mathrm{S}\mathrm{p}\mathrm{e}\mathrm{c}{\mathrm{t}}_{\mathrm{m}\mathrm{i}\mathrm{n}}} $
其中,$ \mathrm{S}\mathrm{p}\mathrm{e}\mathrm{c}{\mathrm{t}}_{\mathrm{m}\mathrm{a}\mathrm{x}} $$ \mathrm{S}\mathrm{p}\mathrm{e}\mathrm{c}{\mathrm{t}}_{\mathrm{m}\mathrm{i}\mathrm{n}} $分别表示在时间$ t $处的时频谱所对应的最大值和最小值。声场的方向性模式可以表示为:
$ \mathrm{DP}\left(t,f\right)=\mathrm{std}\left(\left[\mathrm{S}\mathrm{p}\mathrm{e}\mathrm{c}\mathrm{t}_{{x}},\mathrm{S}\mathrm{p}\mathrm{e}\mathrm{c}\mathrm{t}_{{y}},\mathrm{S}\mathrm{p}\mathrm{e}\mathrm{c}\mathrm{t}_{{z}}\right]\right) $
由于不同音素会给声场方向模式的稳定性带来影响。为了使声场方向性对人体声源和扬声器声源之间的差异性表征更加稳定且一致,沿着频率维度对声场方向性进行平均计算,以限制不同音素产生的动态影响,如下式所示:
$ {\mathrm{LTADP}}\left(f\right)={\sum }_{t={t}_{0}}^{T}{\mathrm{DP}}\left(t,f\right) $
本文称最后计算得到的$ \mathrm{L}\mathrm{T}\mathrm{A}\mathrm{D}\mathrm{P}\left(f\right) $为长时平均方向性模式。
特征有效性验证。本文使用两类扬声器和一名用户参与特征有效性的验证。首先,为该名用户准备一段包含50个句子的阅读材料,要求该名用户朗读,用作真实样本。然后,再利用两类扬声器重放该名用户的声音,用作虚假样本。最后,将获得的加速度计信号进行长时平均方向性模式的计算,将计算得到的LTADP使用t-SNE(t-distributed Stochastic Neighbor Embedding)方法进行降维。图6图7分别展现了不同语言内容以及不同声源位置对特征有效性的影响。从图中可以明显观察到,在不同语言内容以及不同声源位置下,同属于一个声源的特征点大部分可以被准确地聚成一类,说明LTADP特征对于语言内容和声源位置的变化较为鲁棒。
图 6 不同语言内容对特征有效性的影响

Fig.6 Impact of different speech content on feature effectiveness

图 7 不同声源位置对特征有效性的影响

Fig.7 Impact of different sound source locations on LTADP effectiveness

5.3 基于皮尔逊距离的活体检测

在用户身份注册阶段,本文机制为每一名用户生成单独的活体模板。经过上述步骤后,从输入的加速度计信号中提取得到长时平均的声场方向性模式。考虑到提取的活体特征是一个高维向量,高维向量之间的相关性越高,则他们之间的皮尔逊相关距离就越近。因此,计算提取了长时平均的声场方向性模式与活体模版之间的皮尔逊相关距离,以用于活体检测。如果距离小于设定的阈值,证明两者相似度极高,则判断输入的语音来自活体声源,认证成功;反之,则认为输入的语音来自虚假声源,认证失败。

6 实验验证

6.1 实验设置

本文使用搭载InvenSense MPU-9250 9 轴运动传感器(内置3轴加速度计、3轴陀螺仪以及3轴磁力计)的Arduino UNO开发板进行数据采集,该运动传感器最高可支持1 000 Hz的采样率。Arduino开发板连接一台个人笔记本电脑(MacBook Pro 2019),所有的信号处理均在个人笔记本电脑上进行。
招募35名志愿者参与实验,其中包含16名女性和19名男性。要求所有参志愿者佩戴设计的原型系统并阅读预先准备好的英文对话。在实验期间,每位志愿者在距离原型系统15~20 cm处阅读这些材料,志愿者声音的声压级约为80 dB,环境噪声的声压级约为60 dB。原型系统中运动传感器的采样率默认为500 Hz。 为了保证实验的通用性,在整个数据采集过程中,不对志愿者做其他行为限制。在使用加速度计进行声音数据的采集时,也会使用麦克风录制志愿者的声音。然后使用9种类型的扬声器进行重放,以此来模拟重放攻击。实验中所使用的扬声器信息如表1所示。在进行重放攻击时,扬声器和加速度计的相对位置如图8所示。
表 1 重放攻击使用的扬声器

Table 1 Loudspeakers used for replay attacks

编号 类型 厂商 型号
1 独立扬声器 Bose Soundlink Mini
2 独立扬声器 Harman Kardon Citation one
3 独立扬声器 EDIFIER R10U
4 独立扬声器 Xiaomi Xiaoai
5 手机内置扬声器 Apple iPhone 11
6 手机内置扬声器 Apple iPhone 7
7 手机内置扬声器 Huawei Mate 8
8 手机内置扬声器 Xiaomi Mi 9
9 手机内置扬声器 Xiaomi 3T (A3000)
图 8 扬声器与加速度计的相对位置

Fig.8 Relative position between the sound source and the accelerometer

6.2 用户身份认证性能评估

本小节中将进行用户身份认证方面的整体性能评估。首先,使用10名参与者的声音振动数据微调预训练的身份认证模型,其余25名参与者的声音振动数据用于评估。对于每个志愿者,选择20%收集到的振动数据作为注册数据,其余80%作为认证数据。AccLive在不同用户规模上的平均认证准确率如表2所示,可以看到,随着参与者数量的增加,AccLive的平均认证准确率逐渐降低,这是因为加速度计信号采样频率有限,使得原语音信号中的生物特征在欠采样的加速度计信号中分辨率降低。因此,随着参与者数量的增多,生物特征之间的可区分度逐渐下降。但是,即使有25名志愿者参与,平均认证准确率仍能达到88.26%。
表 2 AccLive在不同用户规模上的认证准确率

Table 2 Authentication accuracy of AccLive with different numbers of participants

参与者数量 平均认证准确率 标准差
5 96.78% 1.52%
10 94.15% 2.99%
15 92.16% 2.21%
20 91.59% 3.24%
25 88.26% 4.01%
此外,设置不同的加速度计采样率(200、350、500、650和800 Hz),分别采集不同采样率下的加速度计信号,结果如表3所示。可以发现,随着采样率的增加,AccLive的认证精度随之提高,这是因为高采样信号包含用户声音间的更多差异信息。当采样率达到500 Hz以上时,认证精度稳定,可达到90%以上的认证准确率。
表 3 采样率对AccLive用户身份认证的影响

Table 3 Impact of sampling rate on user authentication of ACCLive

采样率200 Hz350 Hz500 Hz650 Hz800 Hz
准确率57.52%72.61%92.34%93.68%94.27%

6.3 活体检测性能评估

本小节将讨论活体声源检测的整体性能,即系统区分声音是源于人类个体还是非活体的扬声器。同样,使用20%的志愿者声音数据作为注册数据来构建用户模型,其余80%的志愿者声音数据作为真实测试样本,9个扬声器重放的声音作为欺骗(虚假)测试样本。表4显示了AccLive对不同扬声器所实现的错误接受率(False Acceptance Rate,FAR)、错误拒绝率(False Rejection Rate,FRR)以及等误率 (Equal Error Rate,EER)。对于每一种扬声器,AccLive均可以实现较低的EER,说明AccLive可以准确区分活体和非活体声源。另外,相较于独立扬声器(编号1~4),手机内置扬声器(编号5~9)所产生的重放攻击更容易被AccLive检测到,这是因为智能手机扬声器产生的声场是从很小的空间发射出来的,特殊的音腔结构元件会扭曲声场的方向性模式,这种扭曲可能会导致特征更具区分性。此外,与高质量扬声器相比,低质量扬声器产生的欺骗攻击更容易被检测到,这是因为高质量扬声器的设计更为复杂,产生的声场方向性模式更接近人类真实的声场方向性模式。
表 4 扬声器类型对AccLive活体检测性能的影响

Table 4 Impact of loudspeaker types on liveness detection of AccLive

扬声器FARFRREER
13.24%4.48%3.68%
23.04%4.56%3.81%
32.83%4.35%3.37%
42.15%4.25%3.21%
52.17%3.28%2.65%
61.49%3.06%2.14%
71.98%3.13%2.56%
81.72%3.34%2.48%
91.99%3.19%2.58%
表5显示了不同信号长度条件下AccLive所实现的EER。同时,本文选择基于麦克风的活体检测系统Void[9]作为基准。可以很直观地发现,随着信号长度的增加,AccLive和Void的EER逐渐降低。给定同样长度的输入信号,与Void相比较,AccLive可以实现更低的EER,说明AccLive在活体检测性能方面优于Void,这是因为AccLive不仅融合了时域和频域信息,还融合了空间域信息,使得活体声源与非活体声源之间的声场模式更具区分度。
表 5 输入信号长度对活体检测性能(EER)的影响

Table 5 Impact of signal length on liveness detection (EER)

信号长度2 000 ms3 000 ms4 000 ms5 000 ms6 000 ms
Void13.82%9.47%7.89%5.53%4.21%
AccLive13.73%9.21%6.82%4.43%3.67%
为了探究AccLive在不同噪声级别下的活体检测性能,在给定输入信号长度5 000 ms下,分别在60(默认)70、80以及90 dB环境中评估了系统的活体检测性能,EER结果如表6所示。随着噪声水平的增加,系统可以实现更低的EER,这是因为噪声成分使人类说话者和扬声器之间的差异更加明显。这表明即使在噪声环境下,本文系统仍然可以实现活体与非活体声源的准确区分。
表 6 噪声水平对AccLive活体检测性能(EER)的影响

Table 6 Impact of noise level on liveness detection (EER)

噪声水平60 dB70 dB80 dB90 dB
Void5.53%5.25%3.06%1.25%
AccLive4.43%4.23%2.23%1.13%
为了探究加速度计采样率对AccLive活体检测性能的影响,分别设置加速度计的采样率为200、350、500、650和800 Hz,计算得到的平均EER如表7所示。可以发现,随着采样频率的增加,AccLive所实现的EER逐渐降低,表明AccLive具有更好的活体检测性能,这主要因为随着采样频率增加,加速度计信号可以更有效地表征声源的声场方向性模式,使得虚假声源和真实声源之间的区分度更明显。
表 7 采样率对AccLive活体检测性能的影响

Table 7 Impact of sampling rate on liveness detection of AccLive

采样率200 Hz350 Hz500 Hz650 Hz800 Hz
EER36.78%9.18%3.17%2.84%2.29%

7 结束语

本文设计了一种安全的基于加速度计的便携式语音认证系统 AccLive。AccLive 通过提取声音振动信号的高级特征来认证合法用户,这些特征可以代表人类说话者之间的物理差异。AccLive 进一步利用人类与扬声器之间声场空间信息的差异来有效防御声学攻击。与以前基于麦克风或其他传感器的研究相比,AccLive只需要一个小尺寸、低成本、低功耗的加速度计,即可实现准确的用户认证和有效的攻击检测。大量实验表明,AccLive可以在各种实际场景中实现高性能和鲁棒性。
由于本文系统利用加速度计捕获的振动信号进行用户身份认证和欺骗攻击防御,因此,攻击者可以通过重放精心设计的振动信号进行重放攻击。目前,本文主要考虑了语音重放攻击这类外部攻击,对于外部所产生的振动重放攻击尚未研究。在未来工作中,我们将持续探索振动重放攻击的可能性,并开展对应防御方案的研究。
1
SEABORN K, MIYAKE N P, PENNEFATHER P, et al. Voice in human-agent interaction: a survey[J]. ACM Computing Surveys, 2021, 54 (4): 1- 43.

2
TRIANTAFYLLOPOULOS A, SCHULLER B W, İYMEN G, et al. An overview of affective speech synthesis and conversion in the deep learning era[J]. Proceedings of the IEEE, 2023, 111 (10): 1355- 1381.

DOI

3
TAN H, WANG L, ZHANG H, et al. Adversarial attack and defense strategies of speaker recognition systems: a survey[J]. Electronics, 2022, 11 (14): 2183.

4
LU X, XIAO L, XU T, et al. Reinforcement learning based PHY authentication for VANETs[J]. IEEE Transactions on Vehicular Technology, 2020, 69 (3): 3068- 3079.

DOI

5
LI G,CAO Z,LI T. EchoAttack:practical inaudible attacks to smart earbuds[C]//Proceedings of the 21st Annual International Conference on Mobile Systems,Applications and Services. ACM,2023:383-396.

6
SHIOTA S,VILLAVICENCIO F,YAMAGISHI J,et al. Voice liveness detection algorithms based on pop noise caused by human breath for automatic speaker verification[C]//INTERSPEECH 2015 16th Annual Conference of the International Speech Communication Association. IEEE,2015:239-243.

7
WANG Q,LIN X,ZHOU M,et al. Voicepop:a pop noise based anti-spoofing system for voice authentication on smartphones[C]//IEEE INFOCOM 2019-IEEE Conference on Computer Communications. IEEE,2019:2062-2070.

8
AHMED M E,KWAK I Y,HUH J H,et al. Void:A fast and light voice liveness detection system[C]//29th USENIX Security Symposium (USENIX Security 20). USENIX Association,2020:2685-2702.

9
MENG Y,LI J,PILLARI M,et al. Your microphone array retains your identity:a robust voice liveness detection system for smart speakers[C]//31st USENIX Security Symposium (USENIX Security 22). USENIX Association,2022:1077-1094.

10
LI H,XU C,RATHORE A S,et al. Vocalprint:exploring a resilient and secure voice authentication via mmwave biometric interrogation[C]//Proceedings of the 18th Conference on Embedded Networked Sensor Systems. ACM,2020:312-325.

11
MENG Y, ZHU H, LI J, et al. Liveness detection for voice user interface via wireless signals in IoT environment[J]. IEEE Transactions on Dependable and Secure Computing, 2020, 18 (6): 2996- 3011.

12
LU L,YU J,CHEN Y,et al. Vocallock:sensing vocal tract for passphrase-independent user authentication leveraging acoustic signals on smartphones[C]//Proceedings of the ACM on Interactive,Mobile,Wearable and Ubiquitous Technologies,ACM,2020,4(2):1-24.

13
LU L,YU J,CHEN Y,et al. Lippass:lip reading-based user authentication on smartphones leveraging acoustic signals[C]//IEEE INFOCOM 2018-IEEE Conference on Computer Communications. IEEE,2018:1466-1474.

14
ZHANG L,PATHAK P H,WU M,et al. Accelword:energy efficient hotword detection through accelerometer[C]//Proceedings of the 13th Annual International Conference on Mobile Systems,Applications,and Services. ACM,2015:301-315.

15
SHI C,WANG Y,CHEN Y,et al. Wearid:low-effort wearable-assisted authentication of voice commands via cross-domain comparison without training[C]//Proceedings of the 36th Annual Computer Security Applications Conference. ACM,2020:829-842.

16
HAN F,YANG P,DU H,et al. Accuth:anti-spoofing voice authentication via accelerometer[C]//Proceedings of the 20th ACM Conference on Embedded Networked Sensor Systems. ACM,2022:637-650.

17
LINDBERG J,BLOMBERG M. Vulnerability in speaker verification-a study of technical impostor techniques[C]//6th European Conference on Speech Communication and Technology. European Association for Signal Processing. ISAC, 1999:283-286.

18
ZHANG L,TAN S,YANG J,et al. Voicelive:a phoneme localization based liveness detection for voice authentication on smartphones[C]//Proceedings of the 2016 ACM SIGSAC Conference on Computer and Communications Security. ACM,2016:1080-1091.

19
YANG Q, CUI K, ZHENG Y. Room-scale voice liveness detection for smart devices[J]. IEEE Transactions on Dependable and Secure Computing, 2024, 21 (5): 4982- 4996.

20
CHEN S,REN K,PIAO S,et al. You can hear but you cannot steal:defending against voice impersonation attacks on smartphones[C]//2017 IEEE 37th international conference on distributed computing systems (ICDCS). IEEE,2017:183-195.

21
BA Z,ZHENG T,ZHANG X,et al. Learning-based practical smartphone eavesdropping with built-in accelerometer[C]//Network and Distributed System Security Symposium. ISOC, 2020:1-18.

22
ANAND S A,SAXENA N. Speechless:analyzing the threat to speech privacy from smartphone motion sensors[C]//2018 IEEE Symposium on Security and Privacy (SP). IEEE,2018:1000-1017.

23
HU P,ZHUANG H,SANTHALINGAM P S,et al. Accear:accelerometer acoustic eavesdropping with unconstrained vocabulary[C]//2022 IEEE Symposium on Security and Privacy (SP). IEEE,2022:1757-1773.

24
CHANG S,ZHOU L,LIU W,et al. Combating voice spoofing attacks on wearables via speech movement sequences[J]. IEEE Transactions on Dependable and Secure Computing,2024,1-13.

25
SHI C,XU X,ZHANG T,et al. Face-Mic:inferring live speech and speaker identity via subtle facial dynamics captured by AR/VR motion sensors[C]//Proceedings of the 27th Annual International Conference on Mobile Computing and Networking. ACM,2021:478-490.

26
KAMATH S,LOIZOU P. A multi-band spectral subtraction method for enhancing speech corrupted by colored noise[C]// IEEE International Conference on Acoustics,Speech,and Signal Processing. IEEE,2002,4:44164-44164.

27
BEROUTI M,SCHWARTZ R,MAKHOUL J. Enhancement of speech corrupted by acoustic noise[C]//IEEE International Conference on Acoustics,Speech,and Signal Processing. IEEE,1979,4:208-211.

28
KINNUNEN T, LI H. An overview of text-independent speaker recognition: from features to supervectors[J]. Speech Communication, European Association for Signal Processing, 2010, 52 (1): 12- 40.

29
AZHAGUSUNDARI B, THANAMANI A S. Feature selection based on information gain[J]. International Journal of Innovative Technology and Exploring Engineering, 2013, 2 (2): 18- 21.

30
BERANEK L L,MELLOW T. Acoustics:sound fields and transducers[M]. London:Academic Press,2012.

文章导航

/