“智能身份认证”专题

跨场景下基于人机交互行为的儿童识别技术

  • 赵竣毅 1 ,
  • 高书馨 2 ,
  • 宋天乐 2 ,
  • 张翀 2 ,
  • 赵正宇 2 ,
  • 沈超 2 ,
  • 蔺琛皓 , 2, 3, *
展开
  • 1. 西安交通大学信息与通信工程学院,西安 710049
  • 2. 西安交通大学网络空间安全学院,西安 710049
  • 3. 西安交通大学前沿科学技术学科交叉中心,西安 710049
蔺琛皓()。

网络出版日期: 2026-01-04

基金资助

国家重点研发计划(2023YFB3107401),国家自然科学基金(T2341003,62376210,62161160337,62132011,U21B2018,U20A20177,62206217),陕西省重点产业创新计划(2023-ZDLGY-38)

版权

版权所有©《网络空间安全科学学报》编辑部 2025

Cross-scenario child recognition technology based on human-computer interaction behavior

  • ZHAO Junyi 1 ,
  • GAO Shuxin 2 ,
  • SONG Tianle 2 ,
  • ZHANG Chong 2 ,
  • ZHAO Zhengyu 2 ,
  • SHEN Chao 2 ,
  • LIN Chenhao , 2, 3, *
Expand
  • 1. School of Information and Communications Engineering, Xi’an JiaoTong University, Xi’an 710049, China
  • 2. School of Cyber Science and Engineering, Xi’an JiaoTong University, Xi’an 710049, China
  • 3. Interdisciplinary Research Center of Frontier science and technology, Xi’an Jiaotong University, Xi’an 710049, China

Online published: 2026-01-04

Copyright

Copyright ©2025 Journal of Aeronautical Materials. All rights reserved.

摘要

近年来,移动互联网蓬勃发展,移动智能终端已成为人们日常生活中不可或缺的工具。移动智能设备的普及化带来了用户年龄分布的多样化,儿童沉迷智能手机、电子游戏大额充值以及误操作手机导致信息泄露等已成为社会的普遍问题。目前,主要的监管措施是依赖身份证信息核对,但儿童可以通过获取家长身份信息的方式绕过该监管。因此,如何在用户使用智能手机的过程中识别用户年龄段以防止儿童过度使用手机是一个亟待解决的问题。基于这一问题,构建了一个涵盖游戏场景、自由场景的大规模人机交互数据集,并提出了多任务学习的跨场景年龄段识别方法,实现了0.09的等错误率(Equal Error Rate,EER),面对13岁以下的低龄儿童群体实现了0.06的EER。

本文引用格式

赵竣毅 , 高书馨 , 宋天乐 , 张翀 , 赵正宇 , 沈超 , 蔺琛皓 . 跨场景下基于人机交互行为的儿童识别技术[J]. 网络空间安全科学学报, 2025 , 3(4) : 43 -52 . DOI: 10.20172/j.issn.2097-3136.250404

Abstract

In recent years, the mobile Internet's rapid growth has made mobile smart terminals essential in daily life. With their widespread use, user age distribution has diversified. Problems like children's smartphone addiction, excessive online game recharges, and accidental info leakage from improper operations are now common social issues.Current regulatory efforts mainly rely on ID based identity verification, but children can evade it by using parents' info. Thus, identifying users' age groups during smartphone use to curb children's overuse is a pressing concern.To solve this, a large scale human-computer interaction dataset covering gaming and free use scenarios has been built. A cross-scenario agegroup recognition method based on multi-task learning is proposed to address children's smartphone addiction, achieving an equal error rate (EER) of 0.09 overall, and 0.06 for children under 13.

0 引言

近年来,移动互联网技术的飞速发展极大地改变了人们的生活方式,移动智能终端逐渐成为日常生活中不可或缺的工具。从社交、娱乐到购物、支付,智能手机为用户提供了便捷高效的体验。然而,随着移动智能设备的普及化,用户群体的年龄分布日益多样化,尤其是儿童的接触和使用频率显著增加。这一现象反映了技术的普及程度,同时也带来了诸多亟待解决的社会问题。
如今手机用户超过全球人口的86%,移动智能设备的普及化带来了用户年龄分布的多样化,尤其近年来呈现低龄化趋势。在中国,智能手机用户已超过10.07亿,儿童占比高达12%[1]。由于儿童的自制力差,更容易对手机上瘾,会危害其生理和心理健康[2]。除了手机成瘾,儿童使用手机可能还存在其他风险,如游戏大额充值、误操作导致信息泄露等,会威胁财产和数据隐私安全[3]。目前,主要的监管措施依赖身份证信息核对,但儿童可以通过获取家长身份信息的方式绕过监管,导致现有措施难以有效解决问题。为了进一步在儿童使用手机时给予其额外的辅助,有效地识别出儿童群体至关重要。现有的识别系统通过采集儿童面部、声音等信息来判断其年龄段[4-5],但这些信息的获取需要额外的摄像头、麦克风权限,存在滥用终端隐私权限和儿童生物特征数据的风险。为了避免敏感数据的泄露,研究人员开始基于人机交互行为来进行儿童年龄段的识别。这些研究通过用户与电子设备的交互,获取用户操作习惯这种隐式特征。通过用户与智能手机屏幕交互时的滑动速度、轨迹长度等特征来进行识别[6]
当前,大多数年龄段识别研究在交互场景方面存在局限性,难以满足多样化的实际应用需求。本文的主要贡献如下:(1)创新性地构建了一个涵盖游戏场景与自由场景的人机交互数据集。该数据集充分考虑了不同场景下用户行为特征的差异性,为后续研究奠定了基础。(2)在构建数据集的基础上,通过融合场景标签实现了多任务联合学习,提出了跨自由场景、游戏场景的儿童年龄段识别方法。这一方法充分利用了跨场景数据的特性,显著提升了儿童与成年人群体在不同场景下的识别准确率。(3)在构建的数据集中进行实验验证,取得了0.09的等错误率(Equal Error Rate,EER)和0.96的曲线下面积(Area Under Curve,AUC),面向13岁以下的低龄儿童,取得了0.06的EER和0.98的AUC。

1 相关理论与技术

1.1 儿童定义与手部发育特点

联合国儿童基金会将“儿童”定义为18岁以下的未成年人[7],儿童身心尚未成熟,需要特殊的保护照料,包括法律上的适当保护。在本文的年龄段识别工作中,儿童年龄段采用该定义范围。
人类主要依靠手与移动智能终端设备进行交互,手部骨骼肌随着年龄的增长而发育。不同年龄、性别和地域的成年人,其骨骼肌质量和抓握力量均存在差异[8]。儿童的身体会随着年龄的增长而发育。儿童手骨的长度和宽度会随着年龄的增长而增加,手指的灵活度和移动速度也会随之提高。年龄较大的儿童在触摸屏上能够更快地点击和拖动,操作也更加准确。同时,由于肌肉的发育,儿童的抓握力量也会随着年龄的增长而增强,使得他们能够更稳定地抓握物体。可以预见,成年人与儿童之间的手部活动具有差异性。在人机交互过程中,儿童对电子设备的握持会更加不稳定,在屏幕上的操作也会更不准确,点击和拖动的速度相对更加不稳定。这些差异会明显反映在触摸屏幕和传感器数据上。

1.2 相关研究现状

随着人机交互行为分析方法的持续发展和完善,越来越多的新技术应运而生。例如,基于移动智能终端的用户年龄段识别技术,能够判断智能设备的使用者是否为儿童,并据此对使用者进行相应的规范限制。当使用者被判断为儿童时,可以限制设备上的隐私数据访问、转账汇款、游戏充值等功能,有效保障机主的隐私与财产安全。然而,现有的年龄段识别技术大多需要采集用户面部、声音等敏感隐私信息,存在隐私泄露的风险。同时,这些识别方法大多为单次识别,无法实现持续识别,这在很大程度上限制了相关技术在实际场景中的应用。相比之下,通过对隐式人机交互行为(如触屏操作、陀螺仪等传感器数据)的分析来进行年龄段识别,不仅可以有效缓解隐私泄露的问题,还能实现持续的实时识别。早期的年龄段识别技术,是基于用户面部图像和声音活动展开的。这些研究将皱纹图像信息或声学韵律层次信息作为分析标准,来识别用户的年龄段。但是这些方法依赖摄像头或麦克风,可能会侵犯用户的隐私。考虑到隐私安全问题,研究人员们开始尝试依靠隐式的人机交互行为特征进行儿童年龄段识别。
儿童年龄段识别任务,是基于数据特征的一个分类问题。将采集到的数据提取为向量化的特征,通过机器学习、深度学习等技术构建识别分类模型。2012年,Anthony等[9]进行了一项关于儿童与成年人在移动智能设备屏幕上触摸交互的研究,证实了通过触摸手势交互行为区分儿童与成年人群体的可行性。2013年,Arif等[10]比较了成年人和8~11岁儿童用户在电容触摸屏上基于触摸和基于笔的输入交互,结果显示,对于成年人用户来说,使用笔输入比触摸输入显著更快、更准确,对于儿童用户,输入方法对输入结果没有显著影响。这进一步印证了儿童与成年人群体的人机交互行为存在很大的差异性。2015年,Vatavu等[11]对3~6岁儿童在智能手机和平板电脑上进行标准点击和拖放互动时的触摸行为进行了研究。他们创建了包含89名儿童和30名成年人的数据集,使用贝叶斯规则对儿童年龄段识别进行了尝试,达到了99%的准确率。Nacher等[12]研究了幼儿园前儿童在多点触摸屏上的交互行为,发现这些儿童能够有效进行单指旋转、双指放大缩小等多指手势。2017年,Zhang等[13]在解锁屏幕和接听电话两个场景中采集数据,利用手机中普遍存在的传感器进行儿童年龄段识别。他们提取拿起手机、滑动屏幕、响应时间和接听电话阶段的特征,使用随机森林分类器来识别儿童用户,在包含35名用户的数据集中精确率达到了94.80%。2019年,Toan等[14]提出了在移动智能终端上自动识别儿童用户的技术,使用触摸屏和传感器数据信息来区分儿童和成年人用户,仅依靠3次滑动行为,就可以达到99%的准确率。Rashed等[15]从60位用户中采集了数据,要求他们在触摸设备上执行6项基本任务,以找出儿童和成年人触摸手势的差异。他们进行探索性数据分析,将问题建模为监督二元分类问题,并使用了不同的机器学习算法,以确定是否可以将机器上未知的用户分类为成年人或儿童。使用支持向量机(Support Vector Machine,SVM)分类算法时,他们的方法在60人的数据集上达到了86.66%的准确率。2020年,Cheng等[16]提出了一个可以在用户操作智能手机时自动无缝地识别儿童用户的系统,从生理成熟的角度研究了儿童和成年人用户之间屏幕触摸模式的内在差异。他们在100位用户的数据集上进行了实验,仅使用屏幕上的一次滑动就可以实现96.6%的儿童识别准确率,而连续3次滑动的准确率则提高到98.3%。

1.3 数据采集技术

目前,在年龄段识别或者身份认证领域,一般通过一款在手机后台运行的软件记录用户使用过程中的触摸屏或传感器数据,其统计信息如表1所示。Asadullah等[17]要求参与者在手机上进行电子签名以采集传感器数据;Shen等[18]在参与者使用日常应用时采集触摸屏和传感器数据;Amini等[19]要求参与者坐在椅子上,模拟进行一次“在线购物”的操作过程,并采集传感器数据;Hu等[20]要求参与者使用文档阅读、地图导航等日常应用以采集传感器数据;Leyfer等[21]对14位参与者进行持续两周的日常行为数据采集;Song等[22]要求参与者在手机屏幕上执行多指并排触摸滑动任务,根据多手指行为进行身份识别;Vatavu等[11]要求参与者执行点击、拖动等特殊的触摸滑动任务,以收集触屏交互数据;Nacher等[12]要求参与者进行点击、双击、长按、拖动、放大、缩小、单次旋转、单指旋转、两指旋转等多项触摸滑动任务以收集数据;Zhang等[13]在参与者解锁手机、接听电话的过程中进行数据采集;Toan等[14]要求参与者使用相册浏览、特定游戏游玩、播放视频网站这三个应用并采集数据;Rasheed等[15]要求参与者执行点击、滑动、放大、缩小和旋转任务并采集数据;Frank等[23]要求参与者进行电子阅读和浏览图片并采集数据。在本文的研究中,主要使用滑动点击触摸屏的横纵坐标数据以及该过程中的加速度计传感器XYZ轴读数数据。
表 1 数据采集字段

Table 1 Data collection fields

字段释义
timeStamp时间戳
screenRes手机屏幕分辨率
screenOri手机方向
tapX tapY触摸屏交互横纵坐标
finger number手指编号
acceX acceY acceZ加速度计传感器XYZ轴读数
size手指接触屏幕面积
userID用户ID编号
userAgeGroup用户年龄段

2 难点与挑战

当前基于人机交互行为的年龄段识别工作大多在理想的实验室环境下完成。研究者们大多要求参与实验的用户在智能手机上完成指定交互行为动作,从而采集数据、提取特征、训练模型完成识别,且数据规模小。但是在现实世界的环境中,用户使用手机的情况复杂多变,在实验室环境下得到的模型无法直接应用。
在现实世界中,用户使用手机的交互行为丰富多样,除了日常自由使用,还会进行游戏。当前基于人机交互行为的年龄段识别研究,尚未充分涵盖上述两种典型场景。并且,相较于不同年龄段用户群体行为的类间差异,自由使用场景和游戏场景下同一群体的用户行为本身还存在着显著的类内差异。如何在综合覆盖自由场景与游戏场景的现实环境下,进行年龄段识别工作,是当前领域的一个重要挑战。本文的研究框架如图1所示。
图 1 研究框架

Fig.1 Research framework

3 数据集构建

3.1 数据采集

实验需要连续采集反映用户与手机交互行为的数据字段。本文使用Java开发的一款数据采集软件开发工具包(Software Development Kit,SDK),它可以在Android 9.0及以上的安卓智能手机中运行。用户需要在SDK中手动输入年龄、用户ID编号,选择用户性别(男、女),设置数据采集过程中的姿态(坐姿胳膊有支撑、坐姿胳膊无支撑、站立行走、手机放置于桌面)。设置完成后点击开始采集,SDK在后台自动采集用户的操作数据,用户在采集数据过程中无特殊任务限制。具体数据采集字段可分为三大部分,分别是触屏信息、传感器信息及其他相关信息。所有数据字段最终整合成JSON格式进行存储。
共有4 989名智能手机用户参与了该次数据采集工作,所有参与者可以熟练地操作使用智能手机,他们的年龄分布为3~55岁,且男女性别比例均衡,分布统计信息如表2所示。
表 2 数据集统计信息

Table 2 Dataset statistical information

数据集 场景 儿童(3~8岁) 儿童(9~14岁) 儿童(15~17岁) 成年人 合计
训练集 自由 303 532 190 975 2 000
游戏 245 473 247 1 025 1 990
测试集 自由 181 52 29 238 500
游戏 66 120 63 250 499
数据采集使用的智能手机品牌是OPPO,涵盖低端至中高端A系列、K系列、Reno系列型号手机。所有手机中内置SDK,数据采集字段信息如表1所示,整体采集频率为60 Hz。其中,现在主流的智能手机中普遍内置加速度计,用于测量手机移动过程中的加速度。用户使用手机时会使其颤动,加速度计可以捕获微小的手部动作。
首次登入时,参与者在SDK中输入年龄、性别等信息,随后可以开始自由使用手机。每次采集的持续时间为10~15 min,采集到的数据为一个样本。在数据采集过程中,参与者可以选择进行游戏游玩、或者使用其他任何应用。在游戏场景采集时,本文选择了5款游戏平台进行采集。同时,选择了5款具有代表性的手机游戏,用以反映用户在日常游戏过程中的典型交互行为。这些游戏涵盖了动作、冒险、角色扮演、策略和休闲五大主流类型。所有游戏均采用横屏模式并以双手操作,模拟了大多数移动游戏的交互方式。游戏过程中不依赖传感器驱动的体感控制,而是通过点击和滑动等基本操作来完成交互。在自由场景采集时,不限制用户使用的应用,包括抖音、淘宝、微博、小红书等众多主流应用软件,涵盖了用户日常使用的绝大部分情况。采集到的样本场景统计信息如表2所示。

3.2 数据预处理

在数据预处理阶段,主要进行异常值过滤剔除和多指触摸分离的操作。在数据采集过程中,SDK 卡顿、智能手机硬件运行不稳定、参与者操作失误等问题难以避免,采集到的数据可能会出现异常值,因此,本文设计了一套脚本进行异常值的判断并过滤剔除。
在采集到的原始数据中,同一时刻可能包含多个手指信息,需要将多指动作信息分割为单指动作信息以进行后续的特征提取操作。其中,手指接触坐标、手指动作类型及手指编号等信息均以数组类型存储,且其长度与手指个数相同,其他信息如时间戳、传感器特征等则以单个数值或字符串保存。对于此类多指数据,需要将数组中的数据分割为多行单个数字的数据,其他非数组的字段则补全为多行相同数据,以完成对多指动作数据的划分,每一行数据代表当前时刻单个手指的完整动作信息。但每个时刻的手指的动作信息混杂在一起,无法得知每个手指的完整动作信息。因此,需要根据手指编号及数据行的紧密程度,按照时间顺序以及手指动作类型以0开始以2结尾的规则,将杂乱的动作数据划分为单个完整动作数据,并将每个完整动作数据整合为一行数据,时间戳坐标等信息以数组格式存储。其中,手指动作类型指系统底层在手指触摸屏幕时记录的操作,共有三类:0 表示按下,1 表示滑动,2 表示抬起。一个完整动作一定是从按下开、以始滑动结束,故完整动作的动作数据一定是开头为0末尾为2,以此作为动作剔除的一个准则。至此,多指动作分割完成,过程示意图如图2所示。
图 2 手指动作分割示意图

Fig.2 Finger action segmentation diagram

4 跨场景儿童年龄段识别方法

在构建的大规模数据集上,进行特征的设计与提取,以描述用户的交互行为习惯。然后进行年龄段识别模型的训练,同时加入场景目标的识别任务,使得模型可以在游戏场景、自由场景下对儿童年龄段的识别具有更泛化的性能。

4.1 特征工程

为了避免隐私的泄露风险,研究采集的用户数据均为非敏感信息(如手指点击滑动屏幕的坐标、加速度计传感器读数等数据),不同年龄段用户在原始数据的维度上区分度较小,需要基于原始数据提取出特征。
根据原始数据的物理意义(如手指滑动速度、加速度、角速度、角加速度、点击停留时长、姿态角)及数学统计意义(如均值、方差、峰度)进行特征的设计与提取。其中,触摸滑动轨迹的角度,是指轨迹点与屏幕左下角原点以及屏幕边的夹角。基于加速度计的三轴读数,计算得到设备的姿态角,包括俯仰角pitch、翻滚角roll、偏航角yaw。由于不同手机的屏幕分辨率有差异,因此基于屏幕像素坐标计算得到的特征会根据机型不同有所变化。为了消除这一影响,本文先对触摸坐标进行了缩放,统一缩放至1 080 P的像素比例,再进行特征提取。提取得到的特征共计184维,具体信息如表3所示。
表 3 特征信息

Table 3 Feature information

特征类别 描述 维度
位置时间 滑动起止点坐标、持续时长 5
滑动距离 触摸滑动轨迹长度、矢量长度及其数学统计值 12
滑动速度 触摸滑动轨迹速度、矢量速度及其数学统计值 12
加速度 触摸滑动加速度、数学统计值 12
角度 滑动轨迹与屏幕X轴夹角及其数学统计值 12
角速度 滑动夹角角度及其数学统计值 12
角加速度 滑动轨迹夹角角加速度及其数学统计值 12
传感器 加速度计三轴读数序列数据数学统计值 20
姿态角 俯仰角、偏航角、翻滚角 6
接触面积 手指触碰屏幕时的接触面积 2
最远距离点 滑动轨迹上最远距离点坐标、距离 3
数学统计值 以10次滑动动作为切片计算内部数学统计值 66
选取部分特征进行可视化分析,如图3所示。其中横坐标表示特征样本,纵坐标表示该特征样本的值。本文分别统计自由场景、游戏场景下儿童和成年人的样本特征,按照特征值从小到大进行排序并绘制成曲线图。从图中可以看出,不同年龄段群体的特征分布具有明显的差异。但是,相比于年龄段群体之间的类间差异,每个年龄段群体中自由场景和游戏场景下使用手机的行为特征具有更大的类内差异。这种差异性给跨场景的年龄段识别带来很大的挑战,这也是本研究工作要解决的难点。
图 3 特征可视化

Fig.3 Feature visualization

4.2 跨场景儿童年龄段识别模型

目前,基于人机交互行为的年龄段识别工作,大多要求用户执行特殊的手势滑动,或在单一场景下进行。本文的工作将识别范围拓宽,涵盖了用户日常的游戏场景和自由使用场景,利用渐进式分层抽取(Progressive Layered Extraction,PLE)多塔神经网络进行建模,将年龄段、场景类别作为联合学习的目标,共享底层参数信息,以提升年龄段识别的效果[24]
成年人与儿童在自由场景、游戏场景下使用手机的行为交互习惯不尽相同,为了捕获这些行为模式上的差异性,本文使用多塔神经网络深度学习设计的交互行为特征。多塔神经网络通过并行排列两个子网络(塔),能够同时处理年龄段识别任务和场景识别任务。这种架构既支持底层参数共享,又可以让每个塔学习独立的任务,用场景信息辅助年龄段识别,从而增强泛化能力。同时,多塔结构能够将复杂任务分解为更易管理的子任务,降低模型对噪声的敏感性,有效减少过拟合风险。多塔神经网络能够更全面地利用数据信息,显著提升模型性能。
多塔神经网络结构如图4所示,其中G代表Gate门控单元。UniversalAnalyzers、AgeGroupSpecialists和SceneInterpreter的信息通过门控单元进行融合。门控单元是激活函数为Softmax的单层前馈神经网络。假设有k个子任务,其中x是输入的向量,$ {{\boldsymbol{S}}}^{k}\left({\boldsymbol{x}}\right) $是一个选择矩阵,把UniversalAnalyzers网络和第k个子任务的Experts K串接起来,则其中的门控网络输出表达式为:
图 4 网络结构图

Fig.4 Network structure diagram

$ {g}^{k}\left(x\right)={w}^{k}\left(x\right){S}^{k}\left(x\right) $
$ {w}^{k}\left(x\right)={\mathrm{softmax}}\left({W}_{g}^{k}x\right) $
$ \mathit{\mathit{S^k\left(x\right)=[E_{\left(k,1\right)}^T,E_{\left(k,mk\right)}^T,E_{\left(s,1\right)}^T,E_{(s,ms)}^T]T\mathit{\mathit{\mathit{ }}}}} $
UniversalAnalyzers、AgeGroupSpecialists和SceneInterpreter网络的输出经过门控单元Gate的融合,最终输入到AgeTower、SceneTower。Tower 网络经过第一个全连接层,应用ReLU激活函数和 Dropout层,来减少过拟合的风险。在第二个全连接层之后,应用Sigmoid激活函数将输出转换为0~1的概率值,再进行二分类决策,输出预测的年龄段或场景结果。本文使用二元交叉熵作为损失函数(Binary Cross Entropy Loss),它是评估模型预测概率与真实标签之间差异的指标,数学表达式为:
$ \text{L}\text{o}\text{ss}=-\frac{1}{N}{\sum }_{i=1}^{N}[{y}_{i}\mathrm{l}\mathrm{o}\mathrm{g}({p}_{i})+(1-{y}_{i})\mathrm{l}\mathrm{o}\mathrm{g}(1-{p}_{i}\left)\right] $
其中,N是样本数量,$ {y}_{i} $是第i个样本的真实标签,其值为0或1,$ {p}_{i} $是模型预测第i个样本为正类(标签为1)的概率。这种损失函数鼓励模型输出接近真实标签的概率值,从而最小化预测误差。本文的总损失函数为年龄段识别和场景分类两个任务损失函数的加权,实验过程中调节权重以达到最好的年龄段识别效果。

5 实验

5.1 实验设置

实验在一台搭载Intel® Xeon® Gold 6226R CPU和Nvidia RTX 3090 GPU的Linux服务器上完成。服务器基于Ubuntu 20.04系统,并使用Python 3.8.16语言、Pytorch 2.2.2深度学习框架进行模型的训练与测试。训练集和测试集按照8∶2比例划分,如表2所示。使用Adam优化器训练网络,学习率为$ 1\times {10}^{-4} $,总训练轮次为200个epochs。

5.2 评价指标

本文以EER和AUC作为评价指标。在二分类问题中,混淆矩阵(Confusion Matrix)是一个重要的概念,用于评估分类模型的性能。混淆矩阵中包含真阳性、假阳性、真阴性、假阴性4个基本元素。真阳性(True Positive,TP),真实标签为正类且被正确预测为正类的样本数;假阳性(False Positive,FP),真实标签为负类但被错误预测为正类的样本数;真阴性(True Negative,TN),真实标签为负类且被正确预测为负类的样本数;假阴性(False Negative,FN),真实标签为正类但被错误预测为负类的样本数。基于混淆矩阵,可以计算错误接受率和错误拒绝率。错误接受率,实际为负类但被错误预测为正类的样本数占实际为负类的样本总数的比例;错误拒绝率,实际为正类但被错误预测为负类的样本数占实际为正类的样本总数的比例。进一步得到EER,即错误接受率等于错误拒绝率时的错误率。EER越低,表示分类系统的性能越好。ROC曲线(Receiver Operating Characteristic Curve)用于衡量模型在不同阈值下的性能,其横轴为假正率(False Positive Rate,FPR),纵轴为真正率(True Positive Rate,TPR),即召回率。如果分类模型可以将正类和负类完全识别分开,那么ROC曲线会从左下角(0,0)直接上升到左上角(0,1),然后水平延伸到右上角(1,1)。这种情况下,AUC的值为1,表示模型性能非常好。如果模型的分类能力是完全随机的,那么ROC曲线是从左下角(0,0)到右上角(1,1)的对角线(即FPR = TPR)。这种情况下,AUC的值为0.5。ROC曲线越靠近左上角,表示模型的性能越好,AUC的值也就越大。

5.3 与现有方法的对比

在功能性方面,现有的儿童识别研究多集中于单一场景或特定手势操作下的年龄段识别,功能覆盖有限,对用户自然行为的适应性较差。例如,随机森林(Random Forest,RF)[14]主要依赖固定手势滑动数据,而极端随机树(Extremely Randomized Trees)[16]则聚焦特定交互任务下的生理特征提取,因此在自由使用场景中的适用性不足。ChildShield[25]的应用范围虽有所扩展,但仍局限于游戏环境,缺乏对多样化日常应用场景的支持。相比之下,本文方法的数据采集同时涵盖游戏场景和自由使用场景,并允许用户自然操作,不受特定手势的限制,同时兼顾跨设备适配(如不同的屏幕分辨率)。
在方法性方面,现有方法普遍设计了低维、简单的特征(约40~60维),特征多样性有限,对多指动作的完整性及跨场景行为差异的捕捉能力不足。同时,模型设计大多依赖传统机器学习方法,缺少针对多场景的系统性建模。本文方法在特征设计上更加丰富,提取了184维综合特征,包括滑动轨迹、速度、加速度、角速度等数学统计特征。在模型设计上,采用PLE多塔神经网络联合学习年龄段和场景识别任务,通过共享底层参数并独立训练子塔,实现场景信息对年龄识别的辅助作用,从而显著提升跨场景泛化能力。使得本文方法在大规模、多场景、多设备数据下的行为模式捕捉更为全面和精确。

5.4 结果与分析

本节与基于机器学习的儿童年龄段识别方法进行比较,调整优化逻辑回归、极端随机树、K近邻、随机森林、朴素贝叶斯、支持向量机分类器的参数。本文设置K近邻算法(K-Nearest Neighbors,KNN)的参数k=22,随机森林和极端随机树的树参数为100。对比结果如表4图5所示,可以看出本文方法具有最佳的性能表现,实现了0.96的AUC和0.09的EER。
表 4 实验结果对比

Table 4 Comparison of experimental results

方法AUCEER
ET[16]0.940.14
KNN[16]0.720.34
RF[14]0.920.18
ChildShield[25]0.910.18
本文方法0.960.09
图 5 实验结果ROC曲线

Fig.5 ROC curves of experimental results

本文还分别对不同年龄段的儿童进行了实验测试,观测识别模型的效果。儿童的年龄段可以划分为3~8岁、9~14岁、15~17岁三组,分别对应幼儿、少年、青少年。不同年龄段的儿童测试结果如表5图6所示,可以发现越小的儿童识别效果越好,随着儿童年龄的增长,识别效果逐渐变差。这是因为随着生长发育,大龄儿童在使用手机时的行为模式和交互习惯逐渐与成年人趋同。大龄儿童的交互行为特征与成年人更为接近,导致年龄段识别模型在区分大龄儿童与成年人时面临更大的挑战,从而导致识别准确性下降。
表 5 不同年龄段结果对比

Table 5 Results across different age groups

年龄段 AUC EER
3~8岁 0.98 0.06
9~14岁 0.95 0.11
15~17岁 0.93 0.13
total 0.96 0.09
图 6 不同年龄段ROC曲线

Fig.6 ROC curves for different age groups

本文还分别对游戏场景、自由场景进行了实验测试,观测识别模型的效果,结果如表6图7所示。可以看出,在游戏场景下,年龄段识别效果更好。进一步分析原因,在游戏场景中,需要进行的滑动交互更为复杂,两种场景的滑动操作统计信息对比如表7所示。对于每个样本来说,游戏场景交互所包含的信息量更加丰富,自由场景下的滑动操作相对简单,样本信息量相对较少,从而导致模型在自由场景下的识别效果相对较弱。
表 6 不同场景结果对比

Table 6 Result comparison for different scenarios

场景AUCEER
游戏0.980.07
自由0.960.11
图 7 不同场景ROC曲线

Fig.7 ROC curves for different scenarios

表 7 不同场景滑动操作对比

Table 7 Touch operation comparison for different scenarios

场景滑动时长/ms滑动轨迹长度/pixel滑动矢量长度/pixel
游戏1 428.931 877.48681.37
自由318.95445.02412.75

6 结束语

本文介绍了基于人机交互行为的用户年龄段识别技术,针对现有研究无法应对现实世界应用的局限性,提出了跨自由使用场景、游戏场景下的儿童年龄段识别方法。构建了首个大规模的跨场景人机交互数据集,设计并提取描述用户交互行为习惯的特征。将自由场景、游戏场景作为模型训练的目标,利用多目标学习网络输出预测两类目标,共享网络底层通用信息,提升两大场景下的儿童年龄段识别能力。进行实验测试,并与当前已有的年龄段识别方法对比,本文方法识别效果最佳。同时,本文所提出的方法具有良好的可扩展性与泛化性。在特征工程方面,所采用的人机交互行为特征(触摸屏+传感器)属于低层次的隐式特征,不依赖特定应用或任务,因此能够自然迁移至更多实际使用场景。在模型构建方面,本文引入多任务学习与多塔网络(PLE架构),通过共享底层表示并区分任务分支(如年龄识别、场景识别),使框架具备天然的扩展能力。具体而言,只须在训练阶段增加新的场景标签(如社交媒体、学习类应用、视频娱乐等),即可直接扩展为多类跨场景学习,而无须对整体架构进行额外修改。本文还进行了不同细分类别的数据划分,并在此基础上进行了实验验证,探索可能影响模型年龄段识别效果的因素。
但是,本文方法对于不同年龄段间的差异性考虑不够充分。大龄儿童的人机交互行为趋同成年人,如何设计出更高效的特征对其行为模式进行刻画,或者从模型角度考虑更细致的分类,是该领域未来的一个深入研究方向。同时,每位用户的交互行为习惯受到多重因素影响,生理健康程度、心理情绪波动、外界物理环境都会对用户的使用行为产生影响。如何排除这些因素的影响、对每位用户的交互行为进行更精准的建模,也是未来该领域的一个深入研究方向。
1
中国互联网络信息中心. 第48次中国互联网发展状况统计报告[EB/OL]. (2021-08-27)[2025-09-11]. http://wlaq.xjtu.edu.cn/48hlbg.pdf.

China Internet Network Information Center. The 48th statistical report on China’s internet development [EB/OL]. (2021-08-27) [2025-09-11]. http://wlaq.xj-tu.edu.cn/48hlbg.pdf.

2
CHEN L, YAN Z, TANG W, et al. Mobile phone addiction levels and negative emotions among Chinese young adults: The mediating role of interpersonal problems[J]. Computers in Human behavior, 2016, 55, 856- 866.

DOI

3
周景凡. 未成年人大额游戏充值行为研究[J]. 法制与经济, 2019 (4): 83- 85.

ZHOU J F. Research on minors’ large-amount game recharge behavior[J]. Legal System and Economy of China, 2019 (4): 83- 85.

4
BASARAN C, YOON H J, RA H K, et al. Classifying children with 3D depth cameras for enabling children’s safety applications[C]//Proceedings of the 2014 ACM International Joint Conference on Pervasive and Ubiquitous Computing. ACM, 2014: 343-347.

5
SAVCHENKO A V. Efficient facial representations for age, gender and identity recognition in organizing photo albums using multi-output ConvNet[J]. PeerJ Computer Science, 2019, 5, e197.

DOI

6
LI L, ZHAO X, XUE G. Unobservable re-authentication for smartphones [C]//Proceedings of the Network and Distributed System Security Symposium (NDSS). Internet Society, 2013, 56: 57-59.

7
联合国儿童基金会. 儿童权利公约[EB/OL]. (1990-09-02)[2025-09-11]. https: //www.unicef.org/child-rights-convention/convention-text.

United Nations Children’s Fund. Convention on the rights of the Child [EB/OL]. (1990-09-02) [2025-09-11]. https: //www.unicef.org/child-rights-convention/convention-text.

8
吴曼, 魏玉虾, 余灿清, 等. 中国 10 个地区成年人骨骼肌质量和手握力的描述性分析[J]. 中华流行病学杂志, 2019, 40 (4): 376- 381.

WU M, WEI Y X, YU C Q, et al. Descriptive analysis of skeletal muscle mass and handgrip strength among adults in 10 regions of China[J]. Chinese Journal of Epidemiology, 2019, 40 (4): 376- 381.

9
ANTHONY L, BROWN Q, NIAS J, et al. Interaction and recognition challenges in interpreting children’s touch and gesture input on mobile devices[C]//Proceedings of the 2012 ACM International Conference on Interactive Tabletops and Surfaces. ACM, 2012: 225-234.

10
ARIF A S, SYLLA C. A comparative evaluation of touch and pen gestures for adult and child users[C]//Proceedings of the 12th International Conference on Interaction Design and Children. ACM, 2013: 392-395.

11
VATAVU R D, CRAMARIUC G, SCHIPOR D M. Touch interaction for children aged 3 to 6 years: Experimental findings and relationship to motor skills[J]. International Journal of Human-Computer Studies, 2015, 74, 54- 76.

DOI

12
NACHER V, JAEN J, NAVARRO E, et al. Multi-touch gestures for pre-kindergarten children[J]. International Journal of Human-Computer Studies, 2015, 73, 37- 51.

DOI

13
ZHANG W, YU Z, XU E, et al. CHIP: A children identification system based on mobile phone sensory data[C]//2017 IEEE SmartWorld, Ubiquitous Intelligence & Computing, Advanced & Trusted Computed, Scalable Computing & Communications, Cloud & Big Data Computing, Internet of People and Smart City Innovation (SmartWorld/SCALCOM/UIC/ATC/CBDCom/IOP/SCI). IEEE, 2017: 1-8.

14
NGUYEN T, ROY A, MEMON N. Kid on the phone! Toward automatic detection of children on mobile devices[J]. Computers & Security, 2019, 84, 334- 348.

15
RASHED O, REXIN A, NASI M. Adult or child: Recognizing through touch gestures on smartphones[C]//2019 Digital Image Computing: Techniques and Applications (DICTA): IEEE, 2019: 1-8.

16
CHENG Y, JI X, LI X, et al. Identifying child users via touchscreen interactions[J]. ACM Transactions on Sensor Networks (TOSN), 2020, 16 (4): 1- 25.

17
LAGHARI A, MEMON Z A. Biometric authentication technique using smartphone sensor[C]//2016 13th International Bhurban Conference on Applied Sciences and Technology (IBCAST). IEEE, 2016: 381-384.

18
SHEN C, LI Y, CHEN Y, et al. Performance analysis of multi-motion sensor behavior for active smartphone authentication[J]. IEEE Transactions on Information Forensics and Security, 2018, 13 (1): 48- 62.

DOI

19
AMINI S, NOROOZI V, PANDE A, et al. Deepauth: A framework for continuous user re-authentication in mobile apps[C]//Proceedings of the 27th ACM International Conference on Information and Knowledge Management. ACM, 2018: 2027-2035.

20
HU H, LI Y, ZHU Z, et al. CNNAuth: Continuous authentication via two-stream convolutional neural networks[C]//2018 IEEE International Conference on Networking, Architecture and Storage (NAS). IEEE, 2018: 1-9.

21
LEYFER K, SPIVAK A. Continuous user authentication by the classification method based on the dynamic touchscreen biometrics[C]//2019 24th Conference of Open Innovations Association (FRUCT). IEEE, 2019: 228-234.

22
SONG Y, CAI Z. Integrating handcrafted features with deep representations for smartphone authentication[J]. Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies, 2022, 6 (1): 1- 27.

23
FRANK M, BIEDERT R, MA E, et al. Touchalytics: On the applicability of touchscreen input as a behavioral biometric for continuous authentication[J]. IEEE Transactions on Information Forensics and Security, 2012, 8 (1): 136- 148.

24
TANG H, LIU J, ZHAO M, et al. Progressive layered extraction (PLE): A novel multi-task learning (MTL) model for personalized recommendations[C]//Proceedings of the 14th ACM Conference on Recommender Systems. ACM, 2020: 269-278.

25
LIN C, SONG T, MIAO Y, et al. ChildShield: An implicit and continuous child identification system on smartphones[J]. IEEE Transactions on Dependable and Secure Computing, 2023, 21 (4): 2257- 2272.

文章导航

/