学术研究

一种基于本体的多维物联网数据标识算法

  • 白健 , 1, 2, * ,
  • 李洪伟 1 ,
  • 董贵山 2 ,
  • 操文成 2
展开
  • 1. 电子科技大学计算机工程学院,成都 611731
  • 2. 中国电子科技集团公司第三十研究所网络安全事业部,成都 610041
白健()。

网络出版日期: 2025-01-25

基金资助

四川省重大科技专项(2022ZDZX0038)

版权

版权所有©《网络空间安全科学学报》编辑部 2024

A multidimensional Internet of Things data identification algorithm based on ontology

  • BAI Jian , 1, 2, * ,
  • LI Hongwei 1 ,
  • DONG Guishan 2 ,
  • CAO Wencheng 2
Expand
  • 1. Department of Computer Science and Engineering, University of Electronic Science and Technology of China, Chengdu 611731, China
  • 2. Cybersecurity Business Division, No. 30 Institute, China Electronics Technology Group Corporation, Chengdu 610041, China

Online published: 2025-01-25

Supported by

Sichuan Provincial Major Science and Technology Project.

Copyright

Copyright ©2024 Journal of Aeronautical Materials. All rights reserved.

摘要

物联网(Internet of Things,IoT)是数据存储和管理的重要基础设施,涉及个人隐私、企业利益、国家安全,实现物联网数据可信确权、安全审计、追踪溯源的难点是数据对象化管理。提出了一种基于本体的多维物联网数据安全标识算法,给出了物联网数据安全标识定义,基于本体理念构建了语义特征词库、敏感特征词库,继而设计数据物理指纹、语义指纹、敏点指纹提取算法,建立了物联网数据安全标识生成方法,并对所提出的算法协议进行模拟测试,验证了所提出的物联网数据安全标识方法的唯一性、简洁性、高效性、单向性、真实性。

本文引用格式

白健 , 李洪伟 , 董贵山 , 操文成 . 一种基于本体的多维物联网数据标识算法[J]. 网络空间安全科学学报, 2024 , 2(5) : 32 -43 . DOI: 10.20172/j.issn.2097-3136.240503

Abstract

The Internet of Things (IoT) is a crucial infrastructure for data storage and management, involving personal privacy, corporate interests, and national security. The challenge in achieving trustworthy IoT data rights confirmation, secure auditing, and traceability lies in the management of data objects. An ontology-based multi-dimensional IoT data security labeling method was proposed, with a definition of IoT data security labels being provided. Based on the concept of ontology, semantic feature libraries and sensitive feature libraries were constructed, and algorithms for extracting physical fingerprints, semantic fingerprints, and sensitive point fingerprints of data were designed. A method for generating IoT data security labels was established, and the proposed algorithms and protocols were simulated and tested to verify the uniqueness, simplicity, efficiency, unidirectionality, and authenticity of the proposed IoT data security labeling method.

0 引言

数据作为一种重要生产要素[1],在数据分析、人工智能等领域发挥重要作用,但数据可复制、易篡改的特性给数据的流通共享造成了极大的安全风险[2]。物联网作为数据产生、传输、共享、处理的重要承载基础设施,在数据权属确认、安全风险分析、追踪溯源方面面临极大安全风险,如何对数据进行标识,继而推动物联网数据确权确责,实现数据全生命周期的安全审计,促进数据安全高效共享,成为产业界和学术界共同关注的热点[3]
物联网主要包括云、网、边、端四层,数据全生命周期安全需求贯穿物联网各个阶段,而数据标识在物联网数据确权、访问控制、安全审计、追踪溯源等方面发挥重要作用,物联网数据架构如图1所示。
图 1 物联网数据架构

Fig.1 Data architecture of Internet of Things

(1)数据可信确权:在物联网端侧,需要基于数据标识明确数据权属,为后续数据授权使用、数据资产共享价值分配提供主要依据。
(2)数据访问控制:在物联网边侧,需要根据数据标识对访问者和数据本身进行细粒度访问控制,防止非授权用户越权访问,避免数据泄露。
(3)数据追踪溯源:在物联网网侧,需要基于数据标识对泄露数据进行全生命周期的追踪溯源,明确泄露和滥用的责任主体、发生方式以及可能对其他数据产生的相关影响。
(4)数据安全审计:在物联网云侧,需要根据数据标识对重点数据对象进行实时监控分析,及时发现安全风险或者数据滥用、泄露事件,为预防风险和及时处置提供充分依据。
本文首先给出了物联网数据安全标识的定义,对物联网数据安全标识的覆盖范围进行了界定,继而结合人工智能本体技术对物联网数据安全标识进行建模,构建语义特征词库、敏感特征词库;其次,提出了物联网数据安全标识生成算法,包括物理指纹、语义指纹、敏点指纹三个核心特征;最后,对物联网数据安全标识的功性能进行了测试分析。

1 基础知识

1.1 人工智能本体

在人工智能应用领域,本体指构成领域词汇的基本术语及其关系,以及借助这些术语和关系界定的词汇外延的规则[4],主要包括明确(Explicit)、形式化(Formal)、概念化(Conceptualization)、共享(Share)4个方面。“明确”表明能够明确定义所使用的概念及其相互关联;“形式化”表明能够被计算机精确定义和处理;“概念化”表明可以通过对客观事物的抽象描述获得独立于特定环境的概念模型;“共享”表明其展现了特定领域共有的知识[5-7]
$ O $为一个本体,则$ O= < E,C,R,A,{A}_{x} > $$ E $表示一个非空的实体集合;$ C $表示一个类集合,其中每个子类$ c\in C $$ E $的一个子集;$ R $表示一个关系集合,其中每个关系$ r\in R $$ E\times E $的一个子集;$ A $表示一个属性的集合,其中每个属性$ a $是一个$ E $的变换;$ {A}_{x} $表示一个公理集合,包含一组逻辑公式,用于描述$ E $$ C $$ R $$ A $之间的约束。
本体构造可以对领域知识进行规范化描述,将其从知识应用环境中抽离,实现领域知识的再利用,从而解决不同系统之间信息的迭代与理解问题[8]。首先,把本体引用到资源库建设中,通过本体对资源库领域的知识进行统一规范描述,达成领域内目标资源库之间相关领域知识概念及概念关系之间的共识,实现资源库之间的重用与共享,从而降低资源库建设成本,避免重复建设[9];其次,在文献检索过程中,本体的应用有助于提升语义推理效率,通过集成异构文档与数据知识,帮助机器迅速理解语义和用户提出的问题,并通过清晰展现概念之间的关系实现与用户的有效交互[10];最后,在数字图书馆领域,本体的应用集中在语义检索、实现异构分布系统之间的语义互操作等方面[11]。目前,关于如何利用本体技术实现数据标识构建方面研究较少,但意义巨大。

1.2 数据安全标识

数据安全标识主要分为绑定标和分离标。绑定标主要指数字水印,该技术主要应用于音视频、文档等版权保护和防伪溯源[12-13]
$ D $表示原始数据,$ W $表示水印信息,$ {D}_{w} $表示嵌入水印后的数据,水印嵌入过程可以表示为$ {D}_{w}={f}_{\mathrm{e}\mathrm{m}\mathrm{b}\mathrm{e}\mathrm{d}}(D,W) $,其中$ {f}_{\mathrm{e}\mathrm{m}\mathrm{b}\mathrm{e}\mathrm{d}} $是一个嵌入函数,按照某种算法将$ W $嵌入到$ D $中。
后续,研究人员也尝试将该技术应用于数据库安全保护,IBM Almaden研究中心的Agrawal等[14]首次提出了数据库水印技术,设计了基于统计分析的数据库水印算法。数据库水印技术一直是研究的热点[15-16],但该方法对数据库中的数据进行了一定程度的修改,适用范围受限。随着大数据技术的发展,传统水印嵌入的难度增大,水印被破解清除的难度变小,业界更希望通过分离标的方式实现数据的指纹提取,从而实现对数据的确权标识和确责溯源,但相关研究成果较少。赖韬等[17]通过对数据进行哈希运算,生成数据校验码,继而通过签名算法进行封装,实现物联网数据安全标识,但是标识与数据的关联性不大,对数据局部进行微小修改便会造成标识无法被识别。此外,数据分类分级技术的快速发展[18],给数据业务属性、数据敏感级别的界定提供了可能,数据标识中对于数据分类分级的覆盖也成为一个研究重点,是数据共享、云计算中数据安全风险分析识别和追踪的前提[19-20],但如何让分类分级结果和原始数据形成强绑定关系一直未得到解决。

1.3 物联网数据安全

根据GSMA(Global System for Mobile Communications Association)预测,到2025年,全球物联网经济效益将达到1.1万亿美元,连接数规模将接近250亿[21],每天将产生大量的数据,物联网数据安全成为研究热点,主要包括物联网数据隐蔽传输、安全计算、可信存储、安全审计、安全共享等方面,但相关方法均在数据安全标识方面涉及较少。
在物联网数据隐蔽传输方面,在无人机辅助物联网下行通信场景下,Yan等[22]利用假设检验理论分析检测性能,利用优化理论设计隐蔽传输速率最大化方案;Zhou等[23]研究了无人机辅助物联网上行数据隐蔽传输方案,上述两个方案都无法解决数据传输后追踪溯源的问题。在物联网数据计算安全方面,Liu等[24]提出了一种基于区块链的物联网SDN(Software-Defined Networking)架构,利用区块链分布式架构来提升物联网系统运行的效率,同时引入安全多方计算技术保护物联网数据安全,方案中存在链上、链下数据映射难的问题。在物联网数据可信存储方面,Lu等[25]针对“物联网-云”环境,提出了基于区块链的数据完整性验证方案;Yang等[26]利用基站构建区块链网络来存储和更新信任数据,基站通过综合多个信息来源对接收到的信息进行可信度判定,以减少恶意车辆发布虚假信息所带来的影响,上述方案也存在链上、链下数据映射难的问题。在物联网安全审计方面,Garcia-Teodoro等[27]提出了一种应用于工业物联网数据安全入侵检测的分类方法,但其缺乏对审计数据对象界定问题的研究。在物联网数据安全共享方面,Huang等[28]提出了一种集成无人机和车辆等多种物联网设备的协作信任系统,来保证数据共享的真实性,该系统使用无人机手机物联网设备的感知信息并将其作为基准数据,再基于基准数据验证车辆发送的数据,对车辆构建全局的信任评估,但未解决共享数据追踪溯源的问题。本文提出的数据安全标识通过将数据对象化,可以在数据安全采集、安全传输、安全存储、安全共享、安全处理的全过程发挥重要作用,覆盖数据安全全生命周期,详细对比如表1所示。
表 1 相关文献解决方案覆盖数据生命周期对比

Table 1 Comparison of solution coverage in relevant literature for the data lifecycle

方案 安全采集 安全传输 安全存储 安全共享 安全处理
文献[22] × × ×
文献[23] × × ×
文献[24] × ×
文献[25] × × × ×
文献[26] × ×
文献[27] × × ×
文献[28] × × ×
本文

2 物联网数据安全标识的定义

物联网数据安全标识是数据对象化的关键,是实施物联网数据采集、传输、存储、共享、处理全生命周期安全细粒度管控、安全审计、追踪溯源的核心抓手,本节主要对物联网数据安全标识的内容进行定义。

2.1 物联网数据安全标识的特性

物联网数据安全标识是一种从安全视角对数据定义的方式,通过在物联网采集端对数据进行安全表示,实现对数据进行精准匹配、权属界定、访问控制、血缘追溯等操作,具备唯一性、简洁性、高效性、单向性、真实性。具体来说,唯一性是指物联网数据安全标识和数据是一一对应的关系;简洁性的核心是物联网数据安全标识数据量小;高效性是指物联网数据安全标识的提取、匹配效率高;单向性是指物联网数据安全标识不可泄露原始数据信息:真实性是指物联网数据安全标识一经发布确认,不可篡改。此外,数据安全标识和普通的数据检索存在本质差异,主要表现为1)功能定位方面:数据安全标识用于数据权属界定和溯源,不要求数据的精确查找和定位;2)原始数据方面:数据安全标识的单向性决定了物联网数据安全标识不可能拥有原始数据;3)标识大小方面:数据安全标识的简洁性要求物联网数据安全标识必须是少量的,避免大量数据索引所带来的管理负担。

2.2 物联网数据安全标识的核心内容

根据上述物联网数据安全标识的定义和特性,为了进一步明确其本质含义,本文提出了物联网数据安全标识模型,如图2所示。
图 2 物联网数据安全标识模型

Fig.2 Model of Internet of Things data security identification

(1)描述要素
描述要素主要包含1)唯一标识:对数据进行唯一性定义,可使用编码或者哈希算法计算获得;2)物理标识:从物理角度对数据的0、1分布进行定义;3)语义标识:从语义角度对数据所代表的含义进行定义;4)敏点标识:从敏感性角度对数据所涉及的敏感信息进行定义。
(2)控制要素
控制要素主要包含1)领域分类:数据所属的领域分类,如密码领域;2)功能分类:数据所属的功能分类,如产品设计文档;3)敏感级别:数据所属的敏感等级,具体可参考《数据安全技术-数据分类分级规则》国家标准[29];4)访问控制:从正向或者反向描述,明确允许或者规避的领域、机构、个体等。
(3)扩展要素
扩展要素主要包含1)归属方:明确数据所属机构或者个体;2)归属方签名信息:归属方对数据的签名;3)登记方:明确数据的发布机构或者个体;4)登记方签名信息:登记方对数据的签名。
该模型的难点是对于描述要素的定义,即如何将一个数据对象化。本文着重对描述要素进行建模,并提出具体可行的算法。

2.3 物联网数据安全标识的分类

物联网数据安全标识根据提取对象的不同,可以分为非结构化物联网数据安全标识和结构化物联网数据安全标识。其中,非结构化物联网数据安全标识主要指文档、图片、视频类数据,数据量大,通常存储在非结构化数据库或者磁盘中;结构化物联网数据安全标识主要指库表、接口类数据,数据量小,通常存储在结构化数据库中。本文所描述的物联网数据安全标识建模方法,同时适用于非结构化数据和结构化数据,但为了描述简洁,后续主要针对非结构化数据进行研究和介绍,而结构化数据安全标识将在第4.5小节进行关联建模分析。

3 基于本体的行业领域数据标识模型

物联网作为一种基础设施,所承载的数据内容涉及金融、医疗、交通等各行各业,为了对数据进行精确描述,需要建立针对不同行业的语义知识库。本文构建了基于本体的行业领域标识基础模型,该模型以本体思想为核心,可形式化表示为$ O=\{{C}_{1},{C}_{2},R\} $,其中,$ {C}_{1} $表示物联网数据安全标识本体的语义特征词概念集合;$ {C}_{2} $表示物联网数据安全标识本体的敏感特征词概念集合,$ {C}_{2}\subseteq {C}_{1} $$ R $表示$ {C}_{1} $$ {C}_{2} $中词组数据在文档中共现关系的集合。此处,物联网数据安全标识本体主要基于具体行业领域的物联网数据安全标识本体进行构建,其中,$ {C}_{1} $对数据行业语义相似性进行度量,$ {C}_{2} $对数据敏感语义相似性进行度量。

3.1 行业语义特征词库的构建

基于上述模型,本文给出了行业语义特征词库构建算法,行业语义特征词库的构建流程如图3所示。
图 3 语义特征词库的构建流程

Fig.3 Construction process of industry-specific semantic feature word library

具体的行业语义特征库的构建如算法1所示,给定行业综述性领域文档集合$ D=\left\{{d}_{01},{d}_{02},\cdots ,{d}_{0n}\right\} $和其他行业综述性文档集合$ {D}_{1}=\left\{{d}_{11},{d}_{12},\cdots ,{d}_{1n}\right\} $,算法1输出行业语义特征词库$ O $。步骤1到步骤3主要是对文档$ D $$ {D}_{1} $进行分词合并,生成$ {{\mathrm{S}}}{{\mathrm{D}}} $和分词集合$ {{\mathrm{KD}}}_{1} $,其中:
$ \mathrm{SD}=\left\{\mathrm{sd}_1,\mathrm{sd}_2,\cdots,\mathrm{sd}_n\right\} $
$ {{\mathrm{KD}}}_{1}=\left\{{{\mathrm{kd}}}_{11},{{\mathrm{kd}}}_{12},\cdots ,{{\mathrm{kd}}}_{1n}\right\} $
$ \left\{\left[{{{{\mathrm{sd}}}}}_{1},{{\mathrm{sd}}}_{2}\right],{{\mathrm{sd}}}_{3},{{\mathrm{sd}}}_{4},\cdots ,{{\mathrm{sd}}}_{n}\right\}\to \{{{\mathrm{sd}}}_{1},\left[{{\mathrm{sd}}}_{2},{{\mathrm{sd}}}_{3}\right],{{\mathrm{sd}}}_{4},\cdots ,{{\mathrm{sd}}}_{n}\} $
步骤4使用$ {{\mathrm{KD}}}_{1} $对文档$ D $进行分词合并,生成$ {{\mathrm{KD}}}_{2}=\{{{\mathrm{kd}}}_{21},{{\mathrm{kd}}}_{22},\cdots ,{{\mathrm{kd}}}_{2n}\} $,并根据步骤(3)的规则对集合分词进行排序,输出$ O=\left\{\left({{\mathrm{kd}}}_{1},{{\mathrm{if}}}_{1}\right),\left({{\mathrm{kd}}}_{2},{{\mathrm{if}}}_{2}\right),\cdots , \left({{\mathrm{kd}}}_{n},{{\mathrm{if}}}_{n}\right)\right\} $。其中:
$ {{\mathrm{df}}}_{i}=\mathrm{d}\mathrm{f}\left({{\mathrm{kd}}}_{i},D\right);{{\mathrm{TF}}}_{i}=\sum _{j=0}^{n}{{\mathrm{tf}}}_{ij};{{\mathrm{if}}}_{i}=\mathrm{l}\mathrm{o}\mathrm{g}\left({{\mathrm{TF}}}_{i}\right)\times {{\mathrm{df}}}_{i} $
至此,算法1输出行业语义特征词库$ O= \left\{\left({{\mathrm{kd}}}_{1},{{\mathrm{if}}}_{1}\right),\left({{\mathrm{kd}}}_{2},{{\mathrm{if}}}_{2}\right),\cdots ,\left({{\mathrm{kd}}}_{n},{{\mathrm{if}}}_{n}\right)\right\} $
算法1:语义特征词库构建算法
输入:行业综述性领域文档集合$ D=\left\{{d}_{01},{d}_{02},\cdots ,{d}_{0n}\right\} $,其他行业综述性文档集合$ {D}_{1}=\left\{{d}_{11},{d}_{12},\cdots ,{d}_{1n}\right\} $
输出:行业语义特征词库$ O=\left\{\left({{{{\mathrm{kd}}}}}_{1},{{\mathrm{if}}}_{1}\right), \left({{\mathrm{kd}}}_{2}, {{\mathrm{if}}}_{2}\right),\cdots ,\left({{\mathrm{kd}}}_{n},{{\mathrm{if}}}_{n}\right)\right\} $,其中,$ {{\mathrm{kd}}}_{i} $代表行业语义特征词,$ {{\mathrm{if}}}_{i} $代表相应特征词的权重。
1. 对文档$ D $$ {D}_{1} $进行分词,生成$ {\mathrm{set}}\_{\mathrm{words}} $$ {{\mathrm{set}}\_{\mathrm{words}}}_{1} $,通过$ \mathrm{t}\mathrm{f}\left(t,d\right)=\dfrac{{\mathrm{num}}\_t}{{\mathrm{num}}\_d} $进行词频统计,其中,num_t代表词在文档中出现的次数,num_d代表文档中出现最多词的次数,设置门限$ l $,过滤生成集合$ {{\mathrm{set}}\_{\mathrm{words}}}^{*} $$ {{\mathrm{set}}\_{\mathrm{words}}}_{1}^{*} $,计算综述性停词库$ {\mathrm{stop}}\_{\mathrm{words}}={{\mathrm{set}}\_{\mathrm{words}}}^{*}\cap {{\mathrm{set}}\_{\mathrm{words}}}_{1}^{*} $,合并至开源通用分词停用词库,生成停用词库为$ {{\mathrm{set}}\_{\mathrm{words}}}_{1} $
2. 使用$ {{\mathrm{set}}\_{\mathrm{words}}}_{1} $$ D $进行分词,生成$ {\mathrm{SD}}=\{{{\mathrm{sd}}}_{1}, {{\mathrm{sd}}}_{2},\cdots ,{{\mathrm{sd}}}_{n}\} $
3. 定义下式所示的滑动窗口,遍历$ {\mathrm{SD}} $分词集合,对分词进行组合,生成分词集合$ {{\mathrm{KD}}}_{1}=\{{{\mathrm{kd}}}_{11},{{\mathrm{kd}}}_{12},\cdots ,{{\mathrm{kd}}}_{1n}\} $
$ \left\{\left[{{\mathrm{sd}}}_{1},{{\mathrm{sd}}}_{2}\right],{{\mathrm{sd}}}_{3},{{\mathrm{sd}}}_{4},\cdots ,{{\mathrm{sd}}}_{n}\right\}\to $    $\{{{\mathrm{sd}}}_{1},\left[{{\mathrm{sd}}}_{2},{{\mathrm{sd}}}_{3}\right],{{\mathrm{sd}}}_{4},\cdots ,{{\mathrm{sd}}}_{n}\} $   
4. 使用$ {{\mathrm{KD}}}_{1} $对文档$ D $进行分词合并,生成$ {{\mathrm{{\mathrm{KD}}}}}_{2}= \{{{\mathrm{kd}}}_{21},{{\mathrm{kd}}}_{22},\cdots ,{{\mathrm{kd}}}_{2n}\} $,并根据下述规则对集合分词进行排序,$ O=\left\{\left({{\mathrm{kd}}}_{1},{{\mathrm{if}}}_{1}\right),\left({{\mathrm{kd}}}_{2},{{\mathrm{if}}}_{2}\right),\cdots ,\left({{\mathrm{kd}}}_{n},{{\mathrm{if}}}_{n}\right)\right\} $
(1)计算$ {{\mathrm{df}}}_{i}=\mathrm{d}\mathrm{f}({{\mathrm{kd}}}_{i},D) $${{\mathrm{df}}}_{i} $为词$ {{\mathrm{kd}}}_{i} $在文档集合$ D $中出现的文档个数;
(2)计算词频$ {{\mathrm{TF}}}_{i}={\displaystyle\sum} _{j=0}^{n}{{\mathrm{tf}}}_{ij} $$ {{\mathrm{tf}}}_{ij} $为词$ {{\mathrm{kd}}}_{i} $在文档$ {D}_{i} $中出现的次数;
(3)计算词重要性$ {{\mathrm{if}}}_{i}=\mathrm{l}\mathrm{o}\mathrm{g}\left({{\mathrm{TF}}}_{i}\right)\times {{\mathrm{df}}}_{i} $
注:①式(1)中组合分词个数为2,具体执行时可以根据实际情况进行调整;②步骤4规则中通过取对数的方式降低了单篇文档中词频对于词重要性的影响;③文中通过分词集合求交提取书面语中通用名词,过滤后将会形成行业专用名词;④文中合并停用词库便于对文档内容进行分词处理。

3.2 敏感特征词库的构建

物联网数据涉及个人隐私、企业利益、国家安全,相应的敏感词便是指关系到个人隐私及企业和国家重要内容的数据。因此,本文的敏感特征词概念合集$ {C}_{2} $需要根据具体行业的规定标准去分析,大体可以分为两类。场景1:根据语义词频确定敏感级别,这个方法与上述$ {C}_{1} $的建模方法一致,此处不再做介绍;场景2:根据特殊词汇确定敏感级别,如项目关键词、项目编号、项目信息(一段话或者一句话)等,本文就这种场景下如何构建敏感词汇表进行深入分析。
场景2与$ {C}_{1} $的主要差别体现为:(1)在文档中出现频率较少;(2)特殊词汇、长词汇较多。所以$ {C}_{2} $的构建方法主要基于敏感信息列表,并通过构建本地词向量的方式实现相似词汇的分析,如图4所示。
图 4 敏感特征词库的构建流程

Fig.4 Construction process of sensitive feature word library

具体的敏感特征词库的构建如算法2所示,给定行业领域特征词汇库$ {C}_{1} $,敏感信息句集合$ M $,行业领域文档集合$ D $,步骤1通过分词生成集合$ L $,并对集合L中分词求交集$ Q $$ L=\{{L}_{1}:\left\{{l}_{11},{l}_{12},\cdots ,{l}_{1{z}_{1}}\right\}, {L}_{2}:\left\{{l}_{21}, {l}_{22},\cdots , {l}_{2{z}_{1}}\right\},\cdots , $$ {L}_{l}:\{{l}_{n1},{l}_{n2},\cdots ,{l}_{n{z}_{l}}\}\} $,步骤2通过词向量模型计算相似词汇,最终输出敏感特征词库$ {\mathrm{SQ}} $$ {\mathrm{SQ}}=\{{{\mathrm{SQ}}}_{1}: \left[{q}_{1},{s}_{11},{s}_{12},\cdots ,{s}_{1{e}_{1}}\right],{{\mathrm{SQ}}}_{2} $: $ \left[{q}_{2},{s}_{21},{s}_{22},\cdots , {s}_{2{e}_{2}}\right],\cdots ,{{\mathrm{SQ}}}_{n} : \left[{q}_{n}, {s}_{n1},{s}_{n2},\cdots ,{s}_{n{e}_{n}}\right]\} $
算法2: 敏感特征词库构建算法
输入:行业领域特征词汇库$ {C}_{1} $,敏感信息句集合$ M $,行业领域文档集合$ D $
输出:敏感特征词库$ {\mathrm{SQ}} $和敏感特征序列集合$ L $
1. 使用$ {C}_{1} $$ M $进行分词,生成集合$ L $$ L=\{{L}_{1}: \left\{{l}_{11},{l}_{12},\cdots ,{l}_{1{z}_{1}}\right\},{L}_{2}:\left\{{l}_{21},{l}_{22},\cdots ,{l}_{2{z}_{1}}\right\},\cdots, $ $ {L}_{l}:\{{l}_{n1},{l}_{n2},\cdots , {l}_{n{z}_{l}}\}\left\} {l}_{n{z}_{1}}\right\}\} $,并对集合$ L $中分词求交集,生成集合$ Q $$ Q=\{{q}_{1}, {q}_{2},\cdots ,{q}_{n}\} $
2. 通过word2vec词向量模型计算$ {C}_{1} $$ Q $中的相似词汇,生成集合$ {\mathrm{SQ}} $$ {\mathrm{SQ}}=\{{{\mathrm{SQ}}}_{1}:\left[{q}_{1},{s}_{11},{s}_{12},\cdots ,{s}_{1{e}_{1}}\right], {{\mathrm{SQ}}}_{2}:\} $$ \left[{q}_{2},{s}_{21},{s}_{22},\cdots ,{s}_{2{e}_{2}}\right],\cdots ,{{\mathrm{SQ}}}_{n}:\left[{q}_{n},{s}_{n1},{s}_{n2},\cdots ,{s}_{n{e}_{n}}\right]\} $
注:$ {L} $为敏感特征序列集合,其中$ {{L}}_{{i}} $代表$ {{M}}_{{i}} $敏感信息句对应的分词序列集合。

4 物联网数据安全标识的生成方法

在物联网数据安全标识模型的定义中,控制要素和扩展要素需要根据实际业务场景通过规则进行定义,而描述要素中的物理指纹、语义标识、敏点标识是物联网数据安全标识的核心。本节主要对物理标识、语义标识、敏点标识的提取方式进行设计,物联网数据安全标识的生成流程如图5所示。
图 5 物联网数据安全标识的生成流程

Fig.5 Generation process of Internet of Things data security identifier

4.1 文档数据预处理

文档数据预处理是物联网数据安全标识提取的基础,目标是将文档中多余的格式部分去除,并根据实际需要选择是否对文档进行重点提取,以提升后续整个标识提取的效率和准确性,主要步骤包括文档结构清洗、重点提取(可选择)。文档预处理算法主要提供文档结构转换、去除冗余信息,并最终输出文档核心内容。文档数据预处理如算法3所示。
算法3: 文档数据预处理算法
输入:输入文档$ D $
输出:文档核心内容$ W\_I $
1. 文档结构转换$ W\_{\mathrm{tmp}}=\mathrm{f}\mathrm{i}\mathrm{l}\mathrm{t}\mathrm{e}\mathrm{r}\mathrm{i}\mathrm{n}\mathrm{g}\left(D\right) $
2. 计算$ W=\left\{{w}_{i}\right|{w}_{i}\in W\_{\mathrm{tmp}}\} $,对文档内容进行冗余去除;
3. 提取文档重点内容$ W\_{\mathrm{tmp}}={\mathrm{f}\mathrm{i}\mathrm{l}\mathrm{t}\mathrm{e}\mathrm{r}\mathrm{i}\mathrm{n}\mathrm{g}}_{1}\left(D\right) $
4. 计算$ W\_I=W\cap W\_{\mathrm{imp}} $
注:①$ \mathrm{f}\mathrm{i}\mathrm{l}\mathrm{t}\mathrm{e}\mathrm{r}\mathrm{i}\mathrm{n}\mathrm{g}\left(\right) $是文档结构去除函数,可以将word格式文档转换为文本格式;②$ {\mathrm{f}\mathrm{i}\mathrm{l}\mathrm{t}\mathrm{e}\mathrm{r}\mathrm{i}\mathrm{n}\mathrm{g}}_{1}\left(\right) $是定义文档核心内容的规则函数,可以取标题、取摘要、取关键字等;③特殊格式文档清洗后形成的文本部分内容对于后续实际标识提取没有意义,而且还会降低标识判定的精度;④标识提取性能要求较高,选取对标识提取影响较大的部分作为核心的标识生成要素。

4.2 文本特征提取

文本特征提取主要是基于行业语义特征词库和敏感特征词库对数据进行分词处理,因此物理标识不需要进行该项处理,语义标识进行行业语义特征分词,敏点标识进行行业敏点特征过滤。
文本特征提取如算法4所示,首先给定行业领域特征词汇库$ {C}_{1} $、敏感特征词库$ {C}_{2} $、待处理文本$ D $、敏感特征词库$ SQ $和敏感特征序列集合$ L $,步骤1通过分词生成顺序分词集合$ W=({w}_{1},{w}_{2},\cdots ,{w}_{n}) $,步骤2进行分词合并和词频统计,生成带词频的集合$ {W}_{1}=\{\left({w}_{1},{o}_{1}\right), \left({w}_{2},{o}_{2}\right),\cdots ,\left({w}_{n},{o}_{n}\right)\} $,最后通过步骤3输出文档敏点特征集合$ M=\{{L}_{i}:({l}_{i1},{l}_{i2},\cdots ,{l}_{in}\left)\right\} $
算法4:文本特征提取算法
输出:文档语义特征集合$ {W}_{1} $,和文档敏点特征集合$ M $
输入:行业领域特征词汇库$ {C}_{1} $,敏感特征词库$ {C}_{2} $,待处理文本$ D $,敏感特征词库$ SQ $,敏感特征序列集合$ L $
1. 基于$ {C}_{1} $$ D $进行分词,生成顺序分词集合$ W=({w}_{1}, {w}_{2},\cdots ,{w}_{n}) $
2. 对分词集合$ W $进行分词合并和词频统计,生成集合$ {W}_{1} $$ {W}_{1}=\{\left({w}_{1},{o}_{1}\right),\left({w}_{2},{o}_{2}\right),\cdots ,\left({w}_{n},{o}_{n}\right)\} $,其中$ {o}_{i} $为分词$ {w}_{i} $的词频;
3. 计算$ Tmp=SQ\cap W=\{{t}_{1},{t}_{2},\cdots ,{t}_{n}\} $,执行
(1)设置窗口大小为$ l $,以$ {t}_{i} $为起始截取长度为l的分词,构成集合为$ Tmp=\{\left({t}_{1},\cdots \right),\left({t}_{2},\cdots \right),\cdots ,({t}_{3},\cdots \left)\right\} $
(2)根据$ SQ $$ {t}_{i}\to {q}_{i} $,生成新的归一化集合$ {Tmp}_{2} $
(3)使用$ {Tmp}_{2} $$ L $进行似性匹配,判定敏点匹配度,生成集合$ M=\{{L}_{i}:({l}_{i1},{l}_{i2},\cdots ,{l}_{in}\left)\right\} $
(4)调整$ l $,重新执行步骤(1),将结果合并至集合$ M $
注:$ {W} $为文档$ {D} $按顺序的分词集合,后续敏点标识提取需要按照分词顺序进行筛选。

4.3 物联网数据安全标识计算

物联网数据安全标识计算是指将特征处理后的文本数据转换为固定长度的数据指纹,分别用以对物理序列、语义特征、敏点特征进行描述,便于后续匹配分析。
物联网数据安全标识计算如算法5所示,给定文本核心内容$ W\_I $、文档语义特征集合$ {W}_{1} $和文档敏点特征集合$ M $,分别使用ssdeep算法、simhash算法和步骤3的敏点标识计算算法,最终输出文本物理标识$ {\mathrm{DS}}\_{\mathrm{PID}} $、语义标识$ {\mathrm{DS}}\_{\mathrm{SID}} $、敏点标识$ {\mathrm{DS}}\_{\mathrm{MID}} $
算法5:数据安全标识计算算法
输入:文本核心内容$ W\_I $,文档语义特征集合$ {W}_{1} $,文档敏点特征集合$ M $
输出:文本物理标识$ {\mathrm{DS}}\_{\mathrm{PID}} $,语义标识$ {\mathrm{DS}}\_{\mathrm{SID}} $,敏点标识$ {\mathrm{DS}}\_{\mathrm{MID}} $
1. 使用ssdeep算法[30]$ {\mathrm{DS}}\_{\mathrm{PID}}=\mathrm{s}\mathrm{s}\mathrm{d}\mathrm{e}\mathrm{e}\mathrm{p}(W\_I) $
2. 使用simhash算法[31]$ {\mathrm{DS}}\_{\mathrm{SID}}=\mathrm{s}\mathrm{i}\mathrm{m}\mathrm{h}\mathrm{a}\mathrm{s}\mathrm{h}\left({W}_{1}\right) $
3. 敏点标识计算算法
  (1)计算$ {c}_{i}=\mathrm{H}\mathrm{a}\mathrm{s}\mathrm{h}\left({m}_{i}\right) $,其中${c}_{i} $代表第$ i $个敏点特征;
 (2)计算$ {p}_{i}={c}_{i}\mathrm{m}\mathrm{o}\mathrm{d}n $,其中$ n $代表敏点比特长度;
 (3)计算$ {\mathrm{DS}}\_{\mathrm{MID}}=\displaystyle\sum {2}^{{p}_{i}} $
注:$ \mathrm{H}\mathrm{a}\mathrm{s}\mathrm{h}\left(\right) $算法可以根据实际需求选取。

4.4 物联网数据安全标识封装

为了进一步实现物联网数据安全标识的可信管理,确保数据标识的可查、可验,需要以物理标识、语义标识、敏点标识为核心,融合物联网数据安全标识定义中的描述信息和扩展信息,对物联网数据安全标识进行统一封装。
物联网数据安全标识封装如算法6所示,给定文本核心内容$ W\_I $、控制要素$ {\mathrm{STR}}\_{\mathrm{Control}} $,扩展要素$ {\mathrm{STR}}\_{\mathrm{Extend }}$、文本物理标识$ {\mathrm{DS}}\_{\mathrm{PID}} $、语义标识$ {\mathrm{DS}}\_{\mathrm{SID}} $、敏点标识$ {\mathrm{DS}}\_{\mathrm{MID}} $、数据安全标识签发机构$ {\mathrm{Org}} $和对应私钥签名$ {\mathrm{sk}} $,计算数据唯一标识$ {\mathrm{DS}}\_{\mathrm{DID}} $,组装数据描述信息。
$ {\mathrm{DS}}\_{\mathrm{ID}}\_{\mathrm{Tmp}}=\{{\mathrm{D{S}}}_{\mathrm{T}\mathrm{I}\mathrm{D}},\left\{{\mathrm{ST{R}}}_{\mathrm{C}\mathrm{o}\mathrm{n}\mathrm{t}\mathrm{r}\mathrm{o}\mathrm{l}}\right\},\{{\mathrm{STR}}\_{\mathrm{Extend}}\left\}\right\} $
输出$ {\mathrm{DS}}\_{\mathrm{ID}}=\{{\mathrm{DS}}\_{\mathrm{ID}}\_{\mathrm{Tmp}},{\mathrm{TIME}},{\mathrm{Org}}, {\mathrm{Signa-}} {\mathrm{ture}}\} $,其中,
$ {\mathrm{Signature}}={\mathrm{S}\mathrm{i}\mathrm{g}\mathrm{n}}_{\mathrm{s}\mathrm{k}}\left(\mathrm{H}\mathrm{a}\mathrm{s}\mathrm{h}\right({\mathrm{DS}}\_{\mathrm{ID}}\_{\mathrm{Tmp}}\left|\left|{\mathrm{TIME}}\right|\right|{\mathrm{Org}}\left)\right) $
算法6:物联网数据安全标识封装算法
输入:文本核心内容$ W\_I $,控制要素$ {\mathrm{STR}}\_{\mathrm{Control}} $,扩展要素$ {\mathrm{STR}}\_{\mathrm{Extend}} $,文本物理标识$ {\mathrm{DS}}\_{\mathrm{PID}} $,语义标识$ {\mathrm{DS\_SID}} $,敏点标识$ {\mathrm{DS\_MID}} $,数据安全标识签发机构$ {\mathrm{Org}} $,对应私钥签名${\mathrm{ sk}} $
输出:数据安全标识$ {\mathrm{DS\_ID}} $
1. 计算数据唯一标识$ {\mathrm{DS\_DID}}=UID\left|\right|\mathrm{H}\mathrm{a}\mathrm{s}\mathrm{h}(W\_I) $
2. 计算数据描述信息$ {\mathrm{DS\_ID}}\_{\mathrm{Tmp}}=\{{\mathrm{D{S}}}_{\mathrm{T}\mathrm{I}\mathrm{D}}, \left\{{\mathrm{ST{R}}}_{\mathrm{C}\mathrm{o}\mathrm{n}\mathrm{t}\mathrm{r}\mathrm{o}\mathrm{l}}\right\}, \{{\mathrm{STR}}\_{\mathrm{Extend}}\left\}\right\} $,其中$ {\mathrm{DS\_TID}}= \{{\mathrm{DS\_DID}}, {\mathrm{DS\_PID}}, \mathrm{DS}\_ {{\mathrm{SID}}}, {\mathrm{DS\_MID}}\} $
3. 计算数据安全标识$ {\mathrm{DS\_ID}}=\{{\mathrm{DS\_ID}}\_{\mathrm{Tmp}}, {\mathrm{TIME}}, {\mathrm{Org,Signature}}\} $,其中$ {\mathrm{Signature}}={\mathrm{S}\mathrm{i}\mathrm{g}\mathrm{n}}_{\mathrm{s}\mathrm{k}}\left(\mathrm{H}\mathrm{a}\mathrm{s}\mathrm{h} \right({\mathrm{DS\_ID}}\_ {\mathrm{Tmp}} \left|\left|{\mathrm{TIME}}\right|\right|{\mathrm{Org}}\left)\right) $
注:①控制要素和扩展要素根据实际需求进行完善;②签名算法$ \mathrm{S}\mathrm{i}\mathrm{g}\mathrm{n}\left(\right) $根据实际需求进行选取。
数据安全标识对应的标识检索可以通过DS_DID、DS_PID、DS_SID、DS_MID4个标识分别进行检索,其中DS_DID直接搜索匹配,DS_PID采用ssdeep提供的相似性匹配算法进行物理标识相似度验证,DS_SID和DS_MID采用汉明距离进行搜索匹配。此外,对于数据安全标识的有效性,可以使用对应的签名验证算法和相应签发组织机构的公钥对标识的可信性进行验证,便于在数据的传递过程中对数据的可信性进行确认。

4.5 结构化数据适用性分析

结构化数据通常由少量的多个字符串组成,其可以映射到一张数据表中的一行数据或者一个API(Application Programming Interface)服务接口,在结构化物联网数据安全标识的生成中,不可能对每条结构化数据均进行指纹提取,因为提取后的数据指纹可能比原始数据量还大,同时在后续应用过程中被再次应用的概率较小。因此,结构化物联网数据安全标识的提取主要针对一张数据表中的字段组合或者一个API服务结构中的字段组合进行。
图6为结构化数据语义指纹的提取流程。针对库表中的行数据,主要通过语义指纹的方式对字段相关性进行识别,完成数据到语义特征的转换,继而提取相应的语义指纹,最终实现对结构化数据语义指纹的跟踪管理。物理指纹由于数据量一般较少,不用提取。敏点指纹待匹配到具体的库表之后,根据库表定义的字段敏感级别进行对应匹配即可。
图 6 结构化数据语义指纹的提取流程

Fig.6 Extraction process of semantic fingerprints from structured data

综上,通过语义指纹的提取,可以实现对结构化数据的标识提取和匹配。

5 物联网数据安全标识的性能测试分析

5.1 特征词库测试

在行业语义特征词库构建方面,本文选取三个行业数据,分别是网络安全行业、金融行业、电力行业,并收集三个行业综述类文献各100篇,作为行业语义特征词库构建的基础数据。生成的行业语义特征词库的测试数据如图7所示。
图 7 行业语义特征词库的测试数据

Fig.7 Test data of industry semantic feature word library

在敏感特征词库构建方面,本文选取10个敏感句子,以敏感句子、行业语义特征词库、行业文档作为输入,生成敏感特征词库。生成的敏感特征词库的测试数据如图8所示。
图 8 敏感特征词库的测试数据

Fig.8 Test data of sensitive feature word library

5.2 物联网数据安全标识测试

基于上述特征词库,本文对物理指纹、语义指纹、敏点指纹的指纹功能和性能进行了测试。
(1)物理指纹
分别选取大小为250 KB、500 KB、1 000 KB的文件数据,分别截取95%、90%、80%、60%和30%的文本构成样本数据集,计算物理指纹并进行相似度匹配,结果如图9所示。
图 9 物理指纹的相似度匹配测试结果

Fig.9 Test results of physical fingerprint similarity matching

(2)语义指纹
选取85篇网络安全相关原始文本,对其按照句子进行划分,分别随机截取其中90%、80%、60%、30%、10%的句子进行语义指纹提取测试,结果如图10所示。
图 10 语义指纹的相似度匹配测试结果

Fig.10 Test results of semantic fingerprint similarity matching

随机选取85篇网络安全相关原始文本,分别计算他们之间的海明距离,测试本文语义特征词库对同一领域文本的区分性,测试结果图11所示。
图 11 语义指纹的区分性测试结果

Fig.11 Test results of semantic fingerprint discriminability

(3)敏点指纹
以生成敏感特征词库的10个句子为基准,使用大语言模型各自生成10个相似句子,共计100个相似句子,使用敏感特征词库对100个句子计算敏点指纹,并与10个基准句子的敏点指纹比较,海明距离$\leqslant $15的敏点指纹统计结果如图12所示。
图 12 敏点指纹匹配测试数据

Fig.12 Test data of sensitive point fingerprint matching

(4)性能测试
本文在Intel Xeon E5-2630 v4 2.20 GHz CPU,110 GB内存,单核物理环境下,对物理指纹、语义指纹、敏点指纹提取性能进行了测试,选取测试样本大小分别为100 KB、150 KB、200 KB、250 KB、300 KB、400 KB、500 KB、700 KB、900 KB、1 200 KB,每个大小10个文本文档,计算平均值,测试结果图13所示。
图 13 指纹提取性能测试数据

Fig.13 Test data of fingerprint extraction performance

5.3 物联网数据安全标识分析

(1)特性分析
上述测试表明,本文设计的物联网数据安全标识方法具有以下特点。
1)唯一性:描述要素中的唯一标识、物理指纹、语义指纹、敏点指纹对数据进行了全维度描述,从而可对数据进行唯一性和相似性判定。
2)简洁性:物理指纹、语义指纹、敏点指纹分别从数据序列、语义特征、敏点构成角度对数据进行了特征定义,针对数据形成物联网数据安全标识,相应的标识长度控制在512 bit以内。
3)高效性:行业语义特征词库能准确、快速地实现行业语义特征词的筛选,构建针对行业领域的专用特征词库,为数据语义标识的构建提供基础;敏感特征词库能通过对敏点的分析,结合行业语义词库实现敏点中分词的相似词扩展,为数据中敏点的快速识别提供基础。
4)单向性:在物理指纹、语义指纹、敏点指纹提取过程中均使用哈希算法进行了数据压缩,避免从指纹数据反推出原始数据,具备单向性。
5)真实性:数字签名技术使得数据标识不可篡改,确保物联网数据安全标识的真实性。
(2)数据安全生命周期覆盖性分析
1)数据采集:作为数据管理的起点,通过对数据提取数据安全标识,支撑数据全生命周期的安全管理。
2)数据传输:通过数据安全标识对重点数据的流转进行安全泄露检测和分类分级保护,防止重要数据泄露,提升了数据安全防护能力。
3)数据存储:通过数据安全标识对不同级别的数据进行分级加密保护,在提升重点数据安全防护的同时,降低了普通数据使用的复杂度,实现了存储数据的细粒度管理。
4)数据处理:通过数据安全标识对数据处理过程进行安全监测审计,防止数据非法滥用。
5)数据交换:通过数据安全标识实现数据分类分级按需共享,在共享过程中对敏感数据进行脱敏处理。
6)数据销毁:通过数据安全标识实现了数据内容的精细化销毁。

6 结束语

本文针对物联网数据全生命周期管理过程中面临的数据对象化表征需求,对物联网数据安全标识进行了定义,并基于本体理论提出了语义特征词库、敏感特征词库的构建方法,继而利用特征词库设计了数据物理指纹、语义指纹、敏点指纹的提取算法,给出了物联网数据安全标识的生成方法,为物联网数据的安全治理和共享流通提供了核心依据。本方法对文本数据完全适配,同时对数据库字段等结构化数据也进行了适用性分析。后续,笔者将以本文方法为依托,重点聚焦结构化物联网数据安全标识提取方法的进一步研究,提升指纹提取方法的适配广度、识别精度、提取效率,为实现物联网数据的全面、高效、准确标识提供技术支撑。
1
中共中央国务院. 关于构建更加完善的要素市场化配置体制机制的意见[R]. 北京:新华社,2020.

The Central Committee of the Communist Party of China and The State Council. Opinions on building a more perfect system and mechanism for the market-oriented allocation of factors [R]. Beijing:Xinhua News Agency,2020.

2
United States Department of Defense. DoD data strategy[R]. Washington:DoD,2020.

3
National Science and Technology Council. Critical and emerging technologies list update[R]. Washington:National Science and Technology Council,2024.

4
NECHES R, FIKES R, FININ T W, et al. Enabling technology for knowledge sharing[J]. AI Magazing, 1991, 12 (3): 36- 56.

5
GUARINO N G. Ontologies and knowledge bases:towards a terminological clarification[M]. Amsterdam:International Scientific,Technical,and Medical Publisher,1995.

6
BORST W N. Construction of engineering ontologies for knowledge sharing and reuse[D]. Enschede:University of Twente,1997.

7
GUARINO N,GIARETTA P. Ontologies and knowledge bases:towards a terminological clarification[M]//Towards very large knowledge bases. Amsterdam:IOS Press,1995.

8
黄新平. 政府网站信息资源多维语义知识融合研究[D]. 长春:吉林大学,2017.

HUANG X P. A study on the multidimensional semantic knowledge integration of government website information resources [D]. Changchun:Jilin University,2017.

9
蔡炜, 邢建国. 基于本体的图书馆文献资源共享技术研究[J]. 情报科学, 2007, 25 (11): 1696- 1701.

DOI

CAI W, XING J G. Research on technology for library literature resource sharing based on ontology[J]. Information Science, 2007, 25 (11): 1696- 1701.

DOI

10
田欣. 基于知识本体的图书馆语义检索系统模型研究[J]. 情报杂志, 2006, 25 (6): 78- 81.

DOI

TIAN X. Research on the model of library semantic retrieval system based on knowledge ontology[J]. Journal of Intelligence, 2006, 25 (6): 78- 81.

DOI

11
董慧. 本体与数字图书馆[M]. 武汉:武汉大学出版社,2008.

DONG H. Ontology and digital libraries[M]. Wuhan:Wuhan University Press,2008.

12
PODILCHUK C I, DELP E J. Digital watermarking: algorithms and applications[J]. IEEE Signal Processing Magazine, 2001, 18 (4): 33- 46.

DOI

13
PETITCOLAS F A. Watermarking schemes evaluation[J]. IEEE Signal Processing Magazine, 2000, 17 (5): 58- 64.

14
AGRAWAL R,KIERNAN J. Watermarking relational databases[C]//Proceedings of the 28th International Conference on Very Large Data Bases. Morgan Kaufmann, 2002:155-166.

15
SILEDAR S,TAMANE S. A distortion-free watermarking approach for verifying integrity of relational databases[C]//2020 International Conference on Smart Innovations in Design,Environment,Management,Planning and Computing (ICSIDEMPC). IEEE, 2020:192-195

16
汪天琦, 张迎周, 邸云龙. 基于动态差分扩展的强鲁棒数据库水印算法研究[J]. 网络与信息安全学报, 2023, 9 (5): 150- 165.

DOI

WANG T, ZHANG Y, DI Y. Research on a strong robust database watermarking algorithm based on dynamic difference expansion[J]. Journal of Network and Information Security, 2023, 9 (5): 150- 165.

DOI

17
赖韬, 杨远辉, 颜亮. 物联网数据安全标识技术及其应用研究[J]. 通信技术, 2020, 53 (11): 2811- 2815.

DOI

LAI T, YANG Y H, YAN L. Research on Internet of Things data security identification technology and its applications[J]. Communication Technology, 2020, 53 (11): 2811- 2815.

DOI

18
刘超, 何正庆, 徐建荣, 等. 公共数据分类分级管理方法研究[J]. 网络安全和信息化, 2024, (3): 9- 11.

DOI

LIU C, HE Z Q, XU J R, et al. Research on public data classification and grading management methods[J]. Cybersecurity and Informatization, 2024, (3): 9- 11.

DOI

19
沈剑, 周天祺, 曹珍富. 云数据安全保护方法综述[J]. 计算机研究与发展, 2021, 58 (10): 2079- 2098.

DOI

SHEN J, ZHOU T Q, CAO Z F. Overview of cloud data security protection methods[J]. Journal of Computer Research and Development, 2021, 58 (10): 2079- 2098.

DOI

20
王惠峰, 李战怀, 张晓, 等. 云存储中数据完整性自适应审计方法[J]. 计算机研究与发展, 2017, 54 (1): 172- 183.

DOI

WANG H F, LI Z H, ZHANG X, et al. Adaptive audit method for data integrity in cloud storage[J]. Journal of Computer Research and Development, 2017, 54 (1): 172- 183.

DOI

21
GSMA. The mobile economy 2020[R]. London:GSMA,2021.

22
YAN S,HANLY S V,COLLINGS B,et al. Hiding unmanned aerial vehicles for wireless transmissions by covert communications[C]//ICC 2019-2019 IEEE International Conference Communications (ICC). IEEE,2019:1-6.

23
ZHOU X, YAN S, SHU F, et al. UAV-enabled covert wireless data collection[J]. IEEE Journal on Selected Areas in Communications, 2021, 39 (11): 3348- 3362.

DOI

24
LIU L,FENG W,CHEN C,et al. BS-IoT:blockchain based software defined network framework for internet of things[C]//IEEE INFOCOM 2020-IEEE Conference on Computer Communications Workshops (INFOCOM WKSHPS). IEEE,2020:496-501.

25
LU N, ZHANG Y, SHI W, et al. A secure and scalable data integrity auditing scheme based on hyperledger fabric[J]. Computers & Security, 2020, 92, 101741.

26
YANG Z, YANG K, LEI L, et al. Blockchain-based decentralized trust management in vehicular networks[J]. IEEE Internet of Things Journal, 2019, 6 (2): 1495- 1505.

27
GARCIA-TEODORO P, DIAZ-VERDEJO J, MACIA-FERNANDEZ G, et al. Anomaly-based network intrusion detection: techniques, systems and challenges[J]. Computers & Security, 2009, 28 (1-2): 18- 28.

28
HUANG S, ZENG Z, OTA K, et al. An intelligent collaboration trust interconnections system for mobile information control in ubiquitous 5G networks[J]. IEEE Trasactions on Network Science and Engineering, 2021, 8 (1): 347- 365.

29
中国国家标准化管理委员会. GB/T 43697-2024 数据安全技术-数据分类分级规则[S]. 北京:中国标准出版社,2024.

China National Standardization Management Committee. GB/T 43697-2024 Data security technology-rules for data classification and grading[S]. Beijing:China Standard Press,2024.

30
KORNBLUM J. Identifying almost identical files using context triggered piecewise hashing[J]. Digital Investigation, 2006, 3, 91- 97.

DOI

31
MANKU G S,JAIN A,DAS SARMA A. Detecting near-duplicates for web crawling[C]//International Conference on World Wide Web. ACM,2007:141.

文章导航

/