Academic Research

Obfuscated web traffic recognition method based on denoising dynamic window recurrent neural network

  • RAO Chen , * ,
  • HUANG Jianan ,
  • LIU Weiwei
Expand
  • School of Automation, Nanjing University of Science and Technology, Nanjing 210094, China

Online published: 2025-01-25

Copyright

Copyright ©2024 Journal of Aeronautical Materials. All rights reserved.

Abstract

Obfuscation of the web traffic is a common tactic used by many illicit online communications to circumvent monitoring, making the effective web traffic recognition crucial for cyberspace protection. In the field of network traffic recognition, the deep learning technology has become a key to break through the limitations of traditional methods and to enhance the recognition accuracy. A method for the obfuscated encrypted web traffic recognition based on the denoising dynamic window recurrent neural network (DDWRNN) was proposed, aiming to efficiently identify the obfuscated encrypted web traffic. Firstly, leveraging the denoising and feature extraction capabilities of denoising autoencoders (DAE), the robust deep spatiotemporal features were effectively extracted from the traffic data. Subsequently, the designed dynamic window recurrent neural network captured the dynamic features of traffic across various time scales using its multi-scale dynamic temporal windows. Experimental results showed that the average recognition accuracy of the proposed method reached 95.7% for the obfuscated encrypted web page traffic. Compared to other machine learning and deep learning approaches, the proposed method not only showed an improvement of the recognition accuracy but also demonstrated strong capabilities to handle the complex traffic patterns and to adapt to the dynamically changing network environments.

Cite this article

RAO Chen , HUANG Jianan , LIU Weiwei . Obfuscated web traffic recognition method based on denoising dynamic window recurrent neural network[J]. Journal of Cybersecurity, 2024 , 2(6) : 98 -109 . DOI: 10.20172/j.issn.2097-3136.240607

0 引言

近年来,随着移动互联网技术的飞速发展,信息的传播方式从传统的线性、单向传递逐渐演变为多元、互动的新模式。据《中国互联网络发展状况统计报告》统计,截至2023年6月,我国网民规模达10.79亿人次,互联网普及率达76.4%[1]。近80%的网民通过网络浏览器进行各类信息的浏览,从而产生了海量的Web访问流量,同时也滋生了各种网络空间恶意行为,给我国网络空间安全监管带来了巨大的挑战。
当前网页流量中往往采用加密的方式来进行内容的传输[2-4]。据互联网巨头谷歌公司所述,自2017年起,用户在使用谷歌服务的网页中超过90%使用了加密手段以保障信息传输安全,且以超文本传输安全协议(Hypertext Transfer Protocol Secure)为主流的加密协议占比达到了97%。加密协议的广泛普及为用户隐私提供了保障,但也为恶意混淆流量的检测带来了一定难度。在此情形下,现有的深度包检测技术难以实现对网络中加密流量内容的有效提取和分析。
被动流量检测方法是在保持用户感知特性与不执行加解密操作的前提下,识别恶意混淆加密流量的主要手段,研究的重点是流量特征的选择与构建。被动流量检测方法可通过监测一些流量的基本特征参数(如数据包到达时间间隔分布、数据包往返时延、数据包长度的分布、连接建立和销毁的频率等)来推测一些关键性的敏感信息[5-8]。随着被动流量检测技术的日益成熟,其抵御问题也成为当前研究者在网络通信领域中的研究热点[9-12]。流量混淆作为一种通过模糊原始流量的协议、形状等特征将流量基本特征进行混淆的技术,已经受到许多研究者的关注,被视为可有效抵御流量分析的主要技术手段之一。
网络攻击者为了进一步增强抵御被动流量检测的能力,越来越多地采取了对加密网页流量进行时空特征混淆的方式来伪装其通信行为。此类方式通过分析目标网页暴露的流量模式,提取流量时空特征来对自身通信行为进行伪装混淆,能够在加密机制下进一步混淆网页流量原有的时空特性,从而规避现有的检测方法[13-15]。因此,此类特征混淆型加密网页流量的有效识别与行为模式分析对于网络空间安全治理有着重要的现实意义。
当前针对特征混淆加密网页流量识别的研究相对较少,本文提出一种基于去噪动态窗循环神经网络(Denoising Dynamic Window Recurrent Neural Network,DDWRNN)的混淆加密网页流量识别方法,基于去噪自编码器(Denoising Autoencoder,DAE)的降噪和特征提取能力有效提取具有较强鲁棒性的流量深层次时空特征,通过设计的动态窗循环神经网络的多尺度动态时间窗口捕获流量在不同时间尺度上的动态特征。实验结果表明,所提模型能够高效地识别经过混淆处理的加密网页流量。

1 相关研究

本文的研究重点在于特征混淆型加密网页流量的识别。此类流量是传统加密流量与流量变形技术的结合,随着流量变形技术的不断发展,特征混淆型加密网页流量的识别难度不断提升。

1.1 流量变形技术相关研究

为了抵御流量统计特征分析,目前网页流量变形技术主要分为基于协议改变的流量变形技术与基于特征混淆的流量变形技术。Dusi等[16]指出使用如点对点协议(Peer-to-Peer)、E-mail、超文本传输协议及安全外壳协议(Secure Shell)等协议作为隧道载体进行通信,可以绕过网络安全策略。修改数据流长度特征和时间特征以隐藏真实的包长分布与时间特征分布情况是一种常见的变形操作手段,其中,一种基础和简单的方法是将所有包都填充至长度为MTU的数据流,统一数据流长度来破坏包长分布特征,以抵御基于包长分布特征的网站指纹攻击。但这种方法以较高的带宽开销为代价,在实际网络中可能会增加负担。为了减少带宽开销,有学者提出了更合理的防御措施。Juarez等[17]提出了一种基于负载的自适应填充方法,这种轻量级混淆方法有效降低了网页流量识别的准确率。Wright等[18]提出了一种凸优化方法,将原始流量特征转化为另一目标流量特征的流量混淆技术,最小化混淆所带来的额外开销,降低各种流量分类器的准确性。Li等[19]提出了GlowGAN工具。该工具使用基于生成对抗网络(Generative Adversarial Network,GAN)的方法对包个数和包长特征进行模仿,实现流量变形,误导监管者使之判断为其他流量进而躲避流量检测。Huang等[20]提出了一种增强随机噪声包插入方法,通过预先收集分析目标网页流量特征,再根据目标网页流量不同长度数据包分布特性采用噪声包自适应拟合插入方法。基于协议改变的变形技术涉及在原始流量中加入协议隧道和额外的数据包协议头,此种变形方法开销较大且难以实施;而基于特征调整的变形技术在保持原流量协议不变的前提下改变流量的时空特征,更易于实施,当前已被广泛应用。

1.2 流量识别技术相关研究

针对混淆流量识别的研究工作,加密协议的普及使得早期依赖明文指纹信息的检测策略已无法满足当前检测需求。为此,研究者提出多种基于数据包特征、数据流特征及原始流量特征的方法进行检测,并利用机器学习和深度学习对流量的时空统计特征、协议特征及行为模式等进行分析。基于传统机器学习的检测方法通常结合流量特征工程技术提取流量的数据包级、会话级大量统计特征,并使用支持向量机(Support Vector Machine,SVM)、决策树等机器学习模型进行流量的识别与分类。文献[21]利用恶意软件传输层安全性协议(Transport Layer Security)流量数据集的前20个数据包长度和上下行方向构造特征向量供SVM学习,但是该方法在现实网络环境中易被规避。王曦锐等[22]采用集成学习思想,提出了一种基于加权Stacking模型的Tor流量识别方法,结合数据流层面的时间相关性特征,对K近邻、SVM和极端梯度提升进行不同的加权改进,并构建两层Stacking模型,实现了较低的漏报率。基于深度学习的检测方法则采用端到端的学习技术,重点在于如何对输入数据进行特征表征,以避免传统方法复杂的特征提取过程。当前大部分研究人员使用的深度学习模型主要为卷积神经网络、循环神经网络、基于注意力的长短期记忆网络和胶囊神经网络等。Shen等[23]将流量聚合矩阵用作卷积神经网络的输入集,实现了对混淆后Tor流量的有效识别。Tang等[24]将基于注意力的长短期记忆网络与胶囊神经网络结合,应用到VPN流量的识别中。蒋彤彤等[25]基于流量层次结构,结合长短期记忆网络和Text CNN,整合加密流量的多尺度局部特征和双层全局特征,并引入多头注意力机制,提出了一种基于层次化时空特征与多头注意力模型的端到端恶意加密流量识别方法。研究表明,该方法具有更强的表征和识别能力。

2 加密网页流量时空特征分析

加密网页流量作为一种典型的时空数据,需要从时间特征和空间特征两方面进行分析。本文对加密网页流量的包级基本时空特征及其流级时空特征展开关联分析。

2.1 加密网页流量包级时间特征分析

时间特征分析的核心在于深入探究数据包之间的包到达时间间隔,根据定义的不同,包到达时间间隔可分为包间时延(Inter-Packet Delay,IPD)与往返时延(Round-Trip Time,RTT)两种。包间时延Td描述的是相邻同向数据包之间的发送时间间隔,一定程度上反映了客户端和服务端处理数据的性能与效率;往返时延Tr是指从发送方发送数据至首次收到接收方的响应数据所经历的时延,可以决定通信链路中的拥塞程度和服务质量。首先,客户端在$ {t}_{0} $时刻发送数据包,数据包经过排队时延以及路由转发的链路时延$ {t}_{1} $到达Web服务器;其次,Web服务器处理上行包并选择下行传输的资源,该处理过程耗时为$ {t}_{2} $;再次,Web服务器将确认的数据包进行反向传输并历时$ {t}_{3} $;最后,客户端在$ {t}_{4} $时刻收到确认包,往返时延计算方法如式(1)所示:
$ \begin{array}{c}{\mathrm{RTT}}={t}_{4}-{t}_{0}={t}_{1}+{t}_{2}+{t}_{3}\end{array} $

2.2 加密网页流量包级空间特征分析

空间特征体现在流量长度、数据包数量、传输资源等方面,这些特征主要取决于包头特定字段、包长度、包数量、包方向等基本特征。由于不同服务类型的网页流量基本特征各有不同,因此空间特征在负载长度分布、窗口尺寸以及分片规律等方面存在差异。
窗口尺寸是指接收端的窗口大小,用来表示接收端所能接收的数据量。其功能是平衡通信双方数据的发送和接收速率,以防止因网络阻塞而导致数据丢失。调整窗口尺寸字段会直接影响后续发送端的资源分配和资源传输速率。数据包长度由包头长度和有效负载长度组成,可以反映该数据包传输数据量的大小。其中,包头长度通常根据协议格式确定,为固定长度,因此包长度主要由有效负载长度($ {\mathrm{P}\mathrm{a}\mathrm{y}\mathrm{l}\mathrm{o}\mathrm{a}\mathrm{d}}_{\mathrm{l}\mathrm{e}\mathrm{n}} $)决定。有效负载长度可以通过IP总长度字段$ {L}_{{\mathrm{tlen}}} $、IP首部长度字段$ {V}_{{\mathrm{ihl}}} $和传输控制协议(Transmission Control Protocol,TCP)首部长度字段$ {V}_{{\mathrm{thl}}} $计算得出,如式(2)所示。
$ \begin{array}{c}{\mathrm{P}\mathrm{a}\mathrm{y}\mathrm{l}\mathrm{o}\mathrm{a}\mathrm{d}}_{\mathrm{l}\mathrm{e}\mathrm{n}}={L}_{\mathrm{t}\mathrm{l}\mathrm{e}\mathrm{n}}-4{V}_{\mathrm{i}\mathrm{h}\mathrm{l}}-4{V}_{\mathrm{t}\mathrm{h}\mathrm{l}}\end{array} $
流量中数据包数量一定程度上反映了流量传输的资源大小、分片大小以及网络状况等。较大的传输资源和分片大小通常意味着更多数据包数量,较差的网络条件可能导致TCP重传包数量增加,从而增多整条流的包数量。流量中每个资源块的大小由分片长度确定,通过统计分片内的字节数和数据包数,不仅能够全面展现出资源量的大小,还能够揭示请求资源的类型,并体现不同类型流量之间的差异。

2.3 加密网页流量流级时空特征关联分析

流持续时间是指整条流从开始到结束的时间跨度,主要由包间时延、往返时延等基本特征决定。流持续时间反映了数据流从建立连接到断开连接的总资源传输时间,与网络状况、传输资源以及服务器的性能密切相关。
流持续时间$ {f}_{\mathrm{d}\mathrm{t}} $由上行包间时延$ {t}_{\mathrm{u}\mathrm{p}} $、往返时延$ {t}_{\mathrm{R}\mathrm{T}\mathrm{T}} $、下行包间时延$ {t}_{\mathrm{d}\mathrm{o}\mathrm{w}\mathrm{n}} $和一般时延(下行与上行时间差)$ {t}_{\mathrm{d}\mathrm{u}} $组成,表达形式如式(3)所示。其中,$ a $$ b $$ c $分别为上行包间时延$ {t}_{\mathrm{u}\mathrm{p}} $、往返时延$ {t}_{\mathrm{R}\mathrm{T}\mathrm{T}} $、下行包间时延$ {t}_{\mathrm{d}\mathrm{o}\mathrm{w}\mathrm{n}} $的数量,$ n $为完整流中数据包总数,$ {t}_{\mathrm{a}\mathrm{r}{i}} $为第$ i $个包的到达时间,$ {t}_{\mathrm{e}{i}} $为第$ i $个包与第$ i-1 $个包的时间间隔,即包间时间间隔。当连续两个数据包的方向相同时,$ {t}_{\mathrm{e}{i}} $对应于包间时延;若前者为上行包,后者为下行包,$ {t}_{\mathrm{e}{i}} $则对应于往返时延;反之,则对应于一般时延。
$ \begin{split} {f}_{\mathrm{d}\mathrm{t}}&={\sum }_{i=1}^{a}{t}_{\mathrm{u}\mathrm{p}{i}}+\\&{\sum }_{i=m}^{b}{t}_{\mathrm{R}\mathrm{T}\mathrm{T}m}+{\sum }_{i=j}^{c}{t}_{\mathrm{d}\mathrm{o}\mathrm{w}\mathrm{n}j}+\\&{\sum }_{i=k}^{d}{t}_{\mathrm{d}\mathrm{u}\mathrm{k}}={\sum }_{i=2}^{n}{t}_{\mathrm{e}{i}}\end{split} $
$ \begin{array}{c}{t}_{\mathrm{e}{i}}={t}_{\mathrm{a}\mathrm{r}{i}}-{t}_{\mathrm{a}\mathrm{r}\left(i-1\right)},i\geqslant 2\end{array} $
流长度即整条流的字节数,可反映该条流中通信双方在流持续期间传输的总资源量。不同类型网页的流长度因传输资源总量不同而存在差异。流长度与流量的包级基本空间特征密切相关,由数据包长度以及包数量决定,可通过整条流所有数据包长度值相加得到,如式(4)所示,其中$ f_{\mathrm{l}\mathrm{e}\mathrm{n}i} $表示流长度;$ {p}_{\mathrm{l}\mathrm{e}{\mathrm{n}}i} $表示第i个包长度;n表示包数量。
$ \begin{array}{c}{f}_{{\mathrm{len}}}={\displaystyle\sum }_{i=1}^{n}{p}_{{\mathrm{len}}i}\end{array} $
最大报文长度(Maximum Segment Size, MSS)包是原始应用层承载资源过大经过TCP分片处理后产生的。而MSS包占比是由MSS包总数与数据包总数的比值计算得到的。MSS包占比由包头特定字段、包数量以及包长度决定,如式(5)所示。其中,$ {\mathrm{n}\mathrm{u}\mathrm{m}}_{\mathrm{M}\mathrm{S}\mathrm{S}} $表示整条流中满载包的数量;N表示整条流中的数据包。
$ {f}_{\mathrm{M}\mathrm{S}\mathrm{S}}=\frac{{\mathrm{n}\mathrm{u}\mathrm{m}}_{\mathrm{M}\mathrm{S}\mathrm{S}}}{N} $
不同服务类型网页流量的流持续时间特征、流长度、MSS包占比存在明显差异,因此,流持续时间、流长度与MSS包占比是流量混淆与流量检测中的典型特征。

3 基于时空特征分析的DDWRNN混淆加密网页流量识别方法

当前流量混淆方法广泛采用将网页流量时空特征混淆的伪装策略,一般检测手段难以识别。由于当前混淆方法多在数据包层面对流量特征进行修改,而未注重与其关联的流级特性,因此本文提出一种基于DDWRNN的混淆加密网页流量识别方法。
基于DDWRNN混淆加密网页流量识别框架如图1所示,分为流量预处理模块、特征集建立模块与混淆加密网页流量识别模块。
图 1 基于DDWRNN络混淆加密网页流量识别框架

Fig.1 Obfuscated encrypted web traffic recognition framework of DDWRNN

流量预处理模块用于获取混淆加密网页流量并过滤其中的无效流样本。该模块首先将捕获的混淆加密网页流量样本进行流量拆分,基于五元组(源IP、源端口、目的IP、目的端口、传输层协议)将样本流量分离为多个数据流文件,其次对重复数据包进行去重,删除空流和数据包数量小于3的无效流并过滤非HTTPS流量。
特征集建立模块用于逐包提取每条流中的数据报文信息,构建数据流统一时空特征表征并用CSV文件表示。所有数据流量样本的统一时空特征表征集将作为混淆加密网页流量识别模块的输入数据集。
混淆加密网页流量识别模块用于对表征的数据流进行流量类型识别。该模块首先将数据流统一时空特征表征数据集划分为训练集、测试集和验证集,其次基于设计的DDWRNN模型对数据流统一时空表征进行深度特征捕获,最后输出混淆加密网页流量类型的识别结果并进行有效性评估。

3.1 统一时空特征表征

在混淆加密网页流量识别任务中,尤其是对于流级识别任务中的深度学习模型,流量表征至关重要。数据流的输入表征需要满足三个主要条件:首先是完整性,即保持数据流的原始特征不失真,在一个完整的流表征方法下,模型基本可以识别出对目标任务有效的特征[26-27];其次是统一性,考虑到模型都期望有一个固定尺寸的输入,包数量存在差异的数据流必须采用尺寸相同的表征方式;最后是对齐性,确保表征中的每个元素都精确对应数据包的特定特征,以防止错位的特征在学习过程中产生噪声,影响模型的准确性[28]
为了充分挖掘加密网页流量包级时空特征与流级时空特征之间的关联性,本文将构建基于包级特征的统一时空数据流表征,将各类型加密网页流量通过维度扩充、标准化等手段处理为统一形式,以保持样本数据维度的一致性。
本文构建的统一时空特征表征形式如图2所示,将流量数据包与数据流两种不同维度特征以二阶矩阵的形式结合,横向为各数据包级别特征向量,可反映数据包彼此之间存在空间维度的关联性。根据原始流中数据包的时间序列先后顺序对所有数据包表征进行纵向拼接,数据包彼此之间存在时间维度的关联性。为了保证统一时空特征表征的完整性,$ n $为所有流中数据包数量的最大值,对于不足$ n $个数据包的流,使用0将缺少的部分包级特征填充至统一维度,最终一条完整的流量可由一个$ n*6 $的矩阵向量表征。将各加密网页样本流量按图2的形式进行模型输入时空表征,可得到式(6)~式(8)的表示形式。
图 2 统一时空特征表征

Fig.2 Unified spatiotemporal feature representation

$ F=\left\{{f}_{1},{f}_{2},\cdots ,{f}_{m}\right\} $
$ {f}_{i}=\left\{{p}_{1}^{i},{p}_{2}^{i},\cdots ,{p}_{n}^{i}\right\}$
$ {p}_{j}^{i}=\left\{{v}_{1}^{i},{v}_{2}^{i},\cdots ,{v}_{6}^{i}\right\} $
式中,$ F $是包含$ m $条流量样本$ {f}_{i} $的数据流集合;$ {f}_{i} $是由$ n $个数据包构成的统一时空特征表征矩阵;$ {p}_{j}^{i} $是第$ i $条流样本中第$ j $个数据包的一维统一时空特征向量,由时间戳、负载长度、包方向、窗口尺寸、满载标志和分片序号组成,维度为$ {R}^{1\times 6} $
并且,还需对不同量纲的时空特征按式(9)进行标准化处理,使各指标处于同一数量级,消除因量纲不同带来的影响,其中$ \mu $$ \sigma $$ x $的均值与标准差。
$ {x}^{*}=\frac{x-\mu }{\sigma } $
通过上述包级时空特征提取与流级统一时空特征表征向量构建,最终得到维度为$ {R}^{m\times n\times 6} $的各网页流量统一时空表征数据集,为后续模型训练奠定基础。

3.2 DDWRNN混淆加密网页流量识别模型

混淆加密网页流量通常包含多种干扰和噪声包,具有一定的复杂性,使得直接提取有效特征具有挑战性。DAE通过从带噪声包的输入数据中学习,可以有效地提取深层的特征,减小噪声包的影响,为后续模型提供更清晰的输入数据,增强模型的鲁棒性。因此本文采用DAE作为模型的前置模块,有效提取混淆加密网页流量数据中的深层特征。
基于流级数据统一时空特征表征的混淆加密网页流量识别分类问题属于多变量时间序列问题。流时间序列存在以下三个特征:(1)流时间序列存在明显的相关性,流时间序列特征的提取依赖不同时间节点之间的信息依存关系;(2)流时间序列不同类型的变量之间存在交互行为关系,如结合时间戳和包负载长度信息可以揭示流量的传输速率特征;(3)流时间序列不同特征的提取需要在多个不同尺度的时间窗上进行,如数据包负载分布的特征是按照每个包来获取的,而TLS分片通常涉及多个数据包的负载,其特征捕获的时间窗口大小应大于负载分布特征捕获的窗口大小。因此,处理流时间序列的分类模型需要能够挖掘单变量自相关特征、识别多变量之间的耦合性互相关特征以及在不同的尺度上捕获这些特征。与一般多变量时间序列不同,流时间序列在特征提取的多尺度时间窗口方面展现了独特性。在典型的多变量时间序列分类器模型中,多时间窗口尺度特征学习通常假设同一类型特征的时间窗口大小是固定的,然而这一假定对于流时间序列并不完全适用。在流时间序列中,相同类型特征的时间窗口尺度往往是动态变化的。因此本文采用动态窗循环神经网络(DWRNN)作为模型的后置模块,对DAE提取的深层特征进行学习,捕获分析DAE难以有效获取的时序关系。
基于上述对混淆加密网页流量时空特性的描述,本文提出了DDWRNN模型,该模型能实现对混淆加密网页流量时空特征的有效挖掘,DDWRNN模型结构如图3所示。
图 3 DDWRNN模型结构

Fig.3 DDWRNN model structure

3.2.1 基于堆叠式DAE的深层特征挖掘机制

自编码器(Autoencoder,AE)是一种由输入层、隐藏层和输出层组成的神经网络,它通过从输入数据中学习来计算有向边上的权重。自编码器的工作流程可以通过数学公式表达,式(10)将输入层描述为向量$ \boldsymbol{x} $,隐藏层的输出为向量$ \boldsymbol{h} $,输入层到隐藏层的权重表示为矩阵$ \boldsymbol{W} $和偏置项向量$ \boldsymbol{b} $,定义激活函数$ {f} $来处理从输入层到隐藏层的数据传播。
$ {\boldsymbol{h}}=f\left(\boldsymbol{W}{\boldsymbol{x}}+{\boldsymbol{b}}\right) $
同理,将输出层的输出定义为向量$ {\boldsymbol{y}} $,隐藏层到输出层的权重为矩阵$ \boldsymbol{W}^\prime $和偏置项向量$ {{{\boldsymbol{b}}}}^\prime $,此处使用的激活函数为$ {f}\mathrm{^\prime} $。隐藏层到输出层的数据传播由式(11)计算:
$ {\boldsymbol{y}}={{f}}{\mathrm{^\prime}}\left({\boldsymbol{W}}{\mathrm{^\prime}}{\boldsymbol{h}}+{{\boldsymbol{b}}}{^\prime}\right) $
自编码器通过调整权重$ \boldsymbol{W} $$ \boldsymbol{W}\mathrm{^\prime} $来实现输入$ x $和输出$ y $的一致性,这些权重的优化基于式(12)计算:
$ \begin{aligned} \begin{array}{*{20}{c}}{}^{\min }\quad\\{}_{{\boldsymbol{W}}, {\boldsymbol{b}}, {\boldsymbol{W}}^{\prime}, {\boldsymbol{b}}^\prime}\end{array} \sum\nolimits_i\left\|{\boldsymbol{x}}_i-{f}^{\prime}\left({\boldsymbol{W}^{\prime} }{f}\left(\boldsymbol{W} {\boldsymbol{x}}_i+{\boldsymbol{b}}\right)+{\boldsymbol{b}}^{\prime}\right)\right\|_2^2\end{aligned}$
通过将一个自编码器的隐藏层作为另一个自编码器的输入可以构建堆叠式自编码器,实现特征的降维表示。这种结构允许模型逐层提取更加抽象和复杂的数据特征,从而在每个层级上实现更深层次的数据理解和表示。在自编码器中引入噪声,可定义为DAE,DAE在训练过程中对输入数据增加扰动,提供模型学习从噪声数据中重建原始数据的能力,可以避免过度学习或过拟合,深入挖掘流量隐藏低维特征[29]。由于混淆加密网页流量时空特征具有复杂性,因此本文采用堆叠式DAE处理流量数据。首先通过初级DAE层提取流量数据基本特征,其次逐级通过更高层的DAE进一步提炼和压缩这些特征。每一层DAE的输出不仅提供了数据的低维表示,还捕获了流量数据不同层次的抽象模式与结构。DAE的层叠结构可以实现从原始的高维复杂网络流量数据中有效提取深层次低维特征表示。

3.2.2 多尺度动态窗堆叠式双层RNN结构

流时间序列的处理要求特征挖掘网络对于不同时间步的信息具备记忆能力,因此本文选取RNN模型作为流时间序列分类模型的基本结构。文献[30]表明,尽管RNN的链式网络结构在时间上的延展性赋予其挖掘深层次时域特性的能力,但仅含单个隐藏层的RNN网络在输入数据空间信息抽象能力表现上有所不足,对于输入维度较高的单时间步信息,单层RNN难以完全建立起从输入到输出的相关性特征。为了深入提取流时间序列中的单变量自相关特征与多变量间耦合性互相关特征,本文采用堆叠式的双层RNN结构。对于每个时间步而言,第一层RNN Cell接收流时间序列的单时间步信息为输入,第二层RNN Cell则以第一层RNN Cell输出的隐状态信息作为输入。每层输出的隐状态信息都会传递给下一时间步对应层的RNN Cell。隐状态信息可表示为式(13)~式(14):
$ {{\boldsymbol{h}}}_{t}^{\left[1\right]}=f\left({{\boldsymbol{W}}}^{\left[1\right]}{{\boldsymbol{x}}}_{t}+{{\boldsymbol{U}}}^{\left[1\right]}{{\boldsymbol{h}}}_{t-1}^{\left[1\right]}+{{\boldsymbol{b}}}^{\left[1\right]}\right)$
$ {{\boldsymbol{h}}}_{t}^{\left[2\right]}=f\left({{\boldsymbol{W}}}^{\left[2\right]}{{\boldsymbol{h}}}_{t}^{\left[1\right]}+{{\boldsymbol{U}}}^{\left[2\right]}{{\boldsymbol{h}}}_{t-1}^{\left[2\right]}+{{\boldsymbol{b}}}^{\left[2\right]}\right)$
式中,$ {{\boldsymbol{h}}}_{t-1}^{\left[1\right]} $$ {{\boldsymbol{h}}}_{t}^{\left[1\right]} $分别为第一层RNN Cell在t-1时间步和t时间步的隐状态输出;$ {{\boldsymbol{h}}}_{t-1}^{\left[2\right]} $$ {{\boldsymbol{h}}}_{t}^{\left[2\right]} $分别为第二层RNN Cell的隐状态输出;$ {{\boldsymbol{x}}}_{t} $t时间步的输入,$ {{\boldsymbol{U}}}^{\left[1\right]} $$ {{\boldsymbol{U}}}^{\left[2\right]} $分别为隐状态权重矩阵;$ {{\boldsymbol{W}}}^{\left[1\right]} $$ {{\boldsymbol{W}}}^{\left[2\right]} $分别为输入权重矩阵。
考虑到流时间序列时空特征具有不同的窗口尺度与强动态性,本文在基础的RNN Cell结构中嵌入了MSDW(Multi-Scale Dynamic Window)模块,MSDW模块首先基于文献[31]中时钟循环神经网络(ClockWork RNN,CW-RNN)的设计思路。该模块在每个时间步对不同窗口尺度的重要性进行量化,并基于量化的重要性调节不同窗口尺度的隐状态更新,从而使模型能够自适应地提取关键特征尺度。MSDW模块由隐状态分解和动态自适应调制两部分构成。
(1)隐状态分解:为了捕获流时间序列在不同时间窗口尺度上的特征,首先需要将RNN Cell的隐状态拆分为多个窗口尺度的独立隐状态块,并针对各自的窗口尺度进行处理。对于给定的流时间序列$ {\boldsymbol{X}}=\left\{{{\boldsymbol{x}}}_{1},{{\boldsymbol{x}}}_{2},\cdots,{{\boldsymbol{x}}}_{T}\right\} $,其中,$ {{\boldsymbol{x}}}_{t}\in {R}^{{d}_{0}} $$ {d}_{0} $是单时间步输入向量的维度;$ T $是时间序列的维度。RNN Cell的隐状态向量$ {{\boldsymbol{h}}}_{t} $可由式(15)表示:
$ {\boldsymbol{h}}_{\boldsymbol{t}}=f\left({\boldsymbol{W}}{{\boldsymbol{x}}}_{t}+{\boldsymbol{U}}{{\boldsymbol{h}}}_{t-1}+{\boldsymbol{b}}\right) $
式中,输入向量权重矩阵$ \boldsymbol{W}\in {R}^{d\times {d}_{0}} $;隐状态向量权重矩阵$ \boldsymbol{U}\in {R}^{d\times d} $$ {\boldsymbol{b}}\in {R}^{d} $$ f\left(\;\;\right) $表示$ \mathrm{t}\mathrm{a}\mathrm{n}h $激活函数。
在时间步$ t $中,RNN Cell的隐状态向量会被分解为$ K $个独立的隐状态向量,即$ {\boldsymbol{h}}_{\boldsymbol{t}}=[{\boldsymbol{h}}_{\boldsymbol{t}}^{1},\cdots,{\boldsymbol{h}}_{\boldsymbol{t}}^{\boldsymbol{K}}] $,其中$ {{\boldsymbol{h}}}_{t}^{K}\in {R}^{p} $$ p=d/K $。对应的隐状态向量权重矩阵为$ \widetilde{\boldsymbol{U}}=[{\widetilde{\boldsymbol{U}}}^{1},\cdots,{\widetilde{\boldsymbol{U}}}^{K}] $,其中$ {\widetilde{\boldsymbol{U}}}^{K}\in {R}^{p\times p} $。输入向量权重矩阵为$ \widetilde{\boldsymbol{W}}=[{\widetilde{\boldsymbol{W}}}^{1},\cdots,{\widetilde{\boldsymbol{W}}}^{K}] $,且$ {\widetilde{{\boldsymbol{W}}}}^{K}\in {R}^{p\times {d}_{0}} $。隐状态向量被分解后,每个独立更新的隐状态子向量通过串联构成完整的隐状态向量$ {{\boldsymbol{h}}}_{t} $,新的隐状态更新方式可由式(16)和式(17)表示:
$ {\boldsymbol{h}}_{t}^{K}=f\left({\widetilde{{\boldsymbol{W}}}}^{K}{{\boldsymbol{x}}}_{t}+{\widetilde{{\boldsymbol{U}}}}^{K}{{\boldsymbol{h}}}_{t-1}^{K}+\widetilde{{\boldsymbol{b}}}\right) $
$ {{\boldsymbol{h}}}_{t}=\left[{{\boldsymbol{h}}}_{t}^{1},\cdots ,{{\boldsymbol{h}}}_{t}^{K}\right] $
式中,$ f\left(\;\;\right) $表示$ \mathrm{t}\mathrm{a}\mathrm{n}h $激活函数;$ p=d/K $$ \widetilde{{\boldsymbol{b}}} $为可学习参数$\widetilde{{\boldsymbol{b}}}\in {R}^{p} $
RNN Cell的隐状态向量被分解后,每一个独立的隐状态子向量可以按照特定的时间窗口值独立更新。假定时间窗口尺度集合为$ S=\{{s}_{1},\cdots,{s}_{K}\} $,对于时间窗口尺度$ {s}_{K} $,隐状态向量$ {{\boldsymbol{h}}}_{t}^{K} $将在每$ {s}_{K} $个时间步更新一次,此时$ {h}_{t}^{K} $的更新规则可表示为:
$ {\boldsymbol{h}}_{\boldsymbol{t}}^{\boldsymbol{K}}=\left\{\begin{array}{l}{\boldsymbol{h}}_{\boldsymbol{t}-1}^{\boldsymbol{K}},t{\mathrm{mod}}{s}_{K}\ne 0\\ f\left({\widetilde{\boldsymbol{W}}}^{K}{{\boldsymbol{x}}}_{t}+{\widetilde{\boldsymbol{U}}}^{K}{{\boldsymbol{h}}}_{t-1}^{K}+\widetilde{{\boldsymbol{b}}}\right),其他\end{array}\right. $
若当前时间步与第$ K $个隐状态向量的窗口尺度模值为0,即$ t\text{}\text{mod}\text{}{s}_{K}=0 $时,则当前时间步的隐状态向量$ {{\boldsymbol{h}}}_{t}^{K} $将基于$ t-1 $时刻隐状态向量$ {{\boldsymbol{h}}}_{t-1}^{K} $更新生成,否则将不更新前一时间步的隐状态向量,并将前一时间步的隐状态向量复制得到当前隐状态向量。
通过上述对于RNN Cell原始隐状态向量的多尺度分解和更新策略,模型能够从目标流时间序列中提取多尺度相关性特征,从而更全面地理解和预测流时间序列数据的行为。
(2)动态自适应调制:经过隐状态分解之后,虽然模型能够捕获到多尺度的流时间序列特征,但每个独立的隐状态向量获取特征的时间窗口尺度仍然是固定的。为适应流时间序列中的动态特性,本文引入一种时间窗口尺度动态自适应调制方法,基于前一时间步的隐状态信息调节不同尺度的特征,使得模型在不同的时间步中能够关注不同的时间窗口尺度。
首先,结合当前时间步的输入向量$ {{\boldsymbol{x}}}_{t} $和前一时间步的隐状态向量$ {{\boldsymbol{h}}}_{t-1}^{K} $生成每个时间步的分布$ {\alpha }_{t} $,其生成方式如式(19)所示:
$ {\alpha }_{t}=\text{s}\text{o}\text{f}\text{t}\text{m}\text{a}\text{x}\left({\boldsymbol{W}}{^\prime}{{\boldsymbol{x}}}_{t}+{\boldsymbol{U}}{{^\prime}}{\boldsymbol{h}}_{\boldsymbol{t}-1}+{{\boldsymbol{b}}}{^\prime}\right)$
式中,$ {\alpha }_{t}\in {R}^{K} $表示在当前时间步$ K $个独立的隐状态向量对应的窗口尺度的重要性,$ {\alpha }_{t}^{K} $越大,窗口尺度$ {s}_{K} $对于当前时间步越重要。$ {{\boldsymbol{W}}}{^\prime}\in {R}^{K\times {d}_{0}} $$ {{\boldsymbol{U}}}{^\prime}\in {R}^{K\times d} $$ {b}{^\prime}\in {R}^{K} $,三者均为可学习参数。
基于窗口尺度的重要性分布$ {\alpha }_{t} $来调制各尺度的特征,通过$ {\alpha }_{t} $调制生成的隐状态向量更新规则可表示为:
$ {\boldsymbol{h}}_{\boldsymbol{t}}^{\boldsymbol{K}}=\left\{\begin{array}{l}{\boldsymbol{h}}_{\boldsymbol{t}-1}^{\boldsymbol{K}},\;\;t\text{m}\text{o}\text{d}{s}_{K}\ne \text{0}\\ f\left({\widetilde{\boldsymbol{W}}}^{K}{{\boldsymbol{x}}}_{t}+{\widetilde{\boldsymbol{U}}}^{K}\left({\alpha }_{t}^{K}{{\boldsymbol{h}}}_{t-1}^{K}\right)+\widetilde{{\boldsymbol{b}}}\right), 其他\end{array}\right. $
为防止连续乘以小于1的数值使得隐状态数值接近0而导致梯度消失,$ {\alpha }_{t} $仅在进行更新操作时用于调制生成当前时间步的隐状态向量,而在复制操作中不使用$ {\alpha }_{t} $分布向量进行调制。
通过调制不同窗口尺度的隐状态信息,模型能够在每个时间步自适应地选择最重要的窗口尺度,从而捕获时间窗口尺度动态变化的深层次时间序列特征。

4 实验结果与分析

4.1 实验环境及数据集

本文的流量采集工作全部在实验室网络环境下进行。流量监测点设置于实验室路由网关处,利用镜像转发技术捕获实验所需各类型网页流量并保存。流量样本采集工作主要通过Python编写的自动化脚本完成,结合Selenium、Scapy、Pyautogui等第三方开源库进行网页操作模拟和流量的自动化捕获与保存。服务器配置以及深度学习模型开发环境如表1所示。
表 1 服务器配置与开发环境

Table 1 Server configuration and development environment

项目配置信息
操作系统Windows 10 64位
CPUIntel(R) Xeon(R) CPU E5-2630 v3 @2.40 GHz
GPUNVIDIA GeForce GTX 1080Ti/PCle/SSE2
内存大小64 GB
磁盘空间1 TB
开发环境Python-3.7.9/Tensorflow-1.13.1/Numpy-1.20.3/ Pandas-1.3.5/Scikit-learn-1.0.2
为了确保网页流量的数据多样性和采集一致性,避免其他因素导致的网页流量差异性,流量采集过程中需遵循以下原则:
(1)确保样本多样性。流量采集应遵循时间段随机性、网页类型多样性以及浏览器客户端版本多样性等原则,提供样本的多样性及复杂度,模拟真实网络环境下网页流量的生成。
(2)维持采集条件的一致性。流量采集应统一网页保持时间、固定采集时长以及不存在网页下拉行为。
(3)减少无关流量影响。预先设置相关路由参数,确保只有目标网页IP流量可以经过镜像网关转发,从而避免其他无关流量对实验样本的干扰。
流量采集工作历时一个月,在一天内各个时间段分别采集qq.com、weibo.com、apple.com、douyin.com 四类网页流量,并将这四类网页流量样本使用WTF-PAD进行流量混淆,经WTF-PAD混淆后流量改变了原始流量时间和空间上的分布特征。WTF-PAD通过分析当前网络环境下的包间间隔分布,在闲时时段通过发送伪造数据包以实现流量特征混淆,且不会给流量增加任何人为的延迟,能够以增加带宽开销作为代价降低流量识别的准确率。WTF-PAD提供多种统计特征分布拟合模式,本文后续实验选取混淆效果最优的“normal_rcv”混淆模式对捕获的原始流量样本进行混淆,然后重新缩放时间戳以匹配原始数据,混淆后此四类网页分别称为qq、weibo、apple、douyin。实验数据集如表2所示,其中80%的数据集为训练集,10%的数据集为测试集,10%的数据集为验证集,三者均由混淆后流量样本随机划分生成。
表 2 实验数据集信息

Table 2 Experimental dataset information

数据集 网页名称 样本流数量 总计
训练集 qq 11594 38759
weibo 9452
apple 7416
douyin 10297
测试集 qq 1449 4845
weibo 1182
apple 927
douyin 1287
验证集 qq 1448 4846
weibo 1183
apple 928
douyin 1287

4.2 模型参数设定

DDWRNN需预设时间窗口尺度$ S $来对隐状态进行分解,为达到最优识别效果,本文对参数$ s $的最优设置进行探究。根据文献[24]中对于CW-RNN模型的相关研究,隐状态分解后,每个分解出的隐状态通常选取2的指数幂作为时间窗口尺度,即对于$ s=\{{s}_{1},{s}_{2},\cdots,{s}_{{{I}}}\} $$ {s}_{i}={2}^{i-1} $,当$ I=1 $时,模型将不对隐状态进行分解。
依次选取$ s $分别为$ \left\{\mathrm{1,2}\right\} $$ \{\mathrm{1,2},4\} $$ \{\mathrm{1,2},\mathrm{4,8}\} \{\mathrm{1,2}, \mathrm{4,8}, 16\}\{\mathrm{1,2},\mathrm{4,8},\mathrm{16,32}\} $进行实验,相应的混淆网页类型识别准确率如图4所示,其中横轴表示不同窗口尺度向量维度。实验发现,随着窗口尺度维度的增加,模型的识别准确率先升高后降低,当I = 4即$ s=\{\mathrm{1,2},\mathrm{4,8}\} $时,模型表现最佳。这表明在较低的维度下,DDWRNN模型未能有效学习到较大时间窗口尺度的流时间序列特征,影响了识别性能。而在维度过高时,隐状态被分解为多个低维度的独立部分,每部分由于信息量不足导致特征丢失,从而影响了模型的表现。因此,选择窗口尺度向量参数为$ s=\{\mathrm{1,2},\mathrm{4,8}\} $作为参数设定。综合上述参数的设定,DDWRNN模型的详细参数设定如表3所示。
图 4 不同时间窗口尺度下DDWRNN模型识别准确率变化

Fig.4 Variation in recognition accuracy of the DDWRNN model under different time window scales

表 3 DDWRNN模型相关参数

Table 3 DDWRNN model related parameters

参数项目参数数值
AE层数3
输入维度 (Layer 1)6
输入维度 (Layer 2)128
输入序列时间步数180
隐藏状态数目(Layer 1 & Layer 2)128
隐藏状态窗口尺度向量$ \{\mathrm{1,2},\mathrm{4,8}\} $
Input_Dropout (Layer 1)0.1
Input_Dropout (Layer 2)0.25
batch_size16
epoch20
初始学习速率0.001
优化器Adam
损失函数Cross_Entropy

4.3 实验分析

4.3.1 实验评价指标

针对实验所采用模型,使用准确率(Accuracy)、精确率(Precision)、召回率(Recall)、和F1-score这4种指标综合评判模型的性能,4种指标具体定义如式(21)~式(24)所示。其中,TP、FP、TN、FN分别代表正确识别为目标类型的混淆网页、错误识别为其他类型的混淆网页、正确识别为其他类型的混淆网页、错误识别为目标类型的混淆网页。
$ {\mathrm{Accuracy}}=\frac{\mathrm{T}\mathrm{P}+\mathrm{T}\mathrm{N}}{\mathrm{T}\mathrm{P}+\mathrm{T}\mathrm{N}+\mathrm{F}\mathrm{P}+\mathrm{F}\mathrm{N}}$
$ {\mathrm{Recall}}=\frac{\mathrm{T}\mathrm{P}}{\mathrm{T}\mathrm{P}+\mathrm{F}\mathrm{N}} $
$ {{F}}1=2\frac{{\mathrm{Precision}}\times {\mathrm{Recall}}}{{\mathrm{Precision+Recall}}} $
$ {\mathrm{Precision}}=\frac{\mathrm{T}\mathrm{P}}{\mathrm{T}\mathrm{P}+\mathrm{F}\mathrm{P}} $

4.3.2 混淆网页类型识别结果

通过设定深度学习早停机制(Early Stopping Strategy,ESS)训练本文模型。具体而言,当模型在验证集上的损失函数在近5轮epoch中不再减少时,则停止训练并保存损失函数值最小的模型。该策略不仅可以保证模型不发生过拟合现象,同时也可适应不同的数据集以实现训练效率最优。模型在训练过程中的准确率与损失变化如图5所示。从图中可以看出,在初始阶段随着迭代次数的增加,模型准确率不断提升,从epoch为8时开始,准确率与损失均趋于稳定,准确率趋于1,损失趋于0,此时模型性能达到最优。
图 5 DDWRNN模型训练过程中准确率与损失变化情况

Fig.5 Accuracy and loss variation during the training process of the DDWRNN model

采用DDWRNN模型对四种混淆加密网页流量的识别结果如图6所示。从图中可以看出,DDWRNN模型对四种混淆加密网页流量类型的整体识别效果较好,四项指标均达到0.9以上。其中,该模型对douyin的识别效果较好,指标可以达到0.97左右,而对qq识别效果较差,指标为0.93左右。qq.com作为一个新闻平台,可能会频繁更新内容,这种高度的动态更新可能导致流量模式不断变化,其混淆后的流量模式依旧保持高度动态性,从而增加模型识别的难度。而douyin.com主要提供短视频服务,对其进行混淆后,其流量模式可能相对更加统一和可预测,如视频流的数据量和传输模式,这可能使得模型更容易准确识别。
图 6 DDWRNN模型不同网页评估指标分布

Fig.6 Distribution of evaluation metrics for different web types of DDWRNN model

为验证本文提出的DDWRNN模型的有效性,将原始的CW-RNN模型[31]改为使用堆叠式RNN结构的CW-SRNN(Clock Work Stacked Recurrent Neural Network)模型,还选取了决策树、CNN+LSTM等基本模型进行对比实验。所有模型均在相同的实验条件下进行评估,各个模型的识别评价指标如图7所示。可以看出,决策树模型识别准确率最低,只有0.88左右,这是由于传统机器学习难以捕捉并学习不同类型混淆加密网页之间的深层次时空特征分布差异,这也是本文采取深度学习模型的原因。相比之下,CNN+LSTM模型表现出更高的准确率,CNN能有效提取局部空间特征,而LSTM则擅长处理流时间序列中的时间依赖性,这种组合使得CNN+LSTM模型在处理具有复杂结构的流量数据时具有较强的优势。综合来看,DDWRNN模型的评估指标均有明显提升且优于CW-SRNN模型和其他基准模型,模型识别准确率达到95.7%,这表明DDWRNN模型对混淆加密网页流量的识别能力是有所提升的,也证明了本文方法的有效性。
图 7 不同模型评估结果

Fig.7 Evaluation results of different models

5 结束语

本文提出了一种基于DDWRNN的混淆加密网页流量识别方法,实现了对混淆加密网页流量的识别。实验结果表明,DDWRNN模型在识别混淆加密网页流量方面表现优异,其平均识别准确率达到了95.7%,相比于现有的机器学习和深度学习方法有显著提升。此外,在面对不同混淆策略和动态变化的网络条件时,DDWRNN模型在稳定性与灵活性方面也表现出色,能够有效地识别混淆加密网页流量,更好地满足网络空间的安全需求。下一步在本文基础上将研究如何提高模型对于其他混淆策略的适应性,以提升模型的泛化能力。
1
CNNIC. 第52次《中国互联网络发展状况统计报告》[EB/OL]. (2023-8-28)[2023-10-20]. http://www.cnnic.net.cn/n4/2023/0828/c199-10830.html.

CNNIC. The 52nd statistical report on Chinese Internet development [EB/OL]. (2023-8-28)[2023-10-20]. http://www.cnnic.net.cn/n4/2023/0828/c199-10830.html.

2
PAPADOGIANNAKI E, IOANNIDIS S. A survey on encrypted network traffic analysis applications, techniques, and countermeasures[J]. ACM Computing Surveys, 2021, 54 (6): 1- 35.

3
ACETO G, CIUONZO D, MONTIERI A, et al. Mobile encrypted traffic classification using deep learning: experimental evaluation, lessons learned, and challenges[J]. IEEE transactions on network and service management, 2019, 16 (2): 445- 458.

DOI

4
SHEN M, LIU Y, ZHU L, et al. Optimizing feature selection for efficient encrypted traffic classification: a systematic approach[J]. IEEE Network, 2020, 34 (4): 20- 27.

DOI

5
MAIOLINI G,BAIOCCHI A,IACOVAZZI A,et al. Real time identification of SSH encrypted application flows by using cluster analysis techniques[C]//NETWORKING 2009:8th International IFIP-TC 6 Networking Conference. Aachen,Germany:May 11-15,2009. Proceedings 8. Springer Berlin Heidelberg,2009:182-194.

6
ZENG X, CHEN X, SHAO G, et al. Flow context and host behavior based shadowsocks’s traffic identification[J]. IEEE Access, 2019, 7, 41017- 41032.

DOI

7
DENG Z,LIU Z,CHEN Z,et al. The random forest based detection of shadowsock's traffic[C]//2017 9th International Conference on Intelligent Human-Machine Systems and Cybernetics (IHMSC). IEEE,2017,2:75-78.

8
SHEN M, YE K, LIU X, et al. Machine learning-powered encrypted network traffic analysis: a comprehensive survey[J]. IEEE Communications Surveys & Tutorials, 2022, 25 (1): 791- 824.

9
ZANG M,ZHENG C,DITTMANN L,et al. Towards continuous threat defense:In-Network traffic analysis for IoT gateways[J]. IEEE Internet of Things Journal,2023.

10
HAFEEZ I,ANTIKAINEN M,TARKOMA S. Protecting IoT-environments against traffic analysis attacks with traffic morphing[C]//2019 IEEE International Conference on Pervasive Computing and Communications Workshops (PerCom Workshops). IEEE,2019:196-201.

11
JANSEN R,JOHNSON A. Safely measuring tor[C]//Proceedings of the 2016 ACM SIGSAC Conference on Computer and Communications Security,2016:1553-1567.

12
MOORE W B,TAN H,SHERR M,et al. Multi-class traffic morphing for encrypted voip communication[C]//Financial Cryptography and Data Security:19th International Conference,FC 2015. San Juan,Puerto Rico:January 26-30,2015,Revised Selected Papers 19. Springer Berlin Heidelberg,2015:65-85.

13
VERMA G,CIFTCIOGLU E,SHEATSLEY R,et al. Network traffic obfuscation:an adversarial machine learning approach[C]//MILCOM 2018-2018 IEEE military communications conference (MILCOM). IEEE,2018:1-6.

14
LIU L, YU H, YU S, et al. Network traffic obfuscation against traffic classification[J]. Security and Communication Networks, 2022, 2022 (1): 3104392.

15
GRANADOS A,MIAH M S,ORTIZ A,et al. A realistic approach for network traffic obfuscation using adversarial machine learning[C]//Decision and Game Theory for Security:11th International Conference,GameSec 2020. College Park,MD,USA:October 28–30,2020,Proceedings 11. Springer International Publishing,2020:45-57.

16
DUSI M, CROTTI M, GRINGOLI F, et al. Tunnel hunter: detecting application-layer tunnels with statistical fingerprinting[J]. Computer Networks, 2009, 53 (1): 81- 97.

DOI

17
JUAREZ M,IMANI M,PERRY M,et al. Toward an efficient website fingerprinting defense[C]//Computer Security–ESORICS 2016:21st European Symposium on Research in Computer Security. Heraklion,Greece:September 26-30,2016,Proceedings,Part 1 21. Springer International Publishing,2016:27-46.

18
WRIGHT C V,COULL S E,MONROSE F. Traffic morphing:an efficient defense against statistical traffic analysis[C]//NDSS. 2009:9.

19
LI J,ZHOU L,LI H,et al. Dynamic traffic feature camouflaging via generative adversarial networks[C]//2019 IEEE Conference on Communications and Network Security (CNS). IEEE,2019:268-276.

20
HUANG G,MA C,DING M,et al. Efficient and low overhead website fingerprinting attacks and defenses based on TCP/IP traffic[C]//Proceedings of the ACM Web Conference.2023:1991-1999.

21
DE LUCIA M J,COTTON C. Detection of encrypted malicious network traffic using machine learning[C]//MILCOM 2019-2019 IEEE Military Communications Conference (MILCOM). IEEE,2019:1-6.

22
王曦锐, 芦天亮, 张建岭, 等. 基于加权Stacking集成学习的Tor匿名流量识别方法[J]. 信息网络安全, 2021, 21 (12): 118- 125.

DOI

WANG X R, LU T L, ZHANG J L, et al. Tor anonymous traffic identification method based on weighted stacking ensemble learning[J]. Netinfo Security, 2021, 21 (12): 118- 125.

DOI

23
SHEN M,JI K,GAO Z,et al. Subverting website fingerprinting defenses with robust traffic representation[C]//32nd USENIX Security Symposium (USENIX Security 23). 2023:607-624.

24
TANG J,YANG L,LIU S,et al. Caps-lstm:a novel hierarchical encrypted VPN network traffic identification using capsnet and LSTM[C]//International Conference on Science of Cyber Security. Cham:Springer International Publishing,2021:139-153.

25
蒋彤彤, 尹魏昕, 蔡冰, 等. 基于层次时空特征与多头注意力的恶意加密流量识别[J]. 计算机工程, 2021, 47 (7): 101- 108.

JIANG T T, YIN W X, CAI B, et a1. Encrypted malicious traffic identification based on hierarchical spatiotemporal feature and multi-head attention[J]. Computer Engineering, 2021, 47 (7): 101- 108.

26
HOLLAND J,SCHMITT P,FEAMSTER N,et al. New directions in automated traffic analysis[C]//Proceedings of the 2021 ACM SIGSAC Conference on Computer and Communications Security. 2021:3366-3383.

27
NAYAK S C, MISRA B B, BEHERA H S. Impact of data normalization on stock index forecasting[J]. International Journal of Computer Information Systems and Industrial Management Applications, 2014, 6, 257- 269.

28
SINGH D, SINGH B. Investigating the impact of data normalization on classification performance[J]. Applied Soft Computing, 2020, 97, 105524.

DOI

29
ABE K, GOTO S. Fingerprinting attack on Tor anonymity using deep learning[J]. Proceedings of the Asia-Pacific Advanced Network, 2016, 42, 15- 20.

30
HERMANS M,SCHRAUWEN B. Training and analysing deep recurrent neural networks[J]. Advances in Neural Information Processing Systems,2013,26.

31
KOUTNIK J,GREFF K,GOMEZ F,et al. A clockwork RNN[C]//International Conference on Machine Learning. PMLR,2014:1863-1871.

Outlines

/