学术研究

基于单向流特征的主干网DoH隧道流量检测方法

  • 吴桦 , 1, 2, 3, * ,
  • 全婧文 1 ,
  • 江初晴 1 ,
  • 杜加加 1
展开
  • 1. 东南大学网络空间安全学院,南京 211189
  • 2. 网络空间国际治理研究基地(东南大学),南京 211189
  • 3. 江苏省泛在网络安全工程研究中心,南京 211189

网络出版日期: 2025-01-25

基金资助

国家重点研发项目(2021YFB3101403)

版权

版权所有©《网络空间安全科学学报》编辑部 2024

Detection method for DoH tunnel traffic in backbone networks based on unidirectional flow features

  • WU Hua , 1, 2, 3, * ,
  • QUAN Jingwen 1 ,
  • JIANG Chuqing 1 ,
  • DU Jiajia 1
Expand
  • 1. School of Cyber Science and Engineering, Southeast University, Nanjing 211189, China
  • 2. International Governance Research Base of Cyberspace (Southeast University), Nanjing 211189, China
  • 3. Jiangsu Province Engineering Research Center of Security for Ubiquitous Network, Nanjing 211189, China

Online published: 2025-01-25

Copyright

Copyright ©2024 Journal of Aeronautical Materials. All rights reserved.

摘要

DoH使用加密的HTTPS连接来隐藏DNS查询和响应的流量,以解决传统DNS的安全问题。然而,攻击者也利用此特性实施DoH隧道攻击。目前,检测DoH隧道流量的方法主要是基于TLS指纹检测方法和基于双向流特征的机器学习方法。但是,由于主干网场景中非对称路由的广泛使用及TLS指纹的可改变性,上述2种方法不适用于主干网。针对以上问题,设计了一种面向主干网的基于单向流特征的DoH隧道流量检测方法,该方法从单向流量中快速提取精简的流量特征,通过机器学习构建检测模型,并对3种分类器的检测效果进行评估。结果显示,XGB算法性能最佳,即使攻击者增大查询时间间隔以规避检测,其各项指标均不低于99.75%。与类似方法的比较结果表明,本方法在具有相似检测准确率的情况下具有更快的特征提取速度。总体来说,本方法能够在主干网中快速有效地检测DoH隧道流量。

本文引用格式

吴桦 , 全婧文 , 江初晴 , 杜加加 . 基于单向流特征的主干网DoH隧道流量检测方法[J]. 网络空间安全科学学报, 2024 , 2(6) : 110 -122 . DOI: 10.20172/j.issn.2097-3136.240608

Abstract

DoH utilizes the encrypted HTTPS connections to conceal the traffic of DNS queries and responses, addressing security concerns in traditional DNS. However, attackers also leverage this feature to carry out the DoH tunneling attacks. Currently, the DoH tunnel traffic detection methods mainly involve the detection approaches based on TLS fingerprint and the machine learning approaches based on bidirectional flow features. Nevertheless, these approaches are unsuitable for backbone networks due to the widespread use of asymmetric routing in such scenarios, as well as the changeable nature of TLS fingerprints. To address these issues, a unidirectional flow feature-based detection method for DoH tunnel traffic was proposed specifically tailored for backbone networks. The method could rapidly extract the concise traffic features from unidirectional flows and construct a detection model using machine learning. The performance of three classifiers was evaluated with the XGB algorithm demonstrating the best performance. Even when attackers increased the query intervals to evade detection, the performance metrics of the XGB classifier remained above 99.75%. The proposed method had faster feature extraction speed than comparable methods while with a similar detection accuracy. In summary, this method could quickly and effectively detected the DoH tunnel traffic in backbone networks.

0 引言

域名系统(Domain Name System,DNS)是重要的网络基础服务之一。然而,传统的DNS请求容易受到第三方的非法监听,从而泄露DNS明文信息。此外,攻击者可以通过DNS隧道对受控端进行远程控制和信息窃取。除了隐私问题,DNS还面临着诸如DNS劫持、重定向和钓鱼攻击等安全威胁。EfficientIP和IDC的报告[1]显示,2021年约87%的受调查组织经历过DNS攻击,比2020年增加了8%。
为了解决DNS带来的隐私和安全问题,DoH协议被广泛应用。DoH协议提供了一种加密的DNS解析方式,将DNS查询请求通过HTTPS协议发送到DoH服务器,并对查询结果进行加密传输。这种加密通信方式有效地防御了传统DNS服务中的窃听和数据篡改攻击,提供了更高的安全性。目前,全球范围内支持DoH服务的提供商超过40家,其中包括主流的DNS解析服务商。
然而,DoH协议也面临新的安全风险和挑战,其中之一是利用DoH隧道实施攻击。DoH隧道攻击利用DoH技术加密传输恶意的DNS隧道流量(以下简称DoH隧道流量),攻击者通过在DoH请求中插入恶意内容,将受害者的DNS请求重新定向到恶意服务器上。此外,由于DoH请求通过HTTPS协议进行加密传输,攻击者可以隐蔽地执行这种攻击,这使得DoH隧道攻击难以检测和防范。当前的DoH隧道流量检测方法在不同部署环境中表现出不同的效果。在客户端上,基于双向流特征的DoH隧道流量检测方法效果良好,但部署于存在非对称路径的主干网中时,由于使用不同路径传递请求报文和响应报文,主干网中的一些网络节点无法采集到双向流量,因此不能直接应用基于双向流特征的检测方法。另外,基于传输层安全(Transport Layer Security, TLS)指纹的检测方法通过采集DoH客户端的TLS指纹建立指纹库,将待测指纹与指纹库中的指纹进行匹配。但是主干网存在流量多、流量类型多的复杂特点,而且攻击者可能会使用技术手段改变TLS指纹,因此导致在主干网部署基于TLS指纹的检测方法可能会产生高误报率。
针对上述问题,本文提出了一种面向主干网的DoH隧道流量检测方法,该方法通过分析DoH隧道流量的特性,提取了屏蔽五元组的单向流特征,并在3种有监督机器学习分类模型中进行DoH隧道流量分类与评估。实验结果表明,本文所提方法在存在非对称路由的主干网场景下,检测性能最佳的极限梯度提升XGB(eXtreme Gradient Boosting,XGB)算法的各项指标均不低于99.75%。此外,在攻击者采用如增大查询时间间隔的检测规避手段时,该方法仍能有效检测出DoH隧道流量。并且,本文所提方法的特征提取速度较现有方法显著提升,具有在真实的主干网环境下实际应用的潜力。
本文的主要贡献如下:
(1)针对主干网中单向流量的普遍性以及DoH隧道流量的加密性,通过分析DoH隧道流量的时间序列特征和统计特征,设计了一种无需解密的单向流特征构建和优化方法,提取了6种基于单向流的精简特征。
(2)面向主干网场景中的DoH隧道流量检测问题,提出了一种基于单向流特征的DoH隧道流量检测方法。使用多种机器学习方法构建了检测模型,并在基于2个公开数据集和1个自行构建数据集的混合数据集上验证了方法的有效性。
(3)与现有DoH隧道流量检测工作比较显示,本方法在保持与现有方法相似准确率的基础上,显示出更快的流量处理能力,可为DoH服务的安全部署提供更为坚实的技术支撑。

1 研究现状

1.1 DoH协议及应用现状

DoH协议是一种DNS查询加密协议,旨在保护用户的隐私和数据安全。它通过将DNS请求和响应封装在HTTPS通信中,为传统DNS带来了更高级别的安全性。自从IETF(the Internet Engineering Task Force)2018年正式发布DoH协议,DoH服务的部署逐渐渗透到互联网生态系统的各个领域。在客户端,主要的Web浏览器如Chrome、Firefox和Edge,已经集成了DoH功能,甚至从2020年起Firefox默认使用DoH协议[2];在服务端,一些公共DNS解析器如Cloudflare、Google和Quad9等,不仅提供DoH协议,还提供DoT(DNS over TLS)[3]
很多工作研究了DoH全球范围内能够被广泛访问和利用的程度以及用户使用率。Lu等[4]实际测量了116个国家的DoH流量,研究结果表明,DoH能够被访问和利用的程度较高,用户使用率也在不断增长。Timm等[5]通过加载时间和数据包计数等统计指标测量了DoH的开销和DoH对DoT的改进,研究结果表明,使用DoH服务对性能影响不显著。同时,Borgolte等[6]评估了DoH的应用对不同运营商、ISP(Internet Service Provider)、法规和政策的影响,发现越来越多的运营商正在支持DoH服务,并且相关法规也在不断完善。此外,Lyu等[7]总结了加密DNS领域的各种标准以及它们的现状、性能、优势和安全问题。
DoH协议的安全性是被广泛研究的一个领域,相关工作已揭示攻击者可能会通过DoH实施各种攻击行为。例如,Hu等[8]发现,尽管DNS基于HTTPS、TLS和QUIC(Quick UDP Internet Connections)协议实现了加密,但依然存在潜在的隐私泄露风险。这些研究表明,区分性特征主要涉及与DNS解析相关的数据包的到达时间间隔。以往的研究揭示了加密DNS在面对流量分析时仍然相当敏感,因此,RFC 8467提出了填充消息以减轻风险的建议。然而,Bushart等[9]指出,单纯地填充并不足以对抗DNS流量分析风险,他们提出了一种新的流量分析方法,仅通过加密和填充的DNS流量数据就能推断用户访问的网站。根据他们在Alexa前10 K网站上的评估,攻击者能够成功标识32%的网站的痕迹。此外,Niakanlahiji等[10]面对基于机器学习的流量分析(Traffic Analysis,TA)攻击,提出了一种客户端模糊方法,该方法采用压缩感知填充、伪查询注入以及查询的随机延迟等组合策略,结合了150多个综合特征。在Cloudflare和Google解析器以及200个目标网站上的实验结果表明,对于仅填充的情况,TA攻击者能够达到95.58%以上的准确率,而这一模糊算法成功将准确率降低到9%以下。
总体而言,自DoH协议正式发布以来,学术界已广泛开展研究,已有研究讨论了DoH协议对网络性能的潜在影响、DoH的全球部署情况、DoH对用户隐私的保护和网络安全性的提升。尽管各大运营商正在积极推动DoH的部署,但使用DoH也面临新的网络安全威胁。因此,为了推进DoH服务的广泛使用,需要研究人员从攻击监测和防御方式等多个方面做出更多努力。

1.2 DoH隧道流量检测研究现状

传统的DNS隧道检测方法在检测DoH隧道流量时面临显著挑战,主要原因是DoH使用HTTPS进行数据传输,使传统基于域名结构和统计特征的检测方法不再有效[11-13]。此外,HTTP/2的广泛应用使恶意软件可以更隐蔽地利用单个连接传输DoH请求和响应。目前在DoH隧道流量检测领域主要有2种方法:基于TLS指纹的方法和基于有监督机器学习的方法。

1.2.1 基于TLS指纹的DoH隧道流量检测方法

基于TLS指纹的DoH隧道流量检测方法通过采集DoH隧道流量的TLS指纹并建立指纹库,随后将待测流量的TLS指纹与指纹库中的指纹进行对比,以初步检测可能存在的DoH隧道流量。Zhan等[12]收集了DoH服务的TLS指纹并建立了相应的指纹库,这种方法虽然不够精确,但在数据传输之前的握手阶段对TLS指纹进行识别可以提供初步警示。然而,基于TLS指纹的DoH隧道流量检测方法存在准确率和灵活性的限制。攻击者可以通过修改TLS指纹扩展部分的参数或密码套件等信息绕过检测。哈希函数对细微变化非常敏感,即使是微小的更改也会导致TLS指纹的哈希值发生巨大变化,这使得基于TLS指纹的DoH隧道流量检测方法容错性较差。

1.2.2 基于有监督机器学习的DoH隧道流量检测方法

基于有监督机器学习的DoH隧道流量检测方法采用多种基于流的统计特征,如报文长度、报文数量等,以及流持续时间和包间隔时间等时序特征,利用机器学习方法训练分类器来识别网络中的DoH隧道流量。目前,已有多项研究关注此领域,为了提高检测的准确率和效率,Montazeri等[13]对DoH隧道技术的原理和潜在攻击进行了深入分析,并创建了CIRA-CIC-DoHBrw-2020数据集,实验结果表明,与时间相关的特征对DoH隧道流量的检测具有较为明确的价值。他们首先对DoH隧道流量和非DoH隧道流量进行分类,随后进一步区分DoH隧道流量和正常的DoH流量,利用时间序列分类器检测DoH隧道流量,实现了高达99%的精确度。
另外,Jafar等[14]运用了多种机器学习算法,通过实验得出随机森林、决策树、支持向量机以及K-近邻等算法的准确率接近99.9%,其中支持向量机算法和K-近邻算法在训练阶段相对较慢,而高斯朴素贝叶斯算法速度较快,但检测效果稍逊于其他算法。Zebin等[15]提出了可解释的AI解决方案,该方案通过CIRA-CIC-DoHBrw-2020数据集检测到DoH隧道流量,达到了99.92%的高召回率,精度和F1值均为99.91%。Banadaki等[16]使用6种机器学习分类器检测DoH隧道流量,结果表明LGBM(Light Gradient Boosting Machine)和XGB算法在分类任务中表现出色,准确率最高可达100%。Vekshin等[17]聚焦加密流量分析,特别是DoH流量的准确识别,评估了使用机器学习方法从HTTPS流数据中获取信息的可行性。他们的机器学习分类器能够在网络流量中准确识别DoH客户端,而且不受IP(Internet Protocol)地址和端口的影响,准确率达到99%以上。Kwan等[18]则专注于使用DoH过滤工具检测DoH隧道流量,其研究重点在于单一特征的检测技术,通过仅观察输出吞吐量实现了93%的准确率。Abu等[19]提出了一个轻量级的双层方案。该方案第一层使用随机森林算法检测流量,并将流量标识为DoH流量或非DoH流量;第二层使用Adaboost算法进一步检测,并将流量标识为良性DoH或DoH隧道流量。研究结果显示,第一层和第二层的预测准确率分别达到100%和83%。
综上所述,各项研究证明了有监督机器学习方法在DoH隧道流量检测领域的可行性。然而,主干网络中同一流的上行数据包和下行数据包可能通过不同的网络路径传输,从而在同一网络节点上只能观察到某个方向的流量。因此,前人研究普遍采用的基于双向流的对称特征在主干网络环境下的DoH隧道流量检测中并不适用。

1.2.3 基于深度学习的DoH隧道流量检测方法

在DoH隧道流量检测领域,深度学习方法以学习样本数据内在规律、特征自动提取为基础。Nguyen等[20]提出了一种建立在Transformer模型上的DoH隧道攻击检测系统,该系统所搭载的两层分类器首先区分DoH流量与正常HTTPS流量,随后对DoH隧道流量与正常DoH流量进行分类,准确率达到99%。
Wang等[21]设计了一种基于特征融合的DoH隐蔽通道检测方法,其基础是多头注意力和残差神经网络,通过融合会话统计特征和多通道会话字节序列特征,选择出对检测任务有显著影响的特征。该方法的核心思想在于将每个特征与其他特征之间的相关性程度表示为注意权重,通过多层感知器(Multi-Layer Perceptron,MLP)检测DoH隧道流量。该方法平均查全率为99.73%、精确度为99.72%。
然而,深度学习算法通常需要庞大的数据集用于训练,考虑到主干网络流量规模巨大,采用深度学习方法会导致高计算复杂度和大规模存储需求。除此之外,相比有监督机器学习方法,深度学习方法的可解释性较低,难以用于安全事件的溯源。
综上,目前的DoH隧道流量检测方法主要集中在两大类:一是基于TLS指纹的方法;二是基于有监督机器学习方法。然而,这两类方法均存在一些不足,基于TLS指纹的方法准确性和灵活性较差,攻击者可以通过调整隧道恶意软件的扩展列表、加密套件等参数,规避基于TLS指纹的DoH隧道流量检测;基于有监督的机器学习方法通常基于双向流的对称特征,但在主干网络中,由于非对称路由的存在,流量普遍具有非对称性。因此,双向流的对称特征难以适用于主干网络中的实际情境。此外,基于深度学习的方法要求大规模数据,计算复杂度高,存储需求巨大,可解释性有限,难以用于安全事件的追溯。调研显示,目前已有的研究主要针对局域网实验环境,尚未有面向主干网络DoH隧道流量的检测。

2 基于单向流特征的DoH隧道流量检测方法

为了克服主干网场景下非对称路由的广泛部署和DoH隧道流量的高隐蔽性带来的挑战,本文提出了一种面向主干网的基于单向流特征的DoH隧道流量检测方法。该方法通过构建单向流特征,使用有监督机器学习方法建立分类模型以实现DoH隧道流量检测。本方法主要包含数据获取与预处理、特征优化提取、有监督机器学习模型训练和DoH隧道流量检测4个部分。面向主干网的基于单向流特征的DoH隧道流量检测方法的整体架构如图1所示。
图 1 基于单向流特征的DoH隧道流量检测方法整体架构

Fig.1 Overall architecture of DoH tunnel traffic detection method based on unidirectional flow features

2.1 基于单向流特征的DoH隧道流量检测模型构建

主干网中基于单向流特征的DoH隧道流量检测模型的构建包括数据获取与预处理、特征优化提取和有监督机器学习模型训练3个部分,如图2所示。
图 2 主干网中基于单向流特征的DoH隧道流量检测模型

Fig.2 DoH tunnel traffic detection model based on unidirectional flow features in backbone networks

2.1.1 数据获取与预处理

首先,为了保证数据的真实性和合理性,本文采用了2种方式获取构建训练和测试所需的数据集,一是直接从公共数据集中获取,即从公共数据集MAWI(Measurement and Analysis on the WIDE Internet)中获取良性背景流量数据,从公共数据集CIRA-CIC-DoHBrw-2020中获取DoH隧道流量数据;二是自建DoH隧道,采集含有DoH隧道流量的数据,构建DoH-Tunnel数据集。
其次,对获取的流量数据进行特征初步提取、数据清洗等预处理操作。针对含有DoH隧道流量的数据,根据特定的IP进行筛选,提取出纯净的DoH隧道流量数据。再对良性背景流量数据和纯净的DoH隧道流量进行初步的统计特征提取,分别构建良性背景流量数据集和纯净DoH隧道流量数据集。
最后,将DoH隧道流量数据和良性背景流量数据混合,按照3∶1的比例将混合数据随机划分为训练集和测试集,并为每个样本打上相应的标签。

2.1.2 特征优化提取

将训练集作为随机森林分类器的输入,对分类器进行训练,并运用特征重要性评估方法确定每个特征在每棵决策树中的贡献程度。通过多次训练,得到每个特征在所有决策树中的平均贡献值。
本文综合考虑了这些贡献值的排序结果和分类准确度,将贡献值的阈值设定为0.05,剔除贡献值低于该阈值的特征,保留那些对模型性能有较高贡献的特征,从而减少特征的维度,降低模型的复杂度并提高模型的效率。

2.1.3 有监督机器学习模型训练

由于DoH流量的加密特性限制了从中提取的特征数量,因此本文选择了3种简单且有效的有监督机器学习方法训练模型以降低工程实施的成本,包括随机森林算法(Random Forest,RF)、K-近邻算法(K-Nearest Neighbor,KNN)和XGB算法。本文对这3种机器学习训练出的分类算法进行性能比较,选出了最有效的DoH隧道流量检测模型。

2.2 基于单向流特征的构建方法

在有监督机器学习模型中,筛选出具备高区分度的关键特征对于其分类性能的上限起着决定性作用。为了构建合适的特征集,本文对DoH隧道流量的传输过程进行了深入分析。考虑到DoH隧道流量的加密性以及主干网中流量的单向性,本文设计了一种基于单向流的特征构建方法,通过对DoH隧道流量的特性分析,仅需提取基于单向流的6种特征,避免了机器学习中由于特征数量过多产生的维度灾难问题,同时也显著减少了检测所需时间。

2.2.1 DoH隧道流量的特性分析

互联网流量中加密流量的比例不断增加,从安全角度来看,使用DoH协议可以将DNS数据信息封装在HTTPS中,使第三方无法查看或篡改请求的统一资源定位器(Uniform Resource Locator,URL)[22]。然而,由于加密信息的隐蔽性,攻击者也可以利用加密通道更加隐秘地掩盖其恶意行为,其中DoH隧道成为一种理想的选择。
攻击者利用DoH隧道来传播恶意软件负载,同时还可以隐藏被感染主机与攻击服务器之间的通信流量特征。传统的DNS隧道流量检测方法通常难以在这种加密恶意流量检测中取得良好效果。在以往的研究中,查询域名的长度被用作检测DNS隧道的重要特征,然而在加密的DNS流量中,无法直接观察查询域名的长度。但加密流量也具有一些显著的特征,如协议指纹、数据包长度和数据包到达时间间隔等。根据调研和分析,时间序列特征和统计特征是常用于加密恶意流量检测的主要特征。
(1)时间序列特征:基于TLS协议加密的网络流量实质上是一系列随时间传输的数据包。因此,可以使用捕获到的流量的时间序列来对网络流进行建模。尽管加密后的数据包内部的有效负载不会泄露相关流量的有用信息,但可以利用其他流量特征参数,如包大小、包方向和包之间的时间差,来推断有关流量特征的某些信息。可以保留原始数据中包含TLS应用数据的包,并删除无关紧要的包,如没有有效载荷的ACK包和太小而无法携带数据帧的包,最后在相同方向上创建一个或多个连续的信息包序列。
数据包之间的时间间隔是检测DoH隧道的常见特征之一。递归解析器通常会缓存先前的DNS查询结果以减少延迟。当DNS响应包含生存时间(Time To Live,TTL)值时,接收递归解析器会在TTL指定的时间内对该记录进行缓存。如果递归解析器在到期时间之前收到查询,它将只使用已缓存的记录进行回复,无需再次向权威DNS服务器发出请求。然而,当递归解析器无法在缓存中找到由DoH隧道生成的域名时,它会将收到的每个查询转发到受攻击者控制的域名服务器(Name Server,NS),相应的响应将从该NS返回,而不是直接从递归解析器的缓存返回。因此,DoH隧道流量中查询和响应之间的时间间隔通常比正常的DoH流量更长。此外,正常的DoH流量通常具有随机性,而在通过DoH传输数据时,DoH请求通常以相对恒定的速率发送。幸运的是,一些与时间相关的特征不受加密的影响,因此本文考虑将数据包之间的时间间隔作为一种特征。
(2)统计特征:统计特征在基于机器学习的加密恶意流量检测领域起着重要作用,研究人员通常使用流的统计特征,如流持续时间、包长度、包数量等来进行分类,以往的研究也证明了这些统计特征在检测DoH隧道流量方面的有效性。然而,基于流的统计特征也会受到网络环境变化的影响。例如,改变流量采集节点的地理位置会导致基于流的统计特征发生变化。此外,非对称路由在主干网络中被广泛部署,这意味着在某个采集点上获取的部分流量是单向的。在这种场景下,需要考虑使用单向流的非对称特征,而不是基于双向流的对称特征。因此,本文考虑将单向流的时间序列特征与统计特征相结合,共同构建特征集。

2.2.2 基于五元组遮蔽的特征提取

由于过多的特征数量可能导致维度灾难问题,也会增加计算资源的消耗和检测时间,从而降低分类器的效率,因此,在基于单向流的特征基础上,本文将进一步优化这些特征。
许多研究将流量特征分为自定义特征和五元组特征:自定义特征是研究者根据研究对象和内容自行选择和定义的特征,通常能够高度区分待测流量和背景流量;五元组特征是指一次流量会话的五元组信息,包括客户端IP、服务器IP、客户端端口号、服务器端口号和协议。
目前,一些研究仍然将五元组信息视为检测DoH隧道流量的主要特征。当采集的样本数据在相似的环境中且数据量较小时,DoH隧道流量的五元组信息非常相似。然而,当采集的样本数据涵盖多样的网络环境且数据量较大时,DoH隧道流量的五元组信息就不再具有明显的规律性。因此,在使用在单一封闭环境中获取的数据训练分类器后,用不同网络环境的数据来测试分类器模型时,检测结果可能会不如人意。因此,为了减少网络环境变化对检测结果的影响,胡斌等[23]在检测恶意流量时遮蔽了五元组特征。
由恶意软件生成的DoH隧道流量的五元组特征也是不稳定的,相同的恶意样本在不同的网络环境和地理位置中运行时,生成的恶意流量的部分五元组信息会发生变化,如客户端IP和服务器IP可能会改变,攻击者可以轻易地改变五元组信息以隐藏自己。
因此,在提取基于单向流的特征的基础上,本文将屏蔽五元组信息,即剔除所有流量的IP地址、端口号和协议信息,以尽可能保持特征的稳定性。

2.2.3 基于特征重要性的特征优化

根据DNS隧道流量检测、恶意加密流量检测等相关研究,本文构造了58个单向数据流相关的时间序列特征和统计特征,即为初始特征集。为了降低计算复杂性并防止模型过拟合,本文在初始特征集的基础上进行进一步优化,主要思想是利用随机森林中算法的特征重要性算法,该算法可以评估每个特征在随机森林中的每棵决策树上的贡献程度,使检测模型的决策更具可靠性和可解释性。本文通过比较各个特征的贡献程度,对特征集进行优化和降维。图3展示了基于特征重要性评估的结果,由于初始的统计特征较多,图中仅展示了一些重要性较高的特征。本文根据特征重要性的排序结果和对应的随机森林算法的分类准确度,丢弃了许多贡献度较小的特征,即权重低于0.05的特征,迭代并保留了具有更高重要性的关键特征。
图 3 基于特征重要性的特征权重图

Fig.3 Feature weight graph based on feature importance

根据特征重要性算法的排序结果,本文最终构建了包含6个特征的单向流特征集:Total_Fwd_Packet、Fwd_IAT_Mean、Fwd_IAT_Std、Fwd_IAT_Max、Fwd_IAT_Min和Fwd_Packets/s,这些特征的具体含义如表1所示。其中,正向是指从受控端向服务器端传输的数据流方向。
表 1 基于特征重要性算法的特征选择结果

Table 1 Feature selection results based on feature importance algorithm

特征描述
Total_Fwd_Packet在正向上发送包的数量
Fwd_IAT_Mean在正向上发送的两个包之间的平均时间
Fwd_IAT_Std在正向上发送的两个包之间的时间的标准差
Fwd_IAT_Max在正向上发送的两个包之间的最大时间
Fwd_IAT_Min在正向上发送的两个包之间的最小时间
Fwd_Packets/s每秒正向包的数量
当发生DoH隧道攻击时,攻击者往往会从受控端窃取数据并向服务器端传输,因此DoH隧道流量的Total_Fwd_Packet值通常高于正常DoH流量。并且,正常DoH流量的数据包发送时间具有随机性,而受控端的DoH隧道攻击程序处于等待状态时,会定期向服务端发送心跳包,以维持一个稳定的连接,这些行为导致DoH隧道流量的数据包以相对恒定的速率发送。所以,4个与数据包时间序列特征相关的特征Fwd_IAT_Mean、Fwd_IAT_Std、Fwd_IAT_Max和Fwd_IAT_Min在DoH隧道流量和正常DoH流量中表现出明显差异。此外,根据DoH隧道建立的原理,当受控端查询由DoH隧道攻击者生成的域名时,将从受攻击者控制的域名服务器返回响应,导致DoH隧道流量被响应的等待时间比正常DoH流量长。但是,DoH隧道流量在正向上发送包的数量比正常DoH流量多,2个因素综合导致DoH隧道流量的Fwd_Packets/s值处于中间区域,所以Fwd_Packets/s是一个比较模糊的区分特征,对检测结果的贡献水平一般。

3 实验与分析

3.1 实验环境

为了验证面向主干网的基于单向流特征的DoH隧道流量检测方法的有效性,本文进行了一系列实验。实验机器的操作系统版本为Windows 11,硬件配置为12th Gen Intel® Core™ i5-12500H CPU、16 GB内存。在数据采集过程中,云服务器采用了CentOS操作系统,其硬件配置为4核8 GB内存。为了进行实验,本文使用了sklearn机器学习库中的Random Forest Classifier、K-neighbors Classifier和XGB Classifier机器学习分类算法。

3.2 数据集构建

本文采用2个公开数据集CIRA-CIC-DoHBrw-2020数据集[24]和MAWI数据集。为了增强检测模型的泛化能力,本文使用多种工具进行DoH隧道攻击,自行采集并构建DoH隧道流量数据集DoH-Tunnel。
获取的数据集可分为良性背景流量数据集和恶意DoH隧道流量数据集。由于本文的目标是检测主干网环境中的DoH隧道流量,因此选择了主干网上的良性流量作为良性背景流量,使用公开数据集MAWI中部分流量作为良性数据集。恶意DoH隧道流量主要有2种来源:一是从公开数据集CIRA-CIC-DoHBrw-2020中选取的一部分数据集,包括通过DNS2tcp、DNSCat2、Iodine等3种恶意软件生成的DoH隧道流量;二是自建DoH隧道流量数据集,使用DoHC2、DNSExfiltrator和godoh 3种恶意软件生成的DoH隧道流量。

3.2.1 MAWI数据集

MAWI数据集捕获了来自WIDE主干网的真实的网络流量数据,并涵盖了多个采集点的数据。为了获得主干网的背景流量,本文选择了MAWI工作组在2020年6月3日捕获的15 min流量数据集(MAWI-0603)。该数据集是在一条10 Gbit/s互联网交换链路的采集点G上捕获的,每秒包含503 K个数据包。在这个数据集中,单向流占比84.10%,表明该数据集是在存在非对称路由的主干网中捕获的。
为了平衡背景流量和DoH隧道流量,本文只使用了MAWI-0603数据集的部分数据进行实验。

3.2.2 CIRA-CIC-DoHBrw-2020数据集

CIRA-CIC-DoHBrw-2020是一个由加拿大网络安全研究院提供的与DoH隧道流量相关的数据集。该数据集包括良性DoH流量、DoH隧道流量以及非DoH流量的捕获数据。为了生成具有代表性的数据集,良性DoH流量和DoH隧道流量是通过访问 Alexa排名前10 K的网站,并分别使用浏览器和DNS隧道工具生成的;DoH隧道流量则使用3种DNS隧道工具(DNS2tcp、DNSCat2、Iodine)来生成。
本文选取了CIRA-CIC-DoHBrw-2020数据集中的DoH隧道流量数据进行实验。

3.2.3 DoH-Tunnel数据集

DoH-Tunnel数据集是自行构建的,包括DoHTunnel-C2、DoHTunnel-DNSExfiltrator以及DoHTunnel-godoh数据集。
本文通过2台主机搭建了自己的DoH隐蔽隧道系统。主机A被设置为攻击端,部署了用于建立DoH隧道的服务器;主机B则作为受控端,充当DoH隧道工具的访问端。为了进行DoH隧道攻击的实验,本文利用了3种工具:DNSExfiltrator、DoHC2和godoh,攻击过程的隧道流量采集拓扑图如图4所示。
图 4 自建DoH隧道流量采集拓扑图

Fig.4 Self-built topology diagram for DoH tunnel traffic collection

首先,攻击者设置了特定的域名“jcqtest.xyz”,并配置了A记录类型,将其指向主机A的IP地址。主机A中部署了一个基于Python开发的自建DNS服务器,通过53端口与网络进行连接。接着,设置send.jcqtest.xyz和receive.jcqtest.xyz2个NS记录类型,它们都会解析为指向域名“jcqtest.xyz”的地址。对于攻击者而言,“receive.jcqtest.xyz”用于传输控制命令,“send.jcqtest.xyz”则用于回传隐私数据信息。
当DoH隧道攻击处于等待状态时,受控端主机B中部署的恶意程序会定期向攻击者发送攻击等待状态的报告。每隔一定时间,受控端B会将攻击等待信息嵌入到域名“receive.jcqtest.xyz”的子域名中,并发送域名解析请求。这些请求经由网络中的DoH服务代理商解析后,将信息发送至攻击端A。当攻击者有意窃取受害者的隐私信息时,会将控制命令隐藏在响应报文中,并从攻击端主机A传递至受控端主机B。在实验之前,已经预先在受控端主机B中放置了数据样本,作为被攻击端主机A盗用的隐私信息,数据大小在10 kB~100 MB。
一旦DoH隧道攻击开始,受控端主机B中嵌入的DoH隧道访问端恶意程序将对用户隐私数据进行填充和分组,并隐藏在域名“send.jcqtest.xyz”的子域名中。随后,恶意程序会不断发送域名解析请求,经过网络中的DoH服务代理商解析后,将数据信息传送至攻击端主机A。同时,攻击端主机A也可以将新的控制命令隐藏在响应报文中,从攻击端主机A传递至受控端主机B。通过以上方式建立DoH隧道,实现双向数据传输。
在采集DoH隧道流量数据时,本文在受控端主机B中部署了流量采集工具Wireshark,并在进行DoH隧道攻击时采集流量,以pcap包的形式进行存储。实验中设置了多种攻击变量,以便采集不同场景下的DoH隧道流量数据,包括不同的恶意软件类型(DNSExfiltrator、DoHC2、godoh),不同的DoH查询的时间间隔(20 ms、500 ms、1000 ms和2000 ms),不同的DoH服务代理商(Cloudflare、Google、阿里和腾讯提供的DoH服务器)以及不同的单次域名字节数的大小(20字节、30字节、40字节、50字节、60字节)。
为了模拟主干网中对DoH隧道流量的检测,需要将DoH隧道流量与MAWI数据集中的主干网背景流量混合。因此,本文将CIRA-CIC-DoHBrw-2020数据集中的3种DoH隧道流量以及DoH-Tunnel数据集与MAWI-0603背景流量混合,以获得包含非对称路由场景的混合数据集。

3.3 数据预处理

在混合数据集进行预处理时,本文基于数据流的五元组信息将原始数据集转换为多条数据流。数据流可以表示为L={pktCount,direction,features},其中pktCount表示数据流中数据包的数量,direction表示流的方向,features表示多个单向流的特征。接着对数据集进行标注,针对每种恶意软件所产生的DoH隧道流量,按照9∶1的比例混合良性背景流量和DoH隧道流量,以获得混合数据集。最后将混合数据集按照3∶1的比例随机划分为训练集和测试集。具体信息见表2
表 2 MAWI主干网流量与不同DoH隧道流量的混合数据集

Table 2 Mixed dataset of MAWI backbone network traffic and different DoH tunnel traffic

数据集 数据流条数 MAWI数据流条数 DoH隧道数据流条数 用途
MAWI-CIC-dns2tcp 568940 512046
(90%)
56894
(10%)
75%训练
25%测试
MAWI-CIC-DNSCat2 186030 167427
(90%)
18603
(10%)
75%训练
25%测试
MAWI-CIC-Iodine 133140 119826
(90%)
13314
(10%)
75%训练
25%测试
MAWI-DoHTunnel-C2 36340 32760
(90%)
3634
(10%)
75%训练
25%测试
MAWI-DoHTunnel-DNSExfiltrator 15560 14004
(90%)
1556
(10%)
75%训练
25%测试
MAWI-DoHTunnel-godoh 15130 13617
(90%)
1513
(10%)
75%训练
25%测试
此外,本文将6种恶意软件生成的DoH隧道流量和MAWI数据集中的主干网背景流量各均分成2份。第1份隧道流量与第1份背景流量混合形成MAWI-DoH1数据集,第2份隧道流量与剩余背景流量混合形成MAWI-DoH2数据集,2份数据集均按3:1比例划分为训练集和测试集。详细信息见表3
表 3 MAWI主干网流量与所有DoH隧道流量的混合数据集

Table 3 Mixed dataset of MAWI backbone network traffic and all DoH tunnel traffic

数据集数据流条数MAWI数据流条数DoH隧道数据流条数
MAWI-DoH1427757380000
(89%)
47757
(11%)
MAWI-DoH2427757380000
(89%)
47757
(11%)

3.4 评价指标

本文选择准确率(Accuracy)、精确率(Precision)、召回率(Recall)和F1值(F1-score)4个指标来评估机器学习算法性能,计算方法如下:
${\mathrm{Accurary}}=\frac{{\mathrm{TP+TN}}}{{\mathrm{TP+FP+TN+FN}}} $
$ {\mathrm{Precision}}=\frac{{\mathrm{TP}}}{{\mathrm{TP+FP}}} $
$ {\mathrm{Recall}}=\frac{{\mathrm{TP}}}{{\mathrm{TP+FN}}} $
${{F}}1\;\text{-}\;{\mathrm{score}}=\frac{2\times \mathrm{P}\mathrm{r}\mathrm{e}\mathrm{c}\mathrm{i}\mathrm{s}\mathrm{i}\mathrm{o}\mathrm{n}\times \mathrm{R}\mathrm{e}\mathrm{c}\mathrm{a}\mathrm{l}\mathrm{l}}{\mathrm{P}\mathrm{r}\mathrm{e}\mathrm{c}\mathrm{i}\mathrm{s}\mathrm{i}\mathrm{o}\mathrm{n}+\mathrm{R}\mathrm{e}\mathrm{c}\mathrm{a}\mathrm{l}\mathrm{l}} $
式中,TP(True Positives)表示将良性背景流量正确识别为良性背景流量的个数;FP(False Positives)表示将DoH隧道流量错误预测为良性背景流量的个数;FN(False Negatives)表示将良性背景流量错误预测为DoH隧道流量的个数;TN(True Negatives)表示将DoH隧道流量正确预测为DoH隧道流量的个数。

3.5 实验结果分析

3.5.1 机器学习分类器性能评估

使用混合数据集MAWI-DoH1作为训练集,MAWI-DoH2作为测试集,训练机器学习分类器。这2个数据集均包含由6种不同的隧道工具产生的DoH隧道流量和MAWI主干网背景流量,且2份数据集中的数据互不交叉,最终得到3种机器学习检测结果,如表4所示。
表 4 MAWI-DoH1训练的机器学习模型检测结果

Table 4 Detection results of machine learning model trained on MAWI-DoH1

分类器 Precision Recall F1-score Accuracy
RF 99.91% 99.91% 99.91% 99.91%
KNN 98.04% 98.00% 98.02% 98.00%
XGB 99.99% 99.99% 99.99% 99.99%
交换机器学习模型使用的训练集和数据集,即使用MAWI-DoH2作为训练集,MAWI-DoH1作为测试集时,得到3种机器学习检测结果,如表5所示。
表 5 MAWI-DoH2训练的机器学习模型检测结果

Table 5 Detection results of the machine learning model trained on MAWI-DoH2

分类器 Precision Recall F1-score Accuracy
RF 99.68% 99.68% 99.68% 99.68%
KNN 95.71% 95.81% 95.51% 95.81%
XGB 99.99% 99.99% 99.99% 99.99%
实验结果显示,XGB分类器在主干网上的DoH隧道流量检测中性能最佳,2次交叉实验的4项评估指标均达到了99.99%,RF分类器性能也较好,2次交叉实验中的4项评估指标均不低于99.68%,能高精度地检测出DoH隧道流量。相比之下,KNN分类器的表现与前两者相差较大,其性能不如XGB分类器和RF分类器适用于主干网上的DoH隧道流量检测。
对使用MAWI-DoH1作为训练集和MAWI-DoH2作为测试集的实验检测结果进一步观察可以发现,在使用RF算法时,47757条DoH隧道流中有302条未被检测出来;而在使用XGB算法时,仅有14条DoH隧道流未被检测出来,XGB算法检测效果显著优于RF算法。从算法原理分析可知,XGB算法在目标函数中引入了正则项,能够简化模型并防止过拟合,同时与RF一样支持随机抽样,可以减少计算量。此外,XGB通过对损失函数进行二阶泰勒展开,具有较快的收敛速度。因此,当实验的训练集只包含6维特征向量时,XGB模型的检测效果非常好。RF算法也是一种出色的机器学习算法,具有一定的抗过拟合能力,并能评估特征的重要性。然而,在某些噪声较大的情况下,RF算法仍可能过拟合,导致精度下降。尽管RF算法在本实验中表现良好,但仍不及XGB算法。KNN算法的原理相对简单,易于实现,但由于曼哈顿距离和欧氏距离的计算方法相对简单,KNN算法无法像XGB算法及时修正上一轮的预测结果,因此KNN算法对异常值不够敏感。此外,KNN算法每次分类都需要进行全局运算,对于具有大样本容量的数据集,其计算量也会增加。因此,在主干网上的DoH隧道流量检测中KNN算法表现不佳。

3.5.2 不同种类DoH隧道流量的检测效果

由3种机器学习分类器的评估实验可知,XGB算法分类器在检测DoH隧道流量上效果最好。故本次实验选择使用XGB算法进行流量分类检测,使用表2中的6种数据集分别进行训练和测试,每种数据集按3:1的比例随机划分为训练集和测试集,各自独立进行。为了评估不同DoH隧道流量产生工具对检测性能的影响,本实验使用的数据集中DoH隧道流量分别由dns2tcp、DNSCat2、Iodine、DoHC2、DNSExfiltrator和godoh 6种不同的隧道工具产生,实验结果如表6所示。
表 6 对不同种类DoH隧道流量的检测结果

Table 6 Detection results for different types of DoH tunnel traffic

数据集 Precision Recall F1-score Accuracy
MAWI-CIC-
dns2tcp
100% 100% 100% 100%
MAWI-CIC-DNSCat2 99.93% 99.93% 99.93% 99.93%
MAWI-CIC-
Iodine
99.88% 99.88% 99.88% 99.88%
MAWI-DoHTunnel-C2 99.76% 99.76% 99.76% 99.76%
MAWI-DoH
Tunnel-DNSExfiltrator
100% 100% 100% 100%
MAWI-DoH
Tunnel-godoh
99.88% 99.88% 99.88% 99.88%
由实验结果可知,基于单向流特征的DoH隧道流量检测方法在主干网中表现出色,尤其对由dns2tcp和DNSExfiltrator产生的DoH隧道流量的检测效果最佳,4项评价指标均达到100%。对于其他4种隧道工具产生的DoH隧道流量,该方法也表现良好,其检测指标均达到99.76%甚至更高。这一实验证明了基于单向流特征的DoH隧道流量检测方法具备广泛适用性,可用于在主干网中检测多种DoH隧道攻击方式产生的流量,由dns2tcp和DNSExfiltrator产生的DoH隧道流量的检测效果最为出色。

3.5.3 DoH查询时间间隔对检测性能的影响

在MAWI-DoHTunnel-DNSExfiltrator数据集中,本实验使用DNSExfiltrator工具模拟生成DoH隧道流量。为了模拟攻击者躲避模型检测的场景,本实验设置了不同的DoH查询时间间隔:20 ms、500 ms、1000 ms、2000 ms。通过进行为期5天的攻击实验,共采集到4.7 GB的原始数据。随后,对原始数据进行流量清洗,得到4份纯净的DoH隧道流量数据集,其DoH查询时间间隔分别为20 ms、500 ms、1000 ms、2000 ms。将这4份DoH隧道流量数据集与MAWI主干网背景流量按照9∶1的比例混合,构建了4个不同的数据集,如表7所示。
表 7 不同DoH查询时间间隔产生的数据集信息

Table 7 Information about the datasets generated with different DoH query intervals

数据集 DoH查询时间
间隔/ms
MAWI数据
流条数
DoH隧道
流条数
M-DNSExfiltrator-20 20 1557(90%) 173(10%)
M-DNSExfiltrator-500 500 1305(90%) 145(10%)
M-DNSExfiltrator-1000 1000 1449(90%) 161(10%)
M-DNSExfiltrator-2000 2000 9693(90%) 1077(10%)
使用表现更好的2种机器学习算法RF和XGB对以上4种数据集分别训练与测试,每个数据集均按3∶1的比例随机划分为训练集和测试集,检测结果分别如表8表9所示。
表 8 基于RF使用不同DoH查询时间间隔的检测结果

Table 8 Detection results based on RF using different DoH query intervals

时间间隔/ms Precision Recall F1-score Accuracy
20 100% 100% 100% 100%
500 100% 100% 100% 100%
1000 100% 100% 100% 100%
2000 99.96% 99.96% 99.96% 99.96%
表 9 基于XGB使用不同DoH查询时间间隔的检测结果

Table 9 Detection results based on XGB using different DoH query intervals

时间间隔/ms Precision Recall F1-score Accuracy
20 100% 100% 100% 100%
500 100% 100% 100% 100%
1000 99.75% 99.75% 99.75% 99.75%
2000 99.96% 99.96% 99.96% 99.96%
实验评估了DoH查询时间间隔对检测结果的影响,结果显示,RF算法仍能准确检测所有DoH查询发送时间间隔不大于1 000 ms的DoH隧道流量,XGB算法仍能准确检测所有DoH查询发送时间间隔不大于500 ms的DoH隧道流量。然而,随着时间间隔的增大,模型的检测性能略有下降。尽管如此,所有的性能指标仍保持在99.75%及以上。总体而言,在主干网络中增加DoH查询时间间隔有助于攻击者逃避检测,但对于本文中基于单向流特征训练的RF分类器和XGB分类器而言,并不会导致大量误报。

3.5.4 本方法与基于双向流特征的检测方法对比

在众多基于双向流的机器学习检测方法中,Zebin等[17]提取的特征最具可解释性,并表现出极佳的检测效果,在CIRA-CIC-DoHBrw-2020数据集中检测DoH隧道流量的各项指标均在99.9%以上。
本实验利用Zebin等[17]使用的特征提取工具DoHlyzer分别从混合数据集MAWI-DoH1和MAWI-DoH2中提取特征,MAWI-DoH1和MAWI-DoH2分别作为训练集和测试集。模型训练使用随机森林分类器进行,并与本文基于XGB算法检测的结果进行比较。基于双向流特征和本文基于单向流特征的检测效果如表10所示。
表 10 基于双向流特征和单向流特征的对比检测结果

Table 10 Comparison detection results based on bidirectional and unidirectional flow features

特征 Precision Recall F1-score Accuracy
双向流 99.10% 99.10% 99.09% 99.10%
单向流 99.99% 99.99% 99.99% 99.99%
表10可以看出,在存在“非对称路由”情况的主干网场景中,基于单向流的特征使用性能最佳的XGB算法时各项指标均为99.99%,证明了基于单向流特征的有效性。Zebin等[17]的方法也表现出良好的性能,仅稍逊于基于单向流特征的方法。分析2种方法提取的特征可以解释为什么基于双向流的特征在主干网场景中表现良好,Zebin等[17]提取了29个特征,丰富的特征覆盖了一些单向DoH隧道流的特点,如流持续时间。考虑到方法的实用性,必须衡量时间成本,本实验进一步测量了2种方法完成特征提取消耗的时间。表11记录2种方法从DoH流量数据集(由CIRA-CIC-DoHBrw-2020数据集中的DoH流量和DoH-Tunnel数据集组成)中提取特征的速度。
表 11 Zebin方法[17]与本文方法特征提取速度对比

Table 11 Comparison of feature extraction speed between Zebin's method[17] and the method in this paper

特征提取方法 平均提取速度/pcap·min−1
Zebin方法[17] 5
本文方法 2670.5
DoH流量数据集中共计5341个pcap,用Zebin等[17]的方法提取特征长达17.8 h,而本文的特征提取方法仅需要2 min,能以534倍的速度完成特征提取。分析其原因,本文的方法不需要提取复杂的统计特征,而Zebin等[17]使用开源特征提取工具DoHlyzer提取了大量流的统计特征,包括数据包长度中值、数据包长度偏值等。这些统计值需要将流中所有数据排序后才能获得,而且处理主干网中的海量流量时,需要在内存中同时维持海量数据流的状态,导致其所需特征提取时间远超过本文方法所用时间。因此,对比结果证明了本方法更适用于主干网络中的DoH隧道流量检测。

4 结束语

本文针对主干网环境中DoH隧道流量的检测问题,提出了一种基于单向流特征的检测方法。该方法通过分析DoH隧道流量的特性,提取关键的单向流特征,并利用机器学习算法进行分类检测。实验结果表明,即使在攻击者采取增加查询间隔的措施来规避检测的情况下,本文提出的方法依然能够有效识别DoH隧道流量,并且完成特征提取的时间是现有工作的534倍。综上,本文提出的高效的基于单向流特征DoH隧道流量检测方法对DoH服务的安全部署具有重要意义。
在本文的基础上,后续工作将从以下方面展开:(1)将更多可能导致流量特征产生变化的因素纳入考虑范围,研究地理位置环境的变化、不同DoH解析器等因素对DoH隧道检测产生的影响;(2)随着DoH服务的不断发展和广泛部署,对抗性攻击仍然是一个重要的开放性研究问题,未来将进一步探索对抗性攻击对DoH隧道检测的影响,进行更多的防御方法研究。
1
FOUCHEREAU R. 2021 Global DNS threat report[R]. https://www.efficientip.com/resources/idc-dns-threat-report-2021/.

2
STEADMAN J,SCOTT-HAYWARD S. Detecting data exfiltration over encrypted DNS[C]//2022 IEEE 8th International Conference on Network Softwarization (NetSoft). IEEE,2022:429-437.

3
HU Z,ZHU L,HEIDEMANN J,et al. RFC 7858,DNS over TLS(DoT)[S]. IETF,2016:1-19.

4
LU C Y,LIU B J,LI Z,et al. An end-to-end,large-scale measurement of DNS-over-encryption:how far have we come[C]//Proceedings of the Internet Measurement Conference (IMC '19). 2019:22-35.

5
BOTTGER T ,CUADRADE F ,ANTICHI G,et al. An empirical study of the cost of DNS-over-HTTPS. [C]//Proceedings of the Internet Measurement Conference (IMC '19). 2019:15-21.

6
BORGOLTE K,CHATTOPADHYAY T,FEAMSTER N,et al. How DNS over https is reshaping privacy,performance,and policy in the internet ecosystem[C]//TPRC47:The 47th Research Conference on Communication,Information and Internet Policy. 2019:1-6.

7
LYU M, GHARAKHERILI H H, SIVARAMAN V. A survey on DNS encryption: current development, malware misuse, and inference techniques[J]. ACM Computing Surveys, 2022, (162): 1- 28.

8
HU G, FUKUDA K. Characterizing privacy leakage in encrypted DNS traffic[J]. IEICE Transactions on Communications, 2023, 106 (2): 156- 165.

9
BUSHART J,ROSSOW C. Padding ain't enough:assessing the privacy guarantees of encrypted DNS[C]// USENIX Security Symposium. 2020:1-6.

10
NIAKANLAHIJI A, ORLOWSKI S, VAHID A, et al. Toward practical defense against traffic analysis attacks on encrypted DNS traffic[J]. Computers & Security, 2023, 124, 103001.

11
WANG B,XIONG G,FU P,et al. A two-stage method for fine-grained DNS covert tunnel behavior detection[C]//Science of Cyber Security:4th International Conference,2022:201-216.

12
ZHAN M, LI Y, YU G, et al. Detecting DNS over HTTPS based data exfiltration[J]. Computer Networks, 2022, 209, 108919.

13
MONTAZERISHATOORI M,DAVIDSON L,KAUR G,et al. Detection of DOH tunnels using time-series classification of encrypted traffic[C]//2020 IEEE Intl Conf on Dependable,Autonomic and Secure Computing,Intl Conf on Pervasive Intelligence and Computing,Intl Conf on Cloud and Big Data Computing,Intl Conf on Cyber Science and Technology Congress (DASC/PiCom/CBDCom/CyberSciTech). IEEE,2020:63-70.

14
JAFAR M T,Al-FAWAREH M,Al-HRAHSHEH Z,et al. Analysis and investigation of malicious DNS queries using CIRA-CIC-DoHBrw-2020 dataset[J]. Manchester Journal of Artificial Intelligence and Applied Sciences (MJAIAS),2021.

15
ZEBIN T, REZVY S, LUO Y. An explainable AI-based intrusion detection system for DNS over HTTPs (DOH) attacks[J]. IEEE Transactions on Information Forensics and Security, 2022, 17, 2339- 2349.

16
BANADAKI Y M, ROBERT S. Detecting malicious DNS over HTTPS traffic in domain name system using machine learning classifiers[J]. Journal of Computer Sciences and Applications, 2020, 8 (2): 46- 55.

17
VEKSHIN D,HYNEK K,CEIJKA T,et al. DoH insight:detecting DNS over HTTPS by machine learning[C]// 15th International Conference on Availability,Reliability and Security. 2020:1-8.

18
KWAN C,JANISZEWSKI P,QIU S,et al. Exploring simple detection techniques for DNS-over-HTTPS tunnels[C]// SIGCOMM '21:ACM SIGCOMM 2021 Conference. ACM,2021:37-42.

19
ABU Al-HAIJA Q, ALOHALY M, ODEH A. A lightweight double-stage scheme to identify malicious DNS over HTTPS traffic using a hybrid learning approach[J]. Sensors, 2023, 23 (7): 3489.

20
NGUYEN T A, PARK M. DoH tunneling detection system for enterprise network using deep learning technique[J]. Applied Sciences, 2022, 12 (5): 2416.

21
WANG Y, SHEN C, HOU D, et al. FF-MR: a DoH-encrypted DNS covert channel detection method based on feature fusion[J]. Applied Sciences, 2022, 12 (24): 12644.

22
JERABEK K,RYSAVY O,BURGETOVA I. Analysis of well-known DNS over HTTPS resolvers[C]//2023 IEEE 13th Annual Computing and Communication Workshop and Conference (CCWC). IEEE,2023:0516-0524.

23
胡斌, 周志洪, 姚立红, 等. 结合报文负载与流指纹特征的恶意流量检测[J]. 计算机工程, 2020, 46 (11): 7.

HU B, ZHOU Z H, YAO L H, et al. Malicious Traffic Detection Combining Features of Packet Payload and Stream Fingerprint[J]. Computer Engineering, 2020, 46 (11): 7.

24
MAWI. Public dataset [EB/OL]. (2024-08-20)http://mawi.wide.ad.jp/mawi/samplepoint-G/2020/, 2020/2023.

MAWI. Public dataset [EB/OL]. (2024-08-20)http://mawi.wide.ad.jp/mawi/samplepoint-G/2020/,2020/2023.

文章导航

/