Academic Research

A fast low-dimensional method for detecting DNS-over-HTTPS tunnel traffic

  • WANG Tao 1, 2 ,
  • ZHAI Jiangtao , 1, 2, * ,
  • WANG Zihao 1, 2 ,
  • ZHANG Kaijie 1, 2 ,
  • LIU Guangjie 1, 2
Expand
  • 1. Key Laboratory of Intelligent Support Technology for Complex Environments, Ministry of Education, Nanjing 210044, China
  • 2. School of Electronic & Information Engineering, Nanjing University of Information Science & Technology, Nanjing 210044, China

Online published: 2025-01-25

Supported by

National Key R&D Program of China (Grants No. 2021QY0700) and the National Natural Science Foundation of China (Grants No. U21B2003,62072250)

Copyright

Copyright ©2024 Journal of Aeronautical Materials. All rights reserved.

Abstract

The standardization and deployment applications of the secure DNS protocol DNS-over-HTTPS (DoH) have brought DoH tunnels to the forefront as a new insidious network threat. Screening potential tunneling traffic among the large-scale DoH service traffic in the cloud network environments requires both computational efficiency and accuracy. Aiming at the low feature efficiency and high computational complexity of the current machine learning-based DoH tunnel detection algorithms, a set of packet block length features was designed and a low-dimensional fast DoH tunnel detection method was proposed based on the max-Relevance and Min-Re-dundancy(mRMR)feature screening algorithm and the random forest algorithm. The features greatly contributing to the DoH tunnel detection task were selected through feature screening and a random forest classifier was used in the DoH tunnel detection task in the proposed method. Experimental results showed that this method achieved a comparable accuracy to other algorithms with using 24 to 34 features, even with using only 10 features. This could effectively reduce the computational complexity of the deployed applications and better adapt to the application scenarios of the large-scale DoH service traffic analysis.

Cite this article

WANG Tao , ZHAI Jiangtao , WANG Zihao , ZHANG Kaijie , LIU Guangjie . A fast low-dimensional method for detecting DNS-over-HTTPS tunnel traffic[J]. Journal of Cybersecurity, 2024 , 2(6) : 123 -130 . DOI: 10.20172/j.issn.2097-3136.240609

0 引言

域名系统(Domain Name System,DNS )是互联网的关键基础设施,用于将人类可读的主机名映射为计算机可理解的互联网协议(IP)地址[1]。国际互联网工程任务组(Internet Engineering Task Force,IETF),最初在设计DNS协议时并没有考虑其安全性和隐私性,所以DNS查询和响应在网络中以明文传输[2],这给恶意攻击者带来了利用未加密的DNS数据侵犯用户隐私或进行域名劫持的机会[3]。为了解决DNS安全问题,IETF于2018年正式在RFC 8484中标准化了DNS-over-HTTPS(DoH)协议[4]。DoH协议旨在通过加密的HTTPS进行DNS查询和响应,从而防止明文DNS查询和响应被第三方窃听或篡改。DoH协议自标准化以来,国内外公共解析器厂商陆续开始对公众提供DoH服务,包括Cloudflare、Google、阿里、腾讯和360等。
引入DoH协议尽管解决了传统DNS存在的安全和隐私问题,但同时也带来了新的威胁,主要体现在恶意攻击者使用DoH隧道进行恶意活动[5]。DNS隧道是一种利用DNS协议将客户端与服务器之间的数据传输进行封装的方法,它将数据编码在常规的DNS请求中进行传输,并由服务器在相应的DNS响应中返回被编码的命令或数据。随着DoH的标准化和广泛部署,加密DNS隧道(DoH隧道)也随之出现,将传统的明文隧道转变为加密隧道形式。过去,攻击者利用明文DNS隧道进行信息窃取或命令传输,而现在DoH隧道的出现为攻击者带来了隐藏其攻击行为的机会。据相关报告,2019年出现了一种名为Godlua的恶意软件菌株,它利用DoH隐藏DNS流量[6]。2020年,已知APT(Advanced Persistent Threat)组织开始使用DoH作为数据泄露渠道[7]
在部署DoH服务的云网络中,从安全管控的角度,需要判断经过DoH解析器入口节点的流量是正常DoH流量还是DoH隧道流量,对云网络的域名服务安全管控尤为重要。为此,研究人员提出了多种基于机器学习的DoH隧道检测方法。由于商用云网络中DoH请求服务规模大且并发数高,对检测算法的计算效率要求也高,因此当前研究中所提特征维数仍然偏高,在不明显牺牲准确率的情况下降低特征维度、提升计算效率是该技术实际部署应用的关键。为此,本文设计了一组数据包块长度特征并提出了一种基于mRMR特征筛选算法和随机森林算法的DoH隧道检测方法,该方法可对网络流统计特征使用特征筛选方法进行筛选,得出仅对检测任务贡献大的特征以减少特征维度,并使用随机森林分类器取得了与原有高维度特征相当的检测性能。

1 相关工作

2018年,IETF正式标准化了DNS-over-HTTPS协议。自标准化该协议以来,国内外各大DNS解析器提供商纷纷部署自己的DoH服务[8]。IETF规定了DoH协议的封装格式,如图1所示。尽管DoH通过使用HTTPS加密DNS请求和响应极大地保护了互联网用户的隐私,但该协议也被网络恶意攻击者用来进行恶意活动[9]
图 1 DoH封装格式

Fig.1 DoH package format

2020年,MontazeriShatoori等[5]使用DNS隧道工具模拟了恶意行为,产生了DoH隧道流量,并设计了一个两层分类器。第一层分类器从采集的HTTPS流量中识别DoH流量,第二层将DoH流量进一步分为良性和恶意两类。同时,该作者公开了一个包含非DoH、良性DoH和恶意DoH流量的数据集CIRA-CIC-DoHBrw-2020。Banadaki等[10]也设计了一个两层分类器用于检测DoH隧道流量,并评估了6种机器学习算法在两层分类任务中的性能表现。
Kwan等[11]分析了正常DoH流量的特征,并提出了一种基于流量特征阈值的DoH隧道检测方法,着重探讨了工程上实用的基于阈值的简单检测方法,为DoH隧道的检测和防御提供了有价值的启发。
Du等[12]和Nguyen等[13]认为传统DoH隧道检测方法因依赖大量的标注数据集而影响了算法的在线迭代,于是分别提出了使用半监督学习来进行DoH隧道检测的方法。结果表明,半监督学习方法在使用较少标注数据下仍能达到与监督学习相当的检测准确率。
Zhan等[14]考虑到大范围场景中的DoH检测问题,首先基于TLS(Transport Layer Security)指纹对DoH流量进行初步检测,若流量的指纹在白名单内,则该DoH流是良性的;否则使用统计特征进一步检测。Mitsuhashi等[15]针对传统分类器难以识别新出现的DoH隧道的问题,设计并实现了一个系统,利用持续的DoH流量分析并识别DoH隧道工具。该系统能够在机器学习模型上不断更新关于新出现的恶意DoH隧道工具的知识,从而减小新出现DoH隧道工具对用户造成的威胁。Vekshin等[16]和Alenezi等[17]分别研究了采用机器学习方法实现更为精细的关于产生DoH流量的客户端或隧道工具的分类展开研究。
已有研究表明,使用TLS流量的统计特征能够准确识别DoH流量并成功检测出其中的DoH隧道流量。当前研究人员所提的方法需要30维左右的统计特征,在图2所示的云网络DoH解析器入口高并发场景中,维度过高的特征会导致检测系统面临较大的计算压力,因此亟须研究低计算复杂度的DoH检测方法。
图 2 DoH隧道检测场景

Fig.2 DoH tunnel detection scenario

2 方法设计

2.1 分类模型的构建

由于DoH解析器入口处的实时流量带宽非常庞大,因此本文致力于减轻DoH隧道流量检测时的计算负担以提高检测系统的实时性能与检测效率。本文构建了一个分类模型,其结构如图3所示,具体步骤如下:
图 3 分类模型结构示意图

Fig.3 Block diagram of the classification model

步骤1:从原始pcap文件中提取本文使用的基本特征;
步骤2:使用特征筛选算法对步骤1中提取的特征进行多次筛选,每次筛选不同维度的特征子集;
步骤3:使用步骤2中筛选出的多组特征分别训练随机森林分类器,并根据分类器效果选择一组最优特征;
步骤4:使用步骤3中选择的最优特征子集和随机森林分类器,部署DoH隧道流量检测系统并对未知流量进行预测。
整个流程旨在通过合理的特征选择和评估,实现在保持高检测精度的同时,提高模型的检测效率和实时性能。

2.2 统计特征提取

DoH流量可以视为由多个有向数据包组成的时间序列。由于DoH使用HTTPS协议加密并传输DNS请求和响应,因此在未对数据包解密的情况下,无法直接提取负载中的有效信息[18]。本文使用数据包负载长度、时间戳和数据包方向构建统计特征。具体而言,使用从双向流和单向流中提取的数据包长度序列和时间间隔序列,计算得出序列的平均值与标准差作为原始统计特征。由于本文是在云网络中的DoH解析器入口处进行DoH隧道流量检测,因此将客户端地址作为源地址、DoH服务器地址作为目的地址。最终本文使用了从客户端到服务器的数据包长度的平均值(src2dst_mean_length)和标准差(src2dst_stddev_length)、从服务器到客户端的数据包长度的平均值(dst2src_mean_length)和标准差(dst2src_stddev_length)、双向流中数据包长度的平均值(bidirectional_mean_length)和标准差(bidirectional_stddev_length)、从客户端到服务器的数据包时间间隔的平均值(src2dst_mean_time)和标准差(src2dst_stddev_time)、从服务器到客户端的数据包时间间隔的平均值(dst2src_mean_time)和标准差(dst2src_stddev_time)、双向流中数据包时间间隔的平均值(bidirectional_mean_time)和标准差(bidirectional_stddev_time)特征作为部分原始特征。在文献[14]中,作者使用了从双向流和单向流中提取的数据包长度和时间间隔信息作为统计特征,并通过实验证明使用此类特征可以准确地检测出DoH隧道流量。
此外,本文分析了DoH隧道流量和正常DoH流量在形态上的差异。由于一个网页可能包含多个资源,如文本、图片、脚本等,且每种资源可能对应不同的域名,所以在访问一个网页时,可以看到客户端同时发起多个DNS请求,每个请求对应一个资源的域名解析。从流量形态的角度来看,一条正常的DoH流量中,客户端会在短时间内向服务器急促地发送多个数据包,服务器也会在短时间内返回对应的响应报文给客户端,如图4所示。然而,DoH隧道的目标是在受害者的机器和恶意攻击者设置的权威DNS服务器之间传输数据[19],将要传输的文件切割成大量较短的片段,随后将这些片段放入DNS请求或响应报文中进行传输。为了提高传输效率,DoH隧道工具通常会同时发起大量的DNS请求来传输数据,且其流量的持续时间通常会比正常的DoH流量更长。因此,如图5所示,DoH隧道流量通常会在传输控制协议(TransmissionControl Protocol,TCP)连接中持续进行数据传输,且每次请求或响应都会产生更多的数据包。
图 4 正常DoH流量形态示意

Fig.4 Schematic of normal DoH flow patterns

图 5 DoH隧道流量形态示意

Fig.5 Schematic of DoH tunnel traffic patterns

本文提取了客户端到服务器和服务器到客户端的数据包块长度特征。在一条丢弃了TCP负载长度为0的数据包的DoH双向流中,如果一段连续的数据包都属于同一方向,那么这段连续的数据包称为一个数据包块。本实验分别记录了从客户端到服务器和从服务器到客户端的每一个数据包块内的数据包数量,并使用其平均值和标准差作为统计特征,如从客户端到服务器的数据包块内包数量的平均值(src2dst_block_mean_length)和标准差(src2dst_block_stddev_length)、从服务器到客户端的数据包块内包数量的平均值(dst2src_block_mean_length)和标准差(dst2src_block_stddev_length)。表1列出了本文算法使用的16个统计特征。
表 1 本文算法使用特征

Table 1 Features used in the algorithm of this paper

特征
src2dst_mean_lengthsrc2dst_stddev_length
dst2src_mean_lengthdst2src_stddev_length
bidirectional_mean_lengthbidirectional_stddev_length
src2dst_mean_timesrc2dst_stddev_time
dst2src_mean_timedst2src_stddev_time
bidirectional_mean_timebidirectional_stddev_time
src2dst_block_mean_lengthsrc2dst_block_stddev_length
dst2src_block_mean_lengthdst2src_block_stddev_length

2.3 mRMR特征筛选算法

在DoH服务器云节点入口处实时网络带宽极大,所以要实时计算流量的统计特征并进行隧道流量检测,这不可避免地要消耗大量的CPU和内存资源。因此,本文致力于减轻DoH隧道检测过程中的计算负担。使用特征筛选方法,选取在DoH隧道流量检测任务中起重要作用的特征,同时尽可能降低所选特征之间的冗余,从而实现更高效的隧道检测。
最大相关最小冗余(max-Relevance and Min-Redundancy,mRMR)算法[20],旨在从原始特征集中选取一组特征子集,使其与目标变量之间的相关性最大(Max-Relevance),同时特征之间的相关性最小(Min-Redundancy)。该算法以互信息作为特征与目标变量之间相关性以及特征之间冗余度的衡量标准。
互信息是信息论中用于衡量两个随机变量之间相互关联程度的概念[21]。具体而言,互信息测量的是两个变量之间的依赖性,互信息越大,两个变量之间的关联性越高;若两个变量之间的互信息为0,则代表这两个变量相互独立。
两个离散随机变量$X$$Y$的互信息可以定义为:
$ I(X,Y) = \sum\limits_{{\text{x}} \in X} {\sum\limits_{y \in Y} {p(x,y)} } \log \frac{{p(x,y)}}{{p(x)p(y)}} $
两个离散随机变量$X$$Y$的互信息也可以定义为:
$ I(X,Y)=\int_{ }^{ }\int_{ }^{ }p(x,y){\mathrm{log}}\frac{p(x,y)}{p(x)p(y)}\mathrm{d}x\mathrm{d}y $
式中,$p(x,y)$$X$$Y$同时取到某一对值$x$$y$的概率,是$X$$Y$的联合概率;$p(x)$$p(y)$分别为$X$$Y$的边缘概率分布,表示随机变量单独取到某个值的概率。
利用互信息可以得到mRMR算法中最大相关性和最小冗余准则:
$ \max D(S,c),D = \frac{1}{{\left| S \right|}}\sum\limits_{{x_i} \in S} {I({x_i},c)} $
$ \min R(S),R = \frac{1}{{{{\left| S \right|}^2}}}\sum\limits_{{x_i},{x_j} \in S} {I({x_i},{x_j})} $
式中,$S$为特征子集;$\left| S \right|$为特征子集的维度;$I({x_i},c)$为特征${x_i}$与目标$c$之间的互信息;$I({x_i},{x_j})$为特征${x_i}$和特征${x_j}$之间的互信息。
使用mRMR算法进行特征选择的目的是寻找一组特征子集使其满足标准:
$ \max{\varPhi}(D,R),\varPhi=D-R $
式中,$ D $$R$分别为mRMR算法中的相关性和冗余性。
mRMR算法在计算最佳特征子集时,使用了增量搜索方法。当向已经选择的$m - 1$个特征中添加第$m$个特征时,应使新添加的特征满足下式:
$ \mathop {\max }\limits_{{x_j} \in X - {S_{m - 1}}} \left[I({x_j},c) - \frac{1}{{m - 1}}\sum\limits_{{x_i} \in {S_{m - 1}}} {I({x_j},{x_i})} \right] $
式(6)表示当已经选择了$m - 1$个特征时,从剩余特征中找到一个特征,计算该特征和目标之间的互信息,并使该互信息与新选特征和已选特征之间的互信息平均值之差最大。

2.4 随机森林模型

随机森林(Random Forest,RF )是一种强大且先进的机器学习算法[22],被视为是集成学习的代表性范例。该算法基于多个决策树(Decision Tree,DT),通过整合多个决策树的预测结果生成最终的预测结果。这种方法有助于缓解单个决策树可能出现的过拟合问题,并提高预测的准确性[23]
在随机森林算法中,每棵决策树都是独立生成和预测的。该算法首先对原始数据集进行有放回的随机采样,生成多个新的训练集,随后基于这些训练集构建一系列决策树。在构建决策树的过程中,每次分裂节点时,并非使用所有特征,而是首先从所有特征中随机选择一部分特征,随后从中选择最优的特征进行分裂,从而增强模型的随机性。
随机森林算法具有以下优点:(1)由于每棵决策树的构建都引入了随机性,所以可以有效地防止模型过拟合,进而提高模型的泛化能力;(2)由于随机森林采用了投票机制,即使某些决策树的预测结果不准确,也可以通过其他决策树的预测结果进行纠正,从而提高模型的稳健性;(3)尽管随机森林由多棵决策树构成,但每一棵决策树的结构和决策过程都是明确的,因此随机森林的预测结果具有一定的解释性。以上优点使得随机森林算法适用于本文的DoH隧道检测任务。

3 实验设计

3.1 数据集构建及预处理

CIRA-CIC-DoHBrw-2020数据集包含非DoH流量、良性DoH流量和DoH隧道流量。数据集创建者使用支持DoH协议的浏览器(Google Chrome、Mozilla Firefox)连接到公共DoH解析器(Adguard、Cloudflare、Google、Quad9),通过访问在Alexa中排名前10000的网站生成了非DoH流量和DoH流量,并使用DNS隧道工具(Iodine、DNS2TCP、DNScat2)生成了DoH隧道流量。
本实验首先使用IP地址从CIRA-CIC-DoHBrw-2020数据集中筛选出良性DoH流量和DoH隧道流量。随后,利用五元组信息(源IP地址、目的IP地址、源端口号、目的端口号和传输层协议),从筛选出的流量中提取每一条TCP流,在此过程中,丢弃了每条流中不包含实际负载的数据包,如TCP确认包等。事实上,当一条流中的数据包数量较少时,可以认为这条流中没有传输任何实质信息,因此本实验还过滤掉了数据包数量小于10的TCP流。经过以上预处理过程,最终生成的数据集中包含了121255条DoH流量,其中良性DoH流量18859条,DoH隧道流量102396条。

3.2 特征筛选及评估

本文使用准确率(Accuracy)和F1-score两个指标评估随机森林模型在DoH分类任务中的性能表现,其中F1-score结合了精确度(Precision)和召回率(Recall)两个指标。由于正负样本比例差异较大,所以使用这两个指标可以提供更全面的评估。其计算公式如下:
$ \mathrm{ }\mathrm{Accuracy}=\frac{{\mathrm{TP+TN}}}{{\mathrm{TP+TN+FN+FP}}} $
$ \mathrm{\Pr ecision}=\frac{{\mathrm{TP}}}{{\mathrm{TP+FP}}} $
$ \mathrm{Recall}=\frac{{\mathrm{TP}}}{{\mathrm{TP+FN}}} $
$ {F1=2\times\frac{\Pr {\mathrm{ecision}}\times {\mathrm{Recall}}}{\Pr {\mathrm{ecision+Recall}}}} $
式中,TP为真正例,即实际为正例且被正确预测为正例的样本数;TN为真负例,即实际为负例且被正确预测为负例的样本数;FN为假负例,即实际为正例但被错误预测为负例的样本数;FP为假正例,即实际为负例但被错误预测为正例的样本数。
本文在使用mRMR算法进行特征筛选时,从原始特征中选取了多组不同维度的特征子集,并使用这些特征子集分别训练随机森林分类模型。在模型训练过程中,为了优化随机森林算法的参数选择,引入网格搜索和交叉验证的策略[24],在参数网格中预设了不同的决策树数量和最大树深度等超参数,以便网格搜索在该预设范围内寻找最优超参数组合。

3.3 实验环境

本实验在搭载了Intel Core i7-9700和32 G内存的Ubuntu计算机中进行,使用python 3.8和C++编写数据处理和分类代码,使用的机器学习库有pandas、sklearn、numpy等。

4 实验结果及分析

本实验首先通过mRMR特征筛选方法选择了不同维度的特征子集,并且使用每组特征子集训练不同的随机森林分类模型,随后使用训练好的随机森林模型在测试集上进行预测,测试集中DoH流量的数量为24251。当特征维度低于6时,分类准确率较低,因此不具有参考价值。实验结果如表2所示,随着特征维度的增加,分类准确率总体呈现上升趋势,当特征维度大于或等于10时,仅有不足25个样本被误分类。
表 2 使用不同维度的特征子集对应的准确率

Table 2 Accuracy corresponding to using subsets of features of different dimensions

特征维度准确率误分类样本数
60.9806470
80.9932163
100.998925
120.999220
140.999024
160.999414
实验最终使用筛选出的10维特征作为DoH检测模型的输入,如表3所示。从表中可以看出,本文提出的有关数据包块长度的4个特征都被mRMR算法所选择,这验证了第2.2节提出的良性DoH流量和DoH隧道流量在形态上的差异对于DoH隧道检测的有效性。同时,在这10个特征中,并未有任何与时间相关的特征被mRMR算法所选择。这说明在DoH隧道流量检测任务中,数据包长度特征的有效性高于时间特征。
表 3 本文最终使用的10维特征

Table 3 Final 10-dimensional features used in this paper

特征
src2dst_stddev_lengthdst2src_block_stddev_length
src2dst_block_mean_lengthdst2src_mean_length
dst2src_block_mean_lengthdst2src_stddev_length
src2dst_block_stddev_lengthbidirectional_mean_length
src2dst_mean_lengthbidirectional_stddev_length
本文在训练随机森林模型时,使用网格搜索的方法寻找随机森林模型的最优超参数,最终该模型使用的参数如表4所示。
表 4 随机森林超参数

Table 4 Random forest hyperparameters

决策树数量最大深度最大叶子节点数
20020None
表5为本文提出的方法与现有DoH隧道检测方法在检测准确率和使用特征维度上的比较结果。从表中可以看出,传统DoH隧道检测方法与本文方法都取得了0.999的检测准确率和0.999的F1-score,但是传统DoH隧道检测方法使用的特征维度远远大于本工作。本实验仅使用10维统计特征便达到了与传统方法相当的检测精度。
表 5 与现有方法的比较结果

Table 5 Comparative results with existing methods

方法 准确率 F1-score 使用特征维度
文献[5] 0.999 0.999 28
文献[10] 1.000 1.000 31
文献[14] 0.999 0.999 24
文献[15] 0.999 0.999 34
本文 0.999 0.999 10
为了验证该方法能够部署在云网络中DoH服务器入口处进行隧道流量检测,本文分析并计算了该方法的资源占用与计算时间开销。由于该方法没有使用与数据包时间信息相关的特征,因此仅需要缓存每个数据包的长度与方向信息,而先前的检测方法需要额外的内存开销来缓存每个数据包的时间信息。实验使用unsigned short类型的数据存缓存据包长度,用bool类型数据缓存数据包的方向,仅需3个字节的内存开销便可以缓存一个数据包的信息。表6列出了本文的方法在单进程情况下计算统计特征的时间开销和内存资源占用情况。从表中可以看出,当流中平均数据包数量为1200时,仅需3.5 kB的内存便可以缓存每条流的有效信息,并且仅需0.098 ms便可以计算出本文使用的10维统计特征。因此,当DoH流量的平均数据包数量为1200时,本方法在1 s内可以处理10000条左右的DoH流量,且这10000条DoH流量所缓存的信息仅占用34 MB的内存。该方法有效降低了特征计算耗时,提高了系统实时检测效率。在面对云网络中DoH服务器入口处的高并发流量时,可以通过多进程技术提高系统的吞吐量。
表 6 本文方法的时间开销与内存资源占用

Table 6 Time overhead and resource consumption of the methods in this paper

数据包数量 内存开销/kB 计算特征用时/ms
1200 3.5 0.098

5 结束语

本研究旨在提高DoH服务器云节点入口处进行DoH隧道检测任务的效率,为此设计并实施了一种名为“最大相关最小冗余−随机森林(mRMR-RF)”的特征筛选与检测方法。首先设计了一组基于包长度和包时间间隔的统计特征,其次使用mRMR算法对原始特征进行筛选,最后使用随机森林算法进行隧道检测工作。实验结果表明,该方法使用10维特征在CIRA-CIC-DoHBrw-2020数据集上取得了99.9%的DoH隧道检测精度,该方法在保证高检测精度的同时,降低了检测任务时消耗的计算机资源。
1
李超群,唐纯莹,韩言妮. DNS公共解析服务可用性研究[C]//中国指挥与控制学会. 第十届中国指挥控制大会论文集(下册). 北京:兵器工业出社,2022:7.

LI C Q, TANG C Y, HAN Y N. Research on the availability of DNS public resolution services[C]//China Command and Control Society. Proceedings of the 10th China Command and Control Conference (Volume 2). Beijing: Ordnance Industry Press, 2022:7.

2
张曼,姚健康,李洪涛,等. DNS信道传输加密技术:现状、趋势和挑战[J]. 软件学报,2024,35(1):309-332.

ZHANG M, YAO J K, LI H T, et al. DNS channel transmission encryption technology: Status, trends, and challenges [J]. Journal of Software,2024,35(1):309-332.

3
丁峤, 刘俊延, 刘林云, 等. DNS隧道流量检测特征分析研究[J]. 无线电工程, 2022, 52 (4): 671- 677.

DOI

DING Q, LIU J Y, LIU L Y, et al. Research on feature analysis of DNS tunnel traffic detection[J]. Radio Engineering, 2022, 52 (4): 671- 677.

DOI

4
DNS Queries over HTTPS (DoH) [S]. RFC8484 IETF,2018.

5
MONTAZERISHATOORI M,DAVIDSON L,KAUR G,et al. Detection of DOH tunnels using time-series classification of encrypted traffic[C]//2020 IEEE Intl Conf on Dependable,Autonomic and Secure Computing,Intl Conf on Pervasive Intelligence and Computing,Intl Conf on Cloud and Big Data Computing,Intl Conf on Cyber Science and Technology Congress (DASC/PiCom/CBDCom/CyberSciTech). IEEE,2020:63-70.

6
CIMPANU C. First-ever malware strain spotted abusing new DoH (DNS over HTTPS) protocoll[EB/OL]. (2019-7-3)[2003-12-4]. https: //www.zdnet.com/article/first- ever-malware-strain-spotted-abusing-new-doh-dns-over-https- protocol/.

7
CIMPANN C. Iranian hacker group becomes first known APT to weaponize DNS-over-HTTPS (DoH)[EB/OL]. ( 2020-8-4)[2023-12-4]. https://www.zdnet.com/article/irnanZDNet,2020.

8
CHHABRA R, MURLEY P, KUMAR D, et al. Measuring DNS-over-HTTPS performance around the world[C]//Proceedings of the 21st ACM Internet Measurement Conference. 2021: 351-365.

9
HYNEK K, VEKSHIN D, LUXEEMBURK J, et al. Summary of DNS over HTTPS abuse[J]. IEEE Access, 2022, 10: 54668-54680.

10
BANADAKI Y M, ROBERT S. Detecting malicious DNS over https traffic in domain name system using machine learning classifiers[J]. Journal of Computer Sciences and Applications, 2020, 8 (2): 46- 55.

DOI

11
KWAN C,JANISZEWSKI P,QIU S,et al. Exploring simple detection techniques for DNS-over-HTTPS tunnels[C]//Proceedings of the ACM SIGCOMM 2021 Workshop on Free and Open Communications on the Internet. 2021:37-42.

12
DU X,LIU D,DING S,et al. Design of an autoencoder-based anomaly detection for the DoH traffic system[C]//2022 IEEE 25th International Conference on Computer Supported Cooperative Work in Design (CSCWD). IEEE,2022:763-768.

13
NGUYEN A T,PARK M. Detection of DoH Tunneling using semi-supervised learning method[C]//2022 International Conference on Information Networking (ICOIN). IEEE,2022:450-453.

14
ZHAN M, LI Y, YU G, et al. Detecting DNS over HTTPS based data exfiltration[J]. Computer Networks, 2022, 209, 108919.

DOI

15
MITSUHASHI R,JIN Y,IIDA K,et al. Malicious DNS tunnel tool recognition using persistent DoH traffic analysis[J]. IEEE Transactions on Network and Service Management,2022,20(2):2086-2095.

16
VEKSHIN D,HYNEK K,CEJKA T. DOH insight:detecting DNS over https by machine learning[C]//Proceedings of the 15th International Conference on Availability,Reliability and Security. 2020:1-8.

17
ALENEZI R,LUDWIG S A. Classifying DNS tunneling tools for malicious DoH traffic[C]//2021 IEEE Symposium Series on Computational Intelligence (SSCI). IEEE,2021:1-9.

18
JHA H, PATEL I, LI G, et al. Detection of tunneling in DNS over HTTPS[C]//2021 7th International Conference on Signal Processing and Communication (ICSC). IEEE, 2021: 42-47.

19
LI B, HE S, PENG H, et al. Detecting DoH tunnels with privacy protection using federated learning[C]//International Conference on Network Communication and Information Security (ICNCIS 2021). SPIE, 2022, 12175: 133-141.

20
孙林, 徐枫, 李硕, 等. 基于ReliefF和最大相关最小冗余的多标记特征选择[J]. 河南师范大学学报(自然科学版), 2023, 51 (6): 21- 29,175.

SUN L, XU F, LI S, et al. Multi-label feature selection based on reliefF and maximum relevance minimum redundancy[J]. Journal of Henan Normal University (Natural Science Edition), 2023, 51 (6): 21- 29,175.

21
张婧,曹峰,董毓莹,等. 基于互信息和遗传算法的特征选择算法[J]. 山西大学学报(自然科学版),2024,47(1):1-8.

ZHANG J, CAO F, DONG Y Y, et al. Feature selection algorithm based on mutual information and genetic algorithm[J]. Journal of Shanxi University (Natural Science Edition), 2024, 47(1): 1-8.

22
吕广旭, 卢加奇, 魏先燕, 等. 基于随机森林-聚类混合方法的多分类入侵检测研究[J]. 现代信息科技, 2022, 6 (16): 165- 167.

LÜ G X, LU J Q, WEI X Y, et al. Research on multi-class intrusion detection based on random forest-clustering hybrid method[J]. Modern Information Technology, 2022, 6 (16): 165- 167.

23
杨剑锋, 乔佩蕊, 李永梅, 等. 机器学习分类问题及算法研究综述[J]. 统计与决策, 2019, 35 (6): 36- 40.

YANG J Q, QIAO P R, LI Y M, et al. A review of machine learning classification problems and algorithms[J]. Statistics and Decision, 2019, 35 (6): 36- 40.

24
章文俊, 韩晓龙. 基于交叉验证网格寻优随机森林的黑产用户识别方法[J]. 科技视界, 2019, (28): 1- 3,7.

ZHANG W J, HAN X L. Black industry user identification method based on cross-validation grid optimization random forest[J]. Science & Technology Horizon, 2019, (28): 1- 3,7.

Outlines

/