Academic Research

Enhanced BiLSTM with multi-head attention for malicious network traffic detection scheme

  • Wu Hongbin ,
  • Zhao Yufei , * ,
  • Zhao Qi ,
  • Wang Yuman ,
  • Chen Kai
Expand
  • State Grid Laboratory of Power Cyber-Security Protection and Monitoring Technology, China Electric Power Research Institute Co., Ltd, Beijing 100192, China

Received date: 2025-09-27

  Revised date: 2025-10-30

  Online published: 2026-05-13

Copyright

Copyright ©2026 Journal of Aeronautical Materials. All rights reserved.

Abstract

In the realm of cybersecurity, accurately detecting malicious network traffic, particularly when it manifests in unknown forms, remains a significant challenge. To address this, we propose a novel detection framework that combines bidirectional long short-term memory (BiLSTM) networks with a multi-head attention mechanism, named as MA-BiLSTM. This integration leverages the inherent strengths of BiLSTM for capturing long-term dependencies in data sequences, while the multi-head attention mechanism enhances the model’s ability to focus on salient features crucial for the accurate identification and classification of unknown malicious traffic. Our approach is distinguished by its robustness in handling dynamic and complex attack vectors that traditional single deep learning models often fail to recognize. Comprehensive experiments conducted on various datasets reveal that our method not only achieves superior detection accuracy but also demonstrates enhanced efficiency in identifying unknown traffic types compared to existing deep learning solutions. Furthermore, we introduce a nuanced multi-dimensional feature analysis technique that employs the attention mechanism for fine-grained feature weight allocation, significantly augmenting the model's adaptability and performance in real-world network conditions. Validation in real-world network environments confirms the practicality and effectiveness of the MA-BiLSTM model, making it a promising tool for enhancing cybersecurity defenses against advanced network threats.

Cite this article

Wu Hongbin , Zhao Yufei , Zhao Qi , Wang Yuman , Chen Kai . Enhanced BiLSTM with multi-head attention for malicious network traffic detection scheme[J]. Journal of Cybersecurity, 2026 , 4(1) : 23 -33 . DOI: 10.20172/j.issn.2097-3136.251016

0 引言

近年来,网络攻击手段持续演进升级,尤其是通过恶意软件进行的攻击,对个人、企业及国家安全构成严重威胁。在此背景下,检测恶意网络流量已成为维护网络安全的关键措施。传统检测方法依赖特定攻击特征,而攻击者多变的技术和策略常使其难以有效应对新型或未知类型的恶意行为。因此,研究如何精准检测未知类型的恶意网络流量,对提升网络安全防御能力具有重要的理论和实践价值。
随着人工智能尤其是深度学习技术的快速发展,其在网络安全领域的应用日益广泛。深度学习方法凭借卓越的特征学习能力,已被用于提升网络入侵检测系统的性能。研究人员尝试采用各类深度学习模型,包括卷积神经网络(convolutional neural network,CNN)、长短期记忆(long short-term memory,LSTM)网络及自编码器等,从网络流量中自动提取有效特征以实现恶意流量分类。这些方法虽在检测精度与效率上取得一定提升,但在应对复杂且动态变化的网络攻击时仍存在局限。尽管深度学习技术在恶意流量检测中成果显著,但现有方法对未知类型攻击的检测能力依然不足,尤其体现在长程依赖关系的捕获与利用以及时序数据处理等方面。
为应对这一挑战,本文提出了一种新型的恶意网络流量检测方法,将双向长短期记忆(bi-directional long short-term memory,BiLSTM)网络与多头注意力(multi-head attention,MA)机制相结合,命名为MA-BiLSTM。该方法利用BiLSTM的结构特性,可有效捕捉数据序列中的长程依赖关系,并通过多头注意力机制增强关键特征学习能力,从而实现未知恶意流量的精准识别与分类。实验结果表明:该方法在多个数据集上超越现有深度学习方法,尤其在未知流量的检测精度与效率方面优势显著。
本文主要贡献如下:
1)提出融合BiLSTM与多头注意力机制用于未知恶意流量检测。该架构不仅优化了模型对时序数据的处理能力,更通过注意力机制增强对数据关键特征的捕获能力,这对提升未知恶意流量的检测精度至关重要;
2)引入基于多头注意力机制的多维特征分析方法,实现细粒度特征权重分配。该机制支持模型在多个维度独立解析输入时序特征,显著增强检测模型对复杂网络行为的理解与适应能力,对识别网络环境中常见的恶意行为尤为有效。
3)基于真实网络流量验证方法有效性,突破理论推演与限定实验场景的局限性。本文在真实网络环境中部署模型并进行广泛验证,既证实其工程实用性,更展现其对实际场景中未知恶意行为的高效检测能力。

1 相关工作

Dhote等[1]对流量分类中的特征选择方法进行了系统梳理,将其归纳为3类:过滤式(filter)、包裹式(wrapper)与嵌入式(embedded),并分析了各类方法的优势与局限,为后续研究提供了重要的方法论基础。
在入侵检测领域,已有多种机器学习与深度学习模型被广泛应用,包括支持向量机(support vector machine,SVM)[2]、卷积神经网络[3]、长短期记忆网络[4]及深度神经网络(deep neural networks,DNN)[5]等。Torres等[6]提出将网络流量转化为字符串,利用LSTM 模型学习字符间的序列依赖关系,在流量分类任务中取得了良好效果。然而,LSTM模型依赖前一时刻的信息,这一机制导致其无法并行计算,进而存在处理速度较慢的问题;同时,LSTM模型无法实现信息从后向前编码,在更细粒度的分类任务中性能显著下降。
针对上述问题,研究人员提出BiLSTM模型概念,这是一种由两个LSTM组成的序列处理模型:前向LSTM处理正向输入时序序列,后向 LSTM处理逆向输入序列。Roy等[7]采用基于注意力的BiLSTM与全连接层结构,对企业内系统主机的正常状态建模,并通过裸金属服务器采集的海量环境主机日志数据检测异常行为,该方法实现了勒索软件的早期检测与分类,从而防止企业关键数据被加密;Sinha等[8]提出融合CNN与BiLSTM的深度学习模型,结合数据的空间与时间特征,提升检测率的同时显著降低误报率,性能超越众多采用机器学习与深度学习模型的网络入侵检测系统。此外,一些研究[9]尝试将注意力机制与 BiLSTM结合以进一步提高模型检测能力,但这些方法在恶意网络流量检测中尚属初步探索阶段。
近年来,研究者开始探索引入更先进的序列建模机制。Zhai等[10]提出基于时间位置编码与多头注意力机制的恶意流量检测模型,旨在解决传统机器学习依赖人工特征提取,以及现有深度学习方法忽视网络流量结构特征与时间分布特性的问题;Zhang等[11]提出了融合BiLSTM与多头注意力机制的网络入侵检测模型,旨在解决特征维度高、类别分布不均衡、现有模型检测准确率普遍较低等问题。上述两项研究采用相似技术路线,但均未深入评估模型对新型或未知类型攻击的泛化能力,也未经过真实网络环境验证。
本文在上述研究基础上,聚焦于恶意流量检测中模型泛化能力不足与真实环境适应性弱的问题,这主要源于两个层面:其一,模型对流量特征的学习往往局限于训练集已有的攻击模式,难以捕捉未知威胁中细微但关键的异常模式;其二,传统评估方式多在封闭、干净的数据集上进行,未能充分模拟真实网络环境中流量复杂、多变的特性,导致模型在实际部署中性能显著下降。针对上述挑战,本文的创新性主要体现在以下两方面。
1)模型构建方面,提出一种面向未知威胁的特征增强机制。通过融合双向序列建模与多头注意力机制,模型不仅能从网络流量的前后向上下文时序关系中提取更全面的时序特征,还能在多个特征子空间中对关键性异常指标进行动态加权与特征聚焦,从而强化对未知恶意行为中微弱痕迹的感知能力。
2)实验验证方面,突破传统依赖基准数据集的评估方式,将模型部署于真实网络环境中进行测试。实验结果表明,所提模型在实际场景中具备良好的适用性与泛化能力,能够有效识别真实网络中的未知威胁,为工程化部署提供了有力支撑。

2 未知恶意流量特征分析和提取

攻击者利用恶意软件入侵目标主机,通过软件预设的网络通道,通常和命令与控制(command and control,C&C)服务器建立连接,实现远程操控。经由该通道,攻击者实现对后门进程的访问和控制,对高价值数据进行压缩、加密与封装后回传至攻击端。为确保程序隐蔽性并规避防火墙等设备检测,恶意软件会在攻击的不同阶段,根据特定目标采用多样化网络协议策略:针对目标主机网络环境的差异,动态选择传输层或应用层协议以提升攻击隐蔽性与效率。
部分恶意软件使用私有协议传输信息,以保护关键数据或规避网络审查。从网络协议分析视角看,仅能观测到此类流量的传输层信息,应用层服务识别更具挑战。因此,深度解析恶意流量所用网络协议是实现精准识别的关键环节。下文将系统阐述恶意软件常用的各类协议类型。

2.1 基于HTTP协议的数据传输

超文本传输协议(hypertext transfer protocol,HTTP)是基于TCP/IP协议栈的应用层协议,用于分布式、协作式超媒体系统[12],该协议通过默认TCP 80端口通信。RFC(request for comments)文档规定了HTTP服务的请求—响应标准:客户端发起请求,与服务器指定端口建立TCP连接,服务器监听HTTP服务端口并在收到请求后返回响应,通过状态码表示连接状态。
HTTP请求消息由请求行、请求头及请求体三部分构成。请求行包含请求方法、目标URL资源及协议版本。HTTP协议定义8种请求方式:GET、POST、PUT、HEAD、DELETE、CONNECT、OPTIONS和TRACE,其中,GET与POST最为常用。客户端通常采用GET方法从服务器获取资源,而POST方法常用于提交登录信息与上传数据资源。
HTTP请求头字段可解析为Key-Value键值对形式。在网络流量分类中常用字段包括Host与User-Agent,Host字段表示接收请求的服务器的主机名(或IP地址)及端口号;User-Agent字段用于告知服务器发起请求的客户端信息。请求头后须接空行以表示请求头的结束,空行标志后为请求体,其内容可为普通文本或加密信息。
HTTP协议常以明文形式传输数据,容易在网络流量中暴露服务类别和服务器信息。因此,对HTTP协议流量进行分类时,将请求头相关字段与已知特征进行匹配可获得较高准确率。正因HTTP的明文传输特性,一些恶意软件将通信服务器部署于云服务商,为检测与反制措施带来了新的挑战。此外,由于请求体可为加密信息,即使通过协议分析识别HTTP协议,也无法确定传输内容,这增加了恶意流量检测的复杂性。因此,此类含加密信息的HTTP协议流量被归类为未知恶意流量。
图1展示了恶意软件通过HTTP协议与C&C服务器通信的流量日志,其使用POST方法将加密数据上传至服务器,原始流量中HTTP请求数据仅含参数e,遮挡的部分暴露了服务器域名信息(敏感内容未展示),数据经过特定加密或编码处理,即使以明文形式呈现,其真实内容仍无法直接获取。显然,HTTP协议最显著特征在于明文传输,即使加密请求体中数据,请求行、请求头及参数仍可能暴露信息,这些信息可作为本节进一步分析的基础。
图 1 恶意HTTP流量

Fig.1 Malicious HTTP traffic

2.2 基于HTTPS协议的数据传输

超文本传输安全(hypertext transfer protocol secure,HTTPS)协议是 HTTP协议的扩展,用于实现网络安全通信。该协议采用SSL(secure sockets layer)/TLS(transport layer security)对数据包进行加密,确保传输数据的机密性与完整性[13]。SSL由网景公司于1994年开发,运行于TCP/IP协议与应用层之间,为数据通信提供安全保障。TLS是基于SSL并加以标准化的安全协议。出于历史兼容性与端口预留考虑,使得采用TLS 1.1/1.0及SSL 3.0/2.0保护的应用程序通常共享同一个连接端口(如HTTPS协议通常使用443端口,与所采用的具体安全协议无关)。
TLS协议的通信过程主要分为4个阶段:参数交换阶段、证书认证阶段、密钥协商阶段与数据传输阶段。参数交换阶段中,客户端与服务端通过client_hello与server_hello报文协商协议版本、加密套件及压缩方法。证书认证阶段,服务端发送证书并执行密钥交换,客户端验证证书后进入后续流程。密钥协商阶段利用参数交换阶段的信息生成密钥,以便使用选定的加密套件进行数据传输。
HTTPS的加密传输特性,使得密钥协商完成后所有数据均被加密传输,报文无法以明文形式获取,从而给网络流量检测带来挑战。然而,这并不意味着 HTTPS流量无法被分类与识别,对恶意 HTTPS流量而言,服务端域名是关键判定依据。client_hello请求的扩展字段包含服务器名称指示(server name indication,SNI)[14],可用于审查客户端访问的域名;服务端发送的证书报文(通常为X.509格式)中,commonName字段亦包含服务器域名信息。
针对HTTPS协议的恶意流量,现有两种主流应对方案:①采用中间人攻击(Man-in-the-middle attack,MITM)技术解密HTTPS加密内容,将其转换为HTTP流量后处理;②直接解析HTTPS加密流量,基于通信过程中的明文特征(如SNI及证书信息)进行处理。

2.3 基于自定义 TCP 协议的数据传输

为保护敏感内容或规避网络审查,一些恶意流量通过私有协议传输信息。此类数据传输依赖传输层TCP或UDP(user datagram protocol)协议,实际传输数据作为传输层载荷(如图2所示)。除传输层协议的首部信息外,载荷由不可打印字符构成,无法直接解析为可读文本,导致此类流量的检测与分类更具挑战性。识别并归类此类未知恶意流量正是本文致力解决的核心问题,相关特征处理与提取方法将在下文详细说明。
图 2 恶意TCP数据包

Fig.2 Malicious TCP packet

2.4 未知恶意流量特征提取

流量特征向量的选择是影响分类模型效果的关键因素。前期研究[15,16]提出从网络流量中提取统计特征的方法(粗粒度特征),可能导致分类准确率偏低;而基于流量载荷的分类方法提取载荷部分作为特征(细粒度特征),却易引发模型过拟合。为解决这一难题,本文提出融合网络流量统计特征与载荷特征的特征提取方法,旨在实现恶意流量的高效精准分类。
本实验数据集中,98%以上的网络流量基于TCP协议,故将分析重点放在TCP流量上,过滤UDP等其他协议数据包。由于在骨干网络上捕获网络流量时不可避免地会出现丢包现象,因此捕获的流量无法完整反映双向交互过程。借鉴流量特征提取经验及相关研究[17-19],从每条网络流中选取前8个数据包进行特征提取,作为模型输入。表1详述各特征的具体含义。
表 1 特征和说明

Table 1 Features and descriptions

特征 说明
port_src 源端口号
port_dst 目的端口号
IAT 包到达时间间隔,指两个连续数据包之间的到达时间差,即当前数据包与前一数据包到达时间差值,
对于网络流量中的第一个数据包,该值为0
IAT_min 前 8 个数据包的最小 IAT
IAT_max 前 8 个数据包的最大 IAT
IAT_med 前 8 个数据包的 IAT 中位数
IAT_total 前 8 个数据包的 IAT 的和
ethernet_len 以太网帧长度
IP_len IP 数据包长度
IP_ttl IP 数据包 TTL
tcph_len TCP 首部长度
tcp_data_len TCP 载荷长度
ack_pkts ACK 数据包,指所有其他 TCP FLAG 字段均为 0。仅含 ACK 标志的空数据包,用于连接维护
sack TCP 首部是否包含 SACK(选择性确认)字段
sack_len TCP 首部 SACK 字段长度
dsack TCP 首部中包含的重复 SACK 字段长度
psh TCP FLAG 中的 PSH 位是否设为 1
psh_rate 网络流量中 PSH 标志设置为1的数据包比例
urg TCP FLAG 中的 URG 位是否设为 1
urg_data_len URG 字段长度
win_size 窗口大小
adv_wind_scale 所用窗口缩放因子的大小
深度包检测技术可显著提升特定流量分类准确率。本文将数据包载荷信息纳入特征集,即除按表1提取每条流量前8个数据包特征外,另提取网络流量载荷作为特征向量的组成部分。具体方法为:拼接流内各TCP包载荷,取前64 byte作为特征向量后64个维度。HTTP协议数据处理同TCP载荷;HTTPS协议数据包若可通过中间人攻击解密,则按HTTP方式提取载荷;若不可解密,对client_hello请求包提取SNI字段后与TCP载荷拼接为64 byte,对服务端证书包则从证书提取服务器信息再与TCP载荷拼接。
需说明表1特征选取依据:恶意软件根据其程序逻辑自主发送控制指令以保持隐蔽性,通常静默潜伏,周期性间歇回传窃取数据。多数未知恶意流量的传输间隔可持续数秒,而正常流量的传输间隔较短。此外,在涉及同源和目的IP对的恶意流量中,观察到最大传输间隔存在明显差异。这种差异可能是恶意流量故意引入延迟以逃避检测,故重点关注IAT相关特征。
在TCP握手过程中,PSH标志可作为识别恶意网络流量的依据。通常,在正常数据包中,PSH值并不总为0。然而,在恶意流量中,许多数据包的PSH值为0,致使PSH = 1的数据包占比偏低。同样,在多数正常流量中,URG值通常为0,而某些恶意流量可能会将值设为1。
文献[20]研究表明,恶意软件与C&C服务器的通信频率非常低,有时几天甚至几周都不会发送任何数据。此外,恶意软件不仅发送频率低,而且发送流量规模也较小。基于这些发现,本文提取了各协议数据包首部长度和载荷长度作为重点分析维度。
综上,为每个数据包构建维度为22~86的特征向量,每条网络流量选取前8个数据包,其中前3个数据包构成 TCP 3次握手,最终每条网络流量由496维特征集描述。此特征提取方案有效性将在实验验证部分检验。

3 模型构建

由Hochreiter和Schmidhuber[21]提出的LSTM模型,其独特的架构设计使其擅长处理和预测时间序列中长间隔事件,已在众多领域得到广泛应用和成功。该模型通过训练过程中的记忆与遗忘机制,能有效捕获长程依赖关系。然而,LSTM模型存在固有局限:仅能捕捉序列中的历史信息,无法利用序列中的未来信息。为了在预测当前时刻时同时利用前后信息,可采用BiLSTM模型[22]。该序列处理模型包含两个LSTM:前向LSTM处理正向输入序列,后向LSTM处理反向输入序列,最终输出双向特征拼接结果。
注意力机制是一种模拟人脑认知注意力的技术。在机器学习与深度学习模型中,它作为嵌入式结构用于计算输入数据对输出数据的贡献度。这种机制允许对信息进行加权分配,并最终实现加权求和。因此,该机制可显著提升模型的可解释性与有效性。注意力机制的抽象定义如下:
$ {\text{Attention}} (Q,K,V) = {\text{Softmax}} \left( {\frac{{Q{K^T}}}{{\sqrt {{d_k}} }}} \right)V $
目前,注意力机制种类繁多,其中应用最广泛的是自注意力机制与多头注意力机制。多头注意力机制通过在多个独立投影空间构建不同的投影信息,对输入矩阵进行差异化投影以获取多个输出矩阵,最终将其拼接起来。计算公式如下:
$ {\text{MultiHead}} (Q,K,V) = {\text{Concat}} ({\text{hea}}{{\text{d}}_{\text{1}}}{\text{,}}\cdots{\text{,hea}}{{\text{d}}_{{h}}}){W^0} $
$ {\text{hea}}{{\text{d}}_{{i}}} = {\text{Attention}} (QW_i^Q,KW_i^K,VW_i^V) $
多头注意力的核心在于并行执行多组独立的注意力计算。通过多个注意力头,模型能够以不同方式聚焦序列的不同部分(如更有效地捕获长程依赖与短程依赖)。这种多组独立注意力计算机制使模型能高效处理复杂输入序列,从而提升整体性能。
网络流量分类本质是序列数据处理过程。BiLSTM模型专为序列建模设计,可深度提取特征序列的上下文信息,构建特征的向量表示。鉴于不同特征贡献度各异,常需差异化加权,引入注意力机制可实现对特征的差异化加权,从而强化对关键特征的后续学习过程。因此,将BiLSTM与注意力机制相结合可以提升分类精度。直观来看,多头注意力机制能够分配更合理的权重,有助于提升分类性能。
为提升恶意流量检测精度、克服传统循环神经网络(recurrent neural network,RNN)的梯度消失与梯度爆炸问题,并确保长短程上下文依赖的有效学习,本文提出了MA-BiLSTM检测模型。该模型旨在检测未知恶意网络行为,其模型结构如图3所示。
图 3 MA-BiLSTM模型结构

Fig.3 The structure of the MA-BiLSTM model

首先,依据第2节所述方法从原始网络流量中提取特征,所得特征向量作为 BiLSTM的输入(x)。接下来,本文将详细介绍多头注意力机制的构建逻辑。在给定网络流量中,特定流量片段对检测结果起关键作用,由于单一特征可能会影响多个维度,因此需引入多头注意力机制,通过多维度视角对每个特征合理加权,以代表整体结果。
$ Y = \tanh ({W_{k1}}{{\boldsymbol{H}}^{\mathrm{T}}}) $
$ Z = {\text{softmax}} ({W_{k2}}Y) $
H作为多头注意力机制的输入查询向量,依据公式(4)和(5)通过softmax函数计算各注意力头的归一化重要性权重,生成权重向量Z。本文将ZH的乘积作为特征嵌入。
$ {\boldsymbol{M}} = {\boldsymbol{ZH}} $
将公式(6)结果与原始流量特征融合,得M'=MFF表示原始流量特征)。最终softmax函数表示如下
$ \widehat y = {\text{softmax}} ({W_f}M' + {b_f}) $
其中,Wf 为输出层权重:
损失函数方程定义如下:
$ {\mathrm{Loss}} = - \sum\limits_{i = 1}^e {{y_i}\log ({{\widehat y}_i})} $
其中,e为类别标签总数,y为第i类真实标签,$ {\widehat y_i} $为公式(7)所得预测概率。

4 验证与分析

为评估MA-BiLSTM检测模型的性能,本文首先收集必要实验数据,进而验证该模型相关性能指标,并与其他深度学习模型进行对比,最终从多维度探究相关参数的调优配置。

4.1 数据集

恶意网络行为分析领域长期面临数据短缺问题,缺乏专用大型公共数据集。现有数据集(如UNSW-NB15[23]、CAIDA[24]与CIC-IDS2018[25])主要覆盖已知类型的恶意网络流量,对未知类型的恶意网络流量覆盖不足。一些从事恶意网络行为检测的研究人员虽公开共享数据子集(如Contagio博客[26]发布的数据及Siddiqui等[27]的研究数据),但满足实验需求的可用数据仍显匮乏,需从实际环境与模拟环境中生成网络流量数据。
为构建正常流量数据集本文从8台物理机、5台虚拟机及1台路由器的小型局域网中,连续采集14天的全量网络流量(所有设备均已通过人工检查,并更新最新补丁,确保环境纯净)。流量采集期间设备处于日常使用状态,共采集180 425条正常网络流量。
为构建恶意流量数据集,本文收集 Contagio[26]博客及Siddiqui[27]等研究中的未知类型恶意流量,但此类数据相对较少,故另配置3台独立设备作为恶意软件运行平台,运行16种不同的恶意软件样本,具体包括:勒索软件(Locky、Cerber、WannaCry、Petya)、木马(Dridex、Dyre、Vawtrak、Carberp、SpyEye、Citadel、Zeus)、蠕虫(Conficker)、Rootkit(TDSS))、僵尸网络(ZeroAccess、Mirai)、病毒(Sality),最终捕获56 089条已知类型恶意网络流量。
综上,本文所使用的数据集包括正常流量和恶意流量两大类,其中,恶意流量涵盖了未知与已知两种类型。
根据第2节所述方法,本文筛选出 HTTP、HTTPS及TCP协议的数据包。为提升模型训练效率与数据质量,执行以下预处理操作:①丢弃包数少于8的网络流量;②对载荷小于64 byte的数据包采用零填充补齐,对超出64 byte的部分截断丢弃。从符合条件的网络流量集中,分别从正常流量集与恶意流量集随机选取40 000条,其中,80%作为训练集,20%作为测试集。本文采用公式(9)作为评估指标。
$ \left\{ \begin{gathered} {\mathrm{PRE}} = \frac{{{\mathrm{TP}}}}{{{\mathrm{TP}} + {\mathrm{FP}}}} \\ {\mathrm{REC}} = \frac{{{\mathrm{TP}}}}{{{\mathrm{TP + FN}}}} \\ {\mathrm{FNR}} = \frac{{{\mathrm{FN}}}}{{{\mathrm{FN}} + {\mathrm{TP}}}} \\ {\mathrm{FPR}} = \frac{{{\mathrm{FP}}}}{{{\mathrm{FP}} + {\mathrm{TN}}}} \\ F1 = \frac{{2 \times {\mathrm{PRE}} \times {\mathrm{REC}}}}{{{\mathrm{PRE}} + {\mathrm{REC}}}} \\ {\mathrm{ACC}} = \frac{{{\mathrm{TP}} + {\mathrm{TN}}}}{{{\mathrm{TP}} + {\mathrm{TN}} + {\mathrm{FP}} + {\mathrm{FN}}}} \\ \end{gathered} \right. $
其中,TP为真正例,FP为假正例,TN为真负例,FN为假负例,PRE为查准率,REC为召回率,FNR为漏报率,FPR为误报率,ACC为准确率。

4.2 运行环境

为保障实验的可复现性与结果的可靠性,本节对所有实验的硬件配置与软件环境进行详细说明。
1)硬件配置方面:实验平台搭载一颗Intel Xeon Gold 6248R CPU,并采用两张NVIDIA GeForce RTX 3090 GPU(单卡显存24 GB)用于模型训练的并行加速。系统内存(RAM)为256GB,确保大规模网络流量数据能够被完整加载并高效处理。
2)软件与依赖库方面:操作系统为Ubuntu 20.04 LTS。所有代码基于Python 3.8实现,深度学习框架采用PyTorch 1.12.1,并搭配CUDA 11.3以充分利用GPU的计算能力。数据处理主要依赖NumPy 1.21.5和Pandas 1.4.2,而模型评估则基于Scikit-learn 1.0.2 库实现。

4.3 MA-BiLSTM模型检测结果对比

将上述数据集应用于MA-BiLSTM 模型进行训练与测试。为确保检测结果的客观性,训练集与测试集均为随机抽取,程序独立运行10次,并以10次结果的平均值作为最终结果。统计结果详见表2
表 2 MA-BiLSTM模型的检测结果

Table 2 Detection results of MA-BiLSTM

模型 ACC PRE REC F1值 FNR FPR
MA-BiLSTM 97.72% 96.96% 98.45% 97.70% 1.55% 2.99%
表2可知,MA-BiLSTM模型基本满足预定义的设计要求,且表现出良好的检测性能。为进一步验证该模型有效性,本文在相同数据集和实验流程下,比较了 MA-BiLSTM模型与其他深度学习模型的性能,对比结果详见表3
表 3 MA-BiLSTM模型与其他深度学习模型性能对比结果

Table 3 Performance results between MA-BiLSTM model and other deep learning models

模型 ACC PRE REC F1值 FNR FPR
MA-BiLSTM 97.72% 96.96% 98.45% 97.70% 1.55% 2.99%
LSTM 95.29% 94.05% 96.45% 95.23% 3.55% 5.81%
BiLSTM 96.16% 95.39% 96.89% 96.13% 3.11% 4.54%
A-LSTM 95.87% 94.81% 96.86% 95.82% 3.14% 5.08%
A-BiLSTM 97.48% 97.70% 97.27% 97.49% 2.73% 2.31%
MA-LSTM 95.74% 95.88% 95.61% 95.74% 4.39% 4.14%
显然,MA-BiLSTM模型在准确率、召回率和F1值上均取得最高值,同时保持最低的漏报率。这表明本文提出的模型性能优于其他深度学习模型。其中,作为基线模型的 LSTM 始终表现欠佳,凸显了其他模型改进策略的有效性。通过A-LSTM与LSTM、A-BiLSTM与BiLSTM的对比可知,引入注意力机制可提升模型检测效果。然而,MA-LSTM与A-LSTM、MA-BiLSTM与 A-BiLSTM的性能对比并非均呈现改进趋势,此现象可能归因于多头注意力机制的特性—头数的选择对最终的检测效果有显著影响。
为进一步验证该模型在真实网络环境中的有效性,本文从某高校骨干网络采集了200 GB原始流量,在相同数据集和实验流程下,进一步对比了MA-BiLSTM模型与其他深度学习模型的性能,比较结果如表4所示。
表 4 真实网络环境模型性能检测结果

Table 4 Model performance detection results in real-world network traffic

模型 检出数 TP FP PRE
MA-BiLSTM 774 676 98 87.34%
LSTM 412 271 141 65.78%
BiLSTM 483 328 155 67.91%
A-LSTM 519 376 143 72.45%
A-BiLSTM 587 431 156 73.42%
MA-LSTM 698 582 116 83.38%
MA-BiLSTM模型共识别出774条未知恶意网络流量,进一步分析显示,人工核验结果为676条真正例与98条假负例,查准率达87.34%。MA-BiLSTM模型在检出数和查准率上均取得最高值,这表明该模型性能优于其他深度学习模型。
表5所示,676条确认样本经沙箱(Cuckoo+Joe Sandbox)与VT行为标签聚类后,可归为6类,与训练集已知家族无重叠,确认为“未知”类型,表明该模型达成预期目标。
表 5 未知流量行为分类

Table 5 Categorization of unknown traffic behaviors

行为族 数量 典型标签(VT 检出名) 主要恶意指标
木马远控 247 AsyncRAT, Nanocore, Remcos 持续外联、键盘记录
挖矿 198 XMRig, CoinMiner Stratum协议、100+ CPU占用
流氓下载器 102 PrivateLoader, SmokeLoader 多阶段PE投放
WebShell 通信 78 China Chopper, AntSword POST载荷含eval关键字
蠕虫横向 36 EternalBlue利用流 SMB异常445扫描
其他/未命名 15 —— 低频次可疑DGA
真实网络流量与实验数据集的检测效果存在明显差异,可能源于以下两个因素:①模型训练样本的规模较小,需拓展训练集以提高模型的泛化能力;②模型内部因素影响,如特征提取过程中每条流量的数据包数量、从载荷中提取的字节数,以及多头注意力机制中头数的选择。下文将深入分析这些因素。
总体而言,MA-BiLSTM模型在实验数据集与真实网络流量环境中均展现出优异的未知恶意流量检测性能,取得显著效果。相较于现有深度学习分类模型,该模型通过时序数据处理优势提升了网络流量分类的适应性,可使安全人员能在网络攻击的早期和中期阶段检测到未知恶意行为,从而实现及时告警与精准响应。

4.4 其他因素的影响

模型内部其他因素也可能影响最终检测效果。此前,这些因素的选择主要以经验为指导,例如提取64 byte的载荷。本文对此类因素展开分析。
(1)网络流量中的数据包数量
如第2节所述,在特征提取阶段,从每条网络流量中提取8个数据包。对基于TCP和HTTP协议的流量,完成TCP 3次握手后即可开始传输数据,即从第4个数据包起可获取载荷信息;对于HTTPS协议流量,因 TLS握手及密钥交换过程复杂,数据传输不会从前8个数据包开始,导致无法提取HTTPS载荷特征。因此,本小节在实验数据集和其他参数固定不变条件下,分析单个流量提取数据包数量变化对检测效果的影响,结果如图4所示。
图 4 提取数据包数量对实验结果的影响

Fig.4 Impact of packet extraction counts on experimental results

将单个流量提取数据包数增至12个可提升检测效果,但继续增加包数将导致检测性能下降,此现象源于特征维度膨胀引发的过拟合。图4表明:当提取包数超过10个时,模型检测效果提升有限,训练时长却显著增加。从成本收益角度考量,单个流量最佳包数应控制在6~10个。增加包数的目的是优化HTTPS协议载荷的特征提取效率,然而数据表明更高包数并未显著改善检测效果,这说明加密载荷作为特征不会对检测结果产生实质性影响。
(2)载荷提取的字节数
本文借鉴以往研究的经验,将载荷提取长度预设为64 byte。图5展示了不同载荷提取长度对实验结果的影响。随着载荷提取长度增加,模型检测性能先小幅上升后急剧下降。此现象源于载荷长度变化导致特征向量维度显著改变,超出临界点后特征向量过度稀疏化,损害模型学习能力。对于MA-BiLSTM 模型,载荷提取长度设置在64~96 byte最优。
图 5 载荷提取长度对实验结果的影响

Fig.5 Impact of payload extraction length on experimental results

(3)注意力头数
MA-BiLSTM模型集成了多头注意机制,其注意力头数需能被特征向量维度整除。在未优化的MA-BiLSTM模型中,每条流量提取8个数据包且从每个载荷中提取64 byte,生成每条流量496维的特征向量。因此,注意力头数存在若干可行取值,实验结果如图6所示。
图 6 注意力头数对实验结果的影响

Fig.6 Impact of the number of attention heads on experimental results

实验表明,在多头注意力机制中,头数增加未必提升模型性能。此现象源于注意力机制本质是对矩阵进行线性变换,其输出具有离散特性,无法精确表示目标的连续概率分布。该差异会导致与真实目标产生误差,且头数增多时误差累积放大,最终削弱模型性能。本模型最优头数为4或8个。

5 结束语

本文提出一种基于多头注意力双向长短期记忆网络的检测方法。首先,分析了从公开数据集与真实网络环境收集到的恶意流量特征。随后,阐述了MA-BiLSTM模型构建过程。接着,该方法在实验数据集与真实网络流量上进行了实证测试,并与多种主流深度学习方法进行了测试对比。最后,评估并讨论了影响模型检测性能的几个因素。实验结果表明:该方法在实验数据集上检测准确率超过97%,且能够在真实流量场景中识别未知类型的网络攻击。本文通过人工调整训练集以规避数据失衡问题,然而实际环境中恶意流量占比极低,非平衡数据场景的检测技术将成为未来重点研究方向。
1
Dhote Y, Agrawal S, Deen A J. A survey on feature selection techniques for internet traffic classification[C]//2015 International Conference on Computational Intelligence and Communication Networks(CICN), Jabalpur, India, Piscataway, USA: IEEE, 2015: 1375-1380.

2
Ma Q, Sun P C, Wang R R, et al. A novel model for anomaly detection in network traffic based on kernel support vector machine[J]. Computers & Security, 2021, 104, 102215.

3
Hwang R H, Peng M C, Huang C W, et al. An unsupervised deep learning model for early network traffic anomaly detection[J]. IEEE Access, 2020, 8, 30387- 30399.

DOI

4
Lindemann B, Maschler B, Sahlab N, et al. A survey on anomaly detection for technical systems using LSTM networks[J]. Computers in Industry, 2021, 131, 103498.

DOI

5
Ahmad Z, Khan A S, Shafai M S, et al. Anomaly detection using deep neural network for IoT architecture[J]. Applied Sciences, 2021, 11 (15): 7050.

DOI

6
Torres P, Catania C, Garcia S, et al. An analysis of recurrent neural networks for botnet detection behavior[C]//2016 IEEE Biennial Congress of Argentina(ARGENCON), Buenos Aires, Argentina, Piscataway, USA: IEEE, 2016: 1-6.

7
Roy K C, Chen Q. DeepRan: Attention-based BiLSTM and CRF for ransomware early detection and classification[J]. Information Systems Frontiers, 2021, 23 (2): 299- 315.

DOI

8
Sinha J, Manollas M. Efficient deep CNN-BiLSTM model for network intrusion detection[C]//Proceedings of the 2020 3rd International Conference on Artificial Intelligence and Pattern Recognition (AIPR), New York, USA: ACM, 2020: 223-231.

9
Liu G, Guo J B. Bidirectional LSTM with attention mechanism and convolutional layer for text classification[J]. Neurocomputing, 2019, 337, 325- 338.

DOI

10
Zhai Y, Lu B, Li X. TPE-MHA: a malicious traffic detection model based on time position encoding and multi-head attention[C]//2021 IEEE 21st International Conference on Communication Technology (ICCT), Piscataway, USA: IEEE, 2021: 143-151.

11
Zhang J, Liu Y, Zhang H, et al. A network intrusion detection model based on BiLSTM with multi-head attention mechanism[J]. Electronics, 2023, 12 (19): 4035.

DOI

12
Internet Engineering Task Force (IETF). Hypertext transfer protocol (HTTP/1.1)[EB/OL]. [2025-09-25]. https://datatracker.ietf.org/doc/html/rfc7230.

13
Network Working Group. The transport layer security (TLS) protocol version 1.1[EB/OL]. [2025-09-25]. https://www.rfc-editor.org/rfc/rfc4346.

14
Network Working Group. Transport layer security (TLS) Extensions[EB/OL]. [2025-09-25]. https://www.ietf.org/rfc/rfc3546.txt.

15
Kasongo S M. A deep learning technique for intrusion detection system using a recurrent neural networks based framework[J]. Computer Communications, 2023, 199, 113- 125.

DOI

16
He K, Kim D D, Asghar M R. Adversarial machine learning for network intrusion detection systems: a comprehensive survey[J]. IEEE Communications Surveys & Tutorials, 2023, 25 (1): 538- 566.

17
Shafiq M, Yu X, Laghari A A, et al. Network traffic classification techniques and comparative analysis using machine learning algorithms[C]//2016 2nd IEEE International Conference on Computer and Communications (ICCC), Chengdu, China. Piscataway, USA: IEEE, 2016: 2451-2455.

18
Shafiq M, Tian Z, Bashir A K, et al. CorrAUC: A malicious Bot-IoT traffic detection method in IoT network using machine-learning techniques[J]. IEEE Internet of Things Journal, 2021, 8 (5): 3242- 3254.

DOI

19
Zhao J J, Liu J Y, Yang L, et al. Network traffic classification for data fusion: a survey[J]. Information Fusion, 2021, 72, 22- 47.

DOI

20
Zhao G, Xu K, Xu L, et al. Detecting APT malware infections based on malicious DNS and traffic analysis[J]. IEEE Access, 2015, 3, 1132- 1142.

DOI

21
Hochreiter S, Schmidhuber J. Long short-term memory[J]. Neural Computation, 1997, 9 (8): 1735- 1780.

DOI

22
Graves A, Schmidhuber J. Framewise phoneme classification with bidirectional LSTM and other neural network architectures[J]. Neural Networks, 2005, 18 (5): 602- 610.

23
Moustafa N, Slay J. UNSW-NB15: a comprehensive data set for network intrusion detection systems (UNSW-NB15 network data set)[C]//2015 Military Communications and Information Systems Conference (MilCIS), Canberra, Australia. Piscataway, USA: IEEE, 2015: 1-6.

24
Caida dataset[EB/OL]. [2025-09-25]. https://www.caida.org/.

25
CSE-CIC-IDS2018 on AWS[EB/OL]. [2025-09-25]. https://www.unb.ca/cic/datasets/ids-2018.html.

26
Parkour M. Contagio malware database[EB/OL]. [2025-09-25]. http://www.mediafire.com/?a49l965nlayad#a49l965nlayad.

27
Siddiqui S, Khan M S, Ferens K, et al. Detecting advanced persistent threats using fractal dimension based machine learning classification[C]//Proceedings of the 2016 ACM on International Workshop on Security and Privacy Analytics, New York, USA: ACM, 2016: 64-69.

Outlines

/