Technology Application

UAV auxiliary insulator defect detection mechanism based on partial convolution and dynamic-static fusion

  • YANG Huiting 1 ,
  • YANG Zhi , 2, * ,
  • GUO Qingrui 1 ,
  • LI Feng 1 ,
  • GUO Xuerang 1 ,
  • GUO Zhiqing 2 ,
  • WANG Liejun 2
Expand
  • 1. Electric Power Science Research Institute of State Grid Xinjiang Electric Power Company, Urumqi 830017, China
  • 2. School of Computer Science and Technology, Xinjiang University, Urumqi 830017, China

Online published: 2025-03-19

Copyright

Copyright ©2025 Journal of Aeronautical Materials. All rights reserved.

Abstract

When automatically detecting defects in insulator images by unmanned aerial vehicle (UAV) , the frequent use of the attention module by the detection algorithm leads to large model parameters and poor real-time performance. In order to realize lightweight and high-accuracy UAV intelligent inspection, a vision transformer (ViT) based UAV insulator defect detection model based on DEtection TRansformer (UID-DETR) was proposed. Firstly, the proposed fast re-parameterization module (FREP) utilized the partial convolution (PConv) and re-parameterization convolution (RepConv) to reduce redundant computations and extract spatial features efficiently. Secondly, the efficient intra-scale interaction module (EISI) was designed for enhancing the interaction of high-level features. Thirdly, the complementary integration of high-level and low-level semantic information was realized by the feature fusion strategy of static fusion (STF) and dynamic fusion (DYF). Extensive experimental results verified the effectiveness of the proposed method on open-source synthetic foggy insulator dataset (SFID) and self-made insulator dataset (SID).

Cite this article

YANG Huiting , YANG Zhi , GUO Qingrui , LI Feng , GUO Xuerang , GUO Zhiqing , WANG Liejun . UAV auxiliary insulator defect detection mechanism based on partial convolution and dynamic-static fusion[J]. Journal of Cybersecurity, 2025 , 3(1) : 86 -99 . DOI: 10.20172/j.issn.2097-3136.250108

0 引言

随着我国用电需求的增加和发电技术的日益成熟,高压输电线路的规模不断扩大。绝缘子是输电线路中广泛使用的部件,负责支撑电线并使其与地面绝缘。绝缘子一旦因老化、外力破坏或自然磨损等原因出现损坏或脱落,将直接威胁输电线路的稳定运行,甚至可能引发大规模停电或更严重的安全事故,从而给社会经济和人民生活带来巨大损失和安全隐患。因此,实现对绝缘子缺陷的实时、精准检测,成为确保输电线路长期安全、高效运行的重要前提和迫切需求。然而,面对分布广泛、数量庞大的输电线路,传统的人工检测方法不仅耗时费力、效率低下,而且难以覆盖所有关键区域,存在检测盲区,无法满足大规模输电线路快速、全面的检测要求。
在这样的背景下,无人机(Unmanned Aerial Vehicle,UAV)技术凭借其独特的优势逐渐崭露头角,成为检测绝缘子缺陷的主要工具和重要手段。无人机能够搭载先进的传感器和图像识别系统,通过实时感知和快速分析实现对绝缘子表面缺陷、裂纹、污渍以及脱落等潜在威胁的精准识别。这不仅极大地提高了检测效率,降低了人力成本,还使得检测工作更加全面、细致,能够及时发现并预警潜在的绝缘子缺陷,为输电线路的安全运行提供了有力保障。同时,随着无人机技术的不断发展和完善,其在电力巡检领域的应用前景将更加广阔,为构建智能电网、提升电力服务水平奠定了坚实基础。
无人机绝缘子缺陷检测方法的结构主要有两种:基于卷积神经网络(Convolutional Neural Network,CNN)的结构和基于Vision Transformer(ViT)的结构。目前,使用这两种结构的检测器主要在特征提取和特征融合方面进行改进。在特征提取阶段,为了实现轻量级特征提取,基于CNN的检测器通常有两种改进模式:引入轻量级卷积[1-5]和使用轻量级骨干网络[6-11]。此外,基于ViT的检测器更多地使用现有的轻量级骨干网络,但很少有研究对骨干网络进行优化。在特征融合阶段,基于CNN的检测器[12-13]通常将轻量级卷积引入特征金字塔网络(Feature Pyramid Network,FPN)。然而,基于ViT的检测器在特征融合阶段更多是为了获得更丰富的上下文信息,却忽略了模型的参数[14-16]
综上所述,为了解决基于ViT方法的局限性,本文在特征提取阶段和特征融合阶段都采用了轻量级和高效的策略。如图1所示,本文所提的模型使用较低的模型参数,同时提高了检测精度和检测速度。本文的主要贡献在于:
图 1 模型的参数量和推理时间与检测精度的关系(详情见表1)

Fig.1 Relationship of model parameters and inference time to detection accuracy (details are in Table 1)

(1)提出了一种快速重参数模块(Fast Re-parameterization Module,FREP),降低了模型参数,提高了骨干网络的特征提取能力。
(2)设计了一个新的高效内尺度交互模块(Efficient Intra-scale Interaction Module,EISI),通过高效加性注意力增强了高层级的语义信息交互。
(3)提出了一种高效的静态融合(Static Fusion,STF)和动态融合(Dynamic Fusion,DYF)策略,充分融合了不同层次的特征信息。
(4)采集和标注了2 312幅野外无人机绝缘子缺陷图像,构建了一个自制绝缘子数据集(Self-made Insulator Dataset,SID)。
(5)提出了一种基于ViT的无人机绝缘子缺陷检测模型(UAV Insulator Defect Detection Model based on DEtection TRansformer,UID-DETR),该模型在合成雾状绝缘子数据集(Synthetic Foggy Insulator Dataset,SFID)[17]和SID上进行了大量实验,结果表明该模型具有良好的无人机绝缘子缺陷检测能力。

1 相关工作

1.1 高精度绝缘子缺陷检测方法

为了提高无人机绝缘子缺陷检测的精度,众多基于CNN的绝缘子检测方法将注意力模块嵌入模型的骨干网络、特征金字塔和检测头中。Wei等[18]将卷积块注意力模块(Convolutional Block Attention Module,CBAM)纳入YOLOv5的骨干网络中。Wang等[19]和Chen等[20]在骨干网络中嵌入协调注意机制(Coordinate Attention)。Xie等[21]在YOLOv4的FPN中引入了挤压和激励(Squeeze-and-Excitation)注意力模块。为了提高对小目标绝缘子缺陷的检测精度,Jiang等[22]和Chang等[23]分别将CBAM和全局注意机制(Global Attention Mechanism)集成到YOLOv7的检测头中。在基于ViT的绝缘子缺陷检测方法中,Li等[14]设计了自注意力上采样,以解决在特征融合过程中捕获详细语义信息的挑战。Yuan等[15]在编码器中利用通道注意力来加强不同通道之间的相互依赖性。Tang等[24]在模型的ResNet50骨干网络中引入CBAM。对于基于特征融合架构的方法,Tang等[25]优化了FPN中的池结构,以保留更多的特征信息。Li等[26]和He等[27]替换了YOLO的路径聚合网络(Path Aggregation Network,PANet),以提高检测精度。
虽然上述方法已经达到了很高的检测精度,但注意力模块的频繁使用使得它们难以在无人机中部署。因此,与其他直接插入注意力模块的方法不同,本文在特征提取中结合了轻量级卷积和重参数化技术的优点,在检测精度和模型参数量上取得了很好的平衡。同时,本文在特征融合部分通过高效的动静态特征融合策略进一步提高了检测精度。

1.2 轻量级绝缘子缺陷检测方法

近年来,许多轻量级的检测方法推进了无人机绝缘子缺陷检测的实际应用。对于基于CNN的检测器,Chen等[7]使用MobileNetV1作为骨干网络,而Niu等[8]和Zhu等[9]引入了MobileNetV3。Wang等[10]引入了ShuffleNetV2,使模型易于部署到资源有限的无人机设备中。Zou等[28]直接用YOLOv8n的CSPDarknet来替代ResNet50,使模型更加轻量化。Zhang等[29]采用轻量级FasterNeXt网络来降低网络规模和计算量。对于基于ViT的检测器,Liu等[30]采用ResNet50作为骨干网络。除了替换骨干网络之外,另一个有效的轻量级策略是使用轻量级卷积。Su等[1]和Zhang等[2]分别在YOLOv8的特征提取部分和特征融合部分引入了轻量级GSConv。Li等[3]和Qi等[4]在YOLOv5的特征提取和特征融合部分都使用了Ghost卷积(GhostConv),以降低计算复杂度。
在上述方法中,无论是轻量级骨干网络还是轻量级卷积,直接使用它们都会损失一定的检测精度。同时,在无人机绝缘子缺陷检测中,轻量化研究主要集中在基于CNN的检测方法上,而基于ViT的检测方法的轻量化研究还比较缺乏。本文在确保检测精度的同时,让模型更加轻量化。

2 改进方法

2.1 整体概述

本文提出了一种新的无人机绝缘子缺陷检测方法,其总体结构如图2所示。包含缺陷的无人机绝缘子图像首先由骨干网络进行处理,以提取其特征。骨干网络最后四层(S2、S3、S4和S5)的特征被输入到编码器中。将二维S5特征转换为向量,并将其输入到EISI中。然后,将EISI的输出调整回二维,表示为F5。接着,将S2、S3、S4和F5的特征进行跨尺度融合。随后,交并比(Intersection over Union,IoU)感知查询选择(IoU-aware Query Selection)从跨尺度融合的输出中选择图像特征。最后,由解码器和分类头(Decoder & Head)获得目标的置信度分数和边界框。在上述过程中,关键结构包括三个部分:(1)快速重参数模块;(2)高效内尺度交互模块;(3)动态融合和静态融合策略。
图 2 用于无人机绝缘子缺陷检测的UID-DETR的总体结构

Fig.2 Overall structure of UID-DETR for UAV insulator defect detection

2.2 快速重参数模块

在深度学习中,骨干网络负责从原始输入数据中提取高级特征,这些特征对于后续的检测任务至关重要。骨干网络的最后几层,尤其是接近输出的部分,往往承担着更为精细和特定的角色。在UID-DETR特征提取的最后阶段,通过三层轻量级特征提取模块(Lightweight Feature Extraction,LFE)获得不同大小的特征图,继而更好地处理图像中不同尺寸的目标。而FREP是LFE中的关键模块,其结合了部分卷积(Partial Convolution,PConv)[31]和重参数化卷积(Re-parameterization Convolution,RepConv)[32]的轻量化特点。
对于输入${F_x} \in {\mathbb{R}^{H \times W \times C}}$,其中$H \times W$表示空间维度,$C$表示通道数,$x$为下标。FREP通过部分重参数模块进行初始的轻量卷积操作,图3展示了具体操作过程。与频繁访问内存的常规卷积不一样,PConv在保留常规卷积提取空间特征能力的同时,减少了冗余计算。PConv会选择一个通道子集(如总通道数的1/4)进行卷积操作,剩余通道则保持不变。同时,部分重参数模块通过RepConv对PConv选择的通道子集进行卷积操作。RepConv在训练阶段使用多分支的卷积层,而在推理阶段将这些分支的参数重参数化到主分支上,形成一个等价的单一卷积层,从而减少内存消耗。通过重参数化技术,RepConv可以在保持或提升模型性能的同时,显著提高模型的推理速度。部分重参数模块用数学公式表示为:
图 3 FREP的整体结构

Fig.3 Overall structure of FREP

$ {{{P}}_{\text{1}}}{(} \cdot {)}{\text{ = }}{{{G}}_{{{\mathrm{PR}}} }}({{\boldsymbol{F}}_{{x}}},{{{c}}_{{p}}},{{n}}) $
其中,${{P}_{{{\mathrm{out}}}}}$表示部分重参数模块之后的输出,${G_{{\text{PR}}}}( \cdot )$表示部分重参数操作,${c_p}$表示实际进行卷积操作的通道,$n$的值为${c_p}/C$。Chen等[31]研究发现,不同通道中的特征图高度相似,所以进行部分卷积也不太影响精度。同时,Chen等[31]通过实验发现,当${c_p}/C$取1/4时效果最好。因此,本文在实验中将$n$设为4。
理论上,部分重参数模块仍然会牺牲网络的特征提取能力。为此,FREP在部分重参数模块之后使用多层感知机(Multilayer Perceptron,MLP)来学习更加复杂的特征表示,并通过正则化技术DropPath增加模型的泛化能力,减少过拟合。DropPath在训练过程中,以一定的概率随机丢弃整个样本的路径,减少模型对某些特定样本的依赖。FREP用公式可以描述为:
$ {F_1}( \cdot ) = {G_{{\text{DropPath}}}}({G_{{\text{MLP}}}}({{{\boldsymbol{P}}}_{{{\mathrm{out}}}}})) + {{{\boldsymbol{F}}}_{x}} $
其中,${{F}_{{{\mathrm{out}}}}}$表示经过FREP增强后的特征,${G_{{\text{MLP}}}}( \cdot )$表示MLP操作,${G_{{\text{DropPath}}}}( \cdot )$表示DropPath操作。

2.3 高效内尺度交互模块

在目标检测任务中,多尺度特征的有效交互是提升模型性能的关键。然而,传统的CNN方法在处理多尺度特征时,往往存在特征交互不充分的问题,尤其是在处理复杂场景和多样目标时,模型难以捕捉到足够的上下文信息和特征间的关联。同时,随着Transformer架构在自然语言处理领域的成功应用,人们开始挖掘其在目标检测中的潜力。RT-DETR基于Transformer实现了初步的实时性目标检测,RT-DETR中的基于注意力的尺度内特征交互模块(Attention-based Intra-scale Feature Interaction,AIFI)[33]通过引入自注意力机制,捕捉图像中概念实体间的联系,从而更有效地利用高层特征的信息。而且,AIFI通过仅在高级特征层(如S5)上进行内部尺度交互,就可以显著降低计算成本。
然而,AIFI主要关注高级特征层的内部尺度交互,这会损失一定的模型检测性能。同时,AIFI中的自注意力机制在局部位置信息捕获方面存在不足,会影响模型在处理无人机检测微小绝缘子缺陷任务时的性能。因此,本文在高效内尺度交互模块中使用高效加性注意力(Efficient Additive Attention)[34]来进一步提高模型高级特征层的内部尺度交互,在提高模型检测精度和实时性的同时,几乎不增加额外的参数量,具体结构如图4所示。
图 4 EISI的整体结构

Fig.4 Overall structure of EISI

为了降低复杂度,高效加性注意力用元素级乘法(Element-wise Multiplication)和线性层(Linear Layer)来替换传统的键-值(Key-Value)交互。对于输入嵌入矩阵$ {{\boldsymbol{x}}} $,其被转换为查询(${{\boldsymbol{Q}}}$)和键(${{\boldsymbol{K}}}$)矩阵。该过程表示为:
$ {{\boldsymbol{Q},{\boldsymbol{K}}} = {\boldsymbol{x}}}{{{\boldsymbol{W}}}_{{{q}}}},{{\boldsymbol{x}}}{{{\boldsymbol{W}}}_{{{k}}}} $
其中,${{\boldsymbol{Q},{\boldsymbol{K}}}} \in {\mathbb{R}^{n \times d}}$${{{\boldsymbol{W}_{{{q}}}}}}{,}{{{\boldsymbol{W}_{k}}}} \in {\mathbb{R}^{d \times d}}$$n$是令牌(token)的长度,$d$是嵌入向量的维度。随后,查询矩阵${{\boldsymbol{Q}}}$被乘以一个可学习的参数向量${{{{{\boldsymbol{w}}}_{{{a}}}}}} \in {\mathbb{R}^d}$,以学习查询的注意力权重,产生全局注意力查询向量${{\boldsymbol{\alpha}} } \in {\mathbb{R}^n}$
$ {{\boldsymbol{\alpha}} } = {{\boldsymbol{Q}}} \cdot \frac{{{{{\boldsymbol{w}}}_{{{a}}}}}}{{\sqrt d }} $
然后,基于学到的注意力权重${{\boldsymbol{\alpha}} }$对查询矩阵${{\boldsymbol{Q}}}$进行池化,得到一个单一的全局查询向量${{\boldsymbol{q}}} \in {\mathbb{R}^d}$${{\boldsymbol{q}}}$表示为:
$ {{\boldsymbol{q}}} = \sum\limits_{i = 1}^n {{{{\boldsymbol{Q}}}_{i}} * {{{\boldsymbol{\alpha}} }_{i}}} $
随后,利用元素级乘法操作对全局查询向量${{\boldsymbol{q}}} \in {\mathbb{R}^d}$和键矩阵${{\boldsymbol{K}}} \in {\mathbb{R}^{n \times d}}$之间的交互进行编码,形成全局上下文。高效加性注意力的整体结构可由下式表示:
$ {\hat {\boldsymbol{x}}} = {\hat {\boldsymbol{Q}}} + T({{\boldsymbol{K}}} * {{\boldsymbol{q}}}) $
其中,${\hat {\boldsymbol{Q}}}$表示归一化查询矩阵,$T$表示线性变换。

2.4 动静态融合策略

在深度学习中,不同层级的特征图具有不同的尺度和分辨率。低层特征通常包含丰富的边缘、纹理等细节信息,高层特征则更多地反映全局的语义信息。传统的特征融合方法往往简单地采用相加、拼接或级联等操作,但这些方法可能无法充分利用不同层级特征之间的互补性,也无法很好地处理特征图之间的尺度差异。为此,本文利用静态融合策略将来自不同层、不同尺度的信息有效地结合起来,从而提升模型的性能。
图5详细展示了静态融合的操作过程,对于大、中、小三个不同尺寸的特征输入$ {{{\boldsymbol{F}}}_{l}} \in {\mathbb{R}^{{H_l} \times {W_l} \times C}}、 {{{\boldsymbol{F}}}_{m}} \in {\mathbb{R}^{{H_m} \times {W_m} \times C}}、{{{\boldsymbol{F}}}_{s}} \in {\mathbb{R}^{{H_s} \times {W_s} \times C}} $${{{\boldsymbol{F}}}_{l}}$$ {{{\boldsymbol{F}}}_{s}} $被调整到与${{{\boldsymbol{F}}}_{m}}$相同的尺寸。首先,${{{\boldsymbol{F}}}_{l}}$分别通过自适应最大池化和自适应平均池化得到${{{\boldsymbol{F}}}_{{{{{\mathrm{lmax}}}}}}}{,}{{{\boldsymbol{F}}}_{{{\rm{lavg}}}}} \in {\mathbb{R}^{{H_m} \times {W_m} \times C}}$,捕捉局部显著特征和全局平均特征。随后,将自适应最大池化和自适应平均池化后的特征图相加,得到融合后的特征图$ {{{\boldsymbol{F}}}_{{{\rm{fused}}}}} \in {\mathbb{R}^{^{{H_m} \times {W_m} \times C}}} $。同时,对$ {{{\boldsymbol{F}}}_{{{s}}}} $进行最邻近插值,得到${{{\boldsymbol{F}}}_{{{\rm{resized}}}}} \in {\mathbb{R}^{^{{H_m} \times {W_m} \times C}}}$。最后,将融合后的特征图${{{\boldsymbol{F}}}_{{{\rm{fused}}}}}$${{{\boldsymbol{F}}}_{{{m}}}}$和插值后的特征图${{{\boldsymbol{F}}}_{{\rm{{resized}}}}}$沿着通道维度进行拼接,得到输出特征图。
图 5 静态融合的整体结构

Fig.5 Overall structure of the static fusion

$ {{{{{\boldsymbol{F}}}_{{{\rm{lms}}}}} = {{{\boldsymbol{F}}}_{{{\rm{fused}}}}} + {{{\boldsymbol{F}}}_{{{m}}}} + {{{\boldsymbol{F}}}_{{{\rm{resized}}}}}}} $
静态融合策略中的池化和插值操作都遵循固定的规则完成上采样。这种固定的方式虽然简单高效,但灵活性和适应性会有所缺乏。因此,为了让UID-DETR的特征融合高效且灵活,本文设计了动态融合策略来补充静态融合。动态融合策略利用动态可学习的DySample[35]来处理复杂场景和细节丰富的图像。通过动态地调整特征图的尺度,动态融合策略能够更好地捕捉和利用不同尺度特征之间的互补性,从而提高模型的泛化能力和性能。此外,基于内核的动态上采样器,如CARAFE[36]、FADE[37]和SAPA[38],取得了不错的性能提升,但它们也引入了大的计算量,这主要源于耗时的动态卷积以及用于生成动态内核的附加子网络。而DySample避开了动态卷积,从点采样的角度构建上采样器,这种方法更加轻量高效。
DySample通过计算偏移量来实现特征图的动态调整。偏移量的计算方法有两种:“线性+像素重排”(Linear+Pixel Shuffle,LP)和“像素重排+线性”(Pixel Shuffle+Linear,PL)。在LP设计中,首先使用线性投影来生成若干个偏移集。然后,这些偏移集被重排以满足空间尺寸的要求。而PL与LP相反,为了节省参数,PL先执行重排操作,然后进行线性投影,再利用这些偏移量和原始特征图,通过双线性插值或网格采样等方法,生成调整后的特征图。
图6详细展示了动态融合的操作过程,对于给定的三个不同输入特征,分别将它们的通道数统一调整到128后,得到$ {{{\boldsymbol{F}}}_{3}} \in {\mathbb{R}^{H \times W \times C}}、{{{\boldsymbol{F}}}_{4}} \in {\mathbb{R}^{H \times W \times C}}、 {{{\boldsymbol{F}}}_{5}} \in {\mathbb{R}^{H \times W \times C}} $。然后,${{{\boldsymbol{F}}}_{4}}$进行DySample操作得到${{{\boldsymbol{F}}}_{{4d}}}$,其使用LP偏移量计算方式。${{{\boldsymbol{F}}}_{5}}$进行DySample操作得到${{{\boldsymbol{F}}}_{{5d}}}$,其使用PL偏移量计算方式。随后,将${{{\boldsymbol{F}}}_{3}}$${{{\boldsymbol{F}}}_{{4d}}}$${{{\boldsymbol{F}}}_{{5d}}}$由三个维度增加到四个维度并相加,得到初步融合特征${{{\boldsymbol{F}}}_{6}}$。为了高效提取特征图中的空间信息和学习更加复杂的特征表示,采用动态融合策略将${{{\boldsymbol{F}}}_{6}}$输入到一个三维卷积层,得到输出${{{\boldsymbol{F}}}_{{3D}}}$。接着,特征${{{\boldsymbol{F}}}_{{3D}}}$经过批量归一化层和激活函数处理后,使用三维最大池化层进行下采样,并移除之前增加的维度,得到最终的输出。
图 6 动态融合的整体结构

Fig.6 Overall structure of the dynamic fusion

在UID-DETR的特征融合部分,本文通过静态融合和动态融合的协作,增强了不同尺度特征信息的融合,进一步提高了模型的检测精度。

3 实验结果与分析

3.1 数据集

为了充分验证模型的有效性,本文分别在SFID和SID数据集上进行了实验。图7详细展示了SFID和SID数据集中的绝缘子图片,其中,(a)图是SFID中的图像,(b)图是SID中的图像。
图 7 SFID和SID数据集的比较

Fig.7 Comparison of SFID and SID datasets

SFID结合了中国电力线绝缘子数据集(Chinese Power Line Insulator Dataset,CPLID)[39]和统一公共绝缘子数据集(Unifying Public Insulator Dataset,UPID)[40]。同时,SFID通过合成雾算法进行数据增强,得到13 718张绝缘子图像。这些图像涵盖了不同雾浓度和亮度条件下的绝缘子及其缺陷,为深度学习模型提供了丰富的训练资源。
图7可以看出,SFID数据集中的绝缘子图像并不是直接在真实环境下拍摄得到的,而是后期通过裁剪拼接所得。为了弥补SFID数据集的不足,进一步验证本文的方法能够适应真实环境下的复杂绝缘子缺陷检测,在实际的检测环境中收集了绝缘子图像,制作了新的数据集SID。首先,通过无人机拍摄了大约2 500张包含绝缘子缺陷的图像。随后,对数据进行整理清洗,去除质量较低的数据,并通过缩放、平移和亮度调整来增强原始数据。在数据标注过程中,使用开源图像标注工具labelimg将标注结果以PASCAL VOC格式保存为XML文件。同时,将图片尺寸调整到统一的1 280×1 280,不足的部分用灰色填补。最终,SID共纳入2 312张含有缺陷的绝缘子图片。
图7还可以看出,SFID数据集中的绝缘子缺陷大部分是单个绝缘子整体脱落,缺陷的特征比较单一、相似,同时,缺陷与背景环境区别比较明显。而真实环境下的绝缘子缺陷类别是各种各样的。如图7所示,SID数据集中的绝缘子缺陷有倾斜、部分破损和半脱落等不同类别,尺寸覆盖大、中、小,这些缺陷类型特征差异较大,并与周围正常绝缘子很相似。另外,SID数据集中1/3以上的图像包含两个以上的绝缘子缺陷。SID数据集中的绝缘子图片背景复杂多样,包含树木、草地、农田和铁塔等,且1/4以上的图像中绝缘子缺陷与背景非常相似。总体来说,SID数据集中的绝缘子缺陷复杂程度要高于SFID数据集,并拥有较强的多样性和代表性。

3.2 实验设置

3.2.1 评估指标

为了充分验证本文提出模型的有效性,引入了七个评价指标:精度(Precision,P)、召回率(Recall,R)、F1分数(F1-Score,F1)、均值平均精度(mean Average Precision,mAP)、参数量(Parameters)、浮点运算数(Floating Point Operations,FLOPs)、推理时间(Inference time),具描述如下:
$ P = \frac{{{\text{TP}}}}{{{\text{TP + FP}}}} $
$ R{\text{ = }}\frac{{{\text{TP}}}}{{{\text{TP + FN}}}} $
$ {\text{AP}} = \int_0^1 {P{\text{(}}R{\text{)d}}R} $
$ {\text{mAP = }}\frac{1}{{{N}}}\sum\limits_{i = 1}^{{N}} {{\text{A}}{{\text{P}}_i}} $
绝缘子图像有正常图像和包含缺陷的图像两类,通常可以把它们分别看作正样本和负样本。其中,真正例(True Positive,TP)表示被正确地划分为正样本的个数,假正例(False Positive,FP)表示被错误地划分为正样本的个数,假负例(False Negative,FN)表示被错误地划分为负样本的个数。
P代表模型检测为正样本的结果中有多少是真正的正样本,P越高,意味着模型越不容易将负样本错误地判定为正样本。
R代表模型正确检测出的正样本数量占所有真实正样本的比例,R越高,模型能够越好地捕捉到真实目标。
F1是精度和召回率的调和平均,能够综合考虑模型的精度和召回率。
mAP综合了不同置信度阈值下的精度,以得到一个综合的性能评估。mAP的计算基于精确-召回曲线(P-R曲线),通过对所有类别的P-R曲线进行平均来获得。mAP50表示IoU为0.5时的均值平均精度,mAP50-95表示在不同IoU(从0.5到0.95,步长0.05)上的平均mAP。
Parameters表示模型中可训练参数的数量,包括权重和偏置等。参数量越多,模型越复杂,具有越强的表示能力,但同时也越可能增加过拟合的风险。
FLOPs可以理解为计算量,FLOPs越大,计算越复杂。
推理时间表示模型从输入到输出所需的时间。推理时间越短,模型的实时性越好。

3.2.2 实验设置

本文实验所用的图形处理器(Graphics Processing Unit,GPU)是一块NVIDIA A40,加速环境是CUDA 12.2,深度学习框架是Pytorch 1.13.1。
在训练前,本文按照文献[17]中的协议将SFID和SID数据集分别划分为训练集、测试集和验证集。在训练阶段,文本使用带有默认参数的AdamW优化器进行训练。此外,检测模型在每组实验中训练了300个epoch,批量大小设置为4,输入图片尺寸为640×640。在SFID和SID数据集上训练时,初始学习率分别为0.000 1和0.000 5。模型在训练300个 epoch的情况下,准确率、召回率、mAP值趋于稳定,模型达到收敛状态。

3.3 对比试验

3.3.1 模型训练和验证过程的结果比较

图8中直观对比了UID-DETR和基线在训练过程中的关键性能指标及其变化趋势。图8中的横坐标表示模型训练的epoch,一共300 epoch。其中,giou_loss表示GIoU损失,cls_loss表示分类损失,l1_loss表示L1损失,三类损失的纵坐标值都大于0。另外,precision (B)表示P,recall (B)表示R,mAP50 (B)表示mAP50,mAP50-95 (B)表示mAP50-95,这四个指标的纵坐标值都为0到1。
图 8 训练过程中的关键性能指标及其变化趋势

Fig.8 Key performance indicators and their trends during training

图8中可看出,与基线相比,本文所提模型的GIoU损失、分类损失和L1损失下降得更快,且更快达到平稳。同时,本文模型的PR和mAP的变化波动更小,这表明本文所提的模型具有更好的稳定性和鲁棒性。

3.3.2 混淆矩阵结果比较

混淆矩阵是评估模型性能的一种方式,它有助于理解模型在各个类别上的表现,包括正确分类和错误分类的情况。图9是UID-DETR与基线模型的混淆矩阵比较。其中,Broken类别表示绝缘子缺陷类别,Insulator类别表示绝缘子串类别。从图9中可以看出,本文所提的模型对Broken和Insulator类别的分类更准确,UID-DETR能够更准确地识别目标。同时,UID-DETR更不容易将Broken和Insulator类别归类为背景。同样地,UID-DETR更不容易将背景识别成Broken和Insulator类别。上述结果表明,UID-DETR能够更好地完成实际的无人机绝缘子缺陷检测。
图 9 UID-DETR与基线的混淆矩阵比较

Fig.9 Comparison of confusion matrices for UID-DETR and baseline

3.3.3 精度-召回率曲线结果比较

精度-召回率曲线(P-R曲线)是一种在机器学习中用于评估分类器性能的重要可视化工具,它描绘了在不同分类阈值下,模型的精度与召回率之间的动态关系。通过观察P-R曲线,可以直观地了解分类器在识别正样本方面的准确度和全面性,从而判断其性能的优劣。从图10可以看出,在检测Broken和Insulator类别时,P-R曲线更靠右上角,UID-DETR有更好的精度和召回率。特别地,UID-DETR在Broken类别上的提升比较大,对绝缘子缺陷能够更好地识别。同时,UID-DETR也能很好地检测到绝缘子串。
图 10 UID-DETR与基线的精度-召回率曲线结果比较

Fig.10 Comparison of P-R curve results for UID-DETR and baseline

3.3.4 与主流缺陷检测方法的比较

在相同的实验设置下,将UID-DETR与主流方法进行比较。如表1所示,YOLO系列模型在SFID和SID两个数据集中以相对较低的参数量和FLOPs实现了比较好的性能。虽然YOLOv3-tiny具有最少的参数量和推理时间,但其mAP50明显低于UID-DETR。在SFID数据集上,UID-DETR的精度和召回率都要好于YOLOv8-m,本文所提的模型以更少的参数量和FLOPs实现了更强的特征提取和更有效的跨尺度特征融合。在SID数据集上,UID-DETR在精度、召回率和mAP50方面都取得了最佳结果。表1的结果进一步表明了本文模型的有效性。
表 1 目标检测模型在SFID和SID数据集上的性能比较

Table 1 Performance comparison of object detection models on SFID and SID datasets

Methods Parameters
(M)
FLOPs
(G)
SFID SID
Precision
(%)
Recall
(%)
mAP50
(%)
Inference time
(ms)
Precision
(%)
Recall
(%)
mAP50
(%)
Inference time
(ms)
EfficientDet[41] 11.9 47.0 99.2 92.0 96.7 148.7 96.9 86.7 93.8 112.2
SSD[42] 23.7 273.6 98.4 93.9 98.7 17.0 97.1 83.5 93.1 15.0
CenterNet[43] 32.7 109.7 98.6 96.8 98.3 27.5 97.4 83.0 88.5 19.2
Faster R-CNN[44] 136.7 401.7 60.0 94.9 86.3 47.4 60.7 77.7 75.4 39.7
YOLOv3-tiny[45] 12.1 18.9 96.1 96.8 98.1 2.1 97.2 79.4 89.5 2.9
YOLOv6-s[46] 16.3 44.0 98.9 97.8 99.1 3.7 91.5 84.8 89.7 6.3
YOLOv8-m[47] 25.8 78.7 99.3 99.1 99.4 5.1 96.4 86.0 93.6 7.2
YOLOv9-m[48] 32.5 130.7 98.2 98.5 99.3 11.2 96.2 88.2 94.0 24.4
YOLOv10-m[49] 16.5 63.4 97.2 97.4 99.2 6.4 96.8 83.3 90.7 7.6
UID-DETR 14.1 41.4 99.4 99.2 99.4 5.7 98.3 91.8 95.4 13.5

3.3.5 不同背景图像下的检测结果

在相同的实验设置下,将UID-DETR与主流方法进行比较。本文选择CenterNet、YOLOv6-s、YOLOv8-m和UID-DETR进行了比较实验,图11为具体的检测结果。其中,(a)图为SFID数据集上的检测结果,(b)图为SID数据集上的检测结果。
图 11 SFID和SID数据集上的检测结果

Fig.11 Detection results on SFID and SID datasets

图11的结果可知,对于图像背景较复杂SFID数据集图片,UID-DETR对绝缘子串和绝缘子缺陷有着最好的mAP50。从图11中第二行可以看出,在有雾的环境中,UID-DETR的mAP50比YOLOv8-m高1.1%。SID数据集中的绝缘子缺陷类型较为复杂,这导致模型更难检测出有缺陷的绝缘子。图11中第三行的绝缘子缺陷类型非常特殊,比常见的脱落类型的检测难度要大。由结果可知,CenterNet、YOLOv6-s和YOLOv8-m都无法检测出缺陷,这表明它们的Recall要低于UID-DETR。同时,基线将背景误检为缺陷。而本文所提的模型能够精确定位和准确检测出缺陷,mAP50达到89%。图11中第四行的绝缘子缺陷和绝缘子串与背景非常相似,检测过程中很容易出现误检。在这组图片中,UID-DETR取得了最高的绝缘子缺陷检测精度,mAP50比CenterNet高1.7%。在第四组图像中,UID-DETR的mAP50和基线相同,但UID-DETR对绝缘子串的检测精度更高,这表明本文所提的模型对大尺寸和小尺寸的目标都能很好地检测识别。
综上所述,对于背景复杂和缺陷类型复杂的绝缘子图像,本文所提的UID-DETR的检测效果都优于对比算法,证明了其在实际绝缘子缺陷检测中的优势。

3.4 消融实验

3.4.1 消融实验结果比较

为了验证所提方法的有效性,本文进行了消融实验。从表2中可以看出,FREP在减少3.1 M参数量的同时,提高了模型的检测精度。在加入EISI后,进一步提高了模型的检测精度和F1。在特征融合部分,模型参数量虽然增加了0.1 M,但检测精度提高了1.8%。与基线相比,UID-DETR拥有更少的参数量、更快的检测速度和更高的检测精度。
表 2 消融实验结果

Table 2 Results of ablation experiments

Baseline FREP EISI STF&DYF mAP50(%) F1(%) Inference time(ms) Parameters(M)
92.7 92.9 14.4 17.1
93.5 92.6 13.5 14.0
93.6 93.5 14.3 14.0
95.4 94.9 13.5 14.1

3.4.2 与不同轻量级骨干网络的比较

为了验证UID-DETR中轻量级骨干网络的有效性,本文与一些轻量级骨干网络进行了比较实验。从表3中可以看出,UID-DETR骨干网络的mAP50达到最优,表明FREP具有良好的特征提取能力。在对比的轻量级骨干网络中,UID-DETR的骨干网络的参数量和FLOPs最少。
表 3 与不同轻量骨干网络的比较

Table 3 Comparison with different lightweight backbone networks

Backbone mAP50
(%)
F1
(%)
Inference time
(ms)
Parameters
(M)
GFLOPs
(G)
FasterNet[31] 86.0 87.8 13.2 18.7 43.1
CSWin Transformer[50] 88.5 89.4 22.7 27.7 78.2
Swin Transformer[51] 89.5 89.0 19.5 33.5 85.2
EfficientViT[52] 92.2 91.2 14.5 17.9 40.8
FREP(Ours 93.5 92.6 13.5 14.0 39.7

4 结束语

针对无人机绝缘子缺陷检测问题,本文提出了一种基于ViT的检测模型。本文所提的FREP结合了轻量级卷积和模型重参数化的优点,具有更少的参数量和更强的特征提取能力。此外,本文还提出了一种改进的高效内尺度交互模块,以获取更多的关键特征,加强高层级特征的交互。在特征融合部分,通过静态融合和动态融合的组合,确保高效的跨尺度特征融合。理论分析和实验结果表明,本文所提的模型在参数量减少17.5%的情况下,检测精度达到了95.4%。同时,该模型在推理时间上与YOLO系列算法处于同一水平,满足了无人机绝缘子缺陷检测的实时性要求。在未来的研究中,我们将继续探索轻量级、高效的基于ViT的无人机绝缘子缺陷检测方法。
1
SU J, YUAN Y, PRZYSTUPA K, et al. Insulator defect detection algorithm based on improved YOLOv8 for electric power[J]. Signal, Image and Video Processing, 2024, 18 (8-9): 6197- 6209.

DOI

2
ZHANG L, LI B, GAO L J. Research on improved YOLOv8 algorithm for insulator defect detection[J]. Journal of Real-Time Image Processing, 2024, 21 (1): 22.

DOI

3
LI D, LU Y, GAO Q, et al. LiteYOLO-ID: A lightweight object detection network for insulator defect detection[J]. IEEE Transactions on Instrumentation and Measurement, 2024, 73 (1): 1- 12.

4
QI X,YE S. Defect detection of aerial insulator based on improved lightweight YOLOv5[C]//2023 IEEE 3rd International Conference on Electronic Technology,Communication and Information(ICETCI). IEEE,2023:1833-1839.

5
WU F,MA A J,PAN Y,et al. Receptive field pyramid network for object detection[C]//ICASSP 2020-2020 IEEE International Conference on Acoustics,Speech and Signal Processing(ICASSP). IEEE,2020:1873-1877.

6
MAI J,WANG S,WANG X. Detection of insulator strings in aerial photography based on lightweight CenterNet[C]//2023 8th International Conference on Intelligent Computing and Signal Processing(ICSP). IEEE,2023:821-824.

7
LANHANG C. Defect identification of electricity transmission line insulators based on the improved lightweight network model with computer vision assistance[J]. Heliyon, 2024, 10 (10): e30405.

DOI

8
NIU W J,WANG B,BAI B. Detection of insulator defects in transmission lines based on lightweight Convolutional Neural Networks[C]//2024 9th Asia Conference on Power and Electrical Engineering(ACPEE). IEEE,2024:415-419.

9
ZHU X. A lightweight improved YOLOv5 for insulator defect detection[C]//2023 3rd International Conference on Computer Science,Electronic Information Engineering and Intelligent Control Technology(CEI). IEEE,2023:675-678.

10
WANG L,QIN J,YAN K,et al. A lightweight insulator defect detection model based on YOLOv8[C]// 2024 5th International Seminar on Artificial Intelligence,Networking and Information Technology(AINIT). IEEE,2024:2349-2353.

11
LIU J,WANG F. Mixed-attention auto encoder for multi-class industrial anomaly detection[C]//ICASSP 2024-2024 IEEE International Conference on Acoustics,Speech and Signal Processing(ICASSP). IEEE,2024:4120-4124.

12
LIN Y,TIAN L,DU Q,et al. Insulator detection based on improved lightweight rotation detector[C]//2023 4th International Conference on Intelligent Computing and Human-Computer Interaction(ICHCI). IEEE,2023:412-417.

13
BAN M,DING R,ZHANG J,et al. PDD-Net:A precise defect detection network based on point set representation[C]//ICASSP 2022-2022 IEEE International Conference on Acoustics,Speech and Signal Processing(ICASSP). IEEE,2022:2350-2354.

14
LI D, YANG P, ZOU Y. Optimizing insulator defect detection with improved DETR models[J]. Mathematics, 2024, 12 (10): 1507.

DOI

15
YUAN W,XIE H,DU S,et al. PAM-DETR:Parallel Attention-MLP for insulator defect detection[C]//2023 International Conference on Sensing,Measurement & Data Analytics in the era of Artificial Intelligence(ICSMD). IEEE,2023:1-6.

16
QU Z, ZANG J, DONG Y, et al. An efficient multi-order cascade distillation model for the detection of small targets and occluded objects in transmission line inspection[J]. Measurement, 2024, 225, 114000.

DOI

17
ZHANG Z D, ZHANG B, LAN Z C, et al. FINet: An insulator dataset and detection benchmark based on synthetic fog and improved YOLOv5[J]. IEEE Transactions on Instrumentation and Measurement, 2022, 71, 1- 8.

18
WEI L, JIN J, DENG K, et al. Insulator defect detection in transmission line based on an improved lightweight YOLOv5s algorithm[J]. Electric Power Systems Research, 2024, 233, 110464.

DOI

19
WANG Z,LIU Q,ZHOU J. Power insulator defect detection method based on improved YOLOX-s[C]//2024 6th International Conference on Energy,Power and Grid(ICEPG). IEEE,2024:1087-1091.

20
CHEN H,ZHANG Z. Improved YOLOv5 algorithm for power insulator defect detection[C]//2023 13th International Conference on Power,Energy and Electrical Engineering(CPEEE). IEEE,2023:301-305.

21
XIE J,DU Y,YU H,et al. Visible-light insulator defect detection algorithm based on improved YOLOv4-tiny[C]//2023 IEEE International Conference on Power Science and Technology(ICPST). IEEE,2023:986-991.

22
JIANG Z,FU X,CHEN W,et al. Research on insulator defect detection by UAV based on deep learning[C]//2023 5th International Conference on Robotics,Intelligent Control and Artificial Intelligence(RICAI). IEEE,2023:657-661.

23
CHANG R, ZHOU S, ZHANG Y, et al. Research on insulator defect detection based on improved YOLOv7 and multi-UAV cooperative system[J]. Coatings, 2023, 13 (5): 880.

DOI

24
TANG S,ZHU R,JI C,et al. Intelligent detection of insulator defects on transmission lines in complex backgrounds based on improved DETR visual perception model[C]//2024 International Conference on Artificial Intelligence and Power Systems(AIPS). IEEE,2024:83-89.

25
TANG C, DONG H, HUANG Y, et al. Foreign object detection for transmission lines based on Swin Transformer V2 and YOLOX[J]. The Visual Computer, 2024, 40 (5): 3003- 3021.

DOI

26
LI Y, FENG D, ZHANG Q, et al. HRD-YOLOX based insulator identification and defect detection method for transmission lines[J]. IEEE Access, 2024, 12, 22649- 22661.

DOI

27
HE M, QIN L, DENG X, et al. MFI-YOLO: Multi-fault insulator detection based on an improved YOLOv8[J]. IEEE Transactions on Power Delivery, 2024, 39 (1): 168- 179.

DOI

28
ZOU X,ZHOU Y. DeFCN-nano:An end-to-end real-time object detection for insulator defects[C]//2023 IEEE International Conference on Robotics and Biomimetics(ROBIO). IEEE,2023:1-6.

29
ZHANG Z,JIANG Q,CHU X. Self-exploding insulator detection for transmission lines based on improved YOLOv5s algorithm[C]//2024 2nd International Conference on Signal Processing and Intelligent Computing(SPIC). IEEE,2024:52-55.

30
LIU X,RAO Z,ZHANG Y,et al. UAVs images based real-time insulator defect detection with Transformer deep learning[C]//2023 IEEE International Conference on Robotics and Biomimetics(ROBIO). IEEE,2023:1-6.

31
CHEN J,KAO S,HE H,et al. Run,don't walk:Chasing higher FLOPS for faster neural networks[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. IEEE,2023:12021-12031.

32
DING X,ZHANG X,MA N,et al. RepVGG:Making VGG-style ConvNets great again[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. IEEE,2021:13733-13742.

33
ZHAO Y,LV W,XU S,et al. DETRs beat YOLOs on real-time object detection[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. IEEE,2024:16965-16974.

34
SHAKER A,MAAZ M,RASHEED H,et al. SwiftFormer:Efficient additive attention for Transformer-based real-time mobile vision applications[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision. IEEE,2023:17425-17436.

35
LIU W,LU H,FU H,et al. Learning to upsample by learning to sample[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision. IEEE,2023:6027-6037.

36
WANG J,CHEN K,XU R,et al. CARAFE:Content-aware reassembly of features[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision. IEEE,2019:3007-3016.

37
LU H,LIU W,FU H,et al. FADE:Fusing the assets of decoder and encoder for task-agnostic upsampling[C]//European Conference on Computer Vision. Cham:Springer Nature Switzerland,2022:231-247.

38
LU H, LIU W, YE Z, et al. SAPA: Similarity-aware point affiliation for feature upsampling[J]. Advances in Neural Information Processing Systems, 2022, 35, 20889- 20901.

39
TAO X, ZHANG D, WANG Z, et al. Detection of power line insulator defects using aerial images analyzed with convolutional neural networks[J]. IEEE Transactions on Systems, Man, and Cybernetics: Systems, 2018, 50 (4): 1486- 1498.

40
ANDREL V S,CHAVES T,FELIX H,et al. Unifying public datasets for insulator detection and fault classification in electrical power lines[DB/OL](2020)[2025-3-10]. https://github.com/heitorcfelix/public-insulator-datasets.

41
TAN M,PANG R,LE Q V. EfficientDet:Scalable and efficient object detection[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. IEEE,2020:10781-10790.

42
LIU W,ANGUELOV D,ERHAN D,et al. SSD:Single shot multibox detector[C]//Computer Vision–ECCV 2016:14th European Conference. Cham:Springer International Publishing,2016:21-37.

43
ZHOU X,KOLTUN V,KRÄHENBÜHL P. Tracking objects as points[C]//European Conference on Computer Vision. Cham:Springer International Publishing,2020:474-490.

44
REN S, HE K, GIRSHICK R, et al. Faster R-CNN: Towards real-time object detection with region proposal networks[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2016, 39 (6): 1137- 1149.

45
FARHADI A,REDMON J. YOLOv3:An incremental improvement[C]//Computer Vision and Pattern Recognition. Berlin,Heidelberg:Springer,2018,1804:1-6.

46
LI C, LI L, JIANG H, et al. YOLOv6: A single-stage object detection framework for industrial applications[J]. ArXiv preprint, ArXiv:, 2209, 02976, 2022.

47
VARGHESE R,SAMBATH M. YOLOv8:A novel object detection algorithm with enhanced performance and robustness[C]//2024 International Conference on Advances in Data Engineering and Intelligent Computing Systems (ADICS),2024:1-6.

48
WANG C Y, YEH I H, LIAO H Y M. YOLOv9: Learning what you want to learn using programmable gradient information[J]. ArXiv preprint, ArXiv:, 2402, 13616, 2024.

49
WANG A, CHEN H, LIU L, et al. YOLOv10: Real-time end-to-end object detection[J]. ArXiv preprint, ArXiv:, 2405, 14458, 2024.

50
DONG X,BAO J,CHEN D,et al. CSWin Transformer:A general vision transformer backbone with cross-shaped windows[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. IEEE,2022:12124-12134.

51
LIU Z,LIN Y,CAO Y,et al. Swin Transformer:Hierarchical Vision Transformer using shifted windows[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision. IEEE,2021:10012-10022.

52
LIU X,PENG H,ZHENG N,et al. EfficientViT:Memory efficient Vision Transformer with Cascaded Group Attention[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. IEEE,2023:14420-14430.

Outlines

/