基于生成对抗网络和对比学习的假新闻检测方法研究

  • 吴聪 1 ,
  • 孟敏智 1 ,
  • 郑炜 1 ,
  • 何琨 , 1, * ,
  • 纪守领 2
展开
  • 1. 武汉大学国家网络安全学院,武汉 430072
  • 2. 浙江大学计算机科学与技术学院,杭州 310058
何琨()。

录用日期: 2024-06-03

  网络出版日期: 2024-11-16

基金资助

国家自然科学基金(62172303)

版权

版权所有©《网络空间安全科学学报》编辑部 2024

An investigation into fake news detection methodology based on generative adversarial networks and contrastive learning

  • WU Cong 1 ,
  • MENG Minzhi 1 ,
  • ZHENG Wei 1 ,
  • HE Kun , 1, * ,
  • JI Shouling 2
Expand
  • 1. School of Cyber Science and Engineering , Wuhan University, Wuhan, Hubei, 430072, China
  • 2. College of Computer Science and Technology, Zhejiang University, Zhejiang, 310058, China

Accepted date: 2024-06-03

  Online published: 2024-11-16

Copyright

Copyright ©2024 Journal of Aeronautical Materials. All rights reserved.

摘要

社交媒体作为信息获取的主要途径,其假新闻问题日益严重。假新闻检测任务的重要挑战之一是确保模型能够及时响应新出现的事件,并在有限时间内完成检测任务,这要求模型具备高效的实时性和对新事件的快速适应能力,与此同时,多模态假新闻检测技术作为未来的重要发展方向也值得关注。针对上述挑战,提出了一种多模态假新闻检测模型ADSCL,利用卷积神经网络提取文本和图像的语义特征,并通过多层联合注意力机制进行融合。针对新事件的及时响应需求,引入生成对抗网络和对比学习,从大量数据中提取可转移特征,提高泛化能力。同时,通过对抗性训练增强模型鲁棒性。实验结果表明,ADSCL模型有效提升了假新闻检测能力,验证了多模态融合和对抗性方法在新闻检测任务上的优越性。

本文引用格式

吴聪 , 孟敏智 , 郑炜 , 何琨 , 纪守领 . 基于生成对抗网络和对比学习的假新闻检测方法研究[J]. 网络空间安全科学学报, 2024 , 2(3) : 27 -40 . DOI: 10.20172/j.issn.2097-3136.240303

Abstract

As the primary avenue for information retrieval, social media increasingly grapples with the issue of fake news. A key challenge in fake news detection is ensuring models can promptly respond to emerging events and complete detection tasks within a limited timeframe. This necessitates models with efficient real-time capabilities and rapid adaptation to new events. Meanwhile, the development of multimodal fake news detection technology as a crucial future direction also merits attention. Addressing these challenges, a multimodal fake news detection model, ADSCL was proposed. Leveraging convolutional neural networks, the model extracts semantic features from text and images, integrating them through a multi-layered joint attention mechanism. To meet the demand for timely responses to new events, the model introduces generative adversarial networks and contrastive learning to extract transferable features from extensive data, enhancing generalization capability. Furthermore, adversarial training enhances model robustness. Experimental results demonstrate that the ADSCL model effectively enhances the capability of fake news detection, validating the superiority of multimodal fusion and adversarial methods in news verification tasks.

0 引言

随着移动互联网和5G通信技术的迅速发展,社交媒体已经成为人们获取各种信息的主要渠道。社交媒体平台不仅能够及时向用户推送全球发生的新闻,还能够提供丰富的多媒体内容,包括文字、图片和视频。然而,与传统媒体相比,社交媒体的信息传播速度更快,覆盖范围更广,且具有扩散式传播的优势,这使得社交媒体成为了假新闻的主要传播渠道之一。
假新闻是一种虚构或歪曲事实的信息,以新闻报道的形式呈现给公众,旨在误导和欺骗读者。假新闻的存在对社会造成了严重的危害,不仅损害了真实信息的传播,还可能导致公众形成错误的观点和决策,甚至影响社会的长期稳定发展。举例来说,在新冠肺炎疫情期间,大量关于“神奇药物”“实验室泄漏”等虚假信息的传播,给疫情防控工作带来了极大的困扰,甚至造成了一些不必要的伤害和死亡。
为了有效应对假新闻的传播,假新闻检测技术应运而生。假新闻检测技术利用人工智能的自然语言处理能力,对给定的数据进行真假分析,从而识别出其中的虚假信息。目前,假新闻检测技术在多个领域发挥着重要作用,包括社交媒体内容监管、政府舆情管控以及消息来源识别等。
然而,假新闻检测技术也面临着诸多挑战。首先,社交媒体上的新闻数据质量参差不齐,需要从海量的数据中筛选出有价值的信息;其次,多媒体新闻的特征维度高且复杂,传统的机器学习方法难以有效提取和分类这些信息;此外,假新闻检测需要具备高度的时效性,能够在短时间内对新出现的事件进行快速地检测。
为了能够有效检测新事件,提高模型的泛化能力,本文提出了一个基于生成对抗网络和对比学习的多模态假新闻检测模型ADSCL。本文的贡献如下:
(1)设计了一个多层的联合注意力模型,成功实现了多模态特征的有效融合。该模型模拟了人类在观察图片时分层定位的过程,利用分层注意力机制逐步推理定位图像中与文本语义相关的区域,从而得到最终的多模态特征向量。
(2)设计了一种基于对抗网络的数据增强方法,通过在特征提取器和事件分类器之间进行极大极小博弈。特征提取器通过最大化事件判别损失来欺骗分类器,而分类器则最小化损失以识别事件,提取出具备良好的事件不变性的多模态特征表示,提高模型的泛化能力。
(3)探讨了在假新闻检测任务中引入对抗性扰动的有效性,并通过实验证明了在训练数据中引入对抗样本能够有效提高模型对于对抗样本攻击的鲁棒性。

1 相关工作

随着社交媒体的普及,假新闻的传播已经成为社会的严重问题,引起了人们的广泛关注。当前的假新闻检测研究主要集中在两个方向:基于网络的假新闻检测方法和基于内容的假新闻检测方法。

1.1 基于网络的假新闻检测方法

基于网络的假新闻检测方法主要关注新闻的传播路径、用户行为、社交关系等,通过使用用户画像特征、内容特征结合深度学习对传播网络进行建模和推理。这种方法主要考虑社会背景和传播网络。
在基于传播结构的检测技术中,Ma 等[1]构建了一个树状结构的递归神经网络(Recursive Neural Network,RNN)来捕获传播特征表示,但该方法无法有效地捕获全局结构特征。相比之下,图卷积网络(Graph Convolutional Network,GCN)更适合捕获图或树的全局结构特征,因此Lin等[2]提出了一种基于GCN的编码和解码模型,用于捕获谣言的传播特征。Bian 等[3]提出了一种Bi-GCN模型,整合了自顶向下的GCN和自底向上的GCN,可以从不同方向捕获谣言的传播特征。Han 等[4]基于Transformer学习传播路径中的特征表示,结合注意力机制提出了基于传播树的节点及路径双注意力谣言检测模型(Dual-attention Network Model on Propagation Tree Structures,DAN-Tree)。然而,这些基于传播结构的方法忽略了时间特征的重要性,导致在捕获谣言传播特征方面存在局限性。
在基于时间序列的方法中,Ma等[5]采用RNN来学习谣言传播的隐藏特征表示。Khoo等[6]则基于自注意力机制模拟了用户之间的交互。Yu等[7]提出了一种基于卷积神经网络(Convolutional Neural Network,CNN)的方法,可以学习分散在输入序列中的关键特征,并模拟重要特征之间的高层次交互。Liu 等[8]结合 RNN 和 CNN 来获取基于时间序列的用户特征。然而,这些基于时间序列的方法在全面理解谣言传播特征方面仍面临挑战,因为它们可能无法充分捕捉由社交网络结构带来的影响。
当前,许多方法在进行假新闻检测任务时不仅使用时间序列或传播结构,还使用了大量的补充信息。例如,Guo 等[9]、Lin 等[10]、Dong 等[11]提出了3种不同层次的神经网络来分别处理假新闻检测的任务,这些模型都利用了大量的社会信息或用户信息作为补充特征来提高性能。然而,过多的辅助特征会导致信息冗余和效率低下的问题。此外,一些研究还探索了对抗学习技术,如Ma 等[12]提出了基于生成对抗网络(Generative Adversarial Networks,GAN)的方法,以提高模型的鲁棒性。尽管这些方法取得了一定的进展,但仍然存在模型鲁棒性不足的挑战,需要进一步的研究和改进。
相比之下,本文提出的方法是在生成对抗网络基础上,结合对比学习进行数据增强任务,采用了多模态特征提取器和事件分类器的联合训练,使生成网络成功提取出具备事件不变性的泛化特征。此外,通过在训练过程中引入投影梯度下降法(Projected Gradient Descent, PGD)进行对抗性扰动,有效地提高了模型在面对对抗样本攻击时的鲁棒性。这种基于对抗网络的数据增强方法利用对抗网络的极大极小博弈来消除特征序列中与特定事件高度相关的特征表示,从而提高模型的泛化能力,同时增强了模型的鲁棒性。

1.2 基于内容的假新闻检测方法

基于内容的假新闻检测方法主要利用新闻的文本及多媒体特征,以及写作的风格和语言模式进行分析和判断。假新闻的特征通常通过自动检测的方法从新闻相关特征(如新闻内容)中提取,或者从社交情境(用户的社交参与度)中提取,通过使用来自新闻的各种类型的信息,如文章内容、新闻来源、标题、图片或视频,构建假新闻检测分类器。
Nikam等[13]使用词频—逆文件频率(Term Frequency–Inverse Document Frequency,TF-IDF)特征提取方法评估朴素贝叶斯和被动攻击机器学习算法,通过将帖子信息与真实来源进行比较来识别虚假新闻。Przybyla[14]开发了一种基于风格的文本分类器,使用双向长短期记忆网络(Bidirectional Long Short Term Memory,Bi-LSTM)从新闻文章中捕获基于风格的特征。一些研究考虑词汇、词袋、句法、词性、上下文无关语法、TF-IDF、潜在主题来从新闻文章中提取基于内容的特征,尽管这些方法在一定程度上取得了进展,但文本的语义特征高度依赖特定事件和相应的领域知识,传统的机器学习方法难以为假新闻检测任务设计手工文本特征。
此外,图像特征被证明在假新闻检测中至关重要[15-16],因此多模态方法成为基于内容的假新闻检测的重要技术。在多模态方面,Jin等[17]提出了一种基于深度学习的假新闻检测模型,该模型提取了多模态的新闻内容和社会上下文特征,并使用注意力机制将它们融合在一起。Qi等[18]提出了多域视觉神经网络(Multi-domain Visual Neural Network,MVNN)模型,该模型利用频域和像素域的视觉信息来判断给定图像是假新闻还是真新闻图像。另一种多模态方法是Zhang等[19]提出的一种基于BERT[20]的域自适应神经网络(BERT-Based Domain Adaptation Neural Network,BDANN),它利用预训练的BERT和VGG-19模型提取文本和图像特征,并通过连接它们来进行假新闻检测。Zhou等[21]提出了一种用于假新闻检测的多粒度多模式融合网络(Multi-grained Multi-modal Fusion Network,MMFN),分别使用两个基于Transformer的预训练模型对文本和图像的标记级特征进行编码,多模态模块融合了细粒度特征,同时考虑了CLIP[22]编码器编码的粗粒度特征。
相比之下,本文提出的方法在多模态特征融合方面进行了创新。本文设计了一种多层联合注意力机制,通过逐层推理定位图像特征中与文本语义相关的部分,有效地将文本和图像特征表示按语义对应进行多模态融合。这种新的多模态融合方法提高了假新闻检测模型的准确性和鲁棒性。

2 基于生成对抗网络和对比学习的设计与实现

本节主要介绍本文设计的假新闻检测模型ADSCL。模型框架如图1所示。包含3个主要组成部分:特征提取器、生成对抗网络、对比学习网络。首先,模型需要对文本和图像的原始材料进行特征提取,从而获得材料的高维语义特征。对于文本材料而言,本文设计了一个卷积神经网络来提取文本的语义特征;对于图像材料而言,本文使用了基于卷积方法的VGG-19网络来提取特征向量。接着,本文设计了一个多层联合注意力模型将文本和图像特征进行结合,从而得到多模态特征。在生成对抗网络中,通过在多模态特征提取器和事件分类器之间进行极大极小博弈,消除特定于事件的部分特征,从而获得具备事件不变性的多模态特征表示,提高模型的泛化能力。同时,本文通过在训练过程中引入对抗性扰动来提高模型对于对抗样本攻击的鲁棒性。最后,本文将所有带标签的多模态特征进行有监督对比学习,训练出能准确分类真假新闻的二分类模型。
图 1 ADSCL 模型结构

Fig.1 The architecture of the ADSCL

2.1 特征表示提取模块

2.1.1 文本特征提取

本模块介绍研究中对于文本原始材料的特征提取方法。为了提取事件相关的语义信息,需要过滤掉无关的细节,只保留有效的语言成分。考虑到本文数据集通常由较短的文本组成,本模块采用了具有多个过滤器和不同单词窗口大小的卷积神经网络作为深度学习模型,用于提取文本特征。卷积神经网络在处理短文本时表现良好,因为它能够直接从单词的 N-Gram 特征中学习文本的特征表示,具有高效的计算能力、更快的训练速度和强大的局部语义特征捕捉能力。由于本文数据集中每个帖子的长度相对较短(小于 140 个字符),使用卷积神经网络可以捕捉到更多具有局部代表性的特征。
本节提出了一种简化的卷积神经网络模型,用于文本特征表示的提取,该模型是基于Text-CNN[23] 的思想进行了一些改进和优化。主要包括4个部分:输入层或词向量层、卷积层、池化层、全连接层。提取文本特征表示的过程如下:首先,通过输入层将文本转换为多维的词向量表示;其次,卷积层提取向量中的局部特征,并利用 ReLU、sigmoid、tanh 等激活函数进行非线性处理;再次,通过池化层降低向量维数,并捕获卷积结果中的重要特征;最后,在全连接层中将池化结果转换为所需维度的输出向量,同时保留主要特征。图2展示了简化的卷积神经网络模型结构,各部分介绍如下:
图 2 文本特征提取卷积神经网络结构

Fig.2 Structure of the text feature extraction convolutional neural network

输入层:将文本转换为矩阵形式,其中每行代表一个词语,每列对应一个维度。这种表示方式允许每个词语用一个多维向量来表示,反映其语义和语法信息。本文选择了预训练的Word2Vec模型,将一系列非固定长度的输入文本转换为固定长度的词向量序列。每个单词的词嵌入向量使用预先训练好的词嵌入进行初始化。为了便于在卷积层中进行批处理,输出序列需要填充成相同的长度,采用的方法是按照所有句子中的最大长度$ n $进行零填充操作。对于句子中的第$ i $个词,其对应的$ k $维词嵌入向量记为$ \boldsymbol{T}_i\in\boldsymbol{R}^k $。因此,一个包含$ n $个单词的句子可以表示为:
$ {T}_{1:n}={T}_{1}\oplus{T}_{2}\oplus\cdots \oplus{T}_{n} $
式(1)中$ \oplus $是连接运算符。
卷积层:通过卷积操作提取文本的局部特征,并进行非线性变换。使用不同大小的卷积核可以捕获不同长度的 N-Gram 特征。在卷积操作后,通过激活函数增加模型的非线性能力。本文设置不同大小的卷积窗口$ h $以提取不同粒度的局部特征,在输入特征上以特定步长滑动卷积窗口。卷积核大小为 $ h $ 的卷积操作将句子中$ h $个单词的连续序列作为输入和输出一个特征。以第$ i $个单词开始的连续 $ h $个单词序列为例,卷积操作是滑动窗口内权重矩阵 $ \boldsymbol{W}_{\mathrm{c}}\in\boldsymbol{R}^{h\times k} $与窗口内的词序列$ {T}_{i:i+h-1} $进行对应元素相乘再求和,并引入偏置$ b\in R $,得到特征$ {t}_{i} $:
$ t_i=f\left(\boldsymbol{W}_{\mathrm{c}}T_{i:i+h-1}+b\right) $
式(2)中,$ f $是非线性的激活函数。本文使用ReLU 作为非线性的激活函数。通过引入激活函数,我们可以对卷积运算的结果进行非线性变换,使模型获得线性方法难以拟合的特征。假设卷积窗口的步长为 1,则卷积窗口在输入序列中共进行$ n-h+1 $次移动,生成窗口的特征向量为:
$ \boldsymbol{t}=\left[t_1,t_2,\cdots,t_{n-h+1}\right] $
池化层:通过池化操作,从卷积层中选取最重要的特征,并降低特征向量的维度。对于每个特征向量$ \boldsymbol{t} $,本文采用最大池化方法提取最重要的信息,对池化窗口内的特征取最大值,获得输出$ \boldsymbol{\hat{t}} $
$ \boldsymbol{\hat{t}}=\mathrm{max}\left(\boldsymbol{t}\right) $
至此,得到了一个特定卷积核的对应特征。为了提取多种粒度的文本特征,设置了$ c $种窗口大小,每个窗口大小下又有$ {n}_{h} $种不同的卷积核,以提取多种局部特征。重复这一过程直到得到所有卷积核的特征,对每个卷积核的结果进行池化,得到文本的最大池化特征$ \boldsymbol{R}_{\mathrm{c}}^T\mathbf{\boldsymbol{\boldsymbol{\boldsymbol{ }}}}\in\boldsymbol{R}^{c\times n_h} $:
$ {{\boldsymbol{R}}}_{c}^{T}=\mathrm{c}\mathrm{o}\mathrm{n}\mathrm{c}\mathrm{a}\mathrm{t}\left(\widehat{{{\boldsymbol{t}}}_{1}},\widehat{{{\boldsymbol{t}}}_{2}},\cdots ,{\hat{{\boldsymbol{t}}}}_{c\cdot {n}_{h}}\right) $
全连接层:通过矩阵乘法将前面捕获的句子的语义特征映射到输出结果所在的向量空间中。因此,在池化层之后,使用一个全连接层来保证最终的文本特征表示(记为$ \boldsymbol{\boldsymbol{R}}^T\in{\boldsymbol{R}}^p $)与图像特征表示具有相同的维度(记为$ p $),具体操作如下:
$ {{\boldsymbol{R}}}^{T}=\mathrm{\sigma }\left({\boldsymbol{W}}_{\mathrm{t}\mathrm{f}}{{\boldsymbol{R}}}_{\mathrm{c}}^{T}\right) $
式中,$ {\boldsymbol{W}}_{\mathrm{t}\mathrm{f}} $为全连接层的权值矩阵。
通过上述4个部分的组合和连接,就可以构建出一个简化的卷积神经网络模型,用于文本特征表示的提取。

2.1.2 图像特征提取

在社交平台上,文本和图片通常是相互配合的,因此有效地从图片中提取高维的视觉特征变得至关重要。本文采用经过预训练的 VGG-19 神经网络模型[24],该模型能够从图片中抽取丰富的视觉信息。
VGG-19 网络是 VGG 网络模型的一种变体,由 19 层组成,被广泛应用于图像分类、转移学习和特征提取等领域。本文使用预训练的 VGG-19 网络完成图像特征提取任务,在 VGG-19 网络的最后一层之后,增加了一个全连接层,以便将最终的图像特征向量的维数与文本特征向量统一为 $ p $。在联合训练过程中,经过预训练的 VGG-19 网络保持静态,以避免过拟合。将 $ p $维图像特征表示为$ \boldsymbol{R}_{\mathrm{V}}\in\boldsymbol{R}^p $,视觉特征提取器中最后一层的操作可表示为:
$ {{\boldsymbol{R}}}_{\mathrm{V}}=\sigma \left({\boldsymbol{W}}_{\mathrm{v}}^{f}{R}_{\mathrm{V}\mathrm{G}\mathrm{G}}\right) $
式中,$ {{\boldsymbol{R}}}_{\mathrm{V}\mathrm{G}\mathrm{G}} $是由预训练的 VGG-19 网络得到的视觉特征表示;$ {\boldsymbol{W}}_{\mathrm{v}}^{f} $是视觉特征提取器中全连接层的权值矩阵。

2.1.3 多层注意力机制

本文的一个关键成果是利用文本和图像的高维语义特征进行多模态融合,设计的简化的多层联合注意力机制如图3所示,以实现文本和图像特征之间的有选择性对齐。图中的虚线框表示注意力层,框中的内容表示计算过程。该机制通过计算文本特征与图像特征之间的相关性,实现了特征的局部对齐。
图 3 多层注意力结构

Fig.3 Hierarchical Attention Networks

在这个多层注意力机制中,首先使用一个单层的神经网络来输入文本向量$ {\boldsymbol{R}}_{\mathrm{T}} $ 和图像向量 $ {\boldsymbol{R}}_{\mathrm{V}} $,随后使用 softmax 函数生成图像上的注意力区域分布。
$ h_{\mathrm{A}}=\mathrm{tan}\left(\boldsymbol{W}_{\mathrm{V},\mathrm{A}}{{{\boldsymbol{R}}}}_{\mathrm{V}}\oplus\left(\boldsymbol{W}_{\mathrm{T},\mathrm{A}}\boldsymbol{R}_{\mathrm{T}}+b_{\mathrm{A}}\right)\right) $
$ {p}_{\mathrm{V}}=\text{softmax}\left({\boldsymbol{W}}_{\mathrm{P}}{h}_{\mathrm{A}}+{b}_{\mathrm{P}}\right) $
式中,$ {\boldsymbol{R}}_{\mathrm{V}}\in {R}^{d\times m} $$ d $为图像特征表示的维数;$ m $为图像区域数。$ {\boldsymbol{R}}_{\mathrm{T}}\in {\boldsymbol{R}}^{d} $$ d $维向量。
$ {\boldsymbol{W}}_{\mathrm{V},\mathrm{A}},{\boldsymbol{W}}_{\mathrm{T},\mathrm{A}}\in {\boldsymbol{R}}^{k\times d},{\boldsymbol{W}}_{\mathrm{P}}\in {\boldsymbol{R}}^{{1}\times k} $,则$ {p}_{\mathrm{V}}\in {\boldsymbol{R}}^{m} $$ m $维向量,对应于给定$ {R}_{\mathrm{T}} $每个图像区域的注意力概率。用$ \oplus $表示一个矩阵和一个向量的相加,由于$ {\boldsymbol{W}}_{\mathrm{V},\mathrm{A}}{\boldsymbol{R}}_{\mathrm{V}}\in {\boldsymbol{R}}^{k\times m} $$ {\boldsymbol{W}}_{\mathrm{V},\mathrm{A}}{\boldsymbol{R}}_{\mathrm{T}}\in {\boldsymbol{R}}^{k} $都是向量,所以矩阵与向量的加法定义为矩阵上的都加上向量。
通过注意力层,生成了图像向量的加权和$ {\tilde{\boldsymbol{R}}}_{\mathrm{V}} $,以及一个中间向量u
$ {\tilde{\boldsymbol{R}}}_{\mathrm{V}}=\sum _{v}{p}_{\mathrm{v}}{\boldsymbol{R}}_{\mathrm{v}} $
$ \boldsymbol{u}={\tilde{\boldsymbol{R}}}_{\mathrm{V}}+{\boldsymbol{R}}_{\mathrm{T}} $
加权和是每个图像区域的特征向量与对应的注意力概率的加权求和,中间向量则用于下一层的查询。不过,对于比较复杂的文本,仅仅使用单个注意力层不足以较准确地定位图像区域,因此需要通过多个注意力层迭代式进行推理。上述过程被迭代地应用多次,每次迭代都生成一个新的中间向量,直到达到预设的注意力层数量。最后,将最终的中间向量与文本特征向量相结合,输出最终的多模态融合特征表示向量。假设共有$ K $个注意力层,则重复以上操作$ K $次后,将中间向量与文本特征向量结合起来,输出最终的多模态融合特征表示向量 $ {\boldsymbol{R}}_{\mathrm{F}} $
$ {\boldsymbol{R}}_{\mathrm{F}}={u}^{\mathrm{K}}+{\boldsymbol{R}}_{\mathrm{T}} $

2.2 生成对抗网络方案

社交平台的多媒体新闻通常涉及特定事件,导致提取的语义特征与事件相关。虽然这些特征在特定事件上表现良好,但对于其他事件,尤其是新事件,效果不佳,导致真假检测的准确性和响应速度下降。因此,本文采用对抗训练的方式优化模型,旨在提高其泛化能力和抵抗对抗样本攻击的能力。
为了解决新事件识别的难题,本文的模型在多模态特征提取器的基础之上设计了一个神经网络,称为事件分类器。基于多模态特征提取器$ {G}_{\mathrm{f}}\left(M;{\theta }_{\mathrm{f}}\right) $的输出$ {\boldsymbol{R}}_{\mathrm{F}} $进行生成对抗训练。其中$ M $是一组包含文本和图像的多媒体帖子,$ {\theta }_{\mathrm{f}} $表示需要进行学习的参数。特征提取器接收文本和图像的多媒体帖子,生成多模态特征表示。具体的生成对抗网络结构如图4所示。
图 4 生成对抗网络结构

Fig.4 Structure of Generative Adversarial Network

事件分类器将这些特征用于表示事件分类,以将帖子准确分类到$ K $ 个事件类别中。事件分类器表示为$ {G}_{\mathrm{e}}\left({\boldsymbol{R}}_{\mathrm{F}};{\theta }_{\mathrm{e}}\right) $,使用交叉熵定义事件分类器的损失函数:
$ {L}_{\mathrm{e}}\left({\theta }_{\mathrm{f}},{\theta }_{\mathrm{e}}\right)=-{E}_{\left(m,y\right)\sim \left(M,{Y}_{\mathrm{e}}\right)}\left[\sum _{k=1}^{K}{1}_{\left[k=y\right]}log\left({G}_{\mathrm{e}}\left({G}_{\mathrm{f}}\left(m;{\theta }_{\mathrm{f}}\right)\right);{\theta }_{\mathrm{e}}\right)\right] $
式中,$ {\theta }_{\mathrm{e}} $为事件分类器需要训练的参数;$ {Y}_{\mathrm{e}} $ 为事件标签的集合。最小化损失$ {L}_{\mathrm{e}}\left(\;\right) $的参数表示为:
$ {\hat{\theta }}_{\mathrm{e}}=\mathrm{a}\mathrm{r}\mathrm{g}\underset{{\theta }_{\mathrm{e}}}{\mathrm{min}}{L}_{\mathrm{e}}\left({\theta }_{\mathrm{f}},{\theta }_{\mathrm{e}}\right) $
本文通过定义了一个损失函数$ {L}_{\mathrm{e}}\left({\theta }_{\mathrm{f}},{\theta }_{\mathrm{e}}\right) $,反映了事件分类器对不同事件的判别能力,估计不同事件分布的差异性。如果训练损失很大,说明判别器很难区分不同事件,也代表不同事件的分布越相似,意味着特征提取器提取的特征是事件不变的。由于模型的目标是学习一个能够在不同事件下都有效的特征提取器,而不是特定于某个事件的特征,因此为了消除事件特征的特定性,需要通过寻找最优的特征提取器参数$ {\hat{\theta }}_{\mathrm{f}} $来最大化判别损失 $ {L}_{\mathrm{e}}\left({\theta }_{\mathrm{f}},{\theta }_{\mathrm{e}}\right) $
$ {\hat{\theta }}_{\mathrm{f}}=\mathrm{a}\mathrm{r}\mathrm{g}\;\underset{{\theta }_{\mathrm{e}}}{\mathrm{min}}{L}_{\mathrm{e}}\left({\theta }_{\mathrm{f}},{\theta }_{\mathrm{e}}\right) $
上述神经网络设计展示了多模态特征提取器与事件分类器之间的极小极大博弈过程。一方面,特征提取器试图欺骗事件分类器并使其产生更大的判别损失,达到提取泛化特征的目的;另一方面,事件分类器则努力寻找特征中的特定信息来识别出特定事件。

2.2.1 参数训练过程

在训练阶段,多模态特征提取器$ {G}_{\mathrm{f}}\left(\cdot ;{\theta }_{\mathrm{f}}\right) $ 与事件分类器 $ {G}_{\mathrm{e}}\left(\cdot ;{\theta }_{\mathrm{e}}\right) $配合使用,多模态特征提取器试图欺骗事件分类器,而事件分类器则试图最小化该损失函数来识别每个事件的特征。在这两个模块之间进行的极大极小博弈的目的是找到最终目标函数的鞍点(saddle point),也就是训练过程中要求的最优参数集合:
$ {\hat{\theta }}_{\mathrm{e}}=\mathrm{a}\mathrm{r}\mathrm{g}\;\underset{{\theta }_{\mathrm{e}}}{\mathrm{min}}{L}_{\mathrm{e}}\left({\theta }_{\mathrm{f}},{\theta }_{\mathrm{e}}\right) $
$ {\hat{\theta }}_{\mathrm{f}}=\mathrm{a}\mathrm{r}\mathrm{g}\;\underset{{\theta }_{\mathrm{e}}}{\mathrm{max}}{L}_{\mathrm{e}}\left({\theta }_{\mathrm{f}},{\theta }_{\mathrm{e}}\right) $
本文采用基于mini-batch 的随机梯度下降(Stochastic Gradient Descent,SGD)方法来优化训练过程。SGD 方法以随机方式从训练集中选择一小部分数据(mini-batch),并利用这些数据来更新模型参数。参数$ {\theta }_{\mathrm{f}} $$ {\theta }_{\mathrm{e}} $的更新规则如下所示:
$ {\theta }_{\mathrm{f}}\leftarrow {\theta }_{\mathrm{f}}-\eta \frac{\partial {L}_{\mathrm{e}}}{\partial {\theta }_{\mathrm{f}}} $
$ {\theta }_{\mathrm{e}}\leftarrow {\theta }_{\mathrm{e}}-\eta \frac{\partial {L}_{\mathrm{e}}}{\partial {\theta }_{\mathrm{e}}} $
为了稳定训练过程,采用了合适的学习率衰减策略来保证训练过程的稳定性。具体来说,学习率η会随着训练轮数的增加而线性减小:
$ \eta ^\prime=\frac{\eta }{{\left(1+\mathrm{\alpha }\times p\right)}^{\beta }} $
式中,α = 10;β = 0.75;$ p $ 根据训练进度从 0 ~ 1 按线性变化。

2.3 对比学习模型及优化目标

本文提出了一种使用生成对抗网络进行数据增强的有监督对比学习模型。对比学习方法通常通过对数据进行旋转、平移、裁剪等方式进行数据增强,本文的方法中对比学习的输入为多模态特征向量序列,导致无法使用以上提到的数据增强方法。因此,设计了一个生成对抗网络,以特征提取器作为生成网络,以事件分类器作为判别网络,从而学习到更加泛化的多模态特征表示。通过增强后的多模态特征表示和标签集作为输入,本文的模型能学习一个低维的标签嵌入空间,使得同一标签的样本在该空间中距离更近,而不同标签的样本在该空间中距离更远。与传统的对比学习方法不同的是,本文采用了有监督的对比学习方法,允许每个样本都有多个正样本(即具有相同标签的样本),而不是只有一个正样本,并且通过标签显示样本之间的正负关联。
所提的对比学习方法不需要依赖任何前置任务来获取特征表示,因为在特征提取模块和对抗网络模块中已经学习了具有泛化能力的多模态特征。具体的对比学习网络结构如图5所示。该网络通过输入层接收多模态特征表示$ {\boldsymbol{R}}_{\mathrm{F}} $和真伪标签y。由于本文的数据带有标签,因此采用 mini-batch 的方法获取数据。首先从数据中随机采样 $ N $ 个样本对,记为$ {x}_{k},{y}_{k},k=\mathrm{1,2},\cdots ,N $,其中 $ {y}_{k} $ 为样本$ {x}_{k} $ 的标签。
图 5 对比学习网络结构

Fig.5 Structure of Contrastive Learning Network

为了计算损失,将样本的特征表示向量通过一个投影网络$ P\left(\; \right) $ 转换为一个最终向量$ {{\bf{z}}} $。投影网络是只有一个隐藏层,隐藏单元数为 64 的多层感知器,训练结束后,投影网络会被一个单一线性层所替代。在对比学习网络中,64 维的输入向量在投影网络层中通过计算损失函数 $ {L}_{{\mathrm{SCL}}} $,将每个多模态特征向量$ {\boldsymbol{R}}_{\mathrm{F}} $进行正则化处理,使每个特征表示变为单位向量,投影在一个半径为 1 的超球面上。通过输出层输出对于该多模态特征的二分类结果。
假设一个 batch 包含$ N $个样本,经过数据增强后可以得到$ N $个相同标签的样本,输入后续网络进行训练。在投影网络中分别对一个 batch 中的 $ N $ 个多模态特征向量$ {\boldsymbol{R}}_{\mathrm{F}} $进行正则化处理,使每个特征表示变为单位向量 $ {\boldsymbol{z}} $,投影在一个半径为 1 的超球面上。对于任意一个正样本 $ i $,都存在与它标签相同的正样本 $ j $。在损失函数中计算与样本 $ i $ 属于同类的特征的余弦距离,使其越大越好。同时,计算与样本 $ i $与所有不同类的负样本 $ k $的余弦距离的总和,使其越小越好。得到关于样本 $ i $ 的对比损失后,将所有样本的对比损失相加,就得到了总体对比学习损失。
$ {{L}}_{{\rm{SCL}}}=\sum _{i=1}^{N}{L}_{{\mathrm{SC{L}}}_{i}} $
$ {L}_{i}^{{\mathrm{scl}}}=\frac{-1}{{N}_{{y}_{i}}-1}\sum_{j=1}^{N}{1}_{\left[i\ne j\right]}{1}_{\left[{y}_{i}={y}_{j}\right]}log\frac{\mathrm{e}\mathrm{x}\mathrm{p}\left(\left({{\boldsymbol{z}}}_{i}{{\boldsymbol{z}}}_{j}\right)/\mathrm{\tau }\right)}{{\displaystyle\sum\nolimits }_{k=1}^{N}{1}_{\left[k\ne i\right]}\mathrm{e}\mathrm{x}\mathrm{p}\left(\left({{\boldsymbol{z}}}_{i}{{\boldsymbol{z}}}_{k}\right)/\mathrm{\tau }\right)} $

2.3.1 对抗性训练

为了让能够更好地抵御对抗样本攻击,本文采用了在模型训练过程中引入对抗性扰动的方法来提高模型的抵抗力,采用基于梯度的攻击方法来生成对抗样本,即通过对梯度施加一定的扰动,最大化模型输出的损失函数,找到使模型预测错误的最小扰动,从而产生对抗性样本,影响其分类结果。受到PGD[25]的启发,本文在原始样本的基础上,沿着损失函数的梯度方向,进行多步的扰动,使得扰动后的样本能够最大化地增加模型的误分类率。本文在数据中添加对抗性扰动的方法如下:
对于某样本对 $ \boldsymbol{\mathit{x}}_i $$ \boldsymbol{\mathit{y}}_i $$ \boldsymbol{\mathit{x}}_i $在本文中为特征提取器输出的多模态特征向量,$ {y}_{i} $为该特征表示的真/伪标签。设置初始时刻 t= 0,扰动的步长(学习率)α 以及一个扰动限制范围$ {\varepsilon } $和迭代次数 T,将对抗样本 $ {x}^{t=0} $设置为$ {x}_{i} $,生成对抗样本$ {x}^{t} $的过程表示为:
$ {x}^{t}={\mathrm{\pi }}_{x+{\varepsilon }}\left({x}^{t-1}+\mathrm{\alpha }{\mathrm{sign}}\left({\nabla }_{x}L\left(\theta ,{x}^{t-1},{y}_{i}\right)\right)\right) $
式中,$ \theta $是模型的参数;$ {\pi }_{x+{\varepsilon }} $是将扰动后的样本限制在以 $ x $ 为中心,以 $ {\varepsilon } $ 为半径的$ {\mathrm{l}}_{\mathrm{\infty }} $范数球内;$ {\nabla }_{x}L\left(\theta ,x,y\right) $表示损失函数关于输入 $ x $ 的梯度;sign( ) 表示符号函数。
在每一步迭代中,都会计算损失函数对样本的梯度,然后通过符号函数得到梯度的方向,最后在样本上加上梯度的符号乘以步长 α,得到扰动后的样本 $ {x}^{t-1} $。将 $ {x}^{t-1} $投影回约束集合$ {\varepsilon } $中,得到下一步的样本$ {x}^{t} $。重复以上迭代过程直到达到指定的迭代次数T

3 模型性能分析

3.1 实验数据和环境

为了公平地评估所提出模型的性能,本文使用分别从推特和微博收集的两个具有客观真实标签的社交媒体数据集进行了实验,数据集的统计结果见表1
表 1 数据集统计结果

Table 1 Statistical Results of the Dataset

统计数据 推特/条 微博/条
训练集谣言78654352
非谣言56423895
测试集谣言1035884
非谣言456524
总计149989655

3.1.1 数据集

3.1.1.1 推特数据集

推特数据集来源于 MediaEval Verifying Multimedia Use 基准测试,用于检测推特上的虚假内容。该数据有两个子集:一个是开发集,另一个是测试集。其中,开发集包含来自 17 个谣言相关事件的约 9 000 条谣言和 6 000 条非谣言推文;测试集包含来自另一批 35 个谣言相关事件的大约 2 000 条推文,两组数据具有不同的事件覆盖范围。本文将开发集作为训练数据,将测试集作为评估数据,并且保持相同的数据分割方案。推特数据中包含了推文的文本内容、媒体内容(图像或视频)和社交媒体的相关信息。本研究的目标是利用文本和图像的融合来识别假新闻,因此需要对数据集进行处理,过滤掉包含了文本和图像之外的信息的推文,同时确保训练集和测试集中没有相同事件的推文。为了提高调优效率和防止过拟合,本文在训练模型时使用了早停法。

3.1.1.2 微博数据集

在微博数据集中,真实新闻是从新华社等中国的权威新闻来源收集的,而虚假新闻从 2012 年 5 月到 2016 年 1 月抓取,经微博官方辟谣系统验证。该系统鼓励用户向平台报告可疑的帖子,并由信誉良好的用户组成的委员会审查这些案例,验证它们的真实性。
与大多数仅关注文本内容的现有数据集不同,该数据集包含了图像等多媒体数据。本文在假新闻和真实新闻来源中收集原始推文文本和附加图像。在删除纯文本推文后,原始数据集包含大约4万条带有图像的推文。社交媒体上的大部分推文通常是冗杂的,因此本文采用一个基于局部敏感哈希(Locality-Sensetive Hashing,LSH)的近似重复图像检测算法从原始数据集中删除重复和低质量的图像。为了避免训练集和测试集之间的数据重叠,本文通过单通道聚类方法将关于同一事件的推文分开,按照 8∶2 的比例划分为训练集和测试集。

3.1.2 文本预处理

文本预处理在自然语言处理中是一项至关重要的步骤,其目的是将原始文本转换为机器可理解和处理的格式,并去除无用的内容。本文针对两个数据集进行了一系列预处理步骤。
首先,针对原始文本中的无用符号进行清理,如占位符、HTML标签等。随后对原始文本中的标点符号进行处理,采用句子分割器将文本材料转化为以句子为单位的形式。 句子分割器是一个专门用于将文本划分为句子的工具,通常基于规则或机器学习算法,对文本进行分析和识别,以便准确地将文本划分为句子。本文采用了简单的句子分割方法,使用特定的标点符号,如句号、感叹号、问号、分号等作为分割句子的依据,而其他的标点符号则在处理过程中去除。完成这个步骤后,就能得到对于该段文本的一个句子列表。
其次,针对句子列表进行分词和去除停用词处理。分词是自然语言处理任务中的一个重要任务,它是一个将连续的自然语言文本划分成具有语义合理性的词汇序列的过程。针对中英文材料分词方法上的不同,对于英文文本较多的推特数据集,本文使用Genism库进行分词,并通过移除停用词进一步处理;而对于中文文本,则采用jieba库进行分词,同样在分词前进行了停用词设置,以确保分词的准确性和有效性。
最后,将文本材料表示为词嵌入向量。本文使用了预训练的 Word2Vec 模型将单词转换为词嵌入向量表示。对于一个句子,将它转换为一个 N × M 的矩阵,其中 $ N $为句子的长度,即句子中单词的个数,为了后续卷积操作处理方便,本文统一设置 $ N $为最长的句子长度,长度不足$ N $ 的句子用零向量填充;$ K $为单词的词嵌入向量,本文中设置 $ K $ = 32。至此,就得到了关于两个数据集上文本材料的词向量表示。

3.1.3 参数设置

本文模型设计的实验参数主要包括词向量的维度,多模态特征的维度,卷积窗口的大小、步长,卷积核的大小以及随机梯度下降法的学习率。在文本特征方面,本文采用了单词的分布式表示方法。对于数据集中的文本内容,在进行标准文本预处理(去除非文本、分词、去除停用词等)后,使用预训练的 Word2Vec 模型获取每个单词的 32 维词嵌入向量。在文本特征提取过程中,采用多尺度卷积神经网络,通过设置不同的窗口大小捕捉不同粒度的局部特征。卷积窗口大小$ h $从 1 ~ 4 逐步增加,每种窗口大小对应$ {n}_{h}=16 $种卷积核,因此卷积核大小范围为 [1,4]$ \times $32。卷积窗口的步长设置为 1,以充分提取文本的所有特征。对于图像特征,本文使用在 ImageNet 数据集上预训练的 VGG-19 网络来提取图像特征表示。为了与文本特征表示对齐,本文在 VGG-19 网络的基础上添加了一个具有 32 个隐藏单元的全连接层。这样可以确保图像和文本特征表示的维度相同,进而更好地进行后续处理。对于随机梯度下降法,采用了λ = 0.001 的学习率,避免模型无法收敛。

3.2 训练流程

本文的实验将采用 mini-batch 的随机梯度下降法进行优化,通过迭代训练来优化目标函数,多次迭代训练后学习到事件不变的多模态特征表示和假新闻检测分类器。本文在实验中对所有基准对比模型使用相同的训练模式,即每批次处理 100 个数据,总共训练 100 个 epoch。训练的过程如下:
(1) 初始化所有参数,包括权重和偏置等。对于神经网络中待训练的参数,使用通过均匀分布产生随机数的方法进行初始化,在训练中不断调整。
(2) 循环迭代,更新所有参数。将训练集划分为多个 mini-batch,然后进行训练,包括网络的前向传播、计算损失函数、反向传播等过程。根据反向传播得到的梯度信息,使用随机梯度下降法更新参数。在对比学习网络训练过程中,本文在所有的多模态特征中随机抽样,按 4∶1 的比例划分为正常训练集和对抗训练集。本文对对抗训练集中的所有数据都使用 PGD 方法添加了对抗性扰动。
(3) 重复循环迭代的过程,直到模型在验证集上表现出收敛或者抵达预设的最大训练轮次后停止训练。
(4) 训练完成,获得模型符合训练目标的最优参数。

3.3 基线对比模型

为了检验本文所提出模型的性能,将本文模型与以下3种类型的模型进行了对比:一是只使用单一模态的模型,二是使用多种模态的模型,三是基于本模型的不同版本,从不同的角度展示本模型的优势和特点。

3.3.1 单模态模型

本文提出的模型采用了文本和图像结合的多模态方法来检测假新闻,但是单独使用文本或图像也能进行检测。因此,本文提出了以下2种基准模型:
(1)Text 模型。 Text 模型使用预训练的32维词嵌入权重初始化嵌入层参数,并利用卷积神经网络提取每个帖子的文本特征$ {\boldsymbol{R}}_{\mathrm{T}} $。随后,通过一个额外的全连接层,并应用 softmax 函数进行文章真实性判断。该模型采用了20个卷积核,窗口大小为1~4,全连接层的隐藏单元数为32。
(2)Visual 模型。Visual 模型的输入是二维图像。为了提取图像特征,本文使用了预训练的VGG-19 网络和一个后续的全连接层。VGG-19 网络是一个深度卷积神经网络,由19个隐藏层组成,包括16个卷积层和3个全连接层。该网络使用多个3$ \times $3的小卷积核来增加网络的深度和非线性变换能力。本文将图像输入VGG-19 网络的前16个卷积层,得到一个7$ \times $7$ \times $512的特征图,然后将其展平为一个25088维的向量。接着,将这个向量输入隐藏单元数为32的全连接层,输出为一个32维的向量,即图像特征$ {\boldsymbol{R}}_{\mathrm{V}} $。最后,将$ {\boldsymbol{R}}_{\mathrm{V}} $输入后续全连接层进行预测。

3.3.2 多模态模型

多模态方法是自然语言处理和假新闻检测领域的研究重点,所有多模态方法都考虑了来自包括文本、图像、视频、社会背景等多种模式的信息,比较典型的模型有 VQA、SAFE 和 att-RNN。
(1)VQA。VQA模型旨在根据给定图像回答问题,这类模型最初是为了解决多分类的问题而构建的。本文只专注于二分类问题,即新闻的真或假。因此,在实现 VQA 模型时,把最后一层的多类别分类器换成了二行文章真实性判断。该模型采用了20个卷积核,窗口大小为1~4,全连接层的隐藏单元数为32。
(2)SAFE。SAFE[26]模型使用CNN提取文本和图像特征,并重点关注它们之间的相关性。通过提取基于内容的多模态特征来识别特定的虚假新闻。
(3)att-RNN。att-RNN[27]是一种先进的多模态假新闻检测模型,利用注意力机制将文本、视觉和社会背景特征有效融合,从而提高检测的准确性和鲁棒性。为了保持与本文模型的一致性,本文对 att-RNN 进行了一些修改,移除了处理社会背景信息的部分,保留了文本和视觉信息的融合部分,并将隐藏层维度设置为32,并采用双曲正切函数作为非线性激活函数。

3.3.3 本文模型的变体

本文提出的模型 ADSCL 包含3个模块:多模态特征提取器、对抗训练网络、对比学习网络。为了评估本模型在抵抗对抗样本攻击时的效果,本文设计了一个在对抗训练阶段不引入对抗性扰动的简化模型ADSCL*。
同时,为了验证对抗网络的作用,评估 ADSCL 模型中对抗训练网络对于提取事件不变性特征的效果,本文还提出了一个简化的版本 ADSCL-,它不采用对抗训练的方式,而是直接从材料中通过多模态提取器获得事件相关的特征,并进行对比学习。

3.4 总体性能对比实验

本小节对基线对比模型和本文提出的 ADSCL 进行了总体性能实验,结果如表2 所示。可以观察到,本文所提出的模型 ADSCL 的整体性能在准确率、精确率和 $ F $1-Score方面都比给出的基准方法优秀。
表 2 总体性能实验结果

Table 2 Overall Performance Experiment Results

数据集 模型 准确率 精确率 召回率 F1 Score
微博数据集 Text Visual 0.691
0.638
0.569
0.510
0.697
0.672
0.627
0.580
VQA
SAFE
0.727
0.717
0.594
0.591
0.845
0.773
0.698
0.670
att-RNN 0.779 0.663 0.826 0.736
ADSCL- 0.800 0.658 0.850 0.742
ADSCL 0.853 0.731 0.892 0.804
推特数据集 Text Visual 0.547
0.598
0.338
0.390
0.502
0.566
0.404
0.462
VQA
SAFE
0.662
0.646
0.467
0.451
0.750
0.735
0.576
0.559
att-RNN 0.709 0.515 0.809 0.627
ADSCL- 0.738 0.547 0.822 0.657
ADSCL 0.759 0.571 0.844 0.681
推特数据集上存在严重的推文数量不平衡问题,即不同事件的推文数量存在很大的差异,导致文本模型学习到的文本特征主要集中在特定事件上,与图像特征相比包含更明显的事件特定特征,严重影响了为文本模型提取不同事件之间的可迁移特征。相比之下,图像数据集中的事件差异不那么明显,图像特征能够更好地捕捉不同事件之间的共性。因此,在单模态的基准方法中,Text 模型的表现最差,而 Visual 模型的表现则相对较好。然而,仅使用图像信息的Visual模型也不能达到多模态模型的水平。在本文的多模态基准模型中,VQA、SAFE、att-RNN 模型的性能表现均优于所有单模态模型。SAFE 模型在面对文本和图像不符的假新闻时表现优秀,但面对其他类型的假新闻时检测准确率较低。同时,att-RNN模型的准确率在多模态基准方法中表现最高,这说明了在模型中使用注意力机制可以更好地关注到重要的文本和特征,从而提高预测准确率。
而在微博数据集上,对于单一模态方法,观察到与推特数据集相反的结果,表现为 Text 模型的预测性能大大高于 Visual 模型。经过对数据集的分析发现,原因在于微博数据集不存在与推特数据集中的数据不平衡问题,并且具有充分的数据多样性,足够让单模态模型也能提取到有用的文本特征表示用于假新闻检测。微博数据集中的图像在语义上比推特数据集中的图像复杂得多。对于如此具有挑战性的图像数据集,尽管使用了有效的图像特征提取网络 VGG-19 来生成特征表示,Visual 模型仍然无法充分学习到有意义的特征表示。
对于本文提出的模型 ADSCL,它在两个数据集上的准确率、精确率和F1-Score方面均优于所有基线方法。与本文给出最好的基线模型 att-RNN 相比,ADSCL 的准确率提高了 5%,F1-Score提高了 5.4%。与变体模型 ADSCL− 相比,ADSCL 模型的准确率、召回率更高,准确率总体达到了 85.3%,召回率总体达到了 89.2%,说明模型对于真实新闻、虚假新闻的正确识别能力都很高,证明了生成对抗网络在假新闻检测任务上对性能改进的有效性。因此,可以得出结论,本文提出的基于生成对抗网络和对比学习的模型 ADSCL 确实有效提高了假新闻检测的性能。

3.5 生成对抗网络消融实验及泛化性分析

本小节旨在通过消融实验分析模型中生成对抗网络对于假新闻检测任务的有效性,这一部分验证了对抗训练网络对可转移特征的提取能力,同时通过观察模型在不同事件类别上的适应能力,以及模型对未见事件的识别性能,以验证模型的泛化能力。
为了更好地进行这个实验,本节对训练集进行了调整,作为实验数据集。具体来说,采用了单通道聚类方法对数据集进行聚类,将其分为 $ K $ 个类别,并在训练过程中,从单个事件类中抽取样本来组成 mini-batch 进行训练。当该事件类的样本用完后,会换成下一个事件类来继续训练,以此让每个训练轮次只存在一个事件的样本。这样做的目的是观察对抗训练网络对可转移特征的提取能力,为了保证实验效果,测试集不做额外的调整。
除此之外,对本文中提出的两个单模态基准模型进行了改进,加入了本文设计的对抗训练网络,分别命名为 Text+ 和 Visual+。这样做的目的是排除其他因素对结果的影响,从而更准确地评估对抗训练网络在假新闻检测中的作用。本节在所有模型上都进行了同样的训练过程,实验的结果如表3所示。
表 3 生成对抗网络消融实验结果

Table 3 Ablation experiment results for GANs

数据集 模型 准确率 精确率 召回率 F1-Score
实验训练集 Text 52.2/% 34.6/% 46.5/% 39.7
Text+ 57.2/% 40.1/% 54.3/% 46.1
Visual 50.7/% 33.2/% 45.5/% 38.4
Visual+ 55.5/% 38.4/% 52.2/% 44.3
att-RNN 75.9/% 60.3/% 84.0/% 70.2
ADSCL- 75.1/% 60.3/% 76.9/% 67.6
ADSCL 82.1/% 70.5/% 89.3/% 78.8
实验结果显示,对于使用单通道聚类方法调整过的训练集,单模态模型 Text、Visual 和多模态模型 att-RNN 的性能相比普通训练集有所下降。这是因为模型在训练过程中更难提取到具备事件不变性的泛化特征。而加入了生成对抗模块的模型 Text+ 和 Visual+ 对比其原模型在准确率方面均有 8% 左右的提升。对于不使用对抗网络进行训练的 ADSCL- 变体模型,其过度关注某些特定于事件的特征,而忽略了与其他事件的差异,导致模型无法学习到事件之间的可转移特征,泛化能力大幅下降。相比之下,引入对抗网络的完整的模型 ADSCL 能够在不同事件之间建立更好的判别能力,并在各种评估指标上显著优于 ADSCL−,达到了 82.1% 的准确率和 89.3% 的召回率。同时,对比不进行修改的原始数据集上模型的表现,ADSCL−的准确率和精确率下降达到了 4.9% 和 5.5%,而 ADSCL 模型的下降仅有 3.2% 和 2.6%。以上实验结果充分证明了引入生成对抗网络能够很好地让模型学习到多模态数据中与特定事件无关的语义特征,提高了模型的泛化能力,使模型在假新闻检测任务上表现出良好的性能。

3.6 对抗样本消融实验

本小节旨在通过消融实验分析在模型训练中引入对抗性扰动对于模型防御对抗样本攻击能力的影响。为了实现这一目的,本文设计了一个在训练过程中不加入对抗性扰动的对比模型 ADSCL*,并在两个数据集上分别进行了实验。本节对测试集的所有数据添加了对抗性扰动,从而得到了有对抗样本实验测试集。对抗性扰动是一种人类难以察觉的噪声,因此这两组数据在人类的感知上并没有显著的区别。本小节在给出的所有模型上对这两组测试集进行实验,得到的结果如表4 所示。
表 4 对抗样本消融实验结果

Table 4 Ablation Results for Adversarial Examples

数据集 模型 准确率 精确率 召回率 $ F $1-Score
对抗测试集 Text
Visual
55.3/%
54.3/%
37.6/%
36.8/%
48.9/%
47.4/%
42.5
41.2
VQA
SAFE
65.4/%
63.1/%
49.1/%
46.3/%
60.1/%
56.5/%
54.0
50.9
att-RNN 75.2/% 60.1/% 79.1/% 68.3
ADSCL* 46.3/% 30.5/% 46.2/% 36.8
ADSCL 84.2/% 71.6/% 88.6/% 79.2
实验结果显示,加入对抗性扰动的测试集中,各模型的准确率、精确率和 $ F $1-Score均有所下降,这是由于对抗样本的存在,让模型对新闻的真实性判别产生了误判。本文提出的模型 ADSCL ,在各个性能指标上均优于不引入对抗性扰动进行训练的变体模型 ADSCL*,达到了 84.2% 的准确率、71.6% 的精确率和 88.6% 的召回率。同时,与未使用对抗样本的原始数据集相比,ADSCL 在对抗测试集的准确率表现仅下降了 1.1%,而 ADSCL* 模型表现了较差的性能,仅有 46.3% 的准确率和 30.5% 的精确率。这充分说明,在模型训练过程中引入对抗性扰动能有效提高模型对于对抗样本攻击的鲁棒性。

4 结束语

为了应对假新闻检测任务中的挑战,实现高效实时的新事件检测,本文提出了一个基于生成对抗网络和对比学习的假新闻检测模型 ADSCL。该模型采用了多模态特征表示的提取方法,通过联合注意力模型将文本特征和图像特征有效融合,实现了对新闻内容的全面理解。此外,本模型创新性地使用生成对抗网络进行对比学习中的数据增强任务,并且取得了优秀的效果。最后,本文在模型训练过程中引入了对抗性扰动,进一步提高了模型的鲁棒性。
本文通过实验证明所提方案在假新闻检测任务上的有效性,并证明了引入对抗性扰动对提高模型对抗样本攻击的鲁棒性的积极作用。然而,笔者也意识到模型在特征提取和泛化能力上存在局限。未来的工作将集中于扩展实验,以包含更广泛的数据集和实际应用场景,进而全面验证模型的泛化性。同时计划优化特征提取方法,并改进判别网络的结构,以进一步提升模型的鲁棒性和适应性,确保在多样化的假新闻检测任务中保持高效和准确。
1
MA J, GAO W, WONG K F. Rumor detection on twitter with tree-structured recursive neural networks[C]//Association for Computational Linguistics, 2018.

2
LIN H,ZHANG X,FU X. A graph convolutional encoder and decoder model for rumor detection[C]//2020 IEEE 7th International Conference on Data Science and Advanced Analytics (DSAA),2020 :300-306.

3
BIAN T,XIAO X,XU T,et al. Rumor detection on social media with bi-directional graph convolutional networks[C]//Proceedings of the AAAI conference on artificial intelligence ,2020 :549-556.

4
韩雪明,贾彩燕,李轩涯,等.传播树结构结点及路径双注意力谣言检测模型[J].计算机科学,2023,50(4):22-31.

HAN X M,JIA C Y,LI X Y,et al. Dual-attention network model on propagation tree structures for rumor detection[J]. Computer Science,223,50(4): 22-31.

5
MA J , GAO W , MITRA P. Detecting rumors from microblogswith recurrent neural networks[C]//Prceeding of the 25th International Joint Conference on Artificial Intelligence,2016: 3818-3824.

6
KHOO L M S,CHIEU H L,QIAN Z,et al. Interpretable rumor detection in microblogs by attending to user interactions[C]//Proceeding of the AAAI Conference on Artificial Intelligence,AAAI 2020,2020,34(5) :8783-8790.

7
YU F,LIU Q,WU S,et al. A convolutional approach for misinformation identification[C]// Proceedings of the Twenty-Sixth International Joint Conference on Artificial Intelligence,2017 :3901-3907.

8
LIU Y,WU Y B. Early detection of fake news on social media through propagation path classification with recurrent and convolutional networks[C]// Proceedings of the Thirty-Second AAAI Conference on Artificial Intelligence,2018 :354-361.

9
GUO H,CAO J,ZHANG Y,et al. Rumor detection with hierarchical social attention network[C]// Proceedings of the 27th ACM international conference on information and knowledge management,2018 :943-951.

10
LIN X,LIAO X,XU T,et al. Rumor detection with hierarchical recurrent convolutional neural network[C]// Natural Language Processing and Chinese Computing:8th CCF International Conference,NLPCC 2019:338-348.

11
DONG S,QIAN Z,LI P,et al. Rumor detection on hierarchical attention network with user and sentiment information[C]// Natural Language Processing and Chinese Computing:9th CCF International Conference,2020 :366-377.

12
MA J,GAO W,WONG K F. Detect rumors on twitter by promoting information campaigns with generative adversarial learning[C]// The World Wide Web Conference,2019 :3049-3055.

13
Nikam S S, Dalvi R. Machine learning algorithm based model for classification of fake news on twitter[C]//2020 Fourth International Conference on I-SMAC (IoT in Social, Mobile, Analytics and Cloud)(I-SMAC). IEEE,2020: 1-4.

14
PRZYBYLA P. Capturing the style of fake news[C]// The Thirty-Fourth AAAI Conference on Artificial Intelligence,2020 :490-497.

15
SHU K, SLIVA A, WANG S, et al. Fake news detection on social media: A data mining perspective[J]. ACM SIGKDD Explorations Newsletter, 2017, 19 (1): 22- 36.

DOI

16
JIN Z, CAO J, ZHANG Y, et al. Novel visual and statistical image features for microblogs news verification[J]. IEEE Transactions on Multimedia, 2016, 19 (3): 598- 608.

17
JIN Z,CAO J,GUO H,et al. Multimodal fusion with recurrent neural networks for rumor detection on microblogs[C]// Proceedings of the 25th ACM international conference on Multimedia,2017 :795-816.

18
QI P,CAO J,YANG T,et al. Exploiting multi-domain visual information for fake news detection[C]// 2019 IEEE International Conference on Data Mining (ICDM),2019 :518-527.

19
ZHANG T,WANG D,CHEN H,et al. BDANN:BERT-based domain adaptation neural network for multi-modal fake news detection[C]// 2020 International Joint Conference on Neural Networks (IJCNN),2020 :1-8.

20
DEVLIN J,CHANG M-W,LEE K,et al. BERT:Pre-training of deep bidirectional transformers for language understanding[C]// Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics:Human Language Technologies,2019.

21
ZHOU Y, YANG Y, YING Q, et al. Multi-modal fake news detection on social media via multi-grained information fusion[J]. arXiv preprint arXiv:, 2304, 00827, 2023.

22
RADFORD A,KIM J W,HALLACY C,et al. Learning transferable visual models from natural language supervision[C]//International Conference on Machine Learning,2021 :8748-8763.

23
CHEN Y. Convolutional neural network for sentence classification[D]. University of Waterloo,2015.

24
SIMONYAN K, ZISSERMAN A. Very deep convolutional networks for large-scale image recognition[J]. arXiv preprint arXiv:, 1409, 1556, 2014.

25
MADRY A, MAKELOV A, SCHMIDT L, et al. Towards deep learning models resistant to adversarial attacks[J]. arXiv preprint arXiv:, 1706, 06083, 2017.

26
ZHOU X,WU J,ZAFARANI R. Similarity-aware multi-modal fake news detection[C]//Pacific-Asia Conference on knowledge discovery and data mining. Cham:Springer International Publishing,2020:354-367.

27
JIN Z,CAO J,GUO H,et al. Multimodal fusion with recurrent neural networks for rumor detection on microblogs[C]// MM’ 17 :Proceedings of the 25th ACM International Conference on Multimedia,2017:795–816.

文章导航

/