学术研究

基于图增强的大模型生成中文文本黑盒检测

  • 董凌众 ,
  • 张倬胜 ,
  • 孟魁 ,
  • 刘功申 , *
展开
  • 上海交通大学网络空间安全学院,上海 200240
刘功申()。

网络出版日期: 2025-08-20

基金资助

国家自然科学基金联合重点项目(U21B2020);科学技术部“社会治理与智慧社会”重点专项(2023YF3303800)

版权

版权所有©《网络空间安全科学学报》编辑部 2025

Graph-augmented black-box detection of Chinese text generated by large models

  • DONG Lingzhong ,
  • ZHANG Zhuosheng ,
  • MENG Kui ,
  • LIU Gongshen , *
Expand
  • School of Cyber Science and Engineering, Shanghai Jiao Tong University, Shanghai 200240, China

Online published: 2025-08-20

Copyright

Copyright ©2025 Journal of Aeronautical Materials. All rights reserved.

摘要

大语言模型的广泛应用带来了生成文本内容被滥用的风险,如学术论文写作、生成低质量评审意见和捏造虚假新闻等。为保障互联网信息内容安全,大模型生成文本检测研究具有重要意义。然而,现有大语言模型生成文本检测方法主要存在三方面的局限性:商用大语言模型通常闭源,现有的白盒检测方法在实际场景中难以获取模型参数;现有检测方法主要针对英文文本,未能充分考虑中文文本在编码阶段的特殊性;现有的方法过度依赖模型特征提取能力,忽视了文本逻辑结构的重要性。针对这些挑战,提出了一种基于图增强的大模型生成中文文本黑盒检测方法。具体而言,提出了中文文本数据集构建方法,设计了融合文本逻辑结构的图增强黑盒检测模型,最后通过实验验证了文本逻辑结构特征在中文文本检测中的关键作用。实验结果表明,所提方法在检测准确率方面优于现有的方法,为中文生成文本检测提供了新的解决方案。

本文引用格式

董凌众 , 张倬胜 , 孟魁 , 刘功申 . 基于图增强的大模型生成中文文本黑盒检测[J]. 网络空间安全科学学报, 2025 , 3(3) : 68 -78 . DOI: 10.20172/j.issn.2097-3136.250305

Abstract

The widespread use of large language models has led to an increase in the misuse of their generated text, including scenarios such as using these models to write academic papers, produce low-quality peer review comments, and create misleading news articles. Detecting text generated by large models is essential for ensuring the integrity of online information and combating misinformation. Given that commercial models are typically closed-source, black-box detection methods that do not require access to model parameters align better with practical needs and real-world applications. Additionally, most existing detection methods focus primarily on English text and are unsuitable for Chinese text due to significant differences in encoding. Current techniques also tend to rely heavily on the feature extraction capabilities of the models themselves, often overlooking the critical importance of logical structure in the text. This research introduced a systematic method for constructing a dataset of Chinese text generated by large models and proposed a graph-augmented black-box detection model to effectively identify such texts. Experiments revealed the significant role of logical structure features in detecting Chinese text produced by these models accurately. By incorporating logical structure into detection methods, researchers improved the ability to differentiate between human-written and machine-generated content significantly. The proposed approach not only addresses the challenges posed by the closed nature of large models but also highlights the effectiveness of focusing on the logical structure of texts to enhance detection accuracy. The findings underscore the necessity of developing specialized detection methods for various languages and demonstrate that an emphasis on text structure can lead to more robust and reliable detection mechanisms. Effective identification of large model-generated Chinese text is crucial for maintaining the reliability of information in the digital landscape. The study concludes that refining detection techniques to account for linguistic and structural differences is vital for keeping pace with advancements in large language model technology, ensuring a safer and more trustworthy online environment.

0 引言

以ChatGPT、通义千问为代表的大语言模型被广泛应用于回答问题、编写文档、生成可执行的代码。随着大语言模型的广泛应用,恶意使用大语言模型带来的风险也逐渐增大[1],这给互联网信息治理带来了严峻的挑战。恶意使用大语言模型的方式包括社会工程攻击、网络钓鱼、捏造虚假新闻以及在学术写作和代码作业中进行作弊[2]。另外,因为生成文本数据质量通常比人工文本数据差,研究者需要在训练模型前检测并排除生成文本数据[3]。一方面,恶意使用大语言模型为互联网信息治理带来严峻的挑战;另一方面,随着大模型生成文本在流畅度、逻辑一致性等方面的显著进步,以及其高度拟人化的特点,检测大语言模型生成文本成为一项具有挑战性的任务[4]。因此,大语言模型生成文本检测成为了保障互联网信息内容安全的关键技术之一。大语言模型生成文本检测技术在学术研究、论文评审以及新闻报道等多个领域发挥着至关重要的作用。在学术研究领域,该技术可以用于识别和防范大模型误用产生的学术不端行为,如剽窃、伪造和错误结论的传播,确保了学术成果的原创性和真实性;在论文评审领域,该技术可识别出由大语言模型辅助生成的低质量评审文本[5],维护了学术出版的公正性和质量;在新闻报道领域,该技术识别和过滤由大语言模型生成的不准确或虚假新闻内容[6],确保新闻内容的准确性和真实性,保护新闻产业的公信力,维护公众利益和社会稳定。
现有的大语言模型生成文本检测方法主要存在三方面的局限性:首先,许多检测方法仅支持白盒检测,即需要访问大语言模型的内部参数。然而,商用大语言模型多为闭源模型,其参数并不对外公开,这使得白盒检测在实际应用中受到限制。相比之下,黑盒检测无须访问模型参数,更具实用价值。
其次,现有的检测方法主要针对英文文本,未能充分考虑中文文本在编码、语法和语义上的特殊性。例如,中文的多义性、分词问题以及文化背景的差异,都可能影响检测的准确性。因此,开发针对中文文本的检测方法显得尤为重要。
最后,现有的方法依赖模型特征提取能力,忽视了文本逻辑结构差异在文本检测任务中的重要性。文本的逻辑结构差异,如句子的连贯性、段落的一致性等,对于区分人类生成文本和机器生成文本具有关键作用。
针对上述局限性,本文有以下贡献。
(1)构建适用于黑盒检测任务的大语言模型生成的中文文本数据集。该数据集涵盖了不同领域和生成模型的文本,包括转述和扩写两类生成方式,为后续中文文本检测研究提供了可靠的基础数据支持。
(2)本文在中文数据集上适配了多种现有检测方法,发现现有的零样本检测方法和机器学习方法在中文数据集上的局限性,并验证了深度学习方法在检测任务的有效性。
(3)本文提出了一种基于图增强的大模型生成中文文本黑盒检测方法。实验结果表明,图增强检测方法取得了比基线模型更好的准确率。表明文本逻辑结构特征在大语言模型生成文本黑盒检测中的重要性。

1 相关工作

本节将从基于训练的文本检测方法、零样本检测方法、中文文本检测方法3个方面介绍大语言模型生成文本黑盒检测的相关工作。

1.1 基于训练的文本检测方法

基于训练的文本检测方法主要分为机器学习和深度学习两类。这些方法首先需要构建标注数据集,分别收集人类编写和机器生成的文本。对于机器生成的文本,通常通过设计提示词(prompt)对大语言模型进行改写或通过对话问答生成。在特征提取和分类器训练方面,机器学习方法依赖于统计差异特征(如困惑度)和语言模式特征(如词汇、词性、情感等),并使用支持向量机、决策树等传统分类器;而深度学习方法则主要基于预训练模型(如RoBERTa[7,8]),通过微调模型提取上下文语义信息,并结合多层感知机进行分类。CoCo[9]在微调RoBERTa模型的基础上增加了基于文本的连贯性图的语言模式特征,并通过对比学习框架帮助模型更集中于困难样本。T5-Sentinel[10]探索了微调Text-to-Text Transfer Transformer(T5)模型用于文本检测的两种策略。POGER[11]通过重采样来估计单词生成概率作为伪白盒特征,以改进黑盒文本检测方法。此外,MAGE[12]和 PECOLA[13] 分别研究了跨域检测的挑战和对比学习在文本检测中的应用。尽管这些方法在英文文本检测中取得了显著成果,但它们大多未充分考虑中文文本的特殊性,如多义性、分词问题等。此外,现有的研究较少关注文本逻辑结构在检测中的作用。

1.2 零样本检测方法

零样本检测方法旨在无须访问特定模型生成的样本或人类写作样本的情况下,对文本是否由机器生成进行分类或判断。这类方法不依赖于特定数据集的训练或模型微调,而是直接利用模型本身的生成特性进行检测。例如,DetectGPT通过比较原始文本与其改写版本对数概率来评估文本的生成来源,发现模型生成文本的改写版本对数概率往往低于原始样本,而人类文本则可能表现出不同的趋势。FastDetectGPT进一步引入了条件概率曲率的概念,解释了大语言模型与人类在词汇选择上的差异,并通过优化采样步长提高了检测效率。此外,有研究者提出了基于贝叶斯代理模型的方法,通过贝叶斯不确定性选择典型样本并进行分数插值,以提升检测的查询效率。尽管这些方法在白盒场景下表现良好,但在黑盒场景中的应用仍面临挑战。FastDetectGPT提出了适用于黑盒场景的替代方案。本文将其作为基线方法之一,在中文数据集上进行了评测。FastDetectGPT在本文工作的中文数据集上仅取得81.55%的检测准确率。

1.3 中文文本检测方法

近年来,AI生成文本检测任务在自然语言处理领域引发了广泛关注,特别是在中文语境下,研究者提出了多种创新性的检测方法。基于RoBERTa系列模型(如chinese-roberta-wwm-ext和XLM-R)的微调策略在该任务中取得了接近SOTA的性能,成为主流技术路线之一[8,14-15]。其中,通过对中英文对比语料库的微调,RoBERTa系列模型在中文文本的二分类检测任务中表现出色[8];在跨语言检测场景中,XLM-R模型的微调进一步拓展了多语言文本检测的能力[15]。此外,GLTR方法作为该领域的重要基线,在多项研究中被广泛采用,为检测任务提供了可靠的评估基准[8,15]。这些研究不仅验证了微调策略在中文文本检测任务中的有效性,同时也为后续研究奠定了重要的技术基础。GLTR方法在本文工作的数据集上最高只取得了86.65%的检测准确率。本文提出的图增强方法进一步提高了微调RoBERTa模型的检测准确率。

2 研究方法

中文和英文的文本逻辑结构在指代实体的相似性上具有高度一致性,即两种语言都通过实体指代来构建文本的逻辑关联。这一共性为本文的方法提供了理论基础。现有的英文文本检测方法通常通过命名实体识别和关键词匹配来构造实体关系图特征,然而中文文本中丰富的指代关系使得传统的命名实体识别方法难以全面捕捉文本的共指逻辑结构,这为中文文本检测带来了独特的挑战。
现有的基于训练的检测方法所依赖的基底模型通常仅支持英文,使得迁移现有适用于英文文本的检测方法到中文文本的检测十分困难。本文的工作在CoCo模型的基础上针对中文文本检测进行了优化,提出RoBERTa图增强方法。具体优化包括:①更换适用于中文文本的基底模型,由RoBERTa更换为chinese-roberta-wwm-ext[16]。②借助指代消解技术构建中文文本的实体关系图,更准确捕捉文本逻辑结构特征。③简化实体关系图特征提取步骤,使模型更简洁。

2.1 模型整体结构

基于图增强的文本检测模型(以下简称为图增强模型)整体结构如图1所示。该模型接收一段文本作为输入,首先利用RoBERTa模型计算出蕴含文本上下文信息的词表示。随后,通过指代消解技术构建出实体关系图,提供文本实体关系信息。
图 1 模型整体结构

Fig.1 Overall structure of model

接下来,模型结合实体关系图的信息以及个体词表示,构造出实体节点的初始特征集。通过图卷积网络,模型能够整合实体图中的信息,从而得到每个实体节点融合后的特征表示。接着,模型将所有实体节点的特征进行平均,以此作为实体图特征。
最终,模型将实体图特征与RoBERTa模型输出的全局表示特征向量进行拼接,以补充实体图特征中可能缺失的语义信息。这一融合特征随后输入到分类器中,用于评估给定文本是由大语言模型生成的还是由人工编写的。

2.2 计算词表示

本小节介绍如何通过RoBERTa模型计算包含文本上下文信息的词表示。该过程可以表示为公式(1)所示的函数。
$ h\left(x\right)=\left[{\boldsymbol{h}}\right(\left[\mathrm{C}\mathrm{L}\mathrm{S}\right]),h(x{)}_{1},\cdots ,h(x{)}_{|x|}] $
RoBERTa模型接收长度为$\left| x \right|$个单词的文本$x$作为输入,并将其映射为对应的隐藏层向量。其中$ h\left(\right[\mathrm{C}\mathrm{L}\mathrm{S}\left]\right) $是整个输入文本的表示,$h{(x)_i}$代表第$i$个单词的词表示。在自然语言处理的文本分类任务中,通常采用$ {\boldsymbol{h}}\left(\right[{\mathrm{CLS}}\left]\right) $作为文本的语义特征向量。这一向量在经过分类层的处理后,能够有效地预测文本所属的类别。

2.3 指代消解实体关系图构建

日常生活中,人们在对话或写作时会用不同的词来指代之前提到的同一事物,比如用“他”来指代前面提到的某个人。在NLP中,指代消解帮助计算机理解文本中哪些词或短语是指同一事物,这对于理解整个句子或段落的意义至关重要。
一个具体的例子如图2所示,通过指代消解后示例句子中的实体被分为两个实体簇,分别为“[[‘我’,0,1],[‘我’,9,10]]”和“[[‘它’,13,14],[‘她的猫’,5,8]]”。如果采用以往命名实体识别方法和关键词匹配的方法构建实体关系图,代词“它”和实体“她的猫”之间的关联关系会被忽略。
图 3 实体关系图构建

Fig.3 Entity relationship graph construction

现有的英文文本检测方法主要依赖命名实体识别和关键词匹配,而中文文本的指代关系更为复杂,这使得传统方法难以全面捕捉共指逻辑结构。因此本文提出的技术方案针对中文文本的这一特性进行了调整,以更有效地建模文本中的实体关系。首先通过提取中文文本中的所有实体,并将相同指代的实体聚为一类,接着根据聚类构造实体关系如图3所示。
图 2 指代消解示例

Fig.2 Coreference resolution example

2.4 提取实体关系图特征

计算实体节点初始特征。由于实体节点可能是多个单词组成的词组,需要对词表示做进一步的处理来计算实体节点表示。给定一个$m$个单词的实体$e$,实体在文档中的跨度是${e^1}, \cdots ,{e^m}$,其初始表示如公式(2)所示。
$ H_e^0 = \frac{1}{m}\sum\limits_{i = 1}^m {h{{(x)}_{{e^i}}}} $
图卷积网络提取图特征。为了通过多跳相邻节点传播和聚合信息,本文采用多层图卷积网络(Graph Convolutional Networks, GCN)。GCN是提取图特征最好的方法之一,并已在多项文本分类任务和英文生成文本检测任务上取得了较好结果[9,17]。将实体图记为$G$,将所有节点表示记为$H \in {R^{N \times D}}$,其中$N$代表节点个数,$D$代表特征维度。将$G$的邻接矩阵记作$\tilde {\boldsymbol{A}}$,度矩阵记作$\tilde {\boldsymbol{D}}$,波浪线上标代表给图中所有节点添加自环边,以保证符合图卷积网络的使用规范。图卷积网络遵循公式(3)。
$ {H}^{l+1}=\sigma \left({\tilde{{\boldsymbol{D}}}}^{-\tfrac{1}{2}}\tilde{{\boldsymbol{A}}}{\tilde{{\boldsymbol{D}}}}^{\tfrac{1}{2}}{H}^{l}{\boldsymbol{W}}^{l}\right) $
其中,${H^l}$为第$l$层图卷积网络计算所有实体节点的特征表示,$ {\boldsymbol{W}}^{l} $为第$l$层的权值矩阵,$\sigma $为激活函数。特别地,${H^0}$是所有实体节点的初始表示。
较少层数的GCN就可以充分聚合相邻节点特征信息,参考之前研究者的方法,采用两层GCN对实体节点特征做信息聚合。然后将经过图卷积网络融合相邻节点传播和聚合信息后的实体节点特征求平均值得到图特征向量,如公式(4)所示。
$ {{\boldsymbol{H}}_G} = \frac{1}{N}\sum\limits_{e = 1}^N {{H_e}} $
其中,${H_{\mathrm{e}}}$代表经过两层GCN对实体节点特征做信息聚合后得到的实体节点特征,$N$代表实体节点数量。提取实体关系图特征流程如图4所示。
图 4 提取实体关系图特征流程

Fig.4 Process of extract entity relationship graph features

2.5 构建分类器

将图特征向量$ {\boldsymbol{H}}_{G} $和RoBERTa的$ {\boldsymbol{h}}\left(\right[\mathrm{C}\mathrm{L}\mathrm{S}\left]\right) $组合后通过分类器进行预测。该操作的目的是保持整个文档的完整上下文语义,因为在图构建过程中遗漏了一些语言信息。分类器设计与微调RoBERTa分类器类似,分类器结构为Dropout层、线性变换层、激活函数层、Dropout层和输出层。

3 实验验证

3.1 中文数据集

本文参考模型生成英文文本数据集方式[9,11,18]构造中文文本数据集,具体分为两种方法:一种方法是向大语言模型提供整段人类编写的文本进行转述;另一方法是向大语言模型提供人类编写文本的主要内容进行扩写。转述方法获得的机器生成文本通常采用单一的prompt,如“润色以下文本:[人类编写的文本]”。扩写方法获得机器生成文本的例子如“我有一个计算机相关的问题,请用中文回答,什么是外存”“请用[新闻标题]为题编写新闻稿”,其中,外存是人类文本的关键词,新闻标题是人类文本的主要内容,要求大语言模型根据关键词或主要内容,结合自身知识储备扩写内容。两种机器生成文本方法的比较见表1
表 1 机器生成文本方法比较

Table 1 Comparison of methods for machine-generated text

生成方法 输入信息 与原文差异
转述 完整原文,转述要求 较小
扩写 原文主要内容,扩写要求 较大
本文首先收集高质量的人类编写文本,包括新闻数据集和百科数据集。新闻数据集由网络搜集CCTV新闻联播文本构成,新闻联播文本主题丰富,内容权威有效,适合作为人类编写文本数据。百科数据集来自HC3数据集,该工作是大模型生成文本检测领域的先驱工作,受到广大研究者的认可和欢迎,本文工作使用了HC3数据集中的人类编写文本。
接着,本文通过转述和扩写两种方法构造中文数据集。针对新闻数据集,本文采用转述的方法,转述要求模拟人类借助大模型写作的多种交流方法,转述提示词见表2。由于新闻文本较长,转述方法避免机器生成文本与原文出现较大的差异。针对百科数据集,本文的工作沿用了HC3工作使用问答扩写方法。
表 2 转述提示词

Table 2 Paraphrase prompts

转述提示词
'尝试用更具体的词汇来描述你的想法。',
'简化句子,使之更容易理解。',
'确保你的段落过渡自然流畅。',
'使用更多的同义词来避免重复。',
'删除冗长或不必要的表述。',
'确保你的观点清晰明了。',
'删除或替换模棱两可或含糊不清的措辞。',
'给予读者更多的上下文信息。',
'确保你的论证具有逻辑连贯性。',
'用更具体的实例来支撑你的主张。',
'删除重复或不必要的信息。',
'确保每个段落都有一个清晰的主题句。',
'使用变化丰富的句型来增加文章的吸引力。',
'通过改变句子的顺序来增加流畅度。',
'使用引用和引用来源来支持你的观点。',
'用更具体的数字和数据来增强论证的说服力。',
'删除不必要的重复观点或论证。',
'修改任何不准确或模棱两可的声明。',
'提供更多背景信息以便读者了解背景。',
'用生动形象的语言来描述场景或情境。',
'检查并修改不恰当或不专业的用词。',
'检查并修改任何片面或不完整的论述。',
'删除或替换任何不必要的修饰语。',
'修改任何不必要的复杂句子。'
另外,本文还对口语风格的HC3数据集网络问答数据集进行了数据清洗,该数据集主要由 AI 生成的问答对组成,其中可能包含冗余信息、格式不规范的文本以及无效内容。针对这些问题,本文采用一系列数据清洗策略,包括无效样本过滤、格式化处理以及停用词清理等。具体过程如下。
首先,为确保文本的完整性与信息量,本文设定了最小字符长度阈值(100 字符),以去除过短的问答对。这类短文本往往缺乏足够的信息支持,可能会影响模型的学习效果。其次,为了避免数据集中混入英语文本,本文使用了基于非 ASCII 字符比例的检测方法。由于 HC3 数据集可能包含少量英文问答,本文计算每条文本中非 ASCII 字符的占比,并将比例低于 5% 的文本识别为英语,从数据集中剔除。针对 AI 生成文本的典型模式,本文进一步采用基于关键字的过滤策略。HC3 数据集中的 AI 生成文本可能包含诸如“抱歉”“作为 AI,我无法回答”等模板化表达,这些内容通常出现在 AI 对无解问题的回答中,缺乏实质性信息。因此,对于标签为 machine 的数据样本,若文本中包含这些关键词,则将其视为低质量文本并予以删除。此外,由于数据集中部分文本包含换行符 \n,可能影响模型的训练与推理,本文对文本进行了格式化处理,去除了所有 \n ,以保证问答对的连续性。
实验数据集统计情况如表3所示。其中新闻—Llama在单卡4090机器运行,新闻—QWEN通过阿里云灵积平台调用。
表 3 实验数据集统计情况

Table 3 Statistical overview of the experimental datasets

名称 文本风格 方法 生成模型 训练集数量 测试集数量
新闻-Llama 书面 转述 Llama3.1-8B-Chinese-Chat[19] 1 984 1 324
新闻-QWEN 书面 转述 qwen-turbo-0624[20] 2 680 1 908
百科-QWEN 书面 扩写 qwen-turbo-0624[20] 4 000 5 230
HC3-Chinese 口语 扩写 GPT-3.5-turbo 10 000 5 800

3.2 算法实现

本文的总体框架基于Transformers工具包[21]实现,重要参数设置包括训练轮数为2、学习率为2×10−5、批大小为16。将机器文本设为正类(标签为1),人类文本设为负类(标签为0),模型将关注识别出机器生成的文本,优化模型以减少将机器文本错误分类为人类文本的情况。其中,指代消解采用学术界广泛使用的NLP工具包CoreNLP[22],构建实体图和GCN层基于DGL库[23]实现。具体实验环境配置及模型参数设置如表4表5所示。提取实体关系图特征的伪代码见算法1。
表 4 实验环境配置

Table 4 Experimental environment configuration

名称 配置
处理器 NVIDIA GeForce RTX 4090
显存 24.00GB
操作系统 Ubuntu 20.04
软件环境 Python 3.9.19、PyTorch 2.2.1+cu121、
Transformers 4.44.2、scikit-learn1.5.1
dgl2.4.0+cu121、CoreNLP4.5.7
开发语言 Python
表 5 模型参数设置

Table 5 Model parameter settings

名称 参数 设置
RoBERTa 名称 Chinese-roberta-wwm-ext
训练维度 768
最大长度 512
GCN 训练维度 768
层数 2
最大节点数 50
最大边数 100
Dropout层 比率 0.5
全连接层 输出空间维度 2
激活函数 ReLU
训练参数 批处理大小 16
学习率 2×10−5
训练轮数 2
优化策略 Adam
算法1中输入为实体图节点信息(实体词在文本中的跨度信息)和实体图边信息([“节点编号” $i$,“节点编号” $j$ ]的二元组),以及RoBERTa输出词表示。对于有实体关系图的文本,构建DGL图$G$并结合实体词在文本中的跨度信息和RoBERTa,输出词表示计算实体节点的初始特征,构建DGL图$G$需要添加节点、添加实体关系边、添加自环关系边、计算实体节点的初始表示。对于没有实体关系图的文本,输出实体关系图特征为全零向量。
在实验过程中,面临的一个关键挑战是指代消解模型和RoBERTa预训练模型使用不同的中文分词器,因此如何将指代消解模型提取的实体词对齐到RoBERTa文段的分词结果中显得尤为重要。为了应对这一挑战,本文通过对文本进行RoBERTa分词,并找到指代消解模型提取的实体词(即mention_text)在RoBERTa分词后的最小覆盖位置,确保实体词的开始位置与指代消解模型提供的开始位置对应。
具体而言,本文使用了一种基于RoBERTa模型的token化方法,首先对整个文本进行分词,获取每个token的起止字符偏移范围(offsets)。通过这些偏移信息,能够精准地识别出mention_text在文本中的最小覆盖token区间。进一步通过全局token索引返回mention_text对应的起止位置,确保指代消解模型提取的实体词准确地与RoBERTa的token化结果进行对齐。为了避免误匹配多个相同的文本,本文还特别考虑了mention_start位置的对齐,确保每次提取的实体词与指代消解模型的输出一致。
通过这一方法,可以解决指代消解模型与RoBERTa分词之间的对齐问题,从而有效地支持后续的指代消解任务,提升模型的整体性能与准确性。这一处理步骤对于中文文本中的指代消解尤其重要,由于中文缺乏明确的词边界,分词和指代消解之间的对齐问题变得复杂。
算法1 提取实体关系图特征
Input: 实体节点信息 nodes、实体图边信息edges、RoBERTa输出词表示
Output: 实体关系图特征
1. if 文本有实体图 then
2.   新建实体图$G$
3.   添加节点$G \leftarrow $nodes;
4.   添加实体关系边$G \leftarrow $edges;
5.   添加自环关系边;
6.    for $i \in $所有实体节点 do
7.    计算节点$i$初始特征;
8.    end
9.   计算GCN融合节点特征;
10.   计算实体关系图特征;
11. else
12.   实体关系图特征$ \leftarrow $全零向量;
13. end

3.3 基线模型

Fast-DetectGPT基线:本文选取Fast-DetectGPT[24]作为基线模型进行实验对比。在黑盒场景下,Fast-DetectGPT使用gpt-neo-2.7b开源模型[25]作为代理模型,用于检测不同模型生成的文本。代理模型的设置基于一个假设:语言模型在大量的人工语料上训练而具有内在的特征,待测语言模型生成文本和gpt-neo-2.7b生成文本越相似,越容易被Fast-DetectGPT检测。
GLTR基线:参考Guo等工作[8],采用与其相同的基线模型设置。具体而言,基于 GLTR提出的 Test-2 特征,统计了输入文本中 token 在语言模型预测概率的 Top-10、Top-100、Top-1000 以及 1000+ 区间的分布情况,并通过训练逻辑回归模型完成分类任务。
RoBERTa基线:参考英文文本检测接近SOTA性能的微调RoBERTa模型用于生成文本检测的方法,本文工作参考Guo等[8]工作,微调了适用于中文分词和词嵌入的Chinese-roberta-wwm-ext[16]模型作为基线模型,重要参数设置包括训练轮数为2、学习率为2×10−5、批大小为16、优化器为Adam,与本文提出的图增强方法保持一致。

3.4 书面文风中文数据集实验

本文在书面文风中文数据集上评估了不同机器生成文本检测方法的性能,实验结果如表6所示。实验结果表明,不同方法在检测能力上存在显著差异。零样本方法和机器学习方法在本文数据集上表现结果较差。深度学习方法取得了较好结果,本文提出的图增强方法进一步提高了深度学习方法的表现。
表 6 书面文风中文数据集实验结果

Table 6 Experimental results of Chinese dataset

模型新闻-Llama新闻-QWEN百科-QWEN
准确率F1分数准确率F1分数准确率F1分数
Fast-DetectGPT基线[24]69.03%59.33%64.99%50.59%81.55%79.82%
GLTR基线[26,8]55.51%55.51%64.31%64.02%68.45%68.32%
RoBERTa基线[8]95.92%95.89%97.54%97.55%94.38%94.68%
RoBERTa图增强96.60%96.55%98.17%98.16%96.06%96.21%
首先,Fast-DetectGPT 基线的整体检测性能相对较低。在新闻-Llama 和新闻-QWEN 数据集上的 F1 分数分别为 59.33% 和 50.59%,表明该方法在新闻类文本上的检测能力较弱,可能是由于其基于黑盒检测方法,依赖代理模型的生成特征进行判别,难以精准适应不同类型的文本。然而,在百科-QWEN 数据集上的 F1 分数达到 79.82%,表明该方法在百科类文本上具有一定的适应性,这可能与百科文本结构更规范,代理模型更擅长生成该类别文本有关。
其次,传统基于统计特征的机器学习方法(GLTR)在中文数据集上的检测效果同样较弱,其 F1 分数在新闻-Llama 数据集上仅为 55.51%,在百科-QWEN 数据集上也仅达到 68.32%。这表明基于 token 预测概率分布的统计方法难以充分捕捉中文文本的生成模式,可能受限于中文分词的多变性和语言建模的适用性。
相比之下,基于深度学习的 RoBERTa 图增强模型显著提高了检测准确率。RoBERTa 基线模型在所有数据集上均取得了 94% 以上的 F1 分数,最高达到 97.55%(新闻-QWEN 数据集),远超 Fast-DetectGPT 和 GLTR 方法。这一结果表明,预训练语言模型能够有效学习机器生成文本的特征,并在不同数据分布下保持较好的泛化能力。此外,RoBERTa 图增强模型在新闻-QWEN 数据集上 F1 分数从 97.55% 提高到 98.16%,在百科-QWEN 数据集上F1 分数从 94.68% 提高到 96.21%。这些结果表明,图增强方法能够有效补充上下文信息,提高检测模型的鲁棒性,在检测不同风格的文本时表现更优。
综上所述, Fast-DetectGPT 和 GLTR 方法在中文书面文风数据集上的检测能力有限,难以满足高精度检测的需求,而基于深度学习的 RoBERTa 方法显著优于传统方法。特别是,RoBERTa 图增强模型在所有数据集上均表现出最优性能,由此验证了该方法在中文机器文本检测任务中的有效性。

3.5 口语文风中文数据集实验

针对书面文本与口语化文本差异性问题,本文进一步扩展了实验验证范围。考虑到网络公开问答数据在语言风格上更贴近日常中文口语表达,且能够反映大模型的实际应用场景,本次修改新增了一组基于网络公开问答数据集的实验。实验结果表明,所提出的方法在书面化文本和口语化文本检测任务中均显著优于基线模型。
表7展示了模型在口语文风中文数据集上的性能表现,其中RoBERTa图增强模型在准确率和F1分数两个指标上均取得了最佳结果,分别为92.17%和92.73%,较RoBERTa基线模型分别提升了1. 2%和1.02%,较GLTR基线模型则分别提升了5.52%和6.08%。这一结果验证了所提出方法在不同语体文本检测任务中的有效性和泛化能力。
表 7 口语文风中文数据集实验

Table 7 The Chinese dataset experiment of colloquial style

模型 准确率 F1分数
GLTR基线 86.65% 86.65%
RoBERTa基线 90.97% 91.71%
RoBERTa图增强 92.17% 92.73%

3.6 消融实验

为进一步探究RoBERTa模型中各模块的作用,本文在百科-QWEN数据集上设计了一组更为精细的消融实验,如表8所示。首先,去除图增强模块,仅保留RoBERTa的文本特征,以验证图增强模块的贡献。其次,去除RoBERTa提取的全局表示特征,仅依赖图增强特征,以分析全局表示特征在最终分类任务中的作用。
表 8 消融实验

Table 8 Ablation experiment

模型 准确率 F1分数
RoBERTa图增强 94.80% 95.05%
- 图增强特征 94.38% 94.68%
- 全局表示特征 94.61% 94.84%
实验结果表明,去除图增强模块后,模型准确率从94.80%下降至94.38%,F1分数也有所下降,验证了图增强模块在中文数据集上的有效性。同时,去除RoBERTa的全局表示特征后,模型性能仍然有所下降(准确率从94.80%降至94.61%),这说明全局表示特征在语义建模中仍然发挥了重要作用,能够辅助模型捕获文本的深层次信息。
综合两组对比实验可以看出,图增强模块与全局表示特征各自发挥不同作用,图增强模块进一步丰富了结构化信息,而全局表示特征则有助于整体语义理解。两者结合能够提升模型的整体表现,验证了RoBERTa图增强方法的有效性。

3.7 中文数据集跨域实验

为了研究基于训练的检测方法的局限性,本文以RoBERTa图增强方法为例,在中文数据集上进行跨域实验,结果如表9表10所示。
表 9 模型跨域测试集检测准确率

Table 9 Model cross-domain test accuracy

训练集/测试集 准确率
新闻- Llama 新闻-QWEN
新闻- Llama 96.60% 96.75%
新闻-QWEN 95.32% 98.17%
表 10 主题跨域测试集检测准确率

Table 10 Topic cross-domain test accuracy

训练集/测试集 准确率
新闻-QWEN 百科-QWEN
新闻-QWEN 98.17% 50.21%
百科-QWEN 74.42% 96.06%
实验结果表明,模型跨域实验准确率没有明显下降(见表9),而主题跨域实验准确率明显下降(见表10)。模型跨域实验准确率没有明显下降,说明语言模型由于在大量的人工语料上训练而具有内在的共同特征。主题跨域实验准确率明显下降,说明基于训练的检测方法在训练数据上容易出现过拟合,在面对来自不同领域的文本时检测准确率较低。
为避免上述泛化性问题,本文进一步在混合数据集进行实验,结果如表11所示。从结果可以看出,当训练数据由新闻和百科文本混合构成时,模型在跨领域测试集上的检测准确率显著提高,相比单一领域训练数据,其在“新闻-QWEN”测试集上的准确率从74.42%提升至96.38%,在“百科-QWEN”测试集上的准确率从50.21%提升至94.84%。这表明增加训练数据的多样性,尤其是引入来自不同领域的文本,可以有效提升模型的泛化能力,从而缓解跨领域检测性能下降的问题。
表 11 混合数据集准确率检测结果

Table 11 Result of mixed dataset experiments

训练集/测试集 准确率
新闻-QWEN 百科-QWEN
混合数据集 96.38% 94.84%
此外,不同测试集上的检测准确率差异可能与文本的语言特征相关。新闻类文本通常具有较强的时效性和结构化信息,而百科类文本更偏向客观描述和知识性表达。因此,未来的研究可以进一步分析不同领域文本的语言特征,并在训练数据选择上引入更多类型的文本,如社交媒体、技术文档等,以进一步提升方法在跨领域任务中的稳健性。

4 结束语

本文针对中文大语言模型生成文本的检测任务,系统评估了现有方法的有效性,并提出了一种基于图增强的深度学习检测方法。实验结果表明,零样本检测方法在中文数据集上的检测准确率最高仅为 81.55%,传统机器学习方法检测准确率最高达到 86.65%,而深度学习方法表现更优,其中图增强方法进一步提升了检测性能,检测准确率最高达到 98.17%。这表明,尽管零样本方法在一定程度上具备泛化能力,但在中文文本检测任务中仍存在显著局限性,而结合文本结构信息的深度学习方法能够有效提升检测效果。另外,增加训练数据的多样性,尤其是引入来自不同领域的文本,可以有效提升模型的泛化能力,从而缓解跨领域检测性能下降的问题。
同时,关注到当前研究者已开始探索更细粒度的检测方法,特别是句子级别的机器生成文本检测。代表性的工作包括浙江大学团队的PTD模型[18]和波士顿大学的上下文增强方法[27]。相比于整篇文本的检测,句子级检测能够更精确地识别局部生成内容,尤其是在人机共创的混合文本环境下更具实际价值。然而,上述工作表明,句子级检测方法面临短文本检测准确率低、易过拟合等挑战,同时现有零样本检测方法难以有效识别短句文本。
鉴于上述观察,笔者未来将进一步拓展句子级检测任务,结合文本逻辑结构信息,探索更加鲁棒的黑盒检测方法;计划构建更大规模的中文句子级检测数据集,设计融合文本逻辑关系的检测模型,以增强模型在不同生成模式和领域文本上的适应性。此外,还将研究跨语言检测方法,以提升中文检测方法的泛化能力,使其能够适用于更广泛的应用场景。
1
MIRSKY Y, DEMONTIS A, KOTAK J, et al. The threat of offensive ai to organizations[J]. Computers & Security, 2023, 124, 103006.

DOI

2
KIRCHENBAUER J, GEIPING J, WEN Y, et al. A watermark for large language models[C]//Proceedings of the 40th International Conference on Machine Learning. PMLR, 2023: 17061-17084.

3
SHI W, AJITH A, XIA M, et al. Detecting pretraining data from large language models[J].arXiv preprint, arXiv: 2310.16789

4
DUGAN L, IPPOLITO D, KIRUBARAJAN A, et al. Real or fake text: Investigating human ability to detect boundaries between human-written and machine-generated text[C]// Proceedings of the AAAI Conference on Artificial Intelligence, 2023, 37(11): 12763-12771.

5
LIANG W, IZZO Z, ZHANG Y, et al. Monitoring AI-modified content at scale: A case study on the impact of ChatGPT on AI conference peer reviews[C]//Proceedings of the 41st International Conference on Machine Learning. PMLR, 2024: 29575-29620.

6
FANG X, CHE S, MAO M, et al. Bias of AI-generated content: An examination of news produced by large language models[J]. Scientific Reports, 2024, 14 (1): 5224.

DOI

7
LIU Y, OTT M, GOYAL N, et al. RoBERTa: A robustly optimized BERT pretraining approach[J] .arXiv preprint, arXiv: 1907.11692

8
GUO B, ZHANG X, WANG Z, et al. How close is ChatGPT to human experts? comparison corpus, evaluation, and detection[J].arXiv preprint, arXiv: 2301.07597

9
LIU X, ZHANG Z, WANG Y, et al. CoCo: Coherence-enhanced machine-generated text detection under low resource with contrastive learning[C]// Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing. Association for Computational Linguistics, 2023: 16167-16188.

10
CHEN Y, KANG H, ZHAI V, et al. Token prediction as implicit classification to identify LLM-generated text[C]// Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing. Association for Computational Linguistics, 2023: 13112-13120.

11
SHI Y, SHENG Q, CAO J, et al. Ten words only still help: Improving black-box AI-generated text detection via proxy-guided efficient re-sampling[J]. arXiv preprint, arXiv: 2402.09199v1

12
LI Y, LI Q, CUI L, et al. MAGE: Machine-generated text detection in the wild[C]/ Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics. Association for Computational Linguistics, 2024: 36-53.

13
LIU S, LIU X, WANG Y, et al. Does DetectGPT fully utilize perturbation? bridging selective perturbation to fine-tuned contrastive learning detector would be better[C]// Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics. Association for Computational Linguistics, 2024: 1874-1889.

14
熊盼, 杨浠, 郑旭飞, 等. AI生成与人类作者撰写论文要素的检测研究[J]. 人工智能科学与工程, 2024, (4): 21- 30.

XIONG P, YANG X, ZHENG X F, et al. Detection research on elements of AI-generated and human-written academic papers[J]. Artificial Intelligence Science and Engineering, 2024, (4): 21- 30.

15
WANG Y, MANSUROV J, IVANOV P, et al. M4GT-Bench: Evaluation benchmark for black-box machine-generated text detection[C]//Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics. Association for Computational Linguistics, 2024: 3964-3992.

WANG Y, MANSUROV J, IVANOV P, et al. M4GT-Bench: Evaluation benchmark for black-box machine-generated text detection[C]//Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics. Association for Computational Linguistics, 2024: 3964-3992.

16
CUI Y, CHE W, LIU T, et al. Pre-training with whole word masking for Chinese BERT[J]. IEEE/ACM Transactions on Audio, Speech, and Language Processing, 2021, 29, 3504- 3514.

DOI

17
Neural deepfake detection with factual structure of text - ACL anthology[C]//Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP).Association for Computational Linguistics, 2020: 2461–2470

18
LI Y, WANG Z, CUI L, et al. Spotting AI’s touch: Identifying LLM-paraphrased spans in text[C]// Findings of the Association for Computational Linguistics ACL 2024. Association for Computational Linguistics, 2024: 7088-7107.

19
WANG S, ZHENG Y, WANG G, et al. Llama3.1-8B-Chinese-chat[Z]. Hugging Face, 2024.

20
BAI J, BAI S, CHU Y, et al. Qwen technical report[J]. arXiv preprint, arXiv: 2309.16609.

21
WOLF T, DEBUT L, SANH V, et al. Transformers: State-of-the-art natural language processing[C]// Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing: System Demonstrations. Association for Computational Linguistics, 2020: 38-45.

22
MANNING C, SURDEANU M, BAUER J, et al. The stanford CoreNLP natural language processing Toolkit[C]//Proceedings of 52nd Annual Meeting of the Association for Computational Linguistics: System Demonstrations. Baltimore, Association for Computational Linguistics, 2014: 55-60.

23
WANG M, ZHENG D, YE Z, et al. Deep graph library: A graph-centric, highly-performant package for graph neural networks[J]. arXiv preprint, arXiv: 1909.01315.

24
BAO G, ZHAO Y, TENG Z, et al. Fast-DetectGPT: Efficient zero-shot detection of machine-generated text via conditional probability curvature[C]//The Twelfth International Conference on Learning Representations. 2023.

25
GAO L, BIDERMAN S, BLACK S, et al. The pile: An 800GB dataset of diverse text for language modeling[J]. arXiv preprint, arXiv: 2101.00027.

26
GEHRMANN S, STROBELT H, RUSH A. GLTR: Statistical detection and visualization of generated text[C]// Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics: System Demonstrations. Association for Computational Linguistics, 2019: 111-116.

27
ZHANG Z, QIN W, PLUMMER B. Machine-generated text localization[C]// Findings of the Association for Computational Linguistics ACL 2024. Association for Computational Linguistics, 2024: 8357-8371.

文章导航

/