Technology Application

Counter-speech based on LLM with hybrid retrieval-augmented-generation method

  • Liu Zixi ,
  • Zhang Yangsen , * ,
  • Wang Xinru ,
  • Wang Yuqi
Expand
  • Institute of Intelligent Information Processing, Beijing Information Science and Technology University, Beijing 100101, China

Online published: 2026-05-06

Copyright

Copyright ©2025 Journal of Aeronautical Materials. All rights reserved.

Abstract

To address the challenges of current social platform moderation strategies—such as content removal and account suspension, which often raise concerns about freedom of speech—and the limitations of existing automated response systems that tend to produce generic and unsubstantiated replies, a counter-speech generation framework based on Large Language Models (LLM) is proposed. A four-layer framework is designed, incorporating enhanced preprocessing, knowledge retrieval, model generation, and content evaluation modules, supported by a self-constructed structured knowledge base to generate counter-speeches from logical, legal, factual, and psychological guidance perspectives. Experimental results show that, across four types of hate speech—geographic, racial, religious, and gender-based—the proposed framework outperforms baseline models including BM25, L-seq2seq, T5, CDial-GPT, and ChatGLM in metrics such as language quality, generation diversity, and counter-speech performance. The study demonstrates that a generation framework integrating knowledge enhancement and multi-level control can effectively improve the professionalism, credibility, and social adaptability of generated counter-speeches, offering an interpretable and controllable technical solution for automated hate speech intervention. Insights are also provided on knowledge base construction and the establishment of evaluation criteria for counter-speech generation.

Cite this article

Liu Zixi , Zhang Yangsen , Wang Xinru , Wang Yuqi . Counter-speech based on LLM with hybrid retrieval-augmented-generation method[J]. Journal of Cybersecurity, 2025 , 3(6) : 100 -111 . DOI: 10.20172/j.issn.2097-3136.250608

0 引言

仇恨言论反驳旨在通过逻辑论证、事实澄清或情感疏导等方式,对具有攻击性、歧视性或煽动性的言论生成理性回应,以削弱其负面影响、遏制偏见扩散。现有工作多集中于仇恨言论的识别[1],缺乏“仇恨—反驳”配对语料,公开的中文反驳数据集近乎空白。国际上虽已构建多语言反驳资源[2-3],但尚未覆盖中文;且仇恨言论高度依赖文化语境,直接迁移其他语言的方法难以适用于中文表达习惯与社会规范[4]。此外,当前治理手段(如人工审核)易受主观性影响,而账号封禁等去平台化措施可能引发用户迁移与内容隐蔽化,加剧监管难度[5-6]。因此,中文反仇恨言论在数据与方法层面均存在显著空白,亟须构建融合语言特性与社会语境的系统性生成框架。
近年来,大语言模型(Large Language Models,LLM)(如ChatGPT[7])在文本生成任务中展现出强大的语言生成能力与泛化性能。然而,其在处理知识密集型任务时,仍面临(如幻觉和知识更新滞后等)问题[8],限制了其在高可靠性场景中的应用。因此,研究者将研究方向转向了检索增强生成(Retrieval Augmented Generation,RAG)技术[9],该技术通过结合外部知识检索与语言模型生成,提升生成内容的准确性与可靠性,已在医疗、法律等领域取得良好效果[10-15]。将RAG机制应用于仇恨言论反驳,不仅为反驳文本生成过程提供了权威知识支持,而且得益于知识库的可更新性,系统能够持续适应不断演变的网络用语和隐性仇恨表达形式,具备良好的动态适应能力与时效性。
受检索增强生成技术在知识密集型任务中成效的启发,针对中文反仇恨言论生成任务存在的问题,本文提出一种混合检索增强的反仇恨言论生成框架(Hybrid Retrieval-Augmented Framework for Counter Hate Speech Generation,HRA-CHSG),包括增强处理层、知识检索层、模型生成层和内容评估层。该框架不依赖于生成模型的纯参数化知识,而是通过构建结构化知识库并融合文本检索与语义检索两种检索机制,在生成过程中动态引入外部事实依据与论证模式,有效缩小生成内容在事实性、逻辑性与社会规范性方面的预期偏差,从而实现知识驱动下精准的、可解释的、高可信的反驳文本生成。
本文的主要贡献如下:
1)构建面向仇恨言论反驳的专项结构化知识库,为反驳文本生成任务提供多维度知识支撑;
2)提出混合知识检索增强的仇恨言论反驳文本生成框架,实现多角度、高质量的反驳文本生成,在多项指标上显著优于现有基线模型;
3)结合语言学专家参与评估,建立兼顾人工判决与自动指标的综合评估体系,为该类任务的质量评价提供可操作的标准。

1 相关工作

1.1 仇恨言论反驳文本生成方法

为了开展大规模研究和参与反仇恨言论工作,开发计算方法以自动生成反仇恨言论至关重要[16]。在仇恨言论反驳文本生成的相关研究中,为提升生成内容质量,研究者采用基于微调模型、提示工程和外部知识增强三类方法。
在基于微调模型的反驳文本生成方面,Doğanç等[17]将发布者画像融入GPT-2和GPT-3.5,发现仅GPT-3.5能实现有效个性化,表明模型规模对个性化生成至关重要。Mathew等[18]构建了首个大规模人工标注的YouTube仇恨言论反驳数据集(13 924条),并指出其用户认可度较高且不同反驳策略效果存在差异。然而,此类方法面临发布者信息获取与隐私保护之间的权衡,且数据采集成本较高。Halim等[19]提出一种配对技术,通过将未配对的仇恨言论与合成或已有反驳文本匹配,扩充小型配对数据集,缓解数据稀缺问题,并用于模型微调以减轻偏见。Fonton[20]提出一种人机协同的数据构建方法,通过语言模型与人工审校的迭代优化,高效构建了首个包含5 000对仇恨言论与反驳文本的数据集。综上,基于微调的仇恨言论反驳生成方法虽在个性化、数据构建与偏见缓解方面取得进展,但仍高度依赖高质量标注数据,面临成本高、训练开销大等问题,限制了其实际应用与持续优化。
在基于提示工程的反仇恨言论文本生成方面,Ashida等[21]探讨了利用提示生成仇恨言论反驳文本的可行性,发现GPT-3在生成安全、有信息量且反对侮辱性内容方面表现最优,展现出语言模型在可控生成中的潜力。Zheng等[22]进一步验证了提示工程的有效性,实验表明ChatGPT生成结果稳定,但内容常缺乏具体性且存在重复现象。Saha等[23]提出3种提示策略,发现人工设计提示优于自动方法,但对ChatGPT仅在“事实型”等特定提示下略有提升。总体而言,提示工程具有实现简便、成本低的优势,适用于资源受限场景。然而,该方法也面临生成内容可能包含错误信息或虚构内容的挑战,且效果高度依赖于提示设计的质量和模型本身的能力。
基于外部知识增强的仇恨言论反驳生成方法的核心是引入外部知识源,为反驳言论生成提供事实性、统计性和实例性证据支持,从而增强内容的信息量与可信度。Chung等[24]提出基于知识约束的反驳生成框架,通过检索外部知识生成证据支持的回应,有效地避免泛化,提升生成内容的可信性。本文延续Chung等所倡导的证据驱动理念,采用混合检索增强方法,对仇恨言论反驳文本的生成进行研究。

1.2 检索增强生成技术

近年来,RAG技术随Transformer架构的发展而深化,其性能关键在于高效准确的段落检索[25]。ChatGPT的兴起推动RAG转向为模型推理提供外部知识支持,以应对复杂知识密集型任务。此外,RAG技术通过更新知识库即可实现知识迭代,具备较高的灵活性与更新效率[26],契合本任务在低资源场景下的应用需求。
传统方法主要依赖于基于词项匹配的稀疏向量空间模型,如词频—逆文档频率(Term Frequency-Inverse Document Frequency TF-IDF)[27]和BM25[28],这些模型通过构建倒排索引实现快速检索,在实践中展现出良好的召回能力和可扩展性。然而,这些方法在处理语义泛化或语言多样性场景时存在明显局限性。近年来,随着BERT[29]的提出,稠密检索逐渐取代传统稀疏方法,通过双编码器架构将查询与文档映射至共享语义空间,并利用对比学习优化向量表示。Karpukhin等[30]提出稠密检索模型,即使仅使用有限的监督信号,稠密检索器也能有效捕捉深层语义关系,在多个主流ODQA基准(如SQuAD、Natural Questions)上显著优于基于Lucene实现的BM25系统,在top-20段落召回率指标上提升9%~19%。
为应对稀疏检索与稠密检索的缺陷,Wang等[31]提出了一种融合BM25与BERT模型的混合检索框架,用于提升文档检索效果。这种方法通过凸线性组合混合检索的方式融合稀疏检索模型和稠密检索模型的检索结果,如式(1)和式(2)所示。实验结果显示,在大多数问答数据集上,该混合方法在文本召回性能方面均优于单独采用稀疏或稠密检索方法。
$ {S}_{{\mathrm{convex}}}\left(q,d\right)=\left(1-\alpha \right)S_{\text{sparse}}^{\prime}\left(q,d\right)+\alpha S_{{\mathrm{d}}\mathrm{e}{\mathrm{n}}\mathrm{s}{\mathrm{e}}}^{\prime}\left(q,d\right) $
$ {S}^{\prime}=\frac{{\mathrm{Score}}\left(q,d\right)-{S}_{\min }}{{S}_{\max }-{S}_{\min }} $
综上,RAG技术在多项任务中展现出生成高质量、可解释内容的能力,为充分挖掘外部知识在反驳文本生成过程中的支撑作用,本文融合稀疏与稠密两种检索范式的优势:一方面,利用稀疏检索方法捕捉关键词匹配信号,确保高词频相关片段的召回;另一方面,借助稠密检索建模语义相似性,识别表达方式不同但含义相近的支持性证据。

2 仇恨言论反驳文本生成框架

本文提出一个面向仇恨言论反驳生成的4层框架,其整体架构如图1所示。增强处理层负责构建结构化知识库,提升信息的可管理性与语义表达能力;知识检索层通过融合两种召回机制,精准定位与输入言论相关的反驳依据;模型生成层基于检索结果与提示模板,驱动大语言模型生成多视角、高可信的反驳内容;内容评估层则结合自动指标与人工评判,对生成结果进行全面质量测评。
图 1 整体框架

Fig.1 Overall framework

2.1 增强处理层

增强处理层对本地数据库文件进行语义三元组抽取,并以元数据的形式存储,实现知识的结构化表示。具体而言,利用大语言模型通过少样本提示为知识库中的文档生成语义三元组,包括摘要、目标对象和主题。摘要是对原文关键内容的抽取和总结。目标对象表示该文件指向的具体个体、群体或组织。主题是对文件在知识库中所属类别的简单短语概括。表1提示模板示例了利用大语言模型和提示模板实现三元组提取的生成方法。提示模板中包含一个示例及相关名词解释以明确任务要求。这里借鉴了Brown等[32]的研究,旨在增强检索效率,缓解生成式模型在生成反驳文本时存在的可解释性弱与内容可控性不足等问题,进而解决生成反驳文本时的幻觉问题。
表 1 基于大模型提取三元组的提示模板示例

Table 1 Example of a prompt template for extracting semantic triples using LLM

模板作用 模板内容
语义三元组提取 语义三元组是由摘要、目标对象和主题构成的组合,其中摘要是对原文关键内容的抽取和总结,目标对象是证据所关于的核心个体、群体或组织,或者证据内容的受益方。主题是证据在知识库中所属类别的短语概括。根据文档中的证据,请提出一个语义三元组。注意:该语义三元组中的目标对象应避免模糊的指代,比如“他”“她”“它”等,并应使用完整的名字。语义的主题应从“心理”“案例”“法律法规”3个选项中选择一个,代表该文件在知识库中所属的类别,如果有多个主题,给出最主要的主题。如果没有提取到语义三元组,请留空。请根据给定的证据生成一个语义三元组,不要自行生成证据,请按照以下格式回答:
证据:[原始上下文]摘要:[原文关键内容的抽取和总结]目标对象:[目标]主题:[主题]
示例:
证据:[全国人民代表大会和地方各级人民代表大会的代表中,应当保证有适当数量的妇女代表。国家采取措施,逐步提高全国人民代表大会和地方各级人民代表大会的妇女代表的比例。居民委员会、村民委员会成员中,应当保证有适当数量的妇女成员。]
摘要:[国家规定全国人民代表大会、地方各级人民代表大会、居民委员会和村民委员会都应当保证有适当数量的妇女代表或成员,并采取措施逐步提高妇女代表的比例。]
目标对象:[妇女]
主题:[法律法规]

2.2 知识检索层

知识检索层融合文本检索和语义检索两种检索方式进行多路召回,并对检索所得进行重排序,获取与特定查询最相关的知识,为生成反驳文本提供依据。

2.2.1 文本检索

选择BM25算法来进行文本检索,它是对TF-IDF算法和倒排索引的一种优化,在信息检索中用于评估文档与查询之间的相关性。综合考虑词项在文档中的$ {\mathrm{TF}} $、文档的长度($ {\mathrm{doc}}\_ {\mathrm{len}} $)以及$ {\mathrm{IDF}} $,通过对每个词项的打分求和得到最终的文档与查询的相关性分数,打分的计算如式(3)所示。
$ \text{score=}\sum\limits_{q\in {\mathrm{query}}}^{}\left[{\mathrm{IDF}}\left(q\right)\cdot \frac{{\mathrm{TF}}\left(q,d\right)\cdot \left({k}_{1}+1\right)}{{\mathrm{TF}}\left(q,d\right)+{k}_{1}\cdot \left(1-b+b\cdot \dfrac{{\mathrm{doc}}\_ {\mathrm{len}}}{{\mathrm{avgdl}}}\right)}\right] $
其中,$ {{k}}_{1} $控制词项频率对分数的影响,$ b $控制文档长度对分数的影响,$ {\mathrm{avgdl}} $是文档集合中平均文档长度。
词项重要性基于TF-IDF算法计算,计算式如(4)和(5)所示。
$ {\mathrm{TF}}\left(q,d\right)=\frac{词项q在文档{d}中出现的次数}{文档{d}中所有词项的总数} $
其中,$ {q} $表示词项,$ {d} $表示文档,$ {{\mathrm{TF}}} $表示一个词项在文档中出现的次数相对于文档总词项数的比例。
$ {\mathrm{IDF}}\left({q}\right)=\log \left(\frac{文档集合中的文档总数}{包含词项{q}的文档数+\text{1}}\right) $
其中,$ q $表示词项,$ {\mathrm{IDF}} $表示一个词项在整个文档集合中的稀有程度。

2.2.2 语义检索

仇恨言论反驳生成属于强语义理解任务,需应对一词多义、近义替换等挑战。语义检索通过词或句嵌入将文本映射到高维语义空间,以向量相似度匹配查询与文档,有效捕捉深层语义,提升检索的准确性与鲁棒性。
语义检索流程如图2所示:利用BGE模型对仇恨言论和知识库中的文档进行嵌入操作,同时将嵌入标准化,进而计算余弦相似度,最后对相似度进行排序,得到相关性较强的结果。余弦相似度的计算如式(6)所示。
图 2 语义检索流程

Fig.2 Workflow of semantic retrieval

$ \mathrm{Cos}\ {\mathrm{ineSimilarity}}=\frac{{\boldsymbol{X}}\cdot {\boldsymbol{Y}}}{\left|\left|{\boldsymbol{X}}\right|\right|\left|\left|{\boldsymbol{Y}}\right|\right|} $
其中,$ {\boldsymbol{X}} $$ {\boldsymbol{Y}} $是一个向量空间中的向量,$ {\boldsymbol{X}}=\left({x}_{1}, {x}_{2},\cdot \cdot \cdot ,{x}_{n}\right) $是第一个向量点,每个向量的分类$ {x}_{1},{x}_{2},\cdot \cdot \cdot , {x}_{n} $各自都是一个浮点值;$ {\boldsymbol{Y}}=\left({y}_{1},{y}_{2},\cdot \cdot \cdot ,{y}_{n}\right) $是第二个向量点,每个向量的分类$ {y}_{1},{y}_{2},\cdot \cdot \cdot ,{y}_{n} $各自都是一个浮点值;公式中的$ {\boldsymbol{X}}\cdot {\boldsymbol{Y}}=\displaystyle\sum\nolimits_{i=1}^{n}{x}_{i}{y}_{i} $是两个向量$ {\boldsymbol{X}}=\left({x}_{1}, {x}_{2},\cdot \cdot \cdot ,{x}_{n}\right) $$ {\boldsymbol{Y}}=\left({y}_{1},{y}_{2},\cdot \cdot \cdot ,{y}_{n}\right) $的点积。

2.2.3 知识选择

知识选择部分结合文本检索和向量检索的结果进行多路召回,并对检索结果进行重排序,得到top 6的结果作为最终选定的知识。
多路召回通过多个召回路径或方法综合获取候选文档,以提高检索的全面性和准确性。单一的召回方法由于模型特性或数据特点而存在局限性,多路召回逻辑引入了多个召回路径,每个路径采用不同的召回方法。
本文将BM25文本检索结果和稠密语义检索的top10个文档,使用BGE-Reranker算法进行重新排序,获取到top6个文档,综合得到检索结果。多路召回与重排序流程如图3所示。
图 3 多路召回与重排序流程

Fig.3 The workflow of multi-path retrieval and re-ranking

2.3 模型生成层

在模型生成层中,系统将知识检索层获取的相关证据整合至预设的提升模板中,驱动大语言模型生成兼具逻辑与真实性的多视角反驳内容。
构建仇恨言论反驳文本需首先准确识别其核心观点,并基于多角度策略引导大模型生成具有对比性与多元视角的对立主张。该层通过挖掘多维度反驳证据,增强生成内容的辩证性,更贴近现实辩论逻辑,从而提升反驳文本的说服力与可靠性。
基于以上分析和设计,本文融合知识检索结果和原始仇恨言论构造Prompt,使用ChatGLM来完成仇恨言论反驳文本的生成。仇恨言论反驳文本生成提示模板示例如表2所示。
表 2 仇恨言论反驳文本生成提示模板示例

Table 2 Example of a prompt template for counter-speech generation.

模板作用 模板内容
生成多角度的仇恨言论反驳文本 你现在是一个仇恨言论反驳专家,请对仇恨言论进行分析,并按以下格式回应:逻辑反驳:指出言论仇恨属性,拆解错误关联,分析多元影响因素。法律法规:根据国际公约、国家法律政策,明确违法性。数据事例:对权威数据和真实事例进行分析,佐证言论与事实不符。心理引导:结合心理相关的研究结论,分析认知偏差根源,给出纠正建议。
输入代码:
问题:{query}\n 相关上下文:{context}\n
输出代码:
result = ['']。

2.4 内容评估层

内容评估层将运用自动化评估标准和人工评估标准来对生成的仇恨言论反驳文本的质量和可用性进行评估。
采用人工评估与自动评估相结合的方法,对所有待测模型在零样本条件下进行反仇恨言论生成能力的评估。评估策略可概括为专家出题,模型答题。为兼顾对多样化仇恨言论的有效反驳,基于CHSD数据集[33]构建了综合性测试集。首先,从原始数据集中依据仇恨类别(性别、地域、种族)进行分层抽样,每类随机选取50条仇恨言论,共构成200条测试样本。为进一步增强语料的现实覆盖性与语言多样性,本文额外补充了从微博平台爬取并经人工清洗的真实语料。
该测试集中的每条仇恨言论均配有由领域专家撰写的标准化参考回复,作为后续评估的标准。所有待评估的语言模型均需针对200条输入生成对应的反驳文本。最终,采用双重评估机制:一方面由语言学专家依据预设的人工评估准则进行主观评分;另一方面,结合多种自动评价指标进行客观量化分析,以全面衡量模型生成结果在内容准确性、逻辑性与说服力等方面的综合表现。
(1)自动评价指标
自动评价方面,从毒性(Toxicity,Tox),语言质量(Linguistic Quality,LQ),多样性(Distinct),相关性(Relevance,Rel)和反驳成功率(Success rate of Countering,SROC)5个角度对生成的反驳文本的质量进行评估。
Tox用于衡量生成文本的冒犯、粗鲁或不合理的程度。采用Google提出的Perspective API来对文本的毒性进行评估。它由一个基于BERT的多语言模型驱动,该模型基于公开的毒性数据和从该模型中提取的几个较小的单语言循环神经网络进行微调。
LQ用于衡量文本的流畅性、可读性和语法正确性。使用无监督的GRUEN[34]评价框架进行评估。
Distinct[35]用于衡量生成的反驳文本的多样性。计算不重复的n-gram数量和总n-gram的比值,如式(7)所示,其中,n表示n-gram的阶数。
$ {\mathrm{Distinct}}\text{-}n=\frac{{\mathrm{count}}\left({\mathrm{unique}}\,\,\,\,n\text{-}{\mathrm{gram}}\right)}{{\mathrm{count}}\left(n\text{-}{\mathrm{gram}}\right)} $
Rel用于衡量生成的反驳文本和仇恨言论之间的主题一致性,可以衡量生成内容对于仇恨言论的针对性,采用BM25相似度计算方法来评估[36]
SROC用于衡量生成的反驳文本对于仇恨言论的反驳成功概率。本文实现了一个准确率为87.8%的立场检测器,来评估生成的反驳文本是否和原始仇恨言论是对立的关系。该检测器是在包含4 000条数据的中文微博立场检测数据集上微调RoBERTa模型训练得到的。
(2)人工评价指标
生成式模型的评估不仅关注语言质量,更应衡量其在特定社会语境中的说服力、得体性与价值对齐性。传统自动指标(如Tox、Distinct)难以建模此类高阶属性。因此,本文构建融合人工评分与多维自动指标的混合评估框架,实现对反驳文本的细粒度情境感知质量评估。
LQ可以衡量生成的反驳文本的流利性、可读性和语法正确性。
反驳性能(Countering Performance,CP)指的是生成的反驳文本对原仇恨言论的反驳力度,即证据的翔实程度和反驳内容的全面程度。
是否选用(Choose or Not,CON)指的是生成的反驳文本是否会在实际情况下使用。
对于LQ和CP指标,研究者对每个样本从0到5的离散值进行打分,分数越高代表在相应指标上的表现越好。CON指标为二元评价指标(1或0),研究者在实际中会使用的样本标记为1,不会使用的标记为0。每个回答的各项得分是由三位语言学研究人员打分的均值。

3 实验与评估

3.1 知识库构建

为提升反驳生成的论据严谨性与策略有效性,本文构建了一个约50万字的仇恨言论知识库。知识来源包括:①知网收录的关于仇恨言论本质、心理成因与治理策略的学术文献;②中央网信办发布的网络内容管理相关法规。知识库涵盖事实分析、法律法规与心理机制三方面,为模型提供多维度支撑,实现从事实回应、法律警示到情绪疏导的综合性反驳策略生成。
在知识组织层面,采用语义三元组作为文本片段的结构化元数据。三元组由本地部署的大语言模型 ChatGLM 基于少样本提示(few-shot prompting)自动生成,并通过预设的规则体系进行后处理校验,包括字段完整性检查、主题类别白名单约束及摘要长度合理性控制,以保障其作为元数据的质量。
在知识库的版本管理与持续更新方面,采用文件系统快照与增量写入相结合的策略。Chroma 数据库在本地存储,当需要更新时,系统仅对新增或修改的文档进行解析、向量化并追加至现有数据库,避免全量重建,支持高效的增量更新。通过 Git 对数据库目录进行版本控制,在保证知识库状态可追溯与可复现的同时,维持了系统的轻量性与易维护性。未来可结合文件哈希比对与定时任务,进一步实现自动化去重与版本追踪,构建动态演进的私有化知识基础设施。

3.2 参数设置

为实现高质量仇恨言论的反驳文本生成,通过设置不同的超参数,来做多次对比实验,最后选取参数的最优值,如表3所示。语义检索采用智源开源的中英文双语嵌入模型 bge-small-zh-v1.5[37],在中文文本表征上表现优异。向量数据库选用轻量级开源系统 Chroma,支持 embedding 及其元数据的高效存储与检索。文档切分采用 CharacterTextSplitter,设置 chunk size 为 1024、chunk overlap为64,以保持上下文连贯性。对于多路检索结果,使用 BAAI 的 bge-reranker-base[37]进行重排序,提升相关性匹配精度。如图4所示,系统将原始文档与语义三元组编码为向量并存入Chroma;查询时,将用户输入向量化后通过相似度检索获取相关证据。
表 3 超参数设置

Table 3 Hyperparameter settings

参数 说明 最优值
Embedding model 嵌入模型 bge-small-zh-v1.5
Embedding Vector 向量数据库 Chroma
TextSplitter 文档分割器 CharacterTextSplitter
Chunk size 块大小 1024
Chunk_overlap 重叠大小 64
Rerank 重排序算法 bge-reranker-base
Top-k 知识检索层的前k个结果 6
图 4 Chroma结构

Fig.4 Architecture of the Chroma

针对每条仇恨言论,模型在生成反驳观点后,通过知识检索获取Top-k相关证据,并结合原始言论与检索结果生成反驳文本。为确定最优k值,评估不同k下的反驳成功率与相关性,结果如图5所示。Rel随k增加趋于稳定(k=5时饱和),而SROC在k=6达到峰值后下降。表明过多的知识引入会增加噪声,干扰模型的知识选择,导致生成质量下降。综合两项指标,最终选定k=6。
图 5 知识数量k对HRA-CHSG框架的影响

Fig.5 Effect of knowledge quantity k on the HRA-CHSG framework

3.3 实验与结果分析

3.3.1 检索效果评估与消融实验

(1)检索效果评估指标
本文使用Hit@1,Hit@3和平均检索排名(Mean Reciprocal Rank,MRR)这3个指标来衡量不同配置下的检索效果。
Hit@1:衡量检索结果中,第一个位置是否为正确答案。计算式如下:
$ {\mathrm{Hit}}@1=\frac{1}{N}\sum\limits_{i=1}^{N}\mathrm{I I }\left({\mathrm{ran}}{{\mathrm{k}}}_{i}=1\right) $
其中,$ N $是查询的总数,$ \mathrm{I I } $是指示函数,如果括号内条件为真则返回1,否则返回0,$ \text{ra}{\mathrm{n{k}}}_{i} $是针对第$ i $个查询,正确答案在所有候选答案中的排名。
Hit@3:衡量检索结果中,前3个位置是否包含正确答案,计算式如下:
$ {\mathrm{Hit}}@3=\frac{1}{N}\sum\limits_{i=1}^{N}\mathrm{I I }\left({\mathrm{ran}}{\mathrm{{k}}}_{i}\leqslant 3\right) $
其中,$ N $是查询的总数,$ \mathrm{I I } $是指示函数,如果括号内条件为真则返回1,否则返回0,$ \text{ra}{\mathrm{n{k}}}_{i} $是针对第$ i $个查询,正确答案在所有候选答案中的排名,$ \mathrm{I I }\left({\mathrm{ran{k}}}_{i}\leqslant 3\right) $表示只要正确答案的排名是第1~3,都算成功,计为1分。
MRR是所有测试查询中正确答案排名倒数的平均值,用于评估检索返回结果的排名质量。
$ {\mathrm{MRR}}=\frac{1}{Q}\sum\limits_{\textit{i}=1}^{Q}\frac{1}{{\mathrm{ran{k}}}_{{i}}} $
其中,$ Q $是总查询的数量,$ {\text{rank}}_{i} $是第$ i $个查询中第一个相关结果的排名。
(2)消融实验
为评估HRA-CHSG框架中混合检索方式的有效性,设计了消融实验。实验结果如表4所示,在引入混合检索与多路召回机制后,各项评价指标均有显著提升,其中,Hit@1达到60.00%,Hit@3为74.00%,MRR提升至72.15%。这一结果验证了混合检索策略在本文框架中的有效性。从检索机制的角度分析,文本检索依赖于关键词匹配,虽然在处理术语明确、表述规范的查询时具有较高精确度,但其检索效果受限于“词汇不匹配”问题,即无法有效识别同义不同词的语义关联。而语义检索基于语义向量匹配,能够捕捉深层语义信息,克服词汇表面差异,但在处理专有名词或特定实体时可能因语义泛化而丢失关键字符义。本文实验中,混合检索对Hit@1指标的提升尤为显著,说明两种检索方式在检索过程中实现了有效互补:文本检索保障了关键实体的精确匹配,语义检索则增强了语义层面的泛化能力。两者结合不仅缓解了单一检索机制的固有局限,也显著提升了系统在多样化查询下的整体召回能力与排序质量,最终使各项指标均达到最优,验证了混合检索方法的实用性与鲁棒性。
表 4 检索方式消融实验结果

Table 4 Ablation study results on retrieval strategies

检索方式Hit@1Hit@3MRR
文本检索37.00%61.00%54.05%
语义检索41.00%68.00%66.20%
文本检索+语义检索60.00%74.00%72.15%

3.3.2 生成模型效果评估

为验证HRA-CHSG框架在仇恨言论反驳文本生成任务上的有效性,将其与各类文本生成基线模型做对比,实验分别从自动评估和人工评估两方面对生成结果进行分析。本文所使用的对比基线模型如下。
1)BM25:经典的检索式问答模型,主要通过计算问题和答案之间重合的关键词以及关键词的权重得分来衡量二者的匹配程度,还可以通过对知识库建立倒排索引来实现高效的答案检索。
2)L-seq2seq:传统的基于sequence-to-sequence架构的生成式模型。本文采用LSTM模型做文本编码和序列生成。
3)T5:基于 Transformer 架构的编码器-解码器语言模型。本文将仇恨言论输入模型的编码器进行编码,并在解码器中采用贪心解码算法生成相应的输出。
4)CDial-GPT:基于预训练模型GPT的drcoder-only的自回归中文文本生成语言模型,本文采用CDial-GPT2LCCC-base进行实验。
5)ChatGLM:基于通用语言模型 GLM架构的自回归式中英文双语对话模型,采用Prefix-LM结构,支持流畅的多轮对话与指令遵循能力。
6)HRA-CHSG:基于知识检索增强和大模型联合的文本生成框架,通过文本检索和语义检索联合选择到知识库中的相关知识,将知识和原始仇恨言论连接作为提示,利用ChatGLM模型生成反驳文本。
自动评价实验结果如表5所示,其中“↓”表示值越低越好,“↑”表示值越高越好。数据显示,HRA-CHSG模型在多个关键性能指标上展现出显著的优势。具体而言,该模型在Rel和SROC上,相较于最优基线模型ChatGLM,分别实现了4.3%和4.4%的提升。这一结果证明了HRA-CHSG模型在生成针对仇恨言论的反驳文本方面的卓越能力,其生成内容与原始仇恨言论之间的关联性更为紧密,反驳效果更为显著。另外HRA-CHSG模型在Tox指标上略高于检索式模型BM25,但相较于纯生成类模型,其毒性水平显著降低。这是因为它是基于大模型生成的,因而会继承大模型本身的一些偏见问题,但整体上生成内容的毒性还是减弱的。LQ和Distinct指标最优,证明HRA-CHSG既保持了生成模型的高质量文本生成能力,另外混合检索方法也提升了它的生成内容的多样性。综上所述,通过集成知识检索技术和大语言模型强大的生成能力,HRA-CHSG 在生成相关性较强的反驳文本的同时,有效平衡了内容的安全性、质量与真实性。
表 5 生成效果评估(自动化指标)

Table 5 Generation effecf evaluation (automatic metrics)

模型类型Tox↓LQ↑Distinct↑Rel↑SROC↑
BM25检索式0.0850.5980.4250.8190.623
L-seq2seq纯生成式0.3270.6430.3750.6230.796
T5纯生成式0.2230.7900.4130.6950.821
CDial-GPT纯生成式0.2140.8030.4220.7120.858
ChatGLM纯生成式0.1550.8240.4730.8030.876
HRA-CHSG知识驱动生成式0.1130.8320.5440.8460.920
人工评价方面,针对检索式,纯生成式和知识驱动生成式的反驳文本生成结果进行人工评价分析,其中纯生成式模型选择ChatGLM模型,用来验证引入外部知识对反驳言论生成的影响。人工评价结果如表6所示,基本与自动评估结果一致。语言质量方面,HRA-CHSG的分数高于ChatGLM,这是因为联结了知识库的信息,可以提供更广泛的证据来支撑反驳文本的生成。另外,在CON方面的评分达到最优,验证了HRA-CHSG生成的反驳文本的可行性是最高的,说明其在现实场景中是最有可能被使用的。以上对比结果都验证了HRA-CHSG模型的优越性以及自动评价标准的有效性。
表 6 生成效果评估(人工指标)

Table 6 Generation effect evaluation (human metrics)

模型类型LQCPCON
BM25检索式3.393.580.33
ChatGLM纯生成式4.183.350.54
HRA-CHSG知识驱动生成4.534.230.76

3.3.3 生成模型效率评估

本文采用BM25算法实现文本检索模块。实验结果表明,该模型因结构简洁、参数量小,平均查询耗时仅为4.8 ms(208.3QPS),响应迅速,对HRA-CHSG框架整体生成效率影响极小。
为进一步评估推理效率,本文对比了HRA-CHSG与基线模型在推理时间、生成速度和总token数上的表现。结果如表7所示,HRA-CHSG 模型的平均推理时间为18.322 s,高于基线模型 ChatGLM 的9.243 s。这一时延的增加主要源于模型生成的文本长度显著增长,由于引入了外部知识支持与结构化推理机制,模型生成的反驳文本更丰富、翔实。HRA-CHSG模型共生成56 894个token,较基线模型增加了近一倍。尽管如此,模型的生成速度仍保持在14.528token/s的稳定水平,表明推理时间的增长主要源于输出长度的增加,检索与知识融合模块并未引入显著的额外计算开销。
表 7 生成效率评估

Table 7 Evaluation of generation efficiency

模型 推理时间/s 生成速度/token.s−1 总token数
ChatGLM 9.243 14.387 26596
HRA-CHSG 18.322 14.528 53236
值得注意的是,无检索机制的基线模型推理时间波动剧烈(4.26~39.31 s),反映出生成过程的不稳定性。相比之下,引入知识检索机制后的HRA-CHSG模型,推理时间集中在18 s左右,这可能源于RAG机制为模型提供了外部知识,约束了生成空间,减少了事实查找过程中的探索成本,从而使生成路径更加一致。综上所述,HRA-CHSG模型在保持显著性能优势的同时,具备良好的推理效率与响应稳定性,验证了其在真实应用场景中的实用性与鲁棒性。

3.4 案例分析

对有知识库辅助的HRA-CHSG框架和无知识库辅助的ChatGLM模型在应对特定仇恨言论情境下的表现进行分析,仇恨言论反驳文本生成示意如图6所示。
图 6 仇恨言论反驳文本生成示意

Fig.6 Schematic diagram of counter-speech generation

针对仇恨言论“黑人天生就有劣根性,所以他们犯罪率高。”在逻辑反驳角度,HRA-CHSG框架展现了对仇恨言论核心论点的深度解析能力,成功识别出言论试图建立的因果关系,即认为黑人群体所谓的“劣根性”是导致其犯罪率偏高的原因;并准确地驳斥这一关系,强调犯罪率的高低与种族属性并无直接联系,而是受多元社会、经济、文化等因素影响的复杂现象。相比之下,ChatGLM模型虽能识别并指出前半句关于“黑人天生劣根性”的表述存在逻辑谬误,但对于整个言论所构建的错误因果链未能进行准确理解,其反驳停留在对部分论据的质疑上,表现出一定的局限性。
在法律法规和数据事例方面,HRA-CHSG模型能够精确引用相关法律法规条文,明确指出言论内容违反了哪项法律,且可能构成违法行为。此外,该模型还能调用权威统计数据或具体案例,以确凿的事实证据揭示黑人犯罪率并非源于种族内在属性。这种基于精确法律依据与实证数据的反驳,极大地增强了反驳的权威性和说服力。
最后,框架生成的反驳文本对仇恨言论所体现的心理问题进行剖析和正向的引导,更有助于提高反驳成功率,营造良好的网络环境。相反,无知识库辅助的ChatGLM模型在生成反驳文本时,尽管可能试图以一般性的道德或伦理原则予以批驳,但其内容往往呈现出通用化与模糊化的特征,而且缺乏针对性的法律法规引用与具体数据支持,使得ChatGLM的反驳显得力度不足并且缺乏正向的心理引导。
综上所述,HRA-CHSG模型凭借其整合的知识库在仇恨言论的深度理解和外部知识的精准运用上展现出显著优越性。

4 结束语

针对中文仇恨言论研究资源匮乏及言论自由与内容治理的现实矛盾,本文提出了一种基于知识检索增强的仇恨言论反驳文本生成框架HRA-CHSG,并构建了一个仇恨言论反驳知识库。使用人工评估方法和自动评估方法对大模型生成的仇恨言论反驳文本进行评估。评估结果表明,HRA-CHSG有较优的表现,证明了大模型执行仇恨言论反驳文本生成任务的有效性。
在后续研究工作中,本文将进一步深入探索仇恨言论的实体抽取与关键信息抽取技术,致力于提升反驳文本生成任务的针对性。此外,当前社交媒体的严格管制虽然限制了仇恨言论的传播,但也导致了更为隐蔽的仇恨言论形式激增,用户开始用谐音和变体等更多样化、更含蓄的表达方式来发表仇恨言论,未来将深入研究针对各类群体的社会偏见以及挖掘更为隐形的仇恨言论,从而扩充并规范中文仇恨言论知识库,为其治理提供更全面的数据基础与理论支持。
1
孙连毅, 许静文. 面向社交媒体的中文文本毒性检测研究综述[J]. 计算机应用研究, 2026, 43 (1): 11- 22.

Sun L Y, Xu J W. Survey of Chinese toxic text detection in social media contexts[J]. Application Research of Computers, 2026, 43 (1): 11- 22.

2
Chung Y L, Kuzmenko E, Tekiroglu S S, et al. CONAN - counter narratives through nichesourcing: a multilingual dataset of responses to fight online hate speech[C]//Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. Stroudsburg, PA, USA: ACL, 2019: 2819-2829.

3
Lee S, Park C, Jung D, et al. Leveraging pre-existing resources for data-efficient counter-narrative generation in Korean[C]//Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024). ELRA, 2024: 10380-10392.

4
Derczynski L, Guerini M, Nozza D, et al. Countering hateful and offensive speech online - open challenges[C]//Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing: Tutorial Abstracts. Stroudsburg, PA, USA: ACL, 2024: 11-16.

5
卞清, 陈迪. “易碎”的智能与“撕裂”的世界: 西方主要社交媒体“仇恨言论”的界定、规制与算法困境[J]. 中国图书评论, 2021 (9): 15- 32.

Bian Q, Chen D. “Fragile” intelligence and “tearing” world: definition, regulation and algorithm dilemma of “hate speech” in western major social media[J]. China Book Review, 2021 (9): 15- 32.

6
Ohlheiser A. Banned from Twitter This site promises you can say whatever you want[J]. WashingtonPost, 2016, 29, 10- 13.

7
Radford A, Narasimhan K, Salimans T, et al. Improving language understanding by generative pre-tra-ining[R]. San Francisco: OpenAI, 2018.

8
徐月梅, 胡玲, 赵佳艺, 等. 大语言模型的技术应用前景与风险挑战[J]. 计算机应用, 2024, 44 (6): 1655- 1662.

DOI

Xu Y M, Hu L, Zhao J Y, et al. Technology application prospects and risk challenges of large language models[J]. Journal of Computer Applications, 2024, 44 (6): 1655- 1662.

DOI

9
Lewis P, Perez E, Piktus A, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks[C]// Advances in Neural Information Processing Systems 33 (NeurIPS 2020). Red Hook, NY: Curran Associates, Inc. , 2020: 9459-9474.

10
段永康, 赵广宇, 耿骞, 等. 基于大语言模型的政策知识库构建与政策比较研究: 以惠企政策为例[J]. 数据分析与知识发现, 2025, 9 (10): 68- 84.

DOI

Duan Y K, Zhao G Y, Geng Q, et al. Constructing policy knowledge base and comparing policies based on large language models: case study of pro-business policies[J]. Data Analysis and Knowledge Discovery, 2025, 9 (10): 68- 84.

DOI

11
Yu Q K, Jin M Y, Shu D, et al. Health-LLM: personalized retrieval-augmented disease prediction system[PP/OL]. V9. arXiv (2025-05-22)[2025-08-01]. https://doi.org/10.48550/arXiv.2402.00746.

12
Alam H M T, Srivastav D, Mohamed Selim A, et al. CBM-RAG: demonstrating enhanced interpretability in radiology report generation with multi-agent RAG and concept bottleneck models[C]//Companion Proceedings of the 17th ACM SIGCHI Symposium on Engineering Interactive Computing Systems. New York: ACM, 2025: 59-61.

13
Sun J Y, Dai C X, Luo Z Z, et al. LawLuo: a multi-agent collaborative framework for multi-round Chinese legal consultation[PP/OL]. V3. arXiv (2024-12-16)[2025-07-26]. https://doi.org/10.48550/arXiv.2407.16252.

14
张艳萍, 陈梅芳, 田昌海, 等. 面向军事领域知识问答系统的多策略检索增强生成方法[J]. 计算机应用, 2025, 45 (3): 746- 754.

DOI

Zhang Y P, Chen M F, Tian C H, et al. Multi-strategy retrieval-augmented generation method for military domain knowledge question answering systems[J]. Journal of Computer Applications, 2025, 45 (3): 746- 754.

DOI

15
Zhang P Y, Zhang Y Z, Wang B, et al. Edu-values: towards evaluating the Chinese education values of large language models[C]//Proceedings of the Companion Proceedings of the ACM on Web Conference 2025. New York: ACM, 2025: 1519-1523.

16
Wright L, Ruths D, Dillon K P, et al. Vectors for counterspeech on Twitter[C]//Proceedings of the First Workshop on Abusive Language Online. Stroudsburg, PA, USA: ACL, 2017: 57-62.

17
Doğanç M, Markov I. From generic to personalized: investigating strategies for generating targeted counter narratives against hate speech[C]//Proceedings of the 1st Workshop on CounterSpeech for Online Abuse (CS4OA). Kerrville: Association for Computational Linguistics 2023: 1-12.

18
Mathew B, Saha P, Tharad H, et al. Thou shalt not hate: countering online hate speech[J]. Proceedings of the International AAAI Conference on Web and Social Media, 2019, 13, 369- 380.

DOI

19
Halim S M, Irtiza S, Hu Y B, et al. WokeGPT: improving counterspeech generation against online hate speech by intelligently augmenting datasets using a novel metric[C]//Proceedings of the 2023 International Joint Conference on Neural Networks (IJCNN). Piscataway: IEEE Press, 2023: 1-10.

20
Fanton M, Bonaldi H, Tekiroğlu S S, et al. Human-in-the-loop for data collection: a multi-target counter narrative dataset to fight online hate speech[C]//Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 1: Long Papers). Stroudsburg, PA, USA: ACL, 2021: 3226-3240.

21
Ashida M, Komachi M. Towards automatic generation of messages countering online hate speech and microaggressions[C]//Proceedings of the Sixth Workshop on Online Abuse and Harms (WOAH). Stroudsburg, PA, USA: ACL, 2022: 11-23.

22
Zheng W, Ross B, Magdy W. What makes good counterspeech a comparison of generation approaches a-nd evaluation metrics[C]//Proceedingsof the 1st Workshop on Counter Spee-ch for Online Abuse. Stroudsburg, PA: Association for Computational Linguistics, 2023: 62-71.

23
Saha P, Agrawal A, Jana A, et al. On zero-shot counterspeech generation by LLMs[C]//Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024). ELRA, 2024: 12443-12454.

24
Chung Y L, Tekiroğlu S S, Guerini M. Towards knowledge-grounded counter narrative generation for hate speech[C]//Proceedings of the Findings of the Association for Computational Linguistics: ACL-IJCNLP 2021. Stroudsburg, PA, USA: ACL, 2021: 899-914.

25
白云天, 郝文宁, 靳大尉. 基于检索增强生成的开放域问答方法研究[J]. 计算机科学, 2025, 52 (S1): 36- 42.

DOI

Bai Y T, Hao W N, Jin D W. Study on open-domain question answering methods based on retrieval-augmented generation[J]. Computer Science, 2025, 52 (S1): 36- 42.

DOI

26
贺梓然, 江波, 王晓龙. 改进检索增强与LLM思维链维修策略生成[J]. 计算机应用与软件, 2025, 42 (3): 1- 6,83.

DOI

He Z R, Jiang B, Wang X L. Improved retrieval-augmented and LLM of chain-of-thought maintenance strategy generation[J]. Computer Applications and Software, 2025, 42 (3): 1- 6,83.

DOI

27
Robertson S E, Walker S. On relevance weights with little relevance information[C]//Proceedings of the 20th Annual International ACM SIGIR Conference on Research and Development in Information Retrieval - SIGIR '97. New York: ACM, 1997: 16-24.

28
Robertson S, Zaragoza H. The probabilistic relevance framework: BM25 and beyond[J]. Foundations and Trends in Information Retrieval, 2009, 3 (4): 333- 389.

29
Devlin J, Chang M W, Lee K, et al. BERT: pre-training of deep bidirectional transformers for language understanding[C]//Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long and Short Papers). Kerrville: Association for Computational Linguistics 2019: 4171-4186.

30
Karpukhin V, Oguz B, Min S, et al. Dense passage retrieval for open-domain question answering[C]//Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP). Stroudsburg, PA, USA: ACL, 2020: 6769-6781

31
Wang S, Zhuang S Y, Zuccon G. BERT-based dense retrievers require interpolation with BM25 for effective passage retrieval[C]//Proceedings of the 2021 ACM SIGIR International Conference on Theory of Information Retrieval. New York: ACM, 2021: 317-324.

32
Brown T B, Mann B, Ryder N, et al. Language models are few-shot learners[C]//Proceedings of the 34th International Conference on Neural Information Processing Systems. New York: ACM, 2020: 1877-1901.

33
饶晓俊, 张仰森, 贾启龙, 等. 基于Ro-BERTa的中文仇恨言论侦测方法研究[C]// 第二十二届全国计算语言学学术会议论文集. 哈尔滨: 中文信息处理学会, 2023: 501-511.

Rao X J, Zhang Y S, Jia Q L, e-t al. Chinese hate speech detection method Based on Ro-BERTa[C]//Proceedings of the 22nd Chinese Nati-onal Conference on Computational Li-nguistics, Harbin, China. Chinese Information Processing Society of China. 2023: 501-511.

34
Zhu W Z, Bhat S. GRUEN for evaluating linguistic quality of generated text[C]//Proceedings of the Findings of the Association for Computational Linguistics: EMNLP 2020. Stroudsburg, PA, USA: ACL, 2020: 94-108.

35
Li J W, Galley M, Brockett C, et al. A diversity-promoting objective function for neural conversation models[C]//Proceedings of the 2016 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies. Stroudsburg, PA, USA: ACL, 2016: 110-119.

36
Luo K, Liu Z, Xiao S T, et al. Landmark embedding: a chunking-free embedding method for retrieval augmented long-context large language models[C]//Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Stroudsburg, PA, USA: ACL, 2024: 3268-3281.

37
Xiao S T, Liu Z, Zhang P T, et al. C-pack: packed resources for general Chinese embeddings[C]//Proceedings of the 47th International ACM SIGIR Conference on Research and Development in Information Retrieval. New York: ACM, 2024: 641-649.

Outlines

/