综述

大语言模型幻觉的检测、归因与缓解技术综述

  • 樊骐瑞 ,
  • 叶麟 , * ,
  • 张宏莉 ,
  • 车万翔
展开
  • 哈尔滨工业大学计算机学部,哈尔滨 150000
叶麟()。

网络出版日期: 2026-05-06

基金资助

国家自然科学基金(62532016)

版权

版权所有©《网络空间安全科学学报》编辑部 2025

Survey on detection, attribution, and mitigation of hallucinations in large language models

  • Fan Qirui ,
  • Ye Lin , * ,
  • Zhang Hongli ,
  • Che Wanxiang
Expand
  • Faculty of Computer Harbin Institute of Technology, Harbin 150000, China

Online published: 2026-05-06

Copyright

Copyright ©2025 Journal of Aeronautical Materials. All rights reserved.

摘要

大语言模型凭借其出色的语言理解与生成能力在多个重要领域得到广泛应用。然而,受训练数据、学习目标与生成机制等因素影响,大语言模型的幻觉现象普遍存在,不仅对模型的输出准确性与决策可靠性构成根本性挑战,还严重制约其在高准确性要求领域的应用,已成为国内外研究者广泛关注的焦点。当前研究多集中于幻觉的检测、归因或缓解等单一环节,却未能在各环节间建立有效关联,以形成统一的治理流程,亦缺乏整体化的技术体系支撑。聚焦大语言模型幻觉治理技术,借鉴医学诊断与治疗的理念,以幻觉治理为导向构建新的综述框架,归纳梳理出涵盖“检测—归因—缓解” 3个步骤的幻觉治理流程及技术体系。该体系围绕大语言模型幻觉的现象分类、归因分析、检测数据集、检测方法及缓解策略5个维度,进行系统归纳与有机整合,形成层次化、关联化的治理技术框架,为大语言模型幻觉治理提供理论支撑。

本文引用格式

樊骐瑞 , 叶麟 , 张宏莉 , 车万翔 . 大语言模型幻觉的检测、归因与缓解技术综述[J]. 网络空间安全科学学报, 2025 , 3(6) : 19 -42 . DOI: 10.20172/j.issn.2097-3136.250602

Abstract

Large language models have been widely applied in numerous important fields due to their exceptional language understanding and generation capabilities. However, influenced by factors such as training data, learning objectives, and generation mechanisms, these models are prone to hallucination, posing a fundamental challenge to their output accuracy and decision-making reliability. This issue severely impacts their application in domains requiring high accuracy and has garnered extensive attention from researchers worldwide. Current research primarily focuses on isolated aspects of hallucination, such as detection, attribution, or mitigation, yet fails to establish effective interconnections among these aspects, resulting in a lack of a unified governance process and a holistic technical framework. Focusing on hallucination governance technologies for large language models, concepts and ideas from medical diagnosis and treatment are adopted to construct a new survey framework oriented toward hallucination governance. A hallucination governance process and technical system comprising three steps: "detection–attribution–mitigation" is summarized and organized. This system systematically summarizes and organically integrates five dimensions: phenomenon classification, cause analysis, detection datasets, detection methods, and mitigation strategies, forming a hierarchical and interconnected governance technology framework that provides a theoretical foundation for hallucination governance in large language models.

0 引言

大语言模型是一种基于深度学习的人工智能系统,其通过在海量文本数据上进行训练,学习自然语言的统计规律、结构特征和语义知识[1]。这类模型通常采用Transformer架构,利用自注意力机制处理词元序列,从而实现对上下文的长程依赖建模[1]。大语言模型的训练目标通常是通过预测下一个词[2]或掩码词[3],从而学习语言的泛化模式。当前,大语言模型的参数量可达千亿级别,展现出强大的零样本和少样本学习能力[4],其核心功能涵盖文本生成、语言理解、对话交互、翻译与摘要等。
大语言模型凭借其强大的语言理解和生成能力,广泛应用于各个领域,并已在多个重要领域展现出巨大的应用潜力与影响,其中包括医疗、法律等对准确性要求极高的行业。截至2025年5月,全球通用大语言模型累计用户已达数亿规模,其中ChatGPT(Chat Generative Pre-trained Transformer)生态系统每月活跃用户约为5.01亿,已有约67%的组织在业务中引入大语言模型辅助运营[5]。以医疗行业为例,美国约21%的医疗机构使用大语言模型来回答患者的问诊问题,另有约20%的机构部署了医疗聊天机器人以提供辅助服务[5]。在法律领域,约73%的律师表示,计划在未来一年内将生成式人工智能(Generative Artificial Intelligence,GenAI)应用于法律工作流程中[6]
在大语言模型广泛应用的同时,其生成内容中的幻觉问题对模型的输出准确性与决策可信性构成根本性挑战,被普遍认为是其迈向可靠应用的核心障碍。幻觉通常指大语言模型在缺乏可靠依据的情况下,凭空编造错误、不存在的信息,或输出与提示及上下文不符内容的现象。OpenAI在其2025年9月发表的论文Why Language Models Hallucinate中,将幻觉更精确地定义为“模型自信地生成不真实答案的情况”[7]。大语言模型幻觉产生的错误信息,正对专业决策、社会秩序及公众信任等方面构成现实且深远的危害。有研究报告指出,Google公司的Gemini模型和OpenAI的GPT-4(Generative Pre-trained Transformer 4)模型在医学研究场景下作为辅助工具时,其输出中25%~50%的参考文献为凭空捏造[8],这可能误导临床医生的决策、对患者做出错误指导,进而危害公共健康。在法律领域,2025年美国亚利桑那州联邦法院对一名律师处以罚款[9],因其提交的法律文书中包含19个人工智能生成的虚假案例引用,这些虚构案例干扰了正常的司法程序,不仅使该律师面临处罚,也削弱了人们对人工智能辅助法律工作的信任。更值得警惕的是,幻觉输出还有可能被别有用心者利用,不法分子可借此大量生成貌似权威、实则虚假的信息,通过社交媒体等渠道广泛传播,进而误导公众认知。由此可见,无论是日常问答还是专业领域,大语言模型产生幻觉的现象屡有发生,其影响不容小觑。因此,系统性研究大语言模型的幻觉问题,深入剖析其产生机理,设计有效的检测方法及缓解策略,对于构建安全、可信、可靠的人工智能生态,推动其负责任地融入关键领域,具有至关重要且迫切的现实意义。
从本质上看,幻觉并非简单的技术缺陷,而是根植于大语言模型统计学习本质和“训练−评估”范式的固有现象。相关研究表明,即使使用完美的训练数据,模型生成答案时的错误率也远高于其判断信息正确性时的错误率[7]。幻觉尤其容易在模型遇到长尾知识或孤立事实时发生,因为这些信息在训练数据中缺乏可学习的模式。值得注意的是,幻觉输出并非总是荒谬易辨;相反,它们往往具有高度的语言流畅性和表面合理性,使用户难以甄别其真实性,进而埋下信任与安全的隐患[10]
为系统应对大语言模型的幻觉挑战,国内外研究者已从多个维度展开广泛而深入的探索。在幻觉现象分类方面,研究者提出“内在幻觉与外在幻觉”[11]、“事实性幻觉与忠实性幻觉”[12]等分类框架,并进行更细粒度划分,以清晰刻画不同类型的幻觉现象。在归因分析方面,现有工作从不同角度系统剖析了训练数据噪声、知识覆盖不足、注意力范围限制、解码启发式偏差等多种幻觉归因。围绕幻觉检测与评估,研究者构建了诸如TruthfulQA[13]、FEVER(Fact Extraction and Verification)[14]、HaluEval[15]等一系列基准数据集,并设计了基于外部知识验证、模型内部知识自检及不确定性分析等的检测方法。在幻觉缓解层面,涌现了数据清洗、检索增强生成(Retrieval-Augmented Generation, RAG)、人类反馈强化学习(Reinforcement Learning with Human Feedback, RLHF)、知识编辑、提示工程等多种缓解策略。这些研究为理解与治理幻觉奠定了坚实基础,但多数工作侧重于单一环节的性能提升,未能形成协同治理的完整流程。现有综述[11-12,16-17]对上述5个维度进行了系统总结,全面归纳了大语言模型幻觉治理相关的分类与技术体系,但未能形成层次化、关联化的治理框架,无法为幻觉治理流程提供理论支撑。
针对现有研究的不足,本文借鉴医学诊断与治疗的核心理念,以幻觉治理为导向构建新的综述框架,归纳梳理出包含“检测—归因—缓解”3个步骤的幻觉治理流程。该流程首先通过观察数据集检测模型幻觉并确定其类型,进而利用拭子数据集定位幻觉产生的具体原因,最终根据归因结果匹配合适的缓解策略。为支撑该流程的有效实施,本文进一步整理出系统化的大语言模型幻觉治理技术体系。该体系将幻觉的现象分类、归因分析、检测数据集、检测方法及缓解策略5个维度有机整合,明确了各环节间的逻辑与指导关系,旨在实现从现象分类到根源诊断、再到精准干预的全链条治理。本文的主要贡献包括以下3个方面。
1)以幻觉治理为导向构建新的综述框架,全面归纳大语言模型幻觉治理技术体系;系统总结幻觉的现象与归因并建立对应关系,进而指导检测数据集、检测方法及缓解策略的归纳,层次化、全面化展示幻觉的核心要素,为幻觉治理流程提供坚实的理论支撑。
2)梳理出包含“检测—归因—缓解”3个步骤的幻觉治理流程:检测步骤评估幻觉倾向、确定幻觉类型;归因步骤锁定幻觉归因;缓解步骤匹配合适的缓解策略。该流程将原本分散的研究环节串联为目标明确、层层递进的治理路径,为系统化、可解释地缓解幻觉问题提供清晰的行动框架与方向指导。
3)引入拭子数据集概念并结合幻觉归因思想,通过设计针对性测试样本定位幻觉的具体归因,突破了现有基准仅能评估幻觉倾向、无法诊断其产生原因的局限,为后续选择最有效的缓解策略提供直接依据。

1 大语言模型幻觉治理流程与技术体系

1.1 问题分析

大语言模型幻觉问题已经引起学术界的广泛关注。现有研究通常围绕3个核心问题开展,即为何产生幻觉、如何检测幻觉以及如何缓解幻觉[18]
以幻觉检测问题为例,已有大量工作通过构建数据集对模型输出的真实性进行判断,进而量化幻觉的产生频率,评估模型的幻觉倾向。
例如TruthfulQA基准数据集[13]包含817个问题,覆盖38个类别,通过诱导模型产生“模仿性错误”并利用人工和经过微调的GPT模型进行检测,进而评估目标模型表现。
图1为TruthfulQA数据集中的一个问题示例,该问题的正确答案为埃隆•加诺,然而ChatGPT-3.5-turbo(Chat Generative Pre-trained Transformer 3.5-turbo)模型却回答埃隆•马斯克。
图 1 TruthfulQA数据集中一个问题示例

Fig.1 Example of aquestion from the truthfulqa dataset

虽然通过该问题能够判定模型出现了幻觉,但却无法辨识其具体归因。可能的产生原因包括但不限于以下几方面。
1)知识边界与长尾效应:模型的训练语料对埃隆•加诺等长尾知识覆盖不足,导致其表征缺失。当问答中触及此类知识时,模型无法给出正确答案,转而选用概率较高的实体进行回答,形成知识不完备下的概率性替代现象。
2)实体间的虚假相关性:在预训练数据中,埃隆与马斯克形成强共现关系。这种强共现关系会构建并激活模型中高权重的虚假关联路径,从而使正确答案的概率显著降低,导致模型输出一个看似合理但事实错误的关联实体。
3)训练目标偏差与解码策略缺陷:大语言模型的训练机制可能更偏好生成流畅且熟悉的文本,引导模型将流畅性置于准确性之上。同时,解码策略过度依赖局部词元概率[18],追求序列连贯而缺乏对全局事实一致性的校验,导致模型倾向于输出流畅但错误的答案。
由上例可知,尽管研究者针对幻觉的归因分析、检测方法及缓解策略分别展开了深入探索,并已形成清晰的认知框架、有效的评估工具及多样的干预方法。
然而,现有数据集侧重于通过结果正确性的判断评估模型表现,类似医生通过观察病人症状以初步判断病情,其优势在于能够快速筛查模型是否存在幻觉倾向,但无法精确定位幻觉产生的具体原因,因此在面对多种缓解策略时难以进行有效选择,制约了幻觉治理的精准性与效率。
现有研究的主要不足包括两大方面。
1)幻觉治理的检测、归因与缓解3个环节相互脱节,未能形成一体化的治理流程。当前研究大多以提高各自环节的性能为主要目标,而非以幻觉治理为最终导向。例如,幻觉检测研究偏向于更精准的倾向评估,幻觉归因分析侧重于更清晰的根源理解。尽管检测数据集能有效发现模型存在幻觉倾向,却难以诊断其具体归因;而归因分析虽能阐明幻觉机理,却无法直接指导应对策略的选择。三大研究方向独立发展,未能形成有效协同。这种“诊断”与“治疗”的脱节,使得治理过程效率低。
2)现有研究未能明确幻觉的现象分类、归因分析、检测数据集、检测方法及缓解策略5个关键维度间的映射关系与相互作用,尚未建立从现象到归因的溯源路径,亦缺乏从归因到缓解策略的映射逻辑,导致各个维度彼此孤立,无法为“检测—归因—缓解”这一完整的治理流程提供系统性理论支撑。
正如完善的医疗体系需要“诊断—病因分析—治疗”的紧密闭环,未来的幻觉治理也亟须构建将检测、归因及缓解三大研究方向深度融合的完整治理流程,并在此基础上对幻觉的5个关键维度进行归纳总结与有机整合,形成层次化、关联化的幻觉治理技术体系,为幻觉治理提供理论指导与技术支撑。

1.2 治理流程与技术体系

以医学“诊断—病因分析—治疗”流程为参考,临床实践不仅需要观察症状,更需通过化验、影像等检查手段明确病因,才能制定个性化治疗方案;大语言模型幻觉治理也需要类似思路。因此,本文以幻觉治理为导向构建新的综述框架,归纳梳理出包含“检测—归因—缓解”3个步骤的幻觉治理流程及技术体系,旨在系统梳理幻觉的现象分类、归因分析、检测数据集、检测方法及缓解策略5个维度间的内在联系,进而精准诊断幻觉产生的原因,为匹配最合适的缓解策略提供理论依据,为推动大语言模型生成内容的准确性与可靠性向更高水平发展提供系统性支撑。具体治理流程与技术体系如图2所示。
图 2 大语言模型幻觉治理流程与技术体系

Fig.2 Governance process and technical framework for hallucinations in large language models

正如医疗操作需建立在扎实的病理与症状学基础之上,针对大语言模型幻觉的治理也需建立清晰的分类与归因体系。因此,本文首先以幻觉治理为目标导向,对幻觉的类型及归因进行总结。本文采用“三违背”分类标准,将幻觉分为现实违背、提示违背、自身违背,以直观区分不同幻觉现象,同时明确幻觉类型与归因的映射关系,为后续数据集构建及检测方法设计提供依据。
在该治理技术体系中,检测数据集分为两类:观察数据集和拭子数据集。观察数据集功能类似于临床视诊,通过设计不同任务场景的问题检验模型是否产生幻觉,并确定幻觉种类,从而初步缩小检测范围。然而,此类基准仅能反映模型幻觉的“症状”,却无法定位具体病因,因此,本文进一步提出拭子数据集概念。拭子数据集类似于医学化验检查,需针对潜在归因设计问题,对模型内部机制进行定向采样。大语言模型幻觉可能源于训练数据噪声、训练目标偏差、解码策略缺陷等多个方面[18],因此可采用控制变量思想,通过调整任务场景、改变提示结构等方式构建针对性问题,精准定位幻觉归因。
医学检测中,拭子采样后需借助诊断仪器进行分析,本文提出的拭子数据集也需与相应检测方法配合使用。尽管不同类型数据集的检测目标各异,但其检测方法仍具共性。可采用外部知识比对、模型自评估等事实核查方法,也可利用模型行为、内部状态、概率分布、熵值等不确定性指标进行检测[12]。最后,根据检测出的幻觉归因,便可为大语言模型制定针对性缓解策略(类比医学诊疗中的开药方)。同类归因可能对应多种缓解策略,治理技术体系会从效果、成本及潜在负面影响等维度进行横向比较,以便选择最适合目标场景的缓解策略。
综上,本文构建的大语言模型幻觉治理体系,将幻觉现象分类、归因分析、检测数据集、检测方法及缓解策略5个维度有机结合,为大语言模型幻觉治理流程的各个步骤提供理论基础与实践指导。

2 幻觉的分类、归因与数据集

对幻觉类型、归因及检测数据集的深入梳理与关联分析,是连接理论认知与治理实践的基础,对后续检测方法及缓解策略的精准应用具有指导作用,也为幻觉治理流程中的检测与归因环节提供理论支持。
构建有效的幻觉治理技术体系,需要系统把握其核心要素,即幻觉现象分类、幻觉归因分析、幻觉检测数据集。本节将围绕这3个维度展开详细论述。

2.1 幻觉现象分类

为更清晰地描述幻觉现象,研究者提出了多种分类体系,其核心思想均是关注大语言模型生成内容是否偏离事实、提示及上下文。Ji等[11]将幻觉分为内在幻觉与外在幻觉。内在幻觉指大语言模型生成内容与给定上下文相互矛盾,如在摘要任务中篡改源文本信息;外在幻觉则指输出中包含无法从上下文推导或验证的信息。该分类体系强调生成内容与用户输入之间的关系。
在此基础上,Huang等[12]进一步提出事实性幻觉与忠实性幻觉二分类框架。事实性幻觉关注生成内容是否与客观世界及公认事实相符,包括大语言模型是否捏造不存在的信息或表达带有歧视偏见的内容等;忠实性幻觉则关注生成内容是否严格遵循用户指令及提供的上下文,可进一步细分为指令不一致、上下文不一致及逻辑不一致三类。其中,指令不一致指大语言模型回答偏离用户要求,上下文不一致则指大语言模型生成内容脱离输入背景,逻辑不一致指大语言模型生成内容前后矛盾。同时,还有部分分类体系与该二分类框架表现形式不同但本质一致,如Li等[19]将幻觉分为事实幻觉、忠实幻觉及逻辑不一致三类。综上所述,无论是内在幻觉与外在幻觉,还是事实幻觉与忠实幻觉,都将幻觉的根源归结为生成内容与某种参考之间的背离。
部分研究提出了更细粒度的分类,以便分析不同类型幻觉的分布及风险。例如,Mishra等[20]在构建FavaBench基准时,将幻觉分为6类,包括实体错误、关系错误、句子级错误、凭空捏造的信息、主观性描述及无法通过检索证实或反驳的不可验证陈述。前三类可用于精细化描述大语言模型对具体实体、语义关系或整个句子产生的事实性冲突。这种分类更关注信息粒度,有助于开发针对性检测方法。而HILT数据集则更细致[21],进一步引入取向、程度及类别对幻觉谱系进行三层刻画。首先,该数据集将幻觉分为Factual Mirage及Silver Lining两大取向,并在此基础上定义6种类别,即时间扭曲、首字母缩略词歧义、生成傀儡、虚拟声音、数值扰动及地理错误。同时,该方法通过轻度、中度及严重三档衡量幻觉的危害程度,类似于医学上对疾病严重程度的分级。虽然这些细粒度分类提供了更详细的维度,但其本质仍是针对生成内容偏离现实或背景的不同表现形式进行命名,逻辑上仍属于同一体系。
为此,本文基于Zhang等[22]的分类体系,构建面向大语言模型幻觉的“三违背”分类框架,具体示例如表1所示,表中答案均由ChatGPT-4o模型生成。第一类为现实违背幻觉,指模型输出与客观事实及通用常识冲突,也包括夸大、捏造事实及歧视偏见等情况。第二类为提示违背幻觉,指模型输出偏离用户提供的提示及背景。提示违背幻觉可进一步分为指令违背幻觉及背景违背幻觉。前者指模型未遵守指令中的要求;后者指模型输出与提示中给定的背景知识矛盾。第三类为自身违背幻觉,指模型在同一段回答或对话中自相矛盾,属于逻辑不一致的表现。
表 1 幻觉分类示例

Table 1 Hallucination taxonomy examples

幻觉类型 问题 回答 解析
现实违背 曹操《观沧海》一诗中东临碣石的下一句是什么 《观沧海》是曹操的著名诗作之一,但“东临碣石”并不是该诗中的一句 “东临碣石”为《观沧海》一诗的开头,下一句为“以观沧海”,模型输出与现实大相径庭,是典型的“现实违背”幻觉
提示违背 指令违背 请撰写5000字短文描述曹操这一历史人物 曹操(155年-220年),字孟德,一代
枭雄,历史上既是一位出色的军事家、
政治家,也是一个充满争议的历史人物···
指令明确要求字数为5000字,但模型最终输出为2500字,不符合指令要求,是典型的指令违背幻觉
背景违背 根据以下背景故事回答问题:在另一个平行时空中,关羽在华容道并没有义释曹操,而是严格执行了军令,将曹操斩杀。请问,在这个故事里,曹操最终是如何死的 曹操是在建安二十五年(公元220年)于洛阳病逝的 模型忽略了提示中的假定背景信息,仍以真实历史情节进行回答,是典型的背景违背幻觉
自身违背 (1)曹操长子曹昂死于哪场战役?
(2)曹操长子曹丕的谥号是什么
(1)曹操长子曹昂死于宛城之战。
(2)曹操长子曹丕的谥号是“文皇帝”
在两轮对话中,模型先认为曹昂是曹操长子,后又认为曹丕是曹操长子,自相矛盾,是典型的自身违背幻觉
本文提出的三违背分类体系具有三大显著优势。第一,该分类基于违背的直观概念,将幻觉的核心问题统一为错误出现于何处。现实违背关注世界知识,提示违背强调输入约束,自身违背则考察推理链条的自洽性。第二,该体系与本文的技术体系紧密耦合,在观察数据集构建阶段,可依据该分类体系设计问题,分别评估模型的事实准确性、指令遵循能力及推理一致性,进而初步缩小检测范围。第三,该分类体系还可为幻觉归因总结、观察数据集及检测方法的分类整理提供标准,在大语言模型幻觉治理技术体系中发挥重要指导作用。

2.2 幻觉归因分析

幻觉归因既能借助幻觉分类体系进行划分,缩小检测范围,也为后续针对性拭子数据集构建及缓解策略选择提供理论依据。
现有研究对幻觉归因的分析已形成较为清晰的框架,例如,Huang等[12]参照大语言模型开发流程,按数据、训练及推理3个阶段总结幻觉归因;Liu等[16]从系统层次出发,将幻觉归因于数据层、模型层及应用层。此类分类框架有助于对幻觉归因形成清晰认知并展开深入分析。
值得注意的是,幻觉归因与幻觉类型之间并非简单的一一对应关系,而是一种多对多的复杂映射,单一归因可能同时导致多种幻觉;同一类型幻觉也可能源于多种归因。现有分类框架无法体现这种复杂的映射关系,若按幻觉类型对归因进行硬性分类,反而容易模糊其与具体现象间的多元关联,降低治理技术体系的可操作性。因此,本文采取更为灵活实用的策略,首先设计分类框架,对各类幻觉归因进行系统介绍;其次通过表格形式,详细呈现归因与幻觉类型间的对应关系。
为全面剖析幻觉产生的根源,本文基于既有研究成果,采用分层式归因分类框架,将幻觉归因归纳为数据层、模型层及应用层3个层面。数据层归因着重关注模型训练语料及知识源自身存在的问题,如数据质量存在缺陷、知识覆盖范围不够全面;模型层归涉及模型内部结构、训练目标及推理机制等方面的局限性,如训练目标出现偏差、记忆检索失败;应用层归因则包含模型在实际使用环境中与外部系统交互时产生的影响因素,如训练及测试的数据分布不一致、工具调用存在误差等。借助这一分层框架,本文能够系统性地涵盖从数据获取到模型构建,再到应用部署各个环节中可能引发幻觉的因素,并据此开展有针对性的归因分析。

2.2.1 数据层幻觉归因

数据层幻觉归因主要源于模型训练数据的固有问题。大语言模型借助大规模语料来学习知识,故而训练语料的质量与完备程度直接影响着模型知识的准确性。下面将着重介绍数据层的几种典型幻觉归因。
训练数据噪声与偏差:大语言模型的预训练数据[23]中可能包含错误信息、陈旧知识及偏颇观点[24-25]。当大语言模型在有噪声的数据中学习时,会不经意地记忆[26]并放大[27-28]不准确的内容,并在生成时复述相应的错误,产生所谓模拟错误的幻觉[13]。另外,训练数据中的社会偏见也会内化到大语言模型中,使其输出带有性别、种族等偏见的歧视信息。
数据虚假相关性[29]:大语言模型在训练时可能学会依赖表面统计相关性来回答问题,而非真正理解概念间的因果或逻辑联系。这种“知识捷径”体现在模型根据词语的共现频率来猜测答案。这类虚假相关性导致模型生成内容看似流畅但事实错误,属于典型的幻觉现象。
知识覆盖不足:大语言模型的训练语料无法覆盖最新动态信息及部分专业领域知识,因此模型存在知识边界。当提问超出知识覆盖范围时,模型往往会凭空编造答案来响应指令[30]。该归因包括两种常见情况:其一为领域知识缺失,大语言模型缺乏某些专业领域的训练数据,在相关问题上易产生幻觉;其二为时效知识滞后,大语言模型的训练知识存在时间截断,对于训练后发生的事实会因缺乏记忆而编造。
综上所述,数据层存在的缺陷会从根源上对模型表征现实世界的质量产生影响。训练数据若不准确或不完备,易使模型习得错误信息或形成错误关联,进而为后续生成幻觉内容埋下隐患。因此,提升训练语料的质量及覆盖面是降低幻觉发生率的基础举措之一。

2.2.2 模型层幻觉归因

模型层幻觉归因源自模型自身在训练及推理过程中存在的局限与偏差。即便提供高质量数据,模型的训练目标、结构机制及对知识的存储与利用方式,仍会对输出的可靠性产生显著影响。下面将对模型层的主要幻觉归因进行总结。
训练目标偏差:当前大多数大语言模型在自回归语言模型框架下训练,即通过选取高概率下一词来生成文本。该训练目标注重提升文本的连贯流畅度,却忽略内容的真实性验证。因此,当模型面对不确定的问题时,仍会依据统计惯性给出一个貌似合理的猜测,以保证句子通顺[7]。大语言模型无内置的事实核对机制分辨真伪,从根本上为幻觉的产生埋下隐患。
教师强制策略与暴露偏差:大语言模型训练时普遍采用教师强制策略,即让模型在每一步均以正确的下一词为条件进行学习。而实际生成时,模型需以自身生成的词作为下一步输入,这种训练与使用条件的不匹配会导致暴露偏差[31-33]。其后果是一旦模型在生成序列的早期出现细微错误,后续步骤会持续偏离,错误会不断累积[34]。由于缺乏让大语言模型在生成过程中反省前文或纠正错误的机制,早期的小偏差最终会造成严重幻觉,使输出内容与事实严重不符。
注意力范围限制:基于Transformer架构的大语言模型在处理长文本时[1],其注意力机制往往更关注最近的词句,可能遗忘开头提到的信息。随着上下文长度增加,模型对前文的记忆逐渐衰减,甚至被后文新信息覆盖。这种注意力的局部性导致模型生成的回答可能脱离先前提供的背景,与原始上下文不一致,从而形成幻觉[35-36]。此外,注意力在长序列上分布“稀释”也会降低模型对全局信息的把握。
Softmax分布瓶颈[37]:大语言模型生成词语分布时使用的Softmax函数,可将隐藏层输出映射为词汇表的概率分布。然而,当有多个候选词具有相近的高概率时,Softmax会强制模型以概率高低进行选择,无法精确处理多个词都合理的情况,可能导致模型忽略同样正确甚至更加恰当的选项,进而引发内容失真。
随机采样策略不确定性:为避免每次生成刻板的高概率答案,大语言模型在推理阶段常采用随机采样来增加多样性[38-39]。随机采样在带来创意的同时,也会引入输出不确定性。当温度较高或采样范围较广时,模型更可能从概率分布的尾部选出罕见词汇或不相关内容[40-41],导致输出风格多变甚至离题,出现前后文不符或事实错误的幻觉。当多次回答同一问题时,随机采样还可能令模型每次给出自相矛盾的内容,暴露其答案的不可靠性。
对齐训练中的能力错配:在对齐阶段,对齐数据[42]可能要求模型执行超出其原始能力范围的任务[43]。若让模型生成超越其知识储备或推理能力的答案,模型为迎合要求进行编造,会使幻觉频率上升[44]
对齐训练中的信念错配:对齐阶段的另一个问题是模型的“信念”可能被训练得不追求真相,转而迎合人类偏好[45],即模型倾向于输出讨好用户或审核者的不正确答案[38]。信念错配往往源于基于人类反馈的强化学习训练,模型从人类反馈中习得用户偏好,就可能违背事实去满足这种预期。因此,模型即使“知道”正确答案,也可能因迎合心理而给出失实回应。
参数记忆回忆失败:大语言模型在预训练阶段利用参数记忆了大量知识,但对于长尾知识或需要复杂推理整合的信息,模型可能检索不出相关记忆[7]。记忆提取失败会导致模型凭借有限的相关片段拼凑错误回答。该情况在回答冷门实体、组合查询或推理链较长的问题时尤为突出,模型无法回忆正确知识点,或在多跳推理中丢失部分约束,最终输出与事实不符的内容。
除此之外,推理能力不足及解码启发式偏差也会导致模型产生幻觉。推理能力不足指大语言模型在算术运算、多跳推理及逻辑约束等方面存在先天能力缺口,这使模型即使掌握相关事实,在组合推理时也易出现自相矛盾的情况,最终生成前后逻辑不一致的幻觉内容[46]。解码启发式偏差则表现为模型在生成时过度依赖局部词元概率以追求序列连贯,却缺乏对全局事实一致性的校验,从而倾向于输出表面流畅但实则错误的答案[47]
综上,模型层幻觉归因揭示了大语言模型在训练目标设定、内部机制等方面存在的不足。因此,改进训练范式、完善模型结构并合理进行对齐调优,对于减少幻觉现象至关重要。

2.2.3 应用层幻觉归因

应用层幻觉归因指模型在部署及使用过程中,由外部环境及交互方式导致的各类问题。当大语言模型脱离原始训练分布,投入真实应用场景时,各类系统层面的因素均可能引发幻觉。
应用层幻觉归因主要包括训练及测试数据分布失配、检索链条误差、跨模态感知失真及模型压缩、蒸馏与量化等。训练及测试数据分布失配使模型在陌生领域或输入分布变化时,沿用训练期的相关性模式进行外推,在关键信号缺失时倾向经验性补全甚至编造答案[48]。引入外部工具时,检索链条误差(如召回不足、排序偏差、证据—回答对齐失败及函数调用参数错误)会导致模型忽略可用证据或在无证据时强行生成,形成有凭据不用或无凭据编造的幻觉[49]。在多模态场景中,跨模态感知失真(如OCR(Optical Character Recognition)/ASR(Automatic Speech Recognition))往往在语言生成阶段被放大,出现对不存在对象或事件的叙述[47]。为满足部署效率而进行的模型压缩、蒸馏与量化,会降低内部表示精度与置信校准,尤其在知识密集及细粒度问答任务中更易引发事实性错误[50]
总体而言,模型在应用层面的行为受到实际环境及使用策略的强烈影响。若训练及使用情境差别过大、外部检索信息未能正确利用或跨模态输入存在偏差,模型则更易产生不可靠回答。为降低应用层引发的幻觉,需针对具体场景采取措施,如缩小训练及应用数据差距、提升检索及工具使用的准确性、加强多模态信息校验等。
综上所述,大语言模型生成内容的幻觉问题源于数据、模型及应用3个层面的多重因素。数据层的缺陷为模型注入了源头性噪声与知识盲区,模型层的机制局限则使模型在学习及推理过程中难以始终保证事实准确与逻辑一致,而应用层的外部交互与部署环境进一步加剧了生成内容偏离真实的风险。该分层归因框架准确揭示了大语言模型幻觉形成的内在机理。同时,上述归因与幻觉类型的详细对应关系如表2所示。
表 2 幻觉类型与归因映射

Table 2 Mapping between hallucination types and their root causes

幻觉归因类型 幻觉归因 现实违背 提示违背 自身违背
背景违背 指令违背
数据层 训练数据噪声与偏差
数据虚假相关性
知识覆盖不足
模型层 训练目标偏差
教师强制策略与暴露偏差
注意力范围限制
Softmax分布瓶颈
随机采样策略不确定性
对齐训练中的能力错配
对齐训练中的信念错配
参数记忆回忆失败
推理能力不足
解码启发式偏差
应用层 分布失配
跨模态感知失真
压缩、蒸馏、量化、退化
检索链条误差
本文提出的幻觉归因总结体系具有两方面显著优势。首先,该体系中幻觉归因与3种幻觉类型形成了清晰的对应关系,可在通过观察数据集初步识别幻觉类型后,迅速聚焦可能的归因方向,大幅缩小后续精细化检测的范围,提升诊断效率。其次,本文采用分层框架系统梳理幻觉归因,条理清晰、机制明确,不仅为构建高针对性拭子数据集提供了直接理论依据,而且可有效指导缓解策略的归纳与总结,进而支撑大语言模型幻觉治理技术体系的构建,增强幻觉治理的整体性与可操作性。

2.3 幻觉检测数据集

针对大语言模型幻觉治理需求,本文将数据集按用途分为观察数据集及拭子数据集两类。观察数据集以评估模型幻觉倾向、识别幻觉具体类型为主要目标,其题型通常针对幻觉类型设计,通过构建大量测试题目,检测模型是否出现事实错误、提示偏离或逻辑矛盾等现象,进而初步评估模型幻觉表现并缩小后续精准检测的范围。与之相对应,拭子数据集则旨在精准检测幻觉产生的内在归因,其题目围绕训练数据噪声、解码启发式偏差、检索链条误差等具体幻觉归因构建,通过控制变量思想开展针对性测试,实现对不同幻觉归因的识别,进而为后续匹配相应缓解策略提供依据。
目前,面向归因诊断的拭子数据集仍处于初步探索阶段,规模有限且覆盖不全。因此,本文系统梳理现有广泛使用的观察数据集,并依据“三违背”的幻觉分类框架对其进行归类与介绍,以期为未来构建更完善的拭子数据集提供参考与依据。观察数据集具体分类情况如图3所示。
图 3 观察数据集分类

Fig.3 Classification of the observation dataset

2.3.1 现实违背幻觉检测数据集

现实违背类幻觉检测数据集侧重于检测模型在无提示信息或仅有有限背景信息的情况下是否会输出背离现实的错误内容。早期研究中,Azaria和Mitchell[51]构建了True-False数据集,涵盖动物、城市、公司、元素、事实及发明6个子集,每个子集包含等量的真假陈述,用于考察模型的基础事实判断能力。Bürger等[52]随后提出LogicStruct数据集,在True-False数据集的基础上引入肯定、否定、逻辑合取及析取4种句法结构,并跨越动物、城市、发明等6个主题构建24个子集,进一步增强了对模型基础事实判断能力的评估。然而,二者均以陈述判断题型为主,难以评估开放问题场景下模型的幻觉倾向。
为此,TruthfulQA数据集[13]设计了817个开放域问题,覆盖38个类别,通过诱导性提问,检测模型是否会沿袭人类误解而生成不真实答案,是目前使用最广泛的现实违背类幻觉检测数据集之一。实验表明,即使是表现最好的模型,在该数据集下的真实率也仅有58%,说明现实违背类幻觉仍然普遍存在。随着实际应用中开放问题与复杂问答需求的激增,该类数据集数量逐步增长。HaluEval数据集进一步扩大了问题规模,收集了约5000条用户提出的通用问题及30000条特定任务问题,由ChatGPT模型生成回答后,通过人工两阶段筛选标注,统计显示约19.5%的回答包含无法验证的信息。HaluEval 2.0数据集[18]将原数据集扩展为8770个跨生物医学、金融、科学、教育及开放域的问题,用以比较模型不同训练阶段的幻觉情况。数据集规模不断扩大的同时,也在向着细粒度化的方向发展。
FavaBench数据集[20]在3个模型输出的基础上提供约1000条细粒度人工注释,涵盖实体错误、关系错误、主观描述及无法验证信息等多种类别,并训练出检索增强模型FAVA,实验结果表明,FAVA在细粒度幻觉检测及纠错方面显著优于GPT-4模型。FactCHD数据集[53]侧重于检测事实冲突类幻觉,其涵盖常规、多跳、比较及集合运算等多种模式,并集成证据链以支持深度解释,同时提出Truth Triangulator方法,结合反思策略及LoRA微调提升检测效果。HaDeS数据集[54]构建了一种无需参考基于词元级别的幻觉检测数据集,通过扰动维基百科片段并利用众包标注,为微观层面识别幻觉提供了新途径。HILT数据集[21]利用15个大语言模型生成75000条样本并进行人工标注,同时引入“取向”“程度”“类别”,对幻觉谱系进行三层刻画。该基准数据集覆盖广泛,适用于评估模型在不同事实错误类型上的脆弱性。

2.3.2 提示违背幻觉检测数据集

提示违背类幻觉检测数据集主要用于评估模型是否严格遵循用户指令及给定背景信息,其典型任务形式包括知识支撑型问答、文本摘要及多轮对话等,该类数据集通常提供外部证据作为幻觉评估的参考依据。
FEVER数据集[14]是该类数据集中的典型代表,其包含185445条基于维基百科句子改写生成的断言及其对应证据。其任务要求模型首先从给定知识库中检索相关证据,进而依据证据判断断言是被支持、被反驳,还是因信息不足无法判断。在此设定下,若模型在决策过程中未能利用检索到的证据对断言进行正确判断,则构成对背景信息的违背,即表现为提示违背幻觉。类似地,DialFact数据集[55]面向开放域对话场景,收集22245条对话回复并为其中陈述匹配维基证据,通过让模型利用已有证据判断回复真实性,可检验模型能否正确使用背景信息,进而评估模型提示违背类幻觉的倾向。二者均要求模型依据证据判断给定命题是否正确,但随着检索增强生成技术的普及及复杂任务的出现,部分数据集要求模型根据提供的背景知识生成答案或摘要,借此评估模型产生提示违背类幻觉的倾向。
针对检索增强生成场景,RAGTruth数据集[56]收集近18000条模型回答并在案例及词元层面标注幻觉程度,以判断模型是否根据检索到的信息生成答案,该工作还支持训练轻量检测模型用于识别大语言模型检索幻觉,且效果良好;ANAH数据集[57]则在4300个问答对的基础上提供12000个句子级注释,标注每句话的检索片段、幻觉类型及修正内容。针对不同任务场景,FRANK数据集[58]通过人工定义的详细错误类型,对2250篇模型生成摘要进行逐句一致性标注,该数据集能够检测信息遗漏、篡改及逻辑错误,成为摘要忠实性评估的重要基准;OpenDialKG-Eval数据集[59]将知识图谱支撑的对话转化为402条由GPT-4模型回答的样本,并通过众包标注其是否完全由历史对话及知识支撑,若模型在回答中引入无关信息或遗漏关键信息,即可判定为提示违背类幻觉。
在多轮对话方面,DiaHalu数据集[60]将忠实性幻觉细分为内在不连贯、无关回答及过度依赖背景三类,并涵盖知识型、任务型、闲聊及推理四类多轮对话任务,其数据由两个大语言模型生成并经人工修正,该数据集可用于检测模型在多轮交互中是否偏离用户意图;在法律领域,DetectorEval数据集[61]源自HalluDetect系统,由115组平均包含7.39轮的法律咨询对话组成,每条回复均由专家标注是否存在幻觉,其能够评估模型在专业领域对话中是否违背规范或忽略用户需求。在复杂查询及多跳推理场景中,MultiHop-RAG数据集[62]将查询类型分为推理、比较、时序及无法回答四类,以此检验模型是否准确理解问题约束并严格依据检索证据回答。
同时,也有诸多针对指令违背类幻觉构建的数据集,例如SelfAware数据集[63]包含1032个不可回答问题及2337个可回答问题,要求模型在无答案时表明不知道。若模型忽视提示中“若不知道,可不回答”的要求而强行回答,即属于指令违背类幻觉;MultiHoax数据集[64]则要求模型在发现错误前提时主动拒绝回答,未能满足该要求则视为指令违背类幻觉。这些基准数据集为复杂语境下的指令遵循与背景忠实性评估提供了重要资源。

2.3.3 自身违背幻觉检测数据集

自身违背类幻觉检测数据集致力于检测模型输出内容内部的逻辑一致性,尤其关注模型在生成长文本或多轮对话过程中出现的自相矛盾现象。由于逻辑一致性难以直接度量,此类基准数据集相对稀缺,其构建通常需结合复杂推理或长程依赖任务以识别前后冲突。
在对话一致性检测方面,DiaHalu数据集[60]引入推理幻觉类别,用于标注模型在多轮对话中出现的推理链条断裂或结论前后矛盾等现象。DetectorEval数据集[61]及OpenDialKG-Eval数据集[59]也提供了包含完整历史的多轮对话样本,可用于分析模型是否在不同轮次对话中自我矛盾。
多跳推理任务本身包含逻辑链条,HotpotQA[65]、2WikiMultiHopQA[66]及MuSiQue[67]等数据集要求模型综合多个信息源进行多跳推理,若模型遗漏关键中间步骤或连接错误,导致最终答案与中间事实矛盾,则属于自身违背类幻觉。类似地,MultiHop-RAG数据集[62]及MultiHoax数据集[64]也通过设计包含错误前提的复杂查询,考察模型能否在推理全程保持逻辑一致;若模型基于错误前提得出无效结论,同样反映出其内部逻辑的失衡。
此外,部分研究者还提出了专门的历史人物对话及人物属性一致性数据集,这些小规模基准数据集通过设定人物背景及角色信息,观察模型在对话中是否维持人物设定。此类数据集虽规模有限,但为自身违背类幻觉检测数据集的发展提供了方向。
综上所述,现有观察数据集已覆盖从开放域问答到多轮对话、从单跳事实检索到多跳推理的多种场景,并可根据幻觉现象分类,分别评估模型在事实正确、提示遵循及逻辑自洽方面的能力。其中,陈述正误判断与文本摘要等典型任务题型为拭子数据集的构建提供了重要启发。
面向当前拭子数据集匮乏的现状,本文提出其构建应遵循的3个核心原则。
首先是题型的高度针对性与控制变量思想。数据集需紧密围绕特定幻觉归因设计题型,以建立从现象到归因的精确映射关系。例如,为检测知识覆盖不足,应设计涉及模型训练截止日期之后的新事件或极其冷门实体知识的问题;而为检测解码启发式偏差,则需构造在事实性与创造性之间存在张力、易诱发模型为追求流畅而牺牲真实的创意性问答。以Kalai等[7]构建的幻觉检测数据集为例,该数据集涵盖任意事实查询任务(如个人生日、博士论文标题等稀疏事实查询)、字符计数任务、二进制评分强制输出任务等差异化题型,实现了对知识覆盖不足、模型结构局限及推理能力不足、评估机制诱导等特定归因幻觉的检测,有效揭示了题型针对性设计与控制变量思想在精确诊断幻觉归因中的核心作用。
其次是数据集的逻辑严密性。为确保归因准确,必须超越单一问题,为每个数据集中的问题构建一个包含对照机制的微型问题集。例如,在检测训练数据噪声与偏差时,需对同一事实设置一正一反的布尔问题对进行交叉验证;同样,在检测知识覆盖不足时,需先提问模型训练截止期前的已知事实作为基线,唯有当模型能正确回答基线问题、却在相关未知问题上编造时,才能将幻觉稳健归因于知识边界问题。这实质上是将科学实验的控制变量思想再次应用于数据集构建。
最后是检测的协同性与系统性。鉴于大语言模型的幻觉往往是多因素交织作用的结果,单一的拭子数据集难以完成全面的归因检测。因此,需构建一个覆盖数据、模型、应用各层归因的拭子数据集族,通过联合使用多种针对性数据集,从不同维度对模型进行交叉检验,进而系统性缩小归因范围,最终实现从可能归因集到主导归因的精准定位,为后续选择最有效的缓解策略提供坚实依据。Bang等[68]构建的HalluLens幻觉检测数据集,包含PreciseWikiQA、LongWiki、HHEM leaderboard及ANAH 2.0等多个任务子集,初步形成了覆盖多种幻觉归因的检测数据集族。虽然各子集间仅为并列关系,缺乏深层的任务协同性,但也为拭子数据集族的构建提供了基础思路。
综上,从高度针对性的题型设计,到逻辑严密的微型问题集构建,再到系统性的数据集族协同,面向归因的拭子数据集构建思路已逐渐明朗。这标志着大语言模型幻觉治理的研究范式,正从对“症状”的被动观察,迈向对“病因”的主动诊断。
作为连接“检测”与“缓解”两大环节的核心桥梁,拭子数据集的成熟与发展,将为构建层次化、可解释的幻觉治理技术体系奠定坚实基础,最终推动大语言模型在关键领域实现更安全、更可靠的应用。

3 幻觉检测方法与缓解策略

3.1 幻觉检测方法

检测方法在幻觉治理过程中发挥着重要作用,它既要基于观察数据集判断模型输出是否偏离客观事实、用户提示或自身逻辑,以评估模型的幻觉产生倾向;也需结合拭子数据集深入定位幻觉的具体归因,从而为后续精准匹配缓解策略提供依据。现有研究通常将检测方法划分为事实性幻觉检测与忠实性幻觉检测两大类别。然而,这种分类方式在应用中容易出现方法重合与界限模糊的情况。为了更好地对检测方法进行研究,本文依据幻觉检测时所依赖的验证资源类型,将检测方法划分为三类:基于外部信息源的检测方法、基于模型内部知识的检测方法,以及基于模型行为与内部状态的检测方法。该分类方式不仅涵盖已有方法体系,也更有利于检测方法同观察数据集和拭子数据集结合,推动幻觉检测从现象评估走向机理分析,检测方法具体分类情况如表3所示。
表 3 检测方法分类情况

Table 3 Classification of detection methods

检测方法类型代表性方法优势局限
基于外部信息源的检测方法FACTScore:原子事实分解与验证结果可靠、可解释性强、对长文本、多事实场景检出率高严重依赖检索质量与知识库覆盖度;计算开销大,实时性差;无法用于缺乏外部知识的场景
FacTool:多源统一事实核查
NLI模型/分类器:矛盾识别
LLM评估器:提示LLM进行一致性判断
基于模型内部知识的检测方法验证链:生成并回答自省问题不依赖外部资源,适用性广、可探测模型的内部信念状态效果受限于模型自身知识的完备性;概率输出可能未校准,置信度不可靠;可能放大模型固有的偏见和错误
概率自评估:询问模型自身置信度
概念熟悉度:通过生成概率衡量知识掌握度
LLM评估器:判断与内部知识是否矛盾
基于模型行为与内部状态的检测方法语义熵:多次采样的语义一致性基于模型行为的检测方法适用于黑盒模型API、部分方法可实现实时检测、从模型生成机制根源提供通用信号对高置信度输出的错误难以检测;行为一致性方法计算成本较高;信号与幻觉的因果关系非绝对
交叉质询:模型间多轮追问
不确定表达一致性:高效黑盒检测
转移解码:主动探测信念强度
实时探针:词元级幻觉分类器

3.1.1 基于外部信息源的检测方法

基于外部信息源的检测方法通过引入外部知识或利用输入提示中的背景信息,对模型输出进行事实核查与一致性验证,是目前应用最广泛的检测方法之一。
针对现实违背类幻觉,需将模型回答与从权威知识库中检索到的证据进行比对,然而当模型回答规模较大时,对比操作较为困难。因此,Min等[69]提出了FACTScore方法,将长文本输出分解为若干原子事实并逐一验证,以支持率衡量整体真实性。该方法解决了长文本整体评估困难的问题,但仅依赖单一检索工具和信息源,难以覆盖广域事实。Chern等[70]随即整合多个权威信息源并集成多种外部检索工具,构建了统一事实核查框架。利用该框架识别生成答案中的不实陈述,大幅提高了检测的可靠性。研究者发现仅通过问题进行检索往往难以精准找到所需证据,因此Huo等[71]提出通过将输入问题与模型输出答案拼接进行扩展检索,缓解因语义偏移导致的检索失效问题。此类方法依托外部权威知识库实现精细校验,在长文本、多事实场景下的检出率较高;但其效果严重依赖检索质量与知识库覆盖范围,在事实缺失或信息不足时性能下降,且多轮检索与验证过程计算开销较大,难以适用于实时交互场景。
在提示违背类幻觉的检测方面,只需将模型回答与输入的提示进行比对即可。早期方法多采用n-gram重叠指标,但此类粗粒度指标难以捕捉细微的偏差。因此,研究者引入了关注更关键信息单元的指标,如实体重合率[72]、关系重合率[73]等。该方法实现简单、直观高效,可用于大规模评估,但仅能发现显性不一致,无法理解语义层面的隐含差别。为更好地捕捉隐含偏差,研究者先从模型输出中选取若干关键信息片段作为答案,再利用自动问题生成技术为每个答案构造问题;随后利用问答系统或大语言模型本身在源文本中寻找这些问题的正确答案,最后将源文本给出的答案与模型输出中的目标答案进行比对,若匹配率高则说明输出未违背提示。该方法可发现语义上的偏差,但其步骤较为烦琐,不易实施。
同时,研究者利用自然语言推理(Natural Language Inference,NLI)模型或专用分类器判断生成内容是否与提示或检索到的外部证据矛盾[74],直接利用自然语言蕴含数据或事实核查数据微调分类器,使其学会识别输出与源文本的不一致之处。此类方法准确率较高,但训练成本较大,且模型缺乏可解释性,无法指明矛盾具体之处。当然,也可选用大语言模型作为评估器,通过设计提示要求其对比源文本与生成内容并判断二者是否相互矛盾。

3.1.2 基于模型内部知识的检测方法

当无法依赖外部知识或提示时,基于模型内部知识的检测方法通过激发模型自身的知识储备与推理能力,对生成内容进行自我审视与验证。这类方法的核心在于利用模型参数中已编码的丰富信息来识别其输出内容的不一致性。
该类方法中具有代表性的思路是引导模型对自身生成的内容进行交叉验证。例如,Dhuliawala等[75]提出的验证链方法,让模型围绕其初始回答生成一系列验证性问题,然后利用自身知识回答问题,通过检查答案之间是否存在矛盾来识别初始回答中的错误。这种方法将模型的内部知识以一种结构化、自省的方式用于幻觉检测,但其验证效果严重依赖于模型生成高质量、高相关度问题的能力,且多轮问答会显著增加计算开销。
为了更直接地量化模型对其回答的信心,研究者提出了基于概率的自我评估方法。Kadavath等[76]和Zhang等[34]通过设计特定的提示,要求模型直接输出其回答为真的概率,或对“上述陈述是否正确”等对抗性问题做出判断。这种方法将模型的置信度作为一个直接的幻觉信号,实现简单。然而,大量研究表明,语言模型的概率输出往往未经校准,可能存在系统性过度自信或自信不足的问题,尤其是在面对对抗性提问时,其自我评估的准确性可能进一步下降。
在提示违背与自身违背类幻觉检测中,当前的研究也广泛采用大型语言模型本身作为评估器,通过设计精细的指令或链式思考提示,要求模型判断生成内容与源提示或上下文之间是否存在矛盾。这类方法在特定任务上展现出与人类判断相近的性能,但其效果直接受制于模型自身的指令遵循能力、知识边界和内在偏见。若模型自身存在对某些知识的错误记忆或对指令的理解偏差,其评估结果的可信度也会被削弱。
总体而言,基于模型内部知识的检测方法不依赖外部检索,在缺乏外部知识场景下具有独特优势。然而,其效果从根本上受限于模型自身的知识完备性与判断可靠性,模型固有的错误和偏见可能在此过程中被放大,导致漏报或误报。因此,这类方法通常作为其他检测方法的有益补充,共同构成更稳健的检测方法体系。

3.1.3 基于模型行为与内部状态的检测方法

基于模型行为与内部状态的检测方法不直接核查知识本身,而是通过分析模型在生成过程中的不确定性表现、内部激活状态或多次行为模式等“元信号”,来间接识别潜在的幻觉。其中,基于模型行为的检测方法在黑盒模型或无法获取完整概率分布时尤为有用。
最直接的途径之一是分析模型输出阶段的内部状态信号,如词元概率或序列熵。Varshney等[77]通过测量生成文本中关键概念或实体对应的最小生成概率,来判断模型对该内容的信心程度,若该概率极低,则认为模型可能是在猜测,缺乏事实依据。类似地,Yao等[78]则从对抗攻击的视角出发,通过梯度扰动构造对抗性提示诱导模型出错,并通过对比正常提示与对抗提示下模型生成首词元的熵值差异来检测幻觉。这类方法为理解模型生成的不确定性提供了可量化的视角,但其通常需要完全访问模型的输出逻辑单元,且对于模型高置信度输出的错误难以生效。
当无法访问模型的内部概率分布时,一种有效的替代方案是进行行为一致性检测。这类方法基于一个核心假设:当模型陈述事实时,其多次生成的回答在语义上应是稳定一致的;而当产生幻觉时,则容易因内在不确定性而出现前后矛盾。Farquhar等[79]提出的语义熵方法对此进行了探索,通过对同一问题多次采样生成不同措辞的回答,并进行语义聚类和熵值计算,来度量模型的不确定性。Agrawal等[80]则模拟了调查访谈的场景,通过间接提问、追问细节等开放式问题引导模型多次透露信息,并进行交叉验证。更进一步,Cohen等[81]借鉴法律领域的交叉质询,设计让一个大语言模型扮演审问者,对另一个回答者模型进行多轮追问,以揭露其回应中的逻辑矛盾或事实错误。这些方法无需外部知识库,在检索受限的API环境下非常实用。但其主要局限性在于需要多次调用模型,成本较高,且对于那些模型“自洽”地重复同样错误的情况,其检测效能会大打折扣。
为了在检测效率和深度之间取得平衡,最新的研究开始探索在解码阶段主动探测模型信念的方法。例如,Joo等[82]提出的基于不确定表达一致性的黑盒检测方法发现,当大语言模型陈述事实时,即使在表达中引入不确定性,其核心语义也保持一致;反之,对于虚构内容,则容易产生语义上的分歧。基于此,他们提出了一种仅需生成两个答案即可高效评估事实性的度量标准。与之类似,Abdeen等[83]提出的转移解码技术则更为激进,在解码阶段主动干预,当模型生成的词元与首次生成的“贪婪答案”在语义上相似时,强制其选择下一个概率最高的候选词元,从而观察模型是否轻易“转向”不同答案。通过提取模型在此过程中的抵抗行为特征,可以训练出高效的幻觉检测分类器。这类方法开始尝试主动探测而非被动观察模型的内在状态。
与此同时,另一项前沿工作致力于实现实时、细粒度的幻觉检测。Obeso等[84]利用网络搜索自动标注了大量长文本中实体级别幻觉的词元级标签,并在此基础上训练了线性探针和LoRA探针。这些轻量级的分类器能够以极低的计算成本,在生成过程中实时识别出被捏造的实体,在Llama-3.3-70B等大语言模型上AUC值达到0.90,显著优于基于不确定性的基线方法。这种方法代表了当前最精细化和实用化的检测方向之一,为高风险应用中的实时干预提供了可能。
综合来看,基于模型行为及内部状态的检测方法从生成过程的不确定性和一致性中挖掘幻觉线索,与前两类方法形成有力互补。该领域正在呈现出从粗粒度到词元级、从被动观察到主动探测、从高延迟到实时检测的明显趋势,为构建高效、通用的幻觉检测器奠定了坚实基础。

3.1.4 检测方法评估标准

在对幻觉检测方法进行评估时,需从多维度构建完整的指标体系,以全面衡量检测方法的有效性和实用性。评估重点涵盖检测准确性、覆盖能力、运行效率、实时性、可解释性及对外部资源的依赖程度。换言之,一个优秀的幻觉检测方法不仅应能准确识别幻觉,还应在覆盖不同类型幻觉、保障检测速度与可解释性等方面具备优势。在检测准确性方面,研究者通常采用精确率、召回率、F1值等分类性能指标[85],量化检测方法对幻觉的检出效果。精确率衡量检测出的幻觉中真实幻觉的占比,召回率反映所有实际存在的幻觉中被成功检出的比例,F1值则结合两者,提供综合平衡的准确性指标。覆盖能力体现检测方法对各类幻觉现象的适用程度,即能否应对不同任务场景,以及长文本、多事实等复杂输出中的幻觉。理想的检测方法应具备跨任务普适性,且不局限于特定幻觉类型或单一数据集。部分基于外部信息源的检测方法,在长篇幅、多事实场景下仍能保持较高检出率,表明其覆盖能力较强。
运行效率与实时性主要关注检测方法的计算开销和响应速度[86]。部分依赖反复检索验证的精细核查方法,尽管准确率较高,但计算代价较大,难以应用于即时交互场景。评估时需考察检测方法在保证性能的前提下,能否以较低延迟完成检测,从而满足实时应用需求。
此外,可解释性也是评估的重要维度[87],即检测方法能否给出明确理由支撑其判断。部分基于证据比对的检测方法,往往结果可靠、可解释性强,能够为幻觉标记提供直观依据;相反,单纯基于黑盒分类器的检测方法,可能难以指明输出中存在不一致的位置。最后需关注外部资源依赖程度:高度依赖检索工具与知识库的方案,在知识库覆盖有限时性能会下降,且无法应用于缺乏外部知识的场景;相比之下,不借助外部资源的内部知识利用型检测方法,在封闭环境中更具优势。因此,评估体系应辨析检测方法对外部信息源的依赖强度,并权衡其带来的性能变化。
综上所述,对幻觉检测方法的评估需综合考虑准确性、覆盖能力、运行效率、可解释性及外部资源依赖代价等多重指标。只有在精确率与召回率俱佳的前提下,同时具备广覆盖、高效率、可解释性等特点,才能称为优秀且实用的幻觉检测方法。该多维度评估指标体系可全面衡量检测方法在幻觉治理中的作用,助力研究者与开发者筛选出最有效的检测技术,为后续幻觉归因分析及缓解策略选择奠定基础。
上述基于外部信息源、内部知识、行为及内部状态的检测方法,相较于传统的事实性与忠实性二分法,更适用于本文提出的幻觉治理技术体系。该三分框架直接依据检测机制所依赖的核心指标进行分类,打破了按幻觉现象类型划分检测方法的惯性思维,构建了统一的分析框架。在此框架下,同一类检测方法可灵活应用于多种类型幻觉的识别,提升检测工具的通用性与可迁移性,为构建不依赖特定任务、具备强泛化能力的普适性幻觉检测技术奠定坚实基础。

3.2 幻觉缓解策略

在确定幻觉归因后,为每种归因匹配针对性的缓解策略是大语言模型幻觉治理技术体系的最后一环。现有研究提出了多种缓解策略,涵盖数据处理、模型训练、推理解码以及后处理等层面。为与前述归因分析相对应,本节将这些缓解策略按照导致幻觉的模型内在缺陷进行归类,并对同种归因的多种方法按照效果、成本和潜在负面影响等维度进行比较,具体比较情况如表4所示。
表 4 缓解策略分析对比

Table 4 Comparative analysis of mitigation strategies

归因类别 缓解策略 效果 成本 潜在负面影响
训练数据噪声与知识覆盖不足 数据清洗与专业
数据补充
通过剔除错误数据、补充高质量领域语料显著提升知识正确性 高:需要持续收集和维护领域
数据
数据收集成本高,专业语料覆盖不全时仍可能遗漏事实
检索增强生成 对小模型效果显著,尤其在开放域任务中,可明显降低幻觉发生率 中:需要构建检索通道和知识库 检索偏差会引入噪声,检索质量直接影响输出可信度
知识编辑 在特定常见问题上可将正确率提升至近100%,直接纠正错误事实 高:编辑操作复杂且需针对具体知识点 泛化能力有限,对幻觉纠正效果不一,可能引入新偏差
训练目标偏差与解码策略缺陷 RLHF/指令微调 在开放域和生物医学等场景显著降低幻觉率,提升响应真实性 高:需要大量人工标注与反馈 可能过度迎合训练偏好,适用性受领域限制
改进解码策略 调整采样方法可在一定程度上提高事实性并保持连贯度 低—中:修改推理参数即可实施 可能牺牲文本多样性,不同任务需不同调参
自我反思与
温度校准
自我反思可利用模型的自省能力核查并修正错误,而温度与对数校准通过调整概率分布来降低不确定性幻觉 低—中:反思会增加推理时间,校准操作简单 自我反思对小模型可能无效甚至有害,过度校准可能导致
输出保守
暴露偏差与记忆检索失败 调度采样/序列级
强化学习
减少教师强制带来的暴露偏差,减缓错误“滚雪球”效应 高:训练过程复杂,调参难度大 训练不稳定,需大量资源支持
调用外部工具 在检索、算术和符号推理任务上显著提高正确率 中—高:集成多工具增加系统复杂度 依赖工具质量,调用会增加时延
长上下文结构和
记忆模块
扩展模型“记忆窗口”,减轻长距离注意力衰减 高:架构复杂,需要更多显存和计算 推理时延增加,可能导致短文本任务效率低
对齐能力与信念错配 RLHF/DPO等
偏好优化
奖励谨慎且真实的回答,能减少编造行为 高:训练成本高,需大量标注 可能导致模型过度保守,难以回答开放式问题
提示工程 在提示中加入专业背景和示例有助于降低幻觉频率 低:无需训练,只需调整提示 提示设计依赖经验,跨任务泛化有限
检索链条误差与对抗提示 改进召回和排序算法 提高检索相关性,降低噪声来源 中:需优化检索模块和算法 算法复杂度增加,仍依赖知识库覆盖率
多工具交叉验证 结合搜索、知识图谱等多种工具互证,有效减少单一检索误差 中—高:系统集成复杂,
运行成本高
增加交互延迟,流程复杂
安全过滤和指令
优先级管理
通过安全过滤和设定系统、用户、工具指令优先级减弱对抗性攻击 中:需设计规则和安全策略 可能限制模型灵活性,过滤过严时影响回答完整度
解码启发式偏差 调整温度/重复
惩罚等采样参数
通过降低采样随机性减少误采样导致的幻觉 低:只需调整模型参数 可能导致回答单调、缺乏多样性
对数几何校准 使概率分布更符合真实置信度,提高正确率 低:计算简单 调参不当可能抑制某些合理但低频的答案
不确定性检测与
重写机制
利用不确定性信号检测可能的幻觉并重新生成对应部分 中:需结合检测模型 重写可能影响文本连贯性,检测阈值设置困难
推理能力不足与跨模态失真 外部计算器/
符号推理器
强化算数和逻辑推理能力,减少推理错误 中:需要集成专用工具 工具可靠性不足时可能引入新的错误
多模态感知对齐 通过OCR/ASR/视觉编码等校准跨模态输入,减少感知失真 高:需复杂预处理与融合模型 噪声积累风险,跨模态数据难获取
强化推理训练 在数据和训练目标上加强链式推理任务,改善复杂推理表现 高:需额外数据和训练资源 有过拟合风险,对其他任务提升有限
(1)训练数据噪声与知识覆盖不足
当幻觉源自训练数据中的错误或知识边界时,缓解的核心思路是从数据源头优化和外部知识接入入手。最直接的方法是进行大规模数据清洗与高质量语料补充[88]。研究表明,在预训练阶段引入经过严格筛选的专业领域数据,能显著提升模型在该领域的知识牢固性,降低幻觉发生频率。另一种在推理阶段广泛应用的策略是检索增强生成 [89],通过实时检索外部知识库为模型提供事实依据。研究表明,检索增强生成对于参数量小于百亿的模型效果尤为显著,能有效弥补其知识容量的不足;但其性能高度依赖检索质量,若返回无关或错误文档,反而会引入新的噪声,导致“幻觉转移”。
针对模型参数中已记忆的顽固性错误事实,知识编辑技术提供了一种精准的修正方案。以ROME[90]、MEMIT[91]和基于LoRA的编辑方法[92]为代表,这类技术旨在不进行全量重训练的情况下,通过极小范围的参数扰动来更新模型的特定知识,在特定的知识问答评测集上能将准确率提升至接近100%,展现出强大的针对性修正能力。然而,专注于真实幻觉场景的基准测试HalluEditBench[93]揭示,知识编辑方法的泛化能力和鲁棒性参差不齐。部分方法编辑后,模型在面对与原知识相关的推理问题时,其正确泛化能力和不影响其他无关知识的能力甚至低于未经编辑的原始模型。从实施成本看,数据清洗和检索增强生成需要持续维护高质量的知识库;而知识编辑技术则较为复杂,目前难以规模化应用。
(2)训练目标偏差与解码策略缺陷
自回归语言模型预测下一个词的核心训练目标,使其倾向于生成流畅而非绝对真实的文本。而矫正根本性偏差是缓解此类幻觉的关键。在训练阶段,人类反馈强化学习和新兴的直接偏好优化(Direct Preference Optimization,DPO)[94]通过引入人类对“真实”与“编造”的判别,直接优化模型输出与事实一致性相关的目标。研究证实,经过人类反馈强化学习微调的模型在开放领域和生物医学等高风险领域的幻觉率显著降低[95],但其训练过程需要耗费大量的人力标注和计算资源,且效果在不同领域间迁移性有限。
在推理阶段,自我反思方法试图让模型扮演自己的“校对员”。例如,让模型首先生成一个初始答案,然后基于提示(如“请找出上述回答中可能不准确的地方并修正”),来生成一个改进版本。对于千亿参数级别的超大模型,此方法能有效利用其强大的推理能力进行自我纠错;然而,对于参数较小的模型,其内在知识和推理能力有限,强制性的自我反思有时反而会使其“过度思考”,生成更多不相关或错误的内容,导致幻觉不减反增[96]。在解码策略上,除了传统的贪婪解码和核采样,研究者提出了事实核采样[97]等改进方案,旨在采样时更倾向于选择与已知事实一致的高概率词元。此外,对模型的输出概率进行温度缩放或对数概率校准[98]等操作,可以改善其概率值与真实置信度的匹配程度,从而降低因随机采样不确定性引发的幻觉。这类方法大多无需外部知识,成本集中于训练或精细调参,但共同的潜在负面影响是可能牺牲文本的创造性或多样性。
(3)暴露偏差与记忆检索失败
教师强制训练与自回归生成之间的条件差异,以及模型在复杂问题上的记忆提取失败,是此类幻觉的根源。为缓解暴露偏差,调度采样方法[32]在训练中逐步用模型自身生成的前缀替换真实的上下文,使其适应在可能包含错误的自身输出上继续生成,从而增强鲁棒性。序列级强化学习则从整体序列的质量出发进行优化,而非仅关注局部词元,有助于减缓错误的“滚雪球”效应。
针对模型在复杂或多跳查询中记忆检索失败的问题,最有效的策略是增强外部工具调用。通过为模型集成检索器、计算器、符号推理引擎或代码解释器等外部工具,可以将模型不擅长的精确计算、事实查询和复杂逻辑推理任务卸载给专用模块[99]。例如,当被问及数学问题时,模型可调用计算器;当需要最新信息时,模型可调用搜索引擎。这种方法能显著提升答案的准确性,但代价是增加了系统的复杂度和响应延迟。此外,改进模型架构以支持自适应长上下文[100]和引入外部记忆存储模块[101],可以扩展模型的“有效记忆窗口”,减轻注意力范围限制而导致的对前文关键信息的遗忘,从而减少自身违背类幻觉。
(4)对齐能力与信念错配
当模型被要求执行超出其核心能力范围的任务,或其行为被训练为过度迎合用户偏好时,便会产生此类幻觉。人类反馈强化学习和直接偏好优化同样适用于此,可通过精心设计的奖励函数,奖励那些承认知识边界或表现谨慎的答案,从而校正模型的“奉承”倾向。
同时,提示工程是一种低成本且灵活的干预手段。研究表明,在提示中明确提供任务相关的专业背景、定义输出格式约束,或加入少量展示“如何正确回答未知问题”的思维链示例,能有效引导模型行为,减少硬性编造[102]。然而,提示工程是一把双刃剑,不恰当的提示重构或示例选择可能会无意中引入偏见或误导模型,因此需要细致调试[103]。该策略的一个最佳实践是,在系统提示中明确鼓励模型表达不确定性,并配套调整评测指标,对诚实回答“我不知道”的行为给予正向评价,而非视作失败[76],进而从根本上避免因惩罚“不知道”而间接鼓励模型猜测的行为模式。
(5)检索链条误差与对抗提示
当模型应用检索增强生成等涉及外部调用的技术时,幻觉常源于检索链路本身。为此,需要优化检索器,包括采用更先进的向量化模型进行查询扩展,以及使用交叉编码器进行精细的重排序,以提升召回文档的相关性和准确性[104]。在函数调用场景中,建立参数验证与多工具交叉检验机制至关重要,如在调用天气API前验证地理位置参数的有效性。
面对旨在误导模型的对抗性提示或提示注入,防御策略包括构建多层安全过滤系统,对输入和输出进行内容安全检查;设定清晰的指令优先级规则,确保系统指令不会被用户输入轻易覆盖;设计确认循环,在执行高风险操作前要求用户或上级系统确认[105]。这些策略提升了系统稳健性,但不可避免地会增加系统复杂性和交互延迟。
(6)解码启发式偏差
解码启发式偏差的本质,是模型在局部连贯性与全局事实性之间的决策失衡。常规参数调整虽能约束采样空间,但属于一种全局性、粗粒度的抑制,难以兼顾事实性与创造性。对此,研究前沿聚焦于基于不确定性的细粒度调控。其核心是首先通过后处理校准技术(如温度缩放或对数几何校准[106]),对模型的原始输出概率进行修正,使置信度这一指标能更可靠地反映正确性。在此基础上,构建一个基于阈值的拒绝机制:当模型在生成过程中,对某个即将产出的词元或语义单元的置信度低于预设阈值时,解码进程会被中断或转向,转而执行预定义的补救策略(例如,触发检索增强生成模块获取外部证据,或回溯到上一个决策点进行重新生成[107])。该技术路线的关键挑战在于阈值策略的制定:阈值过高则无法有效拦截幻觉,形同虚设;阈值过低则会过度保守,不仅导致回复信息量骤减,还可能误伤那些符合事实但属于低概率表达的正确内容。
(7)推理能力不足与跨模态失真
对于模型固有的逻辑、算术推理短板,以及处理多模态信息时感知模块误差导致的失真,最有效的策略是外部工具集成。为模型配备专用的符号推理器和计算器,可近乎完美地解决其数值计算和符号逻辑问题。在多模态任务中,通过改进光学字符识别、自动语音识别等前端感知模块的精度,并对齐视觉编码器与语言模型,可从源头减少因“看错”或“听错”而引发的跨模态幻觉[108]。此外,在训练数据中强化推理训练(例如引入更多的数学证明、逻辑推理链数据),可从根本上提升模型的推理能力,但这需要大量的高质量数据和计算资源,且存在对特定任务类型过拟合的风险。
大语言模型幻觉问题层出不穷,各类缓解策略不断涌现,但如何评估缓解策略的有效性和实用性仍是亟待解决的重要问题。目前针对幻觉缓解策略的评测缺乏统一标准,不同研究采用各自的数据集和指标,导致方法间难以直接横向比较。在高准确性要求的应用领域,引入缓解策略后模型性能和行为可能发生复杂变化,因此建立统一的评估指标体系十分必要。本文构建的体系主要涵盖以下5个指标,能够帮助全面衡量缓解策略在抑制模型幻觉方面的成效、预估成本与潜在风险,为不同应用场景下选择合适的缓解策略提供依据。
1)效果指标,用于衡量缓解策略实际抑制幻觉的能力。例如,Anthropic的Constitutional AI(CAI)方法使模型有害幻觉减少约85%[109]。这类指标通常通过幻觉减少率或事实准确率的提升进行量化。
2)成本指标,包括训练和推理的计算开销、额外标注所需人力以及工程实现难度等。高成本方法即便有效,也可能缺乏实用性,因此需评估其性价比。例如,基于人类反馈的强化学在降低幻觉方面效果显著,但训练代价高且依赖大量人工反馈,后续研究提出用AI反馈替代人工反馈,将标注工作量减少了90%[110]。又如,检索增强生成技术虽然提升了内容真实性,但增加了检索和长上下文处理的开销。
3)潜在负面影响指标,用于考察缓解策略可能带来的副作用,包括创造性或多样性的牺牲、回复过于保守甚至拒答,以及模型知识的遗失等。评估时需检查模型输出风格是否变得保守刻板,是否大量使用不确定、无法回答等保守措辞,或遗漏本应提供的有用信息。此外,还应警惕过度校正导致的遗忘现象,有研究发现过强的对比学习微调曾导致模型发生灾难性遗忘,需通过弹性权重凝固等技术保留原有知识[111]。另有研究指出,过度的顺从式优化会产生“逢迎”倾向,即模型一味迎合用户而忽略事实准确性。
4)可解释性指标,考察缓解策略是否提供了易于理解和判断其成效的信号。例如,一些策略在生成过程中引入自我检验步骤或引用外部证据,产生了可审计的证据链和来源依据,便于开发者分析模型在何时因何故产生幻觉[112]。相反,如果缓解过程完全是黑箱式的,则出现幻觉时难以追查原因,不利于后续改进。
5)实时性指标,即方法在实际系统中运行的效率和易用性。许多缓解策略会引入额外步骤,从而增加响应延迟和系统复杂度。因此,需要以延迟、吞吐量等指标评估方法的实时性能,以及部署时对内存、模型调用次数的需求。若缓解策略虽能有效抑制幻觉,但导致推理速度骤降,则在应用中可能得不偿失,不宜采用。
综上所述,完善的幻觉缓解策略评估指标体系对于推进大语言模型幻觉治理研究具有关键作用。该体系不仅能够全面衡量缓解策略在抑制幻觉方面的效益,及其在成本、性能等方面可能带来的负面影响,从而为不同应用环境下选择最佳策略提供依据;也能够通过多维指标揭示各方法的实用性与适用边界,引导研究者在抑制幻觉的同时,兼顾模型整体性能的平衡。

4 未来挑战与展望

为推动大语言模型幻觉治理从倾向评估迈向精准缓解,本文认为未来的工作应聚焦于三大研究方向:评测基准的归因化设计、检测方法的通用化演进以及缓解策略的智能化匹配。

4.1 评测基准的归因化设计:从“观察”到“诊断”

现有观察数据集根据幻觉的类型(即现实违背、提示违背和自身违背)进行构建,虽能有效评估模型的整体幻觉倾向,却难以追溯其内在根源。未来研究的核心任务在于推动评测基准从现象观察向归因诊断的方向转变,即构建与研究拭子数据集。此类数据集的核心设计原则是针对特定归因进行精准化设计。例如,为诊断因“知识边界与长尾效应”产生的幻觉,应设计模型训练截止日期之后发生的事件或极其冷门的知识问题进行检测,如“2026年诺贝尔物理学奖得主是谁?”诊断为因“解码启发式偏差”产生的幻觉,则可设计需在事实性与创造性间取得微妙平衡的“创意性问答”。可见,拭子数据集必须具备高度的针对性、多样性和专业性,其构建需覆盖从数据噪声、训练缺陷到推理局限的全链条归因,从而为精准归因与治理提供可靠的理论依据。

4.2 检测方法的通用化演进:从“针对”到“泛化”

未来幻觉检测技术的发展需要致力于构建更具通用性的范式。其一,增强对新题型的适应性,要求检测方法能够灵活应对各类拭子数据集题型,而非局限于传统题型。其二,追求跨任务的普适性,设计能够统一处理多种题型的检测方法,改变当前“一种方法应对一种题型”的烦琐局面。其三,深化多指标的融合性,通过集成外部信息源、模型内部知识以及行为状态等多种检测依据,构建鲁棒性更强的综合检测框架。最终形成一个能够跨题型、跨任务、跨归因稳健工作的统一检测器。

4.3 缓解策略的智能化匹配:从“枚举”到“推荐”

当前缓解策略众多,但其效果高度依赖于模型规模、任务领域和资源约束,形成复杂的决策空间,仅凭经验选择已无法满足高效治理的需求。未来的核心方向是构建智能化的缓解策略推荐机制。该机制应能综合考量幻觉的具体归因诊断结果、任务的关键性要求(如事实准确性优先或创意性优先)、可用的计算资源及可容忍的潜在负面影响等因素,从一个统一的“策略池”中,自动匹配并推荐最优缓解策略组合。可借鉴医学诊疗思想,建立量化评估体系,甚至引入强化学习框架进行动态优化,实现检测结果与缓解策略的闭环联动,提升治理体系自动化水平与可解释性,最终达成“量体裁衣”式的精准干预。

5 结束语

本文围绕大语言模型的幻觉治理问题,开展了一系列系统性的研究。面对当前研究中检测、归因与缓解环节相互脱节的现状,本文借鉴医学“诊断—病因分析—治疗”的一体化思想,以幻觉治理为导向构建新的综述框架,归纳并梳理包含“检测—归因—缓解”的治理流程。本文引入了拭子数据集这一核心概念,旨在通过针对性测试实现幻觉归因的精准定位,突破了传统观察数据集只能评估现象而无法诊断根源的局限。在此基础上,本文将幻觉的现象分类、归因分析、检测数据集、检测方法与缓解策略5个维度有机整合,明确了各环节间的逻辑关联,为治理实践提供了清晰的理论框架和行动指南。
本文的治理技术体系,其优势在于强调了治理环节间的因果链条与闭环反馈,推动了研究范式从孤立的技术点优化转向协同的系统工程。大语言模型幻觉治理的研究必将朝着更加精细化、自动化、通用化的方向发展。通过拭子数据集的不断完善、通用检测范式的逐渐成熟以及智能推荐机制的深入应用,有望最终构建出能够自我诊断、自我修正的下一代可信赖语言模型,为人工智能在高风险领域的可靠、安全应用奠定坚实的基础。
1
Vaswani A, Shazeer N, Parmar N, et al. Attention is all you need[J]. Advances in Neural Information Processing Systems, 2017, 30, 6000.

DOI

2
Radford A, Narasimhan K, Salimans T, et al. Improving language understanding by generative pre-training[EB/OL]. [2025-09-08]https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf.

3
Devlin J, Chang M W, Lee K, et al. BERT: pre-training of deep bidirectional transformers for language understanding[C]//Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long and Short Papers). Kerrville: Association for Computational Linguistics 2019: 4171-4186.

4
Brown T, Mann B, Ryder N, et al. Language models are few-shot learners[J]. Advances in Neural Information Processing Systems, 2020, 33, 1877- 1901.

5
Hostinger. LLM statistics 2025: comprehensive insights into market trends and integration[EB/OL]. [2025-09-20]. https://www.hostinger.com/tutorials/llm-statistics.

6
MORAN L. 73% of lawyers plan to use generative AI, report finds[EB/OL]. (2023-11-20)[2025-09-20]. https://www.legaldive.com/news/generative-ai-legal-use-cases-wolters-kluwer-report/700342/.

7
Kalai A T, Nachum O, Vempala S S, et al. Why language models hallucinate[PP/OL]. V1. arXiv (2025-09-04) [2025-09-10]. https://doi.org/10.48550/arXiv.2509.04664.

8
Jain S, Chakraborty B, Agarwal A, et al. Performance of large language models (ChatGPT and gemini advanced) in gastrointestinal pathology and clinical review of applications in gastroenterology[J]. Cureus, 2025, 17 (2): e31892.

DOI

9
从“律师因AI编造案例被罚”谈起: 大模型幻觉的根源与最新研究进展[EB/OL]. (2025-09-01) [2025-09-20]. https://blog.csdn.net/AI_gurubar/article/details/150603480.

From “Lawyers penalized for AI-generated fictitious cases”: the root causes and latest research progress of hallucinations in Large language models[EB/OL]. (2025-09-01) [2025-09-20]. https://blog.csdn.net/AI_gurubar/article/details/150603480.

10
Li Z, Yi W, Chen J. Accuracy paradox in large language models: regulating hallucination risks in generative AI[EB/OL]. [2025-09-10] arXiv preprint arXiv: 2509.13345 (cs. AI), 2025. https://arxiv.org/abs/2509.13345.

11
Ji Z W, Lee N, Frieske R, et al. Survey of hallucination in natural language generation[J]. ACM Computing Surveys, 2023, 55 (12): 1- 38.

12
Huang L, Yu W J, Ma W T, et al. A survey on hallucination in large language models: principles, taxonomy, challenges, and open questions[J]. ACM Transactions on Information Systems, 2025, 43 (2): 1- 55.

13
Lin S, Hilton J, Evans O. TruthfulQA: measuring how models mimic human falsehoods[C]//Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Stroudsburg, PA, USA: ACL, 2022: 3214-3252.

14
Thorne J, Vlachos A, Christodoulopoulos C, et al. FEVER: a large-scale dataset for Fact Extraction and VERification[PP/OL]. V3. arXiv (2018-12-18) [2025-09-10]. https://doi.org/10.48550/arXiv.1803.05355.[LinkOut]]

15
Li J Y, Cheng X X, Zhao W X, et al. HaluEval: a large-scale hallucination evaluation benchmark for large language models[PP/OL]. V3. arXiv (2023-10-23) [2025-09-10] https://doi.org/10.48550/arXiv.2305.11747.

16
Liu Z H, Wang P J, Song X B, et al. Survey on hallucinations in large language models[J]. Journal of Software, 2024, 36(3): 1152-1185.

Liu Z H, Wang P J, Song X B, et al. Survey on hallucinations in large language models[J]. Journal of Software, 2024, 36(3): 1152-1185.

17
Lin X X, Ning Y C, Zhang J W, et al. LLM-based agents suffer from hallucinations: a survey of taxonomy, methods, and directions[PP/OL]. V2. arXiv (2025-11-18) [2025-09-10]. https://doi.org/10.48550/arXiv.2509.18970.

18
Li J Y, Chen J, Ren R Y, et al. The dawn after the dark: an empirical study on factuality hallucination in large language models[PP/OL]. V1. arXiv (2024-01-06) [2025-09-10]. https://doi.org/10.48550/arXiv.2401.03205.[LinkOut]]

19
Li C Z, Wang P B, Wang C X, et al. Loki’s dance of illusions: a comprehensive survey of hallucination in large language models[PP/OL]. V1. arXiv (2025-06-06) [2025-09-10]. https://doi.org/10.48550/arXiv.2507.02870.

20
Mishra A, Asai A, Balachandran V, et al. Fine-grained hallucination detection and editing for language models[PP/OL]. V4. arXiv (2024-08-12) [2025-09-10]. https://doi.org/10.48550/arXiv.2401.06855.

21
Rawte V, Chakraborty S, Pathak A, et al. The troubling emergence of hallucination in large language models - an extensive definition, quantification, and prescriptive remediations[C]//Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing. Stroudsburg, PA, USA: ACL, 2023: 2541-2573.

22
Zhang Y, Li Y F, Cui L Y, et al. Siren’s song in the AI ocean: a survey on hallucination in large language models[J]. Computational Linguistics, 2025, 51 (4): 1373- 1418.

DOI

23
Zhou C, Liu P, Xu P, et al. Lima: less is more for alignment[J]. Advances in Neural Information Processing Systems, 2023, 36, 55006- 55021.

24
Bender E M, Gebru T, McMillan-Major A, et al. On the dangers of stochastic parrots: can language models be too big[C]//Proceedings of the 2021 ACM Conference on Fairness, Accountability, and Transparency. New York: ACM, 2021: 610-623

25
Weidinger L, Mellor J, Rauh M, et al. Ethical and social risks of harm from language models[PP/OL]. V1. arXiv (2021-12-08) [2025-09-10]. https://doi.org/10.48550/arXiv.2112.04359.

26
Carlini N, Tramer F, Wallace E, et al. Extracting training data from large language models[C]//30th USENIX security symposium (USENIX Security 21). 2021: 2633-2650.

27
Carlini N, Ippolito D, Jagielski M, et al. Quantifying memorization across neural language models[C]//The Eleventh International Conference on Learning Representations. 2022.

28
Chowdhery A, Narang S, Devlin J, et al. PaLM: scaling language modeling with pathways[J]. Journal of Machine Learning Research, 2023, 24, 1- 113.

29
Wu A P, Kuang K, Zhu M Q, et al. Causality for large language models[PP/OL]. V1. arXiv (2024-10-20) [2025-09-10]. https://doi.org/10.48550/arXiv.2410.15319.

30
Min S, Gururangan S, Wallace E, et al. SILO language models: isolating legal risk in a nonparametric datastore[PP/OL]. V2. arXiv (2024-07-31) [2025-09-10]. https://doi.org/10.48550/arXiv.2308.04430.

31
Wang C J, Sennrich R. On exposure bias, hallucination and domain shift in neural machine translation[PP/OL]. V1. arXiv (2020-05-07) [2025-09-10]. https://doi.org/10.48550/arXiv.2005.03642

32
Bengio S, Vinyals O, Jaitly N, et al. Scheduled sampling for sequence prediction with recurrent Neural networks[C]//Proceedings of the 29th International Conference on Neural Information Processing Systems - Volume 1. New York: ACM, 2015: 1171-1179.

33
Bowman S R, Hyun J, Perez E, et al. Measuring progress on scalable oversight for large language models[PP/OL]. V2. arXiv (2022-11-11) [2025-09-10]. https://doi.org/10.48550/arXiv.2211.03540.

34
Zhang M R, Press O, Merrill W, et al. How language model hallucinations can snowball[PP/OL]. V1. arXiv (2023-05-22) [2025-09-10]. https://doi.org/10.48550/arXiv.2305.13534.

35
Chiang D, Cholak P. Overcoming a theoretical limitation of self-attention[PP/OL]. V1. arXiv (2022-02-24) [2025-09-10]. https://doi.org/10.48550/arXiv.2202.12172.

36
Hahn M. Theoretical limitations of self-attention in neural sequence models[J]. Transactions of the Association for Computational Linguistics, 2020, 8, 156- 171.

DOI

37
Yang Z L, Dai Z H, Salakhutdinov R, et al. Breaking the softmax bottleneck: a high-rank RNN language model[PP/OL]. V4. arXiv (2018-03-02) [2025-09-10]. https://doi.org/10.48550/arXiv.1711.03953

38
Fan A, Lewis M, Dauphin Y. Hierarchical neural story generation[PP/OL]. V1. arXiv (2018-05-13) [2025-09-10]. https://doi.org/10.48550/arXiv.1805.04833.

39
Holtzman A, Buys J, Du L, et al. The curious case of neural text degeneration[PP/OL]. V2. arXiv (2020-02-14) [2025-09-10]. https://doi.org/10.48550/arXiv.1904.09751.

40
Chuang Y S, Xie Y J, Luo H Y, et al. DoLa: decoding by contrasting layers improves factuality in large language models[PP/OL]. V2. arXiv (2024-03-11) [2025-09-10]. https://doi.org/10.48550/arXiv.2309.03883

41
Dziri N, Madotto A, Zaïane O, et al. Neural path hunter: reducing hallucination in dialogue systems via path grounding[C]//Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing. Stroudsburg, PA, USA: ACL, 2021: 2197-2214.

42
Wang Y F, Zhong W J, Li L Y, et al. Aligning large language models with human: a survey[PP/OL]. V1. arXiv (2023-07-24) [2025-09-10]. https://doi.org/10.48550/arXiv.2307.12966.

43
Gekhman Z, Yona G, Aharoni R, et al. Does fine-tuning LLMs on new knowledge encourage hallucinations[PP/OL]. V3. arXiv (2024-10-01)[2025-09-10]. https://doi.org/10.48550/arXiv.2405.05904.

44
Schulman J. Reinforcement learning from human feedback: Progress and challenges[C/OL]//Berkeley EECS Colloquium. Berkeley: University of California, Berkeley, 2023. https://www.youtube.com/watch?v=Q70FS5Z3z0E.

45
Wei J, Huang D, Lu Y F, et al. Simple synthetic data reduces sycophancy in large language models[PP/OL]. V2. arXiv (2024-02-15) [2025-09-10]. https://doi.org/10.48550/arXiv.2308.03958.

46
Liu C Z, Xu Z X, Wei Q Y, et al. More thinking, less seeing? assessing amplified hallucination in multimodal reasoning models[PP/OL]. V3. arXiv (2025-06-20) [2025-09-10]. https://doi. org/10.48550/arXiv. 2505.21523.

47
Wang C X, Chen X, Zhang N Y, et al. MLLM can see? dynamic correction decoding for hallucination mitigation[PP/OL]. V2. arXiv (2025-02-23) [2025-09-10]. https://doi.org/10.48550/arXiv.2410.11779.

48
Miao M M, Kearns M. Hallucination, monofacts, and miscalibration: an empirical investigation[PP/OL]. V2. arXiv (2025-05-15) [2025-09-10]. https://doi.org/10.48550/arXiv.2502.08666.

49
Shen Y D, Wu K X, Ding Y C, et al. Alleviating LLM-based generative retrieval hallucination in alipay search[C]//Proceedings of the 48th International ACM SIGIR Conference on Research and Development in Information Retrieval. New York: ACM, 2025: 4294-4298.

50
Shu F X, Liao Y, Zhuo L, et al. LLaVA-MoD: making LLaVA tiny via MoE knowledge distillation[PP/OL]. V3. arXiv (2024-10-23) [2025-09-10]. https://doi.org/10.48550/arXiv.2408.15881.

51
Azaria A, Mitchell T. The internal state of an LLM knows when it’s lying[PP/OL]. V2. arXiv (2023-10-17) [2025-09-10]. https://doi.org/10.48550/arXiv.2304.13734.

52
Bürger L, Hamprecht F, Nadler B. Truth is universal: robust detection of lies in LLMs[C]//Proceedings of the Advances in Neural Information Processing Systems 37. Neural Information Processing Systems Foundation, Inc. (NeurIPS), 2024: 138393-138431.

53
Chen X, Song D Z, Gui H H, et al. FactCHD: benchmarking fact-conflicting hallucination detection[PP/OL]. V3. arXiv (2024-05-26) [2025-09-10]. https://doi.org/10.48550/arXiv.2310.12086.

54
Liu T Y, Zhang Y Z, Brockett C, et al. A token-level reference-free hallucination detection benchmark for free-form text generation[C]//Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Stroudsburg, PA, USA: ACL, 2022: 6723-6737.

55
Gupta P, Wu C S, Liu W H, et al. DialFact: a benchmark for fact-checking in dialogue[C]//Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Stroudsburg, PA, USA: ACL, 2022: 3785-3801.

56
Niu C, Wu Y H, Zhu J, et al. RAGTruth: a hallucination corpus for developing trustworthy retrieval-augmented language models[C]//Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Stroudsburg, PA, USA: ACL, 2024: 10862-10878.

57
Ji Z W, Gu Y Z, Zhang W W, et al. ANAH: analytical annotation of hallucinations in large language models[PP/OL]. V1. arXiv (2024-05-30) [2025-09-10]. https://doi.org/10.48550/arXiv.2405.20315.

58
Pagnoni A, Balachandran V, Tsvetkov Y. Understanding factuality in abstractive summarization with FRANK: a benchmark for factuality metrics[PP/OL]. V2. arXiv (2021-07-23) [2025-09-10]. https://doi.org/10.48550/arXiv.2104.13346.

59
Zhang D X, Gangal V, Lattimer B, et al. Enhancing hallucination detection through perturbation-based synthetic data generation in system responses[C]//Proceedings of the Findings of the Association for Computational Linguistics ACL 2024. Stroudsburg, PA, USA: ACL, 2024: 13321-13332.

60
Chen K D, Chen Q, Zhou J, et al. DiaHalu: a dialogue-level hallucination evaluation benchmark for large language models[C]//Proceedings of the Findings of the Association for Computational Linguistics: EMNLP 2024. Stroudsburg, PA, USA: ACL, 2024: 9057-9079.

61
Anaokar S, Ganatra S, Bhattacharyya S, et al. HalluDetect: detecting, mitigating, and benchmarking hallucinations in conversational systems in the legal domain[C]//Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing: Industry Track. Stroudsburg, PA, USA: ACL, 2025: 1822-1847.

62
Tang Y, Yang Y. Multihop-rag: Benchmarking retrieval-augmented generation for multi-hop queries[EB/OL]. arXiv preprint arXiv: 2401.15391 (cs. AI), [2025-09-10]. https://arxiv.org/abs/2401.15391.

63
Yin Z, Sun Q, Guo Q, et al. Do large language models know what they don't know?[EB/OL]. arXiv preprint arXiv: 2305.18153 (cs. AI) [2025-09-10]. https://arxiv.org/abs/2305.18153.

64
Shafiei M, Saffari H, Moosavi N S. MultiHoax: a dataset of multi-hop false-premise questions[PP/OL]. V2. arXiv (2025-06-04)[2025-09-10]. https://doi.org/10.48550/arXiv.2506.00264

65
Yang Z L, Qi P, Zhang S Z, et al. HotpotQA: a dataset for diverse, explainable multi-hop question answering[C]//Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing. Stroudsburg, PA, USA: ACL, 2018: 2369-2380.

66
Ho X, Nguyen A D, Sugawara S, et al. Constructing a multi-hop QA dataset for comprehensive evaluation of reasoning steps[PP/OL]. V2. arXiv (2020-11-12) [2025-09-10]. https://doi.org/10.48550/arXiv.2011.01060.

67
Trivedi H, Balasubramanian N, Khot T, et al. ♫ MuSiQue: multihop questions via single-hop question composition[J]. Transactions of the Association for Computational Linguistics, 2022, 10, 539- 554.

DOI

68
Bang Y J, Ji Z W, Schelten A, et al. HalluLens: LLM hallucination benchmark[PP/OL]. V1. arXiv (2025-04-24) [2025-09-10] https://doi.org/10.48550/arXiv.2504.17550.

69
Min S, Krishna K, Lyu X X, et al. FActScore: fine-grained atomic evaluation of factual precision in long form text generation[C]//Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing. Stroudsburg, PA, USA: ACL, 2023: 12076-12100.

70
Chern I C, Chern S, Chen S Q, et al. FacTool: factuality detection in generative AI: a tool augmented framework for multi-task and multi-domain scenarios[PP/OL]. V2. arXiv (2023-07-26) [2025-09-10]. https://doi.org/10.48550/arXiv.2307.13528.

71
Huo S Q, Arabzadeh N, Clarke C L A. Retrieving supporting evidence for LLMs generated answers[PP/OL]. V1. arXiv (2023-06-23) [2025-09-10]. https://doi.org/10.48550/arXiv.2306.13781.

72
Nan F, Nallapati R, Wang Z G, et al. Entity-level factual consistency of abstractive text summarization[C]//Proceedings of the 16th Conference of the European Chapter of the Association for Computational Linguistics: Main Volume. Stroudsburg, PA, USA: ACL, 2021: 2727-2733

73
Goodrich B, Rao V, Liu P J, et al. Assessing the factual accuracy of generated text[C]//Proceedings of the 25th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining. New York: ACM, 2019: 166-175.

74
Falke T, Ribeiro L F R, Utama P A, et al. Ranking generated summaries by correctness: an interesting but challenging application for natural language inference[C]//Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. Stroudsburg, PA, USA: ACL, 2019: 2214-2220.

75
Dhuliawala S, Komeili M, Xu J, et al. Chain-of-verification reduces hallucination in large language models[C]//Proceedings of the Findings of the Association for Computational Linguistics ACL 2024. Stroudsburg, PA, USA: ACL, 2024: 3563-3578.

76
Kadavath S, Conerly T, Askell A, et al. Language models (mostly) know what they know[PP/OL]. V4. arXiv (2022-11-21) [2025-09-10]. https://doi.org/10.48550/arXiv.2207.05221.

77
Varshney N, Yao W L, Zhang H M, et al. A stitch in time saves nine: detecting and mitigating hallucinations of LLMs by validating low-confidence generation[PP/OL]. V2. arXiv (2023-08-12)[2025-09-10]. https://doi.org/10.48550/arXiv.2307.03987.

78
Yao J Y, Ning K P, Liu Z H, et al. LLM lies: hallucinations are not bugs, but features as adversarial examples[PP/OL]. V3. arXiv(2024-08-04)[2025-09-10]. https://doi.org/10.48550/arXiv.2310.01469.

79
Farquhar S, Kossen J, Kuhn L, et al. Detecting hallucinations in large language models using semantic entropy[J]. Nature, 2024, 630 (8017): 625- 630.

DOI

80
Agrawal A, Suzgun M, MacKey L, et al. Do language models know when they’re hallucinating references[C]//Proceedings of the Findings of the Association for Computational Linguistics: EACL 2024. Stroudsburg, PA, USA: ACL, 2024: 912-928.

81
Cohen R, Hamri M, Geva M, et al. LM vs LM: detecting factual errors via cross examination[PP/OL]. V1. arXiv (2023-05-22) [2025-09-10]. https://doi.org/10.48550/arXiv.2305.13281.

82
Joo S, Min K, Koo J, et al. Black-box hallucination detection via consistency under the uncertain expression[PP/OL]. V1. arXiv (2025-09-26) [2025-09-10]. https://doi.org/10.48550/arXiv.2509.21999.

83
Abdeen B, Siddiqui S M T, Ahmed M T, et al. Hallucination detection in large language models using diversion decoding[M]//Data and Applications Security and Privacy XXXIX. ChamSpringer Nature Switzerland2025: 116-133.

84
Obeso O, Arditi A, Ferrando J, et al. Real-time detection of hallucinated entities in long-form generation[PP/OL]. V2. arXiv (2026-02-05) [2025-09-10]. https://doi.org/10.48550/arXiv.2509.03531.[LinkOut]]

85
Powers D M W. Evaluation: from precision, recall and F-measure to ROC, informedness, markedness and correlation[PP/OL]. V1. arXiv(2020-10-11)[2025-09-10]. https://doi.org/10.48550/arXiv.2010.16061.

86
Su W H, Wang C Y, Ai Q Y, et al. Unsupervised real-time hallucination detection based on the internal states of large language models[PP/OL]. V2. arXiv(2024-06-10)[2025-09-10]. https://doi.org/10.48550/arXiv.2403.06448.

87
Lipton Z C. The Mythos of model interpretability: in machine learning, the concept of interpretability is both important and slippery[J]. Queue, 2018, 16 (3): 31- 57.

DOI

88
Abbas A, Albalak A, Arora K, et al. DataComp-LM: in search of the next generation of training sets for language models[C]//Proceedings of the Advances in Neural Information Processing Systems 37. Neural Information Processing Systems Foundation, Inc. (NeurIPS), 2024: 14200-14282.

89
Lewis P, Perez E, Piktus A, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks[C]//Proceedings of the 34th International Conference on Neural Information Processing Systems. New York: ACM, 2020: 9459-9474.

90
Meng K, Sharma A S, Andonian A, et al. Mass-editing memory in a transformer[PP/OL]. V2. arXiv (2023-08-01)[2025-09-10]. https://doi.org/10.48550/arXiv.2210.07229.

91
Mitchell E, Lin C, Bosselut A, et al. Fast model editing at scale[PP/OL]. V2. arXiv(2022-06-13)[2025-09-10]. https://doi.org/10.48550/arXiv.2110.11309

92
Wang H Y, Liu T C, Li R R, et al. RoseLoRA: row and column-wise sparse low-rank adaptation of pre-trained language model for knowledge editing and fine-tuning[C]//Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing. Stroudsburg, PA, USA: ACL, 2024: 996-1008.

93
Huang B X, Chen C Y, Xu X X, et al. Can knowledge editing really correct hallucinations[PP/OL]. V3. arXiv (2025-03-03)[2025-09-10]. https://doi.org/10.48550/arXiv.2410.16251.

94
Rafailov R, Sharma A, Mitchell E, et al. Direct preference optimization: your language model is secretly a reward model[J]. Advances in Neural Information Processing Systems, 2023, 36, 53728- 53741.

95
Ouyang L, Wu J, Xu J, et al. Training language models to follow instructions with human feedback[C]//Proceedings of the 36th International Conference on Neural Information Processing Systems. New York: ACM, 2022: 27730-27744.

96
Shinn N, Labash B, Gopinath A. Reflexion: an autonomous agent with dynamic memory and self-reflection[PP]. arXiv preprint arXiv: 2303.11366.

97
Lee N, Ping W, Xu P, et al. Factuality enhanced language models for open-ended text generation[J]. Advances in Neural Information Processing Systems, 2022, 35, 34586- 34599.

98
Guo C, Pleiss G, Sun Y, et al. On calibration of modern neural networks[C]//Proceedings of the 34th International Conference on Machine Learning - Volume 70. New York: ACM, 2017: 1321-1330.

99
Schick T, Dwivedi-Yu J, Dessì R, et al. Toolformer: Language models can teach themselves to use tools[J]. Advances in Neural Information Processing Systems, 2023, 36, 68539- 68551.

100
Beltagy I, Peters M E, Cohan A. Longformer: the long-document transformer[PP/OL].V2.arXiv(2020-12-02)[2025-09-10]. https://doi.org/10.48550/arXiv.2004.05150.

101
Wu Y H, Rabe M N, Hutchins D, et al. Memorizing transformers[PP/OL]. V1. arXiv (2022-03-16)[2025-09-10]. https://doi.org/10.48550/arXiv.2203.08913.

102
Liu P F, Yuan W Z, Fu J L, et al. Pre-train, prompt, and predict: a systematic survey of prompting methods in natural language processing[J]. ACM Computing Surveys, 2023, 55 (9): 1- 35.

DOI

103
Zamfirescu-pereira J D, Wong R Y, Hartmann B, et al. Why johnny can’t prompt: how non-AI experts try (and fail) to design LLM prompts[C]//Proceedings of the 2023 CHI Conference on Human Factors in Computing Systems. New York: ACM, 2023: 1-21.

104
Liu Y A, Zhang R Q, Guo J F, et al. Robust neural information retrieval: an adversarial and out-of-distribution perspective[J]. ACM Transactions on Information Systems, 2026, 44 (1): 1- 48.

105
Gokul V, Tenneti S, Nakkiran A. Contradiction detection in RAG systems: evaluating LLMs as context validators for improved information consistency[PP/OL]. V1. arXiv (2025-03-31) [2025-10-10] https://doi.org/10.48550/arXiv.2504.00180.

106
Kull M, Perello Nieto M, Kängsepp M, et al. Beyond temperature scaling: Obtaining well-calibrated multi-class probabilities with dirichlet calibration[J]. Advances in neural information processing systems, 2019, 32, 12897- 12908.

107
Liu H S, Zhang H, Guo Z J, et al. CtrlA: adaptive retrieval-augmented generation via inherent control[PP/OL]. V2. arXiv (2024-10-03)[2025-10-10]. https://doi.org/10.48550/arXiv.2405.18727

108
Yoon H, Jung J, Kim J, et al. Visual representation alignment for multimodal large language models[PP/OL]. V2. arXiv (2025-10-10)[2025-10-10]. https://doi.org/10.48550/arXiv.2509.07979.

109
Bai Y T, Kadavath S, Kundu S, et al. Constitutional AI: harmlessness from AI feedback[PP/OL]. V1. arXiv (2022-12-15)[2025-10-10]. https://doi.org/10.48550/arXiv.2212.08073.

110
Lee H, Phatale S, Mansoor H, et al. RLAIF vs. RLHF: scaling reinforcement learning from human feedback with AI feedback[PP/OL]. V3. arXiv (2024-09-03)[2025-10-10]. https://doi.org/10.48550/arXiv.2309.00267.

111
Sun W W, Shi Z L, Gao S, et al. Contrastive learning reduces hallucination in conversations[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2023, 37 (11): 13618- 13626.

DOI

112
Kazlaris I, Antoniou E, Diamantaras K, et al. From illusion to insight: a taxonomic survey of hallucination mitigation techniques in LLMs[J]. AI, 2025, 6 (10): 260.

DOI

文章导航

/