幻觉 (人工智能)

在人工智能领域中,幻觉(,或称人工幻觉)是由人工智能生成的一种回应,它含有貌似事实的虚假或误导性资讯。

该术语源自幻觉的心理学概念,因为它们具有相似的特征。然而实际上更相似的概念是“虚谈症(confabulation)”,但“幻觉(hallucination)”一词在人工智能领域已经广为流传。人工智能幻觉的危险之处之一是模型的输出看起来一本正经,而实际上是错误的。

在自然语言处理中
喊出「看!熊猫!」的的圖片,但其生成文字毫無意義]]
在自然语言处理中,幻觉通常被定义为“生成的内容相對於被提供的源内容而言是无意义或不可信的”。文本和表达之间的编码和解码错误会导致幻觉。产生不同反应的人工智能训练也可能导致幻觉。当 AI 在数据集上进行训练时,也会出现幻觉,其中标记的摘要尽管事实上准确。在GPT-3等系统中,人工智能会根据之前的一系列单词(包括它自己先前回应过的单词)生成下一个单词,随着对话时长的增加,可能会不断地产生幻觉。

2022年8月, Meta在发布 BlenderBot 3 期间警告说,该系统容易出现“幻觉”,Meta 将其定义为“自信的假话”。 2022年11月15日,Meta 发布了卡拉狄加()的演示版本,旨在“存储、组合和推理科学知识”。 卡拉狄加生成的内容带有警告“输出可能不可靠!语言模型很容易输出幻觉文本。”在一个案例中,当被要求起草一篇关于创建虚拟形象的论文时,卡拉狄加引用了一位在相关领域工作的工作者的虚构的论文。 Meta 于 11月 17日因其具有一定的冒犯性和因幻觉产生的不准确而撤回了卡拉狄加的演示版。

OpenAI的ChatGPT于 2022年 12月公开发布测试版,它基于 GPT-3.5 系列大型语言模型。沃顿商学院的莫里克()教授将 ChatGPT 称为“无所不知、渴望取悦别人但有时会撒谎的实习生()”。数据科学家特蕾莎() 讲述了其故意编造“”这个短语,并通过向 ChatGPT 询问不存在的现象来测试 ChatGPT。 ChatGPT 回答了了一个听起来似是而非的答案,并配以看似有理有据的引用,使她不得不仔细检查自己是否不小心输入了真实现象的名称。奥伦( )等其他学者一起评估 特蕾莎所作的結果,并评价道此类软件通常可以为用户提供“一个非常令人印象深刻的答案,但却是完全错误的”。

Mashable的麦克() 使用多个问题测试了 ChatGPT。在其中一个例子中,他询问了“中美洲除墨西哥以外最大的国家”的模型。 ChatGPT回复了危地马拉 ,而答案却是尼加拉瓜 。 当CNBC向 ChatGPT 询问“The Ballad of Dwight Fry”的歌词时,ChatGPT 提供了虚构的歌词。 在为新iPhone 14 Pro撰写评论的过程中,ChatGPT 错误地将相关芯片组列为 A15 而不是A16 ,尽管这可以归因于ChatGPT 是在 2021 年结束的数据集上训练的。 当被问及有关新不伦瑞克省的问题时,ChatGPT 回答了很多正确答案,但错误地将萨曼莎·比归类为“来自新不伦瑞克省的人”。 当被问及天体物理学磁场时,ChatGPT 错误地提出“黑洞的(强)磁场是由其附近极强的引力产生的”的理论。 快公司要求 ChatGPT 生成一篇关于特斯拉上一财季的新闻文章; ChatGPT 创建了一篇连贯的文章,但编造了其中包含的财务数字。

人们认为,自然语言模型产生幻觉数据的可能原因有很多。

分类
根据模型输出与输入信息源的关系,幻觉可分为:
*封闭域幻觉:在给定上下文中生成超出信息源的虚构内容;
*开放域幻觉:模型在无特定输入背景下生成错误信息,例如虚构文献、案例或数据。

从矛盾来源划分,幻觉可分为:
*输入矛盾幻觉:模型输出与用户指令或输入信息不一致;
*上下文矛盾幻觉:生成内容内部前后不一致;
*事实矛盾幻觉:输出与现实世界知识相冲突。

成因
数据层
大模型依赖于规模巨大的语料或图像集合进行预训练。为提高效率与降低成本,数据收集常采用启发式、自动化或弱监督方法,而非对所有样本进行人工严格校验。这种做法虽能迅速扩展数据规模,但易引入噪声、误标或来源不明的信息配对,从而使训练数据本身含有与输入不一致或不可验证的目标文本/标签。在模型学习阶段,这些不忠实或嘈杂的训练样本会被吸收为“知识”,进而在生成时以高置信度再现,导致幻觉的发生。

训练语料中的重复短语或近似样本会促使模型“记忆化”输出,而非学到泛化的映射,进而在无提示或长上下文情形下直接复制训练中见到的文本,造成与输入不一致的输出。相反,某些事实或语义类型在训练集中分布稀少(缺失),则会使模型在相关场景上出现高不确定性和错误补全,从而产生幻觉。跨区域、跨文化的数据采集与标注差异也可能引入系统性偏见,影响模型对事实的判定与表述。

随着指令微调与对齐过程对标注数据依赖加深,标注方式从人工向机器辅助甚至自动化转变,这既提高效率也带来一致性和质量问题。合成或模型生成的数据如果未经严格审核,就可能把“模型的错误”再循环进训练集中,形成反馈环,进一步加剧幻觉倾向。

与此同时,上述高维统计解释并非无争议。部分研究者质疑模型“发现隐藏正确特征”的说法,指出模型往往偏向利用表面统计规律而非掌握更深层次的语义或因果关系,因此其在对抗训练或实验室构造样本上取得的“正确性”难以推广到自然、真实世界的数据分布。换言之,即便模型在某些受控条件下能利用微弱纹理做出统计上合理的判断,其鲁棒性在现实场景中仍可能不足,从而在真实应用中表现出幻觉或错误。

模型的编码器负责将输入映射到内部表示,解码器根据该表示生成输出。如果编码阶段未能准确捕捉输入的核心事实或建立正确的实体关系,解码阶段可能依据错误或不完整的表示生成与输入不一致的文本(即内在幻觉)。当模型在表征空间中错误地将相似实体或事实关联时,输出会混淆两个或多个相似概念,导致事实性错误。大模型难以及时更新(模型知识的时效性问题)与灾难性遗忘现象,使得模型无法在保留既有能力的同时快速吸纳新事实,从而在面对新知识时产生事实性幻觉

主流模型大量采用相似架构(如Transformer)和类似的数据处理管线,这种“同质化”使得某一类设计缺陷或训练偏差可能被广泛复制到多种模型与产品中,从而在产业层面系统性放大幻觉风险。

伦理与法律风险
随着大模型在司法、医疗等高风险领域的应用,其幻觉输出可能造成不可逆的损害。在司法领域,若用于生成裁判文书的模型出现事实错误,可能直接影响司法公正及当事人权利;在医疗领域,若生成的诊疗建议或药品说明出现幻觉,将威胁患者生命安全;在在药品、法律文件等高精度翻译任务中,幻觉可能导致误导性内容传播,引发社会信任危机。

截至2026年6月14日,加拿大各法院及法庭已收到至少167份包含人工智能生成之虚构引文的诉讼材料,涉及51个法院及法庭。

评估方法
传统的度量指标(如BLEU、ROUGE)往往难以有效量化幻觉水平,且与人工评判的相关性较低。针对这一问题,依据评估的侧重点与幻觉成因,目前大模型幻觉的评估方法主要分为三类:基于数据文本的评估方法、基于模型的评估方法和基于多任务应用的评估方法;另一类是以源文本为参考,在评估时不依赖目标文本,更适用于多样化输出场景;还可以基于多参考文本的扩展方法。该类方法从数据层面评估模型的幻觉程度,常用于检测内在幻觉、封闭域幻觉及上下文矛盾幻觉。但其局限在于难以从语义理解层面准确识别幻觉,适用于事实矛盾幻觉与开放域幻觉,但其准确性依赖于信息提取模型的性能,可能因提取误差导致评估偏差(常用的模型有BERT, 以及在此基础上发展出的RoBERTa、DeBERTa等),适用于输入矛盾幻觉、上下文矛盾幻觉及事实矛盾幻觉等场景,但仍面临泛化能力与指标扩展性不足的问题。特别是,研究表明,语言模型不仅会产生幻觉,还会放大幻觉,即使是那些旨在缓解这一问题的模型也遇到了同样的问题。

根据幻觉的主要来源,常见的缓解方法可分为数据层方法、模型层方法和应用层方法三大类。通过删除不被数据支持的短语、去语境化处理以及语法修正等手段,生成忠实于源数据的文本样本,从而提升训练数据的准确性与流畅度,这类方法可低成本构建评测与训练语料,但仍需较高的人工标注投入;不确定性感知解码器,用于惩罚高不确定性预测;双解码器结构结合序列与树状结构解码以平衡语法与忠实性;约束解码方法通过词汇或结构约束提升语义正确性。

在模型训练或微调阶段引入幻觉抑制策略,是缓解幻觉的重要方向。通过修改或扩展损失函数,可以惩罚幻觉输出、鼓励事实一致生成。;多任务学习方法,共享编码器权重,在翻译、问答等多任务中联合训练,增强模型的对齐能力和通用性。例如:

专家模型与反专家模型是通过模型微调实现幻觉控制的另一类有效手段。其基本原理是利用不同性质的数据集引导模型行为:专家模型基于忠实(真实一致)的样本训练;反专家模型基于幻觉性样本训练。两者通过融合或权重控制实现幻觉的动态调节。。合理的提示设计可显著改善模型的忠实性。提示工程方法具有广泛的可扩展性,但其关键挑战在于如何设计合理的提示结构以确保输入有效引导模型生成忠实内容。。

实例
2023年5月,美國紐約一名律師利用ChatGPT,為同事處理的訴訟蒐集資料,搜尋以往相關案例。該名律師曾多次向ChatGPT確認案例的真偽,惟ChatGPT每次均回答案例真實,結果被對家律師揭發,至少6宗案例並不存在,似是偽造。該名律師其後表示,後悔依賴產生式人工智能,此前從未使用該技術搜尋案例,不知道ChatGPT提供的內容有可能是假。該名律師最終須接受紀律聆訊。

2025年6月,梁姓用户询问AI某高校信息,AI给出了虚构的内容,并承诺回答错误赔偿用户10万元人民币,而随后证实AI的回答确实有误。用户遂起诉索赔,杭州互联网法院经审理认为,人工智能不具有民事主体资格,承诺赔偿金额无效,驳回诉讼请求,原被告均未继续上诉。

2026年5月,一男子询问AI助手豆包机票退票手续费规则,AI回复称退票手续费为5%,但男子随后退费后发现手续费高达40%,亏损600元人民币。

参见

  • 人工智能
  • ChatGPT
  • 图灵测试
  • 垃圾进,垃圾出

註解
参考
外部連結

评论 (0)

  • 还没有评论,来抢沙发吧。