大模型幻觉机制
用通俗方式讲清 ChatGPT 为什么会「一本正经地胡说八道」——从 token、概率预测到训练机制的一次走通。
科技 · 科技 · 人工智能 · ChatGPT · 大模型 · 科普 · 作者:问学·科技 · 1 人学过
学什么:token 与分词机制(含中英文切分差异)、语言模型的概率预测本质、从「猜下一个 token」到「一本正经地编造」的逻辑跳跃、预训练目标(下一 token 预测)、人类反馈强化学习(RLHF)为何只能缓解而非根除幻觉、「我不确定」式回答只是表层话术、幻觉产生的三类技术原因(知识边界、训练数据偏差、解码策略)、如何判断模型是否在「假装谦虚」、基础对齐与安全机制概览
不学什么:Transformer 架构数学推导、具体 API 调用与编程实践、prompt 工程技巧、不同大模型横评
知识地图
Token 与分词机制——大模型读懂文字的最小单位
理解 token 是大模型处理文字的最小单位,掌握中英文切分差异及其对模型理解的影响。
本章是理解后续一切的物理基础。模型不直接处理『字』或『词』,而是处理 token;中英文切分规则的差异直接影响了模型对同一段文本的理解粒度,进而影响其生成内容的可靠性。
语言模型的概率预测本质
理解『猜下一个 token』不是简单接龙,而是从概率分布中采样;理解这种本质为何导致输出『流畅却可能失真』。
本章是连接『切分』与『幻觉』的桥梁。模型在每一步都是从整个词表上的概率分布中挑出下一个 token,这种『逐 token 概率最大化』的训练目标与『输出真实信息』之间存在天然张力。
幻觉的定义与三类技术成因
掌握幻觉产生的三大技术根源——知识边界、训练数据偏差、解码策略——并能对一个具体幻觉判断其最可能的成因。
本章是整张地图的核心模块之一,把『猜下一个 token 为什么会变成自信地编造』拆解为三条可理解的技术路径:模型『不知道』自己不知道、训练数据本身就有错、生成时的解码方式放大了冒险倾向。三类成因常共同作用。
RLHF 的边界与对齐安全的更广图景
理解 RLHF 在做什么、它为什么能改善『礼貌度』和『有用性』却无法根除幻觉,并建立对齐与安全机制的整体边界感。
本章是第二个核心模块。RLHF 把『对不对』这一信号引入训练流程,但它的优化对象是『整体回答质量的人类偏好』,而不是『每个 token 是否为真』,导致它能压住最显眼的胡说八道,却无法让模型在内部真正区分『知道』与『不知道』。在此基础上,本章最后把视野再拉远一格,让读者知道 RLHF 只是对齐安全这条大河的一条支流。
『我不确定』是表层话术——如何识别假装谦虚
学会判断模型是在『真诚表达不确定』还是『套用话术应付』,并理解这种区分背后的技术根源。
本章聚焦 RLHF 留下的一个具体漏洞:模型内部对『自己知道什么』其实有表征,但被训练出来的『我不确定』只是一种学来的话术,并非来自内部认知信号。用户必须学会从回答模式中识别这种『假装谦虚』。
评估机制的反向激励与用户认知
理解当前『答对得分、答错不扣分』的评估体系如何反向激励模型『自信地编』,并建立作为普通用户对大模型的整体认知定位。
本章把视角从单次生成拉到系统层面。现有『答对得分、答错不扣分』的评估机制本身就在反向激励模型自信地编造,让诚实承认不知道变成系统性惩罚。这套系统级压力最终要由用户来对冲:必须把大模型看作『高覆盖低置信的合作者』,对关键信息保持独立验证习惯。