报告正文
你问 AI 一个人生日,它张口就编,还编得特别自信
有人让 AI 报个专家的博士论文题目,它一口气给了三个答案,全错;再问这人生日,它又给了三个日期,还是全错——语气一次比一次笃定,跟查过户口本似的。
这场面你八成也撞见过:AI 一本正经地给你编参考文献、编法条、编一个根本不存在的 API。行话叫"幻觉"(hallucination)。今天把这事讲透——它不是坏了,也不是有意骗你,这是它的工作方式本身决定的。
一句话先给答案
大模型干的活,本质是"猜下一个最像的词",不是"去查这句话是不是真的"。
它嘴上说得再顺,脑子里也没有一个"事实数据库"在对照。它只是在算:接在你这句话后面,哪个词出现的概率最高。像不像真,是两码事。
那它到底在"想"什么?三个小点讲明白
第一,它是个"超强自动补全"。 手机打字时的联想输入,你打"今天天",它蹦出"气不错"。大模型是这玩意儿的究极加强版:吞了海量文本,练就一身"接话"的本事。它优化的目标从头到尾都是"接得像",而不是"接得对"。多数时候像=对("法国的首都是……巴黎"),但一旦碰到它没底的冷门事实,它照样硬接一个最顺口的——于是就编了。
第二,它学的时候,只见过"正确答案",没人教它说"我不知道"。 预训练阶段,模型看的全是网上的正常句子,没有谁在每句话后面贴个"真/假"标签。所以像语法、拼写这种有规律的东西它学得贼溜;可像某个人的生日这种一次性、无规律的冷知识,它天然容易错——这不是数据脏不脏的问题,OpenAI 的研究说,哪怕训练数据一个错都没有,这种错依然躲不掉。
第三,考试机制把它逼成了"宁可蒙、不肯认怂"。 这是最反直觉、也最关键的一点。业界给模型打分,长期是"答对加分、答错和'不知道'一个样"。你换位想想:蒙一下还有概率蒙对,老实说"我不确定"必然是零分——那当然是闭眼蒙更划算。于是模型被一路训练成了"自信满满的蒙题家"。它不是不懂装懂,是我们的评分规则,在奖励它装懂。
普通人怎么防?记住三条
- 别拿它当百科查精确事实。 具体的日期、数字、人名、法条、文献出处——这些正是幻觉高发区,一定另找权威源头交叉验证。
- 优先用"带检索"的。 联网/引用来源的模式(技术上叫 RAG,检索增强生成),是先去外部资料里翻一遍再回答,等于把闭卷考改成开卷考,还能点开看它引的原文。IBM 的说法是,这能实打实降低瞎编的概率——但注意,是降低,不是根除,检索到的料不对,它照样跟着错。
- 越自信越要多个心眼。 它的语气和它对不对,半毛钱关系没有。说得越溜的地方,越值得你回头核一下。

你自己用用无所谓,但换个场景呢
个人聊天时它编个生日,你笑笑就过去了。可把同一个"自信的蒙题家"塞进工业、能源这种严肃场景里呢?
一条产线的工艺参数、一份设备故障的判断、一个电网调度的建议——这里的"胡说八道"不再是笑料,是要出事的。所以真正把大模型往能源、工业里落地的人,第一件事从来不是比谁的模型更能聊,而是:怎么用检索增强、用行业知识库、用人来兜底,把幻觉这条命门死死摁住。
这,恰恰是 AI 从"会聊天的玩具"变成"能干活的生产力"之间,最难、也最值钱的那道坎。
想看清 AI 大模型在能源、工业里到底怎么落地、拐点在哪? 我们做了份《AI大模型工业能源落地全景与商业化拐点研究》——公众号后台回「AI」,领取试读。