大模型为什么“会说话”?从“接龙游戏”讲起

先给结论 大模型(比如 ChatGPT 背后的 GPT)本质上是一个极其擅长玩文字接龙的机器:给它一段开头,它根据"经验"预测下一个最合适的词,再预测下一个……直到生成完整回答。它的"经验",来自读过的海量人类文本。 用生活场景理解 想象一个小孩读了十万本书之后,你给他一个开头:“今天天气很好,我们去公园”,他大概率会接"散步"“玩”——因为他读过的书里,这种搭配出现得最多。 大模型做的事一模一样,只是规模惊人: 读的书:几乎整个互联网的公开文本(维基百科、论文、书籍、代码……)。 “接龙"的本事:不是死记硬背,而是学会了词与词之间的"统计规律"和深层模式。 参数:几千亿个可调旋钮,共同决定"下一个词"怎么选。 为什么它看起来"懂"了 接龙接得足够好,就会涌现出"理解"的假象——不,准确说是涌现出真正的能力:能翻译、能写代码、能推理。就像围棋 AI 最初只是学"哪步赢面大”,最终却"会"了围棋。 但它有三个本质局限: 会一本正经地胡说八道(幻觉):它从不对"事实"负责,只对"像不像"负责。 知识有截止日期:只知道自己读过的,不知道之后发生的。 不会真正"思考":没有目标、没有意图,只是在给定开头时算出最合理的下文。 一句话总结 大模型 = 一台读过全网、把"接龙"玩到极致、从而涌现出理解和创作能力的机器。用得好,它是生产力;要清楚,它从不保证自己说的都是真的。

2026-08-08 · 1 分钟 · 星哥