大模型到底是什么
用一个不需要数学的模型理解大语言模型:它在做什么、它不做什么,以及为什么这决定了你该怎么用它。
一、它的本职工作:预测下一个词
大语言模型(LLM)的核心机制出人意料地简单:给定一段文字,预测接下来最可能出现的词。把这个动作重复成千上万次,就生成了你看到的整段回答。
这个机制解释了很多现象。为什么 AI 写东西看起来很流畅?因为「通顺」正是预测训练的目标。为什么它会一本正经地编造事实?因为「像真话的句子」和「真话」在预测下一词的任务里并没有被严格区分——模型优先保证语言合理,而不是事实准确。
二、两件它做不到的事
它不查询数据库
回答不是从某个资料库里「检索」出来的,而是「生成」出来的。所以引用一个不存在的论文标题对它来说毫不费力,这被称为幻觉。
它没有持续记忆
每次对话都是一次全新的开始。它能记住的只有当前对话里出现过的内容,以及训练时沉淀进参数的知识。关掉窗口,一切清零。
那「联网搜索」是怎么回事
联网版本是外挂的能力:系统先把搜索到的网页内容塞进对话,模型再基于这些内容作答。这大幅提升了事实准确度,但也意味着答案质量取决于搜到了什么。
三、由此推出的使用姿势
理解了机制,正确的用法自然浮现:
第一,把事实核对留给自己。关键数字、引用、日期,用完要验。第二,把上下文喂给它。既然它只记得当前对话,你说得越完整,它答得越靠谱。第三,把「流畅」当成草稿而不是成品。AI 的初稿质量很高,但定稿的判断责任在你。
本节关键
大模型是一个「语言合理性引擎」,不是「事实引擎」。你负责事实,它负责表达和推理的组织形式。
本节小结
- LLM 的本质是基于海量文本训练出的「下一个词预测器」。
- 幻觉不是 bug,是机制的自然副产品——它优化语言合理性,不优化事实性。
- 没有对话外的记忆,也没有内置数据库;联网能力是外挂的检索。
- 正确姿势:喂足上下文、自己核对事实、把输出当草稿。
AI 认知