许多 LLM 的基础训练目标是预测下一个 token;它们没有像传统数据库那样逐条检索事实的内置机制。那它们为什么能表现出复杂能力?从这个简单目标开始理解。
一、一个接龙游戏
想象你在玩一个简单的文字接龙:
- 输入:“今天天气很”
- 你来猜:下一个字可能是?
大概率你会想:“好”(60%)、“热”(20%)、“冷”(15%)、其他(5%)。
这是自回归 LLM 生成文本的核心过程。 它根据前文上下文计算下一个 token 的概率分布,再按解码策略选出一个 token,并将其加入上下文、继续循环。
输入: "今天天气很"
↓ 预测下一个 token
输出: "好"
↓ 加入上下文
输入: "今天天气很好"
↓ 预测下一个 token
输出: ","
↓ 继续循环...
最终: "今天天气很好,适合出去走走。"
一段看似深刻的回答,本质上就是这样一次次的”预测→输出→预测→输出”的连锁反应。
二、什么是 Token?
你可能注意到了,上面反复提到 token 而不是”字”或”词”。这是因为 LLM 并不直接处理文字,而是处理 token——文本被拆分后的最小处理单元。
| 语言 | Token 化方式 | 示例 |
|---|---|---|
| 中文 | 可能是一个字、词的一部分或多个字 | “我很高兴”的切分取决于具体 tokenizer |
| 英文 | 可能是完整单词或子词 | “unbelievable”可能被切成一个或多个 token |
| 通用 | 标点、空格也可能参与 token 化 | 同一文本在不同模型上可能得到不同切分 |
一句话理解:token 就是 LLM 的”最小阅读单位”。就像我们读书时一个字一个字地看,LLM 是一个 token 一个 token 地处理。
三、它并不是一个数据库
新手最容易产生的误解:
- ❌ “LLM 把维基百科、教科书都背下来了”
- ❌ “它有一个索引系统,问问题时去查找答案”
更准确地说:LLM 是一个神经网络,参数规模可以从较小模型的数亿到大型模型的数百亿乃至更高。 训练过程通过大量数据调整参数,让它学习语言和任务中的统计结构。知识不是以可直接查询的文档条目存放,而是以分布式方式编码在参数中。
不同模型的数据规模差异很大,有些前沿模型会处理万亿级 token,有些小模型远少于此。无论规模大小,训练数据都不可能完整、无偏且实时地覆盖“人类全部知识”。
四、简单的预测,为什么会产生”智能”?
既然只是预测下一个词,为什么 ChatGPT 能写诗、编程、分析问题?答案是三个关键要素的叠加效应:
要素 1:统计学习
LLM 通过自监督训练,从文本中自动提取统计模式:
- 语法规律:“的”后面通常跟名词
- 语义关联:“医生”和”处方”经常一起出现
- 隐含知识:“巴黎是法国的首都”在训练数据中高频共现
这些规律不是人工编写的,而是从数据中自动涌现的。
要素 2:海量训练数据
训练数据通常覆盖多个领域和表达方式,但具体规模、来源、时间范围和质量因模型而异,也必然存在缺口、重复、噪声与偏差。
规模带来质变:当数据量足够大,简单的统计规律能逼近复杂的智能行为——这就是”涌现”。
要素 3:超强推理算力
训练所需算力取决于模型规模、数据量、硬件和训练方法:小模型可以用较少资源训练,前沿模型则可能需要大型加速器集群。更多算力让研究者训练更大模型、处理更多数据,但能力提升仍取决于架构、数据、训练目标和后训练方法。
这些因素共同影响模型能力,但不存在适用于所有 LLM 的固定参数量、数据量或硬件门槛。
五、智能 ≠ 理解
一个需要保持谨慎的认知:LLM 的能力不等同于人类的主观理解。 “理解”本身也是认知科学与哲学中的开放问题。
- 它并没有人类的主观体验;其内部表征和人类概念理解也不能简单画等号
- 它的输出由参数、上下文和解码策略共同决定,不能把流畅表达当作事实保证
- 它没有主观体验,没有意图,没有意识
但它可以通过模式匹配,完成复杂对话、解决数学题、写代码——因为这些任务中的规律,已经被编码在了参数中。
核心洞察:预测下一个 token 是理解 LLM 的重要起点,但它不足以单独解释所有能力、局限和安全风险。
小结
- 许多自回归 LLM 的基础目标:根据上下文预测下一个 token;完整系统还可能包含后训练、推理计算、工具与检索。
- Token 是 tokenizer 切分出的处理单元,具体边界依赖模型。
- 智能来源于统计:统计学习 + 海量数据 + 超强算力的涌现效应。
- 它不具有人类式主观体验,但强大的模式建模能力可以表现出复杂能力。
下一篇,我们来看看让这一切成为可能的关键架构——Transformer 与自注意力机制,它是如何让 AI “既看得远,又看得快”的。