跳至正文
来两杯美式
返回

LLM 工作原理(一):从预测下一个字开始

By 来两杯美式
发布于更新于

许多 LLM 的基础训练目标是预测下一个 token;它们没有像传统数据库那样逐条检索事实的内置机制。那它们为什么能表现出复杂能力?从这个简单目标开始理解。

一、一个接龙游戏

想象你在玩一个简单的文字接龙:

大概率你会想:“好”(60%)、“热”(20%)、“冷”(15%)、其他(5%)。

这是自回归 LLM 生成文本的核心过程。 它根据前文上下文计算下一个 token 的概率分布,再按解码策略选出一个 token,并将其加入上下文、继续循环。

输入: "今天天气很"
  ↓ 预测下一个 token
输出: "好"
  ↓ 加入上下文
输入: "今天天气很好"
  ↓ 预测下一个 token
输出: ","
  ↓ 继续循环...
最终: "今天天气很好,适合出去走走。"

一段看似深刻的回答,本质上就是这样一次次的”预测→输出→预测→输出”的连锁反应。

二、什么是 Token?

你可能注意到了,上面反复提到 token 而不是”字”或”词”。这是因为 LLM 并不直接处理文字,而是处理 token——文本被拆分后的最小处理单元。

语言Token 化方式示例
中文可能是一个字、词的一部分或多个字“我很高兴”的切分取决于具体 tokenizer
英文可能是完整单词或子词“unbelievable”可能被切成一个或多个 token
通用标点、空格也可能参与 token 化同一文本在不同模型上可能得到不同切分

一句话理解:token 就是 LLM 的”最小阅读单位”。就像我们读书时一个字一个字地看,LLM 是一个 token 一个 token 地处理。

三、它并不是一个数据库

新手最容易产生的误解:

更准确地说:LLM 是一个神经网络,参数规模可以从较小模型的数亿到大型模型的数百亿乃至更高。 训练过程通过大量数据调整参数,让它学习语言和任务中的统计结构。知识不是以可直接查询的文档条目存放,而是以分布式方式编码在参数中

不同模型的数据规模差异很大,有些前沿模型会处理万亿级 token,有些小模型远少于此。无论规模大小,训练数据都不可能完整、无偏且实时地覆盖“人类全部知识”。

四、简单的预测,为什么会产生”智能”?

既然只是预测下一个词,为什么 ChatGPT 能写诗、编程、分析问题?答案是三个关键要素的叠加效应:

要素 1:统计学习

LLM 通过自监督训练,从文本中自动提取统计模式:

这些规律不是人工编写的,而是从数据中自动涌现的。

要素 2:海量训练数据

训练数据通常覆盖多个领域和表达方式,但具体规模、来源、时间范围和质量因模型而异,也必然存在缺口、重复、噪声与偏差。

规模带来质变:当数据量足够大,简单的统计规律能逼近复杂的智能行为——这就是”涌现”。

要素 3:超强推理算力

训练所需算力取决于模型规模、数据量、硬件和训练方法:小模型可以用较少资源训练,前沿模型则可能需要大型加速器集群。更多算力让研究者训练更大模型、处理更多数据,但能力提升仍取决于架构、数据、训练目标和后训练方法。

这些因素共同影响模型能力,但不存在适用于所有 LLM 的固定参数量、数据量或硬件门槛。

五、智能 ≠ 理解

一个需要保持谨慎的认知:LLM 的能力不等同于人类的主观理解。 “理解”本身也是认知科学与哲学中的开放问题。

但它可以通过模式匹配,完成复杂对话、解决数学题、写代码——因为这些任务中的规律,已经被编码在了参数中。

核心洞察:预测下一个 token 是理解 LLM 的重要起点,但它不足以单独解释所有能力、局限和安全风险。

小结

  1. 许多自回归 LLM 的基础目标:根据上下文预测下一个 token;完整系统还可能包含后训练、推理计算、工具与检索。
  2. Token 是 tokenizer 切分出的处理单元,具体边界依赖模型。
  3. 智能来源于统计:统计学习 + 海量数据 + 超强算力的涌现效应。
  4. 它不具有人类式主观体验,但强大的模式建模能力可以表现出复杂能力。

下一篇,我们来看看让这一切成为可能的关键架构——Transformer 与自注意力机制,它是如何让 AI “既看得远,又看得快”的。


分享这篇文章:
通过邮件分享这篇文章✓ 链接已复制
查看系列全部文章
  1. 01.LLM 工作原理(一):从预测下一个字开始
  2. 02.LLM 工作原理(二):Transformer 与自注意力机制
  3. 03.LLM 工作原理(三):推理与采样策略——AI 如何选择下一个词
  4. 04.LLM 工作原理(四):延迟、成本与幻觉——工程落地三大挑战
  5. 05.Prompt Engineering 入门:与 AI 高效协作的第一课
  6. 06.零样本与少样本提示:AI 提示的两大基础技巧
  7. 07.Prompt 实用技巧与趣味实践:分隔符、条件检查与分步指令
  8. 08.思维链(CoT):让 AI 学会一步步思考
  9. 09.思维树(ToT):从线性推理到多分支探索
  10. 10.复杂任务拆解:像项目经理一样驾驭 AI
  11. 11.Prompt Engineering 高阶技巧与全景总结
  12. 12.生态 > 模型:大模型竞争的本质不是模型本身
  13. 13.大模型 vs 小模型,以及一场关于电价的算力战争

上一篇
LLM 工作原理(二):Transformer 与自注意力机制
下一篇
React 核心(17):TanStack Query 缓存机制详解