2017 年,Google 的一篇论文《Attention Is All You Need》改写了 AI 的历史。论文提出的 Transformer 架构,凭借一个核心创新——自注意力机制,让 AI 从此可以并行处理长文本,催生了我们今天看到的 ChatGPT 等大模型。
一、Transformer 之前的困境
在 Transformer 出现之前,AI 处理语言主要依赖一种叫循环神经网络(RNN)的模型。你可以把它想象成一个”单线程”的阅读者——读句子时,必须一个字一个字、按顺序处理。
比如这句话:“我昨天在公园里看见一只可爱的小猫。”
RNN 在处理”小猫”这个词时,需要记住前面”我""昨天""公园”等所有信息。短句子还好,但一旦句子变长,读到后面就忘了前面——这就是长距离依赖问题。
更糟糕的是,RNN 这种”一个一个来”的方式非常低效,就像一条生产线一次只能处理一个零件,无法并行。这严重限制了模型可以训练到多大。
二、自注意力机制:AI 的”全局视野”
Transformer 的核心创新叫做自注意力机制(Self-Attention)。它解决的就是上面两个问题:既看得远,又看得快。
一个比喻
读这句话:“它把苹果递给了我,因为它熟了。”
你的大脑会自动理解:第一个”它”指的是人,第二个”它”指的是”苹果”。你是怎么做到的?因为在阅读时,你的大脑会不自觉地关注句子中不同词语之间的关联。
自注意力机制提供了一种计算词元间关系的方法。 它是否、以及在多大程度上对应人类认知机制,是另一个需要实验证据的问题。当模型处理一个 token 时,会计算它与可见上下文中其他 token 的注意力权重:
- 对”熟了”这个词 → 模型会给”苹果”打高分
- 对”递给了我” → 模型会给第一个”它”打高分
两个革命性的好处
-
解决长距离依赖:不管两个词相隔多远,自注意力都能直接建立联系。读到第 1000 个字时,依然能”记住”第 3 个字。
-
支持并行计算:不再需要一个接一个地处理。模型可以一次性”看到”整个句子,同时计算所有词语之间的关联。这为训练千亿参数的大模型铺平了道路。
三、Transformer 的三种常见形态
2017 年原始 Transformer 用于机器翻译,采用 Encoder-Decoder:
输入: "一只可爱的小猫"
↓
【编码器 Encoder】
"理解"输入内容,捕捉深层含义
通过自注意力分析每个词之间的关系
↓
生成一个充满信息的数学表示
↓
【解码器 Decoder】
参考编码器的理解,逐词生成输出
生成每个词时也会回顾已生成的部分
↓
输出: "A cute little cat"
可以把它想象成一个翻译团队:
- 编码器相当于”理解者”,负责深入读懂原文。
- 解码器相当于”表达者”,根据理解写出最精准的译文。
两者配合,实现从输入序列到输出序列的转换。但现代模型不一定同时包含两部分:
| 架构 | 代表模型 | 典型用途 |
|---|---|---|
| Encoder-only | BERT | 分类、检索表征、序列标注 |
| Decoder-only | GPT 类模型 | 自回归文本生成,也是当前多数生成式 LLM 的常见形态 |
| Encoder-Decoder | T5、原始 Transformer | 翻译、摘要等输入到输出任务 |
因此,“Transformer”指一组以注意力模块为核心的架构,不等于固定的 Encoder+Decoder 组合。
四、为什么 Transformer 改变了世界?
Transformer 的出现是 AI 发展史上的里程碑,影响力体现在三个方面:
1. 催生了大语言模型
Transformer 的并行训练能力和扩展性推动了 GPT 等大规模生成模型,也催生了 BERT。需要注意,原始 BERT Base 和 BERT Large 约为 1.1 亿和 3.4 亿参数,并不是数千亿参数;不同 Transformer 模型的规模差异可以非常大。
2. 应用领域远超文本
Transformer 架构的通用性令人惊叹。除了机器翻译和文本生成,它还被成功应用于:
- 计算机视觉:图像分类、目标检测(Vision Transformer)
- 生物信息学:蛋白质序列分析(AlphaFold)
- 语音识别:端到端的语音模型
3. 成为现代 AI 的核心架构
如今,几乎所有前沿 AI 模型都构建在 Transformer 或其变体之上。它已经从一个”创新”变成了”基础设施”。
五、一句话总结自注意力
让数据内部每个元素都能动态地、自主地和其他所有元素建立联系。
这个思想是具有普适性的——不只是语言,图片的每个像素块之间、蛋白质的每个氨基酸之间,都可以用同样的思路建立关系。这也是为什么 Transformer 能从 NLP 领域”出圈”,影响整个 AI 的发展。
小结
- RNN 的痛点:长距离依赖差 + 无法并行,限制了模型规模。
- 自注意力机制:让模型同时关注整句话所有词的关系,解决了”看得远”和”算得快”两个问题。
- 三类架构:Encoder-only、Decoder-only 和 Encoder-Decoder 分别适合不同任务;生成式 LLM 常见的是 Decoder-only。
- Transformer 的遗产:大模型时代的基石,应用远超文本领域。
下一篇,我们来看 LLM 是如何从概率分布中”选择”下一个 token 的——推理与采样策略,这决定了 AI 是”循规蹈矩”还是”天马行空”。