跳至正文
来两杯美式
返回

LLM 工作原理(二):Transformer 与自注意力机制

By 来两杯美式
发布于更新于

2017 年,Google 的一篇论文《Attention Is All You Need》改写了 AI 的历史。论文提出的 Transformer 架构,凭借一个核心创新——自注意力机制,让 AI 从此可以并行处理长文本,催生了我们今天看到的 ChatGPT 等大模型。

一、Transformer 之前的困境

在 Transformer 出现之前,AI 处理语言主要依赖一种叫循环神经网络(RNN)的模型。你可以把它想象成一个”单线程”的阅读者——读句子时,必须一个字一个字、按顺序处理。

比如这句话:“我昨天在公园里看见一只可爱的小猫。”

RNN 在处理”小猫”这个词时,需要记住前面”我""昨天""公园”等所有信息。短句子还好,但一旦句子变长,读到后面就忘了前面——这就是长距离依赖问题

更糟糕的是,RNN 这种”一个一个来”的方式非常低效,就像一条生产线一次只能处理一个零件,无法并行。这严重限制了模型可以训练到多大。

二、自注意力机制:AI 的”全局视野”

Transformer 的核心创新叫做自注意力机制(Self-Attention)。它解决的就是上面两个问题:既看得远,又看得快。

一个比喻

读这句话:“它把苹果递给了我,因为它熟了。”

你的大脑会自动理解:第一个”它”指的是人,第二个”它”指的是”苹果”。你是怎么做到的?因为在阅读时,你的大脑会不自觉地关注句子中不同词语之间的关联。

自注意力机制提供了一种计算词元间关系的方法。 它是否、以及在多大程度上对应人类认知机制,是另一个需要实验证据的问题。当模型处理一个 token 时,会计算它与可见上下文中其他 token 的注意力权重:

两个革命性的好处

  1. 解决长距离依赖:不管两个词相隔多远,自注意力都能直接建立联系。读到第 1000 个字时,依然能”记住”第 3 个字。

  2. 支持并行计算:不再需要一个接一个地处理。模型可以一次性”看到”整个句子,同时计算所有词语之间的关联。这为训练千亿参数的大模型铺平了道路。

三、Transformer 的三种常见形态

2017 年原始 Transformer 用于机器翻译,采用 Encoder-Decoder:

输入: "一只可爱的小猫"

    【编码器 Encoder】
    "理解"输入内容,捕捉深层含义
    通过自注意力分析每个词之间的关系

    生成一个充满信息的数学表示

    【解码器 Decoder】
    参考编码器的理解,逐词生成输出
    生成每个词时也会回顾已生成的部分

输出: "A cute little cat"

可以把它想象成一个翻译团队:

两者配合,实现从输入序列到输出序列的转换。但现代模型不一定同时包含两部分:

架构代表模型典型用途
Encoder-onlyBERT分类、检索表征、序列标注
Decoder-onlyGPT 类模型自回归文本生成,也是当前多数生成式 LLM 的常见形态
Encoder-DecoderT5、原始 Transformer翻译、摘要等输入到输出任务

因此,“Transformer”指一组以注意力模块为核心的架构,不等于固定的 Encoder+Decoder 组合。

四、为什么 Transformer 改变了世界?

Transformer 的出现是 AI 发展史上的里程碑,影响力体现在三个方面:

1. 催生了大语言模型

Transformer 的并行训练能力和扩展性推动了 GPT 等大规模生成模型,也催生了 BERT。需要注意,原始 BERT Base 和 BERT Large 约为 1.1 亿和 3.4 亿参数,并不是数千亿参数;不同 Transformer 模型的规模差异可以非常大。

2. 应用领域远超文本

Transformer 架构的通用性令人惊叹。除了机器翻译和文本生成,它还被成功应用于:

3. 成为现代 AI 的核心架构

如今,几乎所有前沿 AI 模型都构建在 Transformer 或其变体之上。它已经从一个”创新”变成了”基础设施”。

五、一句话总结自注意力

让数据内部每个元素都能动态地、自主地和其他所有元素建立联系。

这个思想是具有普适性的——不只是语言,图片的每个像素块之间、蛋白质的每个氨基酸之间,都可以用同样的思路建立关系。这也是为什么 Transformer 能从 NLP 领域”出圈”,影响整个 AI 的发展。

小结

下一篇,我们来看 LLM 是如何从概率分布中”选择”下一个 token 的——推理与采样策略,这决定了 AI 是”循规蹈矩”还是”天马行空”。


分享这篇文章:
通过邮件分享这篇文章✓ 链接已复制
查看系列全部文章
  1. 01.LLM 工作原理(一):从预测下一个字开始
  2. 02.LLM 工作原理(二):Transformer 与自注意力机制
  3. 03.LLM 工作原理(三):推理与采样策略——AI 如何选择下一个词
  4. 04.LLM 工作原理(四):延迟、成本与幻觉——工程落地三大挑战
  5. 05.Prompt Engineering 入门:与 AI 高效协作的第一课
  6. 06.零样本与少样本提示:AI 提示的两大基础技巧
  7. 07.Prompt 实用技巧与趣味实践:分隔符、条件检查与分步指令
  8. 08.思维链(CoT):让 AI 学会一步步思考
  9. 09.思维树(ToT):从线性推理到多分支探索
  10. 10.复杂任务拆解:像项目经理一样驾驭 AI
  11. 11.Prompt Engineering 高阶技巧与全景总结
  12. 12.生态 > 模型:大模型竞争的本质不是模型本身
  13. 13.大模型 vs 小模型,以及一场关于电价的算力战争

上一篇
LLM 工作原理(三):推理与采样策略——AI 如何选择下一个词
下一篇
LLM 工作原理(一):从预测下一个字开始