基础篇教你”告诉 AI 做什么”,进阶篇教你”引导 AI 怎么想”。思维链(Chain of Thought),就是引导 AI 思考的第一招。
一、从”直接回答”到”先思考再回答”
为什么 AI 会在复杂任务上”犯傻”?
我们先来看一个简单的逻辑题:
一个篮子里有 10 个苹果,小明拿走了 2 个,小红又放进来了 5 个,
后来篮子不小心翻了,掉出去了 3 个。请问篮子里最后还剩几个苹果?
如果你直接问 AI,它可能回答正确,也可能出错。LLM 会基于上下文进行复杂计算,再按概率生成 token;“下一个 token 预测”本身既不能证明它拥有人的主观思考,也不能证明内部没有推理计算。 对多步任务,要求模型列出可检查的中间结果,有时能改善表现,但展示出来的文字不是对内部计算过程的可靠读取。
想象一下,你自己在解这道题时,是不是心里默念:“10 个,拿走 2 个剩 8 个,放进 5 个变 13 个,掉了 3 个剩 10 个”?——这就是”思考过程”。
思维链的核心思想
思维链(Chain of Thought,简称 CoT) 的核心就是:在 Prompt 中引导模型在给出最终答案之前,先输出它的推理步骤。
最常见的零样本 CoT 提示只有一句话:
Let's think step by step.(让我们一步一步地思考。)
这类提示在一些多步推理任务上可能改善结果,但效果依赖模型、任务、提示和评测集;它不是保证正确的“魔咒”。对需要高可靠性的任务,应验证最终答案和外部事实,而不是只相信展示出来的步骤。
为什么这行得通?
- 拆解复杂度:复杂问题被拆成多个简单步骤,每一步都是模型擅长处理的”小问题”。
- 注意力聚焦:输出中间步骤的过程,让模型的注意力始终集中在当前推理上,而不是”跳跃”到答案。
- 便于检查:将计算和假设写出来,用户更容易发现明显遗漏或算术错误。
- 有限可解释性:展示的步骤是模型生成的说明,不等于可验证的内部思维轨迹;仍要独立核验关键结论。
二、CoT 实战演示
基础版:一句魔咒就够了
一个篮子里有 10 个苹果,小明拿走了 2 个,小红又放进来了 5 个,
后来篮子不小心翻了,掉出去了 3 个。请问篮子里最后还剩几个苹果?
请一步一步地列出你的计算过程。
AI 的典型输出可能是:
让我们一步一步地计算:
1. 初始有 10 个苹果。
2. 小明拿走了 2 个,剩余 10 - 2 = 8 个。
3. 小红放进来 5 个,现在有 8 + 5 = 13 个。
4. 篮子翻了,掉出去 3 个,最终剩余 13 - 3 = 10 个。
答案:篮子里最后还剩 10 个苹果。
有了推导过程,你不仅得到了答案,还能确认推理是否正确。
进阶版:在 Prompt 中嵌入推理模板
除了通用的”一步一步思考”,你还可以给模型提供推理模板,让它按你的框架思考:
你是一个数学辅导老师。请用以下框架解答学生的每一个问题:
第一步:理解问题——用自己的话复述题目,明确已知条件和未知量。
第二步:制定策略——确定用什么方法或公式来解决。
第三步:执行计算——逐步计算,展示每一步。
第四步:验证——用另一种方法验算结果是否合理。
问题:一座桥长 200 米,一列火车以 72 千米/小时的速度通过这座桥,
从车头上桥到车尾离桥共用了 12 秒。求这列火车的长度是多少米?
CoT 适用的场景
| 场景 | 示例 |
|---|---|
| 数学计算 | 多步算术、方程求解、应用题 |
| 逻辑推理 | 推理题、谜题、逻辑推导 |
| 代码调试 | 解释代码逻辑、追踪 Bug |
| 步骤规划 | 行程安排、项目规划 |
| 复杂分析 | 多因素决策、利弊分析 |
不适用 CoT 的场景
- 简单事实问答(“地球的直径是多少?”)
- 需要直觉和跳跃性思维的创意任务(写诗、起名)
- 对速度要求极高、推理链价值不大的场景
三、CoT 的变体:零样本 CoT 与少样本 CoT
CoT 有两种主要的应用方式:
零样本 CoT
就是前面演示的——不加范例,直接在指令中要求”一步一步思考”。适合通用推理任务。
请逐步分析以下论点,并指出其逻辑漏洞。
论点:"所有成功人士都早睡早起,张三是成功人士,所以张三一定早睡早起。"
少样本 CoT
提供包含推理步骤的范例,让模型不仅模仿答案格式,还模仿推理方式。
请解答以下数学题,并展示完整的推理过程。
示例题目:"小明有 5 个苹果,小红给了他 3 个,他又吃掉了 2 个,还剩几个?"
示例解答:
- 初始:5 个
- 小红给了 3 个:5 + 3 = 8 个
- 吃掉了 2 个:8 - 2 = 6 个
- 答案:6 个
现在请解答:"一个水池有进水管和出水管,进水管每小时注入 3 吨水,
出水管每小时排出 2 吨水。如果水池初始有 10 吨水,
3 小时后水池里有多少吨水?"
四、CoT 的局限性
虽然 CoT 很强大,但它不是万能药:
- 单一路径的局限:一次 CoT 通常只展开一条候选路径;如果早期假设错误,后续可能沿着错误方向继续。可以通过采样多个候选、工具验证或显式复核来缓解。
- 不适合开放性问题:对于需要”多方向探索”而非”一条路走到底”的任务(如头脑风暴、策略制定),CoT 会把思维局限在单一路径上。
- 对模型规模有要求:小模型可能无法稳定执行 CoT,推理质量参差不齐。
这就引出了我们的下一个话题——如何突破 CoT 的单一路径限制。下一篇,我们将学习思维树(Tree of Thoughts),用”多分支探索”的方式,让 AI 在每一个关键决策点都停下来做”头脑风暴”。
小结
- CoT = “一步一步思考”,引导模型在给答案前先输出推理过程。
- 可以从一句
Let's think step by step开始,但要按任务实测其效果。 - 适用场景:数学计算、逻辑推理、代码调试、步骤规划。
- 局限:线性思维,一旦中间出错可能无法自我修正。
提示词工程不是死记硬背的理论,而是一门手艺活。亲手试一次,感受”一步一步”带来的质变,远比读十篇文章更有用。