跳至正文
来两杯美式
返回

LLM 工作原理(三):推理与采样策略——AI 如何选择下一个词

By 来两杯美式
发布于更新于

同样的问题,AI 有时给出严谨准确的回答,有时却能天马行空地创作。这背后是采样策略在起作用——它决定了 AI 如何从”可能的下一个词”中做选择。

一、不只是”最高概率”

前面我们说过,LLM 的核心是预测下一个 token。但这里有一个细节:模型输出的不是一个确定的词,而是一个概率分布

输入: "今天天气"
模型预测下一个 token 的概率:
  "很"   → 30%
  "真"   → 25%
  "非常" → 15%
  "比较" → 10%
  其他   → 20%

问题来了:怎么选?永远只选概率最高的那个吗?

如果每次都选最高概率,LLM 会变得非常无聊——对同一个问题永远给出同样的答案,毫无创造力。但如果随便选,又可能输出一堆胡言乱语。

采样策略,就是用来平衡”确定性”和”多样性”的。

二、四种核心采样策略

2.1 贪心解码(Greedy Decoding)

做法:每次选概率最高的 token。

输入: "今天天气"
选概率最高 → "很"(30%)
输入: "今天天气很"
选概率最高 → "好"(70%)
输入: "今天天气很好"
选概率最高 → "。"(60%)
输出: "今天天气很好。"
优点缺点
不引入随机采样,结果通常更稳定仍可能受模型版本、运行后端和数值计算影响,不能承诺跨环境完全复现
适合翻译、摘要等需要准确性的任务可能陷入重复循环

2.2 温度采样(Temperature Sampling)

做法:引入一个温度参数 T 来调节概率分布的”陡峭程度”。

输入: "写一个故事的开头"

T=0.3(保守):
"从前有一个小村庄,坐落在一片宁静的山谷中..."  ← 经典开局

T=1.5(创意):
"在第七维度的边缘,时间的裂缝中渗出蓝色的光..."  ← 天马行空

温度就像是 AI 的”创意滑块”——温度越低越稳重,越高越奔放。

2.3 Top-K 采样

做法:只从概率最高的 K 个候选中随机选择,直接排除那些不合理的低概率词。

典型值: K=40~50

概率分布: 好(30%) 热(20%) ... 冰雹(0.01%) 台风(0.005%)

Top-K=40: 只从前 40 个候选中选 → 自动排除了"冰雹""台风"等怪词

优点:避免选到明显不合理的词。 缺点:K 值固定不够灵活——对确定性强的场景,40 个候选太多;对发散性强的场景,40 个太少。

2.4 Top-P 采样(Nucleus Sampling)

做法:不固定候选数量,而是选择累积概率达到 P 的最小候选集合。

示例: P=0.9

高确定性场景: "今天天气很___"
前 3 个候选(好、热、差)累积概率已达到 92% → 只从这 3 个里选

低确定性场景: "他突然说了一句___"
可能需要 20 个候选才累积到 90% → 从 20 个里选

Top-P 的优势在于动态调整候选集合大小:分布集中时保留较少候选,分布分散时保留较多候选。具体是否使用、默认值是多少,要看模型和推理服务。

三、实战:如何搭配使用?

不同模型对采样参数的支持并不一致。对于同时支持 Temperature 和 Top-P 的 API,先固定其他参数、只调其中一个,通常更容易判断效果:

# 示例 A:只调 temperature
temperature = 0.7

# 示例 B:保持默认 temperature,只调 top_p
top_p = 0.9

下面只给出实验方向,不是跨模型通用的推荐值:

任务类型推荐配置原因
代码生成从较低随机性开始,对单测通过率做评测语法稳定不等于逻辑正确
创意写作逐步提高随机性,人工比较多样性与可读性防止低概率噪声破坏连贯性
客服对话以准确率、语气一致性和拒答表现调参不能只看“自然”
事实问答降低随机性并接入检索、引用和事实核验低温不能保证事实正确
头脑风暴适当提高随机性并保留筛选步骤多样性提升不代表质量提升

快速调参口诀:

小结

下一篇是本系列的终章,我们将从工程视角看 LLM 的三大实际问题——延迟、成本与幻觉,以及如何应对。


分享这篇文章:
通过邮件分享这篇文章✓ 链接已复制
查看系列全部文章
  1. 01.LLM 工作原理(一):从预测下一个字开始
  2. 02.LLM 工作原理(二):Transformer 与自注意力机制
  3. 03.LLM 工作原理(三):推理与采样策略——AI 如何选择下一个词
  4. 04.LLM 工作原理(四):延迟、成本与幻觉——工程落地三大挑战
  5. 05.Prompt Engineering 入门:与 AI 高效协作的第一课
  6. 06.零样本与少样本提示:AI 提示的两大基础技巧
  7. 07.Prompt 实用技巧与趣味实践:分隔符、条件检查与分步指令
  8. 08.思维链(CoT):让 AI 学会一步步思考
  9. 09.思维树(ToT):从线性推理到多分支探索
  10. 10.复杂任务拆解:像项目经理一样驾驭 AI
  11. 11.Prompt Engineering 高阶技巧与全景总结
  12. 12.生态 > 模型:大模型竞争的本质不是模型本身
  13. 13.大模型 vs 小模型,以及一场关于电价的算力战争

上一篇
LLM 工作原理(四):延迟、成本与幻觉——工程落地三大挑战
下一篇
LLM 工作原理(二):Transformer 与自注意力机制