跳至正文
来两杯美式
返回

LLM 工作原理(四):延迟、成本与幻觉——工程落地三大挑战

By 来两杯美式
发布于更新于

理解了 LLM 怎么工作,接下来要面对现实问题:它太慢了怎么办?太贵了怎么办?一本正经地胡说八道怎么办?这是每个 LLM 应用开发者绕不开的三道坎。

一、延迟问题:用户等不及

什么是延迟?

LLM 的延迟(Latency)指从发送请求到获得响应的时间。我们通常关注两个指标:

体验目标:聊天场景通常应尽量缩短首字延迟;可接受阈值取决于任务复杂度、是否流式输出和用户预期,应结合真实用户数据设定 SLO。

延迟为什么会高?

因素说明
模型与服务配置更强或更大的模型通常可能更慢,但实际延迟也受服务档位、批处理和推理优化影响
上下文长度输入的 prompt 越长,计算量越大。处理 32K tokens 远比 4K tokens 慢
基础设施GPU 型号、网络速度、服务器位置都有影响
并发压力同时请求的人越多,排队时间越长

优化策略

选小模型   → 简单任务不需要最大模型,能用小的就别用大的
精简 Prompt → 移除冗余信息,每省 1000 个 token 都是真金白银
流式输出   → 边生成边展示,用户看到第一个字就感觉"在动了"
缓存机制   → 高频问题缓存答案,不用每次都算一遍

关键思路:延迟优化不是一味加硬件,很多时候是选择合适的模型 + 精简上下文

二、成本问题:每一字都要钱

成本构成

使用第三方 API(如 OpenAI),成本按 token 计费:

总费用 = 输入 token 数 × 输入单价 + 输出 token 数 × 输出单价

不同模型的价格差异巨大——最强模型可能是基础模型的 10-30 倍。

如果自建服务,成本还包括 GPU 采购/租赁、电力和运维人力。是否自部署取决于吞吐、数据边界、模型许可、团队运维能力和总体拥有成本,不应只按应用规模判断。

成本控制的核心策略:模型分级

不需要所有问题都请”最贵的专家”:

简单问题(打招呼、常见FAQ)
  → 小模型(如 Qwen 14B)
  → 成本较低,但仍应计入调用、托管或硬件成本

复杂问题(逻辑推理、专业分析)
  → 大模型(如 GPT-4、Claude)
  → 按需使用

这种做法常能降低成本,但节省幅度取决于流量结构、路由准确率和模型价差;应通过离线评测与线上监控确认核心体验没有下降。

其他技巧:设置 max_tokens 限制输出长度、明确要求简洁回答、定期监控 API 调用热点。

三、幻觉问题:AI 也会胡说八道

什么是幻觉?

幻觉(Hallucination)指的是 LLM 生成的内容看似合理,但实际上是错误的、编造的。典型例子:

为什么会”睁眼说瞎话”?

这不是 bug,而是 LLM 工作方式的必然结果:

  1. 它是预测模型,不是知识库——它学会了”像人类一样说话”,但不一定”说真话”
  2. 训练数据有噪声——数据中本来就包含错误信息
  3. 参数知识有时间边界——训练之后的信息不会自动写进模型权重,但可以通过当前上下文、检索和工具提供
  4. 过度追求流畅——当没有确切答案时,倾向于”编”一个流畅的,而非承认不知道

缓解策略

常用方法之一:RAG(检索增强生成)

传统方式:
用户提问 → LLM 直接回答(可能产生幻觉)

RAG 方式:
用户提问 → 先从可信知识库检索相关文档 → LLM 基于检索结果回答

外部知识库能为回答提供可核查依据,但错检索、过期文档、上下文冲突和模型误读仍会造成错误。RAG 是否降低幻觉,应以引用正确性和任务级评测验证。

其他辅助手段:

策略做法
Prompt 约束明确指示”如果不知道就说不知道”
降低温度事实性任务用 T=0~0.3,减少随机性
独立验证用权威数据源、规则或人工复核关键结论;多个模型可能共享同类错误
结构化输出用 Schema 约束输出形状,便于校验;它不会自动提高事实正确性

重要提醒:在医疗、法律、金融等高风险领域,必须有人工复核机制,不能完全依赖 LLM。

四、模型选型:不要依赖“排行榜”

模型能力、上下文长度、价格和可用性变化很快,静态的“第一梯队”或“最强”结论会迅速过期。比起按厂商排名,建议按业务约束建立候选列表并在真实任务上评测:

维度要问的问题
质量在你的问答、代码、分类或抽取任务上,准确率、引用正确性和拒答表现如何?
延迟与吞吐TTFT、tokens/s、并发时的 p95 延迟是否满足 SLO?
成本输入、输出、缓存、工具调用与运维的总成本是多少?
数据与合规数据是否允许出域?是否需要私有部署、审计或区域存储?
能力与生态是否需要工具调用、结构化输出、视觉、长上下文或特定语言支持?

选模型的核心原则:先用代表性样本做离线评测,再做小流量线上验证。闭源 API、开源自部署和模型路由各有适用场景,没有脱离任务的“最优模型”。

五、核心概念速查

概念一句话解释
LLM大语言模型,在海量文本上训练、能理解和生成语言的 AI
NLP自然语言处理,让计算机理解人类语言的 AI 分支
Transformer现代 LLM 的基础架构,核心是自注意力机制
TokenLLM 处理文本的最小单元
Embedding将文本、图片等输入映射为向量表示,用于相似度计算、检索或分类
预训练在海量数据上学会语言的通用规律
微调用少量特定领域数据,让模型适配具体任务
RAG检索增强生成——先查资料再回答,提升可追溯性并可能降低无依据生成,但不保证正确
Prompt给 LLM 的指令和输入,相当于”你要 AI 做什么”

本系列四篇文章,从预测下一个 token 讲起,到 Transformer 架构、采样策略,再到工程挑战,覆盖了 LLM 工作原理的核心知识。如果你还意犹未尽,可以继续阅读同期的 Prompt Engineering 系列——理解原理之后,接下来就是学会如何更好地与 AI 对话。


分享这篇文章:
通过邮件分享这篇文章✓ 链接已复制
查看系列全部文章
  1. 01.LLM 工作原理(一):从预测下一个字开始
  2. 02.LLM 工作原理(二):Transformer 与自注意力机制
  3. 03.LLM 工作原理(三):推理与采样策略——AI 如何选择下一个词
  4. 04.LLM 工作原理(四):延迟、成本与幻觉——工程落地三大挑战
  5. 05.Prompt Engineering 入门:与 AI 高效协作的第一课
  6. 06.零样本与少样本提示:AI 提示的两大基础技巧
  7. 07.Prompt 实用技巧与趣味实践:分隔符、条件检查与分步指令
  8. 08.思维链(CoT):让 AI 学会一步步思考
  9. 09.思维树(ToT):从线性推理到多分支探索
  10. 10.复杂任务拆解:像项目经理一样驾驭 AI
  11. 11.Prompt Engineering 高阶技巧与全景总结
  12. 12.生态 > 模型:大模型竞争的本质不是模型本身
  13. 13.大模型 vs 小模型,以及一场关于电价的算力战争

上一篇
Prompt Engineering 入门:与 AI 高效协作的第一课
下一篇
LLM 工作原理(三):推理与采样策略——AI 如何选择下一个词