理解了 LLM 怎么工作,接下来要面对现实问题:它太慢了怎么办?太贵了怎么办?一本正经地胡说八道怎么办?这是每个 LLM 应用开发者绕不开的三道坎。
一、延迟问题:用户等不及
什么是延迟?
LLM 的延迟(Latency)指从发送请求到获得响应的时间。我们通常关注两个指标:
- 首字延迟(TTFT):用户发送问题后,看到第一个字出现的时间
- 生成速度(Tokens/s):每秒生成多少个 token
体验目标:聊天场景通常应尽量缩短首字延迟;可接受阈值取决于任务复杂度、是否流式输出和用户预期,应结合真实用户数据设定 SLO。
延迟为什么会高?
| 因素 | 说明 |
|---|---|
| 模型与服务配置 | 更强或更大的模型通常可能更慢,但实际延迟也受服务档位、批处理和推理优化影响 |
| 上下文长度 | 输入的 prompt 越长,计算量越大。处理 32K tokens 远比 4K tokens 慢 |
| 基础设施 | GPU 型号、网络速度、服务器位置都有影响 |
| 并发压力 | 同时请求的人越多,排队时间越长 |
优化策略
选小模型 → 简单任务不需要最大模型,能用小的就别用大的
精简 Prompt → 移除冗余信息,每省 1000 个 token 都是真金白银
流式输出 → 边生成边展示,用户看到第一个字就感觉"在动了"
缓存机制 → 高频问题缓存答案,不用每次都算一遍
关键思路:延迟优化不是一味加硬件,很多时候是选择合适的模型 + 精简上下文。
二、成本问题:每一字都要钱
成本构成
使用第三方 API(如 OpenAI),成本按 token 计费:
总费用 = 输入 token 数 × 输入单价 + 输出 token 数 × 输出单价
不同模型的价格差异巨大——最强模型可能是基础模型的 10-30 倍。
如果自建服务,成本还包括 GPU 采购/租赁、电力和运维人力。是否自部署取决于吞吐、数据边界、模型许可、团队运维能力和总体拥有成本,不应只按应用规模判断。
成本控制的核心策略:模型分级
不需要所有问题都请”最贵的专家”:
简单问题(打招呼、常见FAQ)
→ 小模型(如 Qwen 14B)
→ 成本较低,但仍应计入调用、托管或硬件成本
复杂问题(逻辑推理、专业分析)
→ 大模型(如 GPT-4、Claude)
→ 按需使用
这种做法常能降低成本,但节省幅度取决于流量结构、路由准确率和模型价差;应通过离线评测与线上监控确认核心体验没有下降。
其他技巧:设置 max_tokens 限制输出长度、明确要求简洁回答、定期监控 API 调用热点。
三、幻觉问题:AI 也会胡说八道
什么是幻觉?
幻觉(Hallucination)指的是 LLM 生成的内容看似合理,但实际上是错误的、编造的。典型例子:
- 编造不存在的论文引用,甚至连 DOI 都有模有样
- 虚构历史事件细节,说得头头是道
- 给出错误计算结果,但表述极其自信
为什么会”睁眼说瞎话”?
这不是 bug,而是 LLM 工作方式的必然结果:
- 它是预测模型,不是知识库——它学会了”像人类一样说话”,但不一定”说真话”
- 训练数据有噪声——数据中本来就包含错误信息
- 参数知识有时间边界——训练之后的信息不会自动写进模型权重,但可以通过当前上下文、检索和工具提供
- 过度追求流畅——当没有确切答案时,倾向于”编”一个流畅的,而非承认不知道
缓解策略
常用方法之一:RAG(检索增强生成)
传统方式:
用户提问 → LLM 直接回答(可能产生幻觉)
RAG 方式:
用户提问 → 先从可信知识库检索相关文档 → LLM 基于检索结果回答
外部知识库能为回答提供可核查依据,但错检索、过期文档、上下文冲突和模型误读仍会造成错误。RAG 是否降低幻觉,应以引用正确性和任务级评测验证。
其他辅助手段:
| 策略 | 做法 |
|---|---|
| Prompt 约束 | 明确指示”如果不知道就说不知道” |
| 降低温度 | 事实性任务用 T=0~0.3,减少随机性 |
| 独立验证 | 用权威数据源、规则或人工复核关键结论;多个模型可能共享同类错误 |
| 结构化输出 | 用 Schema 约束输出形状,便于校验;它不会自动提高事实正确性 |
重要提醒:在医疗、法律、金融等高风险领域,必须有人工复核机制,不能完全依赖 LLM。
四、模型选型:不要依赖“排行榜”
模型能力、上下文长度、价格和可用性变化很快,静态的“第一梯队”或“最强”结论会迅速过期。比起按厂商排名,建议按业务约束建立候选列表并在真实任务上评测:
| 维度 | 要问的问题 |
|---|---|
| 质量 | 在你的问答、代码、分类或抽取任务上,准确率、引用正确性和拒答表现如何? |
| 延迟与吞吐 | TTFT、tokens/s、并发时的 p95 延迟是否满足 SLO? |
| 成本 | 输入、输出、缓存、工具调用与运维的总成本是多少? |
| 数据与合规 | 数据是否允许出域?是否需要私有部署、审计或区域存储? |
| 能力与生态 | 是否需要工具调用、结构化输出、视觉、长上下文或特定语言支持? |
选模型的核心原则:先用代表性样本做离线评测,再做小流量线上验证。闭源 API、开源自部署和模型路由各有适用场景,没有脱离任务的“最优模型”。
五、核心概念速查
| 概念 | 一句话解释 |
|---|---|
| LLM | 大语言模型,在海量文本上训练、能理解和生成语言的 AI |
| NLP | 自然语言处理,让计算机理解人类语言的 AI 分支 |
| Transformer | 现代 LLM 的基础架构,核心是自注意力机制 |
| Token | LLM 处理文本的最小单元 |
| Embedding | 将文本、图片等输入映射为向量表示,用于相似度计算、检索或分类 |
| 预训练 | 在海量数据上学会语言的通用规律 |
| 微调 | 用少量特定领域数据,让模型适配具体任务 |
| RAG | 检索增强生成——先查资料再回答,提升可追溯性并可能降低无依据生成,但不保证正确 |
| Prompt | 给 LLM 的指令和输入,相当于”你要 AI 做什么” |
本系列四篇文章,从预测下一个 token 讲起,到 Transformer 架构、采样策略,再到工程挑战,覆盖了 LLM 工作原理的核心知识。如果你还意犹未尽,可以继续阅读同期的 Prompt Engineering 系列——理解原理之后,接下来就是学会如何更好地与 AI 对话。