Temperature、Top P 与输出预算:生成参数怎样影响结果
# Temperature、Top P 与输出预算:生成参数怎样影响结果
理解常见生成参数的实际作用、适用场景和边界,避免把低 Temperature、Seed 或最大 Token 数误解成业务可靠性保证。
# 先记住一句话
生成参数只能调整模型怎样从候选 Token 中选择和何时停止,不能补充缺失知识,也不能保证事实、格式和业务结果正确。
# 从概率分布到输出 Token
模型会为下一个 Token 计算概率分布。解码策略决定是总选最高概率项,还是从一组高概率候选中采样。
候选 Token:连接池 复用 关闭 新建
模型概率: 0.48 0.31 0.13 0.08
↓ 采样参数调整分布
选出一个 Token
2
3
4
参数影响的是选择过程。即使 “复用” 在业务上正确,模型也不会因为把 Temperature 调低就自动知道当前项目的数据库配置。
# 常见参数分别控制什么
| 参数 | 主要作用 | 常见误区 |
|---|---|---|
| Temperature | 调整概率分布的平缓或集中程度 | 设为 0 就绝对确定 |
| Top P | 只在累计概率达到阈值的候选集合中采样 | 与 Temperature 同时大幅调整更好 |
| Max Output Tokens | 限制最多生成多少 Token | 等于保证输出完整 |
| Stop | 遇到指定序列时停止 | 所有模型和接口都支持相同格式 |
| Seed | 尝试提高重复请求的一致性 | 可以保证永久复现 |
| Reasoning Effort | 控制支持该能力的模型投入多少推理资源 | 越高一定越适合所有任务 |
参数名称、范围和支持情况由模型与 API 决定。接入新模型时应读取对应文档,并用实际请求验证,不能照搬另一个模型的配置。
# Temperature 怎样理解
Temperature 较低时,概率高的候选更占优势,输出通常更集中;较高时,更多候选有机会被选中,结果通常更有变化。
- 信息抽取、分类和固定格式任务通常更看重稳定;
- 文案创意和头脑风暴可以允许更多变化;
- 事实问答的正确性主要取决于模型能力与证据,不是单靠低 Temperature;
- 某些推理模型可能限制、忽略或不建议暴露采样参数。
“较低” 和 “较高” 没有跨模型通用的最佳数值,应通过任务评测选择。
# Top P 怎样理解
Top P 又称核采样(Nucleus Sampling)。它从最高概率候选开始累加,只保留累计概率达到指定范围的一组 Token,再从中采样。
Temperature 改变整个概率分布,Top P 改变参与采样的候选范围。通常先选择其中一个作为主要调节手段,避免同时大幅修改后无法判断效果来自哪里。
# 输出长度怎样预算
Max Output Tokens 是输出上限,不是期望长度。上限过小,JSON、代码或解释可能被截断;上限过大,则可能增加最坏情况下的延迟和费用。
合理做法是:
- 根据产品需要定义输出结构和大致长度;
- 为正常结果和结束标记留出余量;
- 检查响应为什么停止;
- 被长度截断时不要把残缺结果当作成功;
- 记录实际输出 Token,再调整预算。
结构化输出被截断时可能无法形成完整对象,因此需要同时处理完成状态和解析失败。
# Seed 为什么不是绝对复现
部分服务提供 Seed,用于让相同请求更可能得到相近结果。但以下变化仍可能影响输出:
- 模型版本或服务端实现更新;
- 输入中的空格、顺序或隐藏上下文变化;
- 并行计算中的数值差异;
- 工具、检索结果或时间等外部状态变化。
测试模型应用时,不应只断言整段文本逐字相同。更稳妥的是检查 Schema、关键事实、允许范围和评测分数。
# 推理投入是不是越高越好
支持 Reasoning Effort 的模型可以在复杂任务上投入更多推理资源,但通常也会影响延迟和 Token 使用。简单分类、路由或抽取任务未必需要高推理投入。
选择时应比较:
- 任务正确率是否实际提高;
- P95 延迟是否仍满足产品要求;
- 单次和整体费用是否可接受;
- 简单请求能否路由到更轻量方案。
# 用实验而不是感觉调参数
准备一组固定真实样本,每次只改变一个变量,记录:
| 维度 | 需要观察的结果 |
|---|---|
| 质量 | 正确率、完整度、格式通过率 |
| 稳定 | 多次运行的波动和失败类型 |
| 性能 | 首 Token 延迟、总延迟 |
| 成本 | 输入、输出和推理 Token |
创意任务还应保留多样性指标,不能为了稳定把所有回答压成同一种表达。
# 高频面试题与回答
1. Temperature 越低,答案越正确吗?参考答案
不一定。低 Temperature 通常让模型更偏向高概率候选,可能减少表达波动,但不会补充缺失知识,也不会验证事实。正确性仍取决于模型能力、上下文证据和业务校验。
2. Temperature 和 Top P 有什么区别?参考答案
Temperature 调整候选概率分布的集中程度,Top P 则限制参与采样的累计概率候选集合。两者都控制随机性,实践中通常先改一个,并通过固定评测集判断效果。
3. Max Output Tokens 设置过小会怎样?参考答案
模型可能在答案、JSON 或代码完成前被截断。应用应检查停止原因和解析状态,不能把残缺结果当成功;预算应根据真实输出分布设置,并保留合理余量。
4. 怎样为任务选择生成参数?参考答案
先根据任务确定稳定性、创造性、长度和延迟目标,再用固定真实样本做对照实验,每次只改变一个参数。最终比较质量、波动、延迟和费用,而不是套用一个所谓通用最佳值。
# 接下来学什么
下一篇学习 Embedding、向量与相似度检索,理解模型除了生成文本,还能怎样把语义转换成可比较的数字表示。