Temperature、Top P 与输出预算:生成参数怎样影响结果

# Temperature、Top P 与输出预算:生成参数怎样影响结果

本篇目标

理解常见生成参数的实际作用、适用场景和边界,避免把低 Temperature、Seed 或最大 Token 数误解成业务可靠性保证。

理解采样控制输出长度区分随机与正确用评测选择参数

# 先记住一句话

生成参数只能调整模型怎样从候选 Token 中选择和何时停止,不能补充缺失知识,也不能保证事实、格式和业务结果正确。

# 从概率分布到输出 Token

模型会为下一个 Token 计算概率分布。解码策略决定是总选最高概率项,还是从一组高概率候选中采样。

候选 Token:连接池  复用  关闭  新建
模型概率:     0.48  0.31  0.13  0.08
                  ↓ 采样参数调整分布
                选出一个 Token
1
2
3
4

参数影响的是选择过程。即使 “复用” 在业务上正确,模型也不会因为把 Temperature 调低就自动知道当前项目的数据库配置。

# 常见参数分别控制什么

参数 主要作用 常见误区
Temperature 调整概率分布的平缓或集中程度 设为 0 就绝对确定
Top P 只在累计概率达到阈值的候选集合中采样 与 Temperature 同时大幅调整更好
Max Output Tokens 限制最多生成多少 Token 等于保证输出完整
Stop 遇到指定序列时停止 所有模型和接口都支持相同格式
Seed 尝试提高重复请求的一致性 可以保证永久复现
Reasoning Effort 控制支持该能力的模型投入多少推理资源 越高一定越适合所有任务

参数名称、范围和支持情况由模型与 API 决定。接入新模型时应读取对应文档,并用实际请求验证,不能照搬另一个模型的配置。

# Temperature 怎样理解

Temperature 较低时,概率高的候选更占优势,输出通常更集中;较高时,更多候选有机会被选中,结果通常更有变化。

  • 信息抽取、分类和固定格式任务通常更看重稳定;
  • 文案创意和头脑风暴可以允许更多变化;
  • 事实问答的正确性主要取决于模型能力与证据,不是单靠低 Temperature;
  • 某些推理模型可能限制、忽略或不建议暴露采样参数。

“较低” 和 “较高” 没有跨模型通用的最佳数值,应通过任务评测选择。

# Top P 怎样理解

Top P 又称核采样(Nucleus Sampling)。它从最高概率候选开始累加,只保留累计概率达到指定范围的一组 Token,再从中采样。

Temperature 改变整个概率分布,Top P 改变参与采样的候选范围。通常先选择其中一个作为主要调节手段,避免同时大幅修改后无法判断效果来自哪里。

# 输出长度怎样预算

Max Output Tokens 是输出上限,不是期望长度。上限过小,JSON、代码或解释可能被截断;上限过大,则可能增加最坏情况下的延迟和费用。

合理做法是:

  1. 根据产品需要定义输出结构和大致长度;
  2. 为正常结果和结束标记留出余量;
  3. 检查响应为什么停止;
  4. 被长度截断时不要把残缺结果当作成功;
  5. 记录实际输出 Token,再调整预算。

结构化输出被截断时可能无法形成完整对象,因此需要同时处理完成状态和解析失败。

# Seed 为什么不是绝对复现

部分服务提供 Seed,用于让相同请求更可能得到相近结果。但以下变化仍可能影响输出:

  • 模型版本或服务端实现更新;
  • 输入中的空格、顺序或隐藏上下文变化;
  • 并行计算中的数值差异;
  • 工具、检索结果或时间等外部状态变化。

测试模型应用时,不应只断言整段文本逐字相同。更稳妥的是检查 Schema、关键事实、允许范围和评测分数。

# 推理投入是不是越高越好

支持 Reasoning Effort 的模型可以在复杂任务上投入更多推理资源,但通常也会影响延迟和 Token 使用。简单分类、路由或抽取任务未必需要高推理投入。

选择时应比较:

  • 任务正确率是否实际提高;
  • P95 延迟是否仍满足产品要求;
  • 单次和整体费用是否可接受;
  • 简单请求能否路由到更轻量方案。

# 用实验而不是感觉调参数

准备一组固定真实样本,每次只改变一个变量,记录:

维度 需要观察的结果
质量 正确率、完整度、格式通过率
稳定 多次运行的波动和失败类型
性能 首 Token 延迟、总延迟
成本 输入、输出和推理 Token

创意任务还应保留多样性指标,不能为了稳定把所有回答压成同一种表达。

# 高频面试题与回答

1. Temperature 越低,答案越正确吗?参考答案

不一定。低 Temperature 通常让模型更偏向高概率候选,可能减少表达波动,但不会补充缺失知识,也不会验证事实。正确性仍取决于模型能力、上下文证据和业务校验。

2. Temperature 和 Top P 有什么区别?参考答案

Temperature 调整候选概率分布的集中程度,Top P 则限制参与采样的累计概率候选集合。两者都控制随机性,实践中通常先改一个,并通过固定评测集判断效果。

3. Max Output Tokens 设置过小会怎样?参考答案

模型可能在答案、JSON 或代码完成前被截断。应用应检查停止原因和解析状态,不能把残缺结果当成功;预算应根据真实输出分布设置,并保留合理余量。

4. 怎样为任务选择生成参数?参考答案

先根据任务确定稳定性、创造性、长度和延迟目标,再用固定真实样本做对照实验,每次只改变一个参数。最终比较质量、波动、延迟和费用,而不是套用一个所谓通用最佳值。

# 接下来学什么

下一篇学习 Embedding、向量与相似度检索,理解模型除了生成文本,还能怎样把语义转换成可比较的数字表示。

# 参考资料