思考深度

Low、High、Max 是配置,不是质量保证

思考深度只有和模型、路由放在一起才有意义。不同供应商使用相同档位名称,并不代表它们是一套可换算的智能单位。

直接结论

只在同一模型、同一路由内比较档位。一次只升一级,保持比较标准不变;质量收益不足以覆盖新增耗时或费用时,就不要继续加档。

不同供应商的档位没有统一标准

有的 API 提供独立的 reasoning effort 字段,有的端点会把 Max 一类档位写进模型 ID,同时把 effort 返回为 default。这两种表示不能当成同一个控制量。

因此 ModelDial 会同时保留原始模型 ID、规范展示名、思考深度和路由,不把它们压成一行品牌名。

只在同一配置系列内画档位曲线

固定模型、路由和比较标准,先比较 Low 与 Medium,再比较 Medium 与 High。如果同时更换了路由,就无法判断变化来自思考深度还是传输行为。

  • 同时看总分和五题分布,避免总分持平掩盖单项短板变化。
  • 比较成功完成的总耗时,不能只看首 Token 时间。
  • 小分差需要在多个可比批次重复出现,才能视为稳定。

更高档位可能输在你真正关心的决策上

更高档位可能花更久,却没有改善关键题目;模型的正常波动也可能让相邻档位在单个批次内换位。因此,提高档位只是需要验证的假设,不是自动升级。

主力 Agent 应保留能够稳定通过质量底线的最低档位。任务边界明确的执行 Agent,则应单独测自己的任务底线,不要直接继承主力档位。

记录真正可复现的完整配置

至少保存供应商、原始模型 ID、思考深度、服务档位、路由类型和评测时间。端点或供应商配置发生变化后,只写一个 High 无法复现原结果。