不同供应商的档位没有统一标准
有的 API 提供独立的 reasoning effort 字段,有的端点会把 Max 一类档位写进模型 ID,同时把 effort 返回为 default。这两种表示不能当成同一个控制量。
因此 ModelDial 会同时保留原始模型 ID、规范展示名、思考深度和路由,不把它们压成一行品牌名。
只在同一配置系列内画档位曲线
固定模型、路由和比较标准,先比较 Low 与 Medium,再比较 Medium 与 High。如果同时更换了路由,就无法判断变化来自思考深度还是传输行为。
- 同时看总分和五题分布,避免总分持平掩盖单项短板变化。
- 比较成功完成的总耗时,不能只看首 Token 时间。
- 小分差需要在多个可比批次重复出现,才能视为稳定。
更高档位可能输在你真正关心的决策上
更高档位可能花更久,却没有改善关键题目;模型的正常波动也可能让相邻档位在单个批次内换位。因此,提高档位只是需要验证的假设,不是自动升级。
主力 Agent 应保留能够稳定通过质量底线的最低档位。任务边界明确的执行 Agent,则应单独测自己的任务底线,不要直接继承主力档位。
记录真正可复现的完整配置
至少保存供应商、原始模型 ID、思考深度、服务档位、路由类型和评测时间。端点或供应商配置发生变化后,只写一个 High 无法复现原结果。