从同一个可比批次开始
比较标准必须一致。在更简单或不同标准下更快,不能说明它完成同一任务更快。
路由也必须保留。即使模型名相同,端点排队、区域网络和服务档位仍属于被观测配置的一部分。
比较成功完成耗时,不要使用误导性平均值
快速失败并没有完成工作。比较速度前,要把硬失败与重试从成功完成耗时中分开。
首 Token 时间适合判断交互体感,但编程任务还取决于完整答案和终止事件何时到达。应选择与实际决策一致的时间指标。
费用缺失代表未知,不代表零费用
参考费用需要 Token usage 和匹配的价格快照。定制套餐、订阅、缓存折扣或 usage 字段不完整,都可能导致费用无法覆盖。不能把未覆盖配置排成最便宜。
- 质量优先:在耗时和预算上限内,选择实测质量最高的配置。
- 综合平衡:在较窄质量区间内,再选更快或参考费用更低的配置。
- 执行 Agent:使用任务专属质量底线,不能套用全站平均分。
参考费用与实际账单要分开
公开参考费用按记录的价格快照估算本轮 API 用量;实际账单可能来自订阅、Token 计划、缓存优惠、区域定价或第三方加价。公开值用于同口径比较,最终还要核对你真正付费的商业路由。