费用与速度

过不了质量底线的低价模型,并不便宜

质量、耗时和参考费用回答的是三个不同问题。把它们合成推荐之前,必须保留各自的比较口径。

判断顺序

先排除没有通过任务质量底线的配置,再比较成功完成耗时。最后才比较参考费用,而且只有两边在同一价格快照下都具备 usage 与计价覆盖时才能比较。

从同一个可比批次开始

比较标准必须一致。在更简单或不同标准下更快,不能说明它完成同一任务更快。

路由也必须保留。即使模型名相同,端点排队、区域网络和服务档位仍属于被观测配置的一部分。

比较成功完成耗时,不要使用误导性平均值

快速失败并没有完成工作。比较速度前,要把硬失败与重试从成功完成耗时中分开。

首 Token 时间适合判断交互体感,但编程任务还取决于完整答案和终止事件何时到达。应选择与实际决策一致的时间指标。

费用缺失代表未知,不代表零费用

参考费用需要 Token usage 和匹配的价格快照。定制套餐、订阅、缓存折扣或 usage 字段不完整,都可能导致费用无法覆盖。不能把未覆盖配置排成最便宜。

  • 质量优先:在耗时和预算上限内,选择实测质量最高的配置。
  • 综合平衡:在较窄质量区间内,再选更快或参考费用更低的配置。
  • 执行 Agent:使用任务专属质量底线,不能套用全站平均分。

参考费用与实际账单要分开

公开参考费用按记录的价格快照估算本轮 API 用量;实际账单可能来自订阅、Token 计划、缓存优惠、区域定价或第三方加价。公开值用于同口径比较,最终还要核对你真正付费的商业路由。