把模型、思考深度和路由当作一个整体
GPT-5.6 Sol Low 与 GPT-5.6 Sol Max 是两个不同配置;官方登录与自定义端点也不能省略。去掉这些字段,榜单虽然更简单,却不再对应你最终会运行的对象。
第一次比较应放在同一个发布批次内。这样比较标准一致,分数差异才有明确的比较框架。
先定质量底线,再看速度
先明确哪类失败不能接受。总耗时最短的配置,如果恰好在你的关键能力上失分,就没有实际价值。某项能力更重要时,要看五题分布,不能只看总分。
- 主力编程 Agent 先设最低总分,并检查是否存在明显单题短板。
- 只处理边界明确任务的执行 Agent,可以在通过同一任务底线后再下调档位。
- 同一批只领先一分时,不要急着宣布长期胜负,先看后续可比批次是否重复出现。
耗时和费用都是观测值,不是厂商承诺
耗时包含被测配置和当时路由的表现,它只能说明这一轮发生了什么,不能代表整个厂商在所有地区和账号下的速度。
参考费用缺失,表示该配置的计价或 usage 证据不足,不表示请求免费。只有两边都在同一价格快照下具备费用覆盖时,才比较费用。
切换前做一次路由级复核
公开雷达回答的是:哪些第一方配置在同一协议下表现更好。它看不到你的代码库、区域网络、账号限额、提示词形态和端点代理。
先用雷达缩小到一个候选,再通过准备长期保留的路由在本机运行。候选既通过质量底线,操作收益又能在你的环境中复现,才值得切换。