模型选择

AI 编程模型排行,先看具体配置

只报模型名会漏掉两个经常改变结果的变量:思考深度和连接路由。真正需要比较的是你能实际运行的配置,而不是孤立的品牌名。

选择规则

先设质量底线,再在达标配置中比较成功完成耗时和参考费用。准备切换默认模型前,用你实际使用的账号与路由再跑一次候选配置。

把模型、思考深度和路由当作一个整体

GPT-5.6 Sol Low 与 GPT-5.6 Sol Max 是两个不同配置;官方登录与自定义端点也不能省略。去掉这些字段,榜单虽然更简单,却不再对应你最终会运行的对象。

第一次比较应放在同一个发布批次内。这样比较标准一致,分数差异才有明确的比较框架。

先定质量底线,再看速度

先明确哪类失败不能接受。总耗时最短的配置,如果恰好在你的关键能力上失分,就没有实际价值。某项能力更重要时,要看五题分布,不能只看总分。

  • 主力编程 Agent 先设最低总分,并检查是否存在明显单题短板。
  • 只处理边界明确任务的执行 Agent,可以在通过同一任务底线后再下调档位。
  • 同一批只领先一分时,不要急着宣布长期胜负,先看后续可比批次是否重复出现。

耗时和费用都是观测值,不是厂商承诺

耗时包含被测配置和当时路由的表现,它只能说明这一轮发生了什么,不能代表整个厂商在所有地区和账号下的速度。

参考费用缺失,表示该配置的计价或 usage 证据不足,不表示请求免费。只有两边都在同一价格快照下具备费用覆盖时,才比较费用。

切换前做一次路由级复核

公开雷达回答的是:哪些第一方配置在同一协议下表现更好。它看不到你的代码库、区域网络、账号限额、提示词形态和端点代理。

先用雷达缩小到一个候选,再通过准备长期保留的路由在本机运行。候选既通过质量底线,操作收益又能在你的环境中复现,才值得切换。