- 发布时间
- 2026年8月26日 UTC 23:00
- 题包
- coding-fast-v4.10
- 覆盖
- 2 个实测配置
- 批次
- snapshot-2026-08-26T23-00-00Z-r3
同批次证据
| 指标 | GPT-5.6 Sol / 最高 | Qwen 3.8 / 最高 |
|---|---|---|
| 排名 | #1 | #10 |
| 得分 | 85/100 | 66/100 |
| 耗时 | 44 分 58 秒 | 21 分 19 秒 |
| 参考费用 | $1.82 | $0.89 |
| 路由 | 官方登录 | 自定义端点 |
| 契约测试/边界场景 | 14/20 | 10/20 |
| 反例构造/重试调度 | 20/20 | 17/20 |
| 方案审计/对抗场景 | 18/20 | 12/20 |
| 状态机/事务回归 | 17/20 | 13/20 |
| 测试设计/缓存回归 | 16/20 | 14/20 |
这组对比能支持什么决策
本轮质量差异,能否覆盖你实际工作中的路由、耗时和费用证据差异?
先看总分与五题分布。两个配置都通过质量底线后再比较耗时;任一方费用未覆盖时,费用结论保持空缺。