- 发布时间
- 2026年8月26日 UTC 23:00
- 题包
- coding-fast-v4.10
- 覆盖
- 2 个实测配置
- 批次
- snapshot-2026-08-26T23-00-00Z-r3
同批次证据
| 指标 | Kimi K3 / 高 | GLM-5.3 / 高 |
|---|---|---|
| 排名 | #21 | #8 |
| 得分 | 61/100 | 68/100 |
| 耗时 | 27 分 47 秒 | 23 分 35 秒 |
| 参考费用 | $0.44 | $0.42 |
| 路由 | 自定义端点 | 自定义端点 |
| 契约测试/边界场景 | 9/20 | 13/20 |
| 反例构造/重试调度 | 13/20 | 16/20 |
| 方案审计/对抗场景 | 12/20 | 12/20 |
| 状态机/事务回归 | 14/20 | 15/20 |
| 测试设计/缓存回归 | 13/20 | 12/20 |
这组对比能支持什么决策
两个配置是否在相同能力上失分,还是相近总分掩盖了不同的使用风险?
先看总分与五题分布。两个配置都通过质量底线后再比较耗时;任一方费用未覆盖时,费用结论保持空缺。