- 发布时间
- 2026年8月26日 UTC 23:00
- 题包
- coding-fast-v4.10
- 覆盖
- 2 个实测配置
- 批次
- snapshot-2026-08-26T23-00-00Z-r3
同批次证据
| 指标 | Qwen 3.8 / 最高 | Kimi K3 / 高 |
|---|---|---|
| 排名 | #10 | #21 |
| 得分 | 66/100 | 61/100 |
| 耗时 | 21 分 19 秒 | 27 分 47 秒 |
| 参考费用 | $0.89 | $0.44 |
| 路由 | 自定义端点 | 自定义端点 |
| 契约测试/边界场景 | 10/20 | 9/20 |
| 反例构造/重试调度 | 17/20 | 13/20 |
| 方案审计/对抗场景 | 12/20 | 12/20 |
| 状态机/事务回归 | 13/20 | 14/20 |
| 测试设计/缓存回归 | 14/20 | 13/20 |
这组对比能支持什么决策
本轮质量差异,放到你的路由稳定性、实际耗时和任务侧重点里,是否仍然有价值?
先看总分与五题分布。两个配置都通过质量底线后再比较耗时;任一方费用未覆盖时,费用结论保持空缺。