- 发布时间
- 2026年10月1日 UTC 22:27
- 评测版本
- coding-fast-v4.12
- 已测配置
- 2 个实测配置
- 批次
- evaluation-3341cc23aef23a47f4fab68345dda94009162dc5f5a4e631003cf135e06bdbca
这是汇集并保留已有成绩的数据快照,各配置的评测完成时间可能不同。此页得分只对应后端,不是三项加权综合分。
已发布后端结果
| 指标 | GPT-5.6 Sol / max | Qwen 3.8 / default |
|---|---|---|
| 后端配置排名 | #14 | #49 |
| 后端得分 | 85/100 | 64/100 |
| 后端实测时间 | 2026年9月20日 UTC 22:40 | 2026年9月9日 UTC 21:53 |
| 耗时 | 29 分 19 秒 | 47 分 48 秒 |
| 参考费用 | $1.71 | $1.07 |
| 路由 | 自定义端点 | 自定义端点 |
| 契约测试/边界场景 | 17/20 | 12/20 |
| 反例构造/重试调度 | 18/20 | 17/20 |
| 方案审计/对抗场景 | 13/20 | 8/20 |
| 状态机/事务回归 | 18/20 | 14/20 |
| 测试设计/缓存回归 | 19/20 | 13/20 |
如何根据结果选择
得分更高的一方,是否也适合你的时间和费用预算?
先看后端总分和单题成绩,确认能满足任务要求后,再比较耗时。任一方缺少参考费用时,暂时无法比较费用。