gpt-6.1-sol
比较各思考档位在私有数据集上的表现。分项成绩与费用均来自对应的实测记录。
最高综合分93.8
gpt-6.1-sol · max
- 后端与测试
- 95
- 前端与交互
- 96
- 知识与推理
- 90
档位收益与代价
比较相邻实测档位的得分、费用与用时。
xhigh max
- 综合分
- +4.1 分 89.7 → 93.8
- 参考费用
- +$0.071 $1.62 → $1.69
- 评测用时
- −16.8% 74m 41s → 62m 9s
各档位实测成绩
选择两到三个配置,比较分数与费用。
左右滑动查看完整成绩 →
| 模型 / 档位 | 综合 | 后端与测试 | 前端与交互 | 知识与推理 | 评测用时 | 参考费用 | 对比 |
|---|---|---|---|---|---|---|---|
| low | 86.5 | 82 | 94 | 85 | 24m 22s | $1.33 | |
| medium | 87.5 | 89 | 83 | 90 | 28m 54s | $1.41 | |
| high | 89.9 | 89 | 96 | 85 | 42m 39s | $1.56 | |
| xhigh | 89.7 | 90 | 94 | 85 | 74m 41s | $1.62 | |
| max | 93.8 | 95 | 96 | 90 | 62m 9s | $1.69 |
如何理解结果
上方分项成绩采用最高综合分所在的同一配置。完整综合分需要三项成绩,缺失结果显示为横线。
本次评测数据发布于 2026/9/30