gpt-5.6-luna
比较各思考档位在私有数据集上的表现。分项成绩与费用均来自对应的实测记录。
最高综合分55.3
gpt-5.6-luna · max
- 后端与测试
- 61
- 前端与交互
- 78
- 知识与推理
- 25
档位收益与代价
比较相邻实测档位的得分、费用与用时。
xhigh max
- 综合分
- +1.3 分 54.0 → 55.3
- 参考费用
- +$0.18 $0.16 → $0.35
- 评测用时
- +14.4% 75m 23s → 86m 14s
各档位实测成绩
选择两到三个配置,比较分数与费用。
左右滑动查看完整成绩 →
| 模型 / 档位 | 综合 | 后端与测试 | 前端与交互 | 知识与推理 | 评测用时 | 参考费用 | 对比 |
|---|---|---|---|---|---|---|---|
| low | 18.9 | 30 | 18 | 5 | 52m 31s | $0.067 | |
| medium | 30.2 | 47 | 13 | 25 | 18m 22s | $0.084 | |
| high | 38.1 | 45 | 52 | 15 | 32m 18s | $0.14 | |
| xhigh | 54.0 | 54 | 83 | 25 | 75m 23s | $0.16 | |
| max | 55.3 | 61 | 78 | 25 | 86m 14s | $0.35 |
如何理解结果
上方分项成绩采用最高综合分所在的同一配置。完整综合分需要三项成绩,缺失结果显示为横线。
本次评测数据发布于 2026/9/30