gpt-6-luna
比较各思考档位在私有数据集上的表现。分项成绩与费用均来自对应的实测记录。
最高综合分61.8
gpt-6-luna · xhigh
- 后端与测试
- 57
- 前端与交互
- 80
- 知识与推理
- 50
档位收益与代价
比较相邻实测档位的得分、费用与用时。
high xhigh
- 综合分
- +15.0 分 46.8 → 61.8
- 参考费用
- +$0.019 $0.042 → $0.061
- 评测用时
- +33.0% 48m 0s → 63m 52s
各档位实测成绩
选择两到三个配置,比较分数与费用。
左右滑动查看完整成绩 →
| 模型 / 档位 | 综合 | 后端与测试 | 前端与交互 | 知识与推理 | 评测用时 | 参考费用 | 对比 |
|---|---|---|---|---|---|---|---|
| low | 31.4 | 23 | 49 | 25 | 39m 27s | —费用未齐 | |
| medium | 33.9 | 24 | 56 | 25 | 39m 46s | $0.032 | |
| high | 46.8 | 42 | 50 | 50 | 48m 0s | $0.042 | |
| xhigh | 61.8 | 57 | 80 | 50 | 63m 52s | $0.061 | |
| max | 54.9 | 57 | 77 | 30 | 72m 51s | —费用未齐 |
如何理解结果
上方分项成绩采用最高综合分所在的同一配置。完整综合分需要三项成绩,缺失结果显示为横线。
本次评测数据发布于 2026/9/30