ModelDial · 模型实测

gpt-6-astra

比较各思考档位在私有数据集上的表现。分项成绩与费用均来自对应的实测记录。

最高综合分95.3

gpt-6-astra · xhigh

后端与测试
95
前端与交互
96
知识与推理
95

档位收益与代价

比较相邻实测档位的得分、费用与用时。

high xhigh
综合分
+4.2 分
91.1 95.3
参考费用
+$2.61
$4.40 $7.01
评测用时
+5.1%
79m 52s 83m 56s
查看完整对比 →

各档位实测成绩

选择两到三个配置,比较分数与费用。

左右滑动查看完整成绩 →

模型 / 档位综合后端与测试前端与交互知识与推理评测用时参考费用对比
low88.988948561m 27s$3.70
medium88.691898572m 41s$3.76
high91.192968579m 52s$4.40
xhigh95.395969583m 56s$7.01
max94.795949593m 26s$8.35

如何理解结果

上方分项成绩采用最高综合分所在的同一配置。完整综合分需要三项成绩,缺失结果显示为横线。

本次评测数据发布于 2026/9/30