ModelDial · 模型实测

Qwen 3.8 Max

比较各思考档位在私有数据集上的表现。分项成绩与费用均来自对应的实测记录。

最高综合分56.7

Qwen 3.8 Max · default

后端与测试
60
前端与交互
69
知识与推理
40

各档位实测成绩

选择两到三个配置,比较分数与费用。

左右滑动查看完整成绩 →

模型 / 档位综合后端与测试前端与交互知识与推理评测用时参考费用对比
default56.7606940133m 3s$3.41费用未齐

如何理解结果

上方分项成绩采用最高综合分所在的同一配置。完整综合分需要三项成绩,缺失结果显示为横线。

本次评测数据发布于 2026/9/30