模型实测榜单

比较模型与思考档位的成绩、耗时和参考费用。

基于自建私有数据集为什么这样测

更新于 2026/9/30

上新值得关注
93.8综合分
89.1综合分
每个模型展示本项最高实测分,展开查看其他档位。33 个模型 · 83 个配置
评分说明

后端 40% · 前端 30% · 推理 30%,采用同一实测配置。 默认显示各模型在当前评测项中得分最高的档位。

耗时与费用对应当前评测项;切换分类后同步更新。这些数值不代表日常单次请求的速度或价格。

查看任务范围 →了解评测方法 →
排名 按得分
ⓘ
排序方式与筛选条件

质量优先更看重得分;得分与耗时平衡兼顾两者;评测耗时优先更看重任务完成时间。每款模型展示当前偏好下的实测档位。

这里使用的是评测任务耗时,不代表日常对话的响应速度。

全部提供商
排名模型 / 实测档位后端前端知识推理评测用时参考费用对比
01
gpt-6-astra
xhigh
95.395969583m 56s$7.01
02
gpt-6.1-sol新
max
93.895969062m 9s$1.69
03
claude-opus-5-5新
max
89.1818910033m 57s$3.67
04
claude-fable-5-1
max
89.083919579m 7s$26.15
05
claude-sonnet-5-5新
xhighAnthropic
85.884898548m 32s$2.80
06
grok-4.7
high
84.3878085196m 18s$5.25
07
gpt-6-sol新
xhigh
81.577947539m 22s$1.10
08
claude-opus-5
max
81.066879592m 12s$7.99
09
grok-4.6
xhigh
79.5758085144m 16s$2.51
10
gpt-5.6-sol
max
77.683737587m 21s$3.25
11
claude-opus-4-8
max
75.9608885106m 52s$16.33
12
k3
highMoonshot
72.5658570158m 17s$3.28
13
mimo-v2.6-pro新
defaultXiaomi MiMo
71.4668565336m 3s$0.66
14
gpt-5.6-terra
max
70.5787655133m 2s$1.94
15
glm-5.3
max
70.0647870156m 42s$1.91
16
space-bunny新
default其他
69.357807562m 35s$0.000
17
hy4-preview
highTencent Hunyuan
69.0697365218m 41s$1.63
18
deepseek-v4.1-flash
max
68.757886535m 40s$0.41
19
MiniMax-M3.1-Flash-Preview新
max
68.071577554m 7s暂无暂无费用
20
Qwen 3.8 Flash
defaultQwen
67.1658750134m 31s$0.42
21
step-5-preview新
defaultStepFun
66.256717598m 22s$1.24
22
k2.8 preview
high
64.254727070m 58s$0.66
23
deepseek-v4-pro
max
64.064636593m 15s$1.15
24
Gemini 3.8 Flash High
defaultGoogle
61.860864025m 21s$0.13费用未齐
24
gpt-6-luna新
xhigh
61.857805063m 52s$0.061
26
deepseek-v4-flash
high
60.553765598m 25s$0.42
27
deepseek-v4-flash-vision-exp
high
56.757437088m 43s$0.32
27
Qwen 3.8 Max
defaultQwen
56.7606940133m 3s$3.41费用未齐
29
mimo-v2.6-flash新
defaultXiaomi MiMo
56.4547145386m 14s$0.28
30
gpt-5.6-luna
max
55.361782586m 14s$0.35
31
Gemini 3.7 Flash High
defaultGoogle
52.459712524m 19s$0.13
32
glm-5.3-flash
max
51.743754096m 41s$0.074费用未齐
32
MiniMax-M3
highMiniMax
51.743655056m 33s$0.62费用未齐
各模型采用本项最高分档位;同分并列。
后端 40% · 前端 30% · 推理 30%,采用同一实测配置。 评测范围与数据来源 →