模型证据

GPT-5.6 Sol

分别比较 GPT-5.6 Sol 的各个思考深度,不把它们压成一个模型分数。

当前批次

GPT-5.6 Sol / 最高是实测最高分(85/100);GPT-5.6 Sol / 轻度是实测最快配置(39 分 5 秒)。两者支持的是不同决策。

所选证据
发布时间
2026年8月26日 UTC 23:00
题包
coding-fast-v4.10
覆盖
5 个实测配置
批次
snapshot-2026-08-26T23-00-00Z-r3

实测配置

配置排名得分耗时参考费用路由
GPT-5.6 Sol / 最高#185/10044 分 58 秒$1.82官方登录
GPT-5.6 Sol / 极高#383/10045 分 48 秒$1.26官方登录
GPT-5.6 Sol / 高#480/10045 分 2 秒$0.96官方登录
GPT-5.6 Sol / 中#968/10043 分 38 秒$0.66官方登录
GPT-5.6 Sol / 轻度#1365/10039 分 5 秒$0.44官方登录

五题分布

题目GPT-5.6 Sol / 最高GPT-5.6 Sol / 极高GPT-5.6 Sol / 高GPT-5.6 Sol / 中GPT-5.6 Sol / 轻度
契约测试/边界场景14/2016/2015/2012/2013/20
反例构造/重试调度20/2018/2017/2017/2014/20
方案审计/对抗场景18/2017/2018/2014/2013/20
状态机/事务回归17/2016/2018/2013/2011/20
测试设计/缓存回归16/2016/2012/2012/2014/20

档位分布能说明什么

该系列通过记录的官方登录路由测试了多个思考深度。页面保留每个档位,避免把 Max 的结果归到 Low,或反过来。

最高分与最快完成是两个不同信号。它们指向不同配置时,应按你的质量底线选择,而不是只看系列名称。