指南与证据

选择、运行和切换 AI 编程模型时,真正需要回答的问题

每个页面都从一个实际决策出发:该试哪个配置、档位名称代表什么、流为什么提前结束,以及最新实测结果能证明什么、不能证明什么。

什么内容才会放进这里
  • 先给直接答案,再明确证据边界。
  • 依赖评测的结论必须使用当前 ModelDial 数据。
  • 所有模型判断都能追溯到具体配置和批次。

选择与稳定性指南

指南

如何判断 AI 模型是否真的出现性能回退

区分一次批次波动与连续、协议一致的下降,再用自己的路由做本机复核。

打开页面
指南

AI 编程模型排行,先看具体配置

只报模型名会漏掉两个经常改变结果的变量:思考深度和连接路由。真正需要比较的是你能实际运行的配置,而不是孤立的品牌名。

打开页面
指南

Low、High、Max 是配置,不是质量保证

思考深度只有和模型、路由放在一起才有意义。不同供应商使用相同档位名称,并不代表它们是一套可换算的智能单位。

打开页面
指南

流式返回能提高可见性,但不能消除超时

流可以证明生成仍在推进,但客户端、代理和供应商仍各自保留时限。没有收到协议要求的终止事件,就不能把这次请求记为完成。

打开页面
指南

过不了质量底线的低价模型,并不便宜

质量、耗时和参考费用回答的是三个不同问题。把它们合成推荐之前,必须保留各自的比较口径。

打开页面

当前后端与测试证据

模型证据

GPT-5.6 Sol、Terra 与 Luna

把三个 GPT-5.6 变体放在同一发布批次中比较,不把 Sol、Terra 与 Luna 当成可以互换的名称。

打开页面
模型证据

GPT-5.6 Sol

分别比较 GPT-5.6 Sol 的各个思考深度,不把它们压成一个模型分数。

打开页面
模型证据

Qwen 3.8

读取 Qwen 3.8 Max 的实测配置,不把费用缺失或模型名中的 Max 当成统一档位。

打开页面
模型证据

DeepSeek V4

在同一发布批次中分别比较 Flash、Pro 及其思考深度,不把它们合成一行。

打开页面
模型证据

Kimi K3

查看 Kimi K3 的实测配置,并始终保留它的思考深度和自定义端点路由。

打开页面
模型证据

GLM-5.3

比较 GLM-5.3 实测档位,不把一条自定义端点的结果扩大为整个供应商结论。

打开页面

直接配置对比

配置对比

GPT-5.6 Sol 与 Qwen 3.8 怎么选

在同一批次中比较两个系列当前最高分实测配置,并保留路由和费用缺失边界。

打开页面
配置对比

Qwen 3.8 与 Kimi K3 怎么选

在同一批次中比较两边当前实测配置,并保留路由和费用缺失边界。

打开页面
配置对比

Kimi K3 与 GLM-5.3 怎么选

总分接近时,五题分布和后续可比批次比一分胜负更重要。

打开页面