评测方法

ModelDial 如何比较模型

三类能力分别评测,综合分按后端与测试 50%、前端与交互 30%、知识与推理 20% 计算。

正在核对最新结果

当前榜单采用什么标准

公开页面展示理解当前结果所需的权重、比较边界、发布状态和来源身份。

最近发布
能力范围
后端与测试、前端与交互、知识与推理
综合分权重
后端与测试 50% · 前端与交互 30% · 知识与推理 20%
比较原则
同类能力、同一标准、独立排名

比较规则

三条简单原则

01

能力分开看

综合分之下仍保留后端、前端和推理分榜,不用一个数字掩盖能力差异。

02

同一标准才比较

只有评测条件一致的结果,才比较名次和趋势。

03

效率单独看

加权综合分只衡量能力;耗时和参考费用单独展示,真正切换前再复核稳定性。

决策规则

切换前,应该怎样读取榜单

当前综合领先只是 50/30/20 加权榜的第一名,不等于自动要求你切换配置。

先看综合领先
用加权综合榜形成候选范围,再打开与你当前工作最相关的能力分榜。
再看是否可比
结合协议一致的历史判断变化,单次波动不代表模型退化。
最后复核路由
单独比较耗时和参考费用,再用自己的账号和路由复核后决定是否切换。

发布流程

结果通过核验后再发布

ModelDial 按计划核验,只有新结果通过校验后才发布;在此之前继续保留上一份可靠结果。

  1. 01

    评测

    在一致条件下运行当前配置。

  2. 02

    核验

    确认结果完整、可比且没有已知异常。

  3. 03

    发布

    更新当前榜单,并保留此前的已验证结果。

如何理解

如何使用这些结果

公开雷达

快速了解模型在 ModelDial 公开评测中的表现,不会消耗你的供应商额度。

本机评测

验证你的账号和接入方式是否适合自己的任务,密钥和历史保留在 Mac 上。

使用边界

单次结果不是永久结论,参考费用也不是你的实际账单。