正在核对最新结果
当前榜单采用什么标准
公开页面展示理解当前结果所需的权重、比较边界、发布状态和来源身份。
- 最近发布
- 能力范围
- 后端与测试、前端与交互、知识与推理
- 综合分权重
- 后端与测试 50% · 前端与交互 30% · 知识与推理 20%
- 比较原则
- 同类能力、同一标准、独立排名
比较规则
三条简单原则
能力分开看
综合分之下仍保留后端、前端和推理分榜,不用一个数字掩盖能力差异。
同一标准才比较
只有评测条件一致的结果,才比较名次和趋势。
效率单独看
加权综合分只衡量能力;耗时和参考费用单独展示,真正切换前再复核稳定性。
决策规则
切换前,应该怎样读取榜单
当前综合领先只是 50/30/20 加权榜的第一名,不等于自动要求你切换配置。
- 先看综合领先
- 用加权综合榜形成候选范围,再打开与你当前工作最相关的能力分榜。
- 再看是否可比
- 结合协议一致的历史判断变化,单次波动不代表模型退化。
- 最后复核路由
- 单独比较耗时和参考费用,再用自己的账号和路由复核后决定是否切换。
发布流程
结果通过核验后再发布
ModelDial 按计划核验,只有新结果通过校验后才发布;在此之前继续保留上一份可靠结果。
- 01
评测
在一致条件下运行当前配置。
- 02
核验
确认结果完整、可比且没有已知异常。
- 03
发布
更新当前榜单,并保留此前的已验证结果。
如何理解
如何使用这些结果
公开雷达
快速了解模型在 ModelDial 公开评测中的表现,不会消耗你的供应商额度。
本机评测
验证你的账号和接入方式是否适合自己的任务,密钥和历史保留在 Mac 上。
使用边界
单次结果不是永久结论,参考费用也不是你的实际账单。