第一方模型可用性雷达

模型降智,别靠感觉ModelDial告诉你何时该切

ModelDial 按计划核验,有新结果通过校验后再发布;综合榜汇总三项能力各自最新的核验结果

当前综合领先正在核对最新结果

先看综合,再看三项能力

综合分按后端与测试 50%、前端与交互 30%、知识与推理 20% 计算;三项结果齐全的配置才会入榜。

综合分
等待三类能力全部发布
正在核对最新结果

综合得分

后端与测试 50%、前端与交互 30%、知识与推理 20% 的加权结果

正在核对最新结果

核验通过后发布

不只看名次,也看这轮变了什么

后端与测试每次发布都会对照上一份可比结果,区分名次升降、得分变化和推荐是否改变。

常见榜单回答哪个模型整体更强?

ModelDial 回答今天这段工作,该用哪套配置?

公开结果筛候选,本机扫描验路由

公开雷达比较三项能力;本机扫描沿用后端与测试的比较方法,请求只走你选择的路由,密钥、历史和证据留在 Mac。

01标准一致

结果可比
核验后发布

02质量门槛

先通过

03你的供应商

请求只会经过你选择的那条路由。

04你的 Mac

密钥、配置、扫描历史和建议都保留在本机。

查看评测方法

看懂 ModelDial

三种能力、百分制、更新状态、参考费用,以及公开雷达和本机验证的边界。

ModelDial 和常见模型榜单有什么区别?

常见榜单回答“哪个模型整体更强”,ModelDial 以自建并核验的评测,分别比较模型、思考深度和路由配置的三种能力。公开雷达用于筛选候选,再用本机扫描复核自己的账号或路由,不把一份榜单当成通用切换建议。

三种能力分别评测什么?

后端与测试关注代码实现、问题调试和测试设计;前端与交互关注界面实现、交互细节和视觉结果;知识与推理关注信息理解、综合分析和复杂问题。三类能力分别排名。

100 分代表什么,综合分什么时候生成?

三种能力各自采用受对应评测协议约束的 100 分制;它不是现实任务的成功概率,也不能脱离评测协议跨榜直接比较。综合分按后端与测试 50%、前端与交互 30%、知识与推理 20% 加权,只有同一配置的三种能力都有核验结果后才会生成;缺失维度继续显示待发布,不会按 0 分计入。

为什么某项显示待发布,或者还在显示上一轮结果?

ModelDial 只发布通过核验的能力结果。没有已验证结果的维度保持待发布;新批次尚未准备好时,页面继续显示上一份已验证结果,不会编造分数,也不会重置为 100 分。页面显示发布时间,不是任务开始时间。

雷达里的参考费用等于我的实际账单吗?

不等于。它只是同等参考评测的大致成本,不是你的实际账单;实际费用还会受账号、缓存和自定义路由影响。

公开雷达和本机验证有什么区别?

公开雷达来自 ModelDial 统一控制的三项能力评测,不占用你的供应商额度。本机扫描只在你主动开始后,沿用后端与测试的比较方法检查自己的账号、路由或端点;密钥、配置、扫描历史和建议都保留在 Mac 上。网站访问统计使用 180 天有效的第一方随机浏览器 Cookie,并尊重 GPC/DNT。