先看综合,再看三项能力
综合分按后端与测试 50%、前端与交互 30%、知识与推理 20% 计算;三项结果齐全的配置才会入榜。
- 综合分
- 等待三类能力全部发布
综合得分
后端与测试 50%、前端与交互 30%、知识与推理 20% 的加权结果
核验通过后发布
不只看名次,也看这轮变了什么
后端与测试每次发布都会对照上一份可比结果,区分名次升降、得分变化和推荐是否改变。
常见榜单回答哪个模型整体更强?
ModelDial 回答今天这段工作,该用哪套配置?
公开结果筛候选,本机扫描验路由
公开雷达比较三项能力;本机扫描沿用后端与测试的比较方法,请求只走你选择的路由,密钥、历史和证据留在 Mac。
结果可比
核验后发布
先通过
请求只会经过你选择的那条路由。
密钥、配置、扫描历史和建议都保留在本机。
看懂 ModelDial
三种能力、百分制、更新状态、参考费用,以及公开雷达和本机验证的边界。
ModelDial 和常见模型榜单有什么区别?
常见榜单回答“哪个模型整体更强”,ModelDial 以自建并核验的评测,分别比较模型、思考深度和路由配置的三种能力。公开雷达用于筛选候选,再用本机扫描复核自己的账号或路由,不把一份榜单当成通用切换建议。
三种能力分别评测什么?
后端与测试关注代码实现、问题调试和测试设计;前端与交互关注界面实现、交互细节和视觉结果;知识与推理关注信息理解、综合分析和复杂问题。三类能力分别排名。
100 分代表什么,综合分什么时候生成?
三种能力各自采用受对应评测协议约束的 100 分制;它不是现实任务的成功概率,也不能脱离评测协议跨榜直接比较。综合分按后端与测试 50%、前端与交互 30%、知识与推理 20% 加权,只有同一配置的三种能力都有核验结果后才会生成;缺失维度继续显示待发布,不会按 0 分计入。
为什么某项显示待发布,或者还在显示上一轮结果?
ModelDial 只发布通过核验的能力结果。没有已验证结果的维度保持待发布;新批次尚未准备好时,页面继续显示上一份已验证结果,不会编造分数,也不会重置为 100 分。页面显示发布时间,不是任务开始时间。
雷达里的参考费用等于我的实际账单吗?
不等于。它只是同等参考评测的大致成本,不是你的实际账单;实际费用还会受账号、缓存和自定义路由影响。
公开雷达和本机验证有什么区别?
公开雷达来自 ModelDial 统一控制的三项能力评测,不占用你的供应商额度。本机扫描只在你主动开始后,沿用后端与测试的比较方法检查自己的账号、路由或端点;密钥、配置、扫描历史和建议都保留在 Mac 上。网站访问统计使用 180 天有效的第一方随机浏览器 Cookie,并尊重 GPC/DNT。