当前公开证据
先看它会怎么回答
核验通过后发布
装一次,之后直接问
把提示词交给支持 Agent Skills 的工具,或运行已审阅的安装脚本。两种方式安装的是同一个匿名只读包。
请从 https://modeldial.com/modeldial-skill/SKILL.md 安装 ModelDial Skill。写入 skills 目录前,先审阅其中链接的全部文件。更习惯用命令行?
bash <(curl -fsSL https://modeldial.com/modeldial-skill/install.sh) --target agents安装到 Agent 已在使用的目录
安装器会先核对完整包,再替换已有的 ModelDial Skill。
开启新会话
多数工具会在会话开始时发现 Skill。安装后请重启工具或新建任务。
用一个问题完成验证
当前 ModelDial 雷达由哪个配置领先?最近一份可比的后端与测试结果有哪些变化?请分别给出证据和数据来源。
成功答案应包含相关发布身份、当前领先配置或代理建议方案、支持结论的证据,以及指向 ModelDial 来源的链接。
如果数据读取失败Agent 必须明确停止,不能改抓网页、沿用旧批次,也不能凭记忆补答案。
直接问你要做的决定
Skill 会根据问题选择当前榜单、可比变化、代理配置方案或完整证据。
- 01当前榜单
当前雷达领先的是哪个配置,为什么?
- 02近期退化信号
GPT-5.6 Sol High 最近有没有降智信号?
- 03你的配置
我在用 GPT-5.6 Sol,思考深度是 XHigh,走官方登录路由。综合平衡下值得切吗?
- 04代理配置
基于最新 ModelDial 结果,我的主代理和执行代理应该怎么配?先给综合平衡方案,再列出质量优先和性价比方案。
先给证据,再给建议
ModelDial 给 Agent 稳定的榜单顺序、明确的比较规则,以及证据不足时必须停下来的边界。
只比较协议一致的批次
只有比较标准一致时,才提供最近变化。
从你的配置出发
缺少模型、思考深度或路由时,Agent 必须先问,不能直接把榜首当成个人建议。
把下降当成信号
单轮可比得分下降可以触发复核,但不能据此断言厂商改动了模型。
最终验收仍由主代理负责
执行代理只承担边界明确的任务;需求理解、结果整合和最终验收留在主代理。
Skill 不会越界下结论
不会重新排名
发布器顺序就是排名。Skill 不会根据得分或厂商名称重排。
不会武断判定模型被改动
可比得分下降属于信号,但不能单独证明厂商修改或削弱了模型。
不会臆测个人适配
不知道你的准确配置时,Skill 只报告当前格局,或追问一个简短问题。
不会把估算写成账单
参考费用描述受控批次,不是你的发票或实际用量账单。
不会声称两个配置一起跑过
角色方案来自三个能力轴各自最新发布结果中的独立评测配置,不是双代理联合评测。
同一份雷达,也能直接读取
日常查询使用紧凑 JSON;审计时按问题选择后端与测试索引,或三项能力发布索引。
- GET / JSON
当前紧凑榜单
/api/v1/radar/latest.json默认展示综合榜及三轴得分和权重,同时保留兼容的后端榜。
- GET / JSON
代理配置方案
/api/v1/radar/agent-profile.json根据已发布决策标签提供综合平衡、质量优先和性价比三种角色方案;不等同于双代理联合评测。
- GET / JSON
最近可比变化
/api/v1/radar/changes.json通过协议兼容检查后提供后端榜排名、得分、耗时和推荐变化;仅在 pricing snapshot 一致时提供费用差值。
- GET / JSON
后端与测试发布索引
/api/v1/radar/index.json后端批次身份、发布时间、协议字段、哈希和完整快照链接。
- GET / JSON
能力分榜发布索引
/data/benchmark-snapshots/index.json三项能力各自最新的核验批次身份、归档链接,以及加权综合榜身份。
- GET / JSON
完整后端与测试快照
/data/reference-snapshots/latest.json适合审计的后端与测试逐题结果和来源字段。
Skill 开放,数据需署名
Skill 指令采用 MIT License。已发布的雷达数据采用 CC BY 4.0,使用时应尽量注明 ModelDial 和来源批次。