← 模型与交互指南
GUIDES / Decision Index

Decision Index 0.2.1 与 0.3:15 万题评测和榜单分数怎么看?

解释 Hugging Face Decision Index 的版本、覆盖修正、公开指数与 Full score,查看 SPX-CD 和 Jev 的 0.2.1 参考成绩。

Surd AI · 研究与工程中文

“跑完 15 万题”和“拿到当前榜单总分”不一定是同一件事。Decision Index 在不同版本中调整过题集与评分范围。发布分数时,应同时写版本号,以及它是公开指数还是包含私有测试的 Full score。

Decision Index 是什么?

Decision Index 面向输出结构化选项和概率的决策模型,提供公开评测复现工具,并在 Hugging Face 展示榜单。本文于 2026 年 10 月 8 日核对的工具文档,已将 0.3 设为当前版本;0.2.1 等旧版本仍可按版本复现。项目与复现说明 · Hugging Face 榜单

约 15 万题指什么范围?

0.2.1 文档列出的可计分请求为 119,898 加上新增部分的 30,419,合计 150,317。这是请求级计数,不等于 150,317 个独立来源数据集,也不能用题量反推一个简单正确率就是指数。0.2.1 版本说明

不同任务可能采用不同原生指标。我们建议保存题集清单、实际回答数、错误数和汇总方式,而不是只保存最后一行分数。这样才能判断两次运行到底是模型表现变化,还是运行覆盖不同。

SPX-CD 与 Jev 的 0.2.1 记录

下面是 Surd AI 发布页保留的 Decision Index 0.2.1 结果。SPX-CD 为自测,effort=1;Jev 为发布页引用的参考。这张表不是 Decision Index 0.3 Full score 排名。模型发布页

模型 0.2.1 指数 ↑ 设置
SPX-CD-Pro 58.30 effort=1
Jev 1.13.0 57.91 已发布参考
SPX-CD-Flash 54.65 effort=1

在这个版本中,Pro 高于 Jev 0.39 分,Flash 低于 Jev 3.26 分。不能只挑选另一个评测中更有利的名次,来声称所有决策任务都得到了相同结论。发布页尚未提供这项指数的 SPX-CD effort=2 成绩。

0.3 的公开指数与 Full score

当前文档把 0.3 Full score 分为公开部分 20%、同类技能私有测试 50%、新领域私有决策 30%;私有部分还涉及尺度对齐。公开工具产生公开指数,不能单独算出缺少私有测试的完整成绩。0.3 计分与提交说明

因此,如果只有公开部分,应明确写“public index”,保留其版本;不把它填到 Full score 一栏,也不把 0.2.1 数字直接换标签为 0.3。

为什么覆盖和随机基线会影响结果?

只对成功回答计算指标,可能奖励跳过困难题的系统。覆盖修正是为了让未回答任务对结果产生影响。随机基线则提醒我们:二选一和很多候选的任务,猜对机会不同。这些一般原则解释了为什么归一化指数不能直接读作准确率。

应用评测也可以采用类似思路,但必须事先固定规则。超时、无法解析、未支持的题型应如何处理,应在看结果之前决定,而不是运行完再选择更有利的分母。

常见问题

58.30 就是答对 58.30% 吗?

不是。它是指定版本的综合指数,具体含义依赖该版本的任务指标与汇总规则。

为什么 JevBench、CMDB 与 Decision Index 的排序不同?

题型、模态、覆盖、配置和汇总规则不同。应把差异当成进一步测试的线索,而不是强行平均成一个“总准确率”。

从哪里开始读其他评测?

参阅 JevBench 成绩指南、CMDB-1500 指南,或到 指南目录 选择图片和音频主题。

SIMPLEX CD / API

用自己的问题,试一次决策。

注册账号,在工作台体验决策模型,或查看 API 文档开始接入。