← 模型与交互指南
GUIDES / JevBench

JevBench 怎么看?Public 231、Hard 111 与 SPX-CD 成绩

查看 SPX-CD-Pro、Flash 和 Jev 的 JevBench Public 231、Hard 111 成绩,区分 effort、ECE、公开题准确率与官方综合榜。

Surd AI · 研究与工程中文

搜索 JevBench 成绩时,经常会同时看到准确率、Intelligence、Calibration 和综合分。它们回答的问题不同。Public 231 上答对多少题,不能直接当作整个 JevBench 综合榜的分数。

JevBench 是谁维护的?

JevBench 是独立的结构化决策评测项目,并非 TypeSafe AI 的官方评测。Jev 是被评测的模型之一。其公开题包括 Easy 48、Original 72 和 Hard 111,共 231 道;Hard 111 已包含在 Public 231 中。项目与题集 · 第三方项目说明

Public 231 与 Hard 111:已有成绩怎么比较?

下表摘自 Surd AI 发布页,于 2026 年 10 月 8 日核对。SPX-CD 是自测记录;Jev 1.13.0 是发布页采用的同组公开题参考。表格展示公开题结果,不声称是第三方完整榜单的认证或排名。原始发布表

模型与设置 Public 231 Hard 111 Hard ECE ↓
SPX-CD-Pro · effort=1 207/231 · 89.61% 88/111 · 79.28% 4.73%
SPX-CD-Pro · effort=2 208/231 · 90.04% 89/111 · 80.18% 9.80%
SPX-CD-Flash · effort=1 204/231 · 88.31% 86/111 · 77.48% 5.18%
SPX-CD-Flash · effort=2 206/231 · 89.18% 86/111 · 77.48% 7.06%
Jev 1.13.0 · 公开参考 200/231 · 86.58% 81/111 · 72.97% 未提供

从正确数可以看出,Pro 的 effort=2 在这组 Hard 题上比 effort=1 多答对 1 题;Flash 的 Hard 正确数相同。同时,两者的 Hard ECE 都是 effort=1 更低。更多评估次数在这组结果中没有同时改善准确率与校准误差。 缺失的 ECE 不应填成零。

为什么榜单总分可能比公开题准确率低?

JevBench v1.4 方法还使用封闭题、概率校准、速度与费用,并用调和平均等规则组合指标。因此,公开题准确率很高的系统,也可能在其他维度受到限制。v1.4 方法

阅读榜单时,建议按顺序检查:具体版本、覆盖哪些题、每个维度的原始量,以及最终分数的计算规则。一个显示为 60 多分的综合结果,不意味着模型只答对 60% 的 Public 题。

ECE 与实际业务阈值如何衔接?

ECE 描述概率分桶与实际正确率之间的差距,越低通常表示该种分桶下更接近。但它会受到样本量、题目分布和分桶方式影响。业务若只在概率高于某个阈值时自动执行,应另外报告该阈值下的覆盖率和错误率。

例如,自动客服路由可以接受少量误分,而执行不可撤销操作通常需要更严格的审核。公开榜单提供候选模型,业务阈值仍应在自己的独立测试集上确定。

常见问题

可以把 Public 231 和 Hard 111 加起来吗?

不能,Hard 是 Public 的子集,相加会重复计数。

effort=2 是否一定更好?

这张表不支持这样的结论。请同时看正确数、概率质量和实际调用成本,并保留测试配置。

Decision Index 与 JevBench 是同一套吗?

不是。见 Decision Index 版本指南。也可以通过 CMDB 指南 了解文字和图片评测,再在 Console 用自己的任务验证。

SIMPLEX CD / API

用自己的问题,试一次决策。

注册账号,在工作台体验决策模型,或查看 API 文档开始接入。