← 模型与交互指南
GUIDES / CMDB-1500

CMDB-1500 榜单指南:文本、图片、准确率与概率校准

解释 CMDB-1500 的 1,200 道文本题、300 道图片题、有效覆盖、ECE 与 I/C,并连接 SPX-CD、Jev 和其他决策模型的公开成绩。

Surd AI · 研究与工程中文

一张榜单里同时出现“文本准确率”“图片准确率”“有效回答”“ECE”和“I/C”,很容易把它们都理解成同一种分数。CMDB-1500 应先按任务模态和固定分母阅读,再结合概率质量选择模型。

CMDB-1500 是什么?

CMDB 是 Comprehensive Multimodal Decision Benchmark。Surd AI 的 CMDB-1500 由 1,200 道文本题和 300 道图片题组成,用于评估选择与概率判断。榜单由 Surd AI 维护,也包含 Surd AI 自己的 SPX-CD 模型,因此应保留自测来源说明。CMDB 介绍与完整榜单

视图 固定分母 适合回答的问题
文本 1,200 在相同文本任务上,谁答对得更多?
图片 300 在这批图片任务上,视觉决策表现如何?
全题 1,500 对同时参加两种模态评测的模型,整体结果如何?
概率与 I/C 以对应方法与覆盖为准 置信度是否可靠,指数如何归一化?

SPX-CD 和 Jev 的文本成绩

2026 年 10 月 8 日核对的文本记录如下。SPX-CD 的这组评测使用 effort=2;数值对应该次固定题集,不代表任意业务的准确率。完整成绩和评测详情

模型 文本准确率 答对 / 1,200
SPX-CD-Pro 79.33% 952
SPX-CD-Flash 77.58% 931
Jev 72.17% 866

按正确数计算,Pro 比 Jev 多答对 86 道文本题,Flash 多答对 65 道。这个比较限定在文本部分。Jev 这条记录的评测范围是 1,200 道文本题,不应把它直接插入混合模态总分来解释图片能力。

有效覆盖为什么要与准确率一起看?

假设一个模型在 1,200 道文本题中只返回 1,000 个可用结果,其中 900 个正确。“有效回答中的正确率”是 90%,而以全部任务为分母则是 75%。两者描述不同,后者才能保留未完成任务的影响。这个例子用于解释分母,不是某个模型的实际成绩。

同时,“有效 / 全评测范围”可能覆盖文本和图片两部分。查看文本表时,不要把一条多模态记录的 1,500 个有效回答误认为 1,500 道文本题。

ECE、I/C 和准确率不能互相替代

CMDB 页面将 ECE 计算口径说明为 10 个概率区间、具有原生概率的有效单选与是非题;不同模型的模态覆盖可能不同。概率校准说明

低 ECE 不意味着每道题都答对,高准确率也不保证高置信度预测可靠。I/C 应按该榜单自己的方法理解,不能仅凭同名缩写,与 JevBench 的 Intelligence、Calibration 数字互换。

对于自动执行任务,建议补充一张误判矩阵:哪些应放行的样本被拦截,哪些应拦截的样本被放行。再结合错误成本设阈值,这通常比只看一个总分更有用。

常见问题

可以和 Image JevBench 直接比数字吗?

不能直接换算。先核对题集、版本和计分方式。见 图片决策评测指南。

榜单证明哪个模型在生产环境最快吗?

准确率表不能回答这个问题。需要另测相同输入长度、图片规格、问题数量和并发下的端到端时间。

如何开始自己的评测?

从 公开榜单 选候选模型,再按照 决策 API 评估指南 固定问题、标签和测试设置。注册后可在 Console 运行应用样例。

SIMPLEX CD / API

用自己的问题,试一次决策。

注册账号,在工作台体验决策模型,或查看 API 文档开始接入。