一张榜单里同时出现“文本准确率”“图片准确率”“有效回答”“ECE”和“I/C”,很容易把它们都理解成同一种分数。CMDB-1500 应先按任务模态和固定分母阅读,再结合概率质量选择模型。
CMDB-1500 是什么?
CMDB 是 Comprehensive Multimodal Decision Benchmark。Surd AI 的 CMDB-1500 由 1,200 道文本题和 300 道图片题组成,用于评估选择与概率判断。榜单由 Surd AI 维护,也包含 Surd AI 自己的 SPX-CD 模型,因此应保留自测来源说明。CMDB 介绍与完整榜单
| 视图 | 固定分母 | 适合回答的问题 |
|---|---|---|
| 文本 | 1,200 | 在相同文本任务上,谁答对得更多? |
| 图片 | 300 | 在这批图片任务上,视觉决策表现如何? |
| 全题 | 1,500 | 对同时参加两种模态评测的模型,整体结果如何? |
| 概率与 I/C | 以对应方法与覆盖为准 | 置信度是否可靠,指数如何归一化? |
SPX-CD 和 Jev 的文本成绩
2026 年 10 月 8 日核对的文本记录如下。SPX-CD 的这组评测使用 effort=2;数值对应该次固定题集,不代表任意业务的准确率。完整成绩和评测详情
| 模型 | 文本准确率 | 答对 / 1,200 |
|---|---|---|
| SPX-CD-Pro | 79.33% | 952 |
| SPX-CD-Flash | 77.58% | 931 |
| Jev | 72.17% | 866 |
按正确数计算,Pro 比 Jev 多答对 86 道文本题,Flash 多答对 65 道。这个比较限定在文本部分。Jev 这条记录的评测范围是 1,200 道文本题,不应把它直接插入混合模态总分来解释图片能力。
有效覆盖为什么要与准确率一起看?
假设一个模型在 1,200 道文本题中只返回 1,000 个可用结果,其中 900 个正确。“有效回答中的正确率”是 90%,而以全部任务为分母则是 75%。两者描述不同,后者才能保留未完成任务的影响。这个例子用于解释分母,不是某个模型的实际成绩。
同时,“有效 / 全评测范围”可能覆盖文本和图片两部分。查看文本表时,不要把一条多模态记录的 1,500 个有效回答误认为 1,500 道文本题。
ECE、I/C 和准确率不能互相替代
CMDB 页面将 ECE 计算口径说明为 10 个概率区间、具有原生概率的有效单选与是非题;不同模型的模态覆盖可能不同。概率校准说明
低 ECE 不意味着每道题都答对,高准确率也不保证高置信度预测可靠。I/C 应按该榜单自己的方法理解,不能仅凭同名缩写,与 JevBench 的 Intelligence、Calibration 数字互换。
对于自动执行任务,建议补充一张误判矩阵:哪些应放行的样本被拦截,哪些应拦截的样本被放行。再结合错误成本设阈值,这通常比只看一个总分更有用。
常见问题
可以和 Image JevBench 直接比数字吗?
不能直接换算。先核对题集、版本和计分方式。见 图片决策评测指南。
榜单证明哪个模型在生产环境最快吗?
准确率表不能回答这个问题。需要另测相同输入长度、图片规格、问题数量和并发下的端到端时间。
如何开始自己的评测?
从 公开榜单 选候选模型,再按照 决策 API 评估指南 固定问题、标签和测试设置。注册后可在 Console 运行应用样例。