← 全部文章

RESEARCH / MULTIMODAL DECISIONS

CMDB-1500多模态决策模型基准测试

Comprehensive Multimodal Decision Benchmark 1500

1,200 道文本题,300 道图片题,评估模型的选择与概率判断。

筛选
SPX-CDJev通用推理模型其他决策模型

查看文本榜精确数值
CMDB-1500 文本榜,固定分母 1,200,有效回答为整个评测范围覆盖
排名模型 / 版本准确率 · 0–100%答对 / 固定分母有效 / 全评测范围
01GPT 6.1 Sol · low80.00%960 / 1,2001,500 / 1,500
02SPX-CD-Pro (2026-10-04)79.33%952 / 1,2001,500 / 1,500
03Claude Sonnet 5.5 · low78.00%936 / 1,2001,500 / 1,500
04StartLux-Decision-27B · BF1677.92%935 / 1,2001,500 / 1,500
05SPX-CD-Flash77.58%931 / 1,2001,500 / 1,500
06GPT 6 Luna · low76.58%919 / 1,2001,500 / 1,500
07GLM 5.3 Flash · low75.75%909 / 1,2001,500 / 1,500
08StartLux-Decision-35B-A3B · BF1675.67%908 / 1,2001,500 / 1,500
09SPX-CD-Omni74.67%896 / 1,2001,500 / 1,500
10Mercury Decide73.92%887 / 1,2001,200 / 1,200
11pplx-decider 27B72.83%874 / 1,2001,500 / 1,500
12Jev72.17%866 / 1,2001,200 / 1,200
13Cloudflare Clef71.50%858 / 1,2001,485 / 1,500
14JPT · 9B71.33%856 / 1,2001,500 / 1,500
15Qwen 3.8 Flash71.08%853 / 1,2001,500 / 1,500
16Kimi K2.671.00%852 / 1,2001,500 / 1,500
17Mapika · Decider 4B v2.169.83%838 / 1,2001,200 / 1,200
18Cloudflare Clef-Flash69.67%836 / 1,2001,485 / 1,500
19Imajev-9B68.83%826 / 1,2001,478 / 1,500
20Kev · 9B68.67%824 / 1,2001,200 / 1,200
21DeepSeek V4.1 Flash68.58%823 / 1,2001,500 / 1,500
22JPT · 4B67.67%812 / 1,2001,500 / 1,500
23Decision Lux · 9B67.42%809 / 1,2001,200 / 1,200
24Jet · v6.2 4B66.92%803 / 1,2001,200 / 1,200
25Open-Jev · Zefan 9B66.67%800 / 1,2001,199 / 1,200
26Nimble · v2 9B66.58%799 / 1,2001,200 / 1,200
27Hopper G · 4B v1.365.92%791 / 1,2001,200 / 1,200
28Malkuth · 4B65.58%787 / 1,2001,200 / 1,200
29Hopper · 4B65.50%786 / 1,2001,200 / 1,200
30Winnow · 12B Q865.33%784 / 1,2001,410 / 1,500
31JevK564.83%778 / 1,2001,200 / 1,200
32Lev · 4B64.58%775 / 1,2001,200 / 1,200
33Mica · 4B BF16 GGUF64.25%771 / 1,2001,200 / 1,200
34Kev · 4B64.17%770 / 1,2001,200 / 1,200
35Jev-Omni · 12B63.58%763 / 1,2001,493 / 1,500
36APUS OpenJev · 9B 3000 High61.42%737 / 1,2001,085 / 1,200
37OpenDecider · Small61.25%735 / 1,2001,200 / 1,200
38APUS OpenJev · 9B 5949 High61.08%733 / 1,2001,085 / 1,200
39OpenDecider · Small TD60.67%728 / 1,2001,200 / 1,200
40APUS OpenJev · 4B 5949 High60.08%721 / 1,2001,085 / 1,200
41Ateve Jev59.75%717 / 1,2001,087 / 1,200
42Bocha Jev58.92%707 / 1,2001,087 / 1,200
43Winnow · E4B Q858.92%707 / 1,2001,410 / 1,500
44Reflex · Stable 4B58.50%702 / 1,2001,387 / 1,500
45Plumb · v5.2 4B58.08%697 / 1,2001,085 / 1,200
46FLock THIS/THAT57.67%692 / 1,2001,156 / 1,200
47Kev · 0.8B51.75%621 / 1,2001,200 / 1,200
48Bosun v3.1 · 1.7B49.75%597 / 1,2001,200 / 1,200
49OpenDecider · Nano46.75%561 / 1,2001,143 / 1,200
50CalDec · Laya46.08%553 / 1,2001,189 / 1,200
51Bosun v3.1 · 0.6B45.58%547 / 1,2001,200 / 1,200
52Laya · Typed Decisions44.58%535 / 1,2001,189 / 1,200
53CalDec · GLiNER43.17%518 / 1,2001,200 / 1,200
54Laya · English41.00%492 / 1,2001,189 / 1,200
55Laya · Multilingual40.25%483 / 1,2001,192 / 1,200
56GLiNER2.5-Decide38.58%463 / 1,2001,200 / 1,200
57Julia-135.75%429 / 1,2001,079 / 1,200
58CLM v0.1 · 8B34.92%419 / 1,2001,200 / 1,200

多模态筛选显示本次参加图片评测的模型。

综合 ECE 校准榜

柱越高,误差越小 ↑
查看ECE榜精确数值
ECE榜完整数值
排名模型 / 版本ECE ↓
01SPX-CD-Pro2.46%
02SPX-CD-Flash2.49%
03StartLux-Decision-27B · BF162.65%
04StartLux-Decision-35B-A3B · BF162.71%
05pplx-decider 27B3.08%
06Reflex · Stable 4B3.33%
07JPT · 9B3.47%
08Plumb · v5.2 4B3.53%
09Imajev-9B3.74%
10GLiNER2.5-Decide3.98%
11Mapika · Decider 4B v2.14.08%
12Kev · 9B4.09%
13OpenDecider · Small TD4.21%
14Decision Lux · 9B4.36%
15Malkuth · 4B4.43%
16Winnow · E4B Q84.56%
17OpenDecider · Small4.58%
18Laya · Typed Decisions4.86%
19Jev4.99%
20OpenDecider · Nano5.00%
21JevK55.05%
22SPX-CD-Omni5.11%
23Kev · 0.8B5.27%
24Nimble · v2 9B5.28%
25Kev · 4B5.63%
26JPT · 4B5.97%
27Ateve Jev6.09%
28Hopper · 4B6.23%
29Bocha Jev6.57%
30Lev · 4B6.78%
31Cloudflare Clef-flash7.90%
32Jet · v6.2 4B7.91%
33Jev-Omni · 12B8.08%
34Open-Jev · Zefan 9B8.62%
35Mica · 4B BF16 GGUF8.66%
36Winnow · 12B Q89.07%
37CalDec · Laya9.24%
38Hopper G · 4B v1.39.29%
39Cloudflare Clef9.40%
40CalDec · GLiNER9.40%
41Bosun v3.1 · 0.6B10.67%
42Mercury Decide10.77%
43APUS OpenJev · 9B 3000 High12.68%
44Bosun v3.1 · 1.7B13.01%
45Laya · English14.42%
46APUS OpenJev · 4B 5949 High14.86%
47APUS OpenJev · 9B 5949 High15.45%
48Laya · Multilingual19.74%
49FLock THIS/THAT30.09%
50CLM v0.1 · 8B31.16%
51Julia-140.55%

ECE 按 10 个概率区间计算,使用有原生概率的有效单选与是/否题。柱顶显示实际误差;各模型的文本与图片覆盖范围可能不同。

I/C 指数榜

0–100 分,越高越好 ↑

查看I/C榜精确数值
I/C榜完整数值
排名模型 / 版本I ↑C ↑
01SPX-CD-Pro65.4183.58
02Mercury Decide64.5474.53
03StartLux-Decision-27B · BF1664.4883.63
04Winnow · 12B Q860.6068.72
05StartLux-Decision-35B-A3B · BF1660.0582.74
06JPT · 9B59.7083.87
07Cloudflare Clef59.4279.68
08Cloudflare Clef-flash57.4682.20
09pplx-decider 27B57.3680.56
10Plumb · v5.2 4B55.9073.01
11Jev55.4076.52
12Imajev-9B54.7682.45
13Open-Jev · Zefan 9B54.1778.80
14SPX-CD-Flash53.7983.25
15APUS OpenJev · 4B 5949 High53.6458.56
16APUS OpenJev · 9B 3000 High53.0464.91
17Malkuth · 4B52.3081.90
18Jev-Omni · 12B52.3064.26
19JPT · 4B52.2679.91
20APUS OpenJev · 9B 5949 High51.7957.45
21Jet · v6.2 4B51.4080.01
22Ateve Jev48.0775.22
23Hopper G · 4B v1.347.6874.10
24Hopper · 4B47.6179.12
25FLock THIS/THAT47.5943.08
26JevK546.7679.66
27SPX-CD-Omni46.6680.19
28Lev · 4B44.6672.91
29Decision Lux · 9B44.1578.17
30Kev · 4B44.0279.79
31Mapika · Decider 4B v2.143.9479.68
32Bocha Jev42.4673.37
33Kev · 9B41.5980.70
34Nimble · v2 9B39.7683.89
35Mica · 4B BF16 GGUF39.6672.19
36OpenDecider · Small39.4181.38
37Winnow · E4B Q834.4876.40
38OpenDecider · Small TD33.9879.02
39Reflex · Stable 4B31.9777.79
40Bosun v3.1 · 1.7B29.5466.11
41Laya · English25.2567.96
42Bosun v3.1 · 0.6B22.3067.78
43OpenDecider · Nano19.8276.75
44Laya · Typed Decisions18.6878.89
45Laya · Multilingual18.4353.67
46CalDec · Laya15.8578.49
47Kev · 0.8B13.4574.45
48Julia-110.3427.00
49CLM v0.1 · 8B5.0155.44
50CalDec · GLiNER0.0067.28
51GLiNER2.5-Decide0.0074.53

I · 智能指数:衡量判断能力,扣除随机猜测的影响。C · 校准指数:衡量预测概率与正确答案的匹配程度。

I/C 使用同一组 900 道文本题,采用 JevBench v1.5 的公式计算 CMDB 成绩。ECE 与 I/C 仅比较提供原生候选概率的模型。

添加模型到榜单

希望你的模型参与 CMDB-1500 评测?

联系我们 ↗

CMDB-1500 汇集语言、图像与动作选择任务,统一为单选、是/否、有序评分和多选四种题型。数据集包含 1,500 道题、322 张不同的原图。

1,500 道题,如何组成?
1,500全部题目

点击分类查看占比;再次点击恢复总览。

题目按领域分层选取,保留候选与原图。文本、图片与全题准确率分别按 1,200、300 和 1,500 题计算,拒答与缺答计为错误。仅测文本的模型只列入文本榜。

题目覆盖语言理解、业务判断、图像理解、工具使用与动作选择。

语言、知识与判断450 题

题目选自 JevBench ,考察知识问答、意图识别、证据核验、语义理解、情绪识别与回答质量。

ARC-Challenge · MMLU · Banking77 · CLINC150 · MASSIVE · BoolQ · MNLI · ChaosNLI · FEVER · PAWS · SST-5 · STS-B · StrategyQA · Civil Comments · Measuring Hate Speech · SMS Spam · HelpSteer2

专业与业务决策300 题

题目选自 Atlan Decision Bench ,考察工具选择、任务完成判断、引用核验、SQL 选择与业务路由。

该集合包含 BFCL、AgentDojo、τ-bench、MT-Bench 与 Spider 等来源的改编题,按给定上下文评估模型的选择。

图像决策300 题

从 10 个视觉测试集各选取 30 题,考察图像数学、图文理解、科学图解与服装分类。多图题保留全部所需原图。

MathVista · MMMU · MMMU-Pro · AI2D · ScienceQA · Fashion200k · GQA · VQAv2 · TextVQA · VizWiz

GQA、VQAv2、TextVQA 与 VizWiz 使用是/否问答子集。

安全与对抗100 题

题目来自 Aegis、PhishNChips 与 JevAdvBench,考察内容安全、钓鱼邮件与 URL 识别,以及面对干扰时的判断。

对抗题沿用来源标签,部分标签并非人工标注。

游戏动作100 题

根据给定游戏状态选择动作,场景包括赛车、贪吃蛇、井字棋、平台跳跃、跑酷与 ViZDoom。题目来自 OpenJev。

按固定状态与参考动作评分。

多选判断100 题

MultiRC 与 GoEmotions 各 50 题,要求选出阅读理解中的全部正确答案,或识别文本中的多种情绪。

具身动作50 题

ALFRED 、ALFWorld 与 VirtualHome 提供 50 道题,根据任务、观察与历史动作选择下一步。

参考答案来自专家轨迹,考察单步动作选择。

中文转写候选50 题

从 ChineseHP 的 AISHELL-4 转写候选中,选出最接近参考文本的一句;答案按字符编辑距离确定。

输入为转写文本候选,不含音频。

工具调用25 题

改编自 BFCL v3,判断用户请求是否需要调用工具。

空间与复杂规则25 题

THIS-THAT 的 19 道复杂规则题与 6 道空间题,考察规则冲突下的选择和空间关系判断;参考答案来自规则或模拟器。

Surd AI

SPX-CD · 原生决策模型

SPX-CD-Pro、Flash 与 Omni 直接返回结构化选择和候选概率。本次评测均使用 effort=2。

SPX-CD-Omni 已在 Hugging Face 开源,提供 LoRA 权重、推理代码与评测结果。

TypeSafeStartLuxHugging Face

其他原生决策模型

包括 Jev、StartLux、Mercury Decide、pplx-decider、JPT、Winnow 与 Kev,使用决策或概率接口作答。榜单区分模型尺寸、版本与量化精度。

GPTClaudeGLM

通用推理模型

GPT、Claude、GLM、Qwen、Kimi 和 DeepSeek 作为通用推理模型参与准确率对比。

SPX-CD-Pro · 全题第 281.20%1,218 / 1,500 题答对
SPX-CD-Flash · 全题第 579.53%1,193 / 1,500 题答对

Pro 的文本/图片准确率为 79.33% / 88.67%,Flash 为 77.58% / 87.33%。

如果模型对一批答案都给出 80% 的概率,实际答对的比例是否也接近 80%?ECE 衡量这种概率与实际表现的偏差,越低越好。本次综合 ECE:Pro 为 2.46%,Flash 为 2.49%。

在 Hugging Face 查看 CMDB-1500 ↗