RESEARCH / MULTIMODAL DECISIONS
CMDB-1500多模态决策模型基准测试
Comprehensive Multimodal Decision Benchmark 1500
1,200 道文本题,300 道图片题,评估模型的选择与概率判断。
查看文本榜精确数值
| 排名 | 模型 / 版本 | 准确率 · 0–100% | 答对 / 固定分母 | 有效 / 全评测范围 |
|---|---|---|---|---|
| 01 | GPT 6.1 Sol · low | 80.00% | 960 / 1,200 | 1,500 / 1,500 |
| 02 | SPX-CD-Pro (2026-10-04) | 79.33% | 952 / 1,200 | 1,500 / 1,500 |
| 03 | Claude Sonnet 5.5 · low | 78.00% | 936 / 1,200 | 1,500 / 1,500 |
| 04 | StartLux-Decision-27B · BF16 | 77.92% | 935 / 1,200 | 1,500 / 1,500 |
| 05 | SPX-CD-Flash | 77.58% | 931 / 1,200 | 1,500 / 1,500 |
| 06 | GPT 6 Luna · low | 76.58% | 919 / 1,200 | 1,500 / 1,500 |
| 07 | GLM 5.3 Flash · low | 75.75% | 909 / 1,200 | 1,500 / 1,500 |
| 08 | StartLux-Decision-35B-A3B · BF16 | 75.67% | 908 / 1,200 | 1,500 / 1,500 |
| 09 | SPX-CD-Omni | 74.67% | 896 / 1,200 | 1,500 / 1,500 |
| 10 | Mercury Decide | 73.92% | 887 / 1,200 | 1,200 / 1,200 |
| 11 | pplx-decider 27B | 72.83% | 874 / 1,200 | 1,500 / 1,500 |
| 12 | Jev | 72.17% | 866 / 1,200 | 1,200 / 1,200 |
| 13 | Cloudflare Clef | 71.50% | 858 / 1,200 | 1,485 / 1,500 |
| 14 | JPT · 9B | 71.33% | 856 / 1,200 | 1,500 / 1,500 |
| 15 | Qwen 3.8 Flash | 71.08% | 853 / 1,200 | 1,500 / 1,500 |
| 16 | Kimi K2.6 | 71.00% | 852 / 1,200 | 1,500 / 1,500 |
| 17 | Mapika · Decider 4B v2.1 | 69.83% | 838 / 1,200 | 1,200 / 1,200 |
| 18 | Cloudflare Clef-Flash | 69.67% | 836 / 1,200 | 1,485 / 1,500 |
| 19 | Imajev-9B | 68.83% | 826 / 1,200 | 1,478 / 1,500 |
| 20 | Kev · 9B | 68.67% | 824 / 1,200 | 1,200 / 1,200 |
| 21 | DeepSeek V4.1 Flash | 68.58% | 823 / 1,200 | 1,500 / 1,500 |
| 22 | JPT · 4B | 67.67% | 812 / 1,200 | 1,500 / 1,500 |
| 23 | Decision Lux · 9B | 67.42% | 809 / 1,200 | 1,200 / 1,200 |
| 24 | Jet · v6.2 4B | 66.92% | 803 / 1,200 | 1,200 / 1,200 |
| 25 | Open-Jev · Zefan 9B | 66.67% | 800 / 1,200 | 1,199 / 1,200 |
| 26 | Nimble · v2 9B | 66.58% | 799 / 1,200 | 1,200 / 1,200 |
| 27 | Hopper G · 4B v1.3 | 65.92% | 791 / 1,200 | 1,200 / 1,200 |
| 28 | Malkuth · 4B | 65.58% | 787 / 1,200 | 1,200 / 1,200 |
| 29 | Hopper · 4B | 65.50% | 786 / 1,200 | 1,200 / 1,200 |
| 30 | Winnow · 12B Q8 | 65.33% | 784 / 1,200 | 1,410 / 1,500 |
| 31 | JevK5 | 64.83% | 778 / 1,200 | 1,200 / 1,200 |
| 32 | Lev · 4B | 64.58% | 775 / 1,200 | 1,200 / 1,200 |
| 33 | Mica · 4B BF16 GGUF | 64.25% | 771 / 1,200 | 1,200 / 1,200 |
| 34 | Kev · 4B | 64.17% | 770 / 1,200 | 1,200 / 1,200 |
| 35 | Jev-Omni · 12B | 63.58% | 763 / 1,200 | 1,493 / 1,500 |
| 36 | APUS OpenJev · 9B 3000 High | 61.42% | 737 / 1,200 | 1,085 / 1,200 |
| 37 | OpenDecider · Small | 61.25% | 735 / 1,200 | 1,200 / 1,200 |
| 38 | APUS OpenJev · 9B 5949 High | 61.08% | 733 / 1,200 | 1,085 / 1,200 |
| 39 | OpenDecider · Small TD | 60.67% | 728 / 1,200 | 1,200 / 1,200 |
| 40 | APUS OpenJev · 4B 5949 High | 60.08% | 721 / 1,200 | 1,085 / 1,200 |
| 41 | Ateve Jev | 59.75% | 717 / 1,200 | 1,087 / 1,200 |
| 42 | Bocha Jev | 58.92% | 707 / 1,200 | 1,087 / 1,200 |
| 43 | Winnow · E4B Q8 | 58.92% | 707 / 1,200 | 1,410 / 1,500 |
| 44 | Reflex · Stable 4B | 58.50% | 702 / 1,200 | 1,387 / 1,500 |
| 45 | Plumb · v5.2 4B | 58.08% | 697 / 1,200 | 1,085 / 1,200 |
| 46 | FLock THIS/THAT | 57.67% | 692 / 1,200 | 1,156 / 1,200 |
| 47 | Kev · 0.8B | 51.75% | 621 / 1,200 | 1,200 / 1,200 |
| 48 | Bosun v3.1 · 1.7B | 49.75% | 597 / 1,200 | 1,200 / 1,200 |
| 49 | OpenDecider · Nano | 46.75% | 561 / 1,200 | 1,143 / 1,200 |
| 50 | CalDec · Laya | 46.08% | 553 / 1,200 | 1,189 / 1,200 |
| 51 | Bosun v3.1 · 0.6B | 45.58% | 547 / 1,200 | 1,200 / 1,200 |
| 52 | Laya · Typed Decisions | 44.58% | 535 / 1,200 | 1,189 / 1,200 |
| 53 | CalDec · GLiNER | 43.17% | 518 / 1,200 | 1,200 / 1,200 |
| 54 | Laya · English | 41.00% | 492 / 1,200 | 1,189 / 1,200 |
| 55 | Laya · Multilingual | 40.25% | 483 / 1,200 | 1,192 / 1,200 |
| 56 | GLiNER2.5-Decide | 38.58% | 463 / 1,200 | 1,200 / 1,200 |
| 57 | Julia-1 | 35.75% | 429 / 1,200 | 1,079 / 1,200 |
| 58 | CLM v0.1 · 8B | 34.92% | 419 / 1,200 | 1,200 / 1,200 |
查看图片榜精确数值
| 排名 | 模型 / 版本 | 准确率 · 0–100% | 答对 / 固定分母 | 有效 / 全评测范围 |
|---|---|---|---|---|
| 01 | Claude Sonnet 5.5 · low | 92.67% | 278 / 300 | 1,500 / 1,500 |
| 02 | GPT 6.1 Sol · low | 92.00% | 276 / 300 | 1,500 / 1,500 |
| 03 | GLM 5.3 Flash · low | 90.67% | 272 / 300 | 1,500 / 1,500 |
| 04 | StartLux-Decision-35B-A3B · BF16 | 89.67% | 269 / 300 | 1,500 / 1,500 |
| 05 | GPT 6 Luna · low | 89.33% | 268 / 300 | 1,500 / 1,500 |
| 06 | SPX-CD-Pro (2026-10-04) | 88.67% | 266 / 300 | 1,500 / 1,500 |
| 07 | SPX-CD-Flash | 87.33% | 262 / 300 | 1,500 / 1,500 |
| 08 | StartLux-Decision-27B · BF16 | 87.00% | 261 / 300 | 1,500 / 1,500 |
| 09 | pplx-decider 27B | 86.33% | 259 / 300 | 1,500 / 1,500 |
| 10 | JPT · 9B | 85.67% | 257 / 300 | 1,500 / 1,500 |
| 11 | Imajev-9B | 83.67% | 251 / 300 | 1,478 / 1,500 |
| 12 | Qwen 3.8 Flash | 83.00% | 249 / 300 | 1,500 / 1,500 |
| 13 | SPX-CD-Omni | 82.67% | 248 / 300 | 1,500 / 1,500 |
| 14 | Kimi K2.6 | 81.33% | 244 / 300 | 1,500 / 1,500 |
| 15 | JPT · 4B | 81.00% | 243 / 300 | 1,500 / 1,500 |
| 16 | Reflex · Stable 4B | 80.33% | 241 / 300 | 1,387 / 1,500 |
| 17 | DeepSeek V4.1 Flash | 79.67% | 239 / 300 | 1,500 / 1,500 |
| 18 | Jev-Omni · 12B | 79.00% | 237 / 300 | 1,493 / 1,500 |
| 19 | Winnow · 12B Q8 | 77.33% | 232 / 300 | 1,410 / 1,500 |
| 20 | Winnow · E4B Q8 | 66.33% | 199 / 300 | 1,410 / 1,500 |
| 21 | Cloudflare Clef | 42.33% | 127 / 300 | 1,485 / 1,500 |
| 22 | Cloudflare Clef-Flash | 41.67% | 125 / 300 | 1,485 / 1,500 |
查看全题榜精确数值
| 排名 | 模型 / 版本 | 准确率 · 0–100% | 答对 / 固定分母 | 有效 / 全评测范围 |
|---|---|---|---|---|
| 01 | GPT 6.1 Sol · low | 82.40% | 1,236 / 1,500 | 1,500 / 1,500 |
| 02 | SPX-CD-Pro (2026-10-04) | 81.20% | 1,218 / 1,500 | 1,500 / 1,500 |
| 03 | Claude Sonnet 5.5 · low | 80.93% | 1,214 / 1,500 | 1,500 / 1,500 |
| 04 | StartLux-Decision-27B · BF16 | 79.73% | 1,196 / 1,500 | 1,500 / 1,500 |
| 05 | SPX-CD-Flash | 79.53% | 1,193 / 1,500 | 1,500 / 1,500 |
| 06 | GPT 6 Luna · low | 79.13% | 1,187 / 1,500 | 1,500 / 1,500 |
| 07 | GLM 5.3 Flash · low | 78.73% | 1,181 / 1,500 | 1,500 / 1,500 |
| 08 | StartLux-Decision-35B-A3B · BF16 | 78.47% | 1,177 / 1,500 | 1,500 / 1,500 |
| 09 | SPX-CD-Omni | 76.27% | 1,144 / 1,500 | 1,500 / 1,500 |
| 10 | pplx-decider 27B | 75.53% | 1,133 / 1,500 | 1,500 / 1,500 |
| 11 | JPT · 9B | 74.20% | 1,113 / 1,500 | 1,500 / 1,500 |
| 12 | Qwen 3.8 Flash | 73.47% | 1,102 / 1,500 | 1,500 / 1,500 |
| 13 | Kimi K2.6 | 73.07% | 1,096 / 1,500 | 1,500 / 1,500 |
| 14 | Imajev-9B | 71.80% | 1,077 / 1,500 | 1,478 / 1,500 |
| 15 | DeepSeek V4.1 Flash | 70.80% | 1,062 / 1,500 | 1,500 / 1,500 |
| 16 | JPT · 4B | 70.33% | 1,055 / 1,500 | 1,500 / 1,500 |
| 17 | Winnow · 12B Q8 | 67.73% | 1,016 / 1,500 | 1,410 / 1,500 |
| 18 | Jev-Omni · 12B | 66.67% | 1,000 / 1,500 | 1,493 / 1,500 |
| 19 | Cloudflare Clef | 65.67% | 985 / 1,500 | 1,485 / 1,500 |
| 20 | Cloudflare Clef-Flash | 64.07% | 961 / 1,500 | 1,485 / 1,500 |
| 21 | Reflex · Stable 4B | 62.87% | 943 / 1,500 | 1,387 / 1,500 |
| 22 | Winnow · E4B Q8 | 60.40% | 906 / 1,500 | 1,410 / 1,500 |
多模态筛选显示本次参加图片评测的模型。
综合 ECE 校准榜
柱越高,误差越小 ↑查看ECE榜精确数值
| 排名 | 模型 / 版本 | ECE ↓ |
|---|---|---|
| 01 | SPX-CD-Pro | 2.46% |
| 02 | SPX-CD-Flash | 2.49% |
| 03 | StartLux-Decision-27B · BF16 | 2.65% |
| 04 | StartLux-Decision-35B-A3B · BF16 | 2.71% |
| 05 | pplx-decider 27B | 3.08% |
| 06 | Reflex · Stable 4B | 3.33% |
| 07 | JPT · 9B | 3.47% |
| 08 | Plumb · v5.2 4B | 3.53% |
| 09 | Imajev-9B | 3.74% |
| 10 | GLiNER2.5-Decide | 3.98% |
| 11 | Mapika · Decider 4B v2.1 | 4.08% |
| 12 | Kev · 9B | 4.09% |
| 13 | OpenDecider · Small TD | 4.21% |
| 14 | Decision Lux · 9B | 4.36% |
| 15 | Malkuth · 4B | 4.43% |
| 16 | Winnow · E4B Q8 | 4.56% |
| 17 | OpenDecider · Small | 4.58% |
| 18 | Laya · Typed Decisions | 4.86% |
| 19 | Jev | 4.99% |
| 20 | OpenDecider · Nano | 5.00% |
| 21 | JevK5 | 5.05% |
| 22 | SPX-CD-Omni | 5.11% |
| 23 | Kev · 0.8B | 5.27% |
| 24 | Nimble · v2 9B | 5.28% |
| 25 | Kev · 4B | 5.63% |
| 26 | JPT · 4B | 5.97% |
| 27 | Ateve Jev | 6.09% |
| 28 | Hopper · 4B | 6.23% |
| 29 | Bocha Jev | 6.57% |
| 30 | Lev · 4B | 6.78% |
| 31 | Cloudflare Clef-flash | 7.90% |
| 32 | Jet · v6.2 4B | 7.91% |
| 33 | Jev-Omni · 12B | 8.08% |
| 34 | Open-Jev · Zefan 9B | 8.62% |
| 35 | Mica · 4B BF16 GGUF | 8.66% |
| 36 | Winnow · 12B Q8 | 9.07% |
| 37 | CalDec · Laya | 9.24% |
| 38 | Hopper G · 4B v1.3 | 9.29% |
| 39 | Cloudflare Clef | 9.40% |
| 40 | CalDec · GLiNER | 9.40% |
| 41 | Bosun v3.1 · 0.6B | 10.67% |
| 42 | Mercury Decide | 10.77% |
| 43 | APUS OpenJev · 9B 3000 High | 12.68% |
| 44 | Bosun v3.1 · 1.7B | 13.01% |
| 45 | Laya · English | 14.42% |
| 46 | APUS OpenJev · 4B 5949 High | 14.86% |
| 47 | APUS OpenJev · 9B 5949 High | 15.45% |
| 48 | Laya · Multilingual | 19.74% |
| 49 | FLock THIS/THAT | 30.09% |
| 50 | CLM v0.1 · 8B | 31.16% |
| 51 | Julia-1 | 40.55% |
ECE 按 10 个概率区间计算,使用有原生概率的有效单选与是/否题。柱顶显示实际误差;各模型的文本与图片覆盖范围可能不同。
I/C 指数榜
0–100 分,越高越好 ↑
查看I/C榜精确数值
| 排名 | 模型 / 版本 | I ↑ | C ↑ |
|---|---|---|---|
| 01 | SPX-CD-Pro | 65.41 | 83.58 |
| 02 | Mercury Decide | 64.54 | 74.53 |
| 03 | StartLux-Decision-27B · BF16 | 64.48 | 83.63 |
| 04 | Winnow · 12B Q8 | 60.60 | 68.72 |
| 05 | StartLux-Decision-35B-A3B · BF16 | 60.05 | 82.74 |
| 06 | JPT · 9B | 59.70 | 83.87 |
| 07 | Cloudflare Clef | 59.42 | 79.68 |
| 08 | Cloudflare Clef-flash | 57.46 | 82.20 |
| 09 | pplx-decider 27B | 57.36 | 80.56 |
| 10 | Plumb · v5.2 4B | 55.90 | 73.01 |
| 11 | Jev | 55.40 | 76.52 |
| 12 | Imajev-9B | 54.76 | 82.45 |
| 13 | Open-Jev · Zefan 9B | 54.17 | 78.80 |
| 14 | SPX-CD-Flash | 53.79 | 83.25 |
| 15 | APUS OpenJev · 4B 5949 High | 53.64 | 58.56 |
| 16 | APUS OpenJev · 9B 3000 High | 53.04 | 64.91 |
| 17 | Malkuth · 4B | 52.30 | 81.90 |
| 18 | Jev-Omni · 12B | 52.30 | 64.26 |
| 19 | JPT · 4B | 52.26 | 79.91 |
| 20 | APUS OpenJev · 9B 5949 High | 51.79 | 57.45 |
| 21 | Jet · v6.2 4B | 51.40 | 80.01 |
| 22 | Ateve Jev | 48.07 | 75.22 |
| 23 | Hopper G · 4B v1.3 | 47.68 | 74.10 |
| 24 | Hopper · 4B | 47.61 | 79.12 |
| 25 | FLock THIS/THAT | 47.59 | 43.08 |
| 26 | JevK5 | 46.76 | 79.66 |
| 27 | SPX-CD-Omni | 46.66 | 80.19 |
| 28 | Lev · 4B | 44.66 | 72.91 |
| 29 | Decision Lux · 9B | 44.15 | 78.17 |
| 30 | Kev · 4B | 44.02 | 79.79 |
| 31 | Mapika · Decider 4B v2.1 | 43.94 | 79.68 |
| 32 | Bocha Jev | 42.46 | 73.37 |
| 33 | Kev · 9B | 41.59 | 80.70 |
| 34 | Nimble · v2 9B | 39.76 | 83.89 |
| 35 | Mica · 4B BF16 GGUF | 39.66 | 72.19 |
| 36 | OpenDecider · Small | 39.41 | 81.38 |
| 37 | Winnow · E4B Q8 | 34.48 | 76.40 |
| 38 | OpenDecider · Small TD | 33.98 | 79.02 |
| 39 | Reflex · Stable 4B | 31.97 | 77.79 |
| 40 | Bosun v3.1 · 1.7B | 29.54 | 66.11 |
| 41 | Laya · English | 25.25 | 67.96 |
| 42 | Bosun v3.1 · 0.6B | 22.30 | 67.78 |
| 43 | OpenDecider · Nano | 19.82 | 76.75 |
| 44 | Laya · Typed Decisions | 18.68 | 78.89 |
| 45 | Laya · Multilingual | 18.43 | 53.67 |
| 46 | CalDec · Laya | 15.85 | 78.49 |
| 47 | Kev · 0.8B | 13.45 | 74.45 |
| 48 | Julia-1 | 10.34 | 27.00 |
| 49 | CLM v0.1 · 8B | 5.01 | 55.44 |
| 50 | CalDec · GLiNER | 0.00 | 67.28 |
| 51 | GLiNER2.5-Decide | 0.00 | 74.53 |
I · 智能指数:衡量判断能力,扣除随机猜测的影响。C · 校准指数:衡量预测概率与正确答案的匹配程度。
I/C 使用同一组 900 道文本题,采用 JevBench v1.5 的公式计算 CMDB 成绩。ECE 与 I/C 仅比较提供原生候选概率的模型。
希望你的模型参与 CMDB-1500 评测?
从文本到原图,
做出结构化选择。
CMDB-1500 汇集语言、图像与动作选择任务,统一为单选、是/否、有序评分和多选四种题型。数据集包含 1,500 道题、322 张不同的原图。
点击分类查看占比;再次点击恢复总览。
题目按领域分层选取,保留候选与原图。文本、图片与全题准确率分别按 1,200、300 和 1,500 题计算,拒答与缺答计为错误。仅测文本的模型只列入文本榜。
这些题,
考察什么?
题目覆盖语言理解、业务判断、图像理解、工具使用与动作选择。
语言、知识与判断450 题
题目选自 JevBench ,考察知识问答、意图识别、证据核验、语义理解、情绪识别与回答质量。
ARC-Challenge · MMLU · Banking77 · CLINC150 · MASSIVE · BoolQ · MNLI · ChaosNLI · FEVER · PAWS · SST-5 · STS-B · StrategyQA · Civil Comments · Measuring Hate Speech · SMS Spam · HelpSteer2
专业与业务决策300 题
题目选自 Atlan Decision Bench ,考察工具选择、任务完成判断、引用核验、SQL 选择与业务路由。
该集合包含 BFCL、AgentDojo、τ-bench、MT-Bench 与 Spider 等来源的改编题,按给定上下文评估模型的选择。
图像决策300 题
从 10 个视觉测试集各选取 30 题,考察图像数学、图文理解、科学图解与服装分类。多图题保留全部所需原图。
MathVista · MMMU · MMMU-Pro · AI2D · ScienceQA · Fashion200k · GQA · VQAv2 · TextVQA · VizWiz
GQA、VQAv2、TextVQA 与 VizWiz 使用是/否问答子集。
安全与对抗100 题
题目来自 Aegis、PhishNChips 与 JevAdvBench,考察内容安全、钓鱼邮件与 URL 识别,以及面对干扰时的判断。
对抗题沿用来源标签,部分标签并非人工标注。
游戏动作100 题
根据给定游戏状态选择动作,场景包括赛车、贪吃蛇、井字棋、平台跳跃、跑酷与 ViZDoom。题目来自 OpenJev。
按固定状态与参考动作评分。
多选判断100 题
MultiRC 与 GoEmotions 各 50 题,要求选出阅读理解中的全部正确答案,或识别文本中的多种情绪。
具身动作50 题
ALFRED 、ALFWorld 与 VirtualHome 提供 50 道题,根据任务、观察与历史动作选择下一步。
参考答案来自专家轨迹,考察单步动作选择。
中文转写候选50 题
从 ChineseHP 的 AISHELL-4 转写候选中,选出最接近参考文本的一句;答案按字符编辑距离确定。
输入为转写文本候选,不含音频。
工具调用25 题
改编自 BFCL v3,判断用户请求是否需要调用工具。
空间与复杂规则25 题
THIS-THAT 的 19 道复杂规则题与 6 道空间题,考察规则冲突下的选择和空间关系判断;参考答案来自规则或模拟器。
相同候选,
不同的判断方式。
SPX-CD · 原生决策模型
SPX-CD-Pro、Flash 与 Omni 直接返回结构化选择和候选概率。本次评测均使用 effort=2。
SPX-CD-Omni 已在 Hugging Face 开源,提供 LoRA 权重、推理代码与评测结果。
其他原生决策模型
包括 Jev、StartLux、Mercury Decide、pplx-decider、JPT、Winnow 与 Kev,使用决策或概率接口作答。榜单区分模型尺寸、版本与量化精度。
通用推理模型
GPT、Claude、GLM、Qwen、Kimi 和 DeepSeek 作为通用推理模型参与准确率对比。
Pro 的文本/图片准确率为 79.33% / 88.67%,Flash 为 77.58% / 87.33%。
模型是否真的
确信自己的答案?
如果模型对一批答案都给出 80% 的概率,实际答对的比例是否也接近 80%?ECE 衡量这种概率与实际表现的偏差,越低越好。本次综合 ECE:Pro 为 2.46%,Flash 为 2.49%。
在 Hugging Face 查看 CMDB-1500 ↗