← 模型与交互指南
GUIDES / 图片决策评测

Image JevBench、Imajev 与 CMDB:图片决策模型怎么评估?

区分 Image JevBench 图片评测与 Imajev 模型,理解版本、准确率、概率校准和图片覆盖范围,并查看 CMDB-1500 图片榜。

Surd AI · 研究与工程中文

图片决策模型的目标可以很具体:从截图里选择下一步操作、判断照片是否满足验收条件,或给一组候选描述分配概率。选型时,模型是否能接收图片只是第一步;更关键的是评测中的图片和问题,是否接近你的实际任务。

ImageJev、Image JevBench 和 Imajev 有什么区别?

查找 ImageJev 相关评测时,先核对完整项目名。Image JevBench 是 Benchmark Heaven 的图片决策评测;Imajev 是另一个接受图片与结构化问题的模型项目。 名称相近不代表它们是同一个产品。本文整理于 2026 年 10 月 8 日。Image JevBench · Imajev 项目

名称 阅读时关注什么 不应混为一谈的内容
Image JevBench 图片评测的版本、题集和计分规则 某个模型的产品名称
Imajev 模型配置、推理代码和作者报告 其他评测发布者的榜单
CMDB-1500 图片部分 固定图片题上的正确数与有效覆盖 其他题集的分数与排名

为什么图片榜单一定要看版本?

本次核对的 Image JevBench v0.3.0 使用新的抽样:300 道公开题、1,200 道封闭题。页面将 v0.1.5 沿用成绩与新版本排名分开,并说明 Capability 综合 Intelligence 与 Calibration。版本和计分说明

比较两个数字前,应记录题集版本、模型版本、推理设置和评测覆盖。即使名称完全相同,一次更换图片、选项或评分方法,都可能改变分数的含义。跨版本分数变化应先检查协议变化,再讨论模型进步。

图片决策需要哪些独立指标?

我们建议保留三组结果。第一组是任务正确性:最终选项是否正确,图中证据是否真的支持它。第二组是概率质量:高置信度的错误是否集中在文字识别、小物体或空间关系上。第三组是服务表现:上传、图片处理、推理及返回结果一共花了多久。

例如,一张截图里的“提交”和“取消”按钮外观相近。模型可能识别了按钮,却没有理解当前任务要求。这时增加普通图片分类题未必能解决问题,应补充同一界面、不同目标的对照样本。这是应用测试的设计建议,不是现有榜单的测量结论。

如何与 CMDB-1500 图片榜一起看?

CMDB-1500 包含 1,200 道文本题和 300 道图片题。图片准确率应以图片部分的固定分母报告;文本分数不能替代视觉能力。在 CMDB-1500 榜单 选择“图片”,可以查看该题集的模型结果与覆盖情况。

比较 SPX-CD 与其他模型时,先取共同覆盖的题目,再保持图片分辨率、候选项和判定方式一致。某个记录未评图片,只能说明该记录没有图片成绩。关于文字与图片混合总分的解释,见 CMDB 阅读指南。

常见问题

Image JevBench 的分数就是准确率吗?

应以具体列名和版本说明为准。综合分数包含转换或多项指标时,不能直接写成“答对百分比”。

SPX-CD 有 Image JevBench 官方成绩吗?

本文没有收录经核实的 SPX-CD 在该榜单上的成绩。Surd AI 当前展示的图片结果来自 CMDB;不能把它改名为 Image JevBench 成绩。

在哪体验图片决策?

可以从 Simplex CD 发布页 了解能力,再查看 API 文档 中的图片输入和路由说明。测试时同时记录请求模型和返回模型。

SIMPLEX CD / API

用自己的问题,试一次决策。

注册账号,在工作台体验决策模型,或查看 API 文档开始接入。