当程序需要在几个动作中做选择时,你通常想要一个稳定的选项标识和概率,而不是一段需要再次解析的回答。Jev 和 Simplex CD 都面向这类结构化决策。选择哪一个,要看你的任务、评测口径,以及上线后如何使用这些概率。
就目前公开的 CMDB 文本题记录而言,SPX-CD-Pro 和 Flash 的准确率高于 Jev;这不等于它们在每一种业务上都更好,也不能替代实际负载下的延迟测试。
Jev 与 Simplex CD 分别是什么?
Jev 是 TypeSafe AI 的决策模型,官方接口用 state 和带类型的问题返回结构化判断。Simplex CD 是 Surd AI 的 Simplex 模型系列中的决策模型,SPX-CD 展开为 Simplex Calibrated Decision Model。Flash 和 Pro 是开放平台提供的两个模型选项。Jev 官方介绍 · Simplex CD 发布页
对开发者来说,共同的价值是把“读懂上下文”与“执行动作”分开:模型提出判断,程序控制路由、权限、确认和执行。客服分流、候选动作选择、图片分类和按规则评分,都可以围绕这种方式设计。
CMDB:先比较同一批 1,200 道文本题
CMDB-1500 包含 1,200 道文本题和 300 道图片题。下表只摘取同一文本部分,因此不会把 Jev 的文本结果与其他模型的全题结果混在一起。
| 模型 | 文本准确率 | 正确 / 文本题数 | 本次评测范围内有效返回 |
|---|---|---|---|
| SPX-CD-Pro | 79.33% | 952 / 1,200 | 1,500 / 1,500 |
| SPX-CD-Flash | 77.58% | 931 / 1,200 | 1,500 / 1,500 |
| Jev | 72.17% | 866 / 1,200 | 1,200 / 1,200 |
按正确题数计算,Pro 比 Jev 多答对 86 道,Flash 多答对 65 道,分别约为 7.17 和 5.42 个百分点。差值根据原始计数计算,显示百分比四舍五入后可能相差 0.01。
这是 Surd AI 维护的评测,包含自家模型,SPX-CD 在该项测试使用 effort=2。有效返回一列对应各模型实际参与的评测范围;Jev 此条记录未覆盖图片题,因此这里不能由空缺推断它当前所有产品的图片能力。模型版本、完整结果和评测方法见 CMDB 榜单。本文固定引用 2026-10-07 查看时的记录。
JevBench 与 Decision Index:结果并不完全同向
另一个测试可以帮助判断结论是否依赖某一套题。以下是发布页记录的 SPX-CD effort=1 成绩,以及 Jev 1.13.0 的已发布参考。
| 模型 | Decision Index 0.2.1 ↑ | JevBench Public 231 | JevBench Hard 111 |
|---|---|---|---|
| SPX-CD-Pro · effort=1 | 58.30 | 89.61%(207 / 231) | 79.28%(88 / 111) |
| SPX-CD-Flash · effort=1 | 54.65 | 88.31%(204 / 231) | 77.48%(86 / 111) |
| Jev 1.13.0 · 公开参考 | 57.91 | 86.58%(200 / 231) | 72.97%(81 / 111) |
这里 Flash 的 Decision Index 低于 Jev,而 Pro 略高。Hard 111 属于 Public 231 的子集,不能当作另一批完全独立的数据来累计。不同来源和配置的记录提供参考,不是同一天、同一服务负载的线上对跑。完整来源和 effort=2 记录见 发布页评测区。
准确率之外,决策 API 还应比较什么?
看错误落在哪一类。 工单分流中,误转一次部门可能可以恢复;权限决策中,把不允许的动作放行代价更高。用自己的标签建立混淆矩阵,并单独统计自动处理覆盖率、错误放行和人工复核比例。
看概率是否适合你的阈值。 分布集中的回答仍可能出错。不要把某个字段显示的 0.9 直接理解成“此请求有经过验证的 90% 正确率”。阈值需要在有参考答案的业务验证集上确定。
看真实请求的耗时。 单题响应、64 题批处理和多用户并发不是同一指标。比较时固定输入长度、问题数量、候选数量和并发,并记录客户端 P50、P95、成功率及实际账单用量。本文不提供未经同条件测量的速度排名。
什么时候值得试 Simplex CD?
如果你的任务需要文字与图片共同参与决策,或一次问题选择多个候选,可以先从 Simplex CD 的现成测试案例开始。如果你已经使用 Jev,先保留原有题目和选项描述,分别用明确的 Flash、Pro 型号做影子评测,再决定是否迁移。
Flash 与 Pro 的名字不应代替测试。用同一组代表性任务记录错误类型、延迟和成本,选择达到业务要求的配置。图片与自动路由请求应按当前平台文档理解实际路由,返回别名本身不能证明底层执行模型。API 文档
常见问题
Simplex CD 是 Jev 的直接替换吗?
它们都能用于结构化决策,但迁移仍需核对 endpoint、model、字段语义、错误处理和概率阈值。不能只换一个地址就假设所有行为一致。迁移检查指南
JevBench 得分能代表所有业务吗?
不能。公开题适合比较特定任务集合上的表现;你的输入分布、候选定义和错误代价可能不同。应保留独立业务测试集。
哪个模型值得先试?
若你优先关注这里的 CMDB 文本准确率,可先评估 Pro;若想同时比较质量与资源成本,则让 Flash、Pro、现有 Jev 在同一批样本上运行。可以先在 Playground 运行一个选择题,再按 决策 API 评估清单 扩展测试。