← 模型与交互指南
GUIDES / 模型对比

Simplex CD 与 Jev:决策模型怎么选?

对比 Jev、SPX-CD-Flash 与 SPX-CD-Pro 的结构化决策、CMDB 文本题和 JevBench 成绩,理解概率、评测口径与接入选择。

Surd AI · 研究与工程中文

当程序需要在几个动作中做选择时,你通常想要一个稳定的选项标识和概率,而不是一段需要再次解析的回答。Jev 和 Simplex CD 都面向这类结构化决策。选择哪一个,要看你的任务、评测口径,以及上线后如何使用这些概率。

就目前公开的 CMDB 文本题记录而言,SPX-CD-Pro 和 Flash 的准确率高于 Jev;这不等于它们在每一种业务上都更好,也不能替代实际负载下的延迟测试。

Jev 与 Simplex CD 分别是什么?

Jev 是 TypeSafe AI 的决策模型,官方接口用 state 和带类型的问题返回结构化判断。Simplex CD 是 Surd AI 的 Simplex 模型系列中的决策模型,SPX-CD 展开为 Simplex Calibrated Decision Model。Flash 和 Pro 是开放平台提供的两个模型选项。Jev 官方介绍 · Simplex CD 发布页

对开发者来说,共同的价值是把“读懂上下文”与“执行动作”分开:模型提出判断,程序控制路由、权限、确认和执行。客服分流、候选动作选择、图片分类和按规则评分,都可以围绕这种方式设计。

CMDB:先比较同一批 1,200 道文本题

CMDB-1500 包含 1,200 道文本题和 300 道图片题。下表只摘取同一文本部分,因此不会把 Jev 的文本结果与其他模型的全题结果混在一起。

模型 文本准确率 正确 / 文本题数 本次评测范围内有效返回
SPX-CD-Pro 79.33% 952 / 1,200 1,500 / 1,500
SPX-CD-Flash 77.58% 931 / 1,200 1,500 / 1,500
Jev 72.17% 866 / 1,200 1,200 / 1,200

按正确题数计算,Pro 比 Jev 多答对 86 道,Flash 多答对 65 道,分别约为 7.17 和 5.42 个百分点。差值根据原始计数计算,显示百分比四舍五入后可能相差 0.01。

这是 Surd AI 维护的评测,包含自家模型,SPX-CD 在该项测试使用 effort=2。有效返回一列对应各模型实际参与的评测范围;Jev 此条记录未覆盖图片题,因此这里不能由空缺推断它当前所有产品的图片能力。模型版本、完整结果和评测方法见 CMDB 榜单。本文固定引用 2026-10-07 查看时的记录。

JevBench 与 Decision Index:结果并不完全同向

另一个测试可以帮助判断结论是否依赖某一套题。以下是发布页记录的 SPX-CD effort=1 成绩,以及 Jev 1.13.0 的已发布参考。

模型 Decision Index 0.2.1 ↑ JevBench Public 231 JevBench Hard 111
SPX-CD-Pro · effort=1 58.30 89.61%(207 / 231) 79.28%(88 / 111)
SPX-CD-Flash · effort=1 54.65 88.31%(204 / 231) 77.48%(86 / 111)
Jev 1.13.0 · 公开参考 57.91 86.58%(200 / 231) 72.97%(81 / 111)

这里 Flash 的 Decision Index 低于 Jev,而 Pro 略高。Hard 111 属于 Public 231 的子集,不能当作另一批完全独立的数据来累计。不同来源和配置的记录提供参考,不是同一天、同一服务负载的线上对跑。完整来源和 effort=2 记录见 发布页评测区。

准确率之外,决策 API 还应比较什么?

看错误落在哪一类。 工单分流中,误转一次部门可能可以恢复;权限决策中,把不允许的动作放行代价更高。用自己的标签建立混淆矩阵,并单独统计自动处理覆盖率、错误放行和人工复核比例。

看概率是否适合你的阈值。 分布集中的回答仍可能出错。不要把某个字段显示的 0.9 直接理解成“此请求有经过验证的 90% 正确率”。阈值需要在有参考答案的业务验证集上确定。

看真实请求的耗时。 单题响应、64 题批处理和多用户并发不是同一指标。比较时固定输入长度、问题数量、候选数量和并发,并记录客户端 P50、P95、成功率及实际账单用量。本文不提供未经同条件测量的速度排名。

什么时候值得试 Simplex CD?

如果你的任务需要文字与图片共同参与决策,或一次问题选择多个候选,可以先从 Simplex CD 的现成测试案例开始。如果你已经使用 Jev,先保留原有题目和选项描述,分别用明确的 Flash、Pro 型号做影子评测,再决定是否迁移。

Flash 与 Pro 的名字不应代替测试。用同一组代表性任务记录错误类型、延迟和成本,选择达到业务要求的配置。图片与自动路由请求应按当前平台文档理解实际路由,返回别名本身不能证明底层执行模型。API 文档

常见问题

Simplex CD 是 Jev 的直接替换吗?

它们都能用于结构化决策,但迁移仍需核对 endpoint、model、字段语义、错误处理和概率阈值。不能只换一个地址就假设所有行为一致。迁移检查指南

JevBench 得分能代表所有业务吗?

不能。公开题适合比较特定任务集合上的表现;你的输入分布、候选定义和错误代价可能不同。应保留独立业务测试集。

哪个模型值得先试?

若你优先关注这里的 CMDB 文本准确率,可先评估 Pro;若想同时比较质量与资源成本,则让 Flash、Pro、现有 Jev 在同一批样本上运行。可以先在 Playground 运行一个选择题,再按 决策 API 评估清单 扩展测试。

SIMPLEX CD / API

用自己的问题,试一次决策。

注册账号,在工作台体验决策模型,或查看 API 文档开始接入。