← 模型与交互指南
GUIDES / 音频决策评测

AudioJev 与 AudioJevBench:音频决策模型评测怎么看?

区分同名 AudioJev 项目与 AudioJevBench,了解音频直接决策、公开与封闭题覆盖、概率校准,以及语音交互评测的边界。

Surd AI · 研究与工程中文

一句“好吧”可能是同意,也可能带着犹豫。只看转写文本,评测会遗漏语气、说话人和背景声音。音频决策测试需要先说明:模型直接听到了音频,还是只拿到了转写结果。

AudioJev 是模型,AudioJevBench 是评测

AudioJev 这个名称对应不止一个项目。 shlv/AudioJev 的模型卡描述了基于 Qwen2.5-Omni-3B 的候选概率模型;mocomoco-inc/AudioJev-AudioDecisionModel 是另一项目。引用配置、许可证或成绩时,应附上完整仓库标识。shlv 模型卡 · mocomoco 模型卡

AudioJevBench 是音频决策评测。 本文于 2026 年 10 月 8 日核对的 v0.1 页面列出 988 道计分题,其中公开题 112 道、封闭题 876 道,并把完整覆盖、仅公开题和部分任务覆盖的系统分组展示。该页面名为 AudioJev 的条目标注的是 mocomoco edge ONNX,不能据此评价 shlv 的同名模型。AudioJevBench 评测页

同一个问题,直接听音频和先转写有什么不同?

假设任务是判断“是否有人按了喇叭”。把音频转成文字的流水线若没有保留这个声音,后面的文本模型再强也缺少关键证据。相反,如果任务只要求识别明确说出的工单编号,转写质量可能就是主要瓶颈。

我们建议把两条方案作为不同系统比较:原始音频输入,以及音频识别后再做文本决策。后者的总耗时和费用应包含转写,不能只计算最后一次文本调用。错误分析也应注明信息是在转写阶段丢失,还是判断阶段选错。

音频决策榜单应检查哪些条件?

条件 建议记录
音频内容 语言、时长、背景噪声、多人重叠
任务与选项 判断目标、候选描述、兜底选项
测试覆盖 完整题集、公开子集或单一任务
概率与错误 高置信度错误、阈值下的误放与误拦
处理时间 音频传输、预处理、转写(如有)与推理

这些是可复用的测试记录建议。不同覆盖的两行,即使都显示百分数,也不能直接据此选出总体更好的模型。

选项顺序稳定,不等于概率已经可靠

打乱候选顺序后仍选择相同语义答案,是一种稳定性检查。概率校准关注另一件事:模型给出约 80% 把握的一组预测,是否大致有 80% 正确。两个性质值得分别测试,不能用一个替代另一个。

应用里可以固定一组经过人工核对的音频,重复更换候选顺序,并在独立样本上检查置信度分桶。如果标签本身存在歧义,先明确标注准则,再讨论模型的概率误差。

音频决策与全双工交互不是同一项验收

离线音频题答得好,还需要在实时场景中检查何时接话、何时停止播放以及怎样恢复任务。Surd AI 的交互模型仍处于研究预览;本文不宣布新的音频 API,也不提供未经核实的 AudioJevBench 成绩。相关概念见 全双工交互指南 与 轮次和打断检测。

常见问题

AudioJev 的分数可以当成 Jev 的分数吗?

不可以。先确认具体项目、模型版本、输入模态和评测题集;名称相似不构成可互换的证据。

能拿公开题成绩与完整覆盖成绩直接排名吗?

应优先比较相同题集,或把覆盖差异明确保留在结果中。公开子集表现不等于未公开题集表现。

Simplex CD 的图片成绩能证明音频能力吗?

不能。文本、图片和音频需要各自的评测证据。已开放的 Simplex CD 输入能力以 API 文档 为准。

SIMPLEX CD / API

用自己的问题,试一次决策。

注册账号,在工作台体验决策模型,或查看 API 文档开始接入。