一句“好吧”可能是同意,也可能带着犹豫。只看转写文本,评测会遗漏语气、说话人和背景声音。音频决策测试需要先说明:模型直接听到了音频,还是只拿到了转写结果。
AudioJev 是模型,AudioJevBench 是评测
AudioJev 这个名称对应不止一个项目。 shlv/AudioJev 的模型卡描述了基于 Qwen2.5-Omni-3B 的候选概率模型;mocomoco-inc/AudioJev-AudioDecisionModel 是另一项目。引用配置、许可证或成绩时,应附上完整仓库标识。shlv 模型卡 · mocomoco 模型卡
AudioJevBench 是音频决策评测。 本文于 2026 年 10 月 8 日核对的 v0.1 页面列出 988 道计分题,其中公开题 112 道、封闭题 876 道,并把完整覆盖、仅公开题和部分任务覆盖的系统分组展示。该页面名为 AudioJev 的条目标注的是 mocomoco edge ONNX,不能据此评价 shlv 的同名模型。AudioJevBench 评测页
同一个问题,直接听音频和先转写有什么不同?
假设任务是判断“是否有人按了喇叭”。把音频转成文字的流水线若没有保留这个声音,后面的文本模型再强也缺少关键证据。相反,如果任务只要求识别明确说出的工单编号,转写质量可能就是主要瓶颈。
我们建议把两条方案作为不同系统比较:原始音频输入,以及音频识别后再做文本决策。后者的总耗时和费用应包含转写,不能只计算最后一次文本调用。错误分析也应注明信息是在转写阶段丢失,还是判断阶段选错。
音频决策榜单应检查哪些条件?
| 条件 | 建议记录 |
|---|---|
| 音频内容 | 语言、时长、背景噪声、多人重叠 |
| 任务与选项 | 判断目标、候选描述、兜底选项 |
| 测试覆盖 | 完整题集、公开子集或单一任务 |
| 概率与错误 | 高置信度错误、阈值下的误放与误拦 |
| 处理时间 | 音频传输、预处理、转写(如有)与推理 |
这些是可复用的测试记录建议。不同覆盖的两行,即使都显示百分数,也不能直接据此选出总体更好的模型。
选项顺序稳定,不等于概率已经可靠
打乱候选顺序后仍选择相同语义答案,是一种稳定性检查。概率校准关注另一件事:模型给出约 80% 把握的一组预测,是否大致有 80% 正确。两个性质值得分别测试,不能用一个替代另一个。
应用里可以固定一组经过人工核对的音频,重复更换候选顺序,并在独立样本上检查置信度分桶。如果标签本身存在歧义,先明确标注准则,再讨论模型的概率误差。
音频决策与全双工交互不是同一项验收
离线音频题答得好,还需要在实时场景中检查何时接话、何时停止播放以及怎样恢复任务。Surd AI 的交互模型仍处于研究预览;本文不宣布新的音频 API,也不提供未经核实的 AudioJevBench 成绩。相关概念见 全双工交互指南 与 轮次和打断检测。
常见问题
AudioJev 的分数可以当成 Jev 的分数吗?
不可以。先确认具体项目、模型版本、输入模态和评测题集;名称相似不构成可互换的证据。
能拿公开题成绩与完整覆盖成绩直接排名吗?
应优先比较相同题集,或把覆盖差异明确保留在结果中。公开子集表现不等于未公开题集表现。
Simplex CD 的图片成绩能证明音频能力吗?
不能。文本、图片和音频需要各自的评测证据。已开放的 Simplex CD 输入能力以 API 文档 为准。