TokenTrim · Evaluation & Observability
用 Jev 分析多 Agent 失败记录的评测项目,预测责任 Agent、关键步骤和错误类型。
把记录里的 Agent、步骤和错误分类作为选项,提交三组 choice 问题。
提供评测脚本和作者结果;部分基线生成答案而 Jev 选候选,比较条件不同。
作者的 benchmark 中,Jev 部分任务采用候选选择,论文基线采用自由生成,不能把全部指标当作严格同条件比较。