iammrduncan · Evaluation & Observability
在共同的应用任务上对照 Jev 与其他结构化输出模型,记录错误、延迟、Token 与估算成本。
把同一任务转换成 Jev 的 Choice/Noul 问题,并把答案映射到统一的结果格式。
保留对照方法与结果,方便检查模型差异。
README 当前描述有限的合成工作负载与独立捕获结果;演示视频并非测量数据,不能推广成所有任务上的排名。本站未复现。