社区项目详情

Jev benchmark on 1,759 decisions

一份发布周实测报告,在多语言标注样例和匿名路由回放上对比 Jev 与 Gemini 前沿模型,覆盖延迟、成本、置信度校准及失败案例。

Stars
0
Forks
0
协议
—
最近提交
—

Jev 在这里做什么

评估置信度门控能否把可自动处理的路由与模糊案例分开,并记录方言区分、缺失负责人上下文、误导性预填文本及一次高置信误判。

为生态补充具体的独立对比和运行错误分析,帮助团队设计自己的评测集与回退阈值,而不是只依赖厂商宣传数字。

本站于 2026-09-24 核对该 Reddit 自述研究;帖子称测试了 1,759 次决策并人工复核分歧,但本站未取得原始数据,也未独立复现其准确率、延迟、成本或校准结果。