社区项目详情
Jev benchmark on 1,759 decisions
一份发布周实测报告,在多语言标注样例和匿名路由回放上对比 Jev 与 Gemini 前沿模型,覆盖延迟、成本、置信度校准及失败案例。
- Stars
- 0
- Forks
- 0
- 协议
- —
- 最近提交
- —
Jev 在这里做什么
评估置信度门控能否把可自动处理的路由与模糊案例分开,并记录方言区分、缺失负责人上下文、误导性预填文本及一次高置信误判。
为生态补充具体的独立对比和运行错误分析,帮助团队设计自己的评测集与回退阈值,而不是只依赖厂商宣传数字。
本站于 2026-09-24 核对该 Reddit 自述研究;帖子称测试了 1,759 次决策并人工复核分歧,但本站未取得原始数据,也未独立复现其准确率、延迟、成本或校准结果。