4esv · Evaluation & Observability
在有标签的分类任务上比较 Jev 与 OpenRouter 模型的准确率、校准、时延和成本。
对相同任务收集模型判断,并计算置信区间及重复输入的稳定性。
发布数据处理、调用与统计代码,以及特定模型的结果。
公开比较为每个任务 300 项、指定模型与日期;优势因任务变化,不应写成全领域领先或无偏证明。 已核对固定版本 README 与集成源码。