anessbelbati · Evaluation & Observability
比较 Jev、专用 reranker 和聊天模型对同一批搜索片段的排序结果。
用 Choice、Noul 和分档评分给候选片段排序,再计算检索指标。
提供原始响应、评分代码和分数据集结果,便于检查比较条件。
作者报告的八个英文数据集等权 nDCG@10 为 Jev 0.692、Cohere 0.691,未证明明确胜出;按查询等权排名会变化。 已核对固定版本 README 与集成源码。