AbdelStark · Evaluation & Observability
把 Jev 和 GLiNER 放到同一批分类题上,除了答对率,也检查概率靠不靠谱。
对固定文本和标签集合做分类,记录每个标签的概率、耗时和失败。
能看清模型在哪些任务上适合自动处理,在哪些任务上容易过度自信。
作者报告 300 样本试验;远程 Jev 与本地 GLiNER 的延迟不能当作统一硬件比较。本站未重跑。