EXTERNAL RUN · SITE RECALCULATION · 2026
Jev 校准与稳定性证据:1000 条公开输出复算
复算外部公开的 2×500 条 Jev 校准输出,并审计 2 个固定输入各 3 次调用的波动;含固定提交、SHA-256、方法、表格和局限。
1,000逐项校准输出
94.0%SST-2 准确率
0.0934SST-2 ECE
0.0866AG News ECE
这批数据能说明什么?
在作者选择的两套公开数据、单一问题措辞与一次托管模型运行中,Jev 的准确率较高,但概率并非完美校准:SST-2 的预测整体偏保守,AG News 的最高概率段偏自信。本站复算与作者聚合值完全一致。
这些结果不能证明其他业务数据、问题措辞、模型版本或接入渠道也有相同准确率和 ECE,也不能直接给出生产阈值。
固定来源与完整性
- 作者
- Colin McNamara
- 运行环境
- 2026-09-20 · Austin, TX
- 模型 / SDK
jev-1.13.0·typesafe-sdk 0.7.0- 固定提交
e32717b1c592↗- t3_raw.json SHA-256
5a46d61b1074d350ed5c915ff36d0ceb0692fe1cf1f904494cc342f0af83ea1f- t1_results.json SHA-256
cac6a52f33c74dfd1c7c6f8bb21cba5cacb057b4bd029b13fedb43206af46a40
下载脚本后运行;它只获取固定提交中的两个 JSON、先校验 SHA-256,再输出复算结果。不需要 Jev API 密钥。
node recompute.mjs 复算指标
| 任务 | 类型 | n | 准确率 | ECE | Brier |
|---|---|---|---|---|---|
| SST-2 validation | Noul | 500 | 0.9400 | 0.0934 | 0.0491二分类 |
| AG News test | Choice | 500 | 0.8820 | 0.0866 | 0.1013仅 top-label |
ECE 使用 10 个等宽区间,按区间样本数加权 |平均预测概率 − 实际发生率|。1.0 归入最后一区间。
Brier SST-2 是正类概率的标准二分类均方误差;AG News 是 top-label 概率与 top-label 是否正确的二分类均方误差,不是四分类完整 Brier。
可靠性区间表
SST-2 validation · Noul
| 概率区间 | n | 均值 | 实际 |
|---|---|---|---|
| 0.0-0.1 | 164 | 0.04 | 0.012 |
| 0.1-0.2 | 46 | 0.146 | 0.087 |
| 0.2-0.3 | 19 | 0.243 | 0.105 |
| 0.3-0.4 | 13 | 0.348 | 0.538 |
| 0.4-0.5 | 14 | 0.459 | 0.786 |
| 0.5-0.6 | 4 | 0.547 | 1 |
| 0.6-0.7 | 25 | 0.644 | 0.92 |
| 0.7-0.8 | 34 | 0.755 | 0.941 |
| 0.8-0.9 | 54 | 0.849 | 1 |
| 0.9-1.0 | 127 | 0.949 | 1 |
AG News test · Choice
| 概率区间 | n | 均值 | 实际 |
|---|---|---|---|
| 0.0-0.1 | 0 | — | — |
| 0.1-0.2 | 0 | — | — |
| 0.2-0.3 | 0 | — | — |
| 0.3-0.4 | 0 | — | — |
| 0.4-0.5 | 1 | 0.47 | 0 |
| 0.5-0.6 | 15 | 0.543 | 0.733 |
| 0.6-0.7 | 15 | 0.648 | 0.667 |
| 0.7-0.8 | 17 | 0.741 | 0.765 |
| 0.8-0.9 | 25 | 0.857 | 0.48 |
| 0.9-1.0 | 427 | 0.995 | 0.925 |
浅色标记表示 n < 20;这些区间波动很大,不应单独解释。AG News 的 0.9–1.0 区间包含 427/500 个样本,平均 top-label 概率 0.995,实际正确率 0.925。
同输入重复调用:只能报告范围
上游另对两个固定输入各调用 3 次。数值没有完全相同,但样本太小,无法估计漂移概率、尾部波动或版本间稳定性。
TICKET A · NOUL0.21–0.22
0.21 · 0.22 · 0.21TICKET A · CHOICE YES0.00–0.01
0.00 · 0.01 · 0.00TICKET B · REFUND0.72–0.73
0.72 · 0.73 · 0.72TICKET B · NOT REFUND0.41–0.47
0.44 · 0.47 · 0.41正确的生产验证应固定 state、问题、criteria、模型版本与接入路径,运行足够多次,并同时记录完整分布、错误、重试和时间。不要通过反复调用直到得到高置信结果。
不能从这份报告推出什么
- 01本站只复算公开输出,没有重新执行模型调用。
- 02每个任务只使用了一个由作者编写的问题措辞。
- 03SST-2 与 AG News 是著名基准,可能出现在训练数据中。
- 04多个中间可靠性区间的样本少于 20 条。
- 05每个示例仅重复 3 次,不能建立稳定率或保证。
- 06结果不能替另一个业务流程或数据分布确定生产阈值。