EXTERNAL RUN · SITE RECALCULATION · 2026

Jev 校准与稳定性证据:1000 条公开输出复算

复算外部公开的 2×500 条 Jev 校准输出,并审计 2 个固定输入各 3 次调用的波动;含固定提交、SHA-256、方法、表格和局限。

本站复算 外部运行 2026-09-20 jev-1.13.0 · typesafe-sdk 0.7.0
1,000逐项校准输出
94.0%SST-2 准确率
0.0934SST-2 ECE
0.0866AG News ECE
00 / ANSWER

这批数据能说明什么?

在作者选择的两套公开数据、单一问题措辞与一次托管模型运行中,Jev 的准确率较高,但概率并非完美校准:SST-2 的预测整体偏保守,AG News 的最高概率段偏自信。本站复算与作者聚合值完全一致。

这些结果不能证明其他业务数据、问题措辞、模型版本或接入渠道也有相同准确率和 ECE,也不能直接给出生产阈值。

01 / PROVENANCE

固定来源与完整性

作者
Colin McNamara
运行环境
2026-09-20 · Austin, TX
模型 / SDK
jev-1.13.0 · typesafe-sdk 0.7.0
固定提交
e32717b1c592 ↗
t3_raw.json SHA-256
5a46d61b1074d350ed5c915ff36d0ceb0692fe1cf1f904494cc342f0af83ea1f
t1_results.json SHA-256
cac6a52f33c74dfd1c7c6f8bb21cba5cacb057b4bd029b13fedb43206af46a40

下载脚本后运行;它只获取固定提交中的两个 JSON、先校验 SHA-256,再输出复算结果。不需要 Jev API 密钥。

node recompute.mjs
02 / CALIBRATION

复算指标

任务类型n准确率ECEBrier
SST-2 validationNoul5000.94000.09340.0491二分类
AG News testChoice5000.88200.08660.1013仅 top-label

ECE 使用 10 个等宽区间,按区间样本数加权 |平均预测概率 − 实际发生率|。1.0 归入最后一区间。

Brier SST-2 是正类概率的标准二分类均方误差;AG News 是 top-label 概率与 top-label 是否正确的二分类均方误差,不是四分类完整 Brier。

03 / BINS

可靠性区间表

SST-2 validation · Noul

概率区间n均值实际
0.0-0.11640.040.012
0.1-0.2460.1460.087
0.2-0.3190.2430.105
0.3-0.4130.3480.538
0.4-0.5140.4590.786
0.5-0.640.5471
0.6-0.7250.6440.92
0.7-0.8340.7550.941
0.8-0.9540.8491
0.9-1.01270.9491

AG News test · Choice

概率区间n均值实际
0.0-0.10——
0.1-0.20——
0.2-0.30——
0.3-0.40——
0.4-0.510.470
0.5-0.6150.5430.733
0.6-0.7150.6480.667
0.7-0.8170.7410.765
0.8-0.9250.8570.48
0.9-1.04270.9950.925

浅色标记表示 n < 20;这些区间波动很大,不应单独解释。AG News 的 0.9–1.0 区间包含 427/500 个样本,平均 top-label 概率 0.995,实际正确率 0.925。

04 / STABILITY

同输入重复调用:只能报告范围

上游另对两个固定输入各调用 3 次。数值没有完全相同,但样本太小,无法估计漂移概率、尾部波动或版本间稳定性。

TICKET A · NOUL0.21–0.220.21 · 0.22 · 0.21
TICKET A · CHOICE YES0.00–0.010.00 · 0.01 · 0.00
TICKET B · REFUND0.72–0.730.72 · 0.73 · 0.72
TICKET B · NOT REFUND0.41–0.470.44 · 0.47 · 0.41

正确的生产验证应固定 state、问题、criteria、模型版本与接入路径,运行足够多次,并同时记录完整分布、错误、重试和时间。不要通过反复调用直到得到高置信结果。

05 / LIMITS

不能从这份报告推出什么

  1. 01本站只复算公开输出,没有重新执行模型调用。
  2. 02每个任务只使用了一个由作者编写的问题措辞。
  3. 03SST-2 与 AG News 是著名基准,可能出现在训练数据中。
  4. 04多个中间可靠性区间的样本少于 20 条。
  5. 05每个示例仅重复 3 次,不能建立稳定率或保证。
  6. 06结果不能替另一个业务流程或数据分布确定生产阈值。