JEV 运行指南
Jev 置信度阈值与人工复核
根据业务风险设计 Jev 置信度阈值、校准测试和人工复核区间,而不是套用一个全局分数线。
1. 置信度不等于胜出概率
对 Choice 和 Score 而言,confidence 概括整个分布是否明确。某个选项即使概率最高,整体分布仍可能非常模糊。
2. 按风险设置三个区间
将结果分为自动执行、人工复核和拒绝执行。退款、账号变更、删除等不可逆操作,应比可撤销的路由建议采用更严格的边界。
# Illustrative policy — calibrate these values on your data.
if answer.confidence >= AUTO_THRESHOLD:
apply_reversible_action(answer.choice)
elif answer.confidence >= REVIEW_THRESHOLD:
enqueue_human_review(answer)
else:
abstain_and_request_more_context() 3. 用自己的数据校准
收集有代表性的标注样本,运行与线上完全相同的问题,按置信度分组并计算实际错误率。模型、规则或输入结构改变后需要重新校准。
4. 记录完整决策契约
保存问题版本、模型版本、答案、分布、置信度、阈值和最终动作,才能衡量回归问题与人工覆盖率。