准确率相同,决策结果为什么不同:校准、基率与阈值成本怎么一起看
准确率接近不代表模型给出的概率同样可信,也不代表同一个0.5阈值适合不同业务。先用独立样本检查概率校准与真实基率,再把误报、漏报和人工容量写进阈值选择,才看得见模型如何改变实际决策。
两个模型在测试集上的准确率都接近九成,团队却发现其中一个把大量样本送进人工审核,另一个漏掉更多真正需要处理的案例。差别不一定来自谁的准确率算错了,而可能来自概率是否校准、目标人群基率和动作阈值不同。
准确率回答最终标签对了多少,不说明模型给出的0.8是否真的对应约八成发生率,也不替业务决定何时采取动作。把概率、校准和阈值分开,才能解释同样准确率为何产生不同成本。
准确率与概率不是同一张成绩单
PMLR发表的研究发现,现代神经网络可以拥有较好分类准确率,却给出过度自信的概率。研究中的温度缩放只调整softmax概率尺度,不改变最大分数对应的类别,因此标签和准确率可以保持不变,置信度却发生变化。
这正是两个准确率相近模型仍需比较校准的原因。若某模型把大量实际发生率约六成的样本报成0.9,按0.8阈值自动通过就会过度自信;另一个模型即使标签命中率相近,概率更贴近发生率,阈值后的错误结构便不同。
校准曲线检查“0.8”是否像0.8
scikit-learn的校准曲线把预测概率分箱,再比较每个区间的平均预测与实际正类比例。若接近0.8的样本中约八成真为正类,这一段较接近校准;若只有五成,则模型在该区间过度自信。校准器应使用独立于模型训练的数据,否则训练集上的乐观表现会把概率推得过满。

单一Brier分数也不能自动替代校准曲线,因为它同时混合校准、分辨率与资料本身的不确定性。上线前应同时看概率区间、样本数量与实际发生率,尤其检查真正会触发业务动作的阈值附近。
基率改变后要重新核对
测试集若为了平衡类别而重采样,正类比例可能与实际人群不同。模型在平衡样本上显示的概率,不能不经验证直接解释成真实发生率。地区、渠道、时间和对象改变,也可能让输入分布与基率漂移。
NIST AI RMF强调风险测量要结合具体使用情境、部署阶段与受影响群体。这里的实际动作,是在目标人群保留独立样本,按真实基率重新画校准曲线,并分群检查高风险对象是否出现不同误差。校准不是一次性贴纸,而是随使用情境复核的测量。

阈值是动作成本,不是模型常数
scikit-learn把概率估计与动作决策分成两步。二分类接口常用0.5作为默认切点,但文档明确指出它通常不是具体任务的最佳策略。漏报成本高时可能降低阈值以提高召回,同时增加误报和审核量;人工容量有限时又必须评估队列是否可承担。
因此不要只报一个最佳阈值。把0.2、0.4、0.6等多个候选点对应的真阳性、假阳性、漏报、每千笔审核量和分群结果列在同一表中。阈值调优也要使用独立验证资料,不能拿训练模型的同一批数据同时选择切点。
温度缩放、校准曲线和阈值调优解决的是连续三步:模型输出概率,校准器修正概率尺度,阈值把概率转换为动作。任何一步使用了与目标场景不一致的数据,最终审核量和错误成本都可能偏离预期。
上线记录至少保留模型版本、目标人群基率、校准资料时间、概率分箱结果、选用阈值、错误成本假设和人工容量。上线后按相同口径复查;若基率、渠道或误差结构改变,先重新测量,不要只移动阈值掩盖漂移。
准确率不证明概率已经校准,校准也不替业务决定阈值;0.5不是通用最优值。先在目标人群核对概率与发生率,再比较多个阈值下的误报、漏报与审核量,决策才有可追踪边界。

资料来源
- National Institute of Standards and Technology:《Artificial Intelligence Risk Management Framework (AI RMF 1.0)》,发布或更新于 2023-01-26
- Proceedings of Machine Learning Research:《On Calibration of Modern Neural Networks》,发布或更新于 2017-08-11
- scikit-learn developers:《Probability calibration》,发布或更新于 2026-06-01
- scikit-learn developers:《Tuning the decision threshold for class prediction》,发布或更新于 2026-06-01