UXO
C39 / 判别与研究方法 · 2.0 · 参考阅读 7 分钟,推导与练习另计

评价判别:ROC、漏检与数据泄漏

阈值、混淆矩阵、类别比例和按目标分组的独立测试。

展开本章阅读路线(10 节)

阈值决定行为,分数不是结论

分类器可能输出一个分数,阈值以上认为更像目标。降低阈值常提高检出率,也增加虚警。必须同时报告实际工作点,而不仅报告一个 AUC。教程中的合成分数实验仅展示统计关系,不是可用于现场的判别器。

TPR=TPTP+FN,FPR=FPFP+TN,Precision=TPTP+FP.TPR=\frac{TP}{TP+FN},\quad FPR=\frac{FP}{FP+TN},\quad Precision=\frac{TP}{TP+FP}.

ROC 画 TPR 对 FPR;精确率依赖类别出现比例。真实场景目标稀少时,即使 FPR 不大,也可能产生大量假阳性。

一个小概率的大影响

设 1000 个对象中只有 10 个真目标,TPR=0.9、FPR=0.1,预期 TP=9、FP=99,精确率只有 9/108≈8.3%。看起来不错的检出率不能单独说明筛选工作量。更不能把分类概率当作物体处置结论。

怎样划分数据才没有偷偷看答案?

同一个实物的不同高度、姿态和重复扫描高度相关。若随机把这些扫描分到训练和测试,模型可能记住该物体或场地特征。应按实物、采集批次甚至场地分组,明确测试是同分布插值还是跨域泛化。

标准化、缺失值填补、特征筛选和超参数调整都只能使用训练数据。验证集可以用于调参;最后测试集不应被反复用来挑最佳方案。

漏检为零意味着什么?

有限样本中零漏检不意味着总体漏检概率为零。若 n 个独立目标均被检出,简单二项模型下可给漏检概率上界;常用粗略 95% 上界约为 3/n,但它依赖独立和代表性假设。样本重复或覆盖不足会使这个解释失效。

把分类分数转成可解释的统计量

在固定阈值下,召回率为 TP/(TP+FN),误报率为 FP/(FP+TN),精确率为 TP/(TP+FP)。ROC 随阈值扫描召回率和误报率;PR 曲线还对类别比例敏感。在目标稀少的数据里,即使误报率很小,误报总数也可能很大。

例如100个真实目标、9900个杂波,召回率99%、误报率1%,则 TP=99、FP=99,精确率只有50%。因此“99%的指标”必须说明分母是什么。

从检测到分类的损失不能漏算

最终正确识别概率可分解为 P(detect)P(correct classdetect)P(\text{detect})P(\text{correct class}|\text{detect})。如果分类测试集只包含被成功检测到的目标,就没有衡量整个流程的漏检。应同时报告候选提取、定位、反演成功率和分类结果。

没有漏检的数据仍有统计不确定性

在 N 个独立同分布目标中观察到零次失败,单侧95%失败概率上界为

pupper=10.051/N3/N.p_{upper}=1-0.05^{1/N}\approx3/N.

N=100 时上界约2.95%,并非失败概率严格等于零。同一实物不同姿态的重复测量通常不满足独立假设,应以目标或场地为单位组织区间估计。

阈值选择与最后测试要分开

训练集学习参数,验证集选模型和阈值,独立测试集报告最终结果。特征标准化、噪声估计和数据增强也不能提前使用测试标签。跨场地、跨目标实物的评价更能检验新环境的泛化。

深入练习:同一个目标的1000个时间门随机分到训练与测试集,会怎样?

测试集包含与训练集共享目标和测量条件的信息,结果可能过于乐观。应先按独立实物、测次或场地划分,再生成训练窗口。

研究拓展

域偏移可能来自土壤、仪器、目标腐蚀或实验协议。应报告分组指标、置信区间及失败案例。一个可拒绝判断的模型有时比在所有输入上强行给类别更可靠,但拒绝规则也需要独立验证。

练习与解析

1. 如果把阈值设置得让所有对象都判为目标,TPR 和 FPR 是多少?

均为 1,假定两类样本都存在。这说明高检出率本身不足以评价分类性能。

2. 同一目标的 100 次重复扫描算 100 个独立目标吗?

不算。重复可以评价测量噪声,却不能等同于覆盖 100 种独立目标实例。

把推导变成可观察的变化

调整合成分布间距、阈值与目标比例,观察 ROC 和工作点。

打开实验:判别阈值:检出、虚警与精确率 ↗

参考文献与继续学习

外部链接需联网,部分论文全文需要机构访问。页面内容为原创教学解释;文献用于核对理论和进一步阅读。资源链接核对日期:2026-09-12。

把这一章变成自己的理解

笔记保存在当前浏览器本机;建议定期导出备份。
SEARCH / 全文搜索