评价判别:ROC、漏检与数据泄漏
阈值、混淆矩阵、类别比例和按目标分组的独立测试。
展开本章阅读路线(10 节)
阈值决定行为,分数不是结论
分类器可能输出一个分数,阈值以上认为更像目标。降低阈值常提高检出率,也增加虚警。必须同时报告实际工作点,而不仅报告一个 AUC。教程中的合成分数实验仅展示统计关系,不是可用于现场的判别器。
ROC 画 TPR 对 FPR;精确率依赖类别出现比例。真实场景目标稀少时,即使 FPR 不大,也可能产生大量假阳性。
一个小概率的大影响
设 1000 个对象中只有 10 个真目标,TPR=0.9、FPR=0.1,预期 TP=9、FP=99,精确率只有 9/108≈8.3%。看起来不错的检出率不能单独说明筛选工作量。更不能把分类概率当作物体处置结论。
怎样划分数据才没有偷偷看答案?
同一个实物的不同高度、姿态和重复扫描高度相关。若随机把这些扫描分到训练和测试,模型可能记住该物体或场地特征。应按实物、采集批次甚至场地分组,明确测试是同分布插值还是跨域泛化。
标准化、缺失值填补、特征筛选和超参数调整都只能使用训练数据。验证集可以用于调参;最后测试集不应被反复用来挑最佳方案。
漏检为零意味着什么?
有限样本中零漏检不意味着总体漏检概率为零。若 n 个独立目标均被检出,简单二项模型下可给漏检概率上界;常用粗略 95% 上界约为 3/n,但它依赖独立和代表性假设。样本重复或覆盖不足会使这个解释失效。
把分类分数转成可解释的统计量
在固定阈值下,召回率为 TP/(TP+FN),误报率为 FP/(FP+TN),精确率为 TP/(TP+FP)。ROC 随阈值扫描召回率和误报率;PR 曲线还对类别比例敏感。在目标稀少的数据里,即使误报率很小,误报总数也可能很大。
例如100个真实目标、9900个杂波,召回率99%、误报率1%,则 TP=99、FP=99,精确率只有50%。因此“99%的指标”必须说明分母是什么。
从检测到分类的损失不能漏算
最终正确识别概率可分解为 。如果分类测试集只包含被成功检测到的目标,就没有衡量整个流程的漏检。应同时报告候选提取、定位、反演成功率和分类结果。
没有漏检的数据仍有统计不确定性
在 N 个独立同分布目标中观察到零次失败,单侧95%失败概率上界为
N=100 时上界约2.95%,并非失败概率严格等于零。同一实物不同姿态的重复测量通常不满足独立假设,应以目标或场地为单位组织区间估计。
阈值选择与最后测试要分开
训练集学习参数,验证集选模型和阈值,独立测试集报告最终结果。特征标准化、噪声估计和数据增强也不能提前使用测试标签。跨场地、跨目标实物的评价更能检验新环境的泛化。
深入练习:同一个目标的1000个时间门随机分到训练与测试集,会怎样?
测试集包含与训练集共享目标和测量条件的信息,结果可能过于乐观。应先按独立实物、测次或场地划分,再生成训练窗口。
研究拓展
域偏移可能来自土壤、仪器、目标腐蚀或实验协议。应报告分组指标、置信区间及失败案例。一个可拒绝判断的模型有时比在所有输入上强行给类别更可靠,但拒绝规则也需要独立验证。
练习与解析
1. 如果把阈值设置得让所有对象都判为目标,TPR 和 FPR 是多少?
均为 1,假定两类样本都存在。这说明高检出率本身不足以评价分类性能。
2. 同一目标的 100 次重复扫描算 100 个独立目标吗?
不算。重复可以评价测量噪声,却不能等同于覆盖 100 种独立目标实例。
调整合成分布间距、阈值与目标比例,观察 ROC 和工作点。
打开实验:判别阈值:检出、虚警与精确率 ↗参考文献与继续学习
- MIT 18.05 · Introduction to Probability and Statistics随机变量、条件概率、统计推断与区间估计;本科公开课。
- US EPA · Advanced Geophysical Classification for Munitions Response地球物理分类与质量计划的背景资料;不能替代项目适用的现场程序。
- Heagy et al. (2024) · Machine learning methods for the classification of UXO from electromagnetic data in marine settingsEMIW 2024扩展摘要;已读本地摘要与方法开头。合成偶极、实测背景及海洋分类图,非完整期刊复现。
外部链接需联网,部分论文全文需要机构访问。页面内容为原创教学解释;文献用于核对理论和进一步阅读。资源链接核对日期:2026-09-12。