最小二乘与似然:什么叫“解释得足够好”
残差、加权、白化和目标函数的统计意义。
展开本章阅读路线(10 节)
一个差 1 的残差,意义总相同吗?
如果某通道标准差是 0.1,差 1 很大;若标准差是 10,差 1 很小。因此残差应按不确定性比较,而不是让数值最大的早期通道自动支配拟合。令 ,高斯噪声协方差为 C:
若独立同方差,退化为常见平方和。相关噪声则需要白化矩阵 W,而不只是逐项除以标准差。
为什么高斯噪声导出平方和?
高斯似然正比于 。取负对数,除去与 θ 无关的常数,就得到目标函数。若协方差本身依赖 θ,不能随意丢掉对数行列式项。最小二乘的统计解释依赖噪声模型,不是任何数据都自动适用。
线性情形可以怎样求解?
当 F=Aθ 时,对平方和求导得到正规方程 。实际计算中,直接形成 AᵀA 会把条件数平方,QR 或 SVD 往往更稳健。写出正规方程是推导步骤,不代表一定按这个方式实现。
数值例子:加权平均
两次测量同一量,数值为 10 和 14,标准差分别为 1 和 2。权重为 1 和 1/4,估计为 ,并非简单平均的 12。若第二次包含未知偏置,这个加权模型本身还需要修正。
残差图比单个误差数更有用
随时间持续同号的残差、在某方向系统性偏差、与发射幅度相关的残差,可能提示模型缺项。低总平方和不能保证残差符合噪声假设。对异常点可考虑稳健损失,但它不能代替找出异常来源。
用噪声分布推导而不是猜测目标函数
当 且 C_d 与目标参数无关时,负对数似然为
固定协方差时后两项与 θ 无关,最小化第一项即可。若连噪声尺度也在估计,不能丢掉 log det 项,否则算法可以靠无限增大噪声解释任意残差。Cholesky 分解 C_d=LLᵀ 后,通过解 Lz=r 实现白化,无需显式计算逆矩阵。
一个两参数最小二乘的完整推导
对 ,设计矩阵的每行是 (1,t_i)。对 求导得到 。t=(-1,0,1)、d=(1,2,4) 时,,,因此 a=7/3、b=3/2。残差不是零,且与两列设计向量正交,这是最优投影的几何含义。
异常值时为什么考虑稳健损失
对标准化残差 z,Huber 损失在 |z|≤δ 时为 z²/2,外侧为 δ|z|−δ²/2。迭代重加权可取 。这减少大残差的主导作用,但不能把真实第二目标产生的结构性残差全部当作异常点删除。UXO 中位置误差和相关噪声的影响可参考 Beran 等的稳健反演研究。
深入练习:白化残差平方和应该严格等于数据个数吗?
不应该。它是随机变量;拟合参数会消耗有效自由度,约束、正则化和相关性还会改变解释。线性满秩、正确高斯模型下,拟合后期望约为 n−p,而非一个必须精确达到的数字。
研究拓展
使用对数数据会强调相对误差,同时改变噪声分布并排除非正值。要么建立对数噪声模型,要么在原始观测空间拟合。拟合优度还应在未用于调参的数据上评价。
练习与解析
1. 两个通道原始残差都为 2,标准差分别 1、4,标准化残差是多少?
分别为 2 和 0.5。平方贡献分别为 4 和 0.25。
2. 降低报告的噪声标准差会让模型更真实吗?
不会。它只改变权重和统计解释;不真实的小标准差会导致过度自信和不合理的拟合压力。
参考文献与继续学习
- MIT 18.06SC · Linear Algebra基础课程:投影、特征值、最小二乘与 SVD。英文。
- MIT 18.05 · Introduction to Probability and Statistics随机变量、条件概率、统计推断与区间估计;本科公开课。
- Boyd & Vandenberghe · Convex Optimization免费教材:最小二乘、正则化、约束与优化。非线性 UXO 反演并不因此自动成为凸问题。
- Beran, Billings & Oldenburg (2011) · Robust Inversion of Time-domain Electromagnetic Data作者机构提供原文;已读本地摘要,讨论位置误差、非高斯噪声与稳健损失。
外部链接需联网,部分论文全文需要机构访问。页面内容为原创教学解释;文献用于核对理论和进一步阅读。资源链接核对日期:2026-09-12。