正则化与先验:稳定答案的代价是什么
Tikhonov、截断 SVD、约束与偏差方差权衡。
展开本章阅读路线(10 节)
数据不够时,必须说明补进了什么信息
常见目标函数在拟合项上加入约束:
L=I 惩罚离参考值太远;差分 L 可惩罚粗糙度。λ 决定两种要求的相对权重。正则化使计算稳定,却不能凭空创造观测信息;强正则化下的答案可能主要反映先验。
从奇异方向看它怎样起作用
对已白化的线性问题、L=I,SVD 方向上的系数从 1/sₖ 变成 。小奇异值不再被无限放大,但真实信号在这些方向也被压制,产生偏差。
截断 SVD 则直接舍去低于阈值的方向。两者都是在“保留信息”和“抑制噪声放大”之间做选择,阈值或 λ 必须有依据。
数值例子
某方向 s=0.01,未经正则化的放大系数为 100。取 λ=0.01 后,系数约为 0.9999,噪声明显减弱;但若真实参数确实在该方向有大分量,它也被强烈压缩。报告结果时应同时说明所用先验和灵敏度。
怎样选择强度?
可用已知噪声水平的差异原则、留出数据验证、L 曲线或其他明确规则。相关噪声、模型误差或被调过的验证集会影响选择。平滑衰减曲线的先验,不等于每个模态都来自真实可分离物理结构。
用一条公式看到偏差与方差
对白化线性问题、零参考模型和 L=I,Tikhonov 解为
相对于无正则解,滤波因子是 。弱方向 f_i 小,噪声被压制,同时真实信号也被压小。若白化噪声方差为1,该方向估计方差为 ,而偏差为 。误差条变窄不等于答案更接近真实值。
平滑、稀疏和非负约束表达不同假设
L 为差分矩阵时,惩罚相邻时间或空间参数变化;L=I 时惩罚参数大小。L1 惩罚倾向少量非零系数,但“稀疏的是目标数、模态数还是空间单元”必须明确。非负约束只在参数的物理定义支持非负时使用,不能对可能带符号的场分量直接施加。
正则化强度如何选择
已知可靠噪声时,可考察不一致度原则;交叉验证应按独立目标或测线划分,而不是随机拆分强相关时间门;L 曲线提供折中图像,但拐点不一定唯一。每种选择都应报告 λ 改变一个量级后,关键目标参数和预测是否稳定。
贝叶斯解释的边界
高斯先验 与高斯似然给出二次 MAP 目标,其中 (在相应可逆条件下)。MAP 是后验峰值;正则解的一条曲线并没有自动给出整个后验分布。
深入练习:某个方向完全不影响数据,正则化为何还能给出一个值?
该值来自先验或参考模型。它可以有用,但应明确标为先验主导,不能称为数据测出来的结果。
研究拓展
正参数、几何边界和材料范围也是先验。Bayesian 观点把正则项看作负对数先验的一部分,但必须连同参数化说明;对 σ 均匀的先验与对 logσ 均匀的先验不同。漂亮而稳定的点估计不能替代后验范围或敏感性分析。
练习与解析
1. λ→∞ 时,解总会趋于零吗?
不一定。取决于参考值与 L 的零空间。若 L=I,则趋向 θref;若 L 有零空间,其中的分量还可能由数据决定。
2. 正则化后参数误差条很窄,能否称为数据已经唯一确定?
不能直接这样称呼。应区分数据约束与先验约束,并检查结果对先验强度和形式的依赖。
参考文献与继续学习
- Boyd & Vandenberghe · Convex Optimization免费教材:最小二乘、正则化、约束与优化。非线性 UXO 反演并不因此自动成为凸问题。
- MIT 18.05 · Introduction to Probability and Statistics随机变量、条件概率、统计推断与区间估计;本科公开课。
外部链接需联网,部分论文全文需要机构访问。页面内容为原创教学解释;文献用于核对理论和进一步阅读。资源链接核对日期:2026-09-12。