第3章 最小二乘学习法

第3章 最小二乘学习法覆盖5个权威目录层级,以最小二乘主线、图解推导和可复现实验重建原书核心。

为什么从最小二乘开始

、、、、、共同构成本页坐标。从设计矩阵与平方损失推导最小二乘解,分析投影、偏差和方差,并用迭代求解与矩阵分解处理大规模样本。

杉山将以最小二乘法作为统一入口,因为设计矩阵、平方损失和线性方程把模型表示、求解与泛化问题同时暴露出来。加入约束得到正则化与稀疏学习,替换损失得到鲁棒学习和分类,加入核得到非线性模型,加入图结构得到半监督与降维,加入密度比则能处理异常与分布移位。统一形式不意味着任务相同,每次扩展都必须重新声明训练信号与评价风险。

实验固定样本、特征构造、随机种子、数据折分与数值容差。训练阶段保存设计矩阵、核矩阵、损失分解、正则强度、梯度或线性系统残差;模型选择阶段保存每个候选在训练折与验证折的结果;测试集直到最终选择完成后才打开。这样可以区分模型机制、优化误差和数据抽样误差。

数学骨架与可核查量

经验风险把样本损失汇总为训练目标:

f^=argminfF1ni=1n ⁣(yi,f(xi)).\widehat{f}=\arg\min_{f\in\mathcal{F}}\frac{1}{n}\sum_{i=1}^{n}\ell\!\left(y_i,f(x_i)\right).

约束或惩罚限制模型容量:

θ^λ=argminθΦθy22+λΩ(θ).\widehat{\theta}_{\lambda}=\arg\min_{\theta}\left\|\Phi\theta-y\right\|_2^2+\lambda\,\Omega(\theta).

核展开把非线性预测写成训练样本的相似度组合:

f(x)=j=1nαjk(x,xj),Kij=k(xi,xj).f(x)=\sum_{j=1}^{n}\alpha_j k(x,x_j),\qquad K_{ij}=k(x_i,x_j).

模型选择只估计未见样本风险,不证明训练目标为真:

R^val(λ)=1mr=1m ⁣(yrval,fλ(xrval)).\widehat{R}_{\mathrm{val}}(\lambda)=\frac{1}{m}\sum_{r=1}^{m}\ell\!\left(y_r^{\mathrm{val}},f_{\lambda}(x_r^{\mathrm{val}})\right).
Phi = basis(x_train);
theta = solve(Phi, y_train, lambda);
assert(first_divergence(trace(theta), expected_trace) == predicted_stage);

机制辨析

  1. 最小二乘法最小化预测与目标的平方残差,正规方程给出闭式条件,但实际求解优先使用 QR、SVD 或稳定线性方程算法。
  2. 最小二乘解是目标向量到设计矩阵列空间的投影。列相关会造成多解或高方差,噪声与模型错设决定残差结构。
  3. 大规模学习避免构造完整逆矩阵,可使用共轭梯度、随机梯度、分块矩阵或低秩近似,并报告时间、内存和收敛误差。

同一公式可以有多个等价表达,但实现应避免显式矩阵求逆。正规方程、对偶问题、核技巧或图拉普拉斯都要通过维度、对称性、半正定性、KKT 条件或残差检查。训练误差下降不是停止分析的理由;条件数过大、权重爆炸或验证误差反弹都说明解不可靠。

权威目录逐项讲解

第II部分 有监督回归

最小二乘法最小化预测与目标的平方残差,正规方程给出闭式条件,但实际求解优先使用 QR、SVD 或稳定线性方程算法。

验证“第II部分 有监督回归”时,在“冻结训练样本”固定输入和预测量,再进入“构造特征与核”只改变一个条件。保存设计矩阵或核矩阵的维度、目标函数分解、求解停止状态与留出误差;若最终分数改善但中间结构没有按机制变化,先排查泄漏、数值误差和随机性。

这一主题的通过标准包含定义、推导、算法和边界四层:能解释它优化什么,写出关键量之间的关系,复现最小 MATLAB 风格实验,并构造一个破坏前提的反例。修复后清空派生产物,从原始样本重新执行整条证据链。

第3章 最小二乘学习法

最小二乘解是目标向量到设计矩阵列空间的投影。列相关会造成多解或高方差,噪声与模型错设决定残差结构。

验证“第3章 最小二乘学习法”时,在“构造特征与核”固定输入和预测量,再进入“写出经验风险”只改变一个条件。保存设计矩阵或核矩阵的维度、目标函数分解、求解停止状态与留出误差;若最终分数改善但中间结构没有按机制变化,先排查泄漏、数值误差和随机性。

这一主题的通过标准包含定义、推导、算法和边界四层:能解释它优化什么,写出关键量之间的关系,复现最小 MATLAB 风格实验,并构造一个破坏前提的反例。修复后清空派生产物,从原始样本重新执行整条证据链。

3.1 最小二乘学习法

大规模学习避免构造完整逆矩阵,可使用共轭梯度、随机梯度、分块矩阵或低秩近似,并报告时间、内存和收敛误差。

验证“3.1 最小二乘学习法”时,在“写出经验风险”固定输入和预测量,再进入“求解参数”只改变一个条件。保存设计矩阵或核矩阵的维度、目标函数分解、求解停止状态与留出误差;若最终分数改善但中间结构没有按机制变化,先排查泄漏、数值误差和随机性。

这一主题的通过标准包含定义、推导、算法和边界四层:能解释它优化什么,写出关键量之间的关系,复现最小 MATLAB 风格实验,并构造一个破坏前提的反例。修复后清空派生产物,从原始样本重新执行整条证据链。

3.2 最小二乘解的性质

最小二乘法最小化预测与目标的平方残差,正规方程给出闭式条件,但实际求解优先使用 QR、SVD 或稳定线性方程算法。

验证“3.2 最小二乘解的性质”时,在“求解参数”固定输入和预测量,再进入“选择模型”只改变一个条件。保存设计矩阵或核矩阵的维度、目标函数分解、求解停止状态与留出误差;若最终分数改善但中间结构没有按机制变化,先排查泄漏、数值误差和随机性。

这一主题的通过标准包含定义、推导、算法和边界四层:能解释它优化什么,写出关键量之间的关系,复现最小 MATLAB 风格实验,并构造一个破坏前提的反例。修复后清空派生产物,从原始样本重新执行整条证据链。

3.3 大规模数据的学习算法

最小二乘解是目标向量到设计矩阵列空间的投影。列相关会造成多解或高方差,噪声与模型错设决定残差结构。

验证“3.3 大规模数据的学习算法”时,在“选择模型”固定输入和预测量,再进入“验证泛化”只改变一个条件。保存设计矩阵或核矩阵的维度、目标函数分解、求解停止状态与留出误差;若最终分数改善但中间结构没有按机制变化,先排查泄漏、数值误差和随机性。

这一主题的通过标准包含定义、推导、算法和边界四层:能解释它优化什么,写出关键量之间的关系,复现最小 MATLAB 风格实验,并构造一个破坏前提的反例。修复后清空派生产物,从原始样本重新执行整条证据链。

常见失败与边界

本章回顾

从设计矩阵与平方损失推导最小二乘解,分析投影、偏差和方差,并用迭代求解与矩阵分解处理大规模样本。 验收时必须从固定样本预测矩阵、损失和参数,解释约束或数据关系为何改变解,并在失败样本中找到第一处违背假设的位置。最终结论要求:设计矩阵、目标向量和尺度一致,求解不依赖显式求逆造成的数值不稳定;残差、条件数和留出误差共同验证解。

讨论

评论区加载中…