第16章 半监督学习

第16章 半监督学习覆盖4个权威目录层级,以最小二乘主线、图解推导和可复现实验重建原书核心。

为什么从最小二乘开始

、、、、、共同构成本页坐标。用全部输入构造流形邻接图,再以图拉普拉斯惩罚相邻样本预测差异,将少量标签和大量无标签样本接入最小二乘学习。

杉山将以最小二乘法作为统一入口,因为设计矩阵、平方损失和线性方程把模型表示、求解与泛化问题同时暴露出来。加入约束得到正则化与稀疏学习,替换损失得到鲁棒学习和分类,加入核得到非线性模型,加入图结构得到半监督与降维,加入密度比则能处理异常与分布移位。统一形式不意味着任务相同,每次扩展都必须重新声明训练信号与评价风险。

实验固定样本、特征构造、随机种子、数据折分与数值容差。训练阶段保存设计矩阵、核矩阵、损失分解、正则强度、梯度或线性系统残差;模型选择阶段保存每个候选在训练折与验证折的结果;测试集直到最终选择完成后才打开。这样可以区分模型机制、优化误差和数据抽样误差。

数学骨架与可核查量

经验风险把样本损失汇总为训练目标:

f^=argminfF1ni=1n ⁣(yi,f(xi)).\widehat{f}=\arg\min_{f\in\mathcal{F}}\frac{1}{n}\sum_{i=1}^{n}\ell\!\left(y_i,f(x_i)\right).

约束或惩罚限制模型容量:

θ^λ=argminθΦθy22+λΩ(θ).\widehat{\theta}_{\lambda}=\arg\min_{\theta}\left\|\Phi\theta-y\right\|_2^2+\lambda\,\Omega(\theta).

核展开把非线性预测写成训练样本的相似度组合:

f(x)=j=1nαjk(x,xj),Kij=k(xi,xj).f(x)=\sum_{j=1}^{n}\alpha_j k(x,x_j),\qquad K_{ij}=k(x_i,x_j).

模型选择只估计未见样本风险,不证明训练目标为真:

R^val(λ)=1mr=1m ⁣(yrval,fλ(xrval)).\widehat{R}_{\mathrm{val}}(\lambda)=\frac{1}{m}\sum_{r=1}^{m}\ell\!\left(y_r^{\mathrm{val}},f_{\lambda}(x_r^{\mathrm{val}})\right).
Phi = basis(x_train);
theta = solve(Phi, y_train, lambda);
assert(first_divergence(trace(theta), expected_trace) == predicted_stage);

机制辨析

  1. 流形构造通过近邻和相似权重表达样本局部几何,邻居数与尺度决定图连通性,错误桥边会传播错误标签。
  2. 拉普拉斯正则化最小二乘同时最小化有标签误差、函数复杂度和图上不平滑度,可化为线性系统求解。
  3. 图正则项等价于相似样本预测应接近的假设。若类别边界穿过高密度区域,无标签样本可能降低性能。

同一公式可以有多个等价表达,但实现应避免显式矩阵求逆。正规方程、对偶问题、核技巧或图拉普拉斯都要通过维度、对称性、半正定性、KKT 条件或残差检查。训练误差下降不是停止分析的理由;条件数过大、权重爆炸或验证误差反弹都说明解不可靠。

权威目录逐项讲解

第16章 半监督学习

流形构造通过近邻和相似权重表达样本局部几何,邻居数与尺度决定图连通性,错误桥边会传播错误标签。

验证“第16章 半监督学习”时,在“冻结训练样本”固定输入和预测量,再进入“构造特征与核”只改变一个条件。保存设计矩阵或核矩阵的维度、目标函数分解、求解停止状态与留出误差;若最终分数改善但中间结构没有按机制变化,先排查泄漏、数值误差和随机性。

这一主题的通过标准包含定义、推导、算法和边界四层:能解释它优化什么,写出关键量之间的关系,复现最小 MATLAB 风格实验,并构造一个破坏前提的反例。修复后清空派生产物,从原始样本重新执行整条证据链。

16.1 灵活应用输入数据的流形构造

拉普拉斯正则化最小二乘同时最小化有标签误差、函数复杂度和图上不平滑度,可化为线性系统求解。

验证“16.1 灵活应用输入数据的流形构造”时,在“构造特征与核”固定输入和预测量,再进入“写出经验风险”只改变一个条件。保存设计矩阵或核矩阵的维度、目标函数分解、求解停止状态与留出误差;若最终分数改善但中间结构没有按机制变化,先排查泄漏、数值误差和随机性。

这一主题的通过标准包含定义、推导、算法和边界四层:能解释它优化什么,写出关键量之间的关系,复现最小 MATLAB 风格实验,并构造一个破坏前提的反例。修复后清空派生产物,从原始样本重新执行整条证据链。

16.2 拉普拉斯正则化最小二乘学习的求解方法

图正则项等价于相似样本预测应接近的假设。若类别边界穿过高密度区域,无标签样本可能降低性能。

验证“16.2 拉普拉斯正则化最小二乘学习的求解方法”时,在“写出经验风险”固定输入和预测量,再进入“求解参数”只改变一个条件。保存设计矩阵或核矩阵的维度、目标函数分解、求解停止状态与留出误差;若最终分数改善但中间结构没有按机制变化,先排查泄漏、数值误差和随机性。

这一主题的通过标准包含定义、推导、算法和边界四层:能解释它优化什么,写出关键量之间的关系,复现最小 MATLAB 风格实验,并构造一个破坏前提的反例。修复后清空派生产物,从原始样本重新执行整条证据链。

16.3 拉普拉斯正则化的解释

流形构造通过近邻和相似权重表达样本局部几何,邻居数与尺度决定图连通性,错误桥边会传播错误标签。

验证“16.3 拉普拉斯正则化的解释”时,在“求解参数”固定输入和预测量,再进入“选择模型”只改变一个条件。保存设计矩阵或核矩阵的维度、目标函数分解、求解停止状态与留出误差;若最终分数改善但中间结构没有按机制变化,先排查泄漏、数值误差和随机性。

这一主题的通过标准包含定义、推导、算法和边界四层:能解释它优化什么,写出关键量之间的关系,复现最小 MATLAB 风格实验,并构造一个破坏前提的反例。修复后清空派生产物,从原始样本重新执行整条证据链。

常见失败与边界

本章回顾

用全部输入构造流形邻接图,再以图拉普拉斯惩罚相邻样本预测差异,将少量标签和大量无标签样本接入最小二乘学习。 验收时必须从固定样本预测矩阵、损失和参数,解释约束或数据关系为何改变解,并在失败样本中找到第一处违背假设的位置。最终结论要求:无标签数据只提供输入结构而不泄漏目标,邻接图和超参数在训练折内建立;流形假设必须通过标签平滑性与反例检验。

讨论

评论区加载中…