第3章 线性模型

第3章 线性模型覆盖8个权威目录层级,以模型机制、数学推导、交互实验和失败对照重建核心知识。

为什么从问题合同开始

、、、、、共同构成本页的学习坐标。从特征加权和出发,贯通最小二乘、对数几率、线性判别、多分类拆解与不平衡学习,并把系数解释限制在预处理和共线性条件内。

机器学习不是先选流行算法再寻找数据,而是先写清任务对象、可观测属性、目标变量或反馈、数据生成过程、允许使用的信息和错误代价。训练集用于估计模型,验证集用于选择结构与超参数,测试集只在所有决定冻结后评价一次。聚类、半监督和强化学习虽然反馈形式不同,也必须给出对应的独立证据,不能把训练目标本身当作泛化结论。

每次实验记录样本标识、折分策略、预处理拟合范围、特征顺序、随机种子、数值精度、依赖版本和停止规则。模型训练保存每步目标分解、关键状态与更新;模型选择保存所有候选而不是只留最好一次;失败样本与成功样本使用同一管线。这样才能区分概念假设错误、数据泄漏、数值错误、优化未收敛和抽样波动。

阅读时先预测:若只改变一个条件,第一处应该变化的是输入表示、模型状态、目标项、参数更新、预测分布还是评价轨迹?随后运行最小样本并在第一条不一致处停止。继续观察下游准确率通常只会增加噪声。任何修复都清空派生产物并从原始数据重放,防止错误状态污染后续结论。

数学骨架与可核查量

经验风险把冻结训练样本上的逐例损失聚合:

R^(f)=1mi=1m(f(xi),yi).\widehat R(f)=\frac{1}{m}\sum_{i=1}^{m}\ell\bigl(f(x_i),y_i\bigr).

结构约束或先验通过正则项进入训练目标:

J(θ)=R^(fθ)+λΩ(θ).\mathcal J(\theta)=\widehat R(f_\theta)+\lambda\Omega(\theta).

模型选择在验证数据上完成,测试风险不得参与选择:

λ^=argminλΛR^valid(fλ),R^test(fλ^) once.\hat\lambda=\arg\min_{\lambda\in\Lambda}\widehat R_{\mathrm{valid}}(f_\lambda),\qquad \widehat R_{\mathrm{test}}(f_{\hat\lambda})\text{ once}.

本页专属可核查关系为:

w^=(XTX)1XTy.\hat{\boldsymbol w}=(X^{\mathsf T}X)^{-1}X^{\mathsf T}\boldsymbol y.

正规方程展示最小二乘闭式解,但实际计算应避免显式求逆,并在秩亏或病态时使用分解与正则化。 实现时同时检查输入输出形状、有限值、约束残差、目标变化方向、概率归一或守恒关系,并用可枚举小样本或有限差分建立独立基线。

机制辨析

  1. 线性模型用属性的线性组合预测,形式简单、可解释、计算高效,也是核方法和神经网络局部运算的基础。线性指参数线性,不必等同于原始输入直线。
  2. 基本形式把样本写成带截距的特征向量。类别属性需要编码,连续属性需要检查量纲,交互项和基函数可在保持参数线性的同时表达曲线关系。
  3. 线性回归最小化平方误差。单变量可由均值、协方差推导,多变量通过矩阵求解;残差图用于检查非线性、异方差和异常点。
  4. 对数几率回归对后验几率的对数做线性建模,使用极大似然学习。输出是概率但校准仍需验证,0.5阈值不适合所有代价结构。
  5. 线性判别分析寻找使类内散度小、类间散度大的投影方向。协方差奇异时需要降维、收缩或正则,投影可视化不能替代独立分类评估。
  6. 多分类可用一对一、一对其余或纠错输出码拆分。拆分会改变训练分布和决策边界,编码长度、基学习器误差相关性与解码规则共同决定效果。
  7. 类别不平衡可通过重采样、阈值移动或代价敏感学习处理。重采样必须只在训练折内进行,评价应关注PR、召回和业务代价。
  8. 阅读材料连接广义线性模型、判别分析与代价敏感决策。扩展方法仍需保持同一数据合同和比较预算。

本章机制必须与替代解释分开。例如训练风险下降可能来自容量增加、泄漏、更多计算或随机好运,而不一定来自目标机制;概率输出可能已归一却未校准;凸目标可全局求解却仍受错误特征和分布偏移影响。对照实验只改变一个因素,并让简单基线获得相同数据、调参机会和资源预算。

权威目录逐项讲解

第3章 线性模型

线性模型用属性的线性组合预测,形式简单、可解释、计算高效,也是核方法和神经网络局部运算的基础。线性指参数线性,不必等同于原始输入直线。

学习“第3章 线性模型”时先在“冻结数据合同”冻结输入、样本身份、特征形状、随机状态和适用假设,再进入“计算模型状态”只改变一个条件。至少保存目标值、关键中间量、更新前后状态和独立评价;若最终指标改善但机制预期的第一处变化没有发生,应先排查泄漏、索引、尺度、优化容差和随机性,不能用末端分数覆盖首错。

通过标准包含四层:能够准确解释定义与适用前提;能够在极小样本上手算公式或枚举状态;能够用固定种子复现算法一步;能够构造一个破坏前提的反例并指出停止位置。修复后清空派生特征、缓存、伪标签、模型状态和评价结果,从冻结原始样本完整重放。

3.1 基本形式

基本形式把样本写成带截距的特征向量。类别属性需要编码,连续属性需要检查量纲,交互项和基函数可在保持参数线性的同时表达曲线关系。

学习“3.1 基本形式”时先在“计算模型状态”冻结输入、样本身份、特征形状、随机状态和适用假设,再进入“核对目标与约束”只改变一个条件。至少保存目标值、关键中间量、更新前后状态和独立评价;若最终指标改善但机制预期的第一处变化没有发生,应先排查泄漏、索引、尺度、优化容差和随机性,不能用末端分数覆盖首错。

通过标准包含四层:能够准确解释定义与适用前提;能够在极小样本上手算公式或枚举状态;能够用固定种子复现算法一步;能够构造一个破坏前提的反例并指出停止位置。修复后清空派生特征、缓存、伪标签、模型状态和评价结果,从冻结原始样本完整重放。

3.2 线性回归

线性回归最小化平方误差。单变量可由均值、协方差推导,多变量通过矩阵求解;残差图用于检查非线性、异方差和异常点。

学习“3.2 线性回归”时先在“核对目标与约束”冻结输入、样本身份、特征形状、随机状态和适用假设,再进入“执行学习或推断”只改变一个条件。至少保存目标值、关键中间量、更新前后状态和独立评价;若最终指标改善但机制预期的第一处变化没有发生,应先排查泄漏、索引、尺度、优化容差和随机性,不能用末端分数覆盖首错。

通过标准包含四层:能够准确解释定义与适用前提;能够在极小样本上手算公式或枚举状态;能够用固定种子复现算法一步;能够构造一个破坏前提的反例并指出停止位置。修复后清空派生特征、缓存、伪标签、模型状态和评价结果,从冻结原始样本完整重放。

3.3 对数几率回归

对数几率回归对后验几率的对数做线性建模,使用极大似然学习。输出是概率但校准仍需验证,0.5阈值不适合所有代价结构。

学习“3.3 对数几率回归”时先在“执行学习或推断”冻结输入、样本身份、特征形状、随机状态和适用假设,再进入“独立评估泛化”只改变一个条件。至少保存目标值、关键中间量、更新前后状态和独立评价;若最终指标改善但机制预期的第一处变化没有发生,应先排查泄漏、索引、尺度、优化容差和随机性,不能用末端分数覆盖首错。

通过标准包含四层:能够准确解释定义与适用前提;能够在极小样本上手算公式或枚举状态;能够用固定种子复现算法一步;能够构造一个破坏前提的反例并指出停止位置。修复后清空派生特征、缓存、伪标签、模型状态和评价结果,从冻结原始样本完整重放。

3.4 线性判别分析

线性判别分析寻找使类内散度小、类间散度大的投影方向。协方差奇异时需要降维、收缩或正则,投影可视化不能替代独立分类评估。

学习“3.4 线性判别分析”时先在“独立评估泛化”冻结输入、样本身份、特征形状、随机状态和适用假设,再进入“定位首个分叉”只改变一个条件。至少保存目标值、关键中间量、更新前后状态和独立评价;若最终指标改善但机制预期的第一处变化没有发生,应先排查泄漏、索引、尺度、优化容差和随机性,不能用末端分数覆盖首错。

通过标准包含四层:能够准确解释定义与适用前提;能够在极小样本上手算公式或枚举状态;能够用固定种子复现算法一步;能够构造一个破坏前提的反例并指出停止位置。修复后清空派生特征、缓存、伪标签、模型状态和评价结果,从冻结原始样本完整重放。

3.5 多分类学习

多分类可用一对一、一对其余或纠错输出码拆分。拆分会改变训练分布和决策边界,编码长度、基学习器误差相关性与解码规则共同决定效果。

学习“3.5 多分类学习”时先在“定位首个分叉”冻结输入、样本身份、特征形状、随机状态和适用假设,再进入“冻结数据合同”只改变一个条件。至少保存目标值、关键中间量、更新前后状态和独立评价;若最终指标改善但机制预期的第一处变化没有发生,应先排查泄漏、索引、尺度、优化容差和随机性,不能用末端分数覆盖首错。

通过标准包含四层:能够准确解释定义与适用前提;能够在极小样本上手算公式或枚举状态;能够用固定种子复现算法一步;能够构造一个破坏前提的反例并指出停止位置。修复后清空派生特征、缓存、伪标签、模型状态和评价结果,从冻结原始样本完整重放。

3.6 类别不平衡问题

类别不平衡可通过重采样、阈值移动或代价敏感学习处理。重采样必须只在训练折内进行,评价应关注PR、召回和业务代价。

学习“3.6 类别不平衡问题”时先在“冻结数据合同”冻结输入、样本身份、特征形状、随机状态和适用假设,再进入“计算模型状态”只改变一个条件。至少保存目标值、关键中间量、更新前后状态和独立评价;若最终指标改善但机制预期的第一处变化没有发生,应先排查泄漏、索引、尺度、优化容差和随机性,不能用末端分数覆盖首错。

通过标准包含四层:能够准确解释定义与适用前提;能够在极小样本上手算公式或枚举状态;能够用固定种子复现算法一步;能够构造一个破坏前提的反例并指出停止位置。修复后清空派生特征、缓存、伪标签、模型状态和评价结果,从冻结原始样本完整重放。

3.7 阅读材料

阅读材料连接广义线性模型、判别分析与代价敏感决策。扩展方法仍需保持同一数据合同和比较预算。

学习“3.7 阅读材料”时先在“计算模型状态”冻结输入、样本身份、特征形状、随机状态和适用假设,再进入“核对目标与约束”只改变一个条件。至少保存目标值、关键中间量、更新前后状态和独立评价;若最终指标改善但机制预期的第一处变化没有发生,应先排查泄漏、索引、尺度、优化容差和随机性,不能用末端分数覆盖首错。

通过标准包含四层:能够准确解释定义与适用前提;能够在极小样本上手算公式或枚举状态;能够用固定种子复现算法一步;能够构造一个破坏前提的反例并指出停止位置。修复后清空派生特征、缓存、伪标签、模型状态和评价结果,从冻结原始样本完整重放。

常见失败与边界

本章回顾

从特征加权和出发,贯通最小二乘、对数几率、线性判别、多分类拆解与不平衡学习,并把系数解释限制在预处理和共线性条件内。 验收时从冻结数据预测中间状态、目标与更新,解释结构或分布条件为何改变答案,并在失败样本中指出第一处违背前提的位置。最终底线是:设计矩阵、截距、编码和缩放约定必须固定;分类阈值由验证集和代价确定;矩阵病态或类别先验改变时必须重新检查结论。

讨论

评论区加载中…