第3章 线性模型
第3章 线性模型覆盖8个权威目录层级,以模型机制、数学推导、交互实验和失败对照重建核心知识。
为什么从问题合同开始
、、、、、共同构成本页的学习坐标。从特征加权和出发,贯通最小二乘、对数几率、线性判别、多分类拆解与不平衡学习,并把系数解释限制在预处理和共线性条件内。
机器学习不是先选流行算法再寻找数据,而是先写清任务对象、可观测属性、目标变量或反馈、数据生成过程、允许使用的信息和错误代价。训练集用于估计模型,验证集用于选择结构与超参数,测试集只在所有决定冻结后评价一次。聚类、半监督和强化学习虽然反馈形式不同,也必须给出对应的独立证据,不能把训练目标本身当作泛化结论。
每次实验记录样本标识、折分策略、预处理拟合范围、特征顺序、随机种子、数值精度、依赖版本和停止规则。模型训练保存每步目标分解、关键状态与更新;模型选择保存所有候选而不是只留最好一次;失败样本与成功样本使用同一管线。这样才能区分概念假设错误、数据泄漏、数值错误、优化未收敛和抽样波动。
阅读时先预测:若只改变一个条件,第一处应该变化的是输入表示、模型状态、目标项、参数更新、预测分布还是评价轨迹?随后运行最小样本并在第一条不一致处停止。继续观察下游准确率通常只会增加噪声。任何修复都清空派生产物并从原始数据重放,防止错误状态污染后续结论。
数学骨架与可核查量
经验风险把冻结训练样本上的逐例损失聚合:
结构约束或先验通过正则项进入训练目标:
模型选择在验证数据上完成,测试风险不得参与选择:
本页专属可核查关系为:
正规方程展示最小二乘闭式解,但实际计算应避免显式求逆,并在秩亏或病态时使用分解与正则化。 实现时同时检查输入输出形状、有限值、约束残差、目标变化方向、概率归一或守恒关系,并用可枚举小样本或有限差分建立独立基线。
机制辨析
- 线性模型用属性的线性组合预测,形式简单、可解释、计算高效,也是核方法和神经网络局部运算的基础。线性指参数线性,不必等同于原始输入直线。
- 基本形式把样本写成带截距的特征向量。类别属性需要编码,连续属性需要检查量纲,交互项和基函数可在保持参数线性的同时表达曲线关系。
- 线性回归最小化平方误差。单变量可由均值、协方差推导,多变量通过矩阵求解;残差图用于检查非线性、异方差和异常点。
- 对数几率回归对后验几率的对数做线性建模,使用极大似然学习。输出是概率但校准仍需验证,0.5阈值不适合所有代价结构。
- 线性判别分析寻找使类内散度小、类间散度大的投影方向。协方差奇异时需要降维、收缩或正则,投影可视化不能替代独立分类评估。
- 多分类可用一对一、一对其余或纠错输出码拆分。拆分会改变训练分布和决策边界,编码长度、基学习器误差相关性与解码规则共同决定效果。
- 类别不平衡可通过重采样、阈值移动或代价敏感学习处理。重采样必须只在训练折内进行,评价应关注PR、召回和业务代价。
- 阅读材料连接广义线性模型、判别分析与代价敏感决策。扩展方法仍需保持同一数据合同和比较预算。
本章机制必须与替代解释分开。例如训练风险下降可能来自容量增加、泄漏、更多计算或随机好运,而不一定来自目标机制;概率输出可能已归一却未校准;凸目标可全局求解却仍受错误特征和分布偏移影响。对照实验只改变一个因素,并让简单基线获得相同数据、调参机会和资源预算。
权威目录逐项讲解
第3章 线性模型
线性模型用属性的线性组合预测,形式简单、可解释、计算高效,也是核方法和神经网络局部运算的基础。线性指参数线性,不必等同于原始输入直线。
学习“第3章 线性模型”时先在“冻结数据合同”冻结输入、样本身份、特征形状、随机状态和适用假设,再进入“计算模型状态”只改变一个条件。至少保存目标值、关键中间量、更新前后状态和独立评价;若最终指标改善但机制预期的第一处变化没有发生,应先排查泄漏、索引、尺度、优化容差和随机性,不能用末端分数覆盖首错。
通过标准包含四层:能够准确解释定义与适用前提;能够在极小样本上手算公式或枚举状态;能够用固定种子复现算法一步;能够构造一个破坏前提的反例并指出停止位置。修复后清空派生特征、缓存、伪标签、模型状态和评价结果,从冻结原始样本完整重放。
3.1 基本形式
基本形式把样本写成带截距的特征向量。类别属性需要编码,连续属性需要检查量纲,交互项和基函数可在保持参数线性的同时表达曲线关系。
学习“3.1 基本形式”时先在“计算模型状态”冻结输入、样本身份、特征形状、随机状态和适用假设,再进入“核对目标与约束”只改变一个条件。至少保存目标值、关键中间量、更新前后状态和独立评价;若最终指标改善但机制预期的第一处变化没有发生,应先排查泄漏、索引、尺度、优化容差和随机性,不能用末端分数覆盖首错。
通过标准包含四层:能够准确解释定义与适用前提;能够在极小样本上手算公式或枚举状态;能够用固定种子复现算法一步;能够构造一个破坏前提的反例并指出停止位置。修复后清空派生特征、缓存、伪标签、模型状态和评价结果,从冻结原始样本完整重放。
3.2 线性回归
线性回归最小化平方误差。单变量可由均值、协方差推导,多变量通过矩阵求解;残差图用于检查非线性、异方差和异常点。
学习“3.2 线性回归”时先在“核对目标与约束”冻结输入、样本身份、特征形状、随机状态和适用假设,再进入“执行学习或推断”只改变一个条件。至少保存目标值、关键中间量、更新前后状态和独立评价;若最终指标改善但机制预期的第一处变化没有发生,应先排查泄漏、索引、尺度、优化容差和随机性,不能用末端分数覆盖首错。
通过标准包含四层:能够准确解释定义与适用前提;能够在极小样本上手算公式或枚举状态;能够用固定种子复现算法一步;能够构造一个破坏前提的反例并指出停止位置。修复后清空派生特征、缓存、伪标签、模型状态和评价结果,从冻结原始样本完整重放。
3.3 对数几率回归
对数几率回归对后验几率的对数做线性建模,使用极大似然学习。输出是概率但校准仍需验证,0.5阈值不适合所有代价结构。
学习“3.3 对数几率回归”时先在“执行学习或推断”冻结输入、样本身份、特征形状、随机状态和适用假设,再进入“独立评估泛化”只改变一个条件。至少保存目标值、关键中间量、更新前后状态和独立评价;若最终指标改善但机制预期的第一处变化没有发生,应先排查泄漏、索引、尺度、优化容差和随机性,不能用末端分数覆盖首错。
通过标准包含四层:能够准确解释定义与适用前提;能够在极小样本上手算公式或枚举状态;能够用固定种子复现算法一步;能够构造一个破坏前提的反例并指出停止位置。修复后清空派生特征、缓存、伪标签、模型状态和评价结果,从冻结原始样本完整重放。
3.4 线性判别分析
线性判别分析寻找使类内散度小、类间散度大的投影方向。协方差奇异时需要降维、收缩或正则,投影可视化不能替代独立分类评估。
学习“3.4 线性判别分析”时先在“独立评估泛化”冻结输入、样本身份、特征形状、随机状态和适用假设,再进入“定位首个分叉”只改变一个条件。至少保存目标值、关键中间量、更新前后状态和独立评价;若最终指标改善但机制预期的第一处变化没有发生,应先排查泄漏、索引、尺度、优化容差和随机性,不能用末端分数覆盖首错。
通过标准包含四层:能够准确解释定义与适用前提;能够在极小样本上手算公式或枚举状态;能够用固定种子复现算法一步;能够构造一个破坏前提的反例并指出停止位置。修复后清空派生特征、缓存、伪标签、模型状态和评价结果,从冻结原始样本完整重放。
3.5 多分类学习
多分类可用一对一、一对其余或纠错输出码拆分。拆分会改变训练分布和决策边界,编码长度、基学习器误差相关性与解码规则共同决定效果。
学习“3.5 多分类学习”时先在“定位首个分叉”冻结输入、样本身份、特征形状、随机状态和适用假设,再进入“冻结数据合同”只改变一个条件。至少保存目标值、关键中间量、更新前后状态和独立评价;若最终指标改善但机制预期的第一处变化没有发生,应先排查泄漏、索引、尺度、优化容差和随机性,不能用末端分数覆盖首错。
通过标准包含四层:能够准确解释定义与适用前提;能够在极小样本上手算公式或枚举状态;能够用固定种子复现算法一步;能够构造一个破坏前提的反例并指出停止位置。修复后清空派生特征、缓存、伪标签、模型状态和评价结果,从冻结原始样本完整重放。
3.6 类别不平衡问题
类别不平衡可通过重采样、阈值移动或代价敏感学习处理。重采样必须只在训练折内进行,评价应关注PR、召回和业务代价。
学习“3.6 类别不平衡问题”时先在“冻结数据合同”冻结输入、样本身份、特征形状、随机状态和适用假设,再进入“计算模型状态”只改变一个条件。至少保存目标值、关键中间量、更新前后状态和独立评价;若最终指标改善但机制预期的第一处变化没有发生,应先排查泄漏、索引、尺度、优化容差和随机性,不能用末端分数覆盖首错。
通过标准包含四层:能够准确解释定义与适用前提;能够在极小样本上手算公式或枚举状态;能够用固定种子复现算法一步;能够构造一个破坏前提的反例并指出停止位置。修复后清空派生特征、缓存、伪标签、模型状态和评价结果,从冻结原始样本完整重放。
3.7 阅读材料
阅读材料连接广义线性模型、判别分析与代价敏感决策。扩展方法仍需保持同一数据合同和比较预算。
学习“3.7 阅读材料”时先在“计算模型状态”冻结输入、样本身份、特征形状、随机状态和适用假设,再进入“核对目标与约束”只改变一个条件。至少保存目标值、关键中间量、更新前后状态和独立评价;若最终指标改善但机制预期的第一处变化没有发生,应先排查泄漏、索引、尺度、优化容差和随机性,不能用末端分数覆盖首错。
通过标准包含四层:能够准确解释定义与适用前提;能够在极小样本上手算公式或枚举状态;能够用固定种子复现算法一步;能够构造一个破坏前提的反例并指出停止位置。修复后清空派生特征、缓存、伪标签、模型状态和评价结果,从冻结原始样本完整重放。
常见失败与边界
本章回顾
从特征加权和出发,贯通最小二乘、对数几率、线性判别、多分类拆解与不平衡学习,并把系数解释限制在预处理和共线性条件内。 验收时从冻结数据预测中间状态、目标与更新,解释结构或分布条件为何改变答案,并在失败样本中指出第一处违背前提的位置。最终底线是:设计矩阵、截距、编码和缩放约定必须固定;分类阈值由验证集和代价确定;矩阵病态或类别先验改变时必须重新检查结论。