第2章 模型评估与选择

第2章 模型评估与选择覆盖7个权威目录层级,以模型机制、数学推导、交互实验和失败对照重建核心知识。

为什么从问题合同开始

、、、、、共同构成本页的学习坐标。建立训练、验证、测试相互隔离的模型选择协议,用任务匹配的度量、统计检验和偏差-方差分解解释性能差异。

机器学习不是先选流行算法再寻找数据,而是先写清任务对象、可观测属性、目标变量或反馈、数据生成过程、允许使用的信息和错误代价。训练集用于估计模型,验证集用于选择结构与超参数,测试集只在所有决定冻结后评价一次。聚类、半监督和强化学习虽然反馈形式不同,也必须给出对应的独立证据,不能把训练目标本身当作泛化结论。

每次实验记录样本标识、折分策略、预处理拟合范围、特征顺序、随机种子、数值精度、依赖版本和停止规则。模型训练保存每步目标分解、关键状态与更新;模型选择保存所有候选而不是只留最好一次;失败样本与成功样本使用同一管线。这样才能区分概念假设错误、数据泄漏、数值错误、优化未收敛和抽样波动。

阅读时先预测:若只改变一个条件,第一处应该变化的是输入表示、模型状态、目标项、参数更新、预测分布还是评价轨迹?随后运行最小样本并在第一条不一致处停止。继续观察下游准确率通常只会增加噪声。任何修复都清空派生产物并从原始数据重放,防止错误状态污染后续结论。

数学骨架与可核查量

经验风险把冻结训练样本上的逐例损失聚合:

R^(f)=1mi=1m(f(xi),yi).\widehat R(f)=\frac{1}{m}\sum_{i=1}^{m}\ell\bigl(f(x_i),y_i\bigr).

结构约束或先验通过正则项进入训练目标:

J(θ)=R^(fθ)+λΩ(θ).\mathcal J(\theta)=\widehat R(f_\theta)+\lambda\Omega(\theta).

模型选择在验证数据上完成,测试风险不得参与选择:

λ^=argminλΛR^valid(fλ),R^test(fλ^) once.\hat\lambda=\arg\min_{\lambda\in\Lambda}\widehat R_{\mathrm{valid}}(f_\lambda),\qquad \widehat R_{\mathrm{test}}(f_{\hat\lambda})\text{ once}.

本页专属可核查关系为:

E(f;D)=bias2(x)+var(x)+ε2.E(f;D)=\operatorname{bias}^{2}(x)+\operatorname{var}(x)+\varepsilon^{2}.

期望泛化误差可分解为偏差、方差与不可约噪声,模型复杂度变化通常在前两项之间形成权衡。 实现时同时检查输入输出形状、有限值、约束残差、目标变化方向、概率归一或守恒关系,并用可枚举小样本或有限差分建立独立基线。

机制辨析

  1. 模型评估回答如何估计泛化性能,模型选择回答如何从候选中做决定。两者共享数据时必须隔离角色,否则选择过程会把验证信息逐渐拟合进去。
  2. 经验误差是在训练样本上的平均损失,泛化误差针对未知分布。过拟合表现为训练误差继续下降而验证风险上升,欠拟合则两者都高。
  3. 留出法要求分层且多次重复,交叉验证保存每折结果,留一法低偏差但计算昂贵,自助法适合小样本却改变训练集分布。时序和群组数据不能随机拆散。
  4. 错误率和精度适合代价对称任务;查准率、查全率与PR曲线关注正例;ROC和AUC考察排序;代价曲线显式纳入类别概率与误判成本。
  5. 比较检验区分同一模型的泛化断言与两个模型的相对断言。二项检验、t检验、交叉验证检验和McNemar检验各有样本独立性假设。
  6. 偏差度量算法期望预测与真实目标的偏离,方差度量训练集扰动造成的波动,噪声给出可达到性能下界。分解依赖损失形式,不能机械套用。
  7. 阅读材料补充多重比较、嵌套交叉验证和学习曲线。报告候选数量、搜索预算和停止规则,避免只公布最好一次运行。

本章机制必须与替代解释分开。例如训练风险下降可能来自容量增加、泄漏、更多计算或随机好运,而不一定来自目标机制;概率输出可能已归一却未校准;凸目标可全局求解却仍受错误特征和分布偏移影响。对照实验只改变一个因素,并让简单基线获得相同数据、调参机会和资源预算。

权威目录逐项讲解

第2章 模型评估与选择

模型评估回答如何估计泛化性能,模型选择回答如何从候选中做决定。两者共享数据时必须隔离角色,否则选择过程会把验证信息逐渐拟合进去。

学习“第2章 模型评估与选择”时先在“冻结数据合同”冻结输入、样本身份、特征形状、随机状态和适用假设,再进入“计算模型状态”只改变一个条件。至少保存目标值、关键中间量、更新前后状态和独立评价;若最终指标改善但机制预期的第一处变化没有发生,应先排查泄漏、索引、尺度、优化容差和随机性,不能用末端分数覆盖首错。

通过标准包含四层:能够准确解释定义与适用前提;能够在极小样本上手算公式或枚举状态;能够用固定种子复现算法一步;能够构造一个破坏前提的反例并指出停止位置。修复后清空派生特征、缓存、伪标签、模型状态和评价结果,从冻结原始样本完整重放。

2.1 经验误差与过拟合

经验误差是在训练样本上的平均损失,泛化误差针对未知分布。过拟合表现为训练误差继续下降而验证风险上升,欠拟合则两者都高。

学习“2.1 经验误差与过拟合”时先在“计算模型状态”冻结输入、样本身份、特征形状、随机状态和适用假设,再进入“核对目标与约束”只改变一个条件。至少保存目标值、关键中间量、更新前后状态和独立评价;若最终指标改善但机制预期的第一处变化没有发生,应先排查泄漏、索引、尺度、优化容差和随机性,不能用末端分数覆盖首错。

通过标准包含四层:能够准确解释定义与适用前提;能够在极小样本上手算公式或枚举状态;能够用固定种子复现算法一步;能够构造一个破坏前提的反例并指出停止位置。修复后清空派生特征、缓存、伪标签、模型状态和评价结果,从冻结原始样本完整重放。

2.2 评估方法

留出法要求分层且多次重复,交叉验证保存每折结果,留一法低偏差但计算昂贵,自助法适合小样本却改变训练集分布。时序和群组数据不能随机拆散。

学习“2.2 评估方法”时先在“核对目标与约束”冻结输入、样本身份、特征形状、随机状态和适用假设,再进入“执行学习或推断”只改变一个条件。至少保存目标值、关键中间量、更新前后状态和独立评价;若最终指标改善但机制预期的第一处变化没有发生,应先排查泄漏、索引、尺度、优化容差和随机性,不能用末端分数覆盖首错。

通过标准包含四层:能够准确解释定义与适用前提;能够在极小样本上手算公式或枚举状态;能够用固定种子复现算法一步;能够构造一个破坏前提的反例并指出停止位置。修复后清空派生特征、缓存、伪标签、模型状态和评价结果,从冻结原始样本完整重放。

2.3 性能度量

错误率和精度适合代价对称任务;查准率、查全率与PR曲线关注正例;ROC和AUC考察排序;代价曲线显式纳入类别概率与误判成本。

学习“2.3 性能度量”时先在“执行学习或推断”冻结输入、样本身份、特征形状、随机状态和适用假设,再进入“独立评估泛化”只改变一个条件。至少保存目标值、关键中间量、更新前后状态和独立评价;若最终指标改善但机制预期的第一处变化没有发生,应先排查泄漏、索引、尺度、优化容差和随机性,不能用末端分数覆盖首错。

通过标准包含四层:能够准确解释定义与适用前提;能够在极小样本上手算公式或枚举状态;能够用固定种子复现算法一步;能够构造一个破坏前提的反例并指出停止位置。修复后清空派生特征、缓存、伪标签、模型状态和评价结果,从冻结原始样本完整重放。

2.4 比较检验

比较检验区分同一模型的泛化断言与两个模型的相对断言。二项检验、t检验、交叉验证检验和McNemar检验各有样本独立性假设。

学习“2.4 比较检验”时先在“独立评估泛化”冻结输入、样本身份、特征形状、随机状态和适用假设,再进入“定位首个分叉”只改变一个条件。至少保存目标值、关键中间量、更新前后状态和独立评价;若最终指标改善但机制预期的第一处变化没有发生,应先排查泄漏、索引、尺度、优化容差和随机性,不能用末端分数覆盖首错。

通过标准包含四层:能够准确解释定义与适用前提;能够在极小样本上手算公式或枚举状态;能够用固定种子复现算法一步;能够构造一个破坏前提的反例并指出停止位置。修复后清空派生特征、缓存、伪标签、模型状态和评价结果,从冻结原始样本完整重放。

2.5 偏差与方差

偏差度量算法期望预测与真实目标的偏离,方差度量训练集扰动造成的波动,噪声给出可达到性能下界。分解依赖损失形式,不能机械套用。

学习“2.5 偏差与方差”时先在“定位首个分叉”冻结输入、样本身份、特征形状、随机状态和适用假设,再进入“冻结数据合同”只改变一个条件。至少保存目标值、关键中间量、更新前后状态和独立评价;若最终指标改善但机制预期的第一处变化没有发生,应先排查泄漏、索引、尺度、优化容差和随机性,不能用末端分数覆盖首错。

通过标准包含四层:能够准确解释定义与适用前提;能够在极小样本上手算公式或枚举状态;能够用固定种子复现算法一步;能够构造一个破坏前提的反例并指出停止位置。修复后清空派生特征、缓存、伪标签、模型状态和评价结果,从冻结原始样本完整重放。

2.6 阅读材料

阅读材料补充多重比较、嵌套交叉验证和学习曲线。报告候选数量、搜索预算和停止规则,避免只公布最好一次运行。

学习“2.6 阅读材料”时先在“冻结数据合同”冻结输入、样本身份、特征形状、随机状态和适用假设,再进入“计算模型状态”只改变一个条件。至少保存目标值、关键中间量、更新前后状态和独立评价;若最终指标改善但机制预期的第一处变化没有发生,应先排查泄漏、索引、尺度、优化容差和随机性,不能用末端分数覆盖首错。

通过标准包含四层:能够准确解释定义与适用前提;能够在极小样本上手算公式或枚举状态;能够用固定种子复现算法一步;能够构造一个破坏前提的反例并指出停止位置。修复后清空派生特征、缓存、伪标签、模型状态和评价结果,从冻结原始样本完整重放。

常见失败与边界

本章回顾

建立训练、验证、测试相互隔离的模型选择协议,用任务匹配的度量、统计检验和偏差-方差分解解释性能差异。 验收时从冻结数据预测中间状态、目标与更新,解释结构或分布条件为何改变答案,并在失败样本中指出第一处违背前提的位置。最终底线是:测试集只能在模型与超参数冻结后使用;分层、成组或时序结构必须进入折分;点估计没有区间和配对证据时不能宣称优胜。

讨论

评论区加载中…