第2章 模型评估与选择
覆盖经验误差、过拟合、评估方法、性能度量、比较检验与偏差方差;用数据协议、单故障轨迹和模型验收门完成独立复核。
学习目标
- 能说明“第2章 模型评估与选择”如何覆盖经验误差、过拟合、评估方法、性能度量、比较检验与偏差方差,并把原版范围、技术核验和现代扩展分层
- 能先预测“怎样让模型选择只使用训练与验证信息,并把最终测试留给一次独立估计?”的数据与模型路径,再用切分、状态、轨迹和独立评估复核
- 能注入“反复查看测试集并据此调参,最后仍把同一测试分数当无偏泛化估计”,用“数据角色、重采样索引、度量方向、显著性方案和最终测试时机预先冻结”决定接受、降级或拒绝实验结论
为什么从这个学习实验开始
评估页把“分数更高”拆成抽样设计、度量语义和不确定性三类证据。 “第2章 模型评估与选择”的贯穿任务是:对三个分类器执行分层交叉验证,比较AUC与错误率,再锁定模型做一次测试。 操作前先写下哪个数据角色、模型状态或评估结论会变化;运行后补理由不算预测。
本页围绕“怎样让模型选择只使用训练与验证信息,并把最终测试留给一次独立估计?”建立基线、故障与恢复路径。只有“第2章 模型评估与选择”守住“数据角色、重采样索引、度量方向、显著性方案和最终测试时机预先冻结”并交付实体分组、随机种子、折索引、预处理拟合范围、混淆矩阵、ROC/PR数据、检验假设、选择记录和测试封存。,分数或图形才构成机器学习证据。
书目、128个原版层级与版本边界
“第2章 模型评估与选择”以清华大学出版社官方书页核对周志华著《机器学习》于2016年出版、425页、ISBN 9787302423287和全书16章的三部分结构,同时以作者官方书页确认这是一部16章、每章6至7节且持续公开勘误的入门教科书,再以作者官方目录PDF逐项核对16章、108个编号小节和附录A/B/C,因此本站覆盖分母计入16个章标题、108个编号小节、附录标题及A/B/C,共128个正式目录层级。
“第2章 模型评估与选择”未取得原书完整正文,只以作者与出版社目录限定范围;中文解释、交互、实验、练习与答案均为独立教学重写。原书统计比较流程保留其假设;现代自动调参也不能豁免独立测试边界。
本页另以技术核对 1、技术核对 2、技术核对 3核对算法机制、评估协议或数学工具。外部资料能验证技术事实,不能反向证明原书正文采用了本站表述。
原版目录层级与学习机制
第2章 模型评估与选择
↡模型评估对应原版目录坐标“第2章 模型评估与选择”,在“第2章 模型评估与选择”中用于把原版目录项转成有输入、状态变化和验收条件的学习合同,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 1/7。 在“第2章 模型评估与选择”的坐标1中,目录项「第2章 模型评估与选择」用于把原版目录项转成有输入、状态变化和验收条件的学习合同;先冻结数据角色,再以数据角色、模型状态、运行轨迹、指标与边界反例复核,出现只复述标题而没有实验或拒绝条件时撤回结论。
2.1 经验误差与过拟合
↡经验误差对应原版目录坐标“2·1 经验误差与过拟合”,在“第2章 模型评估与选择”中用于分离模型拟合、选择与泛化估计,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 2/7。 目录项「2·1 经验误差与过拟合」进入“第2章 模型评估与选择”后要回答第2个学习问题:它怎样分离模型拟合、选择与泛化估计、改变什么模型状态、由哪些切分索引、度量语义、重采样结果与不确定性证明,并如何排除测试复用或度量方向混淆。
2.2 评估方法
↡评估方法对应原版目录坐标“2·2 评估方法”,在“第2章 模型评估与选择”中用于分离模型拟合、选择与泛化估计,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 3/7。 围绕“怎样让模型选择只使用训练与验证信息,并把最终测试留给一次独立估计?”,在“第2章 模型评估与选择”的原版层级3把「2·2 评估方法」落实为分离模型拟合、选择与泛化估计;复核者先读取切分索引、度量语义、重采样结果与不确定性,不能接受测试复用或度量方向混淆。
2.3 性能度量
↡性能度量对应原版目录坐标“2·3 性能度量”,在“第2章 模型评估与选择”中用于分离模型拟合、选择与泛化估计,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 4/7。 对“第2章 模型评估与选择”而言,目录项「2·3 性能度量」的最小实验合同是分离模型拟合、选择与泛化估计,第4次检查保存切分索引、度量语义、重采样结果与不确定性;若产生测试复用或度量方向混淆,就返回上游。
2.4 比较检验
↡比较检验对应原版目录坐标“2·4 比较检验”,在“第2章 模型评估与选择”中用于分离模型拟合、选择与泛化估计,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 5/7。 第5个正式坐标「2·4 比较检验」服务于覆盖经验误差、过拟合、评估方法、性能度量、比较检验与偏差方差,需要以切分索引、度量语义、重采样结果与不确定性呈现分离模型拟合、选择与泛化估计;测试复用或度量方向混淆会破坏“数据角色、重采样索引、度量方向、显著性方案和最终测试时机预先冻结”。
2.5 偏差与方差
↡偏差对应原版目录坐标“2·5 偏差与方差”,在“第2章 模型评估与选择”中用于分离模型拟合、选择与泛化估计,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 6/7。 在“第2章 模型评估与选择”的坐标6中,目录项「2·5 偏差与方差」用于分离模型拟合、选择与泛化估计;先冻结数据角色,再以切分索引、度量语义、重采样结果与不确定性复核,出现测试复用或度量方向混淆时撤回结论。
2.6 阅读材料
↡阅读材料对应原版目录坐标“2·6 阅读材料”,在“第2章 模型评估与选择”中用于把本章结论连接到可追溯的进阶路线与原始资料,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 7/7。 目录项「2·6 阅读材料」进入“第2章 模型评估与选择”后要回答第7个学习问题:它怎样把本章结论连接到可追溯的进阶路线与原始资料、改变什么模型状态、由哪些问题清单、前置假设、来源版本与可复现实验入口证明,并如何排除只堆链接而不说明验证对象。
先预测,再操作三个章专属实验
1. 数据角色与模型协议
固定“对三个分类器执行分层交叉验证,比较AUC与错误率,再锁定模型做一次测试。”,在基线与反例间切换,逐阶段查看“角色切分、重采样计划、度量计算、统计比较、一次测试”允许的输入、操作、输出和证据。
数据与模型协议
选择实验,再逐阶段检查信息边界
怎样让模型选择只使用训练与验证信息,并把最终测试留给一次独立估计?
实验设置
对三个分类器执行分层交叉验证,比较AUC与错误率,再锁定模型做一次测试。 固定数据版本、实体切分、流水线、预算和随机种子。
预期结果
沿“角色切分 → 重采样计划 → 度量计算 → 统计比较 → 一次测试”得到可重放结论。
适用边界
全过程保持“数据角色、重采样索引、度量方向、显著性方案和最终测试时机预先冻结”。
允许输入
第2章 模型评估与选择:冻结版本、实体与样本角色,不得越过样本角色
本阶段操作
只读取任务允许的信息,并持续满足“数据角色、重采样索引、度量方向、显著性方案和最终测试时机预先冻结”
阶段输出
角色切分产生可追踪输入状态
复核证据
可追踪输入状态、索引和版本;出现“反复查看测试集并据此调参,最后仍把同一测试分数当无偏泛化估计”时拒绝推进
原版坐标:第2章 模型评估与选择、2.1 经验误差与过拟合、2.2 评估方法、2.3 性能度量、2.4 比较检验、2.5 偏差与方差、2.6 阅读材料
第2章 模型评估与选择的可重放研究协议
| 阶段 | 允许动作 | 必留证据 | 拒绝条件 |
|---|---|---|---|
| 角色切分 | 在“第2章 模型评估与选择”执行角色切分,只读取该角色允许的信息 | 任务、版本、实体与切分哈希 | 角色或来源不可追溯 |
| 重采样计划 | 在“第2章 模型评估与选择”执行重采样计划,只读取该角色允许的信息 | 表示、参数、轨迹、候选比较与选择理由 | 反复查看测试集并据此调参,最后仍把同一测试分数当无偏泛化估计 |
| 度量计算 | 在“第2章 模型评估与选择”执行度量计算,只读取该角色允许的信息 | 表示、参数、轨迹、候选比较与选择理由 | 反复查看测试集并据此调参,最后仍把同一测试分数当无偏泛化估计 |
| 统计比较 | 在“第2章 模型评估与选择”执行统计比较,只读取该角色允许的信息 | 表示、参数、轨迹、候选比较与选择理由 | 反复查看测试集并据此调参,最后仍把同一测试分数当无偏泛化估计 |
| 一次测试 | 在“第2章 模型评估与选择”执行一次测试,只读取该角色允许的信息 | 封存指标、错误样本、复现与边界 | 测试被复用或无法重放 |
unit: "mlw-02"
question: "怎样让模型选择只使用训练与验证信息,并把最终测试留给一次独立估计?"
scenario: "对三个分类器执行分层交叉验证,比较AUC与错误率,再锁定模型做一次测试。"
stages: ["角色切分", "重采样计划", "度量计算", "统计比较", "一次测试"]
invariant: "数据角色、重采样索引、度量方向、显著性方案和最终测试时机预先冻结"
fault: "反复查看测试集并据此调参,最后仍把同一测试分数当无偏泛化估计"
evidence: "实体分组、随机种子、折索引、预处理拟合范围、混淆矩阵、ROC/PR数据、检验假设、选择记录和测试封存。"
reset: restore_experiment_stage_trace_mode_step_gates_and_artifact该协议要求“第2章 模型评估与选择”在相同任务、数据版本、实体切分、流水线、预算和种子下重放。重置后若实验、阶段、轨迹模式、步骤、验收门或复核包没有回到基线,交互状态已经污染比较。
本页回顾
掌握“第2章 模型评估与选择”不是背诵算法名,而是能围绕“怎样让模型选择只使用训练与验证信息,并把最终测试留给一次独立估计?”重建数据与模型证据,并用“数据角色、重采样索引、度量方向、显著性方案和最终测试时机预先冻结”拒绝“反复查看测试集并据此调参,最后仍把同一测试分数当无偏泛化估计”。最终交付为实体分组、随机种子、折索引、预处理拟合范围、混淆矩阵、ROC/PR数据、检验假设、选择记录和测试封存。
练习与答案
练习
- 问题 1:实验合同。 “第2章 模型评估与选择”为什么必须先冻结任务、数据版本、实体切分、流水线、预算和种子?
- 问题 2:目录逐项覆盖。 怎样证明原版目录坐标已经进入机制、交互和练习?
- 问题 3:故障恢复。 怎样证明“反复查看测试集并据此调参,最后仍把同一测试分数当无偏泛化估计”已经被修正?
小结
- 评估方法决定结论可信度
- 留出、交叉验证与自助法
- 性能度量按任务选择
- 偏差方差分解误差来源
- 过拟合与欠拟合要识别
名词解释
名词解释
本章出现的专业名词,用大白话再讲一遍。
- 模型评估
检索键 ml-A 对应目录坐标「第2章 模型评估与选择」;在“第2章 模型评估与选择”中用于把原版目录项转成有输入、状态变化和验收条件的学习合同,需要连接原版范围、数据角色、模型状态与独立证据。
- 经验误差
检索键 ml-B 对应目录坐标「2·1 经验误差与过拟合」;在“第2章 模型评估与选择”中用于分离模型拟合、选择与泛化估计,需要连接原版范围、数据角色、模型状态与独立证据。
- 评估方法
检索键 ml-C 对应目录坐标「2·2 评估方法」;在“第2章 模型评估与选择”中用于分离模型拟合、选择与泛化估计,需要连接原版范围、数据角色、模型状态与独立证据。
- 性能度量
检索键 ml-D 对应目录坐标「2·3 性能度量」;在“第2章 模型评估与选择”中用于分离模型拟合、选择与泛化估计,需要连接原版范围、数据角色、模型状态与独立证据。
- 比较检验
检索键 ml-E 对应目录坐标「2·4 比较检验」;在“第2章 模型评估与选择”中用于分离模型拟合、选择与泛化估计,需要连接原版范围、数据角色、模型状态与独立证据。
- 偏差
检索键 ml-F 对应目录坐标「2·5 偏差与方差」;在“第2章 模型评估与选择”中用于分离模型拟合、选择与泛化估计,需要连接原版范围、数据角色、模型状态与独立证据。
- 阅读材料
检索键 ml-G 对应目录坐标「2·6 阅读材料」;在“第2章 模型评估与选择”中用于把本章结论连接到可追溯的进阶路线与原始资料,需要连接原版范围、数据角色、模型状态与独立证据。