第4章 决策树
覆盖决策树流程、划分选择、剪枝、连续/缺失值与多变量树;用数据协议、单故障轨迹和模型验收门完成独立复核。
学习目标
- 能说明“第4章 决策树”如何覆盖决策树流程、划分选择、剪枝、连续/缺失值与多变量树,并把原版范围、技术核验和现代扩展分层
- 能先预测“怎样逐节点证明划分增益来自训练数据,并让停止、缺失处理与剪枝可重放?”的数据与模型路径,再用切分、状态、轨迹和独立评估复核
- 能注入“用测试集选择剪枝强度或连续切分点,树变小但独立评估已经泄漏”,用“候选属性、纯度准则、连续阈值、缺失分配、停止条件和剪枝集固定”决定接受、降级或拒绝实验结论
为什么从这个学习实验开始
决策树页保存每次分裂为何发生,而不是只展示一棵漂亮的终树。 “第4章 决策树”的贯穿任务是:在西瓜数据上逐层生长分类树,记录每个候选划分并对比预剪枝与后剪枝。 操作前先写下哪个数据角色、模型状态或评估结论会变化;运行后补理由不算预测。
本页围绕“怎样逐节点证明划分增益来自训练数据,并让停止、缺失处理与剪枝可重放?”建立基线、故障与恢复路径。只有“第4章 决策树”守住“候选属性、纯度准则、连续阈值、缺失分配、停止条件和剪枝集固定”并交付节点样本ID、候选阈值、纯度变化、分支覆盖、缺失权重、停止理由、剪枝前后风险和决策路径。,分数或图形才构成机器学习证据。
书目、128个原版层级与版本边界
“第4章 决策树”以清华大学出版社官方书页核对周志华著《机器学习》于2016年出版、425页、ISBN 9787302423287和全书16章的三部分结构,同时以作者官方书页确认这是一部16章、每章6至7节且持续公开勘误的入门教科书,再以作者官方目录PDF逐项核对16章、108个编号小节和附录A/B/C,因此本站覆盖分母计入16个章标题、108个编号小节、附录标题及A/B/C,共128个正式目录层级。
“第4章 决策树”未取得原书完整正文,只以作者与出版社目录限定范围;中文解释、交互、实验、练习与答案均为独立教学重写。本章保留单树的局部贪心与剪枝机制;随机森林属于第8章集成语境。
本页另以技术核对 1、技术核对 2、技术核对 3核对算法机制、评估协议或数学工具。外部资料能验证技术事实,不能反向证明原书正文采用了本站表述。
原版目录层级与学习机制
第4章 决策树
↡决策树对应原版目录坐标“第4章 决策树”,在“第4章 决策树”中用于按纯度变化递归划分并用独立角色控制复杂度,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 1/7。 在“第4章 决策树”的坐标1中,目录项「第4章 决策树」用于按纯度变化递归划分并用独立角色控制复杂度;先冻结数据角色,再以节点样本、候选阈值、增益、缺失权重与剪枝风险复核,出现用测试集选择分裂或剪枝时撤回结论。
4.1 基本流程
↡基本流程对应原版目录坐标“4·1 基本流程”,在“第4章 决策树”中用于按纯度变化递归划分并用独立角色控制复杂度,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 2/7。 目录项「4·1 基本流程」进入“第4章 决策树”后要回答第2个学习问题:它怎样按纯度变化递归划分并用独立角色控制复杂度、改变什么模型状态、由哪些节点样本、候选阈值、增益、缺失权重与剪枝风险证明,并如何排除用测试集选择分裂或剪枝。
4.2 划分选择
↡划分选择对应原版目录坐标“4·2 划分选择”,在“第4章 决策树”中用于按纯度变化递归划分并用独立角色控制复杂度,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 3/7。 围绕“怎样逐节点证明划分增益来自训练数据,并让停止、缺失处理与剪枝可重放?”,在“第4章 决策树”的原版层级3把「4·2 划分选择」落实为按纯度变化递归划分并用独立角色控制复杂度;复核者先读取节点样本、候选阈值、增益、缺失权重与剪枝风险,不能接受用测试集选择分裂或剪枝。
4.3 剪枝处理
↡剪枝处理对应原版目录坐标“4·3 剪枝处理”,在“第4章 决策树”中用于按纯度变化递归划分并用独立角色控制复杂度,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 4/7。 对“第4章 决策树”而言,目录项「4·3 剪枝处理」的最小实验合同是按纯度变化递归划分并用独立角色控制复杂度,第4次检查保存节点样本、候选阈值、增益、缺失权重与剪枝风险;若产生用测试集选择分裂或剪枝,就返回上游。
4.4 连续与缺失值
↡连续对应原版目录坐标“4·4 连续与缺失值”,在“第4章 决策树”中用于按纯度变化递归划分并用独立角色控制复杂度,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 5/7。 第5个正式坐标「4·4 连续与缺失值」服务于覆盖决策树流程、划分选择、剪枝、连续/缺失值与多变量树,需要以节点样本、候选阈值、增益、缺失权重与剪枝风险呈现按纯度变化递归划分并用独立角色控制复杂度;用测试集选择分裂或剪枝会破坏“候选属性、纯度准则、连续阈值、缺失分配、停止条件和剪枝集固定”。
4.5 多变量决策树
↡多变量决策树对应原版目录坐标“4·5 多变量决策树”,在“第4章 决策树”中用于按纯度变化递归划分并用独立角色控制复杂度,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 6/7。 在“第4章 决策树”的坐标6中,目录项「4·5 多变量决策树」用于按纯度变化递归划分并用独立角色控制复杂度;先冻结数据角色,再以节点样本、候选阈值、增益、缺失权重与剪枝风险复核,出现用测试集选择分裂或剪枝时撤回结论。
4.6 阅读材料
↡阅读材料对应原版目录坐标“4·6 阅读材料”,在“第4章 决策树”中用于把本章结论连接到可追溯的进阶路线与原始资料,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 7/7。 目录项「4·6 阅读材料」进入“第4章 决策树”后要回答第7个学习问题:它怎样把本章结论连接到可追溯的进阶路线与原始资料、改变什么模型状态、由哪些问题清单、前置假设、来源版本与可复现实验入口证明,并如何排除只堆链接而不说明验证对象。
先预测,再操作三个章专属实验
1. 数据角色与模型协议
固定“在西瓜数据上逐层生长分类树,记录每个候选划分并对比预剪枝与后剪枝。”,在基线与反例间切换,逐阶段查看“节点样本、候选划分、子节点生长、剪枝比较、路径解释”允许的输入、操作、输出和证据。
数据与模型协议
选择实验,再逐阶段检查信息边界
怎样逐节点证明划分增益来自训练数据,并让停止、缺失处理与剪枝可重放?
实验设置
在西瓜数据上逐层生长分类树,记录每个候选划分并对比预剪枝与后剪枝。 固定数据版本、实体切分、流水线、预算和随机种子。
预期结果
沿“节点样本 → 候选划分 → 子节点生长 → 剪枝比较 → 路径解释”得到可重放结论。
适用边界
全过程保持“候选属性、纯度准则、连续阈值、缺失分配、停止条件和剪枝集固定”。
允许输入
第4章 决策树:冻结版本、实体与样本角色,不得越过样本角色
本阶段操作
只读取任务允许的信息,并持续满足“候选属性、纯度准则、连续阈值、缺失分配、停止条件和剪枝集固定”
阶段输出
节点样本产生可追踪输入状态
复核证据
可追踪输入状态、索引和版本;出现“用测试集选择剪枝强度或连续切分点,树变小但独立评估已经泄漏”时拒绝推进
原版坐标:第4章 决策树、4.1 基本流程、4.2 划分选择、4.3 剪枝处理、4.4 连续与缺失值、4.5 多变量决策树、4.6 阅读材料
第4章 决策树的可重放研究协议
| 阶段 | 允许动作 | 必留证据 | 拒绝条件 |
|---|---|---|---|
| 节点样本 | 在“第4章 决策树”执行节点样本,只读取该角色允许的信息 | 任务、版本、实体与切分哈希 | 角色或来源不可追溯 |
| 候选划分 | 在“第4章 决策树”执行候选划分,只读取该角色允许的信息 | 表示、参数、轨迹、候选比较与选择理由 | 用测试集选择剪枝强度或连续切分点,树变小但独立评估已经泄漏 |
| 子节点生长 | 在“第4章 决策树”执行子节点生长,只读取该角色允许的信息 | 表示、参数、轨迹、候选比较与选择理由 | 用测试集选择剪枝强度或连续切分点,树变小但独立评估已经泄漏 |
| 剪枝比较 | 在“第4章 决策树”执行剪枝比较,只读取该角色允许的信息 | 表示、参数、轨迹、候选比较与选择理由 | 用测试集选择剪枝强度或连续切分点,树变小但独立评估已经泄漏 |
| 路径解释 | 在“第4章 决策树”执行路径解释,只读取该角色允许的信息 | 封存指标、错误样本、复现与边界 | 测试被复用或无法重放 |
unit: "mlw-04"
question: "怎样逐节点证明划分增益来自训练数据,并让停止、缺失处理与剪枝可重放?"
scenario: "在西瓜数据上逐层生长分类树,记录每个候选划分并对比预剪枝与后剪枝。"
stages: ["节点样本", "候选划分", "子节点生长", "剪枝比较", "路径解释"]
invariant: "候选属性、纯度准则、连续阈值、缺失分配、停止条件和剪枝集固定"
fault: "用测试集选择剪枝强度或连续切分点,树变小但独立评估已经泄漏"
evidence: "节点样本ID、候选阈值、纯度变化、分支覆盖、缺失权重、停止理由、剪枝前后风险和决策路径。"
reset: restore_experiment_stage_trace_mode_step_gates_and_artifact该协议要求“第4章 决策树”在相同任务、数据版本、实体切分、流水线、预算和种子下重放。重置后若实验、阶段、轨迹模式、步骤、验收门或复核包没有回到基线,交互状态已经污染比较。
本页回顾
掌握“第4章 决策树”不是背诵算法名,而是能围绕“怎样逐节点证明划分增益来自训练数据,并让停止、缺失处理与剪枝可重放?”重建数据与模型证据,并用“候选属性、纯度准则、连续阈值、缺失分配、停止条件和剪枝集固定”拒绝“用测试集选择剪枝强度或连续切分点,树变小但独立评估已经泄漏”。最终交付为节点样本ID、候选阈值、纯度变化、分支覆盖、缺失权重、停止理由、剪枝前后风险和决策路径。
练习与答案
练习
- 问题 1:实验合同。 “第4章 决策树”为什么必须先冻结任务、数据版本、实体切分、流水线、预算和种子?
- 问题 2:目录逐项覆盖。 怎样证明原版目录坐标已经进入机制、交互和练习?
- 问题 3:故障恢复。 怎样证明“用测试集选择剪枝强度或连续切分点,树变小但独立评估已经泄漏”已经被修正?
小结
- 决策树用树结构递归划分
- 信息增益与基尼指数选特征
- 剪枝防止过拟合
- 连续与缺失值要处理
- 可解释性是最大优点
名词解释
名词解释
本章出现的专业名词,用大白话再讲一遍。
- 决策树
检索键 ml-A 对应目录坐标「第4章 决策树」;在“第4章 决策树”中用于按纯度变化递归划分并用独立角色控制复杂度,需要连接原版范围、数据角色、模型状态与独立证据。
- 基本流程
检索键 ml-B 对应目录坐标「4·1 基本流程」;在“第4章 决策树”中用于按纯度变化递归划分并用独立角色控制复杂度,需要连接原版范围、数据角色、模型状态与独立证据。
- 划分选择
检索键 ml-C 对应目录坐标「4·2 划分选择」;在“第4章 决策树”中用于按纯度变化递归划分并用独立角色控制复杂度,需要连接原版范围、数据角色、模型状态与独立证据。
- 剪枝处理
检索键 ml-D 对应目录坐标「4·3 剪枝处理」;在“第4章 决策树”中用于按纯度变化递归划分并用独立角色控制复杂度,需要连接原版范围、数据角色、模型状态与独立证据。
- 连续
检索键 ml-E 对应目录坐标「4·4 连续与缺失值」;在“第4章 决策树”中用于按纯度变化递归划分并用独立角色控制复杂度,需要连接原版范围、数据角色、模型状态与独立证据。
- 多变量决策树
检索键 ml-F 对应目录坐标「4·5 多变量决策树」;在“第4章 决策树”中用于按纯度变化递归划分并用独立角色控制复杂度,需要连接原版范围、数据角色、模型状态与独立证据。
- 阅读材料
检索键 ml-G 对应目录坐标「4·6 阅读材料」;在“第4章 决策树”中用于把本章结论连接到可追溯的进阶路线与原始资料,需要连接原版范围、数据角色、模型状态与独立证据。