第4章 决策树

覆盖决策树流程、划分选择、剪枝、连续/缺失值与多变量树;用数据协议、单故障轨迹和模型验收门完成独立复核。

学习目标

  • 能说明“第4章 决策树”如何覆盖决策树流程、划分选择、剪枝、连续/缺失值与多变量树,并把原版范围、技术核验和现代扩展分层
  • 能先预测“怎样逐节点证明划分增益来自训练数据,并让停止、缺失处理与剪枝可重放?”的数据与模型路径,再用切分、状态、轨迹和独立评估复核
  • 能注入“用测试集选择剪枝强度或连续切分点,树变小但独立评估已经泄漏”,用“候选属性、纯度准则、连续阈值、缺失分配、停止条件和剪枝集固定”决定接受、降级或拒绝实验结论

为什么从这个学习实验开始

决策树页保存每次分裂为何发生,而不是只展示一棵漂亮的终树。 “第4章 决策树”的贯穿任务是:在西瓜数据上逐层生长分类树,记录每个候选划分并对比预剪枝与后剪枝。 操作前先写下哪个数据角色、模型状态或评估结论会变化;运行后补理由不算预测。

本页围绕“怎样逐节点证明划分增益来自训练数据,并让停止、缺失处理与剪枝可重放?”建立基线、故障与恢复路径。只有“第4章 决策树”守住“候选属性、纯度准则、连续阈值、缺失分配、停止条件和剪枝集固定”并交付节点样本ID、候选阈值、纯度变化、分支覆盖、缺失权重、停止理由、剪枝前后风险和决策路径。,分数或图形才构成机器学习证据。

书目、128个原版层级与版本边界

“第4章 决策树”以清华大学出版社官方书页核对周志华著《机器学习》于2016年出版、425页、ISBN 9787302423287和全书16章的三部分结构,同时以作者官方书页确认这是一部16章、每章6至7节且持续公开勘误的入门教科书,再以作者官方目录PDF逐项核对16章、108个编号小节和附录A/B/C,因此本站覆盖分母计入16个章标题、108个编号小节、附录标题及A/B/C,共128个正式目录层级。

“第4章 决策树”未取得原书完整正文,只以作者与出版社目录限定范围;中文解释、交互、实验、练习与答案均为独立教学重写。本章保留单树的局部贪心与剪枝机制;随机森林属于第8章集成语境。

本页另以技术核对 1技术核对 2技术核对 3核对算法机制、评估协议或数学工具。外部资料能验证技术事实,不能反向证明原书正文采用了本站表述。

原版目录层级与学习机制

第4章 决策树

原版坐标 1/7。 在“第4章 决策树”的坐标1中,目录项「第4章 决策树」用于按纯度变化递归划分并用独立角色控制复杂度;先冻结数据角色,再以节点样本、候选阈值、增益、缺失权重与剪枝风险复核,出现用测试集选择分裂或剪枝时撤回结论。

4.1 基本流程

原版坐标 2/7。 目录项「4·1 基本流程」进入“第4章 决策树”后要回答第2个学习问题:它怎样按纯度变化递归划分并用独立角色控制复杂度、改变什么模型状态、由哪些节点样本、候选阈值、增益、缺失权重与剪枝风险证明,并如何排除用测试集选择分裂或剪枝。

4.2 划分选择

原版坐标 3/7。 围绕“怎样逐节点证明划分增益来自训练数据,并让停止、缺失处理与剪枝可重放?”,在“第4章 决策树”的原版层级3把「4·2 划分选择」落实为按纯度变化递归划分并用独立角色控制复杂度;复核者先读取节点样本、候选阈值、增益、缺失权重与剪枝风险,不能接受用测试集选择分裂或剪枝。

4.3 剪枝处理

原版坐标 4/7。 对“第4章 决策树”而言,目录项「4·3 剪枝处理」的最小实验合同是按纯度变化递归划分并用独立角色控制复杂度,第4次检查保存节点样本、候选阈值、增益、缺失权重与剪枝风险;若产生用测试集选择分裂或剪枝,就返回上游。

4.4 连续与缺失值

原版坐标 5/7。 第5个正式坐标「4·4 连续与缺失值」服务于覆盖决策树流程、划分选择、剪枝、连续/缺失值与多变量树,需要以节点样本、候选阈值、增益、缺失权重与剪枝风险呈现按纯度变化递归划分并用独立角色控制复杂度;用测试集选择分裂或剪枝会破坏“候选属性、纯度准则、连续阈值、缺失分配、停止条件和剪枝集固定”。

4.5 多变量决策树

原版坐标 6/7。 在“第4章 决策树”的坐标6中,目录项「4·5 多变量决策树」用于按纯度变化递归划分并用独立角色控制复杂度;先冻结数据角色,再以节点样本、候选阈值、增益、缺失权重与剪枝风险复核,出现用测试集选择分裂或剪枝时撤回结论。

4.6 阅读材料

原版坐标 7/7。 目录项「4·6 阅读材料」进入“第4章 决策树”后要回答第7个学习问题:它怎样把本章结论连接到可追溯的进阶路线与原始资料、改变什么模型状态、由哪些问题清单、前置假设、来源版本与可复现实验入口证明,并如何排除只堆链接而不说明验证对象。

先预测,再操作三个章专属实验

分步1 / 3

1. 数据角色与模型协议

固定“在西瓜数据上逐层生长分类树,记录每个候选划分并对比预剪枝与后剪枝。”,在基线与反例间切换,逐阶段查看“节点样本、候选划分、子节点生长、剪枝比较、路径解释”允许的输入、操作、输出和证据。

数据与模型协议

选择实验,再逐阶段检查信息边界

怎样逐节点证明划分增益来自训练数据,并让停止、缺失处理与剪枝可重放?

实验设置

在西瓜数据上逐层生长分类树,记录每个候选划分并对比预剪枝与后剪枝。 固定数据版本、实体切分、流水线、预算和随机种子。

预期结果

沿“节点样本 → 候选划分 → 子节点生长 → 剪枝比较 → 路径解释”得到可重放结论。

适用边界

全过程保持“候选属性、纯度准则、连续阈值、缺失分配、停止条件和剪枝集固定”。

允许输入

第4章 决策树:冻结版本、实体与样本角色,不得越过样本角色

本阶段操作

只读取任务允许的信息,并持续满足“候选属性、纯度准则、连续阈值、缺失分配、停止条件和剪枝集固定”

阶段输出

节点样本产生可追踪输入状态

复核证据

可追踪输入状态、索引和版本;出现“用测试集选择剪枝强度或连续切分点,树变小但独立评估已经泄漏”时拒绝推进

原版坐标:第4章 决策树、4.1 基本流程、4.2 划分选择、4.3 剪枝处理、4.4 连续与缺失值、4.5 多变量决策树、4.6 阅读材料

第4章 决策树的可重放研究协议

阶段允许动作必留证据拒绝条件
节点样本在“第4章 决策树”执行节点样本,只读取该角色允许的信息任务、版本、实体与切分哈希角色或来源不可追溯
候选划分在“第4章 决策树”执行候选划分,只读取该角色允许的信息表示、参数、轨迹、候选比较与选择理由用测试集选择剪枝强度或连续切分点,树变小但独立评估已经泄漏
子节点生长在“第4章 决策树”执行子节点生长,只读取该角色允许的信息表示、参数、轨迹、候选比较与选择理由用测试集选择剪枝强度或连续切分点,树变小但独立评估已经泄漏
剪枝比较在“第4章 决策树”执行剪枝比较,只读取该角色允许的信息表示、参数、轨迹、候选比较与选择理由用测试集选择剪枝强度或连续切分点,树变小但独立评估已经泄漏
路径解释在“第4章 决策树”执行路径解释,只读取该角色允许的信息封存指标、错误样本、复现与边界测试被复用或无法重放
unit: "mlw-04"
question: "怎样逐节点证明划分增益来自训练数据,并让停止、缺失处理与剪枝可重放?"
scenario: "在西瓜数据上逐层生长分类树,记录每个候选划分并对比预剪枝与后剪枝。"
stages: ["节点样本", "候选划分", "子节点生长", "剪枝比较", "路径解释"]
invariant: "候选属性、纯度准则、连续阈值、缺失分配、停止条件和剪枝集固定"
fault: "用测试集选择剪枝强度或连续切分点,树变小但独立评估已经泄漏"
evidence: "节点样本ID、候选阈值、纯度变化、分支覆盖、缺失权重、停止理由、剪枝前后风险和决策路径。"
reset: restore_experiment_stage_trace_mode_step_gates_and_artifact

该协议要求“第4章 决策树”在相同任务、数据版本、实体切分、流水线、预算和种子下重放。重置后若实验、阶段、轨迹模式、步骤、验收门或复核包没有回到基线,交互状态已经污染比较。

本页回顾

掌握“第4章 决策树”不是背诵算法名,而是能围绕“怎样逐节点证明划分增益来自训练数据,并让停止、缺失处理与剪枝可重放?”重建数据与模型证据,并用“候选属性、纯度准则、连续阈值、缺失分配、停止条件和剪枝集固定”拒绝“用测试集选择剪枝强度或连续切分点,树变小但独立评估已经泄漏”。最终交付为节点样本ID、候选阈值、纯度变化、分支覆盖、缺失权重、停止理由、剪枝前后风险和决策路径。

练习与答案

练习

  1. 问题 1:实验合同。 “第4章 决策树”为什么必须先冻结任务、数据版本、实体切分、流水线、预算和种子?
  1. 问题 2:目录逐项覆盖。 怎样证明原版目录坐标已经进入机制、交互和练习?
  1. 问题 3:故障恢复。 怎样证明“用测试集选择剪枝强度或连续切分点,树变小但独立评估已经泄漏”已经被修正?

小结

  • 决策树用树结构递归划分
  • 信息增益与基尼指数选特征
  • 剪枝防止过拟合
  • 连续与缺失值要处理
  • 可解释性是最大优点

名词解释

名词解释

本章出现的专业名词,用大白话再讲一遍。

决策树

检索键 ml-A 对应目录坐标「第4章 决策树」;在“第4章 决策树”中用于按纯度变化递归划分并用独立角色控制复杂度,需要连接原版范围、数据角色、模型状态与独立证据。

基本流程

检索键 ml-B 对应目录坐标「4·1 基本流程」;在“第4章 决策树”中用于按纯度变化递归划分并用独立角色控制复杂度,需要连接原版范围、数据角色、模型状态与独立证据。

划分选择

检索键 ml-C 对应目录坐标「4·2 划分选择」;在“第4章 决策树”中用于按纯度变化递归划分并用独立角色控制复杂度,需要连接原版范围、数据角色、模型状态与独立证据。

剪枝处理

检索键 ml-D 对应目录坐标「4·3 剪枝处理」;在“第4章 决策树”中用于按纯度变化递归划分并用独立角色控制复杂度,需要连接原版范围、数据角色、模型状态与独立证据。

连续

检索键 ml-E 对应目录坐标「4·4 连续与缺失值」;在“第4章 决策树”中用于按纯度变化递归划分并用独立角色控制复杂度,需要连接原版范围、数据角色、模型状态与独立证据。

多变量决策树

检索键 ml-F 对应目录坐标「4·5 多变量决策树」;在“第4章 决策树”中用于按纯度变化递归划分并用独立角色控制复杂度,需要连接原版范围、数据角色、模型状态与独立证据。

阅读材料

检索键 ml-G 对应目录坐标「4·6 阅读材料」;在“第4章 决策树”中用于把本章结论连接到可追溯的进阶路线与原始资料,需要连接原版范围、数据角色、模型状态与独立证据。

资料与写作方式声明

本章以周志华著《机器学习》权威目录界定学习范围,并结合正文列出的技术资料独立重写;不宣称复现原书正文,也不沿用原作表述。

原作版权归作者与出版社所有;本站原创教学结构与表述仅供学习交流。

讨论

评论区加载中…