第5章 决策树
覆盖特征选择、树生成、剪枝、CART与分类回归树;用推导路径、单故障数值轨迹和结论验收门完成独立复核。
学习目标
- 能说明“第5章 决策树”如何覆盖特征选择、树生成、剪枝、CART与分类回归树,并区分原版范围、独立核验和后续扩展
- 能先预测“怎样逐节点核对信息增益或基尼下降,并用独立角色决定剪枝?”的定义与数值路径,再用已知量、变换、残差和反例逐步复核
- 能注入“在测试集上挑选特征阈值或剪枝子树,使最终风险失去独立性”,用“候选特征、离散化、划分准则、停止条件、剪枝集与代价参数固定”决定接受、降级或拒绝方法结论
为什么从这个方法推演开始
决策树页保存每次分裂和剪枝的局部证据,不只保存终树。 “第5章 决策树”的贯穿任务是:对同一训练集构建ID3、C4.5与CART候选,并保存剪枝序列。 动手前先写下哪个定义、矩阵、分布、目标或迭代状态会变化;运行后补理由不算预测。
本页围绕“怎样逐节点核对信息增益或基尼下降,并用独立角色决定剪枝?”建立参考、故障与恢复路径。只有“第5章 决策树”守住“候选特征、离散化、划分准则、停止条件、剪枝集与代价参数固定”并交付节点ID、候选划分、熵/基尼、阈值、子树、训练与验证风险、剪枝参数和决策路径。,公式、图形或指标才构成统计学习证据。
书目、285个原版层级与版本边界
“第5章 决策树”以清华大学出版社官方书页核对李航著《统计学习方法(第2版)》于2019年出版、ISBN 9787302517276和监督/无监督两篇结构,同时以出版社英文版权页确认484页及两篇主要内容,再以出版社公开完整目录逐项核对两篇、22章、256个编号节/小节和附录A-E,因此本站覆盖分母共285个正式目录层级。
“第5章 决策树”未取得原书完整正文授权,只以出版社完整目录限定范围;中文解释、推导、数值实验、交互、练习与答案均为独立教学重写。“第5章 决策树”按2019年第2版范围解释;当前库函数和后续研究只作独立核验,不反写原版。
本页另以技术核对 1、技术核对 2、技术核对 3核对算法原始定义、实现语义或数值工具。外部资料能验证技术事实,不能反向证明原书正文采用了本站表述。
原版目录层级与方法机制
第5章 决策树
↡决策树对应原版目录坐标“第5章 决策树”,在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,并受定义域、形状、目标、算法状态与版本边界约束。原版坐标 1/17。 在“第5章 决策树”的坐标1中,目录项「第5章 决策树」用于按纯度变化生成子树并以独立风险剪枝;先冻结符号与形状,再以节点样本、候选划分、熵/基尼、阈值、子树与剪枝序列复核,出现测试集选择分裂或子树时撤回结论。
5.1 决策树模型与学习
↡决策树模型对应原版目录坐标“5·1 决策树模型与学习”,在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,并受定义域、形状、目标、算法状态与版本边界约束。原版坐标 2/17。 目录项「5·1 决策树模型与学习」进入“第5章 决策树”后要回答第2个方法问题:它怎样按纯度变化生成子树并以独立风险剪枝、改变什么数值状态、由哪些节点样本、候选划分、熵/基尼、阈值、子树与剪枝序列证明,并如何排除测试集选择分裂或子树。
5.1.1 决策树模型
↡决策树模型对应原版目录坐标“5·1·1 决策树模型”,在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,并受定义域、形状、目标、算法状态与版本边界约束。原版坐标 3/17。 围绕“怎样逐节点核对信息增益或基尼下降,并用独立角色决定剪枝?”,在“第5章 决策树”的原版层级3把「5·1·1 决策树模型」落实为按纯度变化生成子树并以独立风险剪枝;复核者先读取节点样本、候选划分、熵/基尼、阈值、子树与剪枝序列,不能接受测试集选择分裂或子树。
5.1.2 决策树与 if-then规则
↡决策树对应原版目录坐标“5·1·2 决策树与 if-then规则”,在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,并受定义域、形状、目标、算法状态与版本边界约束。原版坐标 4/17。 对“第5章 决策树”而言,目录项「5·1·2 决策树与 if-then规则」的最小推演合同是按纯度变化生成子树并以独立风险剪枝,第4次检查保存节点样本、候选划分、熵/基尼、阈值、子树与剪枝序列;若产生测试集选择分裂或子树,就返回上一步。
5.1.3 决策树与条件概率分布
↡决策树对应原版目录坐标“5·1·3 决策树与条件概率分布”,在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,并受定义域、形状、目标、算法状态与版本边界约束。原版坐标 5/17。 第5个正式坐标「5·1·3 决策树与条件概率分布」服务于覆盖特征选择、树生成、剪枝、CART与分类回归树,需要以节点样本、候选划分、熵/基尼、阈值、子树与剪枝序列呈现按纯度变化生成子树并以独立风险剪枝;测试集选择分裂或子树会破坏“候选特征、离散化、划分准则、停止条件、剪枝集与代价参数固定”。
5.1.4 决策树学习
↡决策树学习对应原版目录坐标“5·1·4 决策树学习”,在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,并受定义域、形状、目标、算法状态与版本边界约束。原版坐标 6/17。 在“第5章 决策树”的坐标6中,目录项「5·1·4 决策树学习」用于按纯度变化生成子树并以独立风险剪枝;先冻结符号与形状,再以节点样本、候选划分、熵/基尼、阈值、子树与剪枝序列复核,出现测试集选择分裂或子树时撤回结论。
5.2 特征选择
↡特征选择对应原版目录坐标“5·2 特征选择”,在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,并受定义域、形状、目标、算法状态与版本边界约束。原版坐标 7/17。 目录项「5·2 特征选择」进入“第5章 决策树”后要回答第7个方法问题:它怎样按纯度变化生成子树并以独立风险剪枝、改变什么数值状态、由哪些节点样本、候选划分、熵/基尼、阈值、子树与剪枝序列证明,并如何排除测试集选择分裂或子树。
5.2.1 特征选择问题
↡特征选择问题对应原版目录坐标“5·2·1 特征选择问题”,在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,并受定义域、形状、目标、算法状态与版本边界约束。原版坐标 8/17。 围绕“怎样逐节点核对信息增益或基尼下降,并用独立角色决定剪枝?”,在“第5章 决策树”的原版层级8把「5·2·1 特征选择问题」落实为按纯度变化生成子树并以独立风险剪枝;复核者先读取节点样本、候选划分、熵/基尼、阈值、子树与剪枝序列,不能接受测试集选择分裂或子树。
5.2.2 信息增益
↡信息增益对应原版目录坐标“5·2·2 信息增益”,在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,并受定义域、形状、目标、算法状态与版本边界约束。原版坐标 9/17。 对“第5章 决策树”而言,目录项「5·2·2 信息增益」的最小推演合同是按纯度变化生成子树并以独立风险剪枝,第9次检查保存节点样本、候选划分、熵/基尼、阈值、子树与剪枝序列;若产生测试集选择分裂或子树,就返回上一步。
5.2.3 信息增益比
↡信息增益比对应原版目录坐标“5·2·3 信息增益比”,在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,并受定义域、形状、目标、算法状态与版本边界约束。原版坐标 10/17。 第10个正式坐标「5·2·3 信息增益比」服务于覆盖特征选择、树生成、剪枝、CART与分类回归树,需要以节点样本、候选划分、熵/基尼、阈值、子树与剪枝序列呈现按纯度变化生成子树并以独立风险剪枝;测试集选择分裂或子树会破坏“候选特征、离散化、划分准则、停止条件、剪枝集与代价参数固定”。
5.3 决策树的生成
↡决策树的生成对应原版目录坐标“5·3 决策树的生成”,在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,并受定义域、形状、目标、算法状态与版本边界约束。原版坐标 11/17。 在“第5章 决策树”的坐标11中,目录项「5·3 决策树的生成」用于按纯度变化生成子树并以独立风险剪枝;先冻结符号与形状,再以节点样本、候选划分、熵/基尼、阈值、子树与剪枝序列复核,出现测试集选择分裂或子树时撤回结论。
5.3.1 ID3算法
↡ID3算法对应原版目录坐标“5·3·1 ID3算法”,在“第5章 决策树”中用于把目录坐标转为有定义、推导、计算和验收的统计学习合同,并受定义域、形状、目标、算法状态与版本边界约束。原版坐标 12/17。 目录项「5·3·1 ID3算法」进入“第5章 决策树”后要回答第12个方法问题:它怎样把目录坐标转为有定义、推导、计算和验收的统计学习合同、改变什么数值状态、由哪些变量、假设、目标、更新、数值残差、评估和边界反例证明,并如何排除只复述结论或公式名称。
5.3.2 C4.5的生成算法
↡C4.5的生成算法对应原版目录坐标“5·3·2 C4·5的生成算法”,在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,并受定义域、形状、目标、算法状态与版本边界约束。原版坐标 13/17。 围绕“怎样逐节点核对信息增益或基尼下降,并用独立角色决定剪枝?”,在“第5章 决策树”的原版层级13把「5·3·2 C4·5的生成算法」落实为按纯度变化生成子树并以独立风险剪枝;复核者先读取节点样本、候选划分、熵/基尼、阈值、子树与剪枝序列,不能接受测试集选择分裂或子树。
5.4 决策树的剪枝
↡决策树的剪枝对应原版目录坐标“5·4 决策树的剪枝”,在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,并受定义域、形状、目标、算法状态与版本边界约束。原版坐标 14/17。 对“第5章 决策树”而言,目录项「5·4 决策树的剪枝」的最小推演合同是按纯度变化生成子树并以独立风险剪枝,第14次检查保存节点样本、候选划分、熵/基尼、阈值、子树与剪枝序列;若产生测试集选择分裂或子树,就返回上一步。
5.5 CART算法
↡CART算法对应原版目录坐标“5·5 CART算法”,在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,并受定义域、形状、目标、算法状态与版本边界约束。原版坐标 15/17。 第15个正式坐标「5·5 CART算法」服务于覆盖特征选择、树生成、剪枝、CART与分类回归树,需要以节点样本、候选划分、熵/基尼、阈值、子树与剪枝序列呈现按纯度变化生成子树并以独立风险剪枝;测试集选择分裂或子树会破坏“候选特征、离散化、划分准则、停止条件、剪枝集与代价参数固定”。
5.5.1 CART生成
↡CART生成对应原版目录坐标“5·5·1 CART生成”,在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,并受定义域、形状、目标、算法状态与版本边界约束。原版坐标 16/17。 在“第5章 决策树”的坐标16中,目录项「5·5·1 CART生成」用于按纯度变化生成子树并以独立风险剪枝;先冻结符号与形状,再以节点样本、候选划分、熵/基尼、阈值、子树与剪枝序列复核,出现测试集选择分裂或子树时撤回结论。
5.5.2 CART剪枝
↡CART剪枝对应原版目录坐标“5·5·2 CART剪枝”,在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,并受定义域、形状、目标、算法状态与版本边界约束。原版坐标 17/17。 目录项「5·5·2 CART剪枝」进入“第5章 决策树”后要回答第17个方法问题:它怎样按纯度变化生成子树并以独立风险剪枝、改变什么数值状态、由哪些节点样本、候选划分、熵/基尼、阈值、子树与剪枝序列证明,并如何排除测试集选择分裂或子树。
先预测,再操作三个章专属实验
1. 定义、推导与变换路径
固定“对同一训练集构建ID3、C4.5与CART候选,并保存剪枝序列。”,在参考与反例间切换,逐阶段查看“节点样本、划分统计、子树生成、剪枝序列、路径验收”的已知量、变换、结果和数值检查。
推导路径
选择案例,逐步核对已知量与变换
怎样逐节点核对信息增益或基尼下降,并用独立角色决定剪枝?
问题设置
对同一训练集构建ID3、C4.5与CART候选,并保存剪枝序列。 固定符号、数据、初值、顺序、容差和种子。
事前预测
沿“节点样本 → 划分统计 → 子树生成 → 剪枝序列 → 路径验收”得到可复核结果。
适用边界
全过程必须满足“候选特征、离散化、划分准则、停止条件、剪枝集与代价参数固定”。
已知量
第5章 决策树:声明对象、符号与适用域,冻结数据、形状和版本
变换或更新
只读取本步允许的已知量,并持续满足“候选特征、离散化、划分准则、停止条件、剪枝集与代价参数固定”
阶段结果
节点样本产生形式化问题状态
数值与逻辑检查
形式化问题状态、索引和数值断言;出现“在测试集上挑选特征阈值或剪枝子树,使最终风险失去独立性”时停止
原版坐标:第5章 决策树、5.1 决策树模型与学习、5.1.1 决策树模型、5.1.2 决策树与 if-then规则、5.1.3 决策树与条件概率分布、5.1.4 决策树学习、5.2 特征选择、5.2.1 特征选择问题、5.2.2 信息增益、5.2.3 信息增益比、5.3 决策树的生成、5.3.1 ID3算法、5.3.2 C4.5的生成算法、5.4 决策树的剪枝、5.5 CART算法、5.5.1 CART生成、5.5.2 CART剪枝
第5章 决策树的可重放方法协议
| 阶段 | 允许动作 | 必留证据 | 拒绝条件 |
|---|---|---|---|
| 节点样本 | 在“第5章 决策树”执行节点样本,只改变声明的数学或数值状态 | 符号、定义域、形状、数据与版本 | 对象或形状不可追溯 |
| 划分统计 | 在“第5章 决策树”执行划分统计,只改变声明的数学或数值状态 | 模型、目标、约束、参数/隐变量与迭代轨迹 | 在测试集上挑选特征阈值或剪枝子树,使最终风险失去独立性 |
| 子树生成 | 在“第5章 决策树”执行子树生成,只改变声明的数学或数值状态 | 模型、目标、约束、参数/隐变量与迭代轨迹 | 在测试集上挑选特征阈值或剪枝子树,使最终风险失去独立性 |
| 剪枝序列 | 在“第5章 决策树”执行剪枝序列,只改变声明的数学或数值状态 | 模型、目标、约束、参数/隐变量与迭代轨迹 | 在测试集上挑选特征阈值或剪枝子树,使最终风险失去独立性 |
| 路径验收 | 在“第5章 决策树”执行路径验收,只改变声明的数学或数值状态 | 残差、诊断、反例、适用边界与复现 | 无法重放或缺少诊断 |
unit: "slm-05"
question: "怎样逐节点核对信息增益或基尼下降,并用独立角色决定剪枝?"
scenario: "对同一训练集构建ID3、C4.5与CART候选,并保存剪枝序列。"
stages: ["节点样本", "划分统计", "子树生成", "剪枝序列", "路径验收"]
invariant: "候选特征、离散化、划分准则、停止条件、剪枝集与代价参数固定"
fault: "在测试集上挑选特征阈值或剪枝子树,使最终风险失去独立性"
evidence: "节点ID、候选划分、熵/基尼、阈值、子树、训练与验证风险、剪枝参数和决策路径。"
reset: restore_case_stage_trace_mode_step_gates_and_artifact该协议要求“第5章 决策树”在相同符号、数据、形状、初值、顺序、容差和种子下重放。重置后若案例、阶段、轨迹模式、步骤、结论门或证据包没有回到基线,交互状态已经污染比较。
本页回顾
掌握“第5章 决策树”不是背诵公式或API,而是能围绕“怎样逐节点核对信息增益或基尼下降,并用独立角色决定剪枝?”重建定义与数值证据,并用“候选特征、离散化、划分准则、停止条件、剪枝集与代价参数固定”拒绝“在测试集上挑选特征阈值或剪枝子树,使最终风险失去独立性”。最终交付为节点ID、候选划分、熵/基尼、阈值、子树、训练与验证风险、剪枝参数和决策路径。
练习与答案
练习
- 问题 1:方法合同。 “第5章 决策树”为什么必须先冻结符号、数据、形状、初值、顺序、容差和种子?
- 问题 2:目录逐项覆盖。 怎样证明原版目录坐标已经进入机制、交互和练习?
- 问题 3:故障恢复。 怎样证明“在测试集上挑选特征阈值或剪枝子树,使最终风险失去独立性”已经被修正?
名词解释
名词解释
本章出现的专业名词,用大白话再讲一遍。
- 决策树
检索键 slm-A 对应目录坐标「第5章 决策树」;在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,需要连接原版范围、定义、数值状态与独立证据。
- 决策树模型
检索键 slm-B 对应目录坐标「5·1 决策树模型与学习」;在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,需要连接原版范围、定义、数值状态与独立证据。
- 决策树模型
检索键 slm-C 对应目录坐标「5·1·1 决策树模型」;在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,需要连接原版范围、定义、数值状态与独立证据。
- 决策树
检索键 slm-D 对应目录坐标「5·1·2 决策树与 if-then规则」;在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,需要连接原版范围、定义、数值状态与独立证据。
- 决策树
检索键 slm-E 对应目录坐标「5·1·3 决策树与条件概率分布」;在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,需要连接原版范围、定义、数值状态与独立证据。
- 决策树学习
检索键 slm-F 对应目录坐标「5·1·4 决策树学习」;在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,需要连接原版范围、定义、数值状态与独立证据。
- 特征选择
检索键 slm-G 对应目录坐标「5·2 特征选择」;在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,需要连接原版范围、定义、数值状态与独立证据。
- 特征选择问题
检索键 slm-H 对应目录坐标「5·2·1 特征选择问题」;在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,需要连接原版范围、定义、数值状态与独立证据。
- 信息增益
检索键 slm-I 对应目录坐标「5·2·2 信息增益」;在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,需要连接原版范围、定义、数值状态与独立证据。
- 信息增益比
检索键 slm-J 对应目录坐标「5·2·3 信息增益比」;在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,需要连接原版范围、定义、数值状态与独立证据。
- 决策树的生成
检索键 slm-K 对应目录坐标「5·3 决策树的生成」;在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,需要连接原版范围、定义、数值状态与独立证据。
- ID3算法
检索键 slm-L 对应目录坐标「5·3·1 ID3算法」;在“第5章 决策树”中用于把目录坐标转为有定义、推导、计算和验收的统计学习合同,需要连接原版范围、定义、数值状态与独立证据。
- C4.5的生成算法
检索键 slm-M 对应目录坐标「5·3·2 C4·5的生成算法」;在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,需要连接原版范围、定义、数值状态与独立证据。
- 决策树的剪枝
检索键 slm-N 对应目录坐标「5·4 决策树的剪枝」;在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,需要连接原版范围、定义、数值状态与独立证据。
- CART算法
检索键 slm-O 对应目录坐标「5·5 CART算法」;在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,需要连接原版范围、定义、数值状态与独立证据。
- CART生成
检索键 slm-P 对应目录坐标「5·5·1 CART生成」;在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,需要连接原版范围、定义、数值状态与独立证据。
- CART剪枝
检索键 slm-Q 对应目录坐标「5·5·2 CART剪枝」;在“第5章 决策树”中用于按纯度变化生成子树并以独立风险剪枝,需要连接原版范围、定义、数值状态与独立证据。