第8章 集成学习
覆盖个体与集成、Boosting、Bagging、随机森林、结合策略与多样性;用数据协议、单故障轨迹和模型验收门完成独立复核。
学习目标
- 能说明“第8章 集成学习”如何覆盖个体与集成、Boosting、Bagging、随机森林、结合策略与多样性,并把原版范围、技术核验和现代扩展分层
- 能先预测“怎样在相同训练角色下组合多个学习器,并区分误差降低来自强度还是多样性?”的数据与模型路径,再用切分、状态、轨迹和独立评估复核
- 能注入“先按测试集表现筛选成员再投票,把测试反馈伪装成集成多样性”,用“基学习器、样本/特征抽样、权重更新、组合规则、种子和外部评估固定”决定接受、降级或拒绝实验结论
为什么从这个学习实验开始
集成页同时记录每个成员如何产生和如何组合,数量多不等于信息互补。 “第8章 集成学习”的贯穿任务是:比较AdaBoost、Bagging和随机森林,追踪样本权重、袋外误差与成员相关性。 操作前先写下哪个数据角色、模型状态或评估结论会变化;运行后补理由不算预测。
本页围绕“怎样在相同训练角色下组合多个学习器,并区分误差降低来自强度还是多样性?”建立基线、故障与恢复路径。只有“第8章 集成学习”守住“基学习器、样本/特征抽样、权重更新、组合规则、种子和外部评估固定”并交付成员配置、样本/特征索引、权重轨迹、随机种子、袋外预测、组合系数、成员错误矩阵和相关性。,分数或图形才构成机器学习证据。
书目、128个原版层级与版本边界
“第8章 集成学习”以清华大学出版社官方书页核对周志华著《机器学习》于2016年出版、425页、ISBN 9787302423287和全书16章的三部分结构,同时以作者官方书页确认这是一部16章、每章6至7节且持续公开勘误的入门教科书,再以作者官方目录PDF逐项核对16章、108个编号小节和附录A/B/C,因此本站覆盖分母计入16个章标题、108个编号小节、附录标题及A/B/C,共128个正式目录层级。
“第8章 集成学习”未取得原书完整正文,只以作者与出版社目录限定范围;中文解释、交互、实验、练习与答案均为独立教学重写。原书集成以监督学习器组合为主;模型路由与基础模型编排不是原版第8章内容。
本页另以技术核对 1、技术核对 2、技术核对 3核对算法机制、评估协议或数学工具。外部资料能验证技术事实,不能反向证明原书正文采用了本站表述。
原版目录层级与学习机制
第8章 集成学习
↡集成学习对应原版目录坐标“第8章 集成学习”,在“第8章 集成学习”中用于把原版目录项转成有输入、状态变化和验收条件的学习合同,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 1/7。 在“第8章 集成学习”的坐标1中,目录项「第8章 集成学习」用于把原版目录项转成有输入、状态变化和验收条件的学习合同;先冻结数据角色,再以数据角色、模型状态、运行轨迹、指标与边界反例复核,出现只复述标题而没有实验或拒绝条件时撤回结论。
8.1 个体与集成
↡个体对应原版目录坐标“8·1 个体与集成”,在“第8章 集成学习”中用于通过重采样或加权产生成员并按声明规则组合,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 2/7。 目录项「8·1 个体与集成」进入“第8章 集成学习”后要回答第2个学习问题:它怎样通过重采样或加权产生成员并按声明规则组合、改变什么模型状态、由哪些成员索引、样本权重、袋外预测、组合系数与错误相关证明,并如何排除按测试表现筛选成员。
8.2 Boosting
↡Boosting对应原版目录坐标“8·2 Boosting”,在“第8章 集成学习”中用于通过重采样或加权产生成员并按声明规则组合,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 3/7。 围绕“怎样在相同训练角色下组合多个学习器,并区分误差降低来自强度还是多样性?”,在“第8章 集成学习”的原版层级3把「8·2 Boosting」落实为通过重采样或加权产生成员并按声明规则组合;复核者先读取成员索引、样本权重、袋外预测、组合系数与错误相关,不能接受按测试表现筛选成员。
8.3 Bagging与随机森林
↡Bagging对应原版目录坐标“8·3 Bagging与随机森林”,在“第8章 集成学习”中用于通过重采样或加权产生成员并按声明规则组合,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 4/7。 对“第8章 集成学习”而言,目录项「8·3 Bagging与随机森林」的最小实验合同是通过重采样或加权产生成员并按声明规则组合,第4次检查保存成员索引、样本权重、袋外预测、组合系数与错误相关;若产生按测试表现筛选成员,就返回上游。
8.4 结合策略
↡结合策略对应原版目录坐标“8·4 结合策略”,在“第8章 集成学习”中用于通过重采样或加权产生成员并按声明规则组合,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 5/7。 第5个正式坐标「8·4 结合策略」服务于覆盖个体与集成、Boosting、Bagging、随机森林、结合策略与多样性,需要以成员索引、样本权重、袋外预测、组合系数与错误相关呈现通过重采样或加权产生成员并按声明规则组合;按测试表现筛选成员会破坏“基学习器、样本/特征抽样、权重更新、组合规则、种子和外部评估固定”。
8.5 多样性
↡多样性对应原版目录坐标“8·5 多样性”,在“第8章 集成学习”中用于通过重采样或加权产生成员并按声明规则组合,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 6/7。 在“第8章 集成学习”的坐标6中,目录项「8·5 多样性」用于通过重采样或加权产生成员并按声明规则组合;先冻结数据角色,再以成员索引、样本权重、袋外预测、组合系数与错误相关复核,出现按测试表现筛选成员时撤回结论。
8.6 阅读材料
↡阅读材料对应原版目录坐标“8·6 阅读材料”,在“第8章 集成学习”中用于把本章结论连接到可追溯的进阶路线与原始资料,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 7/7。 目录项「8·6 阅读材料」进入“第8章 集成学习”后要回答第7个学习问题:它怎样把本章结论连接到可追溯的进阶路线与原始资料、改变什么模型状态、由哪些问题清单、前置假设、来源版本与可复现实验入口证明,并如何排除只堆链接而不说明验证对象。
先预测,再操作三个章专属实验
1. 数据角色与模型协议
固定“比较AdaBoost、Bagging和随机森林,追踪样本权重、袋外误差与成员相关性。”,在基线与反例间切换,逐阶段查看“基学习器合同、重采样或加权、成员训练、组合决策、多样性分析”允许的输入、操作、输出和证据。
数据与模型协议
选择实验,再逐阶段检查信息边界
怎样在相同训练角色下组合多个学习器,并区分误差降低来自强度还是多样性?
实验设置
比较AdaBoost、Bagging和随机森林,追踪样本权重、袋外误差与成员相关性。 固定数据版本、实体切分、流水线、预算和随机种子。
预期结果
沿“基学习器合同 → 重采样或加权 → 成员训练 → 组合决策 → 多样性分析”得到可重放结论。
适用边界
全过程保持“基学习器、样本/特征抽样、权重更新、组合规则、种子和外部评估固定”。
允许输入
第8章 集成学习:冻结版本、实体与样本角色,不得越过样本角色
本阶段操作
只读取任务允许的信息,并持续满足“基学习器、样本/特征抽样、权重更新、组合规则、种子和外部评估固定”
阶段输出
基学习器合同产生可追踪输入状态
复核证据
可追踪输入状态、索引和版本;出现“先按测试集表现筛选成员再投票,把测试反馈伪装成集成多样性”时拒绝推进
原版坐标:第8章 集成学习、8.1 个体与集成、8.2 Boosting、8.3 Bagging与随机森林、8.4 结合策略、8.5 多样性、8.6 阅读材料
第8章 集成学习的可重放研究协议
| 阶段 | 允许动作 | 必留证据 | 拒绝条件 |
|---|---|---|---|
| 基学习器合同 | 在“第8章 集成学习”执行基学习器合同,只读取该角色允许的信息 | 任务、版本、实体与切分哈希 | 角色或来源不可追溯 |
| 重采样或加权 | 在“第8章 集成学习”执行重采样或加权,只读取该角色允许的信息 | 表示、参数、轨迹、候选比较与选择理由 | 先按测试集表现筛选成员再投票,把测试反馈伪装成集成多样性 |
| 成员训练 | 在“第8章 集成学习”执行成员训练,只读取该角色允许的信息 | 表示、参数、轨迹、候选比较与选择理由 | 先按测试集表现筛选成员再投票,把测试反馈伪装成集成多样性 |
| 组合决策 | 在“第8章 集成学习”执行组合决策,只读取该角色允许的信息 | 表示、参数、轨迹、候选比较与选择理由 | 先按测试集表现筛选成员再投票,把测试反馈伪装成集成多样性 |
| 多样性分析 | 在“第8章 集成学习”执行多样性分析,只读取该角色允许的信息 | 封存指标、错误样本、复现与边界 | 测试被复用或无法重放 |
unit: "mlw-08"
question: "怎样在相同训练角色下组合多个学习器,并区分误差降低来自强度还是多样性?"
scenario: "比较AdaBoost、Bagging和随机森林,追踪样本权重、袋外误差与成员相关性。"
stages: ["基学习器合同", "重采样或加权", "成员训练", "组合决策", "多样性分析"]
invariant: "基学习器、样本/特征抽样、权重更新、组合规则、种子和外部评估固定"
fault: "先按测试集表现筛选成员再投票,把测试反馈伪装成集成多样性"
evidence: "成员配置、样本/特征索引、权重轨迹、随机种子、袋外预测、组合系数、成员错误矩阵和相关性。"
reset: restore_experiment_stage_trace_mode_step_gates_and_artifact该协议要求“第8章 集成学习”在相同任务、数据版本、实体切分、流水线、预算和种子下重放。重置后若实验、阶段、轨迹模式、步骤、验收门或复核包没有回到基线,交互状态已经污染比较。
本页回顾
掌握“第8章 集成学习”不是背诵算法名,而是能围绕“怎样在相同训练角色下组合多个学习器,并区分误差降低来自强度还是多样性?”重建数据与模型证据,并用“基学习器、样本/特征抽样、权重更新、组合规则、种子和外部评估固定”拒绝“先按测试集表现筛选成员再投票,把测试反馈伪装成集成多样性”。最终交付为成员配置、样本/特征索引、权重轨迹、随机种子、袋外预测、组合系数、成员错误矩阵和相关性。
练习与答案
练习
- 问题 1:实验合同。 “第8章 集成学习”为什么必须先冻结任务、数据版本、实体切分、流水线、预算和种子?
- 问题 2:目录逐项覆盖。 怎样证明原版目录坐标已经进入机制、交互和练习?
- 问题 3:故障恢复。 怎样证明“先按测试集表现筛选成员再投票,把测试反馈伪装成集成多样性”已经被修正?
名词解释
名词解释
本章出现的专业名词,用大白话再讲一遍。
- 集成学习
检索键 ml-A 对应目录坐标「第8章 集成学习」;在“第8章 集成学习”中用于把原版目录项转成有输入、状态变化和验收条件的学习合同,需要连接原版范围、数据角色、模型状态与独立证据。
- 个体
检索键 ml-B 对应目录坐标「8·1 个体与集成」;在“第8章 集成学习”中用于通过重采样或加权产生成员并按声明规则组合,需要连接原版范围、数据角色、模型状态与独立证据。
- Boosting
检索键 ml-C 对应目录坐标「8·2 Boosting」;在“第8章 集成学习”中用于通过重采样或加权产生成员并按声明规则组合,需要连接原版范围、数据角色、模型状态与独立证据。
- Bagging
检索键 ml-D 对应目录坐标「8·3 Bagging与随机森林」;在“第8章 集成学习”中用于通过重采样或加权产生成员并按声明规则组合,需要连接原版范围、数据角色、模型状态与独立证据。
- 结合策略
检索键 ml-E 对应目录坐标「8·4 结合策略」;在“第8章 集成学习”中用于通过重采样或加权产生成员并按声明规则组合,需要连接原版范围、数据角色、模型状态与独立证据。
- 多样性
检索键 ml-F 对应目录坐标「8·5 多样性」;在“第8章 集成学习”中用于通过重采样或加权产生成员并按声明规则组合,需要连接原版范围、数据角色、模型状态与独立证据。
- 阅读材料
检索键 ml-G 对应目录坐标「8·6 阅读材料」;在“第8章 集成学习”中用于把本章结论连接到可追溯的进阶路线与原始资料,需要连接原版范围、数据角色、模型状态与独立证据。