第9章 集成分类

比较剪枝分类、Bagging与Boosting的采样、组合与误差结构;用模型空间、单反例拟合轨迹和独立验证门完成复核。

学习目标

  • 能说明“第9章 集成分类”如何比较剪枝分类、Bagging与Boosting的采样、组合与误差结构,并把2013原版范围、独立论文核验与当前迁移分层
  • 能先预测“怎样区分重采样降方差和顺序加权纠错,并用袋外或独立验证证明集成收益?”的五阶段统计链,再用输入、目标、求解、验证与反例逐层复核
  • 能注入“用同一训练样本评估每轮并挑选最佳轮数,未保留袋外或验证证据”,用“基础学习器、采样种子、轮数、组合权重和评估集合固定”决定接受、修正或拒绝学习结论

为什么从这个统计学习任务开始

集成页不把“模型更多”当原因,而是分别追踪样本重采样、错误加权和预测组合。 “第9章 集成分类”的贯穿任务是:在不稳定树基线上比较剪枝、Bagging和Boosting,记录样本权重与预测分歧。 操作前必须写下哪个模型状态、风险项或验证结果会先变化,运行后再补理由不算预测。

本页围绕“怎样区分重采样降方差和顺序加权纠错,并用袋外或独立验证证明集成收益?”建立基线、边界反例与恢复路径。只有“第9章 集成分类”守住“基础学习器、采样种子、轮数、组合权重和评估集合固定”并交付基础树、重采样索引、样本权重、成员预测、组合权重、轮数、袋外误差、验证曲线和分歧样本。,最终指标才构成统计学习证据。

书目、88个原版层级与独立重写边界

讲谈社官方书页确认杉山将《イラストで学ぶ 機械学習》于2013年出版、232页、ISBN 9784061538214,并公开6部分20章;中文版目录与书目用于交叉核对许永伟译、人民邮电出版社2015年版及62个编号小节。覆盖分母为6部分、20章和62个编号小节,共88个原版目录层级。

“第9章 集成分类”未取得原书完整正文,只以权威目录限定范围;中文解释、图示结构、交互、实验、练习与答案均为独立教学重写。本章限定三类原版集成方法;现代梯度提升实现只作迁移对照。

本页另以技术核对 1技术核对 2核对算法机制。论文、作者与出版社资料能验证定义、假设或历史事实,不能反向证明原书正文采用了本站表述。

原版目录层级与统计机制

第9章 集成分类

原版坐标 1/4。 在“第9章 集成分类”的坐标1中,目录项「第9章 集成分类」用于通过剪枝、重采样或顺序加权组合分类器;先冻结数据角色,再以采样索引、样本权重、成员预测、组合与袋外误差复核,出现只展示最好一轮训练结果时撤回结论。

9.1 剪枝分类

原版坐标 2/4。 目录项「9.1 剪枝分类」进入“第9章 集成分类”后要回答第2个问题:它怎样通过剪枝、重采样或顺序加权组合分类器、优化什么、由哪些采样索引、样本权重、成员预测、组合与袋外误差证明,并如何排除只展示最好一轮训练结果。

9.2 Bagging学习法

原版坐标 3/4。 围绕“怎样区分重采样降方差和顺序加权纠错,并用袋外或独立验证证明集成收益?”,原版层级3把「9.2 Bagging学习法」解释为通过剪枝、重采样或顺序加权组合分类器;复核者先读取采样索引、样本权重、成员预测、组合与袋外误差,不能接受只展示最好一轮训练结果。

9.3 Boosting学习法

原版坐标 4/4。 对“第9章 集成分类”而言,目录项「9.3 Boosting学习法」的最小合同是通过剪枝、重采样或顺序加权组合分类器,第4次检查保存采样索引、样本权重、成员预测、组合与袋外误差;若产生只展示最好一轮训练结果,就返回上游重放。

先预测,再操作三个章专属实验

分步1 / 3

1. 模型空间与风险贡献

固定“在不稳定树基线上比较剪枝、Bagging和Boosting,记录样本权重与预测分歧。”,在基线与边界样本间切换,逐一查看“基础学习器、采样或加权、成员拟合、组合预测、袋外/验证”的输入、变换、输出与证据。

模型空间

固定样本,追踪模型到风险

怎样区分重采样降方差和顺序加权纠错,并用袋外或独立验证证明集成收益?

条件

在不稳定树基线上比较剪枝、Bagging和Boosting,记录样本权重与预测分歧。 使用冻结训练/验证/测试角色。

预测

沿“基础学习器 → 采样或加权 → 成员拟合 → 组合预测 → 袋外/验证”形成预注册输出。

目标

满足“基础学习器、采样种子、轮数、组合权重和评估集合固定”。

风险贡献

按本页目标计入经验风险,并与简单基线同口径比较。

阶段输入

第9章 集成分类:冻结的问题、样本与数据角色

变换

登记单位、切分、分布和形状,并守住“基础学习器、采样种子、轮数、组合权重和评估集合固定”

阶段输出

可追溯样本

复核证据

数据卡、索引与哈希;若出现“用同一训练样本评估每轮并挑选最佳轮数,未保留袋外或验证证据”就保留失败运行

原版坐标:第9章 集成分类、9.1 剪枝分类、9.2 Bagging学习法、9.3 Boosting学习法

第9章 集成分类的可重放统计协议

阶段学习动作必留证据拒绝条件
基础学习器在“第9章 集成分类”执行基础学习器,一次只改变预注册变量任务、样本角色、分布、版本与输入数据角色或假设不可追溯
采样或加权在“第9章 集成分类”执行采样或加权,一次只改变预注册变量表示、模型、风险、约束、参数或求解轨迹用同一训练样本评估每轮并挑选最佳轮数,未保留袋外或验证证据
成员拟合在“第9章 集成分类”执行成员拟合,一次只改变预注册变量表示、模型、风险、约束、参数或求解轨迹用同一训练样本评估每轮并挑选最佳轮数,未保留袋外或验证证据
组合预测在“第9章 集成分类”执行组合预测,一次只改变预注册变量表示、模型、风险、约束、参数或求解轨迹用同一训练样本评估每轮并挑选最佳轮数,未保留袋外或验证证据
袋外/验证在“第9章 集成分类”执行袋外/验证,一次只改变预注册变量独立指标、稳定性、反例与环境无法独立重放或解释失败
unit: "iml-09"
question: "怎样区分重采样降方差和顺序加权纠错,并用袋外或独立验证证明集成收益?"
scenario: "在不稳定树基线上比较剪枝、Bagging和Boosting,记录样本权重与预测分歧。"
stages: ["基础学习器", "采样或加权", "成员拟合", "组合预测", "袋外/验证"]
invariant: "基础学习器、采样种子、轮数、组合权重和评估集合固定"
fault: "用同一训练样本评估每轮并挑选最佳轮数,未保留袋外或验证证据"
evidence: "基础树、重采样索引、样本权重、成员预测、组合权重、轮数、袋外误差、验证曲线和分歧样本。"
reset: restore_case_stage_trace_mode_step_gates_and_artifact

该协议要求“第9章 集成分类”在相同任务、数据角色、分布、代码、环境和种子下重放。重置后若样本情形、阶段、拟合模式、步骤、验证门或证据包没有回到基线,交互状态已经污染比较,不能作为结论。

本页回顾

掌握“第9章 集成分类”不是记住算法名,而是能围绕“怎样区分重采样降方差和顺序加权纠错,并用袋外或独立验证证明集成收益?”重建统计假设、风险与验证,并用“基础学习器、采样种子、轮数、组合权重和评估集合固定”拒绝“用同一训练样本评估每轮并挑选最佳轮数,未保留袋外或验证证据”。最终交付为基础树、重采样索引、样本权重、成员预测、组合权重、轮数、袋外误差、验证曲线和分歧样本。

练习与答案

练习

  1. 问题 1:统计合同。 “第9章 集成分类”为什么必须先冻结任务、数据角色、分布假设、代码、环境与种子?
  1. 问题 2:目录逐项覆盖。 怎样证明原版目录坐标已经进入机制、交互和练习?
  1. 问题 3:反例恢复。 怎样证明“用同一训练样本评估每轮并挑选最佳轮数,未保留袋外或验证证据”已经被修正?

名词解释

名词解释

本章出现的专业名词,用大白话再讲一遍。

集成分类

对应“第9章 集成分类”;在“第9章 集成分类”中用于通过剪枝、重采样或顺序加权组合分类器,需要连接原版范围、统计假设与独立验证。

剪枝分类

对应“9.1 剪枝分类”;在“第9章 集成分类”中用于通过剪枝、重采样或顺序加权组合分类器,需要连接原版范围、统计假设与独立验证。

Bagging学习法

对应“9.2 Bagging学习法”;在“第9章 集成分类”中用于通过剪枝、重采样或顺序加权组合分类器,需要连接原版范围、统计假设与独立验证。

Boosting学习法

对应“9.3 Boosting学习法”;在“第9章 集成分类”中用于通过剪枝、重采样或顺序加权组合分类器,需要连接原版范围、统计假设与独立验证。

讨论

评论区加载中…