第11章 特征选择与稀疏学习
覆盖子集搜索、过滤式/包裹式/嵌入式选择、L1、字典学习与压缩感知;用数据协议、单故障轨迹和模型验收门完成独立复核。
学习目标
- 能说明“第11章 特征选择与稀疏学习”如何覆盖子集搜索、过滤式/包裹式/嵌入式选择、L1、字典学习与压缩感知,并把原版范围、技术核验和现代扩展分层
- 能先预测“怎样在嵌套评估中选择特征,并区分预测稀疏、表示稀疏与测量恢复?”的数据与模型路径,再用切分、状态、轨迹和独立评估复核
- 能注入“先用全量标签筛特征再交叉验证,导致每一折的验证标签已经进入表示”,用“特征候选、搜索预算、选择评分、内外层切分、正则和稀疏阈值固定”决定接受、降级或拒绝实验结论
为什么从这个学习实验开始
稀疏学习页把选择过程纳入评估折内,防止先看答案再压缩特征。 “第11章 特征选择与稀疏学习”的贯穿任务是:比较过滤、包裹与L1嵌入式选择,再用稀疏字典重构西瓜属性。 操作前先写下哪个数据角色、模型状态或评估结论会变化;运行后补理由不算预测。
本页围绕“怎样在嵌套评估中选择特征,并区分预测稀疏、表示稀疏与测量恢复?”建立基线、故障与恢复路径。只有“第11章 特征选择与稀疏学习”守住“特征候选、搜索预算、选择评分、内外层切分、正则和稀疏阈值固定”并交付特征清单、过滤统计、搜索路径、内外折索引、正则路径、非零支持集、字典与编码、选择稳定性和外层性能。,分数或图形才构成机器学习证据。
书目、128个原版层级与版本边界
“第11章 特征选择与稀疏学习”以清华大学出版社官方书页核对周志华著《机器学习》于2016年出版、425页、ISBN 9787302423287和全书16章的三部分结构,同时以作者官方书页确认这是一部16章、每章6至7节且持续公开勘误的入门教科书,再以作者官方目录PDF逐项核对16章、108个编号小节和附录A/B/C,因此本站覆盖分母计入16个章标题、108个编号小节、附录标题及A/B/C,共128个正式目录层级。
“第11章 特征选择与稀疏学习”未取得原书完整正文,只以作者与出版社目录限定范围;中文解释、交互、实验、练习与答案均为独立教学重写。L1产生稀疏解受设计矩阵与正则影响;系数为零不自动等于因果无关。
本页另以技术核对 1、技术核对 2、技术核对 3核对算法机制、评估协议或数学工具。外部资料能验证技术事实,不能反向证明原书正文采用了本站表述。
原版目录层级与学习机制
第11章 特征选择与稀疏学习
↡特征选择对应原版目录坐标“第11章 特征选择与稀疏学习”,在“第11章 特征选择与稀疏学习”中用于在训练折内选择变量或稀疏编码并由外层评估,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 1/8。 在“第11章 特征选择与稀疏学习”的坐标1中,目录项「第11章 特征选择与稀疏学习」用于在训练折内选择变量或稀疏编码并由外层评估;先冻结数据角色,再以搜索路径、内外折、正则路径、支持集与选择稳定性复核,出现全量标签先筛特征再验证时撤回结论。
11.1 子集搜索与评价
↡子集搜索对应原版目录坐标“11·1 子集搜索与评价”,在“第11章 特征选择与稀疏学习”中用于在训练折内选择变量或稀疏编码并由外层评估,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 2/8。 目录项「11·1 子集搜索与评价」进入“第11章 特征选择与稀疏学习”后要回答第2个学习问题:它怎样在训练折内选择变量或稀疏编码并由外层评估、改变什么模型状态、由哪些搜索路径、内外折、正则路径、支持集与选择稳定性证明,并如何排除全量标签先筛特征再验证。
11.2 过滤式选择
↡过滤式选择对应原版目录坐标“11·2 过滤式选择”,在“第11章 特征选择与稀疏学习”中用于在训练折内选择变量或稀疏编码并由外层评估,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 3/8。 围绕“怎样在嵌套评估中选择特征,并区分预测稀疏、表示稀疏与测量恢复?”,在“第11章 特征选择与稀疏学习”的原版层级3把「11·2 过滤式选择」落实为在训练折内选择变量或稀疏编码并由外层评估;复核者先读取搜索路径、内外折、正则路径、支持集与选择稳定性,不能接受全量标签先筛特征再验证。
11.3 包裹式选择
↡包裹式选择对应原版目录坐标“11·3 包裹式选择”,在“第11章 特征选择与稀疏学习”中用于在训练折内选择变量或稀疏编码并由外层评估,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 4/8。 对“第11章 特征选择与稀疏学习”而言,目录项「11·3 包裹式选择」的最小实验合同是在训练折内选择变量或稀疏编码并由外层评估,第4次检查保存搜索路径、内外折、正则路径、支持集与选择稳定性;若产生全量标签先筛特征再验证,就返回上游。
11.4 嵌入式选择与L1正则化
↡嵌入式选择对应原版目录坐标“11·4 嵌入式选择与L1正则化”,在“第11章 特征选择与稀疏学习”中用于把几何间隔转换为约束优化并通过核计算内积,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 5/8。 第5个正式坐标「11·4 嵌入式选择与L1正则化」服务于覆盖子集搜索、过滤式/包裹式/嵌入式选择、L1、字典学习与压缩感知,需要以尺度、Gram矩阵、乘子、KKT残差与支持向量呈现把几何间隔转换为约束优化并通过核计算内积;核参数或尺度在测试样本上拟合会破坏“特征候选、搜索预算、选择评分、内外层切分、正则和稀疏阈值固定”。
11.5 稀疏表示与字典学习
↡稀疏表示对应原版目录坐标“11·5 稀疏表示与字典学习”,在“第11章 特征选择与稀疏学习”中用于在训练折内选择变量或稀疏编码并由外层评估,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 6/8。 在“第11章 特征选择与稀疏学习”的坐标6中,目录项「11·5 稀疏表示与字典学习」用于在训练折内选择变量或稀疏编码并由外层评估;先冻结数据角色,再以搜索路径、内外折、正则路径、支持集与选择稳定性复核,出现全量标签先筛特征再验证时撤回结论。
11.6 压缩感知
↡压缩感知对应原版目录坐标“11·6 压缩感知”,在“第11章 特征选择与稀疏学习”中用于在训练折内选择变量或稀疏编码并由外层评估,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 7/8。 目录项「11·6 压缩感知」进入“第11章 特征选择与稀疏学习”后要回答第7个学习问题:它怎样在训练折内选择变量或稀疏编码并由外层评估、改变什么模型状态、由哪些搜索路径、内外折、正则路径、支持集与选择稳定性证明,并如何排除全量标签先筛特征再验证。
11.7 阅读材料
↡阅读材料对应原版目录坐标“11·7 阅读材料”,在“第11章 特征选择与稀疏学习”中用于把本章结论连接到可追溯的进阶路线与原始资料,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 8/8。 围绕“怎样在嵌套评估中选择特征,并区分预测稀疏、表示稀疏与测量恢复?”,在“第11章 特征选择与稀疏学习”的原版层级8把「11·7 阅读材料」落实为把本章结论连接到可追溯的进阶路线与原始资料;复核者先读取问题清单、前置假设、来源版本与可复现实验入口,不能接受只堆链接而不说明验证对象。
先预测,再操作三个章专属实验
1. 数据角色与模型协议
固定“比较过滤、包裹与L1嵌入式选择,再用稀疏字典重构西瓜属性。”,在基线与反例间切换,逐阶段查看“候选特征、内层选择、稀疏拟合、外层评估、稳定性解释”允许的输入、操作、输出和证据。
数据与模型协议
选择实验,再逐阶段检查信息边界
怎样在嵌套评估中选择特征,并区分预测稀疏、表示稀疏与测量恢复?
实验设置
比较过滤、包裹与L1嵌入式选择,再用稀疏字典重构西瓜属性。 固定数据版本、实体切分、流水线、预算和随机种子。
预期结果
沿“候选特征 → 内层选择 → 稀疏拟合 → 外层评估 → 稳定性解释”得到可重放结论。
适用边界
全过程保持“特征候选、搜索预算、选择评分、内外层切分、正则和稀疏阈值固定”。
允许输入
第11章 特征选择与稀疏学习:冻结版本、实体与样本角色,不得越过样本角色
本阶段操作
只读取任务允许的信息,并持续满足“特征候选、搜索预算、选择评分、内外层切分、正则和稀疏阈值固定”
阶段输出
候选特征产生可追踪输入状态
复核证据
可追踪输入状态、索引和版本;出现“先用全量标签筛特征再交叉验证,导致每一折的验证标签已经进入表示”时拒绝推进
原版坐标:第11章 特征选择与稀疏学习、11.1 子集搜索与评价、11.2 过滤式选择、11.3 包裹式选择、11.4 嵌入式选择与L1正则化、11.5 稀疏表示与字典学习、11.6 压缩感知、11.7 阅读材料
第11章 特征选择与稀疏学习的可重放研究协议
| 阶段 | 允许动作 | 必留证据 | 拒绝条件 |
|---|---|---|---|
| 候选特征 | 在“第11章 特征选择与稀疏学习”执行候选特征,只读取该角色允许的信息 | 任务、版本、实体与切分哈希 | 角色或来源不可追溯 |
| 内层选择 | 在“第11章 特征选择与稀疏学习”执行内层选择,只读取该角色允许的信息 | 表示、参数、轨迹、候选比较与选择理由 | 先用全量标签筛特征再交叉验证,导致每一折的验证标签已经进入表示 |
| 稀疏拟合 | 在“第11章 特征选择与稀疏学习”执行稀疏拟合,只读取该角色允许的信息 | 表示、参数、轨迹、候选比较与选择理由 | 先用全量标签筛特征再交叉验证,导致每一折的验证标签已经进入表示 |
| 外层评估 | 在“第11章 特征选择与稀疏学习”执行外层评估,只读取该角色允许的信息 | 表示、参数、轨迹、候选比较与选择理由 | 先用全量标签筛特征再交叉验证,导致每一折的验证标签已经进入表示 |
| 稳定性解释 | 在“第11章 特征选择与稀疏学习”执行稳定性解释,只读取该角色允许的信息 | 封存指标、错误样本、复现与边界 | 测试被复用或无法重放 |
unit: "mlw-11"
question: "怎样在嵌套评估中选择特征,并区分预测稀疏、表示稀疏与测量恢复?"
scenario: "比较过滤、包裹与L1嵌入式选择,再用稀疏字典重构西瓜属性。"
stages: ["候选特征", "内层选择", "稀疏拟合", "外层评估", "稳定性解释"]
invariant: "特征候选、搜索预算、选择评分、内外层切分、正则和稀疏阈值固定"
fault: "先用全量标签筛特征再交叉验证,导致每一折的验证标签已经进入表示"
evidence: "特征清单、过滤统计、搜索路径、内外折索引、正则路径、非零支持集、字典与编码、选择稳定性和外层性能。"
reset: restore_experiment_stage_trace_mode_step_gates_and_artifact该协议要求“第11章 特征选择与稀疏学习”在相同任务、数据版本、实体切分、流水线、预算和种子下重放。重置后若实验、阶段、轨迹模式、步骤、验收门或复核包没有回到基线,交互状态已经污染比较。
本页回顾
掌握“第11章 特征选择与稀疏学习”不是背诵算法名,而是能围绕“怎样在嵌套评估中选择特征,并区分预测稀疏、表示稀疏与测量恢复?”重建数据与模型证据,并用“特征候选、搜索预算、选择评分、内外层切分、正则和稀疏阈值固定”拒绝“先用全量标签筛特征再交叉验证,导致每一折的验证标签已经进入表示”。最终交付为特征清单、过滤统计、搜索路径、内外折索引、正则路径、非零支持集、字典与编码、选择稳定性和外层性能。
练习与答案
练习
- 问题 1:实验合同。 “第11章 特征选择与稀疏学习”为什么必须先冻结任务、数据版本、实体切分、流水线、预算和种子?
- 问题 2:目录逐项覆盖。 怎样证明原版目录坐标已经进入机制、交互和练习?
- 问题 3:故障恢复。 怎样证明“先用全量标签筛特征再交叉验证,导致每一折的验证标签已经进入表示”已经被修正?
名词解释
名词解释
本章出现的专业名词,用大白话再讲一遍。
- 特征选择
检索键 ml-A 对应目录坐标「第11章 特征选择与稀疏学习」;在“第11章 特征选择与稀疏学习”中用于在训练折内选择变量或稀疏编码并由外层评估,需要连接原版范围、数据角色、模型状态与独立证据。
- 子集搜索
检索键 ml-B 对应目录坐标「11·1 子集搜索与评价」;在“第11章 特征选择与稀疏学习”中用于在训练折内选择变量或稀疏编码并由外层评估,需要连接原版范围、数据角色、模型状态与独立证据。
- 过滤式选择
检索键 ml-C 对应目录坐标「11·2 过滤式选择」;在“第11章 特征选择与稀疏学习”中用于在训练折内选择变量或稀疏编码并由外层评估,需要连接原版范围、数据角色、模型状态与独立证据。
- 包裹式选择
检索键 ml-D 对应目录坐标「11·3 包裹式选择」;在“第11章 特征选择与稀疏学习”中用于在训练折内选择变量或稀疏编码并由外层评估,需要连接原版范围、数据角色、模型状态与独立证据。
- 嵌入式选择
检索键 ml-E 对应目录坐标「11·4 嵌入式选择与L1正则化」;在“第11章 特征选择与稀疏学习”中用于把几何间隔转换为约束优化并通过核计算内积,需要连接原版范围、数据角色、模型状态与独立证据。
- 稀疏表示
检索键 ml-F 对应目录坐标「11·5 稀疏表示与字典学习」;在“第11章 特征选择与稀疏学习”中用于在训练折内选择变量或稀疏编码并由外层评估,需要连接原版范围、数据角色、模型状态与独立证据。
- 压缩感知
检索键 ml-G 对应目录坐标「11·6 压缩感知」;在“第11章 特征选择与稀疏学习”中用于在训练折内选择变量或稀疏编码并由外层评估,需要连接原版范围、数据角色、模型状态与独立证据。
- 阅读材料
检索键 ml-H 对应目录坐标「11·7 阅读材料」;在“第11章 特征选择与稀疏学习”中用于把本章结论连接到可追溯的进阶路线与原始资料,需要连接原版范围、数据角色、模型状态与独立证据。