第10章 降维与度量学习
覆盖k近邻、低维嵌入、PCA、核化降维、流形学习与度量学习;用数据协议、单故障轨迹和模型验收门完成独立复核。
学习目标
- 能说明“第10章 降维与度量学习”如何覆盖k近邻、低维嵌入、PCA、核化降维、流形学习与度量学习,并把原版范围、技术核验和现代扩展分层
- 能先预测“怎样证明邻域与低维表示只由允许数据拟合,并量化降维丢失了什么?”的数据与模型路径,再用切分、状态、轨迹和独立评估复核
- 能注入“在全量数据含测试点上拟合PCA或度量,再把下游测试提升归功于泛化”,用“尺度、邻域、目标维数、拟合样本、核/图参数和重构或邻域指标固定”决定接受、降级或拒绝实验结论
为什么从这个学习实验开始
降维页要求同时观察保留结构与损失结构,不把二维散点图当结论。 “第10章 降维与度量学习”的贯穿任务是:对高维西瓜描述执行PCA与流形嵌入,再用k近邻比较邻域保持与分类。 操作前先写下哪个数据角色、模型状态或评估结论会变化;运行后补理由不算预测。
本页围绕“怎样证明邻域与低维表示只由允许数据拟合,并量化降维丢失了什么?”建立基线、故障与恢复路径。只有“第10章 降维与度量学习”守住“尺度、邻域、目标维数、拟合样本、核/图参数和重构或邻域指标固定”并交付拟合索引、尺度统计、协方差/核矩阵、特征值、嵌入坐标、重构误差、邻域保持率和下游冻结评估。,分数或图形才构成机器学习证据。
书目、128个原版层级与版本边界
“第10章 降维与度量学习”以清华大学出版社官方书页核对周志华著《机器学习》于2016年出版、425页、ISBN 9787302423287和全书16章的三部分结构,同时以作者官方书页确认这是一部16章、每章6至7节且持续公开勘误的入门教科书,再以作者官方目录PDF逐项核对16章、108个编号小节和附录A/B/C,因此本站覆盖分母计入16个章标题、108个编号小节、附录标题及A/B/C,共128个正式目录层级。
“第10章 降维与度量学习”未取得原书完整正文,只以作者与出版社目录限定范围;中文解释、交互、实验、练习与答案均为独立教学重写。二维图只是一种投影证据;视觉分离不能单独证明高维预测可泛化。
本页另以技术核对 1、技术核对 2、技术核对 3核对算法机制、评估协议或数学工具。外部资料能验证技术事实,不能反向证明原书正文采用了本站表述。
原版目录层级与学习机制
第10章 降维与度量学习
↡降维对应原版目录坐标“第10章 降维与度量学习”,在“第10章 降维与度量学习”中用于构造邻域或低维表示并量化结构保留与信息损失,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 1/8。 在“第10章 降维与度量学习”的坐标1中,目录项「第10章 降维与度量学习」用于构造邻域或低维表示并量化结构保留与信息损失;先冻结数据角色,再以拟合索引、协方差/核矩阵、嵌入、重构与邻域指标复核,出现在测试样本上拟合投影或度量时撤回结论。
10.1 k近邻学习
↡k近邻学习对应原版目录坐标“10·1 k近邻学习”,在“第10章 降维与度量学习”中用于构造邻域或低维表示并量化结构保留与信息损失,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 2/8。 目录项「10·1 k近邻学习」进入“第10章 降维与度量学习”后要回答第2个学习问题:它怎样构造邻域或低维表示并量化结构保留与信息损失、改变什么模型状态、由哪些拟合索引、协方差/核矩阵、嵌入、重构与邻域指标证明,并如何排除在测试样本上拟合投影或度量。
10.2 低维嵌入
↡低维嵌入对应原版目录坐标“10·2 低维嵌入”,在“第10章 降维与度量学习”中用于构造邻域或低维表示并量化结构保留与信息损失,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 3/8。 围绕“怎样证明邻域与低维表示只由允许数据拟合,并量化降维丢失了什么?”,在“第10章 降维与度量学习”的原版层级3把「10·2 低维嵌入」落实为构造邻域或低维表示并量化结构保留与信息损失;复核者先读取拟合索引、协方差/核矩阵、嵌入、重构与邻域指标,不能接受在测试样本上拟合投影或度量。
10.3 主成分分析
↡主成分分析对应原版目录坐标“10·3 主成分分析”,在“第10章 降维与度量学习”中用于构造邻域或低维表示并量化结构保留与信息损失,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 4/8。 对“第10章 降维与度量学习”而言,目录项「10·3 主成分分析」的最小实验合同是构造邻域或低维表示并量化结构保留与信息损失,第4次检查保存拟合索引、协方差/核矩阵、嵌入、重构与邻域指标;若产生在测试样本上拟合投影或度量,就返回上游。
10.4 核化线性降维
↡核化线性降维对应原版目录坐标“10·4 核化线性降维”,在“第10章 降维与度量学习”中用于构造邻域或低维表示并量化结构保留与信息损失,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 5/8。 第5个正式坐标「10·4 核化线性降维」服务于覆盖k近邻、低维嵌入、PCA、核化降维、流形学习与度量学习,需要以拟合索引、协方差/核矩阵、嵌入、重构与邻域指标呈现构造邻域或低维表示并量化结构保留与信息损失;在测试样本上拟合投影或度量会破坏“尺度、邻域、目标维数、拟合样本、核/图参数和重构或邻域指标固定”。
10.5 流形学习
↡流形学习对应原版目录坐标“10·5 流形学习”,在“第10章 降维与度量学习”中用于构造邻域或低维表示并量化结构保留与信息损失,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 6/8。 在“第10章 降维与度量学习”的坐标6中,目录项「10·5 流形学习」用于构造邻域或低维表示并量化结构保留与信息损失;先冻结数据角色,再以拟合索引、协方差/核矩阵、嵌入、重构与邻域指标复核,出现在测试样本上拟合投影或度量时撤回结论。
10.6 度量学习
↡度量学习对应原版目录坐标“10·6 度量学习”,在“第10章 降维与度量学习”中用于构造邻域或低维表示并量化结构保留与信息损失,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 7/8。 目录项「10·6 度量学习」进入“第10章 降维与度量学习”后要回答第7个学习问题:它怎样构造邻域或低维表示并量化结构保留与信息损失、改变什么模型状态、由哪些拟合索引、协方差/核矩阵、嵌入、重构与邻域指标证明,并如何排除在测试样本上拟合投影或度量。
10.7 阅读材料
↡阅读材料对应原版目录坐标“10·7 阅读材料”,在“第10章 降维与度量学习”中用于把本章结论连接到可追溯的进阶路线与原始资料,并受数据角色、模型假设、评估时机与版本边界约束。原版坐标 8/8。 围绕“怎样证明邻域与低维表示只由允许数据拟合,并量化降维丢失了什么?”,在“第10章 降维与度量学习”的原版层级8把「10·7 阅读材料」落实为把本章结论连接到可追溯的进阶路线与原始资料;复核者先读取问题清单、前置假设、来源版本与可复现实验入口,不能接受只堆链接而不说明验证对象。
先预测,再操作三个章专属实验
1. 数据角色与模型协议
固定“对高维西瓜描述执行PCA与流形嵌入,再用k近邻比较邻域保持与分类。”,在基线与反例间切换,逐阶段查看“尺度与邻域、低维目标、投影或嵌入、邻域复核、下游评估”允许的输入、操作、输出和证据。
数据与模型协议
选择实验,再逐阶段检查信息边界
怎样证明邻域与低维表示只由允许数据拟合,并量化降维丢失了什么?
实验设置
对高维西瓜描述执行PCA与流形嵌入,再用k近邻比较邻域保持与分类。 固定数据版本、实体切分、流水线、预算和随机种子。
预期结果
沿“尺度与邻域 → 低维目标 → 投影或嵌入 → 邻域复核 → 下游评估”得到可重放结论。
适用边界
全过程保持“尺度、邻域、目标维数、拟合样本、核/图参数和重构或邻域指标固定”。
允许输入
第10章 降维与度量学习:冻结版本、实体与样本角色,不得越过样本角色
本阶段操作
只读取任务允许的信息,并持续满足“尺度、邻域、目标维数、拟合样本、核/图参数和重构或邻域指标固定”
阶段输出
尺度与邻域产生可追踪输入状态
复核证据
可追踪输入状态、索引和版本;出现“在全量数据含测试点上拟合PCA或度量,再把下游测试提升归功于泛化”时拒绝推进
原版坐标:第10章 降维与度量学习、10.1 k近邻学习、10.2 低维嵌入、10.3 主成分分析、10.4 核化线性降维、10.5 流形学习、10.6 度量学习、10.7 阅读材料
第10章 降维与度量学习的可重放研究协议
| 阶段 | 允许动作 | 必留证据 | 拒绝条件 |
|---|---|---|---|
| 尺度与邻域 | 在“第10章 降维与度量学习”执行尺度与邻域,只读取该角色允许的信息 | 任务、版本、实体与切分哈希 | 角色或来源不可追溯 |
| 低维目标 | 在“第10章 降维与度量学习”执行低维目标,只读取该角色允许的信息 | 表示、参数、轨迹、候选比较与选择理由 | 在全量数据含测试点上拟合PCA或度量,再把下游测试提升归功于泛化 |
| 投影或嵌入 | 在“第10章 降维与度量学习”执行投影或嵌入,只读取该角色允许的信息 | 表示、参数、轨迹、候选比较与选择理由 | 在全量数据含测试点上拟合PCA或度量,再把下游测试提升归功于泛化 |
| 邻域复核 | 在“第10章 降维与度量学习”执行邻域复核,只读取该角色允许的信息 | 表示、参数、轨迹、候选比较与选择理由 | 在全量数据含测试点上拟合PCA或度量,再把下游测试提升归功于泛化 |
| 下游评估 | 在“第10章 降维与度量学习”执行下游评估,只读取该角色允许的信息 | 封存指标、错误样本、复现与边界 | 测试被复用或无法重放 |
unit: "mlw-10"
question: "怎样证明邻域与低维表示只由允许数据拟合,并量化降维丢失了什么?"
scenario: "对高维西瓜描述执行PCA与流形嵌入,再用k近邻比较邻域保持与分类。"
stages: ["尺度与邻域", "低维目标", "投影或嵌入", "邻域复核", "下游评估"]
invariant: "尺度、邻域、目标维数、拟合样本、核/图参数和重构或邻域指标固定"
fault: "在全量数据含测试点上拟合PCA或度量,再把下游测试提升归功于泛化"
evidence: "拟合索引、尺度统计、协方差/核矩阵、特征值、嵌入坐标、重构误差、邻域保持率和下游冻结评估。"
reset: restore_experiment_stage_trace_mode_step_gates_and_artifact该协议要求“第10章 降维与度量学习”在相同任务、数据版本、实体切分、流水线、预算和种子下重放。重置后若实验、阶段、轨迹模式、步骤、验收门或复核包没有回到基线,交互状态已经污染比较。
本页回顾
掌握“第10章 降维与度量学习”不是背诵算法名,而是能围绕“怎样证明邻域与低维表示只由允许数据拟合,并量化降维丢失了什么?”重建数据与模型证据,并用“尺度、邻域、目标维数、拟合样本、核/图参数和重构或邻域指标固定”拒绝“在全量数据含测试点上拟合PCA或度量,再把下游测试提升归功于泛化”。最终交付为拟合索引、尺度统计、协方差/核矩阵、特征值、嵌入坐标、重构误差、邻域保持率和下游冻结评估。
练习与答案
练习
- 问题 1:实验合同。 “第10章 降维与度量学习”为什么必须先冻结任务、数据版本、实体切分、流水线、预算和种子?
- 问题 2:目录逐项覆盖。 怎样证明原版目录坐标已经进入机制、交互和练习?
- 问题 3:故障恢复。 怎样证明“在全量数据含测试点上拟合PCA或度量,再把下游测试提升归功于泛化”已经被修正?
名词解释
名词解释
本章出现的专业名词,用大白话再讲一遍。
- 降维
检索键 ml-A 对应目录坐标「第10章 降维与度量学习」;在“第10章 降维与度量学习”中用于构造邻域或低维表示并量化结构保留与信息损失,需要连接原版范围、数据角色、模型状态与独立证据。
- k近邻学习
检索键 ml-B 对应目录坐标「10·1 k近邻学习」;在“第10章 降维与度量学习”中用于构造邻域或低维表示并量化结构保留与信息损失,需要连接原版范围、数据角色、模型状态与独立证据。
- 低维嵌入
检索键 ml-C 对应目录坐标「10·2 低维嵌入」;在“第10章 降维与度量学习”中用于构造邻域或低维表示并量化结构保留与信息损失,需要连接原版范围、数据角色、模型状态与独立证据。
- 主成分分析
检索键 ml-D 对应目录坐标「10·3 主成分分析」;在“第10章 降维与度量学习”中用于构造邻域或低维表示并量化结构保留与信息损失,需要连接原版范围、数据角色、模型状态与独立证据。
- 核化线性降维
检索键 ml-E 对应目录坐标「10·4 核化线性降维」;在“第10章 降维与度量学习”中用于构造邻域或低维表示并量化结构保留与信息损失,需要连接原版范围、数据角色、模型状态与独立证据。
- 流形学习
检索键 ml-F 对应目录坐标「10·5 流形学习」;在“第10章 降维与度量学习”中用于构造邻域或低维表示并量化结构保留与信息损失,需要连接原版范围、数据角色、模型状态与独立证据。
- 度量学习
检索键 ml-G 对应目录坐标「10·6 度量学习」;在“第10章 降维与度量学习”中用于构造邻域或低维表示并量化结构保留与信息损失,需要连接原版范围、数据角色、模型状态与独立证据。
- 阅读材料
检索键 ml-H 对应目录坐标「10·7 阅读材料」;在“第10章 降维与度量学习”中用于把本章结论连接到可追溯的进阶路线与原始资料,需要连接原版范围、数据角色、模型状态与独立证据。