第12章 异常检测
比较局部异常因子、单类SVM与密度比异常检测;用模型空间、单反例拟合轨迹和独立验证门完成复核。
学习目标
- 能说明“第12章 异常检测”如何比较局部异常因子、单类SVM与密度比异常检测,并把2013原版范围、独立论文核验与当前迁移分层
- 能先预测“怎样在没有普通分类标签时定义参照邻域、支持区域或密度比,并控制异常率?”的五阶段统计链,再用输入、目标、求解、验证与反例逐层复核
- 能注入“在含测试异常的全量数据上拟合尺度和阈值,造成评估泄漏”,用“参考样本、距离或核、邻居数、阈值选择和污染测试集固定”决定接受、修正或拒绝学习结论
为什么从这个统计学习任务开始
异常检测页先冻结“正常参照”与阈值来源,再比较不同分数的局部和全局含义。 “第12章 异常检测”的贯穿任务是:对局部密度不同的数据比较LOF、单类SVM和密度比评分,并注入新型异常。 操作前必须写下哪个模型状态、风险项或验证结果会先变化,运行后再补理由不算预测。
本页围绕“怎样在没有普通分类标签时定义参照邻域、支持区域或密度比,并控制异常率?”建立基线、边界反例与恢复路径。只有“第12章 异常检测”守住“参考样本、距离或核、邻居数、阈值选择和污染测试集固定”并交付参考集、缩放、距离/核、邻居、局部密度、支持区域、密度比、阈值、误报漏报和新型异常。,最终指标才构成统计学习证据。
书目、88个原版层级与独立重写边界
讲谈社官方书页确认杉山将《イラストで学ぶ 機械学習》于2013年出版、232页、ISBN 9784061538214,并公开6部分20章;中文版目录与书目用于交叉核对许永伟译、人民邮电出版社2015年版及62个编号小节。覆盖分母为6部分、20章和62个编号小节,共88个原版目录层级。
“第12章 异常检测”未取得原书完整正文,只以权威目录限定范围;中文解释、图示结构、交互、实验、练习与答案均为独立教学重写。异常检测按原版三类方法展开;业务规则另列,不能冒充学习算法。
本页另以技术核对 1、技术核对 2、技术核对 3核对算法机制。论文、作者与出版社资料能验证定义、假设或历史事实,不能反向证明原书正文采用了本站表述。
原版目录层级与统计机制
第IV部分 无监督学习
↡无监督学习对应原版目录坐标“第IV部分 无监督学习”,在“第12章 异常检测”中用于由问题、数据角色与反馈定义学习任务,并受数据角色、分布假设、目标、求解与验证边界约束。原版坐标 1/5。 在“第12章 异常检测”的坐标1中,目录项「第IV部分 无监督学习」用于由问题、数据角色与反馈定义学习任务;先冻结数据角色,再以样本、输出、监督、损失、基线与指标复核,出现先选算法再改写问题时撤回结论。
第12章 异常检测
↡异常检测对应原版目录坐标“第12章 异常检测”,在“第12章 异常检测”中用于由参照分布产生异常分数与阈值,并受数据角色、分布假设、目标、求解与验证边界约束。原版坐标 2/5。 目录项「第12章 异常检测」进入“第12章 异常检测”后要回答第2个问题:它怎样由参照分布产生异常分数与阈值、优化什么、由哪些邻域、核、密度比、阈值、误报漏报和新型异常证明,并如何排除测试异常参与拟合尺度与阈值。
12.1 局部异常因子
↡局部异常因子对应原版目录坐标“12.1 局部异常因子”,在“第12章 异常检测”中用于由参照分布产生异常分数与阈值,并受数据角色、分布假设、目标、求解与验证边界约束。原版坐标 3/5。 围绕“怎样在没有普通分类标签时定义参照邻域、支持区域或密度比,并控制异常率?”,原版层级3把「12.1 局部异常因子」解释为由参照分布产生异常分数与阈值;复核者先读取邻域、核、密度比、阈值、误报漏报和新型异常,不能接受测试异常参与拟合尺度与阈值。
12.2 支持向量机异常检测
↡支持向量机异常检测对应原版目录坐标“12.2 支持向量机异常检测”,在“第12章 异常检测”中用于通过间隔约束与损失学习分类边界,并受数据角色、分布假设、目标、求解与验证边界约束。原版坐标 4/5。 对“第12章 异常检测”而言,目录项「12.2 支持向量机异常检测」的最小合同是通过间隔约束与损失学习分类边界,第4次检查保存核、C、对偶、KKT、支持向量、间隔与验证曲线;若产生未缩放或测试集选核参数,就返回上游重放。
12.3 基于密度比的异常检测
↡基于密度比的异常检测对应原版目录坐标“12.3 基于密度比的异常检测”,在“第12章 异常检测”中用于由参照分布产生异常分数与阈值,并受数据角色、分布假设、目标、求解与验证边界约束。原版坐标 5/5。 第5个正式坐标「12.3 基于密度比的异常检测」服务于比较局部异常因子、单类SVM与密度比异常检测,需要以邻域、核、密度比、阈值、误报漏报和新型异常呈现由参照分布产生异常分数与阈值;测试异常参与拟合尺度与阈值会破坏“参考样本、距离或核、邻居数、阈值选择和污染测试集固定”。
先预测,再操作三个章专属实验
1. 模型空间与风险贡献
固定“对局部密度不同的数据比较LOF、单类SVM和密度比评分,并注入新型异常。”,在基线与边界样本间切换,逐一查看“参考分布、邻域/核表示、异常分数、阈值、新型异常验证”的输入、变换、输出与证据。
模型空间
固定样本,追踪模型到风险
怎样在没有普通分类标签时定义参照邻域、支持区域或密度比,并控制异常率?
条件
对局部密度不同的数据比较LOF、单类SVM和密度比评分,并注入新型异常。 使用冻结训练/验证/测试角色。
预测
沿“参考分布 → 邻域/核表示 → 异常分数 → 阈值 → 新型异常验证”形成预注册输出。
目标
满足“参考样本、距离或核、邻居数、阈值选择和污染测试集固定”。
风险贡献
按本页目标计入经验风险,并与简单基线同口径比较。
阶段输入
第12章 异常检测:冻结的问题、样本与数据角色
变换
登记单位、切分、分布和形状,并守住“参考样本、距离或核、邻居数、阈值选择和污染测试集固定”
阶段输出
可追溯样本
复核证据
数据卡、索引与哈希;若出现“在含测试异常的全量数据上拟合尺度和阈值,造成评估泄漏”就保留失败运行
原版坐标:第IV部分 无监督学习、第12章 异常检测、12.1 局部异常因子、12.2 支持向量机异常检测、12.3 基于密度比的异常检测
第12章 异常检测的可重放统计协议
| 阶段 | 学习动作 | 必留证据 | 拒绝条件 |
|---|---|---|---|
| 参考分布 | 在“第12章 异常检测”执行参考分布,一次只改变预注册变量 | 任务、样本角色、分布、版本与输入 | 数据角色或假设不可追溯 |
| 邻域/核表示 | 在“第12章 异常检测”执行邻域/核表示,一次只改变预注册变量 | 表示、模型、风险、约束、参数或求解轨迹 | 在含测试异常的全量数据上拟合尺度和阈值,造成评估泄漏 |
| 异常分数 | 在“第12章 异常检测”执行异常分数,一次只改变预注册变量 | 表示、模型、风险、约束、参数或求解轨迹 | 在含测试异常的全量数据上拟合尺度和阈值,造成评估泄漏 |
| 阈值 | 在“第12章 异常检测”执行阈值,一次只改变预注册变量 | 表示、模型、风险、约束、参数或求解轨迹 | 在含测试异常的全量数据上拟合尺度和阈值,造成评估泄漏 |
| 新型异常验证 | 在“第12章 异常检测”执行新型异常验证,一次只改变预注册变量 | 独立指标、稳定性、反例与环境 | 无法独立重放或解释失败 |
unit: "iml-12"
question: "怎样在没有普通分类标签时定义参照邻域、支持区域或密度比,并控制异常率?"
scenario: "对局部密度不同的数据比较LOF、单类SVM和密度比评分,并注入新型异常。"
stages: ["参考分布", "邻域/核表示", "异常分数", "阈值", "新型异常验证"]
invariant: "参考样本、距离或核、邻居数、阈值选择和污染测试集固定"
fault: "在含测试异常的全量数据上拟合尺度和阈值,造成评估泄漏"
evidence: "参考集、缩放、距离/核、邻居、局部密度、支持区域、密度比、阈值、误报漏报和新型异常。"
reset: restore_case_stage_trace_mode_step_gates_and_artifact该协议要求“第12章 异常检测”在相同任务、数据角色、分布、代码、环境和种子下重放。重置后若样本情形、阶段、拟合模式、步骤、验证门或证据包没有回到基线,交互状态已经污染比较,不能作为结论。
本页回顾
掌握“第12章 异常检测”不是记住算法名,而是能围绕“怎样在没有普通分类标签时定义参照邻域、支持区域或密度比,并控制异常率?”重建统计假设、风险与验证,并用“参考样本、距离或核、邻居数、阈值选择和污染测试集固定”拒绝“在含测试异常的全量数据上拟合尺度和阈值,造成评估泄漏”。最终交付为参考集、缩放、距离/核、邻居、局部密度、支持区域、密度比、阈值、误报漏报和新型异常。
练习与答案
练习
- 问题 1:统计合同。 “第12章 异常检测”为什么必须先冻结任务、数据角色、分布假设、代码、环境与种子?
- 问题 2:目录逐项覆盖。 怎样证明原版目录坐标已经进入机制、交互和练习?
- 问题 3:反例恢复。 怎样证明“在含测试异常的全量数据上拟合尺度和阈值,造成评估泄漏”已经被修正?
名词解释
名词解释
本章出现的专业名词,用大白话再讲一遍。
- 无监督学习
对应“第IV部分 无监督学习”;在“第12章 异常检测”中用于由问题、数据角色与反馈定义学习任务,需要连接原版范围、统计假设与独立验证。
- 异常检测
对应“第12章 异常检测”;在“第12章 异常检测”中用于由参照分布产生异常分数与阈值,需要连接原版范围、统计假设与独立验证。
- 局部异常因子
对应“12.1 局部异常因子”;在“第12章 异常检测”中用于由参照分布产生异常分数与阈值,需要连接原版范围、统计假设与独立验证。
- 支持向量机异常检测
对应“12.2 支持向量机异常检测”;在“第12章 异常检测”中用于通过间隔约束与损失学习分类边界,需要连接原版范围、统计假设与独立验证。
- 基于密度比的异常检测
对应“12.3 基于密度比的异常检测”;在“第12章 异常检测”中用于由参照分布产生异常分数与阈值,需要连接原版范围、统计假设与独立验证。