第6章 逻辑斯谛回归与最大熵模型

第6章 逻辑斯谛回归与最大熵模型覆盖14个正式节点,以手算、章专属交互、前提反例和独立评价验收。

为什么从“概率与最大熵约束台”开始

第6章 逻辑斯谛回归与最大熵模型不能只靠术语和最终分数验收。概率与最大熵约束台先把数据与符号冻结,再把模型空间、学习目标、计算步骤和独立评价分开;这样任何异常都能回退到第一项错误中间量,而不是在准确率或可视化之后补故事。

先预测线性得分从“零”进入“正”时,概率与最大熵约束台命中率与优化状态偏差风险怎样变化。交互数值只表达公开的因果方向,不冒充真实训练结果。

来源、版次与独立重写边界

清华大学出版社官方产品页确认李航《统计学习方法》第2版、2019年、ISBN 9787302517276和监督/无监督两篇结构;官方完整目录逐项核定22章、256个编号节/小节与附录A–E,共285个正式层级。第6章 逻辑斯谛回归与最大熵模型未取得出版正文授权,目录只界定范围,不宣称复现原书正文。

第6章 逻辑斯谛回归与最大熵模型的计算语义还与scikit-learn官方用户指南NumPy SVD文档SciPy统计分布文档中适用部分交叉核对;它们不替代本章推导,也不被误报为原书授权。中文解释、手算、图示、实验、反例与答案均为独立教学重写。

本章术语与数学合同

、、、、、。

本章不变量是“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”。数据身份、训练/验证/测试折分、预处理统计、特征顺序、随机种子、浮点精度与停止准则必须随实验保存;修复后从原始数据重算,不复用污染的缓存、责任度、矩阵分解、链状态或评价结果。

章专属数学骨架

P(Y=1x)=exp(wTx)1+exp(wTx).P(Y=1\mid x)=\frac{\exp(w^Tx)}{1+\exp(w^Tx)}.

二项逻辑斯谛模型令后验对数几率成为输入的线性函数,并通过极大似然估计参数。 实现还要检查张量或矩阵形状、有限值、概率归一、正交或KKT残差、目标单调性、梯度方向和停止容差。

核心机制与适用边界

  1. 逻辑斯谛回归是判别概率模型,直接估计给定输入的类别条件概率。
  2. 二项模型的线性部分作用于对数几率,多项模型使用softmax归一并需处理参数冗余。
  3. 最大熵原理在满足已知约束的分布中选择熵最大者,避免加入未由数据支持的额外偏好。
  4. 特征函数经验期望与模型期望相等构成约束,拉格朗日对偶导出指数形式。
  5. 最大熵极大似然和对偶最优化具有同一目标视角,需核对配分函数和梯度。
  6. IIS逐坐标改善参数,拟牛顿用曲率近似加速;二者应在同一似然和容差下比较。

官方目录逐项深读

第6章 逻辑斯谛回归与最大熵模型

四级证据 1/14。 第6章 逻辑斯谛回归与最大熵模型:写出随机变量、空间、参数、归一条件与可识别性,不用算法名称替代数学对象。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为第6章 逻辑斯谛回归与最大熵模型。

对于第6章 逻辑斯谛回归与最大熵模型这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。

6.1 逻辑斯谛回归模型

四级证据 2/14。 6.1 逻辑斯谛回归模型:写出随机变量、空间、参数、归一条件与可识别性,不用算法名称替代数学对象。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为6.1 逻辑斯谛回归模型。

对于6.1 逻辑斯谛回归模型这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。

6.1.1 逻辑斯谛分布

四级证据 3/14。 6.1.1 逻辑斯谛分布:把该节点放回模型—策略—算法链,说明输入、输出、假设和第一项可观察中间量。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为6.1.1 逻辑斯谛分布。

对于6.1.1 逻辑斯谛分布这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。

6.1.2 二项逻辑斯谛回归模型

四级证据 4/14。 6.1.2 二项逻辑斯谛回归模型:写出随机变量、空间、参数、归一条件与可识别性,不用算法名称替代数学对象。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为6.1.2 二项逻辑斯谛回归模型。

对于6.1.2 二项逻辑斯谛回归模型这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。

6.1.3 模型参数估计

四级证据 5/14。 6.1.3 模型参数估计:写出随机变量、空间、参数、归一条件与可识别性,不用算法名称替代数学对象。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为6.1.3 模型参数估计。

对于6.1.3 模型参数估计这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。

6.1.4 多项逻辑斯谛回归

四级证据 6/14。 6.1.4 多项逻辑斯谛回归:固定数据、基线、损失和错误代价,区分训练目标改善与独立任务收益。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为6.1.4 多项逻辑斯谛回归。

对于6.1.4 多项逻辑斯谛回归这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。

6.2 最大熵模型

四级证据 7/14。 6.2 最大熵模型:写出随机变量、空间、参数、归一条件与可识别性,不用算法名称替代数学对象。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为第6章 逻辑斯谛回归与最大熵模型。

对于6.2 最大熵模型这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。

6.2.1 最大熵原理

四级证据 8/14。 6.2.1 最大熵原理:写出随机变量、空间、参数、归一条件与可识别性,不用算法名称替代数学对象。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为6.1 逻辑斯谛回归模型。

对于6.2.1 最大熵原理这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。

6.2.2 最大熵模型的定义

四级证据 9/14。 6.2.2 最大熵模型的定义:写出随机变量、空间、参数、归一条件与可识别性,不用算法名称替代数学对象。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为6.1.1 逻辑斯谛分布。

对于6.2.2 最大熵模型的定义这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。

6.2.3 最大熵模型的学习

四级证据 10/14。 6.2.3 最大熵模型的学习:写出随机变量、空间、参数、归一条件与可识别性,不用算法名称替代数学对象。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为6.1.2 二项逻辑斯谛回归模型。

对于6.2.3 最大熵模型的学习这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。

6.2.4 极大似然估计

四级证据 11/14。 6.2.4 极大似然估计:在可枚举小样本上执行一步更新,保存输入、充分统计、参数前后值、目标差和停止残差。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为6.1.3 模型参数估计。

对于6.2.4 极大似然估计这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。

6.3 模型学习的最优化算法

四级证据 12/14。 6.3 模型学习的最优化算法:写出随机变量、空间、参数、归一条件与可识别性,不用算法名称替代数学对象。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为6.1.4 多项逻辑斯谛回归。

对于6.3 模型学习的最优化算法这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。

6.3.1 改进的迭代尺度法

四级证据 13/14。 6.3.1 改进的迭代尺度法:把该节点放回模型—策略—算法链,说明输入、输出、假设和第一项可观察中间量。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为第6章 逻辑斯谛回归与最大熵模型。

对于6.3.1 改进的迭代尺度法这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。

6.3.2 拟牛顿法

四级证据 14/14。 6.3.2 拟牛顿法:把该节点放回模型—策略—算法链,说明输入、输出、假设和第一项可观察中间量。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为6.1 逻辑斯谛回归模型。

对于6.3.2 拟牛顿法这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。

三个必须主动触发的误区

练习、答案与285节点验证

讨论

评论区加载中…