第6章 逻辑斯谛回归与最大熵模型
第6章 逻辑斯谛回归与最大熵模型覆盖14个正式节点,以手算、章专属交互、前提反例和独立评价验收。
为什么从“概率与最大熵约束台”开始
第6章 逻辑斯谛回归与最大熵模型不能只靠术语和最终分数验收。概率与最大熵约束台先把数据与符号冻结,再把模型空间、学习目标、计算步骤和独立评价分开;这样任何异常都能回退到第一项错误中间量,而不是在准确率或可视化之后补故事。
先预测线性得分从“零”进入“正”时,概率与最大熵约束台命中率与优化状态偏差风险怎样变化。交互数值只表达公开的因果方向,不冒充真实训练结果。
来源、版次与独立重写边界
清华大学出版社官方产品页确认李航《统计学习方法》第2版、2019年、ISBN 9787302517276和监督/无监督两篇结构;官方完整目录逐项核定22章、256个编号节/小节与附录A–E,共285个正式层级。第6章 逻辑斯谛回归与最大熵模型未取得出版正文授权,目录只界定范围,不宣称复现原书正文。
第6章 逻辑斯谛回归与最大熵模型的计算语义还与scikit-learn官方用户指南、NumPy SVD文档和SciPy统计分布文档中适用部分交叉核对;它们不替代本章推导,也不被误报为原书授权。中文解释、手算、图示、实验、反例与答案均为独立教学重写。
本章术语与数学合同
、、、、、。
本章不变量是“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”。数据身份、训练/验证/测试折分、预处理统计、特征顺序、随机种子、浮点精度与停止准则必须随实验保存;修复后从原始数据重算,不复用污染的缓存、责任度、矩阵分解、链状态或评价结果。
章专属数学骨架
二项逻辑斯谛模型令后验对数几率成为输入的线性函数,并通过极大似然估计参数。 实现还要检查张量或矩阵形状、有限值、概率归一、正交或KKT残差、目标单调性、梯度方向和停止容差。
核心机制与适用边界
- 逻辑斯谛回归是判别概率模型,直接估计给定输入的类别条件概率。
- 二项模型的线性部分作用于对数几率,多项模型使用softmax归一并需处理参数冗余。
- 最大熵原理在满足已知约束的分布中选择熵最大者,避免加入未由数据支持的额外偏好。
- 特征函数经验期望与模型期望相等构成约束,拉格朗日对偶导出指数形式。
- 最大熵极大似然和对偶最优化具有同一目标视角,需核对配分函数和梯度。
- IIS逐坐标改善参数,拟牛顿用曲率近似加速;二者应在同一似然和容差下比较。
官方目录逐项深读
第6章 逻辑斯谛回归与最大熵模型
四级证据 1/14。 第6章 逻辑斯谛回归与最大熵模型:写出随机变量、空间、参数、归一条件与可识别性,不用算法名称替代数学对象。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为第6章 逻辑斯谛回归与最大熵模型。
对于第6章 逻辑斯谛回归与最大熵模型这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。
6.1 逻辑斯谛回归模型
四级证据 2/14。 6.1 逻辑斯谛回归模型:写出随机变量、空间、参数、归一条件与可识别性,不用算法名称替代数学对象。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为6.1 逻辑斯谛回归模型。
对于6.1 逻辑斯谛回归模型这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。
6.1.1 逻辑斯谛分布
四级证据 3/14。 6.1.1 逻辑斯谛分布:把该节点放回模型—策略—算法链,说明输入、输出、假设和第一项可观察中间量。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为6.1.1 逻辑斯谛分布。
对于6.1.1 逻辑斯谛分布这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。
6.1.2 二项逻辑斯谛回归模型
四级证据 4/14。 6.1.2 二项逻辑斯谛回归模型:写出随机变量、空间、参数、归一条件与可识别性,不用算法名称替代数学对象。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为6.1.2 二项逻辑斯谛回归模型。
对于6.1.2 二项逻辑斯谛回归模型这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。
6.1.3 模型参数估计
四级证据 5/14。 6.1.3 模型参数估计:写出随机变量、空间、参数、归一条件与可识别性,不用算法名称替代数学对象。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为6.1.3 模型参数估计。
对于6.1.3 模型参数估计这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。
6.1.4 多项逻辑斯谛回归
四级证据 6/14。 6.1.4 多项逻辑斯谛回归:固定数据、基线、损失和错误代价,区分训练目标改善与独立任务收益。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为6.1.4 多项逻辑斯谛回归。
对于6.1.4 多项逻辑斯谛回归这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。
6.2 最大熵模型
四级证据 7/14。 6.2 最大熵模型:写出随机变量、空间、参数、归一条件与可识别性,不用算法名称替代数学对象。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为第6章 逻辑斯谛回归与最大熵模型。
对于6.2 最大熵模型这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。
6.2.1 最大熵原理
四级证据 8/14。 6.2.1 最大熵原理:写出随机变量、空间、参数、归一条件与可识别性,不用算法名称替代数学对象。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为6.1 逻辑斯谛回归模型。
对于6.2.1 最大熵原理这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。
6.2.2 最大熵模型的定义
四级证据 9/14。 6.2.2 最大熵模型的定义:写出随机变量、空间、参数、归一条件与可识别性,不用算法名称替代数学对象。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为6.1.1 逻辑斯谛分布。
对于6.2.2 最大熵模型的定义这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。
6.2.3 最大熵模型的学习
四级证据 10/14。 6.2.3 最大熵模型的学习:写出随机变量、空间、参数、归一条件与可识别性,不用算法名称替代数学对象。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为6.1.2 二项逻辑斯谛回归模型。
对于6.2.3 最大熵模型的学习这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。
6.2.4 极大似然估计
四级证据 11/14。 6.2.4 极大似然估计:在可枚举小样本上执行一步更新,保存输入、充分统计、参数前后值、目标差和停止残差。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为6.1.3 模型参数估计。
对于6.2.4 极大似然估计这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。
6.3 模型学习的最优化算法
四级证据 12/14。 6.3 模型学习的最优化算法:写出随机变量、空间、参数、归一条件与可识别性,不用算法名称替代数学对象。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为6.1.4 多项逻辑斯谛回归。
对于6.3 模型学习的最优化算法这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。
6.3.1 改进的迭代尺度法
四级证据 13/14。 6.3.1 改进的迭代尺度法:把该节点放回模型—策略—算法链,说明输入、输出、假设和第一项可观察中间量。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为第6章 逻辑斯谛回归与最大熵模型。
对于6.3.1 改进的迭代尺度法这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。
6.3.2 拟牛顿法
四级证据 14/14。 6.3.2 拟牛顿法:把该节点放回模型—策略—算法链,说明输入、输出、假设和第一项可观察中间量。本节点固定优化状态,只改变线性得分,用“特征函数、参考类别、概率归一和似然符号必须一致;优化停止以梯度或目标残差为准,概率输出需独立校准。”判断计算是否仍在适用边界内;观察点为6.1 逻辑斯谛回归模型。
对于6.3.2 拟牛顿法这个节点,先预测从“零”切到“正”后,哪一个概率、距离、间隔、谱、目标或残差最先变化。运行极小样本后若方向不符,优先检查数据折分、尺度、索引、归一和符号,而不是用末端分数掩盖第一处错误。