第10章 近似推断

第10章 近似推断逐项覆盖作者官方目录,以概率图、最小推导、交互实验和失败对照重建PRML核心证据链。

为什么先写联合分布与条件集合

、、、、、共同构成本页坐标。以 KL 分解和 ELBO 建立变分推断,完整覆盖变分高斯混合、变分线性与逻辑回归、指数族消息传递、局部界及 expectation propagation。

PRML 的主线不是算法清单,而是“模型假设 -> 联合分解 -> 学习 -> 推断 -> 预测 -> 决策”。同一个数值优化器可能服务最大似然、MAP 或变分下界;同一个图结构也可能执行边缘推断或最可能配置。实验记录若不注明目标和条件集合,就无法判断数值相同是正确等价还是偶然碰撞。

本页统一使用证据账本:保存数据版本、样本身份、随机变量支持域、观测与潜变量、参数和超参数、归一化常数、目标每一项、优化或消息更新前后值、随机种子及独立评价切片。指标上升仍可能来自泄漏、广播、协方差退化、下溢、错误条件化或挑选采样链。

数学骨架

logp(X)=L(q)+KL(q(Z)p(ZX))\log p(\mathbf X)=\mathcal L(q)+\mathrm{KL}(q(\mathbf Z)\|p(\mathbf Z\mid\mathbf X)) logqj(Zj)=Eij[logp(X,Z)]+const\log q_j^*(\mathbf Z_j)=\mathbb E_{i\ne j}[\log p(\mathbf X,\mathbf Z)]+\mathrm{const} L(q)=Eq[logp(X,Z)]Eq[logq(Z)]\mathcal L(q)=\mathbb E_q[\log p(\mathbf X,\mathbf Z)]-\mathbb E_q[\log q(\mathbf Z)] qnew(θ)qi(θ)f~inew(θ)q^{\mathrm{new}}(\theta)\propto q^{\setminus i}(\theta)\,\widetilde f_i^{\mathrm{new}}(\theta)

公式进入代码前先声明每个符号的shape、支持域和条件变量。概率必须非负且归一化,协方差与核矩阵要检查对称和半正定,混合权重与责任度要逐样本归一化;对数域计算必须配套 log-sum-exp,不能把下溢后的零当作理论概率。

可复现推断账本

第一栏记录原始样本、切分身份、预处理统计和数据版本;第二栏写联合分布的每个因子、plate 或时间索引,并标出哪些量已观测。第三栏保存目标分解,例如数据项、先验项、熵项、正则项或约束项,确保符号和归一化一致。

第四栏记录优化、消息传递或采样的逐步状态,包括梯度、Hessian、责任度、自然参数、接受率、有效样本数和收敛阈值。第五栏从冻结参数和空缓存重算预测分布与决策风险,禁止复用训练批次统计、旧消息或筛选过的随机种子。

权威目录逐项讲解

10.1 Variational Inference

“10.1 Variational Inference”在本章中承担从变分推断到ELBO的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。

最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.1 Variational Inference”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。

10.1.1 Factorized distributions

“10.1.1 Factorized distributions”在本章中承担从因子分解到变分消息传递的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。

最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.1.1 Factorized distributions”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。

10.1.2 Properties of factorized approximations

“10.1.2 Properties of factorized approximations”在本章中承担从ELBO到局部变分界的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。

最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.1.2 Properties of factorized approximations”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。

10.1.3 Example: The univariate Gaussian

“10.1.3 Example: The univariate Gaussian”在本章中承担从变分消息传递到期望传播的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。

最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.1.3 Example: The univariate Gaussian”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。

10.1.4 Model comparison

“10.1.4 Model comparison”在本章中承担从局部变分界到变分推断的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。

最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.1.4 Model comparison”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。

10.2 Illustration: Variational Mixture of Gaussians

“10.2 Illustration: Variational Mixture of Gaussians”在本章中承担从期望传播到因子分解的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。

最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.2 Illustration: Variational Mixture of Gaussians”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。

10.2.1 Variational distribution

“10.2.1 Variational distribution”在本章中承担从变分推断到ELBO的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。

最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.2.1 Variational distribution”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。

10.2.2 Variational lower bound

“10.2.2 Variational lower bound”在本章中承担从因子分解到变分消息传递的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。

最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.2.2 Variational lower bound”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。

10.2.3 Predictive density

“10.2.3 Predictive density”在本章中承担从ELBO到局部变分界的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。

最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.2.3 Predictive density”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。

10.2.4 Determining the number of components

“10.2.4 Determining the number of components”在本章中承担从变分消息传递到期望传播的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。

最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.2.4 Determining the number of components”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。

10.2.5 Induced factorizations

“10.2.5 Induced factorizations”在本章中承担从局部变分界到变分推断的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。

最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.2.5 Induced factorizations”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。

10.3 Variational Linear Regression

“10.3 Variational Linear Regression”在本章中承担从期望传播到因子分解的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。

最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.3 Variational Linear Regression”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。

10.3.1 Variational distribution

“10.3.1 Variational distribution”在本章中承担从变分推断到ELBO的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。

最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.3.1 Variational distribution”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。

10.3.2 Predictive distribution

“10.3.2 Predictive distribution”在本章中承担从因子分解到变分消息传递的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。

最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.3.2 Predictive distribution”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。

10.3.3 Lower bound

“10.3.3 Lower bound”在本章中承担从ELBO到局部变分界的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。

最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.3.3 Lower bound”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。

10.4 Exponential Family Distributions

“10.4 Exponential Family Distributions”在本章中承担从变分消息传递到期望传播的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。

最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.4 Exponential Family Distributions”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。

10.4.1 Variational message passing

“10.4.1 Variational message passing”在本章中承担从局部变分界到变分推断的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。

最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.4.1 Variational message passing”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。

10.5 Local Variational Methods

“10.5 Local Variational Methods”在本章中承担从期望传播到因子分解的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。

最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.5 Local Variational Methods”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。

10.6 Variational Logistic Regression

“10.6 Variational Logistic Regression”在本章中承担从变分推断到ELBO的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。

最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.6 Variational Logistic Regression”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。

10.6.1 Variational posterior distribution

“10.6.1 Variational posterior distribution”在本章中承担从因子分解到变分消息传递的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。

最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.6.1 Variational posterior distribution”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。

10.6.2 Optimizing the variational parameters

“10.6.2 Optimizing the variational parameters”在本章中承担从ELBO到局部变分界的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。

最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.6.2 Optimizing the variational parameters”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。

10.6.3 Inference of hyperparameters

“10.6.3 Inference of hyperparameters”在本章中承担从变分消息传递到期望传播的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。

最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.6.3 Inference of hyperparameters”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。

10.7 Expectation Propagation

“10.7 Expectation Propagation”在本章中承担从局部变分界到变分推断的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。

最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.7 Expectation Propagation”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。

10.7.1 Example: The clutter problem

“10.7.1 Example: The clutter problem”在本章中承担从期望传播到因子分解的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。

最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.7.1 Example: The clutter problem”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。

10.7.2 Expectation propagation on graphs

“10.7.2 Expectation propagation on graphs”在本章中承担从变分推断到ELBO的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。

最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.7.2 Expectation propagation on graphs”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。

七类实现证据

概率模型合同

先列随机变量、支持域、条件独立和联合分解,再决定参数化。对第10章 近似推断,必须从联合分布恢复所用条件分布,并验证每个离散求和或连续积分归一化。若代码只暴露损失标量,应额外导出因子级对数概率,防止常数项、轴或符号被误删。

shape与数值合同

逐项标注样本轴、特征轴、类别轴、成分轴、时间轴和潜变量轴。矩阵乘法前后保存shape,对协方差、精度、Gram 和 Hessian 检查对称性;在极端概率下同时比较普通域与对数域,预先规定有限值和正定性断言。

学习合同

固定数据与初值,手算一次最大似然、MAP、EM、梯度或闭式更新,并与实现逐项比较。超参数学习必须与参数学习分账,训练停止条件不能读取测试集;若使用近似优化,要记录目标单调性、梯度范数和容差。

推断合同

明确查询变量与证据变量,区分精确边缘化、MAP、变分近似、Laplace、EP 和 Monte Carlo。正常路径与故障路径只改变一个因子或近似假设,检测器必须在消息、后验参数、ELBO 或样本统计处先于最终预测报警。

预测合同

预测分布要积分参数和潜变量的不确定性,或明确说明采用了点估计。分类同时报告类别概率、校准和阈值,回归同时报告均值与方差;生成样本要保留对应潜变量、随机种子与条件输入,不能只挑选好看的输出。

决策与评价合同

将预测概率与损失函数分开:同一后验在不同误分类代价、拒绝选项或回归损失下可能产生不同动作。评价切片必须独立于学习和模型选择,报告基线、置信区间、失败类别与数据漂移,而不是只给一个平均分。

回退合同

第一条证据不一致时,从原始样本、固定配置和空派生状态重放。依次检查数据身份、条件集合、shape、联合因子、目标分解、更新、推断与决策;每修一处只重放最小模型,直到中间量一致后才扩大数据或预算。

常见失败与边界

本章回顾

以 KL 分解和 ELBO 建立变分推断,完整覆盖变分高斯混合、变分线性与逻辑回归、指数族消息传递、局部界及 expectation propagation。验收底线是:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。掌握标准是能在未运行前预测首个变化,手算最小概率模型,复现实验,解释失败样本,并证明独立评价不读取训练或推断缓存。

讨论

评论区加载中…