第10章 近似推断
第10章 近似推断逐项覆盖作者官方目录,以概率图、最小推导、交互实验和失败对照重建PRML核心证据链。
为什么先写联合分布与条件集合
、、、、、共同构成本页坐标。以 KL 分解和 ELBO 建立变分推断,完整覆盖变分高斯混合、变分线性与逻辑回归、指数族消息传递、局部界及 expectation propagation。
PRML 的主线不是算法清单,而是“模型假设 -> 联合分解 -> 学习 -> 推断 -> 预测 -> 决策”。同一个数值优化器可能服务最大似然、MAP 或变分下界;同一个图结构也可能执行边缘推断或最可能配置。实验记录若不注明目标和条件集合,就无法判断数值相同是正确等价还是偶然碰撞。
本页统一使用证据账本:保存数据版本、样本身份、随机变量支持域、观测与潜变量、参数和超参数、归一化常数、目标每一项、优化或消息更新前后值、随机种子及独立评价切片。指标上升仍可能来自泄漏、广播、协方差退化、下溢、错误条件化或挑选采样链。
数学骨架
公式进入代码前先声明每个符号的shape、支持域和条件变量。概率必须非负且归一化,协方差与核矩阵要检查对称和半正定,混合权重与责任度要逐样本归一化;对数域计算必须配套 log-sum-exp,不能把下溢后的零当作理论概率。
可复现推断账本
第一栏记录原始样本、切分身份、预处理统计和数据版本;第二栏写联合分布的每个因子、plate 或时间索引,并标出哪些量已观测。第三栏保存目标分解,例如数据项、先验项、熵项、正则项或约束项,确保符号和归一化一致。
第四栏记录优化、消息传递或采样的逐步状态,包括梯度、Hessian、责任度、自然参数、接受率、有效样本数和收敛阈值。第五栏从冻结参数和空缓存重算预测分布与决策风险,禁止复用训练批次统计、旧消息或筛选过的随机种子。
权威目录逐项讲解
10.1 Variational Inference
“10.1 Variational Inference”在本章中承担从变分推断到ELBO的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。
最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.1 Variational Inference”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。
10.1.1 Factorized distributions
“10.1.1 Factorized distributions”在本章中承担从因子分解到变分消息传递的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。
最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.1.1 Factorized distributions”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。
10.1.2 Properties of factorized approximations
“10.1.2 Properties of factorized approximations”在本章中承担从ELBO到局部变分界的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。
最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.1.2 Properties of factorized approximations”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。
10.1.3 Example: The univariate Gaussian
“10.1.3 Example: The univariate Gaussian”在本章中承担从变分消息传递到期望传播的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。
最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.1.3 Example: The univariate Gaussian”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。
10.1.4 Model comparison
“10.1.4 Model comparison”在本章中承担从局部变分界到变分推断的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。
最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.1.4 Model comparison”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。
10.2 Illustration: Variational Mixture of Gaussians
“10.2 Illustration: Variational Mixture of Gaussians”在本章中承担从期望传播到因子分解的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。
最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.2 Illustration: Variational Mixture of Gaussians”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。
10.2.1 Variational distribution
“10.2.1 Variational distribution”在本章中承担从变分推断到ELBO的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。
最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.2.1 Variational distribution”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。
10.2.2 Variational lower bound
“10.2.2 Variational lower bound”在本章中承担从因子分解到变分消息传递的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。
最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.2.2 Variational lower bound”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。
10.2.3 Predictive density
“10.2.3 Predictive density”在本章中承担从ELBO到局部变分界的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。
最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.2.3 Predictive density”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。
10.2.4 Determining the number of components
“10.2.4 Determining the number of components”在本章中承担从变分消息传递到期望传播的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。
最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.2.4 Determining the number of components”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。
10.2.5 Induced factorizations
“10.2.5 Induced factorizations”在本章中承担从局部变分界到变分推断的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。
最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.2.5 Induced factorizations”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。
10.3 Variational Linear Regression
“10.3 Variational Linear Regression”在本章中承担从期望传播到因子分解的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。
最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.3 Variational Linear Regression”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。
10.3.1 Variational distribution
“10.3.1 Variational distribution”在本章中承担从变分推断到ELBO的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。
最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.3.1 Variational distribution”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。
10.3.2 Predictive distribution
“10.3.2 Predictive distribution”在本章中承担从因子分解到变分消息传递的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。
最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.3.2 Predictive distribution”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。
10.3.3 Lower bound
“10.3.3 Lower bound”在本章中承担从ELBO到局部变分界的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。
最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.3.3 Lower bound”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。
10.4 Exponential Family Distributions
“10.4 Exponential Family Distributions”在本章中承担从变分消息传递到期望传播的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。
最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.4 Exponential Family Distributions”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。
10.4.1 Variational message passing
“10.4.1 Variational message passing”在本章中承担从局部变分界到变分推断的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。
最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.4.1 Variational message passing”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。
10.5 Local Variational Methods
“10.5 Local Variational Methods”在本章中承担从期望传播到因子分解的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。
最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.5 Local Variational Methods”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。
10.6 Variational Logistic Regression
“10.6 Variational Logistic Regression”在本章中承担从变分推断到ELBO的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。
最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.6 Variational Logistic Regression”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。
10.6.1 Variational posterior distribution
“10.6.1 Variational posterior distribution”在本章中承担从因子分解到变分消息传递的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。
最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.6.1 Variational posterior distribution”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。
10.6.2 Optimizing the variational parameters
“10.6.2 Optimizing the variational parameters”在本章中承担从ELBO到局部变分界的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。
最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.6.2 Optimizing the variational parameters”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。
10.6.3 Inference of hyperparameters
“10.6.3 Inference of hyperparameters”在本章中承担从变分消息传递到期望传播的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。
最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.6.3 Inference of hyperparameters”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。
10.7 Expectation Propagation
“10.7 Expectation Propagation”在本章中承担从局部变分界到变分推断的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。
最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.7 Expectation Propagation”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。
10.7.1 Example: The clutter problem
“10.7.1 Example: The clutter problem”在本章中承担从期望传播到因子分解的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。
最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.7.1 Example: The clutter problem”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。
10.7.2 Expectation propagation on graphs
“10.7.2 Expectation propagation on graphs”在本章中承担从变分推断到ELBO的推导节点。阅读时先写清随机变量、已知条件、待估参数和输出量,再决定是在联合分布上做边缘化、条件化、优化还是采样;只记算法名称会掩盖概率语义。把每个求和、积分与矩阵乘法的轴写在旁边,并标注归一化常数是否依赖待优化变量。
最小实验固定两到八个样本、参数初值、数据切分和随机种子。先预测改变一个条件后,最早变化的是充分统计量、对数似然、后验参数、消息、责任度、采样权重还是决策风险;随后保存中间量并从原始输入独立重算。针对“10.7.2 Expectation propagation on graphs”,验收仍服从本页标准:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。若首个证据未按预测变化,立即停止扩大模型并检查条件集合、shape、归一化和缓存版本。
七类实现证据
概率模型合同
先列随机变量、支持域、条件独立和联合分解,再决定参数化。对第10章 近似推断,必须从联合分布恢复所用条件分布,并验证每个离散求和或连续积分归一化。若代码只暴露损失标量,应额外导出因子级对数概率,防止常数项、轴或符号被误删。
shape与数值合同
逐项标注样本轴、特征轴、类别轴、成分轴、时间轴和潜变量轴。矩阵乘法前后保存shape,对协方差、精度、Gram 和 Hessian 检查对称性;在极端概率下同时比较普通域与对数域,预先规定有限值和正定性断言。
学习合同
固定数据与初值,手算一次最大似然、MAP、EM、梯度或闭式更新,并与实现逐项比较。超参数学习必须与参数学习分账,训练停止条件不能读取测试集;若使用近似优化,要记录目标单调性、梯度范数和容差。
推断合同
明确查询变量与证据变量,区分精确边缘化、MAP、变分近似、Laplace、EP 和 Monte Carlo。正常路径与故障路径只改变一个因子或近似假设,检测器必须在消息、后验参数、ELBO 或样本统计处先于最终预测报警。
预测合同
预测分布要积分参数和潜变量的不确定性,或明确说明采用了点估计。分类同时报告类别概率、校准和阈值,回归同时报告均值与方差;生成样本要保留对应潜变量、随机种子与条件输入,不能只挑选好看的输出。
决策与评价合同
将预测概率与损失函数分开:同一后验在不同误分类代价、拒绝选项或回归损失下可能产生不同动作。评价切片必须独立于学习和模型选择,报告基线、置信区间、失败类别与数据漂移,而不是只给一个平均分。
回退合同
第一条证据不一致时,从原始样本、固定配置和空派生状态重放。依次检查数据身份、条件集合、shape、联合因子、目标分解、更新、推断与决策;每修一处只重放最小模型,直到中间量一致后才扩大数据或预算。
常见失败与边界
本章回顾
以 KL 分解和 ELBO 建立变分推断,完整覆盖变分高斯混合、变分线性与逻辑回归、指数族消息传递、局部界及 expectation propagation。验收底线是:能逐项计算 ELBO、验证坐标更新不降低下界,区分 KL 方向导致的 mode-seeking 行为,并记录 EP 的 cavity、tilted 与矩匹配。掌握标准是能在未运行前预测首个变化,手算最小概率模型,复现实验,解释失败样本,并证明独立评价不读取训练或推断缓存。