《深度学习入门4:强化学习》全书总复习
《深度学习入门4:强化学习》全书总复习逐项覆盖权威目录,以公式、最小轨迹、交互实验和失败对照重建核心。
为什么先冻结交互合同
、、、、、共同构成本页坐标。用同一GridWorld贯通动态规划、蒙特卡罗、TD、Q学习、DQN与Actor-Critic,并比较模型需求和更新目标。
强化学习同时改变数据分布和决策策略,奖励上升可能来自随机幸运、环境状态泄漏、错误终止、自举目标漂移或评估仍在探索。实验开始前固定环境版本、种子、初始状态分布、策略参数、训练预算和评估协议,并写下哪一条中间证据应最先变化。
本页遵循“定义MDP -> 写条件变量与公式 -> 手算最小轨迹 -> 运行单变量实验 -> 对照独立评价 -> 注入失败并重放”。首处分叉出现后停止扩大训练,从环境reset和空派生状态开始复现,不能用最终奖励替代过程证据。
数学骨架
每个方程进入实现前都声明时间索引、条件分布、终止mask和更新前旧值。期望、max、采样动作和目标动作必须区分,神经网络目标要停止梯度,概率比和策略梯度要核对支持集与归一化。
可复现证据工作表
第一栏保存环境版本、reset种子、初始状态、动作空间、奖励定义、终止与截断标志。第二栏按时间记录状态、行为策略概率、动作、奖励、下一状态和目标策略概率;模型型方法再记转移分布,无模型方法保留原始样本身份。
第三栏保存更新前价值、目标值、TD误差、学习率、更新后价值与策略概率。函数近似还要记录网络参数版本、回放索引、目标网络同步时刻和梯度范数。第四栏写独立评价协议:关闭探索和训练随机层,使用固定未见种子,从环境reset重新生成轨迹。
失败对照只改变一个条件,例如错置终止mask、复用旧状态、把SARSA目标换成max、让目标网络参与梯度或使用不覆盖目标策略的行为策略。检测器应在预先声明的第一条证据处报警;若只能从最终奖励发现问题,工作表仍不合格。
核心实现合同
- 环境合同: reset、step、终止、截断和奖励时刻明确,训练与评估不能共享未重置状态。
- 策略合同: 动作概率归一,探索动作与目标动作分别记录;随机种子只用于复现,不用于挑选好结果。
- 目标合同: 收益、贝尔曼目标、TD目标或优势从保存轨迹独立重算,终止后自举为零。
- 更新合同: 使用更新前旧值;表格重复访问和网络批量梯度正确聚合,目标分支按算法要求停止梯度。
- 评价合同: 多个固定种子报告均值、波动和训练预算,评估关闭探索、Dropout与参数更新。
- 回退合同: 首错出现后清空环境、回放、梯度、优化器和目标网络缓存,从原始配置完整重放。
权威目录逐项讲解
第1章 赌场老虎机问题
固定每个动作的真实奖励分布与随机种子,逐步保存动作、奖励、选择次数和估计价值。比较样本平均与常数步长对突变后的追踪速度,并跨多次独立试验报告均值和置信区间。 针对“第1章 赌场老虎机问题”,运行前预测最先变化的转移、价值、TD误差、梯度或策略概率;验收合同为“答案必须同时说明采样分布、目标、更新式、终止处理、失败样本和独立评估,不能只给算法名称或奖励曲线。”。
先固定环境、策略、参数和随机种子,手算一个最小轨迹。若累计奖励看似改善但首个预期证据没有变化,应停止训练,清空回放、梯度、优化器与环境状态后完整重放。
第2章 马尔可夫决策过程
把该小节放回状态、动作、奖励、目标和更新主链,先声明输入输出,再用最小轨迹核对中间证据与失败边界。 针对“第2章 马尔可夫决策过程”,运行前预测最先变化的转移、价值、TD误差、梯度或策略概率;验收合同为“答案必须同时说明采样分布、目标、更新式、终止处理、失败样本和独立评估,不能只给算法名称或奖励曲线。”。
先固定环境、策略、参数和随机种子,手算一个最小轨迹。若累计奖励看似改善但首个预期证据没有变化,应停止训练,清空回放、梯度、优化器与环境状态后完整重放。
第3章 贝尔曼方程
把收益拆成一步奖励与下一状态剩余收益,分别对策略动作和环境转移求期望。最优方程才使用max;固定策略评价使用期望,二者混用会在第一轮备份就出现可检测差异。 针对“第3章 贝尔曼方程”,运行前预测最先变化的转移、价值、TD误差、梯度或策略概率;验收合同为“答案必须同时说明采样分布、目标、更新式、终止处理、失败样本和独立评估,不能只给算法名称或奖励曲线。”。
先固定环境、策略、参数和随机种子,手算一个最小轨迹。若累计奖励看似改善但首个预期证据没有变化,应停止训练,清空回放、梯度、优化器与环境状态后完整重放。
第4章 动态规划法
在小网格中逐状态列出所有动作与下一状态,比较同步副本和原地更新。记录每轮最大变化、策略并列处理与终止状态,直到阈值收敛后再进行策略改善。 针对“第4章 动态规划法”,运行前预测最先变化的转移、价值、TD误差、梯度或策略概率;验收合同为“答案必须同时说明采样分布、目标、更新式、终止处理、失败样本和独立评估,不能只给算法名称或奖励曲线。”。
先固定环境、策略、参数和随机种子,手算一个最小轨迹。若累计奖励看似改善但首个预期证据没有变化,应停止训练,清空回放、梯度、优化器与环境状态后完整重放。
第5章 蒙特卡罗方法
完整采样一个回合后从末尾倒推收益,明确首次访问或每次访问。异策略实验同时保存目标策略概率、行为策略概率和累计重要性比率,避免零覆盖或极端权重被平均曲线掩盖。 针对“第5章 蒙特卡罗方法”,运行前预测最先变化的转移、价值、TD误差、梯度或策略概率;验收合同为“答案必须同时说明采样分布、目标、更新式、终止处理、失败样本和独立评估,不能只给算法名称或奖励曲线。”。
先固定环境、策略、参数和随机种子,手算一个最小轨迹。若累计奖励看似改善但首个预期证据没有变化,应停止训练,清空回放、梯度、优化器与环境状态后完整重放。
第6章 TD方法
在更新前保存旧Q、实际下一动作、贪心目标动作、终止标志与TD目标。SARSA使用行为策略采到的下一动作,Q学习使用max目标;终止转移必须把自举项置零。 针对“第6章 TD方法”,运行前预测最先变化的转移、价值、TD误差、梯度或策略概率;验收合同为“答案必须同时说明采样分布、目标、更新式、终止处理、失败样本和独立评估,不能只给算法名称或奖励曲线。”。
先固定环境、策略、参数和随机种子,手算一个最小轨迹。若累计奖励看似改善但首个预期证据没有变化,应停止训练,清空回放、梯度、优化器与环境状态后完整重放。
第7章 神经网络和Q学习
在更新前保存旧Q、实际下一动作、贪心目标动作、终止标志与TD目标。SARSA使用行为策略采到的下一动作,Q学习使用max目标;终止转移必须把自举项置零。 针对“第7章 神经网络和Q学习”,运行前预测最先变化的转移、价值、TD误差、梯度或策略概率;验收合同为“答案必须同时说明采样分布、目标、更新式、终止处理、失败样本和独立评估,不能只给算法名称或奖励曲线。”。
先固定环境、策略、参数和随机种子,手算一个最小轨迹。若累计奖励看似改善但首个预期证据没有变化,应停止训练,清空回放、梯度、优化器与环境状态后完整重放。
第8章 DQN
为回放项保存状态、动作、奖励、下一状态、终止标志和插入版本;目标网络按明确周期同步。Double DQN分离动作选择与评价,优先回放还要记录采样概率与重要性权重。 针对“第8章 DQN”,运行前预测最先变化的转移、价值、TD误差、梯度或策略概率;验收合同为“答案必须同时说明采样分布、目标、更新式、终止处理、失败样本和独立评估,不能只给算法名称或奖励曲线。”。
先固定环境、策略、参数和随机种子,手算一个最小轨迹。若累计奖励看似改善但首个预期证据没有变化,应停止训练,清空回放、梯度、优化器与环境状态后完整重放。
第9章 策略梯度法
先画智能体与环境边界,声明状态是否满足马尔可夫性、动作集合、转移条件、奖励时刻和终止标志。用一条两三步轨迹手算折扣收益,核对策略在动作轴上归一。 针对“第9章 策略梯度法”,运行前预测最先变化的转移、价值、TD误差、梯度或策略概率;验收合同为“答案必须同时说明采样分布、目标、更新式、终止处理、失败样本和独立评估,不能只给算法名称或奖励曲线。”。
先固定环境、策略、参数和随机种子,手算一个最小轨迹。若累计奖励看似改善但首个预期证据没有变化,应停止训练,清空回放、梯度、优化器与环境状态后完整重放。
第10章 进一步学习
把该小节放回状态、动作、奖励、目标和更新主链,先声明输入输出,再用最小轨迹核对中间证据与失败边界。 针对“第10章 进一步学习”,运行前预测最先变化的转移、价值、TD误差、梯度或策略概率;验收合同为“答案必须同时说明采样分布、目标、更新式、终止处理、失败样本和独立评估,不能只给算法名称或奖励曲线。”。
先固定环境、策略、参数和随机种子,手算一个最小轨迹。若累计奖励看似改善但首个预期证据没有变化,应停止训练,清空回放、梯度、优化器与环境状态后完整重放。
附录A 异策略型的蒙特卡罗方法
先画智能体与环境边界,声明状态是否满足马尔可夫性、动作集合、转移条件、奖励时刻和终止标志。用一条两三步轨迹手算折扣收益,核对策略在动作轴上归一。 针对“附录A 异策略型的蒙特卡罗方法”,运行前预测最先变化的转移、价值、TD误差、梯度或策略概率;验收合同为“答案必须同时说明采样分布、目标、更新式、终止处理、失败样本和独立评估,不能只给算法名称或奖励曲线。”。
先固定环境、策略、参数和随机种子,手算一个最小轨迹。若累计奖励看似改善但首个预期证据没有变化,应停止训练,清空回放、梯度、优化器与环境状态后完整重放。
附录B n-step TD方法
在更新前保存旧Q、实际下一动作、贪心目标动作、终止标志与TD目标。SARSA使用行为策略采到的下一动作,Q学习使用max目标;终止转移必须把自举项置零。 针对“附录B n-step TD方法”,运行前预测最先变化的转移、价值、TD误差、梯度或策略概率;验收合同为“答案必须同时说明采样分布、目标、更新式、终止处理、失败样本和独立评估,不能只给算法名称或奖励曲线。”。
先固定环境、策略、参数和随机种子,手算一个最小轨迹。若累计奖励看似改善但首个预期证据没有变化,应停止训练,清空回放、梯度、优化器与环境状态后完整重放。
附录C Double DQN的理解
为回放项保存状态、动作、奖励、下一状态、终止标志和插入版本;目标网络按明确周期同步。Double DQN分离动作选择与评价,优先回放还要记录采样概率与重要性权重。 针对“附录C Double DQN的理解”,运行前预测最先变化的转移、价值、TD误差、梯度或策略概率;验收合同为“答案必须同时说明采样分布、目标、更新式、终止处理、失败样本和独立评估,不能只给算法名称或奖励曲线。”。
先固定环境、策略、参数和随机种子,手算一个最小轨迹。若累计奖励看似改善但首个预期证据没有变化,应停止训练,清空回放、梯度、优化器与环境状态后完整重放。
附录D 策略梯度法的证明
先画智能体与环境边界,声明状态是否满足马尔可夫性、动作集合、转移条件、奖励时刻和终止标志。用一条两三步轨迹手算折扣收益,核对策略在动作轴上归一。 针对“附录D 策略梯度法的证明”,运行前预测最先变化的转移、价值、TD误差、梯度或策略概率;验收合同为“答案必须同时说明采样分布、目标、更新式、终止处理、失败样本和独立评估,不能只给算法名称或奖励曲线。”。
先固定环境、策略、参数和随机种子,手算一个最小轨迹。若累计奖励看似改善但首个预期证据没有变化,应停止训练,清空回放、梯度、优化器与环境状态后完整重放。
常见失败与边界
本章回顾
用同一GridWorld贯通动态规划、蒙特卡罗、TD、Q学习、DQN与Actor-Critic,并比较模型需求和更新目标。 验收底线是:答案必须同时说明采样分布、目标、更新式、终止处理、失败样本和独立评估,不能只给算法名称或奖励曲线。。掌握标准是能从固定环境预测首个变化、手算最小轨迹、复现实验、解释失败样本,并证明独立评价不读取训练期状态。