第5章 SARSA算法
比较SARSA、Q学习、多步TD、蒙特卡洛与自举的目标构造和策略角色;用环境合同、更新轨迹和独立评估门交付逐步目标、TD误差、Q表差异与n步截断记录
学习目标
- 能说明“第5章 SARSA算法”如何比较SARSA、Q学习、多步TD、蒙特卡洛与自举的目标构造和策略角色,并区分原版目录、作者代码映射、独立技术来源和本站重写
- 能先预测“行为策略真实选择的下一动作怎样进入同策略SARSA目标?”会改变哪一个环境、轨迹、回报、目标、策略或评估状态,再操作三类交互证据
- 能只注入“用下一状态最大Q值替代行为策略实际选择的下一动作”,定位首个偏离“同一轨迹、行为概率、步数、折扣与终止规则下只改变目标定义”的状态,并从同一快照完成恢复
为什么从这个问题开始
“第5章 SARSA算法”围绕“行为策略真实选择的下一动作怎样进入同策略SARSA目标?”建立贯穿任务:让SARSA与Q学习复用同一批轨迹和Q表。先写下哪个环境、轨迹、回报、目标、策略或评估状态会最先变化,再运行参考、故障和恢复路径;运行后补理由不算预测。只有守住“同一轨迹、行为概率、步数、折扣与终止规则下只改变目标定义”并交付逐步目标、TD误差、Q表差异与n步截断记录,训练回报、策略价值、搜索统计或应用收益才构成机制证据。
原版书目、272个正式坐标与访问边界
“第5章 SARSA算法”以作者官方代码仓库核对王树森、黎彧君、张志华著《深度强化学习》的第1至19章及主要算法—实现映射,以馆藏书目核对人民邮电出版社、2022年11月、294页和ISBN 9787115600691,再以发行数字版完整目录核对5个部分、19章、233个编号节/小节、附录A、附录B与B.1至B.13,合计272个正式目录层级。
作者仓库验证章节和算法实现确实对应,但仓库页面未提供可据以复用代码、图表或书稿的明确许可;发行数字版用于核对目录范围,不作为复制正文的授权。“第5章 SARSA算法”不翻译、摘编或改写原书正文,也不复制仓库代码;中文讲解、状态轨迹、反例、交互、练习与答案均为独立教学重写。
本页独立核对 1、本页独立核对 2只用于独立核对本页算法、环境接口或实验边界,不能反向证明原书使用本站表述。Gymnasium、PyTorch、PettingZoo等当前API行为按2026-07-30核对并显式视为当前实现,不倒填为2022年原书内容。
原版目录层级与可验证机制
第5章 SARSA算法
↡SARSA算法对应正式目录坐标“第5章 SARSA算法”,在“第5章 SARSA算法”中用于构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 1/17。 原版目录键 第5章 SARSA算法。在“第5章 SARSA算法”的第1个正式坐标中,「第5章 SARSA算法」通过构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色推进同策略、自举与多步回报;复核者保存回放索引、下一动作、TD目标、误差、优先级和参数快照,出现目标网络泄漏、策略角色错位或多技巧同时变化就撤回结论。
5·1 表格形式的SARSA
↡表格形式的SARSA对应正式目录坐标“5.1 表格形式的SARSA”,在“第5章 SARSA算法”中用于构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 2/17。 原版目录键 5.1 表格形式的SARSA。围绕“行为策略真实选择的下一动作怎样进入同策略SARSA目标?”,“第5章 SARSA算法”在坐标2把「5·1 表格形式的SARSA」落实为构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色;只有回放索引、下一动作、TD目标、误差、优先级和参数快照可重放且反例排除目标网络泄漏、策略角色错位或多技巧同时变化,本节点才算掌握。
5·1·1 算法推导
↡算法推导对应正式目录坐标“5.1.1 算法推导”,在“第5章 SARSA算法”中用于把“算法推导”放进同策略、自举与多步回报的环境—轨迹—目标—更新链,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 3/17。 原版目录键 5.1.1 算法推导。“第5章 SARSA算法”的目录节点3「5·1·1 算法推导」不能停在术语复述:它要把“算法推导”放进同策略、自举与多步回报的环境—轨迹—目标—更新链,交付第5章 SARSA算法的输入角色、中间状态、策略快照、反例与独立评估,并把只复述“算法推导”名称而没有可观察状态、单一故障和恢复证据设为单一反事实。
5·1·2 训练流程
↡训练流程对应正式目录坐标“5.1.2 训练流程”,在“第5章 SARSA算法”中用于把“训练流程”放进同策略、自举与多步回报的环境—轨迹—目标—更新链,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 4/17。 原版目录键 5.1.2 训练流程。对“第5章 SARSA算法”而言,「5·1·2 训练流程」在第4次检查中改变可观察状态,因为它负责把“训练流程”放进同策略、自举与多步回报的环境—轨迹—目标—更新链;第5章 SARSA算法的输入角色、中间状态、策略快照、反例与独立评估必须与“同一轨迹、行为概率、步数、折扣与终止规则下只改变目标定义”对齐,不能接受只复述“训练流程”名称而没有可观察状态、单一故障和恢复证据。
5·1·3 Q学习与SARSA的对比
↡Q学习与SARSA的对比对应正式目录坐标“5.1.3 Q学习与SARSA的对比”,在“第5章 SARSA算法”中用于构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 5/17。 原版目录键 5.1.3 Q学习与SARSA的对比。在“第5章 SARSA算法”的第5个正式坐标中,「5·1·3 Q学习与SARSA的对比」通过构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色推进同策略、自举与多步回报;复核者保存回放索引、下一动作、TD目标、误差、优先级和参数快照,出现目标网络泄漏、策略角色错位或多技巧同时变化就撤回结论。
5·2 神经网络形式的SARSA
↡神经网络形式的SARSA对应正式目录坐标“5.2 神经网络形式的SARSA”,在“第5章 SARSA算法”中用于明确输入/输出shape、损失、局部导数和参数更新,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 6/17。 原版目录键 5.2 神经网络形式的SARSA。围绕“行为策略真实选择的下一动作怎样进入同策略SARSA目标?”,“第5章 SARSA算法”在坐标6把「5·2 神经网络形式的SARSA」落实为明确输入/输出shape、损失、局部导数和参数更新;只有shape、前向值、损失分量、梯度与有限差分可重放且反例排除数值可运行却混淆样本轴、动作轴、类别轴或梯度缩放,本节点才算掌握。
5·2·1 价值网络
↡价值网络对应正式目录坐标“5.2.1 价值网络”,在“第5章 SARSA算法”中用于把“价值网络”放进同策略、自举与多步回报的环境—轨迹—目标—更新链,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 7/17。 原版目录键 5.2.1 价值网络。“第5章 SARSA算法”的目录节点7「5·2·1 价值网络」不能停在术语复述:它要把“价值网络”放进同策略、自举与多步回报的环境—轨迹—目标—更新链,交付第5章 SARSA算法的输入角色、中间状态、策略快照、反例与独立评估,并把只复述“价值网络”名称而没有可观察状态、单一故障和恢复证据设为单一反事实。
5·2·2 算法推导
↡算法推导对应正式目录坐标“5.2.2 算法推导”,在“第5章 SARSA算法”中用于把“算法推导”放进同策略、自举与多步回报的环境—轨迹—目标—更新链,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 8/17。 原版目录键 5.2.2 算法推导。对“第5章 SARSA算法”而言,「5·2·2 算法推导」在第8次检查中改变可观察状态,因为它负责把“算法推导”放进同策略、自举与多步回报的环境—轨迹—目标—更新链;第5章 SARSA算法的输入角色、中间状态、策略快照、反例与独立评估必须与“同一轨迹、行为概率、步数、折扣与终止规则下只改变目标定义”对齐,不能接受只复述“算法推导”名称而没有可观察状态、单一故障和恢复证据。
5·2·3 训练流程
↡训练流程对应正式目录坐标“5.2.3 训练流程”,在“第5章 SARSA算法”中用于把“训练流程”放进同策略、自举与多步回报的环境—轨迹—目标—更新链,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 9/17。 原版目录键 5.2.3 训练流程。在“第5章 SARSA算法”的第9个正式坐标中,「5·2·3 训练流程」通过把“训练流程”放进同策略、自举与多步回报的环境—轨迹—目标—更新链推进同策略、自举与多步回报;复核者保存第5章 SARSA算法的输入角色、中间状态、策略快照、反例与独立评估,出现只复述“训练流程”名称而没有可观察状态、单一故障和恢复证据就撤回结论。
5·3 多步TD目标
↡多步TD目标对应正式目录坐标“5.3 多步TD目标”,在“第5章 SARSA算法”中用于构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 10/17。 原版目录键 5.3 多步TD目标。围绕“行为策略真实选择的下一动作怎样进入同策略SARSA目标?”,“第5章 SARSA算法”在坐标10把「5·3 多步TD目标」落实为构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色;只有回放索引、下一动作、TD目标、误差、优先级和参数快照可重放且反例排除目标网络泄漏、策略角色错位或多技巧同时变化,本节点才算掌握。
5·3·1 算法推导
↡算法推导对应正式目录坐标“5.3.1 算法推导”,在“第5章 SARSA算法”中用于把“算法推导”放进同策略、自举与多步回报的环境—轨迹—目标—更新链,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 11/17。 原版目录键 5.3.1 算法推导。“第5章 SARSA算法”的目录节点11「5·3·1 算法推导」不能停在术语复述:它要把“算法推导”放进同策略、自举与多步回报的环境—轨迹—目标—更新链,交付第5章 SARSA算法的输入角色、中间状态、策略快照、反例与独立评估,并把只复述“算法推导”名称而没有可观察状态、单一故障和恢复证据设为单一反事实。
5·3·2 多步TD目标的原理
↡多步TD目标的原理对应正式目录坐标“5.3.2 多步TD目标的原理”,在“第5章 SARSA算法”中用于构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 12/17。 原版目录键 5.3.2 多步TD目标的原理。对“第5章 SARSA算法”而言,「5·3·2 多步TD目标的原理」在第12次检查中改变可观察状态,因为它负责构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色;回放索引、下一动作、TD目标、误差、优先级和参数快照必须与“同一轨迹、行为概率、步数、折扣与终止规则下只改变目标定义”对齐,不能接受目标网络泄漏、策略角色错位或多技巧同时变化。
5·3·3 训练流程
↡训练流程对应正式目录坐标“5.3.3 训练流程”,在“第5章 SARSA算法”中用于把“训练流程”放进同策略、自举与多步回报的环境—轨迹—目标—更新链,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 13/17。 原版目录键 5.3.3 训练流程。在“第5章 SARSA算法”的第13个正式坐标中,「5·3·3 训练流程」通过把“训练流程”放进同策略、自举与多步回报的环境—轨迹—目标—更新链推进同策略、自举与多步回报;复核者保存第5章 SARSA算法的输入角色、中间状态、策略快照、反例与独立评估,出现只复述“训练流程”名称而没有可观察状态、单一故障和恢复证据就撤回结论。
5·4 蒙特卡洛方法与自举
↡蒙特卡洛方法与自举对应正式目录坐标“5.4 蒙特卡洛方法与自举”,在“第5章 SARSA算法”中用于声明目标分布、采样分布、估计量和误差诊断,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 14/17。 原版目录键 5.4 蒙特卡洛方法与自举。围绕“行为策略真实选择的下一动作怎样进入同策略SARSA目标?”,“第5章 SARSA算法”在坐标14把「5·4 蒙特卡洛方法与自举」落实为声明目标分布、采样分布、估计量和误差诊断;只有样本流、权重、运行均值、标准误与置信区间可重放且反例排除偏置采样或相关样本仍按独立同分布公式解释,本节点才算掌握。
5·4·1 蒙特卡洛方法
↡蒙特卡洛方法对应正式目录坐标“5.4.1 蒙特卡洛方法”,在“第5章 SARSA算法”中用于声明目标分布、采样分布、估计量和误差诊断,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 15/17。 原版目录键 5.4.1 蒙特卡洛方法。“第5章 SARSA算法”的目录节点15「5·4·1 蒙特卡洛方法」不能停在术语复述:它要声明目标分布、采样分布、估计量和误差诊断,交付样本流、权重、运行均值、标准误与置信区间,并把偏置采样或相关样本仍按独立同分布公式解释设为单一反事实。
5·4·2 自举
↡自举对应正式目录坐标“5.4.2 自举”,在“第5章 SARSA算法”中用于构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 16/17。 原版目录键 5.4.2 自举。对“第5章 SARSA算法”而言,「5·4·2 自举」在第16次检查中改变可观察状态,因为它负责构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色;回放索引、下一动作、TD目标、误差、优先级和参数快照必须与“同一轨迹、行为概率、步数、折扣与终止规则下只改变目标定义”对齐,不能接受目标网络泄漏、策略角色错位或多技巧同时变化。
5·4·3 蒙特卡洛方法和自举的对比
↡蒙特卡洛方法和自举的对比对应正式目录坐标“5.4.3 蒙特卡洛方法和自举的对比”,在“第5章 SARSA算法”中用于声明目标分布、采样分布、估计量和误差诊断,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 17/17。 原版目录键 5.4.3 蒙特卡洛方法和自举的对比。在“第5章 SARSA算法”的第17个正式坐标中,「5·4·3 蒙特卡洛方法和自举的对比」通过声明目标分布、采样分布、估计量和误差诊断推进同策略、自举与多步回报;复核者保存样本流、权重、运行均值、标准误与置信区间,出现偏置采样或相关样本仍按独立同分布公式解释就撤回结论。
先预测,再操作三个章专属实验
1. 环境与轨迹合同
为“第5章 SARSA算法”选择正式目录坐标,在参考合同与单一反事实间切换,逐角色核对输入、状态变化、证据与即时裁决。
环境—轨迹合同
第5章 SARSA算法
选择正式目录坐标,冻结环境角色,再定位参考轨迹与单一反事实的首个分岔。
合同 1/4
第5章 SARSA算法 · 环境与角色
- 输入角色
- 让SARSA与Q学习复用同一批轨迹和Q表
- 状态变化
- 冻结同策略、自举与多步回报所需的环境版本、观测/状态、动作、奖励和数据角色
- 应留证据
- 第5章 SARSA算法的环境合同、策略快照与基线轨迹
- 即时裁决
- 第5章 SARSA算法的角色、时间索引、shape、终止和可见性没有错位
第5章 SARSA算法的可重放协议
| 阶段 | 允许动作 | 必留证据 | 拒绝条件 |
|---|---|---|---|
| 第5章 SARSA算法 · 环境与角色 | 冻结同策略、自举与多步回报所需的环境版本、观测/状态、动作、奖励和数据角色 | 第5章 SARSA算法的环境合同、策略快照与基线轨迹 | 未满足“第5章 SARSA算法的角色、时间索引、shape、终止和可见性没有错位” |
| 第5章 SARSA算法 · 回报与目标 | 按比较SARSA、Q学习、多步TD、蒙特卡洛与自举的目标构造和策略角色构造回报、目标、估计量或搜索统计 | 第5章 SARSA算法的逐步回报、目标分量与中间状态 | 未满足“第5章 SARSA算法的目标可由同一轨迹、公式和随机状态复算” |
| 第5章 SARSA算法 · 更新与策略 | 执行一次受控更新并记录策略、价值、梯度或联合决策的变化 | 第5章 SARSA算法的更新前后差、首个分岔和恢复路径 | 未满足“第5章 SARSA算法没有把代理损失、单次回报或训练内统计当作最终结论” |
| 第5章 SARSA算法 · 独立评估 | 重放基线、单故障、恢复和边界案例 | 第5章 SARSA算法的接受、回退或拒绝理由 | 未满足“第5章 SARSA算法满足“同一轨迹、行为概率、步数、折扣与终止规则下只改变目标定义”” |
unit: "drl-05"
question: "行为策略真实选择的下一动作怎样进入同策略SARSA目标?"
scenario: "让SARSA与Q学习复用同一批轨迹和Q表"
invariant: "同一轨迹、行为概率、步数、折扣与终止规则下只改变目标定义"
fault: "用下一状态最大Q值替代行为策略实际选择的下一动作"
evidence: "逐步目标、TD误差、Q表差异与n步截断记录"
reset: restore_concept_mode_stage_trace_step_case_gates_and_artifact“第5章 SARSA算法”要求从同一环境、轨迹、策略/对手版本、预算和随机状态重放参考、故障与恢复路径。重置后若目录选择、合同模式、阶段、轨迹步骤、案例、证据门或交付包没有回到基线,本次比较已经混入状态泄漏。
本页回顾
掌握“第5章 SARSA算法”不是背算法名或抄训练循环,而是围绕“行为策略真实选择的下一动作怎样进入同策略SARSA目标?”重建环境、轨迹、回报、目标、更新、策略/对手快照与独立评估,并用“同一轨迹、行为概率、步数、折扣与终止规则下只改变目标定义”拒绝“用下一状态最大Q值替代行为策略实际选择的下一动作”。最终交付为逐步目标、TD误差、Q表差异与n步截断记录。
练习与答案
练习
- 问题 1:实验合同。 “第5章 SARSA算法”为什么必须先冻结环境、轨迹、策略/对手版本、预算、随机性和评估口径?
- 问题 2:目录逐项覆盖。 怎样证明“第5章 SARSA算法”的正式目录坐标已经进入机制、交互和练习?
- 问题 3:故障恢复。 怎样证明“用下一状态最大Q值替代行为策略实际选择的下一动作”已经被修正?
名词解释
名词解释
本章出现的专业名词,用大白话再讲一遍。
- SARSA算法
检索键 drl-A 对应正式目录坐标「第5章 SARSA算法」;在“第5章 SARSA算法”中用于构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 表格形式的SARSA
检索键 drl-B 对应正式目录坐标「5·1 表格形式的SARSA」;在“第5章 SARSA算法”中用于构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 算法推导
检索键 drl-C 对应正式目录坐标「5·1·1 算法推导」;在“第5章 SARSA算法”中用于把“算法推导”放进同策略、自举与多步回报的环境—轨迹—目标—更新链,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 训练流程
检索键 drl-D 对应正式目录坐标「5·1·2 训练流程」;在“第5章 SARSA算法”中用于把“训练流程”放进同策略、自举与多步回报的环境—轨迹—目标—更新链,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- Q学习与SARSA的对比
检索键 drl-E 对应正式目录坐标「5·1·3 Q学习与SARSA的对比」;在“第5章 SARSA算法”中用于构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 神经网络形式的SARSA
检索键 drl-F 对应正式目录坐标「5·2 神经网络形式的SARSA」;在“第5章 SARSA算法”中用于明确输入/输出shape、损失、局部导数和参数更新,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 价值网络
检索键 drl-G 对应正式目录坐标「5·2·1 价值网络」;在“第5章 SARSA算法”中用于把“价值网络”放进同策略、自举与多步回报的环境—轨迹—目标—更新链,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 算法推导
检索键 drl-H 对应正式目录坐标「5·2·2 算法推导」;在“第5章 SARSA算法”中用于把“算法推导”放进同策略、自举与多步回报的环境—轨迹—目标—更新链,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 训练流程
检索键 drl-I 对应正式目录坐标「5·2·3 训练流程」;在“第5章 SARSA算法”中用于把“训练流程”放进同策略、自举与多步回报的环境—轨迹—目标—更新链,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 多步TD目标
检索键 drl-J 对应正式目录坐标「5·3 多步TD目标」;在“第5章 SARSA算法”中用于构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 算法推导
检索键 drl-K 对应正式目录坐标「5·3·1 算法推导」;在“第5章 SARSA算法”中用于把“算法推导”放进同策略、自举与多步回报的环境—轨迹—目标—更新链,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 多步TD目标的原理
检索键 drl-L 对应正式目录坐标「5·3·2 多步TD目标的原理」;在“第5章 SARSA算法”中用于构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 训练流程
检索键 drl-M 对应正式目录坐标「5·3·3 训练流程」;在“第5章 SARSA算法”中用于把“训练流程”放进同策略、自举与多步回报的环境—轨迹—目标—更新链,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 蒙特卡洛方法与自举
检索键 drl-N 对应正式目录坐标「5·4 蒙特卡洛方法与自举」;在“第5章 SARSA算法”中用于声明目标分布、采样分布、估计量和误差诊断,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 蒙特卡洛方法
检索键 drl-O 对应正式目录坐标「5·4·1 蒙特卡洛方法」;在“第5章 SARSA算法”中用于声明目标分布、采样分布、估计量和误差诊断,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 自举
检索键 drl-P 对应正式目录坐标「5·4·2 自举」;在“第5章 SARSA算法”中用于构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 蒙特卡洛方法和自举的对比
检索键 drl-Q 对应正式目录坐标「5·4·3 蒙特卡洛方法和自举的对比」;在“第5章 SARSA算法”中用于声明目标分布、采样分布、估计量和误差诊断,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。