第10章 连续控制
比较动作离散化、DDPG、TD3与随机高斯策略在连续控制中的目标和更新;用环境合同、更新轨迹和独立评估门交付动作缩放表、双Q目标、策略延迟与噪声重放日志
学习目标
- 能说明“第10章 连续控制”如何比较动作离散化、DDPG、TD3与随机高斯策略在连续控制中的目标和更新,并区分原版目录、作者代码映射、独立技术来源和本站重写
- 能先预测“连续动作的范围、探索噪声、双Q和延迟更新怎样保持训练与执行一致?”会改变哪一个环境、轨迹、回报、目标、策略或评估状态,再操作三类交互证据
- 能只注入“tanh输出未映射到环境动作范围却直接送入环境和critic”,定位首个偏离“动作缩放、噪声位置、目标策略、双Q聚合和更新频率均被记录”的状态,并从同一快照完成恢复
为什么从这个问题开始
“第10章 连续控制”围绕“连续动作的范围、探索噪声、双Q和延迟更新怎样保持训练与执行一致?”建立贯穿任务:在固定连续控制轨迹上复算actor与critic更新。先写下哪个环境、轨迹、回报、目标、策略或评估状态会最先变化,再运行参考、故障和恢复路径;运行后补理由不算预测。只有守住“动作缩放、噪声位置、目标策略、双Q聚合和更新频率均被记录”并交付动作缩放表、双Q目标、策略延迟与噪声重放日志,训练回报、策略价值、搜索统计或应用收益才构成机制证据。
原版书目、272个正式坐标与访问边界
“第10章 连续控制”以作者官方代码仓库核对王树森、黎彧君、张志华著《深度强化学习》的第1至19章及主要算法—实现映射,以馆藏书目核对人民邮电出版社、2022年11月、294页和ISBN 9787115600691,再以发行数字版完整目录核对5个部分、19章、233个编号节/小节、附录A、附录B与B.1至B.13,合计272个正式目录层级。
作者仓库验证章节和算法实现确实对应,但仓库页面未提供可据以复用代码、图表或书稿的明确许可;发行数字版用于核对目录范围,不作为复制正文的授权。“第10章 连续控制”不翻译、摘编或改写原书正文,也不复制仓库代码;中文讲解、状态轨迹、反例、交互、练习与答案均为独立教学重写。
本页独立核对 1、本页独立核对 2只用于独立核对本页算法、环境接口或实验边界,不能反向证明原书使用本站表述。Gymnasium、PyTorch、PettingZoo等当前API行为按2026-07-30核对并显式视为当前实现,不倒填为2022年原书内容。
原版目录层级与可验证机制
第10章 连续控制
↡连续控制对应正式目录坐标“第10章 连续控制”,在“第10章 连续控制”中用于对齐连续动作范围、critic目标、双Q、噪声与延迟策略更新,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 1/20。 原版目录键 第10章 连续控制。在“第10章 连续控制”的第1个正式坐标中,「第10章 连续控制」通过对齐连续动作范围、critic目标、双Q、噪声与延迟策略更新推进连续动作、critic目标与延迟更新;复核者保存动作缩放、噪声、双Q目标、策略梯度和更新频率,出现动作尺度、目标噪声或actor/critic更新时序错位就撤回结论。
10·1 连续空间的离散化
↡连续空间的离散化对应正式目录坐标“10.1 连续空间的离散化”,在“第10章 连续控制”中用于对齐连续动作范围、critic目标、双Q、噪声与延迟策略更新,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 2/20。 原版目录键 10.1 连续空间的离散化。围绕“连续动作的范围、探索噪声、双Q和延迟更新怎样保持训练与执行一致?”,“第10章 连续控制”在坐标2把「10·1 连续空间的离散化」落实为对齐连续动作范围、critic目标、双Q、噪声与延迟策略更新;只有动作缩放、噪声、双Q目标、策略梯度和更新频率可重放且反例排除动作尺度、目标噪声或actor/critic更新时序错位,本节点才算掌握。
10·2 深度确定性策略梯度
↡深度确定性策略梯度对应正式目录坐标“10.2 深度确定性策略梯度”,在“第10章 连续控制”中用于建立环境、轨迹、终止、策略、回报和价值的时间合同,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 3/20。 原版目录键 10.2 深度确定性策略梯度。“第10章 连续控制”的目录节点3「10·2 深度确定性策略梯度」不能停在术语复述:它要建立环境、轨迹、终止、策略、回报和价值的时间合同,交付转移记录、策略概率、终止/截断标记、回报与价值残差,并把混淆状态与观测、终止与截断或行为策略与目标策略设为单一反事实。
10·2·1 策略网络和价值网络
↡策略网络和价值网络对应正式目录坐标“10.2.1 策略网络和价值网络”,在“第10章 连续控制”中用于建立环境、轨迹、终止、策略、回报和价值的时间合同,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 4/20。 原版目录键 10.2.1 策略网络和价值网络。对“第10章 连续控制”而言,「10·2·1 策略网络和价值网络」在第4次检查中改变可观察状态,因为它负责建立环境、轨迹、终止、策略、回报和价值的时间合同;转移记录、策略概率、终止/截断标记、回报与价值残差必须与“动作缩放、噪声位置、目标策略、双Q聚合和更新频率均被记录”对齐,不能接受混淆状态与观测、终止与截断或行为策略与目标策略。
10·2·2 算法推导
↡算法推导对应正式目录坐标“10.2.2 算法推导”,在“第10章 连续控制”中用于把“算法推导”放进连续动作、critic目标与延迟更新的环境—轨迹—目标—更新链,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 5/20。 原版目录键 10.2.2 算法推导。在“第10章 连续控制”的第5个正式坐标中,「10·2·2 算法推导」通过把“算法推导”放进连续动作、critic目标与延迟更新的环境—轨迹—目标—更新链推进连续动作、critic目标与延迟更新;复核者保存第10章 连续控制的输入角色、中间状态、策略快照、反例与独立评估,出现只复述“算法推导”名称而没有可观察状态、单一故障和恢复证据就撤回结论。
10·3 深入分析DDPG
↡深入分析DDPG对应正式目录坐标“10.3 深入分析DDPG”,在“第10章 连续控制”中用于对齐连续动作范围、critic目标、双Q、噪声与延迟策略更新,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 6/20。 原版目录键 10.3 深入分析DDPG。围绕“连续动作的范围、探索噪声、双Q和延迟更新怎样保持训练与执行一致?”,“第10章 连续控制”在坐标6把「10·3 深入分析DDPG」落实为对齐连续动作范围、critic目标、双Q、噪声与延迟策略更新;只有动作缩放、噪声、双Q目标、策略梯度和更新频率可重放且反例排除动作尺度、目标噪声或actor/critic更新时序错位,本节点才算掌握。
10·3·1 从策略学习的角度看待DDPG
↡从策略学习的角度看待DDPG对应正式目录坐标“10.3.1 从策略学习的角度看待DDPG”,在“第10章 连续控制”中用于建立环境、轨迹、终止、策略、回报和价值的时间合同,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 7/20。 原版目录键 10.3.1 从策略学习的角度看待DDPG。“第10章 连续控制”的目录节点7「10·3·1 从策略学习的角度看待DDPG」不能停在术语复述:它要建立环境、轨迹、终止、策略、回报和价值的时间合同,交付转移记录、策略概率、终止/截断标记、回报与价值残差,并把混淆状态与观测、终止与截断或行为策略与目标策略设为单一反事实。
10·3·2 从价值学习的角度看待DDPG
↡从价值学习的角度看待DDPG对应正式目录坐标“10.3.2 从价值学习的角度看待DDPG”,在“第10章 连续控制”中用于对齐连续动作范围、critic目标、双Q、噪声与延迟策略更新,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 8/20。 原版目录键 10.3.2 从价值学习的角度看待DDPG。对“第10章 连续控制”而言,「10·3·2 从价值学习的角度看待DDPG」在第8次检查中改变可观察状态,因为它负责对齐连续动作范围、critic目标、双Q、噪声与延迟策略更新;动作缩放、噪声、双Q目标、策略梯度和更新频率必须与“动作缩放、噪声位置、目标策略、双Q聚合和更新频率均被记录”对齐,不能接受动作尺度、目标噪声或actor/critic更新时序错位。
10·3·3 DDPG的高估问题
↡DDPG的高估问题对应正式目录坐标“10.3.3 DDPG的高估问题”,在“第10章 连续控制”中用于构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 9/20。 原版目录键 10.3.3 DDPG的高估问题。在“第10章 连续控制”的第9个正式坐标中,「10·3·3 DDPG的高估问题」通过构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色推进连续动作、critic目标与延迟更新;复核者保存回放索引、下一动作、TD目标、误差、优先级和参数快照,出现目标网络泄漏、策略角色错位或多技巧同时变化就撤回结论。
10·4 双延迟深度确定性策略梯度
↡双延迟深度确定性策略梯度对应正式目录坐标“10.4 双延迟深度确定性策略梯度”,在“第10章 连续控制”中用于建立环境、轨迹、终止、策略、回报和价值的时间合同,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 10/20。 原版目录键 10.4 双延迟深度确定性策略梯度。围绕“连续动作的范围、探索噪声、双Q和延迟更新怎样保持训练与执行一致?”,“第10章 连续控制”在坐标10把「10·4 双延迟深度确定性策略梯度」落实为建立环境、轨迹、终止、策略、回报和价值的时间合同;只有转移记录、策略概率、终止/截断标记、回报与价值残差可重放且反例排除混淆状态与观测、终止与截断或行为策略与目标策略,本节点才算掌握。
10·4·1 高估问题的解决方案——目标网络
↡高估问题的解决方案对应正式目录坐标“10.4.1 高估问题的解决方案——目标网络”,在“第10章 连续控制”中用于构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 11/20。 原版目录键 10.4.1 高估问题的解决方案——目标网络。“第10章 连续控制”的目录节点11「10·4·1 高估问题的解决方案——目标网络」不能停在术语复述:它要构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色,交付回放索引、下一动作、TD目标、误差、优先级和参数快照,并把目标网络泄漏、策略角色错位或多技巧同时变化设为单一反事实。
10·4·2 高估问题的解决方案——截断双Q学习
↡高估问题的解决方案对应正式目录坐标“10.4.2 高估问题的解决方案——截断双Q学习”,在“第10章 连续控制”中用于构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 12/20。 原版目录键 10.4.2 高估问题的解决方案——截断双Q学习。对“第10章 连续控制”而言,「10·4·2 高估问题的解决方案——截断双Q学习」在第12次检查中改变可观察状态,因为它负责构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色;回放索引、下一动作、TD目标、误差、优先级和参数快照必须与“动作缩放、噪声位置、目标策略、双Q聚合和更新频率均被记录”对齐,不能接受目标网络泄漏、策略角色错位或多技巧同时变化。
10·4·3 其他改进点
↡其他改进点对应正式目录坐标“10.4.3 其他改进点”,在“第10章 连续控制”中用于把“其他改进点”放进连续动作、critic目标与延迟更新的环境—轨迹—目标—更新链,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 13/20。 原版目录键 10.4.3 其他改进点。在“第10章 连续控制”的第13个正式坐标中,「10·4·3 其他改进点」通过把“其他改进点”放进连续动作、critic目标与延迟更新的环境—轨迹—目标—更新链推进连续动作、critic目标与延迟更新;复核者保存第10章 连续控制的输入角色、中间状态、策略快照、反例与独立评估,出现只复述“其他改进点”名称而没有可观察状态、单一故障和恢复证据就撤回结论。
10·4·4 训练流程
↡训练流程对应正式目录坐标“10.4.4 训练流程”,在“第10章 连续控制”中用于把“训练流程”放进连续动作、critic目标与延迟更新的环境—轨迹—目标—更新链,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 14/20。 原版目录键 10.4.4 训练流程。围绕“连续动作的范围、探索噪声、双Q和延迟更新怎样保持训练与执行一致?”,“第10章 连续控制”在坐标14把「10·4·4 训练流程」落实为把“训练流程”放进连续动作、critic目标与延迟更新的环境—轨迹—目标—更新链;只有第10章 连续控制的输入角色、中间状态、策略快照、反例与独立评估可重放且反例排除只复述“训练流程”名称而没有可观察状态、单一故障和恢复证据,本节点才算掌握。
10·5 随机高斯策略
↡随机高斯策略对应正式目录坐标“10.5 随机高斯策略”,在“第10章 连续控制”中用于建立环境、轨迹、终止、策略、回报和价值的时间合同,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 15/20。 原版目录键 10.5 随机高斯策略。“第10章 连续控制”的目录节点15「10·5 随机高斯策略」不能停在术语复述:它要建立环境、轨迹、终止、策略、回报和价值的时间合同,交付转移记录、策略概率、终止/截断标记、回报与价值残差,并把混淆状态与观测、终止与截断或行为策略与目标策略设为单一反事实。
10·5·1 基本思路
↡基本思路对应正式目录坐标“10.5.1 基本思路”,在“第10章 连续控制”中用于把“基本思路”放进连续动作、critic目标与延迟更新的环境—轨迹—目标—更新链,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 16/20。 原版目录键 10.5.1 基本思路。对“第10章 连续控制”而言,「10·5·1 基本思路」在第16次检查中改变可观察状态,因为它负责把“基本思路”放进连续动作、critic目标与延迟更新的环境—轨迹—目标—更新链;第10章 连续控制的输入角色、中间状态、策略快照、反例与独立评估必须与“动作缩放、噪声位置、目标策略、双Q聚合和更新频率均被记录”对齐,不能接受只复述“基本思路”名称而没有可观察状态、单一故障和恢复证据。
10·5·2 随机高斯策略网络
↡随机高斯策略网络对应正式目录坐标“10.5.2 随机高斯策略网络”,在“第10章 连续控制”中用于建立环境、轨迹、终止、策略、回报和价值的时间合同,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 17/20。 原版目录键 10.5.2 随机高斯策略网络。在“第10章 连续控制”的第17个正式坐标中,「10·5·2 随机高斯策略网络」通过建立环境、轨迹、终止、策略、回报和价值的时间合同推进连续动作、critic目标与延迟更新;复核者保存转移记录、策略概率、终止/截断标记、回报与价值残差,出现混淆状态与观测、终止与截断或行为策略与目标策略就撤回结论。
10·5·3 策略梯度
↡策略梯度对应正式目录坐标“10.5.3 策略梯度”,在“第10章 连续控制”中用于建立环境、轨迹、终止、策略、回报和价值的时间合同,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 18/20。 原版目录键 10.5.3 策略梯度。围绕“连续动作的范围、探索噪声、双Q和延迟更新怎样保持训练与执行一致?”,“第10章 连续控制”在坐标18把「10·5·3 策略梯度」落实为建立环境、轨迹、终止、策略、回报和价值的时间合同;只有转移记录、策略概率、终止/截断标记、回报与价值残差可重放且反例排除混淆状态与观测、终止与截断或行为策略与目标策略,本节点才算掌握。
10·5·4 用REINFORCE学习参数
↡用REINFORCE学习参数对应正式目录坐标“10.5.4 用REINFORCE学习参数”,在“第10章 连续控制”中用于从轨迹概率、回报、优势、概率比与KL约束推导策略更新,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 19/20。 原版目录键 10.5.4 用REINFORCE学习参数。“第10章 连续控制”的目录节点19「10·5·4 用REINFORCE学习参数」不能停在术语复述:它要从轨迹概率、回报、优势、概率比与KL约束推导策略更新,交付动作对数概率、回报、基线、优势、梯度、KL与接受规则,并把用新策略重算旧轨迹、动作依赖基线或越过置信域设为单一反事实。
10·5·5 用actor-critic学习参数
↡用actor-critic学习参数对应正式目录坐标“10.5.5 用actor-critic学习参数”,在“第10章 连续控制”中用于从轨迹概率、回报、优势、概率比与KL约束推导策略更新,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 20/20。 原版目录键 10.5.5 用actor-critic学习参数。对“第10章 连续控制”而言,「10·5·5 用actor-critic学习参数」在第20次检查中改变可观察状态,因为它负责从轨迹概率、回报、优势、概率比与KL约束推导策略更新;动作对数概率、回报、基线、优势、梯度、KL与接受规则必须与“动作缩放、噪声位置、目标策略、双Q聚合和更新频率均被记录”对齐,不能接受用新策略重算旧轨迹、动作依赖基线或越过置信域。
先预测,再操作三个章专属实验
1. 环境与轨迹合同
为“第10章 连续控制”选择正式目录坐标,在参考合同与单一反事实间切换,逐角色核对输入、状态变化、证据与即时裁决。
环境—轨迹合同
第10章 连续控制
选择正式目录坐标,冻结环境角色,再定位参考轨迹与单一反事实的首个分岔。
合同 1/4
第10章 连续控制 · 环境与角色
- 输入角色
- 在固定连续控制轨迹上复算actor与critic更新
- 状态变化
- 冻结连续动作、critic目标与延迟更新所需的环境版本、观测/状态、动作、奖励和数据角色
- 应留证据
- 第10章 连续控制的环境合同、策略快照与基线轨迹
- 即时裁决
- 第10章 连续控制的角色、时间索引、shape、终止和可见性没有错位
第10章 连续控制的可重放协议
| 阶段 | 允许动作 | 必留证据 | 拒绝条件 |
|---|---|---|---|
| 第10章 连续控制 · 环境与角色 | 冻结连续动作、critic目标与延迟更新所需的环境版本、观测/状态、动作、奖励和数据角色 | 第10章 连续控制的环境合同、策略快照与基线轨迹 | 未满足“第10章 连续控制的角色、时间索引、shape、终止和可见性没有错位” |
| 第10章 连续控制 · 回报与目标 | 按比较动作离散化、DDPG、TD3与随机高斯策略在连续控制中的目标和更新构造回报、目标、估计量或搜索统计 | 第10章 连续控制的逐步回报、目标分量与中间状态 | 未满足“第10章 连续控制的目标可由同一轨迹、公式和随机状态复算” |
| 第10章 连续控制 · 更新与策略 | 执行一次受控更新并记录策略、价值、梯度或联合决策的变化 | 第10章 连续控制的更新前后差、首个分岔和恢复路径 | 未满足“第10章 连续控制没有把代理损失、单次回报或训练内统计当作最终结论” |
| 第10章 连续控制 · 独立评估 | 重放基线、单故障、恢复和边界案例 | 第10章 连续控制的接受、回退或拒绝理由 | 未满足“第10章 连续控制满足“动作缩放、噪声位置、目标策略、双Q聚合和更新频率均被记录”” |
unit: "drl-10"
question: "连续动作的范围、探索噪声、双Q和延迟更新怎样保持训练与执行一致?"
scenario: "在固定连续控制轨迹上复算actor与critic更新"
invariant: "动作缩放、噪声位置、目标策略、双Q聚合和更新频率均被记录"
fault: "tanh输出未映射到环境动作范围却直接送入环境和critic"
evidence: "动作缩放表、双Q目标、策略延迟与噪声重放日志"
reset: restore_concept_mode_stage_trace_step_case_gates_and_artifact“第10章 连续控制”要求从同一环境、轨迹、策略/对手版本、预算和随机状态重放参考、故障与恢复路径。重置后若目录选择、合同模式、阶段、轨迹步骤、案例、证据门或交付包没有回到基线,本次比较已经混入状态泄漏。
本页回顾
掌握“第10章 连续控制”不是背算法名或抄训练循环,而是围绕“连续动作的范围、探索噪声、双Q和延迟更新怎样保持训练与执行一致?”重建环境、轨迹、回报、目标、更新、策略/对手快照与独立评估,并用“动作缩放、噪声位置、目标策略、双Q聚合和更新频率均被记录”拒绝“tanh输出未映射到环境动作范围却直接送入环境和critic”。最终交付为动作缩放表、双Q目标、策略延迟与噪声重放日志。
练习与答案
练习
- 问题 1:实验合同。 “第10章 连续控制”为什么必须先冻结环境、轨迹、策略/对手版本、预算、随机性和评估口径?
- 问题 2:目录逐项覆盖。 怎样证明“第10章 连续控制”的正式目录坐标已经进入机制、交互和练习?
- 问题 3:故障恢复。 怎样证明“tanh输出未映射到环境动作范围却直接送入环境和critic”已经被修正?
小结
- 连续控制输出实值动作
- DDPG 用确定性策略
- TD3 修正 Q 值高估
- SAC 引入最大熵
- 机器人控制的主战场
名词解释
名词解释
本章出现的专业名词,用大白话再讲一遍。
- 连续控制
检索键 drl-A 对应正式目录坐标「第10章 连续控制」;在“第10章 连续控制”中用于对齐连续动作范围、critic目标、双Q、噪声与延迟策略更新,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 连续空间的离散化
检索键 drl-B 对应正式目录坐标「10·1 连续空间的离散化」;在“第10章 连续控制”中用于对齐连续动作范围、critic目标、双Q、噪声与延迟策略更新,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 深度确定性策略梯度
检索键 drl-C 对应正式目录坐标「10·2 深度确定性策略梯度」;在“第10章 连续控制”中用于建立环境、轨迹、终止、策略、回报和价值的时间合同,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 策略网络和价值网络
检索键 drl-D 对应正式目录坐标「10·2·1 策略网络和价值网络」;在“第10章 连续控制”中用于建立环境、轨迹、终止、策略、回报和价值的时间合同,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 算法推导
检索键 drl-E 对应正式目录坐标「10·2·2 算法推导」;在“第10章 连续控制”中用于把“算法推导”放进连续动作、critic目标与延迟更新的环境—轨迹—目标—更新链,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 深入分析DDPG
检索键 drl-F 对应正式目录坐标「10·3 深入分析DDPG」;在“第10章 连续控制”中用于对齐连续动作范围、critic目标、双Q、噪声与延迟策略更新,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 从策略学习的角度看待DDPG
检索键 drl-G 对应正式目录坐标「10·3·1 从策略学习的角度看待DDPG」;在“第10章 连续控制”中用于建立环境、轨迹、终止、策略、回报和价值的时间合同,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 从价值学习的角度看待DDPG
检索键 drl-H 对应正式目录坐标「10·3·2 从价值学习的角度看待DDPG」;在“第10章 连续控制”中用于对齐连续动作范围、critic目标、双Q、噪声与延迟策略更新,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- DDPG的高估问题
检索键 drl-I 对应正式目录坐标「10·3·3 DDPG的高估问题」;在“第10章 连续控制”中用于构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 双延迟深度确定性策略梯度
检索键 drl-J 对应正式目录坐标「10·4 双延迟深度确定性策略梯度」;在“第10章 连续控制”中用于建立环境、轨迹、终止、策略、回报和价值的时间合同,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 高估问题的解决方案
检索键 drl-K 对应正式目录坐标「10·4·1 高估问题的解决方案——目标网络」;在“第10章 连续控制”中用于构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 高估问题的解决方案
检索键 drl-L 对应正式目录坐标「10·4·2 高估问题的解决方案——截断双Q学习」;在“第10章 连续控制”中用于构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 其他改进点
检索键 drl-M 对应正式目录坐标「10·4·3 其他改进点」;在“第10章 连续控制”中用于把“其他改进点”放进连续动作、critic目标与延迟更新的环境—轨迹—目标—更新链,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 训练流程
检索键 drl-N 对应正式目录坐标「10·4·4 训练流程」;在“第10章 连续控制”中用于把“训练流程”放进连续动作、critic目标与延迟更新的环境—轨迹—目标—更新链,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 随机高斯策略
检索键 drl-O 对应正式目录坐标「10·5 随机高斯策略」;在“第10章 连续控制”中用于建立环境、轨迹、终止、策略、回报和价值的时间合同,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 基本思路
检索键 drl-P 对应正式目录坐标「10·5·1 基本思路」;在“第10章 连续控制”中用于把“基本思路”放进连续动作、critic目标与延迟更新的环境—轨迹—目标—更新链,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 随机高斯策略网络
检索键 drl-Q 对应正式目录坐标「10·5·2 随机高斯策略网络」;在“第10章 连续控制”中用于建立环境、轨迹、终止、策略、回报和价值的时间合同,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 策略梯度
检索键 drl-R 对应正式目录坐标「10·5·3 策略梯度」;在“第10章 连续控制”中用于建立环境、轨迹、终止、策略、回报和价值的时间合同,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 用REINFORCE学习参数
检索键 drl-S 对应正式目录坐标「10·5·4 用REINFORCE学习参数」;在“第10章 连续控制”中用于从轨迹概率、回报、优势、概率比与KL约束推导策略更新,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 用actor-critic学习参数
检索键 drl-T 对应正式目录坐标「10·5·5 用actor-critic学习参数」;在“第10章 连续控制”中用于从轨迹概率、回报、优势、概率比与KL约束推导策略更新,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。